做过无限画布 AI 视频的团队,基本都栽过同一个跟头。
镜头往左推三米,主角的脸直接歪成陌生人;画布往外扩两轮,前景的道具直接凭空消失;多角色同框走两步,五官串得亲妈不认。
很多人第一反应是参数没调好,死命加关键帧、拉 CFG 权重。实际跑过就知道,固定画幅那套保一致性的方法,放到无限画布场景里,大半都失灵。
常有人问:是不是关键帧插得越密,角色一致性就越好?也有人疑惑:无限画布越扩人物越歪,到底是算力不够还是算法本身有缺陷?
本质上,无限画布的一致性难题,根本不是 “生成质量” 的问题,是 “空间跟踪 + 特征锚定” 的系统问题。Vera1.1 能把无限画布场景的角色保留率做到 94.7%,靠的不是单点调优,是一整套从坐标体系到分层约束的完整机制。今天我们从底层实现、参数逻辑到落地踩坑,完整拆解一遍。
很多人没意识到,固定画幅的 AI 视频,本质是 “框内生成”。所有注意力计算、时序传播,都在一个固定尺寸的画布内完成,坐标是相对的,边界是已知的。
无限画布直接打破了这个前提。画布可以向任意方向延伸,没有固定边界,物体可以进出画面,镜头可以自由运镜。原来的一致性方案,天然就不适用。
做个直观对比:
挑战维度 | 固定画幅视频生成 | 无限画布视频生成 |
|---|---|---|
坐标体系 | 相对画布坐标,边界固定 | 全局绝对坐标,无固定边界 |
误差累积范围 | 仅帧间时序误差,范围可控 | 时序 + 空间双重误差,随扩幅放大 |
物体跟踪逻辑 | 帧间特征匹配,无需空间定位 | 跨瓦片空间匹配 + 帧间时序跟踪 |
角色特征锚定 | 单参考图全局注入,全程生效 | 多区块参考图按需注入,需坐标对齐 |
边界一致性 | 无额外边界问题 | 瓦片拼接处易出现特征断层 |
不是模型能力不行,是解题的前提变了。
固定画幅只要管好 “时间维度” 的一致性,无限画布要同时管好 “时间 + 空间” 两个维度的跟踪与锚定,难度是指数级上升的。这也是为什么很多模型单独出图效果很好,一开无限画布就崩的核心原因。
无限画布的所有能力,都建立在 “能精准找到物体在哪” 的基础上。跟踪做不准,后面的一致性全是空谈。
Vera1.1 的跟踪体系,是三层嵌套的设计:全局坐标锚定打底,瓦片级特征匹配做空间衔接,动态掩码跟踪做目标隔离。
这是最基础,也最容易被忽略的设计。
很多模型的无限画布,是 “拼贴式” 的 —— 生成一块,拼一块,每一块都有自己的相对坐标。拼的块多了,累计的坐标偏差就会让物体错位、变形。
Vera1.1 从底层就用了全局绝对坐标编码。
整个无限画布共用一套二维坐标系统,每一个像素点都有唯一的全局坐标值。坐标信息会和图像特征一起注入扩散模型,不管画布扩到多大、分成多少个瓦片,模型都知道当前生成的区域在全局的哪个位置。
别小看这个设计。很多拼接痕迹明显、物体越扩越歪的问题,根源就是没有全局坐标,每块生成都是 “各自为政”。
全局坐标解决了 “在哪” 的问题,跨瓦片的特征连续,靠的是滑动瓦片匹配机制。
无限画布不可能一次性生成整块内容,都是分瓦片迭代生成。如果瓦片之间没有特征交互,拼接处必然会出现物体断裂、风格跳变。
Vera1.1 的做法是,每个新瓦片生成时,都会和相邻的已生成瓦片做重叠区特征对齐。
具体流程:
我们团队实测过,25% 的重叠率是性价比最高的选择。低于 20%,匹配特征不足,容易出现断层;高于 30%,重复计算太多,生成速度下降明显。
正常运镜速度下,跨瓦片的物体特征匹配成功率能到 98.2%,肉眼基本看不出衔接痕迹。
如果所有像素都用同一套跟踪逻辑,算力浪费不说,动态目标的跟踪精度还会被背景干扰。
Vera1.1 引入了动态目标实例掩码机制。
生成过程中,模型会自动识别画面中的独立物体:人物、道具、前景元素,给每个目标分配独立的实例 ID 和掩码。不同的目标,执行不同的跟踪策略。
这个设计还有个额外好处:多角色场景下,每个角色有独立的掩码和特征锚,不会出现走着走着脸串到另一个人身上的情况。
跟踪解决了 “找得到人”,要保证 “人不变”,还要靠分层特征锚定体系。
很多人以为角色一致性就是保脸,其实不是。一套合格的一致性方案,要同时保住五官身份、服饰纹理、体型比例、动作逻辑,缺一个都会有 “违和感”。
Vera1.1 的做法是对应分层扩散架构,给每一层都加上一致性约束,从细到粗逐层兜底。
特征层级 | 对应角色要素 | 约束方式 | 校准频率 | 效果贡献占比 |
|---|---|---|---|---|
像素纹理层 | 皮肤质感、服饰花纹、发色细节 | 参考图特征注入,权重 0.6 | 每 8 帧校准一次 | 25% |
几何结构层 | 五官比例、脸型轮廓、体型骨架 | 结构掩码约束,权重 0.85 | 每 4 帧校准一次 | 55% |
语义身份层 | 人物身份、动作风格、整体气质 | 文本 + 身份双条件控制 | 全程生效 | 20% |
这里面核心是几何结构层的约束,也是大部分模型的短板。
很多模型保一致性,只在像素层灌参考图特征,结果就是脸的纹理像,但五官比例歪了、脸型变了,看着还是像另一个人。
模型会先从参考图里提取人脸关键点、人体骨骼、轮廓掩码这些结构化信息。
生成过程中,每 4 帧就会做一次结构对齐校验。如果当前帧的五官偏差超过设定阈值,就会强制拉回基准结构,再进行后续的纹理生成。
这也是为什么很多人觉得 Vera1.1 的角色 “稳”—— 不是纹理贴得像,是骨架和比例从头到尾没乱过。
光有逐帧校准还不够,硬校准容易出现 “跳帧” 感,前一帧和后一帧脸突然变了。
所以在结构校准之外,还有一层帧间光流平滑约束。
简单说就是,模型会计算相邻两帧之间的光流场,预判角色的运动轨迹,让特征变化沿着运动方向平滑过渡,而不是生硬地跳变。
尤其是快速运镜、人物大动作的场景,光流平滑的作用特别明显。我们对比过,开光流平滑后,动作场景的角色连贯度提升了 37%,基本不会出现一卡一卡的 “变脸” 感。
再精准的跟踪,帧间误差也会慢慢累积。长视频 + 大幅扩幅的场景,必须有兜底机制。
Vera1.1 用的是分段基准帧校准,在无限画布场景里还加入了额外的空间校准逻辑。
相当于每隔一段就 “归零” 一次误差,不让偏差越滚越大。
实测数据:48 帧 + 3 倍扩幅的场景下,开启分段校准后,角色身份保留率从 72% 提升到 94.7%,空间位置偏差降低 81%。
讲完原理,说点干活能用得上的。我们团队用 Vera1.1 跑了近百条无限画布的视频,踩了不少坑,也总结了一套可复用的参数和流程。
不是一套参数走天下。不同的镜头运动、角色数量,参数要对应调整,不然要么效果差,要么浪费算力。
整理了一份我们常用的参数表,大家可以参考:
场景类型 | 瓦片重叠率 | 结构锚定权重 | 校准间隔(帧) | 跟踪窗口大小 |
|---|---|---|---|---|
慢镜头 / 静态运镜 | 20% | 0.7 | 8 | 16 帧 |
快速推拉摇移 | 30% | 0.9 | 4 | 12 帧 |
单角色中近景 | 25% | 0.85 | 6 | 16 帧 |
多角色全景 | 25% | 0.8 | 4 | 8 帧 |
大幅扩幅(>2 倍) | 30% | 0.9 | 每扩 1 瓦校准 1 次 | 12 帧 |
几个踩过的坑提醒一下:
无限画布的生产,和传统 AI 视频的工作流不一样。它不是 “生成完再剪辑”,是 “边生成边剪辑”,团队的协作模式也要跟着变。
我们现在的标准流程是四步走:
这么跑下来,一条 30 秒的无限画布视频,生产周期能从原来的 3 天压缩到 1 天,返工率降了 60%。
核心心得就一条:别把无限画布当 “生成工具”,要当 “生产工作台” 来用。团队所有人都在同一个画布上协作,信息差少了,效率自然就上去了。
刚接触 AI 视频的时候,我也天天盯着 CFG、采样步数这些参数调,觉得参数调到位了效果就好。做的项目多了才发现,真正决定上限的,是对底层架构的理解。
就像无限画布的一致性问题,你要是不懂跟踪和坐标体系的逻辑,再怎么调 CFG、插关键帧,都解决不了根本问题。
技术迭代太快了,今天的参数技巧,下个月模型一更新就没用了。但底层的算法逻辑、工程设计思路,是通用的。多往底层挖一层,比攒十个调参技巧都有用。
客观说,没有完美的方案。Vera1.1 这套机制也有它的边界。
目前比较明显的局限有两个:
一是大跨度跳景场景。如果镜头直接从角色近景切到百米外的全景,跟踪链路会断,角色一致性会明显下降。这种场景目前还是要靠手动插关键帧来兜底。
二是极端侧脸 / 背面。身份特征主要提取自正面五官,角度太偏的时候,结构匹配的精度会下降,容易出现脸歪。
但整体来看,这套分层跟踪 + 分层锚定的思路,已经把无限画布的可用性拉到了商用级别。未来的优化方向,大概率会往 3D 空间跟踪、实例级细粒度控制走,到时候角色一致性还能再上一个台阶。
Q1:无限画布最多扩到多大,还能保证角色一致性?
在正常运镜、开启分段校准的前提下,3-5 倍的扩幅范围内,角色身份保留率能稳定在 90% 以上。超过 5 倍之后,建议每扩 2 倍插入一次人工关键帧锚定,避免误差累积。理论上只要合理插帧,扩到几十倍的尺寸也能保住角色身份。
Q2:多角色同框的时候,怎么避免人物脸串到一起? 首先要开启实例掩码跟踪功能,让模型给每个角色分配独立的跟踪 ID。其次建议给每个角色单独上传参考图,并且在画布上标注好各自的初始位置。如果是 3 人以上的多角色场景,建议把结构校准间隔缩短到 4 帧,进一步降低串脸概率。
Q3:消费级显卡(比如 RTX 4090)能跑高精度跟踪模式吗? 可以跑,但要做取舍。高精度跟踪 + 大瓦片的配置,RTX 4090 跑 720P 分辨率会比较吃显存。建议把瓦片尺寸调小一点,关闭非必要的实例跟踪,只给主要角色开高精度锚定,这样既能保证核心效果,也能流畅运行。
Q4:跟踪失效、角色突然崩了,有没有快速补救的方法? 最有效的方法是在崩掉的位置插一张局部关键帧,不用整帧重画,只把角色脸的位置修正就行。无限画布支持局部区域重绘,只重新生成崩掉的区块,比整段重新生成效率高很多。另外可以临时拉高结构锚定权重,让后续帧快速拉回正常状态。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。