多视角生成和视频生成有一个共同的难点:单张图看上去可能都不错,但放在一起就容易“穿帮”。同一个物体换个视角后结构变了,纹理一会儿有一会儿没;视频里主体走着走着形状漂移,背景也会出现不连续的跳动。对于多图像扩散模型来说,这类问题通常被概括为时空一致性不足。 CVPR 2026 论文 Align Images Before You Generate 提出了一个很直接、也很巧妙的思路:既然最终生成的多张图应该描述同一个场景,那么能不能在图像真正生成出来之前,就从扩散模型内部找到它们之间的对应关系,并利用这些对应关系约束后续生成? 作者给出的答案是 CorrAdapter。它是一个即插即用的时空一致性适配器,不依赖额外深度图、分割图、光流或显式几何先验,而是直接从多图像扩散模型的中间特征里挖掘“扩散原生对应关系”(diffusion-native correspondence),再让模型只在对齐区域之间聚合信息。实验表明,CorrAdapter 可以稳定提升图像条件多视角生成、文本条件多视角生成,以及文本到视频生成中的一致性。

图:CorrAdapter 面向静态多视角和动态视频两类多图生成任务,核心目标是减少跨视角、跨帧的结构和纹理漂移。
论文标题: Align Images Before You Generate 作者: Shihua Zhang, Qiuhong Shen, Xinchao Wang 单位: National University of Singapore 会议: CVPR 2026 论文主页:
https://openaccess.thecvf.com/content/CVPR2026/html/Zhang_Align_Images_Before_You_Generate_CVPR_2026_paper.html 论文 PDF:
https://openaccess.thecvf.com/content/CVPR2026/papers/Zhang_Align_Images_Before_You_Generate_CVPR_2026_paper.pdf 补充材料:
https://openaccess.thecvf.com/content/CVPR2026/supplemental/Zhang_Align_Images_Before_CVPR_2026_supplemental.pdf 代码:
https://github.com/SuhZhang/CorrAdapter
多图像扩散模型通常一次生成一组相关图像,例如同一物体的多视角图,或者同一视频的连续帧。这些任务的共同要求是:多张图不仅要各自真实,还要彼此说得通。
以单图到多视角生成为例,模型需要根据一张参考图补全物体在不同角度下的外观。它不仅要猜出背面、侧面是什么样子,还要保证物体的主体结构、纹理位置和语义细节在各个视角中保持一致。视频生成也是类似:主体、背景、动作和镜头都在变化,但同一个对象不应该突然变形或丢失关键部件。
已有方法大致有几条路线:
这些方法各有局限。纯粹依赖数据学习时,一致性约束往往不够硬;几何或光流方法通常需要额外输入,且更适合特定场景。CorrAdapter 试图回答一个更基础的问题:如果推理时没有额外几何或语义先验,模型自己内部有没有可用的对应关系?
这篇工作的出发点很有意思。扩散模型生成图像时,最开始只有高斯噪声,表面上看还没有任何可匹配的图像内容。但作者观察到,在多图像扩散模型的中间层特征中,不同视角或不同帧之间已经会出现有意义的结构对齐。
换句话说,图像还没有真正生成出来,模型的内部特征空间里已经隐约知道:这块区域可能对应另一张图里的哪块区域。论文称之为 native correspondence,可以理解为模型自身“长出来”的对应关系。
这正是 CorrAdapter 的关键:不从外部找深度图、分割图或光流,而是利用扩散模型内部特征和注意力相似度,直接构建跨图像匹配。
CorrAdapter 被设计成插入 Transformer block 的旁路分支。它不替换原模型的主干,而是在多图像扩散模型的去噪过程中,额外做两件事:

图:CorrAdapter 在每个去噪时间步中,从中间特征构建跨图像对应关系,再围绕匹配区域进行局部信息聚合。
在 Transformer block 中,每张图的中间特征都会被投影成 query、key、value。常规注意力会通过 query-key 相似度来决定信息如何交互。CorrAdapter 借用了这一点:跨图像 token 之间的注意力相似度,天然可以作为区域匹配的线索。
具体来说,对任意两张待生成图像,CorrAdapter 根据它们中间特征的 query-key 相似度构建匹配关系。论文中先用最近邻匹配解释基本形式,实际实现中进一步使用匹配阈值筛选更可靠的对应点,避免把低置信度区域强行拉到一起。
这一点非常重要。CorrAdapter 并不是让所有区域互相平均,也不是粗暴增强全局注意力,而是先判断“哪里和哪里更像”,再决定应该让哪些区域交换信息。
有了对应关系后,第二步是做局部聚合。对于当前图像中的某个 token,CorrAdapter 会在另一张图中找到对应位置,并以该位置为中心裁剪一个局部窗口。随后,模型只在这个局部窗口内做注意力聚合,再把聚合后的特征与原始 Transformer 输出融合。
这样做有两个好处:
从直觉上看,CorrAdapter 更像是在告诉模型:不要泛泛地让所有图互相交流,而是先找到真正对应的地方,再让这些地方互相校准。
CorrAdapter 的主设定是 无需训练(training-free):插入已有多图像扩散模型后,在推理阶段直接工作。对于已有多视角或视频扩散模型来说,这一点很实用,因为不需要重新收集数据、重新训练大模型。
论文也提供了一个可选训练版本 CorrAdapter。这个版本会用 LoRA 对部分 Transformer 分支进行轻量微调,并引入基于 LoFTR 的对应关系监督,让中间特征更适合建立稳定匹配。补充材料中提到,训练数据来自过滤后的 Objaverse 子集,约 70k 个样本,每个物体渲染 6 个正交视角,并用 Cap3D 提供文本描述;训练 1 个 epoch,大约需要 4 张 NVIDIA RTX 6000 Ada GPU 跑 24 小时。
值得注意的是,作者也尝试过直接把匹配模块和一致性损失一起端到端训练,但效果反而不如免训练版本。论文分析认为,匹配和裁剪过程会让梯度传播变得不稳定。因此最终采用的策略是:先通过 LoRA 让特征更一致,再在推理时加入 CorrAdapter 的匹配聚合分支。
这篇论文有一个关键判断:扩散模型内部特征确实能产生可靠匹配。为了验证这一点,作者把 CorrAdapter 构建出的原生对应关系拿出来,与 SIFT、SuperPoint 等传统/学习型匹配方法进行比较。

图:绿色线表示正确匹配,红色线表示错误匹配。CorrAdapter 从扩散模型内部特征得到的对应关系,在匹配数量和准确率上都具有竞争力。
从可视化结果看,即使是在视角变化较大、纹理较少或局部形变明显的情况下,扩散模型的中间特征也能提供相当有用的匹配信号。例如论文中闹钟样例里,CorrAdapter 得到 97/119 个正确匹配,准确率 81.5%;鞋子样例中得到 67/90 个正确匹配,准确率 74.4%。这些结果说明,CorrAdapter 的核心假设不是凭空成立的:多图像扩散模型内部确实已经蕴含了可以被显式利用的跨图像结构对应。
论文分别在静态场景和动态场景上评估 CorrAdapter。静态场景包括图像条件多视角生成和文本条件多视角生成;动态场景主要是文本到视频生成。

图:CorrAdapter 可以修复多视角生成中的结构扭曲、内容缺失,也能缓解视频帧中的主体局部崩坏。
作者在 GSO 数据集上评估 SyncDreamer 和 MVAdapter 两个强基线。SyncDreamer 生成 16 个视角,MVAdapter 生成 6 个视角。评价指标分为两类:单图质量指标(PSNR、SSIM、LPIPS)和几何一致性指标(cPSNR、cSSIM、cLPIPS、CD、depth、MEt3R)。
方法 | 单图质量 | 几何一致性 |
|---|---|---|
SyncDreamer -> SyncDreamer + CorrAdapter | PSNR 19.24 -> 19.72;SSIM 0.8215 -> 0.8310;LPIPS 0.1557 -> 0.1472 | cPSNR 26.28 -> 27.20;cLPIPS 0.0634 -> 0.0572;depth 14.15 -> 12.60;MEt3R 0.1656 -> 0.1529 |
MVAdapter -> MVAdapter + CorrAdapter | PSNR 23.15 -> 23.82;SSIM 0.8761 -> 0.8829;LPIPS 0.1276 -> 0.1235 | cPSNR 18.75 -> 19.68;cLPIPS 0.2519 -> 0.2371;CD 9.75 -> 9.20;MEt3R 0.2116 -> 0.2036 |
MVAdapter -> MVAdapter + CorrAdapter* | PSNR 23.15 -> 24.05;SSIM 0.8761 -> 0.8866;LPIPS 0.1276 -> 0.1220 | cPSNR 18.75 -> 20.47;cSSIM 0.7201 -> 0.7634;cLPIPS 0.2519 -> 0.2256;MEt3R 0.2116 -> 0.1955 |
可以看到,CorrAdapter 不只是让指标小幅波动,而是在多个一致性指标上都有稳定收益。更重要的是,这种收益来自不同基线:一个是 SyncDreamer,一个是 MVAdapter,说明它不是为某一个模型定制的“小补丁”。

图:在 SyncDreamer 上加入 CorrAdapter 后,多视角结果在局部结构、纹理延续和物体完整性上更稳定。
对于文本到多视角生成,论文在 Objaverse 上随机选取 1000 个 prompt 进行评估。基线是 MVAdapter 的文本条件版本。
方法 | 单图/文本相关指标 | 几何一致性指标 |
|---|---|---|
MVAdapter | FID 24.20;IS 15.22;CLIP-Score 33.10 | cPSNR 14.09;cSSIM 0.5797;cLPIPS 0.3513;CD 12.70;MEt3R 0.3017 |
MVAdapter + CorrAdapter | FID 23.42;IS 15.96;CLIP-Score 33.17 | cPSNR 14.29;cSSIM 0.5786;cLPIPS 0.3418;CD 12.63;MEt3R 0.2986 |
MVAdapter + CorrAdapter* | FID 24.17;IS 17.07;CLIP-Score 33.52 | cPSNR 15.27;cSSIM 0.6275;cLPIPS 0.3085;CD 11.61;MEt3R 0.2701 |
文本条件生成本身更开放,过强的一致性约束可能损害多样性。因此论文在这类任务上只在前若干去噪步启用 CorrAdapter,以避免后期把生成结果“锁死”。从结果看,CorrAdapter* 在 CLIP-Score、IS 和多项几何一致性指标上都有提升,说明一致性增强并没有以明显牺牲文本语义为代价。
在动态视频生成上,作者以 Wan2.1-1.3B 为基线,并采用 VBench 指标评估。CorrAdapter 主要提升主体一致性、背景一致性和文本-视频整体一致性。
指标 | Wan2.1 | Wan2.1 + CorrAdapter |
|---|---|---|
Subject Consistency | 0.9536 | 0.9715 |
Background Consistency | 0.9626 | 0.9696 |
Motion Smoothness | 0.9851 | 0.9857 |
Aesthetic Quality | 0.6016 | 0.6071 |
Scene | 0.2202 | 0.2878 |
Overall Consistency | 0.2275 | 0.2320 |
Dynamic Degree | 0.5556 | 0.5139 |
这里有一个值得注意的取舍:CorrAdapter 增强了一致性,但 Dynamic Degree 有所下降。也就是说,它会让视频更稳定,但可能略微降低运动幅度。这符合它的设计目标,也提醒后续研究需要更精细地平衡“稳定”和“动态”。

图:在 Wan2.1 上加入 CorrAdapter 后,视频帧中的主体局部崩坏、背景突变等现象明显减少。
补充材料进一步验证了 CorrAdapter 的泛化性:
任务 | 基线 | 加入 CorrAdapter 后的变化 |
|---|---|---|
图像条件多视角生成 | Zero123++ | PSNR 20.70 -> 21.55;cSSIM 0.7771 -> 0.7934;MEt3R 0.4008 -> 0.3982 |
文本条件多视角生成 | MVDream | FID 32.06 -> 29.94;cPSNR 15.86 -> 17.23;cSSIM 0.6965 -> 0.7474;MEt3R 0.2945 -> 0.2728 |
文本到视频生成 | HunyuanVideo | Subject Consistency 0.9659 -> 0.9732;Background Consistency 0.9761 -> 0.9815;Overall Consistency 0.2503 -> 0.2571 |
这组结果进一步说明,CorrAdapter 的价值不局限于某个具体模型,而是可以作为多图像扩散模型的一类通用一致性增强模块。
CorrAdapter 需要构建对应关系并做局部聚合,因此会带来额外推理开销。论文在 MVAdapter 上统计了时间、FLOPs、参数量和显存:
方法 | 时间 | FLOPs | 参数量 | 峰值显存 |
|---|---|---|---|---|
MVAdapter | 33.42s | 2.71P | 4.29G | 15.27GB |
MVAdapter + CorrAdapter | 39.83s | 2.73P | 4.30G | 20.86GB |
MVAdapter + CorrAdapter* | 40.60s | 2.74P | 4.31G | 20.88GB |
从数字看,FLOPs 和参数量增加很少,主要成本体现在推理时间和显存上。考虑到 CorrAdapter 带来的多项一致性收益,这个开销在高质量多视角生成或视频生成场景中是可以接受的。
当前 GitHub 仓库已经提供了两个图像条件静态场景的集成版本:
image-conditioned/static/SyncDreamer:SyncDreamer + CorrAdapter,免训练推理分支;image-conditioned/static/MVAdapter:MVAdapter + CorrAdapter,以及可选训练版本 MVAdapter + CorrAdapter*。其中,MVAdapter + CorrAdapter* 的训练权重也已放出: https://huggingface.co/SuhZhang/CorrAdapter-Model-on-MVAdapter
仓库 README 中还列出了后续计划支持的方向,包括 Zero123++、文本条件 MVAdapter、MVDream、Wan2.1 和 HunyuanVideo 等。对于希望复现或进一步开发的同学,建议优先从已发布的 SyncDreamer 和 MVAdapter 两条路径入手。
CorrAdapter 解决的是生成图像之间的一致性问题,但它并不能完全修复基线模型本身对条件理解不足的问题。补充材料中也展示了一些失败案例:例如输入条件本身要求生成模型理解不可见背面、复杂文本属性或不常见结构时,如果基线模型已经偏离条件,CorrAdapter 可能只能让多张输出彼此更一致,而不能保证它们一定更符合输入条件。
这也指出了一个很自然的后续方向:除了对齐生成结果之间的关系,未来还需要进一步挖掘扩散过程中的多模态条件线索,让输出与文本、图像等条件本身也对齐得更好。
Align Images Before You Generate 的亮点在于,它没有把一致性问题完全交给更大规模训练,也没有依赖额外几何输入,而是回到扩散模型自身:多图像扩散模型的中间特征里,已经存在可利用的跨图像对应关系。
CorrAdapter 通过“原生对应关系构建器 + 对齐区域聚合器”这两个模块,把这些内部对应关系显式用起来,让模型在图像真正生成出来之前就开始对齐。它可以以免训练方式接入不同多图像扩散模型,也可以通过轻量训练进一步增强性能。对于多视角生成、3D 内容生成和视频生成来说,这种思路都很有启发性:一致性不一定只能靠外部先验,也可以从生成模型自己的内部表征中挖出来。
如果用一句话概括这篇工作:CorrAdapter 让多图像扩散模型先找到彼此对应的地方,再动手生成,因此结果更稳定、更连贯,也更适合需要跨视角、跨时间一致性的生成任务。
本文系学术转载,如有侵权,请联系CVer小助手删文