首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >CVPR 2026 | CorrAdapter:让多图扩散模型先“对齐”,再生成

CVPR 2026 | CorrAdapter:让多图扩散模型先“对齐”,再生成

作者头像
Amusi
发布2026-07-27 21:30:41
发布2026-07-27 21:30:41
640
举报
文章被收录于专栏:CVerCVer

多视角生成和视频生成有一个共同的难点:单张图看上去可能都不错,但放在一起就容易“穿帮”。同一个物体换个视角后结构变了,纹理一会儿有一会儿没;视频里主体走着走着形状漂移,背景也会出现不连续的跳动。对于多图像扩散模型来说,这类问题通常被概括为时空一致性不足。 CVPR 2026 论文 Align Images Before You Generate 提出了一个很直接、也很巧妙的思路:既然最终生成的多张图应该描述同一个场景,那么能不能在图像真正生成出来之前,就从扩散模型内部找到它们之间的对应关系,并利用这些对应关系约束后续生成? 作者给出的答案是 CorrAdapter。它是一个即插即用的时空一致性适配器,不依赖额外深度图、分割图、光流或显式几何先验,而是直接从多图像扩散模型的中间特征里挖掘“扩散原生对应关系”(diffusion-native correspondence),再让模型只在对齐区域之间聚合信息。实验表明,CorrAdapter 可以稳定提升图像条件多视角生成、文本条件多视角生成,以及文本到视频生成中的一致性。

图:CorrAdapter 面向静态多视角和动态视频两类多图生成任务,核心目标是减少跨视角、跨帧的结构和纹理漂移。

论文信息

论文标题: Align Images Before You Generate 作者: Shihua Zhang, Qiuhong Shen, Xinchao Wang 单位: National University of Singapore 会议: CVPR 2026 论文主页:

https://openaccess.thecvf.com/content/CVPR2026/html/Zhang_Align_Images_Before_You_Generate_CVPR_2026_paper.html 论文 PDF:

https://openaccess.thecvf.com/content/CVPR2026/papers/Zhang_Align_Images_Before_You_Generate_CVPR_2026_paper.pdf 补充材料:

https://openaccess.thecvf.com/content/CVPR2026/supplemental/Zhang_Align_Images_Before_CVPR_2026_supplemental.pdf 代码:

https://github.com/SuhZhang/CorrAdapter

一、问题:多图生成为什么总会“不一致”?

多图像扩散模型通常一次生成一组相关图像,例如同一物体的多视角图,或者同一视频的连续帧。这些任务的共同要求是:多张图不仅要各自真实,还要彼此说得通。

以单图到多视角生成为例,模型需要根据一张参考图补全物体在不同角度下的外观。它不仅要猜出背面、侧面是什么样子,还要保证物体的主体结构、纹理位置和语义细节在各个视角中保持一致。视频生成也是类似:主体、背景、动作和镜头都在变化,但同一个对象不应该突然变形或丢失关键部件。

已有方法大致有几条路线:

  • 依赖跨图像 Transformer,让模型从大规模数据里学到隐式一致性;
  • 引入几何约束,例如深度、极线约束、多视角几何;
  • 在视频任务中借助光流或关键帧匹配来约束局部运动。

这些方法各有局限。纯粹依赖数据学习时,一致性约束往往不够硬;几何或光流方法通常需要额外输入,且更适合特定场景。CorrAdapter 试图回答一个更基础的问题:如果推理时没有额外几何或语义先验,模型自己内部有没有可用的对应关系?

二、核心观察:噪声特征里已经藏着对应关系

这篇工作的出发点很有意思。扩散模型生成图像时,最开始只有高斯噪声,表面上看还没有任何可匹配的图像内容。但作者观察到,在多图像扩散模型的中间层特征中,不同视角或不同帧之间已经会出现有意义的结构对齐。

换句话说,图像还没有真正生成出来,模型的内部特征空间里已经隐约知道:这块区域可能对应另一张图里的哪块区域。论文称之为 native correspondence,可以理解为模型自身“长出来”的对应关系。

这正是 CorrAdapter 的关键:不从外部找深度图、分割图或光流,而是利用扩散模型内部特征和注意力相似度,直接构建跨图像匹配。

三、方法:一个旁路分支,两步完成“先对齐再生成”

CorrAdapter 被设计成插入 Transformer block 的旁路分支。它不替换原模型的主干,而是在多图像扩散模型的去噪过程中,额外做两件事:

  1. 构建原生对应关系;
  2. 只在对齐区域之间聚合信息。

图:CorrAdapter 在每个去噪时间步中,从中间特征构建跨图像对应关系,再围绕匹配区域进行局部信息聚合。

1. Native Correspondence Constructor:从注意力里找匹配

在 Transformer block 中,每张图的中间特征都会被投影成 query、key、value。常规注意力会通过 query-key 相似度来决定信息如何交互。CorrAdapter 借用了这一点:跨图像 token 之间的注意力相似度,天然可以作为区域匹配的线索。

具体来说,对任意两张待生成图像,CorrAdapter 根据它们中间特征的 query-key 相似度构建匹配关系。论文中先用最近邻匹配解释基本形式,实际实现中进一步使用匹配阈值筛选更可靠的对应点,避免把低置信度区域强行拉到一起。

这一点非常重要。CorrAdapter 并不是让所有区域互相平均,也不是粗暴增强全局注意力,而是先判断“哪里和哪里更像”,再决定应该让哪些区域交换信息。

2. Aligned Area Aggregator:只聚合对齐区域

有了对应关系后,第二步是做局部聚合。对于当前图像中的某个 token,CorrAdapter 会在另一张图中找到对应位置,并以该位置为中心裁剪一个局部窗口。随后,模型只在这个局部窗口内做注意力聚合,再把聚合后的特征与原始 Transformer 输出融合。

这样做有两个好处:

  • 增强匹配区域的一致性。 同一物体部件、同一纹理区域可以在不同视角或不同帧之间互相补充信息;
  • 减少错误信息传播。 非匹配区域不会被强行混合,避免把背景、遮挡区域或不相关结构错误地传过去。

从直觉上看,CorrAdapter 更像是在告诉模型:不要泛泛地让所有图互相交流,而是先找到真正对应的地方,再让这些地方互相校准。

四、免训练,也可以进一步微调

CorrAdapter 的主设定是 无需训练(training-free):插入已有多图像扩散模型后,在推理阶段直接工作。对于已有多视角或视频扩散模型来说,这一点很实用,因为不需要重新收集数据、重新训练大模型。

论文也提供了一个可选训练版本 CorrAdapter。这个版本会用 LoRA 对部分 Transformer 分支进行轻量微调,并引入基于 LoFTR 的对应关系监督,让中间特征更适合建立稳定匹配。补充材料中提到,训练数据来自过滤后的 Objaverse 子集,约 70k 个样本,每个物体渲染 6 个正交视角,并用 Cap3D 提供文本描述;训练 1 个 epoch,大约需要 4 张 NVIDIA RTX 6000 Ada GPU 跑 24 小时。

值得注意的是,作者也尝试过直接把匹配模块和一致性损失一起端到端训练,但效果反而不如免训练版本。论文分析认为,匹配和裁剪过程会让梯度传播变得不稳定。因此最终采用的策略是:先通过 LoRA 让特征更一致,再在推理时加入 CorrAdapter 的匹配聚合分支。

五、原生对应关系靠谱吗?

这篇论文有一个关键判断:扩散模型内部特征确实能产生可靠匹配。为了验证这一点,作者把 CorrAdapter 构建出的原生对应关系拿出来,与 SIFT、SuperPoint 等传统/学习型匹配方法进行比较。

图:绿色线表示正确匹配,红色线表示错误匹配。CorrAdapter 从扩散模型内部特征得到的对应关系,在匹配数量和准确率上都具有竞争力。

从可视化结果看,即使是在视角变化较大、纹理较少或局部形变明显的情况下,扩散模型的中间特征也能提供相当有用的匹配信号。例如论文中闹钟样例里,CorrAdapter 得到 97/119 个正确匹配,准确率 81.5%;鞋子样例中得到 67/90 个正确匹配,准确率 74.4%。这些结果说明,CorrAdapter 的核心假设不是凭空成立的:多图像扩散模型内部确实已经蕴含了可以被显式利用的跨图像结构对应。

六、实验:静态多视角和动态视频都能提升

论文分别在静态场景和动态场景上评估 CorrAdapter。静态场景包括图像条件多视角生成和文本条件多视角生成;动态场景主要是文本到视频生成。

图:CorrAdapter 可以修复多视角生成中的结构扭曲、内容缺失,也能缓解视频帧中的主体局部崩坏。

1. 图像条件多视角生成

作者在 GSO 数据集上评估 SyncDreamer 和 MVAdapter 两个强基线。SyncDreamer 生成 16 个视角,MVAdapter 生成 6 个视角。评价指标分为两类:单图质量指标(PSNR、SSIM、LPIPS)和几何一致性指标(cPSNR、cSSIM、cLPIPS、CD、depth、MEt3R)。

方法

单图质量

几何一致性

SyncDreamer -> SyncDreamer + CorrAdapter

PSNR 19.24 -> 19.72;SSIM 0.8215 -> 0.8310;LPIPS 0.1557 -> 0.1472

cPSNR 26.28 -> 27.20;cLPIPS 0.0634 -> 0.0572;depth 14.15 -> 12.60;MEt3R 0.1656 -> 0.1529

MVAdapter -> MVAdapter + CorrAdapter

PSNR 23.15 -> 23.82;SSIM 0.8761 -> 0.8829;LPIPS 0.1276 -> 0.1235

cPSNR 18.75 -> 19.68;cLPIPS 0.2519 -> 0.2371;CD 9.75 -> 9.20;MEt3R 0.2116 -> 0.2036

MVAdapter -> MVAdapter + CorrAdapter*

PSNR 23.15 -> 24.05;SSIM 0.8761 -> 0.8866;LPIPS 0.1276 -> 0.1220

cPSNR 18.75 -> 20.47;cSSIM 0.7201 -> 0.7634;cLPIPS 0.2519 -> 0.2256;MEt3R 0.2116 -> 0.1955

可以看到,CorrAdapter 不只是让指标小幅波动,而是在多个一致性指标上都有稳定收益。更重要的是,这种收益来自不同基线:一个是 SyncDreamer,一个是 MVAdapter,说明它不是为某一个模型定制的“小补丁”。

图:在 SyncDreamer 上加入 CorrAdapter 后,多视角结果在局部结构、纹理延续和物体完整性上更稳定。

2. 文本条件多视角生成

对于文本到多视角生成,论文在 Objaverse 上随机选取 1000 个 prompt 进行评估。基线是 MVAdapter 的文本条件版本。

方法

单图/文本相关指标

几何一致性指标

MVAdapter

FID 24.20;IS 15.22;CLIP-Score 33.10

cPSNR 14.09;cSSIM 0.5797;cLPIPS 0.3513;CD 12.70;MEt3R 0.3017

MVAdapter + CorrAdapter

FID 23.42;IS 15.96;CLIP-Score 33.17

cPSNR 14.29;cSSIM 0.5786;cLPIPS 0.3418;CD 12.63;MEt3R 0.2986

MVAdapter + CorrAdapter*

FID 24.17;IS 17.07;CLIP-Score 33.52

cPSNR 15.27;cSSIM 0.6275;cLPIPS 0.3085;CD 11.61;MEt3R 0.2701

文本条件生成本身更开放,过强的一致性约束可能损害多样性。因此论文在这类任务上只在前若干去噪步启用 CorrAdapter,以避免后期把生成结果“锁死”。从结果看,CorrAdapter* 在 CLIP-Score、IS 和多项几何一致性指标上都有提升,说明一致性增强并没有以明显牺牲文本语义为代价。

3. 文本到视频生成

在动态视频生成上,作者以 Wan2.1-1.3B 为基线,并采用 VBench 指标评估。CorrAdapter 主要提升主体一致性、背景一致性和文本-视频整体一致性。

指标

Wan2.1

Wan2.1 + CorrAdapter

Subject Consistency

0.9536

0.9715

Background Consistency

0.9626

0.9696

Motion Smoothness

0.9851

0.9857

Aesthetic Quality

0.6016

0.6071

Scene

0.2202

0.2878

Overall Consistency

0.2275

0.2320

Dynamic Degree

0.5556

0.5139

这里有一个值得注意的取舍:CorrAdapter 增强了一致性,但 Dynamic Degree 有所下降。也就是说,它会让视频更稳定,但可能略微降低运动幅度。这符合它的设计目标,也提醒后续研究需要更精细地平衡“稳定”和“动态”。

图:在 Wan2.1 上加入 CorrAdapter 后,视频帧中的主体局部崩坏、背景突变等现象明显减少。

4. 更多基线:Zero123++、MVDream、HunyuanVideo

补充材料进一步验证了 CorrAdapter 的泛化性:

任务

基线

加入 CorrAdapter 后的变化

图像条件多视角生成

Zero123++

PSNR 20.70 -> 21.55;cSSIM 0.7771 -> 0.7934;MEt3R 0.4008 -> 0.3982

文本条件多视角生成

MVDream

FID 32.06 -> 29.94;cPSNR 15.86 -> 17.23;cSSIM 0.6965 -> 0.7474;MEt3R 0.2945 -> 0.2728

文本到视频生成

HunyuanVideo

Subject Consistency 0.9659 -> 0.9732;Background Consistency 0.9761 -> 0.9815;Overall Consistency 0.2503 -> 0.2571

这组结果进一步说明,CorrAdapter 的价值不局限于某个具体模型,而是可以作为多图像扩散模型的一类通用一致性增强模块。

七、效率:不是没有代价,但开销可控

CorrAdapter 需要构建对应关系并做局部聚合,因此会带来额外推理开销。论文在 MVAdapter 上统计了时间、FLOPs、参数量和显存:

方法

时间

FLOPs

参数量

峰值显存

MVAdapter

33.42s

2.71P

4.29G

15.27GB

MVAdapter + CorrAdapter

39.83s

2.73P

4.30G

20.86GB

MVAdapter + CorrAdapter*

40.60s

2.74P

4.31G

20.88GB

从数字看,FLOPs 和参数量增加很少,主要成本体现在推理时间和显存上。考虑到 CorrAdapter 带来的多项一致性收益,这个开销在高质量多视角生成或视频生成场景中是可以接受的。

八、开源情况

当前 GitHub 仓库已经提供了两个图像条件静态场景的集成版本:

  • image-conditioned/static/SyncDreamer:SyncDreamer + CorrAdapter,免训练推理分支;
  • image-conditioned/static/MVAdapter:MVAdapter + CorrAdapter,以及可选训练版本 MVAdapter + CorrAdapter*。

其中,MVAdapter + CorrAdapter* 的训练权重也已放出: https://huggingface.co/SuhZhang/CorrAdapter-Model-on-MVAdapter

仓库 README 中还列出了后续计划支持的方向,包括 Zero123++、文本条件 MVAdapter、MVDream、Wan2.1 和 HunyuanVideo 等。对于希望复现或进一步开发的同学,建议优先从已发布的 SyncDreamer 和 MVAdapter 两条路径入手。

九、局限性与展望

CorrAdapter 解决的是生成图像之间的一致性问题,但它并不能完全修复基线模型本身对条件理解不足的问题。补充材料中也展示了一些失败案例:例如输入条件本身要求生成模型理解不可见背面、复杂文本属性或不常见结构时,如果基线模型已经偏离条件,CorrAdapter 可能只能让多张输出彼此更一致,而不能保证它们一定更符合输入条件。

这也指出了一个很自然的后续方向:除了对齐生成结果之间的关系,未来还需要进一步挖掘扩散过程中的多模态条件线索,让输出与文本、图像等条件本身也对齐得更好。

十、总结

Align Images Before You Generate 的亮点在于,它没有把一致性问题完全交给更大规模训练,也没有依赖额外几何输入,而是回到扩散模型自身:多图像扩散模型的中间特征里,已经存在可利用的跨图像对应关系。

CorrAdapter 通过“原生对应关系构建器 + 对齐区域聚合器”这两个模块,把这些内部对应关系显式用起来,让模型在图像真正生成出来之前就开始对齐。它可以以免训练方式接入不同多图像扩散模型,也可以通过轻量训练进一步增强性能。对于多视角生成、3D 内容生成和视频生成来说,这种思路都很有启发性:一致性不一定只能靠外部先验,也可以从生成模型自己的内部表征中挖出来。

如果用一句话概括这篇工作:CorrAdapter 让多图像扩散模型先找到彼此对应的地方,再动手生成,因此结果更稳定、更连贯,也更适合需要跨视角、跨时间一致性的生成任务。

本文系学术转载,如有侵权,请联系CVer小助手删文

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-26,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 CVer 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 论文信息
  • 一、问题:多图生成为什么总会“不一致”?
  • 二、核心观察:噪声特征里已经藏着对应关系
  • 三、方法:一个旁路分支,两步完成“先对齐再生成”
    • 1. Native Correspondence Constructor:从注意力里找匹配
    • 2. Aligned Area Aggregator:只聚合对齐区域
  • 四、免训练,也可以进一步微调
  • 五、原生对应关系靠谱吗?
  • 六、实验:静态多视角和动态视频都能提升
    • 1. 图像条件多视角生成
    • 2. 文本条件多视角生成
    • 3. 文本到视频生成
    • 4. 更多基线:Zero123++、MVDream、HunyuanVideo
  • 七、效率:不是没有代价,但开销可控
  • 八、开源情况
  • 九、局限性与展望
  • 十、总结
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档