[CVPR 2026] Kiwi-Edit:视频编辑的“进化形态”,指令+参考图双剑合璧

Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance

总结
问题
方法
结果
要点
摘要

本文提出了 Kiwi-Edit,一个支持语言指令和视觉参考(Reference)双向引导的全能视频编辑框架。通过引入大规模开源数据集 RefVIE(477K 三元组)和 MLLM-DiT 统一架构,该方法在保持视频时空一致性的同时,实现了极其精确的细粒度视觉控制,刷新了多项 SOTA 纪录。

TL;DR

传统的视频编辑往往面临“词不达意”的尴尬:你告诉 AI “给车换个涂装”,它生成的颜色可能完全不是你想要的。Kiwi-Edit 通过引入视觉参考(Reference Image)解决了这一痛点。它推出了首个大规模开源参考引导数据集 RefVIE(477K 个高保真四元组),并基于 MLLM 和 DiT 架构构建了一个能够精准“复刻”参考图细节的视频编辑引擎,性能全面超越了包括 Runway 在内的顶尖基线。

痛点深挖:为什么只靠文字行不通?

在 Video Editing 领域,Instruction-based(基于指令)的方法由于 text-only 的限制,存在物理意义上的“表达天花板”。

  • 歧义性:同样的“复古风”,在不同人心目中的纹理完全不同。
  • 数据荒:虽然 reference-guided 对图像编辑很成熟,但对视频而言,收集“修改前-修改后-参考物”的对应视频数据成本极高,导致开源界一直缺乏高质量数据集。

核心贡献 1:RefVIE 数据集——变废为宝的艺术

作者没有盲目进行人工标注,而是开发了一套可扩展的数据生成流水线。他们从已有的 3.7M 个文本编辑对出发:

  1. 精准定位:用垂直领域大模型 Qwen3-VL 找到视频中需要修改的区域(Grounding)。
  2. 自动合成:利用图像编辑模型(如 Qwen-Image-Edit)为视频中的目标对象专门合成一张“参考证件照”。
  3. 质控过滤:通过 EditScore 和 MLLM 对合成效果进行双重复核,最终精炼出 477K 组高质量数据。

RefVIE 生成流程

核心贡献 2:Kiwi-Edit 架构——语义与结构的完美平衡

Kiwi-Edit 的精髓在于其 Hybrid Injection(混合注入) 策略,它解决了视频编辑中“改哪里”和“怎么改”的矛盾:

1. 语义引导(Dual-Connector)

它把 MLLM 作为“大脑”,通过两个通道提取信号:

  • Query Connector:捕捉用户的操作意图(如“把背景换掉”)。
  • Latent Connector:提取参考图的密集视觉特征(如具体某件衣服的材质)。 这些 Token 被拼接成统一的上下文,通过 Cross-Attention 告诉 DiT 每一帧该画什么。

2. 结构保留(Element-wise Injection)

为了防止生成视频出现“人脸漂移”或背景崩坏,作者将源视频的 Latent 特征通过一个带时间步缩放(Timestep-dependent scalar γ) 的层,直接加到噪声图中。实验证明,这种简单的“相加”比复杂的“拼接”在训练稳定性上更好,能完美保留视频的运动轨迹。

Kiwi-Edit 模型架构图

实验与结果:全方位碾压

Kiwi-Edit 在 RefVIE-Bench(作者自建的严苛评测集)上展现了惊人的实力。

  • 性能 SOTA:在背景变换任务上,Kiwi-Edit 的 3.84 分远超 Runway Aleph 的 2.62 分。
  • 视觉保真度:如图 7 所示,当要求将背景换成特定的“插画风格”或更换特定款式的“汉堡”时,Kiwi-Edit 能够精准还原参考图中的颜色和结构,而不会像其他模型那样产生模糊效果。

实验结果可视化对比

深度洞察:为什么这种做法有效?

Kiwi-Edit 的成功不仅在于架构,更在于其三阶段训练课程(Curriculum Training)

  1. Alignment:先对齐 MLLM 和 DiT 的语义。
  2. Instruction Tuning:学习通用的编辑原语(如增、删、改)。
  3. Reference Fine-tuning:最后引入 RefVIE 数据进行视觉细节的“微操”训练。 这种由浅入深的方法,让模型既具备了大模型的理解力,又保留了扩散模型的生成细腻度。

展望与局限

尽管表现强悍,但论文也指出,当编辑任务极度复杂(如大规模背景移除同时叠加剧烈相机运动)时,模型在边缘细化(Matting Quality)上仍有提升空间。未来,将这种 reference-guided 能力扩展到长视频或更复杂的多模态交互中,将是行业关注的焦点。

总结

Kiwi-Edit 填补了开源界在视觉参考视频编辑领域的空白。它告诉我们:即便没有完美的手真标注数据,通过巧妙的模型组合与合成流水线,AI 依然能学会“按图索骥”,实现像素级的创作自由。

发现相似论文

试试这些示例

  • 查找最近一年关于利用合成数据(Synthetic Data)提升视频生成或编辑模型可控性的相关工作。
  • 哪篇论文最早在扩散模型中应用了特征注入(Feature Injection)技术,本文提出的带有时间步缩放的 scalar 策略是对其如何改进的?
  • 调研目前除了 DiT 架构外,还有哪些多模态架构(如 U-Net 或 SSM)被应用于支持视觉参考引导的视频编辑任务?
目录
[CVPR 2026] Kiwi-Edit:视频编辑的“进化形态”,指令+参考图双剑合璧
1. TL;DR
2. 痛点深挖:为什么只靠文字行不通?
3. 核心贡献 1:RefVIE 数据集——变废为宝的艺术
4. 核心贡献 2:Kiwi-Edit 架构——语义与结构的完美平衡
4.1. 1. 语义引导(Dual-Connector)
4.2. 2. 结构保留(Element-wise Injection)
5. 实验与结果:全方位碾压
6. 深度洞察:为什么这种做法有效?
7. 展望与局限
8. 总结