[CVPR 2026] FREE-Edit:Rectified Flow 模型下的零样本视频编辑新范式

FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing

总结
问题
方法
结果
要点
摘要

本文提出了 FREE-Edit,一种基于 Rectified Flow (RF) 模型的零样本(Zero-shot)图像驱动视频编辑框架。通过引入“编辑感知注入”(Editing-awaRE, REE)机制,该方法在保持原始视频运动轨迹的同时,精准地将首帧的编辑效果传播至全片,在 LTX-Video 模型上实现了 SOTA 性能。

TL;DR

在视频生成领域,Rectified Flow (RF) 模型正逐渐超越传统的扩散模型。然而,如何精准地“改动想改的地儿,留住不想改的动感”依然是难题。FREE-Edit 给出了一种优雅的解法:它无需任何训练或微调(Zero-shot),通过光流追踪编辑区域,并动态调整 Transformer 中的特征注入强度。结果证明,其在推理速度和编辑保真度上均刷新了记录。

背景定位:从文本驱动到图像驱动

目前的视频编辑多依赖 Prompt,但文本描述往往难以精准控制局部细节。图像驱动(Image-driven)编辑——即“改好视频第一帧,后面跟着变”——更符合实际生产流。 以往的方法(如 AnyV2V)虽然尝试在去噪时注入原始视频的特征,但这种“胡子眉毛一把抓”的 Vanilla Injection(统一强度注入)经常导致编辑效果被原始画面覆盖。

痛点深挖:注入的“过犹不及”

作者指出,在处理 RF 模型(如 LTX-Video)时,传统的特征注入存在严重的语义冲突:

  1. 过度注入 (Excessive Injection):原始视频的特征会“漏”到编辑区域,比如你把一个男人的帽子改成了草帽,原始的黑礼帽特征会强行扭曲它。
  2. 注入不足 (Insufficient Injection):视频会失去原来的运动逻辑,背景乱晃,完全不像同一个视频。

核心方法:REE (Editing-awaRE) 注入机制

1. 动态掩码追踪

FREE-Edit 的第一步是“锁定目标”。它计算编辑前后首帧的差异图 D1,生成二值化掩码 M1。为了让这个掩码在后续帧中也生效,作者引入了 RAFT 光流估计。 通过公式 ,首帧的编辑区被精准地“带”到了每一帧。

2. 权重调节因子 λ

这是本文的灵魂。在 Transformer 的 Self-attention 层,作者修改了 Query (Q) 和 Key (K) 的计算方式:

  • 在编辑区域:,完全使用去噪分支的特征,确保“新内容”长得准。
  • 在非编辑区域:,注入原始视频特征,确保“老动作”不走样。

模型架构图

实验战绩:速度与质量的双重碾压

实验在 I2V-Edit-Benchmark(包含 60 个复杂视频,涵盖物体替换、风格转换等 6 种类型)上展开。

  • 非编辑区保真度:PSNR 达到 27.05,远超 I2VEdit (22.57) 和 AnyV2V (22.08)。
  • 效率表现:得益于 LTX-Video 的实时特性,FREE-Edit 仅需 1.53 分钟 即可完成 41 帧编辑,而此前的 SOTA 方法 I2VEdit 则需要长达 2 小时 的一轮微调。

实验结果对比

从可视化结果(如上图)可以明显看出,相比 Vanilla 注入带来的内容模糊,REE 注入后的视频物体边缘清晰,运动自然。

深度洞察:RF 模型的潜力

FREE-Edit 的成功不仅在于其掩码策略,更在于其对 Rectified Flow 这种“直线流”模型的适配。RF 模型生成的路径更平滑,结合光流引导,能比传统 DDPM 模型更稳定地处理长序列。

局限性与挑战

虽然该方法在传播已有运动方面几近完美,但它目前无法为新加入的物体生成自由运动。例如:如果你在静止湖面上加了一只海龟,它只能跟着湖面的波纹纹理微动,无法自主游走。这是因为它的运动信号完全来源于 Source Video。

结论

FREE-Edit 为我们展示了一个高效、低成本的视频编辑方案。它证明了在生成式 AI 时代,经典的计算机视觉工具(如光流)与最前沿的 Flow 模型结合,依然能迸发出巨大的能量。对于开发者而言,这种 Training-free 的特性使其成为极具落地潜力的工业级方案。

发现相似论文

试试这些示例

  • 查找最近一年内其他利用光流(Optical Flow)或特征传播技术来增强视频编辑一致性的扩散模型论文。
  • 探究 Rectified Flow 模型中 ODE Inversion 与传统 Diffusion 模型中 DDIM Inversion 在语义保持能力上的理论差异。
  • 搜索是否有研究将视觉轨迹(Visual Trajectory)引导与 FREE-Edit 结合,以解决新增物体缺乏运动路径的问题。
目录
[CVPR 2026] FREE-Edit:Rectified Flow 模型下的零样本视频编辑新范式
1. TL;DR
2. 背景定位:从文本驱动到图像驱动
3. 痛点深挖:注入的“过犹不及”
4. 核心方法:REE (Editing-awaRE) 注入机制
4.1. 1. 动态掩码追踪
4.2. 2. 权重调节因子 λ
5. 实验战绩:速度与质量的双重碾压
6. 深度洞察:RF 模型的潜力
6.1. 局限性与挑战
7. 结论