[CVPR 2026] FREE-Edit:Rectified Flow 模型下的零样本视频编辑新范式
FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing
本文提出了 FREE-Edit,一种基于 Rectified Flow (RF) 模型的零样本(Zero-shot)图像驱动视频编辑框架。通过引入“编辑感知注入”(Editing-awaRE, REE)机制,该方法在保持原始视频运动轨迹的同时,精准地将首帧的编辑效果传播至全片,在 LTX-Video 模型上实现了 SOTA 性能。
TL;DR
在视频生成领域,Rectified Flow (RF) 模型正逐渐超越传统的扩散模型。然而,如何精准地“改动想改的地儿,留住不想改的动感”依然是难题。FREE-Edit 给出了一种优雅的解法:它无需任何训练或微调(Zero-shot),通过光流追踪编辑区域,并动态调整 Transformer 中的特征注入强度。结果证明,其在推理速度和编辑保真度上均刷新了记录。
背景定位:从文本驱动到图像驱动
目前的视频编辑多依赖 Prompt,但文本描述往往难以精准控制局部细节。图像驱动(Image-driven)编辑——即“改好视频第一帧,后面跟着变”——更符合实际生产流。 以往的方法(如 AnyV2V)虽然尝试在去噪时注入原始视频的特征,但这种“胡子眉毛一把抓”的 Vanilla Injection(统一强度注入)经常导致编辑效果被原始画面覆盖。
痛点深挖:注入的“过犹不及”
作者指出,在处理 RF 模型(如 LTX-Video)时,传统的特征注入存在严重的语义冲突:
- 过度注入 (Excessive Injection):原始视频的特征会“漏”到编辑区域,比如你把一个男人的帽子改成了草帽,原始的黑礼帽特征会强行扭曲它。
- 注入不足 (Insufficient Injection):视频会失去原来的运动逻辑,背景乱晃,完全不像同一个视频。
核心方法:REE (Editing-awaRE) 注入机制
1. 动态掩码追踪
FREE-Edit 的第一步是“锁定目标”。它计算编辑前后首帧的差异图 D1,生成二值化掩码 M1。为了让这个掩码在后续帧中也生效,作者引入了 RAFT 光流估计。 通过公式 ,首帧的编辑区被精准地“带”到了每一帧。
2. 权重调节因子 λ
这是本文的灵魂。在 Transformer 的 Self-attention 层,作者修改了 Query (Q) 和 Key (K) 的计算方式:
- 在编辑区域:,完全使用去噪分支的特征,确保“新内容”长得准。
- 在非编辑区域:,注入原始视频特征,确保“老动作”不走样。

实验战绩:速度与质量的双重碾压
实验在 I2V-Edit-Benchmark(包含 60 个复杂视频,涵盖物体替换、风格转换等 6 种类型)上展开。
- 非编辑区保真度:PSNR 达到 27.05,远超 I2VEdit (22.57) 和 AnyV2V (22.08)。
- 效率表现:得益于 LTX-Video 的实时特性,FREE-Edit 仅需 1.53 分钟 即可完成 41 帧编辑,而此前的 SOTA 方法 I2VEdit 则需要长达 2 小时 的一轮微调。

从可视化结果(如上图)可以明显看出,相比 Vanilla 注入带来的内容模糊,REE 注入后的视频物体边缘清晰,运动自然。
深度洞察:RF 模型的潜力
FREE-Edit 的成功不仅在于其掩码策略,更在于其对 Rectified Flow 这种“直线流”模型的适配。RF 模型生成的路径更平滑,结合光流引导,能比传统 DDPM 模型更稳定地处理长序列。
局限性与挑战
虽然该方法在传播已有运动方面几近完美,但它目前无法为新加入的物体生成自由运动。例如:如果你在静止湖面上加了一只海龟,它只能跟着湖面的波纹纹理微动,无法自主游走。这是因为它的运动信号完全来源于 Source Video。
结论
FREE-Edit 为我们展示了一个高效、低成本的视频编辑方案。它证明了在生成式 AI 时代,经典的计算机视觉工具(如光流)与最前沿的 Flow 模型结合,依然能迸发出巨大的能量。对于开发者而言,这种 Training-free 的特性使其成为极具落地潜力的工业级方案。
