[CVPR 2025候选] Motion Factorization:解耦动作原型,开启免训练组合视频生成新范式

Training-free Motion Factorization for Compositional Video Generation

总结
问题
方法
结果
要点
摘要

本文提出了一个名为 Motion Factorization 的免训练(Training-free)视频生成框架,旨在解决组合视频生成(CVG)中多实例动作性质混淆的问题。通过将动作分解为静止、刚性运动和非刚性运动三类,该框架在 VideoCrafter-v2.0 和 CogVideoX-2B 等 SOTA 模型上实现了显著的生成质量提升。

TL;DR

在组合视频生成(Compositional Video Generation, CVG)领域,平衡多个物体的不同动作属性一直是个难题。本文提出的 Motion Factorization 框架,通过 LLM 结构化推理解耦动作引导,成功实现了将复杂场景动作分解为“静止、刚性、非刚性”三类。该方法无需任何微调,即可让 VideoCrafter 或 CogVideoX 等模型生成的视频在一致性和动态感上达到全新高度。

背景定位:由于“胡子眉毛一把抓”引发的动作崩坏

当前的视频生成模型虽然能生成漂亮的单目标视频,但在面对“一个静止的容器旁,一个拳击手正在挥拳,一辆救护车疾驰而过”这种复杂组合提示词时,往往会表现得非常吃力。

现有的 CVG 方法(如 VideoTetris 或 LVD)主要存在两个病灶:

  1. 语义模糊性:直接让 LLM 出 Bounding Box 序列容易导致动作路径断裂或尺寸异常。
  2. 引导单一化:对所有物体使用统一的 Diffusion Guidance,导致原本该静止的物体在晃动,而该变形的物体却像僵硬的石块。

核心方法论:先规划,后生成的双重奏

1. 结构化动作推理 (SMR)

作者认为,不能直接从自然语言跳到坐标点。SMR 模块引入了一个中介——Motion Graph (动作图)

  • 节点 (Nodes):代表实例,标注动作标签(静止/刚性/非刚性)。
  • 边 (Edges):代表实例间的时空交互(如“经过”、“在...之上”)。 通过这种结构化表达,LLM 可以依据物理规律(如速度、加速度公式)推导出更合理的 Bbox 序列。

模型架构图

2. 解耦动作引导 (DMG)

这是本文的精华所在,针对不同“段位”的动作分配不同的“教练”:

  • 静止分支 (RCG):将所有帧的特征锚定在表现最稳的参考帧上,彻底根治背景闪烁。
  • 刚性分支 (GIG):提取形状模板,通过像素点票选机制确保物体在移动过程中不发生“软化”或“融化”。
  • 非刚性分支 (SDG):针对跳舞、打斗等复杂形变,建立感知变形场与 Box 诱导变形场的像素级回归,引导模型生成 expressive 的动作。

解耦引导示意图


实验战果:全方位的 SOTA 飞跃

研究团队在自建的 CVGBench-mCVGBench-p(基于 MSR-VTT 和 Panda-70M)上进行了严苛测试。

指标CogVideoX-2B+ Ours (提升)
Subject Consistency ↑91.33%98.27% (+6.94%)
Background Consistency ↑92.78%97.73% (+4.95%)
Dynamic Degree ↑87.80%96.00% (+8.20%)

消融实验启示

从消融实验可以看出,如果没有 SMR 模块(直接文本转动作),视频质量会大幅下降。这意味着 LLM 生成的布局逻辑性 才是高质量视频的骨架。

实验结果对比


深度洞察与局限

为什么这种“分解”思想有效? 在高维的 Latent Space 中,不同性质的运动对应着不同的流形变换。强行用统一的 Attention 操作去覆盖它们会造成 Inductive Bias 的冲突。本文通过解耦 Mask,实际上是在注意力层级为不同物体定制了专属的“物理场”。

局限性 (Limitations): 尽管动作很溜,但该模型对稀有语义(如文中提到的 Dendroid 树人)和细腻情感(如“忧伤”的面部表情)处理欠佳。这反映了基础模型(Base Model)本身语义空间的局限。

总结

Motion Factorization 为我们提供了一个极具性价比的方案:不需要昂贵的计算资源去训练 Video DiT,只需要在推理阶段加入一套精巧的“动作法则”,就能让 AI 导演学会如何调度复杂的动作。这对于未来 VR 场景生成和高质量交互视频制作具有重要的参考价值。

发现相似论文

试试这些示例

  • 查找最近其他利用大语言模型(LLM)进行视频布局规划(Video Layout Planning)并处理复杂动作语义的论文。
  • 追溯在扩散模型中提出“注意力重聚焦”(Attention Refocusing)或“区域提示”(Regional Prompting)的原始论文,及其在视频领域的演进。
  • 有哪些研究探讨了将这种基于动作分解的免训练方法应用到 3D 场景生成或 4D 动态内容创作中?
目录
[CVPR 2025候选] Motion Factorization:解耦动作原型,开启免训练组合视频生成新范式
1. TL;DR
2. 背景定位:由于“胡子眉毛一把抓”引发的动作崩坏
3. 核心方法论:先规划,后生成的双重奏
3.1. 1. 结构化动作推理 (SMR)
3.2. 2. 解耦动作引导 (DMG)
4. 实验战果:全方位的 SOTA 飞跃
4.1. 消融实验启示
5. 深度洞察与局限
6. 总结