[CVPR 2026] DreamVideo-Omni:多主体身份与全方位运动控制的深度融合
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
本文提出了 DreamVideo-Omni,一个统一的视频定制框架,首次实现了多主体身份(Multi-subject Identity)与全方位运动(Omni-motion,包括全局、局部及相机运动)的协同控制。该方法基于 Wan2.1 基础模型,通过两阶段训练范式在视频生成质量和控制精度上达到了 SOTA 水平。
TL;DR
DreamVideo-Omni 是一个创新的视频定制框架,旨在解决大模型时代视频生成的“鱼与熊掌不可兼得”难题:如何在保持多个特定主体(如你家里的两只猫)身份不变的同时,精确控制它们的动作(一只跑,一只跳)以及相机的推拉摇移?该方案通过两阶段训练和 Latent 空间的强化学习,实现了比肩 14B 参数模型的极高控制精度。
背景定位
在学术坐标系中,该工作属于**受控视频生成(Controllable Video Generation)与视频定制(Video Customization)**的交汇处。它不仅打破了单主体定制的局限,更通过全方位运动(Omni-motion)控制,将运动粒度从简单的轨迹提升到了全局定位、局部细节与镜头语言的统一。
1. 痛点:为什么“精准控制”会让“身份名片”失效?
目前的 SOTA 方法往往在做一种妥协:
- 身份退化 (Identity Degradation):身份保持倾向于像素级的静态一致性,而运动则要求像素动态演变。标准的重建损失(Reconstruction Loss)很难平衡这种冲突,导致主体在大动作下“毁容”。
- 控制歧义 (Ambiguity):当场景中有多个主体时,模型往往分不清哪条轨迹属于哪个人,导致“张冠李戴”。
- 反馈效率低下:传统的强化学习(RL)需要将 Latent 解码回像素空间计算奖励,显存占用极大且速度缓慢。
2. 核心机制:DreamVideo-Omni 的技术内功
A. 异构条件的“交响乐”平抑:Condition-aware 3D RoPE
为了在同一个 Transformer (DiT) 中处理视频帧、参考图、Bounding Box 和轨迹,作者改进了 3D Rotary Positional Embedding (RoPE)。
- 独立索引:为参考图像分配固定的时间索引 ,与视频帧的时间索引解耦。
- 失效处理:通过专门的 Padding 索引让模型学会忽略无效补丁,极大提升了多任务联合训练的稳定性。
B. 语义绑定:Group & Role Embeddings
为了解决多主体的“控制混乱”,DreamVideo-Omni 引入了类似数据库中“外键”的概念:
- Group Embedding:将“参考图-框-轨迹”打包成一个单元,共享同一个组嵌入。
- Role Embedding:明确标识输入是“视觉资产”还是“运动指南”,让模型各司其职。
C. 潜在空间身份强化:LIReFL
这是本文最惊艳的部分。作者训练了一个 Latent Identity Reward Model (LIRM):
图 1:DreamVideo-Omni 的两阶段训练范式,重点展示了第二阶段的潜在身份奖励反馈学习。
- 动作感知 (Motion-aware):不像前人使用静态的 CLIP 评估,LIRM 基于视频扩散模型构建,能理解运动中的身份一致性。
- 端到端反馈:直接在 Latent 空间计算梯度并回传,无需 VAE 解码,显存开销极小。
3. 实验战绩:以小博大的力量
在包含 1027 个高质量视频的 DreamOmni Bench 评估中,DreamVideo-Omni 展现了极强的统治力:
| 指标 | DreamVideo-2 | DreamVideo-Omni (Ours) | 提升幅度 |
|---|---|---|---|
| 运动精度 (EPE) | 24.05 | 9.31 | 61.3% ↓ |
| 面部相似度 (Face-S) | 0.157 | 0.301 | 91.7% ↑ |
| 空间重合度 (mIoU) | 0.212 | 0.558 | 163% ↑ |
图 2:消融实验对比。可以看出,缺乏分层注入或 RoPE 改进会导致生成结果完全崩溃或不受控。
此外,作者还展示了其涌现能力(Emergent Capabilities):虽然模型是在文本到视频(T2V)任务上训练的,但它能自然扩展到图生视频(I2V),且轨迹控制依然精准。
4. 深度洞察与总结
核心价值: DreamVideo-Omni 不仅仅是在刷榜单,它提出了一套能够处理“异构、多模态、互斥约束”的标准化架构。特别是 Latent Space RL 的应用,为解决生成模型在追求“控制力”时产生的“伪影”和“身份漂移”提供了极具启发性的思路。
局限性与展望: 虽然模型在短视频上表现卓越,但对于超长视频的身份累计漂移仍需进一步研究。未来,如何将这种全方位控制与长视频生成技术(如 Streaming Attention)结合,将是工业界落地的关键。
结论: 如果你正在寻找一种能让你的数字人“听指挥”且“不毁容”的方法,DreamVideo-Omni 无疑是目前的行业范本。
