[CVPR 2026] DreamVideo-Omni:多主体身份与全方位运动控制的深度融合

DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning

总结
问题
方法
结果
要点
摘要

本文提出了 DreamVideo-Omni,一个统一的视频定制框架,首次实现了多主体身份(Multi-subject Identity)与全方位运动(Omni-motion,包括全局、局部及相机运动)的协同控制。该方法基于 Wan2.1 基础模型,通过两阶段训练范式在视频生成质量和控制精度上达到了 SOTA 水平。

TL;DR

DreamVideo-Omni 是一个创新的视频定制框架,旨在解决大模型时代视频生成的“鱼与熊掌不可兼得”难题:如何在保持多个特定主体(如你家里的两只猫)身份不变的同时,精确控制它们的动作(一只跑,一只跳)以及相机的推拉摇移?该方案通过两阶段训练和 Latent 空间的强化学习,实现了比肩 14B 参数模型的极高控制精度。

背景定位

在学术坐标系中,该工作属于**受控视频生成(Controllable Video Generation)视频定制(Video Customization)**的交汇处。它不仅打破了单主体定制的局限,更通过全方位运动(Omni-motion)控制,将运动粒度从简单的轨迹提升到了全局定位、局部细节与镜头语言的统一。


1. 痛点:为什么“精准控制”会让“身份名片”失效?

目前的 SOTA 方法往往在做一种妥协:

  • 身份退化 (Identity Degradation):身份保持倾向于像素级的静态一致性,而运动则要求像素动态演变。标准的重建损失(Reconstruction Loss)很难平衡这种冲突,导致主体在大动作下“毁容”。
  • 控制歧义 (Ambiguity):当场景中有多个主体时,模型往往分不清哪条轨迹属于哪个人,导致“张冠李戴”。
  • 反馈效率低下:传统的强化学习(RL)需要将 Latent 解码回像素空间计算奖励,显存占用极大且速度缓慢。

2. 核心机制:DreamVideo-Omni 的技术内功

A. 异构条件的“交响乐”平抑:Condition-aware 3D RoPE

为了在同一个 Transformer (DiT) 中处理视频帧、参考图、Bounding Box 和轨迹,作者改进了 3D Rotary Positional Embedding (RoPE)

  • 独立索引:为参考图像分配固定的时间索引 ,与视频帧的时间索引解耦。
  • 失效处理:通过专门的 Padding 索引让模型学会忽略无效补丁,极大提升了多任务联合训练的稳定性。

B. 语义绑定:Group & Role Embeddings

为了解决多主体的“控制混乱”,DreamVideo-Omni 引入了类似数据库中“外键”的概念:

  • Group Embedding:将“参考图-框-轨迹”打包成一个单元,共享同一个组嵌入。
  • Role Embedding:明确标识输入是“视觉资产”还是“运动指南”,让模型各司其职。

C. 潜在空间身份强化:LIReFL

这是本文最惊艳的部分。作者训练了一个 Latent Identity Reward Model (LIRM)模型架构图 图 1:DreamVideo-Omni 的两阶段训练范式,重点展示了第二阶段的潜在身份奖励反馈学习。

  • 动作感知 (Motion-aware):不像前人使用静态的 CLIP 评估,LIRM 基于视频扩散模型构建,能理解运动中的身份一致性。
  • 端到端反馈:直接在 Latent 空间计算梯度并回传,无需 VAE 解码,显存开销极小。

3. 实验战绩:以小博大的力量

在包含 1027 个高质量视频的 DreamOmni Bench 评估中,DreamVideo-Omni 展现了极强的统治力:

指标DreamVideo-2DreamVideo-Omni (Ours)提升幅度
运动精度 (EPE)24.059.3161.3% ↓
面部相似度 (Face-S)0.1570.30191.7% ↑
空间重合度 (mIoU)0.2120.558163% ↑

实验结果对比 图 2:消融实验对比。可以看出,缺乏分层注入或 RoPE 改进会导致生成结果完全崩溃或不受控。

此外,作者还展示了其涌现能力(Emergent Capabilities):虽然模型是在文本到视频(T2V)任务上训练的,但它能自然扩展到图生视频(I2V),且轨迹控制依然精准。


4. 深度洞察与总结

核心价值: DreamVideo-Omni 不仅仅是在刷榜单,它提出了一套能够处理“异构、多模态、互斥约束”的标准化架构。特别是 Latent Space RL 的应用,为解决生成模型在追求“控制力”时产生的“伪影”和“身份漂移”提供了极具启发性的思路。

局限性与展望: 虽然模型在短视频上表现卓越,但对于超长视频的身份累计漂移仍需进一步研究。未来,如何将这种全方位控制与长视频生成技术(如 Streaming Attention)结合,将是工业界落地的关键。

结论: 如果你正在寻找一种能让你的数字人“听指挥”且“不毁容”的方法,DreamVideo-Omni 无疑是目前的行业范本。

发现相似论文

试试这些示例

  • 查找最近其他尝试解决多主体视频定制中身份冲突(Identity Conflict)和运动模糊问题的论文。
  • 哪篇论文最早在 Transformer 架构中提出了分层运动注入(Hierarchical Motion Injection)的概念,本文是如何改进它的?
  • 有哪些研究将基于反馈的学习(Reward Feedback Learning)应用到了 3D 内容生成或长视频合成任务中?
目录
[CVPR 2026] DreamVideo-Omni:多主体身份与全方位运动控制的深度融合
1. TL;DR
2. 背景定位
3. 1. 痛点:为什么“精准控制”会让“身份名片”失效?
4. 2. 核心机制:DreamVideo-Omni 的技术内功
4.1. A. 异构条件的“交响乐”平抑:Condition-aware 3D RoPE
4.2. B. 语义绑定:Group & Role Embeddings
4.3. C. 潜在空间身份强化:LIReFL
5. 3. 实验战绩:以小博大的力量
6. 4. 深度洞察与总结