[CVPR 2025] DISPLAY:极简引导实现高保真“人机交互”视频生成
DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary
本文提出了 DISPLAY,一个基于 Flow Matching DiT 的可控人机交互 (HOI) 视频生成框架。该方法通过“稀疏运动引导 (Sparse Motion Guidance)”(仅由手腕坐标和形状无关的物体边界框组成)实现了高自由度的交互生成,并在物体替换、插入及环境交互任务中达到了 SOTA 性能。
TL;DR
百度研究团队推出的 DISPLAY 框架彻底改变了人机交互 (Human-Object Interaction, HOI) 视频生成的范式。它不再需要复杂的 3D 骨架或密集的深度图,仅凭手腕轨迹和物体方框这两个极其稀疏的信号,就能生成物理规律正确、视觉细节丰富的交互视频。
痛点深挖:为什么“喂饭”太多反而学不会?
在 AI 视频生成领域,让数字人“自然地拿起一个水杯”出奇地难。现有方法如 Re-HOLD 或 AnchorCraft 往往陷入两个极端:
- 表示对称性缺失:对人手提供极强的约束(如 21 个手部关键点),但对物体只提供模糊的文本或全局特征。结果是手动了,物体却像贴纸一样飘忽,甚至产生手穿过物体的“灵异画面”。
- 过度拟合:强控制信号让模型学会了“死记硬背”特定物体的形状,一旦用户想换一个奇形怪状的杯子,模型就因无法匹配深度图而崩溃。
核心机制:以简御繁的艺术
DISPLAY 的名字来源于其核心理念:DIrectable Sparse Partial LAYout。
1. 稀疏运动引导 (Sparse Motion Guidance)
作者大胆舍弃了复杂的骨架,只保留手腕 (Wrist) 坐标。这种设计灵感来自机器人学中的“末端执行器 (End-effector)”概念——只要手腕位置对了,手掌的自适应抓取逻辑可以交给强大的预训练大模型去补全。配合形状无关 (Shape-agnostic) 的 Bounding Box,这为模型提供了极大的泛化空间。
2. 物体强调注意力 (Object-Stressed Attention, OSA)
为了防止物体在稀疏引导下被“边缘化”,DISPLAY 修改了 Transformer 的自注意力机制:
通过为物体 Token 引入一个超参数 (实验设定为 8),强制模型在计算注意力时给物体分配更高的权重,确保物体在交互过程中不丢失纹理细节。
实验战绩:全方位的视觉进化
在对比实验中,DISPLAY 展现出了降维打击般的优势:
- 物体保真度 (O-CLIP):相比 VACE 和 HunyuanCustom 等方案,DISPLAY 在物体特征保持上提升了约 10%-20%。
- 物理一致性 (Contact Agreement):生成的抓取动作更加紧凑自然,没有浮空感。
上图展示了物体替换与插入的对比:可以看到 DISPLAY 在处理新物体时,能完美保留其几何特征与纹理,而其他方法常出现由于骨架依赖导致的物体扭曲。
多任务辅助训练:破解数据荒
高质量的 HOI 数据极其难找。DISPLAY 巧妙地采用了一种“混合训练”模式:
- 主任务:使用 100 小时的高质量 HOI 标注数据。
- 辅助任务:引入 50 小时仅有坐标标注的普通人体视频,通过随机掩码 (Masking) 强迫模型从上下文推断人体结构。这种“以多补精”的策略极大地增强了模型对复杂背景的适应力。
深度洞察
DISPLAY 的成功再次验证了在大模型时代,“显式几何约束”正在让位于“隐式语义补全”。通过降低输入端(引导信号)的复杂度,反而释放了生成端(DiT 模型)的想象力。
局限性分析: 目前该方法在处理非刚性物体(如毛巾或丝绸)时仍有挑战,因为稀疏方框无法描述物体的形态学形变。
总结
DISPLAY 为可控视频生成提供了一个高度可用的交互界面。无论是想把一段健身视频里的哑铃换成西瓜,还是想让一个静态模特“动起来”拿起产品展示,这个框架都给出了目前最优的工程解。
本文基于 arXiv 论文 《DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary》重构撰写。
