[CVPR 2025] DISPLAY:极简引导实现高保真“人机交互”视频生成

DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary

总结
问题
方法
结果
要点
摘要

本文提出了 DISPLAY,一个基于 Flow Matching DiT 的可控人机交互 (HOI) 视频生成框架。该方法通过“稀疏运动引导 (Sparse Motion Guidance)”(仅由手腕坐标和形状无关的物体边界框组成)实现了高自由度的交互生成,并在物体替换、插入及环境交互任务中达到了 SOTA 性能。

TL;DR

百度研究团队推出的 DISPLAY 框架彻底改变了人机交互 (Human-Object Interaction, HOI) 视频生成的范式。它不再需要复杂的 3D 骨架或密集的深度图,仅凭手腕轨迹物体方框这两个极其稀疏的信号,就能生成物理规律正确、视觉细节丰富的交互视频。

痛点深挖:为什么“喂饭”太多反而学不会?

在 AI 视频生成领域,让数字人“自然地拿起一个水杯”出奇地难。现有方法如 Re-HOLDAnchorCraft 往往陷入两个极端:

  1. 表示对称性缺失:对人手提供极强的约束(如 21 个手部关键点),但对物体只提供模糊的文本或全局特征。结果是手动了,物体却像贴纸一样飘忽,甚至产生手穿过物体的“灵异画面”。
  2. 过度拟合:强控制信号让模型学会了“死记硬背”特定物体的形状,一旦用户想换一个奇形怪状的杯子,模型就因无法匹配深度图而崩溃。

核心机制:以简御繁的艺术

DISPLAY 的名字来源于其核心理念:DIrectable Sparse Partial LAYout。

1. 稀疏运动引导 (Sparse Motion Guidance)

作者大胆舍弃了复杂的骨架,只保留手腕 (Wrist) 坐标。这种设计灵感来自机器人学中的“末端执行器 (End-effector)”概念——只要手腕位置对了,手掌的自适应抓取逻辑可以交给强大的预训练大模型去补全。配合形状无关 (Shape-agnostic) 的 Bounding Box,这为模型提供了极大的泛化空间。

2. 物体强调注意力 (Object-Stressed Attention, OSA)

为了防止物体在稀疏引导下被“边缘化”,DISPLAY 修改了 Transformer 的自注意力机制: 模型架构图 通过为物体 Token 引入一个超参数 (实验设定为 8),强制模型在计算注意力时给物体分配更高的权重,确保物体在交互过程中不丢失纹理细节。

实验战绩:全方位的视觉进化

在对比实验中,DISPLAY 展现出了降维打击般的优势:

  • 物体保真度 (O-CLIP):相比 VACE 和 HunyuanCustom 等方案,DISPLAY 在物体特征保持上提升了约 10%-20%。
  • 物理一致性 (Contact Agreement):生成的抓取动作更加紧凑自然,没有浮空感。

实验结果对比 上图展示了物体替换与插入的对比:可以看到 DISPLAY 在处理新物体时,能完美保留其几何特征与纹理,而其他方法常出现由于骨架依赖导致的物体扭曲。

多任务辅助训练:破解数据荒

高质量的 HOI 数据极其难找。DISPLAY 巧妙地采用了一种“混合训练”模式:

  • 主任务:使用 100 小时的高质量 HOI 标注数据。
  • 辅助任务:引入 50 小时仅有坐标标注的普通人体视频,通过随机掩码 (Masking) 强迫模型从上下文推断人体结构。这种“以多补精”的策略极大地增强了模型对复杂背景的适应力。

深度洞察

DISPLAY 的成功再次验证了在大模型时代,“显式几何约束”正在让位于“隐式语义补全”。通过降低输入端(引导信号)的复杂度,反而释放了生成端(DiT 模型)的想象力。

局限性分析: 目前该方法在处理非刚性物体(如毛巾或丝绸)时仍有挑战,因为稀疏方框无法描述物体的形态学形变。

总结

DISPLAY 为可控视频生成提供了一个高度可用的交互界面。无论是想把一段健身视频里的哑铃换成西瓜,还是想让一个静态模特“动起来”拿起产品展示,这个框架都给出了目前最优的工程解。


本文基于 arXiv 论文 《DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary》重构撰写。

发现相似论文

试试这些示例

  • 查找最近一年内利用扩散变换器 (DiT) 处理视频编辑中人机交互 (HOI) 一致性问题的相关论文。
  • 哪篇论文最早探讨了在生成模型中通过物体权重注意力 (Object-weighted Attention) 来增强特定目标保真度的理论?
  • 有哪些研究尝试将类似 DISPLAY 的稀疏运动引导应用于人形机器人的动作规划或虚拟现实 (VR) 的交互生成中?
目录
[CVPR 2025] DISPLAY:极简引导实现高保真“人机交互”视频生成
1. TL;DR
2. 痛点深挖:为什么“喂饭”太多反而学不会?
3. 核心机制:以简御繁的艺术
3.1. 1. 稀疏运动引导 (Sparse Motion Guidance)
3.2. 2. 物体强调注意力 (Object-Stressed Attention, OSA)
4. 实验战绩:全方位的视觉进化
5. 多任务辅助训练:破解数据荒
6. 深度洞察
7. 总结