[arXiv 2026] RealWonder:点燃物理 AI,首个物理动作驱动的实时视频生成系统
RealWonder: Real-Time Physical Action-Conditioned Video Generation
本文推出了 RealWonder,这是首个支持实时(13.2 FPS)生成受 3D 物理动作(如力、扭矩、机器人操作)控制的视频生成系统。核心方法是通过物理模拟作为中间桥梁,将抽象的连续动作转化为视频模型可处理的光流和 RGB 预览,从而实现高度拟真的交互式视频合成。
TL;DR
斯坦福与南加州大学的研究团队推出了 RealWonder,这是第一款能够根据 3D 物理动作(如推力、风场、机器人抓取)实时生成视频的系统。通过引入物理引擎作为中间层,它解决了生成模型难以理解物理因果的难题,实现了在单卡 H200 上以 13.2 FPS 的速度生成高质量、符合物理规律的视频流。
核心痛点:为什么 LLM 懂得写诗,却不懂“力”?
当前的视频生成(Video Generation)模型在视觉上已经足够惊艳,但在“交互”层面却显得十分稚嫩。
- 动作表示难题:文本描述(如“用力推”)太模糊,2D 轨迹(Drag-based)忽略了 3D 深度,而真正的物理动作(力、扭矩)是连续且无界的,很难像文本一样 Token 化。
- 数据荒漠:互联网上有无数视频,但很少有视频标注了每一帧物体受到的精确力学参数,这就导致监督学习无法进行。
- 实时性缺失:传统的物理渲染方法或多步扩散模型速度极慢,无法满足 AR/VR 或机器人模拟所需的即时反馈。
核心直觉:物理模拟作为“翻译官”
RealWonder 的直觉非常巧妙:既然视频模型理解像素和光流(Motion Patterns),而物理引擎理解力和动力学,那为什么不让**物理引擎把“力”翻译成“光流”**呢?

1. 从单图到可模拟的世界
系统首先将一张图片输入,通过深度估计和分割(SAM 2),将场景拆解为静态背景和动态物体,并利用 VLM(如 GPT-4V)估计材质参数(如密度、弹性模量)。
2. 物理模拟作为中间桥梁
当用户施加一个 3D 动作 时,系统调用专业的物理求解器(如用于流体的 MPM 或用于硬体的 PBD):
- 生成光流 (Optical Flow):捕捉物体受力后的精确位移。
- 生成粗糙 RGB 预览:提供遮挡关系和结构变化的视觉提示。
3. 生成器的“闪电蒸馏”
为了达到实时,作者基于 Wan2.1 进行了两项改进:
- 光流调节:通过 Flow-based Noise Warping 将光流直接注入初始噪声,让模型“知道”哪里该动。
- 状态闭环蒸馏 (DMD):将繁重的扩散过程蒸馏为仅需 4 步的因果生成器(Causal Generator),支持无限长度的视频流生成。
实验战绩:真实感与速度的双重飞跃
RealWonder 在处理硬体、布料、流体甚至沙尘等复杂材质时,表现出了惊人的稳健性。

在量化评估中,RealWonder 在物理真实感(PhysReal)上大幅超越了传统的物理渲染方法 PhysGaussian(0.705 vs 0.468)。更重要的是速度提升:
- RealWonder: 13.2 FPS(实时互动)
- Tora / CogVideoX: 0.1 ~ 0.2 FPS(离线生成)
在船只移动的案例中,RealWonder 能够根据物理模拟生成逼真的水波纹和喷溅效果,而传统的 2D 轨迹控制模型往往会忽略这些动力学细节。
局限性与展望
尽管 RealWonder 表现优异,但其性能高度依赖于初始阶段的 3D 重建精度。如果深度估计出错,物理模拟会产生“穿模”或不寻常的漂浮。
总结:RealWonder 为“交互式世界模型”提供了一个清晰的范式——不要试图让神经网络从零学习物理定律,而是通过物理引擎去引导生成模型。这对于未来的机器人示教、自动驾驶仿真以及沉浸式游戏开发具有深远的启示。
