WAM在现实世界中真的具备泛化能力,还是仅仅在基准测试上表现良好?
WAM并非基准测试技巧的最有力证据,来自那些刻意扰动环境的鲁棒性测试——比如改变光照、添加干扰物或改写指令。在2026年的一项对比研究中,像LingBot-VA这样的WAM在RoboTwin 2.0-Plus上达到了74.2%的成功率,而Cosmos-Policy在LIBERO-Plus上达到了82.2%,均是在这些扰动条件下实现的[2]。相比之下,一个强大的VLA(π0.5)只有在经过大量多样化机器人数据集和多种学习目标的广泛训练后,才能达到同样的鲁棒性[2]。这意味着WAM基于预测性视频训练所获得的固有韧性,是VLA除非经过大量工程化处理否则难以企及的。
同一项研究发现,混合方法——即在VLA中加入部分视频预测——仅表现出中等程度的鲁棒性[2]。这一规律颇具启示性:模型越是真正学会预测未来状态,就越能应对未见过的情境。如果WAM只是过度拟合了基准测试的特定模式,那么在测试条件改变时,它们便无法保持稳定表现。
WAMs能否在实体机器人上工作,而不仅仅是在仿真中?
基准测试中的技巧在将模型部署到真实机器人上时往往失效,但世界模型已证明它们能够在物理世界中在线学习和适应。在2022年的一项研究中,Dreamer世界模型仅用1小时便从头训练四足机器人学会站立和行走,当机器人被推倒时,它能在10分钟内适应扰动,要么抵抗推力,要么翻身重新站起[5]。该模型还在两种不同的机械臂上学会了抓取和放置任务,并在轮式机器人上学会了导航,所有这些都直接基于摄像头图像和稀疏奖励,无需使用模拟器[5]。
更近期的研究进一步推进了这一方向:MotuBrain,一个统一的世界动作模型,在RoboTwin 2.0的干净环境和随机环境下分别取得了95.8%和96.1%的平均成功率,并且仅用50–100条轨迹就能适应新的人形机器人形态[1]。这种样本效率——从几十条演示中学会一个新的机器人身体——正是你对一个理解动力学而非死记硬背基准测试的模型所期待的表现。
预测未来真的能提升控制精度吗?
WAM的核心主张是,预测未来状态有助于你选择更优的行动。多角度的证据支持了这一观点。ActionSink将动作重新表述为“动作流”(由机器人运动引起的光流),并整合了历史流信息,在LIBERO基准测试上以7.9%的成功率超越了此前的最先进方法,并在长时程的LIBERO-Long任务上获得了近8%的准确率提升[3]。这直接体现了建模动作动态与实现更精准操作之间的联系。
同样地,2025年一项关于持续学习的研究利用流匹配技术在线对齐机器人的动力学模型,与传统基于探索的方法相比,该方法将任务成功率提高了34.2%[4]。关键洞见在于:机器人不再使用失配的模型采取行动,而是优化其计划动作,使其与良好对齐模型的行为相匹配,从而加速学习并提升性能。这些结果表明,预测组件并非装饰性存在——它正是驱动控制增益的核心。
关于这些来源
这个回答基于5项研究(2项经同行评审,3项为预印本),发表于2022年至2026年间,其中4项为2024年或之后发表,合计被引用424次。这些研究是从9项通过质量筛选的研究中选出的最相关者,而这9项研究又源自从超过5亿篇论文的数据库中检索到的37篇文献。
本文引用的文献
MotuBrain:一种用于机器人控制的高级世界动作模型
MotuBrain作为一个统一的世界动作模型,在RoboTwin 2.0的干净环境和随机环境下分别取得了95.8%和96.1%的平均成功率,并且仅需50至100条轨迹即可适应新的人形机器人形态,展现了其可扩展性和可部署性。
世界动作模型是否比VLA泛化得更好?一项鲁棒性研究
在对比研究中,WAM在视觉和语言扰动下表现出强大的鲁棒性,其中LingBot-VA在RoboTwin 2.0-Plus上达到74.2%的成功率,Cosmos-Policy在LIBERO-Plus上达到82.2%,而VLA则需要大量训练才能达到同等水平。
ActionSink:通过动作流的动态集成实现精确机器人操作
ActionSink利用动作引起的光流(“动作流”)来增强动作估计,在LIBERO上比先前的最先进方法成功率高出7.9%,并在LIBERO-Long上获得了近8%的准确率提升。
用于持续机器人学习的动作流匹配
动作流匹配通过优化规划动作以匹配对齐良好的动力学模型,使持续机器人学习的任务成功率较传统基于探索的方法提升了34.2%。
DayDreamer:用于物理机器人学习的世界模型
Dreamer是一个世界模型,直接在实体机器人上学习,无需模拟器:一台四足机器人在1小时内学会了站立和行走,并在10分钟内适应了外力推挤;机械臂则从摄像头图像中学会了抓取和放置操作。
