[CoRL 2025] ROBOMETER:通过轨迹对比缩放通用机器人奖励模型
Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons
本文提出了 ROBOMETER,一种可大规模扩展的通用机器人奖励模型框架,通过结合轨迹内(Intra-trajectory)进度监督与轨迹间(Inter-trajectory)偏好监督,显著提升了模型从失败和次优数据中学习的能力。该模型在 RBM-1M 百万级大规模多模态数据集上训练,在 21 种机器人平台上实现了 SOTA 性能。
TL;DR
奖励函数是机器人学习的“罗盘”,但传统的绝对进度标注在大规模嘈杂数据面前显得力不从心。ROBOMETER 突破了这一局限,通过引入轨迹间偏好对比(Preference Comparison),将数百万条之前无法被有效利用的失败和次优轨迹转化为高质量的监督信号。实验证明,该方法在 Zero-shot 场景下的奖励校准度提升了 32%,并在多项机器人学习任务中实现了 2 倍以上的成功率增长。
痛点深挖:为什么奖励模型难以“规模化”?
在机器人领域,获取高质量奖励函数(Reward Function)一直是一个瓶颈。
- 进度标注的模糊性:对于专家轨迹,我们可以线性假设进度从 0 到 1。但在失败的尝试中(比如物体滑落),进度是波动且难以量化的。
- 数据的浪费:现实采样的机器人数据 90% 以上可能是失败的。如果只用专家数据,模型会因为没见过“坏例子”而在推理阶段产生极高的假阳性(False Positives)。
- 泛化性能差:现有的模型往往绑定在特定机器人或固定视角下,换个环境就失效。
ROBOMETER 的核心直觉是:人类更擅长做判断题(对比 A 和 B 哪个好)而非填空题(给 A 打分)。通过轨迹对比,模型可以学习到一种内在的全局排序规律。
方法论详解:双重目标与 RBM-1M 数据集
1. 核心架构:多模态大模型的改造
ROBOMETER 基于 Qwen3-VL-4B 视觉语言模型。作者创新性地在序列中插入了特殊的 Progress Tokens(用于帧级预测)和 Preference Tokens(用于轨迹对对比)。
- 因果掩码(Causal Masking):确保在线推理时,模型只能看到当前及过去的帧。
- 双重头(Dual Heads):一个 MLP 预测连续进度值,另一个 MLP 处理轨迹对的二分类偏好。

2. 采样策略:化腐朽为神奇
为了充分利用 RBM-1M(100万条轨迹)中的杂乱数据,作者设计了三种对比策略:
- 不同水平对比:将专家轨迹(p=1)与失败轨迹进行配对。
- 任务负采样:给模型一个指令 A,同时输入执行任务 A 和任务 B 的视频,强迫模型识别指令的一致性。
- 视频回溯(Video Rewind):人为地将一段成功的视频倒放,让模型意识到“撤销进度”是一种典型的失败行为。
实验与结果:奖励模型也是“六边形战士”
SOTA 对比:统治 OOD 场景
在包含 6 种机器人形态(部分不在训练集中)的分布外(OOD)测试中,ROBOMETER 在轨迹任务校准度上展现了统治级的紫色对角线分布(见下图),这意味着它能精准识别当前执行动作是否符合任务描述。

下游任务加速:
- 自动在线 RL:配合 DSRL 算法,ROBOMETER 在单阶段任务中将成功率从 20% 提升至 85%,学习速度较 baseline 快了 2.5 倍。
- 零样本失败检测:无需特定阈值微调,便能识别物体掉落或进度停滞等 7 种不同类别的失败模式,F1 score 达到 0.81。

深度洞察与总结
为什么偏好学习如此有效? 消融实验给出了答案:即使在没有额外失败数据的情况下,仅在专家数据上引入对比(H1 实验),也能显著提升模型的排序能力。这说明**全局对比约束(Global Constraints)**诱导模型生成了结构更优的内在表征(Self-structured representation)。
局限性分析:
- 时间分辨率:目前采用 8 帧子采样,可能遗漏接触力学相关的细微物理特征(如抓取时的稳定性)。
- 物理感知缺失:作为视觉模型,它缺乏对接触力(Contact Forces)的直接感知,可能在视觉不可见的失败(如电机过热或力矩超限)面前失效。
未来展望: ROBOMETER 为具身智能规模化提供了一个重要结论:与其追求更昂贵的专家数据,不如研究如何更聪明地利用现有的“坏数据”。这一框架未来极易扩展至人形机器人等更加复杂且昂贵的硬件平台。
