[ICLR 2025] TOPReward:跳出文本陷阱,用 Token 概率解锁 VLM 的零样本机器人奖赏
本文提出了 TOPReward,一种利用预训练视频视觉语言模型(VLM)的内部 Token 概率(Logits)作为机器人任务零样本(Zero-shot)奖赏信号的方法。该方法在 Qwen3-VL 上实现了 0.947 的平均价值-顺序相关性(VOC),显著优于现有的 GVL 基线。
TL;DR
在机器人强化学习中,获取高质量的稠密奖赏(Dense Rewards)一直是核心瓶颈。TOPReward 提出了一种极具启发性的思路:不要让 VLM 告诉你“进度是 0.7”,而是通过查看模型内部对“任务是否完成”这一判断的 Token 概率(Logits) 来直接推导进度。在 130 多个真实任务中,该方法让开源模型(如 Qwen3-VL)展现出了超越闭源巨头 Gemini 的进度估算能力。
背景定位:由于“数学差”被误解的 VLM
长期以来,学术界普遍认为开源视觉语言模型(VLM)在机器人进度估算(Progress Estimation)上表现糟糕。现有的主流方法如 GVL (Generative Value Learning) 强迫模型通过文本输出 0 到 1 之间的数值。
然而,本文作者敏锐地发现:开源 VLM 的失败并非由于视觉理解力不足,而是由于文本生成的表达瓶颈。 LLM 普遍存在“数学偏差”,且指令遵循的不稳定性导致生成的数值波动剧烈。
核心直觉:从“回答”转向“信念”
TOPReward 放弃了让模型“说话”,转而监测模型的“心思”。
- 二分类诱导:构造一个 Prompt 询问:“上述视频是否完成了指令:{Task}?答案是:[ ]”。
- Logits 提取:直接提取模型预测下一个 Token 为
True的对数概率 。 - 时序平滑:随着机器人动作的推进,如果 VLM 观察到视觉证据显示任务接近完成,那么它预测
True的信念(概率)会单调上升。
这就像是在测谎仪下观察模型的反应,而不是听它亲口报告,从而完美避开了承载能力有限的文本生成层。
图 1:通过不同长度的视频前缀输入,模型预测 "True" 的概率随任务执行过程单调增加。
ManiRewardBench:真实世界的压力测试
为了验证这一方法,作者推出了 ManiRewardBench。其特点在于:
- 多样性:涵盖 Franka, SO-100/101, YAM 等多种机械臂及 130 多个任务。
- 精细化:不仅仅有成功/失败标签,还标注了子任务边界,用于评估奖赏函数的“阶段感知”能力。
实验结果:开源模型的惊人反补
在 Qwen3-VL-8B 上,TOPReward 取得了 0.947 的 VOC(Value-Order Correlation),而传统的 GVL 基线在该模型上几乎处于随机状态(接近 0)。
图 2:TOPReward 在 OXE 和 ManiRewardBench 上的表现远超零样本 GVL。
有趣的是,实验发现 Chat Template(对话模板) 反而会损害性能。作者认为,进度估算更接近于预训练时的“下一个 Token 预测”任务,而非对话逻辑,因此裸 Prompt 反而能激发模型的最强直觉。
闭环提升:Advantage-Weighted BC
除了作为评估工具,TOPReward 还能直接提升机器人策略。通过将提取出的概率增量作为优势权重(Advantage Weights),作者对标准的行为克隆(BC)进行了细化调整。
在 SO-100 机械臂上的实测显示,在“放玩偶进盒子”等任务中,TOPReward 引导的 Fine-tuning 实现了 100% 的成功率,而原始 BC 只有 70%。
图 3:TOP-AWR 微调后的策略在复杂任务中表现出更强的鲁棒性。
总结与思考
TOPReward 为我们提供了一个重要的启示:在利用大模型作为机器人“大脑”时,提取内部表征(Representations/Logits)往往比监听其语言输出更可靠。
局限性:
- 感知边界:该方法仍受限于底层 VLM 的视觉分辨率。如果模型看不清细小的零件对齐,奖赏信号就会变差。
- 归一化依赖:目前的进度分数依赖于单次轨迹内的 Min-max 归一化,跨轨迹的绝对值比较仍需进一步探索。
这项工作为构建“无需人工标注、全自动闭环”的机器人在线学习系统铺平了道路。
