Odysseus:强化学习助力视觉语言模型突破 100+ 步长程游戏决策

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

总结
问题
方法
结果
要点
摘要

本文提出了 Odysseus,一个旨在将视觉语言模型(VLM)扩展到长程(100+ 步)游戏决策任务的强化学习框架。通过在《超级马里奥大陆》中应用改进的 PPO 算法,Odysseus 在游戏进度上达到了 SOTA 水平,显著超越了 GPT-4o 等顶尖模型。

TL;DR

普林斯顿大学的研究团队发布了 Odysseus,一个专门为 VLM(视觉语言模型)设计的开放式强化学习框架。该工作成功地将 VLM 智能体在复杂动作游戏《超级马里奥大陆》中的决策长度从以往的几十步扩展到了 100 步以上。相比于闭源的 GPT-4 等模型,Odysseus 在游戏进度上实现了约 3-5 倍 的跨越式增长,并展示了惊人的跨游戏泛化能力。

痛点深挖:为什么 VLM 玩不好马里奥?

目前将 VLM 转化为具身智能体(Embodied Agent)主要面临两大障碍:

  1. 长程信用分配难题:在马里奥这类游戏中,一个“跳跃”按键的效果可能要在几十帧后才能体现。传统的 GRPO 或 Reinforce++ 等 Critic-free 方法在处理这种长程反馈时表现极其不稳定。
  2. 巨大的计算开销:如果效仿 RLHF 使用另一个 VLM 作为 Critic(批评者网络),显存和计算资源的需求将呈指数级增长。

任务概览与性能对比

核心方法论:轻量级 Critic 与 动作先验

Odysseus 的成功归功于三个关键的算法直觉:

1. 异构 Critic 设计 (Adapted PPO)

作者发现,Critic 不需要像 Actor 一样聪明。他们没有使用大模型,而是采用了一个极其轻量化的 CNN 批评者 专门负责进行轮次级(Turn-level)的价值评估。

  • 物理直觉:视觉状态的价值判断(如“当前位置是否安全”)可以通过简单的空间特征提取完成,无需复杂的语义理解。这种设计减少了近 50% 的计算开销,同时显著提升了训练稳定性。

2. 正优势过滤 (Positive-advantage Filtering)

在训练过程中,Odysseus 会主动忽略那些表现不如预期的正样本(优势值为负的样本),只针对表现更好的动作进行梯度更新。这在长程序列优化中极大地降低了噪声干扰。

3. VLM 并非“空脑壳”

相比从零训练(Train from scratch)的传统深度强化学习(Deep RL),VLM 内部已经封装了大量关于物理世界的常识(如“悬崖不能踩”、“敌人要跳过”)。实验数据的对比令人震惊:VLM 驱动的 RL 样本效率比传统 CNN 策略快了 2 倍以上

算法架构示意图

实验结果:马里奥之王的诞生

Odysseus 在多个维度上展现了压倒性的优势:

  • 进度突破:在《超级马里奥大陆》前五关中,Odysseus 平均进度远超 GPT-4o 和 GLM-4V。
  • 零样本泛化:即便只在第一关训练,模型也能在未见过的关卡甚至完全不同的游戏(如《超级马里奥兄弟》)中表现出色的避障和导航能力。
  • 通用性保留:在经历了几千万波次的强化学习训练后,该模型在 MMMU 和 MathVision 等通用基准测试上的表现依然坚挺,没有发生严重的“灾难性遗忘”。

对比实验结果图

深度洞察

Odysseus 的意义在于它为 “如何让模型动起来” 提供了可落地的路径。它证明了:

  1. 解耦是关键:将复杂的 Token 生成(Actor)与简单的环境评估(Critic)解耦,是目前扩展 Agent 能力的最佳平衡点。
  2. 先验即效率:我们不需要通过 RL 让模型学习“什么是敌人”,而应该通过 RL 让模型学习“如何以正确的时间戳应对敌人”。

局限性与展望

尽管 Odysseus 表现出色,但在处理极端复杂的逻辑关卡(如需要特定顺序触发机关)时仍有提升空间。未来,将这种轻量级 RL 框架与更大规模的多模态模型(如 GPT-5 级别)结合,可能会诞生真正具备类人反应速度与策略深度的全能游戏智能体。


总结 (Takeaway):Odysseus 是一套高效的“训练配方”,它告诉我们:稳定的 Critic 设计 + 正向优势引导 + VLM 的动作先验 = 强大的交互式智能体。

发现相似论文

试试这些示例

  • 查找最近其他关于如何提高强化学习在长程视觉决策任务(超过 100 个交互轮次)中样本效率的论文。
  • 哪篇论文最早在 VLM 微调中讨论了 Token-level 与 Turn-level 信用分配的区别,本文的轻量化 Critic 是如何改进其复杂性的?
  • 调研当前除了《马里奥》之外,评估 VLM 智能体进行复杂闭环控制(Closed-loop control)的其他主流基准测试与环境。
目录
Odysseus:强化学习助力视觉语言模型突破 100+ 步长程游戏决策
1. TL;DR
2. 痛点深挖:为什么 VLM 玩不好马里奥?
3. 核心方法论:轻量级 Critic 与 动作先验
3.1. 1. 异构 Critic 设计 (Adapted PPO)
3.2. 2. 正优势过滤 (Positive-advantage Filtering)
3.3. 3. VLM 并非“空脑壳”
4. 实验结果:马里奥之王的诞生
5. 深度洞察
5.1. 局限性与展望