VGPO:对抗视觉遗忘,让多模态大模型推理不再“走马观花”
Visually-Guided Policy Optimization for Multimodal Reasoning
本文提出了 VGPO (Visually-Guided Policy Optimization),一种通过强化视觉关注度来提升多模态推理能力的强化学习框架。该方法利用模型内部隐状态计算视觉关注分数,并结合双粒度优势重加权策略,在 MathVista 和 LogicVista 等多个基准测试中达到了 SOTA 性能。
TL;DR
针对视觉语言模型(VLM)在长链推理中容易出现的“视觉遗忘”——即推理越久越不看图的问题,本文提出了 VGPO (Visually-Guided Policy Optimization)。该方法不需要额外的辅助模型或标注,直接通过模型内部隐状态挖掘视觉信号,在强化学习阶段引导模型“盯住”关键视觉信息。实验显示,7B 模型经过 VGPO 优化后,其推理表现甚至能叫板 72B 的大体量模型。
1. 痛点:为什么 VLM 总是“睁眼瞎”?
在当前的多模态研究中,即便模型逻辑能力很强,也常会出现低级幻觉。作者研究发现,VLM 的推理过程是**文本主导(Text-dominated)**的。
- 稀疏激活:模型对图像 Token 的注意力远低于文本 Token。
- 时间性遗忘(Temporal Visual Forgetting):随着推理链条(CoT)的增长,视觉关注度呈指数级衰减。模型在推理后期基本是靠“脑补”而非“视线”。
图 1:研究显示,正确样本(右侧)在推理后期的视觉积累比例明显高于错误样本(左侧)。
2. 核心直觉:内置的“视觉雷达”
作者提出了一个关键 Insight:模型内部的隐状态(Hidden States)已经包含了精准的定位能力。生成的 Token 与图像 Token 之间的语义相似度,可以作为天然的 视觉关注分数 (Visual Focus Score)。
基于此,VGPO 并不依赖于外部 GPT-4V 审稿,而是利用模型自身的“自觉性”来通过以下机制进行补偿:
- 线性补偿机制:在推理步数 增加时,动态提高对视觉相似度的预期,强迫模型在后期也要保持“视觉敏锐度”。
- 双粒度重加权:
- 轨迹内(Intra-trajectory):奖励那些在关键步骤紧扣视觉信息的 Token。
- 轨迹间(Inter-trajectory):在整个采样组(Group)中,优先选择整体视觉忠实度更高的推理路径。
3. 算法架构:从 GRPO 到 VGPO
VGPO 建立在著名的 GRPO (Group Relative Policy Optimization) 之上。它修改逻辑非常优雅: 原本的优势函数 仅由结果正误(Outcome-based)决定,而 VGPO 将其乘以一个“视觉调节因子”:
- :Token 级的视觉微操。
- :序列级的视觉大势。
图 2:VGPO 框架流程:从定位视觉 Token 到双粒度优势重加权优化。
4. 实验战绩:四两拨千斤
VGPO 在 Qwen2.5-VL 全系列上展现了极强的扩展性。
- 性能霸榜:在 7B 尺度上,VGPO 在 MathVista(数学)、LogicVista(逻辑)和 Counting(计数)等任务上全面超越了之前的 SOTA 方案(如 PAPO, VPPO)。
- 超越规模限制:令人吃惊的是,VGPO 优化后的 7B 模型均分水平接近 72B 基座模型,证明了通过“精细化视线管理”潜力巨大。
图 3:VGPO 在各类数学与视觉依赖基准测试中的对比。
5. 局限性与思考
虽然 VGPO 有效缓解了视觉遗忘,但它无法解决感知上限的问题。
- 垃圾进,垃圾出:如果底层的 Visual Encoder 根本没看清(如分辨率太低),VGPO 强行让模型看图反而会加重幻觉(Confident Errors)。
- 非视觉任务的副作用:在纯逻辑推导步骤(不需要看图的计算部分),强行要求视觉关注可能并非最优解。
总结
VGPO 为多模态强化学习提供了一个高效、自洽的新思路。它通过“视觉补偿”这一简单的物理直觉,成功矫正了模型的文本偏见。这告诉我们,不仅仅要教 LLM “如何思考”,更要教 VLM “在思考时时刻看路”。
