VGPO:对抗视觉遗忘,让多模态大模型推理不再“走马观花”

Visually-Guided Policy Optimization for Multimodal Reasoning

2026-04-01
Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu
总结
问题
方法
结果
要点
摘要

本文提出了 VGPO (Visually-Guided Policy Optimization),一种通过强化视觉关注度来提升多模态推理能力的强化学习框架。该方法利用模型内部隐状态计算视觉关注分数,并结合双粒度优势重加权策略,在 MathVista 和 LogicVista 等多个基准测试中达到了 SOTA 性能。

TL;DR

针对视觉语言模型(VLM)在长链推理中容易出现的“视觉遗忘”——即推理越久越不看图的问题,本文提出了 VGPO (Visually-Guided Policy Optimization)。该方法不需要额外的辅助模型或标注,直接通过模型内部隐状态挖掘视觉信号,在强化学习阶段引导模型“盯住”关键视觉信息。实验显示,7B 模型经过 VGPO 优化后,其推理表现甚至能叫板 72B 的大体量模型。

1. 痛点:为什么 VLM 总是“睁眼瞎”?

在当前的多模态研究中,即便模型逻辑能力很强,也常会出现低级幻觉。作者研究发现,VLM 的推理过程是**文本主导(Text-dominated)**的。

  • 稀疏激活:模型对图像 Token 的注意力远低于文本 Token。
  • 时间性遗忘(Temporal Visual Forgetting):随着推理链条(CoT)的增长,视觉关注度呈指数级衰减。模型在推理后期基本是靠“脑补”而非“视线”。

视觉遗忘分析 图 1:研究显示,正确样本(右侧)在推理后期的视觉积累比例明显高于错误样本(左侧)。

2. 核心直觉:内置的“视觉雷达”

作者提出了一个关键 Insight:模型内部的隐状态(Hidden States)已经包含了精准的定位能力。生成的 Token 与图像 Token 之间的语义相似度,可以作为天然的 视觉关注分数 (Visual Focus Score)

基于此,VGPO 并不依赖于外部 GPT-4V 审稿,而是利用模型自身的“自觉性”来通过以下机制进行补偿:

  • 线性补偿机制:在推理步数 增加时,动态提高对视觉相似度的预期,强迫模型在后期也要保持“视觉敏锐度”。
  • 双粒度重加权
    1. 轨迹内(Intra-trajectory):奖励那些在关键步骤紧扣视觉信息的 Token。
    2. 轨迹间(Inter-trajectory):在整个采样组(Group)中,优先选择整体视觉忠实度更高的推理路径。

3. 算法架构:从 GRPO 到 VGPO

VGPO 建立在著名的 GRPO (Group Relative Policy Optimization) 之上。它修改逻辑非常优雅: 原本的优势函数 仅由结果正误(Outcome-based)决定,而 VGPO 将其乘以一个“视觉调节因子”:

  • :Token 级的视觉微操。
  • :序列级的视觉大势。

VGPO 框架总览 图 2:VGPO 框架流程:从定位视觉 Token 到双粒度优势重加权优化。

4. 实验战绩:四两拨千斤

VGPO 在 Qwen2.5-VL 全系列上展现了极强的扩展性。

  • 性能霸榜:在 7B 尺度上,VGPO 在 MathVista(数学)、LogicVista(逻辑)和 Counting(计数)等任务上全面超越了之前的 SOTA 方案(如 PAPO, VPPO)。
  • 超越规模限制:令人吃惊的是,VGPO 优化后的 7B 模型均分水平接近 72B 基座模型,证明了通过“精细化视线管理”潜力巨大。

性能对比表 图 3:VGPO 在各类数学与视觉依赖基准测试中的对比。

5. 局限性与思考

虽然 VGPO 有效缓解了视觉遗忘,但它无法解决感知上限的问题。

  1. 垃圾进,垃圾出:如果底层的 Visual Encoder 根本没看清(如分辨率太低),VGPO 强行让模型看图反而会加重幻觉(Confident Errors)。
  2. 非视觉任务的副作用:在纯逻辑推导步骤(不需要看图的计算部分),强行要求视觉关注可能并非最优解。

总结

VGPO 为多模态强化学习提供了一个高效、自洽的新思路。它通过“视觉补偿”这一简单的物理直觉,成功矫正了模型的文本偏见。这告诉我们,不仅仅要教 LLM “如何思考”,更要教 VLM “在思考时时刻看路”。

发现相似论文

试试这些示例

  • 查找最近其他试图通过修改奖励函数或优势估计(Advantage Estimation)来解决多模态大模型视觉幻觉问题的论文。
  • 哪篇论文最早探讨了 Transformer 架构中视觉 Token 注意力衰减的物理直觉,本文提出的补偿机制与其有何关联?
  • 有哪些研究探讨了将 VGPO 这种基于隐状态相似度的重加权方法应用到视频理解或长视频推理任务中的潜力?
目录
VGPO:对抗视觉遗忘,让多模态大模型推理不再“走马观花”
1. TL;DR
2. 1. 痛点:为什么 VLM 总是“睁眼瞎”?
3. 2. 核心直觉:内置的“视觉雷达”
4. 3. 算法架构:从 GRPO 到 VGPO
5. 4. 实验战绩:四两拨千斤
6. 5. 局限性与思考
7. 总结