[ICLR 2025] Durian:告别 GRPO 的极端样本焦虑,让 MLLM 推理更稳健

Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization

总结
问题
方法
结果
要点
摘要

本文提出了 Durian,一种针对多模态大语言模型(MLLMs)推理任务的难度感知组归一化方法。该方法在 GRPO 框架基础上,通过引入视觉熵(感知维度)和模型置信度(推理维度)进行样本重分组,显著提升了模型在 MathVista、MathVision 等多个推理基准上的表现,平均性能提升达 11.3%。

TL;DR

在多模态大模型(MLLM)的强化学习过程中,传统的 GRPO 方法常常因为几个“太简单”或“太难”的极端样本而导致整个训练梯度“炸掉”。本文提出的 Durian (Difficulty-aware re-grouping) 通过感知难度和推理难度对样本进行动态重组,成功解决了 std 归一化的不稳定性。在只有 2.1k 训练数据的情况下,性能超越了众多重型模型,平均提升达 11.3%

痛点深挖:为什么 GRPO 在多模态推理上会“晕头转向”?

在标准的 GRPO (Group Relative Policy Optimization) 中,模型会对同一问题生成多个回答(Group),并基于这组回答的奖励标准差(std)进行归一化。

逻辑缺陷在于

  1. 极端样本干扰:如果一组回答全部正确或全部错误,std 会变得极小。在计算 Advantage 时,公式 就会产生极大的数值,导致模型对这些“运气成分”较大的样本过度拟合。
  2. 多模态的叠加效应:相比纯文本,MLLM 既要看懂图(感知),又要算对题(推理)。图像的复杂度和逻辑的深度共同增加了极端分布出现的概率。作者调查发现,在训练初期,高达 35%-46% 的样本奖励方差为 0(全对或全错),严重阻碍了有效学习。

核心机制:Durian 的“两把尺子”

为了解决上述问题,作者不再“一刀切”地对每个 Question 的 Group 独立归一化,而是将 batch 内难度相近的样本拉到一个大组里共享 std。

1. 感知难度(Perceptual Difficulty)

作者认为图像的复杂程度可以用**视觉熵(Visual Entropy)**来衡量。

  • 方法:提取图像 patch 特征,计算协方差矩阵并进行频谱分析(特征值分解)。
  • 直觉:特征值分布越均匀(熵高),说明图像空间结构越复杂,感知难度越大。

模型架构图 图 1:Durian 的两种重分组策略逻辑图

2. 推理难度(Reasoning Difficulty)

即使图像简单,推理步骤也可能充满不确定性。

  • 方法:使用模型生成这些 Reasoning Chains 的平均 Log 概率(Log-pro)作为置信度指标。
  • 直觉:Log 概率越低,说明模型对该推理路径越不确定,推理难度越高。

实验与结果:小样本撬动大性能

作者在 Qwen2.5-VL-7B 的基础上应用了 Durian,并与 GPT-4o、Claude-3.5 以及一众 R1 系列视觉模型进行了对比。

核心战绩

  • 性能飞跃:在 MathVision 榜单上性能提升 16%,综合平均提升 11.3%。
  • 数据效率:仅使用 2.1k 的 Geometry3K 数据集进行 RL,其表现竟然能与使用 260k 数据的 R1-VL-7B 掰手腕。

实验结果对比 表 1:Durian 在各大主流 MLLM 推理榜单上的表现对比

消融分析:谁在起作用?

实验显示(见图3),感知分组和推理分组单独使用都有提升。感知分组对检测“视觉幻觉”(如 HallusionBench)效果显著,而推理分组则在逻辑复杂的 MathVerse 上表现更佳。两者结合(Durian)达到了最优平衡。

深度洞察

Durian 的成功带给我们一个深刻的启示:大模型的强化学习不一定要追求极其复杂的奖励模型或海量数据,对训练动力学(Optimization Dynamics)的细微修正往往能产生巨大的杠杆效应。

通过将“相同难度”的样本放在一起比较,我们实际上是为模型提供了一套更公平的“打分参考系”,避免了它在简单任务上盲目自信,在困难任务上无所适从。

总结与展望

优势

  • 显著增强了 GRPO 的稳定性。
  • 对多模态数据的难度有了定量的刻画方法。

局限性

  • 目前的难度估计依赖于预训练视觉编码器的特征,如果编码器本身有偏,难度估计可能失效。
  • 引入了 α 系数等超参数。

未来,这种“难度感知”的思想有望扩展到更通用的多模态 RL 框架中,甚至是自适应地调整每组样本的采样数量。

发现相似论文

试试这些示例

  • 查找最近其他针对多模态 LLM 强化学习中奖励分布不均或梯度不稳定性问题的改进方案。
  • 哪篇论文最早在多模态领域讨论了视觉熵作为任务难度的度量标准,并分析其与模型感知错误率的相关性?
  • 研究如何将这种基于感知难度的重分组策略应用到除了推理之外的其他任务(如多模态具身智能或视频理解)中。
目录
[ICLR 2025] Durian:告别 GRPO 的极端样本焦虑,让 MLLM 推理更稳健
1. TL;DR
2. 痛点深挖:为什么 GRPO 在多模态推理上会“晕头转向”?
3. 核心机制:Durian 的“两把尺子”
3.1. 1. 感知难度(Perceptual Difficulty)
3.2. 2. 推理难度(Reasoning Difficulty)
4. 实验与结果:小样本撬动大性能
4.1. 核心战绩
4.2. 消融分析:谁在起作用?
5. 深度洞察
6. 总结与展望