PRISM:修正 SFT 偏移,多模态 RL 之前的关键“预对齐”

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

总结
问题
方法
结果
要点
摘要

本文提出了 PRISM,一种针对多模态大模型(LMMs)的三阶段后训练框架。该方法在传统的 SFT 到 RLVR 流程中插入了一个基于黑盒在线策略蒸馏(On-Policy Distillation)的预训练对齐阶段,利用 Mixture-of-Experts (MoE) 判别器修正 SFT 引入的分布偏移,在 Qwen3-VL 基础上显著提升了推理性能。

TL;DR

在大型多模态模型(LMM)的训练中,传统的“指令微调(SFT)→ 强化学习(RL)”路径并非最优。本文提出的 PRISM 框架通过在 SFT 之后加入一个基于 MoE 判别器 的**黑盒在线策略蒸馏(On-Policy Distillation)**阶段,成功修复了 SFT 带来的分布偏移(Distributional Drift)。在 Qwen3-VL 上的实验显示,这一步骤能让下游 RL 的收益放大,平均得分提升高达 6.0 分。

1. 痛点:SFT 其实也是一把双刃剑

在模型后训练(Post-training)领域,学术界一直有一个直觉:SFT 建立基础能力,RL 进一步打磨性能。然而,最新的研究(如 Kang et al., 2025)指出,SFT 可能会让模型陷入一种“妥协状态”:

  1. 分布偏移:模型通过 token 级别的模仿学习外部数据,往往只学会了表面模式,却偏离了预训练阶段积累的高质量原生分布。
  2. 错误放大:在多模态推理中,视觉感知的微小偏差会扭曲整个推理链条的逻辑前提。
  3. 异质性退化:感知能力的下降与逻辑推理的崩溃是不同质的,单一的奖励信号(Verifiable Reward)很难同时修复这两者。

2. Methodology: PRISM 的三阶段炼金术

PRISM 的核心是在 SFT 和 RL 之间插入了一个显式的**预对齐(Pre-alignment)**阶段。

2.1 架构解析:MoE 判别器

为了应对感知和推理的异质性偏移,作者设计了一个 Mixture-of-Experts (MoE) 判别器。它不只是输出一个简单的分值,而是由两个专家组成:

  • 感知专家 (Perception Expert ):专门评估视觉描述部分,确保模型“眼见为实”。
  • 推理专家 (Reasoning Expert ):专门评估 CoT(思维链)的逻辑严密性。

其最终奖励信号定义为两者的加权组合: 这种设计允许模型接收到解耦的反馈信号,避免了单一奖励导致的梯度噪声。

PRISM 流程总览图

2.2 黑盒在线策略蒸馏 (OPD)

传统的蒸馏需要访问 Teacher 模型的 Logits,这在当下 API 闭源时代非常困难。PRISM 采用对抗游戏(Adversarial Game)的形式:

  • 策略网络 (Policy) 负责生成回应。
  • 判别器 (Discriminator) 负责区分模型生成与高质量监督数据。 这种 On-Policy(在线)的特性让模型在自己的采样空间内进行对齐,能有效缓解推理时的 Exposure Bias。

对齐阶段架构图

3. 实验战绩与深度洞察

作者在 Qwen3-VL 的不同规模(4B, 8B)上进行了广泛测试,使用了 GRPO, DAPO 和 GSPO 等多种 RL 算法。

3.1 关键结果:RL 效果的翻倍

实验证明,PRISM+GRPO 在所有指标上均显著优于传统的 SFT→GRPO。特别是在 MathVision (+9.9%) 这种强依赖感知与逻辑结合的任务中,PRISM 展现了极强的统治力。

实验结果对比表

3.2 为什么 MoE 判别器有效?

通过训练动态观察发现,感知专家和推理专家的收敛曲线是异步的(见下图)。

  • 感知专家收敛极快,能迅速确立视觉接地的边界;
  • 推理专家则波动较大,需要更细腻的对齐。 如果使用传统的 Dense 判别器,这两类信号会互相抵消(Collapse),导致训练不稳定。

训练动态分析图

4. 结论与局限性

PRISM 证明了分布对齐是 LMM 进行强化学习之前不可或缺的“热身”。它不仅让模型更聪明(得分更高),还让模型更高效(Token 消耗更少)。

局限性

  1. 计算成本:由于需要同时训练 Generator 和 MoE Discriminator,内存和显存压力较大。
  2. 格式依赖:目前强依赖于结构化的输出格式(Caption-Think-Answer),对于非结构化任务的泛化尚待研究。

总而言之,PRISM 这种“空间换能力”的思想,为未来的 LMM 训练提供了一个严谨且可高度复现的技术范式。

发现相似论文

试试这些示例

  • 查找最近其他探讨大模型 SFT 阶段导致分布偏移(Distributional Drift)及其对下游 RL 性能影响的研究论文。
  • 哪篇论文最早在 Transformer 架构中提出了奖励模型(Reward Model)的对齐不仅应关注结果,还应关注过程(Process Reward),PRISM 的 MoE 判别器是如何借鉴这一思想的?
  • 有哪些研究将类似 PRISM 的解耦感知与推理专家的方法应用到了多模态视频理解或具体具身智能(Embodied AI)的任务中?
目录
PRISM:修正 SFT 偏移,多模态 RL 之前的关键“预对齐”
1. TL;DR
2. 1. 痛点:SFT 其实也是一把双刃剑
3. 2. Methodology: PRISM 的三阶段炼金术
3.1. 2.1 架构解析:MoE 判别器
3.2. 2.2 黑盒在线策略蒸馏 (OPD)
4. 3. 实验战绩与深度洞察
4.1. 3.1 关键结果:RL 效果的翻倍
4.2. 3.2 为什么 MoE 判别器有效?
5. 4. 结论与局限性