[ArXiv 2024] UnifiedGRPO:强化学习如何激活多模态交错生成的“任督二脉”?
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
本文提出了 UnifiedGRPO,一种基于强化学习的后训练策略,旨在提升统一视觉语言模型(如 VILA-U)的多模态交错生成(Multimodal Interleaved Generation)能力。该方法通过两阶段训练(Warm-up 与 RL 优化),在不依赖大规模交错数据集的情况下,显著提升了模型在视觉故事叙述和多步推理任务中的表现。
TL;DR
本文由复旦大学与华为诺亚实验室等机构联合提出,核心目标是解决统一大模型在“交错生成”(即一段文字配一张图,再接一段文字)这一复杂任务上的乏力表现。作者通过将 DeepSeek 的 GRPO 算法引入多模态领域,并配合过程级奖励,在极少量数据下让模型实现了高质量的图文交替推理与叙事。
1. 痛点:为什么“文生图”强,但“交错生成”难?
目前的统一多模态模型(如 Chameleon, VILA-U)在单一任务上很强,但在推理时往往面临模态切换坍缩的问题:模型要么一直生成文字,要么生成一张图就结束了。
其根源在于:
- 数据稀缺:高质量的图文交错语料极少。
- 对齐困难:模型难以在长序列中保持生成的图像与前序文本的逻辑一致性。
- 反馈稀疏:如果只在序列最后给一个奖励(Outcome Reward),模型很难学会每一步该如何切换模态。
2. Methodology:UnifiedGRPO 的三大核心支柱
2.1 统一解码轨迹 (Unified Decoding Trajectory)
作者通过引入特殊的 Token(如 <think> 和 <vis>)来显式标记模态边界。在 GRPO 框架下,无论生成的是文本 Token 还是图像 Token,都被视为同一个决策过程(Single Trajectory)。这意味着 KL 散度的计算和策略更新是全模态覆盖的。

2.2 混合奖励函数 (Hybrid Rewards)
为了全方位约束模型,作者设计了三层奖惩机制:
- 文本奖励 ():评估生成的文字是否符合 Prompt。
- 视觉奖励 ():使用 ImageReward 模型评估图像质量及其与文本的语义对齐。
- 格式奖励 ():严厉惩罚不遵守交错格式(如乱放 Token)的行为。
2.3 过程级奖励 (Process-level Rewards)
这是本文的神来之笔。相比于等整个故事讲完再打分,作者在每一个模态切换点(Modality Step)都进行打分并归一化。这种细粒度的反馈能让模型更精准地捕捉到“这一步图画得合不合适”或“这段话转场是否自然”。
3. 实验战绩:全方位碾压基线
在 MMIE(大规模多模态交错理解与生成基准)上,UnifiedGRPO 表现强劲:
| Method | Avg Score | Situational Analysis |
|---|---|---|
| MiniGPT-5 | 50.92 | 47.63 |
| Emu2 (37B) | 45.33 | 39.65 |
| Ours (VILA-U 基座) | 59.50 | 56.87 |

尤其在 Situational Analysis(情景分析) 任务中,模型展现出了极强的叙事逻辑,得分超出前人 SOTA(Anole)10 个百分点以上。
4. 深度洞察
为什么 GRPO 在这里有效? 传统的 PPO 需要额外的 Critic 网络,在多模态场景下显存开销极大。GRPO 通过在同一个 Prompt 下采样多组结果(Group),利用组内相对得分来估计优势函数(Advantage),不仅减少了计算量,还利用“对比学习”的直觉让模型学会了分辨什么样的图文组合是“好的对齐”。
局限性: 尽管一致性大幅提升,但作者也坦言,模型对于复杂场景的**视觉幻觉(Hallucination)**依然存在。图像的风格连贯性(如故事里的主角在不同图中长得不一样)仍是一个待解决的长远课题。
5. 总结与启示
UnifiedGRPO 告诉我们,多模态能力的提升不一定需要暴力堆砌数据。通过聪明的 RL 策略和细粒度的奖励建模,现有的预训练模型完全可以被“点石成金”,解锁类似“视觉导演”般的连贯创作能力。
本文由 AI 技术主编重构,旨在提供深度学术见解。更多详情请参阅原论文。
