[ArXiv 2024] UnifiedGRPO:强化学习如何激活多模态交错生成的“任督二脉”?

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

总结
问题
方法
结果
要点
摘要

本文提出了 UnifiedGRPO,一种基于强化学习的后训练策略,旨在提升统一视觉语言模型(如 VILA-U)的多模态交错生成(Multimodal Interleaved Generation)能力。该方法通过两阶段训练(Warm-up 与 RL 优化),在不依赖大规模交错数据集的情况下,显著提升了模型在视觉故事叙述和多步推理任务中的表现。

TL;DR

本文由复旦大学与华为诺亚实验室等机构联合提出,核心目标是解决统一大模型在“交错生成”(即一段文字配一张图,再接一段文字)这一复杂任务上的乏力表现。作者通过将 DeepSeek 的 GRPO 算法引入多模态领域,并配合过程级奖励,在极少量数据下让模型实现了高质量的图文交替推理与叙事。

1. 痛点:为什么“文生图”强,但“交错生成”难?

目前的统一多模态模型(如 Chameleon, VILA-U)在单一任务上很强,但在推理时往往面临模态切换坍缩的问题:模型要么一直生成文字,要么生成一张图就结束了。

其根源在于:

  • 数据稀缺:高质量的图文交错语料极少。
  • 对齐困难:模型难以在长序列中保持生成的图像与前序文本的逻辑一致性。
  • 反馈稀疏:如果只在序列最后给一个奖励(Outcome Reward),模型很难学会每一步该如何切换模态。

2. Methodology:UnifiedGRPO 的三大核心支柱

2.1 统一解码轨迹 (Unified Decoding Trajectory)

作者通过引入特殊的 Token(如 <think><vis>)来显式标记模态边界。在 GRPO 框架下,无论生成的是文本 Token 还是图像 Token,都被视为同一个决策过程(Single Trajectory)。这意味着 KL 散度的计算和策略更新是全模态覆盖的。

模型架构图

2.2 混合奖励函数 (Hybrid Rewards)

为了全方位约束模型,作者设计了三层奖惩机制:

  1. 文本奖励 ():评估生成的文字是否符合 Prompt。
  2. 视觉奖励 ():使用 ImageReward 模型评估图像质量及其与文本的语义对齐。
  3. 格式奖励 ():严厉惩罚不遵守交错格式(如乱放 Token)的行为。

2.3 过程级奖励 (Process-level Rewards)

这是本文的神来之笔。相比于等整个故事讲完再打分,作者在每一个模态切换点(Modality Step)都进行打分并归一化。这种细粒度的反馈能让模型更精准地捕捉到“这一步图画得合不合适”或“这段话转场是否自然”。

3. 实验战绩:全方位碾压基线

MMIE(大规模多模态交错理解与生成基准)上,UnifiedGRPO 表现强劲:

MethodAvg ScoreSituational Analysis
MiniGPT-550.9247.63
Emu2 (37B)45.3339.65
Ours (VILA-U 基座)59.5056.87

实验结果对比

尤其在 Situational Analysis(情景分析) 任务中,模型展现出了极强的叙事逻辑,得分超出前人 SOTA(Anole)10 个百分点以上。

4. 深度洞察

为什么 GRPO 在这里有效? 传统的 PPO 需要额外的 Critic 网络,在多模态场景下显存开销极大。GRPO 通过在同一个 Prompt 下采样多组结果(Group),利用组内相对得分来估计优势函数(Advantage),不仅减少了计算量,还利用“对比学习”的直觉让模型学会了分辨什么样的图文组合是“好的对齐”。

局限性: 尽管一致性大幅提升,但作者也坦言,模型对于复杂场景的**视觉幻觉(Hallucination)**依然存在。图像的风格连贯性(如故事里的主角在不同图中长得不一样)仍是一个待解决的长远课题。

5. 总结与启示

UnifiedGRPO 告诉我们,多模态能力的提升不一定需要暴力堆砌数据。通过聪明的 RL 策略和细粒度的奖励建模,现有的预训练模型完全可以被“点石成金”,解锁类似“视觉导演”般的连贯创作能力。


本文由 AI 技术主编重构,旨在提供深度学术见解。更多详情请参阅原论文。

发现相似论文

试试这些示例

  • 查找最近其他将强化学习(PPO, DPO 或 GRPO)应用于多模态模型对齐(Multimodal Alignment)或生成的论文。
  • DeepSeek 提出的 GRPO (Group Relative Policy Optimization) 原文是什么,它是如何通过组内相对比较取消 Critic 网络的?
  • 除了 VILA-U,还有哪些最新的统一多模态模型(如 Janus, Show-o, Chameleon)支持端到端的交错文本图像生成?
目录
[ArXiv 2024] UnifiedGRPO:强化学习如何激活多模态交错生成的“任督二脉”?
1. TL;DR
2. 1. 痛点:为什么“文生图”强,但“交错生成”难?
3. 2. Methodology:UnifiedGRPO 的三大核心支柱
3.1. 2.1 统一解码轨迹 (Unified Decoding Trajectory)
3.2. 2.2 混合奖励函数 (Hybrid Rewards)
3.3. 2.3 过程级奖励 (Process-level Rewards)
4. 3. 实验战绩:全方位碾压基线
5. 4. 深度洞察
6. 5. 总结与启示