[CVPR 2024?] SpatialScore:让 AI 画布告别“空间错位”,强化学习重塑图像逻辑理解
Enhancing Spatial Understanding in Image Generation via Reward Modeling
本文提出了 SpatialScore,一个专门用于增强图像生成模型空间理解能力的奖励模型,以及包含 80k 相对关系偏好对的 SpatialReward-Dataset。通过在线强化学习(Online RL)框架,该方法在多个基准测试中显著提升了模型处理复杂空间指令的能力,性能超越了 GPT-5 等顶尖闭源模型。
TL;DR
尽管当前的文生图模型(如 Flux, SDXL)视觉效果惊人,但在面对“A在B左边,C在A后面”这类复杂空间指令时,往往表现得像个“空间感缺失”的学徒。本文通过推出 SpatialReward-Dataset 和专门的奖励模型 SpatialScore,利用在线强化学习(Online RL)让模型真正“读懂”方位。其实验结果不仅刷新了 SOTA,甚至在空间评估准确度上击败了 GPT-5。
核心速览:为什么 AI 总是画错位置?
在文生图领域,空间关系(Spatial Understanding)一直是 LLM 驱动的扩散模型的“阿喀琉斯之踵”。
- 定位: 本文属于“对生成模型进行后训练(Post-training)”的范畴,通过 RL 提升模型的指令遵循能力(Prompt Following)。
- 痛点: 现有的奖励模型(Reward Models)主要看“画得美不美”,而不是“位置对不对”。即便强如 Qwen2.5-VL-72B,在面对多对象空间推理时也存在明显的幻觉。
痛点深挖:现有机制的崩塌
作者发现,现有的评估体系存在两大弊端:
- 审美偏移:PickScore 等模型会给一张漂亮但方位错误的图打高分。
- 规则僵化:像 GenEval 这样基于目标检测器的规则方法,在遇到遮挡(Occlusion)或长文本时,检测器本身就会报错,导致训练信号有偏。
图 1:现有的 Reward 模型即便面对明显的空间错误也无法提供正确反馈。
核心方法:SpatialScore 与 Top-k GRPO
1. 数据驱动:对抗性偏好对
作者利用 GPT-5 生成原始 Prompt(Perfect Prompt)和经过方位扰动的 Prompt(Perturbed Prompt),生成对应的图像对。通过 80k 组人类校验的数据,训练出一个能够感知细微方位差异的 VLM 奖励模型。
2. 算法改进:缓解优势偏差 (Advantage Bias)
在 RL 过程中,作者采用了 GRPO(群组相对策略优化)。GRPO 的标准做法是对一组样本的 reward 进行标准化。
- 问题:对于简单的 Prompt,所有样本可能都很优秀,导致均值过高,部分优秀的样本反而被赋予负优势(Negative Advantage)。
- 对策:Top-k 过滤。仅选取每组 samples 中表现最好和最差的 个样本进行更新。这不仅平衡了梯度方向,还显著降低了计算量(NFE)。
图 2:针对空间准确性优化的 GRPO 训练流程。
实验与结果:超越闭源模型
在对比实验中,SpatialScore (仅 7B) 的表现令人惊叹:
- 评估准确率:在空间偏好测试中达到 95.8%,超越了 GPT-5 (89.0%)。
- 泛化能力:在 DPG-Bench 等第三方长文本测试集上,经过微调的 Flux.1-dev 表现远超原始版本和基于 GenEval 的基线。
图 3:RL 微调前后的定性对比。可以看到,模型现在能准确处理复杂的物体排列,减少了逻辑伪影。
深度洞察:奖励模型是 T2I 的下一块基石
本文的研究直觉非常明确:文生图模型的瓶颈不再是画质(Fidelity),而是语义一致性(Semantic Alignment)。
- 局限性:目前该方法主要针对静态图像。在视频生成(Text-to-Video)中,空间关系随时间动态变化(如“A 穿过 B 后面”),这需要更高维度的时空奖励模型。
- 未来展望:这种“专用奖励模型 + 在线 RL”的范式可以推广到属性绑定、颜色分配等其他逻辑缺陷领域,逐步解决 AI 绘画的“常识性”错误。
总结
SpatialScore 为解决 Diffusion Models 的逻辑缺陷提供了一个范式级别的参考。通过构建高质量的对抗偏好数据,并结合高效的 Top-k 强化学习策略,我们离“所写即所得”的图像生成更近了一步。
