GraphDPO:超越 Pairwise 对齐,LLM 的偏好潜能隐藏在图中

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

总结
问题
方法
结果
要点
摘要

本文提出了 Graph Direct Preference Optimization (GraphDPO),这是一种将 Direct Preference Optimization (DPO) 推广到图结构偏好上的对齐方法。该方法通过构建有向无环图 (DAG) 来建模多条采样回复(Rollouts)间的偏好关系,在推理和代码生成任务中显著优于传统的成对或序列对齐方法。

TL;DR

在 LLM 对齐领域,传统的 DPO 总是将偏好数据拆解为“你优我劣”的成对比较。然而,来自亚马逊(Amazon)的研究团队近日提出:你的语言模型秘密地在优化一个偏好图(Preference Graph)。 新提出的 GraphDPO 突破了 Pairwise 和 Listwise 的局限,通过建模 DAG 图结构,捕捉多条回复间的传递性和等价关系,在数学推理与代码生成任务上刷新了性能上限。

背景定位:偏好对齐的第三种范式

目前主流的对齐方法可以分为三类:

  1. Pairwise (如 DPO):简单但孤立,忽略了多样本间的全局联系。
  2. Listwise (如 PRO, LiPO):假设了严苛的全序关系,无法处理“平局”或部分可比的情况。
  3. Graphwise (本文 GraphDPO):通过有向无环图(DAG)建模偏好,既能处理传递性,又能兼容等价类。

核心动机:为什么要用“图”?

在实际生产中,为了对齐模型,我们常针对一个提示词(Prompt)生成 个回复。如果用 DPO 拆解,会产生 个独立对,这会带来两个严重问题:

  • 传递性丢失:如果 ,独立处理时模型可能感知不到 的全局序。
  • 逻辑冗余或冲突:离散的判读信号(如:答案是否正确)会产生大量完全等价的回复,强行排序会引入虚假梯度(Spurious Gradients)。

机制详解:GraphDPO 是如何运作的?

1. 偏好图表示与等价类掩码

GraphDPO 为每个 Prompt 构建一个 。为了处理“平局”,作者引入了等价类掩码(Equivalence-class masking)。只有当回复 确实优于 时才建立边。同一层级(如同样都是错的或都是对的)的回复之间不产生损耗。

2. 图结构化目标函数

受 Plackett–Luce 模型的启发,GraphDPO 定义了局部选择概率: 这里的 是被 支配的邻域。这种设计让每个节点仅与其“手下败将”竞争,从而在全局上强化了偏好的一致性。

模型架构图 GraphDPO 的核心流程:采样、分层构建 DAG、节点邻域聚合更新。

3. 基准锚定 (Ground-Truth Anchoring)

在数学推理任务中,作者巧妙地加入了验证过的正确答案作为“超级节点”,并配以退火权重策略:早期重度依赖 GT 稳定方向,后期逐渐放权给模型自生成的回复,以保证多样性。

实验战绩:全线 SOTA

研究者在 GSM8K (数学)、MATH-500 (竞赛数学) 和 APPS (编程) 上进行了严谨消融:

任务LiPO (Listwise)GraphDPO (Ours)提升幅度
GSM8K89.23%92.75%+3.52%
MATH-50085.60%88.87%+3.27%
APPS69.32%73.76%+4.44%

实验结果对比 数据表明,任务越复杂(如 MATH 和 APPS),GraphDPO 的图结构优势越明显。

深度洞察

  • 隐式权重平衡:通过数学推导,作者发现 GraphDPO 实际上为那些具有更多“继任者”的节点分配了更高的梯度权重。这意味着模型会更激进地修正那些明显的低级错误。
  • 复杂度优势:尽管利用了全图结构,但在分层 DAG 下,其复杂度仅为 ,避开了 Pairwise 常见的 陷阱,极其适用于工业级的大规模 Rollouts。

总结与局限

GraphDPO 证明了偏好的本质是一种拓扑关系。尽管目前在推理任务中表现极其稳健,但对于主观性极强、难以形成明确层级偏好的对话任务,如何自动构建鲁棒的图结构仍是一个挑战。对于追求极限性能的 LLM 团队来说,放弃 Pairwise DPO,转向 GraphDPO 这种更符合逻辑直觉的方法,或许是性价比最高的下一步。

发现相似论文

试试这些示例

  • 针对大语言模型对齐,查找最近一年内除了 GraphDPO 外,其他利用偏好图(Preference Graph)或偏好传递性(Transitivity)改进算法的论文。
  • 哪篇论文最早引入了 Plackett-Luce 模型用于 LLM 的 Listwise 偏好对齐,GraphDPO 在其基础上做了哪些核心的数学改进?
  • 有哪些研究探讨了将 GraphDPO 的图结构优化方法应用到多模态(如图像生成偏好)或其他强化学习奖励建模任务中?
目录
GraphDPO:超越 Pairwise 对齐,LLM 的偏好潜能隐藏在图中
1. TL;DR
2. 背景定位:偏好对齐的第三种范式
3. 核心动机:为什么要用“图”?
4. 机制详解:GraphDPO 是如何运作的?
4.1. 1. 偏好图表示与等价类掩码
4.2. 2. 图结构化目标函数
4.3. 3. 基准锚定 (Ground-Truth Anchoring)
5. 实验战绩:全线 SOTA
6. 深度洞察
7. 总结与局限