[arXiv 2025] 双向课程生成:让大模型通过“查漏补缺”高效掌握数学推理
Bidirectional Curriculum Generation: A Multi-Agent Framework for Data-Efficient Mathematical Reasoning
本文提出了 Bidirectional Curriculum Generation (BCG),一个面向大语言模型数学推理的自适应多智能体课程学习框架。该方法通过“向上挑战”与“向下修复”的闭环反馈机制,在仅使用 5,873 个指令样本的情况下,使 Qwen3-8B 在 AIME 2025 等复杂竞赛任务上性能翻倍,显著提升了数据效率。
TL;DR
在训练大语言模型(LLM)处理复杂的数学竞赛题时,传统的“题海战术”正逐渐失效。来自浙江大学、上海 AI Lab 等机构的研究者提出了 Bidirectional Curriculum Generation (BCG)。该框架抛弃了死板的单向难度升级,引入了一套多智能体反馈机制:模型做错了,就由“修复者”降低难度补基础;模型做对了,就由“挑战者”加难度提上限。这种精准的“因材施教”让模型仅需 5,800 条数据,就在 AIME 等竞赛中超越了使用百万级数据的模型。
1. 痛点:为什么“由易到难”的单向学习不够好?
传统的课程学习(Curriculum Learning)遵循人类的直觉:先学 1+1,再学微积分。但在 LLM 训练中,这会带来两个隐患:
- 推理断层 (Reasoning Cliffs):如果模型还没理解代数基础,你强行喂给它奥数题,它只会死记硬背而无法理解逻辑,导致训练停滞。
- 效率低下:静态数据集里有大量模型已经掌握的“废话”或模型无论如何也理解不了的“天书”,造成了巨大的算力成本浪费。
作者的核心 Insight 是:最有效的学习发生在“最近发展区(ZPD)”——即那些模型跳一跳就能摘到的苹果。为了捕捉这个区域,训练必须从“开环”变为“闭环”。
2. 核心架构:多智能体教学闭环
BCG 框架摒弃了预先排好序的静态数据,而是雇佣了四个“AI 老师”来实时出题。

四大智能体各司其职:
- 难度降低智能体 (The Repairer):当模型在某个知识点跌倒时,该智能体通过减少约束、简化步骤(Downward Adjustment),为模型铺设“台阶”,直到它掌握基础。
- 难度增加智能体 (The Challenger):一旦模型表现稳定,该智能体注入更复杂的概念或多步推导(Upward Expansion),推送模型挑战能力极限。
- 逆向生成智能体 (The Reasoner):这是一个绝妙的设计。它要求模型“已知答案求题目”,这种反向逻辑推导能有效破除模型的思维定式。
- 多样性增强智能体 (The Explorer):将同类逻辑平移到几何、概率、代数等不同背景下,防止模型对特定模板产生过拟合。
3. 实验战绩:以一当百的数据效率
在 Qwen3-8B 上的实验结果令人震惊。相比于那些动辄使用几十万、上百万数据的合成数据方法,BCG 展示了极高的性价比。

- 小规模,大提升:仅用 5,873 个样本,平均性能(60.03)就超过了拥有 1,250,000 个样本的 MegaScience。
- 攻克 AIME 巅峰:在极其困难的 AIME 2025 榜单上,BCG 提升了近 4 倍的性能(10.8 -> 40.0),这意味着模型真正习得了复杂的长链条逻辑,而非简单的模式匹配。
4. 深度洞察:为什么双向调节有效?
作者在论文中给出了 Optimal Pacing Theorem(最优步调定理) 的证明。其核心物理直觉在于:
- 如果题目太简单,梯度会消失(模型学不到新东西);
- 如果题目太难,梯度会变得随机且充满噪音(模型学不会)。
通过双向调节,BCG 将训练分布精确定位在梯度范数最大的“峰值区域”。
上图展示了 BCG 生成数据的“金字塔”结构:既有厚实的基础(Level 1-3),也有足够高的金字塔尖(Level 7-10 竞赛级),确保了模型的逻辑鲁棒性。
5. 总结与反思
BCG 告诉我们:数据质量不等于“正确率”,而是“匹配度”。
局限性:目前该系统高度依赖于数学领域的结构化难度打分。如果将这套逻辑应用到文学创作或法律咨询等主观性较强的领域,如何量化“难度”和“失败模式”将是下一个巨大的挑战。
启示:未来的 LLM 训练可能会从“大算力+大数据”向“智能诊断+精准合成”进化。给模型一个懂它的“AI 老师”,可能比给它整个互联网的数据更有用。
