[ArXiv 2025] Code2Math:让代码代理成为奥数题目的“造物主”

Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?

总结
问题
方法
结果
要点
摘要

本文提出了 Code2Math,这是一个利用代码代理(Code Agents)自主演化数学难题的多智能体框架。通过在该框架下进行代码执行与符号探索,模型能够将现有的种子题目(如 IMO, AIME 试题)转化为结构更复杂、且具备更高“探索负担”(Burden of Discovery)的新题。

TL;DR

随着 LLM 推理潜力的深入挖掘,高质量“题库”成了稀缺资源。Code2Math 提出了一种创新的多智能体系统,让模型不仅仅是“做题家”,更是“出题人”。通过在 Python 沙盒中进行符号探索,它能将简单的数学题演化为逻辑深奥、需要跳跃性思维(Aha Moment)的顶级难题,且保证题目是可解的。

1. 痛点:IMO 级别的数据荒

目前,DeepSeek-R1、o1 等模型已经展现出触及 IMO 水平的推理能力,但我们面临一个尴尬的现实:题不够用了

  • 人工出题难:顶级数学竞赛题需要专家耗费数周构思,无法规模化。
  • 简单生成差:过往的自动生成方法要么逻辑不通(不可解),要么只是把数字变大(计算繁琐而非智力挑战)。

作者意识到,数学发现本质上是一个“探索-验证”的过程。这正是代码代理(Code Agents)的强项。

2. 核心架构:三位一体的演化工厂

Code2Math 不仅仅是简单的 Prompt Engineering,它构建了一个闭环的生产线:

Code2Math 多智能体架构图

  1. 演化代理 (Evolution Agent):基于“心灵理论”(Theory of Mind),预测人类选手的心理盲区,利用代码探索(如数值模拟、边界探测)来修改原题结构,注入新的“探索负担”(Burden of Discovery)。
  2. 可解性校验代理 (Solvability Verification Agent):这是最关键的一步。它不仅看题目描述,还要求必须推导出一个逻辑无懈可击的解题链。如果解不出来,题目直接废弃。
  3. 难度校验代理 (Difficulty Verification Agent):采用 5 分制评分,剔除那些“靠繁杂计算增加难度”的次品(1-2分),保留那些“打破模板、需要灵光一现”的精品(3-5分)。

3. 代码驱动的“数学发现”

为什么一定要用代码?在 Case Study 中,我们看到当模型遇到不确定性时,会调用 Python 库(如 SymPy, itertools):

  • 发现模式:通过打印数列前十项,找出潜在的非线性规律。
  • 寻找反例:在构造不等式时,利用 Z3 求解器搜索是否存在违反条件的点,从而修正边界。

这种代码引导的探索让生成过程从“盲目猜测”变成了“科学实验”。

4. 实验结果:难度的真实跨越

实验结果令人振奋:

实验结果对比表

  • 性能大幅下降:在演化后的题目上,SOTA 系统(如 GPT-5.2-High)的解决率从 70% 掉到了 64%,而其他模型的跌幅甚至超过 20%。
  • 思考长度增加:从下图可以看到,解答演化后的题目所需的 Token 数(ATC)分布明显向右偏移,这意味着模型必须进行更深层的思考和自我纠正。

Token 消耗分布图

5. 深度洞察:能力的“非对称性”

本文最耐人寻味的一个结论是:模型出题的能力上限竟然高于其解题能力。 通过多轮 Rollout 和代码验证,一个模型可以设计出连它自己(在单次尝试中)都解不出来的难题。这种“能力非对称性”为模型的自进化提供了可能——通过不断制造并攻克这些“自己出的难题”,模型可以在没有外部标注的情况下实现自我博弈和能力提升。

总结

Code2Math 不仅仅是一个数据生成框架,它展示了人工智能如何通过“代码实验”这种具身化的方式,触及数学知识的边界。尽管目前演化过程存在较高的计算成本(平均每成功一次需要 1.5 到 6 次失败),但它为通往 AGI 领域的“自我合成数据”提供了一张极具启发性的蓝图。

发现相似论文

试试这些示例

  • 查找最近其他利用代码执行环境(Code Sandbox)来增强 LLM 逻辑推理或自动生成合成数据的相关论文。
  • 哪篇论文最早提出了“测试时缩放”(Test-time Scaling)的概念,本文在生成任务中又是如何应用这一范式的?
  • 调研当前针对数学竞赛题目(如 IMO 级)自动评估可解性与逻辑严密性的主流方法与基准测试。
目录
[ArXiv 2025] Code2Math:让代码代理成为奥数题目的“造物主”
1. TL;DR
2. 1. 痛点:IMO 级别的数据荒
3. 2. 核心架构:三位一体的演化工厂
4. 3. 代码驱动的“数学发现”
5. 4. 实验结果:难度的真实跨越
6. 5. 深度洞察:能力的“非对称性”
7. 总结