MATHNET:当 Olympiad 解题不再等于数学检索

MATHNET: A GLOBAL MULTIMODAL BENCHMARK FOR MATHEMATICAL REASONING AND RETRIEVAL

2026-04-01
Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei, Sultan Albarakati, William T. Freeman, Antonio Torralba
总结
问题
方法
结果
要点
摘要

本文提出 MATHNET,包含 30,676 道 Olympiad-level problems 和三类任务:Problem Solving、Math-Aware Retrieval、Retrieval-Augmented Problem Solving。结果显示最强解题模型可达到 78.4% 准确率,但嵌入模型在等价题检索上的 Recall@1 仅约 5%;当检索到结构对齐的专家配对题时,DeepSeek-V3.2-Speciale 在人类评分下达到 97.3%。

TL;DR

MATHNET 把数学奥赛评测从“能否写出答案”扩展为三个互相耦合但本质不同的能力:Problem Solving、Math-Aware Retrieval 和 Retrieval-Augmented Problem Solving。论文用 30,676 道 Olympiad-level problems、47 个国家、17 种语言和 143 场竞赛构建了主语料;在 Table 3 中,gemini-3.1-pro-preview 的 Micro Avg 达到 78.4,gpt-5 为 69.3,但 Table 4 显示最强 embedding 模型 gemini-embedding-001 的 All R@1 仅 4.83,qwen3-embedding-4B 也只为 4.96。进一步地,Table 5 中 DeepSeek-V3.2-Speciale 在人类评分下从 Zero-shot 的 84.8 升至 Expert-RAG 的 97.3,说明检索增强并非天然有效,而取决于召回的上下文是否真正具备数学结构对齐。

背景定位

这是一篇典型的 Benchmark 和 Dataset 工作,而不是单纯刷新某个单一推理榜单。它的坐标系意义在于同时占据两个方向:一方面,它用官方题册规模超过既有 Olympiad 数据集;另一方面,它首次把“数学问题检索”作为独立任务推到前台。MATHNET 的主要贡献不是证明某个模型更强,而是指出模型在“找到等价题”这件事上几乎失败,并把这种失败转化为可测量、可构造、可改进的评测对象。

从论文给出的 Table 1 看,既有 benchmark 多集中在英语或中英双语、社区平台来源或较小规模上;MATHNET 则强调 official country booklets、international contests 和 national contests 来源,并覆盖 EN、ZH、ES、RU、FR、RO 等语言。这里的关键不是语言数量本身,而是它让“数学等价”必须跨表示、跨记号、跨自然语言叙述而被识别,从而逼近真实竞赛出题与科研检索的困难。

问题与动机

现有数学推理评测存在一个被长期掩盖的失效机制:生成模型可以因为训练数据中存在相似题目、或者因为最终答案碰巧正确而获得高分,但这并不说明模型掌握了数学对象的等价类。论文在 Section 1 中给出了一个核心例子:形如 $x^{2}+y^{2}=1$$a^{2}+b^{2}=1$ 的表述在结构上等价,甚至可以与单位范数二维向量集合相关联,但它们并不等价于 $x+y=1$。传统 retrieval 模型可能因为变量名、关键词或表面符号重叠,把 $x+y=1$ 这类近邻错误表述排在更高位置。

这个问题在专家工作流中也很真实。论文提到 IMO shortlist 构造过程中,出题人需要识别新题是否与已有题目、书籍或在线题集重复;数学研究中,研究者搜索“upper bounds on prime gaps”这类自然语言主题,而不是固定公式。现有系统擅长语义改写匹配,却对 symbolic equivalence、变量重命名、代数变形和跨域同构不敏感。MATHNET 的动机正是把这种“结构盲视”变成可量化评测。

核心章节:MATHNET 作为 benchmark 的三段式骨架

评测目标与设计:从答案正确性到数学等价类

MATHNET 的主语料 MathNet-Solve 支撑 Problem Solving;MathNet-Retrieve 支撑 Math-Aware Retrieval;MathNet-RAG 支撑 Retrieval-Augmented Problem Solving。三者不是同一任务的三种变体,而是刻意拆分出的三层能力:生成能力、表示能力、检索对生成是否有用。这种拆分的价值在于,它避免把“检索增强后变强”直接归因于 solver 更强;相反,论文通过 Zero-shot、Embed-RAG 和 Expert-RAG 三个条件,把 retrieval quality 单独隔离出来。

论文进一步提出一个精细的相似性 taxonomy:Invariance、Resonance 和 Affinity。Invariance 是严格等价,例如变量重命名、代数改写、几何再表述或跨域同构;Resonance 是部分相似,两个问题不等同,但可用同一证明策略、引理或结构直觉解决;Affinity 则是主题性相关,例如都属于数论或组合,但没有共享解法结构。MATHNET-RAG 使用 35 对 expert-paired real problems,并明确落在 Structural Resonance 类别,这说明作者关心的不是“找到几乎一样的题”,而是“找到能迁移人类类比直觉的题”。

MATHNET overview showing Olympiad problems, countries, languages, competitions, and evaluation tasks

为什么不用简单的 Invariance 作为 RAG 的唯一正例?因为如果 retrieved context 与 target 几乎完全等价,RAG 的任务会退化为复制示例答案,不能测量类比迁移能力。论文选择 Structural Resonance pair,使模型必须从官方解法中抽取可迁移结构,而不是直接搬运符号。论文没有给出 Invariance、Resonance、Affinity 三种 pair 在同一 solver 上的完整对照实验,但 Table 5 的 Expert-RAG 与 Embed-RAG 差异至少说明,上下文相似度层级会影响下游推理。

指标的形式化定义:准确率、Recall@k 与检索质量边界

Problem Solving 的评分并不只是检查最终答案。Section 4.2 说明 MATHNET 采用类似 IMO-Bench 的模型评分:GPT-5 作为 judge,基于题目、参考解答和模型解答给出 0 到 7 分,再将分数二值化。可以把它形式化为:

其中 是测试题数, 是第 道题由 judge 给出的整数分数,取值来自 0、1、6、7 等评分档位, 是指示函数。这个式子在论文中的作用是把“证明过程质量”压成一个 benchmark accuracy,而不是只看 boxed answer。它比 exact-match 更接近奥赛评分,因为答案碰巧对但推理有严重漏洞时,judge 仍可给低分。它的边界也很明显:若阈值从 降为 ,大量 partial progress 会被错误计为正确;若升为 ,则许多合理但有小瑕疵的解法会被过度惩罚。论文选择阈值 6,本质上是在“完全正确”和“几乎正确”之间取一个保守边界。

Math-Aware Retrieval 的核心指标是 Recall@k。对每个 anchor problem ,MATHNET 构造一个等价正例 ,并用 embedding similarity 排序候选问题。可写为:

其中 是 anchor 集合, 在 MathNet-Retrieve 中为 10,000, 表示正例 在该 anchor 的候选排序中的位置。这个式子定义了任务是否成功:只要 top-k 中出现等价正例,就记为命中。相比生成式解题,Recall@k 更直接暴露 representation 的缺陷:模型可能生成正确答案,却仍无法把等价题排到前面。若把 增大,命中变容易,但任务会退化为“只要捞进候选池就行”;若把 压到 1,则真正要求 embedding 区分数学等价与表面相似。论文 Table 4 同时报告 R@1 与 R@5,并强调 R@1 极低,而正文又提到 Recall@10 在部分领域可超过 80,这恰好说明问题不是“完全找不到”,而是 top 排序被 near-miss 错误干扰。

数据构造与质量控制:官方文档、三段式提取与人工核验

MATHNET 的数据基础不是 AoPS 社区帖子,而是官方题册。Section 3.2 报告数据收集范围为 1985 至 2025 的 47 个国家材料,包含 1595 份 PDF volumes 和超过 25,000 页。这一步很重要,因为官方材料保证题目与解答由国家队或竞赛组织作者撰写,风格一致,且不像社区平台那样混入非正式讨论、多人改写和噪声标注。论文随后用多语言 document parsing framework dots-ocr 将不同版式转为 Markdown,再用 LLM pipeline 对齐问题与解答。

提取流程分为三个阶段。Stage 1 是文档摄取和问题分段,使用 Gemini-2.5-Flash 识别问题和解答所在行号,并记录作者、提示、来源文件和页码。Stage 2 使用 GPT-4.1 从定位片段中提取 LaTeX-friendly 的问题与解答,并保留前后 buffer text 以避免截断。Stage 3 使用 rule-based analytical checker、GPT-4.1 screenshot judge 和人工 annotator 进行验证,只有三方一致同意才保留。这样的质量控制直接服务于 benchmark 可信度:如果提取出的“官方解答”本身不完整或错配,后续 judge 评分会被污染。

MATHNET pipeline showing document ingestion, problem solution extraction, and multi-stage verification

MathNet-Retrieve 的构造则更直接地针对 retrieval failure mode。论文用 10,000 个 anchor problems,对每个 anchor 用 GPT-5 生成 1 个 equivalent positive 和 3 个 hard negatives,形成 40,000 个 synthetic problems。可以形式化为:

其中 是原始题目, 是数学等价正例, 是保持表层形式但改变数学结构的负例。这个式子定义了评测集合的最小单元:不是普通 query-document pair,而是一个正例与三个近邻错误例共同构成的困难候选环境。如果 被替换成随机无关题,任务会退化成关键词匹配;如果只保留 positive,则无法检验模型是否被 subtle symbolic perturbation 误导。hard negative 的意义正在于此:它让 Recall@1 失败变得可解释。

MATHNET 三个组件的总体结构可以用下面这张表概括:

组件规模支撑任务
MathNet-Solve30,676 道题,train 23,776、test 6,400、test-hard 500Problem Solving
MathNet-Retrieve10,000 anchors,1 个等价正例和 3 个 hard negatives,共 40,000 synthetic problemsMath-Aware Retrieval
MathNet-RAG35 anchors 与 35 个 expert-paired real problems,共 70 problemsRetrieval-Augmented Problem Solving

这张表说明 MATHNET 不是一个只给题号和答案的集合,而是把数据分成三种评测角色: Solve 用于测 solver,Retrieve 用于测 embedding,RAG 用于把两者连起来。论文没有给出 MathNet-Retrieve 中人工标注者对 synthetic pairs 的不一致率,但 Section 6 提到 expert annotators reviewed problem similarity labels,因此数据构造不是纯自动生成的闭环,而是带有专家核验层。

实验与证据

主结果:解题能力快速进步,但几何与离散仍难

Table 3 报告了 Problem Solving Accuracy 在 MathNet-Solve-Test 上的结果,包含 Algebra、Number Theory、Geometry、Discrete Math 四个 domain,以及 Macro Avg 和 Micro Avg:

模型类别模型AlgebraNumber TheoryGeometryDiscrete MathMacro AvgMicro Avg
LLM text-onlyministral-3B6.4 ± 1.02.9 ± 0.94.3 ± 0.81.7 ± 0.64.4 ± 0.54.4 ± 0.5
LLM text-onlyDeepSeek-V3.251.6 ± 2.045.3 ± 2.632.2 ± 1.832.7 ± 2.140.1 ± 1.240.1 ± 1.2
LLM text-onlygrok-337.7 ± 1.933.0 ± 2.321.7 ± 1.624.2 ± 1.928.5 ± 1.128.5 ± 1.1
LMMLlama-4-Maverick-17B22.5 ± 1.714.4 ± 1.810.7 ± 1.28.6 ± 1.314.7 ± 0.914.7 ± 0.9
LMMgpt-4.129.4 ± 1.824.0 ± 2.215.7 ± 1.416.6 ± 1.721.4 ± 1.021.4 ± 1.0
LMMgpt-4o10.9 ± 1.27.0 ± 1.34.5 ± 0.84.2 ± 0.96.8 ± 0.66.8 ± 0.6
Reasoning LLMDeepSeek-R146.1 ± 2.039.5 ± 2.531.2 ± 1.827.3 ± 2.036.3 ± 1.236.3 ± 1.2
Reasoning LMMgemini-3.1-pro-preview83.7 ± 1.582.2 ± 2.074.6 ± 1.775.6 ± 2.078.4 ± 1.078.4 ± 1.0
Reasoning LMMgemini-3-flash-preview77.7 ± 1.773.3 ± 2.367.0 ± 1.864.0 ± 2.270.4 ± 1.170.4 ± 1.1
Reasoning LMMgemini-2.5-flash50.5 ± 2.042.6 ± 2.536.8 ± 1.831.0 ± 2.141.1 ± 1.241.1 ± 1.2
Reasoning LLMgpt-580.3 ± 1.673.6 ± 2.361.1 ± 1.965.3 ± 2.269.3 ± 1.169.3 ± 1.1
Reasoning LLMgpt-5-mini67.6 ± 1.861.5 ± 2.650.3 ± 2.050.2 ± 2.357.0 ± 1.257.0 ± 1.2
Reasoning LLMgpt-5-nano53.9 ± 2.049.6 ± 2.632.4 ± 1.834.6 ± 2.142.2 ± 1.242.2 ± 1.2
Reasoning LLMclaude-opus-4.653.2 ± 2.044.6 ± 2.544.3 ± 1.936.4 ± 2.245.7 ± 1.245.7 ± 1.2

Table 3 的核心信息不是某个模型比另一个高几个点,而是分层非常剧烈。gemini-3.1-pro-preview 的 Micro Avg 为 78.4,gpt-5 为 69.3,而 ministral-3B 只有 4.4;仅从表中数字看,首尾差值达到 74.0 个百分点。更值得注意的是 domain 不均衡:gemini-3.1-pro-preview 在 Algebra 上为 83.7,Number Theory 上为 82.2,但 Geometry 降至 74.6,Discrete Math 降至 75.6;DeepSeek-V3.2 的 Algebra 为 51.6,Geometry 只有 32.2。这说明即便 frontier reasoning models 在符号代数和数论上进步很大,几何图形推理与离散结构搜索仍是瓶颈。

Appendix D 的 Table 9 与 Table 10 进一步给出 sensitivity 证据。Table 9 显示 gemini-3.1-pro-preview 在 text+images 子集上达到 85.1,高于 full set 的 78.4;gpt-5 的 text+images 为 72.0,也高于 full set 的 69.3。Table 10 显示跨语言结果并不均匀:gemini-3.1-pro 在 Chinese 上为 64.2,而在 English 上为 77.4;DeepSeek-R1 在 Chinese 上仅为 7.3,English 上为 35.8。这组数字意味着 benchmark 的 multilingual 和 multimodal 设计不是装饰,而会真实影响排序和绝对分数。

检索结果:Top-1 几乎失败,问题不在找不到,而在找错

Table 4 报告 MathNet-Retrieve 上的 Recall@1 和 Recall@5。数值如下:

模型代数 R@1代数 R@5数论 R@1数论 R@5几何 R@1几何 R@5离散 R@1离散 R@5全部 R@1全部 R@5
all-mpnet-base-v24.5473.064.6782.544.3774.764.2575.383.7857.70
multi-qa-mpnet-base-dot-v14.0069.403.7380.763.8871.733.9873.403.2755.08
cohere-embed-v4.02.7359.852.6768.852.3559.872.7863.402.2444.81
qwen3-embedding-4B5.2478.744.6286.435.6079.055.9681.504.9664.95
gemini-embedding-0015.5081.624.9587.435.4981.865.3582.804.8368.88
text-embedding-ada-0022.0554.942.2263.352.1655.072.7157.511.9442.02
text-embedding-3-small2.1047.471.8954.622.1047.612.8450.121.9835.49
text-embedding-3-large3.1968.182.7375.253.2068.183.3569.522.7454.23

Table 4 揭示出一个非常尖锐的落差:最强的两个 embedding 模型在 All R@1 上也只有 4.96 和 4.83,几乎相当于随机猜测量级;但 All R@5 上升到 64.95 和 68.88。这说明等价题并非完全无法进入 top 候选,而是被大量 hard negatives 挤压到 1 名之后。论文正文还称 Recall@10 在多个领域超过 80,且 gemini-embedding-001 的 Recall@10 为 83.79。这个现象比单纯低分更有诊断价值:embedding 模型具备某种“语义附近”的能力,但 top-1 决策极易受表层符号影响。

失败机制在 Section 4.3.2 和 Figure 6 中解释得比较清楚。Figure 6 展示了等价题与 near-miss hard negatives 的 cosine similarity distribution。论文文字指出 non-equivalent pairs 有时比 equivalent pairs 获得更高 similarity,这意味着 embedding 空间里的距离排序与数学等价排序不一致。模型可能把包含相同关键词、相似句式和接近公式的题目误判为更相关,而对真正只做了变量重命名或代数变形的题目排序靠后。

Cosine similarity distributions show equivalent problems and hard negatives overlap across embedding models

这组证据对 embedding 训练提出了具体要求。若要提升 Recall@1,最直接的路线不是增加普通 contrastive negatives,而是增加数学 hard negatives:变量重命名不变、结构不变但符号微扰、局部表达式相似但全局不变量不同。MATHNET-Retrieve 已经提供了这种 quadruplet 结构,但论文没有训练新的 math-aware embedding,而是把缺口留给社区。

RAG 结果:有效上下文能提升,但嵌入检索不稳定

Table 5 报告 MathNet-RAG 上 Retrieval-Augmented Problem Solving 的结果,使用 35 problems,同时给出 human grading 和 LLM grading:

模型Human ZeroHuman Embed-RAGHuman Expert-RAGLLM ZeroLLM Embed-RAGLLM Expert-RAG
DeepSeek-V3.2-Speciale84.8 ± 6.189.5 ± 5.297.3 ± 2.782.2 ± 6.587.9 ± 5.589.0 ± 5.3
Claude-4.5-Opus46.8 ± 8.455.5 ± 8.452.4 ± 8.446.0 ± 8.450.3 ± 8.556.4 ± 8.4
oLMO-3-Think45.2 ± 8.454.6 ± 8.447.6 ± 8.449.5 ± 8.545.6 ± 8.451.1 ± 8.4
Grok-4.1-Fast75.4 ± 7.383.8 ± 6.283.2 ± 6.373.1 ± 7.567.7 ± 7.969.1 ± 7.8
Gemini-3-Pro89.1 ± 5.392.9 ± 4.387.5 ± 5.673.2 ± 7.570.5 ± 7.776.4 ± 7.2
GPT-576.8 ± 7.175.2 ± 7.386.6 ± 5.887.1 ± 5.781.8 ± 6.585.8 ± 5.9
Phi-4-Reasoning Plus15.1 ± 6.114.3 ± 5.916.7 ± 6.324.1 ± 7.219.6 ± 6.730.0 ± 7.7

Table 5 的主结论是:Expert-RAG 是最强的整体设置,但提升并不单调。DeepSeek-V3.2-Speciale 从 Human Zero-shot 的 84.8 上升到 Human Expert-RAG 的 97.3,差值约 12.5 个百分点;GPT-5 从 76.8 上升到 86.6,也表现出明显的专家上下文收益。与此同时,Gemini-3-Pro 在 Human grading 下 Embed-RAG 为 92.9,高于 Expert-RAG 的 87.5;GPT-5 在 Human grading 下 Embed-RAG 为 75.2,甚至低于 Zero-shot 的 76.8。这说明 retrieved context 如果与 target 不真正结构对齐,可能引入噪声。

LLM grading 和 human grading 的差异进一步说明结论强度有限。Table 11 比较了 LLaMA-4、DeepSeek-V3、GPT-4.1、GPT-4o 四个 graders 与 human expert grading。例如 gemini-3-pro-preview 的 Human Zero-shot 为 89.1,而 LLM Avg 为 73.1;gpt-5 的 Human Zero-shot 为 76.8,而 LLM Avg 为 87.1。不同 grader 对同一 solver 的打分可相差十几个百分点。论文没有提供所有 solver 在全部 domain 和全部语言上的完整 LLM grader 表,但 Table 11 足以提醒读者:MathNet-RAG 的模型排名受到 grader 选择影响。

证据质量方面,Table 4 支撑的 retrieval 失败较为稳健,因为它覆盖 10,000 anchors 和多个 domain,且 Recall@1 与 Recall@5 的落差符合 Figure 6 的分布解释。Table 3 的 problem solving 结果也覆盖 6,400 道测试题,规模足够。相较之下,Table 5 的 RAG 结论只基于 35 problems,standard error 普遍在 5 到 8 个百分点左右,某些模型提升幅度与误差范围同量级。因此 Expert-RAG 的优势应理解为机制性证据,而不是严格显著的统计效应。论文也没有给出 formula-aware baseline 在 Section 4 主结果中的完整表格,但 Discussion 提到 structured representations 对 retrieval 重要,这留下了后续对照空间。

深度洞察与总结

MATHNET 最重要的学术贡献是把“数学检索”与“数学生成”从同一个含糊的 reasoning 标签下拆出来。生成模型可以在答案上表现出强推理,但 embedding 模型仍无法稳定识别等价类;反过来,RAG 实验表明,只有当检索到的上下文真正属于 Structural Resonance 层级时,solver 才会获得一致收益。这让后续研究有了一个更清晰的分工:solver 负责利用上下文,retriever 负责提供上下文,benchmark 负责测量两者是否共享数学结构。

它的局限性同样具体。第一,MathNet-RAG 的 35 对专家题非常小,Table 5 中多个结论受 standard error 限制,不能把某个模型在 Expert-RAG 的排名视为稳定 leader。第二,MathNet-Retrieve 的 synthetic positives 和 hard negatives 由 GPT-5 生成,论文说明有人类专家 review similarity labels,但没有给出人工复核样本量、错误率或标注者一致性,因此 equivalence gold label 的噪声仍需要后续量化。第三,Section 4 的主结果没有完整报告公式感知 baseline 或符号图检索 baseline,而 Discussion 又强调 structured representations 的关键作用,这使论文的诊断比解决方案更有力。

未来最有技术含量的方向不是继续堆更大的 math dataset,而是把 MATHNET-Retrieve 的四元组结构用于训练 math-aware embeddings:用 anchor、positive 和 hard negatives 构造 contrastive objective,让 embedding 学习变量重命名不变性、代数变形等价性和 near-miss 可分性。另一个方向是把 MathNet-RAG 的 taxonomy 从 35 对扩展到更大规模,并加入不同 Invariance 与 Resonance 层级的 controlled retrieval,以判断 solver 提升究竟来自 example answer,还是来自 structural analogy。MATHNET 真正打开的问题不是“模型会不会解题”,而是“模型能否在数学对象之间建立可检索、可迁移、可验证的等价关系”。

发现相似论文

试试这些示例

  • 查找 2025 年以来解决 Math-Aware Retrieval 或数学等价检索的其他最新论文。
  • MATHNET 中 Math-Aware Retrieval 的 hard negatives 与 formula-aware indexing 在数学检索评测上有哪些不同?
  • 有哪些研究把 MATHNET 的 Retrieval-Augmented Problem Solving 思路应用到定理证明、代码等价检索或科学问题检索?
目录
MATHNET:当 Olympiad 解题不再等于数学检索
1. TL;DR
2. 背景定位
3. 问题与动机
4. 核心章节:MATHNET 作为 benchmark 的三段式骨架
4.1. 评测目标与设计:从答案正确性到数学等价类
4.2. 指标的形式化定义:准确率、Recall@k 与检索质量边界
4.3. 数据构造与质量控制:官方文档、三段式提取与人工核验
5. 实验与证据
5.1. 主结果:解题能力快速进步,但几何与离散仍难
5.2. 检索结果:Top-1 几乎失败,问题不在找不到,而在找错
5.3. RAG 结果:有效上下文能提升,但嵌入检索不稳定
6. 深度洞察与总结