MATHNET:重塑全球奥数基准,揭示 AI 在数学结构感知上的短板

MATHNET: A GLOBAL MULTIMODAL BENCHMARK FOR MATHEMATICAL REASONING AND RETRIEVAL

2026-04-20
Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei, Sultan Albarakati, William Freeman, Antonio Torralba, Kaust, Humain
总结
问题
方法
结果
要点

本文推出了 MATHNET,这是一个大规模、高质量的多模态多语言奥数竞赛基准测试集。它包含来自 47 个国家、跨越 40 年的 30,676 道专家级数学题及解决方案,旨在评估模型在数学推理(Problem Solving)和数学感知的检索(Math-Aware Retrieval)方面的能力。

TL;DR

近日,来自 MIT 和 KAUST 的研究团队发布了 MATHNET,这是目前最大规模、最纯净的官方奥数题库。它不仅涵盖了 3 万余道中、英、俄等 17 种语言的竞赛真题,更首次提出了**“数学感知的检索”**任务。实验惊人地发现:即便能解出复杂难题的 GPT-5 和 Gemini,在识别“两道题是否逻辑等效”时竟然屡屡翻车。

背景定位:从社区采集到官方真传

过去我们依赖 AoPS 等社区平台数据,虽然量大但噪声多。MATHNET 直接溯源至全球 47 个国家的官方竞赛手册(包括中国 TST、俄罗斯奥数等)。这不仅仅是数据的扩充,更是从“民间流传版”向“官方权威版”的学术迁徙。

痛点深挖:会做题不代表“懂”题

目前的 LLM 在数学领域面临两个核心尴尬:

  1. 多模态与多语言缺失:许多几何题依赖复杂的图表,以往的 OCR 往往丢失信息。
  2. 检索的“色盲”症:当前的 Embedding 模型(向量模型)极易被表面文字欺骗。例如,检索模型会将“求解 ”判定为与“求解 ”极其相似(因为字母一样),而忽略了两者在拓扑和代数结构上的天壤之别。

方法论详解:数学相似性的三层境界

作者不仅是堆砌题目,还为数学检索定义了严密的分类法(Taxonomy),这对于未来开发数学专用向量模型至关重要:

  • 不变性 (Invariance):符号不同但结构一致(如变量名变换 )。
  • 共鸣 (Resonance):题目不同但解题思路/引理高度一致(如利用同一个结构削减技巧)。
  • 亲和性 (Affinity):仅属于同一数学范畴(如都是数论)。

模型架构与处理流程 图注:MATHNET 的三阶段提取流水线,结合了 dots-ocr 解析、LLM 分割以及基于视觉比对的专家验证。

实验与结果:前沿模型的“滑铁卢”

在 MathNet-Solve 任务(解题)中,Gemini-3.1-Pro 以 78.4% 的准确率领跑,GPT-5 紧随其后。然而,一旦进入几何 (Geometry) 领域,所有模型的分数均大幅缩水,显示了 LMM 在空间逻辑上的瓶颈。

最为惨烈的是检索任务(Math-Aware Retrieval)。如表 4 所示,最强的向量模型在 Recall@1 上的表现仅为 5% 左右。这意味着,如果你给 AI 一道奥数题,让它从库里找一道一模一样的“变式题”,它的成功率竟然不到十分之一!

检索性能对比表 图注:即便最先进的向量模型也无法有效区分数学等效性,Recall@1 极低。

而在 RAG(检索增强生成)方面,研究发现:质量比数量重要

  • 使用通用的 Embedding 检索结果作为参考(Embed-RAG),效果往往不稳定甚至不如不加,因为检索回来的“相似题”可能是带有误导性的“硬负样本”。
  • 使用专家标注的对偶题(Expert-RAG),DeepSeek-V3.2-Speciale 的准确率飙升至 97.3%。

深度洞察:通往符号逻辑的下一步

MATHNET 的出现向学术界发出了一个信噪:解决数学问题不能只靠 Token 的统计预测。

现有的 Embedding 模型完全是逻辑“色盲”,无法识别符号背后的物理含义。未来的突破口可能不在于更大参数量的 LLM,而在于如何训练具有**“符号一致性感知”**的嵌入模型,让 AI 真正能通过“类比学习”来攻克未知的数学难题。

局限性与展望

虽然 MATHNET 覆盖了 17 种语言,但在小语种上的 OCR 精度仍有提升空间。此外,对于完全“零文字”的纯图形几何推理,目前的模型依然显得力不从心。这正是下一代多模态推理模型的主战场。

发现相似论文

试试这些示例

  • 查找并对比最近一年内发布的其他针对奥林匹克数学竞赛(Olympiad-level)的多模态大模型基准测试及其性能差异。
  • 探究“数学感知检索(Math-Aware Retrieval)”在数学定理证明或辅助科研中的最新进展,是否有专门优化符号结构的嵌入方法?
  • 调研将检索增强生成(RAG)应用于数学推理时,如何通过过滤“硬负样本(Hard Negatives)”来减少推理噪声的研究。
目录
MATHNET:重塑全球奥数基准,揭示 AI 在数学结构感知上的短板
1. TL;DR
2. 背景定位:从社区采集到官方真传
3. 痛点深挖:会做题不代表“懂”题
4. 方法论详解:数学相似性的三层境界
5. 实验与结果:前沿模型的“滑铁卢”
6. 深度洞察:通往符号逻辑的下一步
6.1. 局限性与展望