MATHNET:重塑全球奥数基准,揭示 AI 在数学结构感知上的短板
MATHNET: A GLOBAL MULTIMODAL BENCHMARK FOR MATHEMATICAL REASONING AND RETRIEVAL
本文推出了 MATHNET,这是一个大规模、高质量的多模态多语言奥数竞赛基准测试集。它包含来自 47 个国家、跨越 40 年的 30,676 道专家级数学题及解决方案,旨在评估模型在数学推理(Problem Solving)和数学感知的检索(Math-Aware Retrieval)方面的能力。
TL;DR
近日,来自 MIT 和 KAUST 的研究团队发布了 MATHNET,这是目前最大规模、最纯净的官方奥数题库。它不仅涵盖了 3 万余道中、英、俄等 17 种语言的竞赛真题,更首次提出了**“数学感知的检索”**任务。实验惊人地发现:即便能解出复杂难题的 GPT-5 和 Gemini,在识别“两道题是否逻辑等效”时竟然屡屡翻车。
背景定位:从社区采集到官方真传
过去我们依赖 AoPS 等社区平台数据,虽然量大但噪声多。MATHNET 直接溯源至全球 47 个国家的官方竞赛手册(包括中国 TST、俄罗斯奥数等)。这不仅仅是数据的扩充,更是从“民间流传版”向“官方权威版”的学术迁徙。
痛点深挖:会做题不代表“懂”题
目前的 LLM 在数学领域面临两个核心尴尬:
- 多模态与多语言缺失:许多几何题依赖复杂的图表,以往的 OCR 往往丢失信息。
- 检索的“色盲”症:当前的 Embedding 模型(向量模型)极易被表面文字欺骗。例如,检索模型会将“求解 ”判定为与“求解 ”极其相似(因为字母一样),而忽略了两者在拓扑和代数结构上的天壤之别。
方法论详解:数学相似性的三层境界
作者不仅是堆砌题目,还为数学检索定义了严密的分类法(Taxonomy),这对于未来开发数学专用向量模型至关重要:
- 不变性 (Invariance):符号不同但结构一致(如变量名变换 )。
- 共鸣 (Resonance):题目不同但解题思路/引理高度一致(如利用同一个结构削减技巧)。
- 亲和性 (Affinity):仅属于同一数学范畴(如都是数论)。
图注:MATHNET 的三阶段提取流水线,结合了 dots-ocr 解析、LLM 分割以及基于视觉比对的专家验证。
实验与结果:前沿模型的“滑铁卢”
在 MathNet-Solve 任务(解题)中,Gemini-3.1-Pro 以 78.4% 的准确率领跑,GPT-5 紧随其后。然而,一旦进入几何 (Geometry) 领域,所有模型的分数均大幅缩水,显示了 LMM 在空间逻辑上的瓶颈。
最为惨烈的是检索任务(Math-Aware Retrieval)。如表 4 所示,最强的向量模型在 Recall@1 上的表现仅为 5% 左右。这意味着,如果你给 AI 一道奥数题,让它从库里找一道一模一样的“变式题”,它的成功率竟然不到十分之一!
图注:即便最先进的向量模型也无法有效区分数学等效性,Recall@1 极低。
而在 RAG(检索增强生成)方面,研究发现:质量比数量重要。
- 使用通用的 Embedding 检索结果作为参考(Embed-RAG),效果往往不稳定甚至不如不加,因为检索回来的“相似题”可能是带有误导性的“硬负样本”。
- 使用专家标注的对偶题(Expert-RAG),DeepSeek-V3.2-Speciale 的准确率飙升至 97.3%。
深度洞察:通往符号逻辑的下一步
MATHNET 的出现向学术界发出了一个信噪:解决数学问题不能只靠 Token 的统计预测。
现有的 Embedding 模型完全是逻辑“色盲”,无法识别符号背后的物理含义。未来的突破口可能不在于更大参数量的 LLM,而在于如何训练具有**“符号一致性感知”**的嵌入模型,让 AI 真正能通过“类比学习”来攻克未知的数学难题。
局限性与展望
虽然 MATHNET 覆盖了 17 种语言,但在小语种上的 OCR 精度仍有提升空间。此外,对于完全“零文字”的纯图形几何推理,目前的模型依然显得力不从心。这正是下一代多模态推理模型的主战场。
