[DeepMind 新突破] Aletheia:自主攻克 FirstProof 研究级数学挑战
Aletheia tackles FirstProof autonomously
本文介绍了谷歌 DeepMind 开发的数学研究智能体 Aletheia,其搭载 Gemini 3 Deep Think 模型,通过自主推理成功解决了 FirstProof 挑战赛中 10 道研究级数学难题中的 6 道(P2, P5, P7, P8, P9, P10),展示了 AI 在处理前沿数学证明方面的重大突破。
TL;DR
谷歌 DeepMind 发布报告,展示了其数学 AI 智能体 Aletheia(基于 Gemini 3 Deep Think)在处理职业数学研究课题上的惊人表现。在备受瞩目的 FirstProof 挑战赛中,Aletheia 在没有任何人类提示的情况下,自主产出了 6 篇符合学术出版标准的数学证明。这不仅仅是解题,更是 AI 首次在完全未知的、研究级的数学坐标系中证明了自己的生存能力。
挑战背景:什么是 FirstProof?
FirstProof 不同于以往的数学竞赛(如 IMO)测试集。它是由 Abouzaid 等多位顶级数学家在 2026 年 2 月发起的,包含 10 个在他们实际研究工作中自然产生的问题。这些问题不仅从未在互联网上出现过(防止 Data Contamination),而且其难度达到了可以直接作为期刊论文 Lemma 的水平。
核心动机:为什么要追求“绝对自主”?
在 AI 辅助证明领域,一直存在“人类专家在回路(Human-in-the-Loop)”的争议。如果人类不断给 AI 提示解题方向,那成果究竟属于谁? Aletheia 的核心 Insight 在于:可靠性优于广度。
- 自过滤机制 (Self-filtering):宁可对 4 道难题保持沉默(P1, P3, P4, P6),也不产生带有幻觉的错误证明。
- 架构驱动:利用 Agent 架构进行大规模推理搜索,并由一个严苛的“验证 Prompt”来确信证明的逻辑链条。
方法论详解:从推理到 LaTeX 的自动管道
Aletheia 的管道分为两个阶段:
- 大规模推理搜索:Generator 尝试多种数学路径,即使在面临 P7 这种曾经是书中“悬而未决”的问题时,也能通过极高的推理算力进行路径探索。
- 严苛验证与提取:使用一个名为“验证者”的 Sub-agent,扮演学术审稿人的角色。它会对候选证明进行逐行扫描,寻找逻辑谬误或不严谨的引用,只有通过审查的内容才会被转化为高质量的 LaTeX 代码。
图 1:Aletheia 的全自动作业流程:从原生问题文本到 LaTeX 证明输出。
实验战绩:超越人类直觉的解法
在 10 道题目中,Aletheia 成功拿下了 6 道。其中最令人称道的是 Problem 10:
- 背景:处理 CP 张量分解中的 RKHS 约束问题。
- 成就:Aletheia 不仅给出了正确证明,还自主发现了一个预计算步骤,将计算复杂度从官方解法的 依赖优化到了更优的理论上限。
- 推理代价:如图 2 所示,对于难题 P7,其消耗的推理成本(Inference Cost)比以往最难的任务还要高出一个数量级,这再次印证了“推理侧 Scaling Law”是通往超级智能的必经之路。
图 2:Aletheia 在各问题上的推理算力投入,P7 的复杂性可见一斑。
深度洞察:AI 会取代数学家吗?
尽管 Aletheia 表现强劲,但实验也暴露了其局限性:
- 主观性难题:在 P8 及其证明中,专家们对于“什么是可发表的严谨度”仍存在分歧,这意味着 AI 在理解“数学审美”和“含糊性处理”上还有路要走。
- 长链条崩溃:对于未解决的 4 道题,模型往往陷入计算量爆炸或无法形成闭环。
总结 (Takeaway): Aletheia 的成功标志着 AI 数学从“模仿者”向“贡献者”的转变。对于未来的产品开发,这启示我们:通过 Agent 脚手架 + 严谨验证层 + 推理算力堆叠,AI 可以在法律、金融、科研等对“无幻觉”有极高要求的严肃领域探索更深层级的自动化。
本文基于 arXiv 报告重构。原作者:Tony Feng, Thang Luong 等 (Google DeepMind)。
