Gemini 挺进数学荒原:Erdős 猜想的半自主发现之路

Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems

2026-01-01
Tony Feng, Trieu Trinh, Garrett Bingham, Jiwon Kang, Shengtong Zhang, Sang-hyun Kim, Kevin Barreto, Carl Schildkraut, Junehyuk Jung, Jaehyeon Seo, Carlo Pagano, Yuri Chervonyi, Dawsen Hwang, Kaiying Hou, Sergei Gukov, Cheng-Chiang Tsai, Hyunwoo Choi, Youngbeom Jin, Wei-Yuan Li, Hao-An Wu, Ruey-An Shiu, Yu-Sheng Shih, Quoc V. Le, Thang Luong
总结
问题
方法
结果
要点
摘要

本文介绍了一项利用 Gemini (Aletheia 智能体) 半自主解决埃尔多斯 (Erdős) 数学猜想的案例研究。研究系统评估了 700 个标记为“开放”的问题,最终解决了 13 个,其中 4 个为自主创新解答,9 个为对现有文献中已解决方案的重新识别。

TL;DR

数学大师保罗·埃尔多斯 (Paul Erdős) 留下了海量的猜想。最近,Google DeepMind 团队利用定制的 Gemini Deep Think 智能体(代号 Aletheia)对 700 个开放问题发起冲锋。结果令人振奋但也发人深省:AI 成功解决了 13 个猜想,但其中大部分属于文献中已被冷落的结论,仅有少数为真正的“自主创新”。

背景定位:这是 AI 在纯数研究领域从“复读机”向“协作者”转变的关键实验,标志着 AI 具备了初步的领域探索能力,同时也揭露了 AI 在数学研究中存在的定义误解与版权隐忧。

痛点深挖:为什么数学发现这么难?

在埃尔多斯的数学遗产中,很多问题被标记为“Open”,并非因为其不可逾越,而是因为它们散落在海量历史文献的角落里,无人问津。

  1. 专家带宽瓶颈:AI 生成证明很快,但有能力验证证明正确性的专家极少。
  2. 定义歧义:Erdős 的许多表述较为随性,AI 容易在忽略语境的情况下得出“正确但无意义”的平凡解(Vacuous Solutions)。
  3. 文献鸿沟:判断一个结论是否真的“原创”比证明过程本身更耗时。

方法论:Aletheia 智能体的筛选机制

为了解决上述痛点,DeepMind 并没有暴力堆砌算力,而是采用了一个混合过滤流程

  1. 自然语言验证器 (NL Verifier):在 Gemini 生成初稿后,由特定的验证模块通过逻辑推演排除明显的错误。这让专家面对的候选方案从 700 个锐减至 212 个。
  2. 领域专家垂直评审:人类专家介入,通过对比文献和跨学科沟通,剔除那些“理解错题意”的方案。

研究流程图

核心突破:独立解决 Erdős-1051

在众多成果中,Erdős-1051 最具代表性。它问:如果一个整数序列 增长极快(满足 ),那么级数 是否一定是无理数?

Aletheia 给出了一个漂亮的证明:

  • 逻辑直觉:通过构造 partial products 和 tails,利用 Mahler 准则证明了该级数无法表示为分母固定的有理数。
  • 成果转化:该证明随后由人类数学家使用 Lean 4 进行了形式化验证,并衍生出了一篇全新的学术论文。

分类统计表

深度洞察:AI 的“潜意识抄袭”

本研究提出了一个极具警示性的概念:潜意识抄袭 (Subconscious Plagiarism)

在解决 Erdős-1089 等问题时,AI 生成的证明与 1981 年的一篇文献极其相似。由于该文献在 AI 的预训练数据集中,即使 AI 在推理日志中没有表现出搜索该行为,它也可能在生成过程中“无意识”地复现了训练数据。

  • 风险:如果人类研究者直接署名发布此类成果,将面临严重的学术诚信挑战。
  • 反思:数学论文的署名权应始终属于人类,因为人类需要承担起“核实文献出处”这一法律与学术责任。

实验总结与启示

  • 现状:AI 已经能熟练处理“学生练习题级别”的数学挑战,并能高效辅助专家缩小搜索空间。
  • 局限性:AI 在理解 Erdős 独特的命名约定和识别隐蔽文献方面仍显笨拙。
  • 未来:数学发现的未来不在于 AI 的全自动化,而在于人类如何利用 AI 的超强联想力来识别那些被历史尘封的连接点。

“数学意义的评估权,目前依然牢牢掌握在人类专家手中。”

发现相似论文

试试这些示例

  • 查找最近其他利用大语言模型或形式化方法(如 Lean)解决 Erdős 猜想或极值图论问题的论文。
  • 哪篇论文最早探讨了学术界中的 AI “潜意识抄袭” (subconscious plagiarism) 现象,本文对该定义有何扩展?
  • 有哪些研究将类似 Aletheia 的半自主 agent 流程应用到了几何学或数论以外的其他科学发现领域?
目录
Gemini 挺进数学荒原:Erdős 猜想的半自主发现之路
1. TL;DR
2. 痛点深挖:为什么数学发现这么难?
3. 方法论:Aletheia 智能体的筛选机制
4. 核心突破:独立解决 Erdős-1051
5. 深度洞察:AI 的“潜意识抄袭”
6. 实验总结与启示