AI是模式发现者,而非真理机器
AI在数学中最富成效的角色,是提出模式和猜想,而非给出完整的证明或结论。2021年发表在《自然》杂志上的一篇论文证明了这一点:研究者利用机器学习,引导数学家走向纽结理论和群论中的新猜想,最终在开放问题上取得了有意义的进展。AI并未产出最终定理,而是帮助人类看到了可能被忽略的联系。这意味着人类数学家依然是真理的裁决者,将AI用作直觉的工具,而非权威论断的来源。
相比之下,2023年的一项研究显示,语言模型(GPT-3)能在大约一小时内生成一篇完全虚构的神经外科文章,其外观逼真,包含标准章节和参考文献。该文章骗过了普通读者,但专家审阅者发现了语义上的不准确和错误,尤其是在参考文献部分。这凸显了AI生成的内容可能极具说服力却暗藏细微错误,因此不经专家审查就依赖它是危险的。
验证与证伪是不可或缺的安全保障
当AI确实提出某个论断时,必须对其进行核查——如果它错了,就需要明确地予以驳斥。2025年一项涉及1200多名参与者的研究发现,在接触错误信息后进行驳斥能有效削弱其对推理的影响,而仅靠免责声明或预先警告(接种式预防)则效果有限。事实上,只有将接种式预防与驳斥相结合,才能完全消除错误信息的影响。就数学研究而言,这意味着当AI提出某个结果时,你应主动寻找反例或错误;如果发现了问题,就要清晰记录下来,而不是置之不理。
这与2023年的一项发现相符,即AI生成的文章包含专家仔细检查后能发现的特定错误。教训在于,验证并非可有可无,而是必要步骤。在实践中,这可能意味着将AI建议的证明通过形式化验证系统运行、手动核对参考文献,并让第二位数学家审阅工作。2023年《自然》杂志关于AI在数学中应用的文章也指出,AI可以协助验证人类撰写的成果,这表明了一种AI与人类相互检查的协作方式。
构建人机协同的验证框架
最有前景的方法是将人工智能嵌入一个由人类控制每个阶段的工作流程中,正如MyCrunchGPT所展示的那样——这是一个2023年的框架,利用大型语言模型来协调科学机器学习任务。在该框架中,AI协助进行数据预处理、代码生成和分析,但用户(人类)在每一步都会验证结果。论文强调“验证阶段”至关重要,表明AI能够加速研究进程,同时不会取消人类的监督。
这一框架与2023年那项伪造论文研究形成鲜明对比——在那项研究中,人工智能被用来生成整篇论文,且未经人工验证,最终产出了看似合理但存在缺陷的结果。区别不在于人工智能的能力,而在于围绕它所建立的流程。通过在每一个阶段要求人工审批,你可以及早发现错误,防止虚假主张进入科学记录。2025年那项研究发现,辟谣在与预先警告相结合时效果最佳,这也支持了这一观点:采取主动姿态——预期错误并加以核查——比事后应对更为有效。
关于这些来源
本回答基于5项同行评审研究——发表于2021年至2025年间,其中1项为2024年或之后发表,4项发表于Q1期刊,合计被引704次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的42篇文献。
本文引用的文献
以预先来源质疑和辟谣来对抗人工智能生成的虚假信息
在两项涉及1,223名参与者的实验中,接触错误信息后再进行辟谣,能减少其对推理的影响;而仅靠事先警告(预防性接种)则无效;只有将两者结合,才能彻底消除其影响。
人工智能能够生成欺诈性但外观逼真的科学医学文章:潘多拉魔盒已被打开
一项概念验证研究使用GPT-3在大约一小时内生成了一篇1992字的虚假神经外科文章,其中包含17条引文;该文章看似真实,但存在语义错误和参考文献错误,专家可以识别出来。
MYCRUNCHGPT:一种大语言模型辅助的科学机器学习框架
MyCrunchGPT是一个将ChatGPT集成到科学机器学习工作流中的框架,它展示了人工智能能够协助完成翼型优化和流场分析等任务,但同时也强调验证阶段对于确保正确性至关重要。
AI将如何改变数学?聊天机器人的兴起引发讨论
2023年《自然》新闻的一篇文章报道称,数学家们正在探索利用人工智能来验证人类撰写的成果,并提出新的问题解决方法,这表明数学领域对人工智能的采用正在增长,但仍持谨慎态度。
通过人工智能引导人类直觉,推动数学发展
2021年《自然》杂志的一篇论文提出了一种机器学习引导的框架,帮助数学家发现了纽结理论和群论中的新猜想与定理,表明人工智能能够引导人类直觉,而无需取代人类的判断。
