如今,大语言模型研究代理能实际完成哪些任务?
它们能够自主执行完整的研究流程。例如,Agent Laboratory 系统接收人类提出的想法后,会依次完成文献综述、实验和报告撰写三个阶段,最终生成代码库和研究论文[1]。当采用顶级大语言模型(o1-preview)驱动时,其生成的机器学习代码在性能上超越了现有方法,达到了最先进水平[1]。这意味着研究人员可以将项目中劳动密集型的环节交由系统处理,从而专注于创造性构思。
它们还能处理医学领域专业且数据密集的任务。AI-HOPE让临床医生能用日常英语提出研究问题,随后自主分析临床和基因组数据,找出具有统计学显著性的关联——例如,它独立发现TP53突变在晚期结直肠癌中富集,且KRAS突变预示接受FOLFOX治疗的患者生存期更差,这两项发现均与现有文献一致[3]。这消除了领域专家在编程方面的障碍。
它们比现有方法好多少?
在标准化基准测试中,最优秀的智能体已大幅超越强基线模型。AIRA_2系统在MLE-bench-30测试中,24小时内的平均百分位排名达到81.5%,而最强基线模型仅为72.7%——提升了近11个百分点[2]。在另一项基准测试中,该系统在20个多样化研究任务中有6项超越了人类现有最佳水平[2]。这些进步源于架构层面的改进:异步多GPU执行、可靠的评估协议,以及能够动态调试自身行为的智能体[2]。
然而,情况并非一边倒。在评估智能体收集整理研究调查信息的ResearchArena基准测试中,当前基于大语言模型的方法实际表现反而不如更简单的关键词检索方法[5]。仅最新的推理模型(如DeepSeek-R1)在零样本任务中展现出略微优势[5]。这表明,尽管智能体在执行既定任务时表现出色,但在研究初期开放式的探索阶段——即如何精准定位相关论文——仍存在明显短板。
有哪些注意事项和风险?
人类的参与仍然至关重要。在Agent Laboratory中,每个阶段提供的人类反馈显著提升了最终论文的整体质量[1]。该系统被设计为研究助手而非替代品——与以往的自主方法相比,它可将成本降低84%,但在人类引导下才能发挥最佳效果[1]。
此外,还存在限制性能的结构性瓶颈。早期的智能体面临三个问题:单GPU执行限制了吞吐量,基于验证的选择导致长搜索中的过拟合,以及固定的单轮LLM操作符限制了性能上限[2]。AIRA_2系统通过特定的架构选择解决了这些问题,但需要此类修复的事实表明,当前的智能体并非即插即用[2]。
伦理问题真实存在且尚未解决。一篇关于眼科研究中自主型人工智能的综述指出了署名归属(当智能体撰写论文时,谁应获得荣誉?)、数据隐私、偏见及问责制等问题[4]。该综述还提到,人工智能生成的稿件已通过同行评审,这引发了对科学记录完整性的质疑[4]。在广泛信任这些工具之前,明确的治理框架和验证标准至关重要。
关于这些来源
该答案基于5篇经同行评审的研究——发表于2025年至2026年,其中5篇为2024年及以后发表——这些研究是从6篇通过质量筛选的文献中选出的最具相关性的成果,而该6篇文献又源自从超过5亿篇论文的数据库中检索到的50篇论文。
本文引用的文献
Agent Laboratory:使用大语言模型代理作为研究助手
Agent Laboratory 是一个自主式大语言模型框架,能够完成从文献综述、实验到报告撰写的完整研究流程,相比以往的自主方法可降低84%的研究成本;在每个阶段引入人类反馈能显著提升输出质量。
AIRA_2:突破AI研究智能体的瓶颈
AIRA_2 解决了AI研究智能体中的三个结构性瓶颈(同步执行、泛化差距、固定算子),在MLE-bench-30上取得了81.5%的平均百分位排名,优于最强基线(72.7%),并在20个研究任务中的6个上超越了人类现有最佳水平。
AI-HOPE:一种基于人工智能的对话代理,用于在精准医学研究中增强临床与基因组数据的整合。
AI-HOPE是一款基于大语言模型的对话式智能体,能够自主整合临床与基因组数据以支持精准医疗;它在无预设假设的情况下,独立复现了已知研究成果(如晚期结直肠癌中TP53突变富集、KRAS突变与较差生存率的相关性)。
迈向自主发现:智能体AI与眼科研究的未来。
一篇关于眼科中自主型人工智能的综述指出,这些系统能够自主完成同行评审、假设生成、系统综述和实验设计,但也引发了关于作者署名、数据隐私、偏见及问责制等方面的伦理担忧。
ResearchArena:评估大型语言模型作为研究代理收集与整理信息能力的基准测试
ResearchArena在学术综述任务(信息发现、筛选与组织)上对大型语言模型进行了基准测试,结果发现当前基于LLM的方法表现不如简单的关键词检索,不过像DeepSeek-R1这样的推理模型在零样本任务中表现略优。
