实际上,有多少真实世界的评估证据存在?
证据基础正在扩大,但仍集中在少数领域和场景中。最有力的定量证据来自对LITURAt智能体在科学数据分析中的验证研究,该研究报告了94.8%的内部一致性率(即智能体在重复回答同一问题时给出几乎相同的答案)和91.9%的外部一致性率(即同一问题以不同措辞提出时,智能体仍能给出一致的答案)[1]。在另一项评估中,Agent Laboratory框架生成的机器学习代码在基准测试任务上达到了最先进的性能,且人类专家评审员确认了其研究报告的质量[2]。然而,这些评估均在受控的研究环境中进行,而非在真实、混乱的实际部署场景中。FHIR-AgentEval研究测试了临床大语言模型智能体在43项现实医疗任务中的表现,发现最佳的记忆增强配置仅将任务成功率较基线提升了9.1%,这表明即使在沙盒环境中,收益也相当有限[4]。
各领域的证据也参差不齐。城市交通模拟显示,基于大语言模型的智能体在包含320个个体、为期20天的模拟中产生了涌现性适应模式,但这终究是模拟而非真实城市[7]。在患者教育领域,一种智能体检索增强生成框架改善了12个测试大语言模型中10个模型的阿拉伯语患者教育材料,但评估依赖自动化大语言模型评分和专家评审,而非患者实际疗效[6]。因此,尽管证据真实且积极,但大多来自模拟环境、沙盒测试或专家评分,而非面向终端用户的大规模真实部署。
这些智能体成功的原因是什么,它们又在哪些方面仍有不足?
证据表明,成功的关键在于几个核心机制。首先,智能体协作与团队优化至关重要:DyLAN框架显示,与使用固定智能体组合相比,从候选者中自动选择智能体团队在MMLU基准测试的特定科目上可将准确率提升高达25%[3]。其次,记忆与情境感知能力不可或缺:在FHIR-AgentEval研究中,加入长期记忆持续提升了任务成功率,并减少了工具选择错误等策略性失误[4];而在城市流动性研究中,短期与长期记忆模块共同助力智能体在突发状况下实现更优推理[7]。第三,空间感知能力可增强用户体验:一项关于空间感知型大语言模型智能体的研究发现,当智能体主动反映用户物理环境时,参与者报告了更高的共在感、信任度及自我表露意愿[5]。
但证据也揭示了明显的局限性。模型规模是一大制约因素:在患者教育研究中,只有参数达到270亿或以上的模型,作为验证有害内容的审核代理时准确率才能超过0.80,而像Fanar-7B这样较小的模型在生成内容方面表现良好,但在验证环节却表现不佳[6]。LITURAt研究指出,对于高度变化的查询,模型稳定性仍是一个问题[1]。此外,尽管Agent Laboratory相比之前的自主研究方法将研究成本降低了84%,但其输出质量仍高度依赖于底层大语言模型——o1-preview表现最佳,但并非所有模型都具备同等能力[2]。因此,证据表明成功并非自动实现,而是取决于围绕模型规模、记忆能力、团队构成和任务类型所做的精心设计选择。
我们能否信任评估本身?
这些研究采用的评估方法总体较为严谨,但仍存在重要局限。LITURAt研究结合了GPT-4自动评估与人类专家评分,结果显示80.3%的智能体回答被认定为准确且全面,其中23.5%的回答在完整性和精确性方面获得了最高5分评级[1]。Agent Laboratory研究则邀请多位人类研究人员提供反馈并评估最终论文,增加了人工验证环节[2]。FHIR-AgentEval研究采用确定性验证方法,同时检验智能体响应及其对服务器状态的实际影响——这种评估方式更为有力,因为它不仅核查智能体的表述,更验证其实际执行效果[4]。
然而,仍存在不足。多数评估为短期且针对特定任务——本研究中无一追踪长期部署或对患者预后、科学发现及城市规划的实际影响。患者教育研究指出,自动化大语言模型评估虽有助于排序,但可能无法完全反映临床相关性[6]。空间感知研究则是在受控的咨询对话中测量用户体验,而非真实治疗场景[5]。因此,尽管这些评估在测试范围内可信,但尚不足以证明这些智能体已准备好用于高风险、无监督的真实场景。证据虽令人期待,但仍不完整。
关于这些来源
该回答基于7篇经同行评审的研究——发表于2023年至2026年间,其中6篇为2024年或之后发表,1篇发表于Q1期刊,累计被引用157次——这些研究是从7篇通过质量筛选的文献中选出的最具相关性的成果,而后者又源自一个涵盖超过5亿篇论文的数据库中所检索到的50篇论文。
本文引用的文献
利用大语言模型与基于智能体的系统进行科学数据分析:验证研究
在一项针对科学数据分析工具LITURAt的验证研究中,该系统在重复及改写查询下实现了94.8%的内部一致性和91.9%的外部一致性,经GPT-4评估,80.3%的回答被评定为准确且全面。
Agent Laboratory:使用LLM智能体作为研究助手
Agent Laboratory作为一个覆盖完整研究流程的自主大语言模型框架,将研究成本较此前自主方法降低了84%,并生成了达到顶尖性能的机器学习代码,而各阶段的人工反馈显著提升了输出质量。
动态LLM-智能体网络:一种具备智能体团队优化的LLM-智能体协作框架
用于动态大语言模型智能体协作的DyLAN框架,通过为每项任务自动选择最佳智能体团队,在特定MMLU科目上实现了高达25%的准确率提升,并在代码生成、决策制定及推理任务中均优于固定智能体基线模型。
FHIR-AgentEval:一个用于基准测试临床大语言模型智能体的模块化沙箱,并附带对记忆增强型配置的评估。
在一项针对临床大语言模型代理在43项真实医疗任务中的沙盒评估中,最佳的记忆增强配置将任务成功率较基线提升了9.1%,并持续减少了诸如工具选择错误等策略性失误。
当大语言模型识别你的空间:关于空间感知型大语言模型代理体验的研究。
在一项关于具备空间感知能力的大语言模型代理在咨询对话中的研究中,参与者报告称,当代理主动反映用户的空间情境时,其共在感、信任度和自我表露程度更高,这表明空间意识能够提升社交互动质量。
基于智能体大语言模型的检索增强生成框架的开发与评估:用于循证患者教育。
在测试的12个大语言模型中,有10个模型在采用智能体检索增强生成(ARAG)框架后,生成的阿拉伯语患者教育材料质量得到提升。但只有参数规模≥270亿的模型作为验证智能体时,在拦截有害内容方面达到了超过0.80的准确率。
城市移动中的认知智能体:将大语言模型推理融入多智能体模拟。
在为期20天、涵盖320名个体的城市出行模拟中,具备多时间跨度记忆的大语言模型驱动智能体在稳定与受干扰的交通条件下均展现出涌现性适应模式,其中记忆模块对推理能力的提升起到了促进作用。
