WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

使用工具的语言模型是否有足够的现实世界评估证据?

使用工具的LLM在编程和化学领域展现出较强的现实应用证据,但在医学领域效果参差不齐。其表现因任务类型和模型不同而存在差异。

直接答案

确实,关于工具使用型语言模型的现实评估证据正在增多,但不同领域之间分布不均。在软件工程领域,一项涵盖1684个API函数的大型研究发现,基于LLM的测试生成器实现了70.2%的中位数语句覆盖率,比传统工具高出近20个百分点[1]。在化学领域,一个配备18种专家工具的LLM智能体成功规划并执行了多种化合物的合成,包括一种新型发色团[4]。然而,在医学诊断领域,结果则喜忧参半:一项急诊医学研究发现,顶级模型的表现与人类专家相当(平均评分3.63 vs. 3.67,p=0.62)[3],而一项宫颈细胞学研究则发现LLM在异常病例中不可靠,部分灵敏度低至6%[2]。总体而言,编码和科学任务的证据最为充分,而临床应用的证据则较弱且波动较大。

7篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

工具型大语言模型在哪些领域的现实证据最为充分?

关于工具增强型大语言模型(LLM)最有力的现实证据来自软件工程和科学化学领域。在一项针对1684个JavaScript API函数的大规模评估中,基于LLM的工具TestPilot生成的单元测试实现了70.2%的中位数语句覆盖率和52.8%的分支覆盖率,显著优于当前最先进的传统工具Nessie(分别为51.3%和25.6%)[1]。该研究还发现,92.8%的生成测试与现有测试的相似度不超过50%,这意味着它们确实是全新的,而非复制品。在化学领域,ChemCrow智能体将18个专家设计的工具与GPT-4集成,自主规划并执行了驱虫剂、三种有机催化剂的合成,并指导发现了一种新型发色团,展现了超越基础LLM的新能力[4]。这些结果表明,当LLM配备领域专用工具时,能够在现实任务中带来可衡量、可落地的改进。

工具使用型大语言模型在医疗场景中的表现如何?

医学评估结果呈现出更为复杂的图景,其表现高度依赖于具体任务和模型。在急诊内科领域,一项针对73例真实患者病例的前瞻性研究发现,OpenAI的o1模型平均最终评分为3.63分(满分4分),与人类医生的3.67分(p=0.62)在统计学上无显著差异,且能正确识别所有异常实验室指标(准确率100%)[3]。然而,另外两个模型(Claude-3.5-Sonnet和Llama-3.2-70B)得分明显较低,主要问题出在治疗方案规划环节。在宫颈细胞学方面,一项针对200张图像的研究显示,虽然大语言模型能以较高灵敏度(85.4%-100%)区分正常与异常细胞,但在特定异常类别的识别上表现欠佳:ChatGPT o3仅检测出6%的高级别鳞状上皮内病变和28%的腺癌[2]。研究者据此认为,通用型大语言模型不宜作为该领域的诊断辅助工具。在医学试题编写方面,专家评估者认为100道生成的多选题中仅约半数(50%-57%)无需修改即可直接使用[5]。这些结果凸显出医学应用需要审慎选择任务类型与模型配置。

哪些因素决定了使用工具的LLM效果更好或更差?

多个因素持续影响着实际应用表现。首先,模型规模与训练数据至关重要:在测试用例生成研究中,较大的GPT-3.5-turbo实现了70.2%的覆盖率,而较小的StarCoder仅达到54.0%[1]。其次,提示工程技术尤为关键:一项针对开源大语言模型在医学问题上的研究发现,先进的提示策略(如思维链)使最佳模型的准确率从74%(基础提示)提升至79%,甚至超越了GPT-3.5[7]。第三,具体工具集成方式影响显著:在化学领域,18个专业工具使ChemCrow能够完成基础大语言模型无法胜任的任务[4]。第四,用户体验研究揭示了期望与现实之间的差距:一项针对24名程序员使用Copilot的研究显示,多数人倾向于在日常任务中使用它,因其能提供有用的起点,但他们在理解、编辑和调试生成代码时遇到困难,这阻碍了任务完成[6]。这表明,即使使用工具的大语言模型能产出正确结果,可用性挑战依然存在。

关于这些来源

该回答基于7篇经同行评审的研究——发表于2022年至2025年间,其中5篇为2024年及以后发表,2篇发表于Q1期刊,累计被引用1170次——这些研究是从8篇通过质量筛选的研究中选出的最具相关性的成果,而8篇研究又源自从超过5亿篇论文的数据库中检索到的58篇文献。

本文引用的文献

1

使用大语言模型进行自动化单元测试生成的实证评估

在一项针对1684个JavaScript API函数的大规模评估中,基于大语言模型的工具TestPilot实现了70.2%的中位数语句覆盖率和52.8%的分支覆盖率,优于传统工具Nessie(51.3%和25.6%),且生成的测试中有92.8%是新颖的(与现有测试的相似度≤50%)。

2

通用大语言模型在宫颈细胞学诊断支持工具中的评估。

在一项针对200张宫颈细胞学图像的研究中,大语言模型在区分正常与异常方面表现出高灵敏度(85.4%-100%),但在特定异常类别的识别上表现不佳(例如,ChatGPT o3仅检测出6%的高级别鳞状上皮内病变和28%的腺癌)。因此,作者建议不要在此领域将其用作诊断辅助工具。

3

评估大型语言模型与大型推理模型在急诊内科中作为决策支持工具的表现。

在一项针对73个真实急诊病例的前瞻性研究中,OpenAI的o1模型平均最终评分为3.63分(满分4分),与人类医生的3.67分在统计学上无显著差异(p=0.62),并能100%正确识别异常实验室数值,而Claude-3.5-Sonnet和Llama-3.2-70B的得分则显著较低。

4

为大型语言模型增强化学工具

ChemCrow智能体将18个专家设计的工具与GPT-4相结合,自主规划并执行了驱虫剂、三种有机催化剂的合成,还指导了一种新型发色团的发现,展现了超越基础大语言模型的新能力。

5

生成式语言模型工具在编写考试题目中的评估。

在一项针对ChatGPT 3.5为药学课程生成的100道选择题的评估中,专家评审认为仅有50%至57%的题目无需修改即可使用,最常见的问题是存在多个正确答案。

6

期望与体验:评估大型语言模型驱动的代码生成工具的可用性

在一项针对24名程序员的用户研究中,Copilot并未显著提升任务完成时间或成功率,但大多数参与者仍偏好使用它,因为它提供了有用的起点;不过,他们在理解、编辑和调试生成的代码时遇到了困难。

7

使用高级提示技术评估大型语言模型作为医学学习者和临床医生诊断工具的效果。

采用高级提示技术,开源大语言模型(llama-3.1-70b-versatile)在Medscape临床问题中实现了79%的正确回答率,优于GPT-3.5(74%),且高级提示技术优于基础提示技术。