WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

工具型语言模型能否在未来十年重塑AI研究?

使用工具的语言模型在研究领域展现出真正的潜力,但证据表明,其最佳情况下的潜力与当前典型应用之间仍存在差距。

直接答案

是的,使用工具的語言模型將在未來十年重塑人工智慧研究,但這項轉變將是不均衡的,且需要審慎治理。最有力的證據來自2023年的一項研究,該研究發現GPT-3能為12,100篇論文評分,其準確度可與人類評分員媲美,顯示對於結構化、重複性的任務,這些模型已能提供可靠的結果[2]。然而,2024年一項橫跨59國、針對226位研究人員的調查顯示,雖然87.6%的人知道這些工具,但僅有18.7%的人實際在出版物中使用過它們,且多數使用僅限於文法與格式調整[1]。綜觀這些研究,規模較大且量化程度較高的調查一致顯示,使用工具的模型在狹隘且定義明確的任務上表現出色——例如毒性預測[4]或自動評分[2]——但調查數據也揭示了「可能做到的事」與「實際被採用的事」之間存在巨大鴻溝。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

使用工具的语言模型在研究中的实际能力如何?

最具体的证据来自那些重复性强、规则明确且数据丰富的任务。2023年的一项研究使用GPT-3自动评分了TOEFL11语料库中全部12100篇作文——这是一个大型、标准化的非英语母语者写作数据集——结果发现,该模型的评分与人类基准达到了“一定程度的准确性和可靠性”[2]。这意味着,在批改论文、筛选摘要或格式化参考文献等任务中,这些模型已经能够大规模处理工作量,从而将研究人员解放出来,专注于更高层次的思考。同样,2025年的一项研究将GPT-4和GPT-4o与传统机器学习模型在预测分子毒性方面进行了比较,发现这些语言模型在预测骨骼、神经和生殖毒性方面与深度学习方法“不相上下”,甚至还能与分子对接技术结合,识别常见草药中的心脏毒性化合物[4]。关键结论是:当任务定义明确且数据结构化时,使用工具的模型表现能达到或接近专用算法的水平——而且用户无需编写代码。

为什么可能做到的事与实际发生的情况之间存在差距?

尽管技术前景广阔,但实际应用仍远远滞后。2024年一项涵盖59个国家226名医学及辅助医学研究人员的调查显示——这些人均接受过哈佛医学院项目的培训——尽管87.6%的人了解大型语言模型,但仅有18.7%的人在发表论文中使用过它们[1]。即便在这些使用者中,大多数(64.9%)也仅将其用于语法和格式调整,而非核心分析任务[1]。这表明认知度虽高,但将AI切实融入研究流程的程度仍然较浅。同一调查发现,40.5%的使用者未在论文中注明AI的使用情况,这暴露出可能阻碍技术推广的伦理与透明度问题[1]。2023年一篇关于将AI用于管理研究的社论也呼应了这一观点,指出当前通用模型架构的主要缺陷在于:它们可能生成看似合理但实际错误的输出,研究人员需理解这些局限性才能安全使用[3]。因此,瓶颈不在于技术能力,而在于信任、培训与规范。

这种重塑在所有领域都会是均匀的吗?

不——证据显示,这种变革并不均衡。在标准化、高重复性任务领域(如语言测试中的作文评分[2]或药物研发中的毒性筛查[4]),人工智能模型可能迅速融入,因为它们能直接替代或增强人力。相比之下,依赖细腻解读的领域——例如定性研究或复杂的文献综合——则面临更大障碍。2023年一项关于AI用于系统性文献综述的研究发现,虽然AI能加速筛选与数据提取,但“最显著的劣势”在于模型无法真正理解语境,因此人类监督仍不可或缺[3]。2024年针对临床研究人员的调查也印证了这一点:52%的受访者认为大语言模型将对写作与编辑产生重大影响,但仅32.6%的人确信其更广泛的应用前景[1]。变革确实会发生,但最快推进的,将是研究中最常规、数据最密集的环节。

关于这些来源

该回答基于5篇经同行评审的研究——发表于2023年至2025年间,其中3篇为2024年或之后发表,2篇发表于Q1期刊,总被引次数达724次——这些研究是从5篇通过质量筛选的研究中选出的最具相关性的成果,而该筛选过程又源自从超过5亿篇论文数据库中检索到的57篇文献。

本文引用的文献

1

全球临床研究人员在学术研究与出版中,将大型语言模型作为人工智能工具的应用情况。

在一项涵盖59个国家226名医学研究人员的横断面调查中,87.6%的人了解大语言模型,但仅18.7%曾在发表文章中使用过它们,主要用于语法/格式调整(64.9%);40.5%的人未声明使用人工智能,52%的人预测其对写作/编辑任务将产生重大影响。

2

探索使用AI语言模型进行自动作文评分的潜力

研究利用GPT-3对TOEFL11语料库中全部12,100篇作文进行自动评分,发现其准确性和可靠性可与人工评分员相媲美,且有望通过语言特征进一步提升评分效果。

3

关于使用ChatGPT等人工智能工具支持管理学研究

这篇关于管理研究中人工智能的社论,为在系统性文献综述中使用AI提供了指导方针,指出其在客观性/可重复性方面的优势,但当前模型架构存在重大缺陷(例如缺乏真正的理解),因此需要人工监督。

4

大型语言模型作为分子毒性预测工具:人工智能对心脏毒性的洞察。

在比较GPT-4和GPT-4o与传统机器学习模型用于分子毒性预测时,GPT-4在骨骼、神经和生殖毒性方面的表现相当;结合分子对接技术,它识别出了常见草药中的心脏毒性化合物。

5

生成式人工智能与人工智能工具在英语教学与学习中的应用:一项探索性研究

这项探索性研究通过对英语教师的半结构化访谈发现,生成式人工智能工具(如ChatGPT、Gemini、Copilot)对教学效率、学生参与度及写作能力产生了积极影响,并为个性化学习提供了支持。