多模态AI智能体在科学领域目前究竟能做什么?
多模态AI智能体能够融合文本、图像、视频和语音等多种数据类型,执行以往需要人类专家才能完成的任务。在教育领域,一个部署在计算机科学课堂上的多模态AI助手,在1200名学生(每组600人)中实现了0.73的标准化学习增益,而对照组仅为0.40——提升了82%——并将调试编程问题的平均时间从134.5分钟缩短至仅11.2分钟,降幅达91.6%[1]。该系统还具备0.85%的低幻觉率和1.65秒的响应延迟,这意味着它既准确又足够快速,能够满足实时应用的需求。
在医学诊断领域,一种结合眼底摄影与OCT成像的多模态深度学习框架,用于糖尿病视网膜病变检测,在基准数据集上达到了98%的准确率、96%的敏感度以及0.99的AUC值[2]。另一项针对阿尔茨海默病预测的模型,融合了临床数据、MRI分割结果及心理测试评分,在OASIS-3数据集上实现了五分类任务中98.81%的准确率[5]。这些结果表明,对于定义明确、数据充足的问题,多模态人工智能代理的性能已能与人类水平持平甚至超越。
在材料科学领域,一个名为Matter AI的拟议框架旨在将文献挖掘、晶体结构学习、物理模拟与可持续性评分整合至单一流程中,不过该框架尚未实际部署[6]。类似地,在生物电子学领域,名为DeviceAgent的智能体能够自主生成制造方案、识别微观缺陷并分析干细胞衍生心肌细胞的心脏信号,且无需针对特定任务进行训练[7]。这些案例表明,该技术正从概念走向实践,并在多个领域得到应用。
这些智能体在哪些方面仍有不足,要实现更广泛的应用还需要什么?
尽管多模态AI代理在特定任务中取得了令人瞩目的成果,但尚未成为通用型科学助手。《自然·机器智能》的一篇综述指出,当前大多数多模态AI研究仍聚焦于视觉与语言领域,而系统的可部署性——即在真实场景中稳定运行的能力——仍是关键挑战[3]。作者认为,部署限制(如有限的计算能力、数据隐私需求以及实时反馈要求)必须从一开始就纳入考量,而非事后补救。
即使在成功部署的案例中,仍存在局限性。那个通过视频、语音和文本捕捉动手实验操作的蛋白质组学实验室智能体,虽然能够识别常见错误并分享隐性知识,但作者指出,其领域特定识别和空间识别能力仍需改进[4][8]。阿尔茨海默症预测模型虽然准确率很高,但依赖于特定数据集(OASIS-3),尚未在真实临床工作流程中接受测试[5]。糖尿病视网膜病变框架虽然在多个数据集上进行了基准测试,但评估使用的是经过筛选的图像,而非嘈杂的真实世界扫描图像[2]。
一个更广泛的担忧在于,许多这类系统仍处于研究阶段。用于材料发现的Matter AI框架目前仅是一个设计方案,尚未取得任何实验结果[6]。面向生物电子学的DeviceAgent仅在单一应用场景(用于心肌细胞的可拉伸网状电子器件)中进行了演示[7]。具身智能体EMMA在ALFWorld基准测试中,相较于其他视觉语言智能体,成功率提升了20%至70%,但该基准测试属于模拟环境,而非真实实验室[9]。因此,尽管发展路径已然清晰,但从受控研究迈向日常科学实践的这一跨越尚未实现。
各项研究对“我们离目标还有多远”的看法是否一致?
在12篇论文中,研究者们高度一致地认为,多模态人工智能代理在特定且明确的科学任务中具有实际应用价值——尤其是在教育、医学影像和实验室自动化领域。其中规模最大、最严谨的一项研究,是针对1200名学生开展的为期一学期的A/B实验,结果显示学生在学习效率和调试能力方面取得了显著且具有统计意义的提升[1]。医学影像研究[2][5]的准确率超过98%,已达到临床相关水平。这些研究共同指向同一结论:对于数据丰富的窄域问题,该技术已具备应用条件。
然而,这些论文也一致认为,能够自主设计实验、解读结果并适应新领域的通用型科学智能体——目前尚不实用。《自然·机器智能》的综述文章明确呼吁采取“以部署为中心”的方法来弥合这一差距[3]。蛋白质组学智能体论文指出,尽管该智能体能够捕捉实践性专业知识,但在空间识别和特定领域识别方面仍存在困难[6]。材料发现框架目前仍是一份蓝图,而非可运行的系统[6]。因此,诚实的答案是:多模态AI智能体如今在特定科学应用中已具备实用性,但通用的“盒子中的科学家”仍是未来的目标。
关于这些来源
该回答基于9篇经同行评审的研究——发表于2023年至2026年间,其中8篇为2024年及以后发表,2篇发表于Q1期刊,累计被引用105次——这些研究是从12篇通过质量筛选的文献中选出的最具相关性的成果,而12篇文献又源自从超过5亿篇论文数据库中检索到的67篇论文。
本文引用的文献
面向大规模计算机科学课堂的多模态生成式AI助教,用于提供实时教学反馈
在一项为期一学期、涉及1200名学生的A/B实验中,多模态AI助教将标准化学习增益从0.40提升至0.73(增幅82%),并将调试时间从134.5分钟缩短至11.2分钟(降幅91.6%),同时实现了0.85%的幻觉率和1.65秒的响应延迟。
面向糖尿病视网膜病变增强诊断与严重程度分级的高级多模态人工智能框架
一种结合眼底摄影与OCT成像的多模态深度学习框架,在糖尿病视网膜病变诊断中达到了98%的准确率、96%的敏感性、97%的特异性,并在基准数据集(EyePACS、IDRiD、Duke OCT)上取得了0.99的AUC值。
面向以部署为中心、超越视觉与语言的多模态人工智能
《自然·机器智能》上的一篇综述指出,当前多模态人工智能研究主要集中于视觉与语言领域,而可部署性(即早期考虑现实世界约束)仍是其在科学应用中面临的关键挑战。
用于捕获和共享蛋白质组学实验室实践的多模态AI智能体
一个多模态人工智能实验室代理被开发出来,通过整合视频、语音和文本分析,将书面实验方案与实际操作相连接,从而捕捉并共享蛋白质组学实验实践。
基于可解释人工智能的多模态数据阿尔茨海默病预测与管理
一种基于临床数据、MRI分割数据及心理数据的可解释AI模型,在OASIS-3数据集上实现了五分类任务中98.81%的准确率,并具备基于SHAP的可解释性。
Matter - AI:一个用于加速物理科学领域材料发现的多模态AI框架
Matter AI材料发现框架整合了文献挖掘、晶体结构学习、物理模拟与可持续性评分,但目前仍是一个设计提案,尚未进行实验部署。
DeviceAgent:一种用于柔性生物电子学的自主多模态人工智能代理。
DeviceAgent,一种用于生物电子学的自主多模态AI智能体,能够自主生成制造方案、识别微观缺陷,并分析干细胞来源心肌细胞的心脏信号,全程无需针对特定任务进行训练。
用于捕捉和共享实验室实践的多模态AI智能体
一个用于蛋白质组学的多模态AI实验室代理,通过视频、语音和文本捕捉了隐性实验操作经验,识别了常见错误,并提升了可重复性,但在领域特定识别和空间识别方面仍有待改进。
由大语言模型从并行文本世界训练的具身多模态智能体
通过跨模态模仿学习从文本世界大语言模型(LLM)训练而成的具身多模态智能体(EMMA),在ALFWorld基准测试中,其成功率相比其他视觉语言智能体提升了20%至70%。
