WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

哪些证据缺口阻碍了AI设计蛋白质的发展?

AI设计的蛋白质面临关键证据缺口:实验成功率低、对实际行为的预测能力差,且缺乏生物安全保障措施。

直接答案

人工智能设计的蛋白质面临若干证据缺口。首先,即便最先进的生成式AI模型在实验中的成功率也仅约20%,这意味着每5个设计方案中就有4个在实际构建和测试时失败[1]。其次,由于计算机使用的评估指标与实际表现不匹配,目前尚无可靠方法能在无需昂贵实验室实验的情况下预测哪些设计可行[1]。第三,AI难以设计出能够改变形态或受化学修饰调控的蛋白质,而这类特性对许多生物功能至关重要[1]。最后,目前缺乏成熟的系统来追踪并保护构建这些蛋白质所需的DNA序列,由此引发的生物安全风险也延缓了研究进展[2]

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何大多数AI设计的蛋白质在实验室中会失败?

最大的证据缺口在于,AI模型在构想蛋白质方面远胜于制造出真正有效的蛋白质。目前最先进的设计方案在实验中成功率接近20%[1]。这意味着,顶尖AI模型每设计100种蛋白质,只有约20种能在实验室合成并测试时正确折叠并发挥预期功能,其余80种均告失败,浪费了时间和资源。如此低的成功率表明,计算机模型对蛋白质在真实世界中的行为方式仍缺乏根本性的理解。

造成这一差距的关键原因在于,用于在计算机上评估设计的指标无法可靠地预测实际性能。该领域面临一个明确的挑战:如何确定最佳的计算机模拟指标,以便优先筛选出值得进行实验测试的设计方案[1]。缺乏可信的计算机预测,研究人员不得不测试远超必要数量的设计,从而拖慢了从设计到应用的整个流程。

目前哪些蛋白质是AI无法设计的?

AI模型在设计与运动或受控相关的蛋白质时表现尤为不佳。当前的生成式AI难以设计出能够发生大幅构象变化(即显著的形态改变)或受翻译后修饰(一种开启或关闭蛋白质功能的化学开关)调控的蛋白质[1]。这些能力对于许多在细胞中充当传感器、马达或开关的天然蛋白质至关重要。在AI能够应对这种复杂性之前,它只能局限于设计静态蛋白质,而这仅占生物体所用蛋白质的一小部分。

逆向问题——根据目标蛋白质形状预测能折叠成该形状的氨基酸序列——已被证明比从序列预测结构更为棘手[5]。尽管AlphaFold2等工具彻底改变了结构预测领域,但设计问题本质上更加困难,因为理论上许多不同的序列都能产生相同的形状,而模型必须从中选出一种能在活细胞中实际发挥作用的序列[3][5]

关于安全性,是否存在隐藏的证据缺口?

是的,这是一个关键问题。人工智能蛋白质设计的威力和准确性正在迅速提升,但目前尚无成熟的系统来追踪构建这些蛋白质所需的合成DNA序列[2]。这造成了生物安全漏洞:设计的蛋白质可能被滥用于制造危险的生物制剂,而由于缺乏追踪系统,我们无法检测或阻止这种滥用行为[2]。这种数据库的缺失本身就是一个证据缺口——因为我们没有进行监测,所以无从知晓滥用可能发生的频率。

专家呼吁,所有合成基因序列及合成数据应被收集并存储于仅在紧急情况下才可查询的数据库中[2]。在相关系统建立之前,该领域缺乏保障安全所需的证据,这可能会减缓投资并削弱公众信任。这并非蛋白质设计本身的技术缺口,而是将设计负责任地转化为实际应用所需的基础设施缺口。

关于这些来源

该回答基于5篇经同行评审的研究——发表于2022年至2024年间,其中2篇为2024年及以后发表,4篇发表于Q1期刊,累计被引155次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程又源自从超过5亿篇论文数据库中检索到的40篇文献。

本文引用的文献

1

用于从头蛋白质设计的生成式人工智能

这篇2024年的综述指出,最先进的AI设计方案在实验中已实现接近20%的成功率,同时揭示了关键不足:缺乏可靠的计算机模拟指标来优先筛选设计方案,以及无法设计出能发生大幅构象变化或受翻译后修饰调控的蛋白质。

2

蛋白质设计面临生物安全挑战

Baker和Church在2024年的前瞻性文章中警告,AI蛋白质设计准确性的快速提升带来了生物安全风险,并主张所有合成基因序列及合成数据应存储于安全数据库中,仅在紧急情况下方可查询。

3

AI增强的蛋白质设计能够创造出从未存在过的蛋白质。

这篇2023年的新闻报道指出,蛋白质工程师正利用机器学习工具和AlphaFold2来追求更复杂的从头蛋白质设计,但同时也指出,设计问题(从形状预测序列)比结构预测更具挑战性。

4

用于蛋白质设计的AI模型正在推动抗体工程的发展。

这篇2023年的综述将基于深度学习的蛋白质结构预测与设计的最新进展与抗体工程联系起来,指出基于结构的生成模型正在兴起,但未报告具体的成功率或证据缺口。

5

用AI构想全新的蛋白质设计

这篇2022年的文章报道称,华盛顿大学开发的一种新型机器学习算法能够比以前更快、更准确地设计蛋白质分子,但文章指出,反向问题(从形状推导序列)已被证明比结构预测更具挑战性。