为何大多数AI设计的蛋白质在实验室中会失败?
最大的证据缺口在于,AI模型在构想蛋白质方面远胜于制造出真正有效的蛋白质。目前最先进的设计方案在实验中成功率接近20%[1]。这意味着,顶尖AI模型每设计100种蛋白质,只有约20种能在实验室合成并测试时正确折叠并发挥预期功能,其余80种均告失败,浪费了时间和资源。如此低的成功率表明,计算机模型对蛋白质在真实世界中的行为方式仍缺乏根本性的理解。
造成这一差距的关键原因在于,用于在计算机上评估设计的指标无法可靠地预测实际性能。该领域面临一个明确的挑战:如何确定最佳的计算机模拟指标,以便优先筛选出值得进行实验测试的设计方案[1]。缺乏可信的计算机预测,研究人员不得不测试远超必要数量的设计,从而拖慢了从设计到应用的整个流程。
目前哪些蛋白质是AI无法设计的?
AI模型在设计与运动或受控相关的蛋白质时表现尤为不佳。当前的生成式AI难以设计出能够发生大幅构象变化(即显著的形态改变)或受翻译后修饰(一种开启或关闭蛋白质功能的化学开关)调控的蛋白质[1]。这些能力对于许多在细胞中充当传感器、马达或开关的天然蛋白质至关重要。在AI能够应对这种复杂性之前,它只能局限于设计静态蛋白质,而这仅占生物体所用蛋白质的一小部分。
逆向问题——根据目标蛋白质形状预测能折叠成该形状的氨基酸序列——已被证明比从序列预测结构更为棘手[5]。尽管AlphaFold2等工具彻底改变了结构预测领域,但设计问题本质上更加困难,因为理论上许多不同的序列都能产生相同的形状,而模型必须从中选出一种能在活细胞中实际发挥作用的序列[3][5]。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2022年至2024年间,其中2篇为2024年及以后发表,4篇发表于Q1期刊,累计被引155次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程又源自从超过5亿篇论文数据库中检索到的40篇文献。
本文引用的文献
用于从头蛋白质设计的生成式人工智能
这篇2024年的综述指出,最先进的AI设计方案在实验中已实现接近20%的成功率,同时揭示了关键不足:缺乏可靠的计算机模拟指标来优先筛选设计方案,以及无法设计出能发生大幅构象变化或受翻译后修饰调控的蛋白质。
蛋白质设计面临生物安全挑战
Baker和Church在2024年的前瞻性文章中警告,AI蛋白质设计准确性的快速提升带来了生物安全风险,并主张所有合成基因序列及合成数据应存储于安全数据库中,仅在紧急情况下方可查询。
AI增强的蛋白质设计能够创造出从未存在过的蛋白质。
这篇2023年的新闻报道指出,蛋白质工程师正利用机器学习工具和AlphaFold2来追求更复杂的从头蛋白质设计,但同时也指出,设计问题(从形状预测序列)比结构预测更具挑战性。
用于蛋白质设计的AI模型正在推动抗体工程的发展。
这篇2023年的综述将基于深度学习的蛋白质结构预测与设计的最新进展与抗体工程联系起来,指出基于结构的生成模型正在兴起,但未报告具体的成功率或证据缺口。
用AI构想全新的蛋白质设计
这篇2022年的文章报道称,华盛顿大学开发的一种新型机器学习算法能够比以前更快、更准确地设计蛋白质分子,但文章指出,反向问题(从形状推导序列)已被证明比结构预测更具挑战性。
