
DRUGONE
2021年7月15日,AlphaFold2(AF2)正式发表于《Nature》,并同步开源。今年,这项具有里程碑意义的人工智能成果迎来了五周年。短短五年间,AlphaFold2不仅解决了困扰结构生物学数十年的蛋白质结构预测难题,更推动人工智能在生命科学中的应用进入全新的发展阶段。如今再回顾AlphaFold2,人们看到的已不仅是一项突破性的算法,而是一套正在重塑科学研究方式的AI基础设施。

从二十万到两亿:蛋白质结构预测迈入AI时代
在AlphaFold2出现之前,蛋白质三维结构主要依赖X射线晶体学、冷冻电镜和核磁共振等实验技术进行解析。这些方法虽然能够获得高精度结构,但通常需要耗费大量时间、人力和资金,许多蛋白质甚至经过多年研究仍难以获得可靠结构。因此,如何快速、准确地预测蛋白质结构,一直被认为是结构生物学最重要的挑战之一。
AlphaFold2的出现彻底改变了这一局面。借助深度学习技术,它能够直接根据蛋白质氨基酸序列预测三维结构,预测精度最高可达到约1.5 Å,与实验测定结果已经非常接近。更重要的是,这种预测能力可以实现大规模自动化运行,使蛋白质结构预测真正进入高通量时代。
这一突破最直观地体现在AlphaFold Protein Structure Database的发展上。在AlphaFold2发布之前,全球实验解析得到的蛋白质结构数量约为20万个,而如今数据库已经收录超过2亿个AI预测结构,几乎覆盖了绝大多数已知蛋白质。这意味着,对于世界各地的科研人员而言,蛋白质结构已经从稀缺资源变成了触手可及的公共基础设施,为生命科学研究提供了前所未有的数据支撑。

从预测单个蛋白到模拟复杂生命体系
AlphaFold2最初面向的是单个蛋白质结构预测,但随后几年,研究人员不断扩展这一框架,使AI能够处理越来越复杂的生命体系。蛋白质在细胞中通常不是孤立存在,而是与其他蛋白质、核酸以及小分子共同组成复杂的生物系统,因此,仅预测单一蛋白结构远远不能满足现代生物学研究需求。
在这一背景下,AlphaFold-Multimer应运而生。该模型将预测对象扩展到蛋白质复合物,能够更加准确地预测多个蛋白之间的结合方式以及相互作用界面,为解析蛋白质互作网络提供了重要工具。
随后发布的AlphaFold3进一步突破了这一限制。新模型采用扩散模型架构,将预测范围扩展到蛋白质、DNA、RNA以及各种小分子共同组成的复合体系,使人工智能能够模拟更加接近真实细胞环境中的分子相互作用。这标志着AI结构预测已经从单个蛋白迈向复杂生命系统,为药物研发、生物调控机制解析以及分子设计提供了更加全面的技术支撑。
AI开始设计蛋白,而不仅仅是预测蛋白
AlphaFold2带来的影响不仅体现在结构预测精度的提升,更重要的是推动了研究范式的转变。过去,研究人员关注的是天然蛋白质长什么样,而近年来,越来越多工作开始探索如何利用人工智能直接设计自然界不存在的新蛋白质,也就是所谓的逆向蛋白设计。
ProteinMPNN便是这一方向的重要代表。该模型能够根据目标蛋白骨架自动生成可能折叠成相应结构的氨基酸序列,实现从结构到序列的逆向设计。随后出现的Chroma进一步证明,人工智能不仅能够生成符合目标结构的蛋白质,还能够设计具有用户指定三维形状的新蛋白,例如字母、数字等复杂几何结构。
近年来迅速发展的RFdiffusion则将扩散模型引入蛋白质生成领域,使AI能够从零开始设计结合蛋白、蛋白支架、寡聚体等多种复杂蛋白结构。这些成果表明,人工智能已经开始从“理解生命”迈向“创造生命”,蛋白质设计正在逐渐成为AI驱动生命科学的重要研究方向。
蛋白质语言模型正在成为新的技术路线
尽管AlphaFold2取得了巨大成功,但它仍存在一定局限,其中最重要的一点便是高度依赖多序列比对(Multiple Sequence Alignment,MSA)。AF2中的Evoformer模块通过分析大量同源蛋白之间的共同进化信息学习结构规律,而对于孤儿蛋白、快速进化病毒蛋白等缺乏丰富同源序列的目标,这类信息往往十分有限,从而影响预测效果。
近年来,蛋白质语言模型(Protein Language Models,PLMs)逐渐成为另一条快速发展的技术路线。这类模型借鉴自然语言处理中的大规模预训练思想,通过学习海量蛋白质序列中的统计规律,自主获得蛋白质的结构和功能信息,从而无需显式构建MSA即可完成结构预测。
越来越多研究表明,PLM能够有效补充甚至替代传统MSA方法。以trRosettaX-Single、RGN2等代表的新一代MSA-free模型,不仅计算效率更高,而且在部分任务中已经能够达到与AlphaFold2相当的预测性能。这意味着蛋白质结构预测正在朝着更加快速、高效和普适的方向不断发展。
开源生态让AlphaFold2持续释放影响力
AlphaFold2之所以能够迅速改变整个领域,一个重要原因在于它坚持开放共享。模型代码、预测数据库以及相关资源的开放,使全球科研人员能够不断优化、扩展并构建新的研究工具,从而形成持续发展的开放生态。
ColabFold便是这一生态的重要成果之一。它通过优化MSA搜索流程,大幅降低了计算资源需求,使普通实验室甚至个人研究人员也能够方便地使用AlphaFold开展结构预测。与此同时,MassiveFold利用大规模并行计算技术,将原本需要数月才能完成的大规模预测任务缩短到数小时,显著提高了计算效率。
另一项重要工作OpenFold则重新实现了一个更加开放、更加节省显存且可重新训练的AlphaFold框架,使研究人员能够根据不同科学问题调整模型结构,并开展算法创新。正是在这些开放项目的推动下,AlphaFold2逐渐从一个单独的软件工具演变成为整个蛋白质人工智能研究的重要基础平台。
五年之后,AlphaFold2留下的是AI科学基础设施
五年过去,AlphaFold2最重要的意义已经远远超出了蛋白质结构预测本身。它向整个科学界证明,一项真正具有革命性的科学AI成果,并不仅仅来自更大的模型或更复杂的算法,而是建立在高质量数据、开放共享平台以及深度融合领域知识的模型设计之上。
AlphaFold2的发展历程也为未来科学人工智能提供了清晰的发展路径。随着蛋白质设计、药物研发、分子模拟以及更多生命科学问题不断引入AI,人们越来越认识到,真正推动科学进步的,不只是单一模型,而是一整套开放、可扩展、能够持续演进的AI科研基础设施。
从破解蛋白质结构预测难题,到推动人工智能成为生命科学的重要研究工具,AlphaFold2仅用了五年时间便完成了一场深刻的科学变革。而它所开启的AI驱动科学发现新时代,或许才刚刚开始。
整理 | DrugOne团队
参考资料
AlphaFold2 turns five. Nat Comput Sci (2026).
https://doi.org/10.1038/s43588-026-01031-8

内容为【DrugOne】公众号原创|转载请注明来源