
DRUGONE
蛋白质功能注释是理解生命过程、解析代谢网络以及开展合成生物学和蛋白质工程研究的重要基础。目前,大多数自动注释方法仍主要依赖序列同源性,将已知蛋白的功能转移给序列相似的新蛋白。然而,随着进化距离增加,许多具有相似功能的蛋白序列已经发生显著分化,仅依赖序列比对容易遗漏大量远缘同源蛋白。AlphaFold的大规模蛋白质结构预测为蛋白功能研究提供了新的契机,使研究人员能够直接利用三维结构推断蛋白功能。
研究人员提出基于AlphaFold结构模型的蛋白质功能注释流程WASP(Whole-proteome Annotation via Structural-homology Prediction)。该流程以整个蛋白质组为分析对象,首先利用Foldseek对AlphaFold预测结构进行快速结构比对,再结合Reciprocal Best Hit策略构建结构同源网络,并利用网络拓扑和功能富集分析预测未知蛋白的功能。WASP能够同时预测Gene Ontology(GO)、Pfam、PANTHER、CATH、酶学委员会(EC)编号及Rhea反应等多种功能注释。在多个标准数据集上的评估结果表明,WASP整体预测性能优于当前主流序列注释工具,并能够为20种工业相关微生物中约20%~30%的未知蛋白补充功能信息。同时,该方法还能为基因组尺度代谢模型中的孤儿反应寻找潜在天然酶,为代谢网络完善和新型生物制造提供重要支持。

蛋白质的三维结构决定其生物学功能,因此蛋白质功能预测一直是生物信息学和系统生物学的重要研究方向。长期以来,研究人员主要利用序列同源性进行自动功能注释,即根据未知蛋白与已知蛋白之间的序列相似程度推断其功能。这类方法已经广泛应用于UniProt、Pfam、PANTHER以及Gene Ontology等数据库的建设,也成为新基因组注释的标准流程。
然而,仅依赖序列信息存在明显局限。通常认为,当蛋白序列一致性低于约40%时,同源关系便难以可靠识别,大量远缘同源蛋白因此无法获得准确注释。此外,由于趋同进化或基因复制后的功能分化,即使序列高度相似,也未必具有相同功能。事实上,即便是酿酒酵母和大肠杆菌等研究最充分的模式生物,仍有超过三分之一蛋白缺乏明确的分子功能注释,而UniProt数据库中真正经过实验验证的蛋白仅占全部序列的极少部分。
近年来,AlphaFold、ESMFold和RoseTTAFold等人工智能模型极大推动了蛋白质结构预测的发展,使几乎所有已测序蛋白都能够获得高质量三维结构模型。这意味着,即使序列已经发生较大变化,其空间折叠结构仍可能保持高度保守,从而为蛋白功能预测提供新的依据。因此,研究人员希望利用结构同源性替代传统序列同源性,在整个蛋白质组尺度建立新的功能预测体系,使结构信息真正成为蛋白功能注释的重要来源。
方法
研究人员开发了Python命令行工具WASP,仅需输入目标物种的NCBI分类编号即可自动完成整个蛋白质组功能预测。首先,系统从AlphaFold数据库下载目标物种全部蛋白结构模型,并利用Foldseek对其与SwissProt及AlphaFold数据库中的参考结构进行全蛋白质组结构比对。随后采用Reciprocal Best Hit策略,仅保留双向最佳匹配关系,以提高远缘结构同源识别的可靠性。保留下来的同源关系进一步构建为加权网络,每个节点代表蛋白,每条边表示结构相似程度。之后,系统自动获取邻域蛋白已有的GO、Pfam、PANTHER、CATH、EC编号和Rhea反应等注释信息,并利用SAFE网络功能富集算法,根据局部网络拓扑关系推断未知蛋白功能。整个流程不仅能够预测完整蛋白质组功能,还可进一步用于全基因组功能注释、工业微生物分析以及基因组尺度代谢模型的孤儿反应修复。

图1: WASP整体工作流程及基于结构同源性的蛋白功能注释框架。
结果
WASP利用结构同源网络实现蛋白功能预测
研究首先验证了结构同源性的优势。研究人员选择经典的FtsZ/Tubulin蛋白家族作为案例分析。虽然来自大肠杆菌和酿酒酵母的代表蛋白序列一致性仅约15%,远低于传统功能转移所需阈值,但二者三维结构仍保持高度一致,TM-score达到0.60,在整个蛋白家族中平均达到0.77。这说明蛋白结构比序列更加保守,更能反映真实功能。
进一步比较发现,基于MMseqs2建立的序列同源网络将该蛋白家族分裂为两个彼此独立的簇,而基于Foldseek建立的结构同源网络则能够正确连接整个家族成员,完整恢复其功能关系。基于这一思想,WASP通过结构同源网络替代传统两两序列比对,使远缘同源蛋白能够进入同一功能模块,并利用网络整体拓扑而非单一匹配关系推断功能,提高了复杂蛋白家族的注释能力。

图2: FtsZ/Tubulin蛋白家族中序列同源性与结构同源性的比较,以及结构网络恢复远缘同源关系。
WASP显著提高蛋白功能注释准确率
为了评估预测性能,研究人员首先在大肠杆菌和酿酒酵母两个模式生物中隐藏已有功能标签,仅利用WASP重新预测其功能。结果显示,WASP在多个功能描述符上的平均F1值均超过80%,随着网络迭代逐步扩展邻域,仅带来极少量误预测,而性能在前2~3轮便趋于稳定,因此默认采用三轮迭代即可获得最佳平衡。
随后,研究人员进一步将WASP与EggNOG、CLEAN、DeepEC以及ProteInfer等代表性自动注释工具进行比较。在New-392标准数据集中,WASP无论在精确率、召回率还是F1值上均取得最佳表现;在更具挑战性的Price-149数据集中,虽然部分第四级EC编号预测与CLEAN相近,但在三级EC分类上仍保持领先。更重要的是,两种方法具有明显互补性,联合使用后可进一步提高整体预测准确率,说明结构信息能够有效弥补序列方法遗漏的远缘同源关系。

图3: WASP与现有蛋白功能注释工具在多个标准数据集上的性能比较。
WASP完善工业微生物和新测序基因组功能注释
研究随后将WASP应用于20种具有工业价值的细菌、酵母和真菌。结果发现,对于毕赤酵母、金属还原菌、铜绿假单胞菌以及高速生长菌等研究相对不足的物种,WASP能够为约20%~30%的未知蛋白补充功能注释;即使在酿酒酵母和大肠杆菌等模式生物中,也仍然能够恢复大量缺失的EC编号、CATH结构域以及Rhea反应信息,从而使不同数据库之间的注释更加完整和一致。
研究人员进一步利用ColabFold预测新测序的油脂酵母Yarrowia lipolytica NRRL Y-64008全部蛋白结构,并利用WASP完成整个蛋白质组注释。结果显示,WASP不仅能够获得大量Pfam、GO及结构域信息,还成功识别出约200个未被BLAST、EggNOG和CLEAN发现的新功能蛋白,进一步证明结构信息能够显著提升新基因组自动注释能力。
WASP解析代谢网络孤儿反应并完善基因组尺度模型
除了蛋白功能预测外,研究人员还将WASP应用于基因组尺度代谢模型优化。许多代谢网络中仍存在大量孤儿反应,即代谢反应已经确定,但尚未找到负责催化该反应的天然酶。这些缺失严重影响代谢模型准确性。
研究人员首先分析20个工业微生物的基因组尺度模型,随后利用WASP寻找与孤儿反应对应的天然蛋白。结果显示,WASP能够为75%~100%的孤儿反应找到至少一个高可信度候选蛋白,大多数候选结构TM-score均超过0.7,而这些蛋白在UniProt中的注释普遍较低。
进一步分析发现,在酿酒酵母、油脂酵母及结核分枝杆菌中,WASP成功恢复了多个长期缺失的重要代谢酶,不仅完善了基因—蛋白—反应之间的对应关系,还帮助修正了代谢模型中的假阳性必需基因预测,提高了模型对真实实验结果的一致性,并进一步发现多个具有潜在药物开发价值的新候选靶点。

图4: WASP利用结构同源关系解析基因组尺度代谢模型孤儿反应及代表性结构比对实例。
讨论
研究人员开发的WASP首次将AlphaFold结构数据库、Foldseek快速结构比对、网络拓扑分析以及功能富集整合为统一的蛋白质组功能注释框架,实现了真正基于结构同源性的全蛋白质组自动功能预测。与传统序列同源方法相比,WASP能够识别大量远缘同源蛋白,在模式生物、新测序基因组以及工业微生物中均显著提高了功能注释覆盖率,同时保持较高预测精度。
研究进一步证明,结构信息不仅能够用于蛋白功能预测,还能够帮助完善基因组尺度代谢模型,为长期缺失的孤儿反应寻找天然催化酶,并提高代谢网络模拟和基因必需性预测的可靠性。这使WASP不仅适用于基础蛋白质组学研究,也为代谢工程、合成生物学、工业菌株改造以及新型药物靶点发现提供了重要工具。
不过,研究人员也指出,WASP目前仍依赖Foldseek进行结构比对,而Foldseek主要依据整体结构相似性进行匹配,并未特别关注催化位点等关键功能区域,因此对于功能位点高度保守但整体结构差异较大的蛋白仍存在一定局限。此外,当某些结构同源网络中所有蛋白均缺乏已有注释时,会形成所谓的“暗簇”,无法继续传播功能信息。未来如果结合功能位点识别、结构语言模型以及功能感知结构比对算法,有望进一步提高蛋白功能预测的准确性,推动下一代基于结构的大规模蛋白功能注释体系的发展。
整理 | DrugOne团队
参考资料
Del Missier, G., Shabestary, K. & Ledesma-Amaro, R. WASP: a pipeline for functional annotation prediction based on AlphaFold structural models. Nat Commun (2026).
https://doi.org/10.1038/s41467-026-75956-z