
DRUGONE
酶是生命体内催化代谢反应的核心生物催化剂,也是药物合成、生物制造和绿色化工的重要基础。然而,仅依据氨基酸序列准确预测酶的催化性质仍然十分困难。现有蛋白质语言模型虽然能够学习通用蛋白质表示,但由于主要针对所有蛋白共同训练,既缺乏对酶特异性序列规律的建模,又受到Transformer计算复杂度较高的限制,因此难以满足大规模酶筛选和酶工程应用需求。
研究人员提出酶特异性蛋白质语言模型EnzGFM。该模型采用Mamba–Transformer混合架构,并设计分层预训练策略,先学习通用蛋白语言,再针对酶序列进行继续训练,使模型能够学习酶催化相关的专有序列模式。在四类典型酶预测任务中,EnzGFM均明显优于当前主流蛋白质语言模型,同时推理速度提高约2~5倍。研究人员进一步构建EnzGFM-Agent多智能体系统,实现酶分析、突变设计、酶检索及自动决策,并通过分泌型碱性磷酸酶实验验证模型能够显著提高有益突变富集效率,为酶工程提供高效的人工智能平台。

酶催化决定了细胞几乎所有生化反应,也是工业生物制造的重要工具。从抗生素、生物燃料到食品酶制剂,大量生物制造过程都依赖高效酶催化完成。因此,如何根据蛋白质序列快速预测酶催化能力,并进一步设计性能更优的新酶,一直是计算生物学和酶工程的重要目标。
随着蛋白质数据库不断扩展,深度学习逐渐成为酶功能预测的重要工具。近年来,大规模蛋白质语言模型能够通过自监督学习从数亿条蛋白序列中学习丰富的进化规律,在蛋白结构预测、功能注释和突变效应分析等任务中取得显著成功。然而,这些模型主要针对所有蛋白共同训练,并未充分关注酶这一特殊蛋白类别,因此学习得到的表示更加偏向通用蛋白特征,而对催化中心、底物识别以及动力学参数等酶特异性规律建模不足。
另一方面,目前主流蛋白质语言模型几乎全部采用Transformer架构。随着蛋白长度增加,自注意力计算复杂度呈平方增长,使模型训练和推理成本迅速增加,不利于工业酶筛选中数百万蛋白序列的大规模分析。因此,一个既具有酶领域知识,又能够兼顾高效率的新型蛋白质语言模型成为当前的重要需求。
研究人员据此提出EnzGFM,希望通过酶特异性继续预训练和高效混合网络,实现蛋白语言模型由“通用蛋白理解”向“酶催化理解”的进一步演化。
方法
EnzGFM采用两阶段层次化预训练策略。首先利用UniRef50中约4828万条蛋白序列完成通用蛋白语言学习;随后进一步使用来自CAZy、BRENDA和SABIO-RK数据库约509万条酶序列继续预训练,使模型学习酶特有的序列规律。网络主体采用Mamba–Transformer混合架构,利用Mamba模块以线性复杂度建模长距离序列依赖,再利用Transformer重点学习催化位点附近局部残基相互作用。研究人员分别构建30M、150M、650M和1.5B参数模型,并在酶动力学参数预测、酶–反应匹配、EC分类以及单点突变效应预测四类任务上进行系统评估。同时,进一步开发EnzGFM-Agent,将模型与代码生成、多智能体协作、BLAST检索及实验设计流程结合,实现自动化酶工程分析。
结果
EnzGFM建立酶特异性蛋白质语言模型
研究人员首先构建EnzGFM整体框架。模型采用层次化预训练策略,先学习所有蛋白共同规律,再针对酶进行领域适应训练,使模型能够逐步从一般蛋白知识迁移到酶催化知识。
随着模型规模由3000万参数扩展到15亿参数,训练困惑度持续下降,说明模型不断学习更加准确的蛋白语言表示。相比仅进行通用预训练的模型,继续进行酶特异性预训练后,模型困惑度进一步降低约5%至35%,表明酶序列具有独立于普通蛋白的重要统计规律。
研究人员进一步利用降维可视化分析不同酶类别的表示空间。结果显示,仅进行通用预训练时,各EC类别之间混杂明显;而经过酶特异性继续训练后,同类酶逐渐聚集,不同催化类别之间分离更加明显,说明模型成功学习到催化功能相关表示。
与此同时,由于Mamba替代大量自注意力计算,EnzGFM推理速度明显提高,在相同参数规模下相比Transformer蛋白语言模型加速约2~5倍,为大规模酶筛选提供了重要基础。

图1:EnzGFM总体框架,包括层次化预训练流程、Mamba–Transformer混合架构、模型缩放规律及酶表示空间可视化。
酶动力学参数预测性能显著提升
研究人员首先评估模型预测酶动力学参数的能力,包括催化常数kcat、米氏常数Km以及催化效率kcat/Km。
在传统随机划分数据集上,EnzGFM整体性能已达到目前先进水平。其中,15亿参数模型在kcat预测中与当前最大蛋白语言模型基本持平,而650M模型在Km预测上进一步超过ESM2。
为了更加真实评价泛化能力,研究人员进一步采用低序列相似性划分方式,使测试酶与训练酶相似性低于40%。这一更加困难的任务中,EnzGFM优势更加明显。其中150M模型取得最佳表现,相比同规模ESM2,在kcat预测中提高约16.7%,Km提高约2%,催化效率提高约6%。
研究人员进一步将EnzGFM替换已有多个动力学预测模型中的蛋白编码器。无论是UniKP、TurNuP、CataPro还是CatPred,只需更换蛋白语言模型,其预测性能均进一步提高。这说明EnzGFM学习到的表示具有良好的迁移能力,可直接作为酶动力学预测的统一基础模型。

图2:EnzGFM在kcat、Km及催化效率预测中的性能比较,以及不同模型规模和不同数据划分方式下的实验结果。
酶–反应匹配与EC分类进一步提升
除了动力学预测,研究人员进一步测试模型在酶–反应对应关系预测中的能力。
利用ReactZyme基准数据集,EnzGFM能够根据酶序列准确识别对应催化反应,同时完成反向反应检索酶序列任务。在酶检索反应方向,15亿参数模型平均准确率提高约16%;在反应检索酶方向,同样获得明显提升。进一步分析发现,无论蛋白长度、分子量、疏水性还是底物类型发生变化,模型均保持稳定预测性能,说明其具有较好的泛化能力。
随后,研究人员进一步评估EC编号预测。EC编号描述酶催化反应类别,是酶功能注释的重要依据。实验表明,在不同序列相似性水平下,EnzGFM均保持领先优势。当测试序列与训练序列仅具有10%相似性时,模型优势最为明显,相比ESM2提高约13%。这一结果说明EnzGFM能够有效学习酶催化功能,而不仅仅依赖序列同源性。
进一步可视化分析显示,不同EC亚类在表示空间形成清晰聚类,即使同属于一个大类,不同亚类之间仍保持明显区分,说明模型已经学习到精细催化功能特征。

图3:EnzGFM在酶–反应检索中的性能比较,包括MAP、Top-k准确率及模型缩放分析。

图4:EnzGFM在EC编号预测中的性能比较、不同序列相似性条件下的泛化能力及表示空间聚类分析。
单点突变效应预测与实验验证
为了评价模型在酶工程中的应用价值,研究人员进一步预测单个氨基酸突变对酶功能的影响。
在包含225组实验数据的突变数据库中,EnzGFM总体预测准确率明显优于ESM-1V和ESM2。其中,对底物结合能力相关突变预测优势最大,相比ESM-1V提高约189%;催化活性预测同样取得稳定提升;而在蛋白稳定性预测方面,两者性能基本接近,说明结构稳定性仍需结合更多三维结构信息进一步提高。
进一步分析发现,模型自注意力明显集中于催化位点、活性位点以及底物结合位点,这说明模型自动学习到了酶催化最重要的功能区域,而无需任何人工标注。
最后,研究人员开发EnzGFM-Agent,并以分泌型碱性磷酸酶开展实验验证。模型首先预测所有可能单点突变,再筛选最有希望的候选突变进行实验测试。结果显示,由EnzGFM筛选出的5个专属突变全部提高酶活性,其中A46I突变活性提高约6.5倍;相比之下,ESM2推荐的部分突变反而降低活性。这说明EnzGFM-Agent能够显著提高有益突变富集效率,减少实验筛选工作量。

图5:EnzGFM单点突变效应预测,包括不同功能参数预测、不同突变类别分析及典型酶实例。

图6:EnzGFM-Agent整体框架及分泌型碱性磷酸酶单点突变实验验证结果。
讨论
研究人员提出的EnzGFM首次构建了专门面向酶催化性质预测的蛋白质语言模型。与现有通用蛋白语言模型相比,该模型通过酶特异性继续预训练,使模型能够学习催化相关序列模式,同时利用Mamba–Transformer混合架构显著降低计算复杂度,实现准确率和推理效率同步提升。
研究结果表明,EnzGFM不仅能够提高动力学参数预测、酶–反应匹配、EC分类以及突变效应预测性能,而且学习得到的表示能够迁移到多个不同下游任务,成为统一的酶基础模型。相比单纯扩大模型规模,针对酶领域开展继续预训练带来的性能提升更加稳定,也更符合实际酶工程需求。
EnzGFM-Agent进一步将模型预测与实验设计连接起来,实现候选突变自动筛选和实验决策支持。实验验证证明,该系统能够显著富集有益突变,在较小候选集合中即可获得多个活性显著提高的酶突变体,为定向进化提供了新的人工智能工具。
研究人员同时指出,目前模型仍主要依据蛋白一级序列进行预测,对于酶活性高度依赖三维结构和构象变化的任务仍存在一定限制。未来可进一步融合AlphaFold结构、多模态蛋白基础模型及实验数据,提高稳定性预测和复杂催化机制建模能力。同时,扩大稀有酶家族数据规模以及主动学习策略,也有望进一步提升模型对低频催化类型的泛化能力。
总体而言,EnzGFM展示了领域专用蛋白质语言模型在酶催化预测中的巨大优势,而EnzGFM-Agent则进一步打通了从序列理解、催化预测到实验设计的完整流程,为智能酶工程、代谢工程和生物制造提供了高效的人工智能基础平台。
整理 | DrugOne团队
参考资料
Wang, C., Li, M., Geng, S. et al. An enzyme-specific protein language model for catalytic property prediction. Nat Commun (2026).
https://doi.org/10.1038/s41467-026-75283-3

内容为【DrugOne】公众号原创|转载请注明来源