深度学习方法已彻底改变了科学家预测基因组中DNA序列活性与功能的方式。由 Martin Vingron领导的生物信息学团队在马克斯·普朗克分子遗传学研究所(德国柏林)开发的一种名为Corgi(上下文感知调控基因组推断)的新人工智能工具,使研究人员能够预测基因组在不同细胞类型中的行为特征。这些发现有望助力提升在虚拟环境中模拟细胞活动的研究水平,并在基础研究与医学领域具有潜在应用价值。该研究发表于《自然·通讯》。
尽管我们体内的不同细胞看似相似,但由于微小的遗传变异,每个人都有独特的基因组成。这些变异能够改变细胞中的基因表达。研究人员对这类变异的兴趣与日俱增,因为它们可能参与疾病的发生机制,并为个性化医疗干预提供重要依据。然而,只有少数变异在功能上具有重要意义。近年来,基于人工智能的工具已被开发出来,能够从序列数据中预测这些变异的影响,并对最重要的变异进行优先排序。
这些工具中的许多都存在根本性的局限性。有些无法将其预测范围扩展到训练数据之外,因为它们未能考虑决定基因开启或关闭的细胞环境因素。
借助Corgi,我们构建了一种能够克服上述诸多局限性的模型。它能够准确预测与基因组活性相关的各项指标,包括基因表达、染色质可及性以及组蛋白修饰等,”该研究的第一作者埃金·德尼兹·阿克苏表示
早期的模型通常忽视了这一细胞环境,仅依赖序列信息。这些模型在大规模数据集上进行训练,将DNA序列与输出结果(如RNA活性或染色质可及性)相关联。然而,问题在于,DNA并非孤立发挥作用,而是与大量调控分子共同协作。例如,同一段DNA序列在神经元中的表现可能与在肝细胞中的表现不同,这是因为每种细胞都含有不同的调控分子组合。

研究人员设计了一种架构,旨在模仿细胞通过反式因子读取调控基因组的机制。该模型首先通过卷积层提取顺式调控特征,并通过一个作用于反式调控因子表达水平的多层感知器提取反式调控特征。这些特征通过FiLM层进行整合,该层施加基于特征的仿射变换,类似于生物物理中的“亲和力×浓度”模型。与单一的转录因子不同,这些特征是由模型学习得到的跨调控因子的组合。随后,带有FiLM层的Transformer模块以细胞类型特异性的方式捕获基因组内的长程相互作用。
为了训练我们的模型,我们如今构建了一种更贴近细胞内真实生物学机制的架构,该架构整合了大量调控基因的表达数据,”埃金·德尼兹·阿克苏表示。
该工具的改进版本名为Corgi+,能够从RNA测序数据中推断表观遗传信息。经过进一步优化后,研究人员未来有望借助该工具填补数据集中的重大空白,而无需逐一开展所有实验,尤其是在涉及稀有细胞类型、胚胎以及有限的患者组织样本时。
科学家们希望他们的方法也能改进虚拟细胞模型。这类系统旨在从细胞层面模拟基因扰动的影响,但尚未纳入有关DNA活性的信息。
我们相信,我们的模型未来有望助力将序列—功能模型与虚拟细胞相融合,”埃金·德尼兹·阿克苏表示。
从长远来看,这类系统有望帮助科学家在虚拟环境中筛选药物候选物,并揭示某些突变如何改变细胞过程、进而导致复杂的疾病表型。
参考文献:Aksu ED, Vingron M. (2026) Context-aware sequence-to-function model of human gene regulation. Nature Communications 17(1):6200.