
一个完整的结构生物学/计算药物设计工作流:
EGFR突变 → 突变蛋白结构预测 → WT/Mut结构比较 → 突变造成的构象变化 → 找结合口袋 → 药物对接 → MD验证 → MM/PBSA/自由能 → 设计/筛选新抑制剂 → 实验验证
下面以 EGFR L858R、Exon 19 deletion、Exon 20 insertion 为主线详细拆开。

EGFR(Epidermal Growth Factor Receptor)是一个受体酪氨酸激酶(RTK)。
它大体可以分成:
胞外结构域
│
│ EGF结合
↓
跨膜区
│
↓
胞内酪氨酸激酶结构域
│
↓
C-terminal tail
│
↓
下游信号
RAS-RAF-MEK-ERK
PI3K-AKT-mTOR
STAT真正适合进行:
的核心,是胞内 kinase domain(KD)。
EGFR激酶结构域大约是:
残基 696–1022
其中最重要的是:
N-lobe
├── β-sheet
├── ATP-binding pocket
└── αC-helix
↓
ATP binding site
↓
C-lobe
├── catalytic loop
├── activation loop
└── substrate binding regionEGFR 的许多致癌突变,实际上就是改变这个 kinase domain 的构象平衡。
如果你准备建立一个结构计算体系,我建议至少比较:
类型 | 突变 | 外显子 | 结构位置 | 主要意义 |
|---|---|---|---|---|
WT | EGFR-WT | — | — | 对照 |
L858R | Leu858→Arg | Exon 21 | activation loop | 激活突变 |
Ex19del | 如 E746_A750del | Exon 19 | β3–αC loop | 激活突变 |
Ex20ins | 如 D770_N771insNPG | Exon 20 | αC-helix附近 | 激活+TKI耐药 |
T790M | Thr790→Met | Exon 20 | gatekeeper | 获得性耐药 |
C797S | Cys797→Ser | Exon 20 | ATP pocket | 三代TKI耐药 |
这里尤其需要注意:
“19、20号外显子突变”不是一种突变。
例如:
最经典的是:
E746_A750del
也就是:
WT:
...E746-L747-R748-E749-A750...
Mutation:
... ΔELREA而 Exon 20 则包括很多不同的 insertion,例如:
D770_N771insNPG
它们虽然都叫 Exon 20 insertion,但结构效应并不完全一样。
这是整个 EGFR 结构生物学中非常经典的问题。
L858 位于:
activation loop(A-loop)
原本:
L858 = Leucine突变:
L858R
Leu → Arg也就是:
疏水氨基酸
↓
带正电的大侧链这不是简单的“一个氨基酸换掉了”。
真正重要的是:
它改变了 EGFR kinase domain 的构象能量景观。
可以简单理解成:
┌──────────────┐
│ │
↓ │
Inactive EGFR ⇄ Active EGFR
│
↓
ATP binding
↓
phosphorylation正常情况下:
inactive state 占比较大的比例。
L858R改变activation loop附近的局部环境,使inactive kinase构象不再那么稳定。
结果:
WT
Inactive
↑
│
│ equilibrium
│
↓
Active
L858R
Inactive
↓
↓
Active
↑↑↑所以:
L858R不是简单地“让ATP结合更强”。
它更核心的作用是:
改变active/inactive构象之间的能量平衡,使active kinase构象更容易出现。
近期结构/动力学研究也支持 L858R 会稳定活性构象,并影响EGFR二聚化及更高阶组装。
这里就非常适合做结构模拟。
经典突变:
E746_A750del
删除:
E746
L747
R748
E749
A750也就是:
ELREA
它所在的位置非常关键:
β3
│
↓
β3–αC loop
│
↓
αC-helixαC-helix 是EGFR kinase activation的核心结构元件。
可以简单画成:
β3
│
│
└──── loop ──── αC helix
│
│
↓
active/inactive
switchExon19 deletion缩短了这个loop。
于是会使αC-helix更倾向于:
inward / active position
而不是:
outward / inactive position
所以:
Ex19 deletion
↓
β3-αC loop缩短
↓
αC-helix构象受到限制
↓
active conformation ↑
↓
EGFR kinase activity ↑这也是为什么 Ex19del 和 L858R 都属于经典的 EGFR sensitizing mutations。
不过有一个非常重要的结构计算细节:
不要期待突变后一定出现“肉眼可见的大结构变化”。
一些晶体结构研究发现,Ex19del和WT整体结构差异可能并不巨大,真正重要的可能是构象分布、动态行为以及active/inactive state population改变。
这就是为什么:
MD往往比单纯的静态结构比较更有价值。
这就是一个非常漂亮的结构药理学案例。
典型:
D770_N771insNPG
发生在:
αC-helix / αC-β4 loop附近插入的氨基酸形成一个类似:
structural wedge(结构楔子)
把αC-helix推向active conformation。
可以理解为:
WT
αC-helix
↔
inactive / active
Ex20 insertion
NPG
↓
[WEDGE]
↓
αC-helix → ACTIVE因此:
Ex20 insertion
↓
αC-helix被锁定
↓
active kinase
↓
持续信号但问题来了:
为什么它不像L858R一样对经典TKI敏感?
关键在于:
L858R / Ex19del:
ATP affinity ↓
↓
TKI相对更容易竞争ATP
↓
drug sensitivity ↑而典型Ex20ins:
ATP affinity ≈ 保持
↓
ATP仍然强烈竞争
↓
经典TKI难以获得足够选择性同时,插入突变会使:
αC-helix + phosphate-binding loop(P-loop)
发生位置变化,部分药物进入结合口袋时出现steric hindrance(空间位阻)。
这就是:
为什么“都是EGFR激活突变”,但药物敏感性却完全不同。
把三个突变放在一起:
EGFR kinase domain
N-lobe C-lobe
┌─────────────┐ ┌───────────────┐
│ │ │ │
│ β-sheet │ │ catalytic │
│ │ │ loop │
│ αC-helix │ │ │
│ ↓ │ │ activation │
│ ATP │ │ loop │
└─────────────┘ └───────────────┘
↑ ↑ ↑
Ex19del L858R T790M
↑
Ex20ins更准确地说:
突变 | 主要影响 |
|---|---|
Ex19del | β3–αC loop / αC-helix |
L858R | activation loop |
Ex20ins | αC-helix/αC-β4 loop |
T790M | ATP pocket gatekeeper |
C797S | ATP pocket / covalent inhibitor site |
这里建议你不要一上来就AlphaFold。
如果研究EGFR:
直接使用实验结构。
因为EGFR kinase domain已经有大量:
晶体结构。
例如经典EGFR-erlotinib结构:
PDB: 1M17
就是非常经典的EGFR kinase结构。
如果研究的是:
EGFR-WT
EGFR-L858R
EGFR-Ex19del
EGFR-Ex20ins并且某个具体突变没有实验结构:
可以:
AlphaFold 3 / AlphaFold 2预测
EGFR-WT
↓
结构预测
EGFR-L858R
↓
结构预测
EGFR-Ex19del
↓
结构预测
EGFR-Ex20ins
↓
结构预测然后比较。
但是:
AlphaFold给你的主要是一个静态结构模型,而突变导致的功能差异往往属于构象动力学问题。
因此:
AlphaFold → MD
通常比:
AlphaFold → docking
更加合理。
如果以后想真正做一个论文级的EGFR计算药物研究,可以按照:
EGFR mutation
│
┌───────────┼───────────┐
↓ ↓ ↓
L858R Ex19del Ex20ins
│ │ │
└───────────┼───────────┘
↓
Protein structure
↓
Experimental PDB / AF3
↓
Structure QC
↓
WT vs mutant comparison
↓
Molecular dynamics
↓
┌────────────────┼─────────────────┐
↓ ↓ ↓
RMSD/RMSF Rg/H-bond PCA/DCCM
↓ ↓ ↓
Conformational analysis
↓
Binding pocket
↓
Drug docking
↓
┌───────────┼────────────┐
↓ ↓ ↓
Gefitinib Osimertinib New compounds
↓ ↓ ↓
MD simulation
↓
MM/PBSA/MMGBSA
↓
Binding free energy
↓
Lead compound selection
↓
Experimental validation建议优先从PDB获取。
例如:
可以选择经典:
1M17
EGFR kinase + erlotinib。
还可以寻找:
例如你有:
WT EGFR要构建:
EGFR L858R
EGFR E746_A750del
EGFR D770_N771insNPG
EGFR T790M可以使用:
非常建议你把这个EGFR案例作为PyRosetta练习项目。
这是非常关键的一点。
例如:
WT EGFR
↓
L858R直接:
L858R
↓
Docking
↓
Osimertinib存在一个问题:
突变侧链只是“换了一个氨基酸”,并不代表整个蛋白已经达到了真实的突变构象。
所以需要:
mutation
↓
side-chain repacking
↓
energy minimization
↓
MD equilibration
↓
conformational sampling
↓
representative structure
↓
docking这会更加可靠。
比如:
EGFR-L858R
↓
添加氢
↓
补缺失原子
↓
选择质子化状态
↓
force field
↓
Energy minimization可以使用:
推荐:
GROMACS作为MD主工具。
这一步实际上是整个研究最关键的地方。
例如:
EGFR-WT
EGFR-L858R
EGFR-Ex19del
EGFR-Ex20ins分别:
Protein
↓
TIP3P water
↓
Na+/Cl-
↓
NPT
↓
Equilibration
↓
Production MD例如可以设计:
每个体系:
3 × 100 ns
或者
3 × 200 ns而不是只跑一次100 ns。
因为:
单次MD trajectory很容易受到初始构象和随机速度的影响。
RMSD、Rg、氢键等。
看整体结构稳定性:
RMSD
│
│ ─────────
│ ──
│ ──
└──────────────── time比较:
WT
L858R
Ex19del
Ex20ins看哪些氨基酸运动发生变化:
RMSF
│ /\ /\
│ / \ / \
│_____/____\__________/____\____
↑
αC重点观察:
如果L858R导致activation loop运动模式改变:
RMSF可能直接体现出来。
EGFR kinase domain:
Radius of gyration主要用于判断:
整体紧致程度有没有变化。
但对EGFR突变而言:
Rg通常不是最有解释力的指标。
所以不要把论文重点放在Rg。
非常重要。
例如:
L858R
↓
Arg858
↓
与附近残基形成新的
electrostatic interaction
/H-bond
↓
activation loop稳定这类分析可以直接把:
“突变”
连接到:
“结构机制”。
例如:
Arg858
│
│ distance
↓
Asp / Glu统计:
distance vs time如果:
WT
interaction occupancy = 10%
L858R
interaction occupancy = 70%就能说明:
突变形成了新的稳定相互作用网络。
Dynamic Cross-Correlation Matrix:
residue
1 2 3 4 5...
┌─────────────
1 │ + + - -
2 │ + + - -
3 │ - - + +
│它可以回答:
L858R是不是改变了不同结构区域之间的协同运动?
例如:
activation loop
↕
αC-helix
↕
ATP pocket如果突变改变了这些区域之间的动态耦合:
这比单纯说:
“RMSD变化了0.2 Å”
有生物学意义得多。
Principal Component Analysis:
PC2
↑
│ WT
│ ● ● ●
│
│ L858R
│ ● ● ●
│
└──────────────────→ PC1如果:
WT trajectory和:
L858R trajectory在PCA空间明显分开:
说明:
突变改变了蛋白的主要构象运动模式。
这对于EGFR特别有价值。
假设你研究:
可以设计:
EGFR-WT + osimertinib
EGFR-L858R + osimertinib
EGFR-Ex19del + osimertinib
EGFR-Ex20ins + osimertinib然后进行:
Molecular docking
常用:
你已经在学习 Vina,因此完全可以用:
Vina → PyRosetta/GROMACS → MD
这个组合。
Docking主要回答:
“药物能不能以合理构象进入这个binding pocket?”
例如:
EGFR
┌───────────────┐
│ │
│ ATP pocket │
│ ↓ │
│ ┌───────┐ │
│ │ Drug │ │
│ └───────┘ │
│ │
└───────────────┘然后看:
以第一代TKI为例:
EGFR ATP-binding pocket
hinge region
↓
──────────
│
Drug
│
──────────许多ATP竞争型EGFR-TKI会与:
hinge region
形成关键氢键。
所以:
ATP
↓
ATP pocket
Drug
↓
竞争ATP
↓
EGFR phosphorylation ↓
↓
RAS/MAPK ↓
PI3K/AKT ↓
↓
tumor cell proliferation ↓Osimertinib是第三代EGFR-TKI。
它有一个非常关键的特点:
covalent irreversible inhibition
也就是:
EGFR Cys797
↑
│
└── covalent bond
↑
Osimertinib所以:
Osimertinib
↓
进入ATP pocket
↓
识别Cys797附近区域
↓
形成共价键
↓
EGFR kinase被不可逆抑制这也是为什么在结构计算中:
Osimertinib不能完全按照普通reversible docking理解。
最好采用:
covalent docking / covalent modeling
或者至少在MD中明确考虑Cys797共价连接状态。
这一步就是你之前一直在问的:
为什么Vina以后还要做MD?
原因非常简单:
静态结构
↓
搜索几个可能poseprotein + ligand + water
↓
真实动态环境
↓
100 ns / 200 ns
↓
判断这个pose是否稳定因此:
Vina
↓
Top 10 poses
↓
选择合理pose
↓
MD
↓
稳定pose例如:
Drug
│
├── H-bond → Met793
│
├── H-bond → Lys745
│
└── interaction → Cys797计算:
occupancy比如:
Met793
H-bond occupancy = 82%
Cys797
interaction = 91%比单纯Docking的:
-8.5 kcal/mol
更有说服力。
例如:
WT + drug
L858R + drug
Ex19del + drug
Ex20ins + drug计算:
ΔGbind
通常:
ΔGbind = ΔEMM
+ ΔGpolar
+ ΔGnonpolar
- TΔS最终可以比较:
EGFR | Drug | ΔGbind |
|---|---|---|
WT | Osimertinib | -X |
L858R | Osimertinib | -Y |
Ex19del | Osimertinib | -Z |
Ex20ins | Osimertinib | -A |
如果:
L858R -60
Ex19del -58
Ex20ins -40那么可以提出:
Ex20ins对该药物结合不利。
但要注意:
MM/PBSA适合做相对比较和机制支持,不应该把绝对数值当成真实实验Kd。
这就进入:
整个过程:
Mutation
↓
Structure
↓
Binding pocket
↓
Hotspot identification
↓
Virtual screening
↓
Docking
↓
MD
↓
MM/GBSA
↓
Lead compounds
↓
Molecular optimization
↓
Experimental validation这是非常有研究价值的。
因为Ex20ins存在:
经典TKI耐药问题。
结构研究发现:
Ex20 insertion
↓
αC-helix位置变化
↓
ATP pocket空间变化
↓
经典TKI steric clash
↓
drug resistance因此你的设计策略可以是:
寻找:
能够避开steric clash的ATP-site inhibitor
设计:
Covalent inhibitor
寻找Cys797附近合理exit vector。
设计:
Allosteric inhibitor
不再直接竞争ATP。
而是:
allosteric pocket
↓
锁定inactive EGFR
↓
阻止activation这类思路非常重要,因为近年来EGFR结构药理学越来越强调:
conformational/selective allosteric inhibition
而不是单纯ATP竞争。
可以把整个科学问题总结成:
EGFR mutation
│
┌─────────────┼─────────────┐
↓ ↓ ↓
L858R Ex19del Ex20ins
│ │ │
↓ ↓ ↓
Activation loop αC-helix αC-helix
│ │ │
└─────────────┼─────────────┘
↓
kinase conformation
↓
active/inactive equilibrium
↓
ATP binding
↓
drug binding pocket
↓
┌────────────┴────────────┐
↓ ↓
sensitive resistant
↓ ↓
EGFR inhibitors novel inhibitors
↓ ↓
Docking Docking
↓ ↓
MD MD
↓ ↓
MM/PBSA MM/PBSA
↓ ↓
validation optimization建议直接做下面这个课题:
设计4组:
Group 1 EGFR-WT
Group 2 EGFR-L858R
Group 3 EGFR-Ex19del
Group 4 EGFR-Ex20ins每组:
apo protein
+
drug-bound protein于是:
4 × 2 = 8个体系
例如:
WT
L858R
Ex19del
Ex20ins
×
apo
osimertinibRMSD
RMSF
Rg
SASA
secondary structurePCA
DCCM
Free energy landscape重点:
αC-helix
P-loop
activation loop
hinge
gatekeeper
Cys797H-bond
hydrophobic interaction
π-π
salt bridge
contact frequency
distanceMM/PBSA
MM/GBSA
per-residue decomposition这个非常适合做论文图。
例如:
Residue contribution
Met793 ███████████
Leu718 ███████
Val726 █████
Lys745 ████
Cys797 █████████
Arg858 ██然后你就可以回答:
到底是哪些氨基酸决定了突变体与药物的结合差异?
进一步:
Mutation
↓
Residue interaction network
↓
Binding pocket remodeling
↓
Drug binding change这就从:
“做MD”
升级到了:
“解释药物机制”。
如果你不是只研究现有药物,而是想:
“寻找一个新的EGFR突变选择性抑制剂”
可以:
EGFR mutant structure
↓
Binding pocket
↓
ZINC / Enamine / ChEMBL等化合物库
↓
Virtual screening
↓
Docking
↓
Top 100
↓
Top 20
↓
MD
↓
MM/GBSA
↓
Top 5
↓
实验这就是现在非常热门的方向:
EGFR mutation
↓
Structure
↓
Pocket
↓
AI molecular generation
↓
生成新分子
↓
Docking
↓
MD
↓
ADMET
↓
合成
↓
实验验证例如可以结合:
形成:
AI + Structure-based Drug Design + MD
的完整体系。
不能简单理解成:
“Docking分数最低 = 最好的药。”
实际上:
Docking score
↓
只是第一轮筛选真正可靠的证据链应该是:
Docking
↓
合理binding pose
↓
MD稳定
↓
关键H-bond/contact稳定
↓
PCA/DCCM支持构象机制
↓
MM/PBSA支持结合差异
↓
突变体选择性
↓
细胞实验
↓
酶活实验
↓
SPR/ITC/Kd
↓
动物实验最终才能形成完整的药物发现证据链。
对于经典:
Exon 19 deletion / L858R
目前临床上已经有多种EGFR靶向方案,第三代TKI osimertinib 是非常重要的代表;FDA也批准其用于这两类EGFR突变的NSCLC,并批准其与铂类化疗联合的一线方案。
此外,2024年FDA还批准:
lazertinib + amivantamab
用于EGFR Ex19del/L858R的一线治疗。
而对于:
EGFR Exon 20 insertion
情况完全不同。
这正好说明:
“同一个靶点、不同突变 → 不同蛋白构象 → 不同药物结合模式 → 不同临床药物敏感性。”
截至目前,FDA已经在2025年批准 sunvozertinib 用于铂类化疗后进展的EGFR Exon 20 insertion转移性NSCLC。
所以Ex20ins是一个非常适合做:
突变结构 → docking → MD → 药物设计
的真实案例。
真正要学习的不是“怎么跑Vina”或者“怎么跑GROMACS”,而是下面这个逻辑:
EGFR突变改变局部结构和构象能量景观 → 改变αC-helix、activation loop、ATP pocket等关键区域的动态行为 → 改变ATP/TKI结合模式 → 造成药物敏感或耐药 → 利用结构预测、分子对接和MD寻找稳定结合构象 → 用MM/PBSA和残基能量分解定位关键作用残基 → 根据突变特异性口袋设计/筛选新的EGFR抑制剂 → 最终通过酶活、SPR/ITC、细胞和动物实验验证。
这实际上就是一个完整的结构基础药物设计(Structure-Based Drug Design, SBDD)项目。
下一步最推荐直接做一个“EGFR-L858R从PDB结构获取 → PyMOL构建突变 → GROMACS建模 → 100 ns MD → RMSD/RMSF/PCA/DCCM → AutoDock Vina对接Gefitinib/Osimertinib → 再MD → MM/PBSA → PyMOL出论文级结构图”的完整实战案例。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。