从头设计一个能结合指定靶标的蛋白(de novo binder),几年前还是研究课题,现在已有可操作的开源管线。但要清楚它的实际成功率和适用边界,才能合理规划实验投入。
标准三段式管线
| 阶段 | 工具 | 产出 |
|---|---|---|
| 1. 骨架生成 | RFdiffusion(见 197《RFdiffusion》) | 三维骨架(无序列) |
| 2. 序列设计 | ProteinMPNN(见 196《ProteinMPNN》) | 能折成该骨架的氨基酸序列 |
| 3. 计算验证 | AlphaFold2 / ESMFold | 自洽性检验,过滤候选 |
| 4. 实验验证 | 高通量表达 + 结合测试 | 真实命中 |
第一步:生成骨架
# 结合物设计模式
./scripts/run_inference.py \
inference.input_pdb=target.pdb \
'contigmap.contigs=[A17-145/0 70-100]' \
'ppi.hotspot_res=[A59,A83,A91]' \
inference.num_designs=1000 \
inference.output_prefix=out/binder \
denoiser.noise_scale_ca=0.5 \
denoiser.noise_scale_frame=0.5
两个参数决定成败:
contigs:A17-145表示保留靶标 A 链 17–145 号残基,/0表示链断开,70-100表示生成一段 70~100 残基的新链。hotspot_res:指定靶标表面你希望结合物接触的关键残基。选择原则:- 位于目标功能位点(如要阻断的相互作用界面);
- 表面暴露且有一定凹陷;
- 疏水残基通常是好的锚点;
- 选 3~5 个,过多会过度约束,过少则设计发散。
noise_scale 降低(如 0.5)通常提高设计质量但降低多样性,是结合物设计的常用设置。
第二步:设计序列
python protein_mpnn_run.py \
--pdb_path backbone.pdb \
--pdb_path_chains "B" \
--out_folder designs/ \
--num_seq_per_target 48 \
--sampling_temp "0.1" \
--omit_AAs "C" \
--use_soluble_model \
--seed 37
--sampling_temp 0.1:低温度更保守、折叠成功率高;--omit_AAs "C":排除半胱氨酸,避免非预期二硫键;--use_soluble_model:用可溶性优化的权重;- 只设计结合物链(
--pdb_path_chains "B"),靶标链保持不变。
第三步:计算过滤(决定实验成功率的关键)
# 对每个设计序列,用 AF2 预测复合物结构,检查自洽性
import json
import numpy as np
from Bio.PDB import PDBParser, Superimposer
def filter_designs(design_pdb, af2_pdb, af2_metrics):
"""三个核心判据"""
checks = {}
# 1) 自洽性:AF2 预测的结构是否回到设计骨架
# 判据:Cα RMSD < 2.0 Å
rmsd = compute_backbone_rmsd(design_pdb, af2_pdb)
checks["rmsd"] = rmsd
checks["rmsd_pass"] = rmsd < 2.0
# 2) 折叠置信度
# 判据:结合物链的 pLDDT > 80
checks["binder_plddt"] = af2_metrics["binder_plddt"]
checks["plddt_pass"] = af2_metrics["binder_plddt"] > 80
# 3) 界面质量 —— 最关键的判据
# 判据:pAE_interaction < 10
checks["pae_interaction"] = af2_metrics["pae_interaction"]
checks["pae_pass"] = af2_metrics["pae_interaction"] < 10
checks["all_pass"] = all([checks["rmsd_pass"], checks["plddt_pass"],
checks["pae_pass"]])
return checks
# 可选的额外过滤:
# - Rosetta 界面能量(ddG)
# - 埋藏溶剂可及表面积(BSA > 800 Ų 较好)
# - 形状互补性(shape complementarity)
# - 无暴露的疏水补丁(可开发性)
pAE_interaction 是最有预测力的单一指标:它衡量 AF2 对「结合物与靶标的相对位置」有多确信。多项工作发现它与实验成功率的相关性最好。
现实的成功率
| 阶段 | 典型数量 |
|---|---|
| 生成骨架 | 1,000~10,000 |
| × 每骨架序列数 | × 8~48 |
| AF2 回测 | 数万次预测(算力主要在此) |
| 通过计算过滤 | 数十到数百 |
| 送实验 | 96 孔板量级 |
| 实验命中 | 个位数到十几个百分点 |
这个成功率已经远优于以往方法,但意味着一次实验轮次仍需测试几十到上百个设计。把它想象成「一发命中」是不现实的——实验体系必须能支撑这个通量。
难度分级
| 靶标特征 | 难度 |
|---|---|
| 结构清晰、有明显凹陷、刚性 | 可行 |
| 疏水表面可用作锚点 | 可行 |
| 平坦的 PPI 界面 | 困难 |
| 高度带电或高度亲水表面 | 困难 |
| 柔性区域 / 无序区 | 很困难 |
| 需要构象特异性(只结合某个状态) | 很困难 |
| 需要极高亲和力(pM 级) | 通常需后续优化 |
从设计到药物还有多远
拿到一个高亲和力的设计蛋白,距离成为药物还有很长的路:
- 可开发性:表达量、可溶性、聚集倾向、热稳定性(见 367《抗体可开发性 Developability》);
- 免疫原性:人工设计的序列在人体中是完全外源的,免疫原性风险需要认真评估(见 368《免疫原性预测》);
- 药代:小蛋白清除快,通常需要半衰期延长策略;
- 生产:细胞株开发、纯化工艺;
- 体内功效:体外结合不等于体内有效。
目前 de novo 设计蛋白在诊断、研究工具、以及作为其它模态的组件(如 CAR 的识别域)上的应用,比作为独立治疗药物更成熟。
关键要点
- 三段式管线(RFdiffusion → ProteinMPNN → AF2 回测)全部开源可用;
- hotspot 残基的选择与
pAE_interaction过滤是成败关键; - 计算过滤后实验命中率在个位数到十几个百分点,需按批量规划实验;
- 结构清晰有凹陷的靶标可行,平坦 PPI 界面仍很困难。