370

de novo 蛋白结合物设计:RFdiffusion 走进生物药

RFdiffusion 让从头设计蛋白结合物成为可操作的流程。这篇给出完整管线、计算过滤判据与实验成功率的现实预期。

从头设计一个能结合指定靶标的蛋白(de novo binder),几年前还是研究课题,现在已有可操作的开源管线。但要清楚它的实际成功率和适用边界,才能合理规划实验投入。

标准三段式管线

阶段 工具 产出
1. 骨架生成 RFdiffusion(见 197《RFdiffusion》 三维骨架(无序列)
2. 序列设计 ProteinMPNN(见 196《ProteinMPNN》 能折成该骨架的氨基酸序列
3. 计算验证 AlphaFold2 / ESMFold 自洽性检验,过滤候选
4. 实验验证 高通量表达 + 结合测试 真实命中

第一步:生成骨架

# 结合物设计模式
./scripts/run_inference.py \
  inference.input_pdb=target.pdb \
  'contigmap.contigs=[A17-145/0 70-100]' \
  'ppi.hotspot_res=[A59,A83,A91]' \
  inference.num_designs=1000 \
  inference.output_prefix=out/binder \
  denoiser.noise_scale_ca=0.5 \
  denoiser.noise_scale_frame=0.5

两个参数决定成败:

  • contigsA17-145 表示保留靶标 A 链 17–145 号残基,/0 表示链断开,70-100 表示生成一段 70~100 残基的新链。
  • hotspot_res指定靶标表面你希望结合物接触的关键残基。选择原则:
    • 位于目标功能位点(如要阻断的相互作用界面);
    • 表面暴露且有一定凹陷;
    • 疏水残基通常是好的锚点;
    • 选 3~5 个,过多会过度约束,过少则设计发散

noise_scale 降低(如 0.5)通常提高设计质量但降低多样性,是结合物设计的常用设置。

第二步:设计序列

python protein_mpnn_run.py \
  --pdb_path backbone.pdb \
  --pdb_path_chains "B" \
  --out_folder designs/ \
  --num_seq_per_target 48 \
  --sampling_temp "0.1" \
  --omit_AAs "C" \
  --use_soluble_model \
  --seed 37
  • --sampling_temp 0.1:低温度更保守、折叠成功率高;
  • --omit_AAs "C":排除半胱氨酸,避免非预期二硫键;
  • --use_soluble_model:用可溶性优化的权重;
  • 只设计结合物链(--pdb_path_chains "B"),靶标链保持不变。

第三步:计算过滤(决定实验成功率的关键)

# 对每个设计序列,用 AF2 预测复合物结构,检查自洽性

import json
import numpy as np
from Bio.PDB import PDBParser, Superimposer

def filter_designs(design_pdb, af2_pdb, af2_metrics):
    """三个核心判据"""
    checks = {}

    # 1) 自洽性:AF2 预测的结构是否回到设计骨架
    #    判据:Cα RMSD < 2.0 Å
    rmsd = compute_backbone_rmsd(design_pdb, af2_pdb)
    checks["rmsd"] = rmsd
    checks["rmsd_pass"] = rmsd < 2.0

    # 2) 折叠置信度
    #    判据:结合物链的 pLDDT > 80
    checks["binder_plddt"] = af2_metrics["binder_plddt"]
    checks["plddt_pass"] = af2_metrics["binder_plddt"] > 80

    # 3) 界面质量 —— 最关键的判据
    #    判据:pAE_interaction < 10
    checks["pae_interaction"] = af2_metrics["pae_interaction"]
    checks["pae_pass"] = af2_metrics["pae_interaction"] < 10

    checks["all_pass"] = all([checks["rmsd_pass"], checks["plddt_pass"],
                              checks["pae_pass"]])
    return checks

# 可选的额外过滤:
#   - Rosetta 界面能量(ddG)
#   - 埋藏溶剂可及表面积(BSA > 800 Ų 较好)
#   - 形状互补性(shape complementarity)
#   - 无暴露的疏水补丁(可开发性)

pAE_interaction 是最有预测力的单一指标:它衡量 AF2 对「结合物与靶标的相对位置」有多确信。多项工作发现它与实验成功率的相关性最好。

现实的成功率

阶段 典型数量
生成骨架 1,000~10,000
× 每骨架序列数 × 8~48
AF2 回测 数万次预测(算力主要在此)
通过计算过滤 数十到数百
送实验 96 孔板量级
实验命中 个位数到十几个百分点

这个成功率已经远优于以往方法,但意味着一次实验轮次仍需测试几十到上百个设计。把它想象成「一发命中」是不现实的——实验体系必须能支撑这个通量。

难度分级

靶标特征 难度
结构清晰、有明显凹陷、刚性 可行
疏水表面可用作锚点 可行
平坦的 PPI 界面 困难
高度带电或高度亲水表面 困难
柔性区域 / 无序区 很困难
需要构象特异性(只结合某个状态) 很困难
需要极高亲和力(pM 级) 通常需后续优化

从设计到药物还有多远

拿到一个高亲和力的设计蛋白,距离成为药物还有很长的路:

  • 可开发性:表达量、可溶性、聚集倾向、热稳定性(见 367《抗体可开发性 Developability》);
  • 免疫原性人工设计的序列在人体中是完全外源的,免疫原性风险需要认真评估(见 368《免疫原性预测》);
  • 药代:小蛋白清除快,通常需要半衰期延长策略;
  • 生产:细胞株开发、纯化工艺;
  • 体内功效:体外结合不等于体内有效。

目前 de novo 设计蛋白在诊断、研究工具、以及作为其它模态的组件(如 CAR 的识别域)上的应用,比作为独立治疗药物更成熟。

关键要点

  • 三段式管线(RFdiffusion → ProteinMPNN → AF2 回测)全部开源可用;
  • hotspot 残基的选择与 pAE_interaction 过滤是成败关键
  • 计算过滤后实验命中率在个位数到十几个百分点,需按批量规划实验;
  • 结构清晰有凹陷的靶标可行,平坦 PPI 界面仍很困难。

延伸资源