317

Generate:Biomedicines:生成式蛋白药物设计案例

Generate:Biomedicines 用生成式模型直接设计蛋白药物。这篇讲清生成式蛋白设计的技术路线、与小分子生成的差别及现实进展。

Generate:Biomedicines 专注生成式蛋白设计:不是从天然蛋白改造,而是用生成模型从头产生具有指定功能的蛋白序列与结构。它是「蛋白版的生成式 AI」这条路线的代表之一,公开发表过 Chroma 等蛋白生成模型。

蛋白生成与小分子生成的关键差别

维度 小分子生成 蛋白生成
搜索空间 约 10⁶⁰ 类药分子 20^N(100 残基即 10¹³⁰)
「合成」难度 主要瓶颈,需多步有机合成 相对容易,基因合成 + 表达
验证周期 合成数周到数月 数周即可表达检测
一次可测数量 几十个 可达数千(高通量文库)
结构预测 构象柔性大,难 AlphaFold 已相当可靠
设计自洽性检验 无直接方法 可用结构预测回测

这几点差别使得蛋白设计的「设计-验证」闭环比小分子快得多。可以用 AlphaFold/ESMFold 在计算上先筛掉大部分不可行设计(见 196《ProteinMPNN》197《RFdiffusion》),再高通量表达测试上千个候选。这个闭环速度,是生成式方法在蛋白领域进展相对更快的重要原因。

技术路线

  • 骨架生成:用扩散模型等生成三维骨架(RFdiffusion 是开源代表,见 197《RFdiffusion》);
  • 序列设计:给定骨架设计氨基酸序列(ProteinMPNN,见 196《ProteinMPNN》);
  • 联合生成:Chroma 等模型试图同时生成结构与序列,并支持在生成时施加约束(如「要有一个特定的结合位点」「要是对称的」);
  • 条件生成:按功能需求生成——结合特定靶标、具有特定形状、满足特定对称性。

标准的设计-验证管线

# 全开源可复现的三段式管线

# 1) 骨架生成(RFdiffusion,见 197)
./scripts/run_inference.py \
  inference.input_pdb=target.pdb \
  'contigmap.contigs=[A17-145/0 70-100]' \
  'ppi.hotspot_res=[A59,A83,A91]' \
  inference.num_designs=1000

# 2) 序列设计(ProteinMPNN,见 196)
python protein_mpnn_run.py --pdb_path backbone.pdb \
  --num_seq_per_target 48 --sampling_temp "0.1"

# 3) 计算过滤(AlphaFold/ESMFold 回测)
#    判据:设计骨架 vs 预测结构 RMSD < 2 Å
#          pLDDT > 80
#          结合物设计还要看 pAE_interaction < 10

# 4) 实验验证
#    通过计算过滤的设计送高通量表达与结合测试
#    实验命中率通常在个位数到十几个百分点

现实进展与限制

  • 已经比较成熟:小型结合蛋白(binder)设计、对称组装体、稳定化已知折叠、motif scaffolding。
  • 仍很困难:设计具有催化活性的酶(活性位点的精确几何要求极高);针对平坦 PPI 界面的高亲和力结合物;需要构象变化的动态蛋白;可成药性(稳定性、可表达性、免疫原性、药代)。
  • 设计成功 ≠ 药物成功:一个能高亲和力结合靶标的设计蛋白,距离成为药物还有很长的路——半衰期、给药途径、免疫原性、生产工艺、临床疗效。这与小分子领域「设计出分子只是开始」是一样的道理。
  • 免疫原性是生物药特有的大风险:人工设计的序列在人体内可能引发抗药抗体,这个风险目前的预测能力仍有限。

对从业者的启示

  • 蛋白设计的核心工具已经开源:RFdiffusion + ProteinMPNN + AlphaFold 的组合能力很强,且完全免费。差异化不在工具,在实验通量与验证能力。
  • 计算过滤是关键杠杆:能把实验命中率从千分之几提到百分之十几,靠的就是那几个自洽性判据。
  • 做好批量实验的准备:命中率决定了必须一次测几十到上百个设计,实验体系要能支撑这个通量。

提示

公司管线与技术进展变动较快,本文为方向性观察,具体信息请以官方披露为准。蛋白设计的核心工具已开源,真正的门槛在实验验证通量与生物药开发能力。

延伸资源