Generate:Biomedicines 专注生成式蛋白设计:不是从天然蛋白改造,而是用生成模型从头产生具有指定功能的蛋白序列与结构。它是「蛋白版的生成式 AI」这条路线的代表之一,公开发表过 Chroma 等蛋白生成模型。
蛋白生成与小分子生成的关键差别
| 维度 | 小分子生成 | 蛋白生成 |
|---|---|---|
| 搜索空间 | 约 10⁶⁰ 类药分子 | 20^N(100 残基即 10¹³⁰) |
| 「合成」难度 | 主要瓶颈,需多步有机合成 | 相对容易,基因合成 + 表达 |
| 验证周期 | 合成数周到数月 | 数周即可表达检测 |
| 一次可测数量 | 几十个 | 可达数千(高通量文库) |
| 结构预测 | 构象柔性大,难 | AlphaFold 已相当可靠 |
| 设计自洽性检验 | 无直接方法 | 可用结构预测回测 |
这几点差别使得蛋白设计的「设计-验证」闭环比小分子快得多。可以用 AlphaFold/ESMFold 在计算上先筛掉大部分不可行设计(见 196《ProteinMPNN》、197《RFdiffusion》),再高通量表达测试上千个候选。这个闭环速度,是生成式方法在蛋白领域进展相对更快的重要原因。
技术路线
- 骨架生成:用扩散模型等生成三维骨架(RFdiffusion 是开源代表,见 197《RFdiffusion》);
- 序列设计:给定骨架设计氨基酸序列(ProteinMPNN,见 196《ProteinMPNN》);
- 联合生成:Chroma 等模型试图同时生成结构与序列,并支持在生成时施加约束(如「要有一个特定的结合位点」「要是对称的」);
- 条件生成:按功能需求生成——结合特定靶标、具有特定形状、满足特定对称性。
标准的设计-验证管线
# 全开源可复现的三段式管线
# 1) 骨架生成(RFdiffusion,见 197)
./scripts/run_inference.py \
inference.input_pdb=target.pdb \
'contigmap.contigs=[A17-145/0 70-100]' \
'ppi.hotspot_res=[A59,A83,A91]' \
inference.num_designs=1000
# 2) 序列设计(ProteinMPNN,见 196)
python protein_mpnn_run.py --pdb_path backbone.pdb \
--num_seq_per_target 48 --sampling_temp "0.1"
# 3) 计算过滤(AlphaFold/ESMFold 回测)
# 判据:设计骨架 vs 预测结构 RMSD < 2 Å
# pLDDT > 80
# 结合物设计还要看 pAE_interaction < 10
# 4) 实验验证
# 通过计算过滤的设计送高通量表达与结合测试
# 实验命中率通常在个位数到十几个百分点
现实进展与限制
- 已经比较成熟:小型结合蛋白(binder)设计、对称组装体、稳定化已知折叠、motif scaffolding。
- 仍很困难:设计具有催化活性的酶(活性位点的精确几何要求极高);针对平坦 PPI 界面的高亲和力结合物;需要构象变化的动态蛋白;可成药性(稳定性、可表达性、免疫原性、药代)。
- 设计成功 ≠ 药物成功:一个能高亲和力结合靶标的设计蛋白,距离成为药物还有很长的路——半衰期、给药途径、免疫原性、生产工艺、临床疗效。这与小分子领域「设计出分子只是开始」是一样的道理。
- 免疫原性是生物药特有的大风险:人工设计的序列在人体内可能引发抗药抗体,这个风险目前的预测能力仍有限。
对从业者的启示
- 蛋白设计的核心工具已经开源:RFdiffusion + ProteinMPNN + AlphaFold 的组合能力很强,且完全免费。差异化不在工具,在实验通量与验证能力。
- 计算过滤是关键杠杆:能把实验命中率从千分之几提到百分之十几,靠的就是那几个自洽性判据。
- 做好批量实验的准备:命中率决定了必须一次测几十到上百个设计,实验体系要能支撑这个通量。
提示
公司管线与技术进展变动较快,本文为方向性观察,具体信息请以官方披露为准。蛋白设计的核心工具已开源,真正的门槛在实验验证通量与生物药开发能力。
延伸资源
- 开源工具:197《RFdiffusion》、196《ProteinMPNN》、195《ESMFold》;
- 同类公司:318《Absci》;蛋白与抗体见「新药模态」模块。