Boltz(MIT,Boltz-1 / Boltz-2)是 AlphaFold3 级别生物分子复合物结构预测的开源实现,最大特点是代码与权重都采用 MIT 许可——商业使用没有限制。在 AF3 官方权重受非商业条款约束、HelixFold3 同样受限的背景下,这一点让它成为工业界最实际的选择之一。
安装与推理
pip install boltz
# 最简单:一个 FASTA 就能跑
boltz predict input.fasta --use_msa_server --out_dir results/
# 复杂体系用 YAML 描述
boltz predict complex.yaml --use_msa_server --diffusion_samples 5
--use_msa_server 调用远程 MSA 服务,省掉本地几百 GB 序列数据库,这是它上手体验远好于 OpenFold 的关键。注意:走远程意味着序列会离开本地,敏感靶点序列不要用这个选项,改为本地 MSA。
输入格式
version: 1
sequences:
- protein:
id: A
sequence: MVTPEGNVSLVDESLLVGVTDEDRAVRSAHQFYERLIGLWA...
- ligand:
id: B
smiles: "N[C@@H](Cc1ccc(O)cc1)C(=O)O"
properties:
- affinity:
binder: B
YAML 里可以混合蛋白链、DNA/RNA、小分子配体(SMILES 或 CCD 代码)、修饰残基。Boltz-2 还能输出结合亲和力预测(properties.affinity),这是它超出纯结构预测的一步——官方报告其亲和力预测速度远快于 FEP 而精度接近,但用于决策前仍应在自家体系上验证。
置信度怎么读
| 指标 | 含义 | 判读 |
|---|---|---|
| pLDDT | 残基级局部置信度 | >90 很可信;70~90 骨架大致正确;<50 常为无序区 |
| PAE | 残基对相对位置误差 | 低 PAE 说明域间/链间取向可信 |
| ipTM | 界面预测质量 | >0.8 界面较可信;<0.6 需谨慎 |
| confidence_score | 综合分 | 用于同一体系内不同采样的排序 |
实际使用建议
- 多采样取共识:
--diffusion_samples 5以上,看不同采样是否收敛到一致构象。发散说明该体系预测不可靠,这个信号比单次的高置信度更有价值。 - 配体姿势要交叉验证:与传统对接结果比对,并跑 PoseBusters 类物理检查。结构预测模型给的配体姿势不能直接当对接结果用。
- 算力:单体系推理通常在消费级 GPU(≥16 GB)上可行,大复合物需要更多显存;比 AF2 系整体更友好。
- 版本演进快:Boltz-1 到 Boltz-2 在精度和功能上变化明显,用之前先看当前版本的能力说明。
上手提示
- MIT 许可、商用无限制,是工业场景最省心的 AF3 级选项;
--use_msa_server极大降低上手门槛,但敏感序列必须走本地 MSA;- 多采样看是否收敛,比单次置信度更能反映可靠性;
- Boltz-2 的亲和力预测很有潜力,但用于决策前需自家验证。
延伸资源
- 教程:020《Boltz 教程》;对照实现:190《HelixFold3》、191《OpenFold》、193《Chai-1》;
- 结构预测置信度与局限见「结构与模拟」模块;
- 自由能计算对照:201《OpenFE》、203《Perses》。