Boltz 提供了在线体验入口,让人不装环境就能试用这个 MIT 许可的 AF3 级结构预测模型。对评估阶段的团队来说,「先试再决定要不要投入部署」是很实际的路径——但要清楚在线试用与生产使用的区别。
在线试用适合做什么
- 快速验证能力:拿一两个自己熟悉的体系(最好有已知结构可对照)试一试,直观感受精度水平;
- 与其他方法对比:同一个体系分别用 Boltz、AlphaFold Server、Chai-1 跑一遍,比较结果与置信度;
- 决定是否值得部署:确认它能解决你的问题类型后,再投入本地部署的工程成本;
- 演示与教学:向不做计算的同事展示结构预测能做什么。
在线试用不适合做什么
- 提交敏感序列。这是首要红线。未公开的靶点序列、专有的抗体序列、任何有知识产权价值的信息,都不应提交到外部服务——无论该服务的许可多宽松。
- 批量预测:在线服务有配额与速率限制。
- 生产流程:可用性、版本稳定性、结果可复现性都无法保证。
- 需要中间产物时:在线服务通常只给最终结构,拿不到 MSA、嵌入等中间结果。
从试用到本地部署
# Boltz 本地部署非常简单,这是它的一大优势
pip install boltz
# 最简:一个 FASTA
boltz predict input.fasta --use_msa_server --out_dir results/
# 生产用法:本地 MSA(敏感序列必须这样)
boltz predict complex.yaml \
--msa_server_url http://内部MSA服务 \
--diffusion_samples 5 \
--out_dir results/
| 阶段 | MSA 来源 | 适用 |
|---|---|---|
| 试用 | 在线 MSA 服务器 | 公开序列,快速上手 |
| 生产(非敏感) | 在线或本地 | 视吞吐需求 |
| 生产(敏感) | 必须本地 | 序列不出内网 |
--use_msa_server 会把序列发到远程服务。这个选项极大降低了上手门槛(省掉几百 GB 的序列数据库),但用于敏感靶点时必须改为本地 MSA。这是部署时最容易疏忽的一点。
本地部署的资源规划
- GPU:单个中等体系通常 16 GB 显存可行,大复合物需要更多;
- MSA 数据库:若走本地 MSA,需准备 UniRef、BFD 等数据库,磁盘占用数百 GB,且检索耗时常常超过推理本身;
- 吞吐规划:批量预测时 MSA 检索通常是瓶颈,可考虑缓存已检索过的序列;
- 版本管理:Boltz-1 到 Boltz-2 变化明显,锁定版本以保证结果可复现。
评估时该看什么
- 拿有共晶结构的自家体系回测:预测结构与实验结构的 RMSD 如何?配体姿势对不对?这比看任何基准成绩都有说服力。
- 多采样看收敛性:
--diffusion_samples 5以上,不同采样是否收敛到一致构象。发散本身是重要信号,说明该体系预测不可靠。 - 置信度指标:pLDDT、PAE、ipTM 是否与实际准确度对应。
- 物理有效性:配体姿势跑一遍 PoseBusters 类检查。
- Boltz-2 的亲和力预测:如果要用这个功能,务必在自家已知活性数据上验证后再用于决策。
提示
在线服务的可用性与功能可能变动,本文为方向性介绍。核心提醒:任何敏感序列都不应提交外部服务;本地部署时 --use_msa_server 同样会外发序列,敏感体系必须配本地 MSA。