190

HelixFold3:国产结构预测模型应用指南

HelixFold3 是飞桨生态下的 AF3 类结构预测实现,可预测蛋白及复合物,是国产开源选项。这篇讲清它的能力范围、许可与部署要点。

HelixFold3 是百度 PaddleHelix 团队复现 AlphaFold3 架构的开源实现。它的意义在于:AlphaFold3 官方长期只提供网页服务且对商业用途设限,HelixFold3 提供了一条可本地部署、可自行控制的替代路径,对需要处理敏感靶点数据、或要批量运行的团队价值明显。

能预测什么

体系 支持
单链 / 多链蛋白复合物 支持
蛋白-小分子配体 支持
蛋白-核酸(DNA / RNA) 支持
含离子、辅因子的体系 支持
翻译后修饰 部分支持

相比只能做蛋白的 AlphaFold2 系,能把配体、核酸、离子放进同一次预测是 AF3 架构这一代的核心跃进——它让「蛋白-配体复合物结构预测」第一次成为结构预测模型的原生能力,而不是靠对接拼接。

部署要点

git clone https://github.com/PaddlePaddle/PaddleHelix.git
cd PaddleHelix/apps/protein_folding/helixfold3
# 按 README 安装 paddlepaddle-gpu、依赖与 MSA 检索工具

python inference.py \
  --input_json data/demo_protein_ligand.json \
  --output_dir ./output --precision bf16
  • 显存:大复合物需要较高显存,通常建议 40 GB 级显卡;小体系可用 bf16 降低占用。
  • MSA 是大头:和所有 AF 系模型一样,需要序列数据库做多序列比对检索,磁盘占用可达数百 GB,检索耗时常常超过推理本身。
  • 输入是 JSON:把蛋白序列、配体 SMILES、核酸序列、离子在一个 JSON 里描述,格式参考仓库示例。

许可与合规

HelixFold3 的模型权重通常按非商业许可发布(学术研究可用)。这是它和 AlphaFold3 权重同样面临的限制。商业项目使用前必须逐条核对当前 LICENSE 与权重使用条款,不要凭「开源」二字想当然——这是这类模型最容易出问题的地方。需要完全自由许可时,考虑 Boltz(见 192《Boltz》,MIT 许可)等选项。

结果怎么读

  • 置信度指标:与 AF 系一致,看 pLDDT(残基级局部置信度,>90 很可信,70~90 大致正确,<50 多为无序区)与 PAE(残基对相对位置误差,判断域间取向是否可信)。
  • 配体姿势要额外验证:AF3 类模型给出的小分子结合姿势不等于对接结果,建议与传统对接交叉比对,并做物理有效性检查。
  • 高置信度不等于生物学正确:模型可能自信地给出一个构象状态,而实际蛋白存在多种构象。功能结论仍需实验支持。

上手提示

  • 核心价值:AF3 级能力 + 可本地部署,适合数据敏感或需批量运行的场景;
  • MSA 检索的磁盘与耗时往往超过推理本身,先规划存储;
  • 商用前务必逐条核对权重许可,非商业限制很常见;
  • 看 pLDDT / PAE 判断可信度,配体姿势需交叉验证。

延伸资源