HelixFold3 是百度 PaddleHelix 团队复现 AlphaFold3 架构的开源实现。它的意义在于:AlphaFold3 官方长期只提供网页服务且对商业用途设限,HelixFold3 提供了一条可本地部署、可自行控制的替代路径,对需要处理敏感靶点数据、或要批量运行的团队价值明显。
能预测什么
| 体系 | 支持 |
|---|---|
| 单链 / 多链蛋白复合物 | 支持 |
| 蛋白-小分子配体 | 支持 |
| 蛋白-核酸(DNA / RNA) | 支持 |
| 含离子、辅因子的体系 | 支持 |
| 翻译后修饰 | 部分支持 |
相比只能做蛋白的 AlphaFold2 系,能把配体、核酸、离子放进同一次预测是 AF3 架构这一代的核心跃进——它让「蛋白-配体复合物结构预测」第一次成为结构预测模型的原生能力,而不是靠对接拼接。
部署要点
git clone https://github.com/PaddlePaddle/PaddleHelix.git
cd PaddleHelix/apps/protein_folding/helixfold3
# 按 README 安装 paddlepaddle-gpu、依赖与 MSA 检索工具
python inference.py \
--input_json data/demo_protein_ligand.json \
--output_dir ./output --precision bf16
- 显存:大复合物需要较高显存,通常建议 40 GB 级显卡;小体系可用 bf16 降低占用。
- MSA 是大头:和所有 AF 系模型一样,需要序列数据库做多序列比对检索,磁盘占用可达数百 GB,检索耗时常常超过推理本身。
- 输入是 JSON:把蛋白序列、配体 SMILES、核酸序列、离子在一个 JSON 里描述,格式参考仓库示例。
许可与合规
HelixFold3 的模型权重通常按非商业许可发布(学术研究可用)。这是它和 AlphaFold3 权重同样面临的限制。商业项目使用前必须逐条核对当前 LICENSE 与权重使用条款,不要凭「开源」二字想当然——这是这类模型最容易出问题的地方。需要完全自由许可时,考虑 Boltz(见 192《Boltz》,MIT 许可)等选项。
结果怎么读
- 置信度指标:与 AF 系一致,看 pLDDT(残基级局部置信度,>90 很可信,70~90 大致正确,<50 多为无序区)与 PAE(残基对相对位置误差,判断域间取向是否可信)。
- 配体姿势要额外验证:AF3 类模型给出的小分子结合姿势不等于对接结果,建议与传统对接交叉比对,并做物理有效性检查。
- 高置信度不等于生物学正确:模型可能自信地给出一个构象状态,而实际蛋白存在多种构象。功能结论仍需实验支持。
上手提示
- 核心价值:AF3 级能力 + 可本地部署,适合数据敏感或需批量运行的场景;
- MSA 检索的磁盘与耗时往往超过推理本身,先规划存储;
- 商用前务必逐条核对权重许可,非商业限制很常见;
- 看 pLDDT / PAE 判断可信度,配体姿势需交叉验证。
延伸资源
- 框架本体:189《PaddleHelix》;教程:023《PaddleHelix 教程》;
- 对照实现:191《OpenFold》、192《Boltz》、193《Chai-1》;
- 结构预测概念与置信度解读见「结构与模拟」模块。