PaddleHelix 是百度基于飞桨(PaddlePaddle)深度学习框架构建的生物计算工具库,覆盖化合物性质预测、蛋白结构预测、药物-靶点相互作用与分子生成。对国内团队而言,它的实际吸引力在于中文文档完整、国产算力适配好(昆仑芯等)、以及与百度自有模型(HelixFold 系列)的直接衔接。
安装
python -m pip install paddlepaddle-gpu # 按 CUDA 版本选择安装源
pip install pgl paddlehelix
python -c "import paddlehelix; print('ok')"
依赖飞桨与 PGL(图学习库)。若团队已全栈 PyTorch,引入飞桨意味着维护两套深度学习环境,这是选型时最实际的成本。
模块地图
| 方向 | 内容 |
|---|---|
| 分子表示与预训练 | ChemRL / GEM(几何增强的分子预训练) |
| 性质预测 | ADMET、理化性质,含 MoleculeNet 基准复现 |
| 结构预测 | HelixFold、HelixFold-Single、HelixFold3(见 190《HelixFold3》) |
| DTI 与筛选 | 药物-靶点亲和力预测 |
| 分子生成 | 条件生成、性质优化 |
| RNA | LinearFold / LinearDesign 等 RNA 二级结构与序列设计 |
其中 GEM(Geometry Enhanced Molecular representation)把键长、键角等几何信息编入预训练,思路与 Uni-Mol 的 3D 预训练同源;LinearDesign 面向 mRNA 序列优化,在疫苗与核酸药方向有实际应用,是它比较独特的一块。
典型用法
import paddle
from pahelix.model_zoo.gem_model import GeoGNNModel
from pahelix.utils.compound_tools import mol_to_geognn_graph_data_MMFF3d
from rdkit import Chem
mol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O")
data = mol_to_geognn_graph_data_MMFF3d(mol) # 生成 3D 构象并构图
# 载入 GEM 预训练权重后接下游任务头微调
选型时怎么判断
- 选它的理由:需要国产化替代或信创合规;团队已在飞桨生态;要用 HelixFold3 做结构预测;做 RNA/mRNA 设计(LinearDesign 是少见的开源选项)。
- 不选的理由:团队全栈 PyTorch,为单个模型引入飞桨的维护成本偏高;国际社区的第三方代码与预训练权重绝大多数基于 PyTorch,迁移与复现成本更低。
- 折中做法:把 PaddleHelix 当作特定模型的提供方而非主框架——需要 HelixFold3 或 LinearDesign 时单独起一个环境调用,主流程仍留在 PyTorch 上。这是多数团队的现实选择。
上手提示
- 独特价值在 HelixFold 系列与 RNA 设计(LinearDesign),而非通用分子建模;
- 引入前先算清「多维护一套深度学习框架」的成本;
- 建议按需单点使用,不必整体迁移主流程;
- 信创与国产算力适配是它在国内的实际优势。
延伸资源
- 教程:023《PaddleHelix 教程》;结构预测模型:190《HelixFold3》;
- 对照框架:172《DeepChem》、175《TorchDrug》、176《PyTorch Geometric》;
- 3D 预训练对照:187《Uni-Mol》。