EquiBind(MIT,ICML 2022)是最早一批「直接回归结合姿势」的深度学习对接模型。它用 SE(3) 等变图神经网络一次前向传播就输出配体的结合坐标,不做任何采样或搜索——单个复合物的推理时间在毫秒到秒级,比传统对接快几个数量级。
部署
git clone https://github.com/HannesStark/EquiBind.git
cd EquiBind
conda env create -f environment.yml
conda activate equibind
# 单个复合物
python inference.py --config=configs_clean/inference.yml
输入目录按「每个复合物一个子目录,内含 protein.pdb 与 ligand.sdf」组织。依赖较老的 PyTorch / DGL 版本,环境复现是主要摩擦点,建议严格按 environment.yml 装。
核心思路:等变性为什么重要
分子在空间中旋转平移后,结合姿势应当随之同样旋转平移——这是物理事实。SE(3) 等变网络把这条对称性直接编码进架构,而不是靠数据增强去学。好处是样本效率高、结果不依赖输入朝向;代价是架构复杂、表达能力受约束。这个思路后来被 DiffDock、RFdiffusion 等广泛沿用,理解 EquiBind 有助于读懂整条技术线。
真实精度:必须诚实看待
- 在 PDBBind 测试集上,EquiBind 的 top-1 姿势 RMSD ≤ 2 Å 的比例大致在 20% 左右,明显低于调好的传统对接(Vina 通常 35%~50%)。
- 它的中位 RMSD 通常在 5~7 Å 量级,意味着多数姿势的细节不可用于相互作用分析。
- 常见失败模式是与蛋白发生空间冲突、键长键角畸变——一步回归没有物理约束层,这类问题结构性存在。
- 原论文也建议配合后处理(能量最小化 / 传统对接精修)使用,作者对定位是清楚的。
正确定位
| 用途 | 是否合适 | 说明 |
|---|---|---|
| 千万级库的粗定位 | 合适 | 速度是唯一无可替代的优势 |
| 给传统对接提供初始姿势 | 合适 | 缩小搜索范围,再由 Vina 精修 |
| 结合模式分析 / 相互作用解读 | 不合适 | 精度不足以支撑残基级结论 |
| 亲和力排序 | 不合适 | 模型不输出可靠打分 |
| 指导化学合成决策 | 不合适 | 单独使用风险过高 |
现在还该用它吗
作为生产工具,它已被 DiffDock(见 184《DiffDock》)、TankBind(见 186《TankBind》)、Uni-Mol Docking V2(见 188《Uni-Mol Docking V2》)等后续方法在精度上超越。它今天的主要价值有两个:一是作为等变几何深度学习的教学范例——架构清晰、论文可读性好;二是在极端规模筛选中做第一道粗过滤,用速度换覆盖面。评测新方法时,它也常被当作速度基线。
上手提示
- 它的卖点是速度(毫秒级),不是精度(top-1 成功率约 20%);
- 输出姿势常有空间冲突,必须做能量最小化或传统对接精修;
- 不要用它的结果做相互作用分析或合成决策;
- 作为理解 SE(3) 等变网络的入门范例,它的价值仍然很高。
延伸资源
- 论文与方法线:102《EquiBind 论文精读》、101《DiffDock 论文精读》;
- 后续更强方法:184《DiffDock》、186《TankBind》、188《Uni-Mol Docking V2》;
- 传统对接对照:182《AutoDock Vina》、183《GNINA》。