314

Atomwise:基于结构的 AI 筛选公司案例

Atomwise 是最早用深度学习做基于结构虚拟筛选的公司之一。这篇讲清 AtomNet 的思路、大规模筛选的实践与该路线的争议。

Atomwise 是最早把卷积神经网络用于基于结构的虚拟筛选的公司之一。其核心技术 AtomNet 把蛋白-配体复合物体素化成三维网格,用 3D CNN 学习判断结合与否——这个思路在 2015 年前后是相当超前的,后来被 GNINA(见 183《GNINA》)等开源工具沿用。

AtomNet 的技术思路

  • 体素化:把结合位点划分成三维网格,每个格点记录附近的原子类型密度(碳、氮、氧、硫、芳香性、氢键供受体等作为不同「通道」);
  • 3D 卷积:像处理图像一样处理这个三维张量,学习空间模式;
  • 训练:用已知的活性/非活性复合物训练分类或打分模型;
  • 筛选:对大规模化合物库逐个对接后打分,或直接预测结合可能性。

与经验打分函数相比,CNN 不依赖人工设计的能量项,而是从数据中学习相互作用模式。理论上能捕捉到人工项难以表达的复杂模式。

这条路线的争议

深度学习打分函数在基准上表现亮眼,但受到过实质性质疑,这些质疑对使用者很重要:

  • 数据泄漏问题:在 DUD-E(见 241《DUD-E》)等基准上,只用配体特征、完全不看蛋白,神经网络也能取得很高的 AUC。这说明模型可能学的是「活性分子长什么样」的化学偏倚,而非蛋白-配体相互作用。
  • PDBbind 上的类似问题(见 238《PDBbind》):去掉蛋白信息后模型性能下降有限,暗示学到的主要是配体本身的性质与亲和力的统计关联。
  • 泛化能力存疑:在训练分布内表现好,换到新的蛋白家族时下降明显。
  • 必要的对照实验评估任何基于结构的深度学习方法,都必须同时报告「只用配体特征」的基线。差距不大就说明结构信息没被真正利用。

这些质疑不否定这条技术路线的价值,但要求更严格的评估纪律——这是整个领域从早期乐观走向成熟的必经过程。

大规模筛选的实践价值

抛开打分函数的争议,这类公司在工程规模化上的实践是有价值的:

  • 把筛选规模推到数十亿量级,需要解决分布式计算、数据管道、结果管理等大量工程问题;
  • 与学术机构的大规模合作(对多个靶点提供免费筛选),产生了实际的苗头化合物;
  • 验证了「计算优先的筛选」在流程上的可行性。

用开源做同样的事

# 完整的大规模结构筛选流程(全开源)

# 1. 结构准备
#    PDBFixer(215)修复 + 质子化态确定

# 2. 重对接验证 —— 必做,RMSD ≤ 2 Å 才继续
#    smina --autobox_ligand ref.sdf ...

# 3. 库准备与过滤
#    ZINC lead-like 子集(230)或 REAL(231)
#    RDKit 做性质过滤 + PAINS/反应性过滤

# 4. 主动学习加速(关键:让十亿级可行)
#    随机抽 100 万对接 → 训 LightGBM → 预筛全库 → 迭代

# 5. 重打分
#    GNINA(183)的 CNN rescore

# 6. 多层过滤
#    PoseBusters 物理有效性检查
#    ProLIF(207)核对是否复现关键相互作用
#    mols2grid(217)人工审查

# 7. 采购与验证
#    Mcule/eMolecules(232、233)核实可得性
#    多样性挑选 20~40 个下单

第 6 步的多层过滤是成败关键:库越大,打分函数的极值越可能是漏洞而非真实信号。只按分数取 top 100 去买,命中率会很低。

提示

公司业务与合作变动较快,本文为方向性观察,具体信息请以官方披露为准。评估任何基于结构的深度学习打分方法,务必设置「只用配体特征」的对照基线。

延伸资源