180

DeepChem Examples:从示例项目学习 AI 制药

DeepChem 的示例与教程仓库用可运行项目串起分子 ML 全流程,是边做边学的好材料。这篇给出推荐的学习顺序和每个阶段该拿到的能力。

DeepChem Tutorials / Examples 是官方维护的一套可运行 Notebook 与脚本,覆盖从「读第一个 SMILES」到「跑分子生成与蛋白模型」的完整路径。相比读文档,跟着可运行的项目走是更快的入门方式——每个 Notebook 都能在 Colab 里直接打开跑。

怎么开始

git clone https://github.com/deepchem/deepchem.git
cd deepchem/examples/tutorials      # Notebook 在这里
jupyter lab

不想配环境的话,仓库里每个 Notebook 顶部都有 Colab 徽章,点开即用,GPU 也是现成的。这是最低摩擦的起步方式。

建议的学习顺序

阶段 内容 学完应该会
1 基础 Dataset / Featurizer / Model 三件套 把一批 SMILES 变成能训练的数据集
2 性质预测 溶解度、毒性等回归与分类 跑通完整训练-评测循环,读懂指标
3 划分与评测 Scaffold / Butina 划分对比 亲眼看到随机划分把指标抬高多少
4 图模型 GraphConv、AttentiveFP、MPNN 理解分子图模型与指纹模型的差异
5 进阶 分子生成、蛋白模型、迁移学习 知道各方向的入口在哪

第 3 步最值得认真做:亲手把同一个模型在随机划分和骨架划分下各跑一遍,看着 AUC 掉下来,比读十遍「不要用随机划分」都管用。

怎么用才有效

  • 改参数而不是只运行:每个 Notebook 跑通后,至少改三处——换特征化器、换划分方式、换模型,观察指标怎么动。只按 Shift+Enter 学不到东西。
  • 换成自己的数据:把示例数据换成自家或 ChEMBL 拉的一批分子(见「实战流程」模块),立刻会遇到真实问题:脏 SMILES、重复分子、标签单位不一致。这些才是实际工作量所在。
  • 建立自己的模板:把跑顺的流程抽成一个内部模板脚本,之后新任务改数据路径即可复用。
  • 注意版本漂移:DeepChem API 变动较多,旧 Notebook 可能跑不通。以仓库 main 分支上的版本为准,遇错先看是不是 API 改名。

配合什么一起学

  • 化学侧补课:TeachOpenCADD(见 181《TeachOpenCADD》)从药化视角讲同样的工具,两者互补——DeepChem 偏 ML,TeachOpenCADD 偏 CADD。
  • 数据侧:TDC(见 173《TDC》)提供更规范的任务与划分,练完 DeepChem 可以转过去做更严肃的评测。
  • 代码侧:RDKit Cookbook(见 013《RDKit Cookbook》)随时查具体化学操作怎么写。

上手提示

  • 用 Colab 徽章起步,省掉环境配置这道劝退关;
  • 每个 Notebook 至少改三处参数,别只是从头跑到尾;
  • 务必亲手做一次「随机划分 vs 骨架划分」的对比实验;
  • 尽早把示例数据换成真实数据,脏数据才是真正的功课。

延伸资源