DeepChem Tutorials / Examples 是官方维护的一套可运行 Notebook 与脚本,覆盖从「读第一个 SMILES」到「跑分子生成与蛋白模型」的完整路径。相比读文档,跟着可运行的项目走是更快的入门方式——每个 Notebook 都能在 Colab 里直接打开跑。
怎么开始
git clone https://github.com/deepchem/deepchem.git
cd deepchem/examples/tutorials # Notebook 在这里
jupyter lab
不想配环境的话,仓库里每个 Notebook 顶部都有 Colab 徽章,点开即用,GPU 也是现成的。这是最低摩擦的起步方式。
建议的学习顺序
| 阶段 | 内容 | 学完应该会 |
|---|---|---|
| 1 基础 | Dataset / Featurizer / Model 三件套 | 把一批 SMILES 变成能训练的数据集 |
| 2 性质预测 | 溶解度、毒性等回归与分类 | 跑通完整训练-评测循环,读懂指标 |
| 3 划分与评测 | Scaffold / Butina 划分对比 | 亲眼看到随机划分把指标抬高多少 |
| 4 图模型 | GraphConv、AttentiveFP、MPNN | 理解分子图模型与指纹模型的差异 |
| 5 进阶 | 分子生成、蛋白模型、迁移学习 | 知道各方向的入口在哪 |
第 3 步最值得认真做:亲手把同一个模型在随机划分和骨架划分下各跑一遍,看着 AUC 掉下来,比读十遍「不要用随机划分」都管用。
怎么用才有效
- 改参数而不是只运行:每个 Notebook 跑通后,至少改三处——换特征化器、换划分方式、换模型,观察指标怎么动。只按 Shift+Enter 学不到东西。
- 换成自己的数据:把示例数据换成自家或 ChEMBL 拉的一批分子(见「实战流程」模块),立刻会遇到真实问题:脏 SMILES、重复分子、标签单位不一致。这些才是实际工作量所在。
- 建立自己的模板:把跑顺的流程抽成一个内部模板脚本,之后新任务改数据路径即可复用。
- 注意版本漂移:DeepChem API 变动较多,旧 Notebook 可能跑不通。以仓库 main 分支上的版本为准,遇错先看是不是 API 改名。
配合什么一起学
- 化学侧补课:TeachOpenCADD(见 181《TeachOpenCADD》)从药化视角讲同样的工具,两者互补——DeepChem 偏 ML,TeachOpenCADD 偏 CADD。
- 数据侧:TDC(见 173《TDC》)提供更规范的任务与划分,练完 DeepChem 可以转过去做更严肃的评测。
- 代码侧:RDKit Cookbook(见 013《RDKit Cookbook》)随时查具体化学操作怎么写。
上手提示
- 用 Colab 徽章起步,省掉环境配置这道劝退关;
- 每个 Notebook 至少改三处参数,别只是从头跑到尾;
- 务必亲手做一次「随机划分 vs 骨架划分」的对比实验;
- 尽早把示例数据换成真实数据,脏数据才是真正的功课。
延伸资源
- 框架本体:172《DeepChem》;教程体系:004《DeepChem 教程体系入门》;
- 互补教材:181《TeachOpenCADD》、012《TeachOpenCADD 教程》;数据集:178《DeepPurpose》、173《TDC》。