MODULE 09 / 30 RECORDS

实战流程

从拉数据到生成分子的 DMTA 端到端工作流

全部文章索引 →
  1. 326 从 ChEMBL 拉取靶点活性数据:AI 建模第一步 从 ChEMBL 拉靶点活性数据是 AI 建模的第一步。这篇给出完整可运行的取数脚本、必须加的过滤条件,以及重复记录的处理方式。
  2. 327 清洗 SMILES:从原始数据到可训练数据集 原始 SMILES 必须清洗后才能训练。这篇给出完整的清洗管线代码、每一步的判断依据,以及清洗前后必须做的统计对照。
  3. 328 RDKit 标准化分子:建立可靠训练集 RDKit 标准化是建立可靠训练集的核心环节。这篇讲清 MolStandardize 各组件的行为、需要自定义的场景与版本一致性问题。
  4. 329 去盐、去重复、去异常结构:数据质量决定模型上限 去盐、去重、去异常结构决定了模型的上限。这篇给出可运行的过滤代码、各项阈值的依据,以及过滤强度的权衡。
  5. 330 计算 ECFP4 Fingerprint:传统特征仍然有价值 ECFP4 指纹至今是最可靠的分子特征基线。这篇给出正确的计算方式、参数含义、常见误用,以及它为什么仍然难以被超越。
  6. 331 用 Tanimoto 相似性做化合物聚类 用指纹加 Tanimoto 距离做 Butina 聚类,可整理大库、去冗余、挑多样化子集。这篇给出完整代码、阈值选择依据与大库的处理策略。
  7. 332 用 Scaffold Split 评估模型真实外推能力 Scaffold Split 是评估模型真实外推能力的标准做法。这篇给出实现代码、与随机划分的对照实验,以及更严格的划分方式。
  8. 333 训练 Chemprop 活性预测模型:从数据到结果 Chemprop 是分子性质预测最该先打的强基线。这篇给出从数据到结果的完整命令、必开选项与结果解读方式。
  9. 334 训练 ADMET 多任务模型:一次预测多个性质 多任务模型一次预测多个 ADMET 性质,能让数据少的终点从数据多的终点受益。这篇给出实现代码、稀疏标签处理与多任务是否有效的判断。
  10. 335 用 TDC Benchmark 评估模型:让结果可比较 用 TDC Benchmark 评估模型能让结果与他人可比。这篇给出标准评测流程代码、指标解读,以及公开基准与自家数据的关系。
  11. 336 用 AutoDock Vina 跑 Docking:基础虚拟筛选流程 AutoDock Vina 是虚拟筛选的基础流程。这篇给出从结构准备到批量筛选的完整可运行脚本,以及每一步的验证方法。
  12. 337 用 GNINA 做 Rescoring:深度学习重打分实战 GNINA 的 CNN 重打分可提升对接姿势质量。这篇给出重打分实战命令、三个分数的正确用法与分级筛选策略。
  13. 338 用 ProLIF 提取相互作用指纹:把 Pose 变成特征 ProLIF 把对接姿势变成可统计的相互作用指纹。这篇给出完整代码,说明怎么用指纹筛姿势、做 SAR 分析与建模特征。
  14. 339 用 PLIP 生成蛋白-配体相互作用报告 PLIP 一条命令生成蛋白-配体相互作用报告,还能直接出 PyMOL 图。这篇给出用法、报告解读与批量处理脚本。
  15. 340 用 PDBFixer 修复蛋白结构:Docking 前处理流程 PDBFixer 修复蛋白结构是对接与模拟前的必经步骤。这篇给出完整修复脚本、每步的判断依据与修复后的检查清单。
  16. 341 用 Meeko 准备 Docking 文件:PDBQT 文件怎么生成 Meeko 把配体与受体转成 Vina 所需的 PDBQT。这篇给出完整命令与 API 用法,以及配体准备中最容易出错的化学细节。
  17. 342 用 OpenBabel 批量转格式:化学文件处理自动化 OpenBabel 批量转格式是化学文件处理的常备工具。这篇给出常用命令、批量脚本,以及什么时候该改用 RDKit。
  18. 343 用 AlphaFold Server 预测无结构靶点 靶点没有实验结构时,用 AlphaFold 预测结构再做设计。这篇给出使用路径、置信度判读,以及预测结构做对接的注意事项。
  19. 344 用 Boltz 或 Chai-1 预测蛋白-配体复合物 Boltz 与 Chai-1 能直接预测蛋白-配体复合物结构。这篇给出两者的运行命令、结果判读与配体姿势的验证方法。
  20. 345 用 DiffDock 预测 Docking Pose:深度学习对接实战 DiffDock 用扩散模型做盲对接,不需要指定口袋。这篇给出部署运行命令、置信度的正确读法与结果验证流程。
  21. 346 比较 DiffDock、Vina、GNINA:什么时候相信哪个结果 DiffDock、Vina、GNINA 各有适用场景。这篇给出系统的对比方法、判断依据,以及三者一致性检验的实际做法。
  22. 347 用 REINVENT4 生成新分子:从规则到奖励函数 REINVENT4 通过配置文件定义生成模式与奖励函数。这篇给出完整配置、四种生成模式的选择,以及打分函数设计的关键原则。
  23. 348 在分子生成中加入 SA Score 约束 SA Score 约束让生成模型产出可合成的分子。这篇讲清 SA Score 的原理、局限、配置方式与更可靠的替代方案。
  24. 349 在分子生成中加入 QED 约束 QED 是常用的类药性综合指标。这篇讲清它的构成、作为生成约束的配置方式,以及为什么不该过度依赖它。
  25. 350 在分子生成中加入 ADMET 约束 在分子生成中加入 ADMET 约束,让产出的分子从一开始就考虑成药性。这篇给出接入自训 QSAR 模型的完整方法与不确定性护栏的设计。
  26. 351 在分子生成中加入 Docking Score 约束 在分子生成中加入对接分数约束,让生成朝着与靶点互补的方向走。这篇给出实现方式、性能优化与对接约束的固有风险。
  27. 352 Scaffold Hopping 实战:如何跳出原有母核 骨架跃迁让分子跳出原有母核。这篇给出多种实战方法的代码、几何约束思路与验证流程。
  28. 353 R-group Replacement 实战:如何系统替换取代基 R 基团替换是先导优化最高频的操作。这篇给出系统枚举、MMP 分析与优先级排序的完整方法。
  29. 354 Linker Design 实战:连接子设计的计算方法 连接子设计是 PROTAC、双功能分子与片段连接的关键。这篇给出计算方法、约束条件与评估流程。
  30. 355 建立 DMTA 闭环:自动生成项目进展报告 DMTA 闭环需要自动生成的项目进展报告来支撑决策。这篇给出报告应包含的内容、自动化实现与决策指标的设计。