MODULE 09 / 30 RECORDS
实战流程
从拉数据到生成分子的 DMTA 端到端工作流
- 326 从 ChEMBL 拉取靶点活性数据:AI 建模第一步 从 ChEMBL 拉靶点活性数据是 AI 建模的第一步。这篇给出完整可运行的取数脚本、必须加的过滤条件,以及重复记录的处理方式。 →
- 327 清洗 SMILES:从原始数据到可训练数据集 原始 SMILES 必须清洗后才能训练。这篇给出完整的清洗管线代码、每一步的判断依据,以及清洗前后必须做的统计对照。 →
- 328 RDKit 标准化分子:建立可靠训练集 RDKit 标准化是建立可靠训练集的核心环节。这篇讲清 MolStandardize 各组件的行为、需要自定义的场景与版本一致性问题。 →
- 329 去盐、去重复、去异常结构:数据质量决定模型上限 去盐、去重、去异常结构决定了模型的上限。这篇给出可运行的过滤代码、各项阈值的依据,以及过滤强度的权衡。 →
- 330 计算 ECFP4 Fingerprint:传统特征仍然有价值 ECFP4 指纹至今是最可靠的分子特征基线。这篇给出正确的计算方式、参数含义、常见误用,以及它为什么仍然难以被超越。 →
- 331 用 Tanimoto 相似性做化合物聚类 用指纹加 Tanimoto 距离做 Butina 聚类,可整理大库、去冗余、挑多样化子集。这篇给出完整代码、阈值选择依据与大库的处理策略。 →
- 332 用 Scaffold Split 评估模型真实外推能力 Scaffold Split 是评估模型真实外推能力的标准做法。这篇给出实现代码、与随机划分的对照实验,以及更严格的划分方式。 →
- 333 训练 Chemprop 活性预测模型:从数据到结果 Chemprop 是分子性质预测最该先打的强基线。这篇给出从数据到结果的完整命令、必开选项与结果解读方式。 →
- 334 训练 ADMET 多任务模型:一次预测多个性质 多任务模型一次预测多个 ADMET 性质,能让数据少的终点从数据多的终点受益。这篇给出实现代码、稀疏标签处理与多任务是否有效的判断。 →
- 335 用 TDC Benchmark 评估模型:让结果可比较 用 TDC Benchmark 评估模型能让结果与他人可比。这篇给出标准评测流程代码、指标解读,以及公开基准与自家数据的关系。 →
- 336 用 AutoDock Vina 跑 Docking:基础虚拟筛选流程 AutoDock Vina 是虚拟筛选的基础流程。这篇给出从结构准备到批量筛选的完整可运行脚本,以及每一步的验证方法。 →
- 337 用 GNINA 做 Rescoring:深度学习重打分实战 GNINA 的 CNN 重打分可提升对接姿势质量。这篇给出重打分实战命令、三个分数的正确用法与分级筛选策略。 →
- 338 用 ProLIF 提取相互作用指纹:把 Pose 变成特征 ProLIF 把对接姿势变成可统计的相互作用指纹。这篇给出完整代码,说明怎么用指纹筛姿势、做 SAR 分析与建模特征。 →
- 339 用 PLIP 生成蛋白-配体相互作用报告 PLIP 一条命令生成蛋白-配体相互作用报告,还能直接出 PyMOL 图。这篇给出用法、报告解读与批量处理脚本。 →
- 340 用 PDBFixer 修复蛋白结构:Docking 前处理流程 PDBFixer 修复蛋白结构是对接与模拟前的必经步骤。这篇给出完整修复脚本、每步的判断依据与修复后的检查清单。 →
- 341 用 Meeko 准备 Docking 文件:PDBQT 文件怎么生成 Meeko 把配体与受体转成 Vina 所需的 PDBQT。这篇给出完整命令与 API 用法,以及配体准备中最容易出错的化学细节。 →
- 342 用 OpenBabel 批量转格式:化学文件处理自动化 OpenBabel 批量转格式是化学文件处理的常备工具。这篇给出常用命令、批量脚本,以及什么时候该改用 RDKit。 →
- 343 用 AlphaFold Server 预测无结构靶点 靶点没有实验结构时,用 AlphaFold 预测结构再做设计。这篇给出使用路径、置信度判读,以及预测结构做对接的注意事项。 →
- 344 用 Boltz 或 Chai-1 预测蛋白-配体复合物 Boltz 与 Chai-1 能直接预测蛋白-配体复合物结构。这篇给出两者的运行命令、结果判读与配体姿势的验证方法。 →
- 345 用 DiffDock 预测 Docking Pose:深度学习对接实战 DiffDock 用扩散模型做盲对接,不需要指定口袋。这篇给出部署运行命令、置信度的正确读法与结果验证流程。 →
- 346 比较 DiffDock、Vina、GNINA:什么时候相信哪个结果 DiffDock、Vina、GNINA 各有适用场景。这篇给出系统的对比方法、判断依据,以及三者一致性检验的实际做法。 →
- 347 用 REINVENT4 生成新分子:从规则到奖励函数 REINVENT4 通过配置文件定义生成模式与奖励函数。这篇给出完整配置、四种生成模式的选择,以及打分函数设计的关键原则。 →
- 348 在分子生成中加入 SA Score 约束 SA Score 约束让生成模型产出可合成的分子。这篇讲清 SA Score 的原理、局限、配置方式与更可靠的替代方案。 →
- 349 在分子生成中加入 QED 约束 QED 是常用的类药性综合指标。这篇讲清它的构成、作为生成约束的配置方式,以及为什么不该过度依赖它。 →
- 350 在分子生成中加入 ADMET 约束 在分子生成中加入 ADMET 约束,让产出的分子从一开始就考虑成药性。这篇给出接入自训 QSAR 模型的完整方法与不确定性护栏的设计。 →
- 351 在分子生成中加入 Docking Score 约束 在分子生成中加入对接分数约束,让生成朝着与靶点互补的方向走。这篇给出实现方式、性能优化与对接约束的固有风险。 →
- 352 Scaffold Hopping 实战:如何跳出原有母核 骨架跃迁让分子跳出原有母核。这篇给出多种实战方法的代码、几何约束思路与验证流程。 →
- 353 R-group Replacement 实战:如何系统替换取代基 R 基团替换是先导优化最高频的操作。这篇给出系统枚举、MMP 分析与优先级排序的完整方法。 →
- 354 Linker Design 实战:连接子设计的计算方法 连接子设计是 PROTAC、双功能分子与片段连接的关键。这篇给出计算方法、约束条件与评估流程。 →
- 355 建立 DMTA 闭环:自动生成项目进展报告 DMTA 闭环需要自动生成的项目进展报告来支撑决策。这篇给出报告应包含的内容、自动化实现与决策指标的设计。 →