MODULE 06 / 55 RECORDS
开源工具
化学信息学、对接、结构、模拟、生成的开源工具栈
- 171 RDKit:化学信息学项目的事实标准工具 RDKit 是开源化学信息学的事实标准:读写分子、指纹、描述符、子结构、构象、绘图都靠它。这篇给出可直接运行的代码骨架、必须知道的坑(分子标准化、指纹参数、构象随机性),以及把它嵌进生产流程的方式。 →
- 172 DeepChem:AI 药物发现开源框架实战价值 DeepChem 把数据集、特征化、模型、划分统一成四件套,是新手跑通分子机器学习最省心的框架。这篇讲清它的对象模型、什么时候该用它、什么时候该换掉它。 →
- 173 TDC:药物发现数据集和 Benchmark 工具箱 PyTDC 一行加载贯穿研发全流程的标准数据集、划分与评测。这篇讲清它的三层任务体系、真正该用的划分方式,以及把公开 benchmark 结论迁到自家项目时的边界。 →
- 174 Chemprop:分子性质预测模型训练入门 Chemprop 提供开箱即用的 D-MPNN 训练流程,是分子性质预测最该先打的强基线。这篇给出完整命令行、必须开的选项,以及怎么读它的不确定性输出。 →
- 175 TorchDrug:面向药物发现的深度学习库 TorchDrug 把分子、蛋白、知识图谱任务封装成统一的 PyTorch 接口,适合做研究与原型。这篇讲清它的分层设计、覆盖范围,以及选型时和 PyG、DeepChem 的取舍。 →
- 176 PyTorch Geometric:GNN 分子建模的基础框架 PyTorch Geometric 是图深度学习的主流框架,也是自己实现分子 GNN 的基础设施。这篇讲清它的数据结构、批处理机制、消息传递写法,以及分子建模里的具体用法。 →
- 177 DGL-LifeSci:生命科学图深度学习工具包 DGL-LifeSci 在 DGL 之上为分子与蛋白图任务提供现成模型与数据加载,是 PyG 之外的另一条 GNN 路线。这篇讲清它的能力边界与选型判断。 →
- 178 DeepPurpose:DTI、药物重定位与组合预测工具 DeepPurpose 用几行代码搭起 DTI、药物重定位与药物组合预测,适合快速起步与做基线。这篇给出完整代码路径,也讲清它在真实项目中的准确边界。 →
- 179 MoleculeNet 工具链:分子机器学习数据怎么用 MoleculeNet 提供标准分子数据集与划分,是建立可比实验的起点。这篇列清主要数据集的规模与任务类型,并说明它作为 benchmark 的已知问题。 →
- 180 DeepChem Examples:从示例项目学习 AI 制药 DeepChem 的示例与教程仓库用可运行项目串起分子 ML 全流程,是边做边学的好材料。这篇给出推荐的学习顺序和每个阶段该拿到的能力。 →
- 181 TeachOpenCADD:CADD 教学项目如何变成内部培训资料 TeachOpenCADD 的 talktorial 体系既能自学,也很适合改造成团队内部的 CADD 培训教材。这篇给出模块地图和把它变成内训课程的具体做法。 →
- 182 AutoDock Vina:开源对接工具部署指南 AutoDock Vina 是最常用的免费对接引擎:部署轻、易脚本化、社区成熟。这篇给出从受体准备到批量筛选的完整命令、盒子设置的具体做法,以及为什么必须先做重对接验证。 →
- 183 GNINA:GPU 加速 Docking 与 CNN 重打分 GNINA 在 Vina 谱系上加入 CNN 打分与 GPU 加速,适合在对接后做深度学习重排序。这篇给出命令、打分模式选择,以及 CNN 重打分真正能带来多少提升。 →
- 184 DiffDock:深度学习对接模型部署与使用 DiffDock 用扩散模型做盲对接,无需指定口袋即可给出候选姿势与置信度。这篇给出部署命令、置信度的正确读法,以及它被独立评测质疑的那些点。 →
- 185 EquiBind:快速结合姿势预测工具评估 EquiBind 一步直接回归结合姿势,速度极快,适合超大规模初筛,但精度有限必须后处理。这篇讲清它的等变思路、真实精度水平和正确定位。 →
- 186 TankBind:蛋白-配体结合预测工具实测 TankBind 预测蛋白-配体分子间距离矩阵再重建姿势,同时给出亲和力估计。这篇讲清它的分块口袋策略、与直接回归方法的区别和实际用法。 →
- 187 Uni-Mol:分子预训练模型部署指南 Uni-Mol 提供 3D 分子预训练权重与微调接口,可迁移到性质预测、对接等任务。这篇讲清它的 3D 预训练思路、微调方式与适用边界。 →
- 188 Uni-Mol Docking V2:开源 Docking 工作流体验 Uni-Mol Docking V2 用预训练模型做对接,在姿势合理性上明显改善,可纳入自有筛选流程。这篇讲清它相比第一代与其它深度学习对接方法的差别。 →
- 189 PaddleHelix:国产开源生物计算框架介绍 PaddleHelix 基于飞桨,覆盖结构预测、DTI 与分子生成,是中文生态友好的国产开源框架。这篇给出模块地图与选型时的实际考量。 →
- 190 HelixFold3:国产结构预测模型应用指南 HelixFold3 是飞桨生态下的 AF3 类结构预测实现,可预测蛋白及复合物,是国产开源选项。这篇讲清它的能力范围、许可与部署要点。 →
- 191 OpenFold:训练和推理 AlphaFold 类模型的开源方案 OpenFold 是可训练的开源 AlphaFold2 复现,适合需要微调或扩展结构预测模型的团队。这篇讲清它相对官方实现的差异与真实使用场景。 →
- 192 Boltz:开放结构预测工具的安装与使用 Boltz 是 MIT 许可的开放结构预测工具,能力对标 AF3 且商用无限制。这篇给出安装推理命令、输入格式与置信度解读。 →
- 193 Chai-1:复合物结构预测工具部署指南 Chai-1 是 Chai Discovery 开源的复合物结构预测工具,支持多模态输入与实验约束注入。这篇讲清它的部署方式、独特功能与许可条件。 →
- 194 ESM:蛋白语言模型工具箱怎么用 ESM 提供 ESM-2 等蛋白语言模型权重与接口,可提取表征用于多种下游任务。这篇给出取嵌入的代码、各档模型的取舍,以及零样本突变效应预测的用法。 →
- 195 ESMFold:快速蛋白结构预测实战 ESMFold 免 MSA、从单序列快速预测结构,适合大规模或快速迭代场景。这篇讲清它的速度优势、精度代价与最适合的使用位置。 →
- 196 ProteinMPNN:蛋白序列设计工具实战 ProteinMPNN 给定骨架结构设计氨基酸序列,湿实验成功率高,是蛋白设计管线的核心环节。这篇给出命令、关键参数与它在设计流程中的位置。 →
- 197 RFdiffusion:蛋白骨架生成工具实战 RFdiffusion 用扩散模型按约束生成蛋白骨架,可做结合物设计与对称组装,是从头设计的主力工具。这篇给出各设计模式的命令与实际成功率预期。 →
- 198 Rosetta:经典蛋白设计平台为什么仍然重要 Rosetta 是积累深厚的蛋白建模与设计平台,在能量函数与设计协议上仍是很多工作的基础。这篇讲清它今天不可替代的部分与获取方式。 →
- 199 PyRosetta:用 Python 调用 Rosetta 的工程路线 PyRosetta 把 Rosetta 能力暴露为 Python 接口,便于脚本化并与 AI 工具集成。这篇给出安装、常用对象与典型精修/打分代码。 →
- 200 OpenMM:分子动力学模拟开源引擎 OpenMM 是 GPU 加速、Python 友好的 MD 引擎,是跑蛋白-配体模拟的推荐起点。这篇给出可直接运行的完整体系搭建脚本与参数选择依据。 →
- 201 OpenFE:自由能计算开源平台 OpenFE 提供可复现的相对结合自由能工作流,是先导优化中 FEP 的开源选择。这篇讲清网络设计、运行方式与结果判读标准。 →
- 202 OpenFF Toolkit:小分子力场参数化工具 OpenFF Toolkit 给小分子生成现代力场参数,是 MD 与自由能计算前不可省略的一步。这篇讲清参数化流程、电荷方法选择与常见失败原因。 →
- 203 Perses:炼金自由能计算工具介绍 Perses 基于 OpenMM 做炼金自由能计算,适合研究与定制方法。这篇讲清它与 OpenFE 的分工、非平衡切换的思路与使用建议。 →
- 204 YANK:结合自由能计算工具介绍 YANK 是基于 OpenMM 的结合自由能计算工具,常用于绝对结合自由能等研究性计算。这篇讲清绝对自由能的难点、限制势的作用与它的当前状态。 →
- 205 MDAnalysis:MD 轨迹分析工具 MDAnalysis 是用 Python 分析 MD 轨迹的主力库,能算 RMSD、相互作用等各类指标。这篇给出选择语法、常用分析代码与大轨迹的性能要点。 →
- 206 MDTraj:轻量级分子动力学轨迹分析 MDTraj 轻量、快速,适合做 MD 轨迹的几何计算与格式转换。这篇给出常用 API、与 MDAnalysis 的分工,以及它在二级结构与聚类分析上的优势。 →
- 207 ProLIF:蛋白-配体相互作用指纹工具 ProLIF 把蛋白-配体相互作用编码成指纹,适合比较姿势、统计 MD 轨迹中相互作用的稳定性。这篇给出完整代码与指纹的实际用法。 →
- 208 PLIP:自动识别蛋白-配体相互作用 PLIP 自动识别氢键、疏水、π 堆积、盐桥等相互作用并生成报告,快速理解结合模式。这篇给出命令行用法、输出解读与它与 ProLIF 的分工。 →
- 209 ProDy:蛋白结构动力学分析工具 ProDy 擅长蛋白结构与柔性分析(弹性网络模型、PCA),用于研究构象变化与功能运动。这篇讲清 ENM 与 PCA 的用法及其在药物设计中的价值。 →
- 210 Biopython:生物序列与结构数据处理基础 Biopython 是处理生物序列与结构数据的基础库,用于序列解析、PDB 处理与数据库交互。这篇给出最常用的三块能力与实际代码。 →
- 211 PyMOL 开源版:结构可视化和作图流程 PyMOL 开源版满足多数结构可视化与作图需求,掌握选择语法与渲染即可出版级配图。这篇给出脚本化作图流程与一套可直接复用的出图设置。 →
- 212 NGLView:Jupyter 中展示三维结构 NGLView 在 Jupyter 里交互展示结构与轨迹,适合边分析边看的工作流。这篇给出与 MDAnalysis/MDTraj 联动的用法和常见渲染技巧。 →
- 213 3Dmol.js:把分子结构嵌入网页 3Dmol.js 是纯 JS 的三维分子查看库,适合把结构与对接结果嵌入网页或内部平台。这篇给出可直接复制的嵌入代码与常见交互实现。 →
- 214 Meeko:Docking 文件准备工具 Meeko 把配体与受体转成 Vina 所需的 PDBQT 并处理大环等细节,是 Vina 对接的标准前处理。这篇给出完整命令与容易出错的化学细节。 →
- 215 PDBFixer:蛋白结构修复工具 PDBFixer 补全缺失原子与残基、加氢、处理非标准残基,是对接与模拟前的结构修复利器。这篇给出完整修复流程与每一步的判断依据。 →
- 216 OpenBabel:化学文件格式转换工具 OpenBabel 支持上百种化学格式互转,是处理格式不兼容的常备工具。这篇给出常用命令、批量处理技巧,以及它在哪些场景该让位给 RDKit。 →
- 217 Mols2grid:分子表格可视化工具 mols2grid 在 Notebook 里把一批分子渲染成可交互的网格表格,便于浏览、筛选与挑选。这篇给出实际代码与在筛选流程中的用法。 →
- 218 Datamol:现代化学信息学数据处理工具 Datamol 在 RDKit 之上提供更简洁的 API 与并行处理,让分子数据清洗更顺手。这篇给出对比代码,说明它省掉了哪些样板。 →
- 219 Molfeat:分子特征工程工具箱 Molfeat 统一了指纹、描述符、预训练表征等多种分子特征化方法,让特征工程一站式完成。这篇给出统一 API 用法与特征选型建议。 →
- 220 DeepChem MolNet Loaders:标准数据集加载方法 DeepChem 的 MolNet loader 一行加载标准分子数据集与划分,是建立可比实验的便捷入口。这篇给出参数含义、返回值结构与常见误用。 →
- 221 REINVENT4:分子生成平台部署与任务配置 REINVENT4 通过配置文件定义生成模式与多目标打分,是目标导向分子生成的工程化平台。这篇给出配置结构、打分函数设计与实际使用要点。 →
- 222 GuacaMol:分子生成模型评测工具 GuacaMol 提供分布学习与目标导向两类基准,用于客观评测分子生成模型。这篇讲清两类任务、各指标含义,以及这套基准已知的局限。 →
- 223 MOSES:分子生成基准评测工具 MOSES 提供标准数据、指标与基线,衡量生成模型的有效性、新颖性与分布相似度。这篇讲清它的指标体系与和 GuacaMol 的互补关系。 →
- 224 CLI Agent 调用 CADD 工具:AI Agent 如何驱动计算流程 用 LLM Agent 通过命令行编排 RDKit、对接、模拟等工具,把零散步骤串成自动化流程。这篇给出可落地的架构、工具封装规范与必须设置的护栏。 →
- 225 AI 制药工具工程化:从脚本到企业内部平台 把零散脚本沉淀为可复用、可复现、可协作的内部平台,是 AI 制药工具规模化落地的关键。这篇给出分阶段演进路径与每个阶段该解决的问题。 →