MODULE 06 / 55 RECORDS

开源工具

化学信息学、对接、结构、模拟、生成的开源工具栈

全部文章索引 →
  1. 171 RDKit:化学信息学项目的事实标准工具 RDKit 是开源化学信息学的事实标准:读写分子、指纹、描述符、子结构、构象、绘图都靠它。这篇给出可直接运行的代码骨架、必须知道的坑(分子标准化、指纹参数、构象随机性),以及把它嵌进生产流程的方式。
  2. 172 DeepChem:AI 药物发现开源框架实战价值 DeepChem 把数据集、特征化、模型、划分统一成四件套,是新手跑通分子机器学习最省心的框架。这篇讲清它的对象模型、什么时候该用它、什么时候该换掉它。
  3. 173 TDC:药物发现数据集和 Benchmark 工具箱 PyTDC 一行加载贯穿研发全流程的标准数据集、划分与评测。这篇讲清它的三层任务体系、真正该用的划分方式,以及把公开 benchmark 结论迁到自家项目时的边界。
  4. 174 Chemprop:分子性质预测模型训练入门 Chemprop 提供开箱即用的 D-MPNN 训练流程,是分子性质预测最该先打的强基线。这篇给出完整命令行、必须开的选项,以及怎么读它的不确定性输出。
  5. 175 TorchDrug:面向药物发现的深度学习库 TorchDrug 把分子、蛋白、知识图谱任务封装成统一的 PyTorch 接口,适合做研究与原型。这篇讲清它的分层设计、覆盖范围,以及选型时和 PyG、DeepChem 的取舍。
  6. 176 PyTorch Geometric:GNN 分子建模的基础框架 PyTorch Geometric 是图深度学习的主流框架,也是自己实现分子 GNN 的基础设施。这篇讲清它的数据结构、批处理机制、消息传递写法,以及分子建模里的具体用法。
  7. 177 DGL-LifeSci:生命科学图深度学习工具包 DGL-LifeSci 在 DGL 之上为分子与蛋白图任务提供现成模型与数据加载,是 PyG 之外的另一条 GNN 路线。这篇讲清它的能力边界与选型判断。
  8. 178 DeepPurpose:DTI、药物重定位与组合预测工具 DeepPurpose 用几行代码搭起 DTI、药物重定位与药物组合预测,适合快速起步与做基线。这篇给出完整代码路径,也讲清它在真实项目中的准确边界。
  9. 179 MoleculeNet 工具链:分子机器学习数据怎么用 MoleculeNet 提供标准分子数据集与划分,是建立可比实验的起点。这篇列清主要数据集的规模与任务类型,并说明它作为 benchmark 的已知问题。
  10. 180 DeepChem Examples:从示例项目学习 AI 制药 DeepChem 的示例与教程仓库用可运行项目串起分子 ML 全流程,是边做边学的好材料。这篇给出推荐的学习顺序和每个阶段该拿到的能力。
  11. 181 TeachOpenCADD:CADD 教学项目如何变成内部培训资料 TeachOpenCADD 的 talktorial 体系既能自学,也很适合改造成团队内部的 CADD 培训教材。这篇给出模块地图和把它变成内训课程的具体做法。
  12. 182 AutoDock Vina:开源对接工具部署指南 AutoDock Vina 是最常用的免费对接引擎:部署轻、易脚本化、社区成熟。这篇给出从受体准备到批量筛选的完整命令、盒子设置的具体做法,以及为什么必须先做重对接验证。
  13. 183 GNINA:GPU 加速 Docking 与 CNN 重打分 GNINA 在 Vina 谱系上加入 CNN 打分与 GPU 加速,适合在对接后做深度学习重排序。这篇给出命令、打分模式选择,以及 CNN 重打分真正能带来多少提升。
  14. 184 DiffDock:深度学习对接模型部署与使用 DiffDock 用扩散模型做盲对接,无需指定口袋即可给出候选姿势与置信度。这篇给出部署命令、置信度的正确读法,以及它被独立评测质疑的那些点。
  15. 185 EquiBind:快速结合姿势预测工具评估 EquiBind 一步直接回归结合姿势,速度极快,适合超大规模初筛,但精度有限必须后处理。这篇讲清它的等变思路、真实精度水平和正确定位。
  16. 186 TankBind:蛋白-配体结合预测工具实测 TankBind 预测蛋白-配体分子间距离矩阵再重建姿势,同时给出亲和力估计。这篇讲清它的分块口袋策略、与直接回归方法的区别和实际用法。
  17. 187 Uni-Mol:分子预训练模型部署指南 Uni-Mol 提供 3D 分子预训练权重与微调接口,可迁移到性质预测、对接等任务。这篇讲清它的 3D 预训练思路、微调方式与适用边界。
  18. 188 Uni-Mol Docking V2:开源 Docking 工作流体验 Uni-Mol Docking V2 用预训练模型做对接,在姿势合理性上明显改善,可纳入自有筛选流程。这篇讲清它相比第一代与其它深度学习对接方法的差别。
  19. 189 PaddleHelix:国产开源生物计算框架介绍 PaddleHelix 基于飞桨,覆盖结构预测、DTI 与分子生成,是中文生态友好的国产开源框架。这篇给出模块地图与选型时的实际考量。
  20. 190 HelixFold3:国产结构预测模型应用指南 HelixFold3 是飞桨生态下的 AF3 类结构预测实现,可预测蛋白及复合物,是国产开源选项。这篇讲清它的能力范围、许可与部署要点。
  21. 191 OpenFold:训练和推理 AlphaFold 类模型的开源方案 OpenFold 是可训练的开源 AlphaFold2 复现,适合需要微调或扩展结构预测模型的团队。这篇讲清它相对官方实现的差异与真实使用场景。
  22. 192 Boltz:开放结构预测工具的安装与使用 Boltz 是 MIT 许可的开放结构预测工具,能力对标 AF3 且商用无限制。这篇给出安装推理命令、输入格式与置信度解读。
  23. 193 Chai-1:复合物结构预测工具部署指南 Chai-1 是 Chai Discovery 开源的复合物结构预测工具,支持多模态输入与实验约束注入。这篇讲清它的部署方式、独特功能与许可条件。
  24. 194 ESM:蛋白语言模型工具箱怎么用 ESM 提供 ESM-2 等蛋白语言模型权重与接口,可提取表征用于多种下游任务。这篇给出取嵌入的代码、各档模型的取舍,以及零样本突变效应预测的用法。
  25. 195 ESMFold:快速蛋白结构预测实战 ESMFold 免 MSA、从单序列快速预测结构,适合大规模或快速迭代场景。这篇讲清它的速度优势、精度代价与最适合的使用位置。
  26. 196 ProteinMPNN:蛋白序列设计工具实战 ProteinMPNN 给定骨架结构设计氨基酸序列,湿实验成功率高,是蛋白设计管线的核心环节。这篇给出命令、关键参数与它在设计流程中的位置。
  27. 197 RFdiffusion:蛋白骨架生成工具实战 RFdiffusion 用扩散模型按约束生成蛋白骨架,可做结合物设计与对称组装,是从头设计的主力工具。这篇给出各设计模式的命令与实际成功率预期。
  28. 198 Rosetta:经典蛋白设计平台为什么仍然重要 Rosetta 是积累深厚的蛋白建模与设计平台,在能量函数与设计协议上仍是很多工作的基础。这篇讲清它今天不可替代的部分与获取方式。
  29. 199 PyRosetta:用 Python 调用 Rosetta 的工程路线 PyRosetta 把 Rosetta 能力暴露为 Python 接口,便于脚本化并与 AI 工具集成。这篇给出安装、常用对象与典型精修/打分代码。
  30. 200 OpenMM:分子动力学模拟开源引擎 OpenMM 是 GPU 加速、Python 友好的 MD 引擎,是跑蛋白-配体模拟的推荐起点。这篇给出可直接运行的完整体系搭建脚本与参数选择依据。
  31. 201 OpenFE:自由能计算开源平台 OpenFE 提供可复现的相对结合自由能工作流,是先导优化中 FEP 的开源选择。这篇讲清网络设计、运行方式与结果判读标准。
  32. 202 OpenFF Toolkit:小分子力场参数化工具 OpenFF Toolkit 给小分子生成现代力场参数,是 MD 与自由能计算前不可省略的一步。这篇讲清参数化流程、电荷方法选择与常见失败原因。
  33. 203 Perses:炼金自由能计算工具介绍 Perses 基于 OpenMM 做炼金自由能计算,适合研究与定制方法。这篇讲清它与 OpenFE 的分工、非平衡切换的思路与使用建议。
  34. 204 YANK:结合自由能计算工具介绍 YANK 是基于 OpenMM 的结合自由能计算工具,常用于绝对结合自由能等研究性计算。这篇讲清绝对自由能的难点、限制势的作用与它的当前状态。
  35. 205 MDAnalysis:MD 轨迹分析工具 MDAnalysis 是用 Python 分析 MD 轨迹的主力库,能算 RMSD、相互作用等各类指标。这篇给出选择语法、常用分析代码与大轨迹的性能要点。
  36. 206 MDTraj:轻量级分子动力学轨迹分析 MDTraj 轻量、快速,适合做 MD 轨迹的几何计算与格式转换。这篇给出常用 API、与 MDAnalysis 的分工,以及它在二级结构与聚类分析上的优势。
  37. 207 ProLIF:蛋白-配体相互作用指纹工具 ProLIF 把蛋白-配体相互作用编码成指纹,适合比较姿势、统计 MD 轨迹中相互作用的稳定性。这篇给出完整代码与指纹的实际用法。
  38. 208 PLIP:自动识别蛋白-配体相互作用 PLIP 自动识别氢键、疏水、π 堆积、盐桥等相互作用并生成报告,快速理解结合模式。这篇给出命令行用法、输出解读与它与 ProLIF 的分工。
  39. 209 ProDy:蛋白结构动力学分析工具 ProDy 擅长蛋白结构与柔性分析(弹性网络模型、PCA),用于研究构象变化与功能运动。这篇讲清 ENM 与 PCA 的用法及其在药物设计中的价值。
  40. 210 Biopython:生物序列与结构数据处理基础 Biopython 是处理生物序列与结构数据的基础库,用于序列解析、PDB 处理与数据库交互。这篇给出最常用的三块能力与实际代码。
  41. 211 PyMOL 开源版:结构可视化和作图流程 PyMOL 开源版满足多数结构可视化与作图需求,掌握选择语法与渲染即可出版级配图。这篇给出脚本化作图流程与一套可直接复用的出图设置。
  42. 212 NGLView:Jupyter 中展示三维结构 NGLView 在 Jupyter 里交互展示结构与轨迹,适合边分析边看的工作流。这篇给出与 MDAnalysis/MDTraj 联动的用法和常见渲染技巧。
  43. 213 3Dmol.js:把分子结构嵌入网页 3Dmol.js 是纯 JS 的三维分子查看库,适合把结构与对接结果嵌入网页或内部平台。这篇给出可直接复制的嵌入代码与常见交互实现。
  44. 214 Meeko:Docking 文件准备工具 Meeko 把配体与受体转成 Vina 所需的 PDBQT 并处理大环等细节,是 Vina 对接的标准前处理。这篇给出完整命令与容易出错的化学细节。
  45. 215 PDBFixer:蛋白结构修复工具 PDBFixer 补全缺失原子与残基、加氢、处理非标准残基,是对接与模拟前的结构修复利器。这篇给出完整修复流程与每一步的判断依据。
  46. 216 OpenBabel:化学文件格式转换工具 OpenBabel 支持上百种化学格式互转,是处理格式不兼容的常备工具。这篇给出常用命令、批量处理技巧,以及它在哪些场景该让位给 RDKit。
  47. 217 Mols2grid:分子表格可视化工具 mols2grid 在 Notebook 里把一批分子渲染成可交互的网格表格,便于浏览、筛选与挑选。这篇给出实际代码与在筛选流程中的用法。
  48. 218 Datamol:现代化学信息学数据处理工具 Datamol 在 RDKit 之上提供更简洁的 API 与并行处理,让分子数据清洗更顺手。这篇给出对比代码,说明它省掉了哪些样板。
  49. 219 Molfeat:分子特征工程工具箱 Molfeat 统一了指纹、描述符、预训练表征等多种分子特征化方法,让特征工程一站式完成。这篇给出统一 API 用法与特征选型建议。
  50. 220 DeepChem MolNet Loaders:标准数据集加载方法 DeepChem 的 MolNet loader 一行加载标准分子数据集与划分,是建立可比实验的便捷入口。这篇给出参数含义、返回值结构与常见误用。
  51. 221 REINVENT4:分子生成平台部署与任务配置 REINVENT4 通过配置文件定义生成模式与多目标打分,是目标导向分子生成的工程化平台。这篇给出配置结构、打分函数设计与实际使用要点。
  52. 222 GuacaMol:分子生成模型评测工具 GuacaMol 提供分布学习与目标导向两类基准,用于客观评测分子生成模型。这篇讲清两类任务、各指标含义,以及这套基准已知的局限。
  53. 223 MOSES:分子生成基准评测工具 MOSES 提供标准数据、指标与基线,衡量生成模型的有效性、新颖性与分布相似度。这篇讲清它的指标体系与和 GuacaMol 的互补关系。
  54. 224 CLI Agent 调用 CADD 工具:AI Agent 如何驱动计算流程 用 LLM Agent 通过命令行编排 RDKit、对接、模拟等工具,把零散步骤串成自动化流程。这篇给出可落地的架构、工具封装规范与必须设置的护栏。
  55. 225 AI 制药工具工程化:从脚本到企业内部平台 把零散脚本沉淀为可复用、可复现、可协作的内部平台,是 AI 制药工具规模化落地的关键。这篇给出分阶段演进路径与每个阶段该解决的问题。