MODULE 07 / 45 RECORDS

数据资源

化合物/结构/活性数据库、Benchmark、组学数据

全部文章索引 →
  1. 226 ChEMBL:药物活性数据的核心数据库 ChEMBL 是开源生物活性数据的核心库,汇集大量从文献人工整理的化合物-靶点活性。这篇给出取数的 SQL / API 写法、必须做的清洗步骤,以及数据本身的噪声水平。
  2. 227 PubChem:化合物信息检索和批量下载指南 PubChem 是全球最大的免费化学信息库,覆盖化合物、物质与生物测定。这篇讲清 CID/SID/AID 三层结构、PUG-REST 批量下载写法与数据质量注意事项。
  3. 228 BindingDB:蛋白-配体结合数据怎么用 BindingDB 专注实测的蛋白-配体结合亲和力,是 DTI 与亲和力预测建模的重要来源。这篇讲清它与 ChEMBL 的差别、下载方式与建模注意事项。
  4. 229 DrugBank:药物信息数据库的价值与限制 DrugBank 整合了药物的靶点、机制、药代与相互作用信息,适合查药物背景,但商用受许可限制。这篇讲清它的内容结构、许可条款与开源替代方案。
  5. 230 ZINC:虚拟筛选化合物库入门 ZINC 提供可商业获取化合物的免费三维库,是虚拟筛选取样的标准来源。这篇讲清子集选择、下载方式与用它做筛选时的实际配置。
  6. 231 Enamine REAL:超大可合成化合物空间怎么理解 Enamine REAL 是数百亿级的「按需合成」化合物空间,把虚拟筛选从现货库扩展到可合成空间。这篇讲清它的构建逻辑、检索方法与实际交付预期。
  7. 232 Mcule:商业筛选库在虚拟筛选中的用途 Mcule 提供可快速采购的商业化合物库与在线工具,适合把虚拟筛选命中物落到可买分子。这篇讲清它的库分层、在线工具与采购流程中的实际用法。
  8. 233 eMolecules:采购导向化合物库怎么筛选 eMolecules 聚合多家供应商的可采购化合物,便于把候选分子落实到现实可得与可比价。这篇讲清它的分层体系、比价逻辑与采购决策要点。
  9. 234 SureChEMBL:专利化学结构数据如何使用 SureChEMBL 从专利文献自动抽取化学结构,是追踪竞品化学空间与专利态势的数据来源。这篇讲清它的抽取原理、检索方式与作为专利分析工具的能力边界。
  10. 235 CAS Common Chemistry:免费化学物质信息资源 CAS Common Chemistry 提供一批常见物质的免费权威基础信息,适合快速核对名称、CAS 号与结构。这篇讲清它的覆盖范围、使用方式与免费版的边界。
  11. 236 PDB:蛋白结构数据库基础入门 PDB 是实验测定生物大分子三维结构的全球档案库,是基于结构的药物设计的基础数据。这篇讲清结构的来源方法、文件内容与使用前必须做的判断。
  12. 237 RCSB PDB:结构检索、下载与质量判断 RCSB 是 PDB 的主要门户,提供强大的检索、下载与质量指标。这篇给出高级检索、批量下载脚本,以及判断一个结构能不能用的具体标准。
  13. 238 PDBbind:结合亲和力数据集怎么用于 AI 训练 PDBbind 把 PDB 复合物配上实测亲和力,是打分函数与亲和力模型的常用训练评测集。这篇讲清它的分层结构、CASF 评测体系与广为人知的数据泄漏问题。
  14. 239 Binding MOAD:蛋白-配体复合物数据库介绍 Binding MOAD 收录高质量的蛋白-配体复合物及部分亲和力数据,是基于结构建模的优质来源。这篇讲清它的筛选标准、与 PDBbind 的差别和使用方式。
  15. 240 CrossDocked2020:深度学习 Docking 常用数据集 CrossDocked2020 提供大量交叉对接姿势,是训练深度学习对接与基于结构生成模型的常用数据集。这篇讲清它的构建逻辑、正确用法与已知偏差。
  16. 241 DUD-E:虚拟筛选 Benchmark 的优势和问题 DUD-E 用活性分子加物理性质匹配的诱饵评测虚拟筛选,是经典基准但存在严重偏倚。这篇讲清它的构建逻辑、被发现的问题与今天该怎么用。
  17. 242 LIT-PCBA:更接近真实筛选场景的 Benchmark LIT-PCBA 从真实高通量筛选实验构建,活性与非活性都是实测的,弥补 DUD-E 的偏倚问题。这篇讲清它的构建方式、难度水平与正确的期望值。
  18. 243 MoleculeNet:分子性质预测标准数据集 MoleculeNet 汇集物理化学、生物活性与毒性等标准数据集与划分,是分子性质预测的常用数据来源。这篇给出数据集速查、正确用法与已知的质量问题。
  19. 244 TDC ADMET Group:ADMET 预测任务集合 TDC ADMET Group 把 22 个 ADMET 终点打包成标准任务与排行榜,是 ADMET 建模的首选数据。这篇给出终点清单、评测流程与各终点的实际难度。
  20. 245 TDC HTS Group:高通量筛选数据建模任务 TDC HTS Group 提供高通量筛选活性建模任务,适合练习大规模、不平衡的活性预测。这篇讲清任务内容、不平衡处理与假阳性问题。
  21. 246 TDC DTI Group:药物-靶点相互作用任务 TDC DTI Group 提供标准的药物-靶点亲和力任务与划分,是 DTI 建模与冷启动评估的基准。这篇讲清数据集差异、冷启动划分的重要性与建模要点。
  22. 247 TDC Trial Group:临床试验相关 AI 任务 TDC Trial Group 提供临床试验结果预测等任务,把 AI 延伸到研发后端的决策问题。这篇讲清任务设置、数据来源与这类预测的现实边界。
  23. 248 TDC Genomics Group:基因组任务与药物研发连接 TDC Genomics Group 提供基因组相关任务(如 CRISPR 结果预测),把组学与药物研发连接起来。这篇讲清任务内容、建模要点与它在研发链条中的位置。
  24. 249 Open Targets Platform:靶点发现证据链怎么查 Open Targets 整合多源证据为「靶点-疾病」关联打分,是查靶点证据链、做优先级排序的权威平台。这篇讲清证据类型、打分逻辑与查询方式。
  25. 250 Open Targets Genetics:遗传学证据如何支持靶点选择 Open Targets Genetics 把 GWAS 等遗传关联映射到具体基因,提供较强的因果性证据。这篇讲清变异到基因的映射难题、L2G 打分与孟德尔随机化的用法。
  26. 251 DisGeNET:疾病-基因关联数据库使用指南 DisGeNET 汇总疾病-基因关联,便于围绕某疾病快速梳理候选基因。这篇讲清它的证据来源分层、打分含义与使用时的判断。
  27. 252 GWAS Catalog:遗传关联研究结果如何转化为靶点证据 GWAS Catalog 收录已发表的全基因组关联结果,是把遗传关联转化为靶点证据的原始来源。这篇讲清数据结构、显著性阈值与从关联到靶点的完整链条。
  28. 253 ClinVar:临床变异数据库在药物研发中的价值 ClinVar 收录变异与临床意义的关联,帮助理解致病变异、支持靶点与适应症判断。这篇讲清致病性分级、证据星级与在靶点验证中的用法。
  29. 254 OMIM:遗传病知识库如何辅助靶点研究 OMIM 系统整理人类基因与遗传病的关系,是理解基因-疾病机制、寻找因果靶点的经典知识库。这篇讲清它的编号体系、内容深度与独特价值。
  30. 255 UniProt:蛋白信息检索的基础数据库 UniProt 是蛋白序列与功能注释的权威基础库,几乎所有蛋白分析都从它取序列与注释。这篇讲清 Swiss-Prot 与 TrEMBL 的区别、检索语法与关键注释字段。
  31. 256 Pfam:蛋白结构域数据库怎么用 Pfam 用隐马尔可夫模型定义蛋白家族与结构域,帮助识别蛋白的功能模块。这篇讲清 HMM 的原理优势、检索方式与在靶点分析中的用法。
  32. 257 InterPro:蛋白功能注释整合平台 InterPro 整合 Pfam 等多个成员库,给蛋白统一的家族、结构域与功能注释。这篇讲清成员库构成、InterProScan 的用法与整合注释的价值。
  33. 258 STRING:蛋白互作网络如何用于靶点分析 STRING 提供已知与预测的蛋白互作网络,帮助把靶点放进相互作用与通路的语境中分析。这篇讲清证据通道、置信度阈值与网络分析的正确做法。
  34. 259 BioGRID:实验支持的互作数据资源 BioGRID 聚焦有实验支持的蛋白与基因相互作用,是比预测网络更可靠的互作证据来源。这篇讲清实验方法分类、证据强度判断与使用方式。
  35. 260 Reactome:通路数据库在机制研究中的用途 Reactome 提供人工审编的生物通路,帮助理解靶点在信号与代谢通路中的位置。这篇讲清它的层级结构、反应级建模的价值与富集分析用法。
  36. 261 KEGG:通路、代谢与药物信息整合资源 KEGG 整合通路、代谢、疾病与药物信息,是机制与代谢研究的经典综合资源。这篇讲清子库结构、访问方式与许可上的注意事项。
  37. 262 Gene Ontology:GO 注释如何解释基因功能 Gene Ontology 用标准化术语描述基因的功能、过程与定位,是功能富集分析的基础。这篇讲清三大本体、证据代码与富集分析的正确做法。
  38. 263 MSigDB:基因集分析与药物机制研究 MSigDB 提供大量精选基因集,配合 GSEA 用于解读表达变化与推断药物机制。这篇讲清各集合的用途、Hallmark 的特殊价值与分析实践。
  39. 264 DepMap:癌症依赖性数据如何寻找靶点 DepMap 用大规模 CRISPR 敲除筛选揭示癌细胞系的基因依赖,是发现癌症靶点的关键资源。这篇讲清依赖性分数的读法、选择性依赖的识别与合成致死分析。
  40. 265 CCLE:癌细胞系组学数据资源 CCLE 提供数百癌细胞系的多组学数据,是解释依赖性、药敏与建立细胞系模型的基础。这篇讲清数据类型、与 DepMap 的关系和分析要点。
  41. 266 GDSC:药敏数据如何支持适应症选择 GDSC 提供细胞系对大量药物的敏感性数据,帮助把药物与基因组特征关联。这篇讲清剂量响应指标、生物标志物发现方法与建模注意事项。
  42. 267 PRISM Repurposing:大规模药物重定位数据集 PRISM 用条形码混合细胞系并行测大量药物活性,是大规模药物重定位与机制研究的数据来源。这篇讲清条形码技术、重定位数据集与结果解读。
  43. 268 LINCS L1000:转录组扰动数据如何用于药物发现 LINCS L1000 用低成本测一千个标志基因,构建海量扰动转录组特征,用于连通性与机制分析。这篇讲清 L1000 技术、连通性分析与数据质量判断。
  44. 269 cBioPortal:肿瘤基因组数据查询指南 cBioPortal 提供友好的界面查询大量癌症基因组数据集,便于快速探索突变、表达与临床关联。这篇给出查询方式、API 用法与分析要点。
  45. 270 TCGA:癌症多组学数据在靶点发现中的用途 TCGA 提供数十种癌症的大规模多组学与临床数据,是癌症靶点发现与生物标志物研究的基石。这篇讲清数据层级、访问方式与分析中的关键陷阱。