239

Binding MOAD:蛋白-配体复合物数据库介绍

Binding MOAD 收录高质量的蛋白-配体复合物及部分亲和力数据,是基于结构建模的优质来源。这篇讲清它的筛选标准、与 PDBbind 的差别和使用方式。

Binding MOAD(Mother Of All Databases,密歇根大学 Carlson 组)是另一个蛋白-配体复合物数据库。它与 PDBbind 的核心差别在于更强调「生物学相关性」的人工判断:不只是有配体就收,而是逐个判断这个配体是不是真正有生物学意义的结合物。

筛选标准

标准 要求
实验方法 X 射线晶体学
分辨率 ≤ 2.5 Å
配体性质 生物学相关,排除结晶助剂、缓冲液成分、冷冻保护剂
配体类型 非共价结合的小分子为主,标注共价情况
亲和力 部分条目有从文献提取的 Kd/Ki/IC50

「生物学相关配体」的人工判定是它最有价值的地方。PDB 结构里的 HETATM 混杂着大量甘油、PEG、硫酸根、乙二醇——自动流程很难可靠区分哪些是真正的结合配体。Binding MOAD 逐个人工审核了这件事,对构建干净的复合物数据集帮助很大。

规模与内容

  • 约 4 万个复合物条目,覆盖近 4 万个 PDB 结构;
  • 其中约 1.6 万条带有实测结合亲和力数据;
  • 按蛋白家族做了聚类(用于避免冗余);
  • 标注了配体的有效性、共价与否、是否为辅因子。

与 PDBbind 的差别

维度 PDBbind Binding MOAD
核心目标 亲和力预测的训练/评测 高质量复合物的全面收录
亲和力覆盖 全部条目都有 约 40% 条目有
配体筛选 侧重有亲和力数据 侧重生物学相关性人工判定
规模 约 1.9 万(general) 约 4 万
标准评测集 有(CASF core set) 无固定评测集
家族聚类 有,且更细致

怎么用

# 从官网下载全量数据(CSV + 结构列表)
# every.csv 含:PDB ID、配体标识、有效性标注、亲和力值与类型

import pandas as pd

df = pd.read_csv("every.csv")
# 只保留有效的生物学相关配体,且有精确亲和力
valid = df[(df["validity"] == "valid") & df["affinity_value"].notna()]

# 按蛋白家族聚类去冗余,避免同源蛋白跨划分
families = valid.groupby("family_id")
print(f"{len(valid)} 条有效数据,覆盖 {families.ngroups} 个蛋白家族")

三个实用场景

  • 构建干净的复合物集:需要「只含真实结合配体」的结构集时(如训练姿势预测模型、做口袋分析),它的有效性标注省掉大量人工筛查。
  • 做非冗余划分:它的蛋白家族聚类可以直接用来构建无泄漏的训练/测试划分——这正是 PDBbind 默认划分最欠缺的(见 238《PDBbind》)。
  • 补充 PDBbind:两者有重叠但不完全相同,合并使用能扩大数据量,但必须去重,且合并后要重新做非冗余划分。

注意

  • 亲和力覆盖不全:多数条目只有结构没有亲和力,做定量预测时可用数据量小于总规模。
  • 亲和力类型混杂:Kd、Ki、IC50 混在一起,含义不同,建模时应分开或只取一种。
  • 更新频率:更新不如 PDB 本身及时,最新结构可能未收录。
  • 结构本身的限制仍在:分辨率、缺失原子、配体密度质量等问题依然需要自己检查(见 237《RCSB PDB》)。

上手提示

  • 核心价值是「生物学相关配体」的人工判定,省掉筛结晶助剂的苦活;
  • 它的蛋白家族聚类可直接用来做无泄漏划分;
  • 只有约 40% 条目有亲和力,定量建模时实际可用量要重新算;
  • 与 PDBbind 合并使用需去重并重做非冗余划分。

延伸资源