Binding MOAD(Mother Of All Databases,密歇根大学 Carlson 组)是另一个蛋白-配体复合物数据库。它与 PDBbind 的核心差别在于更强调「生物学相关性」的人工判断:不只是有配体就收,而是逐个判断这个配体是不是真正有生物学意义的结合物。
筛选标准
| 标准 | 要求 |
|---|---|
| 实验方法 | X 射线晶体学 |
| 分辨率 | ≤ 2.5 Å |
| 配体性质 | 生物学相关,排除结晶助剂、缓冲液成分、冷冻保护剂 |
| 配体类型 | 非共价结合的小分子为主,标注共价情况 |
| 亲和力 | 部分条目有从文献提取的 Kd/Ki/IC50 |
「生物学相关配体」的人工判定是它最有价值的地方。PDB 结构里的 HETATM 混杂着大量甘油、PEG、硫酸根、乙二醇——自动流程很难可靠区分哪些是真正的结合配体。Binding MOAD 逐个人工审核了这件事,对构建干净的复合物数据集帮助很大。
规模与内容
- 约 4 万个复合物条目,覆盖近 4 万个 PDB 结构;
- 其中约 1.6 万条带有实测结合亲和力数据;
- 按蛋白家族做了聚类(用于避免冗余);
- 标注了配体的有效性、共价与否、是否为辅因子。
与 PDBbind 的差别
| 维度 | PDBbind | Binding MOAD |
|---|---|---|
| 核心目标 | 亲和力预测的训练/评测 | 高质量复合物的全面收录 |
| 亲和力覆盖 | 全部条目都有 | 约 40% 条目有 |
| 配体筛选 | 侧重有亲和力数据 | 侧重生物学相关性人工判定 |
| 规模 | 约 1.9 万(general) | 约 4 万 |
| 标准评测集 | 有(CASF core set) | 无固定评测集 |
| 家族聚类 | 有 | 有,且更细致 |
怎么用
# 从官网下载全量数据(CSV + 结构列表)
# every.csv 含:PDB ID、配体标识、有效性标注、亲和力值与类型
import pandas as pd
df = pd.read_csv("every.csv")
# 只保留有效的生物学相关配体,且有精确亲和力
valid = df[(df["validity"] == "valid") & df["affinity_value"].notna()]
# 按蛋白家族聚类去冗余,避免同源蛋白跨划分
families = valid.groupby("family_id")
print(f"{len(valid)} 条有效数据,覆盖 {families.ngroups} 个蛋白家族")
三个实用场景
- 构建干净的复合物集:需要「只含真实结合配体」的结构集时(如训练姿势预测模型、做口袋分析),它的有效性标注省掉大量人工筛查。
- 做非冗余划分:它的蛋白家族聚类可以直接用来构建无泄漏的训练/测试划分——这正是 PDBbind 默认划分最欠缺的(见 238《PDBbind》)。
- 补充 PDBbind:两者有重叠但不完全相同,合并使用能扩大数据量,但必须去重,且合并后要重新做非冗余划分。
注意
- 亲和力覆盖不全:多数条目只有结构没有亲和力,做定量预测时可用数据量小于总规模。
- 亲和力类型混杂:Kd、Ki、IC50 混在一起,含义不同,建模时应分开或只取一种。
- 更新频率:更新不如 PDB 本身及时,最新结构可能未收录。
- 结构本身的限制仍在:分辨率、缺失原子、配体密度质量等问题依然需要自己检查(见 237《RCSB PDB》)。
上手提示
- 核心价值是「生物学相关配体」的人工判定,省掉筛结晶助剂的苦活;
- 它的蛋白家族聚类可直接用来做无泄漏划分;
- 只有约 40% 条目有亲和力,定量建模时实际可用量要重新算;
- 与 PDBbind 合并使用需去重并重做非冗余划分。
延伸资源
- 对照数据集:238《PDBbind》、240《CrossDocked2020》;结构来源:236《PDB》、237《RCSB PDB》;
- 评测陷阱:169《Benchmark 陷阱》。