PDB(Protein Data Bank)是生物大分子三维结构的全球唯一档案库,1971 年建立至今。基于结构的药物设计的一切——对接、口袋分析、结构预测模型的训练——都建立在它之上。但 PDB 里的结构不是「真相」,而是「实验对真相的一次测量」,理解这一点是正确使用它的前提。
规模与构成
| 维度 | 情况 |
|---|---|
| 结构总数 | 逾 22 万个 |
| X 射线晶体学 | 约 85% |
| 冷冻电镜(cryo-EM) | 约 10% 且快速增长 |
| 核磁共振(NMR) | 约 7% |
| 含小分子配体的结构 | 数万个,是药物设计的核心资源 |
不同实验方法的特点
- X 射线晶体学:分辨率高(好的可达 1.5 Å 以下),是配体结合模式的主要来源。但是晶体环境下的构象,可能与溶液中的生理状态有差异;晶体堆积接触有时会固定住非生理构象。
- 冷冻电镜:适合大复合物和膜蛋白,不需要结晶。分辨率近年大幅提升,但通常仍不如高分辨晶体结构精细,局部侧链位置可能不确定。
- NMR:给出溶液中的构象系综(一个文件里多个模型),能反映柔性,但仅适用于较小的蛋白。
文件里有什么
ATOM 1 N MET A 1 38.428 13.104 12.311 1.00 34.52 N
ATOM 2 CA MET A 1 37.132 12.427 12.318 1.00 33.87 C
...
HETATM 3421 C1 LIG A 501 12.345 23.456 -5.678 1.00 21.34 C
HETATM 3455 O HOH A 601 15.234 20.123 -3.456 1.00 28.91 O
| 记录 | 含义 |
|---|---|
ATOM |
标准生物聚合物原子(蛋白、核酸) |
HETATM |
配体、水、离子、辅因子、结晶助剂 |
| 占有率(occupancy) | 该原子出现的比例,<1 表示多构象或部分占据 |
| B 因子 | 原子位置的不确定性/热运动,越大越不确定 |
REMARK |
分辨率、R 因子、缺失残基等元数据 |
现代推荐用 mmCIF 格式而非传统 PDB 格式:PDB 格式有列宽限制,链数、原子数超限的大结构无法正确表达,mmCIF 没有这个问题。
使用前必须做的判断
- 没有氢原子:绝大多数 X 射线结构分辨率不足以定位氢。对接和模拟前必须自己加氢并确定质子化态(见 215《PDBFixer》)。
- 常有缺失原子和残基:柔性 loop 和侧链末端经常在电子密度中看不见,文件里就直接没有。缺失区域若靠近结合位点,口袋形状就是不完整的。
- HETATM 里混着结晶助剂:甘油、DMSO、PEG、硫酸根等是为了结晶加的,不是生物学相关的。但催化金属、辅因子必须保留——删之前要判断每一个是什么。
- 可能存在多构象:占有率小于 1 的原子有替代构象(altloc A/B),处理时要选定一个。
- 生物学装配 vs 不对称单元:文件里的内容是晶体学不对称单元,不一定等于生物学功能单元。二聚体酶可能在文件里只有一条链,需要用生物学装配(biological assembly)文件。
- 水分子要不要留:结合位点的保守水常参与桥接相互作用,对接时是否保留需专门决定,不能一律删掉。
关键要点
- PDB 结构是实验测量结果,带有分辨率、缺失、晶体环境等固有限制;
- 几乎没有氢原子,使用前必须自行加氢并定质子化态;
- 删 HETATM 前要逐个判断:结晶助剂删、催化金属与辅因子留;
- 注意不对称单元与生物学装配的区别,别把二聚体当单体用。
延伸资源
- 检索与质量判断:237《RCSB PDB》;结构修复:215《PDBFixer》;
- 结合亲和力配对数据:238《PDBbind》、239《Binding MOAD》;
- 口袋分析见「结构与模拟」模块。