236

PDB:蛋白结构数据库基础入门

PDB 是实验测定生物大分子三维结构的全球档案库,是基于结构的药物设计的基础数据。这篇讲清结构的来源方法、文件内容与使用前必须做的判断。

PDB(Protein Data Bank)是生物大分子三维结构的全球唯一档案库,1971 年建立至今。基于结构的药物设计的一切——对接、口袋分析、结构预测模型的训练——都建立在它之上。但 PDB 里的结构不是「真相」,而是「实验对真相的一次测量」,理解这一点是正确使用它的前提。

规模与构成

维度 情况
结构总数 逾 22 万个
X 射线晶体学 约 85%
冷冻电镜(cryo-EM) 约 10% 且快速增长
核磁共振(NMR) 约 7%
含小分子配体的结构 数万个,是药物设计的核心资源

不同实验方法的特点

  • X 射线晶体学:分辨率高(好的可达 1.5 Å 以下),是配体结合模式的主要来源。但是晶体环境下的构象,可能与溶液中的生理状态有差异;晶体堆积接触有时会固定住非生理构象。
  • 冷冻电镜:适合大复合物和膜蛋白,不需要结晶。分辨率近年大幅提升,但通常仍不如高分辨晶体结构精细,局部侧链位置可能不确定。
  • NMR:给出溶液中的构象系综(一个文件里多个模型),能反映柔性,但仅适用于较小的蛋白。

文件里有什么

ATOM      1  N   MET A   1      38.428  13.104  12.311  1.00 34.52   N
ATOM      2  CA  MET A   1      37.132  12.427  12.318  1.00 33.87   C
...
HETATM 3421  C1  LIG A 501      12.345  23.456  -5.678  1.00 21.34   C
HETATM 3455  O   HOH A 601      15.234  20.123  -3.456  1.00 28.91   O
记录 含义
ATOM 标准生物聚合物原子(蛋白、核酸)
HETATM 配体、水、离子、辅因子、结晶助剂
占有率(occupancy) 该原子出现的比例,<1 表示多构象或部分占据
B 因子 原子位置的不确定性/热运动,越大越不确定
REMARK 分辨率、R 因子、缺失残基等元数据

现代推荐用 mmCIF 格式而非传统 PDB 格式:PDB 格式有列宽限制,链数、原子数超限的大结构无法正确表达,mmCIF 没有这个问题。

使用前必须做的判断

  • 没有氢原子:绝大多数 X 射线结构分辨率不足以定位氢。对接和模拟前必须自己加氢并确定质子化态(见 215《PDBFixer》)。
  • 常有缺失原子和残基:柔性 loop 和侧链末端经常在电子密度中看不见,文件里就直接没有。缺失区域若靠近结合位点,口袋形状就是不完整的。
  • HETATM 里混着结晶助剂:甘油、DMSO、PEG、硫酸根等是为了结晶加的,不是生物学相关的。但催化金属、辅因子必须保留——删之前要判断每一个是什么
  • 可能存在多构象:占有率小于 1 的原子有替代构象(altloc A/B),处理时要选定一个。
  • 生物学装配 vs 不对称单元:文件里的内容是晶体学不对称单元,不一定等于生物学功能单元。二聚体酶可能在文件里只有一条链,需要用生物学装配(biological assembly)文件。
  • 水分子要不要留:结合位点的保守水常参与桥接相互作用,对接时是否保留需专门决定,不能一律删掉。

关键要点

  • PDB 结构是实验测量结果,带有分辨率、缺失、晶体环境等固有限制;
  • 几乎没有氢原子,使用前必须自行加氢并定质子化态;
  • 删 HETATM 前要逐个判断:结晶助剂删、催化金属与辅因子留;
  • 注意不对称单元与生物学装配的区别,别把二聚体当单体用。

延伸资源