115

RoseTTAFold All-Atom:全原子建模为什么重要

RoseTTAFold All-Atom 把建模范围扩展到小分子、核酸与修饰。这篇讲清全原子建模的必要性与它的开放优势。

RoseTTAFold All-Atom(RFAA)(Krishna 等,Science 2024)把 RoseTTAFold 从「只建模蛋白主链框架」扩展到全原子、多分子类型。它与 AlphaFold3 目标相似,但完全开放——这是它的核心差异。

为什么「全原子」重要

# AF2/RF 的表示方式:
#   每个氨基酸残基用一个「框架」(frame)表示
#     = 主链 N-CA-C 定义的局部坐标系
#   侧链通过扭转角(chi angles)附加
#
#   优点:参数少,适合蛋白
#   限制:
#     - 只能处理标准氨基酸
#     - 小分子没有「残基框架」的概念
#     - 核酸、辅因子、金属、修饰都无法自然表示
#
# 全原子表示:
#   每个原子是一个独立的实体,有自己的坐标
#
#   优点:
#     - 统一处理任何分子类型
#     - 蛋白、DNA、RNA、小分子、离子、共价修饰
#       —— 都只是「一堆原子」
#   代价:
#     - 参数与计算量增加
#     - 需要处理原子间的化学键约束
#
# 这就是 AF3 与 RFAA 都转向全原子的原因:
#   要建模真实的生物复合物,就必须能处理非蛋白成分

RFAA 能建模什么

类型 支持 药物发现中的意义
蛋白(含多链) 基础
小分子配体 结合模式预测
DNA / RNA 核酸药物、转录因子(见 375《反义寡核苷酸 ASO》
金属离子 金属酶的活性位点
共价修饰 共价抑制剂(见 379《共价抑制剂设计》
糖基化 抗体与膜蛋白
非标准氨基酸 多肽药物(见 372《多肽药物设计》

与 AlphaFold3 的对比

AlphaFold3 RFAA
准确度 总体更高 接近但通常略低
结构生成 扩散模块 基于 RF 的三轨 + 全原子扩展
开放程度 受限(非商业) 完全开放,可商用
权重获取 需申请 直接下载
与设计工具的衔接 与 RFdiffusion 生态打通
共价修饰 支持 支持,且可用于设计

RFAA 的独特价值不在于预测准确度,而在于它是「可用于设计的全原子模型」——配合 RFdiffusion,可以做针对小分子的结合口袋从头设计,这是 AF3 做不到的(AF3 只做预测)。

使用

git clone https://github.com/baker-laboratory/RoseTTAFold-All-Atom.git
cd RoseTTAFold-All-Atom
# 按 README 配置环境并下载权重与序列数据库

# 输入用 YAML 配置
# config.yaml:
#   job_name: my_complex
#   protein_inputs:
#     A:
#       fasta_file: protein.fasta
#   sm_inputs:
#     B:
#       input: ligand.sdf
#       input_type: sdf
#   na_inputs: {}      # 核酸(可选)

python -m rf2aa.run_inference --config-name config

# 输出:
#   预测的复合物 PDB(含配体)
#   置信度指标

# 注意:
#   1) 需要 GPU(显存需求随体系大小增长)
#   2) 需要下载序列数据库做 MSA 搜索
#   3) 小分子输入需要正确的化学结构(SDF/SMILES)
#      质子化态与互变异构体会影响结果

结合口袋设计:RFAA 的独特应用

# 这是 RFAA + RFdiffusion 组合的核心能力
#
# 目标:设计一个能结合指定小分子的全新蛋白
#
# 流程:
#   1) 用 RFdiffusion All-Atom 生成蛋白骨架
#      条件:给定小分子的三维结构
#      → 生成一个「包裹」该分子的蛋白骨架
#
#   2) 用 ProteinMPNN / LigandMPNN 设计序列
#      LigandMPNN 是考虑了配体环境的版本
#      → 在配体附近选择合适的残基
#
#   3) 用 RFAA 或 AF2 验证
#      预测设计序列的结构,检查:
#        - 是否折叠成设计的骨架(RMSD)
#        - 口袋是否保持
#        - 配体是否能结合在预期位置
#
#   4) 实验验证
#      表达、纯化、测结合
#
# 应用场景:
#   - 小分子传感器(生物传感)
#   - 人工酶设计
#   - 新型结合蛋白(替代抗体)
#   - 药物递送载体
#
# 现状:
#   成功率仍然不高(实验验证的命中率是主要瓶颈)
#   但这是【之前完全做不到】的能力
#   → 见 151

使用中的注意事项

  • 小分子的准确度低于蛋白:训练数据中蛋白-小分子复合物的数量远少于蛋白结构,因此配体姿势的预测可靠性较低;
  • 必须做物理检查:与所有深度学习方法一样,生成的配体姿势可能有键长键角问题或空间冲突,用 PoseBusters 检查(见 096《Binding Pose》);
  • 与传统对接交叉验证:RFAA 的预测应与 Vina/GNINA 结果比较;
  • 不预测亲和力:与 AF3 一样,RFAA 只给结构不给结合强度;
  • 新颖配体的可靠性下降:与训练数据差异大的化学类型(如金属有机配合物、罕见杂环)要格外谨慎。

在工具选择中的位置

需求 推荐
最高准确度的复合物预测 AF3(学术)/ Boltz-2(商用,见 121《Boltz-2 技术报告精读》
结合口袋从头设计 RFAA + RFdiffusion All-Atom
共价复合物建模 RFAA 或 Boltz-2
常规蛋白结构预测 ColabFold(见 118《ColabFold》
大规模配体筛选 传统对接(速度)

关键要点

  • 全原子表示让蛋白/核酸/小分子/修饰能被统一建模——这是建模真实生物复合物的前提;
  • 准确度通常略低于 AF3,但完全开放、可商用
  • 独特价值是「可用于设计」——配合 RFdiffusion 能做结合口袋的从头设计,AF3 做不到;
  • 小分子姿势的可靠性低于蛋白部分,必须做物理检查与交叉验证。

延伸资源