193

Chai-1:复合物结构预测工具部署指南

Chai-1 是 Chai Discovery 开源的复合物结构预测工具,支持多模态输入与实验约束注入。这篇讲清它的部署方式、独特功能与许可条件。

Chai-1 是 Chai Discovery 发布的生物分子结构预测模型,能力对标 AlphaFold3,可预测蛋白、核酸、小分子配体及其复合物。它最有辨识度的功能是支持注入实验约束——能把交联质谱、突变实验等已知接触信息作为条件喂给模型。

部署

pip install chai_lab

# 也可直接用官方网页版(无需本地 GPU)
python - <<'PY'
from pathlib import Path
from chai_lab.chai1 import run_inference
run_inference(
    fasta_file=Path("input.fasta"),
    output_dir=Path("outputs"),
    num_trunk_recycles=3,
    num_diffn_timesteps=200,
    use_esm_embeddings=True,   # 无 MSA 模式
)
PY

FASTA 用特殊头部标记实体类型:

>protein|name=receptor
MVTPEGNVSLVDESLLVGVTDEDRAVRSAHQFYERLIG
>ligand|name=inhibitor
CC(=O)Oc1ccccc1C(=O)O
>rna|name=aptamer
GGCUAGCUACGAUC

两个实际有用的特性

  • 无 MSA 模式use_esm_embeddings=True 时用蛋白语言模型嵌入替代多序列比对。精度会有损失,但省掉了几百 GB 数据库和漫长的检索时间,对快速迭代或缺乏同源序列的蛋白(如人工设计序列、孤儿蛋白)很实用。
  • 实验约束注入:可以把已知的残基接触、交联质谱结果、突变扫描证据作为约束传入,引导预测。当你手上已有部分实验证据、想补全整体结构时,这个功能是同类工具里少见的。

许可要看清楚

Chai-1 的代码与权重按特定条款发布:学术与内部研究用途通常允许,但商业用途(尤其是用于药物发现服务)可能受限或需单独授权。不要因为能 pip install 就假定可以商用。需要完全无限制的商业许可时,Boltz(见 192《Boltz》,MIT)更稳妥。使用前逐条核对当前版本的 LICENSE。

怎么用好

场景 建议设置
常规蛋白复合物 带 MSA,num_trunk_recycles=3
快速迭代 / 无同源序列 use_esm_embeddings=True,接受精度损失
已有实验证据 注入约束,通常明显改善界面预测
难体系 提高 num_diffn_timesteps,多次采样看收敛性
  • 同样看 pLDDT / PAE / ipTM 判断可信度,界面预测重点看 ipTM。
  • 多次采样取共识:不同随机种子给出一致结构,才说明预测稳定。
  • 配体姿势仍需与对接交叉验证并做物理检查,这是所有 AF3 类模型的共同注意事项。

上手提示

  • 独特功能是「实验约束注入」和「无 MSA 模式」,选它主要冲这两点;
  • 无 MSA 模式牺牲精度换速度,适合迭代阶段而非最终结论;
  • 商用前必须核对许可,能安装不等于能商用;
  • 多采样看收敛性,界面质量重点看 ipTM。

延伸资源