AI 药物发现是典型的交叉领域。没有人能同时精通生物、药化与算法——关键是知道每条线的「最小必要知识」是什么,以及如何判断自己的短板。
三条主线的最小必要知识
| 主线 | 最小必要 | 能做什么判断 |
|---|---|---|
| 生物 | 靶点的作用机制、通路、疾病关联 | 这个靶点值不值得做 |
| 药化 | 成药性、SAR、合成可行性 | 这个分子像不像药 |
| 算法 | 建模、评测、不确定性 | 这个结果能不能信 |
三条线对应三个不同的「否决权」:生物学家能说「这个靶点不行」,药化学家能说「这个分子不行」,算法工程师能说「这个评测不可信」。缺任何一条,项目都可能在错误的方向上走很远。
生物学主线
# 【最小必要】
# □ 中心法则:DNA → RNA → 蛋白
# □ 蛋白的结构层次与功能关系
# □ 主要的靶点类别及其特点:
# 激酶、GPCR、核受体、离子通道、蛋白酶、
# 表观遗传调控因子、转录因子
# □ 信号通路的基本概念
# □ 疾病模型:细胞、类器官、动物
# □ 【证据梯度】:相关 vs 因果(见 154)
#
# 【进阶】
# □ 组学技术与数据类型
# □ 药理学:受体理论、量效关系
# □ 免疫学基础(做生物药/免疫治疗必需)
#
# 【判断标准】:
# 能不能读懂一篇靶点验证的论文,
# 并说出它的证据强度处在哪一层?
#
# 【常见误区】:
# 把「这个基因在疾病中高表达」
# 当作「抑制它能治病」
# → 这是最常见也最昂贵的错误
药物化学主线
# 【最小必要】
# □ 有机化学基础:官能团、反应类型、立体化学
# □ 成药性概念:
# 类药性(见 064)、配体效率(见 071、072)
# □ ADME 的基本过程(见 082)
# □ 【SAR 的读法】(见 073)
# □ 常见的结构警示(见 069)
# □ 【合成可行性的直觉】:
# 什么样的分子容易做,什么样的很难
#
# 【进阶】
# □ 生物电子等排体
# □ 代谢途径与代谢软点
# □ 前药与制剂策略
# □ 专利与化学空间
#
# 【判断标准】:
# 看到一个分子,能不能说出
# 「它可能有什么问题」?
# 例:这个酰肼基团有反应性风险;
# 这个分子 logP 太高会有溶解度问题;
# 这个季碳中心合成会很麻烦
#
# 【最有效的学习方式】:
# 【看真实项目的 SAR 表格】
# 一个系列几十个类似物与它们的数据
# → 比读教科书有用得多
#
# 【常见误区】:
# 只看活性数字,不看分子结构
# → 生成模型产出的「高分分子」
# 常常一眼就能看出不可能是药
算法主线
# 【最小必要】
# □ Python:pandas、numpy、matplotlib
# □ scikit-learn:训练、交叉验证、指标
# □ 【评测设计】:
# 数据划分(见 051、167)、过拟合、泄漏
# □ 【不确定性与适用域】(见 166)
# □ RDKit 基本操作(见 022)
# □ 梯度提升(LightGBM/XGBoost)
#
# 【进阶】
# □ 深度学习基础:PyTorch
# □ 图神经网络(见 159)
# □ 生成模型(见 158)
# □ 分子动力学与自由能(见 123、127)
#
# 【判断标准】:
# 看到一个模型的评测结果,
# 能不能指出它可能高估了多少、为什么?
#
# 【常见误区】:
# 1) 【一上来就学深度学习】
# 而实际项目中,认真调优的
# ECFP + LightGBM 常常已经够用(见 131)
#
# 2) 【追新模型而忽视评测设计】
# 换模型的收益远小于修正评测的收益
#
# 3) 【不做基线】
# 没有基线就无法判断新方法是否真的更好
按背景的补课顺序
| 你的背景 | 优先补 | 顺序建议 |
|---|---|---|
| 计算机 / 数学 | 药化 > 生物 | ① 化学信息学基础 ② 成药性概念 ③ SAR 阅读 ④ 靶点生物学 |
| 化学 / 药学 | 算法(尤其评测) | ① Python + pandas ② sklearn + 评测 ③ RDKit ④ 深度学习(可选) |
| 生物 / 医学 | 药化 + 算法 | ① Python ② 化学信息学 ③ 成药性 ④ 建模 |
| 计算化学 | 机器学习方法论 | ① 评测设计 ② ML 基础 ③ 深度学习 |
最有效的学习方式
# 【做一个完整的小项目】比读十本书有效
#
# 推荐的入门项目:
#
# 项目一:【建一个活性预测模型】(1~2 周)
# 1) 从 ChEMBL 下载某个靶点的活性数据(见 226)
# 2) 数据清洗:去重、标准化、处理删失数据(见 046、056)
# 3) 计算 ECFP 指纹(见 045)
# 4) 【骨架划分】训练 LightGBM(见 051)
# 5) 评测:与随机划分对比,看差距
# 6) 加不确定性估计(见 166)
# → 【这个项目覆盖了最核心的技能】
#
# 项目二:【跑通一次对接】(1 周)
# 1) 从 PDB 下载共晶结构
# 2) 结构准备(见 105)
# 3) 【重对接验证】(见 096)
# 4) 对一批分子对接并排序
# 5) 用 PLIP 分析相互作用(见 108)
# → 理解结构基方法的流程与陷阱
#
# 项目三:【读一个真实项目的 SAR】(持续)
# 找一篇药化论文,看它的 SAR 表格
# → 尝试解释:为什么这个取代基更好?
# → 【培养化学直觉的最快方式】
#
# 【学习的顺序原则】:
# 先做出【能跑通的东西】,再理解原理
# → 有了具体的问题,读理论才有针对性
关于交叉沟通
- 最有价值的技能不是精通某一条线,而是能与另外两条线的人有效沟通;
- 常见的沟通失败:
- 算法人员说「AUC 0.85」,化学家不知道这意味着什么——应该说「按模型排序,前 100 个里大概有 X 个真的有活性」;
- 化学家说「这个分子不行」,算法人员不知道为什么——应该追问具体是哪个基团、什么问题;
- 生物学家说「这个靶点很好」,其他人不知道证据强度——应该问「是哪一层的证据」。
- 实用建议:把模型输出翻译成对方能直接使用的形式——化学家要的是「合成哪几个」,不是 AUC 数字。
关键要点
- 三条线对应三个否决权:靶点不行 / 分子不行 / 评测不可信——缺任何一条都危险;
- 计算背景的人最该补药化——看到分子能说出「它可能有什么问题」;
- 不要一上来就学深度学习——评测设计的收益远大于换模型;
- 最有效的学习是做一个完整的小项目,而非广泛读教程。
延伸资源
- 全流程地图:001《AI 药物发现是什么》;CADD 边界:002《AI DD 与传统 CADD 的区别》;
- TeachOpenCADD:012《TeachOpenCADD 教程》;RDKit Cookbook:013《RDKit Cookbook》;论文阅读:170《AI 制药论文阅读框架》。