003

AI 药物发现学习路线:生物、药化、算法三条主线怎么补

AI 制药需要生物、药化、算法三条主线。这篇给出各自的最小必要知识、补课顺序与常见的学习误区。

AI 药物发现是典型的交叉领域。没有人能同时精通生物、药化与算法——关键是知道每条线的「最小必要知识」是什么,以及如何判断自己的短板。

三条主线的最小必要知识

主线 最小必要 能做什么判断
生物 靶点的作用机制、通路、疾病关联 这个靶点值不值得做
药化 成药性、SAR、合成可行性 这个分子像不像药
算法 建模、评测、不确定性 这个结果能不能信

三条线对应三个不同的「否决权」:生物学家能说「这个靶点不行」,药化学家能说「这个分子不行」,算法工程师能说「这个评测不可信」。缺任何一条,项目都可能在错误的方向上走很远。

生物学主线

# 【最小必要】
#   □ 中心法则:DNA → RNA → 蛋白
#   □ 蛋白的结构层次与功能关系
#   □ 主要的靶点类别及其特点:
#     激酶、GPCR、核受体、离子通道、蛋白酶、
#     表观遗传调控因子、转录因子
#   □ 信号通路的基本概念
#   □ 疾病模型:细胞、类器官、动物
#   □ 【证据梯度】:相关 vs 因果(见 154)
#
# 【进阶】
#   □ 组学技术与数据类型
#   □ 药理学:受体理论、量效关系
#   □ 免疫学基础(做生物药/免疫治疗必需)
#
# 【判断标准】:
#   能不能读懂一篇靶点验证的论文,
#   并说出它的证据强度处在哪一层?
#
# 【常见误区】:
#   把「这个基因在疾病中高表达」
#   当作「抑制它能治病」
#   → 这是最常见也最昂贵的错误

药物化学主线

# 【最小必要】
#   □ 有机化学基础:官能团、反应类型、立体化学
#   □ 成药性概念:
#     类药性(见 064)、配体效率(见 071、072)
#   □ ADME 的基本过程(见 082)
#   □ 【SAR 的读法】(见 073)
#   □ 常见的结构警示(见 069)
#   □ 【合成可行性的直觉】:
#     什么样的分子容易做,什么样的很难
#
# 【进阶】
#   □ 生物电子等排体
#   □ 代谢途径与代谢软点
#   □ 前药与制剂策略
#   □ 专利与化学空间
#
# 【判断标准】:
#   看到一个分子,能不能说出
#   「它可能有什么问题」?
#   例:这个酰肼基团有反应性风险;
#       这个分子 logP 太高会有溶解度问题;
#       这个季碳中心合成会很麻烦
#
# 【最有效的学习方式】:
#   【看真实项目的 SAR 表格】
#   一个系列几十个类似物与它们的数据
#   → 比读教科书有用得多
#
# 【常见误区】:
#   只看活性数字,不看分子结构
#   → 生成模型产出的「高分分子」
#     常常一眼就能看出不可能是药

算法主线

# 【最小必要】
#   □ Python:pandas、numpy、matplotlib
#   □ scikit-learn:训练、交叉验证、指标
#   □ 【评测设计】:
#     数据划分(见 051、167)、过拟合、泄漏
#   □ 【不确定性与适用域】(见 166)
#   □ RDKit 基本操作(见 022)
#   □ 梯度提升(LightGBM/XGBoost)
#
# 【进阶】
#   □ 深度学习基础:PyTorch
#   □ 图神经网络(见 159)
#   □ 生成模型(见 158)
#   □ 分子动力学与自由能(见 123、127)
#
# 【判断标准】:
#   看到一个模型的评测结果,
#   能不能指出它可能高估了多少、为什么?
#
# 【常见误区】:
#   1) 【一上来就学深度学习】
#      而实际项目中,认真调优的
#      ECFP + LightGBM 常常已经够用(见 131)
#
#   2) 【追新模型而忽视评测设计】
#      换模型的收益远小于修正评测的收益
#
#   3) 【不做基线】
#      没有基线就无法判断新方法是否真的更好

按背景的补课顺序

你的背景 优先补 顺序建议
计算机 / 数学 药化 > 生物 ① 化学信息学基础 ② 成药性概念 ③ SAR 阅读 ④ 靶点生物学
化学 / 药学 算法(尤其评测) ① Python + pandas ② sklearn + 评测 ③ RDKit ④ 深度学习(可选)
生物 / 医学 药化 + 算法 ① Python ② 化学信息学 ③ 成药性 ④ 建模
计算化学 机器学习方法论 ① 评测设计 ② ML 基础 ③ 深度学习

最有效的学习方式

# 【做一个完整的小项目】比读十本书有效
#
# 推荐的入门项目:
#
# 项目一:【建一个活性预测模型】(1~2 周)
#   1) 从 ChEMBL 下载某个靶点的活性数据(见 226)
#   2) 数据清洗:去重、标准化、处理删失数据(见 046、056)
#   3) 计算 ECFP 指纹(见 045)
#   4) 【骨架划分】训练 LightGBM(见 051)
#   5) 评测:与随机划分对比,看差距
#   6) 加不确定性估计(见 166)
#   → 【这个项目覆盖了最核心的技能】
#
# 项目二:【跑通一次对接】(1 周)
#   1) 从 PDB 下载共晶结构
#   2) 结构准备(见 105)
#   3) 【重对接验证】(见 096)
#   4) 对一批分子对接并排序
#   5) 用 PLIP 分析相互作用(见 108)
#   → 理解结构基方法的流程与陷阱
#
# 项目三:【读一个真实项目的 SAR】(持续)
#   找一篇药化论文,看它的 SAR 表格
#   → 尝试解释:为什么这个取代基更好?
#   → 【培养化学直觉的最快方式】
#
# 【学习的顺序原则】:
#   先做出【能跑通的东西】,再理解原理
#   → 有了具体的问题,读理论才有针对性

关于交叉沟通

  • 最有价值的技能不是精通某一条线,而是能与另外两条线的人有效沟通
  • 常见的沟通失败
    • 算法人员说「AUC 0.85」,化学家不知道这意味着什么——应该说「按模型排序,前 100 个里大概有 X 个真的有活性」
    • 化学家说「这个分子不行」,算法人员不知道为什么——应该追问具体是哪个基团、什么问题
    • 生物学家说「这个靶点很好」,其他人不知道证据强度——应该问「是哪一层的证据」
  • 实用建议把模型输出翻译成对方能直接使用的形式——化学家要的是「合成哪几个」,不是 AUC 数字。

关键要点

  • 三条线对应三个否决权:靶点不行 / 分子不行 / 评测不可信——缺任何一条都危险;
  • 计算背景的人最该补药化——看到分子能说出「它可能有什么问题」;
  • 不要一上来就学深度学习——评测设计的收益远大于换模型;
  • 最有效的学习是做一个完整的小项目,而非广泛读教程。

延伸资源