做 AI 药物发现,生物学基础的缺口往往比算法缺口更致命——因为它决定了「靶点选得对不对」这个最上游、也最难纠正的判断。MIT 的计算生物学公开课提供了系统补课的路径。
与药物发现最相关的主题
| 主题 | 与药物发现的关系 | 优先级 |
|---|---|---|
| 序列比对与同源性 | 靶点的家族关系、选择性分析 | 中 |
| 基因表达分析 | 靶点发现的常用证据(见 154《AI 靶点发现模型》) | 高 |
| 基因调控网络 | 理解通路与下游效应 | 高 |
| 群体遗传学与 GWAS | 最强的靶点证据来源 | 最高 |
| 蛋白结构与功能 | 结构基设计的基础 | 高 |
| 系统发育 | 物种间外推 | 低 |
| 表观遗传学 | 一类重要的靶点 | 中 |
| 单细胞分析 | 定位到具体细胞类型 | 中高 |
为什么遗传学最重要
# 【药物研发中最可靠的先验之一】:
# 有人类遗传学支持的靶点,
# 临床成功率明显高于没有的
#
# 为什么:
#
# 1) 【遗传变异是「自然实验」】
# 某些人天生携带某基因的功能缺失变异
# → 观察他们的表型,
# 相当于观察「终生抑制该靶点」的效果
# → 这直接回答了两个关键问题:
# - 抑制这个靶点能不能改善疾病?(有效性)
# - 抑制它会有什么副作用?(安全性)
#
# 2) 【基因型先于表型】
# 不存在反向因果
# → 比表达相关性强得多的证据
#
# 3) 【已有成功先例】
# 多个重要药物的靶点,
# 其人体验证最初来自遗传学观察
#
# 【需要理解的概念】:
# □ GWAS:全基因组关联研究
# - 效应量通常很小
# - 关联位点常在非编码区,需要映射到基因
# - 【连锁不平衡】让因果变异难以确定
#
# □ 罕见变异关联:功能缺失变异携带者的表型
# - 效应量大,更接近药物作用
#
# □ 【孟德尔随机化】:
# 用遗传变异作工具变量推断因果
# - 假设:变异只通过该基因影响表型
# - 【水平多效性】是主要威胁
#
# □ 基因的约束性(如 gnomAD 的 pLI):
# 该基因在人群中能否容忍功能缺失
# → 高约束 = 敲除可能有害 = 【安全性风险】
#
# 【实用资源】:
# Open Targets Genetics、GWAS Catalog、gnomAD
组学数据的正确解读
# 【最常见的错误:把相关当因果】
#
# 「基因 X 在肿瘤中高表达」
# → 【不能推出】「抑制 X 能治疗肿瘤」
#
# 可能的其它解释:
# - X 的上调是疾病的【结果】而非原因
# - X 是【代偿性】上调,抑制它反而有害
# - X 只是与真正的驱动因素共变
# - 组织组成差异(肿瘤中免疫细胞比例不同)
#
# 【需要注意的技术问题】:
#
# 1) 【批次效应】
# 不同时间、不同平台的样本有系统差异
# → 可能大于生物学差异
# → 必须做批次校正,并检查校正是否过度
#
# 2) 【多重检验】
# 同时检验两万个基因
# → 必须做 FDR 校正
# → 未校正的 p < 0.05「显著基因」大多是假的
#
# 3) 【组织异质性】
# bulk RNA-seq 是所有细胞的平均
# → 某个基因的变化可能只是细胞比例变了
# → 【单细胞数据能解决这个问题】
#
# 4) 【效应量 vs 显著性】
# 样本量大时,微小的差异也会「显著」
# → 【应该看 fold change 而非只看 p 值】
#
# 5) 【mRNA 与蛋白的相关性有限】
# 转录本水平的变化不一定反映蛋白水平
# → 有条件应看蛋白组数据
# 【一个实用的自检】:
# 看到「差异表达」的结论时,问:
# - 样本量多少?
# - 效应量多大?
# - 做了什么校正?
# - 有独立队列验证吗?
# - 有功能实验支持吗?
靶点类别的基本认识
| 类别 | 特点 | 可成药性 |
|---|---|---|
| 激酶 | 有明确的 ATP 口袋;家族大 | 好,但选择性是挑战 |
| GPCR | 膜蛋白;结构获取曾很难 | 好;结构预测帮助大 |
| 核受体 | 有配体结合域 | 好 |
| 蛋白酶 | 有活性位点 | 好;选择性需注意 |
| 离子通道 | 膜蛋白;构象复杂 | 中等 |
| 转录因子 | 表面平坦,无明显口袋 | 难——考虑降解剂(见 356《PROTAC 是什么》) |
| PPI | 界面大而平 | 难(见 382《PPI 抑制剂》) |
| 支架蛋白 | 无催化活性 | 难——降解剂是出路 |
关键认识:「不可成药」常常只是「小分子不可成药」。降解剂、核酸药物、抗体等模态扩大了可及的靶点空间(见 356《PROTAC 是什么》、375《反义寡核苷酸 ASO》)。
学习建议
- 不需要系统看完整门课:按上表的优先级选择性学习;
- 优先级最高的是遗传学部分:GWAS、孟德尔随机化、变异的功能注释;
- 配套实践:用 Open Targets 查几个你熟悉的药物靶点,看它们的证据构成——这比读教材直观得多;
- 与同事学习:如果团队里有生物学背景的同事,定期请他们讲一个靶点的故事,比自学高效很多;
- 判断标准:能不能读懂一篇靶点验证论文,并说出它的证据处在哪一层(见 154《AI 靶点发现模型》)。
关键要点
- 遗传学是优先级最高的部分——有人类遗传学支持的靶点临床成功率明显更高;
- 差异表达是最弱的证据——可能是疾病的结果、代偿反应,甚至是保护性的;
- 组学解读要注意批次效应、多重检验、组织异质性、效应量 vs 显著性;
- 「不可成药」常常只是「小分子不可成药」——其它模态可能可行。
延伸资源
- AI 靶点发现:154《AI 靶点发现模型》;学习路线:003《AI 药物发现学习路线》;
- PROTAC:356《PROTAC 是什么》;PPI:382《PPI 抑制剂》;靶点可成药性:413《靶点可成药性 Druggability》。