Valo Health 的定位与多数 AI 制药公司不同:它把人类数据——临床试验数据、真实世界数据、长期队列研究——放在平台的核心,而非从分子或细胞开始。这条路线的逻辑值得单独理解。
「从人类数据出发」的逻辑
新药研发失败的主要原因不是分子不够好,而是靶点与疾病的关系判断错了。而验证这个关系最直接的证据来自人:
| 证据来源 | 与人体的相关性 |
|---|---|
| 细胞系实验 | 低 |
| 动物模型 | 中,物种差异大 |
| 类器官 / 原代细胞 | 中高 |
| 人类遗传学 | 高,且有因果方向 |
| 临床与真实世界数据 | 最高,但混杂严重 |
已有分析表明,有人类遗传学证据支持的靶点,临床成功率约为无支持靶点的两倍(见 250《Open Targets Genetics》)。这是「以人类数据为起点」最有力的实证依据。
真实世界数据(RWD)的价值与陷阱
- 价值:样本量大、覆盖真实临床实践中的多样人群、能观察长期结局、成本远低于前瞻性试验。
- 陷阱一:混杂。这是最根本的问题。接受某种治疗的患者与未接受的患者在很多方面本来就不同(病情严重程度、合并症、经济条件、就医习惯)。观察到的疗效差异可能完全来自这些差异。
- 陷阱二:适应症混杂(confounding by indication):医生给病情更重的患者用更强的药,导致该药「看起来」预后更差。
- 陷阱三:不朽时间偏倚(immortal time bias):定义治疗组时若要求「用药满 X 天」,则该组成员必须活过 X 天,人为制造生存优势。
- 陷阱四:数据质量:电子病历为计费和诊疗设计,不是为研究设计。缺失、编码错误、记录不一致普遍存在。
- 陷阱五:缺失非随机:某项检查没做,本身就携带信息(医生认为不必要)。
因果推断的常用方法
# 处理观察性数据混杂的主要工具
# 1. 倾向性评分(Propensity Score)
# 估计每个患者接受治疗的概率,用于匹配、加权或分层
from sklearn.linear_model import LogisticRegression
ps_model = LogisticRegression().fit(X_covariates, treatment)
ps = ps_model.predict_proba(X_covariates)[:, 1]
# IPTW 加权:w = t/ps + (1-t)/(1-ps)
# 2. 目标试验模拟(Target Trial Emulation)
# 先明确定义「如果做一个 RCT,它会是什么样」,
# 再用观察数据尽可能模拟这个设计。
# 这是目前公认最能避免常见偏倚的框架。
# 3. 双重稳健估计(AIPW / TMLE)
# 同时建模处理分配与结局,只要其一正确即可无偏
# 4. 阴性对照(Negative Control)
# 找一个理论上不应受该治疗影响的结局,
# 如果也观察到「效应」,说明存在未测量混杂
# 5. 敏感性分析
# 量化「需要多强的未测量混杂才能推翻结论」(E-value)
阴性对照和敏感性分析是最容易被忽略但最能提升可信度的两步。任何基于观察数据的因果结论,如果没做这两项检验,说服力都很有限。
AI 在这个环节的作用与边界
- 能做的:从非结构化病历中抽取信息、处理高维协变量、发现患者亚群、生成待验证的假设。
- 不能做的:机器学习本身不解决混杂问题。用更复杂的模型拟合观察数据,只会更精确地拟合出有偏的关联。因果推断需要的是设计与假设(哪些变量该调整、是否满足可交换性),而非更强的预测模型。
- 正确的分工:用 ML 处理高维数据与非结构化文本,用因果推断框架处理识别问题。两者缺一不可。
提示
公司业务与管线变动较快,本文为方向性观察,具体信息请以官方披露为准。基于观察性数据的因果结论必须配合目标试验模拟、阴性对照与敏感性分析,机器学习本身不解决混杂。
延伸资源
- 遗传学证据:250《Open Targets Genetics》、249《Open Targets Platform》;临床预测:273《InClinico》、247《TDC Trial Group》;
- 临床决策见「决策与监管」模块。