SureChEMBL(EMBL-EBI)用文本挖掘和图像识别技术,从专利文献中自动抽取化学结构,并建立可检索的数据库。药物化学的大量结构信息首先出现在专利而非论文中,这个库让「专利里的化学空间」变得可以程序化分析。
规模与覆盖
| 内容 | 量级 |
|---|---|
| 抽取的化合物 | 逾 2,000 万个 |
| 专利文献 | 数百万篇 |
| 专利局 | USPTO、EPO、WIPO、JPO 等 |
| 更新频率 | 持续更新,通常滞后专利公开数天到数周 |
结构是怎么抽出来的
- 化学命名识别(NER):从正文中识别 IUPAC 名称等化学实体,再转成结构。
- 图像识别(OSRA 类技术):从专利附图中识别化学结构式。
- 标注位置:记录结构出现在标题、摘要、权利要求还是说明书——这个位置信息很关键,出现在权利要求中的结构通常是核心保护对象。
抽取是自动的,因此有错误率。图像识别对复杂结构、手写体、低质量扫描件容易出错;马库什结构(通式)通常只能抽出具体例示化合物,无法完整表达通式覆盖的范围。这是它作为专利工具最重要的局限。
检索方式
# 网页界面支持结构检索、子结构检索、相似性检索、关键词组合
# 数据下载(EBI FTP)
wget -r ftp://ftp.ebi.ac.uk/pub/databases/chembl/SureChEMBL/data/
# 也可通过 ChEMBL 的接口关联查询
# SureChEMBL ID 形如 SCHEMBL1234567
# 典型分析:某骨架在专利中的时间趋势
import pandas as pd
# 从下载的数据中筛出含目标骨架的化合物及其专利信息
hits = search_substructure(scaffold_smarts="c1ccc2[nH]ccc2c1")
df = pd.DataFrame(hits)
# 按年份和申请人统计,看竞争态势
trend = df.groupby([df["pub_date"].dt.year, "applicant"]).size()
print(trend.unstack().fillna(0).tail(10))
实际用途
- 竞品化学空间追踪:搜自家骨架,看有哪些公司在同一化学空间布局、时间线如何。这是最主要的用途。
- 新颖性初步自查:设计出一个新分子后,先搜一遍是否已被专利例示。注意这只是初筛,不能替代正式的专利检索。
- 骨架跃迁的灵感来源:看同一靶点的专利里出现过哪些不同骨架,理解可行的化学空间。
- 补充训练数据:专利中的化合物往往比论文更接近真实的药物化学优化路径,可作为生成模型或活性模型的补充数据(但活性数据通常不在其中)。
- 技术趋势分析:结合申请人、时间、靶点,分析某个领域的研发热度变化。
作为专利工具的能力边界
这一点必须讲清楚,避免误用:
- 不能替代专业专利检索:马库什通式的覆盖范围、权利要求的法律解释、同族专利、法律状态——这些 SureChEMBL 都不处理。任何涉及自由实施(FTO)或专利性判断的结论,必须由专利律师用专业数据库(如 CAS SciFinder、Derwent)完成。
- 召回率不完整:自动抽取会漏掉一部分结构,「搜不到」不等于「没有被专利覆盖」。
- 不含活性数据:专利中的活性数据通常以表格或范围形式给出,SureChEMBL 不做结构化抽取。
- 准确性需抽检:重要结论前应回查原始专利文本确认。
上手提示
- 它让「专利化学空间」可程序化分析,用于竞品追踪与趋势分析最合适;
- 自动抽取有错误与遗漏,「搜不到」不等于「没被覆盖」;
- 无法处理马库什通式的覆盖范围,这是最关键的局限;
- FTO 与专利性判断必须交给专业检索与专利律师,不能靠它下结论。
延伸资源
- 关联数据库:226《ChEMBL》、227《PubChem》;
- 骨架与化学空间概念见「分子表示」模块;
- 专利与决策见「决策与监管」模块。