234

SureChEMBL:专利化学结构数据如何使用

SureChEMBL 从专利文献自动抽取化学结构,是追踪竞品化学空间与专利态势的数据来源。这篇讲清它的抽取原理、检索方式与作为专利分析工具的能力边界。

SureChEMBL(EMBL-EBI)用文本挖掘和图像识别技术,从专利文献中自动抽取化学结构,并建立可检索的数据库。药物化学的大量结构信息首先出现在专利而非论文中,这个库让「专利里的化学空间」变得可以程序化分析。

规模与覆盖

内容 量级
抽取的化合物 逾 2,000 万个
专利文献 数百万篇
专利局 USPTO、EPO、WIPO、JPO 等
更新频率 持续更新,通常滞后专利公开数天到数周

结构是怎么抽出来的

  • 化学命名识别(NER):从正文中识别 IUPAC 名称等化学实体,再转成结构。
  • 图像识别(OSRA 类技术):从专利附图中识别化学结构式。
  • 标注位置:记录结构出现在标题、摘要、权利要求还是说明书——这个位置信息很关键,出现在权利要求中的结构通常是核心保护对象。

抽取是自动的,因此有错误率。图像识别对复杂结构、手写体、低质量扫描件容易出错;马库什结构(通式)通常只能抽出具体例示化合物,无法完整表达通式覆盖的范围。这是它作为专利工具最重要的局限。

检索方式

# 网页界面支持结构检索、子结构检索、相似性检索、关键词组合

# 数据下载(EBI FTP)
wget -r ftp://ftp.ebi.ac.uk/pub/databases/chembl/SureChEMBL/data/

# 也可通过 ChEMBL 的接口关联查询
# SureChEMBL ID 形如 SCHEMBL1234567
# 典型分析:某骨架在专利中的时间趋势
import pandas as pd

# 从下载的数据中筛出含目标骨架的化合物及其专利信息
hits = search_substructure(scaffold_smarts="c1ccc2[nH]ccc2c1")
df = pd.DataFrame(hits)

# 按年份和申请人统计,看竞争态势
trend = df.groupby([df["pub_date"].dt.year, "applicant"]).size()
print(trend.unstack().fillna(0).tail(10))

实际用途

  • 竞品化学空间追踪:搜自家骨架,看有哪些公司在同一化学空间布局、时间线如何。这是最主要的用途。
  • 新颖性初步自查:设计出一个新分子后,先搜一遍是否已被专利例示。注意这只是初筛,不能替代正式的专利检索。
  • 骨架跃迁的灵感来源:看同一靶点的专利里出现过哪些不同骨架,理解可行的化学空间。
  • 补充训练数据:专利中的化合物往往比论文更接近真实的药物化学优化路径,可作为生成模型或活性模型的补充数据(但活性数据通常不在其中)。
  • 技术趋势分析:结合申请人、时间、靶点,分析某个领域的研发热度变化。

作为专利工具的能力边界

这一点必须讲清楚,避免误用:

  • 不能替代专业专利检索:马库什通式的覆盖范围、权利要求的法律解释、同族专利、法律状态——这些 SureChEMBL 都不处理。任何涉及自由实施(FTO)或专利性判断的结论,必须由专利律师用专业数据库(如 CAS SciFinder、Derwent)完成。
  • 召回率不完整:自动抽取会漏掉一部分结构,「搜不到」不等于「没有被专利覆盖」。
  • 不含活性数据:专利中的活性数据通常以表格或范围形式给出,SureChEMBL 不做结构化抽取。
  • 准确性需抽检:重要结论前应回查原始专利文本确认。

上手提示

  • 它让「专利化学空间」可程序化分析,用于竞品追踪与趋势分析最合适;
  • 自动抽取有错误与遗漏,「搜不到」不等于「没被覆盖」;
  • 无法处理马库什通式的覆盖范围,这是最关键的局限;
  • FTO 与专利性判断必须交给专业检索与专利律师,不能靠它下结论。

延伸资源

  • 关联数据库:226《ChEMBL》227《PubChem》
  • 骨架与化学空间概念见「分子表示」模块;
  • 专利与决策见「决策与监管」模块。