☰
ChatGPT讲解——MinerU.Chem
2026/10/6 8:02:05 网站建设 项目流程

MinerU.Chem: A High-Precision System for Optical Chemical Structure and Reaction Recognition

Abstract:摘要想表达什么

这篇论文介绍了MinerU.Chem,一个面向有机化学论文和专利的高精度文档解析系统。

它要解决的核心问题是:

有机化学文献中的大量关键信息不是普通文字,而是嵌在分子结构图、反应路线图、表格和图片中;通用文档解析系统通常无法理解这些图像中的化学含义。

1. 为什么普通文档解析不够用

有机化学论文里经常包含:

  • 分子结构式;
  • 反应路线;
  • 反应物和产物;
  • 反应条件;
  • 化合物编号;
  • 复杂的图表和示意图。

这些内容对化学家来说非常重要,但普通 PDF 或 Markdown 解析工具通常只会把它们当成图片,无法识别:

  • 原子之间如何连接;
  • 哪些分子是反应物;
  • 哪些分子是产物;
  • 反应条件是什么;
  • 分子结构在原图中的位置;
  • 化学结构中包含的立体化学、重复单元或特殊键。

因此,许多有机化学知识无法自动转成机器可读的数据。

2. MinerU.Chem 的目标

MinerU.Chem 是建立在 MinerU 通用文档解析系统之上的化学专用扩展。

MinerU 负责先把论文转换为:

  • Markdown;
  • JSON;
  • 页面布局;
  • 文本;
  • 公式;
  • 表格;
  • 图片区域。

MinerU.Chem 再对其中与化学相关的图像区域进行进一步分析,把它们转换成结构化的化学信息。

3. 系统包含五个化学模块

MinerU.Chem 主要增加了五个模块:

  1. 化学相关性筛选
    • 判断页面中的图表区域是否与化学有关。
  2. 分子结构检测
    • 找出图像中哪些区域包含分子结构。
  3. 分子标识符提取
    • 识别结构旁边的化合物编号或标签,如 1、2、1a、2a。
  4. 分子结构识别
    • 把分子结构图转换为机器可读的化学结构。
  5. 反应路线解析
    • 从反应图中提取反应物、产物和反应条件。

这些模块共同把化学论文中的视觉信息转换成两类输出:

  • Molecule Summary List:分子摘要列表;
  • Reaction Summary List:反应摘要列表。

4. 两种主要输出是什么

Molecule Summary List

它记录论文中检测到和识别出的分子,包括:

  • 分子所在页码;
  • 图像中的位置;
  • 化合物编号;
  • MolFile;
  • SMILES;
  • 与原始图像的关联。
Reaction Summary List

它把一个反应组织成:

  • 反应物;
  • 产物;
  • 反应条件;
  • 对应的分子结构记录。

如果反应物或产物带有化合物编号,系统还会将它们链接回 Molecule Summary List 中对应的分子。

这样,用户可以从一个反应追溯到原论文中的具体分子图像。

5. 为什么采用 CARBON 表示法

分子结构识别的核心表示不是只输出 SMILES,而是使用CARBON:

Complex Atomic Representation and Bonding Object Notation

作者认为,SMILES 虽然适合表示基本的原子连接关系,但对一些复杂信息表达能力有限,例如:

  • 分子图像中的二维布局;
  • 非标准化学键;
  • 原子价态;
  • 自由基;
  • 连接点;
  • 重复结构;
  • Markush 结构;
  • 特殊立体化学信息。

CARBON 以原子为中心表示分子图,可以同时保留:

  • 原子;
  • 键;
  • 化学语义;
  • 特殊结构;
  • 原图中的二维坐标。

在系统内部,CARBON 作为主要预测格式;为了兼容现有化学软件,系统还可以进一步导出:

  • MolFile;
  • SMILES。

6. 分子识别效果很强

作者在修订后的 MolRecBench-Wild 数据集上测试了分子结构识别模块。

在可以用 SMILES 评价的 2,392 个样本上:

SMILES exact-match = 93.02 % \text{SMILES exact-match}=93.02\%SMILES exact-match=93.02%

作为对比,论文测试的最佳比较系统 GPT-5.6-Sol 达到:

74.87 % 74.87\%74.87%

MinerU.Chem 高出:

18.15 18.1518.15

个百分点。

在全部 5,024 个带图结构标注的样本上,MinerU.Chem 的图结构准确率达到:

79.66 % 79.66\%79.66%

相比之下,比较系统中的最好结果约为:

36.41 % 36.41\%36.41%

高出 43.25 个百分点。

7. 系统的实际用途

MinerU.Chem 的目标不是只做单张图片识别,而是服务于整篇化学文献的结构化数据生产。

它可以帮助构建:

  • 有机化学知识库;
  • 反应数据库;
  • 分子数据库;
  • AI for Chemistry 训练数据;
  • 反应预测数据;
  • 逆合成数据;
  • 反应条件推荐数据;
  • 分子性质预测数据;
  • 药物分子设计数据。

同时,系统保留原始页面位置,使识别结果能够:

  • 回溯原文;
  • 人工检查;
  • 修正识别错误;
  • 确认模型是否误读了化学结构。

摘要一句话总结

这篇论文提出 MinerU.Chem,将通用文档解析与化学专用模块结合,把有机化学论文中的分子结构、化合物编号和反应路线转换为可追溯的结构化数据,并通过 CARBON 保留复杂化学语义和图像布局,在分子结构识别准确率上明显超过现有比较系统。

第 1 章:Introduction(引言)

这一章主要说明论文为什么需要 MinerU.Chem,以及它要解决什么问题、采用什么结构表示,并总结系统的主要贡献。

1. 有机化学文献中的关键信息往往不是普通文字

在有机化学论文和专利中,大量核心知识被放在:

  • 分子结构图;
  • 反应路线图;
  • 表格;
  • 图片;
  • 实验流程示意图。

分子结构图中包含的不只是“有哪些原子”,还包括:

  • 原子之间的连接关系;
  • 原子和基团标签;
  • 二维布局;
  • 立体化学信息;
  • 重复结构;
  • 特殊键;
  • 连接点;
  • 化合物之间的空间关系。

反应图还要组织:

  • 反应物;
  • 产物;
  • 反应条件;
  • 反应步骤;
  • 箭头方向;
  • 多个区域之间的对应关系。

这些图像对化学家来说非常直观,但对于通用文档解析系统来说很难直接理解。

2. 通用文档解析工具的局限

普通 PDF 或论文解析系统通常能够处理:

  • 普通文本;
  • 公式;
  • 表格;
  • 页面布局;
  • 图片位置。

但遇到化学图像时,往往只会把它当作普通图片,而不会分析图片内部的化学语义。

这会导致:

  • 无法建立完整的化学知识库;
  • 分子结构无法转成机器可读格式;
  • 反应物和产物无法自动整理;
  • 反应条件无法与分子对应;
  • AI for Chemistry 缺少高质量结构化训练数据。

3. 现有化学识别系统仍然不够稳定

光学化学结构识别(OCSR)系统能够从分子结构图中恢复基本的原子连接关系。

但是,在真实论文和专利中,图像质量和结构形式更加复杂,常见问题包括:

  • 低分辨率扫描;
  • 模糊;
  • 图像背景复杂;
  • 多个分子拥挤排列;
  • 非标准结构表示;
  • 键的视觉形式容易混淆;
  • 分子结构与文字、箭头、表格相互重叠。

即使成功恢复了原子连接,很多复杂语义仍可能丢失,例如:

  • 立体化学;
  • 重复单元;
  • Markush 片段;
  • 配位键;
  • 非标准键;
  • 原始图像中的空间坐标。

因此,论文认为真正可用于数据库构建和 AI 训练的系统,不仅要识别“分子拓扑”,还必须保留:

  • 复杂化学语义;
  • 原图中的位置;
  • 分子与标签的对应关系;
  • 从识别结果回溯到原文的能力。

4. 反应路线解析也存在类似问题

现有系统已经尝试解析反应图,例如识别:

  • 反应物;
  • 产物;
  • 反应箭头;
  • 反应条件。

但在真实文献中,反应图经常包含:

  • 密集排版;
  • 多个反应区域;
  • 复杂背景;
  • 低质量扫描;
  • 跨区域对应关系;
  • 多步反应;
  • 分子编号和结构图分离出现。

因此,单独识别某一张反应图还不够。系统还需要把反应图与整篇论文的布局、文字、编号和分子记录联系起来。

5. MinerU.Chem 的定位

MinerU 是一个通用科学文档解析工具,可以把 PDF 和图片转成:

  • Markdown;
  • JSON;
  • 文本;
  • 公式;
  • 表格;
  • 页面布局信息。

MinerU.Chem 在此基础上增加化学专用解析层。

它首先利用 MinerU 得到论文的整体结构,再对其中与化学有关的图片区域进行深入识别。

系统输出两种核心结果:

Molecule Summary List

记录文档中检测到的分子,包括:

  • 分子所在页码;
  • 图像中的边界框;
  • 化合物编号;
  • MolFile;
  • SMILES;
  • 与原始图像的对应关系。
Reaction Summary List

记录反应图中的:

  • 反应物;
  • 产物;
  • 反应条件;
  • 与对应分子记录的链接。

这样,用户可以从一个反应追溯到具体分子,再追溯到论文原始页面。

6. 系统包含五个化学模块

MinerU.Chem 的化学解析层包括:

  1. 化学相关性筛选
    • 判断某个图片或表格区域是否与化学有关。
  2. 分子结构检测
    • 找到页面或图表中的分子结构区域。
  3. 分子标识符提取
    • 识别结构旁边的编号和标签,如 1、2、1a、2a。
  4. 分子结构识别
    • 把结构图转换成 CARBON、MolFile 和 SMILES。
  5. 反应路线解析
    • 识别反应物、产物、条件和反应关系。

这五个模块不是相互独立的,而是组成一条完整的数据生产流程。

7. 为什么不能只使用 SMILES

SMILES 是目前化学信息学中最常用的分子表示形式之一,非常适合表示:

  • 原子连接关系;
  • 基本分子拓扑;
  • 与下游化学软件的接口。

但它不擅长完整保留分子图像中的所有信息,例如:

  • 非标准键;
  • 原子价态;
  • 自由基;
  • 连接点;
  • 重复结构;
  • Markush 结构;
  • 原始图像布局;
  • 某些特殊立体化学表示。

因此,单独把图片转换为 SMILES,可能会得到一个“拓扑上看似正确,但语义不完整”的结果。

8. CARBON 是系统的核心表示

MinerU.Chem 采用 CARBON:

Complex Atomic Representation and Bonding Object Notation

CARBON 是一种以原子为中心的图结构表示,可以保存:

  • 原子;
  • 化学键;
  • 原子属性;
  • 缩写基团;
  • 非标准键;
  • 重复结构;
  • 二维坐标;
  • 原始分子布局。

论文将 CARBON 从原本的评测表示扩展为系统内部的原生预测格式。

系统内部保留 CARBON,以保证复杂语义和原图布局不丢失;同时再从 CARBON 导出:

  • MolFile;
  • SMILES。

这样兼顾了两方面需求:

  • CARBON 负责忠实表示复杂化学结构;
  • MolFile 和 SMILES 负责兼容现有化学工具链。

9. 论文的主要贡献

作者总结了三项贡献。

第一,完成化学解析能力的集成部署

把以下模块集成到 MinerU 在线平台:

  • 化学相关性筛选;
  • 分子检测;
  • 编号提取;
  • 分子结构识别;
  • 反应路线解析。

最终输出带有原文位置链接的 Molecule Summary List 和 Reaction Summary List。

第二,系统性使用 CARBON

CARBON 不只是用于离线评测,而是成为系统内部的原生预测格式。

它保留了 SMILES 难以完整表达的:

  • 分子布局;
  • 复杂化学语义;
  • 特殊结构。

同时,系统仍能导出 MolFile 和 SMILES,方便下游使用。

第三,在真实复杂图像上取得高识别准确率

在修订版 MolRecBench-Wild 上:

  • SMILES 可评估子集共 2,392 个样本;
  • SMILES exact match 达到 93.02%;
  • 全部图结构标注样本共 5,024 个;
  • 图结构准确率达到 79.66%。

相比对比系统:

  • SMILES 准确率比 GPT-5.6-Sol 高 18.15 个百分点;
  • 图结构准确率比 Gemini-3.5-flash-thinking 高 43.25 个百分点。

本章一句话总结

第 1 章指出,有机化学文献中的关键知识大量存在于复杂图像中,通用文档解析和单纯 SMILES 表示都难以完整保留这些信息

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询