MinerU.Chem: A High-Precision System for Optical Chemical Structure and Reaction Recognition
Abstract:摘要想表达什么
这篇论文介绍了MinerU.Chem,一个面向有机化学论文和专利的高精度文档解析系统。
它要解决的核心问题是:
有机化学文献中的大量关键信息不是普通文字,而是嵌在分子结构图、反应路线图、表格和图片中;通用文档解析系统通常无法理解这些图像中的化学含义。
1. 为什么普通文档解析不够用
有机化学论文里经常包含:
- 分子结构式;
- 反应路线;
- 反应物和产物;
- 反应条件;
- 化合物编号;
- 复杂的图表和示意图。
这些内容对化学家来说非常重要,但普通 PDF 或 Markdown 解析工具通常只会把它们当成图片,无法识别:
- 原子之间如何连接;
- 哪些分子是反应物;
- 哪些分子是产物;
- 反应条件是什么;
- 分子结构在原图中的位置;
- 化学结构中包含的立体化学、重复单元或特殊键。
因此,许多有机化学知识无法自动转成机器可读的数据。
2. MinerU.Chem 的目标
MinerU.Chem 是建立在 MinerU 通用文档解析系统之上的化学专用扩展。
MinerU 负责先把论文转换为:
- Markdown;
- JSON;
- 页面布局;
- 文本;
- 公式;
- 表格;
- 图片区域。
MinerU.Chem 再对其中与化学相关的图像区域进行进一步分析,把它们转换成结构化的化学信息。
3. 系统包含五个化学模块
MinerU.Chem 主要增加了五个模块:
- 化学相关性筛选
- 判断页面中的图表区域是否与化学有关。
- 分子结构检测
- 找出图像中哪些区域包含分子结构。
- 分子标识符提取
- 识别结构旁边的化合物编号或标签,如 1、2、1a、2a。
- 分子结构识别
- 把分子结构图转换为机器可读的化学结构。
- 反应路线解析
- 从反应图中提取反应物、产物和反应条件。
这些模块共同把化学论文中的视觉信息转换成两类输出:
- Molecule Summary List:分子摘要列表;
- Reaction Summary List:反应摘要列表。
4. 两种主要输出是什么
Molecule Summary List
它记录论文中检测到和识别出的分子,包括:
- 分子所在页码;
- 图像中的位置;
- 化合物编号;
- MolFile;
- SMILES;
- 与原始图像的关联。
Reaction Summary List
它把一个反应组织成:
- 反应物;
- 产物;
- 反应条件;
- 对应的分子结构记录。
如果反应物或产物带有化合物编号,系统还会将它们链接回 Molecule Summary List 中对应的分子。
这样,用户可以从一个反应追溯到原论文中的具体分子图像。
5. 为什么采用 CARBON 表示法
分子结构识别的核心表示不是只输出 SMILES,而是使用CARBON:
Complex Atomic Representation and Bonding Object Notation
作者认为,SMILES 虽然适合表示基本的原子连接关系,但对一些复杂信息表达能力有限,例如:
- 分子图像中的二维布局;
- 非标准化学键;
- 原子价态;
- 自由基;
- 连接点;
- 重复结构;
- Markush 结构;
- 特殊立体化学信息。
CARBON 以原子为中心表示分子图,可以同时保留:
- 原子;
- 键;
- 化学语义;
- 特殊结构;
- 原图中的二维坐标。
在系统内部,CARBON 作为主要预测格式;为了兼容现有化学软件,系统还可以进一步导出:
- MolFile;
- SMILES。
6. 分子识别效果很强
作者在修订后的 MolRecBench-Wild 数据集上测试了分子结构识别模块。
在可以用 SMILES 评价的 2,392 个样本上:
SMILES exact-match = 93.02 % \text{SMILES exact-match}=93.02\%SMILES exact-match=93.02%
作为对比,论文测试的最佳比较系统 GPT-5.6-Sol 达到:
74.87 % 74.87\%74.87%
MinerU.Chem 高出:
18.15 18.1518.15
个百分点。
在全部 5,024 个带图结构标注的样本上,MinerU.Chem 的图结构准确率达到:
79.66 % 79.66\%79.66%
相比之下,比较系统中的最好结果约为:
36.41 % 36.41\%36.41%
高出 43.25 个百分点。
7. 系统的实际用途
MinerU.Chem 的目标不是只做单张图片识别,而是服务于整篇化学文献的结构化数据生产。
它可以帮助构建:
- 有机化学知识库;
- 反应数据库;
- 分子数据库;
- AI for Chemistry 训练数据;
- 反应预测数据;
- 逆合成数据;
- 反应条件推荐数据;
- 分子性质预测数据;
- 药物分子设计数据。
同时,系统保留原始页面位置,使识别结果能够:
- 回溯原文;
- 人工检查;
- 修正识别错误;
- 确认模型是否误读了化学结构。
摘要一句话总结
这篇论文提出 MinerU.Chem,将通用文档解析与化学专用模块结合,把有机化学论文中的分子结构、化合物编号和反应路线转换为可追溯的结构化数据,并通过 CARBON 保留复杂化学语义和图像布局,在分子结构识别准确率上明显超过现有比较系统。
第 1 章:Introduction(引言)
这一章主要说明论文为什么需要 MinerU.Chem,以及它要解决什么问题、采用什么结构表示,并总结系统的主要贡献。
1. 有机化学文献中的关键信息往往不是普通文字
在有机化学论文和专利中,大量核心知识被放在:
- 分子结构图;
- 反应路线图;
- 表格;
- 图片;
- 实验流程示意图。
分子结构图中包含的不只是“有哪些原子”,还包括:
- 原子之间的连接关系;
- 原子和基团标签;
- 二维布局;
- 立体化学信息;
- 重复结构;
- 特殊键;
- 连接点;
- 化合物之间的空间关系。
反应图还要组织:
- 反应物;
- 产物;
- 反应条件;
- 反应步骤;
- 箭头方向;
- 多个区域之间的对应关系。
这些图像对化学家来说非常直观,但对于通用文档解析系统来说很难直接理解。
2. 通用文档解析工具的局限
普通 PDF 或论文解析系统通常能够处理:
- 普通文本;
- 公式;
- 表格;
- 页面布局;
- 图片位置。
但遇到化学图像时,往往只会把它当作普通图片,而不会分析图片内部的化学语义。
这会导致:
- 无法建立完整的化学知识库;
- 分子结构无法转成机器可读格式;
- 反应物和产物无法自动整理;
- 反应条件无法与分子对应;
- AI for Chemistry 缺少高质量结构化训练数据。
3. 现有化学识别系统仍然不够稳定
光学化学结构识别(OCSR)系统能够从分子结构图中恢复基本的原子连接关系。
但是,在真实论文和专利中,图像质量和结构形式更加复杂,常见问题包括:
- 低分辨率扫描;
- 模糊;
- 图像背景复杂;
- 多个分子拥挤排列;
- 非标准结构表示;
- 键的视觉形式容易混淆;
- 分子结构与文字、箭头、表格相互重叠。
即使成功恢复了原子连接,很多复杂语义仍可能丢失,例如:
- 立体化学;
- 重复单元;
- Markush 片段;
- 配位键;
- 非标准键;
- 原始图像中的空间坐标。
因此,论文认为真正可用于数据库构建和 AI 训练的系统,不仅要识别“分子拓扑”,还必须保留:
- 复杂化学语义;
- 原图中的位置;
- 分子与标签的对应关系;
- 从识别结果回溯到原文的能力。
4. 反应路线解析也存在类似问题
现有系统已经尝试解析反应图,例如识别:
- 反应物;
- 产物;
- 反应箭头;
- 反应条件。
但在真实文献中,反应图经常包含:
- 密集排版;
- 多个反应区域;
- 复杂背景;
- 低质量扫描;
- 跨区域对应关系;
- 多步反应;
- 分子编号和结构图分离出现。
因此,单独识别某一张反应图还不够。系统还需要把反应图与整篇论文的布局、文字、编号和分子记录联系起来。
5. MinerU.Chem 的定位
MinerU 是一个通用科学文档解析工具,可以把 PDF 和图片转成:
- Markdown;
- JSON;
- 文本;
- 公式;
- 表格;
- 页面布局信息。
MinerU.Chem 在此基础上增加化学专用解析层。
它首先利用 MinerU 得到论文的整体结构,再对其中与化学有关的图片区域进行深入识别。
系统输出两种核心结果:
Molecule Summary List
记录文档中检测到的分子,包括:
- 分子所在页码;
- 图像中的边界框;
- 化合物编号;
- MolFile;
- SMILES;
- 与原始图像的对应关系。
Reaction Summary List
记录反应图中的:
- 反应物;
- 产物;
- 反应条件;
- 与对应分子记录的链接。
这样,用户可以从一个反应追溯到具体分子,再追溯到论文原始页面。
6. 系统包含五个化学模块
MinerU.Chem 的化学解析层包括:
- 化学相关性筛选
- 判断某个图片或表格区域是否与化学有关。
- 分子结构检测
- 找到页面或图表中的分子结构区域。
- 分子标识符提取
- 识别结构旁边的编号和标签,如 1、2、1a、2a。
- 分子结构识别
- 把结构图转换成 CARBON、MolFile 和 SMILES。
- 反应路线解析
- 识别反应物、产物、条件和反应关系。
这五个模块不是相互独立的,而是组成一条完整的数据生产流程。
7. 为什么不能只使用 SMILES
SMILES 是目前化学信息学中最常用的分子表示形式之一,非常适合表示:
- 原子连接关系;
- 基本分子拓扑;
- 与下游化学软件的接口。
但它不擅长完整保留分子图像中的所有信息,例如:
- 非标准键;
- 原子价态;
- 自由基;
- 连接点;
- 重复结构;
- Markush 结构;
- 原始图像布局;
- 某些特殊立体化学表示。
因此,单独把图片转换为 SMILES,可能会得到一个“拓扑上看似正确,但语义不完整”的结果。
8. CARBON 是系统的核心表示
MinerU.Chem 采用 CARBON:
Complex Atomic Representation and Bonding Object Notation
CARBON 是一种以原子为中心的图结构表示,可以保存:
- 原子;
- 化学键;
- 原子属性;
- 缩写基团;
- 非标准键;
- 重复结构;
- 二维坐标;
- 原始分子布局。
论文将 CARBON 从原本的评测表示扩展为系统内部的原生预测格式。
系统内部保留 CARBON,以保证复杂语义和原图布局不丢失;同时再从 CARBON 导出:
- MolFile;
- SMILES。
这样兼顾了两方面需求:
- CARBON 负责忠实表示复杂化学结构;
- MolFile 和 SMILES 负责兼容现有化学工具链。
9. 论文的主要贡献
作者总结了三项贡献。
第一,完成化学解析能力的集成部署
把以下模块集成到 MinerU 在线平台:
- 化学相关性筛选;
- 分子检测;
- 编号提取;
- 分子结构识别;
- 反应路线解析。
最终输出带有原文位置链接的 Molecule Summary List 和 Reaction Summary List。
第二,系统性使用 CARBON
CARBON 不只是用于离线评测,而是成为系统内部的原生预测格式。
它保留了 SMILES 难以完整表达的:
- 分子布局;
- 复杂化学语义;
- 特殊结构。
同时,系统仍能导出 MolFile 和 SMILES,方便下游使用。
第三,在真实复杂图像上取得高识别准确率
在修订版 MolRecBench-Wild 上:
- SMILES 可评估子集共 2,392 个样本;
- SMILES exact match 达到 93.02%;
- 全部图结构标注样本共 5,024 个;
- 图结构准确率达到 79.66%。
相比对比系统:
- SMILES 准确率比 GPT-5.6-Sol 高 18.15 个百分点;
- 图结构准确率比 Gemini-3.5-flash-thinking 高 43.25 个百分点。
本章一句话总结
第 1 章指出,有机化学文献中的关键知识大量存在于复杂图像中,通用文档解析和单纯 SMILES 表示都难以完整保留这些信息