PaddleOCR PP-Structure 系列模型库全解析:版面分析、表格识别与关键信息抽取模型选型指南
【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR
本文围绕 docs/version2.x/ppstructure/ppstructure_model.md 展开,系统梳理 PP-Structure 版面分析、OCR、表格识别与 KIE 关键信息抽取四类模型的适用场景、推理模型大小、精度与下载方式,并结合仓库中的字典文件与
ppstructure目录源码说明模型与配置的对应关系,帮助你在实际文档理解任务中快速完成模型选型与搭配。
PP-Structure 是 PaddleOCR 团队自研的智能文档分析系统,覆盖版面分析、表格识别、关键信息抽取(KIE)等文档理解任务(详见 overview.md)。其中模型列表页是选型的第一入口,它按“版面分析 → OCR 与表格识别 → KIE”三层结构给出官方可用模型及其配套字典文件。读完本文,你将掌握每类模型的类别划分能力、中英文适用场景、精度与体积权衡,以及如何用det_model_dir、rec_model_dir、layout_model_dir等字段替换为自训模型。
一、版面分析模型:从整页文档到语义区域
版面分析是 PP-Structure 流水线的第一步,负责把文档图像划分为文字、标题、表格、图片等不同语义区域,供后续 OCR、表格识别等模块分别处理。模型列表中共收录 6 个版面分析模型,分为 PicoDet 轻量系列与 PP-YOLOv2 高精度系列两条路线。
1.1 轻量级:PicoDet LCNet_x1_0 FGD 蒸馏系列
| 模型名称 | 训练数据 | 可划分区域 | 推理模型大小 | 配套字典 |
|---|---|---|---|---|
| picodet_lcnet_x1_0_fgd_layout | PubLayNet(英文) | 文字、标题、表格、图片、列表5 类 | 9.7M | layout_publaynet_dict.txt |
| picodet_lcnet_x1_0_fgd_layout_cdla | CDLA(中文) | 表格、图片、图片标题、表格标题、页眉、页脚、脚本、引用、公式10 类 | 9.7M | layout_cdla_dict.txt |
| picodet_lcnet_x1_0_fgd_layout_table | 表格数据集 | 中英文文档表格区域检测 | 9.7M | layout_table_dict.txt |
三个轻量模型均为 9.7M 推理模型,采用 LCNet_x1_0 骨干网络与 FGD(Feature-map-level Gathered Distillation,特征图级聚合蒸馏)技术训练,兼顾速度与精度。三者的差异完全由训练数据与字典决定:
- 英文通用版面:PubLayNet 是公开英文版面数据集,对应字典
layout_publaynet_dict.txt内容为text / title / list / table / figure五类标签; - 中文通用版面:CDLA 中文数据集对应字典
layout_cdla_dict.txt,内容为text / title / figure / figure_caption / table / table_caption / header / footer / reference / equation十类标签,覆盖了页眉页脚、公式等中文论文排版常见区域; - 纯表格检测:
layout_table_dict.txt只包含table一个类别,专门用于定位表格区域,适合已明确目标为表格抽取的场景。
字典文件在仓库中的实际位置为ppocr/utils/dict/layout_dict/目录下,上述三个文件均已确认存在,与文档中的dict path列一一对应。
1.2 高精度:PP-YOLOv2 R50vd DCN 系列
| 模型名称 | 训练数据 | 推理模型大小 |
|---|---|---|
| ppyolov2_r50vd_dcn_365e_publaynet | PubLayNet(英文通用版面) | 221.0M |
| ppyolov2_r50vd_dcn_365e_tableBank_word | TableBank Word(英文表格) | 221.0M |
| ppyolov2_r50vd_dcn_365e_tableBank_latex | TableBank Latex(英文表格) | 221.0M |
PP-YOLOv2 系列采用 R50vd 骨干与 DCN 可变形卷积,推理模型大小约 221M,适合对版面区域检测精度要求高、对模型体积不敏感的服务端场景。其中 TableBank Word 与 TableBank Latex 两个模型分别针对 Word 渲染表格与 LaTeX 排版表格训练,均是表格区域检测专用模型。
1.3 从源码看版面分析流程
仓库中版面分析的实际执行逻辑位于 ppstructure/layout/predict_layout.py 的LayoutPredictor类。从源码结构看,其前处理将输入图像 Resize 到[800, 608],按 ImageNet 均值方差归一化;后处理构建PicoDetPostProcess时传入三个关键参数:
layout_dict_path:即上文提到的字典文件路径,用于将模型输出的类别索引映射为区域名称;score_threshold:检测框置信度阈值(默认 0.5);nms_threshold:非极大值抑制阈值(默认 0.5)。
因此,当你替换版面分析模型时,必须同步更换对应的字典文件,否则类别编号与区域名称将错位,这正是模型列表中为每个版面分析模型单独列出dict path列的原因。
二、OCR 与表格识别模型:结构化读取的前置与核心
版面分析划分出区域后,文本区域需要 OCR 识别,表格区域需要表格结构识别。模型列表将这部分分为 OCR 与表格识别两类。
2.1 OCR 模型
表格场景专用 OCR 模型在 PubTabNet 数据集上训练:
| 模型名称 | 任务 | 推理模型大小 |
|---|---|---|
| en_ppocr_mobile_v2.0_table_det | 英文表格场景文字检测 | 4.7M |
| en_ppocr_mobile_v2.0_table_rec | 英文表格场景文字识别 | 6.9M |
文档同时给出重要提示:如需使用其他 OCR 模型,可以在 PP-OCR model_list 下载模型,或使用自己训练好的模型配置到det_model_dir、rec_model_dir两个字段即可。这意味着 PP-Structure 的 OCR 环节完全复用 PP-OCR 的模型体系,中英文、多语种检测识别模型(如 PP-OCRv4_mobile_det/rec、PP-OCRv3_mobile_det/rec 等,见 PP-OCR 模型列表)均可直接接入。
2.2 表格识别模型
| 模型名称 | 算法与训练数据 | 推理模型大小 |
|---|---|---|
| en_ppocr_mobile_v2.0_table_structure | TableRec-RARE,PubTabNet(英文) | 6.8M |
| en_ppstructure_mobile_v2.0_SLANet | SLANet,PubTabNet(英文) | 9.2M |
| ch_ppstructure_mobile_v2.0_SLANet | SLANet(中文) | 9.3M |
其中 SLANet(Structure Layout Analysis Network)是 PP-Structure 系列主推的表格结构识别模型,中英文各有一个版本,推理模型约 9.2~9.3M。表格识别输出的结果是一个包含表格 HTML 字符串的 dict,可进一步转换为 Excel 文件(save_structure_res会把每个表格另存为 xlsx,详见 quick_start.md 的返回结果说明)。
三、关键信息抽取(KIE)模型:SER 与 RE 双任务
KIE 任务包含两个子任务:
- SER(Semantic Entity Recognition,语义实体识别):从文档中抽取语义实体,如发票上的金额、抬头等;
- RE(Relation Extraction,关系抽取):建立实体之间的对应关系,如"问题-答案"配对。
3.1 XFUND_zh 数据集上的精度与速度对比
模型列表给出在 XFUND_zh 中文数据集上的 hmean 精度与 V100 GPU 推理耗时(仅 inference 模型推理耗时,不含前后处理):
| 模型名称 | 任务 | 推理模型大小 | 精度(hmean) | 预测耗时(ms) |
|---|---|---|---|---|
| ser_VI-LayoutXLM_xfund_zh | SER | 1.1G | 93.19% | 15.49 |
| re_VI-LayoutXLM_xfund_zh | RE | 1.1G | 83.92% | 15.49 |
| ser_LayoutXLM_xfund_zh | SER | 1.4G | 90.38% | 19.49 |
| re_LayoutXLM_xfund_zh | RE | 1.4G | 74.83% | 19.49 |
| ser_LayoutLMv2_xfund_zh | SER | 778.0M | 85.44% | 31.46 |
| re_LayoutLMv2_xfund_zh | RE | 765.0M | 67.77% | 31.46 |
| ser_LayoutLM_xfund_zh | SER | 430.0M | 77.31% | - |
从表中可以清晰看出模型代际演进:
- VI-LayoutXLM在 XFUND_zh 上 SER 精度最高(93.19%)且耗时最短(15.49ms),是当前推荐首选;
- LayoutXLM次之(SER 90.38%),体积更大(1.4G);
- LayoutLMv2与LayoutLM为较早的跨模态预训练模型,精度依次递减,其中 LayoutLM 推理耗时未给出(表中为
-)。
注:上述预测耗时仅包含 inference 模型推理耗时,未统计预处理与后处理耗时;测试环境为
V100 GPU + CUDA 10.2 + CUDNN 8.1.1 + TRT 7.2.3.4。
3.2 wildreceipt 数据集上的 SDMGR
| 模型名称 | 模型简介 | 模型大小 | 精度 |
|---|---|---|---|
| SDMGR | 关键信息提取模型(Spatial Dual-Modality Graph Reasoning) | 78.0M | 86.70% |
SDMGR 在 wildreceipt 数据集上达到 86.70% 精度,体积仅 78M,适合票据类关键信息抽取场景。仓库中 KIE 相关训练配置位于 configs/kie 目录,按layoutlm_series、vi_layoutxlm、sdmgr三个子目录组织,与模型列表中的模型家族一一对应,可据此查看对应训练配置。
四、模型选型与搭配建议
PP-Structure 部分任务需要同时使用结构化分析模型与 OCR 模型(如表格识别需要表格结构模型解析结构,同时需要 OCR 模型识别单元格内文字)。结合模型列表与 overview.md 的说明,给出以下搭配思路:
- 通用中英文文档理解:
picodet_lcnet_x1_0_fgd_layout(英文)/picodet_lcnet_x1_0_fgd_layout_cdla(中文)做版面分析 + PP-OCR 检测识别模型做文字识别 + SLANet(中/英文)做表格结构识别,全流程模型体积可控,适合服务端常规部署; - 仅关注表格:可用
picodet_lcnet_x1_0_fgd_layout_table或 TableBank 系列先定位表格区域,再送入表格识别模型;也可直接关闭版面分析(layout=false)跳过检测,单独跑表格识别; - 高精度版面分析:选用 PP-YOLOv2 R50vd DCN 系列(221M),代价是更高的显存占用与推理耗时;
- 票据/证照关键信息抽取:SER 用
ser_VI-LayoutXLM_xfund_zh(93.19% hmean),RE 用re_VI-LayoutXLM_xfund_zh,或轻量场景选用 SDMGR。
五、模型替换与自训模型接入
文档明确说明,版面分析模型可通过layout_model_dir字段指定,配套字典通过layout_dict_path指定(默认layout_publaynet_dict.txt);OCR 模型通过det_model_dir、rec_model_dir替换;表格结构模型通过table_model_dir、table_char_dict_path配置;KIE 的 SER 模型通过ser_model_dir、ser_dict_path配置。相关参数及其默认值在 quick_start.md 的参数说明表中完整列出,主要包括:
| 参数 | 说明 | 默认值 |
|---|---|---|
| layout_model_dir | 版面分析模型 inference 模型地址 | None |
| layout_dict_path | 版面分析模型字典 | ../ppocr/utils/dict/layout_publaynet_dict.txt |
| layout_score_threshold | 版面分析检测框置信度阈值 | 0.5 |
| layout_nms_threshold | 版面分析 NMS 阈值 | 0.5 |
| table_model_dir | 表格结构模型 inference 模型地址 | None |
| table_char_dict_path | 表格结构模型字典 | ../ppocr/utils/dict/table_structure_dict.txt |
| table_max_len | 表格结构模型预测时图像长边 resize 尺度 | 488 |
| ser_model_dir | SER 模型 inference 模型地址 | None |
| ser_dict_path | SER 模型字典 | ../train_data/XFUND/class_list_xfun.txt |
| kie_algorithm | KIE 模型算法 | LayoutXLM |
需要注意:替换模型时字典必须与模型训练时使用的类别顺序一致。以版面分析为例,模型输出的类别索引正是按layout_publaynet_dict.txt、layout_cdla_dict.txt等文件中的行序编号的,字典错配将直接导致区域类别标注错误。
六、小结
PP-Structure 系列模型库围绕"版面分析 → OCR/表格识别 → 关键信息抽取"的文档理解链路,提供了轻量(PicoDet 9.7M / SLANet 9.2M)与高精度(PP-YOLOv2 221M / VI-LayoutXLM 1.1G)两条完整选型路线,且所有模型均可通过 whl 包参数自由组合替换。结合 ppstructure_model.md 的模型清单、models_list.md 的完整列表、overview.md 的系统流程与 quick_start.md 的实战教程,即可针对中英文文档解析、表格抽取、票据信息抽取等场景快速搭建可落地的结构化文档理解方案。
【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考