PaddleOCR PP-Structure 系列模型库全解析:版面分析、表格识别与关键信息抽取模型选型指南
2026/9/12 3:00:21 网站建设 项目流程

PaddleOCR PP-Structure 系列模型库全解析:版面分析、表格识别与关键信息抽取模型选型指南

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

本文围绕 docs/version2.x/ppstructure/ppstructure_model.md 展开,系统梳理 PP-Structure 版面分析、OCR、表格识别与 KIE 关键信息抽取四类模型的适用场景、推理模型大小、精度与下载方式,并结合仓库中的字典文件与ppstructure目录源码说明模型与配置的对应关系,帮助你在实际文档理解任务中快速完成模型选型与搭配。

PP-Structure 是 PaddleOCR 团队自研的智能文档分析系统,覆盖版面分析、表格识别、关键信息抽取(KIE)等文档理解任务(详见 overview.md)。其中模型列表页是选型的第一入口,它按“版面分析 → OCR 与表格识别 → KIE”三层结构给出官方可用模型及其配套字典文件。读完本文,你将掌握每类模型的类别划分能力、中英文适用场景、精度与体积权衡,以及如何用det_model_dirrec_model_dirlayout_model_dir等字段替换为自训模型。

一、版面分析模型:从整页文档到语义区域

版面分析是 PP-Structure 流水线的第一步,负责把文档图像划分为文字、标题、表格、图片等不同语义区域,供后续 OCR、表格识别等模块分别处理。模型列表中共收录 6 个版面分析模型,分为 PicoDet 轻量系列与 PP-YOLOv2 高精度系列两条路线。

1.1 轻量级:PicoDet LCNet_x1_0 FGD 蒸馏系列

模型名称训练数据可划分区域推理模型大小配套字典
picodet_lcnet_x1_0_fgd_layoutPubLayNet(英文)文字、标题、表格、图片、列表5 类9.7Mlayout_publaynet_dict.txt
picodet_lcnet_x1_0_fgd_layout_cdlaCDLA(中文)表格、图片、图片标题、表格标题、页眉、页脚、脚本、引用、公式10 类9.7Mlayout_cdla_dict.txt
picodet_lcnet_x1_0_fgd_layout_table表格数据集中英文文档表格区域检测9.7Mlayout_table_dict.txt

三个轻量模型均为 9.7M 推理模型,采用 LCNet_x1_0 骨干网络与 FGD(Feature-map-level Gathered Distillation,特征图级聚合蒸馏)技术训练,兼顾速度与精度。三者的差异完全由训练数据与字典决定:

  • 英文通用版面:PubLayNet 是公开英文版面数据集,对应字典layout_publaynet_dict.txt内容为text / title / list / table / figure五类标签;
  • 中文通用版面:CDLA 中文数据集对应字典layout_cdla_dict.txt,内容为text / title / figure / figure_caption / table / table_caption / header / footer / reference / equation十类标签,覆盖了页眉页脚、公式等中文论文排版常见区域;
  • 纯表格检测layout_table_dict.txt只包含table一个类别,专门用于定位表格区域,适合已明确目标为表格抽取的场景。

字典文件在仓库中的实际位置为ppocr/utils/dict/layout_dict/目录下,上述三个文件均已确认存在,与文档中的dict path列一一对应。

1.2 高精度:PP-YOLOv2 R50vd DCN 系列

模型名称训练数据推理模型大小
ppyolov2_r50vd_dcn_365e_publaynetPubLayNet(英文通用版面)221.0M
ppyolov2_r50vd_dcn_365e_tableBank_wordTableBank Word(英文表格)221.0M
ppyolov2_r50vd_dcn_365e_tableBank_latexTableBank Latex(英文表格)221.0M

PP-YOLOv2 系列采用 R50vd 骨干与 DCN 可变形卷积,推理模型大小约 221M,适合对版面区域检测精度要求高、对模型体积不敏感的服务端场景。其中 TableBank Word 与 TableBank Latex 两个模型分别针对 Word 渲染表格与 LaTeX 排版表格训练,均是表格区域检测专用模型。

1.3 从源码看版面分析流程

仓库中版面分析的实际执行逻辑位于 ppstructure/layout/predict_layout.py 的LayoutPredictor类。从源码结构看,其前处理将输入图像 Resize 到[800, 608],按 ImageNet 均值方差归一化;后处理构建PicoDetPostProcess时传入三个关键参数:

  • layout_dict_path:即上文提到的字典文件路径,用于将模型输出的类别索引映射为区域名称;
  • score_threshold:检测框置信度阈值(默认 0.5);
  • nms_threshold:非极大值抑制阈值(默认 0.5)。

因此,当你替换版面分析模型时,必须同步更换对应的字典文件,否则类别编号与区域名称将错位,这正是模型列表中为每个版面分析模型单独列出dict path列的原因。

二、OCR 与表格识别模型:结构化读取的前置与核心

版面分析划分出区域后,文本区域需要 OCR 识别,表格区域需要表格结构识别。模型列表将这部分分为 OCR 与表格识别两类。

2.1 OCR 模型

表格场景专用 OCR 模型在 PubTabNet 数据集上训练:

模型名称任务推理模型大小
en_ppocr_mobile_v2.0_table_det英文表格场景文字检测4.7M
en_ppocr_mobile_v2.0_table_rec英文表格场景文字识别6.9M

文档同时给出重要提示:如需使用其他 OCR 模型,可以在 PP-OCR model_list 下载模型,或使用自己训练好的模型配置到det_model_dirrec_model_dir两个字段即可。这意味着 PP-Structure 的 OCR 环节完全复用 PP-OCR 的模型体系,中英文、多语种检测识别模型(如 PP-OCRv4_mobile_det/rec、PP-OCRv3_mobile_det/rec 等,见 PP-OCR 模型列表)均可直接接入。

2.2 表格识别模型

模型名称算法与训练数据推理模型大小
en_ppocr_mobile_v2.0_table_structureTableRec-RARE,PubTabNet(英文)6.8M
en_ppstructure_mobile_v2.0_SLANetSLANet,PubTabNet(英文)9.2M
ch_ppstructure_mobile_v2.0_SLANetSLANet(中文)9.3M

其中 SLANet(Structure Layout Analysis Network)是 PP-Structure 系列主推的表格结构识别模型,中英文各有一个版本,推理模型约 9.2~9.3M。表格识别输出的结果是一个包含表格 HTML 字符串的 dict,可进一步转换为 Excel 文件(save_structure_res会把每个表格另存为 xlsx,详见 quick_start.md 的返回结果说明)。

三、关键信息抽取(KIE)模型:SER 与 RE 双任务

KIE 任务包含两个子任务:

  • SER(Semantic Entity Recognition,语义实体识别):从文档中抽取语义实体,如发票上的金额、抬头等;
  • RE(Relation Extraction,关系抽取):建立实体之间的对应关系,如"问题-答案"配对。

3.1 XFUND_zh 数据集上的精度与速度对比

模型列表给出在 XFUND_zh 中文数据集上的 hmean 精度与 V100 GPU 推理耗时(仅 inference 模型推理耗时,不含前后处理):

模型名称任务推理模型大小精度(hmean)预测耗时(ms)
ser_VI-LayoutXLM_xfund_zhSER1.1G93.19%15.49
re_VI-LayoutXLM_xfund_zhRE1.1G83.92%15.49
ser_LayoutXLM_xfund_zhSER1.4G90.38%19.49
re_LayoutXLM_xfund_zhRE1.4G74.83%19.49
ser_LayoutLMv2_xfund_zhSER778.0M85.44%31.46
re_LayoutLMv2_xfund_zhRE765.0M67.77%31.46
ser_LayoutLM_xfund_zhSER430.0M77.31%-

从表中可以清晰看出模型代际演进:

  • VI-LayoutXLM在 XFUND_zh 上 SER 精度最高(93.19%)且耗时最短(15.49ms),是当前推荐首选;
  • LayoutXLM次之(SER 90.38%),体积更大(1.4G);
  • LayoutLMv2LayoutLM为较早的跨模态预训练模型,精度依次递减,其中 LayoutLM 推理耗时未给出(表中为-)。

注:上述预测耗时仅包含 inference 模型推理耗时,未统计预处理与后处理耗时;测试环境为V100 GPU + CUDA 10.2 + CUDNN 8.1.1 + TRT 7.2.3.4

3.2 wildreceipt 数据集上的 SDMGR

模型名称模型简介模型大小精度
SDMGR关键信息提取模型(Spatial Dual-Modality Graph Reasoning)78.0M86.70%

SDMGR 在 wildreceipt 数据集上达到 86.70% 精度,体积仅 78M,适合票据类关键信息抽取场景。仓库中 KIE 相关训练配置位于 configs/kie 目录,按layoutlm_seriesvi_layoutxlmsdmgr三个子目录组织,与模型列表中的模型家族一一对应,可据此查看对应训练配置。

四、模型选型与搭配建议

PP-Structure 部分任务需要同时使用结构化分析模型与 OCR 模型(如表格识别需要表格结构模型解析结构,同时需要 OCR 模型识别单元格内文字)。结合模型列表与 overview.md 的说明,给出以下搭配思路:

  1. 通用中英文文档理解picodet_lcnet_x1_0_fgd_layout(英文)/picodet_lcnet_x1_0_fgd_layout_cdla(中文)做版面分析 + PP-OCR 检测识别模型做文字识别 + SLANet(中/英文)做表格结构识别,全流程模型体积可控,适合服务端常规部署;
  2. 仅关注表格:可用picodet_lcnet_x1_0_fgd_layout_table或 TableBank 系列先定位表格区域,再送入表格识别模型;也可直接关闭版面分析(layout=false)跳过检测,单独跑表格识别;
  3. 高精度版面分析:选用 PP-YOLOv2 R50vd DCN 系列(221M),代价是更高的显存占用与推理耗时;
  4. 票据/证照关键信息抽取:SER 用ser_VI-LayoutXLM_xfund_zh(93.19% hmean),RE 用re_VI-LayoutXLM_xfund_zh,或轻量场景选用 SDMGR。

五、模型替换与自训模型接入

文档明确说明,版面分析模型可通过layout_model_dir字段指定,配套字典通过layout_dict_path指定(默认layout_publaynet_dict.txt);OCR 模型通过det_model_dirrec_model_dir替换;表格结构模型通过table_model_dirtable_char_dict_path配置;KIE 的 SER 模型通过ser_model_dirser_dict_path配置。相关参数及其默认值在 quick_start.md 的参数说明表中完整列出,主要包括:

参数说明默认值
layout_model_dir版面分析模型 inference 模型地址None
layout_dict_path版面分析模型字典../ppocr/utils/dict/layout_publaynet_dict.txt
layout_score_threshold版面分析检测框置信度阈值0.5
layout_nms_threshold版面分析 NMS 阈值0.5
table_model_dir表格结构模型 inference 模型地址None
table_char_dict_path表格结构模型字典../ppocr/utils/dict/table_structure_dict.txt
table_max_len表格结构模型预测时图像长边 resize 尺度488
ser_model_dirSER 模型 inference 模型地址None
ser_dict_pathSER 模型字典../train_data/XFUND/class_list_xfun.txt
kie_algorithmKIE 模型算法LayoutXLM

需要注意:替换模型时字典必须与模型训练时使用的类别顺序一致。以版面分析为例,模型输出的类别索引正是按layout_publaynet_dict.txtlayout_cdla_dict.txt等文件中的行序编号的,字典错配将直接导致区域类别标注错误。

六、小结

PP-Structure 系列模型库围绕"版面分析 → OCR/表格识别 → 关键信息抽取"的文档理解链路,提供了轻量(PicoDet 9.7M / SLANet 9.2M)与高精度(PP-YOLOv2 221M / VI-LayoutXLM 1.1G)两条完整选型路线,且所有模型均可通过 whl 包参数自由组合替换。结合 ppstructure_model.md 的模型清单、models_list.md 的完整列表、overview.md 的系统流程与 quick_start.md 的实战教程,即可针对中英文文档解析、表格抽取、票据信息抽取等场景快速搭建可落地的结构化文档理解方案。

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询