PaddleOCR 版本更新全览:从 3.2.0 核心能力到 2.x 历史演进
2026/9/10 1:30:00 网站建设 项目流程

PaddleOCR 版本更新全览:从 3.2.0 核心能力到 2.x 历史演进

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

PaddleOCR 的版本更新记录完整呈现了从 2020 年 5 月首次开源超轻量中文 OCR 模型,到 2025 年 8 月发布 3.2.0 版本的整个演进轨迹。本文以该更新文档为主线,系统梳理 PaddleOCR 3.x 时代的关键能力(PP-OCRv5 系列模型、PP-StructureV3、PP-ChatOCRv4、部署与推理升级、依赖与生态改进),并回溯 2.x 时代的里程碑事件,同时结合仓库中的源码、配置文件与文档,帮助读者快速定位每个版本新增能力的具体实现位置与使用方式。

2025.08.21:PaddleOCR 3.2.0 发布

3.2.0 是更新文档记录的最新版本,围绕模型、部署、性能分析、Bug 修复与依赖管理五个方向进行了升级。

重要模型新增

  • PP-OCRv5 英文、泰文、希腊文识别模型正式支持训练、推理与部署。官方公布的指标显示:PP-OCRv5 英文模型较 PP-OCRv5 主模型在英文场景提升 11%,泰文识别模型精度 82.68%,希腊文识别模型精度 89.28%。

在仓库的configs/rec/PP-OCRv5/multi_language/目录下可以看到完整的多语种训练配置,其中即包含en_PP-OCRv5_mobile_rec.yamlth_PP-OCRv5_mobile_rec.yamlel_PP-OCRv5_mobile_rec.yaml等文件,与本次新增的三种语言模型一一对应。

部署能力升级

  • 全面支持飞桨框架 3.1.0 与 3.1.1,这意味着用户可以在新版本飞桨上获得更好的训推体验。
  • PP-OCRv5 C++ 本地部署方案全面升级,支持 Linux 与 Windows 双平台,功能与精度效果和 Python 方案保持一致。C++ 推理源码位于 deploy/cpp_infer,其中src/pipelines/ocr/等目录实现了检测、识别等产线的底层串联逻辑。
  • 高性能推理支持 CUDA 12,可选择 Paddle Inference 与 ONNX Runtime 两种后端。
  • 高稳定性服务化部署方案全面开源,用户可根据需求对 Docker 镜像和 SDK 进行定制化修改;同时支持通过手动构造 HTTP 请求的方式调用,客户端代码可以用任意编程语言编写。仓库中 api_sdk 目录下的 Go 与 TypeScript SDK 即为多语言服务调用的官方示例。

Benchmark 支持

  • 全部产线支持产线细粒度 benchmark,可测量产线端到端推理时间以及逐层、逐模块的耗时数据,用于辅助产线性能分析。
  • 文档中补充了各产线常用配置在主流硬件上的关键指标,包括推理耗时与内存占用等,为用户部署选型提供参考。

Bug 修复

  • 修复模型训练时训练日志保存失败的问题。
  • 公式模型的数据增强部分完成版本兼容性升级,以适应新版本 albumentations 依赖,并修复多进程使用 tokenizers 依赖时的死锁警告。
  • 修复 PP-StructureV3 配置文件中use_chart_parsing等开关行为与其他产线不统一的问题。

其他升级

  • 分离必要依赖与可选依赖:仅使用基础文字识别功能时只需安装少量核心依赖;需要文档解析、信息抽取等功能时可按需安装额外依赖,大幅降低最小安装体积。
  • 支持 Windows 用户使用英伟达 50 系显卡,可按安装文档安装对应版本的飞桨框架。
  • PP-OCR 系列模型支持返回单文字坐标,为需要字符级定位的下游任务提供了数据基础。
  • 模型新增 AIStudio、ModelScope 等下载源,可指定下载源下载对应模型。
  • 支持图表转表 PP-Chart2Table 单功能模块推理能力
  • 优化部分使用文档描述,提升易用性。

2025.08.15:PaddleOCR 3.1.1 发布

3.1.1 以 Bug 修复与文档优化为主:

  • 补充PP-ChatOCRv4类缺失的save_vectorsave_visual_info_listload_vectorload_visual_info_list方法。在源码 paddleocr/_pipelines/pp_chatocrv4_doc.py 中可以找到save_vector等方法的实现,其内部委托给底层 paddlex 产线完成向量保存。
  • 补充PPDocTranslation类的translate方法缺失的glossaryllm_request_interval参数。对应实现在 paddleocr/_pipelines/pp_doctranslation.py 中,glossary用于传入翻译术语表,llm_request_interval默认值为0.0,用于控制 LLM 请求的间隔时间。
  • 文档优化:补充 MCP 文档 demo、补充性能指标测试所用的飞桨框架与 PaddleOCR 版本、修复文档翻译产线文档中的错漏。
  • 其他:MCP 服务器依赖改用纯 Python 库puremagic替代python-magic,减少安装问题;使用 3.1.0 版本 PaddleOCR 重新测试 PP-OCRv5 性能指标并更新文档。

2025.06.29:PaddleOCR 3.1.0 发布

重要模型和产线

  • 新增 PP-OCRv5 多语种文本识别模型,支持法语、西班牙语、葡萄牙语、俄语、韩语等 37 种语言的文字识别模型训推流程,官方称平均精度涨幅超 30%。对应配置文件同样位于 configs/rec/PP-OCRv5/multi_language,覆盖 latin、cyrillic、arabic、devanagari、korean、eslav 等多个语系。
  • 升级 PP-StructureV3 中的 PP-Chart2Table 模型,图表转表能力进一步升级,在内部自建测评集合上 RMS-F1 指标提升 9.36 个百分点(71.24% → 80.60%)。
  • 新增文档翻译产线 PP-DocTranslation,基于 PP-StructureV3 与 ERNIE 4.5,支持翻译 Markdown 格式文档、各种复杂版式的 PDF 文档和文档图像,结果保存为 Markdown 格式。产线实现见 paddleocr/_pipelines/pp_doctranslation.py。

新增 MCP Server

3.1.0 起提供 MCP Server 集成,特性包括:

  • 支持 OCR 与 PP-StructureV3 两种工具;
  • 支持本地 Python 库、星河社区云服务、自托管服务三种工作模式;
  • 支持通过 stdio 调用本地服务、通过 Streamable HTTP 调用远程服务。

仓库中的 mcp_server 目录即为 MCP 服务的完整实现,包含paddleocr_mcp/inference/(推理相关工具)与paddleocr_mcp/tasks/(任务封装)等子模块。

2025.06.26:PaddleOCR 3.0.3 发布

修复enable_mkldnn参数不生效的问题,恢复 CPU 默认使用 MKL-DNN 推理的行为。从 paddleocr/_constants.py 可以看到DEFAULT_ENABLE_MKLDNN = True,即 MKL-DNN 默认开启,这与 3.0.3 恢复的默认行为一致。

2025.06.19:PaddleOCR 3.0.2 发布

功能新增

  • 模型默认下载源从 BOS 改为 HuggingFace,同时支持通过环境变量PADDLE_PDX_MODEL_SOURCE切换回 BOS。这一配置在仓库多处文档中均有说明,例如 docs/FAQ.md 中给出的用法:
os.environ['PADDLE_PDX_MODEL_SOURCE'] = 'BOS' # 使用百度云对象存储
  • PP-OCRv5、PP-StructureV3、PP-ChatOCRv4 等产线新增 C++、Java、Go、C#、Node.js、PHP 6 种语言的服务调用示例,仓库中 api_sdk 目录下的 Go 与 TypeScript SDK 即为其中一部分。
  • 优化 PP-StructureV3 产线中版面分区排序算法,完善复杂竖版版面排序逻辑。
  • 优化模型选择逻辑:指定语言而未指定模型版本时,自动选择支持该语言的最新版本模型(社区贡献 @timminator)。
  • 为 MKL-DNN 缓存大小设置默认上界,防止缓存无限增长,并支持用户配置缓存容量(@timminator)。从 paddleocr/_constants.py 可看到DEFAULT_MKLDNN_CACHE_CAPACITY = 10
  • 更新高性能推理默认配置,支持 Paddle MKL-DNN 加速;优化自动配置逻辑,支持更智能的配置选择。
  • 调整默认设备获取逻辑,考虑环境中安装的飞桨框架对计算设备的实际支持情况。
  • 新增 PP-OCRv5 的 Android 端示例,见端侧部署文档。

Bug 修复

  • 修复 PP-StructureV3 部分 CLI 参数不生效的问题;
  • 修复部分情况下export_paddlex_config_to_yaml无法正常工作的问题;
  • 修复save_path实际行为与文档描述不符的问题;
  • 修复基础服务化部署在使用 MKL-DNN 时可能出现的多线程错误;
  • 修复 Latex-OCR 模型图像预处理通道顺序错误;
  • 修复文本识别模块保存可视化图像的通道顺序错误;
  • 修复 PP-StructureV3 表格可视化结果通道顺序错误;
  • 修复 PP-StructureV3 产线极端情况下计算overlap_ratio时的变量溢出问题。

文档优化与其他

  • 更新enable_mkldnn参数说明,使其更准确描述程序实际行为;
  • 修复langocr_version参数描述错误;
  • 补充通过 CLI 导出产线配置文件的说明;
  • 修复 PP-OCRv5 性能数据表格列缺失问题;
  • 放松 numpy、pandas 等依赖的版本限制,恢复对 Python 3.12 的支持。

2025.06.05:PaddleOCR 3.0.1 发布

  • 更新 PP-OCRv5 默认模型配置:检测与识别均由 mobile 改为 server 模型;为改善大多数场景默认效果,配置中limit_side_len由 736 改为 64。对应配置可见 configs/det/PP-OCRv5/PP-OCRv5_server_det.yml 与 configs/rec/PP-OCRv5/PP-OCRv5_server_rec.yml。
  • 新增文本行方向分类模型PP-LCNet_x1_0_textline_ori,精度 99.42%,OCR、PP-StructureV3、PP-ChatOCRv4 产线的默认文本行方向分类器均改为该模型。
  • 优化文本行方向分类模型PP-LCNet_x0_25_textline_ori,精度提升 3.3 个百分点,当前精度 98.85%。
  • CLI 使用体验优化:使用 PaddleOCR CLI 不传任何参数时给出用法提示。
  • 新增参数:PP-ChatOCRv3、PP-StructureV3 支持use_textline_orientation参数。该参数在 paddleocr/_pipelines/ocr.py 中贯穿了参数定义、CLI 解析与产线传参全链路。
  • CPU 推理速度优化:所有产线 CPU 推理默认开启 MKL-DNN。
  • C++ 推理支持:PP-OCRv5 检测与识别串联部分支持 C++ 推理。
  • 修复公式识别、表格识别模型无法使用 MKL-DNN 导致 PP-StructureV3 在部分 CPU 推理报错的问题;修复部分 GPU 环境推理报FatalError: Process abort signal is detected by the operating system的问题;修复PPStructureV3.concatenate_markdown_pages方法不存在、实例化paddleocr.PaddleOCR同时指定langmodel_namemodel_name不生效等问题。

2025.05.20:PaddleOCR 3.0 正式发布

3.0 是 PaddleOCR 架构层面的重大版本,主要内容如下:

  • 发布全场景文字识别模型 PP-OCRv5:单模型支持五种文字类型和复杂手写体识别,整体识别精度相比上一代提升 13 个百分点。
  • 发布通用文档解析方案 PP-StructureV3:支持多场景、多版式 PDF 高精度解析。
  • 发布智能文档理解方案 PP-ChatOCRv4:原生支持文心大模型 4.5,精度相比上一代提升 15 个百分点。
  • 重构部署能力,统一推理接口:融合飞桨 PaddleX 3.0 工具的底层能力,全面升级推理、部署模块,统一并优化 Python API 与命令行接口(CLI)。部署能力覆盖高性能推理、服务化部署及端侧部署三大场景。
  • 适配飞桨框架 3.0:兼容 CINN 编译器(paddleocr/_constants.py 中可见DEFAULT_USE_CINN = False默认配置)等最新特性,静态图模型存储文件名由xxx.pdmodel改为xxx.json
  • 统一模型名称:对 3.0 支持的模型命名体系进行更新,采用更规范、统一的命名规则。

从 2.x 升级到 3.x 的详细说明(含 2.x 推理代码迁移示例、已知问题清单)见 2.x 升级 3.x 说明。其中关键的迁移点包括:PaddleOCR.ocr不再接受detrec等参数,改用TextDetectionTextRecognition等单功能模块接口;use_onnx参数由高性能推理功能代替;PPStructure被功能更丰富的PPStructureV3替代。

2025.03.07:PaddleOCR 2.10 版本

2.10 是 2.x 系列的收官之作,重点推出了 12 个自研单模型与 4 条高价值多模型组合方案。

12 个自研单模型

  • 版面区域检测系列 3 个:PP-DocLayout-L / M / S,支持预测 23 个常见版面类别,mAP@0.5 最高达 90.4%。
  • 公式识别系列 2 个:PP-FormulaNet-L / S,支持 5 万种 LaTeX 常见词汇,支持高难度印刷公式与手写公式识别。
  • 表格结构识别系列 2 个:SLANeXt_wired、SLANeXt_wireless,分别支持有线表格与无线表格的结构预测。对应推理配置见 configs/table/SLANeXt_wired.yml 与 configs/table/SLANeXt_wireless.yml。
  • 表格分类系列 1 个:PP-LCNet_x1_0_table_cls,超轻量级有线/无线表格分类模型。
  • 表格单元格检测系列 2 个:RT-DETR-L_wired_table_cell_det、RT-DETR-L_wireless_table_cell_det。
  • 文本识别系列 1 个:PP-OCRv4_server_rec_doc,支持 1.5 万+ 字典。
  • 文本行方向分类系列 1 个:PP-LCNet_x0_25_textline_ori,存储仅 0.3M 的超轻量级模型。

4 条高价值组合方案

  • 文档图像预处理产线:通过超轻量级模型组合实现文档图像扭曲与方向矫正。
  • 版面解析 v2 产线:组合多个自研 OCR 类模型,优化复杂版面阅读顺序,实现多种复杂 PDF 端到端转换为 Markdown 与 JSON 文件。
  • 表格识别 v2 产线:组合表格分类、表格单元格检测、表格结构识别、文本检测、文本识别等模块,用户可自定义微调任意模块。
  • PP-ChatOCRv4-doc 产线:融合多模态大模型,优化 Prompt 与多模型组合后处理逻辑,准确率较 PP-ChatOCRv3-doc 高 15 个百分点;大模型支持本地部署,提供标准 OpenAI 调用接口,支持调用 DeepSeek-R1 等本地模型。

2024.10:低代码全流程开发能力

依托飞桨低代码开发工具 PaddleX,PaddleOCR 支持 OCR 领域的低代码全流程开发:

  • 将文本图像智能分析、通用 OCR、通用版面解析、通用表格识别、公式识别、印章文本识别涉及的 17 个模型整合为 6 条模型产线,通过极简 Python API 一键调用;同一套 API 还支持图像分类、目标检测、图像分割、时序预测等共计 200+ 模型,形成 20+ 单功能模块。
  • 提供统一命令与图形界面两种方式,支持高性能推理、服务化部署和端侧部署;可无缝切换英伟达 GPU、昆仑芯、昇腾、寒武纪、海光等主流硬件。

2.x 时代的关键里程碑

2.x 系列的演进记录了 PaddleOCR 从单一 OCR 工具走向全场景文档智能处理平台的历程:

  • 2024.7:收录 PaddleOCR 算法模型挑战赛冠军方案——场景文本识别 SVTRv2 与表格识别 SLANet-LCNetV2。
  • 2023.8.7:发布 release/2.7,推出 PP-OCRv4(mobile 与 server 两种模型),其中 PP-OCRv4-server 为当时精度最高的 OCR 模型。
  • 2022.11:新增 4 种前沿算法——文本检测 DRRG、文本识别 RFL、文本超分 Text Telescope、公式识别 CAN。
  • 2022.10:优化 JS 版 PP-OCRv3 模型,模型大小仅 4.3M,预测速度提升 8 倍。
  • 2022.8.24:发布 release/2.6,推出 PP-StructureV2,新增版面复原能力,支持一行命令完成 PDF 转 Word。
  • 2022.5.9:发布 v2.5,推出 PP-OCRv3,速度可比情况下中文场景效果比 PP-OCRv2 再提升 5%。
  • 2021.12.21:发布 v2.4,新增 PSENet、NRTR、SEED、SAR 等算法与 SDMGR、LayoutLM 系列文档结构化算法。
  • 2021.9.7:发布 v2.3 与 PP-OCRv2,CPU 推理速度相比 PP-OCR server 提升 220%。
  • 2021.8.3:发布 v2.2,新增 PP-Structure 工具包,支持版面分析与表格识别。
  • 2021.4.8:release 2.1,开源端到端识别算法 PGNet,多语言模型支持种类增加到 80+。
  • 2020 系列:开源超轻量中文 OCR 模型(8.6M)、支持 whl 包安装、添加数据增强与学习率衰减策略、开放 C++ 预测引擎推理、服务化部署与端侧部署方案等。

版本演进脉络小结

纵观更新记录,PaddleOCR 的演进呈现清晰的三阶段脉络:

  1. 2020–2021(2.0–2.4):以轻量化 OCR 模型为核心,逐步扩展多语种、文档结构化(PP-Structure)与训练部署工具链;
  2. 2022–2024(2.5–2.10):通过 PP-OCRv3/v4、PP-StructureV2 及 12 个自研单模型建立起覆盖版面、表格、公式、方向分类的全场景模型矩阵,并推出低代码 PaddleX 全流程;
  3. 2025(3.0–3.2):重构架构、统一推理接口,围绕 PP-OCRv5、PP-StructureV3、PP-ChatOCRv4 三条核心产线全面拥抱大模型与多模态能力,并在依赖管理、多语种扩展、C++/服务化部署、Benchmark 可观测性上持续打磨。

对于开发者而言,当前仓库根目录即对应最新的 3.x 主线代码;2.x 的历史算法与模型文档仍保留在 docs/version2.x 目录中,供研究参考。无论是需要升级存量 2.x 项目,还是评估 3.2.0 的新增能力,版本更新记录与 2.x 升级 3.x 说明 都是最直接的权威入口。

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询