从 PDF 旋转到双栏布局:Umi-OCR v2.1.5 版本更新解读
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
用截图OCR核对扫描版 PDF 时,旋转页文字顺序错乱、几万张图拖进批量页后界面卡住,是离线OCR用户常遇到的两类卡点。Umi-OCR v2.1.5 针对它们做了修正:修复 PDF 提取文本的旋转影响(#785)、优化批量页异步加载(#710),并新增日志机制与双栏布局切换。受益人是做批量识别、文档识别的普通用户,以及通过命令行调用离线OCR的开发者。
更新速览
| 改进项 | 用户收益 | 对应文档/模块 |
|---|---|---|
| 日志机制 | 默认存 ERROR 及以上日志,便于排查 | 全局设置标签页、UmiOCR-data/logs |
| 双栏布局切换 | 宽屏下原图与结果同屏 | 各标签页布局按钮(#789) |
| PDF 文本旋转修正 | 文字按正确顺序输出 | 文档识别(#785) |
| 单层 PDF 保留原文 | 双层 PDF 文本更完整 | 文档识别 |
| 二维码参数自动刷新 | 调参即时预览 | 二维码页(#690) |
| 异步加载优化 | 数万文件可流畅加载并显示进度 | 批量OCR/文档页(#710) |
| Linux 截图偏移修复 | 截图区域定位准确 | 截图OCR(#778) |
命令行--reload | 改配置无需重启 | 命令行手册 |
| 新增俄语、泰米尔语 | 更多语言可用 | 翻译步骤 |
PDF 旋转修正:文字顺序不再错乱
旧问题。早期版本提取 PDF 自带文本时,没有把页面旋转角度算进去,旋转排版的文档读出来的顺序容易乱;生成单层 PDF 时,原文已有的文本层也会被丢掉。
新版本怎么做。v2.1.5 在提取 PDF 文本时考虑了页面旋转影响(#785),并修复了生成单层 PDF 时未写入原 PDF 文本的问题。
怎么用、效果如何。把 PDF 拖进文档识别页,选择"提取原有文本"或生成双层 PDF 即可,输出顺序与文档阅读顺序一致。接口侧同样修正了/api/doc/download的ignore_blank参数,生成 TXT/CSV 时能正确过滤空白页。
一次拖进数万张图片也不卡
旧问题。往批量页拖入含大量子文件、尤其高分辨率图片的文件夹时,界面会卡顿甚至假死,且看不到加载到哪一步。
新版本怎么做。v2.1.5 优化了图片/文档的异步加载机制(#710),加载过程可预览进度。
怎么用、效果如何。把整目录拖进批量 OCR 或文档页即可,进度条会显示当前处理到第几个文件。官方说明批量识别没有数量上限,离线OCR批量任务可一次导入数百张乃至更多。
标签页双栏布局:宽屏下原图与结果同屏
旧问题。默认布局下,要看原图又看识别结果时,需要在面板间来回切换。
新版本怎么做。大部分标签页现在可手动切换左右/上下双栏模式(#789),截图OCR、批量、二维码页都适用。
怎么用、效果如何。在标签页右上角的布局按钮处切换,宽屏显示器上可让原图与记录并排查看。配合本次新增的 Esc 键隐藏主窗口(#652),截图、识别、复制的连贯操作更顺。
升级与上手
- 获取版本:v2.1.5 对应分支
main,可从本仓库 main 分支或对应备份分支获取,分支说明见 CHANGE_LOG.md。 - 解压即用,无需安装:Windows 双击
Umi-OCR.exe,Linux 用umi-ocr.sh启动。 - 命令行启动可查看实时日志,指定级别(默认 ERROR)以上的日志保存到
UmiOCR-data/logs,保存级别在全局设置标签页调整。 - 手动修改配置文件
UmiOCR-data/.settings后,执行以下指令即可重载,无需重启软件:
umi-ocr --reload- 需要接口调用或二次开发,参考 命令行手册 与 HTTP接口手册,示例见 api_doc_demo.py。
v2.1.5 通过一批围绕离线OCR的稳定与体验修正,让截图、批量、文档识别的日常使用更顺手。有相关使用场景不妨试试这个版本。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考