Umi-OCR 批量 OCR 实战:把一个文件夹的截图变成可编辑文本
2026/8/31 9:16:10 网站建设 项目流程

Umi-OCR 批量 OCR 实战:把一个文件夹的截图变成可编辑文本

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款开源、免费、离线运行的 OCR 软件,所有识别都在本机完成,图片不需要上传到任何服务器。它的核心用法很直接:把几十张图片一次性导入批量 OCR 页面,选好识别参数,跑完后按你想要格式导出文字。下面以"处理一个文件夹的截图"为主线,把主流程走通,再按场景展开几个分支。

一条主流程:从图片文件夹到文本文件

打开 Umi-OCR 后切换到"批量 OCR"标签页(软件解压即用,无需安装,支持 Windows 7 x64 与 Linux x64)。在左侧列表区选择图片导入,支持jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff等常见格式,数量没有上限,一次导入几百张也可以。导入完成后点击"开始任务",右侧会显示每张图的识别进度。

任务跑完后,识别结果可以直接在页面里划选复制,也可以保存为文件。保存格式支持txtjsonlmdcsv(Excel)四种,想归档选 txt,想接着编辑排版选 md,想导入表格软件选 csv,jsonl 则保留了更结构化的输出,方便程序后续处理。

有两个参数值得留意。一是限制图像边长:如果你的素材里有像素很高的长图或大图,在页面设置中找到"文字识别 → 限制图像边长"调高数值,避免大图被裁切。二是任务完成后自动关机/待机,适合晚上挂一批大任务,跑完机器自己休息。

排版乱?先选对"文本后处理"方案

识别出的文字顺序不对、多栏内容混在一行,这类问题大多不是识别错了,而是后处理方案没选对。Umi-OCR 内置了一套"排版解析方案",用于整理 OCR 结果的阅读顺序,常见情况对照如下:

你的素材类型推荐方案效果
双栏论文、书刊页面多栏-按自然段换行自动区分栏位,按自然段合并换行
代码截图单栏-保留缩进保留行首缩进和行中空格
长段连续文字(网页、公告)多栏-无换行所有内容合并为一行输出
普通单栏文档单栏-按自然段换行最常见的通用选择
需要原始输出不做处理保留 OCR 引擎的原始分行

这套方案对横排和竖排(从右到左)排版都能自动处理,竖排识别还需要所装的 OCR 引擎本身支持。方案在右侧"设置"面板的"文本后处理"里切换,截图 OCR 页和批量 OCR 页通用。

忽略区域:把水印、页眉页脚挡在识别之外

批量素材里如果每张图都带固定位置的水印或 LOGO,识别结果里就会混进一堆废字。Umi-OCR 的"忽略区域"功能专门处理这种情况:在批量 OCR 页右栏设置中进入忽略区域编辑器,按住鼠标右键绘制矩形框,框住水印可能出现的所有位置。任务运行时,落在框内整个文本块的文字会被跳过,框外相邻的文字不受影响。

这个功能同样适用于文档识别页,配合页眉页脚这种每页固定位置的干扰文字特别顺手。画框时宁大勿小,但注意边界别包住正文。

没有现成图片文件?截图和粘贴图片都能识别

如果你手头的"图片"其实是屏幕上正在显示的内容,走"截图 OCR"标签页更省事。打开该页后按快捷键唤起截图,划选区域即可识别;左侧是图片预览,可以直接划选复制;右侧是识别记录栏,支持编辑文字、跨多条记录划选合并复制。

除了主动截图,还支持把别处复制的图片直接粘贴进来识别——比如浏览器里右键复制了一张商品图,切回 Umi-OCR 粘贴即可出文字,中间不需要保存文件。

PDF 和电子书:文档识别页

扫描件 PDF 想变成可复制、可搜索的文本,不必先手动转图片。"文档识别"标签页支持pdf, xps, epub, mobi, fb2, cbz格式,对扫描件做 OCR,或直接提取文档自带文本,并可输出双层可搜索 PDF(原图之上叠加隐形文字层)。同样支持设定忽略区域排除页眉页脚,任务完成后可自动关机。

界面、语言和渲染:全局设置里能改什么

第一次启动时,界面语言会跟随系统设置自动切换,软件内置简体中文、繁体中文、英语、日语等多种语言,想手动调整就去"全局设置"改。

这个页面还管几件实用的小事:一键添加快捷方式或设置开机自启、切换亮/暗主题、调整字体和字号、切换 OCR 引擎插件。另外如果你的机器出现截图闪烁或界面错位,可以到"界面和外观 → 渲染器"换一种渲染方案,或关掉硬件加速试试。

想让流程自动化?命令行和 HTTP 接口都已备好

如果你希望批量识别嵌进自己的脚本或工作流,Umi-OCR 提供了命令行调用,例如对指定路径(文件、文件夹均可)执行识别并写入结果文件:

umi-ocr --path "D:/img1.png" "D:/image/test" --output "result.txt"

注意命令行依赖程序内的 HTTP 服务(默认开启,选择"仅本地"即可)。更完整的参数、二维码识别/生成指令以及 HTTP 接口说明,可以分别看仓库里的 命令行手册 和 HTTP 接口手册,这里不展开。

主流程其实很短:导入图片 → 选对后处理方案 → 开始任务 → 导出结果。水印和页眉页脚交给忽略区域,屏幕内容走截图 OCR,PDF 走文档识别,再配合命令行和 HTTP 接口把整个流程接进自动化里。遇到识别效果或界面显示的问题,先查 README 与 更新日志,仍解决不了再到项目 Issue 区反馈。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询