Umi-OCR离线OCR完整指南:截图、批量图片与PDF文档识别一次到位
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
一句话定位:免费离线OCR软件到底能做什么
Umi-OCR 是一款免费、开源、完全离线的 OCR 文字识别软件:截屏识别、批量图片识别、PDF 文档识别、二维码扫描与生成一应俱全,解压即用、无需注册联网。一句话概括它的价值:它把文字识别引擎整个搬进你的电脑,让截图、图片和扫描件里的文字全部在本地完成提取——不吹不黑,这是目前把"离线"和"好用"平衡得相当好的方案之一。
要不要用:离线OCR与在线工具、商业软件的一张对比表
先别急着下载,用一张表看清它和主流替代方案的差异,再决定值不值得投入时间:
| 对比维度 | Umi-OCR | 在线OCR网站 | 商业OCR套装 |
|---|---|---|---|
| 联网与隐私 | 完全本地,图片不出电脑 | 图片需上传服务器 | 多数需联网授权 |
| 价格 | 免费、开源 | 免费额度有限或按次收费 | 授权费不便宜 |
| 批量能力 | 无数量上限,支持暂停与自动关机 | 大多限量 | 视版本而定 |
| PDF处理 | 扫描件可转双层可搜索PDF | 少见或需付费 | 通常专业版才有 |
| 上手成本 | 解压即用、免安装 | 打开网页即可 | 安装+激活 |
| 平台 | Windows 7 x64 / Linux x64 | 任意有浏览器的设备 | 视产品而定 |
| 扩展性 | 命令行、HTTP接口、插件切换引擎 | 基本没有 | 有API但多另收费 |
💡 提示:判断标准很简单——如果你的图片不想离开硬盘,或者你有一批扫描件要归档,Umi-OCR 就是那个"成本最低、隐私最稳"的选项。
谁适合、谁不需要:先划清边界再投入时间
适合你,如果:你是 Windows 或 Linux 用户,日常要处理截图、扫描件、带水印的图片;你需要把扫描版 PDF 变成可搜索的归档文件;你对数据隐私敏感,合同、论文、票据不想上传到别人的服务器;或者你想让"批量挂机识别几百张图"这种需求自动化。
不需要你,如果:你用 Mac(目前只支持 Windows 与 Linux);你只是偶尔识别一两张图、也不介意上传,那打开网页可能更快;你需要把表格图片直接转成 Excel(表格识别还在远期计划中);或者你期待"图片翻译"这类能力——Umi-OCR 只做文字识别,翻译同样在计划列表里躺着。
五分钟拿到第一个结果:从下载解压到首次截图识别
目标很朴素:在五分钟内让软件帮你识别出第一段文字。
- 下载:取本仓库的发布包 Umi-OCR_Rapid_v2.1.5.7z(自带 Rapid-OCR 引擎,兼容性好;电脑没装解压软件就选
.7z.exe自解压包)。 - 解压:解压到不含中文和空格的目录,例如
D:/Tools/Umi-OCR。为什么:这是绿色软件无需安装,但路径里的中文/空格偶尔会引发莫名其妙的兼容问题,一步规避最省心。 - 启动:双击
Umi-OCR.exe(Linux 下运行umi-ocr.sh)。首次启动会自动匹配你的系统语言,界面由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置,用哪个点哪个,还可以锁住常用标签防误关。 - 识别:切到"截图OCR"标签页,按快捷键唤起截图框,划出目标区域。松开鼠标,结果几秒内出现在右侧记录栏。
还有一个更快的方式:在聊天窗口里复制任意一张图片,回到 Umi-OCR 直接粘贴,它照样识别。到这一步,你的第一个正反馈就拿到了——"看到文字→复制文字"从此是一条肌肉记忆。
进阶玩法按能力档位分层:从入门到折腾
入门档:把"看到文字就复制"练成肌肉记忆
- 排版方案默认选"多栏-按自然段换行":OCR 引擎吐出的文字是"散装"的,这套方案会自动识别多栏布局、按自然段断行,覆盖大多数阅读场景。什么时候才需要换?遇到两栏/三栏论文、代码截图这类特殊排版时再切换对比。
- 结果栏可以直接当草稿纸:识别记录支持原地改错、划选多条一起复制,识别完顺手整理成你要的格式,不用再经过记事本中转。
- 竖排文字不用管:排版解析会自动处理横排与竖排(从右到左)的文本顺序,前提是你的 OCR 引擎本身支持竖排。
💡 提示:如果你经常处理代码截图,切到"单栏-保留缩进",行首缩进和行中空格会被保留下来,输出基本能保持代码结构。
熟练档:批量图片与扫描PDF的提速方法
- 忽略区域,让水印和页眉页脚自动"隐身":在批量识别页右侧设置里进入忽略区域编辑器,按住右键画矩形框,把水印、LOGO、页眉页脚可能出现的位置都框住,识别时这些区域内的文字会被自动排除。记住关键机制:只有完全处于矩形框内部的整个文本块才会被忽略,所以宁可框大一点,别漏。
- 文档识别,把扫描版PDF变成可搜索文件:支持
pdf、xps、epub、mobi、fb2、cbz六种格式。Umi 会优先提取 PDF 自带的文本层(速度快、零识别误差),遇到纯扫描页才自动切到 OCR;你也可以主动选"整页强制OCR"。最实用的输出是双层可搜索PDF——外观跟原扫描件一模一样,但文字可以搜索、复制、划线;v2.1.2 起还能输出单层纯文本 PDF,体积更小、更好编辑。 - 挂机任务一条龙:批量图片和文档任务都支持完成后自动关机/待机;v2.1.2 起支持暂停任务,只要软件不退出,待机休眠后回来继续跑。
💡 提示:文档识别里的忽略区域可以按页码范围设置,适合统一排除整本扫描件的页眉页脚——框一次,全册生效。
折腾档:命令行、HTTP接口与引擎插件的自定义空间
如果你想把它嵌入自己的工作流,图形界面只是冰山一角:
umi-ocr --screenshot --clip umi-ocr --path "D:/扫描件.png" --output result.txt umi-ocr --qrcode_create "你好,Umi-OCR" "D:/qrcode.png" 256三条命令分别对应:截屏识别并直接进剪贴板、识别指定图片输出到文件、生成二维码。所有指令支持前几个字母简写(--sc等价于--screenshot)。注意一个前提:命令行依赖本地 HTTP 服务做进程间通信,请确认全局设置里 HTTP 服务是开启的(默认开启,只监听本地环回、不经过物理网卡,数据不会外泄)。
- HTTP 接口:默认端口 1224,提供图片 OCR、文档识别、二维码识别/生成等接口,几十行代码就能封装一个"上传图片→返回 JSON"的本地小服务。
- 引擎与界面语言随意换:全局设置里可以切换 OCR 插件——默认内置 Rapid-OCR(兼容性好)和 PaddleOCR(速度稍快);界面语言支持简中、繁中、英、日、葡、俄、泰米尔语。界面语言和识别语言是两码事:界面用中文,照样可以识别日文书籍。
性能与资源实测:体积、内存、速度与兼容性取舍
从一个"真会用"的人的角度,给你四条实测经验:
- 体积与安装:整个程序(界面+OCR引擎)打包在单个压缩包里,解压即用、免安装,拷到另一台电脑目录就能带走。想要干净环境就删目录,不留注册表垃圾。
- 内存:如果用的是 PaddleOCR 插件,v2.1.4 起默认内存占用被限制在系统总内存的一半以内;任务停止约 30 秒后会自动释放一次内存。还想更省,去插件配置里调低线程数即可。
- 速度与长图:单张截图识别通常几秒内出结果,批量几百张图挂机跑即可。遇到像素超大的长图识别不全,正确做法是去"文字识别"设置里调高"限制图像边长",而不是盲目放大原图——过度放大增加噪声,反而降低准确率。
- 兼容性:Windows 7 x64 起,Linux 需要 glibc 2.31 以上(覆盖 Debian-11、Ubuntu-20),也支持 Docker 部署。如果你的机器出现截屏闪烁、界面错位,八成是显卡渲染兼容问题,去 全局设置→界面和外观→渲染器 切换方案或直接关闭硬件加速,通常能解决。
💡 提示:追求稳定选 Rapid 版,追求速度换 Paddle 版;内存紧张就少开标签页,用多少开多少,程序会自己省。
社区与生态:官方文档、插件目录与版本演进
Umi-OCR 是一个长期维护的开源项目,配套资源都在仓库里,按需取用:
- 命令行手册:docs/README_CLI.md(含截屏、路径、二维码、高级指令的完整用法)
- HTTP 接口文档:docs/http/README.md 与 docs/http/api_doc.md
- 更新日志:CHANGE_LOG.md(每个版本的改动一目了然)
- 插件目录:
UmiOCR-data/plugins/(程序运行时存放 OCR 引擎插件的位置,切换引擎在此发生) - 多语言翻译:
dev-tools/i18n/(社区译者协作维护,Weblate 在线协作)
版本演进只需要记住五个节点:v2.1.0上线文档识别;v2.1.2新增单层纯文本 PDF 输出与任务暂停;v2.1.3登陆 Linux 并支持 Docker 部署;v2.1.4将 PaddleOCR 默认内存限制为系统内存一半;v2.1.5加入日志机制、双栏布局、超大文件夹异步加载,并修复了 PDF 页面旋转导致的文本错位——如果你手头有旋转过方向的扫描件,务必用最新版。
收尾:三句话行动建议
适合谁:Windows/Linux 上经常与截图、扫描件、PDF 打交道的你。怎么开始:下载解压即用,先跑通一张截图识别拿正反馈,再按档位逐步解锁批量与文档识别。遇到问题先看哪:先翻 CHANGE_LOG.md 和 docs 目录,再试"渲染器→忽略区域→限制图像边长"这三个旋钮,九成麻烦都能解决。
下一步动作很具体:现在就去下载 Umi-OCR_Rapid_v2.1.5.7z,解压、启动、按一下截图快捷键。从这一刻起,扫描版 PDF 和带水印的图片都不再需要在线工具和手动抄录了。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考