免费离线文字识别神器Umi-OCR:从安装到自动化,一篇玩明白
2026/8/14 5:56:07 网站建设 项目流程

免费离线文字识别神器Umi-OCR:从安装到自动化,一篇玩明白

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款开源、完全免费的离线文字识别软件,无需联网即可完成截图识别、批量图片转文字、PDF 文档提取与二维码扫码,是"图片转文字工具"里少见的全能选手。它解压即用、内置多国语言识别库,特别适合注重隐私又想省钱的普通用户,一篇文章带你从零上手到进阶自动化。

你有没有经历过这样的时刻:网页上的文字明明在眼前,却怎么都复制不出来,只能对着屏幕一个字一个字手敲?几百张扫描件堆在桌上,光是整理文字就能耗掉一下午?图片里的代码段想抄下来,复制过来却缩进全乱、格式全丢?Umi-OCR 就是为了解决这类"看得见却拿不走"的文字而生,而且它完全离线运行,你的图片不会上传到任何服务器。

第一步:下载解压,3 分钟完成第一次识别

Umi-OCR 的安装可能是你见过的软件里最简单的——因为它根本不需要安装。

  1. 从项目发布页下载最新版的压缩包(.7z格式,也有免装压缩软件的.exe自解压版)。
  2. 把压缩包解压到一个纯英文路径下,比如D:\Umi-OCR
  3. 双击文件夹里的Umi-OCR.exe,程序即刻启动。
  4. 进入"截图OCR"标签页,按下你设置好的截图快捷键,用鼠标框选屏幕上的任意文字区域。
  5. 识别结果会出现在右侧的记录栏里,选中直接复制即可。

💡 提示:软件完全免安装,不写注册表,想"卸载"时直接删掉整个文件夹就行。第一次启动时,它还会根据你电脑的系统语言自动切换界面语言。

这一套流程走下来通常不超过 3 分钟,你已经完成了人生第一次离线 OCR。接下来,我们看看如何让识别结果真正"好用"。

第二步:让识别结果"能读"——排版解析与代码识别

很多 OCR 工具能认出文字,但输出的顺序和换行一团糟:多栏排版的文章被读成"左一句右一句",代码缩进全被抹平。Umi-OCR 在截图识别页内置了**文本后处理(排版解析)**功能,专门解决这个问题。

截图识别页面,左侧是原图,右侧是识别结果,支持划选复制

打开"文本后处理"下拉框,你可以选择不同的排版解析方案:

  • 多栏-按自然段换行:适合大部分场景,自动识别多栏布局,按自然段换行。
  • 多栏-总是换行 / 无换行:每句都换行,或强制合并成一行。
  • 单栏-保留缩进:保留行首缩进和行中空格,专为代码截图设计。
  • 不做处理:返回 OCR 引擎的原始输出。

对程序员来说,"单栏-保留缩进"简直是大救星。遇到没法复制的代码截图,框选识别后直接得到带缩进的原始代码,中文注释和特殊符号也能保留下来。

左侧是原始代码截图,右侧是识别结果,缩进与结构完整还原

实用技巧:截图页还支持直接把剪贴板里的图片粘贴进来识别(Ctrl+V 即可);识别记录可以多选合并复制;如果觉得识别结果需要微调,右侧记录栏支持直接编辑文字。另外,公式识别功能也已经排上开发日程,数学公式截图同样可以期待。

第三步:批量 OCR,几百张图片一次搞定

如果说截图 OCR 是"单兵作战",那批量 OCR 就是"集团军作战"。在"批量OCR"标签页里,你可以一次性拖入几百张图片,软件会自动排队识别,还能实时显示每张图的耗时和置信度。

批量识别页面,支持多图队列、进度跟踪与结果预览

支持的输入格式有jpg、png、webp、bmp、tif等常见图片类型;识别结果的导出则非常灵活,支持txt、jsonl、md、csv(Excel)四种格式,既能拿到纯文本,也能拿到带坐标的结构化数据,方便做二次处理。

这里有两个功能特别值得一说:

  • 忽略区域:如果你的图片角落常年挂着水印或 LOGO,可以在右侧设置里进入忽略区域编辑器,用鼠标框出几个矩形,任务中这些区域内的文字会被自动跳过,识别结果干净不少。处理页眉页脚时同样好用。
  • 任务完成自动关机/待机:晚上挂机跑几百张图,跑完自动休眠,第二天直接收结果。

💡 提示:如果遇到像素超大的长图、大图识别异常,可以在"页面的设置 → 文字识别 → 限制图像边长"里调高数值。

第四步:把 PDF 变成可搜索文本,顺手扫个二维码

批量页解决图片,文档识别页则专攻电子书和扫描件。Umi-OCR 的文档识别支持pdf、xps、epub、mobi、fb2、cbz等格式,可以从扫描件中提取文字,更厉害的是能输出双层可搜索 PDF——即你看到的是原版扫描影像,但可以像普通文档一样选中、搜索、复制里面的文字。文献党的福音,谁用谁知道。

二维码功能同样集成在标签页里,且一页两用:

  • 扫码:截图、粘贴或拖入图片,即可读取其中的二维码、条形码,支持一图多码,兼容 19 种协议(QRCode、Code128、PDF417、DataMatrix 等)。
  • 生成码:输入任意文本,一键生成二维码图片,还能调整纠错等级和尺寸,做资料分享、信息交换都很顺手。

第五步:接入自动化工作流——命令行与 HTTP 接口

如果你嫌点鼠标太慢,Umi-OCR 还提供了完整的外部调用能力:命令行和 HTTP 接口。这让它从一个图形软件,变成了可以被脚本、被其他程序调用的 OCR 引擎。

命令行的入口就是主程序本身,常见的玩法有:

# 截屏识别,结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片或整个文件夹 umi-ocr --path "D:/图片目录" # 识别剪贴板里的图片 umi-ocr --clipboard # 识别二维码 / 生成二维码 umi-ocr --qrcode_read "D:/code.png" umi-ocr --qrcode_create "你好" "D:/out.png"

配合 Windows 的任务计划程序或第三方热键工具,你甚至可以做到"按一个键就自动截屏识别"。

HTTP 接口默认监听本地 1224 端口(仅本地回环,不经过物理网卡,数据不出本机),提供图片 OCR、PDF 识别、二维码等 REST 接口,返回 JSON 格式结果。你可以在自己的小程序、Python 脚本里直接 POST 图片过去拿文字,详细的参数说明见HTTP接口手册,命令行完整用法见命令行手册。

避坑清单:这些小事能帮你少走弯路

  • 务必用英文路径安装:中文路径可能引发个别引擎组件异常,这是老玩家总结出来的第一条经验。
  • 界面闪烁或错位?在"全局设置 → 界面和外观 → 渲染器"里切换渲染方案,或直接关闭硬件加速。
  • 批量任务别贪多:虽然支持数百张图片排队,但建议分批处理,方便中途检查识别质量。
  • 关闭软件前记得断开 HTTP 连接:如果有程序还挂着 HTTP 连接,可能导致软件关闭不彻底,等待连接断开或进任务管理器结束进程即可。
  • 命令行不弹窗:如果不想让命令行任务弹出主窗口,记得在"截图OCR"页关闭相关选项。
  • 语言不满意?在"全局设置 → 语言"里手动切换,中、英、日、韩、俄等界面语言随你选,识别语言库同样内置了多国模型。

总结:从"看得见"到"拿得走"

回看整条体验路径:从第一次截图识别的新奇,到排版解析让结果可读,再到批量处理解放双手,最后通过命令行与 HTTP 接口把 OCR 能力嵌入自己的工作流——Umi-OCR 的每一层能力都踩在"让文字真正属于你"这个点上。它免费、开源、离线运行,功能还在持续迭代(完整的更新历史见更新日志)。

如果你也有过对着图片文字干瞪眼的时刻,现在就去下载体验吧。下一次遇到"复制不了"的网页、堆积如山的扫描件,你会庆幸自己手里有了这把顺手的工具。🚀

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询