Umi-OCR完整上手指南:免费离线搞定截图识别、批量图片与PDF转文字
2026/8/18 16:33:35 网站建设 项目流程

Umi-OCR完整上手指南:免费离线搞定截图识别、批量图片与PDF转文字

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源、可完全离线的 OCR 识别软件,让你在断网状态下也能完成截图识别、批量图片识别、PDF 扫描件转文字以及二维码的扫描与生成。如果你正需要一款「免费离线OCR软件」,想把图片里的文字一键变成可编辑文本,又担心隐私与网络依赖,这份 Umi-OCR 上手指南就是为你准备的。

那些「看得见却复制不了」的文字

想想最近一次崩溃时刻:甲方发来一份扫描版合同,标题行写着「禁止复制」;老师把复习资料做成了长截图,你对着屏幕一个字一个字敲;群里甩来一张表格图片,想改一个数字却连内容都提取不出来……

文字一旦被"关"进图片里,复制粘贴这个基本功就彻底失效。交给在线工具吧,又得担心文件上传后的隐私问题,网络一波动还得排队等结果。而 Umi-OCR 的思路很直接:把识别引擎放进你的电脑里。所有图片在本地处理完毕,不联网、不注册、不排队,识别完成后文字立刻变成可复制的普通文本。

装好它只需要三步,全程不碰安装向导

Umi-OCR 采用绿色免安装设计,没有注册表、没有安装向导、没有一堆下一步按钮。你只需要做三件事:

  1. 拉取项目:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR
  2. 把压缩包Umi-OCR_Rapid_v2.1.5.7z解压到任意文件夹(想放移动硬盘随身带也行)
  3. Windows 双击Umi-OCR.exe启动,Linux 用户运行umi-ocr.sh

💡 如果你的电脑没装压缩软件,直接下载自解压版本(.7z.exe),双击后它会自己完成解压,连解压工具都省了。

第一次启动就能看到完整的图形界面,之后每次使用都不需要网络连接。把软件装进 U 盘,到任何一台电脑上都能开箱即用,这是很多在线服务给不了的自由度。

场景一:截到什么,就能复制什么

截图识别是 Umi-OCR 里使用频率最高的入口,适合处理课件、网页、聊天记录这类"看到即所得"的内容。整套流程只需要三步:

  1. 打开软件,进入「截图OCR」标签页
  2. 按下默认快捷键Ctrl+Alt+Z唤起截图框
  3. 用鼠标框选文字区域,松开后识别自动完成

识别完成后,你面对的不再是一张图,而是一段可以随意处置的文字:直接Ctrl+C复制走人;先改几个错字再保存;也可以按需导出为 TXT、JSONL、MD 等格式,甚至对识别结果做排版优化,把乱糟糟的多栏文本整理成通顺的段落。

🔁 想要快速重复上一次框选?快捷键Ctrl+Alt+X可以原样重放上一轮的截图区域,连续截同一个位置时能省下不少功夫。

场景二:上百张图片与整本 PDF 的「无人值守」处理

截图解决的是单张图片,那积压成山的旧照片、课件截图、扫描件怎么办?Umi-OCR 的批量任务功能,本质上是把"手动逐张识别"这件事交给了任务队列自动执行。

操作路径同样很轻:

  1. 切到「批量OCR」标签页
  2. 点「选择图片」或直接把文件拖进列表
  3. 可选:为每张图设置「忽略区域」,把水印、页眉、页码这类干扰内容排除在外
  4. 点「开始任务」,然后去干别的,识别结果按顺序沉淀在列表里

JPG、PNG、WebP、BMP、TIFF 等常见格式都能吃下,一次挂上几百张图也不成问题。每张图的识别文本、耗时、置信度都清清楚楚地列出来,方便事后核对。

扫描版 PDF 走的是同一条流水线:在批量页面点「选择文件」导入 PDF,软件会自动按页拆分识别。输出时你可以选纯文本,也可以选双层 PDF——保留原始扫描图作为底图,同时叠加一层可选中、可复制的文字,既保真又方便检索引用。

📌 对付带页眉页脚的文档,提前在「忽略区域」里圈掉这些固定元素,能明显减少识别结果里的噪音字符,比事后清理省心得多。

场景三:二维码既能扫,也能造

除了文字识别,Umi-OCR 里还藏着一套完整的二维码工具箱,日常用途比想象中更广:

  • :截图或粘贴任意含码的图片,立刻读出里面的二维码或条形码内容,扫码查快递单、读取设备序列号都很顺手
  • 生成:输入一段文本或链接,马上产出自定义二维码,用于分享资料、制作活动物料

工具内置 19 种编码格式,常见的 QRCode、DataMatrix、PDF417 等都在覆盖范围内。不打开手机、不装额外 App,桌面端就把"读码"和"造码"两件事全包了。

把工具调成你想要的样子

默认配置已经够用,但花两分钟做一次个性化设置,Umi-OCR 会更贴合你的工作习惯。

语言与外观。软件会跟随系统语言自动切换界面,也可以在「全局设置」里手动指定;主题支持浅色/深色等多种风格,夜间赶工时切个深色主题能舒服不少。

快捷键。上面提到的截图识别和重复截图快捷键,都可以在「全局设置→快捷键」中改成你顺手的组合。

输出格式。按使用场景设定结果文件的默认格式:普通记录用 TXT,做数据统计选 CSV(Excel 直接打开),写文档用 MD,程序对接则用 JSONL 这种便于逐行解析的格式。

识别语言。内置识别库覆盖中、英、日、韩等 50+ 种语言,界面本身也做了多语言本地化;遇到冷门语言,去设置里安装对应的语言包即可补齐。

识别不准?先做这三个动作,再看避坑清单

偶尔一次识别结果不理想,别急着怀疑软件。三个动作通常就能救回来:

  1. 源头要清晰:模糊、反光、旋转过的图片会直接拉低识别率,优先用高清截图或高分辨率扫描件
  2. 框选要精准:把识别区域紧紧框住文字,避开背景纹理和无关元素
  3. 后处理要选对:在设置里选择合适的排版解析方案,比如多栏文档用「多栏-按自然段换行」,段落结构会工整很多

如果问题不是出在识别质量上,再对照这份排查清单:

现象排查方向
识别速度慢在「全局设置→OCR插件」切换引擎,换个引擎可能又快又准
界面显示异常在「全局设置→渲染器」切换渲染方案,兼容性问题多由此解决
竖排文字无法识别确认已装对应语言包,并在设置中启用竖排识别选项

更进一步的玩法:命令行、HTTP 接口与插件

如果你不满足于点按钮,Umi-OCR 还给开发者留好了三扇门:

  • 命令行调用:脚本里直接批量处理图片,自动化流程的入口文档见 docs/README_CLI.md
  • HTTP 接口:把识别能力封装成服务,供自己的应用远程调用,接口说明在 docs/http/README.md
  • 插件扩展:想加功能、换引擎,都可以在UmiOCR-data/plugins目录下动手,项目结构本身就为扩展留出了空间

🧩 如果你只是普通用户,这三扇门可以暂时忽略;但当你哪天想把"识别图片里的文字"接进自己的脚本或小工具时,它们就是现成的捷径。

下一步,从一张截图开始

Umi-OCR 的核心逻辑其实只有一句话:把困在图片里的文字解放出来,而且免费、离线、本地完成。无论是学生整理课件笔记、办公族处理扫描合同,还是开发者做自动化集成,它都提供了一条足够顺滑的路径。

现在就拉取项目、解压、启动,然后随手截一张图试试——当那行文字出现在可编辑文本框里的瞬间,你会感受到"复制自由"的快乐。想持续跟进新功能与改进细节,可以定期翻翻项目里的 CHANGE_LOG.md,说不定下一版就多了一个你正需要的能力。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询