扫描PDF复制不出文字?我用 Umi-OCR 离线OCR 把500页书变成了可搜索文本
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
你是不是也遇见过这种情况:PDF 里的字看得清清楚楚,想复制一句话出来,鼠标圈了半天只得到一片空白;手机相册里躺着几百张拍书页的照片,想转成文字却不知从哪下手。如果你的答案是"是",这篇Umi-OCR使用记录值得读完。它是一款免费、开源的离线OCR软件:不联网、不注册,把截图识别、批量图片转文字、扫描PDF文字提取、二维码扫描生成全装进了一个程序。
先回答三个问题:这软件解决了我的哪些"懒"
动手之前,我先盘点了自己最痛的三件事:
- 扫描版PDF:没有文字层,只能一页页翻着看,想检索一个术语要眼扫全书;
- 手机照片:书页、课件、白板拍了几百张,张张是图,没法搜索也没法编辑;
- 屏幕截图:教程里的代码、文章里的段落,截图存了一堆,用时还得对着打。
这三件事的共同点,是把图变成字。而我找到的答案,就是这个叫Umi-OCR的离线OCR软件。
为什么我留下它:四个不吹不黑的理由
- 数据不出本机——OCR 引擎跑在本地,图片不用上传到任何服务器,对课件、书稿这类不方便外传的资料尤其重要;
- 免费且开源——没有试用期、没有水印、没有会员墙,长期维护,更新日志写得明明白白;
- 批量能力是真的——图片、PDF 都能成批排队处理,睡前挂机、醒来收成果;
- 上手不费劲——主界面就是几个标签页,每个功能摆在明面上,不用读文档也能猜个八九不离十。
先放一张全局设置界面,后面每个场景里都会反复用到它:
场景一:扫描版PDF的文字提取方法,从翻书到全文搜索 🔍
我手头最棘手的是一本 500 多页的扫描版技术书,出版社只给了图片版 PDF——文字层一个字符都没有。查一个术语,我得翻十几页;想摘一段引用,只能照着屏幕敲。
我的做法是打开"文档识别"标签页,把 PDF 拖进去,选择输出成双层可搜索PDF:底层保留扫描原图,顶层覆盖一层透明识别文字。这样既保留了书的原貌,又能像普通文档一样全文搜索、划词复制。
有几个值得记住的细节:
- 支持 pdf、xps、epub、mobi、fb2、cbz 等格式,不只是 PDF;
- 本身带文字层的文件可以直接提取原有文本,省一遍识别时间;
- 处理长文档时,先在设置里把页眉、页脚划进忽略区域,避免页码和书名混进正文。
那本书大约跑了一个多小时,睡一觉醒来,整个 PDF 都能检索了。后来写技术笔记,我直接搜索关键词定位段落,几秒钟就能找到出处。
场景二:三百张手机照片,批量转文字的最优解 ⏳
扫描书解决之后,第二个坑是手机里的照片。我攒了三百多张拍的书页和课件,一张张用截图识别显然不现实。于是我把它们全部拖进"批量OCR"标签页——这个页面支持 jpg、png、webp、bmp、tif 等常见格式,没有数量上限。
点"开始任务"后,右侧面板会实时显示每张图的耗时和置信度,跑完的结果可以整体导出为 txt、jsonl、md 或 csv(Excel)格式,方便后续整理。
这一页最实用的功能是忽略区域:我的照片里总有手机时间水印和页角阴影,每次识别都会混进"15:30""2026/08"这类噪声。进入忽略区域编辑器,按住右键在水印可能出现的位置画上矩形框,任务执行时这些区域内的文字会被整块跳过,识别结果干净一大截。
三百多张照片,让它在后台慢慢跑,我中途去干别的,回头来看结果已经全部就绪。
场景三:课件截图里的代码,怎么做到连缩进都不丢 ⚡
日常用得最多的其实是"截图OCR":按一下截图快捷键,框住屏幕上任意区域,松开鼠标右侧就吐出识别结果。我试过识别一段 Python 课件,代码里的缩进和空格都被原样保留下来,直接粘贴就能跑。
这里的关键在"文本后处理"里的排版解析方案:
- 识别代码截图,选
单栏-保留缩进,行首缩进和行中空格原样保留; - 读多栏论文页面,选
多栏-按自然段换行,左右栏按阅读顺序输出,不会交叉错乱; - 竖排文字(日文古籍、老报纸)也能自动处理。
右侧的记录栏支持划选多条一起复制,也可以把剪贴板里复制好的图片直接粘贴进来识别。一个下午的课件整理,被我压成了半小时。
踩坑与技巧:四条用学费换来的经验 🕳️
用了一段时间,踩过不少坑,整理成四条最值得分享的:
- 识别超长图报错:像素超大的长截图会提示图像过大。解决办法是进"批量OCR → 设置 → 文字识别 → 限制图像边长",把数值调高。
- 截屏闪烁、界面错位:某些电脑上会出现截屏闪烁或 UI 错位,去"全局设置 → 界面和外观 → 渲染器"换一种渲染方案,或直接关闭硬件加速,基本能解决。
- 忽略区域画太小没用:只有完全落在矩形框内部的整个文本块才会被忽略。水印位置飘忽不定的话,宁可把框画大一圈。
- 语言不对就白跑:识别英文资料时,记得先确认当前用的是支持英文的 OCR 引擎和语言库,否则中文模型会输出一堆乱码。
和在线OCR、商用软件相比,差在哪
用过在线 OCR 网站,也研究过商用识别软件,我的结论是各有所长:
- 在线OCR:方便,但要把资料传上别人的服务器。对涉及未公开内容的课件和书稿,这一步我迈不过去;
- 商用软件:识别质量确实好,但价格对个人用户不友好,且通常要联网激活;
- Umi-OCR:免费离线,隐私和成本两头都顾上,中文、英文、日文的识别精度都够日常使用。代价是需要自己下载引擎、稍作配置,好在配套文档齐全,支持 Windows 7+ 和 Linux。
多语言界面它也做得认真——简体中文、繁体中文、英文、日文随意切换,入口就在全局设置里,一次选择永久生效:
复盘:处理资料的方式,从"翻"变成了"搜"
用了一个多月,回头复盘,真正改变我的不是某个炫技功能,而是三点:
- 完全离线,课件、书稿不用经过任何第三方之手;
- 上手不费劲,核心功能都摆在标签页上,第一次用就能跑通完整流程;
- 批量处理省心,图片、PDF 都能成批跑,配合"完成后自动关机",把等待时间从白天挪到了夜里。
如果你想深入,命令行调用和 HTTP 接口的说明都在项目里:命令行手册见 docs/README_CLI.md,HTTP 接口文档见 docs/http/api_doc.md,功能演进记录在 CHANGE_LOG.md。开发者想看源码,可以直接git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。
如果你手头也压着扫描件、截图和旧 PDF,别急着逐字手打。去项目仓库的发行版页面下载一份,挑你最头疼的文档试一次——把图和字之间的那堵墙拆掉,也许只需要一个周末的下午。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考