Umi-OCR|三步把扫描 PDF 变成可搜索文档的免费离线 OCR
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
读扫描版论文想抄一句话,文字选不中、Ctrl+F 也搜不到。Umi-OCR 是一款免费、全程离线的 OCR 文字识别工具:把截图、批量图片、扫描 PDF 直接变成可复制、可搜索的文字,识别过程全部在本地完成。
这是什么工具:解压即用的免费离线 OCR
- 是什么:开源免费的 OCR 软件,全程不联网、不上传文档,不为识别次数付费
- 怎么跑:Windows 7 x64 及以上用
Umi-OCR.exe,Linux x64 用umi-ocr.sh,解压后双击即用,无需安装 - 内置语言库:简中、繁中、英文、日文等多国语言;引擎自带 Rapid-OCR(兼容性好)与 Paddle-OCR(速度稍快)两种可选
- 支持输入:jpg、png、webp、tif 等图片,以及 pdf、xps、epub、mobi、fb2、cbz 文档
从启动到第一次出识别结果:5 步
- 从项目发行版页面下载
.7z压缩包并解压;需要源码则git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR - 双击
Umi-OCR.exe启动(Linux 用umi-ocr.sh),首次运行界面语言按系统自动切换 - 打开"截图OCR"标签页,按快捷键框选屏幕区域
- 等识别完成:文字自动进剪贴板,右侧识别记录可编辑、可划选
- 需要落盘的文件,走"批量OCR"或"文档识别"标签页,导出 txt、csv 或双层 PDF
能力拆解:四个标签页各管一类取字任务
截图 OCR:从屏幕任意位置取字
网页、PPT、课件里禁止复制的文字,截一张图就能拿走。
操作路径:"截图OCR"标签页 → 按快捷键截屏(Esc 取消)→ 左侧预览划选原文复制,右侧识别记录里编辑文字。
- 在别处复制了图片,直接粘贴进 Umi-OCR 即可识别
- 代码截图把"文本后处理"设为"单栏-保留缩进",行首空格和缩进都会保留
- 多次截图的结果会累加进识别记录,最后一次性划选复制
批量 OCR:几百张图片排队识别
一文件夹扫描件、截图要批量转文字,交给任务队列跑就行。
操作路径:"批量OCR"标签页 → 拖入图片(jpg、png、webp、tif 等)→ 点"开始任务" → 完成后把结果导出为 txt、jsonl、md 或 csv(Excel)。
- 图片有固定位置水印时,在右侧设置栏进入"忽略区域"编辑器,按住右键画矩形框,框内文字不会出现在结果里
- 要进 Excel 汇总的,选 csv 导出格式,Excel 直接打开
- 长任务可开启"任务完成后自动关机/待机",睡前挂着跑完
文档识别:把扫描 PDF 变成可搜索文档
扫描版 PDF 搜不到也复制不了,重新录入要几个小时,这个标签页直接输出双层可搜索 PDF。
操作路径:"文档识别"标签页 → 导入 PDF(也支持 xps、epub、mobi、fb2、cbz)→ 识别完成后导出。输出的双层 PDF 原扫描外观保留,上面叠一层透明文字,支持全文检索、Ctrl+F 定位和直接复制。
- 用"忽略区域"排除页眉页脚文字,框尽量包住可能出现的全部位置
- 可设任务完成后自动关机/休眠
- 原 PDF 自带文本层时可直接提取,不走识别
二维码标签页:识别与生成都在一处
图里的二维码、条形码不方便用手机扫,直接读出来;反过来,输入文本也能生成码图片。
操作路径:"二维码"标签页 → 拖入图片、粘贴或截图读取内容;生成侧输入文本,设纠错等级和尺寸后导出图片。
- 支持一图多码,覆盖 QRCode、EAN13、PDF417 等 19 种编码协议
- 也可用命令行调用:
umi-ocr --qrcode_read "D:/xxx.png",参数见命令行手册
端到端工作流:三条从扫描件到可检索的完整路径
一学期扫描件变成可检索文献库。把百页扫描 PDF 导入"文档识别",识别语言设为中文,忽略区域框掉页码和页眉,开始任务。完成后导出双层可搜索 PDF,之后在 PDF 阅读器里直接 Ctrl+F 定位"图 3"或参考文献里的一句话。
200 张发票截图汇总进 Excel。发票截图全部拖入"批量OCR"标签页,文本后处理选"单栏"系列,导出格式选 csv,开始任务。跑完用 Excel 打开 csv,金额、日期两列一求和,不用手工录入。
把识别挂进自己的脚本。开发者两条路:让 Umi-OCR 常驻,脚本走HTTP接口调用;或命令行umi-ocr --path识别整个文件夹的图片,--output写文件、--clip进剪贴板,参数详见命令行手册。
设置与调优速查:影响识别效果的几个选项
- 文本后处理:截图/批量OCR标签页 → 多栏版面选"多栏-按自然段换行",段落顺序自动理顺;竖排版面同一预设也能处理
- 忽略区域:批量识别页右侧设置栏 → 编辑器 → 右键画框,框得越完整,水印和页眉页脚去得越干净
- 限制图像边长:批量识别页 → 设置 → 文字识别 → 调高数值,避免大图、长图被压缩导致识别不全
- OCR 引擎:全局设置 → 切换插件,Rapid-OCR 求兼容,Paddle-OCR 求稍快的速度
- 识别语言:文字识别设置 → 指定文档主要语言,多语言资料按主语言切换后再识别
- 界面语言/主题:全局设置 → 语言、主题,首次运行自动匹配系统,可随时手改
高频问题:5 个常见情况
问:多栏版面的识别顺序是乱的。答:引擎按文本块位置输出,文本后处理里选"多栏"系列预设会把顺序理顺。
问:结果里总有水印文字。答:忽略区域没框到,批量 OCR 的忽略区域编辑器里把矩形框画大,包住水印可能出现的全部位置。
问:长图、大图只识别出一部分。答:默认"限制图像边长"会压缩大图,识别前把数值调高即可。
问:截图闪烁、界面错位。答:显卡加速渲染不兼容,全局设置 → 界面和外观 → 渲染器,换渲染方案或关掉硬件加速。
问:不联网能用吗。答:全程本地离线识别,语言库随发行版内置,不需要下载模型或联网。
Umi-OCR 是一款解压即用的免费离线 OCR 工具:截图取字、批量图片文字提取、三步把扫描 PDF 变成可搜索文档。去项目发行版页面下载一份,把积压的扫描件跑完一批;遇到 bug 或功能建议,直接到项目里提 Issue。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考