RapidOCR如何十分钟装好并跑通OCR识别:新手完整指南
【免费下载链接】RapidOCR📄 Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR
RapidOCR 是一款开源的 OCR 识别工具包,能把图片里的文字变成可复制、可检索的文本。装好之后,你传给它一张文档照片或截图,它就能输出识别出的文字内容和每段文字的位置框。它完全在本地离线运行,不依赖任何云端接口。跟着下面的步骤走,纯新手也能在十分钟以内看到第一张识别结果。
一分钟认识RapidOCR
把 OCR 理解成"让电脑替你读照片里的字",RapidOCR 就是装在你电脑上的这套"眼睛"。它做三件事:先在整张图里找出文字位置,再判断文字方向,最后逐字识别,最后给你文字加坐标框。它解决的核心问题是部署麻烦——PaddleOCR 的原版模型绑定特定框架、体积大,RapidOCR 把这些模型转成了跨平台格式,你在 Windows、macOS、Linux 上用一条 pip 命令就能离线跑起来,不需要联网、不需要调云端 API。
3步完成安装
准备环境:确认Python版本
RapidOCR 要求 Python 3.8 及以上版本,先确认一下你手头的版本。
python --version看到 3.8~3.13 之间的版本号就没问题,低于 3.8 的话先升级 Python 再继续。
一行命令装好rapidocr和推理引擎
核心安装就一条命令,包含两部分:rapidocr是工具包本身,onnxruntime是默认推理引擎。
pip install rapidocr onnxruntime装完后你的命令行里会多出一个rapidocr命令。如果你的机器是 NVIDIA 显卡想用 GPU,或者偏好 Intel 平台的 OpenVINO,只需把第二个包名换成对应的后端即可,主包不用动。
从源码安装:想改代码时用
需要二次开发或跑测试的话,克隆源码装成可编辑模式。
git clone https://gitcode.com/GitHub_Trending/ra/RapidOCR cd RapidOCR pip install -e ./python装完执行rapidocr --version能打印版本号,说明源码安装生效。注意源码方式同样依赖onnxruntime,没有就补装。
验证成功与看到第一个结果
新建一个脚本,放入仓库里自带的测试图片路径,跑一下即可。
from rapidocr import RapidOCR engine = RapidOCR() result = engine("python/tests/test_files/issue_170.png") print(result.txts) result.vis("vis_result.jpg")出现什么算成功:控制台打印出包含TEST的文字列表,同时当前目录生成vis_result.jpg,原图上画着绿色的文字检测框。✅ 第一次运行时它会自动下载默认模型,看到下载进度条属正常现象。
最常见的失败是ModuleNotFoundError: No module named 'onnxruntime'——只装了主包没装推理引擎,补一句pip install onnxruntime再跑就行。
常见坑速查
- 现象:
pip install报依赖冲突 →原因:机器里已有别的包占用了不兼容的 numpy 版本 →解法:新建虚拟环境(python -m venv venv)后再装,干净环境最省心。 - 现象:跑起来却打印不出任何文字 →原因:图片里没有清晰文本,或路径写错指向了一张空图 →解法:换一张文字清晰、对比度高的图片,并先
print确认路径存在。 - 现象:首次运行卡住或下载模型失败 →原因:默认模型要在线拉取,网络受限 →解法:手动下载模型后在配置里把
model_root_dir指向本地目录,python/rapidocr/config.yaml 里有完整可调参数。 - 现象:想用 Docker 隔离环境但镜像构建报错 →原因:官方已为每种后端预置了 Dockerfile →解法:直接照 docker/README.md 里对应后端的示例构建,别自己手写镜像。
想深入调参或体验其他推理后端,仓库里的 python/README.md 和官方文档是好去处——跑通第一张图只是起点,把text_score阈值和词级框返回玩明白,你会发现它的输出比想象中更灵活。
【免费下载链接】RapidOCR📄 Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考