公式图片不再手敲:用 LaTeX-OCR(pix2tex)快速把图片转成 LaTeX 代码的简单方法
【免费下载链接】LaTeX-OCRpix2tex: Using a ViT to convert images of equations into LaTeX code.项目地址: https://gitcode.com/GitHub_Trending/la/LaTeX-OCR
你在写论文,文献里的一个公式只有截图,不想逐字符手敲进 LaTeX——LaTeX-OCR(pix2tex)就是干这个的:给一张公式图片,它返回对应的 LaTeX 代码,免费、开源,贴进文档就能用。
🚀 5 分钟装好并跑通
装完依赖,你就能开始把公式图片转成 LaTeX 代码。先确认本机有 Python 3.7+ 和 PyTorch,然后执行:
pip install "pix2tex[gui]"[gui]标签会顺带装上图形界面所需的依赖。首次运行时会自动下载模型 checkpoint(约 200MB),所以第一次启动会慢一些,属于正常现象。更省心的备选:直接拉取官方 Docker 镜像跑 API 容器,一行命令即可,细节可查官方文档。
日常随手转:截图即得代码
写论文时最快的取公式方式是 GUI,一条命令启动:
latexocr窗口打开后框选或截图一张公式,识别结果会即时渲染出来,LaTeX 代码同时自动复制到剪贴板,你直接粘贴即可。如果模型对这张图不太确定,点 Retry 重跑一次,用 temperature 参数(0.0-1.0)控制结果的稳定性与多样性:低温度结果固定,高温度每次可能有变化。
⚡ 批量转图片与跑服务
手头有一批本地公式图片要转,用命令行最顺,一条命令输出一张图的结果:
pix2tex path/to/formula.png图片已经在剪贴板里时,不带文件参数即可直接读剪贴板。量再大一些,比如把整批 PDF 里的公式都转掉,可以安装[api]扩展并运行python -m pix2tex.api.run启动服务,它跑在 8502 端口,你的脚本发 HTTP 请求就能批量处理。
集成进自己的工具
如果你正在做一个需要公式 OCR 的工具,pix2tex 可以直接当现成组件用:在 Python 里从pix2tex.cli导入LatexOCR,用 PIL 打开图片后调用模型实例即可拿到 LaTeX 字符串,几行代码的事。官方文档里有完整示例可对照:docs/installation.md。
| 场景 | 方式 | 一句话说明 |
|---|---|---|
| 写论文随手抓公式 | GUI(latexocr) | 截图即渲染,结果自动进剪贴板 |
| 几本地图片 | 命令行(pix2tex) | 一条命令一张图,也支持读剪贴板 |
| 批量转换 | API(8502 端口) | 起一个服务,脚本发 HTTP 请求 |
| 构建自己的工具 | Python 库 | 导入 LatexOCR 直接调用 |
💡 常见坑与解法
- 症状:识别结果不对、符号缺失。先检查截图裁得是否太宽,只保留公式主体、排除复杂背景效果最好;模型偏好较小分辨率的输入,原图过大就先裁剪缩放,别把图放大到最大再截。仍然不理想就多按几次 Retry 取最好的那次。
- 症状:首次运行模型下载失败。多半是网络问题,检查连接;也可以手动把 checkpoint 下载到
~/.cache/pix2tex/目录,程序会自动读取。 - 症状:Linux 下 GUI 的截图功能不工作。通常是系统挑到的截图工具与你的桌面环境不匹配,设置环境变量
SCREENSHOT_TOOL切到grim(可配合slurp)或spectacle即可解决。
🔗 写在最后
这个项目底层是 ResNet backbone + ViT 编码器看图片、Transformer 解码器吐 LaTeX,识别前还有一个小网络预测最优输入分辨率,在标准数据集上拿到 0.88 的 BLEU 分数,精度够应付大多数学术场景。装好之后,从写论文抠公式到搭自己的工具,基本都能直接用起来。
- 官方文档:docs/installation.md
- 模型配置:pix2tex/model/settings/config.yaml
【免费下载链接】LaTeX-OCRpix2tex: Using a ViT to convert images of equations into LaTeX code.项目地址: https://gitcode.com/GitHub_Trending/la/LaTeX-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考