两步译好整篇PDF:PDFMathTranslate快速指南
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
PDFMathTranslate(包名 pdf2zh)是一款开源 PDF 全文翻译工具:先把页面拆成正文、公式、图表等区域,只翻译文本区,再把译文写回原坐标,一次产出纯译文(-mono.pdf)和双语对照(-dual.pdf)两份文件,解决的是复制粘贴翻译弄乱公式与多栏排版的痛点。
先跑通:最短路径
- 准备 Python 3.11~3.12 环境后执行
pip install pdf2zh。执行后应看到安装成功提示,无依赖报错。 - 对任意文件执行
pdf2zh paper.pdf。首次运行会下载几十 MB 的版面检测模型(网络不佳可先设环境变量HF_ENDPOINT=https://hf-mirror.com),随后出现逐段翻译的进度条。 - 检查当前目录:应多出
paper-mono.pdf(纯译文)与paper-dual.pdf(双语对照)。两份文件都能正常打开,即说明流程跑通。
原理一句话 + 能力清单
它有效的关键是"先分区、后翻译、再回填":内置 DocLayout-YOLO ONNX 推理把每页切分成文本、公式、图片、表格、页眉页脚等区域,非文本区域原样保留,译文按原始坐标回填,因此多栏、跨页、公式编号都能留在原位。
| 能力 | 说明 |
|---|---|
| 排版保留 | 公式、图表、目录的位置与样式不变,支持多栏、跨页文档 |
| 双份输出 | 同一次翻译同时产出纯译文版与双语对照版 |
| 服务可换 | Google、Bing、DeepL、Ollama、OpenAI 等十余种,任意 OpenAI 兼容接口都能接 |
| 多入口 | 命令行、Web 界面、Docker 容器、MCP 服务、Python / HTTP API |
按你的习惯选入口
🖥️ 命令行派:怎么切语言、页码和服务
pdf2zh paper.pdf -li en -lo zh -p 1-3,5-li/-lo指定源/目标语言,-p指定页码范围,-s deepl换服务、-s openai:gpt-4o-mini直接点名模型;-t 8加线程提速,-f/-c用正则声明需原样保留的字体或字符(默认已保护数学、代码类字体)。
🖱️ 点选派:浏览器里传文件
pdf2zh -i打开http://localhost:7860/,上传 PDF、选服务与语言即可,完成后直接在页面预览并下载两份结果 PDF;更多界面选项见 docs/README_GUI.md。
开发者接入:Python 与 MCP
from pdf2zh import translate translate(files=['paper.pdf'], lang_in='en', lang_out='zh', service='google')想在脚本里嵌入翻译能力就用上面的 API;需要常驻 HTTP 服务就装pdf2zh[backend]后运行pdf2zh --flask;要接 AI 助手则用pdf2zh --mcp把翻译暴露给 MCP 客户端。
干重活:批量与进阶
pdf2zh --dir papers/:把目录下所有 PDF 逐一翻译,适合整批文献整理。pdf2zh paper.pdf --config config.json:预置语言、字体与多组服务密钥,命令行和环境变量仍可覆盖文件内容。pdf2zh paper.pdf --prompt prompt.txt:自定义大模型提示词,模板可用${lang_in}、${lang_out}、${text}注入术语要求。pdf2zh paper.pdf --ignore-cache:跳过缓存强制重翻;平时已翻过的文本段走缓存,不重复消耗 API 额度。pdf2zh paper.pdf --skip-subset-fonts:个别阅读器打不开时关闭字体子集化,用体积换兼容性。pdf2zh -i --share:生成对外可访问的临时链接;加--authorized users.txt按"用户名,密码"文件限制登录用户。- API 走自建中转时
BASE_URL必须带/v1后缀,完整示例见 docs/PROXY_CONFIGURATION.md。 --mode precise:实验性 v2 内核,需先运行pdf2zh-setup-precise搭独立环境,正式交付建议先用默认模式。
这些情况别硬上
- 扫描版 / 图片型 PDF 没有可提取的文本层,需先做 OCR 再处理。
- DeepL、OpenAI、Gemini 等付费服务要先在环境变量或配置文件里给 API Key,各服务的变量名对照见
docs/ADVANCED.md的表格;Google、Bing 免密钥。 - 本地运行要求 Python 3.11~3.12,不满足可改用 Docker 镜像或 Windows 免安装版。
- 译文质量取决于所选服务,对术语要求高时换大模型服务并配合
--prompt使用。
从pip install pdf2zh到pdf2zh paper.pdf就是完整的最快路径,几分钟即可拿到第一份双语论文。参数与服务变量名对照查 docs/ADVANCED.md,Python / HTTP / MCP 集成细节查 docs/APIS.md。
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考