两步译好整篇PDF:PDFMathTranslate快速指南
2026/9/8 21:39:40 网站建设 项目流程

两步译好整篇PDF:PDFMathTranslate快速指南

【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate

PDFMathTranslate(包名 pdf2zh)是一款开源 PDF 全文翻译工具:先把页面拆成正文、公式、图表等区域,只翻译文本区,再把译文写回原坐标,一次产出纯译文(-mono.pdf)和双语对照(-dual.pdf)两份文件,解决的是复制粘贴翻译弄乱公式与多栏排版的痛点。

先跑通:最短路径

  1. 准备 Python 3.11~3.12 环境后执行pip install pdf2zh。执行后应看到安装成功提示,无依赖报错。
  2. 对任意文件执行pdf2zh paper.pdf。首次运行会下载几十 MB 的版面检测模型(网络不佳可先设环境变量HF_ENDPOINT=https://hf-mirror.com),随后出现逐段翻译的进度条。
  3. 检查当前目录:应多出paper-mono.pdf(纯译文)与paper-dual.pdf(双语对照)。两份文件都能正常打开,即说明流程跑通。

原理一句话 + 能力清单

它有效的关键是"先分区、后翻译、再回填":内置 DocLayout-YOLO ONNX 推理把每页切分成文本、公式、图片、表格、页眉页脚等区域,非文本区域原样保留,译文按原始坐标回填,因此多栏、跨页、公式编号都能留在原位。

能力说明
排版保留公式、图表、目录的位置与样式不变,支持多栏、跨页文档
双份输出同一次翻译同时产出纯译文版与双语对照版
服务可换Google、Bing、DeepL、Ollama、OpenAI 等十余种,任意 OpenAI 兼容接口都能接
多入口命令行、Web 界面、Docker 容器、MCP 服务、Python / HTTP API

按你的习惯选入口

🖥️ 命令行派:怎么切语言、页码和服务

pdf2zh paper.pdf -li en -lo zh -p 1-3,5

-li/-lo指定源/目标语言,-p指定页码范围,-s deepl换服务、-s openai:gpt-4o-mini直接点名模型;-t 8加线程提速,-f/-c用正则声明需原样保留的字体或字符(默认已保护数学、代码类字体)。

🖱️ 点选派:浏览器里传文件

pdf2zh -i

打开http://localhost:7860/,上传 PDF、选服务与语言即可,完成后直接在页面预览并下载两份结果 PDF;更多界面选项见 docs/README_GUI.md。

开发者接入:Python 与 MCP

from pdf2zh import translate translate(files=['paper.pdf'], lang_in='en', lang_out='zh', service='google')

想在脚本里嵌入翻译能力就用上面的 API;需要常驻 HTTP 服务就装pdf2zh[backend]后运行pdf2zh --flask;要接 AI 助手则用pdf2zh --mcp把翻译暴露给 MCP 客户端。

干重活:批量与进阶

  • pdf2zh --dir papers/:把目录下所有 PDF 逐一翻译,适合整批文献整理。
  • pdf2zh paper.pdf --config config.json:预置语言、字体与多组服务密钥,命令行和环境变量仍可覆盖文件内容。
  • pdf2zh paper.pdf --prompt prompt.txt:自定义大模型提示词,模板可用${lang_in}${lang_out}${text}注入术语要求。
  • pdf2zh paper.pdf --ignore-cache:跳过缓存强制重翻;平时已翻过的文本段走缓存,不重复消耗 API 额度。
  • pdf2zh paper.pdf --skip-subset-fonts:个别阅读器打不开时关闭字体子集化,用体积换兼容性。
  • pdf2zh -i --share:生成对外可访问的临时链接;加--authorized users.txt按"用户名,密码"文件限制登录用户。
  • API 走自建中转时BASE_URL必须带/v1后缀,完整示例见 docs/PROXY_CONFIGURATION.md。
  • --mode precise:实验性 v2 内核,需先运行pdf2zh-setup-precise搭独立环境,正式交付建议先用默认模式。

这些情况别硬上

  • 扫描版 / 图片型 PDF 没有可提取的文本层,需先做 OCR 再处理。
  • DeepL、OpenAI、Gemini 等付费服务要先在环境变量或配置文件里给 API Key,各服务的变量名对照见docs/ADVANCED.md的表格;Google、Bing 免密钥。
  • 本地运行要求 Python 3.11~3.12,不满足可改用 Docker 镜像或 Windows 免安装版。
  • 译文质量取决于所选服务,对术语要求高时换大模型服务并配合--prompt使用。

pip install pdf2zhpdf2zh paper.pdf就是完整的最快路径,几分钟即可拿到第一份双语论文。参数与服务变量名对照查 docs/ADVANCED.md,Python / HTTP / MCP 集成细节查 docs/APIS.md。

【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询