
PDFMathTranslate 入门教程保版式 PDF 翻译公式图表不动免 API key【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate把一篇公式密集的英文论文丢给普通网页翻译器出来的往往是一堆乱码公式、错位的图注和断掉的双栏。PDFMathTranslate命令名pdf2zh做的就是保版式 PDF 翻译它读取带文本层的 PDF用 ONNX 版面模型逐块认出正文、公式、图和图注只把需要翻译的文字发给翻译服务再把译文写回原位产出纯中文版和中英对照版各一份。适合读论文、做文献综述也要批量 PDF 翻译整个文件夹的人。用之前先想清楚的三个问题我的 PDF 能不能翻能翻的前提是文件带文本层鼠标选中正文能复制出来就合格。扫描版、图片型 PDF 不适用要先 OCR 成可复制文本的 PDF 再翻仓库也提供了实验性 OCR 扩展pip install pdf2zh[ocr]可对纯图片页自动跑本地 OCR。我要不要先准备 API key不用。默认服务google免 keybing同样免 key装完直接能跑deepl、openai这类服务要先配环境变量各服务要设哪些变量见 docs/ADVANCED.md 里的对照表ollama可走本地模型翻译环节不依赖外网。跑一遍要花多少功夫装完一条命令出结果。pip install pdf2zh之后执行pdf2zh paper.pdf等翻译完成当前目录就多两个文件首次运行会先下载版面模型多等一会儿属正常现象。从安装到第一份输出先装包要求 Python 3.11 或 3.12pip install pdf2zh把要翻的 PDF 放进当前目录执行pdf2zh paper.pdf✅ 翻译完成后你会在原地找到两份产物paper-mono.pdf纯中文版paper-dual.pdf中英双语对照版习惯uv的话用uv tool install --python 3.12 pdf2zh代替 pip 安装Windows 不想装 Python可下载官方发布的pdf2zh-version-win64.zip解压后直接运行pdf2zh.exe。命令组合速查常用场景的参数都收在这张表里使用场景命令/参数说明指定语言方向-li en -lo zh默认就是英译中其他方向显式指定只翻部分页-p 1-5长文档先试读前几页重复内容靠缓存不重复调 API切换翻译服务-s deepl、-s openai、-s ollamagoogle/bing 免 key其余先配环境变量见 docs/ADVANCED.md固定术语--prompt prompt.txt模板支持${lang_in}、${lang_out}、${text}三个变量批量 PDF 翻译--dir papers/ -o output/ -t 3整目录处理-t设翻译线程数-o指定输出目录浏览器图形界面pdf2zh -i没自动弹出就访问http://localhost:7860/详见 docs/README_GUI.mdDocker 部署docker pull byaidu/pdf2zh再执行docker run -d -p 7860:7860 byaidu/pdf2zh团队共用一个入口怎么确认译文靠谱先看官方演示仓库 docs/ 里放了一篇双栏、多公式、带网络图的论文翻译前后截图正文换成了中文公式、网络图、图注都留在原位。还有三个可自行核实的事实项目论文被 EMNLP 2025 System Demonstrations 接收摘要中写明 PyPI 累计下载量已超过 22 万次核心代码都在 pdf2zh/ 包内版面解析看pdfinterp.py约 360 行、翻译调度看translator.py约 1200 行能顺下来读Python API 目前处于弃用状态、计划在 2.0 重新提供需要程序化调用的先看 docs/APIS.md 的说明。避坑清单⚠️ 遇到问题按「症状 → 原因 → 解法」对号入座翻译卡住、输出空白 → 输入是扫描版或图片型 PDF没有文本层可解析 → 先 OCR 成可复制文本的 PDF 再翻。首次运行一直卡住或超时 → 程序在下载版面模型wybxc/DocLayout-YOLO-DocStructBench-onnx网络不畅 → 先设镜像变量再运行set HF_ENDPOINThttps://hf-mirror.com $env:HF_ENDPOINThttps://hf-mirror.com其他网络问题查 docs/PROXY_CONFIGURATION.md。 3. 换了服务或提示词译文却没变 → 翻译结果有缓存相同内容不会重翻 → 加--ignore-cache强制重翻。 4. 输出 PDF 字体显示异常 → 默认做了字体子集化以压缩体积个别阅读器不兼容 → 加--skip-subset-fonts跳过字体子集化。说到底PDFMathTranslate 只干一件具体的事把文字换成中文公式、图表和版式保持原样。在读论文的人今天装完跑一条命令就能拿到第一份dual对照文件要给团队搭共用工具的人起一个 Docker 实例让大家从浏览器进想弄明白实现的人从 pdf2zh/ 目录读起整条链路读起来并不长。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考