ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

两条命令完成PDF翻译:PDFMathTranslate简单指南,公式与排版原样保留

2026/9/1 20:56:51 拓冰建站 浏览量
两条命令完成PDF翻译:PDFMathTranslate简单指南,公式与排版原样保留 两条命令完成PDF翻译PDFMathTranslate简单指南公式与排版原样保留【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate一条命令把英文学术PDF丢进去一两分钟后你会拿到两个新文件中文版和中文-英文双语版里面的LaTeX公式原封不动图表与目录位置不挪一分。这就是开源工具PDFMathTranslate命令名 pdf2zh做的事——一个完整保留排版的AI PDF翻译工具也是本篇指南的主角。PDFMathTranslate 是什么保留公式与版式的PDF翻译工具PDFMathTranslate 做全文翻译但保留原始版式正文变成中文公式、插图、表格、目录和注释保持原样。每份文档会产出两个 PDF——单语版方便速读双语版适合逐行对照。它面向需要长期读外文材料的人查文献的学生、做科研的研究者、啃英文技术文档的工程师以及要出双语课件的教师。项目入选过 EMNLP 2025 Demo 轨道功能完全开源免费。 快速上手两条命令翻译第一份PDF前置条件只有一个Python 版本在 3.11 到 3.12 之间。先执行下面的命令安装 pdf2zh 命令行工具pip install pdf2zh然后进入待翻译文件所在目录执行翻译命令pdf2zh example.pdf运行结束后当前目录会多出一个example-mono.pdf中文单语版和example-dual.pdf中英双语版。默认走 Google 翻译服务不需要配置任何 API Key。其余安装方式压成下表按需取用方式获取方法适合谁uv 隔离安装pip install uv后执行uv tool install --python 3.12 pdf2zh不想污染系统 Python 环境的开发者Windows 绿色版从 releases 页下载 win64 压缩包双击pdf2zh.exe不想装 Python 的用户Docker 容器docker pull byaidu/pdf2zh后运行镜像团队共享、服务器部署图形界面安装后执行pdf2zh -i浏览器自动打开新手Zotero 插件安装社区插件 zotero-pdf2zh文献管理流程用户图形界面里上传文件、选目标语言、点按钮即可详见 docs/README_GUI.md。功能实战4个典型用法读外文文献先译关键页再译全文一篇 40 页的论文全译需要时间。用-p先指定页码把摘要和方法部分翻出来确认公式渲染正常再跑全文pdf2zh paper.pdf -p 1-3,5看一组真实论文的翻译前后对比公式与网络图逐像素一致正文换成了中文。啃技术文档复杂版式切精准模式代码块、特殊符号密集的文档切换到实验性 v2 内核可获得更稳的版式识别pdf2zh manual.pdf --mode precise该模式在隔离环境中运行参数说明见 docs/ADVANCED.md。做双语教学材料dual.pdf 直接可用中英双语版默认生成逐行对照、公式位置完全一致可以直接发给学生配合-li/-lo还能换成英译日等其他语对。批量翻译整个文件夹不用逐个复制文件一条命令处理目录下所有 PDFpdf2zh --dir ./papers/命令速查表命令/参数作用示例-i启动浏览器图形界面pdf2zh -i-p只译指定页码支持区间与枚举pdf2zh a.pdf -p 1-5,8-li/-lo指定源语言与目标语言pdf2zh a.pdf -li en -lo ja-s选择翻译服务Google/DeepL/OpenAI/Ollama 等pdf2zh a.pdf -s deepl-t并发翻译线程数pdf2zh a.pdf -t 4-o指定输出目录pdf2zh a.pdf -o out/-f用正则排除代码、公式字体等内容不译pdf2zh a.pdf -f (MS.*)--mode precise实验性 v2 精准翻译内核pdf2zh --mode precise a.pdf--dir批量翻译整个文件夹pdf2zh --dir ./papers/--config加载 JSON 配置文件复用参数pdf2zh --config c.json--ignore-cache忽略翻译缓存强制重新翻译pdf2zh a.pdf --ignore-cache完整服务列表与每个参数的说明见 docs/ADVANCED.md。原理简述4个步骤公式为什么不动布局检测内置 DocLayout-YOLO 视觉模型逐页扫描标出正文、公式、图片、表格、目录各在哪个区域。元素分类正文文本进入翻译队列公式、代码、图片被标记为不碰。内容翻译文本按段拆分交给在线翻译服务或本地大模型多线程并行处理。格式重建译文按原位置回填到页面生成单语与双语两个 PDF。整条链路在 pdf2zh/ 源码目录中布局检测与转换逻辑分别在 pdf2zh/doclayout.py 和 pdf2zh/converter.py。⚠️ 避坑指南以下都是高频卡点解法现成首次运行卡在模型下载程序依赖 DocLayout-YOLO ONNX 模型网络不佳时设置环境变量HF_ENDPOINThttps://hf-mirror.comPowerShell 写$env:HF_ENDPOINThttps://hf-mirror.com后重试。Windows 的 .exe 打不开缺 VC 运行库安装vc_redist.x64.exe再试。Docker 拉不到镜像Docker Hub 访问受限时改用官方 ghcr 镜像docker pull ghcr.io/byaidu/pdfmathtranslate。找不到翻译结果文件生成在你执行命令的目录里加-o out/可以固定输出位置。7860 端口被占用启动图形界面时加--serverport 7861换端口。precise 模式是实验性的--mode precise依赖pdf2zh_next子模块见 pdf2zh/kernel/ 目录正式交付场景建议先用默认 fast 模式。二次开发注意官方 Python/HTTP API 已暂时弃用程序化接入请参考 docs/APIS.md 中的 BabelDOC 后端方案。常见问题Q必须付费或配置 Key 吗A默认 Google 服务免 Key、免费。用 DeepL、OpenAI 需先设置对应环境变量Ollama 本地模型则不需要 Key也不需要联网。Q能完全离线使用吗A可以。选择 Ollama 服务并跑本地模型翻译过程全程不出内网但首次仍需联网下载一次布局检测模型。Q一份10页的论文要多久A一般 1-2 分钟。瓶颈通常在翻译服务响应加-t多线程可以进一步提速。Q重复翻译同一份文件会更快吗A会。相同文本命中翻译缓存重跑时直接跳过已译部分想强制全量重译就加--ignore-cache。Q支持哪些 Python 版本A仅 3.11 和 3.12。其他版本请安装对应 Python或直接使用 Windows 绿色版。现在开始克隆仓库动手试译或参与贡献git clone https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate先用默认设置翻一篇你手头积压的论文拿到公式完好无损的双语 PDF 之后再按自己的场景调服务、调线程。核心关键词PDF翻译、PDFMathTranslate、数学公式保留、学术双语论文、pdf2zh长尾关键词学术论文中文翻译工具、保留排版的PDF翻译、LaTeX公式翻译工具、批量PDF翻译命令、PDFMathTranslate安装教程、pdf2zh图形界面使用、PDF翻译保留公式【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考