ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

PDFMathTranslate(pdf2zh)快速上手:两条命令翻完 PDF 论文,公式与双栏排版原样保留

2026/9/20 18:09:42 拓冰建站 浏览量
PDFMathTranslate(pdf2zh)快速上手:两条命令翻完 PDF 论文,公式与双栏排版原样保留 PDFMathTranslatepdf2zh快速上手两条命令翻完 PDF 论文公式与双栏排版原样保留【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatePDFMathTranslate 提供的命令行工具 pdf2zh专门做 PDF 论文的双语翻译文字译成中文公式、图表和双栏排版照旧默认服务不用配密钥。读外文文献的学生和研究人员用它几分钟就能拿到一份可读的中文对照版。先看清产物pdf2zh 翻译后你会拿到什么对document.pdf跑一遍pdf2zh当前目录会多出两份文件document-mono.pdf纯译文版通篇是翻译后的内容document-dual.pdf中英对照版原文与译文同页并排对照效果上正文里的公式、插图、目录、双栏结构一个不缺图编号、脚注、页眉也都留在原位。两分钟跑起来安装 pdf2zh 并得到第一份译文整个过程就两条命令pip install pdf2zhpdf2zh document.pdf默认使用 Google 翻译服务不用申请任何密钥。第一次运行会下载 ONNX 版面模型ONNX 是一种可以在本地直接运行的模型文件格式所以比之后每次都要慢一些属于正常现象。跑完后上一节说的两份产物就落在当前目录。三步管线拆解公式、图表、双栏为什么一个不丢把它理解成一位面对已排版校样的老校订员分三步走版面模型逐页扫描把公式、图片、表格、目录统统圈出来标记为不能碰只有文字块被单独摘出来送到翻译服务其余部分纹丝不动译好的文字按原字体、原位置填回原来的位置版式因此毫发不伤。版面检测这一步的实现在 pdf2zh/doclayout.py想抠细节可以直接读。五种使用场景对号入座单篇、批量、GUI、Docker、MCP单个文件pdf2zh paper.pdf一条命令产物直接出现在当前目录。批量目录pdf2zh --dir /path/to/papers/ -o results/整个目录的 PDF 一次翻完输出统一归到-o指定的目录。Web 图形界面pdf2zh -i然后浏览器打开http://localhost:7860/在服务配置、页码选择、实时预览之间点点就行。Docker 部署docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zh同样是 7860 端口的 Web 界面适合固定跑在服务器上。MCP 接入pdf2zh --mcpMCP 即模型上下文协议给 AI 助手挂外部工具的方式。注册进 Claude Desktop 后对话里丢一个 PDF 就能直接翻配置示例见 docs/ADVANCED.md。pdf2zh 参数速查表日常常用的 8 个参数作用短示例-p指定页码pdf2zh paper.pdf -p 1-3,5只翻第 1–3 页和第 5 页-s换翻译服务-s deepl、-s openai:gpt-4o-mini-li/-lo源语言 / 目标语言-li en -lo zh-t翻译线程数-t 4开四线程并发-o输出目录缺省为当前目录-o results/--ignore-cache忽略翻译缓存强制重翻加在任意命令后--prompt加载自定义 LLM 提示词文件--prompt my_prompt.txt--config加载 JSON 配置文件--config config.json环境前置条件Python 版本、网络与 Windows 运行库Python 必须是 3.11 或 3.12项目声明3.11,3.133.10 和 3.13 都不行。需要联网首次运行要从 Hugging Face 拉取wybxc/DocLayout-YOLO-DocStructBench-onnx版面模型断网会卡住。依赖不用手装onnxruntime、pdfminer、gradio 等会随pip install自动带入。Windows 用户如果跑 exe 版本报 DLL 加载失败先装 VC 2015–2022 运行库。报错对照清单三个高频问题怎么解扫描版 PDF 翻不动纯图片扫描件没有文本层而 pdf2zh 读的就是文本层取不到任何内容。先用 OCR光学字符识别把图片里的字还原成可选中文字生成文本层再投入翻译。模型下载卡住部分地区访问 Hugging Face 受限运行前先设镜像set HF_ENDPOINThttps://hf-mirror.comPowerShell 里写$env:HF_ENDPOINT https://hf-mirror.com。切换服务后报鉴权错误对应服务的密钥环境变量没有预设比如DEEPL_AUTH_KEY、OPENAI_API_KEY。各服务对应哪个变量名查 docs/ADVANCED.md 里的表格设好再执行。想要翻 PDF 还保住排版装pdf2zh两条命令就能交付其余参数与配置细节翻 docs/ADVANCED.md 就有答案。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考