
PDFMathTranslate保留公式排版一条命令产出双语 PDF【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatePDFMathTranslatePython 包名pdf2zh是一款免费开源的 PDF 翻译工具它先识别 PDF 里的公式、图表和正文再交给 Google、DeepL、OpenAI 等服务逐段翻译最后把译文放回原文位置。跑完一次会同时得到纯译文版-mono.pdf和中英对照版-dual.pdf。论文、标准文档、技术报告读外文费劲的研究生、科研人员和技术工程师是最典型的使用者。项目已被 EMNLP 2025自然语言处理领域国际会议收录为系统演示论文。先跑起来两条命令装好并出稿第一步装工具pip install pdf2zh第二步把任意一个 PDF 丢给它pdf2zh paper.pdf完成后当前目录会出现paper-mono.pdf纯译文和paper-dual.pdf双语对照。默认走 Google 翻译服务不用填任何密钥装没装好看一眼输出就知道。 首次运行会拉一个约几十 MB 的版面检测模型下载失败时先把HF_ENDPOINT指到镜像源再跑Windows 用setPowerShell 用$env:set HF_ENDPOINThttps://hf-mirror.com它凭什么保住排版先切版面再回填译文传统做法是复制粘贴 PDF 文本公式变乱码、多栏结构散架。PDFMathTranslate 换了个顺序翻译前先用内置的版面分析模型DocLayout-YOLO ONNX 推理把每个页面切成正文、公式、图片、表格、页眉页脚几块只动文本块非文本区域原样保留译完后按原始坐标把文字贴回去多栏、跨页文档也能对齐。由此得到的能力排版保留—— 公式、图表、目录和注释留在原位样式不动双语双份输出—— 一次翻译同时拿到纯译文版和对照版翻译服务可换—— Google、Bing、DeepL、OpenAI、Ollama、Gemini、DeepSeek 等十余种内置也兼容任意 OpenAI 格式接口形态齐全—— 命令行、Web 界面、Docker、MCP 服务、Python / HTTP API三种用法命令行、Web 界面、开发者接口命令行最常用的组合完整参数见 docs/ADVANCED.mdpdf2zh paper.pdf -li en -lo zh -p 1-3,5 pdf2zh paper.pdf -s deepl -o out-li/-lo指定源语言和目标语言代码见各服务的支持列表-s换翻译服务写成服务名:模型名如openai:gpt-4o-mini可直接定模型-p限定页码范围-t调多线程数长文档可加大-f/-c用正则声明需要原样保留的字体或字符Math、Mono、Italic 等数学与代码字体默认受保护输入不限于本地文件PDF 的 URL 直接可用。Web 界面不想记参数就开界面翻译参数、页码范围全在页面上点pdf2zh -i启动后浏览器访问http://localhost:7860/结果可直接在页面里预览、下载。细节见 图形界面说明。部署给团队共用加--share生成对外临时链接控制访问范围--authorized users.txt按用户名,密码文件限定登录用户登录页可自定义。开发者接口三种接入方式任选细节见 API 文档from pdf2zh import translate (file_mono, file_dual) translate( files[example.pdf], lang_inen, lang_outzh, servicegoogle, thread4 )Python上面这段代码即可在自己的脚本里直接调用HTTP安装pdf2zh[backend]运行pdf2zh --flask与pdf2zh --celery worker用 REST 接口提交任务、查进度、下载结果MCP运行pdf2zh --mcp或加--sse把翻译能力暴露给 Claude Desktop 等 MCP 客户端用自然语言让 AI 助手找文件并翻译。团队与进阶Docker、免安装版与实验特性Dockerdocker pull byaidu/pdf2zh后docker run -d -p 7860:7860 byaidu/pdf2zh浏览器访问http://localhost:7860/即可与本机 GUI 是同一套界面仓库内的 Dockerfile 和 docker-compose.yml 支持二次定制。Windows 免安装发布页有pdf2zh.exe压缩包解压双击即跑打不开就按提示补装 VC 运行库。实验特性--mode precise启用 v2 翻译内核需先跑pdf2zh-setup-precise搭独立环境面向跨栏跨页一致性等边缘场景--babeldoc换用 BabelDOC 后端可搭配-s openaiZotero 用户可装社区插件在文献管理软件里直接触发翻译。自定义代理API 要走自建中转时参考 代理配置说明BASE_URL必须带/v1后缀。什么时候用不了扫描、密钥与环境扫描版 / 图片型 PDF程序读的是 PDF 内嵌文本纯图片页面没有可翻译内容先做 OCR 再处理术语质量取决于所选服务默认 Google 免配置要求更高时换 DeepL 或大模型服务配--prompt prompt.txt注入领域术语要求模板变量为${lang_in}、${lang_out}、${text}付费服务Google、Bing 等免费服务除外DeepL、OpenAI、Gemini 都要在环境变量或配置文件里给 API Key变量名对照表在 docs/ADVANCED.md环境本地运行需 Python 3.11~3.12否则走 Docker 或 Windows 免安装版默认模式 vs 实验模式正式交付建议先验证默认模式--mode precise属实验特性。另外两条日常会碰到的--config config.json加载指定配置不指定时读~/.config/PDFMathTranslate/config.json命令行和环境变量仍可在其上覆盖已翻译过的文本段会写进缓存同一文档再跑不耗 API 额度需要强制重译加--ignore-cache。装好后挑一篇论文跑一次pdf2zh paper.pdf几分钟就能拿到第一份双语对照稿更多参数与集成方式看 docs/ADVANCED.md。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考