
MinerU 快速入门免费把扫描件 PDF 转成 Markdown一条命令就能跑通【免费下载链接】MinerUA high-quality tool for convert PDF to Markdown and JSON.一站式开源高质量数据提取工具将PDF转换成Markdown和JSON格式。项目地址: https://gitcode.com/OpenDataLab/MinerU上个月我把 200 多份扫描论文批量做 PDF 转 Markdown喂给团队的知识库。手动复制粘贴根本不可能最后用开源工具 MinerU 一条命令跑完输出直接是干净的 Markdown 和结构化 JSON。MinerU 是 OpenDataLab 开源的文档解析工具把 PDF、扫描件、Word、Excel、PPT 解析成带阅读顺序的 Markdown 和 JSON。个人批量转文件、企业搭文档流水线都适用。快速上手安装到跑通只要两步# 一条命令装好 MinerU含全部核心功能 pip install --upgrade pip pip install uv uv pip install -U mineru[all]然后对一份中文论文 PDF 执行解析输出目录会自动建好# 解析单份 PDF结果输出到 out 目录Markdown / 中间 JSON / 图片 mineru -p paper.pdf -o out # 纯 CPU 机器无 GPU 加速改用 pipeline 后端 mineru -p paper.pdf -o out -b pipeline跑完后out目录下有一份 Markdown、一份中间 JSON、裁好的图片以及一份标注了版面框和阅读顺序的布局可视化 PDF方便你核对解析是否靠谱。为什么值得用自动判断解析方式-m auto会先探测每份文档是带文本层的电子版还是扫描件有文本层走快速抽取没有就走 OCR不用你提前分类。表格和公式不丢结构表格转成带th/td的 HTML 片段公式转成 LaTeX贴回 Markdown 就能渲染。不止 PDF同一个-p参数也接受 DOCX、XLSX、PPTX 和图片Office 文件也能进同一条流水线。三种后端可选pipeline 兼容纯 CPUvlm-engine / hybrid-engine 精度更高但需要 GPU最低 8GB 显存。精度和速度之间的取舍由你按机器配置决定。实战场景批量解析扫描论文目录把 200 份 PDF 放进一个目录目录直接当输入传不用写循环脚本# 目录级批量解析每个文件在输出目录下生成对应子目录 mineru -p ./papers -o ./out解析链路是版面检测 → 文本/公式/表格识别 → 按阅读顺序拼 Markdown。每份文件的中间结果都落盘某一份坏了不影响其他文件。Office 文档混着解析目录里 docx、xlsx、pptx 混着放也可以MinerU 会按文件类型走各自的解析分支。如果你接了远端 API 服务想省一次服务端渲染可以在客户端本地生成 Markdown# 混合目录批量解析并在客户端基于服务端返回的 JSON 本地生成 Markdown mineru -p ./docs_mixed -o ./out --client-side-output-generation true在自己的服务里调用把 MinerU 当作服务跑起来其他系统通过 HTTP 提交任务mineru-api --host 0.0.0.0 --port 8000Python 端提交异步任务、轮询状态、下载结果仓库里的 demo 脚本已经写好了完整流程直接参考即可import httpx # POST /tasks 提交解析任务立即返回 task_id再轮询 /tasks/{id}/result r httpx.post(http://127.0.0.1:8000/tasks, files{files: open(paper.pdf, rb)}) task_id r.json()[task_id]同样的接口也能接进 Dify、n8n 这类工作流平台上传文件、拿到 Markdown中间不用写胶水代码。进阶用法后端选型与参数控制默认后端是 hybrid-engine精度不满意可切-b vlm-engine纯 CPU 机器用-b pipeline。hybrid 还可以把--effort调到 high 换取更高精度代价是更慢。公式、表格解析默认开启可以单独关# 只解析第 10-20 页关闭公式解析保留表格 mineru -p report.pdf -o out -s 10 -e 20 -f false # 不想合并跨页表格时 export MINERU_TABLE_MERGE_ENABLEfalse用 Python 服务化调用服务化部署后CLI 和代码都走同一套接口POST /tasks拿task_id轮询GET /tasks/{task_id}/result取结果结果默认保留 24 小时。写 RAG 入库脚本时这套异步接口比同步阻塞更稳。避坑指南首次运行卡在下载模型默认从 huggingface 拉模型网络受限就一行切换国内源export MINERU_MODEL_SOURCEmodelscope。长文档内存吃紧vlm/hybrid 后端建议 16GB 以上内存、20GB 以上磁盘SSD 更稳跑不完就换-b pipeline或按-s/-e分页拆开跑。扫描件识别错乱pipeline 后端加-l ch指定语言能明显减少识别错误hybrid 和 vlm 后端会自动判断语言不受这个参数影响。API 任务突然查不到任务状态是进程内存储服务重启或开启--reload后就丢了生产环境别依赖它做持久记录结果拿到手就落库。部署怎么选本地 CLI个人使用最省事装完即用。Docker团队共用一台服务器环境隔离干净。mineru-api 服务要集成进自己的产品或知识库流水线。mineru-router多卡、多服务实例要统一入口时加一层路由。以 Docker 为例启动命令如下仅支持 Linux 和 WSL2macOS 不建议走 Docker# 拉取仓库获取 Dockerfile构建后启动容器需要 Volta 及以上 GPU、8GB 显存 git clone https://gitcode.com/OpenDataLab/MinerU docker run --gpus all --shm-size 32g --ipchost \ -p 8000:8000 -p 7860:7860 -p 30000:30000 \ -it mineru:latest mineru-api --host 0.0.0.0 --port 8000容器里也可以直接跑mineruCLI仓库自带的compose.yaml还能一键拉起 WebUI、API、router 等不同角色。适合谁怎么开始如果你的日常是扫描件、表格和公式混排的文档MinerU 是目前免费开源方案里比较省心的选择。个人批量转文件用 CLI 就够了团队协作直接上 Docker要接进 RAG 或 AI 工作流就起一个 API 服务对接。详细参数和输出文件说明看官方文档 docs/zh/各解析后端的实现源码在 mineru/backend/。【免费下载链接】MinerUA high-quality tool for convert PDF to Markdown and JSON.一站式开源高质量数据提取工具将PDF转换成Markdown和JSON格式。项目地址: https://gitcode.com/OpenDataLab/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考