资讯动态

一条命令把 PDF 和 Office 文档转成 Markdown:MinerU 完整新手指南

发布时间:2026/8/29 10:11:07 来源:尧图企业网站定制
一条命令把 PDF 和 Office 文档转成 MarkdownMinerU 完整新手指南【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU 是一款开源文档解析工具把 PDF、图片以及 DOCX、PPTX、XLSX 文件转成 Markdown 与 JSON。如果你要做 RAG 知识库或想把纸质合同、技术文档电子化本地跑一条命令就能得到保留版式的结构化文本适合直接接入大模型工作流。谁该关注这个项目做 RAG 和 Agent 的开发者需要把大量 PDF、Office 文档喂给大模型MinerU 输出的 Markdown/JSON 带阅读顺序省掉人工清洗环节。文档处理人员希望把扫描件、合同、论文变成可检索、可编辑的文本表格和公式以 HTML 与 LaTeX 形式保留而不是乱码。自建解析服务的工程师提供 pipeline、hybrid、vlm 三种后端纯 CPU 环境也能跑 pipeline 后端。从文件到结果完整走一遍安装 MinerU 命令行工具先装完整包它包含全部核心功能支持 Windows、Linux、macOSpip install mineru[all]如果需要从源码构建可以克隆仓库仓库地址https://gitcode.com/GitHub_Trending/mi/MinerU再执行uv pip install -e .[all]。模型文件会在首次使用时自动下载访问不了 HuggingFace 时用环境变量MINERU_MODEL_SOURCEmodelscope切换到国内源。运行第一次解析把文件放在任意目录仓库里自带样例demo/pdfs/demo1.pdf执行mineru -p input_path -o output_path输入可以是单个文件也可以是整个目录。机器没有 GPU 时加-b pipeline走纯 CPU 推理有 GPU 或 Apple Silicon 时默认 hybrid 后端精度更高。查看解析结果输出目录里会得到主 .md 文件、JSON 结构化数据、提取出的图片以及{文件名}_layout.pdf这类可视化文件。后者用色块标出每页的内容块每个块角上的数字表示阅读顺序。发现某段文字顺序不对时直接在这里定位问题页不用翻回原 PDF 逐页比对。内部流程也固定为几个环节预处理乱码检测、扫描件识别→ 模型层layout 检测、公式检测、文本 OCR→ 管线层表格合并、公式替换、段落合并→ 输出层Markdown/JSON 与可视化文件。出问题时能很快判断该查哪一层。核心能力表格与公式输出直接可用表格转成 HTML公式转成 LaTeX遇到扫描版或乱码 PDF 时自动启用 OCR支持 109 种语言。一份带价格清单的合同解析后Markdown 里保留表格结构可以直接拷进别的文档而不是普通工具输出的断行乱码。版式与阅读顺序自动删除页眉、页脚、脚注和页码按阅读顺序输出文本多栏排版也能处理。解析一篇双栏学术论文后段落按可读顺序排好标题层级保留不需要手工重新整理。接入现有 AI 工作流CLI 只是最基础形态还有 FastAPI 服务、Gradio WebUI 和 MCP Server。用 Dify 这类平台时可以直接在市场安装 MinerU 插件工作流里免写代码调用解析能力。边界与实话复杂版面、手写体和低质量扫描件上解析质量会下降官方文档也建议先用在线版评估效果再决定部署方式。vlm 和 hybrid 后端要求至少 8GB 显存纯 CPU 的 pipeline 后端精度分数偏低这是硬件与精度之间的取舍。一条可操作的建议批量处理前先解析一份有代表性的样例打开_layout.pdf可视化文件确认阅读顺序与内容块分类再决定要不要跑全量。模型下载卡住时优先换 modelscope 源。效果对比方式得到什么复杂内容处理手工复制整理纯文本表格、公式、版式全靠手工费时易错普通 PDF 转换工具文本或 HTML残留页眉页脚表格和公式容易断裂MinerU结构化 Markdown/JSON表格转 HTML、公式转 LaTeX保留阅读顺序从官方给出的 OmniDocBench v1.6 端到端分数看hybrid 后端为 95.39纯 CPU 的 pipeline 后端为 86.47差约 9 分按硬件选后端即可。MinerU 不会让每一份扫描件都干净如新但能把“PDF 变文本”的琐碎环节从你手里接走。先拿一份样例文件跑一条命令再用版面可视化核对效果然后决定部署哪种后端。官方文档中文站输出文件说明命令行工具使用指南【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价