MinerU 多语言OCR完全指南一个参数搞定37语言文档解析【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU把一份俄文扫描件、一本印地语论文、一份阿拉伯语商务文件变成 LLM 能直接阅读的 Markdown这是 MinerU 内置的多语言OCR能力。2.1.0 起MinerU 集成了 PP-OCRv5 多语种识别模型一个语言参数就能选到专用模型覆盖 37 种以上语言。本文让你 3 分钟跑通多语言解析并把语言选择和常见坑一次讲清。先看效果扫描件 30 秒变结构化块理解 MinerU 解析能力的最快方式是看一份真实的中间结果。下图是项目 docs 目录里的版式检测示例左侧原页右侧每个文本段、公式、图表都被精确定位并编号。你要配置的多语言文本识别正是在这些块里执行的——检测决定文字在哪里语言模型决定文字是什么。解析的输出也不只是纯文本管线层会把段落合并、识别表格与公式统一转成中间态最终输出 Markdown 和结构化 JSON直接喂给 RAG 知识库或 LLM 工作流就能用。3 分钟上手从安装到第一次多语言解析最短路径只有两步安装、解析。pip install uv uv pip install -U mineru[all]装完自带mineru命令行工具第一条多语言解析命令长这样mineru -p demo/pdfs/demo1.pdf -o output/ -b pipeline -l ch其中-p是输入文件或目录-o是输出目录-b pipeline指定小模型管线后端-l ch指定文档语言。跑完在输出目录里就能看到 Markdown 和 JSON 解析结果。主线拆解语言参数在解析链路里到底生效于哪一步一页文档在 MinerU 里走完整条链路可以从项目架构总览图看到它的五层结构预处理到质检把与语言相关的主干抽出来是六步关键在第 E 步语言参数决定 OCR 阶段加载哪套识别模型和字典。多语言OCR能力正挂在这一环节上。当前支持的 12 个语言参数值及其覆盖范围定义于mineru/utils/ocr_language.py语言参数-l取值覆盖语言最适用ch默认中文、英文、日文、繁体中文、拉丁字母中英混合技术文档ch_server同ch更高精度服务端模型要求最高精度的重要文档korean韩语、英文韩文文档ta/te/ka泰米尔语、泰卢固语、卡纳达语含英文印度语系文档th泰语、英文泰文文档el希腊语、英文希腊文文档arabic阿拉伯语、波斯语、乌尔都语、维吾尔语等 9 种阿拉伯字母系文档east_slavic俄语、白俄罗斯语、乌克兰语、英文斯拉夫语文档cyrillic塞尔维亚语、保加利亚语、蒙古语、哈萨克语等 36 种冷门西里尔字母语言devanagari印地语、马拉地语、尼泊尔语、梵语等 13 种天城文系文档默认值ch已经覆盖中英日繁加拉丁字母文档恰好落在这些范围里时你什么都不用配。场景实战两个真实工作流场景一翻译组接手一批俄文合同目录里几十份俄文合同 PDF要全部转成文本进入后续术语比对流程mineru -p contracts_ru/ -o out_ru/ -b pipeline -l east_slavic为什么这么写-l只在 pipeline 后端生效所以必须显式带上-b pipeline传east_slavic后 OCR 阶段直接加载俄语/白俄罗斯语/乌克兰语专用模型西里尔字母和拉丁字母不会互相干扰目录作为输入一条命令批处理整批文件。场景二课题组归档一本印度学术期刊正文为印地语天城文混排英文摘要的期刊mineru -p journal_hi.pdf -o out_hi/ -b pipeline -l devanagari为什么这么写devanagari一个参数覆盖印地语、马拉地语、尼泊尔语、梵语等 13 种天城文系语言页面上的英文摘要也能正确识别不必把文件拆开两次处理。数据对比PP-OCRv5 到底带来了什么下表数字全部来自项目官方更新记录出处可查指标结果记录版本37 种语言平均识别精度提升超 30%2.1.0英文识别精度提升 11%2.2.0泰语识别精度82.68%2.2.0新增支持希腊语识别精度89.28%2.2.0新增支持翻译成体感从旧模型到 PP-OCRv537 种语言的平均精度从吃力变为提升超 30%泰语、希腊语这类语言从基本不可用到可以直接交付。语言覆盖还在持续扩大——2.1.0 的 37 种语言基线在 2.2.0 又加进了泰语和希腊语。避坑清单四个高频问题加了-l精度却没变化。现象命令跑完结果和默认一样。原因语言参数只在 pipeline 后端生效而默认后端是混合大小模型模式。动作显式传-b pipeline再跑一遍。韩文、泰文文档识别差中英却正常。原因默认ch模型只覆盖中英日繁加拉丁不含其他语系。动作换成对应参数如korean、th。升级版本后识别质量反而变差。原因模型权重换代例如ch_server更新为 PP-OCRv5_rec_server 系列本地旧模型文件不匹配。动作用内置的mineru-models-download命令重新下载模型。文档混排大小语种如乌尔都语加英文。原因-l只接受一个取值每套模型对应一个语系。动作按小语种选模型arabic一个参数覆盖乌尔都语等 9 种中英混排则不用管ch本身就同时覆盖两者。收尾把多语言文档交给管线只要你判断得出文档属于哪个语系MinerU 的多语言OCR就能用一条命令把它变成干净的 Markdown后面交给你的 RAG 或 LLM 去做。现在就挑一份手头的外文文档跑一条mineru -p 你的文档 -o output/ -b pipeline -l 语言参数对比一下识别结果和你之前手工整理稿的差距。本文基于 MinerU 3.4.4 编写。多语言识别能力在 pipeline 后端生效具体语言参数清单以当前版本官方文档为准。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考