资讯动态

MinerU 多语言OCR指南:12 个语言参数识别 37 种语言的配置技巧

发布时间:2026/8/29 10:13:48 来源:尧图企业网站定制
MinerU 多语言OCR指南12 个语言参数识别 37 种语言的配置技巧【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU解析韩语手册、俄语合同时默认中文模型对非中文文字的识别准确率会明显下滑。MinerU 多语言 OCR 用-l参数指定识别模型12 个参数覆盖 37 种语言官方口径平均精度提升超 30%。快速上手一条命令跑通韩语文档装好后跑这条命令即可-l选语言-b pipeline是它生效的前提默认 hybrid 后端不读这个参数后面会讲。pip install -U mineru mineru -p manual_ko.pdf -o out -b pipeline -l korean执行完成后输出目录里会出现manual_ko.md和图片文件夹韩文正文、标题、表格都转成了 Markdown图片单独切出存放。参数值只有 12 个定义在 mineru/utils/ocr_language.py 里每个参数对应哪套模型和字典配置清单在 mineru/model/utils/pytorchocr/utils/resources/models_config.yml。功能全景12 个参数对应哪些文字语言参数-l覆盖语言识别模型ch默认中、英、日、繁及拉丁字母语言ch_PP-OCRv6_small_recch_server同上server 档ch_PP-OCRv6_medium_reckorean韩语、英语korean_PP-OCRv5_rec_inferta/te/ka泰米尔语、泰卢固语、卡纳达语对应 PP-OCRv5/v3 模型th/el泰语、希腊语各含英语PP-OCRv5 对应模型arabic阿拉伯、波斯、乌尔都、维吾尔等 9 种文字arabic_PP-OCRv5_rec_infereast_slavic俄、白俄、乌克兰、英eslav_PP-OCRv5_rec_infercyrillic西里尔字母 32 种语言含哈萨克、蒙古文cyrillic_PP-OCRv5_rec_inferdevanagari印地、马拉地等 13 种语言devanagari_PP-OCRv5_rec_infer原理拆解-l 参数背后发生什么MinerU 的 OCR 分两步走检测负责找出页面上文字在哪里识别负责把文字块读成字符。检测模型基本共用真正的差异在识别模型——-l传进去的值先经过一层别名归一latin、japan、ru这类写法会被映射回正式参数再查配置表加载对应的模型权重和字典。字典可以理解为模型的可输出字符表。字符不在字典里就认不出来。所以选对语言参数的本质是选对了字符集西里尔字母文档用cyrillic它一张字典覆盖 32 种语言反过来纯英文文档其实不用换参数默认的ch本来就包含拉丁文字。需要留意的一点--lang只对 pipeline 后端生效hybrid 和 VLM 后端会忽略它这也是后面大部分参数没生效问题的根源。场景实战三类文档各一条命令韩语产品手册单独指定korean韩文正文不会被打散成拉丁字母零件编号保持完整。西里尔字母标书哈萨克语、蒙古语这类小众文字别用east_slavic它只覆盖 4 种语言选覆盖面更宽的cyrillic。mineru -p manual_ko.pdf -o out -b pipeline -l korean mineru -p tender.kz.pdf -o out -b pipeline -l cyrillic中英混合论文什么都不用加ch是默认值中英日繁混合直接跑如果是带文本层的电子版 PDF再加-m txt走文本提取比 OCR 更快。数据说话v5 多语言模型带来什么版本多语言识别能力关键数据2.0.x 及更早未引入专门多语言模型非中文文字靠ch兜底基线2.1.0引入 PP-OCRv5 多语言识别模型37 种语言平均精度提升超 30%当前 3.4.4ch/ch_server升级到 PP-OCRv6其余沿用 v5 语言模型cyrillic单参数覆盖 32 种语言前两条来自官方 changelog 的 2.1.0 记录模型与字典对应关系以仓库配置为准。踩坑与排错参数不生效先查这四处现象加了-l korean效果和没加一样。原因--lang只在 pipeline 后端生效默认 hybrid-engine 直接忽略。 解决命令里补上-b pipeline。现象写-l latin直接报 Language latin not supported。原因CLI 只接受帮助里列出的 12 个正式值latin、japan这类别名在底层会被归一到ch但命令行入口不做这个转换。 解决改用正式参数想要中英加拉丁文字混合直接用ch。现象国内机器第一次运行卡在模型下载很久。原因默认模型源是 huggingface网络不通时下载会一直重试。 解决执行前设置export MINERU_MODEL_SOURCEmodelscope再跑解析命令。现象纯英文文档不知道该配哪个参数。原因ch默认已含拉丁字母语言没有单独的英文参数。 解决保持默认即可文本层完好的 PDF 加-m txt跳过 OCR速度更快。收尾语言参数只在 pipeline 后端生效命令里记得带-b pipeline12 个参数覆盖 37 种语言西里尔、婆罗米这类小众文字选cyrillic、devanagari这类宽覆盖参数中英混合用默认ch不用额外下载模型国内网络先切模型源export MINERU_MODEL_SOURCEmodelscope手边有非中文 PDF 的话装上 MinerU 跑一下开头那条命令对比一下指定语言前后的识别结果。本文基于 MinerU 3.4.4 版本编写功能与参数以实际版本为准。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价