资讯动态

PaddleOCR 多语言 OCR 全景指南:从印地语(天城文)到 80 语种模型的安装、推理与训练

发布时间:2026/9/11 20:36:52 来源:尧图企业网站定制
PaddleOCR 多语言 OCR 全景指南从印地语天城文到 80 语种模型的安装、推理与训练【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCRPaddleOCR 是一个面向多语言场景的实用 OCR 工具库致力于把图片/PDF 中的文字高效地转化为结构化文本数据。本文以仓库印地语首页文档docs/index/index.hi.md为骨架系统梳理 PaddleOCR 的快速体验、PP-OCR 系列模型、80 语种支持机制、自定义训练与推理部署全流程读完你既能用一行命令跑通印地语等小语种识别也能理解语言模型在源码层是如何组织与切换的。PaddleOCR 项目定位多语言、实用的 OCR 工具库PaddleOCR 的目标是打造一套丰富、领先且实用的 OCR 工具库。除了通用中英文模型它还提供了专门面向英文场景训练的模型以及覆盖 80 种语言的小语种模型。英文模型优化了大小写字母、常见标点与空格字符的识别小语种模型则覆盖拉丁语系、阿拉伯语系、中文繁体、韩语、日语、天城文语系等。印地语首页文档给出的项目愿景प्रस्तावना可以概括为三点多语言बहुभाषी、高精度शानदार与可落地व्यावहारिक——即不仅要把模型训练出来还要帮助用户在生产环境中真正用起来。围绕这一目标项目沉淀了完整的产线数据标注与合成、模型训练、模型压缩量化/剪枝/蒸馏、推理与多端部署以及基于 PP-OCR 与 PP-Structure 的文档智能分析能力。从源码结构看多语言能力并非简单贴标签而是贯穿了 CLI、管道Pipeline与底层语言分组三个层次CLI 入口 paddleocr/_cli.py 将PaddleOCR等管道与TextDetection、TextRecognition等模型注册为子命令paddleocr命令行的所有参数都经由argparse统一解析语言分组常量定义在 paddleocr/_utils/langs.py其中DEVANAGARI_LANGS明确收录了hi印地语、mr马拉地语、ne尼泊尔语等 13 种天城文字系语言与印地语文档中--langhi的用法一一对应各语言的字符集则落在 ppocr/utils/dict/ 目录下的字典文件中如devanagari_dict.txt、korean_dict.txt等识别模型的输出类别空间即由这些字典决定。快速体验一条命令跑通印地语 OCR印地语首页文档提供了最小化的快速体验路径仅需两个安装步骤加一条命令# 1. 安装飞桨深度学习框架GPU 用户请安装 paddlepaddle-gpu pip3 install paddlepaddle # 2. 安装 PaddleOCR pip3 install paddleocr # 3. 直接对图片做检测 识别整图预测--langhi 指定印地语 paddleocr --image_dir /your/test/image.jpg --langhi其中--lang参数是切换语种的开关。PaddleOCR 支持的语言缩写非常多例如ch中英文、en英文、fr法文、german德文、japan日文、korean韩文、hi印地语等。完整的语言缩写与语种对照表可查阅 多语言模型教程 中的支持语种及缩写章节该章节以两列对照表的形式列出了全部 80 个语种例如语种缩写语种缩写中文Chinese Englishch保加利亚文Bulgarianbg英文Englishen乌克兰文Ukranianuk法文Frenchfr白俄罗斯文Belarusianbe德文Germangerman泰卢固文Telugute日文Japanesejapan泰米尔文Tamilta韩文Koreankorean阿拉伯文Arabicar中文繁体Chinese Traditionalchinese_cht印地文Hindihi意大利文Italianit尼泊尔文Nepaline西班牙文Spanishes乌尔都文Urduur葡萄牙文Portuguesept马来文Malayms俄罗斯文Russianru越南文Vietnamesevi从源码看paddleocr/_utils/langs.py 将这些语言进一步归类为LATIN_LANGS拉丁语系40 种、ARABIC_LANGS阿拉伯语系、CYRILLIC_LANGS西里尔语系与DEVANAGARI_LANGS天城文语系OCR 管道据此选择对应的检测/识别模型与字典这就是改一个--lang参数即可切换语种的底层实现机制。PP-OCR 系列模型从超轻量到高精度的多语言方案印地语首页文档给出了一张 PP-OCR 系列模型清单覆盖移动端与服务器端两类典型场景模型介绍模型名称推荐场景检测模型识别模型印地语超轻量 PP-OCRv3 系统9.9Mdevanagari_PP-OCRv3_xx移动端与服务器端多语言 PP-OCRv3 检测推理模型devanagari PP-OCRv3 识别推理模型英文超轻量 PP-OCRv3 模型13.4Men_PP-OCRv3_xx移动端与服务器端英文 PP-OCRv3 检测推理模型英文 PP-OCRv3 移动端识别推理模型中英文超轻量 PP-OCRv3 模型16.2Mch_PP-OCRv3_xx移动端与服务器端PP-OCRv3 移动端检测推理模型PP-OCRv3 移动端识别推理模型更完整的模型清单见 PP-OCR 系列模型列表。该文档对模型类型做了清晰划分可帮助理解上述表格推理模型inference.pdmodelinference.pdiparams用于预测引擎直接推理是命令行/whl 包默认拉取的格式训练模型 / 预训练模型*.pdparams、*.pdopt、*.states训练过程中保存的参数与优化器状态用于指标评估与恢复训练nb 模型*.nb经飞桨 Paddle-Lite 优化后的端侧模型面向移动端 / IoT 场景。多语言识别模型部分PP-OCR 系列模型列表 为每个语种都配了独立字典与训练配置文件例如模型名称字典文件模型简介配置文件korean_PP-OCRv3_mobile_recppocr/utils/dict/korean_dict.txt韩文识别configs/rec/PP-OCRv3/multi_language/ 下的对应 ymljapan_PP-OCRv3_mobile_recppocr/utils/dict/japan_dict.txt日文识别同上devanagari_PP-OCRv3_mobile_recppocr/utils/dict/devanagari_dict.txt梵文/天城文识别覆盖印地语同上arabic_PP-OCRv3_mobile_recppocr/utils/dict/arabic_dict.txt阿拉伯字母同上cyrillic_PP-OCRv3_mobile_recppocr/utils/dict/cyrillic_dict.txt斯拉夫字母同上多语言检测模型ml_PP-OCRv3_det与中文检测模型结构完全相同仅训练数据不同因此共用同一份配置文件多语言识别模型则以语种专属字典 专属训练配置的形式逐语种提供。命令行与 Python 双入口整图预测、检测与识别拆分印地语首页文档把快速上手定位为入口实际使用时可以参考 快速开始 与 多语言模型教程两者提供了完整的 CLI 与 Python 用法。命令行模式整图预测检测 识别结果是一个 list每个 item 包含文本框、文字与识别置信度paddleocr --image_dir doc/imgs_en/254.jpg --langen输出示例[(PHO CAPITAL, 0.95723116), [[66.0, 50.0], [327.0, 44.0], [327.0, 76.0], [67.0, 82.0]]] [(107 State Street, 0.96311164), [[72.0, 90.0], [451.0, 84.0], [452.0, 116.0], [73.0, 121.0]]]仅做识别跳过检测--det falsepaddleocr --image_dir doc/imgs_words_en/word_308.png --det false --langen # 输出 (0.99879867, LITTLE)仅做检测跳过识别--rec falsepaddleocr --image_dir PaddleOCR/doc/imgs/11.jpg --rec false # 输出仅含文本框坐标的 list方向分类器可通过--use_angle_cls true开启用于处理 180 度旋转文字--use_gpu false可在纯 CPU 环境运行。PaddleOCR 还支持直接输入 PDF并通过--page_num控制参与推理的页数默认 0 表示全部页。模型版本可用--ocr_version指定如PP-OCRv4、PP-OCRv3。Python 脚本模式from paddleocr import PaddleOCR, draw_ocr # 通过 lang 参数切换语种首次执行会自动下载模型 ocr PaddleOCR(langkorean) img_path doc/imgs/korean_1.jpg result ocr.ocr(img_path) # 整图预测检测 识别 # result ocr.ocr(img_path, detFalse) # 仅识别 # result ocr.ocr(img_path, recFalse) # 仅检测 # 可视化 from PIL import Image image Image.open(img_path).convert(RGB) boxes [line[0] for line in result] txts [line[1][0] for line in result] scores [line[1][1] for line in result] im_show draw_ocr(image, boxes, txts, scores, font_path/path/to/PaddleOCR/doc/fonts/korean.ttf) Image.fromarray(im_show).save(result.jpg)提示仓库 doc/fonts/ 目录下提供了korean.ttf、japan.ttc、arabic.ttf、hindi.ttf等多语言可视化字体绘制结果时需要为对应语种指定正确的字体文件否则会出现文字乱码。PDF 场景下快速开始 给出了配合PyMuPDF (fitz)逐页渲染并调用draw_ocr保存result_page_N.jpg的完整示例超长图场景则可使用slice滑动窗口参数将大图切块识别后再合并结果。多语言识别效果可视化验证PP-OCRv3 多语言模型在日文、韩文等场景下的识别效果见下图更多效果图可参考 多语言模型教程 的可视化部分印地语首页文档的可视化章节विज़ुअलाइज़ेशन同样以 PP-OCRv3 多语言模型、英文模型、中文模型以及 PP-Structurev2版面分析 表格识别、SER 语义实体识别、RE 关系抽取为主题展示效果可进一步在仓库 docs/version2.x/ppocr/visualization.md 中查看。自定义训练用自己的数据 finetune 多语言模型当内置语种或通用模型无法满足业务精度时PaddleOCR 支持使用自有数据做自定义训练或 finetune。多语言模型教程 以法语模型为例说明了完整流程——先改配置文件再启动训练。修改识别训练配置以 configs/rec/multi_language/rec_french_lite_train.yml 为模板Global: ... # 指向自定义字典如法语字典 character_dict_path: ./ppocr/utils/dict/french_dict.txt ... # 是否识别空格 use_space_char: True Train: dataset: name: SimpleDataSet # 支持 SimpleDataSet 与 LMDBDataSet data_dir: ./train_data/ # 数据集路径 label_file_list: [./train_data/french_train.txt] # 训练集标签文件 Eval: dataset: name: SimpleDataSet data_dir: ./train_data label_file_list: [./train_data/french_val.txt] # 验证集标签文件下载预训练模型并启动训练单卡 / 多卡# 下载预训练模型并解压 wget https://paddleocr.bj.bcebos.com/dygraph_v2.0/multilingual/french_mobile_v2.0_rec_train.tar tar -xf french_mobile_v2.0_rec_train.tar # 单卡训练通过 -o 覆盖配置中的预训练模型路径 python3 tools/train.py -c configs/rec/rec_french_lite_train.yml \ -o Global.pretrained_modelfrench_mobile_v2.0_rec_train/best_accuracy # 多卡训练通过 --gpus 指定卡号 python3 -m paddle.distributed.launch --gpus 0,1,2,3 tools/train.py \ -c configs/rec/rec_french_lite_train.yml \ -o Global.pretrained_modelfrench_mobile_v2.0_rec_train/best_accuracy数据准备与训练细节可分别参考 文本识别训练 与 文本检测训练。印地语首页文档也给出了模型训练之外的两条进阶路径模型压缩量化 deploy/slim/quantization/README_en.md、剪枝 deploy/slim/prune/README_en.md、知识蒸馏 docs/version2.x/ppocr/model_compress/knowledge_distillation.md以及多端部署Python / C 推理、服务化部署、端侧部署、Paddle2ONNX 转换。新语言支持与社区机制印地语首页文档专门开辟了新语言请求नई भाषा अनुरोध章节明确了语言扩展的两种路径请求官方新增语种如果希望官方升级某语言模型可参与多语言模型升级投票官方会定期根据投票结果迭代模型自行训练新语种模型如果业务场景需要自定义语言可按多语言模型训练教程准备数据集并逐步完成训练全流程。仓库 docs/version2.x/ppocr/blog/multi_languages.md 对新增语言需要哪些配套资源给出了完整答案每种语言对应一份字典文件ppocr/utils/dict/、一份训练配置configs/rec/multi_language/以及可选的专属字体文件doc/fonts/新增语言本质上是补齐这三类资源并完成训练与评测。环境准备与更多教程导航首次使用建议按以下顺序阅读仓库文档以下路径均相对仓库根目录运行环境准备环境准备PP-OCR 快速上手快速开始覆盖中英文、多语言、PDF 与滑动窗口模型训练训练文档检测 / 识别 / 方向分类三个子任务模型压缩量化、剪枝、知识蒸馏deploy/slim/ 目录推理与部署deploy/README.mdPython、C、服务化、移动端、Paddle2ONNX、PaddleCloudPP-Structure 文档智能分析ppstructure/README.md版面分析、表格识别、关键信息提取学术算法概览docs/version2.x/algorithm/overview.md数据标注与合成docs/data_anno_synth/data_annotation.md、docs/data_anno_synth/data_synthesis.md公开数据集docs/datasets/ 目录通用 OCR、手写、版面、表格、KIE、多语种数据集常见问题docs/FAQ.md开源许可PaddleOCR 采用 Apache 2.0 许可证发布仓库根目录的 LICENSE 文件给出了完整的许可条款允许自由使用、修改与再分发需保留版权声明与许可文本。综上PaddleOCR 的多语言能力并非停留在口号层面从印地语首页文档的快速体验命令到 paddleocr/_utils/langs.py 中的天城文语言分组再到 ppocr/utils/dict/ 的逐语种字典与 configs/rec/multi_language/ 的训练配置整个链条清晰可循。无论是用paddleocr --image_dir xxx.jpg --langhi快速验证还是基于自己的数据集训练新语种模型这条多语言 OCR 通路都能直接复用。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价