Umi-OCR 本地 OCR 实操从单张识别到批量跑 40 页扫描【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR下午三点桌上摊着 40 页扫描合同老板要下班前改完签字页。逐字手敲不现实。把图片文件夹拖进 Umi-OCR点一下「开始任务」批量 OCR 全程在本地跑40 张 PNG 大约 6 分钟变成一份能编辑的 txt。这篇讲的就是我用了两周的真实流程只说有用的。 它到底能做什么Umi-OCR 是一款免费开源的桌面 OCR 软件识别模型跑在你自己的机器上图片不离开机器。它提供两个主要入口截图 OCR 和批量 OCR。前者负责从屏幕上抠一段文字或一段代码后者负责一次性处理一整个文件夹的图片。内置 Rapid-OCR 和 Paddle-OCR 两套引擎还带多语言识别库覆盖简体中文、繁体中文、英文、日文等。PDF 文档识别、二维码和条形码的读取与生成也有。下图是一次典型的截图识别左栏是代码图片右栏是对应的文本复制就能用。️ 从打开到出结果批量识别一个文件夹的完整闭环选一个最典型的场景把文件夹里所有图片批量识别。整个闭环分四步。第一步拿到工具。从项目 Releases 页下载最新压缩包解压到一个目录双击 Umi-OCR.exe 就能运行。没有安装环节也不依赖系统环境整个文件夹拷走就能用。第二步基本设置。首次打开去「全局设置」页看一眼界面语言跟随系统也可以手动切换主题选浅色或深色再确认一下 OCR 引擎。第三步执行任务。打开批量 OCR 页点「选择图片」加入文件夹或者直接把图片拖进列表。在右侧设置里确定保存目录和输出文件类型然后按下「开始任务」。顶部进度条显示总体进度列表里能看到每张图的耗时和置信度。第四步拿到输出。任务结束后结果按你选的格式写成文件txt、jsonl、md、csv右侧记录栏保留每张图片的文字右键可以复制单条或全选方便抽查。想把这步放进脚本命令行一句话就够umi-ocr --path D:/contract_scan传入文件夹路径它会把里面所有图片识别完也可以再加--clip之类的输出参数。⚠️ 批量 OCR 的三个常见坑怎么绕过去水印和页眉混进结果用忽略区域一批带公司 logo 或水印的图片识别结果里总会混进水印文字。打开批量页右侧设置里的忽略区域编辑器按住鼠标右键画矩形框内文字在任务中不输出。两个实际要点框画大一点把水印可能出现的位置整个包进去忽略的单位是整个文本块不是单个字符框得随意了把正文一行包进去那一行会整个被跳过。输出格式怎么选默认 txt 够人读一张图一个文件。结果要喂给脚本选 JSONL一行一张图的结果和置信度jq 或 pandas 都好解析。要进 Excel 核对就选 csv。用图片直接拼文档的话md 合适。排版顺序怎么保对识别引擎输出的是一个个「文本块 坐标」最终阅读顺序由「排版解析」方案拼出来。双栏论文选多栏-按自然段换行左右两栏的段落不会串代码截图选单栏-保留缩进源码的缩进和空行原样保留。日常单栏文字用默认方案就行不用动它。⚖️ 跟云端 OCR 服务放在一起看云端 OCR 服务是成熟选项传文件、拿结果弹性好、不用自己维护。代价是图片要过网通常按次计费文件敏感度也有讲究。Umi-OCR 的长处正好相反模型本地推理不联网、不按张收费、数量不设限内网和涉密场景里能用。代价是速度受本机 CPU 限制首次调用加载模型略慢。一句话分法少量、一次性、高并发的需求适合云端日常办公和处理敏感文档本地更省心。 谁适合用谁可以跳过如果你经常处理扫描件、截图、代码图片或者一次要处理几百张图这就是为你准备的工具。多语言团队也可以放心界面内置简体中文、繁体中文、英文、日文等一键切换。每月只识别个三五张图的可以跳过系统截图加手工修正足够。对复杂表格或手写字的精度要求极高的本地和云端一样纯 OCR 都需要人工复核。下一步打开项目 Releases 页下载最新压缩包解压把一个文件夹拖进去试。跑完一批 40 张图这篇文章里的功能你就都摸到了。更多命令行参数和服务配置见仓库里的命令行手册与HTTP 接口手册。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考