免费离线OCR软件Umi-OCR实战从随手截图到双层PDF识别的完整指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上周五下午同事把十几张微信群截图和一份扫描版合同一起甩给我说下班前要把文字整理出来。对着屏幕手打肯定来不及在线识别工具又不敢用——合同涉及敏感信息。后来我靠Umi-OCR这个免费开源的离线OCR软件截图、批量、PDF文档识别一条龙半小时交差。这篇按先用起来 → 用顺手 → 用到专业的主线走把完整路径和踩过的坑一次讲透。为什么偏偏是它一个免费离线的全场景OCR先说我挑工具的标准不联网、不要钱、能批量、格式广。市面上在线OCR一抓一大把但敏感文件不能上传云端这一条就把它们全毙了。Umi-OCR 把识别引擎做成本地插件RapidOCR、PaddleOCR 两种可选断网照跑识别全程不出本机——这是它区别于一堆在线工具的核心卖点。它覆盖的也不只是图片转文字这一件事对比项在线OCR工具Umi-OCR网络依赖必须联网大文件常排队全程离线断网可用隐私文件上传到云端数据不出本机价格免费额度有限常要会员完全免费、开源批量能力逐张上传效率低几百张一次拖入场景覆盖一般只有图片识别截图/批量/PDF/二维码/公式安装上更省心下载Umi-OCR_Rapid_v2.1.5.7z压缩包解压后双击Umi-OCR.exe就能启动没有安装向导也没有环境配置绿色运行适合在别人的电脑上即用即走。别急着研究参数先让它跑起来。三分钟上手解压即用第一次截图OCR截图识别是日常最高频的入口——看到什么就想提取什么几秒钟搞定。照着三步做启动软件打开截图OCR标签页。主界面是标签页结构默认就停在这一页。按快捷键唤起截图框选任意区域。也可以直接在别处复制一张图回到这里 CtrlV 粘贴识别。右侧识别记录栏出结果。鼠标划选就能复制右键菜单里还能复制图片、显示/隐藏文字方便对照原文核对。为什么选快捷键而不是拖文件因为它的触发路径最短唤起截图 → 框选 → 出结果三步全是键盘鼠标的连续动作赶时间时这个体验差异是决定性的。这里有个小知识识别出来的文字顺序对不对取决于文本后处理——排版解析方案。默认的多栏-按自然段换行会自动识别分栏布局、还原阅读顺序大部分场景不用动它。单张截图只是热身真正省时间的是批量。进阶一批量OCR整个文件夹一次搞定截图适合单张遇到几十张聊天记录图、合同扫描图就该用批量OCR了。操作同样很直白把图片文件夹直接拖进左侧列表一次拖入几百张也没压力支持 jpg、png、webp、bmp、tif 等常见格式。右侧设置里确认两件事——识别语言选对排版方案用默认然后点开始任务进度条会逐张显示处理状态和置信度。批量场景里最容易被忽略的是忽略区域如果你的图片右上角常年挂着水印或LOGO识别结果就会被这些杂讯污染。点进忽略区域编辑器按住右键在对应位置画几个矩形框这些区域内的文字就会被跳过——画框时尽量画大一点完整包住水印可能出现的位置。识别完成后结果可以一键保存为 txt、jsonl、md、csv(Excel) 等格式方便对接下游。挂机党还可以勾选任务完成后自动关机/待机。图片能批量那几百页的扫描PDF呢这就是文档识别的主场。进阶二文档识别把扫描PDF变成能搜索的文字扫描版PDF本质上是图片的合订本文字烙在像素里不能复制、不能搜索。文档识别页就是为它准备的而且不止支持 PDFpdf、xps、epub、mobi、fb2、cbz都能导入电子书阅读的顺带需求也一并解决了。操作链路和批量OCR几乎一样区别在输出格式上双层可搜索PDF底层保留扫描原图上层叠加透明文字层。你看到的还是原图但复制、搜索、摘录全部变为可能这是档案数字化的主流方案。单层纯文本PDF只想要纯文字、不在乎版式的场景v2.1.2 起支持文件更小、打开更快。记住一点双层PDF的文字是透明不可见层肉眼看到的永远是原图观感、打印效果不受影响——但电脑已经认识它了。转换前建议做一个小动作很多文档每页有页眉页码会混进正文。在忽略区域里框出页眉页脚的位置还能指定生效的页码范围最终文本的整洁度能上一个台阶。开始任务后右侧会逐页显示进度单页通常一两秒。完成后去输出目录打开生成的PDF先用 CtrlF 搜一个文档里的词验证文本可搜索是否生效再随机抽几页目测图像清晰度确认无误就算验收通过。结果能看但想让识别文本更漂亮还有几个开关值得调。让结果更漂亮四个值得调一遍的开关很多人会用默认配置一路点到底其实右侧设置面板里藏着几个好用与能用的分水岭设置项默认值推荐值适用场景识别语言简体中文按文档语言选中英混排选含英文的配置准确率肉眼可见提升排版解析方案多栏-按自然段换行单栏-保留缩进扫描版代码文档可保留行首缩进与空格图像压缩画质优先约80%对文件体积敏感的场合体积与画质的平衡点限制图像边长适中调高像素超大的长图或大图防止识别不全另外几个全局参数在全局设置页界面语言、主题、字体大小、开机自启、渲染器截屏闪烁或UI错位时切换渲染方案还有内存与线程的控制——识别引擎默认把内存占用控制在系统总内存的一半以内低配机器可以再调低宁慢勿崩。配置都懂了接下来是避坑时间。新手最常踩的四个坑坑一转换后文字和图像位置错位。现象是文字层和原图对不上。原因老版本在解析带旋转的页面时出现过坐标问题v2.1.2 集中修复过相关内容。解决先升级到 v2.1.5 再重试若依旧检查文档是否含旋转页面或改用整页强制OCR模式。坑二PDF加密或损坏导致任务卡死。现象任务一直停在等待状态。原因加密PDF需要密码才能解析。解决加密文档在参数中填写文档密码损坏文件则去看日志——v2.1.5 起日志会保存到UmiOCR-data/logs目录能帮你定位到具体是哪一页出了问题。坑三大批量任务吃满内存。现象一次塞几百页大文件时机器变卡。原因识别引擎默认内存上限是系统总内存的一半。解决在设置里调低引擎线程数和内存上限让任务慢慢跑也别把机器跑崩。坑四以为双层PDF等于可编辑文档。现象双击PDF想改文字没有光标。原因双层PDF的文字层是不可见文本适合检索与复制不代表能像Word一样编辑。解决动手转换前先想清楚目标格式要可编辑文档就另选方案能省下大量返工时间。下一步还能玩什么到这里你已经掌握了一套完整的扫描件数字化工作流。顺着这几条线还能继续深入命令行调用截图、识图、指定路径识别都能用命令触发还能配合快捷键工具做范围截图。入口在 docs/README_CLI.md例如umi-ocr --screenshot、umi-ocr --clipboard、umi-ocr --path D:/xxx.png。HTTP接口自动化完整接口见 docs/http/api_doc.md接口跑在http://127.0.0.1:1224流程是上传文件 → 轮询任务状态 → 下载结果 → 清理任务写个脚本就能把整个文件夹批量转成双层PDF还能输出 txt、csv、jsonl 对接下游系统。二维码工具内置扫码与生成功能支持 19 种码制算是个意外加分项。二次开发如果想基于源码研究实现可以 clone 仓库git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。技术更迭很快但保留图像、叠加文字的思路依然稳妥。折腾完你多半会想——免费的离线工具凭什么比一堆在线会员还顶用别问问就是早该换。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考