资讯动态

Umi-OCR 离线 OCR 三步上手:截图、批量图片、扫描版 PDF 的 3 个实战场景

发布时间:2026/9/2 9:51:09 来源:尧图企业网站定制
Umi-OCR 离线 OCR 三步上手截图、批量图片、扫描版 PDF 的 3 个实战场景【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的离线 OCR 工具截图文字识别、批量图片 OCR、扫描版PDF转可搜索PDF全部在本地完成图片不上传、不联网、不注册。本文不按功能清单罗列而是跟着三个真实任务走——先把屏幕上的字转成文本再让整批图片一次出结果最后处理扫描版 PDF中间穿插识别质量调优、自动化接入和一张故障速查表。能力总览先对号入座三步跑起来这节回答它能不能干我的活、怎么开始。项目内容运行平台Windows x64Win7 及以上Linux x64 自 v2.1.3 起支持标签页截图 OCR / 批量 OCR / 文档识别 / 二维码 / 全局设置右上角可锁定标签防误关图片输入jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff图片结果输出txt, jsonl, md, csvcsv 可直接用 Excel 打开文档输入pdf, xps, epub, mobi, fb2, cbzv2.1.0 起二维码识别 19 种码制QRCode、EAN13、Code128 等也支持把文本生成码图启动只要三步下载发布包.7z压缩包或.7z.exe自解压包拿到源码的话git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。解压到纯英文路径例如D:\Tools\Umi-OCR。内置引擎和运行库可能被杀软误报启动前把目录加白名单更省事。运行Windows 双击Umi-OCR.exeLinux 执行umi-ocr.sh首次启动会跟随系统语言显示界面想改就进全局设置 → 语言/Language简中、繁中、英、日、俄、葡萄牙语等都支持。屏幕上的字怎么搬进文档截图 OCR 与粘贴识别这节解决眼前这块文字我要复制进文档的问题。打开截图OCR标签页按快捷键唤起截图框。划出文字区域结果立刻出现在右侧记录栏。没有截图需求时把聊天窗口里的图片复制后直接粘贴过来效果一样。三个细节值得留意记录栏的文字可以直接编辑划选多条记录可一次复制不用跳去编辑器整理。左侧预览栏支持鼠标划选复制方便核对单个词。识别出的文本默认经过排版解析横排、竖排从右到左都会按阅读顺序输出。论文类双栏页面一般选多栏-按自然段换行即可代码截图请切到单栏-保留缩进行首缩进和行中空格会原样保留。方案全表见后文调优一节。批量图片怎么一次出文本拖入、去水印、导出这节解决几百张图怎么快速拿到干净文本的问题。打开批量OCR标签页把图片拖进窗口没有数量上限。任务面板逐张显示耗时、置信度和结果跑完按需要导出txt、jsonl、md或csv。图片角落带水印时打开忽略区域编辑器按住右键在图上画多个矩形框包住水印可能出现的位置。忽略区域有一条容易踩坑的规则整块文本完全落进框内才会被排除只盖住一半不会生效。框宁可画大一点把水印所有可能的落位都包住。长任务也有配套设计任务完成后可自动关机/待机v2.1.2 起支持暂停任务只要软件不退出待机或休眠恢复后任务继续。扫描版 PDF 怎么变成能搜索的文件这节解决旧合同、旧书扫描件想搜想复制的问题文档识别标签页v2.1.0 起。处理思路很简单解析器会区分 PDF 里内嵌的文本层和扫描图片层。带文本的页面直接抽取快且零误差纯扫描页才交给本地 OCR 引擎。你也可以反着来整页强制 OCR或只提取原有文本。输出选哪种双层可搜索PDF保留原图上方叠一层透明文字外观不变、可搜索可复制适合归档和论文数字化。单层纯文本PDFv2.1.2 起文件更小只取文字不在乎原版外观时选它。页眉页脚位置固定按页码范围设定忽略区域一次性排掉v2.1.1 起。同样支持任务完成后自动关机/待机一柜子旧书丢进去过夜第二天收可搜索存档。识别质量怎么调引擎、语言库、排版方案这节把识别不准、顺序乱、内存高归到几个开关上。引擎全局设置里可随时切换。Rapid-OCR 兼容性好遇到报错先换它试PaddleOCR 速度稍快v2.1.4 起默认内存占用被限制在系统总内存的一半以内想再压低可在插件配置里调低线程数。界面语言 ≠ 识别语言库前者只决定菜单按钮显示什么字在各标签页文字识别设置里单独选择或下载的才是引擎认哪种文字。界面用中文、识别日文书籍完全可以并存。排版解析决定文本块谁先谁后内置选项方案什么时候用多栏-按自然段换行两栏/三栏论文、书籍按段落断行默认就选它多栏-总是换行 / 多栏-无换行每句独立成行 / 整段合并成一行单栏-按自然段换行 / 总是换行 / 无换行同上但不区分多栏布局单栏-保留缩进代码截图专用不做处理引擎原始输出三个常见性能问题按现象 → 设置位置 → 做法处理长图/大图识别不完整页面设置 → 文字识别 → 限制图像边长把数值调高别靠放大原图解决过度放大反而引入噪声。内存占用偏高插件配置PaddleOCR里调低线程数。截图闪烁、界面错位全局设置 → 界面和外观 → 渲染器换渲染方案或关闭硬件加速。怎么让脚本调用它命令行与 HTTP 接口这节解决把 Umi-OCR 接进自动化流程的问题。命令行的入口就是主程序本身Windows 为Umi-OCR.exeLinux 为umi-ocr指令依赖全局设置里的 HTTP 服务转发默认开启仅本地环回不经过物理网卡且必须用主程序调用RUN_GUI.bat这类备用启动器不支持。所有指令支持前缀简写--screenshot可写成--sc。常用写法umi-ocr --path D:/scans -- all.txt递归识别整个文件夹含子目录结果追加到all.txt--等价于覆盖写入的--output。umi-ocr --screenshot screen1 rect50,100,300,200免鼠标划选直接截取第 2 块显示器上(50,100)起点、300×200 的区域并识别配合快捷键工具就是一键识别固定区域。umi-ocr --qrcode_create https://example.com D:/qr.png 256生成 256×256 的二维码图片末尾数字也可分开指定宽高。另外注意受运行环境限制系统管道重定向符、|可能失效需要程序化收取结果时改用 HTTP 接口。完整参数见命令行手册。HTTP 接口在软件运行期间常驻OCR、文档识别、二维码都暴露了接口文档见 docs/http/api_doc.md。几十行代码就能封装成传图 → 返回 JSON的小服务接进自己的脚本或局域网工具。故障速查先对现象再对原因这节把高频问题收成一张表照着处理现象原因处理代码截图缩进全乱默认排版方案合并了空格排版解析方案切到单栏-保留缩进旋转过的扫描件文字位置错位提取原文本层时早期版本未处理页面旋转v2.1.5 已修复升级到最新版拖入数万文件的文件夹后卡住文件量大时同步加载拖慢界面v2.1.5 已改为异步加载等进度条走完再提交任务命令行指令无反应HTTP 服务未开或用了备用启动器确认全局设置里 HTTP 服务开启用主程序Umi-OCR.exe调用长图识别缺头少尾限制图像边长默认值偏低大图被压缩页面设置 → 文字识别 → 限制图像边长调高数值画了忽略区域水印文字还在矩形没把整个文本块包住或配置未保存框要完整包住文本块再确认已保存截图闪烁、界面错位显卡渲染兼容问题全局设置 → 界面和外观 → 渲染器换方案或关硬件加速最短上手清单下载解压包放到纯英文路径启动Umi-OCR.exeLinux 为umi-ocr.sh。在截图OCR页划选一次屏幕拿到第一个识别结果。批量页打开忽略区域编辑器画好水印框拖入整批图片执行任务导出txt或csv。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价