OCRmyPDF给扫描件 PDF 加上可搜索文本层【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一个命令行 OCR 文字识别工具专门处理扫描版 PDF它在保留原始图像的基础上给扫描件添加一层可搜索的文本层。处理后的文件可以直接在 PDF 阅读器里搜索关键词、复制文字。下面按安装到出结果的完整流程走一遍大约 5 分钟能跑通第一个文件。 各平台安装步骤OCRmyPDF 以命令行程序的形式分发三个主流平台都有官方渠道选对应系统的命令执行即可brew install ocrmypdf # macOS apt install ocrmypdf # Debian / Ubuntu / WSL dnf install ocrmypdf # FedoraWindows 用户先装好 WSL再在其中执行apt那条命令。其他系统FreeBSD、Snap、Docker 等的路径列在 安装文档 里。装完后跑一下ocrmypdf --help确认命令可用。 第一次运行从扫描图到可搜索 PDF命令形式很简单一个输入文件一个输出文件。典型的输入长这样是扫描仪或手机拍出来的一页文档这条命令完成 OCR 识别同时把歪斜页面摆正、纠正横纵向ocrmypdf --deskew --rotate-pages scan.pdf searchable.pdf几个默认行为值得知道文本层放在原图像的正下方图像分辨率不变文字可选中、可复制位置对得上输出默认是 PDF/A 归档格式适合长期保存已有文字层的页面默认不再重复识别需要强制处理时用--force-ocr输入也可以是 jpg / png 图片会先转成 PDF 再处理️ 常用进阶选项校正倾斜与页面方向--deskew会先估计每页的倾斜角度再把整页旋转回水平--rotate-pages负责 90° / 180° 的方向问题。两者建议同时开启手机拍摄和快速扫描的文档尤其受益。多语言识别配置识别引擎是 Tesseract它提供 100 多种语言包。先装好对应语言包再用-l指定多种语言用连接ocrmypdf -l engchi-sim in.pdf out.pdf各系统能装哪些语言包、具体命令是什么见 语言配置说明。去除背景噪点泛黄的旧文档、底色发灰的扫描件可以在识别前加--clean和--remove-background先清背景再做 OCR识别结果会明显更干净。️ 处理结果长什么样运行过程中每一步的进度都会直接打在终端里扫描、识别、转 PDF/A、图像优化各阶段完成多少一目了然默认利用全部 CPU 核心并行处理几百页的文件也能稳定跑完。除了 PDF还可以加--sidecar同步导出一份纯文本ocrmypdf --sidecar out.txt input.pdf output.pdf生成的 txt 与 PDF 页面一一对应方便后续对文本做检索或二次加工。还有几个实用入口要处理整个文件夹的扫描件可以参考 批量处理文档思路是把选项配好后对目录内每个文件循环调用所有选项的完整说明以ocrmypdf --help输出为准安全、性能、插件等专题都在 docs/ 目录的对应章节里下一步挑一份手头的扫描 PDF执行ocrmypdf input.pdf output.pdf在阅读器里搜索一个关键词验证文本层是否就位之后再按上面的进阶选项逐项加。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考