三步把扫描 PDF 变成可搜索文本OCRmyPDF 入门指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF手上有扫描版 PDF 时常见的麻烦是文字选不中、复制不出来全文搜索关键词也搜不到而且扫描件常常歪斜字都对不齐。OCRmyPDF 是一个开源的命令行 OCR 工具输入扫描 PDF 或图片它做文字识别输出一份可搜索的 PDF——外观仍是原扫描图但底层可以选中和复制文字。一分钟看懂 OCRmyPDF 能做什么输入扫描版 PDF或 JPG、PNG 等图片文件单页和多页都可以处理逐页调用 Tesseract 引擎做文字识别可选地纠正页面歪斜、自动转正页面方向输出一份双层可搜索 PDF表面是原始扫描图像底层是可选中、可搜索的文本层如还需要纯文本可用--sidecar参数同时导出文本文件。安装三选一按平台macOSbrew install ocrmypdfDebian / Ubuntu 系 Linuxapt install ocrmypdfWindowsWSL在 WSL 的 Ubuntu 终端中执行apt install ocrmypdf三种方式都会带上 Tesseract 等依赖装完用ocrmypdf --version验证即可。三个示例从第一次识别到进阶如何完成第一次识别基础 OCR目标把一个扫描 PDF 变成可搜索文档。命令ocrmypdf scan.pdf scan_ocr.pdf预期结果生成scan_ocr.pdf在 PDF 阅读器里可以选中、复制其中的文字也能用全文搜索定位关键词。如何纠正歪斜扫描件并自动转正页面方向目标识别的同时把倾斜的扫描图像摆正并把颠倒、横放的页面转到正常方向。命令ocrmypdf --deskew --rotate-pages skewed.pdf fixed.pdf预期结果fixed.pdf中每页文字基本水平倒置的页面被自动旋转过来整体识别准确率高于不加校正的处理。如何做多语言识别并导出纯文本旁车文件目标处理中英混合文档同时得到一份可直接编辑的纯文本。命令ocrmypdf -l engchi_sim --sidecar mixed.pdf mixed_ocr.pdf预期结果生成mixed_ocr.pdf并在同目录得到同名mixed_ocr.txt里面是全部识别出的文字可直接粘贴进编辑器或导入其他工具。高频参数速查参数作用什么时候用--deskew检测倾斜角度并把页面图像摆正扫描件明显歪斜、字行不水平时--rotate-pages自动判断并转正页面方向文档中有倒置或横放的页面时-l指定识别语言多个语言用连接文档不是纯英文时--sidecar额外输出同名纯文本文件需要单独导出文字做编辑或分析时--optimize对输出文件做压缩优化0–3 级别越高越激进输出 PDF 体积过大、需要存档时--clean去除扫描噪点和背景杂色处理老旧扫描件、手机拍照件时常见问题与解法识别不准怎么办先确认-l指定了正确的语言代码再检查输入质量扫描件最好达到 300 DPI模糊、低分辨率的图先重新扫描或换更清晰的源文件。语言代码怎么选在终端运行tesseract --list-langs查看本机已安装的语言包常见代码如eng英语、chi_sim简体中文、fra法语完整列表见 语言支持文档。输出文件太大怎么办加--optimize 2或--optimize 3压缩图像再输出如果处理的是大量黑白文档安装 jbig2enc 编码器还能进一步减小体积。装好之后一条命令就能完成识别上面的三个示例覆盖了日常处理扫描件的大部分场景。需要查看完整参数列表或补充语言包时参考仓库内的 安装文档 即可。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考