公司动态
如何让扫描PDF支持搜索:OCRmyPDF 完整上手指南
如何让扫描PDF支持搜索OCRmyPDF 完整上手指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描仪吐出来的 PDF点开却搜不到任何一个字——这是纸质文档数字化后最头疼的问题全文检索用不了想复制一段话只能逐字重打。OCRmyPDF 是给扫描 PDF 加 OCR 文本层的命令行工具让文档可搜索、可复制原图原样保留适合处理旧合同、老论文和手机照片的用户。典型的扫描件内容都在但全是图像搜不到任何一个字30 秒装好并跑通第一条命令按你的系统复制对应的一行安装命令即可依赖会自动装齐macOSbrew install ocrmypdfDebian / Ubuntu / WSLapt install ocrmypdfFedoradnf install ocrmypdf tesseract-osd各平台更细的安装步骤见 docs/installation.md。装完不用翻文档直接跑这条最小命令ocrmypdf --deskew --rotate-pages input.pdf output.pdf它做了三件事检测并纠正页面倾斜、把横竖颠倒的页面转正、识别文字并在原图下方贴一层可搜索文本最终生成 output.pdf。处理 200 页左右的文档普通笔记本上通常一两分钟就能跑完进度全程可见执行过程中会显示并发页数、OCR 进度和最终的压缩率按处理流程看懂核心能力从校正到 PDF/A 输入端先把歪和脏处理掉扫描件歪 3° 以上识别率就会明显下降。--deskew通过检测文本基线角度把页面自动摆正--rotate-pages处理颠倒的页背景泛黄或有噪点时再加--clean、--remove-background清理对旧报纸、泛黄存档这类文档改善尤其明显。一份老式打字机文档的扫描页正是这类校正功能的主要处理对象 核心转换生成能贴回原位的双层 PDF识别由 Tesseract 引擎完成支持 100 多种语言中英混排文档用-l chi_simeng一次指定即可语言包安装方法见 docs/languages.md。它和多数同类工具的区别在于文本层按原文排版位置逐字放置复制出来的文字顺序是对的不会变成堆在页底的一大段。需要纯文本时加个参数就行ocrmypdf --sidecar out.txt input.pdf output.pdf--sidecar会额外输出一份纯文本方便直接编辑或做数据统计。 输出端默认 PDF/A还能顺带瘦身默认输出符合 ISO 标准的 PDF/A适合长期归档。输入若是高分辨率扫描件--optimize会重新压缩图像输出文件经常比输入还小ocrmypdf --optimize 3 input.pdf output.pdf等级 0–3 越高压缩越狠归档场景用 3 通常没问题。实战场景批量档案与单张手机照片的参数组合场景一一柜扫描档案批量 OCR重度。文件夹里几百个 PDF套一层循环批量处理多核默认并行跑完原文件不动ocr_前缀的就是可搜索版本for f in *.pdf; do ocrmypdf --deskew $f ocr_$f done2000 页的档案库四核机器上一小时左右能过完中途断电重跑不会弄坏原文件。场景二手机拍的合同转正存档轻量。手机拍摄角度随意倾斜、方向问题一条命令解决输入是图片也没关系ocrmypdf --deskew --rotate-pages photo.jpg document.pdf输出就是可直接放进档案系统的双层 PDF拍照、处理、归档一步到位。进阶调优识别不准、校验失败的对策如果扫描件分辨率低、识别出的文字缺字断句加上--image-dpi 300它会先把页面按 300 DPI 重新光栅化再识别。如果输出反复通不过 PDF/A 校验多半是原文件带了不支持的字体或元数据先用--output-type none跳过校验定位问题再决定是修原件还是换输出格式。底层机制它调用了哪些引擎OCRmyPDF 自己不实现识别算法文字识别交给 Tesseract 引擎倾斜校正与背景清理调用 unpaperPDF/A 转换和校验由 Ghostscript 完成各组件的版本探测在 src/ocrmypdf/_exec/tesseract.py 等模块里。它的角色更像调度器——把光栅化、识别、排版、压缩串成一条流水线每步之后校验结果出错时直接报告是哪一环失败。想查全部选项就跑ocrmypdf --help也可以克隆源码看看实现git clone https://gitcode.com/GitHub_Trending/oc/OCRmyPDF下次扫描仪再吐出一摞搜不到字的 PDF跑一行命令它们就能被搜索、被复制了。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考