公司动态
双层PDF怎么生成?免费离线Umi-OCR一键把扫描件变成可搜索文档
双层PDF怎么生成免费离线Umi-OCR一键把扫描件变成可搜索文档【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR你正在翻阅一份50页的扫描合同急着找出违约金条款于是按下 CtrlF输入关键词回车——光标转了两圈什么也没找到。别怀疑电脑坏了问题出在文件本身扫描件PDF就是一叠照片上面的字是画上去的根本不存在真正的文字。Umi-OCR——这款免费、开源、完全离线的OCR软件恰好是这类哑巴文档的解药。它的核心卖点之一就是能把扫描件PDF一键转换为双层可搜索PDF保留原貌又能搜索、复制、编辑。我花了半小时做了一次真实测试下面把完整过程、原理和坑位一次讲清楚。先搞懂你手里的PDF是哑巴还是话痨PDF分两种差别比很多人以为的大得多类型本质能不能复制搜索文本型PDF真正的文字排版✅ 可以像网页一样顺滑扫描件PDF一页页图片❌ 只能看CtrlF无效扫描件里的字就像拍进照片里的路牌——眼睛看得见手指却点不中。如果你手头有大量这类文件合同、论文、古籍、发票想全文检索只能一页页人工翻痛苦程度堪比大海捞针。而双层PDF的思路就是给每张照片贴上一层看不见的透明便利贴。双层PDF的原理图像透明文字层像贴便利贴看名字就明白双层PDF由两层构成底层原始扫描图像负责保留版面、签章、图片、表格的完整视觉外观顶层OCR识别出的透明文字层肉眼不可见但鼠标可以选中、搜索引擎可以索引、CtrlF可以命中。有个技术细节值得一说Umi-OCR写入文字层时把文字的透明度设为0也就是完全隐形源码在UmiOCR-data/py_src/ocr/output/output_pdf_layered.py。这一层文字不抢任何视觉却让整份文档从只能看变成能搜能复制。识别出的文字还会按文本块坐标精准贴合原图位置页面旋转角度也做了校正不会出现字和图对不上的尴尬。实测记录50页合同从哑巴到可搜索下面是这次实测的操作路径跟着走就能复现。第一步打开批量文档标签页。Umi-OCR v2 采用标签页框架文档识别在名为批量文档的独立标签里界面结构见UmiOCR-data/qt_res/qml/TabPages/BatchDOC/。第二步拖入扫描件PDF。支持格式很宽pdf、xps、epub、mobi、fb2、cbz还能整文件夹导入、递归读取子文件夹批量任务无上限。第三步勾选输出类型。在保存文件类型里把layered.pdf 双层可搜索文档打上勾默认开启。想同时要纯文本可以顺手勾上txt或csv一次任务产出多份结果。第四步点开始任务。引擎逐页渲染、识别、写入透明文字层完成后在原目录生成xxx.layered.pdf。用任意PDF阅读器打开CtrlF 搜违约金——这次光标精准跳到了对应页面。全程大概一杯茶的功夫而这一切发生在断网环境下。四个值得单独讲的设置别只点开始如果你想让结果更专业下面四个选项建议逐个过一遍。1. 内容提取模式决定谁说了算当一页既有图片又有原始文本时Umi-OCR给了你四种选择配置在BatchDOCConfigs.qml混合OCR/原文本图片走OCR已有文本直接提取速度与质量兼顾日常首选整页强制OCR所有内容重新识别适合原本文字层质量很差的文件仅OCR图片只处理图片原文保留不动仅拷贝原有文本完全不OCR相当于做PDF文本层复印。2. 忽略区域专治页眉页脚扫描书最烦人的就是页眉页码混进正文。在预览页右键拖拽画出矩形框框内的文字在识别时会被整块忽略——注意是忽略完整文本块不是单字符。这个功能同样适用于水印、Logo 干扰。3. 页面范围与忽略空白页只想转第2到10页设置页数范围即可。开启忽略空白页还能避免空白页被输出为错误提示。4. 输出格式不只是PDF双层PDF之外还支持txt、p.txt、csv(Excel)、jsonl多种格式。比如要建全文索引导出jsonl原始信息最合适要归档台账csv配合 Excel 事半功倍。避坑指南生成的PDF太大怎么办双层PDF同时承载高清图像和文字层体积确实会膨胀。三个实用对策压缩图像处理前用工具适当压缩扫描件画质视觉影响不大体积大幅下降识别质量优先太模糊的扫描件会影响识别率预处理时先纠偏、调对比度再用整页强制OCR善用字体子集Umi-OCR保存时默认构建字体子集并压缩deflate 垃圾回收新版已优化无新文本写入时的处理逻辑不需要你额外操心。为什么免费离线是它最大的护城河扫描件往往涉及合同、病历、论文等敏感内容把文件传上网用在线OCR等于把隐私交出去。Umi-OCR的OCR引擎完全本地运行断网可用不存在数据泄露问题内置多国语言库中英日韩都不在话下还支持命令行和HTTP接口——想把它接进自己的自动化流程参考docs/README_CLI.md和docs/http/api_doc.md即可。从只能看到可搜索可复制双层PDF让沉积的扫描档案重新拥有了生产力。这大概就是好工具的意义免费的开源软件解决最日常的痛点不联网、不收费、不绑架。动手试试吧下载一份扫描PDF拖进批量文档页勾上双层PDF点击开始——你会亲眼看到那份哑巴文档开口说话。遇到问题欢迎到项目社区交流你的使用心得。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考