公司动态
Umi-OCR 双层PDF转换:离线免费,从首次上手到批量自动化的完整指南
Umi-OCR 双层PDF转换离线免费从首次上手到批量自动化的完整指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR从扫描版PDF里复制一句话你会发现选中工具连一个字符都框不住——这份只可远观的文档正是很多档案、合同和教材电子化后的尴尬处境。Umi-OCR 是一款免费、离线运行的OCR工具能把扫描PDF批量转成可搜索、可复制的双层PDF全程无需联网也不向任何云端发送文件。双层PDF如何被电脑读懂离线可搜索文档的原理扫描PDF对计算机来说就是一摞照片每个字只是若干像素的堆砌所以搜索框里永远查无此词复制按钮也形同虚设。双层PDF的做法是在原图之上附加一条隐形的字幕轨——画面你看到的一像素都不变但每一页都挂着一份机器能读的文字轨。CtrlF 查的是字幕轨复制粘贴取的也是字幕轨而打印出来的依旧是原始扫描画面。处理方式全文搜索复制文字原始版式是否依赖网络纯扫描PDF无法无法原样保留否识别后只存文本可以可以基本丢失多数工具需要Umi-OCR 双层PDF可以可以原样保留否引擎装在本地 识别引擎是以本地插件形式随软件分发的PaddleOCR、RapidOCR 两种可选断网环境下同样工作——这对不能出内网的资料尤其重要。4步快速上手从扫描件到可搜索PDF的最短路径解压启动。拿到Umi-OCR_Rapid_v2.1.5.7z后解压双击Umi-OCR.exe即可运行没有安装向导。放入文件。打开文档识别标签页把PDF直接拖进左侧文件列表pdf、xps、epub、mobi、fb2、cbz都支持几十个文件一次拖入也没问题。配置并开跑。右侧把保存格式选为双层可搜索PDF识别语言切到文档对应的语言点击开始任务。验收。打开输出目录里生成的文件按 CtrlF 搜一个你确定存在的词——能命中说明文字轨已经生效。 只想要纯文字、不在乎版式的场景保存格式可改选单层纯文本PDF文件会小得多。按场景调参语言、版式与体积的关键配置处理中英混排的论文与教材语言库是最先要动的开关默认配置未必覆盖文档主体语言切到对应的多国语言库繁中、日、韩、俄等均已内置后准确率差距很明显。处理双栏排版的报纸、期刊保持排版解析为多栏-按自然段换行软件会先分栏、再按阅读顺序拼接段落导出的文本基本不需要二次整理。而扫描版代码、日志文档请改选单栏-保留缩进行首空格与层级缩进会被完整保留。处理大文件与超长文档用OCR页数起始/结束跳过封面、目录等无用页面只对目标区间跑识别若扫描件分辨率极高适当调低限制图像边长可明显提速。带页眉、页码的文档再用忽略区域框出页眉页脚并指定生效页码范围正文会干净一个档次。进阶用HTTP接口把整个文件夹批量转完手动拖文件只适合个位数批量就该交给接口。先确认全局设置中已允许HTTP服务默认开启本机端口1224然后上传、轮询状态、取下载链接、清理任务四步走完import requests, time B http://127.0.0.1:1224 with open(scan.pdf, rb) as f: tid requests.post(f{B}/api/doc/upload, files{file: f}, data{json: {tbpu.parser: multi_para}}).json()[data] while not requests.post(f{B}/api/doc/result, json{id: tid}).json()[is_done]: time.sleep(1) url requests.post(f{B}/api/doc/download, json{id: tid, file_types: [pdfLayered]}).json()[data] open(searchable.pdf, wb).write(requests.get(f{B}{url}).content) requests.get(f{B}/api/doc/clear/{tid})把这段套进文件循环一个文件夹的扫描件几小时内就能全部完成。上传时json字段还能带上忽略区域、页数范围等参数效果与图形界面一致。结果除pdfLayered外还能导出txt、csv、jsonl方便喂给下游流程不手动清理的任务会在 24 小时后自动释放。完整的请求/响应定义见 HTTP接口详细说明。转换前的避坑清单最容易让任务失败的三个配置⚠️ 这三个坑都在任务开始前就能排掉比事后查日志省事得多加密PDF不填密码任务会一直等下去。带文档密码的PDF必须在参数里填入密码再启动任务否则状态会停留在等待或直接失败——上传前确认一下文件是否加密。旧版本处理含旋转页面的文档会错位。页面旋转相关的坐标与提取问题分别在 v2.1.2、v2.1.5 修复过详见 更新日志使用 v2.1.5 或更新版本可一并避开这两类坑。低配机器上高并发调接口。后端对并发支持较弱并行请求容易得到连接被拒的报错且长时间连续大批量调用偶发失败顺序执行、失败重试是更稳的姿势。内存方面引擎默认控制在系统总内存一半以内低配机器可在全局设置里调低线程数与内存上限宁慢勿崩。v2.1.5 起异常日志会写入UmiOCR-data/logs目录真出了问题按页码定位比盲猜快得多。现在就转一份把剩下的交给自动化整条工作流其实就一句话拖入文件 → 选双层PDF → 等任务完成 → 取回可搜索文档离线、免费、版式不变。现在就去解压挑一份最头疼的扫描件按上面 4 步走一遍十几分钟后第一份可搜索文档就会出现在输出目录里。转完之后值得顺手探索的还有两个隐藏入口截图OCR快捷键截屏即识别适合网页里的零散文本以及二维码标签页19种码制的识别与生成。想更进一步把 Umi-OCR 嵌进自己的脚本里参考 命令行调用手册 即可。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考