公司动态

扫描件PDF文字识别:用Umi-OCR批量OCR手把手

📅 2026/8/26 15:08:19
扫描件PDF文字识别:用Umi-OCR批量OCR手把手
扫描件PDF文字识别用Umi-OCR批量OCR手把手【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR你打开一份扫描版合同选中一句话复制粘贴出来得到的是一堆乱码甚至什么都没有。原因很简单扫描件里的字其实全是图片必须做一次 PDF 文字识别OCR才能变成能选中的真文字。Umi-OCR 是一款免费、开源、离线的 OCR 软件解压就能用不安装、不联网。读完这篇你能把 30 份扫描版 PDF 拖进去变成可搜索的文本顺便学会排除水印、还原排版。一、先花30秒判断它是不是你要的批量识别工具手动重敲付费在线 OCRUmi-OCR成本一页几分钟30 页到崩溃按月付费文件逐个上传免费、开源联网不需要文件传到别人服务器上全程离线文件不出本机批量能力靠手多数工具限文件数/大小一次几百个文件没有数量上限适合谁经常处理扫描版合同、教材、纸质 PDF又需要把文件留在本地的你。不适合谁指望在手机上拍张照片三秒出字的人。它是桌面程序支持 Windows 764位和 Linux x64出门在外帮不上忙。二、5分钟跑通免安装配置批量识别的最短路径 ✅解压启动。项目仓库里直接带了发布包如Umi-OCR_Rapid_v2.1.5.7z解压到不含中文的路径下双击Umi-OCR.exe。你会看到带截图OCR批量OCR文档识别全局设置等标签页的窗口比如截图OCR标签页就是下面这样可以直接划选截图里的文字复制打开文档识别标签页拖入扫描版 PDF。它支持pdf, xps, epub, mobi等格式如果你手里是一堆纯图片就换批量OCR标签页。你会看到窗口里的文件列表出现你拖入的文档。看一眼右侧设置点开始任务。想保留原排版存档就选输出双层可搜索PDF只要纯文字能搜单层纯文本 PDF 也够用。你会看到进度条显示处理到第几个文件、耗时多少任务完成后输出目录里出现结果文件。到这里你已经把扫描版 PDF 变成了能搜索、能复制的文本。三、核心功能拆解忽略区域、排版解析与双层PDF输出处理水印忽略区域让页眉页脚别混进来批量识别扫描论文时每页重复的页眉、角标水印全混进识别结果把排版搅成一团。在批量OCR或文档识别页右侧设置里进入忽略区域编辑器在预览图上按住右键把水印位置框起来可以画多个框一套框会应用到任务的所有页面。任务跑完输出文本里的水印和页眉消失了正文干干净净。顺带说一句只有完全落在框内的整个文本块才会被忽略所以框宁可画大、把水印可能出现的位置都盖住也别画得紧紧包住。理顺排版排版解析方案让多栏文档读得通识别多栏的报刊、或者代码截图时输出的文字顺序是乱的一行话拆得到处都是。在页面设置里找到OCR文本后处理-排版解析方案多栏文档选多栏-按自然段换行代码截图选单栏-保留缩进。输出的文字按原版面的顺序和段落排好代码的缩进也保住了。注意这些方案都能自动处理横排和竖排但竖排文字还需要 OCR 引擎本身支持才行。强制识别整页强制OCR糊掉的页面不怕了扫描页歪斜模糊或者原 PDF 自带的文本层是坏的直接拷原文本就得不到东西。在文档识别页右侧设置里把文档内容提取切换为整页强制OCR。整页由引擎重新识别输出的是纯靠图像认出来的文字坏文本层不再捣乱。顺带说一句如果 PDF 是纯文字没有图片根本不用整页 OCR直接提取原有文本秒出结果还省 CPU。四、跑通之后才会注意到的 3 个调优细节长图、超长截图识别乱掉→ 图像边长超出了处理上限 → 在页面的设置→文字识别→限制图像边长里把数值调高比如从 1920 提到 2880。界面截屏闪烁、UI 错位→ 默认显卡加速渲染在你机器上兼容性差 → 进全局设置→界面和外观→渲染器切换到别的渲染方案或关闭硬件加速。大批量排队时人走不开→ 页面设置里有任务完成后自动关机/待机 → 打开它任务跑完电脑自动关机或休眠不用陪跑。五、高频翻车现场有人问我来答 ❓有人问PDF 里明明能选中文字为什么复制出来是乱码因为那层文本是坏的真正的字还压在图片里。切成整页强制OCR让引擎整页重认一遍就好——这是 PDF 文字识别最反直觉的一点能不能复制才作数别信看起来有文本层。有人问我把扫描分辨率提到 4000 像素怎么识别又慢又差分辨率不是越高越准。超大图像会引入噪声、拖慢速度边长控制在 1920~2880 像素之间就够了。有人问只想识别页面上几行字非得整份文档都处理吗不用打开截图OCR标签页框选那几行复制走就行其实不用走整份文档的批量流程更不用手动重敲。如果你是开发者想从脚本里调用它也不用点鼠标——命令行入口就是主程序本身把文件路径传给它即可umi-ocr --path D:/scan/contract1.pdf这行是在干嘛把文件路径交给后台程序它自动完成识别并把结果存进输出目录。现在你自己就能完成 PDF 文字识别了从拖入扫描文档、排除水印到拿到双层可搜索 PDF全都顺手。想再深入一点docs/README_CLI.md 写了完整的命令行用法docs/http/README.md 是 HTTP 接口手册。下次再遇到只可看不可搜的 PDF直接打开它把这件苦差事交出去就行。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考