公司动态

Umi-OCR 离线文字识别全攻略:截图、PDF、批量处理一篇讲透

📅 2026/8/15 13:10:04
Umi-OCR 离线文字识别全攻略:截图、PDF、批量处理一篇讲透
Umi-OCR 离线文字识别全攻略截图、PDF、批量处理一篇讲透【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR那天下班前老板丢给我一份 200 多页的扫描版合同让我把里面的字都敲出来。我盯着屏幕上发黄的 PDF手动复制了三行就崩溃了——扫描件根本没有可选中的文字。后来同事甩给我一个绿色小软件说解压就能用断网也能识别我半信半疑地双击运行10 分钟后200 页合同变成了可搜索、可复制的文字。那个软件就是Umi-OCR一款免费、开源的离线 OCR 工具专门解决图片和扫描件里没法复制文字这个老大难问题。图Umi-OCR 批量识别界面多个文件排队处理进度和置信度一目了然一、三分钟快速上手从下载到出结果在讲各种花哨功能之前先让你尝到甜头。这段只需要三步目标10 分钟内完成第一次文字识别。解压即用Umi-OCR 是绿色软件下载.7z压缩包后解压无需安装双击Umi-OCR.exe启动。完成标志程序窗口弹出标签栏上能看到截图OCR批量OCR全局设置等页面。截一张图试试打开截图OCR页按下截图快捷键框选屏幕上的任意文字区域。完成标志松开鼠标后右侧面板立刻出现识别出的文字准确率通常超过 95%。复制走人在右侧结果面板划选文字CtrlC复制即可。完成标志粘贴到任意文档中文字无乱码、顺序正确。一句话总结解压 → 截图 → 复制这就是 Umi-OCR 的全部入门门槛。我把它比作文字的扫描仪——扫一下文字就进剪贴板了。二、场景一日常办公让截图 OCR 成为肌肉记忆这一节你将获得把看到文字 → 得到文字的时间从 1 分钟压缩到 5 秒的实操方法。我在写日报、整理资料时最常用的功能就是截图 OCR。以前遇到网页上无法复制的文字要么手打要么截图发给自己再慢慢看。现在流程变成了按快捷键 → 框选 → 粘贴一气呵成。几个让效率翻倍的细节排版解析方案这是 Umi-OCR 的独门绝技。识别出文字只是第一步把文字按正确的阅读顺序排好才是关键。比如你截图一段代码选单栏-保留缩进缩进和空格会被原样保留截论文里那种左右两栏的页面选多栏-按自然段换行识别结果会自动按栏排序不会左右内容串行。截图后立即编辑右侧记录面板里的文字可以直接改还能跨多条记录划选复制。我经常用它处理截图里带水印的场景。为什么它做得更好很多在线 OCR 工具把图片传上服务器等待、下载、还担心隐私。Umi-OCR 的原理完全不同它把PaddleOCR / RapidOCR 引擎打包进了本地所有识别都在你的电脑上完成不经过网络。就像把翻译官请回家常驻而不是每次发传真出去。这也是它敢叫离线 OCR的底气。图截图 OCR 界面框选即识别右侧结果支持划选与右键操作三、场景二批量处理几百张图片和 PDF 交给队列这一节你将获得把手动处理一下午变成挂机等结果的批量任务配置方法。如果说截图 OCR 是单发点射那批量 OCR就是火力覆盖。我接手过一批 800 多张的历史资料照片如果一张张截图识别手会断。Umi-OCR 的批量处理直接解决了这个痛点。三步完成批量识别打开批量 OCR页把整个文件夹拖进文件列表支持 jpg、png、webp、tif 等常见格式。完成标志左侧列表出现所有文件且有数量统计。在右侧设置里选好输出格式txt / jsonl / md / csv 都可以还能多选。完成标志设置面板显示已选格式用逗号分隔。点击开始任务然后去喝茶。完成标志进度条推进识别结果逐条出现在记录面板完成后可一键打开输出目录。关于 PDF 识别这里重点说Umi-OCR 的文档识别是我用过的工具里最省心的。它支持 pdf、xps、epub、mobi、fb2、cbz 六种格式核心亮点是四种提取模式我第一次看到这个设计时眼前一亮源码见 UmiOCR-data/py_src/mission/mission_doc.py模式适用场景一句话理解混合模式既有扫描页又有原生文本的 PDF能拷文本的直接拷不能拷的才 OCR又快又准整页强制 OCR老扫描件、图片型 PDF不管有没有文本层统统重新识别仅图片 OCR只想处理文档里的插图文字只识别图片不碰文字层仅文本拷贝本身就是文字版 PDF纯提取秒出结果更妙的是输出双层可搜索 PDF——底层是扫描原图上层是透明识别文字。原排版、原样子一点不变但你可以全文搜索、复制、划词就像给扫描件装了隐形文字层。我拿它处理过一批 2000 页的技术文档转成双层 PDF 后放进公司知识库同事搜关键词一找一个准。配合忽略区域功能你还可以框掉页眉页脚、水印、印章这些干扰项让识别结果更干净。这一点在做学术论文数字化时尤其有用。提示PDF 页面文字旋转导致的乱序问题在 v2.1.5 版本已修复见 CHANGE_LOG.md。如果你用旧版本遇到识别结果东倒西歪先升级再排查。图识别效果预览原始图像与识别文本逐块对照方便校对参数四、场景三开发者把 OCR 装进你的工作流这一节你将获得一条命令、一个接口接入 OCR 能力的最小方案。Umi-OCR 不只是个图形软件它还内置了命令行和HTTP 接口方便接入自动化脚本。我写过一个批量处理小脚本全靠这两样东西。命令行示例在软件运行时使用# 截取屏幕指定区域并识别结果复制到剪贴板 umi-ocr --screenshot screen0 rect50,100,300,200 --clip一行注释--screenshot负责截图--clip把识别结果送进剪贴板全程无需手动操作。HTTP 接口则适合远程调用比如把服务跑在一台机器上其他设备通过接口提交任务完整文档见 docs/http/README.mdimport requests # 上传 PDF拿到任务 ID 后轮询结果即可获取双层 PDF 或 JSON 文本 resp requests.post(http://127.0.0.1:1224/api/doc/upload, files{file: open(doc.pdf, rb)}) print(resp.json())注意接口默认只允许本机访问仅本地模式想局域网调用需在全局设置里把主机切换为任何可用地址。图全局设置页HTTP 服务开关、界面语言、主题都在这里配置五、避坑与问答速查表这一节你将获得新手最容易踩的 6 个坑附一句话解法。常见问题一句话解决识别大图/长图超慢或失败批量 OCR 页设置里调高限制图像边长如 960 → 2880截图时画面闪烁、UI 错位全局设置 → 渲染器切换渲染方案或关闭硬件加速PDF 识别结果顺序乱先升级到 v2.1.5再检查排版方案是否匹配文档版式识别结果夹杂水印文字用忽略区域把水印框掉注意要框住整个文本块命令行指令没反应确保软件已启动且允许 HTTP 服务处于开启状态想识别斜着的、倒着的字开启纠正文本方向ocr.cls 参数会略微降低速度六、进阶亮点与延伸这一节你将获得值得长期关注的 4 个进阶方向。多语言界面和识别模型都支持多国语言中文、英文、日文、韩文、俄文等都能切换配置见全局设置 → 语言/Language。二维码内置扫码与生成功能支持 19 种码制协议识别结果还能走 HTTP 接口。性能调优低配机器4GB 内存把限制边长降到 960、任务并行数调成 1 即可流畅跑高配机器16GB可以开到 2880 和更高并行度。插件机制可切换不同的 OCR 引擎插件官方维护 PaddleOCR 与 RapidOCR 两套引擎见 README.md 中支持的离线 OCR 引擎。图多语言界面示意同一软件可切换简体中文、日文等不同语言环境写在最后扫描件不能复制、网页文字抠不出来、几百张图片要转文字……这些让人头大的时刻Umi-OCR 都能接住。它不要求你懂任何技术解压、截图、复制三步就能上手需要深入时命令行和接口又足够强大。现在就下载一个试试吧把桌面那张一直想提取文字的截图拖进去按下识别——从今天起再也没有敲不出来的字。项目仓库与源码https://gitcode.com/GitHub_Trending/um/Umi-OCR克隆后请先阅读根目录 README.md 的构建项目章节命令行与接口手册分别在 docs/README_CLI.md 和 docs/http/README.md。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考