公司动态
本地离线OCR快速上手指南:免费开源 Umi-OCR 让截图、批量图片与扫描版PDF全部变成可编辑文字
本地离线OCR快速上手指南免费开源 Umi-OCR 让截图、批量图片与扫描版PDF全部变成可编辑文字【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR先把结论放在最前面方便你快速判断这篇文章值不值得读下去Umi-OCR 是一款免费、开源、完全离线的文字识别软件。它把截屏识别、批量图片文字提取、PDF 文档识别、二维码生成/扫描和多国语言支持统统装进一个本地程序里不联网、不注册、不上传解压就能用。下面的内容不堆术语只按你日常最容易遇到的几个问题一节一节讲清楚。先别急着装把最近的搬字经历盘一遍说个真实场景。上个月我帮朋友整理考研复习资料几十份扫描版讲义、手机拍的书页、群聊里发的课件截图堆了满满一个文件夹。想搜一下罗尔定理到底出现在哪一页结果文件夹里全是图片和扫描 PDFCtrlF 按下去屏幕只回我一行字找不到。没办法只好一页页翻、一段段手打引用一个晚上过去眼睛酸了目录才整理到一半。如果你也经历过类似的搬字时刻——比如复制不了文字的合同、截图里想引用的一句话、一堆待归档的老照片扫描件——那 Umi-OCR 大概率就是你要找的那把本地文字剪刀。它的核心逻辑只有一句话所有文字识别都在你自己的电脑上完成图片和文档不离开硬盘。下面我用问答式带你把这款本地离线OCR过一遍一共六问六答加一个彩蛋每个问题都对应一类真实需求不是技术党这软件装起来难不难屏幕上的文字怎么最快抓下来攒了几百张图片能不能一口气处理完扫描版 PDF 复制不了怎么救识别出来的文字乱序、带水印怎么调教界面语言和性能还有哪些值得调问题一离线OCR软件解压即用三分钟快速上手先回答最让人发怵的问题Umi-OCR 是绿色软件不需要安装这也是它最省心的地方。你拿到手的只是一个压缩包全程只需要三步下载从项目发布页获取.7z压缩包如果电脑没装压缩软件就选自解压包双击自己就能解开。解压放到任意目录比如D:/Tools/Umi-OCR。唯一的小建议是路径里别带中文和空格能省掉不少莫名其妙的兼容问题。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。第一次启动软件会自动读取系统语言把界面切成对应语言。整个程序主体像浏览器的标签栏由截图OCR、批量OCR、文档识别、二维码、全局设置等标签页组成想用哪个点哪个常用的还能锁住防止误关。顺带提醒一句如果启动后闪退先检查杀毒软件的白名单。因为程序内置了本地 OCR 引擎和运行库部分杀软会误报把软件目录加进白名单能省去后面很多烦恼。问题二截图OCR识别文字一秒把屏幕上看到的字抓下来日常最高频的需求就是看到一段字想立刻复制。切到截图OCR标签页按下快捷键唤起截图框划出目标区域识别结果瞬间出现在右侧记录栏整个过程两秒都不到。这个标签页里有三个很实用的小细节不用截图也能识别在聊天窗口里复制一张图片回到 Umi-OCR 直接 CtrlV 粘贴它照样帮你把文字抠出来。结果可以二次编辑右侧记录栏里的文字能直接改错还能划选多条记录合并复制识别完顺手就整理成了你想要的格式。竖排文字不用怕排版解析会自动处理横排和从右到左的竖排文本只要 OCR 引擎本身支持竖排即可。截图识别算是开胃菜真正体现效率的还在后面。问题三批量图片文字提取几百张图一口气处理完遇到几十上百张截图、扫描件、相册照片一张张截屏就太亏了。切到批量OCR标签页把图片直接拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式一次拖几百张也没有数量上限。点下开始任务右侧会逐张显示每张图片的耗时、置信度和识别结果。任务跑完可以按需输出成txt、jsonl、md、csv四种格式——其中 csv 用 Excel 直接就能打开做资料归档很方便。如果你有深夜挂机的习惯它还支持任务完成后自动关机或待机睡前扔进去几百张图醒来直接拿结果一个字都不用你盯着。问题四扫描版PDF转可搜索文档三步实现全文可复制如果说前面是热身文档识别就是 Umi-OCR 的压轴功能。它支持pdf、xps、epub、mobi、fb2、cbz六种格式其中扫描版 PDF 是最典型的应用场景。底层逻辑可以概括成三步解析 → 识别 → 重组。PDF 先被解析引擎拆开区分出本来就带文字层的页面和只有扫描图片的页面扫描图片交给本地 OCR 引擎逐页识别最后按阅读顺序重新拼装输出成你指定的格式。有两个亮点值得展开双层可搜索 PDF这是很多人的刚需。对扫描版 PDF 做 OCR 后输出为底层是原图、上层是透明文字的双层 PDF。外观和原扫描件一模一样但里面的文字可以搜索、复制、划线。给公司做合同归档、给学校做论文数字化这个功能都能直接顶上。灵活的提取模式程序会优先提取 PDF 自带的文本层速度快、零识别误差只有遇到纯扫描页才自动切换 OCR。你也可以主动选择整页强制 OCR或者反过来只提取原文本新版还支持输出单层纯文本 PDF想要体积小、好编辑的文件时选它最合适。文档识别同样支持忽略区域可按页码范围设置用来排除扫描件的页眉页脚。家里要是有一堆扫描版书想转成可搜索存档这个标签页能帮你省下大量人工。问题五给OCR识别结果排座位顺便让水印自动隐身OCR 引擎吐出来的文字往往是散装的谁先谁后取决于排版解析怎么安排。Umi-OCR 内置了多套预设方案选对方案输出的文本才符合阅读习惯排版方案适用场景多栏-按自然段换行两栏/三栏排版的论文、书籍自动按段落断行最常用多栏-总是换行每句独立成行适合后续按行处理多栏-无换行强制整段合并成一行单栏-按自然段换行单栏文档段落自然换行单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理OCR 引擎原始输出不做任何整理其中单栏-保留缩进值得单独表扬把代码截图扔进去输出能基本保持缩进结构配合截图 OCR 简直是小程序员的福音。如果你不确定选哪个直接选**多栏-按自然段换行**就对了它能覆盖大多数场景。另一个高频痛点是图片角落的水印、LOGO、页眉页脚每次都会混进结果里。在批量识别页的忽略区域编辑器里按住右键在图上绘制矩形框把水印可能出现的位置全部框住识别时这些区域内的文字就会被自动排除。这里有个必须记住的机制只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。所以画框时宁可大一点把水印所有可能出现的位置都包住否则漏一次结果里就混进一行杂音。问题六界面语言、识别语言与性能的配置方法多语言界面一套软件多国面孔界面语言支持中文、繁体中文、英文、日文、俄语、葡萄牙语等多种由社区译者协作维护。切换路径是全局设置 → 语言/Language。这里要分清两件事界面语言和识别语言库是两码事。界面语言管按钮菜单长什么样识别语言库管 OCR 引擎认哪种文字后者可以在各标签页的文字识别设置里单独选择或下载。比如界面用中文、日常却识别日文书籍二者完全可以搭配使用。性能微调长图、内存与渲染器三个常见性能问题的应对方法识别长图/大图不完整去文字识别设置里调高限制图像边长。默认边长限制是为了平衡速度与内存遇到像素特别大的长截图适当调高即可。内存占用偏高如果用的是 PaddleOCR 插件新版起默认内存占用被限制在系统总内存的一半以内想进一步压内存可以在插件配置里调低线程数。截屏闪烁或界面错位这是显卡渲染兼容问题去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速通常能解决。彩蛋让这台文字打印机自动打工对普通用户来说图形界面已经够用但如果你想把它嵌进自己的工作流Umi-OCR 还留了两条程序化通道。命令行模式入口就是主程序本身几个常用姿势umi-ocr --screenshot --clip截屏识别结果直接进剪贴板umi-ocr --path 扫描件.png --output result.txt识别指定图片并输出到文件umi-ocr --path D:/scans -- all_result.txt识别整个文件夹含子目录。配合快捷键工具还能实现按一个键自动截指定区域并识别的骚操作。指令的完整参数和简写规则见项目内的 docs/README_CLI.md。HTTP 接口程序启动后本地 HTTP 服务提供 OCR、文档识别、二维码等接口接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成小工具实现上传图片 → 返回 JSON 识别结果的自动化流程。引擎与版本演进也值得一提软件默认内置 Rapid-OCR 引擎兼容性好与 PaddleOCR 引擎速度快一些在全局设置里随时可以切换。版本更新日志记录在 CHANGE_LOG.md——v2.1.2 加入单层纯文本 PDF 与任务暂停v2.1.3 登陆 Linux 并支持 Docker 部署v2.1.5 修复了 PDF 页面旋转导致的文本错位问题。如果你手头有旋转过方向的扫描件一定要用最新版。写在最后把复制不了从你的字典里删掉回到开头那个整理复习资料的夜晚。如果当时我手里有 Umi-OCR故事会变成这样扫描版讲义拖进文档识别几分钟后变成全文可搜索的双层 PDF手机拍的书页扔进批量 OCR导出成 csv 表格群里那张看不清的课件截图直接粘贴进截图 OCR引用文字秒到手。一晚上能做完的事压缩成了十几分钟。总结成三句话Umi-OCR 免费、开源、离线运行解压就能用截屏、批量、文档识别三大功能覆盖了从日常摘抄到批量归档的绝大多数场景遇到问题别慌排版方案、忽略区域、渲染器这几个旋钮能解决大部分麻烦。下次再收到扫描版文件或一堆带水印的图片时打开它你会发现自己已经不再需要在线工具和手动抄录了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考