公司动态
Umi-OCR完整攻略:免费离线识别,截图、批量图片与扫描PDF一站搞定
Umi-OCR完整攻略免费离线识别截图、批量图片与扫描PDF一站搞定【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR同事甩过来一份扫描版PDF合同说帮我看看第三页那条款。你全选、复制屏幕却只回你一句无法从此PDF复制文字。转头想找在线识别网站要么文件超了大小限制、要么免费额度早被用完更要命的是——这份合同得先传到别人的服务器上。这种看得到却摸不到的憋屈正是今天的主角存在的理由。Umi-OCR是一款免费、开源、完全离线的OCR软件它把文字识别引擎整个塞进你的电脑里解压即用、不用联网截图识别、批量图片识别、PDF扫描件识别三大场景一把抓你的图片和文档全程不离开本机硬盘。这篇文章就按真实的使用旅程从跑起来讲到玩得转让你读完就能上手。第一章 解压即用三分钟把离线OCR请进门先说清楚一个概念为什么能离线因为Umi-OCR把识别引擎直接打包进了软件本体图像解析、文字提取全部在你的电脑上本地完成不需要把图片发到任何服务器。这对处理合同、病历、证件这类敏感材料的人来说几乎是刚需。上手过程简单到不像话三步从项目发布页下载.7z压缩包或者.7z.exe自解压包电脑没装压缩软件就选它。解压到任意目录比如D:/Tools/Umi-OCR。路径里尽量避免中文和空格能少碰很多莫名其妙的兼容问题。双击Umi-OCR.exeLinux 下运行umi-ocr.sh启动。软件本体由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置——像浏览器的标签栏一样想用哪个点哪个还能锁定常用标签防止误关。第一次启动会自动跟随系统语言想手动改随时去全局设置里换。一个小提醒如果电脑装了杀毒软件建议先把软件目录加进白名单。因为它内置了本地OCR引擎和运行库部分杀软会误报提前加白能省掉后续很多为什么闪退的烦恼。第二章 截图OCR屏幕上的字随抓随用日常最高频的场景就是看到一段文字想立刻复制。打开截图OCR标签页按下快捷键唤起截图框划出目标区域识别结果马上出现在右侧记录栏里。几个实测好用的小习惯不需要截图也能识别在聊天窗口里复制一张图片回到Umi-OCR直接粘贴它照认不误。结果可以二次编辑右侧记录栏里的文字能直接改错、划选多条一起复制识别完顺手就能整理成你要的格式。竖排文字自动处理排版解析会自动识别横排和从右到左的竖排文本前提是OCR引擎本身支持竖排。排版方案给识别结果排好队再输出OCR引擎吐出来的文字往往是散装的谁先谁后、怎么换行全靠排版解析来安排。在设置里可以切换多种预设方案我帮你划一下重点方案适用场景多栏-按自然段换行两栏/三栏的论文、书籍自动按段落断行大多数场景选它就对多栏-总是换行每句独立成行方便后续按行处理多栏-无换行强制整段合并成一行单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理OCR引擎的原始输出其中单栏-保留缩进值得单独表扬把代码截图扔进去缩进结构基本能保住配合截图OCR简直是程序员的日常福利。下面的预览对比图就来自项目文档左侧是原截图右侧是排版解析后的文本用来校对代码非常直观。截图识别是开胃菜真正体现效率的在后面。第三章 批量图片OCR几百张图一夜跑完水印自动隐身遇到几十上百张截图、扫描件、相册照片一张张截屏识别就太亏了。切到批量OCR标签页把图片拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式一次拖几百张也没有数量上限。点下开始任务右侧会逐张显示文件耗时、置信度和识别结果。任务跑完可以按需导出成txt、jsonl、md、csv四种格式其中csv可以直接用Excel打开。它还支持任务完成后自动关机或待机——睡前扔进去几百张图醒来直接拿结果。忽略区域让水印、页眉页脚自动隐身批量识别有个高频痛点图片角落的水印、LOGO、页眉页脚每次都会混进识别结果里得人工手动删。Umi-OCR的忽略区域功能就是为这个设计的。在批量识别页的右侧设置里进入忽略区域编辑器按住右键在图片上绘制矩形框把水印可能出现的位置全部框住识别时这些区域内的文字就会被自动排除。做学术论文批量转换时把统一的页眉页脚一次框掉输出会干净很多。这里有个必须记住的机制只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。所以画框时宁可大一点把水印所有可能出现的位置都包住否则漏框一次结果里就混进一行杂音。如果你的图片特别长、特别大识别结果缺行漏字可以去文字识别设置里调高限制图像边长。别盲目放大原图——过度放大会增加噪声反而降低准确率。第四章 文档识别扫描版PDF从此可搜索如果说前面是热身文档识别就是压轴。它支持pdf、xps、epub、mobi、fb2、cbz六种格式其中PDF扫描件是最典型的应用场景。底层逻辑可以概括成三步解析 → 识别 → 重组。PDF先被拆开区分出本来就有的文本层和需要OCR的扫描图片层扫描图片交给本地OCR引擎逐页识别最后按阅读顺序重新拼装输出成你指定的格式。有两个亮点值得展开双层可搜索PDF对扫描版PDF做OCR后输出底层是原图、上层是透明文字的双层PDF。外观和原扫描件一模一样但里面的文字可以搜索、复制、划线。给公司做合同归档、给学校做论文数字化这个功能都能直接顶上去。灵活的提取模式Umi-OCR会优先提取PDF自带的文本层速度快、零误差只有遇到纯扫描页才自动切到OCR。你也可以主动选择整页强制OCR或反过来只提取原文本。v2.1.2起还支持输出单层纯文本PDF想要体积小、好编辑的文件就选它。文档识别同样支持忽略区域还能按页码范围设置用来排除扫描件的页眉页脚也支持任务完成后的自动关机。如果你手头有一堆扫描版书要转成可搜索存档这个标签页能帮你省下大量人工。顺带一提如果你见过PDF页面旋转后文本错位的bug请务必用v2.1.5以上版本这个问题已修复。微调两个旋钮再开一条进阶通道界面语言和识别语言库是两回事Umi-OCR的界面支持中文、繁体中文、英文、日文、俄语、葡萄牙语等多种语言由社区译者协作维护。但要注意界面语言管按钮菜单长什么样识别语言库管OCR引擎认哪种文字。识别语言可以在各标签页的文字识别设置里单独选择或下载。比如你的界面用中文、日常却识别日文书籍二者完全可以搭配使用互不干扰。截屏闪烁、界面错位换渲染器如果截图时界面闪烁或者错位多半是显卡渲染兼容问题。去全局设置 → 界面和外观 → 渲染器切换不同渲染方案或者直接关闭硬件加速通常就能解决。进阶通道命令行与HTTP接口对普通用户来说图形界面已经够用但想把它嵌进自己的工作流Umi-OCR还提供两条程序化通道。命令行入口就是主程序本身# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录 umi-ocr --path D:/scans -- all_result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256指令的具体参数和简写规则见 docs/README_CLI.md 命令行手册。软件启动后还会在本地开启HTTP服务提供OCR、文档识别、二维码等接口开发者可以用几十行代码封装成自动化流程实现上传图片 → 返回JSON识别结果接口文档在 docs/http/README.md。程序默认内置Rapid-OCR兼容性好和PaddleOCR速度稍快两套引擎随时可以切换。结尾现在就差你动手了把整篇压缩成三句话Umi-OCR是一款免费、开源、离线运行的OCR工具装好就能用截图、批量、文档识别覆盖了从日常摘抄到批量归档的绝大多数场景遇到问题别慌忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。下一步建议很简单下载最新版先打开截图OCR试一次快捷键截图——感受一下屏幕上的字随抓随用是什么体验。然后再把一份扫描版PDF丢进文档识别生成双层PDF你大概率会回来把这篇文章转发给同样被PDF折磨的同事。项目的历史版本演进都记录在CHANGE_LOG.md里想了解每个版本改了什么、适合谁翻它准没错。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考