ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Umi-OCR 新手指南:3 分钟上手这款免费离线 OCR 识别工具

Umi-OCR 新手指南:3 分钟上手这款免费离线 OCR 识别工具 Umi-OCR 新手指南3 分钟上手这款免费离线 OCR 识别工具【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR想把截图、PDF 扫描件、二维码图片里的文字变成可编辑文本在线工具往往要上传文件、还要担心敏感内容外泄。Umi-OCR是一款开源、免费的离线 OCR 软件所有识别都在本地完成不联网、不上传同时支持截图识别、批量图片文字识别、PDF 文档识别和二维码扫描生成内置多国语言库中英文日等语言都能识别。一句话看懂 Umi-OCR文字被锁在图片里它负责帮你解锁它的核心价值就一句话把图片、文档里的文字变成可以复制、编辑、检索的文本而且全程在本地完成。适合办公场景会议纪要截图、网页图文、PDF 扫描页随手截图就能提取文字适合批处理场景几百张截图、扫描件一次性导入识别导出 txt 或 Excel适合隐私敏感场景合同、内部文档等不需要经过任何云端解压即用、无需安装软件体积不大支持 Windows 7 x64 和 Linux x64属于典型的绿色便携工具放哪个文件夹都能直接跑。30 秒跑起来下载、解压、启动上手 Umi-OCR 不需要安装三步就能开工下载发布包官方发行版提供.7z压缩包和.7z.exe自解压包后者在没有装压缩软件的电脑上也能直接解压解压到无中文的路径建议解压到一个全英文路径下避免个别环境的路径兼容问题启动程序Windows 下双击Umi-OCR.exeLinux 下运行umi-ocr.sh脚本即可打开后默认进入截图OCR页就像上图这样左侧是截取的图片右侧就是识别出的文字所见即所得。顶部还有一排标签页你可以按需打开批量OCR全局设置等页面左上角能切换窗口置顶右上角能锁定标签页防止误关。启动顺利之后接下来看看它到底能帮你做什么。核心能力拆解这款文字识别工具能帮你做什么截图OCR框选一下文字立刻出来打开截图OCR页后用快捷键唤起截图框选屏幕上的任意区域识别结果会自动出现在右侧记录区。也支持在别处复制一张图片、直接粘贴进来识别。左侧图片预览栏可以直接鼠标划选文字右侧记录栏还能二次编辑、划选多条记录一起复制处理完直接贴到文档或聊天窗口里。右侧记录区的右键菜单如上图集成了复制CtrlC、全选CtrlA、复制图片等常用操作识别完基本不需要离开这个窗口就能完成整理。批量OCR几百张图片一次性处理完当你有一堆图片要处理时批量OCR页就是主场。把本地图片添加进左侧列表点击开始任务即可支持的格式包括jpg, jpeg, png, webp, bmp, tiff等没有数量上限一次导入几百张也能跑。从上图可以看到顶部进度条实时显示处理进度3/1323%每张图的耗时和识别置信度都单独列出右侧记录面板展示每个文件的完整识别结果。任务完成后支持导出为txt、jsonl、md、csv(Excel)四种格式还可以设置完成后自动关机/待机适合睡前挂着跑完一整批扫描件。全局设置语言、主题、自启动等个性化选项全局设置页集中管理软件的运行参数。常用的几项一键添加桌面快捷方式和开机自启切换界面语言繁中、英语、日语等、主题多套亮/暗主题、字体和界面文字大小切换 OCR 引擎插件。除这三个主页面外软件还有两个高频标签页值得一提文档识别支持pdf, xps, epub, mobi, fb2, cbz格式能对扫描件做 OCR 或提取原文本并输出双层可搜索 PDF二维码页则支持扫码截图/粘贴/拖入图片一图多码19 种协议和根据文本生成二维码图片。这些能力组合起来可以覆盖下面这些真实场景。真实使用场景三个日常例子场景一整理会议纪要截图让文字顺序读起来顺。截图识别之后如果觉得文字顺序乱尤其是多栏排版的文档或代码截图可以在页面设置里选择OCR 文本后处理 - 排版解析方案普通文档选多栏-按自然段换行代码截图选单栏-保留缩进就能把识别结果整理成贴近原文的阅读顺序。右侧记录区还会标注每条记录的耗时和置信度右键可删除选中记录或清空全部方便反复截取同一个区域。场景二归档一批扫描的 PDF 和课件照片。把扫描 PDF 交给文档识别页识别后导出双层可搜索 PDF——既能搜到文字又保留了原扫描版式如果每页都有页眉页脚或水印用忽略区域功能框住这些位置识别时就会排除它们。散落的照片则直接丢给批量OCR导出 csv 后就能进 Excel 做进一步整理。场景三读码、出码两不误。图片里有二维码、条形码截图或拖进二维码页即可读取内容支持一图多码。反过来输入一段文本或链接也能直接生成二维码图片用于打印张贴。场景四多语言团队共用一套工具。Umi-OCR 的界面支持多国语言首次启动会跟随系统语言自动切换如上图的繁中、日语、英语窗口需要时也可在全局设置里手动修改团队里不同习惯的同事都能用自己的语言界面。让效果更好四个实用小招识别效果好不好多半取决于图片本身和几个容易忽略的设置。如果截图本身文字模糊或倾斜再强的引擎也救不回来尽量在屏幕分辨率足够时截清晰区域效果立竿见影。如果识别出来的文字顺序不对优先换排版解析方案多栏文档用多栏-按自然段换行代码截图用单栏-保留缩进保留行首缩进和行内空格横排竖排都能自动处理。如果水印、页眉页脚混进结果里在批量识别页的右栏设置中进入忽略区域编辑器按住右键画出几个矩形框把水印可能出现的位置都包住——注意框内的整个文本块才会被忽略所以框要画得足够大。如果超大的长图识别不全是触发了图像边长限制去页面设置→文字识别→限制图像边长把数值调高即可。常见坑与排障用 Umi-OCR 过程中如果遇到下面这些情况基本都能找到对应解法。如果出现截屏闪烁、界面错位通常是显卡加速渲染的问题去全局设置→界面和外观→渲染器换一个渲染方案或关闭硬件加速即可恢复。如果识别结果总是混入水印文字说明忽略区域框得太小只包住了一部分文字块——把矩形框放大到完全覆盖水印的所有可能位置重新跑任务就干净了。如果是Linux 下启动提示没有权限一般是启动脚本未加执行权限对umi-ocr.sh执行一次chmod x即可Windows 下若启动异常优先检查解压路径是否包含中文或特殊符号。如果想识别外文日文、英文等但效果不佳记得在页面设置里选择对应的语言模型库而不是只用默认库硬识。延伸与资源想从图形界面走向自动化Umi-OCR 还内置了两种调用方式命令行手册docs/README_CLI.md通过命令行指令完成截图识别、窗口控制等操作HTTP 接口手册docs/http/README.md其他程序通过网络调用图片 OCR、文档识别、二维码识别/生成等接口更新日志CHANGE_LOG.md查看各版本新增与修复内容想参与界面翻译的话dev-tools/i18n/ 目录下备好了翻译工具和《翻译步骤简易》说明获取方式下载官方发布包解压即用仓库中也附带了发行版Umi-OCR_Rapid_v2.1.5.7z如果你习惯从源码获取可以克隆仓库体验git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR下一步建议先打开截图OCR页框一块网页文字试试手感再拿几张本地图片跑一次批量OCR导出 txt——两次操作之后你就能体会到离线 OCR 在工作流里的真正效率。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表