
Umi-OCR 离线OCR文字识别实战指南免费开源、截图与批量处理一步到位【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源且完全离线运行的 OCR 文字识别工具。它不需要联网、不上传任何图片就能完成截图识别、批量图片处理、PDF 文档识别和二维码扫描生成四类任务适合看重数据隐私的个人用户、需要批量数字化的办公人员以及希望把文字识别集成进自动化流程的开发者。为什么选择离线 OCR 软件很多在线文字识别服务要求上传图片到云端存在两个麻烦隐私风险合同、病历、内部文档截图等敏感内容不宜出网使用限制部分服务需要注册、有次数配额批量处理时成本不可控。Umi-OCR 的解决思路是把识别引擎完整内置在本地特性说明完全离线识别过程不经过物理网卡图片不离开本机免费无限制代码开源无次数、无会员、无广告解压即用无需安装双击主程序即可启动引擎内置自带 OCR 引擎内置多国语言识别库支持中文、英文等多种调用方式图形界面、命令行、HTTP 接口均可驱动适用平台Windows 7/8/10/11 x64 与 Linux x64。Windows 下建议保留 Visual C 2015-2022 运行库以免主程序因缺少依赖而启动失败。三步跑起来获取、解压、启动第 1 步获取软件包三种方式任选其一下载压缩包从项目发布页获取.7z压缩包或.7z.exe自解压包后者无需额外安装压缩软件Scoop 安装Windows 用户可添加extras桶后执行scoop install extras/umi-ocr一步装好另有 Paddle 引擎版本可选源码构建适合开发者二次开发构建步骤见 README 中的构建项目章节。第 2 步解压到固定目录选择一条不含中文和空格的路径例如D:\Umi-OCR\解压。软件以数据目录 程序的方式组织运行后会在同目录生成UmiOCR-data文件夹存放配置与缓存建议整个目录一起备份。第 3 步启动并确认界面语言双击Umi-OCR.exe启动。首次运行会按系统语言自动切换界面如需手动调整进入全局设置 → 语言/Language选择目标语言后重启即可。任务一截图识别——一键提取屏幕上的文字这是使用频率最高的场景网页、文档、聊天记录里的文字框一下就能变成本地文本。操作流程打开截图OCR标签页按快捷键可在设置中自定义唤起截图鼠标划选要识别的区域松开后结果自动出现在右侧识别记录栏在预览图上直接划选复制或在记录栏中编辑、合并多条记录后复制。让结果更可用的关键设置是文本后处理不同预设对应不同排版场景排版解析方案适用场景多栏-按自然段换行报纸、双栏文档等大部分情况单栏-保留缩进代码截图保留行首缩进与行内空格单栏-无换行需要把所有语句合并成一段时不做处理保留引擎原始输出逐行调试用以上方案同时支持横排和竖排从右到左文字。识别代码时记得切到保留缩进方案行距和空格才能被正确保留方便直接粘进编辑器。任务二批量处理——一次识别几百张图片需要把一整个文件夹的扫描件、票据截图转成文字时用批量OCR标签页支持格式jpg、jpeg、jfif、png、webp、bmp、tif、tiff无数量上限一次性导入几百张图片排队处理递归导入传入文件夹路径时会包含嵌套子文件夹中的图片结果输出txt、jsonl、md、csvExcel 可打开四种格式按后续用途选择——人工校对选 txt/md程序处理选 jsonl表格归档选 csv附加能力支持任务完成后自动关机/待机适合夜间挂机跑大批量任务。忽略区域是批量识别的实用技巧如果每张图片的固定位置都有水印或 LOGO可以在识别前用右击绘制多个矩形框框内的文字块会被整体排除避免水印污染识别结果。画框时尽量放大把水印可能出现的位置全部包住。另外若图片像素特别大长图、扫描大图请在页面设置中调高限制图像边长的数值否则超大图可能被截断识别。任务三文档识别——把扫描件变成可搜索 PDF文档识别标签页面向 PDF 及电子书文件pdf、xps、epub、mobi、fb2、cbz对扫描件做 OCR对已有文本层的 PDF 直接提取文字可输出双层可搜索 PDF——原图像不变上面叠加一层不可见文字之后就能用 PDF 阅读器直接搜索、复制同样支持忽略区域常用于排除每页重复出现的页眉、页脚。典型流程整本扫描书 → 导入文档识别 → 勾选输出双层 PDF → 得到一份可以 CtrlF 的电子书。任务四二维码——扫描与生成二合一二维码标签页覆盖两个方向扫码截图、粘贴或拖入本地图片读取其中的二维码和条形码支持一图多码覆盖 QRCode、EAN13、DataMatrix、PDF417 等 19 种协议生成码输入文本即可生成二维码图片可选纠错等级等参数输出为本地图片文件。办公中把一批表格截图里的码统一扫出来这类需求直接配合批量路径传入即可完成。进阶用命令行和 HTTP 接口驱动 Umi-OCR图形界面之外Umi-OCR 还有两条程序化调用路径官方手册在 docs/README_CLI.md 与 docs/http/README.md。命令行调用入口就是主程序本身。几条高频指令# 识别单张图片或整个文件夹含子文件夹 umi-ocr --path D:/images/ # 截图识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别结果写入文件覆盖 / 追加 umi-ocr --path D:/a.png --output result.txt umi-ocr --path D:/a.png --output_append result.txt要点指令支持前缀简写如--screenshot可写成--sc命令行识别依赖软件内置的 HTTP 服务做跨进程通信默认开启仅本地环回若提示无法调用先去全局设置确认服务已允许结果输出建议用--clip或--output显式指定系统管道重定向可能失效。HTTP 接口调用把 Umi-OCR 当作一台本地识别服务器在全局设置 → 服务中确认允许 HTTP 服务默认开启需要局域网访问时把主机切到任何可用地址接口覆盖图片 OCRBase64 传图、文档识别、二维码识别与生成、命令行转发五类能力参数说明见 docs/http/api_ocr.md、docs/http/api_doc.md、docs/http/api_qrcode.md注意两点后端对并发支持较弱尽量串行调用长时间大批量连续请求偶发ECONNREFUSED重试即可恢复。常见问题自查清单遇到异常时按此表从上到下排查症状可能原因处理办法双击后程序不启动缺少 C 运行库安装 Visual C 2015-2022 运行库界面显示异常、卡顿显卡驱动或硬件加速问题更新显卡驱动或在全局设置中关闭相关加速选项识别结果乱序、断行未选对排版解析方案按任务一的方案表切换代码选单栏-保留缩进水印文字混进结果未配置忽略区域批量页右栏进入忽略区域编辑器框住水印位置超大长图只识别了一半边长限制生效调高限制图像边长数值命令行无响应HTTP 服务被禁用全局设置中允许 HTTP 服务批量任务中途卡死内存不足或单张图过大减少单次导入数量、拆分任务配置文件位于UmiOCR-data/.settingsini 格式可手动修改后执行umi-ocr --reload重新加载运行日志在UmiOCR-data/logs/下排查异常时先看最新日志。下一步行动建议今天就能做下载压缩包解压到无中文路径双击启动用快捷键截一张屏幕试试识别本周内把日常最多的任务跑通一遍——网页文字用截图识别文件归档用批量 OCR扫描件用文档识别需要自动化时先试命令行两条指令再阅读 HTTP 接口文档把识别能力接进自己的脚本或系统长期习惯留意版本更新日志及时获取引擎与功能修复。相关资源入口命令行手册docs/README_CLI.mdHTTP 接口手册docs/http/README.md各接口参数详情docs/http/api_ocr.md | docs/http/api_doc.md | docs/http/api_qrcode.md更新日志CHANGE_LOG.md多语言翻译工具链维护者用dev-tools/i18n/配置位置UmiOCR-data/.settings日志位置UmiOCR-data/logs/Umi-OCR 的价值在于把识别这件事留在本机不联网、不计费、不限量。从一张截图到一个装满扫描件的大文件夹它都给出了可以直接落地的操作路径。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考