ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Umi-OCR 离线OCR识别完全上手指南:从第一张截图到批量PDF处理

2026/8/15 11:38:10 拓冰建站 浏览量
Umi-OCR 离线OCR识别完全上手指南:从第一张截图到批量PDF处理

Umi-OCR 离线OCR识别完全上手指南:从第一张截图到批量PDF处理

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

如果你受够了"打开在线OCR网站→上传图片→等待→复制结果→被限制次数",那么这款免费、开源、离线运行的 OCR识别 工具,很可能是你期待已久的答案。本文的主角 Umi-OCR 不需要联网、不需要注册、解压即用,内置多国语言识别库,还能一口气处理几百张图片甚至整本扫描版PDF。接下来,我会用"先讲是什么、再教怎么用、最后说何时用"的思路,带你从零开始掌握这套完整工作流。

为什么要专门写一篇入门指南

先看一组反常识的事实:很多朋友的电脑里其实已经装了截图工具,但截图之后文字还是要靠手敲;也有人下载过"万能OCR软件",打开却发现要么收费、要么必须联网、要么识别出来乱七八糟。Umi-OCR 想解决的,正是这三个最常见的痛点——免费、离线、准确。它不是一个只能截屏的小工具,而是一整套可扩展的 OCR识别 工作台:截图识别、批量识别、PDF文档识别、二维码扫描与生成,全部集成在同一个绿色软件里。

三分钟认识这个"三合一"工作台

Umi-OCR v2 的界面由多个标签页组成,你可以像浏览器一样自由开关、排列它们。真正需要记的只有四个:

标签页一句话概括适合谁
截图OCR按下快捷键截屏,立刻转文字日常办公、读论文、抄资料
批量OCR拖入上百张图片,排队识别导出处理截图集、电子书插图
文档识别PDF/XPS/EPUB 转文本或双层PDF扫描件数字化、合同归档
全局设置语言、主题、快捷键、启动项所有人(建议先逛一圈)

小提示:软件支持 Windows 7 x64 与 Linux x64,下载.7z.7z.exe自解压包,解压后双击Umi-OCR.exe即可启动,全程不需要安装向导。

第一个实操:30秒完成一次截图识别

这是你上手最快的一个场景。切换到"截图OCR"标签页,默认截图快捷键就能唤起取景框;框选屏幕上任何区域,松开鼠标,右侧立刻出现识别结果,左下角还会显示置信度。

几个立刻能用的操作:

  • 划选复制:在左侧预览图或右侧识别结果上,直接用鼠标划选文字复制,不用逐行手抄。
  • 粘贴识别:在别处复制了图片(比如微信聊天截图),回到 Umi-OCR 直接 Ctrl+V 粘贴就能识别。
  • 文字叠加:识别出的文本会以半透明方式叠加在原图上,方便你核对哪句对应哪块,发现错误点一下就能改。

识别结果怎么排版,取决于"排版解析方案"。大多数场景选默认的多栏-按自然段换行即可;如果是代码截图,务必切换到单栏-保留缩进,否则缩进和空格会丢失。

批量处理的高效姿势:几百张图一次搞定

当图片多到一张张截屏不现实时,"批量OCR"标签页就是主力。它支持jpg/png/webp/bmp/tif等常见格式,没有数量上限,拖入整个文件夹也可以,任务完成后还能自动关机。

这里有一个普通用户很容易忽略、但实战价值极高的功能——忽略区域

  • 很多截图或扫描件带水印、页眉、页脚、LOGO,如果让 OCR识别 去"读"这些干扰元素,结果会混进大量垃圾文字。
  • 在右栏设置中打开"忽略区域"编辑器,按住鼠标右键框选干扰区,任务执行时这些区域内的文字会被整体跳过。

注意一个细节:忽略区域按"文本块"生效,而不是按单个字符。所以框选时宁可画大一点,把水印所有可能出现的位置都包住,效果才稳定。

输出的保存格式支持txtjsonlmdcsv。给个选择建议:要写报告选 md,要丢进 Excel 选 csv,要做数据分析选 jsonl。

进阶玩法:让扫描版PDF开口说话

这是 Umi-OCR 最能体现"降维打击"的地方。普通的 PDF 查看器只能看不能选字,而"文档识别"标签页支持pdf / xps / epub / mobi / fb2 / cbz六种格式,输出物可以是普通文本,也可以是双层可搜索PDF——视觉上保持原排版,底层埋了识别出的文字,以后在任意阅读器里都能直接搜索、复制。

处理扫描件时,有一个必须理解的参数:内容提取模式,它决定了"一页里既有图片又有文本"时怎么办:

模式行为适用场景
混合OCR/原文本(默认)图片区域走OCR,文本层直接拷贝大多数电子书、原生PDF
整页强制OCR整页都按图片识别扫描质量一般、想统一处理
仅OCR图片只识别页面里的图片区域图文混排的杂志
仅拷贝原有文本不识别,只提取文本层本身就是文字版PDF

其他实用参数一并介绍:页数范围可以写成1-5,10-15只处理指定页;密码选项支持带加密的文档;忽略区域同样适用于 PDF,批量处理学术论文时用来排除统一格式的页眉页脚非常顺手。

给程序员的礼物:命令行与HTTP接口

如果上面这些界面操作还不够,Umi-OCR 还开放了完整的命令行与 HTTP 接口,方便你把它嵌进自动化脚本。

命令行示例(Umi-OCR.exe是程序入口,也支持umi-ocr简写):

# 鼠标截屏并识别 umi-ocr --screenshot # 识别指定图片/文件夹,结果输出到文件 umi-ocr --path "D:/scans" --output "result.txt" # 识别二维码图片 umi-ocr --qrcode_read "D:/qrcode.png" # 生成一个二维码图片 umi-ocr --qrcode_create "https://example.com" "D:/code.png" 256

命令行依赖本地 HTTP 服务进行进程间通信,默认在全局设置中已开启(主机选"仅本地"即可,不会暴露到局域网外)。

HTTP 接口的典型流程是"上传文件 → 轮询任务状态 → 下载结果",默认端口1224。用 Python 调用图片识别只需几行:

import base64, requests with open("test.png", "rb") as f: img_b64 = base64.b64encode(f.read()).decode() res = requests.post( "http://127.0.0.1:1224/api/ocr", json={"base64": img_b64, "ocr.language": "models/config_chinese.txt"}, ) print(res.json()["data"])

完整的接口与参数说明见 docs/http/README.md 和 docs/README_CLI.md,仓库里还附带了可直接运行的 api_doc_demo.py 示例。

识别质量调优:把准确率从"够用"拉到"好用"

同样的图片,参数不同,识别结果可能天差地别。三个关键旋钮值得记住:

参数作用低配建议常规建议
限制图像边长边长超限的图片会被压缩,越大越清晰但越慢9601920~2880
纠正文本方向(cls)自动摆正倾斜、倒置的文字关闭复杂文档开启
并行任务数同时跑几个识别任务12(8GB内存)

实操经验三条:

  1. 扫描件发虚时,先在外部工具里做一次锐化+提对比度,往往比盲目调高图像边长更有效。
  2. 纯英文文档就切英文模型,中日混排再选多语言模型,别让引擎"猜"语言。
  3. 输出jsonl格式的结果里带置信度字段,批量处理完可以按置信度排序,只人工复核低分项,省时又精准。

常见问题与避坑盘点

Q:识别速度很慢,怎么办?A:优先把"限制图像边长"从2880降到960,并把并行任务数调到与内存匹配的值。识别精度损失通常很小,速度却能提升好几倍。

Q:截图时界面闪烁、UI错位?A:这是渲染器兼容性问题,到"全局设置 → 界面和外观 → 渲染器"换一种渲染方案,或关闭硬件加速。

Q:想换界面语言或主题?A:同样在全局设置里改。"语言/Language"支持简体中文、繁体中文、英文、日文、俄语等多种界面语言,主题有多套亮/暗可选。

Q:中英文界面切换后找不到设置项?A:先记住固定位置——"全局设置"标签页永远在最右,设置项顺序不随语言变化。

Q:批量任务中途断电了?A:v2.1.2 起支持"暂停任务",只要软件不退出,休眠唤醒后可以继续;但进程被杀就没法恢复了,长任务建议分小批次跑。

动手试试,然后把它变成日常习惯

回顾一下全文的三个关键点:

  1. 三合一:截图、批量、PDF 三大 OCR识别 场景都在这一个免费离线软件里,不用再装一堆工具。
  2. 两个王牌功能:忽略区域帮你踢掉水印干扰,双层PDF让扫描件变得可搜索。
  3. 可编程:命令行与 HTTP 接口让 OCR 能力可以嵌入你自己的脚本和工作流。

今天的建议很简单:下载后先截一次屏感受速度,再拖一个真实文件夹进去跑一遍批量任务,最后找一份扫描版 PDF 试试双层导出。等你熟悉了这四个标签页,很多曾经要"手动打字"的活儿,都可以放心交给它了。

版本更新与历史功能清单可以参考 CHANGE_LOG.md,遇到问题还可以在项目 Issues 中反馈。希望这篇指南能帮你真正用起来,把省下的时间花在更有价值的事情上。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考