
Umi-OCR 本地 OCR 工作流截图、批量图片、扫描 PDF 三条识别路径【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的文字识别工具截图识别、批量图片 OCR、扫描 PDF 转文本、二维码扫描与生成全部在本地完成图片不上传、不注册、识别不设次数上限。这篇按工作流讲先跑通一次截图拿到第一段文字再把量放大到整批图片、整本扫描 PDF最后把它接进你的自动化脚本。装好就能跑——3 分钟拿到第一段识别文字从项目 Release 页下载.7z压缩包没有解压软件就用.7z.exe自解压包解压到纯英文、无空格的路径比如D:\Tools\Umi-OCR能少踩很多兼容性问题。⚠️ 内置 OCR 引擎和运行库有时会触发杀软误报启动前顺手把目录加进白名单。Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh即可启动首次会按系统语言自动切换界面。打开截图OCR标签页按快捷键唤起截图框划一下屏幕上的文字区域右侧记录栏立刻出现识别结果——第一段文字到手。同一个窗口里还躺着二维码标签页后面讲自动化时再回来用它。从一张图到一柜子扫描件——三种识别工作流Umi-OCR 把识别按输入类型分成三条路素材从剪贴板、文件夹还是整本 PDF 来走对应的那条就行。交互式——剪贴板进、文字出截图OCR 是日常用得最多的那条。除了快捷键截图你在别处复制一张图聊天窗口里的图、网页上的图切回 Umi-OCR 直接粘贴效果一样。记录栏里的文字可以直接改划选多条记录还能一次复制省去跳到编辑器再整理的麻烦。识别出的散装文字块默认会经过排版解析横排、竖排从右到左都按阅读顺序输出具体怎么排在调优那节细讲。什么时候选这条路零散、临时、来一张识一张的文字走剪贴板最省事。批量式——拖入整个文件夹切到批量OCR标签页把图片直接拖进窗口即可没有数量上限几百张一次导入。项目支持范围输入格式jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff输出格式txt、jsonl、md、csv可直接用 Excel 打开右侧面板逐张显示每张的耗时、置信度和结果跑完按上表挑输出格式。批量图角落常带水印、LOGO会混进结果可以在右侧设置打开忽略区域编辑器按住右键画多个矩形框框住水印可能出现的位置。记住一个机制只有整个文本块完全落在框内才会被忽略按单个字符不算所以框要画大一点把水印所有可能落位都包住。什么时候选这条路手里是一堆独立图片、要一次性出文本就是批量页的活儿。文档式——扫描件变可搜索 PDFv2.1.0 起支持文档批量识别输入覆盖pdf、xps、epub、mobi、fb2、cbz扫描版 PDF 是典型场景。它的逻辑是「先挑现成的再补缺的」解析器会区分 PDF 里自带的文本层和扫描图片层自带文本的页面直接提取速度快且零识别误差只有纯扫描页才交给本地 OCR 引擎。也可以反向操作整页强制 OCR或只提取原文本。输出两种成品双层可搜索 PDF 底层保留原图、上层叠加透明文字层外观和扫描件一致但能搜索、能复制适合合同归档、论文数字化单层纯文本 PDFv2.1.2 起文件更小、方便后续编辑。文档识别也支持按页码范围设忽略区域把统一位置的页眉页脚一次排除跑完还能自动关机/待机。什么时候选这条路整本扫描文档要转成能搜、能复制的 PDF就交给它。识别质量不达标先查这三个旋钮结果不对九成是这三个地方没配对。① 换引擎。默认内置两套全局设置里随时切Rapid-OCR 兼容性好遇到识别不准或报错先换它PaddleOCR 速度稍快v2.1.4 起默认内存占用被压在系统总内存一半以内想再压低就在插件配置里调低线程数。② 选对识别语言库。界面语言和识别语言库是两回事界面语言管菜单按钮显示什么字识别语言库管 OCR 引擎认哪种文字在各标签页的「文字识别」设置里单独选或下载。界面用中文、日常识日文书籍这种组合完全成立。③ 挑对排版解析方案。OCR 引擎吐出来的是散装文本块排版解析决定谁先谁后。不确定就留默认的「多栏-按自然段换行」。方案什么时候用多栏-按自然段换行默认推荐论文/书籍多栏排版单栏-保留缩进代码截图保留行首缩进和行中空格多栏-无换行强制整段合并成一行不做处理引擎原始输出不整理性能相关的三项收在一句话里长图识别缺头少尾去「文字识别 → 限制图像边长」调高数值别靠放大原图解决内存偏高去 PaddleOCR 插件配置调低线程数截图闪烁、界面错位去「全局设置 → 界面和外观 → 渲染器」换渲染方案或关硬件加速。把它焊进你的自动化流程你手头已经有脚本想调 Umi-OCR有两条程序化通道。命令行入口就是主程序Umi-OCR.exeLinux 为umi-ocr所有指令支持前缀简写。最常用的两个组合umi-ocr --screenshot --clip截屏识别结果直接进剪贴板。umi-ocr --path D:\scans -- all.txt递归识别整个文件夹含子目录结果追加到all.txt--等价于覆盖写入。其余参数——指定屏幕区域免鼠标截图、二维码批量生成——一句话指向命令行手册。注意命令行走的是本地 HTTP 环回通信要求 HTTP 服务处于开启状态默认开启仅监听本地环回不经过物理网卡而且入口必须用主程序RUN_GUI.bat这类备用启动器不支持命令行。想要程序化稳定收结果更推荐 HTTP 接口软件运行期间本地暴露 OCR、文档识别、二维码等接口传图进去、拿 JSON 出来几十行代码就能封成一个小服务具体字段见HTTP 接口文档。踩坑速查现象原因一招解决代码缩进全乱默认排版方案会合并空格排版解析切到「单栏-保留缩进」拖入几万文件界面卡死超大文件夹一次性同步加载v2.1.5 已改异步加载等进度条跑完再操作命令行指令没反应HTTP 服务没开或入口用了备用启动器确认全局设置里 HTTP 服务开启入口用主程序Umi-OCR.exe忽略区域画了水印还在只包住文本块一半不算把整个文本块完整框住并保存配置 旋转过方向的扫描件文字错位是文档识别提取原文本层早期未处理页面旋转导致v2.1.5 已修复遇到就升级到最新版。下一步下载最新版 v2.1.5先完成一次截图识别拿到第一个结果再把批量页的忽略区域画好——这两步走完你手头任何带水印的图片或扫描版 PDF都能直接产出干净的文本。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考