ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Umi-OCR 离线 OCR 教程:3 步跑通截图、批量图片与 PDF 文字识别

2026/9/5 23:26:44 拓冰建站 浏览量
Umi-OCR 离线 OCR 教程:3 步跑通截图、批量图片与 PDF 文字识别 Umi-OCR 离线 OCR 教程3 步跑通截图、批量图片与 PDF 文字识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 识别工具。截图、批量图片、扫描版 PDF 都能提取文字全程在本机完成不需要联网、不上传。它能帮你做什么能力典型场景截图 OCR提取网页正文、聊天截图、屏幕代码中的文字批量图片 OCR一次性识别几十张图片逐张给出文字与置信度PDF 文档识别扫描版 PDF 转可编辑文本或生成可搜索的双层 PDF二维码识别与生成读取图片中的二维码/条形码从文本生成码图忽略区域批量识别时排除水印、页眉页脚干扰命令行与 HTTP 接口从脚本、批处理或其他程序调用识别能力快速上手本节带你从获取软件包到第一次识别成功。获取从仓库根目录下载发布包Umi-OCR_Rapid_v2.1.5.7z无压缩软件可用自解压包或克隆源码git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。解压绿色免安装版解压到任意目录即可不依赖特定路径。启动双击Umi-OCR.exeLinux 版为umi-ocr.sh。首次截图识别打开「截图OCR」标签页点左侧工具栏的截屏图标在屏幕上拖出矩形框选松开后识别自动完成。取回结果右侧「记录」面板中右键文字选「复制」即可带出。核心功能逐一拆解截图 OCR 识别从屏幕到可复制文字定位单次、即时的屏幕文字提取适合网页正文与截图。操作路径进入「截图OCR」标签页 → 点截屏图标或Esc取消截图→ 拖框选区 → 结果出现在右侧「记录」区。也支持在别处复制图片后直接粘贴进来识别。识别结果可划选、编辑右键菜单提供「复制」「全选」等选项。关键参数排版解析方案默认「多栏-按自然段换行」自动处理多栏排版与换行纠正文本方向处理倾斜、倒置文字。批量图片 OCR 步骤定位一次处理本地图片文件夹不用逐张打开。操作路径「批量OCR」标签页 → 点「选择图片」可加入文件或整个文件夹支持 jpg、png、webp、tiff 等格式无数量上限→ 在右侧「设置」里确认语言与排版参数 → 点「开始任务」。顶部进度条实时显示耗时与完成进度「记录」面板逐张列出识别文本并标注每条的置信度列表可随时用「清空」重置。关键参数结果保存格式txt、csv、md 等限制图像边长识别超大长图时调高数值避免精度损失。PDF 文字识别扫描版转可编辑文本定位把扫描版 PDF 变成可编辑文本或可搜索的双层 PDF。操作路径「文档识别」标签页加入文档支持 pdf、xps、epub 等格式可多个文件一起排队。识别后按页整理为纯文本保存也可生成双层 PDF——保留原始扫描画面上面叠加文字层之后在 PDF 里直接搜索、复制版式观感不变。关键参数忽略区域排除页眉页脚文字规则与批量页一致任务完成后可设置自动关机/休眠适合夜间挂机跑大批量任务。二维码识别与生成定位图片扫码与从文本造码二者都支持。操作路径截图、粘贴或拖入图片即可读取其中的二维码、条形码支持一图多码共 19 种协议生成页输入文本即可得到码图可设置纠错等级与尺寸。调优与避坑本节列出直接影响输出质量的参数组合按文档类型对号入座。排版方案匹配文档类型。引擎先找出文字块再按你指定的方式排序换行选对方案比任何调参都有效选项适用文档说明多栏-按自然段换行报纸、网页等多栏排版自动分栏切段最为通用单栏-保留缩进代码截图、缩进文本保留原始缩进便于复制代码多栏-无换行表格数据、密集文本不额外换行输出连续文本单栏-总是换行每行独立短句每行文字后强制换行用「忽略区域」排除干扰。在批量页设置中打开忽略区域编辑器按住右键在水印、页眉页脚处画矩形框尽量画大、完全包住整块位于框内的文字会被舍弃。留意置信度。识别记录中置信度明显偏低时换更清晰的图或在「文字识别 → 限制图像边长」中调高数值。倾斜文字开方向纠偏。开启「纠正文本方向」后引擎先判断文字方向再识别准确率提升、速度略降。接入你的工作流命令行入口就是主程序本身前提是「全局设置」页允许 HTTP 服务默认开启主机选「仅本地」即可umi-ocr --screenshot umi-ocr --path D:/xxx.png --output result.txt umi-ocr --help其他程序则走 HTTP 接口默认监听127.0.0.1:1224图片识别调用 POST/api/ocrdata.format设为text即只返回纯文本curl -X POST http://127.0.0.1:1224/api/ocr -H Content-Type: application/json \ -d {base64: 图片Base64字符串, options: {data.format: text}}高频问题识别时必须联网吗不需要。所有识别由本地引擎完成断网可用命令行与接口走的也只是系统本地环回不经物理网卡。支持哪些系统Windows 7 x64 与 Linux x64绿色免安装解压即用。识别语言怎么切换在「截图OCR」或「批量OCR」的设置面板中选择简体、英文、日文、繁体等模型库混合语言文档按文字主体选语言即可。倾斜或倒置的文字能识别吗可以。开启「纠正文本方向」选项后引擎会先判断文字方向再识别。识别结果能保存到哪里默认展示在右侧「记录」面板可复制或导出用命令行时加--output参数可直接写入文本文件--output_append则追加写入。从一张截图到一批 PDFUmi-OCR 把日常最常见的文字提取场景都收在本地完成解压之后就能直接用。相关资源命令行手册 · HTTP 接口文档 · 更新日志【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考