ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

免费离线识别截图、图片与PDF文字:Umi-OCR完整实战指南

2026/8/31 8:02:02 拓冰建站 浏览量
免费离线识别截图、图片与PDF文字:Umi-OCR完整实战指南 免费离线识别截图、图片与PDF文字Umi-OCR完整实战指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR是一款开源、免费的离线文字识别工具截图识别、批量图片OCR、PDF文档文字提取一把梭解压即用图片数据一个字都不出内网还带命令行和HTTP接口供脚本调用。Umi-OCR离线文字识别快速上手5分钟跑起来Windows 版免安装、解压即用从仓库 Releases 下载.7z发布包解压后双击Umi-OCR.exe。系统要求很低Windows7 x64 及以上、Linux x64 都支持。习惯用包管理器的话Scoop 两行搞定scoop bucket add extras scoop install extras/umi-ocr # Rapid引擎换 umi-ocr-paddle 即装 Paddle 引擎Linux 下需先部署运行库再执行umi-ocr.sh启动源码开发则直接克隆仓库git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR主界面是标签页布局截图OCR / 批量OCR / 全局设置三个标签是主要入口首次启动会按系统语言自动切换界面。看到主界面并能打开任意标签即安装成功。能力一览一张表看懂哪里用什么能力适用场景输入输出截图OCR网页、文档里快速抠文字快捷键截屏 / 粘贴图片文字、复制到剪贴板批量OCR几百张图片一次处理jpg/png/bmp/tiff等图片txt/jsonl/md/csv(Excel)文档识别扫描件转可搜索PDFpdf/xps/epub/mobi/cbz双层可搜索PDF二维码扫码 / 生成图片 / 文本码内容 / 码图片二维码模块支持 QRCode、Code128、DataMatrix、PDF417 等19种协议批量任务图片数量不设上限还能设置任务完成后自动关机。核心场景实战从一张截图到自动化一键截图识别网页文字想从网页里抠文字、对方又禁止选中时截图识别是最快的路。打开截图OCR标签页按默认快捷键框选区域右侧记录栏选中复制关键设置排版解析方案普通文字选多栏-按自然段换行最自然代码截图用单栏-保留缩进保住缩进滚动开启后可截取超出屏幕的长页识别后操作默认复制到剪贴板也可改为弹出主窗口确认预期效果识别完文字出现在右侧每条记录带置信度0~1左栏图片里还能用鼠标直接划选复制多条记录可全选一次带走。批量把图片文件夹转成txt扫描件、照片一大堆手动复制不现实在线工具还按张收费——交给批量任务。打开批量OCR标签页选择文件夹或多张文件点开始任务等进度条走完关键设置输出格式txt 最通用jsonl 方便脚本读取csv 可直接用 Excel 打开忽略区域右键画矩形框排除水印、页眉页脚注意框内只有完整的文本块才被排除框要画大一点限制图像边长超大长图被裁切时进页面设置→文字识别调高数值预期效果任务跑完生成与图片同名的 txt可设置任务结束后自动关机或休眠丢给电脑跑一夜。扫描件PDF转成可搜索的双层PDF扫描件PDF没法选中文字、CtrlF 搜不到内容用文档识别标签解决。打开文档识别标签页选择 pdf / xps / epub 文件开始任务关键点双层PDF底层原图、上层透明文字层肉眼不变但可以搜索、复制忽略区域同批量页适合排除每页重复的页眉页脚原生文本直提epub / mobi 等自带文字的文件直接提取不走OCR预期效果新PDF打开如常但文字可选中、可全文检索。命令行脚本化自动跑任务想把识别塞进自动化流程就调用命令行入口完整手册见 docs/README_CLI.mdumi-ocr --path D:/images --clip # 批量识别文件夹并复制到剪贴板 umi-ocr --output D:/result.txt # 结果写入文件--为追加 umi-ocr --screenshot screen0 rect50,100,300,200 # 固定区域截屏识别参数说明--path可传多个路径或文件夹递归搜子文件夹指令支持前缀简写--sc即--screenshot拿不准时先跑umi-ocr --help看全部选项。预期效果只要后台开着HTTP服务默认开启仅本地回环通信一条命令跑完一个任务批处理文件或 CI 里都能串起来。进阶配置与自动化集成引擎、CLI与HTTP想改语言、主题、开机自启全局设置标签一页搞定——快捷方式桌面/开始菜单/开机自启、界面和外观语言/主题/字体OCR插件也能在这里切换。Umi-OCR全局设置语言主题快捷方式配置如果界面截屏闪烁、UI 错位去全局设置→界面和外观的渲染器里换一种渲染方案或关闭硬件加速。想切换 OCR 引擎RapidOCR兼容性好发行版默认自带普通环境优先PaddleOCR速度稍快大批量任务更省时也可以从插件库导入 OCR 插件随时切换不用重装。想让别的程序调用它开启HTTP服务默认开启照 HTTP接口手册 走/api/ocr图片识别、文档识别流程和二维码识别/生成接口。老规矩后端对并发支持较差串行调用即可。配置文件位于UmiOCR-data/.settingsini 格式允许手动改完再用umi-ocr --reload热加载改参数不用重启软件。调优与避坑常见调优与排错性能调优引擎选择日常优先 RapidOCR赶时间换 Paddle语言库按识别内容选超大图先调高限制图像边长默认值会把长图裁掉任务分批几百张高分辨率图片分批跑顺手关掉吃内存的大户输出格式给脚本吃选 jsonl给非技术同事看选 csv高频问题命令行没反应→ 依赖HTTP服务与主进程通信确认全局设置里HTTP服务已开启默认开启、仅本地。忽略区域不生效→ 框内只排除完整文本块跨在边框上的字不剔除把框画大重画。HTTP连调偶尔报ECONNREFUSED→ 小概率抽风重新发一次请求就好别并发调用。识别不准→ 确认图片清晰换排版解析方案或换引擎对比置信度。截图闪烁、界面错位→ 全局设置里切换渲染器方案。生态与参与结构、插件与路线图发布目录结构长这样Umi-OCR ├─ Umi-OCR.exe # Windows入口 ├─ umi-ocr.sh # Linux入口 └─ UmiOCR-data ├─ main.py # 主入口 ├─ py_src # Python源码 ├─ qt_res # QT资源 ├─ plugins # 插件目录 └─ i18n # 多语言文件二次开发主要靠插件机制导入新的 OCR 引擎插件或后处理插件界面里切换即可不用改代码。翻译文件与 i18n 工具脚本在 dev-tools/i18n/也可在 Weblate 平台参与界面翻译。参与渠道仓库 Issues 提 Bug 或功能请求参与 UI 翻译协作直接提交代码 PR路线图项目长期计划中已列明的方向基于 GPU 的离线 OCR独立数学公式识别与 LaTeX 渲染表格图片识别输出 Excel兼容 macOS 等更多平台Umi-OCR 的卖点始终是免费、离线、解压即用三件事。今天就去试试截图快捷键、再跑一个批量任务踩坑先翻仓库 Issues顺手点个 Star。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考