ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Umi-OCR 离线 OCR 三步上手:免费、解压即用的截图与 PDF 识别

2026/9/19 5:13:18 拓冰建站 浏览量
Umi-OCR 离线 OCR 三步上手:免费、解压即用的截图与 PDF 识别 Umi-OCR 离线 OCR 三步上手免费、解压即用的截图与 PDF 识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款开源免费的离线 OCR 工具识别全程在本地完成图片不上传任何服务器无需安装解压后直接运行。它覆盖截图识别、批量图片识别、PDF 文档识别三类高频需求这篇文章带你三步跑通第一次识别。一张表对比Umi-OCR 与在线 OCR 的差别对比维度Umi-OCR在线免费 OCR 网站付费商用 OCR费用开源免费不限次数免费额度有限超量按次收费按年授权价格不低联网要求本地识别与输出全程不联网图片需上传到对方服务器视厂商策略多需联网数据去向文件始终留在本机图片内容进入第三方服务器依厂商政策而定部署方式解压绿色包即用零配置浏览器打开网页需安装并激活授权识别对象截图、批量图片、PDF、二维码、公式以单张图片为主功能全面但成本较高三句简评当免费和不联网同时成立时可选工具其实不多这是它的第一层价值中日韩英俄等多语言模型内置在绿色包里不用额外装引擎双层可搜索 PDF 的输出能力在免费阵营里几乎没有同档对手。从解压到第一次识别三步完成截图 OCR下载.7z压缩包另有.7z.exe自解压版本解压到路径双击Umi-OCR.exe即可启动界面语言会跟随系统自动切换。启动后是全局页左侧可以看到各个功能标签页切到截图 OCR页。用全局快捷键可在设置中更改唤起截图框在屏幕上任意框选文字区域松手后自动识别结果进入记录区直接编辑或复制即可。首次识别通常十几秒完成到这里你已经拥有一台随身的离线识别设备。批量识别与 PDF 文档识别批量识别拖入目录后挂机出结果在批量 OCR页把图片拖进列表或直接选择整个目录点开始任务后逐张识别进度实时可见。识别结果支持保存为txt、jsonl、md、csvExcel等格式勾选完成后自动关机几百张图挂夜跑第二天直接收文本。PDF 识别如何生成双层可搜索 PDF把 PDF、EPUB、MOBI、XPS 等文件拖进文档识别页。程序会先判断页面有没有原生文字层有文字的直接提取没有的纯扫描件则走 OCR 引擎。保存类型勾选双层可搜索 PDF得到的文件在原有图像之上多了一层不可见文字可搜索、可划选、可复制老扫描件等于重获新生。页眉、页脚、水印、红章这类干扰内容用忽略区域处理按住右键拖出一个矩形框框内文字不再进入结果。注意被忽略的是框所覆盖的整个文本块而非单个字所以框要画得足够大把可能出现干扰的位置整体包住。进阶功能排版解析多栏论文与代码截图怎么排默认输出按文本块顺序排列遇到双栏排版或代码截图时容易读乱。设置里提供六种排版解析方案双栏论文选多栏-自然段会按阅读顺序重新归并段落代码截图选单栏-代码段缩进与行层级得以保留横排、竖排文字也有对应方案可选。命令行一条指令跑完批量识别只要设置中允许 HTTP 服务默认开启就能在终端直接调用主程序。下面这条指令会识别指定目录内的全部图片含子文件夹并把结果写入文本文件umi-ocr --path D:/invoice --output D:/text.txt更多参数用umi-ocr --help查看完整说明在 docs/README_CLI.md。HTTP 接口把识别能力接进自己的脚本面向程序调用官方提供一套完整的 HTTP 接口上传文件获取任务 ID按 ID 轮询任务状态拿到生成文件如双层可搜索 PDF的下载链接最后下载并清理任务。接口说明与 Python 示例见 docs/http/api_doc.md示例脚本 docs/http/api_doc_demo.py 可直接运行改造。想深入改动识别引擎的话可克隆源码仓库https://gitcode.com/GitHub_Trending/um/Umi-OCR。高频问题速查Q识别大尺寸长图时缺字、卡顿 A检查设置里的限制图像边长。默认 960 像素超大图会被压缩后再识别而损失细节调到 2880 是质量与速度比较均衡的取值。Q页眉、页脚、水印反复混进结果里 A用忽略区域把干扰位置整体框住。忽略单位是整个文本块框画大一点覆盖住疑似区域再在预览里核对一遍再开始任务。Q打开 PDF 选不中文字复制出来是空白 A这类文档是纯扫描件本身没有文字层。在文档识别页改用整页强制 OCR或混合模式并导出双层可搜索 PDF之后该文件即可全文检索。Q双栏版面识别后左右栏串行 A默认解析不理解多栏结构。把排版解析换成多栏-自然段输出会按阅读顺序重排左栏读完再接右栏。结语解压之后先做三件事免费、离线、免安装三件事同时满足是这类工具里少见的组合值得放在常用位置。建议按顺序动手先跑一次截图识别确认快捷键顺手再拖一批图片试txt或csv导出最后挑一个扫描版 PDF生成一份双层可搜索 PDF。参数细节查 docs/README_CLI.md接口文档看 docs/http/api_doc.md版本演进记录在 CHANGE_LOG.md。使用中遇到问题可以到项目 Issues 区提问作者响应很快。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考