ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

OCRmyPDF 多语言 OCR 配置指南:中文、日文、韩文一次搞定

2026/9/2 10:46:46 拓冰建站 浏览量
OCRmyPDF 多语言 OCR 配置指南:中文、日文、韩文一次搞定 OCRmyPDF 多语言 OCR 配置指南中文、日文、韩文一次搞定【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF周一早上日企客户发来一份扫描件你满怀期待地按下 CtrlF 搜注文書——什么都没搜到页面里根本不存在文字。这就是 OCRmyPDF 出场的时刻它给扫描 PDF 加一层肉眼看不见、却可被全文检索的文字层。本文带你配置好 Tesseract 语言包让 OCRmyPDF 多语言 OCR 稳定识别中、日、韩文扫描件。先跑通一条命令验证你的环境本节能解决的问题10 分钟内确认你的 Tesseract 和语言包真的能用。版本要求Tesseract ≥ 4.1.15.4.0 因回归问题不受支持。先查版本再装一个中文语言包tesseract --version sudo apt-get install tesseract-ocr-chi-sim装好语言包后对任意一份中文扫描 PDF 跑下面这条命令-l就是指定语言ocrmypdf -l chi_sim in.pdf out.pdf跑完提取文字验证能搜到字就通了pdftotext out.pdf - | head选对语言代码一张表讲清 ISO 639-2 对照本节能解决的问题一眼查准语言代码别再为zh还是chi_sim报错纠结。Tesseract 的语言包相当于一本本方言词典——每种语言一本认不认得这种字全看装了哪本。代码遵循 ISO 639-2 Alpha-3 标准代码语言什么时候用eng英文默认语言中英混排时显式加上更稳chi_sim简体中文大陆简体中文文档最高频chi_tra繁体中文港台繁体文档jpn日文常规横排日文jpn_vert日文竖排传统竖排、从右往左的书页kor韩文韩文文档多语言页面用拼接-l chi_simjpn表示这页可能出现中文和日文。注意jpn_vert这类变体是独立语言包装完jpn不等于装了对且它要配合竖排专用的 PSM 才好用文末急救站有现成命令。按你的系统挑一条路装本节能解决的问题不用翻遍官方文档直接按你的系统抄对应命令。Ubuntu 走 APT搜一下有哪些包可装再装目标语言apt-cache search tesseract-ocr sudo apt-get install tesseract-ocr-chi-sim tesseract-ocr-jpn包名规律简单tesseract-ocr-加代码下划线装几个语言装几条。Fedora 走 DNFFedora 的包名带langpack中缀注意下划线写法dnf search tesseract sudo dnf install tesseract-langpack-chi_sim tesseract-langpack-kor装完tesseract --list-langs能看到chi_sim就对了。macOS 一把梭Homebrew 提供全量语言包懒得挑就全装brew install tesseract-lang一个包解决所有语言问题代价是体积不小。Windows 手动放文件官方安装包默认只有英文.traineddata要自己从 tessdata 仓库下载丢进安装目录的tessdata文件夹如C:\Program Files\Tesseract-OCR\tessdata\。Docker 扩一层镜像官方镜像已自带英、德、简中、法、葡、西六种语言缺别的就派生一个镜像补装FROM jbarlow83/ocrmypdf USER root RUN apt-get update apt-get install -y tesseract-ocr-kor USER app调参旋钮PSM、OEM 与阈值到底拧哪个本节能解决的问题文档认不准时知道先拧哪个旋钮、拧到哪。真正影响效果的旋钮就三颗。PSM页面阅读策略告诉 Tesseract 怎么读这一页——整页扫、单栏读还是捡散字。常规合同用默认3单栏长文拧到6避免页眉页脚被并进正文图文混排、文字零散拧到11位置保留最完整。OEM识别引擎0传统引擎、1LSTM 神经网络、2混合、3自动。日韩文建议显式给1LSTM 对表意文字的特征建模更足。阈值处理Tesseract 5.0 支持决定灰度图怎么二值化。adaptive-otsu适合背景明暗不均的扫描件sauvola适合字色与纸色接近的低对比度文档。这条命令对中文文档用稀疏文字模式让零散文字不被插图冲散ocrmypdf -l chi_sim --tesseract-pagesegmode 11 in.pdf out.pdf这条命令给低对比度旧扫描开 Sauvola 阈值再配英文中文双语识别ocrmypdf -l chi_simeng --tesseract-thresholding sauvola old.pdf out.pdf三颗旋钮的推荐组合直接抄中英混排合同默认 PSM 3 -l chi_simeng起步复杂图文排版PSM 11 --tesseract-oem 1老旧低质扫描件--tesseract-thresholding sauvola翻车急救站本节能解决的问题三种最常见的翻车一条命令一个方案修好。语言包明明装了却报 Language not available九成是代码写错简中是chi_sim不是zh也不是cn。tesseract --list-langs对照输出确认拼写再重跑同一条 ocrmypdf 命令即可。几百兆的大图一跑就卡死Tesseract 单边像素上限是 32767超限的图会拖死进程。默认已开启自动下采样被拖慢时给它更多时间ocrmypdf -l chi_sim --tesseract-downsample-large-images --tesseract-timeout 600 big.pdf out.pdf跑完看日志里该页耗时是否远低于 600 秒说明下采样生效。竖排日文识别出来全是乱序横排语言包jpn按从左到右一行行读竖排文档必然错位。换jpn_vert并用 PSM 5 逐列读ocrmypdf -l jpn_vert --tesseract-pagesegmode 5 vert.pdf out.pdf验证方法用pdftotext提取后词序应按从上到下、从右到左排列。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考