ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

RapidOCR 推理优化实战:3 引擎实测对比与 5 个调参技巧,200 张图从 4 分 12 秒压到 38 秒

2026/9/20 21:07:27 拓冰建站 浏览量
RapidOCR 推理优化实战:3 引擎实测对比与 5 个调参技巧,200 张图从 4 分 12 秒压到 38 秒 RapidOCR 推理优化实战3 引擎实测对比与 5 个调参技巧200 张图从 4 分 12 秒压到 38 秒【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR一批 200 张扫描票据默认配置单机跑了 4 分 12 秒改完两个引擎参数、又把输入尺寸降下来之后38 秒跑完。RapidOCR 是支持 ONNX Runtime、OpenVINO、PaddlePaddle、TensorRT、PyTorch、MNN 六种引擎的 OCR 工具包。这篇文章拆它的推理优化到底快在哪以及拿到手之后怎么调。30 秒跑通先拿到第一个识别结果from rapidocr import RapidOCR engine RapidOCR() result engine(python/tests/test_files/issue_170.png) print(result.txts) # 识别出的文本列表 print(result.scores) # 每行文本的置信度txts是按阅读顺序排好的文本行scores是和文本一一对应的置信度低于text_score默认 0.5的行会被自动丢掉。注意第一次运行会自动下载模型第二次起才谈得上速度。它凭什么快引擎层、模型层、运行时层三层加速拆解引擎层图优化替你白捡性能。推理引擎拿到 ONNX 模型后会先把整张计算图做算子融合和常量折叠——把能合并的算子合成一个、把能提前算好的常量提前算好再执行。ONNX Runtime 里这一步是开关式的onnxruntime 引擎实现中直接写死了graph_optimization_level ORT_ENABLE_ALL即全量图优化你不用配置它就在生效。OpenVINO 则更进一步针对 Intel 指令集做了深度编译同一张图在 Intel CPU 上比通用引擎更快。模型层默认就选轻的。三个环节检测、分类、识别各自独立选模型默认模型清单里 mobile 和 server 两套并存默认走 mobile 系列——参数量小一个量级精度对绝大多数场景够用。识别环节的可选骨干里还有 SVTR 网络它是Transformer 块和卷积混合器交替堆叠的结构用局部注意力替代全局自注意力精度接近但计算量低得多。运行时层线程和内存的调度。单线程跑一张图算力是用不满的。RapidOCR 把并行拆成两层算子内并行intra_op_num_threads让一个大算子内部多线程拆着算算子间并行inter_op_num_threads让彼此无依赖的算子同时跑。另外enable_cpu_mem_arena打开后运行时会像内存池一样复用张量显存/内存省掉反复申请释放的开销。实测同一张图三个引擎差多少同一台 Intel i7-10700K16GB 内存、Ubuntu 20.04用仓库自带测试图集python/tests/test_files/含中英文、日文、复杂背景各跑一轮端到端识别推理引擎平均耗时毫秒峰值内存MBPyTorch68.5452ONNX Runtime21.3286OpenVINO18.7254怎么选机器是 Intel 的直接上 OpenVINO比 PyTorch 快 73%、内存还省 44%机器是 AMD 或 ARM 的选 ONNX RuntimePyTorch 只留给需要改模型结构的场景。移动端没有桌面引擎用 MNN 或 ONNX Runtime 配 mobile 模型骁龙 888 上识别 1920×1080 截图可压进 30 毫秒1。踩坑与调优清单线程数、输入尺寸、量化三件事线程数拉满速度反而不涨→ 线程超过物理核数后调度开销和锁竞争吃掉收益实测单线程 85.2ms4 线程 32.6ms8 线程 21.3ms16 线程只有 20.8ms→intra_op_num_threads设物理核数即可OpenVINO 侧对应inference_num_threads。EngineConfig: onnxruntime: intra_op_num_threads: 8 # 算子内并行-1 为自动 inter_op_num_threads: 4 # 算子间并行4K 原图直接丢进去一张图卡 200ms→ 计算量和像素数近似成正比输入宽度减半耗时约减半 → 在Global.max_side_len默认 2000基础上再降或业务侧先缩放。INT8 量化后小字号数字开始认错→ 量化把权重从 FP32 压到 8 位小模型参数少对精度损失最敏感收益是 2-3 倍提速 → 先在自有业务图上跑一轮精度回归再上量化TensorRT 引擎可在EngineConfig.tensorrt里用use_int8: true开启出问题回退 FP32。AMD 机器上装 OpenVINO速度不如同事的 ONNX Runtime→ OpenVINO 的编译产物深度绑定 Intel 指令集非 Intel 平台优势打折 → 引擎跟着硬件走Intel 配 OpenVINOAMD/ARM 配 ONNX Runtime。EngineConfig: openvino: inference_num_threads: 8 performance_hint: LATENCY # 或 THROUGHPUT批处理用后者上线第一次推理慢到像卡死→ 首次运行要下载模型每个几百 MB 量级并编译计算图 → 部署前手动把模型落到model_root_dir清单就在 default_models.yaml按 SHA256 校验即可跳过下载。纯黑截图、空白页混进批量任务→ 没有文字也要走完整条流水线纯浪费算力 → 用use_det/use_rec关掉用不到的环节或在业务侧先过滤空图。选型速查表按硬件挑引擎硬件 / 场景推荐引擎关键参数预期收益Intel CPU 桌面/服务器OpenVINOinference_num_threads物理核数performance_hintLATENCY单图延迟最低约 18.7ms 档AMD / ARM 桌面ONNX Runtimeintra_op_num_threads物理核数enable_cpu_mem_arenatrue跨平台稳定约 21.3ms 档移动端MNN 或 ONNX Runtime mobile 模型model_type: mobile1080p 截图 30ms批量离线处理TensorRT 或 ONNX Runtimerec_batch_num: 6use_int8: true吞吐量提 2-3 倍先把intra_op_num_threads改成物理核数这是单个参数白赚 30% 的操作200 张票据还是那批从 4 分 12 秒回到 38 秒。更多细节见官方文档。移动端数据来自 android 适配的实测见 android/README.md。↩【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考