
TensorRT 推理调试三件事精度丢失、性能瓶颈与图结构分析【免费下载链接】TensorRTNVIDIA® TensorRT™ is an SDK for high-performance deep learning inference on NVIDIA GPUs. This repository contains the open source components of TensorRT.项目地址: https://gitcode.com/GitHub_Trending/tens/TensorRT模型换成 FP16 或 INT8 之后输出开始飘、延迟忽高忽低、层融合后完全看不出网络还在跑什么——这三个问题几乎每个用 TensorRT 上线推理的同学都会撞上。TensorRT 本身不只是一个高性能推理 SDK它的开源组件里就藏着一条完整的调试链Polygraphy 负责精度比对与定位trtexec 负责逐层计时onnx-graphsurgeon 负责拆开看图。下面按出什么问题 → 用哪把工具 → 看什么结果的路子走一遍。精度丢了一条命令定位问题层这一节解决FP16/INT8 一开精度就掉但不知道是哪层背锅的难题。TensorRT 仓库里的 tools/Polygraphy 是一套命令行调试工具check子工具用来逐张量比较两个引擎的输出debug子工具组源码在 polygraphy/tools/debug则是精度定位的主力。其中debug precision的工作方式很直白它把网络里的层分批标记成更高精度默认 FP32后反复重建引擎用二分思路不断缩小范围最后告诉你前 N 层跑高精度精度就达标了。跑起来大致是这样polygraphy debug precision \ --model model.onnx \ --fp16 \ --check python compare_outputs.py这条命令会自动做多轮建引擎和验证--check里放你自己写的输出比对脚本作为裁判。结束时它会打印一个明确结论把最前面的几层固定成 FP32精度即可回到可接受范围。拿到结论后别急着收工量化模型里 Quantize/Dequantize 节点附近的层往往是误差热点可以顺手用debug build反复构建引擎、把产物按合格/不合格分目录归档缩小到具体某一层再上高精度。推理变慢了用 trtexec 导出逐层耗时这一节解决整体变慢了但不知道瓶颈卡在哪个算子的问题。仓库 samples/trtexec 里的 trtexec 不只是跑推理的壳子它还会测量并报告每一层也就是融合后的算子组的执行耗时天然就是一个性能分析器。加上 profile 导出参数参考trtexec --help里--exportProfile一类选项每层耗时就会落到一个 JSON 文件里打开后一眼能看出哪层占大头。常见结论无非两种某层耗时异常高可能选到了不理想的 kernel 或精度组合回到上一节的精度/精度组合上调整或者时间均匀分布在很多层上那更可能是 batch、内存拷贝的问题而不是单个算子。如果想在引擎构建阶段就盯着进度仓库里还有一个 samples/sampleProgressMonitor 示例演示了用 Progress Monitor API 给构建过程挂进度条适合封装进自己的部署脚本。模型到底做了什么把图拆开看这一节解决优化之后黑箱感太重想逐层核对网络行为的需求。tools/onnx-graphsurgeon 是 TensorRT 配套的图编辑库可以把 ONNX 网络加载成对象模型每个节点、每条边都能遍历、查询和修改改完再导回 ONNX。它最常被用在做转换前的手术——删除冗余节点、折叠常量、替换不支持的算子也可以给关键层挂上 Identity 之类的调试节点把中间张量暴露出来比对。而 Polygraphy 的debug reduce子工具实验特性则更狠它能把一个跑挂的 ONNX 模型自动压缩到最小的失败子图只保留触发问题的节点再排查就容易得多。仓库 tools/Polygraphy/examples/cli/debug 下的示例配图就直观展示了瘦身前后的对比这张图就是原模型 vs 最小失败子图的样子节点数量肉眼可见地少了一大截——调试从全图缩小到几十个节点效率完全不同。动手前先做好环境工具版本不齐是调试路上最常见的坑Polygraphy、onnx-graphsurgeon 和 TensorRT 运行时最好来自同一发布版本。仓库 docker/ 目录里提供了 ubuntu、rockylinux 等多平台 Dockerfile用官方镜像起环境最省心命令行装好后跑一下polygraphy --help确认工具链可用。另外一个容易忽视的点debug precision、debug build这类工具内部会反复重建引擎单轮不慢跑一轮完整定位可能要不少时间。把每轮的引擎文件和输出张量按目录归档好工具本身就会分 good/bad 归档出问题时可以回溯到具体某一步而不是从头再来。接下来三步上手先跑polygraphy check之类的比对脚本确认 FP32/FP16 引擎输出到底差在哪一层附近。用polygraphy debug precision二分定位需要保 FP32 的层把结论固化成 builder 上的精度设置。如果模型是跑不通而不是精度差用debug reduce拿到最小失败子图再交给 onnx-graphsurgeon 逐节点核对。工具不多但把比对—定位—缩小范围这条链走顺TensorRT 的优化黑箱基本就只剩透明的了。【免费下载链接】TensorRTNVIDIA® TensorRT™ is an SDK for high-performance deep learning inference on NVIDIA GPUs. This repository contains the open source components of TensorRT.项目地址: https://gitcode.com/GitHub_Trending/tens/TensorRT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考