目标检测模型相关结构总结)
深度学习17目标检测模型相关结构总结总结模型中常用结构的含义与作用不定时更新1. 常用术语自顶向下Top-Down从“整体 → 局部”先有全局再逐步细化 自底向上Bottom-Up从“局部 → 整体”先有细节再逐步组合 上采样Upsample图变大分辨率 ↑细节更密集常用于恢复空间信息 下采样Downsample图变小分辨率 ↓信息更抽象常用于提取语义2. 模型基础卷积Convolution 提取特征最核心池化Pooling 降采样、压缩信息全连接FC 做决策分类/回归2.1 卷积 用一个“小窗口”在图像上滑动提取局部特征2.2 池化层 在局部区域取一个“代表值”常见Max Pool最大值Avg Pool平均值2.3 全连接层 把所有特征“拉直”后做决策3. 模型结构模型中的常见结构3.1 特征金字塔FPNFPNFeature Pyramid Network及其演进结构通常被称为模型的**“颈部”Neck。它的核心作用是特征融合**即解决卷积神经网络中“深层语义强但位置糊”与“浅层位置精但语义弱”的矛盾。结构3.2 PANet (Path Aggregation Network) —— 目前 YOLO 系列的标配这是 FPN 最直接、最成功的继承者也是 YOLOv5 到 YOLOv11 默认使用的结构。结构特点在 FPN 的“自顶向下”Top-Down路径之后额外增加了一个**“自底向上”Bottom-Up**的路径。作用分析缩短定位信息路径在 FPN 中底层的精确位置信息要传到最顶层P5需要经过几十甚至上百层卷积。PANet 通过快捷的自底向上路径让顶层特征也能快速获得底层的精确位置信息。提升大目标精度这对大目标的定位非常有帮助。使用场景通用目标检测平衡大小目标的综合性能。3.3 BiFPN (Bidirectional Feature Pyramid Network) —— 追求极致效率由 Google 在 EfficientDet 中提出。结构特点双向融合 跳层连接在同一层级之间增加连接跳过不必要的节点。加权特征融合并不是简单的 Concat拼接或 Add相加而是给不同层的特征分配不同的学习权重Weighted Fusion。作用分析自动筛选重要特征模型会发现某些层对当前目标的贡献更大从而给它更大的权重。轻量化用更少的参数量实现了比 PANet 更强的特征融合能力。使用场景对模型体积和推理延迟极其敏感但又需要高精度的移动端或嵌入式场景。3.4 ASFF (Adaptively Spatial Feature Fusion) —— 解决尺度不一致这是一种更“细粒度”的融合方式。结构特点它在特征融合时会让每个层级都去观察其他所有层级的信息。例如P3 层在融合时会同时参考 P4 和 P5 经过缩放后的特征并为每个像素点计算一个空间权重。作用分析过滤干扰如果 P5 层的某个区域对 P3 检测小目标有干扰ASFF 的空间权重会将其抑制。极致的小目标优化对于像乒乓球这种物体ASFF 能有效利用全局信息来辅助定位减少背景干扰。使用场景极小目标检测或者背景极其复杂的场景。3.3 NAS-FPN —— AI 设计的结构利用神经架构搜索NAS技术自动寻找的最佳融合方式。结构特点其连接方式往往“不按套路出牌”看起来杂乱无章没有明显的上下行规律是经过数千次实验跑出来的最优拓扑。作用分析性能上限极高在特定任务上通常能打破人工设计的性能瓶颈。缺点结构复杂不符合人类的直观理解且对硬件推理加速如 TensorRT不一定友好。4. 骨干网络在目标检测任务中**骨干网络Backbone**是整个算法的“特征提取器”。它的质量直接决定了下游任务检测、分割等的上限。为了让你清晰地掌握这一领域我将骨干网络按照经典卷积、轻量化、检测专用、以及现代Transformer/State-Space四大类进行详细整理。4.1 经典通用型Classic CNNs这类网络最初为图像分类设计但因其强大的通用特征提取能力成为了检测领域的基石。4.2 轻量化型Lightweight Backbones主要用于移动端、嵌入式设备如手机、无人机。4.3 检测专用/高效型Detection-Oriented这类网络伴随 YOLO 等实时检测框架发展专门针对检测性能进行了优化。4.4. 现代 SOTA 型Transformers Hybrid进入 2024-2026 年Backbone 的主流正向“全局建模”和“大核卷积”演进。