ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

(论文速读)FSDC-DETR:一种用于小目标检测的频域-空域协同DETR

2026/8/26 17:25:59 拓冰建站 浏览量
(论文速读)FSDC-DETR:一种用于小目标检测的频域-空域协同DETR 论文题目FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object DetectionFSDC-DETR一种用于小目标检测的频域-空域协同DETR会议ECCV 2026摘要在实际应用中小目标检测仍然是一项具有挑战性的任务。尽管最近取得了进展但现有的检测器仍然受到僵化处理的限制这些处理将空间聚集与隐含的频率混叠和截断纠缠在一起导致对SOD高频分量的保存不足。为了解决这些局限性我们提出了一种频率-空间域协同检测转换器(FSDC-DETR)这是一种新的协作框架显式地建模互补的空间和频率表示。具体地说我们首先引入了双分支频率-空间自适应融合(DBFSAF)来增强频率分集并自适应地捕获频率-空域区分表示。在这些表示的基础上在混合编码器内进一步探索频率-空间交互方案以使得能够将渐进特征传播到解码器。特别是通过分流频率-空间特征融合(SFS-FF)实现了结构感知的频率-空间聚合在频率和空间表示之间建立了双向交互和渐进的跨尺度传播用于相干判别建模。同时通过频率-空间动态下采样(FSD-Down)在尺度转换期间保留信息丰富的高频响应从而在多尺度融合过程中最大限度地减少频率退化以获得精确的SOD。实验结果表明FSDC-DETR达到了最先进的性能在VisDrone-DET2019和AITODv2上分别提高了6.4和6.6的AP对于小对象分别提高了6.8和6.9 AP。代码可在https://github.com/nevereverinsomnia/FSDCDETR.上获得FSDC-DETR用频率-空间协同建模突破小目标检测瓶颈一、背景与动机小目标检测为何如此难小目标检测Small Object Detection, SOD是计算机视觉领域长期存在的挑战性任务在无人机航拍、卫星遥感、工业缺陷检测、医学影像分析等场景中有着广泛的实际需求。近年来以 DETR 为代表的端到端 Transformer 检测器凭借去除锚框和 NMS 的优雅设计在通用目标检测上取得了显著进展。RT-DETR、DEIMv2 等变体进一步提升了推理效率和收敛速度。然而这些先进检测器在面对小目标时依然表现出明显的性能瓶颈原因可以归结为以下三个层面1.1 特征表示能力不足小目标在图像中仅占极少数像素空间信息极为稀疏。随着网络层数加深特征图分辨率不断下降小目标的特征极易在层级结构中被逐渐淹没导致特征损失和表示不充分。1.2 CNN 与 ViT 的频率特性差异被忽视DEIMv2 引入了DINOv3预训练ViT 轻量CNN的双分支架构试图融合全局语义建模与局部结构提取的优势。然而这两类骨干网络在频率域上存在本质差异ViT因全局注意力的聚合机制天然表现出低通滤波特性倾向于过度平滑特征削弱局部建模能力CNN因局部感受野能天然保留更强的高频分量但全局建模能力受限。DEIMv2 仅通过通道拼接后接 1×1 卷积来融合两支特征完全没有考虑两者的频率域异质性可能导致频率混叠效应阻碍有效信息互补。【配图】论文 Figure 1四种骨干结构CNN、ViT、DEIMv2、FSDC-DETR的频率响应分析对比图。可以清晰看到CNN 频率响应集中在高频区ViT 集中在低频区DEIMv2 的融合频率响应不够丰富而 FSDC-DETR 的各通道频率响应分布更广、更均衡。1.3 多尺度融合中的频率降级问题传统的卷积下采样在进行空间缩减时会引入频率混叠伪影高频响应被无意间衰减。而高频信息目标边界、精细纹理恰恰是小目标精准定位的关键线索。主流混合编码器RT-DETR、DEIMv2等在跨尺度特征融合时均依赖传统卷积下采样缺乏对频率完整性的保护机制。二、FSDC-DETR 整体框架针对上述三大问题本文提出FSDC-DETRFrequency-Spatial Domain Collaborative Detection Transformer以 DEIMv2-L 为基础构建了一个统一的频率-空间协同检测流水线核心思路是显式地建模互补的空间表示与频率表示并在整个检测流程中持续构建、传播和保护频率感知特征。整体框架由三个关键模块构成DBFSAF双分支频率-空间自适应融合作用于双分支骨干网络的输出解决频率混叠与截断问题SFS-FF分流频率-空间特征融合作用于混合编码器实现跨尺度的频率-空间协同聚合FSD-Down频率-空间动态下采样替代传统卷积下采样在尺度转换时保护频率完整性。【配图】论文 Figure 2FSDC-DETR 整体架构图。展示了 ViT CNN 双分支骨干、DBFSAF 模块、FSC-Hybrid Encoder含 SFS-FF 和 FSD-Down以及解码器的完整数据流。三、核心创新模块详解3.1 DBFSAF双分支频率-空间自适应融合这是整个框架的第一个关键模块负责处理 HGNetv2CNN和 DINOv3ViT输出的双分支特征弥合两者的频率域鸿沟。【配图】论文 Figure 3DBFSAF 模块的详细结构图展示了 FDConv、Partial 分割、MKSRU 和 FPU 的协同工作流程。工作流程分三步第一步频率动态卷积FDConv将来自 HGNetv2 的低频特征图和来自 DINOv3 的高频特征图进行通道拼接再输入 FDConv。FDConv 能够在保持判别性高频分量的同时实现动态频率多样化增强整体特征的频谱覆盖范围。第二步Partial 通道分割通过超参数 γ 将 FDConv 的 C 通道输出做分割个通道的特征送入后续的频率-空间联合精化PFSR个通道的特征直接保留减少冗余的通道间交互。这种 Partial 设计在鲁棒性和精度之间取得了良好平衡同时降低了不必要的计算量。第三步PFSR 协同精化MKSRU FPU对分两路处理MKSRU多核空间精化单元采用 5×5 深度卷积分割后分别用不同膨胀率的 7×7 深度卷积处理捕获多尺度空间结构线索最终通过 SiLU 激活的门控机制输出空间精化特征FPU频率处理单元对频率敏感响应进行精化输出。两路特征经过 GAP Softmax 的通道注意力融合带可学习参数 α 和 β最终与保留的拼接后输出完整的频率-空间协同表示。DBFSAF 的核心价值在于它明确利用了 ViT 与 CNN 互补的频率特性通过增加频谱多样性、保护判别性高频细节、抑制冗余通道交互为后续模块提供质量更高的频率感知表示这对边界精准定位尤为重要。消融实验数据有力证明了这一点单独加入 DBFSAF 就使 VisDrone-DET2019 上的 AP 从 24.7 提升到 29.75.0APS 从 14.2 提升到 19.85.6是三个模块中单独贡献最大的。3.2 SFS-FF分流频率-空间特征融合SFS-FF 作为 FSC-Hybrid Encoder 的核心组件解决了现有混合编码器在跨尺度特征融合中隐式衰减高频分量的问题。【配图】论文 Figure 4SFS-FF 模块结构图展示了三路分流设计FFT分支、CSP空间分支、残差分支的并行处理与融合方式。给定当前尺度输入和来自更高分辨率的输入SFS-FF 的核心操作如下第一步三路分流将与经过 FSD-Down 下采样的拼接后通过 1×1 卷积分流为三路C/2 通道空间精化分支3C/8 通道频率精化分支C/8 通道残差连接分支。第二步双路并行处理频率分支对进行 FFT → Conv3×3 → IFFT在频域做卷积运算精确捕获频率结构空间分支对进行 SRM空间精化模块处理增强空间结构感知。第三步三路融合输出三路结果拼接后经 1×1 卷积输出实现了频率与空间表示的双向交互和跨尺度的渐进式传播。这种分流设计的优势在于频率分量和空间分量被显式解耦后分别精化再协同融合既保证了结构感知的精确性又不会因合并处理而导致细粒度细节被抑制。3.3 FSD-Down频率-空间动态下采样传统卷积下采样包括步长卷积、平均池化等在空间分辨率降低的同时会隐式引入频率混叠。UAV-DETR 虽然尝试了平均池化 FFT的方案但平均池化本质上是低通滤波器在进行频率建模之前就已经损失了高频信息。FSD-Down 从根本上解决了这一问题以可学习的小波分解为核心实现频率完整性的保护。【配图】论文 Figure 5FSD-Down 模块结构图展示了 DWT 分解四子带、GConv 并行处理、通道注意力融合与可学习缩放因子 ρ 的完整流程。工作机制第一步双路并行特征提取DWT 路径对输入进行 2D 离散小波变换分解为四个子带LL低频近似、LH水平高频、HL垂直高频、HH对角高频空间分辨率降为通道数变为 4C。小波变换天然无损地保留了所有频率分量GConv 路径对进行分组卷积kernel2, stride2, groupsC捕获空间结构信息同样输出的特征。第二步通道注意力计算将两路特征拼接后通过 GAP Sigmoid 计算通道注意力权重自适应地决定哪些频率子带和空间结构信息更具判别性。第三步自适应频率调制输出其中 ρ 是可学习缩放因子能够让模型自适应地强调对 SOD 最具判别性的频率模式和局部对比度。FSD-Down 的核心优势在于以小波变换替代卷积作为下采样算子从根源上杜绝了频率混叠同时通过注意力机制和可学习参数保持了高频响应的空间一致性。四、实验结果4.1 数据集VisDrone-DET201914,018 张无人机拍摄图像10 类目标平均每张图像包含 40.7 个目标实例场景密度变化极大是 SOD 的经典高难度基准AITODv228,036 张航拍图像752,745 个标注实例8 类目标平均目标尺寸仅 12.7 像素86% 的实例小于 16 像素极具挑战性。所有实验均在 800×800 输入分辨率下进行使用 8×NVIDIA H200 GPU 训练 100 个 epoch。4.2 主实验对比【配表】论文 Table 1在 VisDrone-DET2019 和 AITODv2 测试集上与主流检测器的定量对比包含 YOLOv11/12/13、D-FINE、DEIMv2、RT-DETRv4 等不同规模模型的全面比较。VisDrone-DET2019 测试集结果FSDC-DETR参数量 40.3M基于 DEIMv2-L 构建取得了31.1 AP相比基线 DEIMv2-L24.7 AP提升6.4 AP。更细粒度的指标同样表现优异AP50 达到52.3分别超越 DEIMv2-L 和 RT-DETRv4-L9.0 和 6.6个百分点AP75 从 24.6 提升至31.97.3反映出更精准的边界框定位能力APS 从 14.2 提升至 21.06.8相对提升约 48%这是最能体现小目标检测能力的核心指标。AITODv2 测试集结果FSDC-DETR 取得32.3 AP和63.9 AP50相比 DEIMv2-L 分别提升6.6 AP 和 8.2 AP50相比 RT-DETRv4-L 领先4.7 AP。小目标指标 APS 从 24.4 提升至31.36.9在极端小目标场景下的改进同样显著。值得注意的是FSDC-DETR 超越了参数量更大的 D-FINE-X62.0M26.6 AP on VisDrone、DEIMv2-X50.0M26.5 AP等规模更大的模型以适中的参数量实现了性能的全面超越。4.3 消融实验【配表】论文 Table 2三个模块DBFSAF、SFS-FF、FSD-Down的逐步消融实验结果在 VisDrone-DET2019 测试集上进行。消融实验在 VisDrone-DET2019 测试集上系统验证了三个模块的独立贡献和协同效果配置APAP50APS相对基线基线DEIMv2-L24.743.314.2— DBFSAF29.749.719.85.0 AP SFS-FF25.944.915.51.2 AP FSD-Down25.444.215.10.7 AP SFS-FF FSD-Down26.345.516.41.6 AP DBFSAF FSD-Down30.050.519.85.3 AP DBFSAF SFS-FF30.350.920.05.6 AP全部三个模块31.152.321.06.4 AP关键发现DBFSAF 是最核心的模块单独使用就贡献了 5.0 AP说明双分支频率-空间自适应融合对于解决骨干网络的频率域异质性问题效果最为直接三个模块的贡献相互独立且互补将任意两个模块组合后再加入第三个模块均有进一步提升最终三者协同达到最优的 31.1 APAPS 的持续增长从 14.2 → 19.8 → 20.0 → 21.0清晰表明频率感知建模对小目标定位精度的系统性提升。4.4 超参数消融【配表】论文 Table 3DBFSAF 中 Partial 比例超参数 γ 的敏感性分析实验。对 DBFSAF 中分割比例 γ 的敏感性分析显示γ 从 0 增大到 0.5 时AP 持续提升γ 0.5 取得最优结果31.1 AP21.0 APSγ 进一步增大至 0.625 和 1 时性能略有下降说明过度的精化会引入冗余交互。γ 0 时的明显性能下降29.7 AP vs 31.1 AP进一步验证了 PFSR 精化过程的有效性。4.5 可视化分析【配图】论文 Figure 6FSDC-DETR、RT-DETRv4、DEIMv2 在 VisDrone-DET2019 测试集上的小目标检测可视化对比橙色框为局部放大区域。【配图】论文 Figure 7FSDC-DETR、RT-DETRv4、DEIMv2 在 AITODv2 测试集上的检测可视化对比绿色框为局部放大区域。定性可视化结果与定量指标高度一致在 VisDrone-DET2019 上FSDC-DETR 的目标边界更清晰预测框与真值的对齐程度更高在复杂背景下能有效抑制误检同时保持对密集小目标的鲁棒性在 AITODv2 上FSDC-DETR 对极小实例的定位更精准在竞争方法出现漏检或误检的场景下依然保持稳定的检测性能。五、方法总结与思考FSDC-DETR 的核心贡献在于将频率感知这一视角系统地引入了 DETR 检测框架并通过三个精心设计的模块分别解决了表示构建、跨尺度传播和尺度转换保护三个阶段的频率降级问题。从更宏观的视角来看FSDC-DETR 揭示了一个重要规律SOD 的瓶颈不仅仅是看得到特征表示能力更在于保得住高频信息的保护与传播。传统检测器默认忽视的频率域恰恰是小目标检测的关键信息载体。本文的思路也提供了一种通用的改进范式识别不同骨干的频率特性差异 → 在融合阶段显式弥合频率鸿沟 → 在传播阶段协同扩散频率信息 → 在下采样阶段防止频率降级这四步思路对于未来的 SOD 研究具有较强的参考价值。实验结果在两个极具挑战性的 SOD 基准上均取得了全面的 SOTA 性能VisDrone-DET2019 上 AP 提升 6.4其中小目标 APS 提升 6.8相对提升近 48%AITODv2 上 AP 提升 6.6APS 提升 6.9充分验证了频率-空间协同建模对小目标检测的系统性增益。