ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

图像融合任务在目标检测中的性能评估与深度思考

2026/8/30 7:45:39 拓冰建站 浏览量
图像融合任务在目标检测中的性能评估与深度思考 图像融合任务在目标检测中的性能评估与深度思考融合图像能够有效保留红外图像中的显著性目标与可见光图像中的纹理细节如何通过下游实验进行验证我们将分享实现细节。目前可以把图像融合任务在目标检测中的性能评估分为以下几种情况方法内容评价①基于现有目标检测官方开源的基于COCO预训练模型如YOLOv8直接对融合图像进行检测基于检测的结果直接与数据集中的标签度量评价指标COCO中的80个检测类别与对应融合数据集中的标签不一致只能检测公共的类别比如人、车等②直接用某些方法中联合下游任务在对应目标检测数据集中重新训练过的模型来进行检测虽然很方便但部分方法微调过的检测模型没有开源不同人的实现方式不同不太方便直接进行测试③基于对应融合数据集中的可见光图像或者红外图像来单独重新训练目标检测模型用于融合图像的检测只针对单个模态训练的检测模型无法有效利用另外一个模态的信息可能导致融合图像的检测精度弱于某个单模态下的检测结果④针对每种图像融合方法得到的融合图像单独训练一个目标检测模型用它的性能来评估融合图像在下游任务中的表现每种融合方法训练一个目标检测模型主要的缺点是时间开销大、复杂又繁琐且融合图像的优势是多维的感觉优化时好像在不断调整检测模型送入的融合图像虽然有差异但很容易照成指标差距不会太过显著等情况⑤选择一种具有代表性且针对下游任务本身进行的融合方法以它的融合图像作为统一参考仅训练一个目标检测模型作为基准用它来评估检测性能很方便测试也可控统一的条件下更能体现出不同融合方法的差距不足就是选择的方法是否有代表性是否融合图像要和它一致才能表现出更好的性能深度思考第一种方法 直接基于开源的公开数据集模型下训练的检测模型做检测感觉是可行的但是标签不一致会导致度量指标等挺复杂、不方便的而且度量的类别有限只能检测出公共的类别不过感觉这样的方法更加公平更能体现出融合图像在下游任务中的表现但是这样操作的认可度可能千人千面由于模型都是在可见光场景下训练的部分场景可能导致融合图像表现不如可见光图像。第二种方法专门针对图像融合下游任务训练过的检测模型来做下游任务的评估挺好的但是大部分方法似乎没有开源即便开源了测试起来也挺费劲的如果能简化使用的流程也挺不错的。第三种方法单个模态下训练的模型可能会导致融合图像的检测结果在部分场景低于单个模态下的表现这样会让人质疑融合的必要性第四种方法这种方法感觉可以但是会很复杂、繁琐。而且如果是这样做的研究者百分之90%不会开源全部方法下的检测模型所以我自己感觉不是很必要。而且融合图像的优势是多样化的都有相同的检测标签做约束它会通过不同的路径去优化检测模型本身而不是关注输入的好坏。虽然输入的融合图像是不同的但是不同融合图像的表现差异没有那么巨大的鸿沟可能导致在标签的约束下每种方法的融合性能差距不显著。因此我感觉没办法很好的去评估不同融合方法在下游任务中的表现可能它也能很好的评估下游任务中的性能但是我自己是不太推荐这种方法。第五种方法如果能够选择一种与下游任务很相关、具有代表性的融合方法且你自己设计的融合方法没有基于它作为Baseline去生成融合图像的话那么选择一个这样统一的融合标准去训练检测模型然后用它来统一度量下游任务中的性能感觉挺公平的。难点之一就在于选择的方法是否具有代表性、是否与下游任务相关唯一担忧的就是检测性能是否会限制于你的融合结果与该方法融合结果更相似的时才能呈现出更好的性能。总结我个人更加倾向于第1、2、5种方法可能有部分人会倾向于第4种方法如果是做学术研究的话应该还是要考虑两个模态才行最好选择2、4、5来做只要言之有理即可接受。融合图像在YOLOv8目标检测中的性能评估与实现以第五种方法为例代码:https://github.com/yidamyth/IF_Yolov8概览首先从 M3FD 数据集中选取红外IR与可见光VIS图像对采用具有代表性的 SeAFusion 方法生成融合图像作为下游目标检测评估的基准输入。以融合图像及其对应的原始目标标注为训练数据构建并训练 YOLOv8-s 目标检测模型以确保检测网络结构与训练策略的一致性。在保持相同检测模型设置不变的前提下将训练得到的模型用于不同融合方法生成融合图像的目标检测测试从而通过检测性能差异评估各类图像融合方法对下游目标检测任务的影响。数据集数据来源M3FD训练集共计 3900 张样本。下载链接https://github.com/JinyuanLiu-CV/TarDAL方法与参考融合方法SeAFusion — “Image fusion in the loop of high-level vision tasks: A semantic-aware real-time infrared and visible image fusion network”。代码https://github.com/Linfeng-Tang/SeAFusion目标检测Ultralytics YOLOv8使用官方yolov8s结构。文档https://docs.ultralytics.com/zh/models/yolov8/#yolov8-usage-examples实验结果与详细方法见论文“Joint multi-view embedding with progressive multi-scale alignment for unaligned infrared-visible image fusion”ME-PMA。代码https://github.com/yidamyth/ME-PMA运行说明train.py训练脚本修改data.yaml配置文件后直接运行该代码得到可训练模型并得到对应权重。test.py运行脚本用于评估/计算指标包括mAP、precision、recall 等。predict.py运行脚本直接得到对应目标检测结果结果将保存在对应runs目录下。数据结构data.yaml为配置文件注意根据你的真实路径修改对应data.yaml中的path路径。基于SeAFusion融合结果构建的训练集下载链接: https://pan.baidu.com/s/5uZCNUqHD6dZW2NL2ofvA_w 请放到./IF_Yolov8/Datasets/M3FD/images/train。想要基于Vis或者Ir图像训练目标检测模型在上面的M3FD数据集中下载即可替换对应的images/train文件。基于其它融合方法训练目标检测模型把对应方法的融合结果替换训练集中的图像即可。# data.yaml path: /Users/yida/Desktop/MyGIthub/MyGitHub/IF_Yolov8/Datasets/M3FD # 数据集根目录 train: images/train # 训练图像目录 val: images/train # 验证图像目录 test: images/test # 测试图像目录 # 数据目录 Datasets/M3FD/ images/ train/ # 融合后或用于训练的图像 val/ # 验证/测试图像 labels/ train/ # 对应每张图像的 .txtYOLO 格式 val/ # 对应每张图像的 .txtYOLO 格式环境与依赖推荐 Python 版本与核心依赖安装如下# Oursconda create-nIF_Yolov8python3.9.18 conda activate IF_Yolov8 pipinstalltorch2.4.1torchvision0.19.1 pipinstall-Uultralytics# 运行环境可参考YOLO系列的官方运行环境https://docs.ultralytics.com/zh/models/yolov8模型选择在训练脚本train.py中修改对应的模型即可方便各位适用不同模型提供了可选择的n | s | m | l的Yolov8权重权重 x 可下载https://pan.baidu.com/s/5uZCNUqHD6dZW2NL2ofvA_wmodel YOLO(“yolov8s.pt”)致谢与引用详细实验结果见论文“Joint multi-view embedding with progressive multi-scale alignment for unaligned infrared-visible image fusion”ME-PMA。代码与说明https://github.com/yidamyth/ME-PMA对于直接或间接采用本项目方法或实验设置的工作欢迎引用我们的论文若在下游任务实验中严格遵循本文的配置进行评估请直接引用本文或在文中明确说明实验设置来源或实验设置参考本工作即可。任何问题欢迎提对应的Issue(▽)尽可能第一时间回复大家。引用 BibTeXarticle{2026_ME-PMA, title {Joint multi-view embedding with progressive multi-scale alignment for unaligned infrared-visible image fusion}, author {Chen, Yida and Zhang, Yafei and Li, Huafeng and Yu, Zhengtao and Liu, Yu}, journal {Information Fusion}, volume {128}, pages {103960}, year {2026}, doi {10.1016/j.inffus.2025.103960} }