多尺度特征融合：为检测学习更好的语义信息（附论文下载）

科技 2024-11-22 12:01 江苏

关注并星标

从此不迷路

计算机视觉研究院

公众号ID｜ComputerVisionGzq

学习群｜扫码在主页获取加入方式

论文地址：https://arxiv.org/pdf/2112.13082.pdf

计算机视觉研究院专栏

多尺度特征融合！

一、前言

本文提出了一种基于单模态语义分割的新型坑洼检测方法。它首先使用卷积神经网络从输入图像中提取视觉特征，然后通道注意力模块重新加权通道特征以增强不同特征图的一致性。随后，研究者采用了一个空洞空间金字塔池化模块（由串联的空洞卷积组成，具有渐进的扩张率）来整合空间上下文信息。

这有助于更好地区分坑洼和未损坏的道路区域。最后，使用研究者提出的多尺度特征融合模块融合相邻层中的特征图，这进一步减少了不同特征通道层之间的语义差距。在Pothole-600数据集上进行了大量实验，以证明提出的方法的有效性。定量比较表明，新提出的方法在RGB图像和转换后的视差图像上均达到了最先进的 (SoTA) 性能，优于三个SoTA单模态语义分割网络。

二、前言

在最先进的（SoTA）语义分割CNN中，全卷积网络(FCN)用卷积层替换了传统分类网络中使用的全连接层，以获得更好的分割结果。上下文信息融合已被证明是一种有效的工具，可用于提高分割精度。ParseNet通过连接全局池化特征来捕获全局上下文。PSPNet引入了空间金字塔池化(SPP)模块来收集不同尺度的上下文信息。Atrous SPP(ASPP)应用不同的空洞卷积来捕获多尺度上下文信息，而不会引入额外的参数。

三、新框架

给定道路图像，坑洼可以具有不同的形状和尺度。我们可以通过一系列的卷积和池化操作获得顶层的特征图。虽然特征图具有丰富的语义信息，但其分辨率不足以提供准确的语义预测。不幸的是，直接结合低级特征图只能带来非常有限的改进。为了克服这个缺点，研究者设计了一个有效的特征融合模块。

研究者提出的道路坑洼检测网络的架构如上图所示。首先，采用预训练的dilated ResNet-101作为主干来提取视觉特征，还在最后两个ResNet-101块中用空洞卷积替换下采样操作，因此最终特征图的大小是输入图像的1/8。

该模块有助于在不引入额外参数的情况下保留更多细节。此外，采用Deeplabv3中使用的ASPP模块来收集顶层特征图中的上下文信息。然后，采用CAM重新加权不同通道中的特征图。它可以突出一些特征，从而产生更好的语义预测。最后，将不同级别的特征图输入到MSFFM中，以提高坑洼轮廓附近的分割性能。

Multi-scale feature fusion

顶部特征图具有丰富的语义信息，但其分辨率较低，尤其是在坑洼边界附近。另一方面，较低的特征图具有低级语义信息但分辨率更高。为了解决这个问题，一些框架直接将不同层的特征图组合起来。然而，由于不同尺度的特征图之间的语义差距，他们取得的改进非常有限。

注意模块已广泛应用于许多工作中。受一些成功应用的空间注意力机制的启发，研究者引入了MSFFM，它基于空间注意力来有效地融合不同尺度的特征图。语义差距是特征融合的关键挑战之一。

为了解决这个问题，MSFFM通过矩阵乘法计算不同特征图中像素之间的相关性，然后将相关性用作更高级别特征图的权重向量。

总之，研究者利用矩阵乘法来测量来自不同层的特征图中像素的相关性，将来自较低特征图的详细信息整合到最终输出中，从而提高了坑洞边界的语义分割性能。在最后两层之间应用这个模块。

Channel-wise feature reweighing

众所周知，高级特征具有丰富的语义信息，每个通道图都可以看作是一个特定类别的响应。每个响应都会在不同程度上影响最终的语义预测。因此，研究者利用CAM，如下图所示，通过改变每个通道中的特征权重来增强每一层中特征图的一致性。

CAM旨在根据每个特征图的整体像素重新加权每个通道。首先采用全局平均池化层来压缩空间信息。随后，使用修正线性单元(ReLU)和sigmoid函数生成权重向量，最终通过逐元素乘法运算将权重向量与输入特征图组合以生成输出特征图。整体信息被整合到权重向量中，使得特征图更可靠，坑洼检测结果更接近GT实况。在最终的实验中，在第4层和第5层使用了CAM。

四、实验及可视化

*baseline network使用的是Deeplabv3

性能比较

坑洼检测结果示例：(a) RGB图像；(b)转换后的视差图像；(c)坑洼地面真相；(d)语义RGB图像分割结果；(e)语义变换视差图像分割结果。

在上图中提供了提出的道路坑洼检测方法的一些定性结果，其中可以观察到CNN在转换后的视差图像上取得了准确的结果。从综合实验评估中获得的结果证明了新提出的方法与其他SoTA技术相比的有效性和优越性。由于提出了CAM和MSFFM，新方法在RGB和转换后的视差图像上实现了更好的坑洼检测性能。

© The Ending

转载请联系本公众号获得授权

计算机视觉研究院学习群等你加入！

计算机视觉研究院主要涉及深度学习领域，主要致力于人脸检测、人脸识别，多目标检测、目标跟踪、图像分割等研究方向。研究院接下来会不断分享最新的论文算法新框架，我们这次改革不同点就是，我们要着重”研究“。之后我们会针对相应领域分享实践过程，让大家真正体会摆脱理论的真实场景，培养爱动手编程爱动脑思考的习惯！

扫码关注

计算机视觉研究院

公众号ID｜ComputerVisionGzq

学习群｜扫码在主页获取加入方式

往期推荐

🔗

计算机视觉研究院

计算机视觉研究院主要涉及AI研究和落地实践，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”！

最新文章

从源头消除大模型“幻觉”，性价比吊打传统微调方法

Fast YOLO：用于实时嵌入式目标检测（附论文下载）

旋转角度目标检测的重要性！！！（附源论文下载）

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

最后征稿+连续8届检索 | 第九届控制工程与人工智能国际会议(CCEAI 2025)会议地点已定！

智慧建筑：基于YOLOv7的建筑外墙缺陷检测

轻量级模型，重量级性能，TinyLlama、LiteLlama小模型火起来了

欢迎加入“计算机视觉研究院”学习群

年薪百万or惨遭裁员，AIGC开发者如何破局？

陈天奇团队LLM结构化生成新引擎XGrammar：百倍加速、近零开销

2024全球无人机市场洞察报告

粉丝福利！免费赠书中奖名单

凭什么YOLO是最强目标检测器，一文读懂！

大改Yolo框架 | 能源消耗极低的目标检测新框架（附论文下载）

智能体零样本解决未见过人类设计环境！全靠这个开放式物理RL环境空间

史上最通俗易懂的YOLO系列（v1-v10）模型解读！

更快、更灵活的Transformer图像去雾网络

“计算机视觉研究院”商务合作

利用先进技术保家卫国：深度学习进行小目标检测（适合初学者入门）

机场项目：解决飞行物空间大小/纵横比、速度、遮挡等问题引起的实时目标检测问题

2024新技术：远距离的小目标也可以准确检测

大改Yolo框架 | 能源消耗极低的目标检测新框架（附论文下载）

“计算机视觉研究院”商务合作

RestoreDet：低分辨率图像中目标检测

GPT理解的CV：基于Yolov5的半监督目标检测

机场项目：解决飞行物空间大小/纵横比、速度、遮挡等问题引起的实时目标检测问题

“计算机视觉研究院”商务合作

送书福利《计算机视觉之PyTorch数字图像处理》等你来拿！！！

YOLO-SLD：一种改进的注意机制YOLO车牌检测

多尺度特征融合：为检测学习更好的语义信息（附论文下载）

“计算机视觉研究院”商务合作

YOLO跌落神坛？新一代目标检测器又有新突破！

乌镇“网”事：看这道“光”！站在小镇望世界

欢迎加入“计算机视觉研究院”学习群

快速学会AI核心架构，Transformer！

大模型承重墙，去掉了就开始摆烂！苹果给出了「超级权重」

免费分享顶会的idea方法！！！

无卷积骨干网络：金字塔Transformer，提升目标检测/分割等任务精度（附源代码）

我用捡来的idea发了顶会！！！

揭示Transformer重要缺陷！北大提出傅里叶分析神经网络FAN，填补周期性特征建模缺陷

YoloV：视频中目标实时检测依然很棒（附源代码下载）

ICLR'25审稿质量历史最低？这么多全负正常么

NeurIPS 2024 | 无需训练，一个框架搞定开放式目标检测、实例分割

“计算机视觉研究院”商务合作

Yolo-Z：改进的YOLOv5用于小目标检测（附原论文下载）

多尺度特征融合：为检测学习更好的语义信息（附论文下载）

轻量级模型，重量级性能，TinyLlama、LiteLlama小模型火起来了

“计算机视觉研究院”商务合作

喜提 TPAMI 顶刊！！！

Token化一切，甚至网络！北大&谷歌&马普所提出TokenFormer，Transformer从来没有这么灵活过！

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉