无卷积骨干网络：金字塔Transformer，提升目标检测/分割等任务精度（附源代码）

科技科技 2024-09-05 10:10 山东

点击蓝字

关注我们

关注并星标

从此不迷路

计算机视觉研究院

公众号ID｜计算机视觉研究院

学习群｜扫码在主页获取加入方式

论文地址：https://arxiv.org/pdf/2102.12122.pdf

源代码地址：https://github.com/whai362/PVT

计算机视觉研究院专栏

Column of Computer Vision Institute

在将金字塔结构嵌入到Transformer结构用于生成多尺度特征，并最终用于稠密预测任务。

背景

具有自注意力的Transformer引发了自然语言处理领域的革命，最近还激发了Transformer式架构设计的出现，并在众多计算机视觉任务中取得了具有竞争力的结果。

如下是之前我们分享的基于Transformer的目标检测新技术！

链接：ResNet超强变体：京东AI新开源的计算机视觉模块！（附源代码）

链接：利用TRansformer进行端到端的目标检测及跟踪（附源代码）

链接：YOLOS：通过目标检测重新思考Transformer（附源代码）

在今天分享的工作中，研究者设计了一个新颖的Transformer模块，针对稠密预测任务的主干网络，利用Transformer架构设计进行了一次创新性的探索，将特征金字塔结构与Transformer进行了一次融合，使其可以更好的输出多尺度特征，进而更方便与其他下游任务相结合。

前言

尽管卷积神经网络 (CNN) 在计算机视觉方面取得了巨大成功，但今天分享的这项工作研究了一种更简单、无卷积的主干网络，可用于许多密集预测任务。

目标检测

语义分割

实例分割

与最近提出的专为图像分类设计的Vision Transformer（ViT）不同，研究者引入了Pyramid Vision Transformer（PVT），它克服了将Transformer移植到各种密集预测任务的困难。与当前的技术状态相比，PVT 有几个优点：

与通常产生低分辨率输出并导致高计算和内存成本的ViT不同，PVT不仅可以在图像的密集分区上进行训练以获得对密集预测很重要的高输出分辨率，而且还使用渐进式收缩金字塔以减少大型特征图的计算；
PVT继承了CNN和Transformer的优点，使其成为各种视觉任务的统一主干，无需卷积，可以直接替代CNN主干；
通过大量实验验证了PVT，表明它提高了许多下游任务的性能，包括对象检测、实例和语义分割。

例如，在参数数量相当的情况下，PVT+RetinaNet在COCO数据集上实现了40.4 AP，超过ResNet50+RetinNet（36.3 AP）4.1个绝对AP（见下图）。研究者希望PVT可以作为像素级预测的替代和有用的主干，并促进未来的研究。

基础回顾

CNN Backbones

CNN是视觉识别中深度神经网络的主力军。标准CNN最初是在【Gradient-based learning applied to document recognition】中区分手写数字。该模型包含具有特定感受野的卷积核捕捉有利的视觉环境。为了提供平移等方差，卷积核的权重在整个图像空间中共享。最近，随着计算资源的快速发展（例如，GPU），堆叠卷积块成功在大规模图像分类数据集上训练（例如，ImageNet）已经成为可能。例如，GoogLeNet证明了包含多个内核路径的卷积算子可以实现非常有竞争力的性能。

multi-path convolutional block的有效性在Inception系列、ResNeXt、DPN、MixNet和SKNet中得到了进一步验证。此外，ResNet将跳过连接引入到卷积块中，从而可以创建/训练非常深的网络并在计算机视觉领域获得令人印象深刻的结果。DenseNet引入了一个密集连接的拓扑，它将每个卷积块连接到所有先前的块。更多最新进展可以在最近的论文中找到。

新框架

该框架旨在将金字塔结构嵌入到Transformer结构用于生成多尺度特征，并最终用于稠密预测任务。上图给出了所提出的PVT架构示意图，类似与CNN主干结构，PVT同样包含四个阶段用于生成不同尺度的特征，所有阶段具有相类似的结构：Patch Embedding+Transformer Encoder。

在第一个阶段，给定尺寸为H*W*3的输入图像，按照如下流程进行处理：

首先，将其划分为HW/4^2的块，每个块的大小为4*4*3；
然后，将展开后的块送入到线性投影，得到尺寸为HW/4^2 * C1的嵌入块；
其次，将前述嵌入块与位置嵌入信息送入到Transformer的Encoder，其输出将为reshap为H/4 * W/4 * C1。

采用类似的方式，以前一阶段的输出作为输入即可得到特征F2，F3和F4。基于特征金字塔F1、F2、F3、F4，所提方案可以轻易与大部分下游任务(如图像分类、目标检测、语义分割)进行集成。

Feature Pyramid for Transforme

不同于CNN采用stride卷积获得多尺度特征，PVT通过块嵌入按照progressive shrinking策略控制特征的尺度。

假设第i阶段的块尺寸为Pi，在每个阶段的开始，将输入特征均匀的拆分为Hi-1Wi-1/Pi个块，然后每个块展开并投影到Ci维度的嵌入信息，经过线性投影后，嵌入块的尺寸可以视作Hi-1/Pi * Wi-1/Pi * Ci。通过这种方式就可以灵活的调整每个阶段的特征尺寸，使其可以针对Transformer构建特征金字塔。

Transformer Encoder

对于Transformer encoder的第i阶段，它具有Li个encoder层，每个encoder层由注意力层与MLP构成。由于所提方法需要处理高分辨率特征，所以提出了一种SRA(spatial-reduction attention)用于替换传统的MHA(multi-head-attention)。

类似于MHA，SRA同样从输入端接收到了Q、K、V作为输入，并输出精炼后特征。SRA与MHA的区别在于：SRA会降低K和V的空间尺度，见下图。

Detailed settings of PVT series

实验

ImageNet数据集上的性能对比，结果见上表。从中可以看到：

相比CNN，在同等参数量与计算约束下，PVT-Small达到20.2%的误差率，优于ResNet50的21.5%；
相比其他Transformer(如ViT、DeiT)，所提PVT以更少的计算量取得了相当的性能。

在语义分割中的性能对比，见上表。可以看到：不同参数配置下，PVT均可取得优于ResNet与ResNeXt的性能。这侧面说明：相比CNN，受益于全局注意力机制，PVT可以提取更好的特征用于语义分割。

END

转载请联系本公众号获得授权

计算机视觉研究院学习群等你加入！

ABOUT

计算机视觉研究院

计算机视觉研究院主要涉及深度学习领域，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”。研究院会针对不同领域分享实践过程，让大家真正体会摆脱理论的真实场景，培养爱动手编程爱动脑思考的习惯！

往期推荐

🔗

http://mp.weixin.qq.com/s?__biz=MzU0NTAyNTQ1OQ==&mid=2247537762&idx=2&sn=4a502486f15b44a18f2a367624170295

计算机视觉研究院

计算机视觉研究院主要涉及AI研究和落地实践，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”！

最新文章

大型视觉语言模型OMG-LLaVA：图像级、目标级和像素级的推理和理解任务统一

PE-YOLO：解决黑夜中的目标检测难点

NeurIPS 2024 | 真实世界复杂任务，全新基准GTA助力大模型工具调用能力评测

人脸识别精度提升 | 基于Transformer的人脸识别（附源码）

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

FP-DETR：通过完全预训练提升transformer目标检测器

3D大模型助力，15分钟即可训练高质量、个性化的数字人模型，代码已开放

顶会新方向！全新多模态大模型统一分割框架

微软新出框架：Transformer扩展到10亿token（附代码下载）

Drone-YOLO：一种有效的无人机图像目标检测

26申博时间规划！别再按老套路来了，没用

“计算机视觉研究院”商务合作

一文读懂模型的可解释性（附代码）

首个快速知识蒸馏的视觉框架：ResNet50 80.1%精度，训练加速30%

劲爆！YOLOv6又快又准的目标检测框架开源啦（附源代码下载）

今天面试了一个字节女生，当场想给她offer

三区idea最后发了顶会！

特别小的目标检测识别（附论文下载）

基于Transformer的跨模态3D点云目标检测SOTA！易复现！

NeurIPS 2024 | 消除多对多问题，清华提出大规模细粒度视频片段标注新范式VERIFIED

“计算机视觉研究院”商务合作

机场项目：解决飞行物空间大小/纵横比、速度、遮挡等问题引起的实时目标检测问题

不需要标注了？看自监督学习框架如何助力目标检测

RestoreDet：低分辨率图像中目标检测

目标检测创新：一种基于区域的半监督方法，部分标签即可（附原论文下载）

又快又准，即插即用！清华8比特量化Attention，两倍加速于FlashAttention2，各端到端任务均不掉点！

MIT韩松团队长上下文LLM推理高效框架DuoAttention：单GPU实现330万Token上下文推理

50K*16薪，进字节了！

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

“计算机视觉研究院”商务合作

RestoreDet：低分辨率图像中目标检测

CVPR’24｜PanoOcc基于相机的3D全景分割最强SOTA！

利用先进技术保家卫国：深度学习进行小目标检测（适合初学者入门）

245个目标检测开源项目合集，建议收藏！

“计算机视觉研究院”商务合作

完爆YOLO家族？新一代目标检测器又有新突破！

NeurIPS 2024 Oral | 小参数，大作为！揭秘非对称 LoRA 架构的高效性能

YOLO-SLD：一种改进的注意机制YOLO车牌检测

“计算机视觉研究院”商务合作

欢迎加入“计算机视觉研究院”学习群

这篇论文非常火！差分Transformer竟能消除注意力噪声，犹如降噪耳机

Kaggle金牌和CCF A一作哪个更有用？

“计算机视觉研究院”商务合作

发论文别太老实，用对方法一年三篇SCI！

AI智能体引擎加持：天玑9400让「完全体」AI手机提前问世了

大规模参数的更强、更鲁棒的视觉基础模型

多尺度特征融合：为检测学习更好的语义信息（附论文下载）

VB-LoRA高效登顶！仅需0.4%参数量，极限超越LoRA！

这篇论文非常火！差分Transformer竟能消除注意力噪声，犹如降噪耳机

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉