Micro-YOLO：探索目标检测压缩模型的有效方法（附论文下载）

科技科技 2024-09-15 22:30 浙江

点击蓝字关注我们

关注并星标

从此不迷路

计算机视觉研究院

公众号ID｜计算机视觉研究院

学习群｜扫码在主页获取加入方式

论文地址：https://www.scitepress.org/Papers/2021/102344/102344.pdf

计算机视觉研究院专栏

Column of Computer Vision Institute

深度学习模型在目标检测的性能上取得了重大突破。然而，在传统模型中，例如Faster R-CNN和YOLO，由于计算资源有限和功率预算紧张，这些网络的规模使其难以部署在嵌入式移动设备上。

一、前言

深度学习领域的加速发展极大地促进了目标检测的发展，其在人脸检测、自动驾驶、机器人视觉和视频监控等方面的广泛应用。随着目标检测的蓬勃发展，近年来提出了几种深度卷积神经网络模型，例如R-CNN、SSD和YOLO等。然而，随着网络变得越来越复杂，这些模型的规模不断增加，这使得在现实生活中将这些模型部署到嵌入式设备上变得越来越困难。因此，开发一种高效快速的物体检测模型以在不影响目标检测质量的情况下减小参数大小至关重要。

二、背景

随着目标检测网络系列不断变得更加复杂，减少权重参数和计算成本变得很重要。模型压缩方法分为低秩分解、知识蒸馏、剪枝和量化，其中剪枝已被证明是通过去除冗余参数来降低网络复杂度的有效方法（A survey of model compression and acceleration for deep neural networks）。

为了解决目标检测网络问题，有几种最先进的工作技术可以减少YOLO架构中的参数数量。(YOLO-LITE: a real-time object detection algorithm optimized for non-GPU computers) 开发了YOLO-Lite网络，其中从YOLOv2-tiny中删除了批量归一化层以加速目标检测。该网络在PASCAL VOC 2007和COCO数据集上分别实现了33.81%和12.26%的mAP。(Yolo nano: a highly compact you only look once convolutional neural network for object detection) 创建了一个高度紧凑的网络YOLO-nano，它是一个基于YOLO网络的8位量化模型，并在PASCAL VOC 2007数据集上进行了优化。该网络在PASCAL VOC 2007数据集上实现了3.18M模型大小和69.1%mAP。

三、概要

因此，研究者就提出了一种新的基于轻量级CNN的目标检测模型，即基于YOLOv3-Tiny的Micro-YOLO，它在保持检测性能的同时显着减少了参数数量和计算成本。研究者建议将YOLOv3-tiny网络中的卷积层替换为深度分布偏移卷积(DSConv：https://arxiv.org/abs/1901.01928v1)和带有squeeze和excitation块的移动反向瓶颈卷积 (MBConv：主要源自于EfficientNet)，并设计渐进式通道级剪枝算法以最小化数量参数并最大化检测性能。因此，与原始YOLOv3-tiny网络相比，所提出的Micro-YOLO网络将参数数量减少了3.46倍，乘法累加操作(MAC)减少了2.55倍，同时在COCO数据集上评估的mAP略微减少了0.7%。

四、新框架介绍

Micro-YOLO

为了减小网络的大小，研究者探索了可选择的轻量级卷积层来替代YOLO网络中的卷积层Conv。MobileNet网络采用两个轻量级卷积层（a）DSConv和（b）MBConv。

如上图(a) 所示，DSConv执行两种类型的卷积：(i) 深度卷积和 (ii) 逐点卷积，这可以显著降低网络的模型大小和计算成本。上图(b) 所示，MBConv的结构是一个1×1的channel expansion卷积，然后是深度卷积和一个1×1的channel reduction层。它利用squeeze和excitation块，这是一个分支，由squeeze阶段的全局平均池化操作和excitation阶段的两个小FC层组成在深度卷积和通道之间还原层。由于输出通道的数量不等于输入通道的数量，研究者在MBConv中移除了残差连接，MBConv层在输入和输出处提供紧凑的表示，同时在内部将输入扩展到更高维的特征空间以增加非线性变换的表达能力。因此，与DSconv层相比，MBconv层提供了更好的压缩网络，而不会降低检测精度。

这些层之间的计算成本，即Conv层（Cs）、DSConv层（Cds）和MBConv层（Cmb）可以分别用以下公式表示：

其中k表示内核大小，Cin表示输入通道数，Cout表示输出通道数，W和H表示特征图的宽度和高度，α和β分别表示MBConv中的扩展因子和缩减因子。

Progressive Channel Pruning

在确定新提出的Micro-YOLO网络的架构后，研究者可以通过使用剪枝技术进一步减少权重参数。在提出的工作中，研究者采用了粗粒度剪枝，因为DSConv和MBConv层主要由1×1内核大小组成，这为细粒度剪枝留下了最小的空间。(Rethinking the value of network pruning) 表明修剪后的架构本身，而不是一组继承的“重要”权重，对最终模型的效率更重要，这表明在某些情况下修剪可能是有用的一种架构搜索范式。因此，研究者提出了一种渐进式剪枝方法来在修改后的网络中搜索“更薄”的架构。具体伪代码流程如下：

五、实验

新提出的框架图

不同卷积类型和相同内核大小的不同输入通道所需的参数数量

不同卷积类型的参数量

内核大小探索结果。不同的条形表示内核大小的不同组合。为简单起见，仅以红色显示最佳内核大小组合，如下图：

最后看下检测效果：

© THE END

转载请联系本公众号获得授权

计算机视觉研究院学习群等你加入！

ABOUT

计算机视觉研究院

计算机视觉研究院主要涉及深度学习领域，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”。研究院会针对不同领域分享实践过程，让大家真正体会摆脱理论的真实场景，培养爱动手编程爱动脑思考的习惯！

计算机视觉研究院主要涉及AI视觉领域和大模型研究，致力于目标检测、目标分类、图像分割、OCR、模型量化、模型部署等方向。

应用于园区人脸人体检测、车辆车牌检测识别、烟雾烟火检测、抽烟等行为检测

应用于景区溺水检测、丢失儿童询查、车辆违停检测、垃圾满溢检测、烟火检测、人流量统计等

应用于工厂中的入侵检测、周界巡检、工服检测、产品缺陷检测、产品计件统计、AGV自动搬运等

应用于林业畜牧业中的无人机实时检测、牲畜计数、林业面积测量、枯黄枯死树木检测定位、烟雾烟火检测、垃圾检测等

研究院承接各种AI视觉类项目，还有更多领域业务可落地，欢迎来咨询！

往期推荐

🔗

http://mp.weixin.qq.com/s?__biz=MzU0NTAyNTQ1OQ==&mid=2247538417&idx=2&sn=c1a75ddb1460b3046fdbddf1ef021daa

计算机视觉研究院

计算机视觉研究院主要涉及AI研究和落地实践，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”！

最新文章

大型视觉语言模型OMG-LLaVA：图像级、目标级和像素级的推理和理解任务统一

PE-YOLO：解决黑夜中的目标检测难点

NeurIPS 2024 | 真实世界复杂任务，全新基准GTA助力大模型工具调用能力评测

人脸识别精度提升 | 基于Transformer的人脸识别（附源码）

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

FP-DETR：通过完全预训练提升transformer目标检测器

3D大模型助力，15分钟即可训练高质量、个性化的数字人模型，代码已开放

顶会新方向！全新多模态大模型统一分割框架

微软新出框架：Transformer扩展到10亿token（附代码下载）

Drone-YOLO：一种有效的无人机图像目标检测

26申博时间规划！别再按老套路来了，没用

“计算机视觉研究院”商务合作

一文读懂模型的可解释性（附代码）

首个快速知识蒸馏的视觉框架：ResNet50 80.1%精度，训练加速30%

劲爆！YOLOv6又快又准的目标检测框架开源啦（附源代码下载）

今天面试了一个字节女生，当场想给她offer

三区idea最后发了顶会！

特别小的目标检测识别（附论文下载）

基于Transformer的跨模态3D点云目标检测SOTA！易复现！

NeurIPS 2024 | 消除多对多问题，清华提出大规模细粒度视频片段标注新范式VERIFIED

“计算机视觉研究院”商务合作

机场项目：解决飞行物空间大小/纵横比、速度、遮挡等问题引起的实时目标检测问题

不需要标注了？看自监督学习框架如何助力目标检测

RestoreDet：低分辨率图像中目标检测

目标检测创新：一种基于区域的半监督方法，部分标签即可（附原论文下载）

又快又准，即插即用！清华8比特量化Attention，两倍加速于FlashAttention2，各端到端任务均不掉点！

MIT韩松团队长上下文LLM推理高效框架DuoAttention：单GPU实现330万Token上下文推理

50K*16薪，进字节了！

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

“计算机视觉研究院”商务合作

RestoreDet：低分辨率图像中目标检测

CVPR’24｜PanoOcc基于相机的3D全景分割最强SOTA！

利用先进技术保家卫国：深度学习进行小目标检测（适合初学者入门）

245个目标检测开源项目合集，建议收藏！

“计算机视觉研究院”商务合作

完爆YOLO家族？新一代目标检测器又有新突破！

NeurIPS 2024 Oral | 小参数，大作为！揭秘非对称 LoRA 架构的高效性能

YOLO-SLD：一种改进的注意机制YOLO车牌检测

“计算机视觉研究院”商务合作

欢迎加入“计算机视觉研究院”学习群

这篇论文非常火！差分Transformer竟能消除注意力噪声，犹如降噪耳机

Kaggle金牌和CCF A一作哪个更有用？

“计算机视觉研究院”商务合作

发论文别太老实，用对方法一年三篇SCI！

AI智能体引擎加持：天玑9400让「完全体」AI手机提前问世了

大规模参数的更强、更鲁棒的视觉基础模型

多尺度特征融合：为检测学习更好的语义信息（附论文下载）

VB-LoRA高效登顶！仅需0.4%参数量，极限超越LoRA！

这篇论文非常火！差分Transformer竟能消除注意力噪声，犹如降噪耳机

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉