又快又准，即插即用！清华8比特量化Attention，两倍加速于FlashAttention2，各端到端任务均不掉点！

科技 2024-10-25 14:30 江苏

点击蓝字

关注我们

关注并星标

从此不迷路

计算机视觉研究院

公众号ID｜计算机视觉研究院

学习群｜扫码在主页获取加入方式

论文标题：SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration
论文链接：https://arxiv.org/abs/2410.02367
开源代码：https://github.com/thu-ml/SageAttention

计算机视觉研究院专栏

Column of Computer Vision Institute

论文第一作者张金涛来自清华大学计算机系，论文通讯作者陈键飞副教授及其他合作作者均来自清华大学计算机系。

大模型中，线性层的低比特量化（例如 INT8, INT4）已经逐步落地；对于注意力模块，目前几乎各个模型都还在用高精度（例如 FP16 或 FP32）的注意力运算进行训练和推理。然而，随着大型模型需要处理的序列长度不断增加，Attention（注意力运算）的时间开销逐渐成为网络优化的主要瓶颈。

为了提高注意力运算的效率，清华大学陈键飞团队提出了 8Bit 的 Attention（SageAttention）。实现了 2 倍以及 2.7 倍相比于 FlashAttention2 和 xformers 的即插即用的推理加速，且在视频、图像、文本生成等大模型上均没有端到端的精度损失。

即插即用举例

SageAttention 可以一行代码轻松替换掉 torch 中当前最优的 Attention 接口（scaled_dot_product_attention），实现即插即用的推理加速。

具体来说，SageAttention 的使用非常方便，使用 pip install sageattention 后，

只需要在模型的推理脚本前加入以下三行代码即可：

效果上，以开源视频生成模型 CogvideoX 为例，使用 SageAttention 可以端到端加速 35%，且生成的视频无损：

全精度 Attention

SageAttention

接下来，将从背景与挑战，技术方案，以及实验效果介绍 SageAttention。

背景

随着大模型需要处理的序列长度越来越长（比如 Llama3.1 支持 128K 的序列长度），Attention 的速度优化变得越来越重要。下图展示了一个标准的 Transformer 模型中各运算随着序列长度变化的时间占比：

挑战

为了方便指代注意力元算中包含的矩阵，我们先回顾一下注意力的计算公式：

将神经网络中各运算的数值类型从高比特量化至低比特是一种有效提升计算和访存效率的方法。然而，研究团队发现直接将注意力运算中的 Q, K, P, V 从 FP16 量化为 INT8 或者 FP8 后将会导致在几乎所有模型和任务上都会得到极差的结果，例如，在 Unidiffuser 文生图模型中，会得到一张完全模糊的图像；在 Llama2-7B 进行四选一选择题任务上得到 25.5% 的准确率。

经过仔细分析后，研究团队发现主要是两个原因导致了量化注意力的不准确：

大多视频、图像生成模型中，矩阵 K 表现出了极强的通道维度的异常值分布，直接使用 INT8 或者 FP8 数据类型对其进行量化会导致巨大的误差。

在所有模型中，对矩阵 P, V 进行量化不能保证一个模型中所有层的精度。下表展示了对 P, V 量化后，Llama2-7B 和 Unidiffuser 模型所有层中，最差情况的层对应的量化注意力的准确度，（该准确度为量化注意力相比全精度注意力的误差），可以发现不管对 P, V 矩阵进行何种 8Bit （INT8，E4M3，E5M2）量化，总有些层的准确率非常差，导致了端到端效果的下降。

技术方案

为了解决上述的两个关键问题，研究团队提出了对应的解决办法。

对 K 进行平滑处理。SageAttention 采用了一个简单但非常实用的方法来消除矩阵 K 的异常值：K = K – mean (K) 其中 mean (K) 是沿着通道维度求平均值。这个简单的做法不仅不会影响注意力计算的正确性 Softmax (QK^T) = Softmax (Q (K-mean (K))^T) ；且对整个 Attention 速度的影响只有 0.2%；同时还保证了量化后的注意力运算的精度：

对 Q, K 进行分块 INT8 量化。对于矩阵 Q, K，SageAttention 采用了以 FlashAttention 的分块大小为粒度的 INT8 量化。这是因为：1. 对 Q, K 矩阵进行 INT8 量化相比于进行 FP8 量化，注意力的精度更高。2. 在一些常用卡上，比如 RTX4090，INT8 矩阵乘法（INT32 为累加器）的速度是 FP8（FP32 为累加器）的两倍。
对 P, V 采用 FP16 数据类型的矩阵乘法累加器。对于矩阵 P, V，SageAttention 采用了保留 P, V 为 FP16 的类型，但进行矩阵乘法时采用 FP16 数据类型的累加器。这是因为：1. PV 矩阵乘法的数值范围始终在 FP16 的表示范围内，且经过大量实验验证，FP16 作为累加器的数据类型不会带来任何精度损失（见下表）。2. 在一些常用卡上，比如 RTX4090，以 FP16 为累加器数据类型的矩阵乘法的速度是 FP32 作为累加器的两倍。

SageAttention 的流程图及算法如下所示：

实验效果

SageAttention 实现了底层的 GPU Kernel，在算子速度以及各个模型的端到端精度上都有十分不错的表现。

具体来说，算子速度相比于 FlashAttention2 和 xformers 有 2.1 以及 2.7 倍的加速。以下 4 张图展示了在 RTX4090 上，不同的序列长度下 SageAttention 的各种 Kernel 与其他方法的速度比较。

以下 4 张图展示了在 RTX3090 上，不同的序列长度下 SageAttention 的各种 Kernel 与其他方法的速度比较。

下表展示了在 RTX4090 上，各模型中的注意力模块中 SageAttention 相比于使用模型原始的注意力的加速比。

真实任务的精度上，下表展示了 SageAttention 在视频、图像、文本生成等大模型上均没有端到端的精度损失：

END

转载请联系本公众号获得授权

计算机视觉研究院学习群等你加入！

ABOUT

计算机视觉研究院

计算机视觉研究院主要涉及深度学习领域，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”。研究院会针对不同领域分享实践过程，让大家真正体会摆脱理论的真实场景，培养爱动手编程爱动脑思考的习惯！

往期推荐

🔗

http://mp.weixin.qq.com/s?__biz=MzU0NTAyNTQ1OQ==&mid=2247539105&idx=2&sn=7c3fbe34500704bb77aee5b970682b7d

计算机视觉研究院

计算机视觉研究院主要涉及AI研究和落地实践，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”！

最新文章

今年顶会这情况。。。大家提前做准备吧！

取代Mamba，超越Transformer！扩展LSTM到数十亿参数

Drone-YOLO：一种有效的无人机图像目标检测

“计算机视觉研究院”商务合作

再见阿里，你好字节！

纯干货：Box Size置信度偏差会损害目标检测器（附源代码）

PE-YOLO：解决黑夜中的目标检测难点

245个目标检测开源项目合集，建议收藏！

YoloV：视频中目标实时检测依然很棒（附源代码下载）

利用先进技术保家卫国：深度学习进行小目标检测（适合初学者入门）

大型视觉语言模型OMG-LLaVA：图像级、目标级和像素级的推理和理解任务统一

PE-YOLO：解决黑夜中的目标检测难点

NeurIPS 2024 | 真实世界复杂任务，全新基准GTA助力大模型工具调用能力评测

人脸识别精度提升 | 基于Transformer的人脸识别（附源码）

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

FP-DETR：通过完全预训练提升transformer目标检测器

3D大模型助力，15分钟即可训练高质量、个性化的数字人模型，代码已开放

顶会新方向！全新多模态大模型统一分割框架

微软新出框架：Transformer扩展到10亿token（附代码下载）

Drone-YOLO：一种有效的无人机图像目标检测

26申博时间规划！别再按老套路来了，没用

“计算机视觉研究院”商务合作

一文读懂模型的可解释性（附代码）

首个快速知识蒸馏的视觉框架：ResNet50 80.1%精度，训练加速30%

劲爆！YOLOv6又快又准的目标检测框架开源啦（附源代码下载）

今天面试了一个字节女生，当场想给她offer

三区idea最后发了顶会！

特别小的目标检测识别（附论文下载）

基于Transformer的跨模态3D点云目标检测SOTA！易复现！

NeurIPS 2024 | 消除多对多问题，清华提出大规模细粒度视频片段标注新范式VERIFIED

“计算机视觉研究院”商务合作

机场项目：解决飞行物空间大小/纵横比、速度、遮挡等问题引起的实时目标检测问题

不需要标注了？看自监督学习框架如何助力目标检测

RestoreDet：低分辨率图像中目标检测

目标检测创新：一种基于区域的半监督方法，部分标签即可（附原论文下载）

又快又准，即插即用！清华8比特量化Attention，两倍加速于FlashAttention2，各端到端任务均不掉点！

MIT韩松团队长上下文LLM推理高效框架DuoAttention：单GPU实现330万Token上下文推理

50K*16薪，进字节了！

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

“计算机视觉研究院”商务合作

RestoreDet：低分辨率图像中目标检测

CVPR’24｜PanoOcc基于相机的3D全景分割最强SOTA！

利用先进技术保家卫国：深度学习进行小目标检测（适合初学者入门）

245个目标检测开源项目合集，建议收藏！

“计算机视觉研究院”商务合作

完爆YOLO家族？新一代目标检测器又有新突破！

NeurIPS 2024 Oral | 小参数，大作为！揭秘非对称 LoRA 架构的高效性能

YOLO-SLD：一种改进的注意机制YOLO车牌检测

“计算机视觉研究院”商务合作

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉