Scaling Laws终结，量化无用，AI大佬都在审视这篇论文

文摘 2024-11-14 07:00 上海

作者 | 机器之心编辑 | 机器之心编辑部
原文链接：xxxx

点击下方卡片，关注“3D视觉之心”公众号

第一时间获取3D视觉干货

>>点击进入→3D视觉之心技术交流群

机器之心报道

作者：泽南、小舟

研究表明，你训练的 token 越多，你需要的精度就越高。

最近几天，AI 社区都在讨论同一篇论文。

UCSD 助理教授 Dan Fu 说它指明了大模型量化的方向。

CMU 教授 Tim Dettmers 则直接说：它是很长一段时间以来最重要的一篇论文。OpenAI 创始成员、特斯拉前 AI 高级总监 Andrej Karpathy 也转发了他的帖子。

Tim Dettmers 表示，可以说，人工智能的大部分进步都来自计算能力的提升，而（在最近）这主要依赖于低精度路线的加速（32- > 16 - > 8 位）。现在看来，这一趋势即将结束。再加上摩尔定律的物理限制，大模型的大规模扩展可以说要到头了。

例如，英伟达最新的 AI 计算卡 Blackwell 将拥有出色的 8 位能力，并在硬件层面实现逐块量化。这将使 8 位训练变得像从 FP16 切换到 BF16 一样简单。然而，正如我们从新论文中看到的那样，对于很多大模型的训练来说，8 位是不够的。

与其他模型相比，Llama 405B 没有得到太多应用的主要原因是它体量太大了，运行 405B 模型进行推理非常麻烦。但论文表明，训练较小的模型（例如 70B）时，你也无法在低精度下有效地训练这些模型。见下图 8B（圆形） 70B（三角形） 405B（星型）：

可见对于 20B Token 数据的训练，训练 8B 模型在 16 位中效率更高。对于 70B 模型来说 8 位仍然有效，但效率越来越低。

Tim Dettmers 感叹道：从我自己的经验（大量失败的研究）来看，效率是无法欺骗的。如果量化失败，那么稀疏化也会失败，其他效率机制也会失败。如果这是真的，那么我们现在就已经接近最优了。

那以后我们怎么办？眼前似乎只有三条可能的路线：

扩大数据中心规模：未来约 2 年这仍然是可以做到的事；
通过动态扩展：路由到更小的专门模型或大 / 小模型上；
知识的提炼：这条路线与其他技术不同，并且可能具有不同的特性。

对于新硬件来说，我们仍然有 HBM4 内存，这将是一个很好的提升。但 FP4 训练似乎是一个谎言，节点缩小不会再增加多少效率了。

这篇名为《Scaling Laws for Precision》的论文顾名思义，制定了一个和大语言模型使用数据精度有关的扩展定律，涵盖了训练前和训练后。

论文标题：Scaling Laws for Precision
论文链接：https://arxiv.org/abs/2411.04330

据论文一作，来自哈佛大学的 Tanishq Kumar 介绍，他们的研究认为：

由于当代大模型在大量数据上经历了过度训练，因此训练后量化已变得非常困难。因此，如果在训练后量化，最终更多的预训练数据可能会造成副作用；
在预训练期间以不同的精度放置权重、激活或注意力的效果是一致且可预测的，并且拟合扩展定律表明，高精度（BF16）和下一代精度（FP4）的预训练可能都是次优的设计选择。

低精度训练和推理会影响语言模型的质量和成本，但当前的大模型 Scaling Law 并未考虑到这一点。在这项工作中，研究人员为训练和推理设计了「精度感知」扩展定律。

作者提出，以较低的精度进行训练会降低模型的有效参数数量，从而使我们能够预测低精度训练和训练后量化带来的额外损失。对于推理，随着模型在更多数据上进行训练，训练后量化带来的性能下降会加剧，最终导致额外的预训练数据产生负面影响。对于训练，扩展定律使我们能够预测具有不同精度的不同部分的模型的损失，以较低精度训练较大的模型可能是计算最优的。

该工作统一了训练后量化和训练前量化的扩展定律，得出一个单一的函数形式，可以预测不同精度下训练和推理的性能下降。

预训练 scaling law 表明，计算最佳预训练精度通常独立于计算预算。然而，令人惊讶的是，如果模型大小受到限制，这种独立性就不再成立，在这种情况下，计算最佳精度在计算中增长缓慢。

该研究以 3-16 bit 精度预训练了 465 个语言模型，并对每个模型进行了训练后量化。对于具有 N 个参数的语言模型，在 D 个 token 上进行训练，训练精度为 P_train，训练后权重精度为 P_post，该研究最终找到了一个统一的 Scaling Law，其形式如下：

其中，A、B、E、α、β 是正拟合常数，δ_PTQ 是指推理前训练后量化引起的损失退化。

研究简介

该研究首先研究了训练后量化模型权重的常用方法，发现训练时间越长 / 预训练期间「看到」的数据越多，模型在推理时对量化就越敏感，这解释了为什么 Llama-3 可能更难量化。

事实上，这种损失退化大致是预训练期间看到的 token / 参数比值的幂律，因此可以提前预测关键数据大小，超过该数据大小的更多数据的预训练会非常有害。直觉可能是，当你训练更多的数据时，更多的知识被压缩成权重，给定的扰动会对模型性能造成更大的损害。

图 1：主要发现示意图。在 BF16 中将固定大小的模型在各种数据预算上训练，并在最后量化权重。可以发现，由于训练后量化而导致的退化会随着预训练期间看到的 token 数量增加而增加，因此额外的预训练数据可能会造成损害。

经过扩展验证表明，以较低的精度训练较大的模型可以实现计算优化。

然后该研究将注意力转向低精度训练，主要研究量化感知训练（仅权重）和低精度训练。该研究将模型分解为权重、激活和 KV 缓存，找到其中任何一个量化到任意精度时损失的 Scaling Law，并开发一种组合且可解释的函数形式来预测在预训练期间，量化这三者的任意组合对损失的影响。

该研究的 Scaling Law 依赖于「有效参数计数」的概念，研究团队假设当你降低精度，参数也降低一定数量，计数就降低，那么包含 FP4 中所有内容的 10 亿参数模型具有可比较的数量 BF16 中 250m 模型的「有效参数」。

虽然权重可以毫无问题地以低精度进行训练，但激活和 KV 缓存很敏感。

最后，该研究将训练前和训练后的发现统一为可解释的函数形式，可以以任何精度组合预测训练前和训练后的损失。

该研究还发现，低精度的预训练可以以定量可预测的方式「增强」模型的训练后量化，但其程度低于直观预期。

作者表示：「该研究在进行实验时保持受控的架构和设置，但在实践中，通常会故意进行架构调整以适应低精度训练。」这也是这项研究的一点局限性。

感兴趣的读者可以阅读论文原文，了解更多研究内容。

参考内容：

https://twitter.com/Tim_Dettmers/status/1856338240099221674

https://twitter.com/Tanishq97836660/status/1856045600355352753

【3D视觉之心】技术交流群

3D视觉之心是面向3D视觉感知方向相关的交流社区，由业内顶尖的3D视觉团队创办！聚焦三维重建、Nerf、点云处理、视觉SLAM、激光SLAM、多传感器标定、多传感器融合、深度估计、摄影几何、求职交流等方向。扫码添加小助理微信邀请入群，备注：学校/公司+方向+昵称（快速入群方式）

扫码添加小助理进群

【3D视觉之心】知识星球

3D视觉之心知识星球主打3D感知全技术栈学习，星球内部形成了视觉/激光/多传感器融合SLAM、传感器标定、点云处理与重建、视觉三维重建、NeRF与Gaussian Splatting、结构光、工业视觉、高精地图等近15个全栈学习路线，每天分享干货、代码与论文，星球内嘉宾日常答疑解惑，交流工作与职场问题。

http://mp.weixin.qq.com/s?__biz=MzkyMDY0OTc1NA==&mid=2247516204&idx=4&sn=0eee3737064f94f74b108a3b73eac566

3D视觉之心

3D视觉与SLAM、点云相关内容分享

专为自动驾驶而生！DeSiRe-GS：彻底摒弃3D框，动静态重建完美解耦（UC Berkeley最新）

具身智能训练数据集哪里找？几大开源数据集帮你汇总好了！

章国锋团队开启SfM新篇章！DATAP-SfM：动态感知跟踪一切！

字节&清华&北京交通大学发布V2X-Radar: 一个用于协同感知的4D雷达多模态数据集

文本、图像、点云任意模态输入，AI能够一键生成高质量CAD模型了

3DLS全新尝试：线性高斯核在高频区域实现更清晰、更精确的结果，帧率提高30%！

闭环仿真杀器！DrivingSphere：理想提出直接构建高保真4D世界

真实雨景/图像去雨/自动驾驶/图像检索相关方向开源数据集资源

美国教授痛心：UC伯克利GPA 4.0计算机本科生，毕业即失业？ML博士直呼太卷后悔转行

高速动态低成本重建救星？SCIGS：首个从单个压缩图像重建3D显式动态场景的方法

论文分享 | 全景场景补全

动态SLAM全新数据集！InCrowd-VI：不同人群密度、遮挡、复杂光照的视觉惯性SLAM数据集！

机器人训练数据不缺了！英伟达团队推出DexMG：数据增强200倍

盘点！那些从自动驾驶“跳槽”进具身智能的大佬们

清华大学发布使用CARLA生成V2V与V2I的增强自动驾驶协作的多智能体调度数据集WHALES

GarVerseLOD：实现单张图像高保真度服装重建的3D重建框架

如何创立一家惯性导航公司

融合神经辐射场和视觉同时定位与地图构建的混合场景表示方法

宝可梦GO「偷家」李飞飞空间智能？全球最强3D地图诞生，150万亿参数解锁现实边界

克服LiDAR固定分辨率的限制！LiV-GS：首个大规模室外场景对齐离散点云与高斯地图的方法

MVSplat360：从稀疏视图到360°全景合成的前馈方法

Siggraph Asia 2024 | Adobe发布MagicClay：可通过文字引导对3D模型特定部分进行雕刻！

谷歌2024博士奖学金名单公布

首个基于高斯点云建图的动态SLAM框架！DGS-SLAM：解决动态物体引起的光度和几何不一致

无需视频流实现全景分割与深度估计MGNiceNet：统一的单目几何场景理解

ECCV 2024 | PARE-Net：用于鲁棒点云配准的位置感知旋转等变网络

NeurIPS 2024高中赛道开卷！人大附中、北师大实验中学等摘得3篇Spotlight

加州大学 | 基于视觉语言模型的端到端导航：零样本，无需数据训练！

港大DEIO：首个学习与传统非线性图优化结合的单目事件惯性里程计

基于语义似然与高精度地图匹配的智能车辆同时定位与检测

钻石冷却的GPU即将问世：温度能降20度，超频空间增加25%

超越现有3DGS网格重建方法！DyGASR：速度提高25%、内存使用量减少30%

复旦&蔚来开源DG-SLAM：第一个动态环境下的鲁棒GS SLAM！

身处相机内外参之间（EG3D/NeRF/3D Gaussian Splatting）

NeurIPS 2024 | 无需训练，一个框架搞定开放式目标检测、实例分割

突破多场景训练方法限制！ETH开源SplatFormer：首个专门设计用于在3DGS上运行的点变换器模型

【清华大学】RINO：基于非迭代估计的精确、鲁棒雷达惯性里程计

论文分享｜无监督点云语义分割

传说中Ilya Sutskever精选论文清单：AI领域40大论文完整版「破解」完成

丰田研究院综述「机器人领域中的神经场」

顶刊TGRS | 使用端到端深度神经网络从高分辨率遥感图像和数字表面模型中提取3D建筑实例

让纸片人动起来! DrawingSpinUp：从单个绘图生成高质量3D动画

浙大西湖大学开源MBA-SLAM！解决NeRF、3DGS中的运动模糊问题！

这三家国内机构合作成果，斩获EMNLP 2024最佳论文奖，主办方：明年苏州见！

ICP还能玩出什么花样？RA-L'24全新GenZ-ICP：根据环境几何特性自适应，解决依赖单一误差度量

英伟达最新！SCube：仅用三张图，就能实现即时大规模三维场景重建

更高轨迹精度、建图质量！基于NeRF轨迹平滑约束的SLAM优化

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉