Scaling Law不总是适用！尤其在文本分类任务中，vivo AI Lab提出数据质量提升解决方法

科技 2024-12-15 19:52 北京

vivo AI Lab 投稿
量子位 | 公众号 QbitAI

Scaling Law不仅在放缓，而且不一定总是适用！

尤其在文本分类任务中，扩大训练集的数据量可能会带来更严重的数据冲突和数据冗余。

要是类别界限不够清晰，数据冲突现象就更明显了。

而文本分类又在情感分析、识别用户意图等任务中极为重要，继而对AI Agent的性能也有很大影响。

最近，vivo AI Lab研究团队提出了一种数据质量提升（DQE）的方法，成功提升了LLM在文本分类任务中的准确性和效率。

实验中，DQE方法以更少的数据获得更高的准确率，并且只用了近一半的数据量，就能有效提升训练集的训练效率。

作者还对全量数据微调的模型和DQE选择的数据微调的模型在测试集上的结果进行了显著性分析。

结果发现DQE选择的数据在大多数测试集上都比全量数据表现出显著的性能提升。

目前，此项成果已被自然语言处理顶会COLING 2025主会接收。

数据质量提升方法长啥样？

在自然语言处理中，文本分类是一项十分重要的任务，比如情感分析、意图识别等，尤其现在企业都在推出各自的AI Agent，其中最重要的环节之一，就是识别用户的意图。

不同于传统的BERT模型，基于自回归的大语言模型的输出往往是不可控的，而分类任务对输出的格式要求较高。

通过在提示词中加入few-shot可以有效地改善这一现象，但是基于提示词的方法带来的提升往往有限。指令微调可以有效地改善模型的性能。

在文本分类任务中，缺乏一种有效的手段来获取高质量的数据集。OpenAI提出了缩放定律（Scaling Law），认为大语言模型的最终性能主要取决于三个因素的缩放：计算能力、模型参数和训练数据量。

然而这一定律并不总是适用，尤其在文本分类任务中，扩大训练集的数据量会可能会带来更加严重的数据冲突现象和数据冗余问题。尤其类别的界限不够清晰的时候，数据冲突的现象更加明显。

下面是vivo AI Lab团队提出的数据质量提升（DQE）方法的具体方法设计。

首先，作者对训练集进行了初步的数据清洗工作，包含处理具有缺失值的数据、query和标签重复的数据以及标签不一致数据（同一条query对应多个不同的标签）。

然后，使用文本嵌入模型，将文本转换为语义向量。再通过贪婪采样的方法，随机初始化一条数据作为初始向量，然后每次选择距离向量中心最远的数据加入到新的集合中，以提升数据的多样性。

接着，更新这个集合的向量中心，不断的重复这个过程，直到收集了50%的数据作为sampled，剩下未被选中的50%的数据集作为unsampled，然后使用sampled数据集微调大语言模型预测unsampled。

通过结合向量检索的方式，将unsampled中预测结果错误的数据分为Uncovered、Difficult和Noisy三种类型。

下面是三种类型的数据的识别原理：

Uncovered：主要指sampled中未覆盖的数据，如果预测错误的数据与最相似的数据具有相同的标签，并且最相似的数据位于unsampled中，则认为该数据相关的特征可能没有参与sampled模型的微调，从而导致unsampled中的该条预测结果错误。

Difficult：主要指sampled中难以学会的困难样本，如果预测错误的数据与最相似的数据具有相同的标签，并且最相似的数据位于sampled，则认为该数据相关的特征已经在sampled中参与过模型的微调，预测错误可能是因为这条数据很难学会。

Noisy：主要是标签不一致导致的噪声数据，如果预测错误的数据与最相似的数据具有不同的标签。则怀疑这两条数据是噪声数据。大多数文本分类任务的数据集都是共同手工标注或者模型标注获得，都可能存在一定的主观性，尤其在类别界限不清晰的时候，标注错误的现象无法避免。这种情况下，作者通过提示词，使用GPT-4o进一步辅助判断。

效果如何？

作者基于多机多卡的L40s服务器上通过swift框架进行了全参数微调，选择开源的Qwen2.5-7B-Instruct模型作为本次实验的基础模型。

作者与PaperWithCode中收录的最好的结果以及全量数据微调的方法进行了对比，作者分别在MR、CR、IMDb、SST-2、SST-5、AG News数据集中进行了对比实验。

从实验结果可以看出，DQE方法以更少的数据获得更高的准确率，并且只用了近乎一半的数据量，可以有效地提升训练集的训练效率。

同时，作者页进一步对全量数据微调的模型和DQE选择的数据微调的模型在测试集上的结果进行了显著性分析。将预测结果正确的数据赋值为1，将预测结果错误的数据赋值为0，通过t检验来评估模型之间性能差异的统计显著性。

从表中可以发现DQE选择的数据在大多数测试集上都比全量数据表现出显著的性能提升。

与传统的BERT模型不同的是，生成式的模型往往是不可控的，作者进一步分析了指令跟随结果。

结果表明，不管是全量数据微调还是DQE方法微调，都可以有效地提升大语言模型的指令跟随能力，按照预期的结果和格式输出。

对于分类任务来讲，当数据量足够大时，很难避免标签噪声现象。即便是被各大顶级学术期刊和会议广泛使用的数据集，也无法避免标签噪声现象。

作者分析了一部分通过实验找出的噪声数据，并且给出了开源数据集中的标签噪声的示例。

值得注意的是，在数据采样过程中，本研究使用贪心算法将数据集划分为sampled和unsampled。此外，作者根据文本相似度将unsampled分类为uncovered、difficult和noisy数据。

接下来，分析sampled中的这三种类型：

由于该数据将用于最终的训练集，因此它不包含uncovered。

关于difficult，将来自unsampled中识别为difficult的样本会加入到最终的训练集，这uncovered中的difficult和sampled是成对存在的，从而部分减轻了采样数据中的difficult问题。

对于noisy数据，使用DQE可以在sampled和unsampled之间识别出大多数成对的噪声实例。

由于使用sampled贪婪采样策略，在sampled内遇到成对的相似噪声数据的概率会相对较低。从理论上解释了本方案的有效性。

论文地址：https://arxiv.org/abs/2412.06575

— 完 —

投稿请发邮件到：

ai@qbitai.com

标题注明【投稿】，告诉我们：

你是谁，从哪来，投稿内容‍

附上论文/项目主页链接，以及联系方式哦

我们会（尽量）及时回复你

点这里👇关注我，记得标星哦～

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~

量子位

追踪人工智能新趋势，关注科技行业新突破

最新文章

Ilya宣判后GPT-5被曝屡训屡败，一次训数月，数据要人工从头构建

素数分布规律又有新发现！赵宇飞学生与牛津教授合作成果

o3来了！编程跻身人类全球前200，破解陶哲轩说难的数学测试，北大校友任泓宇现身直播间

图森未来转型6个月：推出AI大模型，布局游戏生态，思考和底气是什么？

这届AI创业：不敲一行代码，营收突破百万级

AI已经在直播间狂刷KPI了

AI风暴席卷达摩院青橙奖，六成获奖者用AI搞科研，平均年龄34岁

1万人研究证实：玩游戏提升智力，与遗传/经济水平都无关

AI能传递气味了！能定制个性化气味，谷歌前研究员新技术

突发！GPT论文一作Alec Radford离职，前两代GPT作者全部离开OpenAI

不会代码的独立开发者，除了学Cursor，还该会些什么？｜十问爆款「小猫补光灯」

谷歌版o1突发即屠榜！思考速度比所有模型快5倍，能解摩斯代码，数学物理秒秒钟解决

苹果Mac用户狂喜！ChatGPT深度集成应用，最后再藏AGI彩蛋

豆包升级了“眼睛”，看APP截图就能写代码了！超低价让多模态AI普惠

100+大模型综测结果出炉！智源发布FlagEval“百模”评测结果，覆盖文本语音图片视频多种模态

12个大模型攒局玩“大富翁”：Claude3.5爱合作，GPT-4o最“自私”｜谷歌DeepMind研究

Claude团队揭发AI伪装对齐：训练时假装遵守目标，只为保护自己价值观不被修改

腾讯版Sora开源后，被提速8倍！官方点赞并预告：下月上新图生视频

突破自动驾驶视频生成极限：港中文&港科大&华为联手推出MagicDriveDiT

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果

云计算一哥的生成式AI之道：Choice Matters

大模型是新的数据库！蚂蚁开源负责人王旭：应用开发新范式，新一代LAMP正在形成 | MEET 2025

英伟达新品“掌心AI超算”，¥1800跑8B多模态模型，算力暴增70%价格腰斩

GPT-4o数学能力跑分直掉50%，上海AI Lab开始给大模型重新出题了

更懂中文还兼顾SD生态，360开源文生图模型结构，寡姐秒变中国新娘 | AAAI

我们要做3D界的ImageNet，推动具身智能训练新范式｜群核科技唐睿@MEET2025

见证历史！AI想的科研idea，真被人类写成论文发表了

从骁龙8至尊版，我看到了AI手机的未来 | 智在终端

新奥程路：AI×能源已到“奇点变革”前夜，仿真大模型是关键｜MEET 2025

开源Llama版o1来了，3B小模型反超80B，逆向工程复现OpenAI新Scaling Law

宇树机器人强化学习代码全面开源，还有训练到仿真和实操手把手教学

为多模态LLM引入ControlNet理念，开源插件解决灾难性遗忘 | AAAI

刚刚，智谱又融了30亿！超200亿估值引领大模型创业赛道

谷歌版Sora升级4K高清！一句话控制镜头运动，跑分叫板可灵海螺

ChatGPT搜索与Her打通了！搜索免费开放，居然还剧透明日直播主题

Kimi版o1实装上线，这里是我们的一手测试↑

把1个脑洞发展成1场顶会workshop，阿里妈妈只用了1年｜直击NeurIPS'24

企业级Agent已进入生产力阶段｜BetterYeah AI张毅@MEET

Gemini 2.0成P图神器，各种P图只需一句话的事儿，可把网友馋哭了

21天不用手机，抑郁减少，入睡更快丨正经研究

基于昇腾算力突破AI求解，最高加速100倍！| 华为GTS&深圳市大数据研究院

全球首个全模态理解开源端模型：长语音自动总结，图文音啥都会！300%推理速度领先，来自无问芯穹

月薪1万4的ChatGPT要来了！OpenAI自曝其达博士级别，网友：我宁可聘请一个博士

直击CCAI大会：院士专家舌战激辩，20个AI案例C位出道，海淀无愧AI科技“梦工厂”

OpenAI附议Ilya预训练终结！“但Scaling Law还没死”

Scaling Law不总是适用！尤其在文本分类任务中，vivo AI Lab提出数据质量提升解决方法

Ilya宣判：预训练即将终结！NeurIPS现场沸腾

ChatGPT终于也推出Projects功能，却故意露出一个“AGI”的项目

4000万+用户！测测CEO任永亮：一个行业既不能离AI太近也不能离AI太远 | MEET 2025

专治大模型“套壳”！上海AI实验室等给LLM做“指纹识别”，剪枝合并也无所遁形

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉

Scaling Law不总是适用！尤其在文本分类任务中，vivo AI Lab提出数据质量提升解决方法

vivo AI Lab 投稿量子位 | 公众号 QbitAI

数据质量提升方法长啥样？

效果如何？

vivo AI Lab 投稿
量子位 | 公众号 QbitAI