Qwen2.5登上全球开源王座！72B模型击败LIama3 405B，轻松胜过GPT-4o-mini

文摘 2024-09-19 15:01 江苏

白小交发自凹非寺
量子位 | 公众号 QbitAI

击败LIama3！Qwen2.5登上全球开源王座。

而后者仅以五分之一的参数规模，就在多任务中超越LIama3 405B。

各种任务表现也远超同类别的其他模型。

跟上一代相比，几乎实现了全面提升，尤其在一般任务、数学和编码方面的能力表现显著。

值得注意的是，此次Qwen可以说是史上最大规模开源，基础模型直接释放了7个参数型号，其中还有六七个数学、代码模型。

像14B、32B以及轻量级Turbo模型胜过GPT-4o-mini。

除3B和72B模型外，此次所有开源模型均采用Apache 2.0许可。

Qwen2.5：0.5B、1.5B、3B、7B、14B、32B和72B
Qwen2.5-Coder：1.5B、7B和32B（on the way）
Qwen2.5-Math：1.5B、7B和72B。

直接一整个眼花缭乱，已经有网友开始用上了。

Qwen2.5 72B与LIama3.1 405B水平相当

相比于Qwen2系列，Qwen2.5系列主要有这么几个方面升级。

首先，全面开源。

他们研究表明，用户对于生产用的10B-30B参数范围以及移动端应用的3B规模的模型有浓厚兴趣。

因此在原有开源同尺寸（0.5/1.5/7/72B）基础上，还新增了14B、32B以及3B的模型。

同时，通义还推出了Qwen-Plus与Qwen-Turbo版本，可以通过阿里云大模型服务平台的API服务进行体验。

可以看到，超半数模型都支持128K上下文，最多可生成8K上下文。

在他们的综合评测中，所有模型跟上一代相比实现了能力的跃迁，比如Qwen2.5-32B胜过Qwen2-72B，Qwen2.5-14B胜过Qwen2-57B-A14B。

其次，预训练数据集更大更高质量，从原本7万亿个token扩展到最多18万亿个token。

然后就是多方面的能力增强，比如获得更多知识、数学编码能力以及更符合人类偏好。

此外，还有在指令跟踪、长文本生成（从1k增加到8K以上token）、结构化数据理解（如表格）和结构化输出生成（尤其是JSON）方面均有显著提升。

来看看实际效果。

表格理解

生成JSON输出

此外，Qwen2.5模型总体上对系统提示的多样性具有更强的适应能力，增强了聊天机器人的角色扮演实现和条件设定能力。

那么就来看看具体模型能力如何。

旗舰模型在前文已经看到，它在各个任务都有明显的进步。

而像0.5B、1.5B以及3B这样的小模型，性能大概是这样的：

值得注意的是，Qwen2.5-0.5B型号在各种数学和编码任务上的表现优于Gemma2-2.6B。

除此之外，Qwen2.5还展现了指令调优之后的模型性能，72B-Instruct在几项关键任务中超越了更大的Llama-3.1-405B，尤其在数学（MATH：83.1）、编码（LiveCodeBench：55.5）和聊天（Arena-Hard：81.2）方面表现出色。

还有像32B-Instruct、14B-Instruct以及Qwen2.5-Turbo，展现了与GPT-4o-mini相当的能力。

Qwen史上最大规模开源

除了基础模型，此次Qwen还放出了代码和数学专业模型。

Qwen2.5-Coder提供了三种模型大小：1.5B、7B和32B版本（即将推出）。

主要有两点改进：代码训练数据规模的扩大以及编码能力的增强。

Qwen2.5-Coder在更大规模的代码数据上进行训练，包括源代码、文本代码基础数据和合成数据，总计5.5万亿个token。

它支持128K上下文，覆盖92种编程语言。开源的7B版本甚至超越了DeepSeek-Coder-V2-Lite和Codestral等更大型的模型，成为目前最强大的基础代码模型之一。

而数学模型这边，Qwen2.5-Math主要支持通过CoT和TIR解决英文和中文数学问题。

目前不建议将此系列模型用于其他任务。

Qwen2.5-Math这一系列开源了包括基础模型Qwen2.5-Math-1.5B/7B/72B、指令调优模型Qwen2.5-Math-1.5B/7B/72B-Instruct，以及数学奖励模型Qwen2.5-Math-RM-72B。

与Qwen2-Math系列仅支持使用思维链（CoT）解决英文数学问题不同，Qwen2.5-Math 系列扩展支持使用思维链和工具集成推理（TIR）解决中英文数学问题。

跟上一版本相比，他们主要干了这三件事来实现基础模型升级。

利用Qwen2-Math-72B-Instruct模型来合成额外的高质量数学预训练数据。

从网络资源、书籍和代码中收集更多高质量的数学数据，尤其是中文数据，跨越多个时间周期。

利用Qwen2.5系列基础模型进行参数初始化，展现出更强大的语言理解、代码生成和文本推理能力。

最终实现了能力的提升，比如1.5B/7B/72B在高考数学问答中分别提升了 3.4、12.2、19.8 分。

好了，以上是Qwen2.5系列一整套堪称「史上最大规模」的开源。

不叫草莓叫猕猴桃

阿里通义开源负责人林俊旸也分享了背后的一些细节。

他首先表示，在开源Qwen2的那一刻就开始了Qwen2.5项目。

在这过程中，他们认识到了很多问题和错误。

比如在预训练方面，他们们只是专注于提高预训练数据的质量和数量，使用了很多大家熟悉的方法。

比如文本分类器用于召回高质量数据，LLM 评分器用于对数据进行评分，这样就能在质量和数量之间取得平衡。

还有在创建专家模型的同时，团队还利用它们生成合成数据。

在后期训练时候，用户的反馈来帮助他们逐一解决问题，同时他们也在探索RLHF 方法，尤其是在线学习方法。

对于之后的升级和更新，他表示受o1启发，认为应该深入研究推理能力。

值得一提的是，在Qwen2.5预热之时，他们团队就透露不叫草莓，叫猕猴桃。

好了，现在猕猴桃可以快快用起来了。

槿墨AI

产品服务

结合大模型通用知识及在交通、社会治理、安全生产、自然资源等行业领域的知识，深入业务场景，精确捕获用户意图，为用户提供智能问答、数据分析、报表生成、工作任务理解与执行等一系列服务

📞若您有相关需求，欢迎点击下方链接与我们沟通洽谈

🗨️也可以在公众号后台给我们留言

参考链接：
[1]https://x.com/JustinLin610/status/1836461575965938104
[2]https://x.com/Alibaba_Qwen/status/1836449414220779584
[3]https://qwenlm.github.io/blog/qwen2.5/
[4]https://qwenlm.github.io/blog/qwen2.5-llm/
[5]https://qwenlm.github.io/blog/qwen2.5-coder/
[6]https://qwenlm.github.io/blog/qwen2.5-math/

http://mp.weixin.qq.com/s?__biz=MzkwMjY0ODMwNA==&mid=2247486739&idx=1&sn=77938f4783b3a73c10e2ccf357da6361

槿墨AI

开启探索人类未来命运的旅程，拥抱如槿似墨的无限可能。

最新文章

【文生智界】WonderWorld：一图在手，世界我有

【文生智界】介绍一下，Stable Diffusion！文生图的稳定之选

【文生智界】AI将3D建模带入大众视野，创意如何突破技术壁垒？

告别预设剧本，“人生”永无止境：Unbounded

国庆节火遍抖音的AI雷军从何而来——GPT-SoVits

ChatGPT终于变AI搜索引擎了！网页/手机/桌面版同时上线，即将人人可用

7天开发一个AI Agent应用！秘密武器：一体化数据库

苹果AI上线，ChatGPT免费用！首款M4 Mac诞生

大模型“投资热”降温，下半场转向“应用落地”

POINTS多模态大模型亮相：微信团队打造，高效简洁性能强

港大最新开源LightRAG：更快、更强、更经济的RAG系统

AIGC丨ChatGPT的流式输出技术SSE实践！

Claude 3.5深夜觉醒，学会模仿人类用电脑！编程干翻o1，Agent一夜变天

切，这玩意儿不就是一眼 AI …… 吧？

字节：不做眼镜做耳机，揭秘Ola Friend核心技术

YOLO11：重新定义性能极限！对比YOLO8如何？

H100价格大跌！GPU供需失衡，真过剩？

大语言模型垂直领域融合的最优解：微调or检索增强生成?

长文本、语音、视觉全覆盖，中国移动抬上大招：九天善智！

李飞飞「数字表兄弟」破解机器人训练难题！零样本sim2real成功率高达90%

LLM（大语言模型），我们距离应用还差什么？

特斯拉首款无人驾驶出租问世，马斯克掀翻全场！无方向盘、无踏板，3万美元26年量产

诺贝尔物理和化学奖都颁给了AI，意味着什么？

双向奔赴！什么是大模型和数据库的双向赋能？

Meta首款多模态Llama 3.2开源！1B羊驼宝宝，跑在手机上了

RT-DETRv3横空出世！探究实时目标检测的尽头

【一手实测】Tripo 2.0：AI 3D生成天花板再拉升！

聊聊3DGS，各应用方向的最新进展是？

李飞飞创业后的首个专访：空间智能是下一个“北极星”

CoT神话破灭，并非LLM标配！三大学府机构联手证实，CoT仅在数学符号推理有用

用AI和宠物闲聊，解锁「毛孩子」语言，铲屎官心动！

Qwen2.5登上全球开源王座！72B模型击败LIama3 405B，轻松胜过GPT-4o-mini

【盘点】AI视觉算法主流部署方式，到底怎么选？

会领路、能聊天，现在的导航已经next level了

深夜空降！OpenAI草莓正式发布，命名o1， GPT-4o被碾压！

对话Qwen2-VL：多模态大模型背后的逻辑

上交大：让代码自动成长！培养你的专属宝可梦

PyTorch官宣去CUDA推理！Triton时代来了

FairMOT：解锁复杂环境下多目标跟踪的难题！

Cursor：开发者的新质生产力，人人都是程序员？

机器人身穿衣服做家务，逼真到被质疑是人类套壳

大模型应用新战场：揭秘终端侧AI竞争关键｜智在终端

全国首个上手机的AI视频通话来了！《黑神话：悟空》经文也能破译

【深度解读】政务大模型的产业图谱、企业布局与落地应用

又创新？U-KAN：专注图像边界细节优化的网络架构！

AI开启“城市漫步”，这Citywalk够不够贴心！

【梳理】主流推荐算法：如何让AI更精准地“猜你喜欢”？

Midjourney地位不稳？AI绘图又一黑马出现，附4款产品一手实测

实测！30秒即可生成工业级Mesh，媲美人工建模？

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉

Qwen2.5登上全球开源王座！72B模型击败LIama3 405B，轻松胜过GPT-4o-mini

白小交 发自 凹非寺量子位 | 公众号 QbitAI

Qwen2.5 72B与LIama3.1 405B水平相当

Qwen史上最大规模开源

不叫草莓叫猕猴桃

白小交发自凹非寺
量子位 | 公众号 QbitAI