首页时事民生政务教育文化科技财富体娱健康情感

旅行百科职场楼市企业乐活学术汽车时尚创业美食幽默美体文摘

超越GPT-4o！阿里发布最强开源多模态模型Qwen2-VL，支持实时视频对话

科技 2024-08-30 17:50 北京

来源|量子位

新的最强开源多模态大模型来了！

阿里Qwen2大模型家族新添多模态模型Qwen2-VL，在图像和长视频理解任务上双双取得了SOTA。

在具体的子类任务中，Qwen2-VL在大部分的指标上都达到了最优，甚至超过 GPT-4o等闭源模型。

在多模态能力的加持下，Qwen2-VL可以实时读取摄像头或电脑屏幕，进行文字形式的视频对话。

甚至还能作为Agent与环境进行交互，根据任务目标自主操控手机等设备。

此次发布的Qwen2共有2B、7B、72B三个版本，其中2B和7B版本已可下载并免费商用（Apache 2.0），72B则通过API提供。

目前开源代码已集成到Hugging Face Transformers、vLLM等第三方框架中。

还有不少网友都在狂cue一些知名大模型推理平台，如Groq、Ollama，希望能够早日提供支持。

下面就来一睹Qwen2-VL的表现！

会操作机械臂的多模态大模型

利用强大的多模态能力，Qwen2-VL能够操纵机械臂，进行物体的拿取、放置等操作。

还可以化身扑克牌玩家，根据识别到的场上信息和提示词描述进行“24点”游戏的决策，并且取得了胜利。

还有开头所展示的，Qwen2-VL可以根据识别到的屏幕内容，结合用户需求自行操作手机在网络上进行信息检索。

当然在这些体现工具调用和Agent交互能力的复杂任务背后，基础能力也是不能落下。

比如图像识别，在物体类的识别当中，Qwen2-VL可以准确地认出花的品种。

另一类识别场景是文字，Qwen2-VL支持多种语言的文本提取。

甚至把16种语言混合到一张图中，Qwen2-VL不仅能判断各自的语种，也能一口气提取出全部文本。

手写字体和复杂的数学公式也能识别，并且上下标这种微小细节处理得非常到位。

Qwen2-VL还支持多模态推理，代码和数学（包括几何）类问题，只需要传张图片就能解决。

视频方面，Qwen2-VL最长可以对20分钟以上的视频进行内容分析，既支持总结也能对细节进行提问。

不过目前还只能分析画面，暂不支持对声音的处理。

同时也支持实时视频文字对话，除了开头展示的基于摄像头的对话外，也可以读取电脑屏幕，作为对话的内容。

总之，在这些任务的背后，蕴含着Qwen2-VL不凡的综合实力。

多模态实力超GPT-4o

为了了解Qwen2-VL在各种任务上的综合表现，千问团队一共从从六个方面对其视觉能力进行了评估。

具体包括了综合类大学试题、数学试题、文档表格理解、通用场景下的问答、视频理解以及Agent能力这六种类型。

整体来看，Qwen2-72B的大部分的指标上都达到了最优，甚至超过了GPT-4o和Claude3.5-Sonnet，特别是在文档理解方面优势明显。

另外在多语言测试中，MTVQA也在9种语言中的8种全面超越了GPT-4o、Claude3-Opus和Gemini Ultra这些先进闭源模型，平均成绩也是最高分。

7B版本同样支持图像、多图、视频的输入，同时也达到了同等规模模型的SOTA水准。

最小的2B版本则主要为移动端设计，但麻雀虽小，却具备完整图像视频多语言的理解能力，特别在视频文档和通用场景问答相较同规模模型优势明显。

整体上，Qwen2-VL延续了其上一代Qwen-VL中ViT加Qwen（2）的串联结构，在三个不同规模的模型上，Qwen2-VL都采用了600M规模大小的ViT，并且支持图像和视频统一输入。

为了让模型更清楚地感知视觉信息和理解视频，Qwen2-VL新增了对原生动态分辨率的全面支持。

与上一代模型相比，Qwen2-VL能够处理任意分辨率的图像输入，不同大小图片被转换为动态数量的tokens，最少只需要4个。

这种设计不仅确保了模型输入与图像原始信息之间的一致性，也模拟了人类视觉感知的自然方式，让模型在图像处理任务上更加灵活高效。

Qwen2-VL在架构上的另一项创新，是多模态旋转位置嵌入（M-ROPE）。

传统的旋转位置嵌入只能捕捉一维序列的位置信息，而M-ROPE通过将原始旋转嵌入分解为代表时间、高度和宽度的三个部分。

这使得大规模语言模型能够同时捕捉和整合一维文本序列、二维视觉图像以及三维视频的位置信息。

这一创新有助于提升模型的多模态处理和推理能力，能够更好地理解和建模复杂的多模态数据。

DEMO：

https://huggingface.co/spaces/Qwen/Qwen2-VL

项目主页：

https://qwenlm.github.io/blog/qwen2-vl/

GitHub：

https://github.com/QwenLM/Qwen2-VL

http://mp.weixin.qq.com/s?__biz=MzkyMDU5OTAyNg==&mid=2247490229&idx=2&sn=f66a10fc2fc114f527ab631383fe21fb

围绕生成式AI技术的交流社区，与开发者和合作伙伴共同探究有深度的生成式AI技术前沿洞见、技术迭代、案例解析、方法和实践，助力企业的数字化转型

最新文章

中美之外，谁还能在AI竞争中占领制高点？迪拜与新加坡的契机

Blackwell与FP4精度：AI量化浪潮中推动端侧发展的“双子星”

OpenAI：AGI共5层，我们现在在第2层

吴恩达：《State of AI report》展现2024的主要趋势和突破（二）

OpenAI 推出了 Canvas 和 SearchGPT

英伟达 GPU 架构：演进与模型推理速度的深度关联

吴恩达：《State of AI report》展现2024的主要趋势和突破（一）

模型剪枝，如何把模型的使用成本降下来？

AI Agent智能数字员工解决案例

MemoRAG：重新定义长期记忆的AI问答模型

从Pre-training Scaling Law到Inference Scaling Law：OpenAI O1模型引领新范式

探秘AIPC软件：云端和本地如何奏响混合乐章

RAG测评关键指标

字节版Sora火爆24小时，同名论文再次被热议

李沐：如果有什么事这一辈子总要试下的，就趁早

曝英特尔被抢投50亿美元！高通求购关口，老伙计火线救场

黑神话热潮，能引发GPU狂欢的才是杀手级应用

o1核心作者MIT演讲：激励AI自我学习，比试图教会AI每一项任务更重要

数据先行 -- Scale AI如何通过AI数据服务成为独角兽

OpenAI重金押注，机器人NEO世界模型登场！机器人迎来ChatGPT时刻？

解析 Llama-Factory：从微调到推理的架构

OpenAI o1模型问世，五级AGI再突破！推理极限超博士，清北复旦华人立功

RAG领域出现技术创新，或将引领AI搜索重大变革？

OpenAI神秘模型「草莓」两周内上线？数学推理暴涨，月收费200刀已有人付费

使用 LlamaIndex 进行 CRAG 开发用来强化检索增强生成

苹果华为新机同日上市，靠谱剧透都在这里了

LLM如何结合知识图谱进行RAG

Windows率先本地文生图，互联iPhone秒传图片，最新AI PC来了！

Blackwell视角揭秘：生成式AI挑战如何重塑GPU芯片的未来版图

大厂不想你有 AI 女友

商汤SenseNova 5.5大模型的应用实践

又有AI创始人卖身大厂！带走25%员工留下空壳，为吴恩达第一位博士生

AI驱动的智能运维：行业案例与挑战解析

超越GPT-4o！阿里发布最强开源多模态模型Qwen2-VL，支持实时视频对话

给RAG开药方：亚马逊发布RAGChecker，专治AI回答不准

GPT-5降临，代号猎户座？OpenAI疑用草莓训练，数学推理暴涨超越所有模型

为什么AI PC需要NPU？

Transformer作者预警：只卖模型玩不过OpenAI！

大模型时代，传统程序员还需要写代码吗？

谷歌搜索引擎全面揭秘！近百份文档泄露，博主爆肝数周逆向工程

AI模型“减肥”风潮：量化究竟带来了什么？

比红杉还猛！7个月投资8家AI公司，智谱为什么投得这么凶？

100%结构化输出——OpenAI新功能大幅增强工具调用

ChatGPT成8岁娃「导师」，外国家长们慌了！

AI模型训练中的双剑侠dd：GPU和CPU的分工

全球首个AI科学家诞生！论文写稿与审稿一起拿下，实现全自动开放式科学发现

Relevance AI：打造一个AI智能体营销团队

谷歌版Her抢跑！一键召唤Gemini，全球52亿终端被颠覆

以小搏大：Salesforce 十亿参数模型表现超过ChatGPT

AI搜索向左，搜索 OG 向右

分类

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉