o1的风又吹到多模态，直接吹翻了GPT-4o-mini

科技 2024-11-20 08:02 北京

开源LLaVA-o1：一个设计用于进行自主多阶段推理的新型VLM。与思维链提示不同，LLaVA-o1独立地参与到总结、视觉解释、逻辑推理和结论生成的顺序阶段。

LLaVA-o1超过了一些更大甚至是闭源模型的性能，例如Gemini-1.5-pro、GPT-4o-mini和Llama-3.2-90B-Vision-Instruct。

基础模型与LLaVA-o1的比较。基础模型Llama-3.2-11B-Vision-Instruct在推理过程中有明显的缺陷，整个推理过程中出现了几个错误。相比之下，LLaVA-o1首先概述问题，从图像中解释相关信息，然后进行逐步推理过程，并最终得出一个有充分支持的结论。

LLaVA-o1如何炼成

LLaVA-o1模型的结构化推理框架，专门的数据集和训练方法，以及推理时的阶段性束搜索策略，来提高模型在复杂任务中的推理能力和扩展性。

结构化推理阶段：

总结阶段（Summary Stage）：LLaVA-o1在这一阶段提供对问题的高层次总结，概述它打算解决的问题的主要方面。
图像描述阶段（Caption Stage）：如果存在图像，LLaVA-o1提供与问题相关的图像元素的简洁概述，帮助理解多模态输入。
推理阶段（Reasoning Stage）：在初始总结的基础上，LLaVA-o1进行结构化、逻辑推理，得出初步答案。
结论阶段（Conclusion Stage）：在最后阶段，LLaVA-o1根据前面的推理综合答案。结论阶段的输出是直接提供给用户的响应，而前三个阶段是内部的“隐藏阶段”，代表LLaVA-o1的推理过程。
四对特殊标签：<SUMMARY></SUMMARY>、<CAPTION></CAPTION>、<REASONING></REASONING>和<CONCLUSION></CONCLUSION>

数据准备和模型训练：

由于现有的视觉问题回答（VQA）数据集缺乏训练LLaVA-o1所需的详细推理过程，研究者们编译了一个新的数据集LLaVA-o1-100k，整合了多个广泛使用的VQA数据集的样本。
使用GPT-4o生成包括总结、图像描述、推理和结论的详细推理过程，并将这些编译成LLaVA-o1-100k数据集。
选择了Llama-3.2-11B-Vision-Instruct模型作为基础模型，并使用LLaVA-o1-100k数据集进行全参数微调。

有效的推理时扩展使用阶段性束搜索：

训练完成后的目标是在推理期间进一步增强模型的推理能力。LLaVA-o1的输出设计为结构化，提供了理想的粒度，用于推理时扩展。
采用阶段性束搜索方法，该方法在每个推理阶段生成多个候选结果，并选择最佳结果以继续生成过程。
通过在每个阶段进行有效的验证，这种方法验证了结构化输出在提高推理时扩展中的有效性。

推理方法的示意图。最佳选择法（Best-of-N search）生成N个完整的响应，并从中选择最好的一个；句子级束搜索（Sentence-level Beam Search）为每个句子生成多个候选项并选择最好的一个。相比之下，LLaVA-o1的阶段性束搜索（Stage-level Beam Search）为每个推理阶段（例如，总结、标题、推理和结论）生成候选项，并在每个阶段选择最佳选项。最佳选择法在粗略层面上操作，而句子级束搜索过于细致，而LLaVA-o1的方法实现了最佳平衡并取得了最佳性能。

有无阶段性束搜索的LLaVA-o1性能比较。LLaVA-o1的阶段性束搜索在模型推理过程中有效地选择了更好的推理。

实验数据

LLaVA-o1在多模态推理基准测试中相较于其基础模型Llama-3.2-11B-Vision-Instruct实现了8.9%的性能提升。
LLaVA-o1在各种基准测试中不仅超越了基础模型，还超过了一些更大甚至是闭源模型，例如Gemini-1.5-pro、GPT-4o-mini和Llama-3.2-90B-Vision-Instruct。
结构化标签（structured tags）对于模型性能至关重要。去除这些标签后，模型性能显著下降，说明这些标签有助于推理过程并提高了模型性能。

https://arxiv.org/pdf/2411.10440LLaVA-o1: Let Vision Language Models Reason Step-by-Stephttps://github.com/PKU-YuanGroup/LLaVA-o1

来源 | PaperAgent

http://mp.weixin.qq.com/s?__biz=MzIxNDgzNDg3NQ==&mid=2247550687&idx=3&sn=a83e9c76a68a1c5aacf14e4f99b767a2

深度学习与NLP

专注深度学习、NLP相关技术、资讯，追求纯粹的技术，享受学习、分享的快乐。

最新文章

教育部公布！25考研人数，再降50万！

大模型代肝，自动刷《崩铁》升级材料，Claude操纵计算机还能这么用！

一篇小型语言模型技术最新全面综述

M3DocRAG：文档问答用哪个多模态大模型效果最好？

已公示！“东方理工大学”，来了

聊一聊做角色扮演大模型的经验

绝对顶流！清华博导倾力编写的《图神经网络导论》pdf免费分享

最高9.0分！这16篇最高分ICLR2025论文必看！从生成模型到MOE等

ICLR 高分：深入研究多模态大模型的对齐策略

谷歌大佬编写，我唯一熬夜看完的机器学习神作pdf分享！

双非二战字节算法岗，拿下70k offer.....

猫猫运动方程，首次被物理学家破解！ |《美国物理学杂志》正经研究

o1的风又吹到多模态，直接吹翻了GPT-4o-mini

谷歌大佬编写，我唯一熬夜看完的机器学习神作pdf分享！

微调图像大模型的经验分享

昨夜， LLM 已经彻底凉凉了...

Karpathy后悔了：2015年就看到了语言模型的潜力，却搞了多年强化学习

微软开源角色Agents，直接模拟了整个世界~

2024最新神书-《大模型应用程序构建指南》免费pdf分享

2024最新,李宏毅深度学习教程pdf免费分享！绝对值得反复阅读的神书！

已注销！985新校区，不建了

RAG黑盒被打开了，可视化RAGViz闪亮全场

LLM性能优化中的一些概念扫盲

Nature:「人类亲吻难题」彻底难倒LLM，所有大模型全部失败！LLM根本不会推理，只是工具

Cursor一不小心把自家的底牌也放出来了~

[送5本]《动手学机器学习》上海交大ACM班总教头团队重磅新作，带你动手学机器学习！

传说中Ilya Sutskever精选论文清单：AI领域40大论文完整版「破解」完成

神书《从零构建大模型》分享，尚未发布，GitHub标星22k！！

LLM性能优化中的一些概念扫盲

暴跌94%，裁员9600人。。。

[送5本]《大语言模型：原理、应用与优化》大模型未来发展方向大揭秘！

多个中国团队斩获EMNLP'24最佳论文！UCLA华人学者中三篇杰出论文，明年顶会落户苏州

DRL2022新书-《深度强化学习》免费pdf分享

陶哲轩：计算机通用方法，往往比深奥的纯数学更能解决问题

中央批准：中央候补委员、教育部副部长，任C9大学书记

谷歌2024博士奖学金公布，KAN作者刘子鸣等数十位年轻华人学者入选

上交2024最新-《动手学大模型》实战教程及ppt分享！

考古OpenAI RLHF基石之作：探索RL和RM阶段的Scaling Law

【完整视频】黄仁勋对话软银孙正义：打造AI代理和物理AI，强调企业必须在AI浪潮中找准定位

2024最新版，人大赵鑫老师《大语言模型》新书pdf分享

上交2024最新-《动手学大模型》实战教程及ppt分享！

饶毅：全世界没有一个学校把博士后纳入“非升即走”

Scaling Laws终结，量化无用，AI大佬都在审视这篇论文

李飞飞等14位斯坦福微软大牛等撰写《AGENT AI: 综述多模态交互的前沿展望》免费pdf分享

一篇综述告诉你：如何用大语言模型设计算法

SFT洗数据，有多少细节？

LSTM+Transformer王炸创新，荣登Nature...

突发！三星7nm停供！

Ilya认错，Scaling Law崩了？自曝SSI秘密技术路线取代OpenAI

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉