CVPR 2024｜多模态大模型引爆！“因果推理”加持, 解锁链接上下文学习的无限潜能

文摘 2024-10-18 08:56 英国

点击上方蓝字关注我们

Link-Context Learning for Multimodal LLMs

作者:

Yan Tai, Weichen Fan, Zhao Zhang, Ziwei Liu

作者单位:

南洋理工大学 S-Lab，商汤科技，东方工学院宁波数字孪生研究所

论文链接:

https://arxiv.org/pdf/2308.07891

代码链接:

https://github.com/isekai-portal/Link-Context-Learning

简介

从上下文中学习新概念并提供适当响应的能力在人类对话中至关重要。尽管当前的多模态大语言模型（MLLM）和大语言模型（LLM）正在大规模数据集上进行训练，但以免训练的方式识别看不见的图像或理解新概念仍然是一个挑战。情境学习（ICL）探索免训练的小样本学习，鼓励模型从有限的任务中“学会学习”并泛化到未见过的任务。本文提出了链接上下文学习（LCL），强调“因果推理”来增强 MLLM 的学习能力。LCL 通过显式强化支持集和查询集之间的因果关系超越了传统的 ICL。通过提供因果关系的演示，LCL 引导模型不仅辨别类比，而且辨别数据点之间的潜在因果关联，这使 MLLM 能够识别看不见的图像并更有效地理解新概念。为了促进对这种方法的评估，文中引入了 ISEKAI 数据集，专门包含为链接上下文学习而设计的未见过的生成图像标签对。

图 1.链接上下文学习的演示对话。在向模型呈现一对看不见的图像和新颖的概念后，改进模型获得了在整个对话过程中学习和保留所获得知识的能力，而普通 MLLM 无法提供准确的答案。

研究动机

MLLM 从演示中学习的主要方法被称为上下文学习，其中模型在接触一些输入标签对后在下游任务上显示出显着的改进。然而，当前的 MLLM 从上下文学习中获得的好处非常有限，因为重点主要是引导模型在从元任务“学习”之后获得处理新任务的能力。然而，即使元任务中提供的答案全部错误，模型的性能也不会受到影响。因此，MLLM 从演示中“学到”的仍然是以特定格式回答问题，而不是理解图像-标签对之间的因果关系。

为了使 MLLM 能够更多地关注图像和标签对之间的因果关系，Frozen 方法将不同的标签绑定到已知图像。然而，当 MLLM 遇到图像和标签都看不见的全新场景时，就会出现重大挑战。在这种情况下，从演示中提取潜在的因果关系并根据新发现的知识做出准确的预测仍然是一个未解决的难题。

图 2.链接上下文学习与上下文学习之间的区别。上下文学习涉及为演示提供不相关的任务，而链接上下文学习的演示和推理阶段之间存在直接的因果关系。

如图 2 所示，当前 MLLM 中的情境学习强调从因果无关的演示中受益。然而，对于链接上下文学习，演示和最终任务是因果关联的。（例如，如果在演示中将“苹果”重命名为“橙色”，则模型应在推理过程中将苹果称为“橙色”。）有了这种能力，MLLM 可以以灵活的方式支持小样本学习。

论文贡献

链接上下文学习：引入了一种新的因果相关的小样本学习设置，其中 MLLM 面临的挑战是从正在进行的对话中吸收新概念，并保留这些知识以准确回答问题。在链接上下文学习下，使 MLLM 能够从演示中掌握源和目标之间的因果关系。
ISEKAI 数据集：由于 MLLM 并非完全看不到大多数现实世界的数据，因此本文发布了一个具有挑战性的数据集，其中引入了新的图像概念对，用于评估 MLLM 的性能。

方法

文中提出链接上下文学习（LCL），赋予 MLLM 理解对话中潜在因果关系并处理看不见的图像和概念的能力。与 ICL 主要侧重于启发具有各种不同任务的模型不同，LCL 更进一步，通过授权模型在源和目标之间建立映射，从而提高其整体性能。

链接上下文学习的主要限制和区别

上下文学习是指：给定查询输入，模型应从一组候选答案中选择预测得分最高的答案x，以支持集 S 为条件，该支持集由来自各种任务的多个输入标签对组成，其中。（查询和S的样本应该属于不同的任务。）

从另一个角度来看，上下文学习可以表示为免训练的少样本学习，因为它将少样本学习的训练阶段转变为演示输入对于大型语言模型。注意到 ICL与 FSL 一致，其中演示（训练）阶段和推理（查询）阶段的任务是不同的。

链接上下文学习（LCL）代表了一种免训练且因果链接的小样本学习的形式。在这种方法中，提供了支持集 S，以及来自查询集 Q 的查询样本 x，其中数据对来自支持集与查询集有因果关系。该模型的任务是根据查询和支持集之间的因果关系来预测答案。

将链接上下文学习引入 MLLM

提出了一种新的训练策略来微调 MLLM。这种方法旨在使模型能够有效地从上下文中掌握因果关系。这种新的训练策略使 MLLM 能够在需要推理和理解因果关系的任务中表现出色，从而扩大他们的能力范围并提高他们的整体表现。

训练数据集

ImageNet1k 通常用于图像分类任务，通常在整个数据集上训练模型以增强其跨所有类别的识别能力。相比之下，在 LCL 的训练配置中，文中仅从每个类别中随机选择有限数量的样本。然后，为每个类别排列一组相似度递减的相关类别，称为“邻居”。具体来说，采用 CLIP 来计算训练数据集中不同类之间的相似度。首先，从每个类别中随机选择 100 张图像，并计算每个类别的平均图像特征。随后，对所有类的文本名称进行编码以获得其对应的特征向量。最终，计算不同类对之间的加权相似度，包括图像到图像、图像到文本和文本到文本的相关性。对于特定类别，根据相似性对所有其他类别进行排序，并将它们划分为 N 个区间。然后，在每个区间内，随机选择类别来构造一组总数为 N 的“邻居”。

训练策略

为了使 MLLM 理解支持集和查询样本之间的因果关系，以及支持集中输入标签对之间的因果关系，文中构建正负对来促使模型从比较中学习。令支持集表示为。根据样本之间的相关性，可以将支持集重新定义为，其中每个作为代表 S 中样本簇的原型。这些原型捕获了本质关系以及 S 内样本之间的相似性。给定查询 x，训练 θ 来最大化可能性：

其中θ表示语言模型的参数。视觉编码器的参数在训练期间被冻结。

[2-way] 策略：训练 MLLM 进行二值图像分类，其中。训练类集表示为，随机采样一个类作为正类，其中它的邻居类集是与最相似的类，而是最不相似的）。然后应用硬负挖掘策略，以概率从中采样负类。请注意，此设置固定为 16 个镜头进行训练。

实验结果

图 4. 与 OpenFlamingo、Otter 之间新图像理解结果的定性比较。

图 5.ISEKAI 数据集概述：该数据集完全由生成的图像组成，其中来自“ISEKAI World”的图像在现实生活中不存在，而来自“Real World”的图像来自现实。

表 1.ISEKAI 从零次到 16 次的定量评估，以准确度衡量。

致谢作者，关于论文的详细实施过程和具体解释请阅读论文原文哦～❤️❤️ 转载请注明出处

喜欢的话，请别忘记点赞👍➕关注哦

一文彻底搞懂多模态 - 多模态推理

大模型经典著作《大语言模型基础与前沿》

NeurIPS 2024|耦合Mamba：通过耦合状态空间模型增强多模态融合

腾讯&南大最新联合发布｜VITA：首个开源交互式全能多模态大模型！

一文彻底搞懂多模态 - 多模态学习

ICCV 2023｜CleanCLIP重磅登场！消除多模态对比学习中的数据中毒攻击

导师一个idea都没给，但也发了顶会AAAI，我摸索的这个方法绝了！

重磅3D多模态MSF框架发布！2D/3D语义分割双模态解析，重塑3D物体检测多语义融合框架

最新进展！全新特征学习框架，深度解析单模态与多模态对比学习泛化差异

揭秘时间魔法！段类型特征驱动的时间序列聚类算法

EMNLP 2024 多模态学习最新论文合集出炉！快速关注热点研究！

文末赠书｜深度揭秘！多模态大模型如何运作？一文读懂其核心原理！

NeurIPS 2024震撼发布：上交大&清华领衔创新，Diff-eRank大模型评估新指标，精准衡量LLM去噪实力！

CVPR投稿倒计时15天！Transformer还能卷出哪些新花样？

I 2025｜快手科技发布突破性EVLM！高效视觉语言模型，极大降低计算成本，实现全面视觉感知！

EMNLP 2024｜南京大学重磅推出EFUF：高效细粒度unlearning框架，全面破解多模态大语言模型“幻觉”难题！

NeurIPS 2024 | G3: 一种基于多模态大模型的高效自适应地理定位框架

港中文、UCL、武大联手攻关！NeurIPS 2024 全新多模态情绪分析模型，精准应对不完整数据挑战！

刷新多模态医学图像报告生成新高度｜AAAI 2023 山东大学&齐鲁医院推出多模态记忆Transformer！

NeurIPS 2024｜多模态学习重磅论文全览！最新研究集锦，不容错过！（下）

NeurIPS 2024｜多模态学习重磅论文全览！最新研究集锦，不容错过！（上）

突破了LLM极限，GPT-o1深度揭秘

港中文、上海AI Lab与浙大重磅推出PointLLM：大语言模型再升级，强势赋能点云理解！-ECCV 2024

NeurIPS 2024 | 像素级MLLM: Vitron, 实现图像视频的理解、生成、分割、编辑大一统

TPAMI 2024 | 基于时空结构对齐的视频-语言表示学习

ECCV 2024｜解锁多模态自监督学习！深度解耦常见与独特表示的创新突破

CVPR2023-基于交互式提示学习的多模态融合方法

CVPR 2024｜多模态大模型引爆！“因果推理”加持, 解锁链接上下文学习的无限潜能

CVPR 2023｜TransFusion震撼登场！突破性语义分割多模态融合网络，点云与图像直接融合！

TPAMI | SegNet:语义分割领域超经典轻量化模型

ECCV 2024｜多模态学习不鲁棒？表示解耦打造稳健多模态学习新纪元

NeurIPS 2021-如何利用知识图谱构建世界模型？！一种新的文本世界建模技术！

文末赠书｜《AI系统：原理与架构》于华为HC大会2024正式发布

又一本开源免费的大模型书来了，449页pdf！

CVPR 2024｜突破模态瓶颈！交替单模态适应引领多模态表示学习，攻克模态惰性与遗忘难题！

速来围观！多模态大型语言模型(MLLM)最新进展与实战应用全揭秘！

学术最前沿！2024最新深度多模态数据融合综述来袭！

AI大模型掀起效率革命！掌握ChatGPT等前沿技术，赋能企事业办公、科研与项目研发实战

ICML 2024｜浙大，NUS等高校联手推出多模态LLM革命性自动编码技术—Morph-Tokens

AAAI 2024｜重磅发布！多模态跟踪新范式：条件生成对抗网络与扩散模型的融合引爆技术革命！

ECCV 2024 | 破解多模态学习：单模态模型联合嵌入助力缺失模态预测新突破！

NeurIPS 2023｜浙大&上海AI Lab&华为联合发表--跨模态泛化的多模态统一表示

TPAMI 2024|打破边界！双向LiDAR相机语义分割中的单到多模态知识蒸馏革命

顶会NeurIPS‘24放榜！接收数量突破4千！8865高分被拒？

NeurIPS 2024|颠覆性发现！大型视觉-语言模型真的会“看”吗？MMStar基准揭示多模态评估误区与数据泄漏隐患

ECCV 2024 ｜中国人民大学、清华大学等提出平衡多模态学习的诊断和再学习方法

TPAMI 2024｜颠覆跨模态相似性学习的“游戏规则”！因果不变交互挖掘CIIM强势来袭：打破模态壁垒，精准捕捉跨模态信息！

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉