ECCV 2024 | 破解多模态学习：单模态模型联合嵌入助力缺失模态预测新突破！

文摘 2024-10-05 10:00 英国

点击上方蓝字关注我们

Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal Models

作者: Donggeun Kim, Taesup Kim

作者单位: 首尔大学

论文链接:

https://www.ecva.net/papers/eccv_2024/papers_ECCV/papers/11614.pdf

简介

多模态学习通常依赖于这样的假设：所有模态在训练和推理阶段都完全可用。然而，在现实场景中，由于各种因素，持续获取完整的多模态数据面临着巨大的挑战。这通常会导致模态缺失的问题，即缺少某些模态的数据，这不仅对多模态预训练模型的可用性造成了相当大的障碍，而且也对其微调和下游任务中鲁棒性的保持造成了相当大的障碍。为了应对这些挑战，提出了一种将单模态预训练模型的参数高效微调与自监督联合嵌入学习方法相结合的新框架。该框架使模型能够在推理过程中预测表示空间中缺失模态的嵌入。该方法通过及时调整，利用可用模态中的信息，有效地预测丢失的嵌入。在多个多模态基准数据集上和各种缺失模态的场景中的实验证明了其有效性和稳健性。

文中将多模态设置的问题定义如下：

假设存在预训练的单模态编码器；
为下游任务提供部分不配对的数据；
推理时也给出未配对的数据。

研究动机

多模态学习需要所有模态的完整性的假设很难维持，从而导致不成对的数据问题以及由此产生的模态缺失问题。而且，在某些情况下，获得在数亿个图像文本对上进行预训练的有效联合（多模态）编码器可能会变得具有挑战性。
获取单模态数据比获取多模态数据相对容易。预训练的单模态模型具有多种形式并表现出高性能，比多模态模型更容易获得。文中建议对每种模态使用独立预训练的单模态编码器。 该策略提供了相对更广泛的适用性，因为每个单模态编码器都可以使用大规模未标记数据的自监督学习进行有效训练。此外，它还受益于利用预训练期间获得的知识。

论文贡献

文中利用单模态预训练编码器并预测缺失模态的表示来解决缺失模态问题。论文贡献如下：

利用参数高效微调（PEFT）来最小化更新预训练的单模态编码器，同时最大限度地保留下游任务的知识。
采用方差-不变-协方差正则化（VICReg）的架构来提高不同模态之间嵌入的缺失模态问题的可预测性。
采用基于提示的方法从其他方式收集有效的任务相关信息。
实验证明该方法更加稳健和有效，在缺少模态的各种场景中的所有测试数据集和指标上都优于之前的研究。

方法

图 1：提出框架概述：利用单独的单模态编码器，将 PEFT 用于目标任务，并引入可训练的提示来有效预测缺失的模态特征，并使用注意掩蔽来保留输入的表示。在推理过程中，模型可以生成手头缺失模态的嵌入。

如图 1.(a) 和 (b) 所示，对于每种模态，文中假设给出了基于 Transformer 架构的预训练单模态编码器，分类器为定义在其表示之上。作者采用了一种简单的后期融合策略，整合来自每种模态的 pre-softmax logits。为了解决缺失模态带来的挑战，引入了特征预测器，旨在预测缺失模态的特征向量。此外，为了增强其预测能力，还采用了一组可训练的提示。基于此设置，目标是构建一个多模态模型，以应对训练和测试场景中不完整的多模态数据问题带来的挑战。

基于后期融合策略进行多模态分类

文中采用 BitFit 作为 PEFT 方法，冻结整个模型的所有参数，并在微调期间仅更新偏差项。基于此设置，将多模态分类损失定义为多种模态上标准交叉熵分类损失的总和，如下所示：

其中、是模态不完整子集的损失，是模态完整子集的损失。由于所提出框架基于后期融合策略，因此该方法能够与任何其他 PEFT 方法兼容，例如基于适配器的调整或基于重新参数化的方法。

通过Prompt-Tuning进行缺失模态特征预测

在存在缺失模态的情况下，我们假设缺失模态的预测特征可以在推理过程中与可用模态的特征相结合，以增强预测性能，而不是仅使用现有模态的特征。因此，文中引入了一个特征预测器，使用一组可训练的提示来有效地解决缺失模态的问题。每个模态 m 的输入数据定义为，相应的输出可以表示为：

基于VICReg用于预测嵌入同时防止嵌入崩溃的损失函数由三个组成部分组成。首先，方差项迫使批次内样本的嵌入向量不同。它涉及一个hinge损失函数，该函数沿批量维度维持嵌入的每个分量的标准偏差。其次，不变项是主要目标，在原始特征和预测特征之间计算的均方欧氏距离。最后，通过将嵌入的协方差矩阵中的非对角系数设置为零，合并协方差项以对嵌入的不同维度去相关。因此，特征预测的损失函数是不变性、方差和协方差项的加权平均值：

此外，为了指导特征预测器生成适合下游任务的特征并增强分类器在缺失情况下的鲁棒性，文中引入了辅助分类损失。这可以通过将预测特征引入分类器并使用交叉熵损失对其进行优化来实现。它模拟缺失模态的情况，并确保预测的表示与下游任务有效地保持一致。综上所述，总体目标函数可以表示为：

实验结果

图 2 显示了完整训练设置下的性能，研究结果表明，使用单独的单模态编码器进行多模态学习也容易丢失模态。具体来说，在 MM-IMDb 和 Food-101 上，当少于 10% 的测试数据配对时，单模态基线的性能甚至比仅使用图像编码器训练的性能更差。然而，文中方法明显优于其他方法，尤其是当文本严重缺失时。图 2：完整训练设置下多模态分类数据集的性能。所有实验均使用 100% 文本和 100% 图像数据进行，并根据文本缺失率进行评估。虚线表示多模态模型，而实线表示单模态模型。

表 1：在 70% 缺失率的训练环境下获得的定量结果。表 1 显示了不同缺失场景下的性能，其中 70% 的模态缺失。每个训练配置都会在模态缺失的场景（如训练阶段）以及与训练场景不同的另外两种情况下进行评估（即测试配置）。当遇到明显偏离训练设置的缺失场景时，其他方法缺乏鲁棒性。例如，使用 30% 图像和 100% 文本样本训练的模型在缺失模态分布均匀的测试样本中表现出足够的性能。然而，当遇到 100% 图像和 30% 文本的样本时，它们的性能会显著下降。虽然单模态基线在训练和测试中缺失的模态一致的一些特定场景中优于文中方法，但它在这种条件下受到限制，并且容易受到不同缺失场景的影响。

致谢作者，关于论文的详细实施过程和具体解释请阅读论文原文哦～❤️❤️

喜欢的话，请别忘记点赞👍➕关注哦

一文彻底搞懂多模态 - 多模态推理

大模型经典著作《大语言模型基础与前沿》

NeurIPS 2024|耦合Mamba：通过耦合状态空间模型增强多模态融合

腾讯&南大最新联合发布｜VITA：首个开源交互式全能多模态大模型！

一文彻底搞懂多模态 - 多模态学习

ICCV 2023｜CleanCLIP重磅登场！消除多模态对比学习中的数据中毒攻击

导师一个idea都没给，但也发了顶会AAAI，我摸索的这个方法绝了！

重磅3D多模态MSF框架发布！2D/3D语义分割双模态解析，重塑3D物体检测多语义融合框架

最新进展！全新特征学习框架，深度解析单模态与多模态对比学习泛化差异

揭秘时间魔法！段类型特征驱动的时间序列聚类算法

EMNLP 2024 多模态学习最新论文合集出炉！快速关注热点研究！

文末赠书｜深度揭秘！多模态大模型如何运作？一文读懂其核心原理！

NeurIPS 2024震撼发布：上交大&清华领衔创新，Diff-eRank大模型评估新指标，精准衡量LLM去噪实力！

CVPR投稿倒计时15天！Transformer还能卷出哪些新花样？

I 2025｜快手科技发布突破性EVLM！高效视觉语言模型，极大降低计算成本，实现全面视觉感知！

EMNLP 2024｜南京大学重磅推出EFUF：高效细粒度unlearning框架，全面破解多模态大语言模型“幻觉”难题！

NeurIPS 2024 | G3: 一种基于多模态大模型的高效自适应地理定位框架

港中文、UCL、武大联手攻关！NeurIPS 2024 全新多模态情绪分析模型，精准应对不完整数据挑战！

刷新多模态医学图像报告生成新高度｜AAAI 2023 山东大学&齐鲁医院推出多模态记忆Transformer！

NeurIPS 2024｜多模态学习重磅论文全览！最新研究集锦，不容错过！（下）

NeurIPS 2024｜多模态学习重磅论文全览！最新研究集锦，不容错过！（上）

突破了LLM极限，GPT-o1深度揭秘

港中文、上海AI Lab与浙大重磅推出PointLLM：大语言模型再升级，强势赋能点云理解！-ECCV 2024

NeurIPS 2024 | 像素级MLLM: Vitron, 实现图像视频的理解、生成、分割、编辑大一统

TPAMI 2024 | 基于时空结构对齐的视频-语言表示学习

ECCV 2024｜解锁多模态自监督学习！深度解耦常见与独特表示的创新突破

CVPR2023-基于交互式提示学习的多模态融合方法

CVPR 2024｜多模态大模型引爆！“因果推理”加持, 解锁链接上下文学习的无限潜能

CVPR 2023｜TransFusion震撼登场！突破性语义分割多模态融合网络，点云与图像直接融合！

TPAMI | SegNet:语义分割领域超经典轻量化模型

ECCV 2024｜多模态学习不鲁棒？表示解耦打造稳健多模态学习新纪元

NeurIPS 2021-如何利用知识图谱构建世界模型？！一种新的文本世界建模技术！

文末赠书｜《AI系统：原理与架构》于华为HC大会2024正式发布

又一本开源免费的大模型书来了，449页pdf！

CVPR 2024｜突破模态瓶颈！交替单模态适应引领多模态表示学习，攻克模态惰性与遗忘难题！

速来围观！多模态大型语言模型(MLLM)最新进展与实战应用全揭秘！

学术最前沿！2024最新深度多模态数据融合综述来袭！

AI大模型掀起效率革命！掌握ChatGPT等前沿技术，赋能企事业办公、科研与项目研发实战

ICML 2024｜浙大，NUS等高校联手推出多模态LLM革命性自动编码技术—Morph-Tokens

AAAI 2024｜重磅发布！多模态跟踪新范式：条件生成对抗网络与扩散模型的融合引爆技术革命！

ECCV 2024 | 破解多模态学习：单模态模型联合嵌入助力缺失模态预测新突破！

NeurIPS 2023｜浙大&上海AI Lab&华为联合发表--跨模态泛化的多模态统一表示

TPAMI 2024|打破边界！双向LiDAR相机语义分割中的单到多模态知识蒸馏革命

顶会NeurIPS‘24放榜！接收数量突破4千！8865高分被拒？

NeurIPS 2024|颠覆性发现！大型视觉-语言模型真的会“看”吗？MMStar基准揭示多模态评估误区与数据泄漏隐患

ECCV 2024 ｜中国人民大学、清华大学等提出平衡多模态学习的诊断和再学习方法

TPAMI 2024｜颠覆跨模态相似性学习的“游戏规则”！因果不变交互挖掘CIIM强势来袭：打破模态壁垒，精准捕捉跨模态信息！

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉