ECCV 2024｜解锁多模态自监督学习！深度解耦常见与独特表示的创新突破

文摘 2024-10-20 08:23 英国

点击上方蓝字关注我们

Decoupling Common and Unique Representations for Multimodal Self-supervised Learning

作者: Yi Wang , Conrad M Albrecht , Nassim Ait Ali Braham, Chenying Liu , Zhitong Xiong , and Xiao Xiang Zhu

作者单位:

德国慕尼黑工业大学，德国航空航天中心遥感技术研究所，慕尼黑机器学习中心

论文链接:

https://arxiv.org/pdf/2309.05300

代码链接:

https://github.com/zhu-xlab/DeCUR

简介

大多数现有多模态自监督方法仅学习跨模态的通用表示，而忽略模态内训练和模态独特的表示。文中提出了一种简单而有效的多模态自监督学习方法，即解耦通用和独特表示（DeCUR）。通过减少多模态冗余来区分模态间和模内嵌入，DeCUR 可以整合不同模态之间的互补信息。文中在三种常见的多模态场景（雷达光学、RGB 仰角和 RGB 深度）中评估 DeCUR，并展示其持续改进，无论架构如何，以及多模态和模态缺失设置。

研究动机

特征嵌入维度可以分为跨模态常见维度和模态独特维度。在训练过程中，计算两种模态之间的公共维度和唯一维度的归一化互相关矩阵，并将公共维度的矩阵驱动到恒等，而将唯一维度的矩阵驱动到零。因此，常见的嵌入在不同模态中保持一致，而模态独特的嵌入则被排除。

图 1：t-SNE 可视化的两种模态的解耦共同和独特表示

然而，简单地推开独特的维度将导致崩溃，因为这些维度无法学习任何有用的信息。因此，除了跨模态学习之外，文中还包括模态内学习，利用所有嵌入维度并将同一模态的两个增强视图之间的互相关矩阵驱动到同一模态。这种模态内组件不仅通过让独特的维度在一种模态内学习有意义的表示来避免崩溃，而且还通过更强大的模态内知识来增强跨模态学习。图 1 提供了学习表示的潜在空间的 t-SNE可视化，其中每种模态的共同和独特嵌入，以及模态之间的模态独特嵌入都被很好地分开。

论文贡献

提出了一种简单而有效的多模态自监督学习方法 DeCUR，将不同模态之间的常见和独特表示解耦，并增强模内和模间学习。对于ConvNet主干网，采用可变形注意力的简单调整来进行模态信息特征学习。
通过丰富的实验和涵盖三个重要多模态场景的综合分析来评估 DeCUR，证明其在多模态和模态缺失环境中的有效性。

方法

图 2：DeCUR 的结构。M 1 和M 2 代表两种模态。来自每种模态的两个增强视图被馈送到特定于模态的编码器（E1，E2）和投影仪（P 1，P 2）以获得嵌入Z。

图 2 展示了 DeCUR 的总体结构。作为 Barlow Twins 的多模态扩展，DeCUR 通过从模内/跨模态角度减少增强视图的联合嵌入空间中的冗余来执行自监督学习。本文的主要贡献在于简单的损失设计，以解耦跨模态的有意义的模态独特表示。

解耦common和独特的表示

如图 2 所示，将来自每种模态的输入的两批增强视图输入模态特定的编码器和投影。批量归一化应用于嵌入，使得它们沿批量维度以均值为中心。然后使用这些嵌入来计算模态之间/模态内的互相关矩阵以进行优化。

互相关矩阵 给定两个嵌入向量，它们之间的互相关矩阵 C 表示为：

跨模态表示解耦 在跨模态情况下，计算来自不同模态的两个嵌入之间的相关矩阵C，如图2中的和。而大多数多模态自监督学习算法仅考虑它们的共同表示，w文中明确考虑模态唯一表示的存在，并在训练期间将它们解耦。具体来说，将总嵌入维度 K 分为和，其中分别存储公共和唯一表示。跨模态的通用表示应该是相同的（图 2 中的红色部分），而模态特定的独特表示应该是去相关的（图 2 中的蓝色部分）.

跨模态通用表示的冗余减少损失如下：

模态唯一表示的冗余减少损失如下：

模内表示增强 为了避免跨模态训练中解耦的唯一维度的崩溃，以及增强模内表示，文中引入了涵盖所有嵌入维度的模内训练。对于每种模态，互相关矩阵（或 Z'_{M1}$ 和 Z''{M1}（或 $Z'{M2} 和）的全维度生成的。模态内表示的冗余减少损失如下：

结合跨模态常见和独特损失以及模内损失，DeCUR 的总体训练目标为：

模态信息特征的可变形注意力

除了 DeCUR 损失设计之外，文中还采用可变形注意力来帮助 ConvNet 模型关注模态信息区域。DAT 和 DAT++ 中提出了可变形注意模块，以在特征图中重要区域的指导下有效地建模特征标记之间的关系。具体可参照原文。

实验结果

表 2：使用冻结编码器和在 GeoNRW 上进行全面微调的 RGB-DEM 迁移学习结果 (mIoU)（左：多模态；右：仅 RGB）。

表 3：SUN-RGBD 和 NYU-Depth v2 上的 RGB 深度微调结果。

表 4：可变形注意模块的消融结果 (mAP)。

致谢作者，关于论文的详细实施过程和具体解释请阅读论文原文哦～❤️❤️ 转载请注明出处

喜欢的话，请别忘记点赞👍➕关注哦

一文彻底搞懂多模态 - 多模态推理

大模型经典著作《大语言模型基础与前沿》

NeurIPS 2024|耦合Mamba：通过耦合状态空间模型增强多模态融合

腾讯&南大最新联合发布｜VITA：首个开源交互式全能多模态大模型！

一文彻底搞懂多模态 - 多模态学习

ICCV 2023｜CleanCLIP重磅登场！消除多模态对比学习中的数据中毒攻击

导师一个idea都没给，但也发了顶会AAAI，我摸索的这个方法绝了！

重磅3D多模态MSF框架发布！2D/3D语义分割双模态解析，重塑3D物体检测多语义融合框架

最新进展！全新特征学习框架，深度解析单模态与多模态对比学习泛化差异

揭秘时间魔法！段类型特征驱动的时间序列聚类算法

EMNLP 2024 多模态学习最新论文合集出炉！快速关注热点研究！

文末赠书｜深度揭秘！多模态大模型如何运作？一文读懂其核心原理！

NeurIPS 2024震撼发布：上交大&清华领衔创新，Diff-eRank大模型评估新指标，精准衡量LLM去噪实力！

CVPR投稿倒计时15天！Transformer还能卷出哪些新花样？

I 2025｜快手科技发布突破性EVLM！高效视觉语言模型，极大降低计算成本，实现全面视觉感知！

EMNLP 2024｜南京大学重磅推出EFUF：高效细粒度unlearning框架，全面破解多模态大语言模型“幻觉”难题！

NeurIPS 2024 | G3: 一种基于多模态大模型的高效自适应地理定位框架

港中文、UCL、武大联手攻关！NeurIPS 2024 全新多模态情绪分析模型，精准应对不完整数据挑战！

刷新多模态医学图像报告生成新高度｜AAAI 2023 山东大学&齐鲁医院推出多模态记忆Transformer！

NeurIPS 2024｜多模态学习重磅论文全览！最新研究集锦，不容错过！（下）

NeurIPS 2024｜多模态学习重磅论文全览！最新研究集锦，不容错过！（上）

突破了LLM极限，GPT-o1深度揭秘

港中文、上海AI Lab与浙大重磅推出PointLLM：大语言模型再升级，强势赋能点云理解！-ECCV 2024

NeurIPS 2024 | 像素级MLLM: Vitron, 实现图像视频的理解、生成、分割、编辑大一统

TPAMI 2024 | 基于时空结构对齐的视频-语言表示学习

ECCV 2024｜解锁多模态自监督学习！深度解耦常见与独特表示的创新突破

CVPR2023-基于交互式提示学习的多模态融合方法

CVPR 2024｜多模态大模型引爆！“因果推理”加持, 解锁链接上下文学习的无限潜能

CVPR 2023｜TransFusion震撼登场！突破性语义分割多模态融合网络，点云与图像直接融合！

TPAMI | SegNet:语义分割领域超经典轻量化模型

ECCV 2024｜多模态学习不鲁棒？表示解耦打造稳健多模态学习新纪元

NeurIPS 2021-如何利用知识图谱构建世界模型？！一种新的文本世界建模技术！

文末赠书｜《AI系统：原理与架构》于华为HC大会2024正式发布

又一本开源免费的大模型书来了，449页pdf！

CVPR 2024｜突破模态瓶颈！交替单模态适应引领多模态表示学习，攻克模态惰性与遗忘难题！

速来围观！多模态大型语言模型(MLLM)最新进展与实战应用全揭秘！

学术最前沿！2024最新深度多模态数据融合综述来袭！

AI大模型掀起效率革命！掌握ChatGPT等前沿技术，赋能企事业办公、科研与项目研发实战

ICML 2024｜浙大，NUS等高校联手推出多模态LLM革命性自动编码技术—Morph-Tokens

AAAI 2024｜重磅发布！多模态跟踪新范式：条件生成对抗网络与扩散模型的融合引爆技术革命！

ECCV 2024 | 破解多模态学习：单模态模型联合嵌入助力缺失模态预测新突破！

NeurIPS 2023｜浙大&上海AI Lab&华为联合发表--跨模态泛化的多模态统一表示

TPAMI 2024|打破边界！双向LiDAR相机语义分割中的单到多模态知识蒸馏革命

顶会NeurIPS‘24放榜！接收数量突破4千！8865高分被拒？

NeurIPS 2024|颠覆性发现！大型视觉-语言模型真的会“看”吗？MMStar基准揭示多模态评估误区与数据泄漏隐患

ECCV 2024 ｜中国人民大学、清华大学等提出平衡多模态学习的诊断和再学习方法

TPAMI 2024｜颠覆跨模态相似性学习的“游戏规则”！因果不变交互挖掘CIIM强势来袭：打破模态壁垒，精准捕捉跨模态信息！

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉