专为自动驾驶而生！DeSiRe-GS：彻底摒弃3D框，动静态重建完美解耦（UC Berkeley最新）

文摘 2024-11-28 07:00 上海

作者 | Chensheng Peng等编辑 | 自动驾驶之心

点击下方卡片，关注“3D视觉之心”公众号

第一时间获取3D视觉干货

写在前面 & 个人理解

UC Berkeley最新的工作，提出了DeSiRe GS。全新自监督高斯飞溅表示，可以在复杂的驾驶场景中实现有效的静态-动态分解和高保真表面重建。我们的方法采用动态街道高斯的两阶段优化流水线。在第一阶段，由于3DGS只能重建动态环境中的静态区域，因此首先提取2D运动目标mask。然后这些提取的2D运动先验以可微的方式映射到高斯空间，在第二阶段利用动态高斯的有效公式。结合引入的几何正则化，我们的方法能够解决自动驾驶中数据稀疏引起的过拟合问题，重建与物体表面对齐而不是漂浮在空中的物理上合理的高斯分布。此外，我们引入了时间跨视图一致性，以确保跨时间和视点的一致性，从而实现高质量的表面重建。综合实验证明了DeSiRe GS的效率和有效性，超越了先前的自监督技术，实现了与依赖外部3D边界框标注的方法相当的准确性。

开源链接：https://github.com/chengweialan/DeSiRe-GS

总结来说，本文的主要贡献如下：

本文基于3DGS无法成功建模动态区域的简单观察，从外观差异中轻松提取运动信息。
然后以可微的方式使用time-varying高斯将提取的局部帧中的2D运动先验提取到全局高斯空间中。
引入了有效的3D正则化和时间交叉视图一致性，以生成物理上合理的高斯球，进一步增强高质量的分解和重建。

DeSiRe-GS方法详解

如图2所示，训练过程分为两个阶段。我们首先通过计算渲染图像和GT图像之间的特征差来提取2D运动mask。在第二阶段，我们使用PVG将2D运动信息提取到高斯空间中，从而能够以可微的方式纠正每个高斯的不准确属性。

Dynamic Mask Extraction (stage I)

在第一阶段，我们观察到3D高斯散斑（3DGS）在重建静态元素方面表现良好，例如驾驶场景中停放的汽车和建筑物。然而它很难准确地重建动态区域，因为原始的3DGS没有包含时间信息。如图2（阶段1）所示，这种限制会导致渲染图像中出现重影状浮点等伪影。为了解决这个问题，我们利用静态和动态区域之间的显著差异，开发了一种有效的方法来提取编码运动信息的分割mask。

最初，采用预训练的基础模型从渲染图像和用于监督的GT图像中提取特征。设F表示从渲染图像I中提取的特征，F表示从GT图像I中抽取的特征。为了区分动态和静态区域，我们计算相应特征之间的每像素相异度D。相异度度量D对于类似特征接近0，表示静态区域，对于不同特征接近1，对应于动态区域。

当预训练模型被冻结时，计算出的相异度得分不涉及任何可学习的参数。我们提出了一种多层感知器（MLP）解码器来预测动态度δ，而不是对D应用简单的阈值来生成运动分割mask。该解码器利用提取的特征，其中包含丰富的语义信息，同时采用相异性得分来指导和优化解码器的学习过程。

通过采用等式7中定义的损失函数，解码器被优化以预测与动态区域对应的D较高的区域中的较低值，从而最小化损失。然后，我们可以获得二进制掩码编码运动信息（ε是固定阈值）：

在训练过程中，图像渲染和mask预测的联合优化是相辅相成的。通过在监控过程中排除动态区域，渲染图像和GT图像之间的差异变得更加明显，从而有助于提取运动蒙版。

Static Dynamic Decomposition (stage II)

虽然第一阶段提供了有效的动态mask，但这些mask仅限于图像空间而不是3D高斯空间，并且依赖于GT图像。这种依赖性限制了它们在新型视图合成中的适用性，在这种情况下，监督图像可能不可用。

为了将2D运动信息从第一阶段桥接到3D高斯空间，我们采用了PVG，一种动态场景的统一表示（第3节）。然而，PVG对图像和稀疏深度图监督的依赖带来了挑战，因为很难从间接监督信号中学习到准确的运动模式。因此，如图2（第2阶段）所示，渲染的速度图V通常包含噪声异常值。例如，速度应为零的道路和建筑物等静态区域没有得到有效处理。这导致场景分解不令人满意，PVG经常对预期速度为零的区域进行错误分类。

为了缓解这个问题并生成更精确的高斯表示，我们结合了从第一阶段获得的分割mask来正则化2D速度图V，该速度图V是从3D空间中的高斯图渲染的。

最小化Lv会惩罚速度应为零的区域，有效地消除了原始PVG产生的噪声异常值。该过程将运动信息从2D局部帧传播到全局高斯空间。对于每个高斯分布，通过应用一个简单的阈值，可以区分动态和静态高斯分布。与PVG和S3Gaussian相比，这种方法实现了更优的自监督分解，而不需要额外的3D标注，如之前方法中使用的边界框。

Surface Reconstruction

Geometric Regularization

Flattening 3D高斯：受2D高斯散斑（2DGS）的启发，我们的目标是将3D椭球体压平成2D圆盘，使优化的高斯更好地符合物体表面，并实现高质量的表面重建。3DGS的尺度s=（s1，s2，s3）定义了椭球体沿三个正交轴的大小。最小化沿最短轴的比例有效地将3D椭球体转换为2D磁盘。缩放正则化损失为：

法线推导：曲面法线对于曲面重建至关重要。以前的方法通过向每个高斯函数附加一个法向量来合并法线，然后使用该法向量来渲染法线图N。使用地面真值法线图来监督高斯法线的优化。然而，这些方法往往无法实现精确的表面重建，因为它们忽略了尺度和法线之间的内在关系。我们不附加单独的法向量，而是直接从尺度向量s中推导出法向量n。法向量方向自然与对应于最小尺度分量的轴对齐，因为高斯在展平正则化后形状像圆盘。

通过这种法线公式，梯度可以反向传播到尺度向量，而不是附加的法线向量，从而促进高斯参数的更好优化。正常损失是：

Giant高斯正则化：我们观察到，3DGS和PVG都可以在不进行额外正则化的情况下产生超大高斯椭球，特别是在无界驱动场景中，如图3（a）所示。

我们的主要目标是拟合适当缩放的高斯分布，以支持精确的图像渲染和表面重建。虽然具有低不透明度的超大高斯椭球体对渲染图像的影响可能很小，但它们会严重损害表面重建。这是一个在仅关注2D图像渲染的现有方法中经常被忽视的局限性。为了解决这个问题，我们为每个高斯函数引入了一个惩罚项：

Temporal Spatial Consistency

在驾驶场景中，视图的稀疏性通常会导致高斯优化过程中对训练视图的过拟合。单视图图像丢失特别容易受到远距离无纹理区域的挑战。因此，依赖图像和稀疏深度图的光度监督是不可靠的。为了解决这个问题，我们建议通过利用时间交叉视图信息来增强几何一致性。

在假设静态区域的深度在不同视图之间随时间保持一致的情况下，我们引入了一个跨视图时空一致性模块。对于参考系中深度值为dr的静态像素（ur，vr），我们将其投影到最近的相邻视图——重叠最大的视图。使用相机内部函数K和外部函数Tr、Tn，相邻视图中的相应像素位置计算如下：

然后，我们查询相邻视图中（un，vn）处的深度值dn。将其投影回3D空间，得到的位置应与通过将（ur，vr，dr）反向投影到参考系而获得的位置对齐：

为了加强交叉视图深度一致性，我们应用几何损失来优化高斯分布，定义为：

这种损失促使高斯人随着时间的推移在视图中产生几何一致的深度。

优化

第一阶段：在第一阶段，我们的目标是利用运动掩模和渲染图像的联合优化来有效地学习运动掩模。因此，我们只使用遮蔽图像损失LI：

第二阶段：我们使用阿尔法混合来渲染深度图、法线图和速度图，如下所示：

实验结果

结论

本文提出了一种用于驾驶场景中静态动态分解和高质量表面重建的自监督方法DeSiRe GS。通过引入运动掩模模块并利用时间几何一致性，DeSiRe GS解决了动态对象建模和数据稀疏性等关键挑战。

【3D视觉之心】技术交流群

3D视觉之心是面向3D视觉感知方向相关的交流社区，由业内顶尖的3D视觉团队创办！聚焦三维重建、Nerf、点云处理、视觉SLAM、激光SLAM、多传感器标定、多传感器融合、深度估计、摄影几何、求职交流等方向。扫码添加小助理微信邀请入群，备注：学校/公司+方向+昵称（快速入群方式）

扫码添加小助理进群

【3D视觉之心】知识星球

3D视觉之心知识星球主打3D感知全技术栈学习，星球内部形成了视觉/激光/多传感器融合SLAM、传感器标定、点云处理与重建、视觉三维重建、NeRF与Gaussian Splatting、结构光、工业视觉、高精地图等近15个全栈学习路线，每天分享干货、代码与论文，星球内嘉宾日常答疑解惑，交流工作与职场问题。

http://mp.weixin.qq.com/s?__biz=MzkyMDY0OTc1NA==&mid=2247517848&idx=2&sn=30547b0640ed08682d60499fad96a980

3D视觉之心

3D视觉与SLAM、点云相关内容分享

专为自动驾驶而生！DeSiRe-GS：彻底摒弃3D框，动静态重建完美解耦（UC Berkeley最新）

具身智能训练数据集哪里找？几大开源数据集帮你汇总好了！

章国锋团队开启SfM新篇章！DATAP-SfM：动态感知跟踪一切！

字节&清华&北京交通大学发布V2X-Radar: 一个用于协同感知的4D雷达多模态数据集

文本、图像、点云任意模态输入，AI能够一键生成高质量CAD模型了

3DLS全新尝试：线性高斯核在高频区域实现更清晰、更精确的结果，帧率提高30%！

闭环仿真杀器！DrivingSphere：理想提出直接构建高保真4D世界

真实雨景/图像去雨/自动驾驶/图像检索相关方向开源数据集资源

美国教授痛心：UC伯克利GPA 4.0计算机本科生，毕业即失业？ML博士直呼太卷后悔转行

高速动态低成本重建救星？SCIGS：首个从单个压缩图像重建3D显式动态场景的方法

论文分享 | 全景场景补全

动态SLAM全新数据集！InCrowd-VI：不同人群密度、遮挡、复杂光照的视觉惯性SLAM数据集！

机器人训练数据不缺了！英伟达团队推出DexMG：数据增强200倍

盘点！那些从自动驾驶“跳槽”进具身智能的大佬们

清华大学发布使用CARLA生成V2V与V2I的增强自动驾驶协作的多智能体调度数据集WHALES

GarVerseLOD：实现单张图像高保真度服装重建的3D重建框架

如何创立一家惯性导航公司

融合神经辐射场和视觉同时定位与地图构建的混合场景表示方法

宝可梦GO「偷家」李飞飞空间智能？全球最强3D地图诞生，150万亿参数解锁现实边界

克服LiDAR固定分辨率的限制！LiV-GS：首个大规模室外场景对齐离散点云与高斯地图的方法

MVSplat360：从稀疏视图到360°全景合成的前馈方法

Siggraph Asia 2024 | Adobe发布MagicClay：可通过文字引导对3D模型特定部分进行雕刻！

谷歌2024博士奖学金名单公布

首个基于高斯点云建图的动态SLAM框架！DGS-SLAM：解决动态物体引起的光度和几何不一致

无需视频流实现全景分割与深度估计MGNiceNet：统一的单目几何场景理解

ECCV 2024 | PARE-Net：用于鲁棒点云配准的位置感知旋转等变网络

NeurIPS 2024高中赛道开卷！人大附中、北师大实验中学等摘得3篇Spotlight

加州大学 | 基于视觉语言模型的端到端导航：零样本，无需数据训练！

港大DEIO：首个学习与传统非线性图优化结合的单目事件惯性里程计

基于语义似然与高精度地图匹配的智能车辆同时定位与检测

钻石冷却的GPU即将问世：温度能降20度，超频空间增加25%

超越现有3DGS网格重建方法！DyGASR：速度提高25%、内存使用量减少30%

复旦&蔚来开源DG-SLAM：第一个动态环境下的鲁棒GS SLAM！

身处相机内外参之间（EG3D/NeRF/3D Gaussian Splatting）

NeurIPS 2024 | 无需训练，一个框架搞定开放式目标检测、实例分割

突破多场景训练方法限制！ETH开源SplatFormer：首个专门设计用于在3DGS上运行的点变换器模型

【清华大学】RINO：基于非迭代估计的精确、鲁棒雷达惯性里程计

论文分享｜无监督点云语义分割

传说中Ilya Sutskever精选论文清单：AI领域40大论文完整版「破解」完成

丰田研究院综述「机器人领域中的神经场」

顶刊TGRS | 使用端到端深度神经网络从高分辨率遥感图像和数字表面模型中提取3D建筑实例

让纸片人动起来! DrawingSpinUp：从单个绘图生成高质量3D动画

浙大西湖大学开源MBA-SLAM！解决NeRF、3DGS中的运动模糊问题！

这三家国内机构合作成果，斩获EMNLP 2024最佳论文奖，主办方：明年苏州见！

ICP还能玩出什么花样？RA-L'24全新GenZ-ICP：根据环境几何特性自适应，解决依赖单一误差度量

英伟达最新！SCube：仅用三张图，就能实现即时大规模三维场景重建

更高轨迹精度、建图质量！基于NeRF轨迹平滑约束的SLAM优化

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉

专为自动驾驶而生！DeSiRe-GS：彻底摒弃3D框，动静态重建完美解耦（UC Berkeley最新）

写在前面 & 个人理解

相关工作回顾

DeSiRe-GS方法详解

Dynamic Mask Extraction (stage I)

Static Dynamic Decomposition (stage II)

Surface Reconstruction

Geometric Regularization

Temporal Spatial Consistency

优化

实验结果

结论