具身智能训练数据集哪里找？几大开源数据集帮你汇总好了！

文摘 2024-11-28 07:00 上海

作者 | 具身智能之心编辑 | 具身智能之心

点击下方卡片，关注“3D视觉之心”公众号

第一时间获取3D视觉干货

>>点击进入→3D视觉之心技术交流群

ARIO数据集 - 机器人控制

数据集链接：https://openi.pcl.ac.cn/ARIO/ARIO_Dataset

项目链接：https://imaei.github.io/project_pages/ario/

论文链接：https://arxiv.org/pdf/2408.10899

ARIO（All Robots In One）是鹏城实验室建立的大规模统一数据集，旨在解决现有数据集在开发多功能通用实体智能体方面的不足。ARIO支持 5 种感官模态，基于时间戳对齐多模态数据，采用统一数据架构，有统一配置，增强数据多样性，涵盖多种数据来源：（1）从真实场景收集：使用 Cobot Magic 平台（双手机器人移动操作平台）、Cloud Ginger XR - 1 平台（5G 轮式人形云机器人）。（2）从模拟平台生成，包括Habitat 的对象导航任务、MuJoCo 的操作任务、SeaWave 的操作任务。（3）从开源数据集转换，基于 Open X - Embodiment 数据集、基于 RH20T 数据集、基于 ManiWAV 数据集。

ARIO 数据集可用于训练具身智能体，以提高它们在各种任务和环境中的性能和适应性。ARIO拥有多模态特性，包含 2D 和 3D 视觉数据、触觉、声音和文本形式的数据，使得开发者可以在多种任务上进行模型训练；解决了多个现有数据集之间数据结构不一致的问题，显著减少前期数据清洗和预处理的时间。

G1数据集 - 人形机器人操作

开源数据采集的链接：https://github.com/unitreerobotics/avp_teleoperate

开源学习算法的链接：https://github.com/unitreerobotics/unitree_IL_lerobot

开源数据集和模型的链接：https://huggingface.co/UnitreeRobotics

宇树科技公布了开源 G1 人形机器人操作数据集，用以训练人形机器人，适配多种开源方案。宇树 G1 人形机器人操作数据集具有以下特点：（1）多样化的操作能力展示：通过演示视频可以看到，G1 人形机器人能够完成拧瓶盖倒水、叠三色积木、将摄像头放入包装盒、收集物品并存储、双臂抓取红色木块并将其放入黑色长方形容器中等复杂操作，显示出高度的灵活性和实用性。（2）数据采集方式创新：使用苹果的 Vision Pro 对 G1 进行遥操作控制。（3）丰富的数据维度：数据集中的图像分辨率为 640×480，每个手臂和灵巧手的状态及动作维度为 7。目前包含拧瓶盖倒水、叠三色积木、包装摄像头、存储物品、双臂抓取和放置等五大类操作的数据集。

RT-1数据集 - 机器人操作

论文链接：https://robotics-transformer.github.io/assets/rt1.pdf

开源链接：https://github.com/google-research/robotics_transformer

项目主页：https://robotics-transformer2.github.io/

RT-1 数据集是用于训练和评估机器人学习模型 RT-1 的数据集，旨在构建一个能够处理多种任务、对新任务和环境具有良好泛化能力的机器人系统。数据收集使用 13 个来自 Everyday Robots 的移动机械臂，在三个厨房环境（两个真实办公室厨房和一个训练环境）中收集数据。数据由人类提供演示，并为每个情节标注执行任务的文本描述，指令通常包含动词和描述目标对象的名词。

RT-1 能够执行超过 700 个语言指令，根据指令中的动词将其分组为不同技能，如拾取、放置、打开和关闭抽屉、取放抽屉中的物品、直立放置细长物品、推倒物品、拉餐巾和打开罐子等。涵盖多种行为和对象，通过增加 “pick” 技能的对象多样性来提升技能的泛化能力，并在实验中扩展了技能，包括一些现实的长指令任务，如在办公室厨房场景中的复杂操作。

RT-1 包含超过 130k 个机器人演示，这些演示构成了 744 个不同的任务指令，涉及多种技能和大量不同的对象。数据集中的技能和指令涵盖了多个领域，如物体操作、环境交互等，以支持机器人在不同场景下的任务执行和学习。

QT-Opt - 抓取

论文链接：https://arxiv.org/pdf/1806.10293

开源链接：https://github.com/quantumiracle/QT_Opt

QT-Opt 数据集是为训练机器人的视觉抓取策略而收集的大规模数据集，通过 7 个机器人在四个月内收集了超过 580k 次真实世界的抓取尝试，旨在让机器人学习通用的抓取技能，能够在未见过的物体上实现高成功率的抓取。

在收集数据集时，使用 7 个 KUKA LBR IIWA 机械臂，每个机械臂配备一个两指夹爪和一个位于肩部上方的 RGB 相机来收集数据。数据收集过程中，为了使模型能够学习到通用的抓取策略，使用了多样化的物体，这些物体在训练过程中定期更换，每 4 小时更换一次（在工作时间内），夜间和周末则保持不变。收集的数据包括机器人的相机观察（RGB 图像，分辨率为 472x472）、夹爪状态（开或关的二进制指示）以及夹爪相对于地面的垂直位置等信息。数据收集总共耗时约 800 机器人小时，数据量达到 4TB，足以训练出具有高成功率的抓取策略模型。

BridgeData - 机器人学习与泛化

论文链接：https://arxiv.org/pdf/2308.12952

项目主页：https://rail-berkeley.github.io/bridgedata/

BridgeData V2 是一个用于大规模机器人学习研究的数据集，旨在促进机器人学习方法的发展，包含丰富的机械臂操作行为数据，以支持多种任务和环境下的技能学习与泛化研究。数据集包含 60,096 条轨迹，其中 50,365 条专家演示轨迹和 9,731 条脚本策略收集的轨迹。涵盖 13 种技能，包括基础操作如拾取和放置、推动、重新定向物体，以及更复杂的操作如开门、关门、抽屉操作、擦拭表面、折叠布料、堆叠积木、扭转旋钮、翻转开关、转动水龙头、拉链操作和使用工具清扫颗粒状介质等。这些技能适用于多种环境和物体，确保学习到的技能具有通用性。包含 24 种环境，如厨房、水槽、桌面等，以及 100 多种物体。环境和任务的多样性使数据集能够支持多种学习方法的评估和研究，有助于机器人学习在不同场景下的任务执行和技能泛化。

TACO - RL - 长时域操作

论文链接：http://tacorl.cs.uni-freiburg.de/paper/taco-rl.pdf

项目链接：http://tacorl.cs.uni-freiburg.de/

数据集链接：https://www.kaggle.com/datasets/oiermees/taco-robot

TACO - RL 使用的数据集是通过在模拟和真实环境中对机器人进行远程操作收集的，包含机器人与环境交互的状态 - 动作序列，用于训练分层策略以解决长时域机器人控制任务，支持机器人从无结构的游戏数据中学习通用技能并实现复杂任务的执行。

收集的数据为无结构的游戏数据，未针对特定任务进行标记，包含多种机器人操作行为，如推动、抓取、放置物体，操作抽屉、滑动门和与 LED 按钮交互等，具有丰富的多样性和复杂性。数据集用于训练低层级策略，通过对无结构数据进行自动编码，学习从潜在计划到动作的映射，提取一系列基本行为原语。高层级策略通过离线强化学习（RL）利用后见之明重标记技术进行训练。

CLVR - 遥控

数据集链接：https://github.com/clvrai/clvr_jaco_play_dataset

CLVR Jaco Play Dataset 是一个专注于遥控机器人领域的数据集，共 14.87 GB，由南加州大学和 KAIST 的研究团队发布，它提供了 1,085 个遥控机器人 Jaco2的片段，并配有相应的语言注释。

FurnitureBench - 长时域操作

论文链接：https://arxiv.org/pdf/2305.12821

项目链接：https://clvrai.github.io/furniture-bench/

数据集链接：https://clvrai.github.io/furniture-bench/docs/tutorials/dataset.html

FurnitureBench是一个用于测试真实机器人复杂长时域操作任务的数据集。数据集聚焦于家具组装这一复杂长时域操作任务，其任务层次结构长，涉及家具部件的选择、抓取、移动、对齐和连接等步骤，平均任务时长在 60 - 230 秒（600 - 2300 低层级步骤）。任务要求机器人具备多种复杂技能，如精确抓取（不同家具部件抓取姿态各异）、部件重定向（通过拾取放置或推动实现）、路径规划（避免碰撞已组装部件）、插入和拧紧（精确对齐并重复操作）等。

通过使用 Oculus Quest 2 控制器和键盘对机器人进行远程操作来收集数据，历时 219 小时，涵盖八个家具模型。针对不同家具模型和初始化水平（低、中、高）收集了不同数量的演示数据。每个演示的时间步长因任务长时域性质而在 300 - 3000 步左右。数据收集过程中，通过使用不同颜色温度的单光面板并改变其位置和方向，以及每集随机化前视图相机姿势来增加数据多样性。

Cable Routing - 多阶段电缆布线

论文链接：https://arxiv.org/abs/2307.08927

项目链接：https://sites.google.com/view/cablerouting/home

数据集链接：https://sites.google.com/view/cablerouting/data

该数据集是为训练机器人的电缆布线策略而收集的，用于支持分层模仿学习系统，使机器人能够学习执行多阶段电缆布线任务，应对复杂的电缆操作挑战。数据集中包含了多种电缆形状、夹取位置和方向的变化，以及不同数量夹子（一夹、两夹、三夹）的布线任务数据，有助于训练出具有泛化能力的策略。

针对单夹电缆布线任务，通过人类专家远程操作机器人在不同位置和夹取方向上执行任务来收集数据。共收集 1442 条夹取轨迹，每条轨迹时长约 3 - 5 秒，包含约 20 个时间步，每个时间步包含机器人相机图像（四个）、机器人配置状态向量和人类远程操作员的指令动作。在训练单夹布线策略和其他原语后，通过人类专家按顺序触发原语以执行完整的多阶段电缆布线任务来收集数据。在一夹、两夹或三夹的场景下，电缆初始状态为平放在桌子上的任意形状，专家输入原语，机器人执行，同时记录整个轨迹的感官信息。

RoboTurk - 模仿学习

论文链接：https://arxiv.org/abs/1811.02790

项目链接：https://github.com/RoboTurk-Platform/roboturk_real_dataset

数据集链接：https://roboturk.stanford.edu/dataset_real.html

ROBOTURK 数据集是通过众包平台收集的用于机器人学习任务的大规模数据集，旨在解决机器人模仿学习中数据收集困难的问题，使机器人能够从大量的人类演示中学习操作技能，应对复杂的操作任务。数据涵盖了不同用户在多种任务和操作条件下的演示，包括不同物体的操作（如 lifting 任务中的立方体、picking 任务中的各种物品、assembly 任务中的螺母等）以及不同的操作场景，有助于训练出具有泛化能力的机器人策略。

【3D视觉之心】技术交流群

3D视觉之心是面向3D视觉感知方向相关的交流社区，由业内顶尖的3D视觉团队创办！聚焦三维重建、Nerf、点云处理、视觉SLAM、激光SLAM、多传感器标定、多传感器融合、深度估计、摄影几何、求职交流等方向。扫码添加小助理微信邀请入群，备注：学校/公司+方向+昵称（快速入群方式）

扫码添加小助理进群

【3D视觉之心】知识星球

3D视觉之心知识星球主打3D感知全技术栈学习，星球内部形成了视觉/激光/多传感器融合SLAM、传感器标定、点云处理与重建、视觉三维重建、NeRF与Gaussian Splatting、结构光、工业视觉、高精地图等近15个全栈学习路线，每天分享干货、代码与论文，星球内嘉宾日常答疑解惑，交流工作与职场问题。

http://mp.weixin.qq.com/s?__biz=MzkyMDY0OTc1NA==&mid=2247517848&idx=3&sn=70944b60204e07d53b5320fea4e2b09e

3D视觉之心

3D视觉与SLAM、点云相关内容分享

专为自动驾驶而生！DeSiRe-GS：彻底摒弃3D框，动静态重建完美解耦（UC Berkeley最新）

具身智能训练数据集哪里找？几大开源数据集帮你汇总好了！

章国锋团队开启SfM新篇章！DATAP-SfM：动态感知跟踪一切！

字节&清华&北京交通大学发布V2X-Radar: 一个用于协同感知的4D雷达多模态数据集

文本、图像、点云任意模态输入，AI能够一键生成高质量CAD模型了

3DLS全新尝试：线性高斯核在高频区域实现更清晰、更精确的结果，帧率提高30%！

闭环仿真杀器！DrivingSphere：理想提出直接构建高保真4D世界

真实雨景/图像去雨/自动驾驶/图像检索相关方向开源数据集资源

美国教授痛心：UC伯克利GPA 4.0计算机本科生，毕业即失业？ML博士直呼太卷后悔转行

高速动态低成本重建救星？SCIGS：首个从单个压缩图像重建3D显式动态场景的方法

论文分享 | 全景场景补全

动态SLAM全新数据集！InCrowd-VI：不同人群密度、遮挡、复杂光照的视觉惯性SLAM数据集！

机器人训练数据不缺了！英伟达团队推出DexMG：数据增强200倍

盘点！那些从自动驾驶“跳槽”进具身智能的大佬们

清华大学发布使用CARLA生成V2V与V2I的增强自动驾驶协作的多智能体调度数据集WHALES

GarVerseLOD：实现单张图像高保真度服装重建的3D重建框架

如何创立一家惯性导航公司

融合神经辐射场和视觉同时定位与地图构建的混合场景表示方法

宝可梦GO「偷家」李飞飞空间智能？全球最强3D地图诞生，150万亿参数解锁现实边界

克服LiDAR固定分辨率的限制！LiV-GS：首个大规模室外场景对齐离散点云与高斯地图的方法

MVSplat360：从稀疏视图到360°全景合成的前馈方法

Siggraph Asia 2024 | Adobe发布MagicClay：可通过文字引导对3D模型特定部分进行雕刻！

谷歌2024博士奖学金名单公布

首个基于高斯点云建图的动态SLAM框架！DGS-SLAM：解决动态物体引起的光度和几何不一致

无需视频流实现全景分割与深度估计MGNiceNet：统一的单目几何场景理解

ECCV 2024 | PARE-Net：用于鲁棒点云配准的位置感知旋转等变网络

NeurIPS 2024高中赛道开卷！人大附中、北师大实验中学等摘得3篇Spotlight

加州大学 | 基于视觉语言模型的端到端导航：零样本，无需数据训练！

港大DEIO：首个学习与传统非线性图优化结合的单目事件惯性里程计

基于语义似然与高精度地图匹配的智能车辆同时定位与检测

钻石冷却的GPU即将问世：温度能降20度，超频空间增加25%

超越现有3DGS网格重建方法！DyGASR：速度提高25%、内存使用量减少30%

复旦&蔚来开源DG-SLAM：第一个动态环境下的鲁棒GS SLAM！

身处相机内外参之间（EG3D/NeRF/3D Gaussian Splatting）

NeurIPS 2024 | 无需训练，一个框架搞定开放式目标检测、实例分割

突破多场景训练方法限制！ETH开源SplatFormer：首个专门设计用于在3DGS上运行的点变换器模型

【清华大学】RINO：基于非迭代估计的精确、鲁棒雷达惯性里程计

论文分享｜无监督点云语义分割

传说中Ilya Sutskever精选论文清单：AI领域40大论文完整版「破解」完成

丰田研究院综述「机器人领域中的神经场」

顶刊TGRS | 使用端到端深度神经网络从高分辨率遥感图像和数字表面模型中提取3D建筑实例

让纸片人动起来! DrawingSpinUp：从单个绘图生成高质量3D动画

浙大西湖大学开源MBA-SLAM！解决NeRF、3DGS中的运动模糊问题！

这三家国内机构合作成果，斩获EMNLP 2024最佳论文奖，主办方：明年苏州见！

ICP还能玩出什么花样？RA-L'24全新GenZ-ICP：根据环境几何特性自适应，解决依赖单一误差度量

英伟达最新！SCube：仅用三张图，就能实现即时大规模三维场景重建

更高轨迹精度、建图质量！基于NeRF轨迹平滑约束的SLAM优化

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉