具身智能数据集调研
-
AgiBot world
-
规模提升:AgiBot World 数据集包含超过 1,001,552 条轨迹,总时长达到 2976.4 小时,覆盖了 217 个特定任务和多种场景。
-
多样性和复杂性:数据集涵盖的场景类型超过 106,涉及 3000 多种不同物体,确保了任务的多样性和真实世界的代表性。
-
数据质量保障:AgiBot World 采用了"人参与循环"的方式来评估和提升数据质量。通过与数据注释者的反馈不断迭代。
-
真实场景表现:AgiBot World 数据集的收集是在真实的场景中进行的,结合 100 台同型号机器人,以标准化的流程确保数据质量的可重复性和实验结果的可靠性。
-
长时间操控任务:与大多数过往数据集关注单一原子技能的短期任务不同,AgiBot World 强调了长时间操控任务的设计,轨迹的持续时间通常在 30 秒以上,甚至超过 2 分钟。
-
https://mp.weixin.qq.com/s/Ck8k315cb8A9ZxKBN-TNtg
-
https://github.com/OpenDriveLab/AgiBot-World
-
RoboTwin 2.0
-
丰富的任务种类:RoboTwin 2.0涵盖了50多种双臂协作的操作任务,支持多种机器人平台的评估,确保其在不同环境和任务 scenario 中的适用性。
-
系统化的域随机化:该数据集在语言指令、物体混乱、背景纹理、光照条件和桌面配置等多个维度上进行了全面的域随机化。
-
高质量的专家数据生成:RoboTwin 2.0利用多模态大语言模型(MLLMs)结合模拟内反馈的闭环系统,自动生成高质量的任务执行代码。
-
应用于多种机器人实体:数据集设计考虑了不同机器人平台的运动学差异,通过物体可操作性的注释,生成机器特定的操作候选。
-
丰富的对象信息:RoboTwin 2.0集成了RoboTwin-OD资产库,涵盖147个类别的731种对象,并提供每个对象的关键点轴信息,支持更加精确的操作和视觉理解。
-
支持跨实体评估:数据集允许在五个不同的机器人平台上进行性能评估,促进了跨实体的基准测试。
-
提升政策的鲁棒性和泛化能力:通过域随机化训练的模型显示出在未见过的环境中的显著性能提升,特别是在视觉复杂的场景中。
-
https://mp.weixin.qq.com/s/SwORezmol2Qd9YdrGYchEA
-
https://github.com/robotwin-Platform/RoboTwin
-
GraspVLA
-
规模巨大:这是全球第一个规模达到十亿帧的抓取数据集,包含了10,000个独特对象,涵盖240个类别。
-
合成数据生成:该数据集完全基于先进的光线追踪渲染和物理模拟生成,从而显著降低了数据采集的成本与时间。
-
丰富的标注:与现有数据集相比,SynGrasp-1B提供了精确的标注,包括相机校准、边界框标注以及目标物体和夹具的3D姿势信息。此外,也可灵活地生成深度图和分割掩码等附加信息。
-
领域随机化:它在生成过程中应用了广泛的领域随机化,使得生成的场景在几何和视觉特征上具有丰富的变化,进一步增强了模型的泛化能力。
-
一体化的训练策略:通过将合成抓取动作与网络上的真实数据进行共同训练(使用逐步动作生成机制PAG),SynGrasp-1B能够有效地扩展到新物体类别的抓取技能。
-
https://mp.weixin.qq.com/s/Gi8nzAepL-ivkL3CuGoByQ
-
https://github.com/PKU-EPIC/GraspVLA
-
Galaxea Open-World
-
单一机器人实体的一致性:Galaxea数据集中的所有数据收集都使用相同的机器人实体进。
-
丰富的任务和环境多样性:该数据集包含超过10万条移动操作数据,覆盖住宅、厨房、等50个不同类型的真实环境,涉及150类任务类型、1600余种操作对象以及58项具身技能。
-
细粒度的子任务级别注释:Galaxea开放世界数据集提供了细粒度的子任务级别注释,使得多模态对齐更加精确。
-
高质量的真实场景数据:与其他数据集(如Open-X Embodiment)主要依赖控制或人工场景不同,Galaxea数据集的收集是在完全无结构的真实世界环境中进行,专注于自然和可行的动作。
-
https://mp.weixin.qq.com/s/SNflAN550LOHhi4ygrHDZg
-
https://github.com/OpenGalaxea/GalaxeaVLA
-
Open X-Embodiment
-
多样性与规模:Open X-Embodiment 数据集包含超过 100 万条真实机器人的操作轨迹,涵盖 22 种机器人形态,包括单臂机器人、双手机器人和四足机器人。
-
数据来源广泛:这个数据集是通过整合来自 34 个机器人研究实验室的 60 个现有数据集而构建的,显示出其在全球范围内的收集和合作。
-
兼容性与一致性:Open X-Embodiment 数据集使用 RLDS 数据格式,能够支持不同机器人配置的多种输入和操作空间。这包括不同的 RGB 摄像头、深度摄像头和点云等输入模式,确保了数据的高效、并行加载,适配所有主流深度学习框架。
-
https://mp.weixin.qq.com/s/KOXsL5OnYJbnRPT9HHL4QQ
-
https://github.com/google-deepmind/open_x_embodiment
-
VLABench
-
任务多样性与维度:VLABench包含100个任务类别,任务精心划分为多个维度,以评估模型在常识与世界知识、网格与纹理理解、语义丰富指令理解、空间理解、物理规则掌握及推理能力等方面的表现。这种多维评估提供了对模型能力的全面分析。
-
丰富的3D对象与情境:VLABench收集了超过2000个3D对象和场景,为任务创造了多样的视觉上下文,能有效评估模型的泛化能力,尤其是在多种技能学习上的表现。
-
人机自然交互:VLABench相较于其他数据库,首次引入自然人机交互、隐含目标导向语义以及基于常识的任务要求,使得机器人操控任务更具现实感和真实性。
-
长远规划与复合任务:该数据集特别强调长时间跨度的任务,这些任务要求多步骤的推理和决策能力,体现出更深层次的推理深度,有别于大多数现有基准。
-
综合能力评估:VLABench不仅评估模型的行动政策,还评估语言模型的能力,体现了对模型在视觉、语言、计划、知识转移和行动等多维度的能力评估。
-
https://mp.weixin.qq.com/s/9C5KmdL24vHVHxsEXKeGzA
-
https://github.com/OpenMOSS/VLABench
-
UniHand 2.0
-
数据规模庞大:UniHand 2.0 数据集包含超过 400 亿个样本,涵盖 35,000 小时的多模态数据。这些数据包括 16,000 小时的第一人称人类视频和 14,000 小时的机器人操作数据,以及 5,000 小时的通用视觉语言理解数据。
-
多样的硬件平台:该数据集跨越 30 种不同的机器人平台,从桌面机械臂到类人机器人,确保了丰富的机器人体现类型。
-
人类视频的丰富性:UniHand 2.0 大量使用低成本的人类视频作为预训练材料,确保了数据的多样性和环境的丰富性,涵盖了家庭事务、烹饪和工业操作等多种情境。
-
统一的操作空间:数据集首次将人类手部运动和多种机器人控制统一到一个动作空间,这为跨体现学习提供了一种新的统一序列建模范式。它将不同来源的数据整合为一个多模态的标记流,可用于优化各种监督信号。
-
高水平的推理与动态理解:UniHand 2.0 包含大量视觉-文本语料,确保其模型在高层次推理、策略规划和遵循指令能力方面的表现。这为 VLA 模型提供了坚实的基础,使其具备在新环境中快速适应的能力。
-
有效处理不平衡性:该数据集特别注重视觉信息和语言信息之间的平衡,针对以往模型在视觉和语言信息不匹配的问题,确保模型在执行原子行为和长远任务规划及空间推理方面的表现都达到最佳。
-
强化学习中的应用:UniHand 2.0 通过引入人类行为的密集样本,提供了可转移的行为先验,改善了机器人的控制能力。此外,结合视觉问答(VQA)信号,提升了模型对场景的理解和优越的控制精度。
-
https://mp.weixin.qq.com/s/iGJ0p6PYIL_qTNB5hlbcjg
-
https://github.com/BeingBeyond/Being-H
-
https://huggingface.co/datasets/BeingBeyond/UniHand_Preview/blob/main/human_data/Human_Data.md
VLA 数据集横向对比
一、数据集概览
| 规模 | 100万轨迹 / 2,976h | 35,000h / 4亿样本 | 10亿帧 / 1000万轨迹 | 1M+轨迹 / 527技能 | 10万+轨迹 / 731物体 | 100任务 / 2,164物体 | ~10万轨迹 / 150+任务 |
| 场景 | 真实 / 5大领域 | 混合(人类视频+机器人+文本) | 纯仿真 / Isaac Sim | 真实 / 21机构贡献 | 纯仿真 / 桌面 | 纯仿真 / MuJoCo | 真实 / 开放世界 |
| 机器人 | 单一(AgiBot G1双臂) | 30种异构机器人 | 单一(Franka) | 22种异构机器人 | 5种双臂平台 | 单一(Franka) | 单一(Galaxea R1) |
| 任务类型 | 通用操作 | 通用操作 | 仅抓取 | 桌面技能 | 双臂协作 | 长时域推理 | 移动操作 |
| 数据来源 | VR遥操作 | 多源混合 | 自动合成 | 多机构遥操作 | MLLM+仿真在环 | 自动化规划 | 一致性遥操作 |
| 语言条件 | ✅ 子任务标注 | ✅ 三种任务标注 | ✅ PAG联合训练 | ⚠️ 部分有 | ✅ 多样化生成 | ✅ 非模板化 | ✅ 子任务级 |
| 开源 | 🔄 CC BY-NC-SA(需申请) | 🔄 部分开源 | 🔄 计划开源 | ✅ RLDS格式 | ✅ | ✅ | 🔄 承诺开源 |
二、任务复杂度层级
简单 ←————————————————————————————→ 复杂
GraspVLA OXE RoboTwin 2.0 AgiBot World VLABench Galaxea
(仅抓取) (桌面技能) (双臂协作) (通用操作) (长时域推理) (移动操作)
-
GraspVLA:单一抓取任务,但深度挖掘(透明物体、少样本适应)
-
VLABench:首个系统定义VLA能力维度(5个),揭示Progress Score < 15%
-
AgiBot World:包含精细操作(倒水、折叠),错误恢复数据
-
Galaxea:长时域移动操作(铺床、微波炉操作等开放世界任务)
三、技术路线差异
3.1 数据采集策略
| VR遥操作 | AgiBot World | 高质量、高一致性、高成本 |
| 全身动捕 | UniHand-2.0 | 从人类视频提取MANO手部参数 |
| 自动合成 | GraspVLA | CuRobo规划+域随机化渲染,成本极低 |
| MLLM生成 | RoboTwin 2.0 | 代码生成+仿真验证闭环,71.3%成功率 |
| 自动规划 | VLABench | RRT+SLERP+Bezier,零人工 |
| 多机构协作 | OXE | 分布式采集,标准化格式(RLDS) |
3.2 动作表示方法
| 7维EEF | OXE, AgiBot, GraspVLA | 简单通用 | 不强制坐标系对齐 |
| 统一槽位 | UniHand-2.0 | 物理语义对齐,跨本体 | 固定维度限制扩展性 |
| 形态适应 | RoboTwin 2.0 | 感知不同抓取形态 | 仅限双臂平台 |
| 潜在动作 | AgiBot World (ViLLA) | 桥接VLM与控制 | 需要额外训练 |
3.3 Sim-to-Real 策略
| 域随机化 | GraspVLA, RoboTwin 2.0 | GraspVLA实现强sim-to-real,透明物体86.6% |
| 少量真实+大量合成 | RoboTwin 2.0 | 10条真实+1K合成 = 367%相对提升 |
| 纯真实数据 | AgiBot World, Galaxea | 无sim-to-real gap,但成本高 |
| 混合数据 | UniHand-2.0 | 仿真控制在26%,人类视频补充 |
四、关键洞察与趋势
4.1 数据规模 vs 策略性能
AgiBot World首次在真实世界验证了数据规模与策略性能的幂律扩展关系(r=0.97),这意味着:
-
更多数据 → 更好性能(至少在当前规模范围内)
-
但数据质量同样关键:AgiBot保留错误恢复数据,Galaxea强调一致性采集
4.2 合成数据的崛起
GraspVLA和RoboTwin 2.0证明了:
-
纯合成数据可以训练出有效的VLA(GraspVLA的sim-to-real抓取)
-
合成+少量真实的组合效果惊人(RoboTwin 2.0: 367%提升)
-
但合成数据目前局限于简单任务(抓取、桌面操作),复杂操作仍需真实数据
4.3 跨本体迁移的困境
OXE开创了跨本体训练方向,但后续工作(Galaxea、UniHand-2.0)揭示了复杂性:
-
小模型在大规模跨本体数据上欠拟合(OXE发现)
-
跨本体预训练可能有害(Galaxea发现)
-
统一动作空间是必要但非充分条件(UniHand-2.0的MoF架构需要额外设计)
4.4 评估标准化的缺失
VLABench首次系统定义VLA能力维度,但:
-
当前VLA的Progress Score < 15%,远未达到LLM级泛化
-
各数据集评估协议不统一,难以横向比较
-
缺乏统一的跨数据集评估框架
五、选型建议
| 训练通用VLA基础模型 | AgiBot World + OXE | 规模大、任务多样 |
| 低成本快速原型 | GraspVLA / RoboTwin 2.0 | 合成数据,成本极低 |
| 跨本体泛化研究 | UniHand-2.0 / OXE | 多本体、统一动作空间 |
| 双臂协作任务 | RoboTwin 2.0 / AgiBot World | 专门支持双臂 |
| VLA能力评估 | VLABench | 系统化能力维度定义 |
| 长时域移动操作 | Galaxea | 开放世界真实场景 |
| 透明/反光物体抓取 | GraspVLA | 透明物体86.6%成功率 |
六、总结
数据规模两极分化
-
第一梯队:AgiBot World(100万轨迹)和 OXE(1M+轨迹)规模最大
-
合成路线:GraspVLA 用仅 ~$5,000 的成本生成 10 亿帧数据,性价比最高
-
评估导向:VLABench 规模最小(2,164 物体),但定义了最系统的能力维度
两条技术路线的分歧
| 代表 | AgiBot World, Galaxea | OXE, UniHand-2.0 |
| 优势 | 数据一致性高,策略质量好 | 跨本体泛化潜力 |
| 劣势 | 无法迁移到新机器人 | 可能负迁移,动作空间对齐难 |
| 关键发现 | Galaxea:单本体预训练至关重要 | OXE:模型容量决定跨本体效果 |
合成数据正在崛起
-
GraspVLA 首次证明纯合成数据可训练有效 VLA(透明物体抓取 86.6%)
-
RoboTwin 2.0 的10 条真实 + 1K 合成 = 367% 提升,性价比惊人
-
但合成数据目前仅限简单任务,复杂操作仍需真实数据
当前最大痛点
-
VLA 泛化能力极弱:VLABench 显示 Progress Score < 15%
-
缺乏统一的跨数据集评估框架
-
跨本体迁移的正/负迁移边界尚不清晰

![[特殊字符]DeepSeek‑Harness(DSH)小白保姆教程-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260816085112-6a817a009aabf-220x150.png)