欢迎光临
我们一直在努力

Being-H0.8:一种大规模的潜触觉世界-行动模型(上)

26年7月来自智在无界博客的论文“Being-H0.8: A Latent Tactile World-Action Model at Scale”:https://research.beingbeyond.com/being-h08。

引言

Being-H0.8,是通用具身基础模型。Being-H0.8 将潜世界-动作建模从视觉预测扩展到触觉感知交互,它是将触觉预训练应用于如此大规模的以自我为中心的人类视频的模型。
请添加图片描述

视觉世界模型可以预测场景的演变,但仅凭视觉无法完全捕捉控制灵巧操作的接触动态。关键决策出现在接触界面:是否已建立接触、手的哪个区域承受负荷以及手随后应如何调整。这些线索在 RGB 观测中通常很微妙或被遮挡,但它们却能决定抓取、插入、扭转和传递等动作的成败。因此,Being-H0.8 将触觉视为共享潜世界状态中与动作相关的部分。

核心挑战在于规模。物理触觉传感器仍然成本高昂,并且在现有的机器人和人类数据中大多缺失。 Being-H0.8 采用手-表面交互作为统一的触觉表征,将未标注的人体操作视频转化为可扩展的接触和邻近度监督来源。其引入了 TactoHand,它基于几何监督的人-物交互数据进行训练,以生成密集的伪触觉标注。二值接触图定位可能的接触区域,而连续邻近度场则捕捉每个手部顶点与接触点的接近程度。在条件允许的情况下,机器人和戴手套的人体数据集还会提供测量的接触或压力值,并通过有效性掩码指定每个样本中观察到的触觉和动作维度。
请添加图片描述

为了将这种触觉监督与跨具身的动作学习连接起来,Being-H0.8 引入 TopoHand,一种基于骨架的表征,它取代了 Being-H0.5 的第一代统一动作空间。TopoHand 为人类手、灵巧机器人手和并联夹爪提供一种共享的状态-动作语言。每只手都由一个以腕部为中心的规范框架、一个紧凑的形态潜变量和规范的关节变量表示。平行夹爪通过形态归一化的开口值进入同一空间,该开口值由拇指与其最近指尖之间的距离计算得出。这种设计使得 Being-H0.8 能够在共享的动作槽中学习手部轨迹和机器人控制,而无需特定于身体的策略头,并提高了从人类预训练到灵巧操作的迁移能力。


真实世界的接触式操作

这些真实世界的演示探索连续力调节、可变形物体操控、接触协调、快速适应和精确工具使用。每个任务都从单一聚焦视角展示,以便于追踪其接触序列。

硬件平台

Being-H0.8 部署在两个互补的双手平台上。第一个平台使用两个 ROKAE AR5 机械臂,并支持可互换的灵巧手,用于跨身体评估:LinkerHand L25,具有 16 个驱动自由度和 21 个总自由度;以及肌腱驱动的 DexHand 021,具有 12 个驱动自由度和 22 个总自由度。L25 的每个指尖都带有一个 12 × 6 的压阻式压力阵列,而 DexHand 021 则集成了指尖视觉触觉传感器。第二个平台结合两个 RealMan RM65 机械臂、Inspire 夹爪和 Daimon DM-TAC W2M 触觉传感器,为双手协调和接触感知控制提供互补设置。
请添加图片描述
请添加图片描述
请添加图片描述
请添加图片描述


触碰世界:迈入50万小时以上的时代

UniHand 3.0 为 Being-H0.8 提供数据基础,它利用了来自公共资源库和广泛数据合作伙伴网络的超过50万小时的以自我为中心的人类视频。TactoHand 通过将观察的手部-物体交互转换为密集的接触和接近度监控,恢复传统 RGB 视频中缺失的触觉信息。其用标准化的异构机器人数据、合成的人机协同演示以及任务相关的多模态人类演示来补充这一语料库。这些资源共同教会 Being-H0.8 不仅物理世界如何演化,而且交互如何在接触点展开。

以自我为中心的人类数据

为了训练 Being-H0.8 模型,收集超过 50 万小时的原始人类视频。这是一个如此大规模的以人为中心的语料库,其中每个样本都可追溯到其来源。
请添加图片描述

该语料库融合开放的以自我为中心的数据集、众多数据合作伙伴的贡献以及我们自行构建的补充资源。这种混合模式扩展对活动、对象、环境、视角和录制条件的覆盖范围,而无需依赖任何单一的采集渠道。

这些资源在格式、标注方案、相机配置和预期用途方面差异显著。通过一个半自动化、人机协作的流程将它们统一起来。自动化工具负责大规模数据导入、元数据提取、格式转换和过滤;人工审核员则对每个资源进行审核,并验证特定资源的处理流程。最终,获得一个适用于原本异构数据的统一训练接口。

在 Being-H 系列项目中,人机视频预训练经历三个阶段。Being-H0 证实人机视频包含可用于机器人操作的可迁移先验信息。Being-H0.5 和 Being-H0.7 则进一步扩展可用于预训练的人机交互的规模和多样性。 Being-H0.8 标志着第三阶段的开始,其核心问题从收集多少视频转变为哪些视频能够提供可靠且有用的具身监督。通过一个全面的流程来应对这一挑战,该流程可以大规模地清洗、去重、过滤、标准化和结构化以自我为中心的视频。
请添加图片描述

该系统超越传统的视频过滤。它将原始的自我中心镜头转换为结构化的具体监督,包括以交互为中心的剪辑、时间一致的手部轨迹和丰富的 3D 接地信号。仅标称规模并不能决定训练价值:相关性、质量、冗余和基础检查在训练前极大地重塑了原始集合。因此,体现预训练的下一个瓶颈不仅仅是数据采集,而是对原始人类视频中有价值的经验的可靠发现、重建和验证。


。。。。。。待续。。。。。。

赞(0)
未经允许不得转载:171主机测评 » Being-H0.8:一种大规模的潜触觉世界-行动模型(上)
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址