26年6月来自跨维智能(DexForce Technology)和港中大深圳分校的论文“Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning”。
端到端操作策略结合网络规模预训练的视觉-语言模型(VLM),展现了实现通用且灵巧的机器人操作的潜力。然而,它们继承了二维基础模型的两个主要局限性:1) 依赖二维RGB输入,从而忽略了操作任务本质上的三维特性;2) 缺乏输入与输出空间之间,以及不同机器人形态、相机配置和轨迹数据集之间的三维空间对齐。本文提出了一系列方案来解决这些问题。首先,引入“对齐顶点图”(aligned vertex map)和“顶点谱”(vertex spectrum)——这是一种利用相机标定及可选深度信息,将二维视觉输入提升为三维信息的像素级三维表征。这种新输入表征将三维感知能力与二维大型VLM的泛化能力有机结合。随后,提出通过将各相机视角的逐像素三维信息及机器人动作统一映射到共享坐标系中,来实现操作策略输入与输出的对齐。在此基础上,确立一个标准的鸟瞰图(BEV)对齐框架,并创新性地提出构建BEV图像,从而生成一种对相机位姿变化具有鲁棒性的视角不变表征。为了支持大规模训练与评估,开发一套全面的数据处理流水线来执行上述对齐操作;同时,针对涉及不同机器人、人类操作员及数据集的轨迹,引入一种新时间对齐方案。这些贡献共同缓解输入与输出在时空上的错位问题,从而提升现实世界操作任务中的一致性与泛化能力。
如图1所示:提出 Dexterity-BEV (Dex-BEV),这是一套旨在实现操作策略学习的技术与系统性方案,能够跨越不同的具身形态、相机视角及数据集实现泛化。具体而言,引入能够与预训练 2D 视觉-语言模型(VLM)无缝集成的 3D 输入表征,实现多视角相机与机器人动作之间的空间对齐,以及来自不同机器人和/或遥操作员的轨迹之间的时间对齐。这些概念构建一套完整的数据处理流水线,并生成在空间和时间上均已对齐的轨迹数据集。

为了最大限度减少因机器人形态各异和相机配置多样而导致的输入差异,将共享对齐坐标系 T_align, t 形式化定义为标准的鸟瞰图(BEV)参考坐标系。参考自动驾驶领域 [31, 32](即“激光雷达坐标系”)及 BridgeVLA [48] 的惯例,将 T_align, t 具体设定为:1) 机器人基座坐标系;或 2) 若场景为桌面操作任务,则设定为包围桌面工作区的 3D 立方体感兴趣区域(RoI)的底部中心。
针对该指定的 BEV 坐标系,借鉴自动驾驶领域的研究成果 [49, 50, 31, 51],构建合成 BEV 图像。该 BEV 图像是通过对所有相机采集的彩色点云进行自上而下的正交投影生成的。在生成投影的同时,还计算该 BEV 图像对应的逐像素 3D 顶点图(vertex map)。如图 2 (a) 所示,BEV 图像为策略学习提供一个视角无关的几何输入空间。

利用顶点谱(Vertex Spectrum)处理可选的深度观测。受自动驾驶领域 PETR [31, 32] 工作的启发,为了适配不具备深度传感器的平台,提出针对仅含 RGB 信息的视图生成“顶点谱”。对于第 i 个相机视图中的像素 p = [u, v, 1]T,采用线性递增离散化(LID)[50] 方法采样 M 个离散深度假设 d_j。
每个“像素-深度”对经由外参矩阵 T_t,i 进行反投影与变换,映射至对齐后的 BEV 坐标系中,从而生成体素坐标网格 G_u,v。该网格随后由轻量级编码器处理,以构建二维位置编码,并将其逐元素(element-wise)加到相应的 RGB 特征上。
整体架构。如图 2(b) 所示,该整体架构将融合后的多视图 Token、合成 BEV 特征、3D 顶点图(vertex maps)与顶点谱(vertex spectrum)以及语言指令输入至 VLM 主干网络中。提取出的多模态表征随后由流匹配(flow-matching)动作专家 [14, 40] 处理,以建模目标动作分布。关键在于,机器人的本体感知测量值与输出动作均被参数化为统一 BEV 坐标系下的 SE(3) 位姿。由此,多视图输入与动作输出在 3D 空间内实现对齐,从而能够跨不同的具身形态(embodiments)与数据集应用统一的规范。
为了支持稳健的训练、评估及跨平台部署,针对异构数据集实现一套全面的三维时空对齐流水线。
三维空间对齐。如图3所示,对于每个数据集,结合人工三维GUI匹配、迭代最近点(ICP)配准以及诸如DepthAnything V3 [30]等数据驱动的估计算法,将相机的内外参统一转换为标准的OpenCV格式。对于缺乏主动深度测量数据的轨迹,通过在仿真环境中回放动作来重新生成缺失的通道数据;对于某些真实世界数据集(如Droid),则可利用FoundationStereo [53]等视觉基础模型合成深度图像。最后,将高质量的机器人URDF模型配准到共享的三维观测空间中。在不同的机器人形态之间强制执行统一的工具中心点(TCP)规范:对于平行夹爪,将其坐标系固定在夹爪尖端;对于多指构型,则固定在手腕处。这些标准化的运动学链能够利用正向运动学,计算出跨所有平台的统一绝对SE(3)位姿。图3(a) 开发一款用于 3D 对齐与可视化的定制 GUI 应用程序。图3 (a-f) 展示了具有代表性的公开数据集与内部数据集的 3D 对齐结果,包括 (a) LIBERO [28]、(b) Agibot-Alpha/Beta [54]、© RoboTwin 2.0 [55]、(d) RoboMind 2.0 [37] 以及我们的内部数据集 (e-f)。此外,如图 3 所示,还采用统一的 TCP 坐标系规范。

跨轨迹时间对齐。轨迹的执行速度往往取决于机器人平台及人类遥操作方式,这给机器人轨迹带来额外的变化,而VLA模型必须克服这些变化。另一方面,大多数操作任务可视为准静态任务:即在一定范围内放慢或加快轨迹速度,仍能完成既定操作任务。尽管并非所有操作都符合这一特性(例如投掷球),但当前VLA数据集中的绝大多数任务均属于准静态任务。基于这一观察,提出将末端执行器的速度归一化为跨多个机器人和VLA数据集的统一标准值。换言之,为了实现时间对齐,重计算机器人轨迹关键点(knots)对应的物理时间。



