欢迎光临
我们一直在努力

FAWAM:用于闭环、高接触操作的力-觉察世界动作模型

26年6月来自北大和上海交大的论文“FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation”。

力信号为涉及丰富接触的机器人操作任务提供关键的交互线索。然而,现有方法大多仅将力视为一种额外的观测模态,未能充分利用其在建模未来交互动力学或指导执行阶段反馈校正方面的作用。本文提出 FAWAM(一种力-觉察世界动作模型),该模型在感知、预测和闭环执行三个层面上融合力信息。FAWAM 首先对历史六轴力/力矩信号进行编码以调节动作生成,随后联合预测未来动作与末端执行器螺旋力(wrench),从而显式地建模接触演变过程。此外,该模型引入一个残差校正模块,利用预测的螺旋力轨迹作为执行阶段的参考,并根据实时力反馈在线优化动作。针对多项涉及丰富接触的任务进行的实际实验表明,与仅依赖视觉的基线方法相比,FAWAM 的平均成功率提升 36.25%;与现有的力感知基线方法相比,提升 21.25%。这些结果验证了该力-觉察框架在实现鲁棒的接触密集型操作方面的有效性。

如图 1 所示:力-条件预测与本文方法的对比。(左图)仅将力作为额外观测信息无法校正接触偏差;(右图)而在三个层级上系统性地融合力信息,则能恢复正确的接触状态,从而成功完成擦拭任务。

请添加图片描述


1 概述

受人类在操作过程中感知、预判及响应接触行为的启发,针对接触密集型任务提出一种闭环力-觉察世界动作模型——FAWAM。如图2所示,FAWAM由两个模块组成:以1 Hz频率运行的“力预想动作模型”(Force-Envisioned Action Model)和以10 Hz频率运行的“力引导残差校正器”(Force-Guided Residual Corrector)。力预想动作模型将近期的力/力矩历史数据编码为紧凑的接触特征,并通过AdaLN-Zero风格的调制机制将其融入动作生成过程。此外,该模型还联合预测未来的动作与力轨迹,从而促使模型学习机器人运动与其接触后果之间的耦合关系。在执行阶段,力引导残差校正器利用预测的力轨迹作为引导,针对动作片段内出现的意外接触变化进行在线自适应调整。通过对比预测的力参考值与实时力反馈,该校正器能够提供及时的残差修正,进而提升执行过程中的鲁棒性。
请添加图片描述

2 力预想动作模型

为了赋予世界动作模型局部接触状态感知能力,将末端执行器近期的高频力/力矩(wrench)历史数据编码为紧凑的接触特征。

基于从未来视觉潜表征解码动作轨迹的 GE-Act [13] 方法,通过力条件(force-conditioned)AdaLN-Zero 调制,将接触特征 c_t 引入动作生成路径。预测一个力条件偏移量,并将其叠加到原始 AdaLN-Zero 参数上。

随后,经调制后的参数被用于动作 DiT 模块的标准 AdaLN-Zero 计算中。由于 MLP(i)_f 的最后一层采用零初始化,模型在初始阶段能够还原为原始动作解码器,并在训练过程中逐渐学习力自适应的修正。

除了利用历史力/力矩(wrench)作为条件外,还进一步监督解码器预测未来的力/力矩。没有添加独立的力预测头,而是将原始的动作投影替换为一个联合线性投影,该投影同时输出拼接后的动作轨迹与力/力矩轨迹。这种做法,促使解码器学习用于动作生成和接触预测的共享表征,从而捕捉机器人运动与其物理接触结果之间的耦合关系。

采用两阶段训练策略。在第一阶段,基于 GE-Base [13] 并利用潜空间流匹配(latent-space flow-matching)目标对视频生成模型进行微调。在第二阶段,冻结视频世界模型,并训练力-觉察动作解码器。该表述使得解码器能够在同一流匹配框架下,同时学习未来运动生成与旋量(wrench)预测。

3 力引导残差校正

由动作解码器生成的动作片段在其时间跨度内以开环方式执行,这使得系统难以应对意外的接触变化,例如压力不足、作用力过大或突发阻力。因此,引一种轻量级的力引导残差校正器,该校正器以 10 Hz 的频率运行,用于调整当前动作片段中的剩余动作。

残差校正器设计

残差模型以基础动作片段、预测的力/力矩(wrench)参考值和实时力/力矩反馈作为输入,输出残差动作校正量。具体而言,用与世界动作模型相同的力编码器,将近期的力/力矩历史数据编码为接触特征 c_t,且该编码器在残差模型训练期间保持冻结状态。为了显式地呈现接触偏差,计算力/力矩跟踪误差。还向残差模型输入即将执行的基础动作片段 a_base 和预测的未来力/力矩片段 w_pred,这些片段提供关于预期运动及接触演变的预判信息。此外,模型中还纳入当前的本体感知状态 q_t,以反映机器人的构型。

鉴于仅在必要时才应用残差校正,引入一个门控头,用于预测标量残差门控值 gres_t。该门控机制利用干预和非干预片段进行训练。

修正数据集的收集与训练

利用 FACTR [21](一种力反馈主从遥操作系统)来收集修正数据。从端机械臂(follower arm)保持阻抗控制模式,以实现安全且柔顺的接触;而主端机械臂(leader arm)在自主执行期间追踪由策略生成的指令,而非镜像从端机械臂的反馈。这种机制确保在切换至人工干预时指令流的连续性,从而减少动作漂移和力反馈振动。当观察到异常接触时,操作员通过主端机械臂修正剩余的动作片段。随后,修正后的指令与基础策略指令之间的差值被记录为残差目标(residual target)。

训练集包含人工干预片段和无干预策略执行样本。对于无干预样本,残差目标设为零,门控标签(gate label)设为 0;对于干预样本,门控标签设为 1。每个训练批次包含均衡比例的干预与无干预样本,旨在促使模型在修正异常执行的同时,保持基础策略的正常行为特征。


实验设置

硬件平台。所有真实世界实验均在 Franka Research 3 (FR3) 7自由度机械臂上进行。腕部安装有 ATI Axia80-M8 六轴力/力矩传感器,用于测量交互过程中的力和力矩(wrenches)。视觉观测数据由三台 Intel RealSense D435i 相机采集,包括一台腕部安装相机和两台分别位于前方与上方的固定式第三人称视角相机。为了进行演示数据收集和人工干预,构建基于 FACTR [21] 的力反馈主从遥操作系统。从端机械臂的力反馈被映射为主端机械臂的关节力矩,使操作员能够在遥操作过程中感知接触力。

任务与数据收集。在四个涉及丰富接触交互的操作任务上评估该方法:擦除白板(Erase Whiteboard)、削黄瓜皮(Peel Cucumber)、翻转盒子(Pivot Box)和擦拭花瓶(Wipe Vase),如图 3 所示。这些任务需要在变化的接触条件下进行持续的物理接触和力敏感操作。为了提高数据的多样性,为每个任务引入受控变量:改变白板和花瓶的倾斜角度,调整削黄瓜任务中的桌面高度,以及改变装沙盒子在翻转任务中的位置。对于每项任务,基础动作模型和所有基线策略均基于相同的 90 个演示样本进行训练。FAWAM 中的残差校正器则利用额外的 20 个包含人工干预的片段进行训练,这些片段提供残差校正的目标数据。多视角相机观测数据和本体感知状态以 30 Hz 的频率记录,而六轴力/力矩测量数据则以 120 Hz 的频率记录。
请添加图片描述

基线与评估。将 FAWAM 与“仅视觉”及“力-觉察”两类策略基线进行对比。在“仅视觉”基线方面,评估 π0.5 [53] 和 GE-Act [13]。其中,π0.5 是一种不包含力输入的通用视觉-语言-动作模型;GE-Act 则是 FAWAM 的“仅视觉”主干版本,它采用相同的动作预测流程,但不包含任何与力相关的组件。在“力-觉察”基线方面,与 ForceVLA [4] 和 TA-VLA [8] 进行比较。ForceVLA 将历史力信号作为一种额外的观测模态纳入模型,而 TA-VLA 则进一步将力预测作为辅助训练目标。针对每种方法,在每项任务上进行 20 次评估试验,每次试验的最长持续时间为 60 秒。

硬件与训练详情

硬件。图6展示跟随机器人、FACTR引导机器人及RealSense相机的物理布局。RealSense RGB视频流以640 × 480的分辨率记录。在训练过程中,每一帧图像在输入视频世界模型之前,都会被调整为256 × 192的分辨率。ATI腕部力/力矩传感器以120 Hz的频率记录6轴力/力矩数据(wrench)。采用截止频率为10 Hz的二阶巴特沃斯(Butterworth)低通滤波器来抑制传感器的高频噪声。对于每一次策略查询,力编码器都会使用最近0.5秒的力/力矩历史数据,这对应于60帧力/力矩采样。
请添加图片描述

训练。训练在8块NVIDIA A100 GPU上进行。在视频生成模型微调和力感知动作解码器训练阶段,总批次大小(batch size)为64,梯度累积步数为1。这两个阶段均采用bfloat16混合精度、DeepSpeed ZeRO-2、范数为1.0的梯度裁剪,以及包含1000个预热(warmup)步数的“预热后保持恒定”学习率调度策略。优化器使用AdamW,参数设置为β1 = 0.9、β2 = 0.95、ε = 10⁻⁸及权重衰减(weight decay)10⁻⁵。视频世界模型以3 × 10⁻⁵的学习率微调30,000步。随后,冻结视频世界模型,并以1.5 × 10⁻⁴的学习率训练力感知动作解码器30,000步。设定λF = 1,以平衡动作预测损失与未来力/力矩预测损失。力编码器实现为一个隐藏层宽度为256的三层多层感知机(MLP),并与力感知动作解码器一同进行训练。

残差校正器作为双头MLP单独训练,并使用在“力感知动作模型”(Force-Envisioned action model)阶段训练完成且已冻结的力编码器。其输入包括:包含60帧数据的滤波旋量(wrench)历史序列、预测的未来旋量片段、即将执行的基准动作片段、过去的旋量跟踪误差以及当前的本体感觉状态。该多层感知机(MLP)采用两个宽度为256的共享隐层,并使用GELU激活函数及0.1的Dropout率;其后连接一个残差动作头(residual-action head)和一个门控头(gate head)。用包含64个干预样本和64个非干预样本的平衡批次(共128个样本)对其进行500个epoch的训练。在训练残差校正器时,采用AdamW优化器,参数设置为:学习率 3 X 10-4,beta_1 = 0.9,beta_2 = 0.999,epsilon = 10-8,权重衰减为 10-6。门控损失的权重手动设定为 lambda_gate = 1。

赞(0)
未经允许不得转载:171主机测评 » FAWAM:用于闭环、高接触操作的力-觉察世界动作模型
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址