欢迎光临
我们一直在努力

ZEST:用于运动机器人控制的零样本具身技能迁移

26年2月来自机器人和AI研究所(RAI)和波士顿动力的论文“ZEST: Zero-shot Embodied Skill Transfer for Athletic Robot Control”。

在人形机器人上实现稳健、类人般的全身控制,以完成敏捷、互动性强的行为,仍然是一项核心挑战,这需要对每个技能进行大量的工程设计,并且控制器的调优过程也十分繁琐。提出 零样本具身技能迁移(ZEST),这是一个精简的运动模仿框架,它利用强化学习从多种来源(高保真运动捕捉、含噪单目视频和非物理约束动画)训练策略,并将其零样本部署到硬件上。ZEST 能够跨行为和平台进行泛化,同时避免接触标签、参考或观察窗口、状态估计器以及大量的奖励塑造。其训练流程结合自适应采样(将训练重点放在困难的运动片段上)和使用基于模型的辅助扳手(wrench)自动课程,从而实现动态的、长时域的机动。此外,还提供一种从闭链执行器的近似解析骨架值中选择关节-级增益的方法,以及一个改进的执行器模型。ZEST 完全在具有适度域随机化的仿真环境中训练,展现出卓越的泛化能力。在波士顿动力公司的Atlas人形机器人上,ZEST通过动作捕捉学习动态的多接触技能(例如匍匐前进、霹雳舞)。它能将富有表现力的舞蹈和场景交互技能(例如爬箱)直接从视频迁移到Atlas机器人和Unitree G11机器人上。此外,它还能扩展到Spot四足机器人,通过动画实现诸如连续后空翻之类的特技动作。

如图所示ZEST的部署:

请添加图片描述


人形机器人的设计源于一个简单的事实:环境是围绕人体形状、比例和运动能力而构建的。原则上,外形相似的机器人无需进行大规模改造即可在这些环境中运行,与人类并肩工作,完成同样的日常任务。然而,为了在这样的环境中高效运作,它首先必须能够执行人类能够完成的各种动作。在这种情况下,成功的衡量标准与其说是单一任务行为的熟练程度,不如说是能够像人类一样流畅地执行一系列协调的全身运动和技能的通用性。然而,在人形机器人上实现人类水平的物理智能面临着巨大的挑战:它们的高自由度、间歇性和多接触交互以及不可避免的建模不匹配,都要求控制策略能够捕捉人类运动的丰富性,同时又能应对现实世界的不确定性。

本文提出 ZEST(零样本具身技能迁移),一个用于学习物理智能的统一框架,来应对这一重大挑战。 ZEST 将来自异构数据源的人体运动的多样性和表现力转化为稳健的控制策略。这种方法使腿式机器人能够零样本地执行各种技能,无需针对每个任务进行微调,从而避免了从头开始进行复杂的行为发现,而是利用人体运动数据集作为通用技能的来源。

过去十年,实现腿式机器人多样化行为的一种常用方法是离线生成全身运动轨迹,然后使用基于模型的控制器对其进行跟踪。波士顿动力公司的 Atlas 人形机器人就是一个典型的例子,它利用从关键帧动画中提取的参考数据,展示了印象深刻的跑酷和舞蹈动作。这些动作是通过一个双层控制架构执行的,该架构由一个模型预测控制 (MPC) 在线规划器和一个基于优化的全身控制器组成 [1-5]。研究界已广泛采用这种基于模型的离线规划、在线跟踪范式,并将其应用于腿式平台的各种任务中。这包括使用扶手攀爬楼梯的人形机器人[6]、展现杂技行为的四足机器人[7]、将动物的运动重新应用于不同形态的机器人[8]以及处理多接触任务的四足移动机械臂[9]。在这些研究中,核心原则始终如一:使用离线轨迹优化(通常在多接触环境下)来发现难以手动设计的、动态可行的复杂行为,并使用通用稳定控制器在线跟踪这些运动。这种方法具有通用性和可解释性,因为经过良好调校的控制器可以跟踪各种物理上一致的运动,而无需针对特定技能进行调整。然而,由此产生的控制器往往对环境建模、估计和参考精度有更高的要求,这使得它们更难应用于涉及高不确定性或复杂接触的场景。

近年来,强化学习(RL)作为一种强大的控制合成方法脱颖而出,展现出卓越的灵活性和鲁棒性。通过隐式地学习管理复杂的接触动态,RL策略能够实时确定何时何地进行接触,从而无需预先定义接触计划,简化了控制设计。此外,在高保真模拟器中进行大规模训练以及将策略零样本迁移到硬件的能力[10, 11]加速了数据驱动控制的发展[12, 13]。这一成功使得腿式运动领域取得了最先进的性能,包括在野外复杂地形上的稳健导航[14-16]、高速奔跑[17, 18]以及极限跑酷[19-21]。除了运动之外,RL也被证明对灵巧操作任务[22-24]和全身移动操作[25-28]同样有效。例如,它已应用于全身移动操作的多种场景,例如四足机器人打羽毛球[25]、人形机器人执行诸如搬运重物、拉车和打开弹簧门等高强度任务[26],以及四足机械臂动态推动和调整大型箱子的方向[27]。然而,这些基于白板(tabula rasa)的强化学习技术,仍然存在样本效率低下和对奖励设计高度敏感的问题;如果没有精心的策略塑造和正则化,学习的策略可能会利用奖励结构,表现出不自然或过于激进的行为。

为了缓解白板(tabula rasa)强化学习的局限性,一种在计算机图形学领域首创的有效策略是利用运动数据作为先验信息来正则化策略学习。这种数据引导的策略能够引导控制器做出自然的运动,从而减少对大量奖励工程的需求。一个开创性的例子是 DeepMimic [29],它训练策略来模仿一系列动作捕捉 (MoCap) 片段,同时依赖于单一且一致的奖励结构。后来,这种方法被扩展,实现了用户可操控的运动匹配器 [30]、对复杂运动进行更高保真度的跟踪 [31] 以及将模仿扩展到大规模运动库 [32]。对抗性模仿学习用通过匹配演示分布间接推断的奖励来代替直接模仿奖励。在对抗性运动先验 [33] 中,一个经过训练的判别器能够区分来自数据集的状态转换和来自策略展开的状态转换,从而提供一种风格奖励来鼓励自然的运动。后续的变体引入了分层或潜技能公式,以缓解模式崩溃并提高可重用性和可操控性 [34, 35]。

最近的研究通过将运动学的生成器与基于物理的控制器相结合,完善整个流程。例如,文本驱动的扩散模型现在可以生成多任务序列的计划[36],而其他分层方法则通过迭代地扩充运动数据集来解决敏捷地形穿越问题[37]。这种范式也通过多教师策略蒸馏等方法扩展到复杂的人机交互领域[38]。这些来自计算机图形学的研究凸显一个关键主题:数据——无论是显式的参考片段、对抗性先验还是学习到的技能嵌入——都充当着强大的正则化器,简化了奖励设计,提高了运动质量,并将控制器扩展到广泛的行为模式。

尽管在仿真中取得显著成果,但在硬件上部署统一的跟踪策略仍然并非易事。仿真与真实之间的差距——源于不可避免的建模差异——会因机器人接近驱动极限的复杂行为和操作而加剧:一旦施加真实的扭矩、速度和安全约束,许多动态或特技动作将变得不可行。相比之下,计算机图形学设置中通常忽略这些限制,从而允许在训练期间进行积极的探索,进而促进学习。策略还必须在部分可观测性(例如,缺失全局位姿或根线速度)下运行,这通常需要状态估计堆栈或历史条件策略,两者都会增加训练和部署的复杂性。尽管如此,越来越多的研究开始利用真实-到-仿真的策略和各种数据源来弥合这一差距。在[39]中,Peng通过模仿真实动物的运动捕捉数据,使四足机器人能够执行各种步态。Grandia[40] 提出一种基于强化学习的策略,该策略能够执行由动画引擎驱动的富有表现力实时舞台表演。VideoMimic [41] 利用日常视频训练全身策略,通过“真实-模拟-真实”的流程来执行情境技能。ASAP [42] 通过从人体视频中预训练运动跟踪策略、在硬件上收集轨迹,并学习一种“增量动作”模型来学习执行敏捷的全身技能,该模型可以缩小模拟与真实之间的差距。KungfuBot [43] 训练 Unitree G1 机器人执行动态动作(例如杂技舞蹈和功夫攻击)的策略,该策略通过多步运动处理(滤波、校正、在物理约束下重定向)来实现。HuB [44] 突破了同一硬件的极限,在具有挑战性的单腿站立任务中实现了极佳的平衡。

使用来自基于模型规划器的参考轨迹,是基于模仿强化学习的另一种策略。 Opt-Mimic [45] 和 DTC [46] 等方法通过训练策略来模仿优化后的方案,从而结合轨迹优化的精确性和强化学习跟踪控制器的鲁棒性,体现这种方法的优势。类似地,两阶段强化学习框架可以利用单个最优轨迹作为初始指导,然后仅针对任务完成情况进行微调,从而产生鲁棒的运动策略 [47]。对于多接触运动操作,Sleiman [48] 利用单个离线演示来训练策略,以完成诸如穿越弹簧门和操作重型洗碗机等任务。由此产生的策略能够超越参考轨迹进行泛化,学习处理物体变化并发现新的恢复动作。

另一项研究工作侧重于基于大规模运动跟踪和师生学习的人类驱动和通用控制。 OmniH2O [49] 将运动学姿态视为通用控制接口,并通过模仿在大规模重定向/增强数据集上训练的特权教师来学习自主全身策略。HOVER [50] 将运动模仿教师模型提炼为学生策略,同时应用本体感觉和基于特定模式和稀疏性命令的掩码,从而为全身跟踪策略构建统一的多模式命令空间。最近,GMT [51] 将自适应采样策略(偏向于更难学习的运动)与混合专家教师模型相结合,增强了模型的表达能力和泛化能力。从该教师模型提炼的学生策略能够跟踪各种运动,并达到目前最先进的实际性能。

尽管取得了这些进展,但可扩展性和鲁棒性方面仍然存在一个重大障碍:依赖于复杂或多阶段的流程,这些流程通常由手工设计的组件构成。这些复杂性可能包括辅助塑造奖励项、接触标注、多阶段训练、访问非本体感觉信号或本体感觉历史记录,以及针对特定行为的重新调整。

本文提出一种统一、通用且极简的策略训练方法 ZEST,该方法可在单阶段内利用异构运动数据源(包括MoCap、ViCap动作和关键帧动画)训练策略。该方法的设计旨在消除复杂的、特定领域的技术,例如接触标注、大量的奖励塑造、未来参考窗口、观测历史和状态估计器,同时避免多阶段训练流程。最终的策略通过一个简单的前馈网络实现,能够使用针对每个机器人的一组超参数稳健地跟踪各种运动参考,并可零样本部署到硬件上。将 ZEST 应用于波士顿动力公司的电动 Atlas 人形机器人(身高约 1.8 米,体重约 100 公斤,与成年人的平均体重相当)。该精确的公式和训练方法适用于不同尺寸、重量和构造的机器人,从全尺寸的 Atlas 人形机器人到较小的 Unitree G1 人形机器人和 Spot 四足机器人。这种多功能性展现了相当高的通用性,相比于与单一机器人或行为紧密耦合的专用控制器,这是一个显著的进步。本文评估一个统一的框架,该框架采用系统化的、低调参量的训练方案,适用于多个机器人平台和多个参考源。

其策略利用下一步参考值和当前的本体感觉信号作为观测值,仅使用前一个动作作为历史数据。它们输出残差关节目标值,这些目标值随后被添加到参考值中,并发送到关节级比例微分(PD)控制器。为了使仿真更贴近现实,用从分析模型中导出的有效电机电枢值来调整 PD 增益,该分析模型近似于膝关节和踝关节等执行器的闭链运动学。对于 Spot,在仿真中加入更精确的动力系统和执行器模型。为了处理长时程片段并扩展到单一技能之外,轨迹被分割成固定时长的区间,难度级别通过失败分数的指数移动平均值 (EMA) 来估计。分类采样器倾向于选择难度较高的区间,从而促进长时程和多轨迹学习,避免灾难性遗忘。为了帮助稳定训练并避免高动态行为(尤其是涉及大幅度基座旋转的行为)出现过长的收敛时间。

其以模型为基础计算一个虚拟辅助扳手,并将其直接应用于机器人的基座。其大小根据每个区间的难度级别进行调整,并最终随着跟踪性能的提高而衰减至零,从而无需手动设计训练方案。训练完全在仿真环境中进行,并采用适度的域随机化(例如,脉冲推力、传感器噪声以及摩擦系数和质量的变化)。该框架最终形成一个从数据到部署都展现出卓越鲁棒性的流程。它能有效处理来自不同来源的参考运动,成功处理高保真度的动作捕捉数据、带有姿态抖动和脚部打滑等伪影的噪声视频捕捉数据,以及运动学上干净但通常在物理上不可行的动画数据。该框架能够重定位来自三个数据源的运动数据,凸显其对各种数据缺陷的强大适应能力。整个训练过程最终生成的策略可通过自动化流程以零样本方式部署到硬件上。


ZEST 的架构如图所示,重点是目标条件马尔可夫决策过程 (MDP) 的构建。我该框架的核心组件,包括建模、参考运动数据集的构建、训练设置以及策略在硬件上的部署过程。
请添加图片描述

系统与建模

用三种不同形态的机器人对 ZEST 进行评估:全尺寸的 Boston Dynamics Atlas 人形机器人(30 自由度,1.8 米,100 公斤)、较小的 Unitree G1 人形机器人(29 自由度,1.2 米,35 公斤)以及 Boston Dynamics Spot 四足机器人(12 自由度,33 公斤)。强化学习 (RL) 方法使用 Isaac Lab 模拟器 [56]。然而,人形机器人面临的主要挑战之一是高效地对并列-联结机构 (PLA) 进行建模,该机构用于脚踝、膝盖和腰部。虽然闭链机构的设计对于动态性能至关重要,但模拟其动力学特性会导致计算量巨大的刚度。为了解决仿真精度和计算效率之间的权衡,针对PLA开发一系列渐进近似模型。如图所示展示该方法:
请添加图片描述

  • 局部投影模型(无质量连杆近似):第一个近似模型是基于PLA支撑连杆的轻量化设计。假设这些连杆无质量,同时保留电机电枢和PLA主运动链的惯性。这样就得到一个与仿真器兼容的模型,其中有效电机电枢的质量取决于其构型。
  • 动态骨架模型(对角近似):为了处理耦合的PLA(例如,人形机器人的脚踝),这些PLA会产生标准仿真器无法处理的非对角骨架矩阵,采用雅可比近似。该方法近似处理非对角动态效应,仅引入微小的瞬态误差。
  • 标称骨架模型(固定构型近似):最后,为了消除在每个时间步更新骨架所带来的计算开销(约20%的计算速度降低),在单个标称构型下计算一次骨架值并将其固定。这提供一个计算成本低廉的模型,并为设计机器人的PD控制器增益提供了理论基础。
  • 虽然[57]中提出的Spot模型足以生成大多数行为,但对于更具动态性的三周后空翻行为,它却显得不足。为了弥合仿真与实际之间的差距,开发一个更精细的执行器模型,该模型融合机器人的功率限制算法,并模拟非线性效应,例如电机磁体饱和以及由传动效率低下和摩擦引起的扭矩损失。模型的静态参数(例如转子惯量、摩擦力)取自制造商提供的规格。正负工作效率是通过对模型进行优化,并结合从机器人记录的真实世界数据(在训练过程中随机选择)来确定的。

    参考运动流水线

    框架从多样化的参考运动库中学习,这些参考运动源自动作捕捉 (MoCap)、视频捕捉 (ViCap) 和关键帧动画。所有通过 MoCap 或 ViCap 获取的以人为中心数据都通过运动学重定向映射到目标机器人的骨架上。至关重要的是,假设所有数据源均无接触标记,仅依赖于运动学信息。

    数据来源

    使用 Xsens [58] 和 Vicon [59] 系统采集的动作捕捉 (MoCap) 数据,是获取自然人体运动的最高保真度来源,仅需极少的后处理。为了充分利用日常视频中丰富的运动数据,ViCap 流程从单个摄像头重建 3D 人体运动。该过程结合 MegaSaM [60] 进行稳健的摄像头运动和场景估计,以及 TRAM [61] 进行人体姿态估计,这种组合可以显著减少姿态抖动和足部滑动等伪影。最后,用关键帧动画来创建人类无法实现或适用于非人形生物(例如 Spot 四足动物)的运动。

    运动学重定向

    为了将运动捕捉 (MoCap) 和视频捕捉 (ViCap) 数据传输到目标机器人,求解一个时空优化问题 [62]。目标函数包含多个加权成本:跟踪源运动的根位置和方向、通过对齐坐标系对齐相应的骨骼,以及通过惩罚关节速度来调节输出。在此过程中,还联合优化源数据的均匀尺度和时间重采样,以确保任何弹道运动在物理上与真实世界的重力一致。该优化受限于机器人的正向运动学以及自身与地面之间的非穿透约束。

    训练设置和MDP

    将 ZEST 建模为一个目标条件马尔可夫决策过程 (MDP),M = (S, A, G, P, r, γ)。状态 s_t ∈ S 表示机器人和环境的状态,a_t ∈ A 是对应于电机动作的连续动作。在时刻 t,智体接收到观测值 o_t = ψ(s_t, g_t) 和目标 g_t ∈ G,选择动作 a_t ∼ π_θ(· | o_t, g_t),获得奖励 r_t = r(s_t, a_t, g_t),系统演化到新状态 s_t+1 ∼ P(· | s_t, a_t)。目标变量 g_t 编码待跟踪的参考目标,可以有多种形式:(i)时间索引的参考片段 sˆ_t:t+H,其中 H ≥ 0(例如,单步或短窗口);(ii)此类片段的潜嵌入 z_t = f (sˆ_t:t+H );或(iii)相位变量 φ_t ∈ [0, 1],以及在存在多个参考运动的情况下的轨迹标识符。策略参数 θ 经过优化,以最大化时间范围 T 内的预期折现收益,其中期望值基于由 P 和 π_θ、随机初始状态以及目标分布引起的展开。

    训练在 Isaac Lab 中进行,使用近端策略优化 (PPO) [63] 作为强化学习算法。为了稳定优化并提高收敛速度,所有观测值均使用经验运行平均方案进行归一化。actor网络和critic网络被建模为具有三个隐层和 ELU 激活函数的多层感知器 (MLP)。为了在保持硬件部署能力的同时加速训练,采用非对称的actor-critic架构 [64]。critic使用仅在模拟中可用的额外特权信息进行训练,这使其能够更准确地估计值函数。相比之下,策略仅限于硬件部署期间可用的观测值,从而确保其无需任何状态估计器即可迁移。这种方法可以避免估计器融合带来的滞后和偏差,规避状态估计器通常所需的脆弱接触和地形假设,并消除训练过程中未捕获的额外复杂性。学习算法确定后,现在来定义马尔可夫决策过程(MDP)的具体细节。

    Actor和Critic观察

    Actor(也称为策略)接收本体感觉信息以及目标参考信息:

    o_t = (o_prop, o_ref),

    本体感觉部分 o_prop = (Tω_IT, Tg_I, q_j, q̇_j, a_t−1) 仅包含瞬时机载测量值。有意排除需要状态估计器的量,例如全局基准位姿或线速度。其中,Tω_IT 是躯干固定式 IMU 坐标系 {T} 的绝对角速度,Tg_I 是在 {T} 中表示的归一化重力矢量,(q_j, q̇_j, a_t−1) 分别表示关节位置、关节速度和先前的动作。假设,在正常地形条件下,包含 a_t−1 足以推断出关键信息,例如接触状态和基座线速度,而无需依赖冗长的观测历史;它还提供确保动作平滑性所需的最小时间上下文。

    参考观测值 o_ref = (Iˆrz_IB, Bvˆ_IB, Bωˆ_IB, BgˆI, qˆ_j) 编码从演示中提取的下一个目标状态:Iˆrz_IB 是基座高度;Bvˆ_IB 和 Bωˆ_IB 是在基坐标系 {B} 中表示的绝对线速度和角速度;Bgˆ_I 是 {B} 中的重力方向;qˆ_j 是参考关节位置。特意避免使用紧邻下一个目标之后的未来参考窗口,这样做对性能或收敛速度没有任何益处。

    除了策略观测值之外,Critic还会接收被称为特权信息的额外信号。这些特权输入包括基座线速度、基座高度、末端执行器位置、速度和接触力,以及与课程相关的信号。

    动作和关节级控制

    该策略输出残差动作,这些残差动作会添加到参考关节位置,然后作为位置目标发送给关节级PD控制器:

    qcmd_j = qˆ_j + Σa_t

    其中 Σ 是一个正定对角矩阵,其对角线元素为每个自由度的动作尺度。这些尺度设置每个轴上残差修正和探索的幅度,并反映参考跟踪是否需要额外的前馈扭矩:需要更多辅助的执行器(例如髋关节和膝关节)使用较大的尺度,而仅由PD控制回路就能充分处理的执行器(例如机器人的头部和腕关节)则使用较小的尺度。PD增益是通过将每个关节建模为一个独立的二阶系统来选择的:

    I θ′′(t) + K_d θ′(t) + K_p θ(t) = 0

    其中 I 是该轴的标称骨架值(参见“建模”部分)。增益 K_p 和 K_d 通过启发式方法进行调整,以实现具有所需固有频率 ω_n > 0 的临界阻尼响应,

    K_p = I ω2_n,K_d = 2 I ω_n

    在实践中,设置 ω_n 以平衡响应性和鲁棒性。它设置得足够高,以实现快速跟踪,但又不会高到使回路在部署过程中变得脆弱,或者使仿真需要非常小的时间步长才能解析具有快速瞬态的刚性动力学,从而增加训练时间。仿真和硬件中使用相同的 PD 增益,以最大限度地减少仿真与实际之间的差异。

    奖励项

    总奖励由三个主要部分组成:跟踪奖励、正则化奖励和生存奖励

    r_total = r_track + r_reg + r_survival

    所有术语均刻意保持通用性:不涉及任何特定任务或动作,奖励机制也不依赖于演示中的参考接触标签,因此具有广泛的适用性。跟踪奖励衡量策略跟踪参考运动的程度。它可以采用不同的形式,例如二次惩罚或衰减指数核;在例子中,采用后者,它产生一个稠密的、有界的整形信号,强调在参考运动附近的精度,并随跟踪误差 r_track 平滑变化,其中 c_t_i 是第 i 项的奖励权重,e_i 表示当前值与参考值之间的误差,这些误差对应于诸如基础线速度、基础角速度、基础姿态、关节位置和关键体姿态等量。正则化项 r_reg 聚合鼓励平滑且物理上可行的行为惩罚项。具体而言,会惩罚跨时间步的快速动作变化、较大的关节加速度以及违反关节位置和扭矩限制的行为。生存奖励是每一步给予的恒定正项,r_survival = c_survival,它通过奖励更长的回合来防止过早终止。

    提前终止

    为了引导探索朝着有希望的状态发展,并避免在极不理想的轨迹上浪费样本,在接触力超过预定义阈值或智体与参考状态偏差较大等情况下触发提前终止。

    域随机化

    为了确保稳健的零样本仿真-到-真实环境迁移,采用域随机化来防止策略过拟合标称仿真模型。域随机化策略包括:向观测值中注入高斯噪声、在随机时间对机器人施加随机脉冲推力、改变表面摩擦系数以及在其标称值附近对连杆质量进行轻微随机化。谨慎地使用这些随机化方法,因为过度的变异性会导致策略过于保守或激进,从而降低性能。

    自适应参考状态初始化

    为了在训练期间初始化环境,首先采用文献 [29] 中提出的参考状态初始化 (RSI) 策略。在每次重置时,对随机相位 φ_init ∼ U (0, 1) 进行采样。然后,将环境初始化为相应的参考状态 sˆ(φ_init)。 RSI从一开始就将策略暴露于轨迹上的相关状态,将episode长度与演示长度解耦,并提高采样效率。此外,当一次展开到达演示结束时,会插入一个短暂的停留,然后通过超时(而非失败)重置,这进一步增加了信息转换的数量。

    虽然均匀RSI通常有效,但对于长时域轨迹或大量轨迹,其效率可能较低,因为它盲目地对阶段进行采样,对已掌握的区域进行过采样,而对难以掌握的片段进行欠采样。为了使采样偏向于最需要学习的区域,用一种自适应RSI方案:所有演示都被划分为固定的N步区间,每个区间b维护一个失败级别f_b,该级别基于最近的跟踪性能(基于相似性评分指标)并使用EMA滤波器进行更新。重置时,从一个logits与{f_b}成正比的分类分布中抽取一个bin索引k,然后在选定的bin内均匀采样一个相位以获得φ_init;每个bin都保留一个小的下限概率,以防止遗忘先前习得的技能。此过程提高对困难动作和困难相位的采样密度,同时保持全局覆盖率。

    辅助扳手自动课程

    虽然目前提出的框架足以跟踪库中的大多数动作,但具有高度动态的基座旋转和大角速率的技能(例如,倒立、侧手翻、后空翻)往往会在仅使用RSI的情况下立即触发早期终止,并且与行走和跑步等更简单的行为相比,收敛速度明显更慢。为了解决这个问题,采用一种自动辅助力课程,作为一种逐步增加任务难度的持续策略:在基础阶段施加一个虚拟空间力,并随着跟踪精度的提高而逐渐减弱,这类似于体操教练逐渐减少对学生的辅助。类似的辅助力课程已在之前的相关研究中有所探讨[65-68]。辅助力以基于模型的方式计算,使用基于基础姿态跟踪误差的PD项,以及一个补偿躯干动力学的前馈分量。为了保持辅助力的部分支持作用,同时促使智体自主学习技能,再次使用β∈(0, β_max)缩放辅助力,其中β_max<1.0。减弱策略由自适应RSI程序中引入的每个区间失败等级自动驱动:失败等级较高的区间最初会获得更强的辅助力,并随着跟踪精度的提高而更积极地减弱辅助力。辅助功能会迅速衰减,并在目标跟踪性能达到一定水平后最终消失。

    硬件部署流程

    具身智能中一个重要但常被忽视的方面是硬件部署流程。由于研究涉及对物理机器人进行频繁测试,创建一个高效、自动化且与框架和硬件无关的流程,以确保跨多个平台安全一致地发布。该流程遵循三阶段工作流程。首先,在训练过程中,策略检查点以 ONNX 格式导出并记录到注册表中,同时记录的还有包含所有相关配置的详细元数据。为了进行验证,会检索这些工件,并使用元数据自动配置评估模拟器 [69] 中的控制器,该模拟器与硬件的软件栈完全一致。一旦策略按预期运行,就会使用完全相同的自动化流程将其部署到物理机器人,从而保证一致性并消除手动设置错误。值得注意的是,虽然硬件测试需要一定的部署工作流程,但学习的策略并不依赖于此特定流程;将其纳入流程主要是为了加速迭代,并减少仿真间评估和硬件测试过程中可能出现的意外错误。

    赞(0)
    未经允许不得转载:171主机测评 » ZEST:用于运动机器人控制的零样本具身技能迁移
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址