文献:AMP: Adversarial Motion Priors for Stylized Physics-Based Character Control
期刊/会议:ACM Transactions on Graphics(Proceedings of ACM SIGGRAPH 2021)
作者:Xue Bin Peng, Ze Ma, Pieter Abbeel, Sergey Levine, Angjoo Kanazawa
单位:University of California, Berkeley;Shanghai Jiao Tong University
项目主页:https://xbpeng.github.io/projects/AMP/
官方实现参考:https://github.com/xbpeng/MimicKit
双足机器人实现参考:https://github.com/Roboparty/roboparty_train
1. 文献定位与核心结论
AMP 的核心目标是解决一个长期存在于物理角色控制和足式机器人强化学习中的问题:任务奖励容易描述,但“动作是否自然”很难通过人工奖励函数完整表达。
以双足机器人速度跟踪为例,任务目标可以直接写成线速度、角速度和姿态误差:
rttask=wvexp(−∥vt−vtcmd∥2σv)+wωexp(−(ωz,t−ωz,tcmd)2σω)+⋯
r_t^{\\mathrm{task}}
=w_v\\exp\\left(-\\frac{\\|\\mathbf v_t-\\mathbf v_t^{\\mathrm{cmd}}\\|^2}{\\sigma_v}\\right)
+w_\\omega\\exp\\left(-\\frac{(\\omega_{z,t}-\\omega_{z,t}^{\\mathrm{cmd}})^2}{\\sigma_\\omega}\\right)+\\cdots
rttask=wvexp(−σv∥vt−vtcmd∥2)+wωexp(−σω(ωz,t−ωz,tcmd)2)+⋯
但仅依赖这类奖励,策略可能通过屈膝滑行、身体前倾、双脚高频点地、异常摆臂或过大的关节力矩完成速度跟踪。为了限制这些非自然解,传统方法通常继续添加足端离地时间、摆脚高度、左右对称、关节姿态、躯干高度、能耗、步频和接触时序等大量奖励项,最终形成难以调节且高度依赖机器人结构的奖励系统。
AMP 的思路是:
因此,AMP 不是一个独立替代 PPO 的强化学习算法,也不是标准图像 GAN。它更准确的定位是:
AMP=GAN式对抗模仿学习得到的运动先验奖励
\\boxed{\\text{AMP}=\\text{GAN式对抗模仿学习得到的运动先验奖励}}
AMP=GAN式对抗模仿学习得到的运动先验奖励
PPO+AMP=任务强化学习+对抗模仿学习
\\boxed{\\text{PPO+AMP}=\\text{任务强化学习}+\\text{对抗模仿学习}}
PPO+AMP=任务强化学习+对抗模仿学习
在该框架中,PPO 负责回答“如何完成速度跟踪、转向、越障等任务”,AMP 负责约束“采用怎样的身体运动方式完成任务”。

图 1 AMP 在不同任务中生成具有指定运动风格的物理控制行为(对应原文 Fig. 1)
图 1 展示了 AMP 的基本能力:策略并不是逐帧回放参考动作,而是在满足外部任务目标的同时,采用动作数据集所描述的运动风格。例如,角色可以在障碍环境中组合奔跑、跳跃和翻滚,也可以先移动到目标附近再完成击打动作。
2. 研究背景与相关文献演进
2.1 从动作跟踪到运动分布匹配
物理角色控制和双足机器人动作学习大致经历了以下技术演进:
| 监督模仿 | Behavioral Cloning | 直接学习专家状态到动作的映射 | 容易产生分布偏移;通常需要专家动作标签 |
| 对抗模仿 | GAIL | 判别专家与策略的状态—动作占用分布 | 原始形式依赖专家动作;复杂任务仍需任务条件 |
| 相位跟踪 | DeepMimic | 跟踪指定参考动作,并叠加任务奖励 | 依赖相位、参考帧和人工设计跟踪权重 |
| 运动先验 | AMP | 匹配专家与策略的状态转移分布,学习任务无关风格奖励 | 存在对抗训练不稳定和模式坍塌风险 |
| 可复用技能空间 | ASE、CALM | 在运动先验上进一步学习条件化或潜变量技能表示 | 系统复杂度与训练成本进一步提高 |
| 机器人落地 | IROS 2022、HumanMimic、Adam 等 | 加入重定向、域随机化和硬件约束,实现实体机器人迁移 | 受动力学误差、时延、接触和硬件安全约束影响 |
2.2 GAIL:AMP 的对抗模仿学习基础
GAIL(Generative Adversarial Imitation Learning)将 GAN 的判别思想引入模仿学习。判别器区分专家状态—动作对与策略状态—动作对:
minD−E(s,a)∼dE[logD(s,a)]−E(s,a)∼dπ[log(1−D(s,a))]
\\min_D
-\\mathbb E_{(s,a)\\sim d_E}[\\log D(s,a)]
-\\mathbb E_{(s,a)\\sim d_\\pi}[\\log(1-D(s,a))]
Dmin−E(s,a)∼dE[logD(s,a)]−E(s,a)∼dπ[log(1−D(s,a))]
策略则通过强化学习最大化由判别器构造的奖励,从而使自身占用分布接近专家分布。AMP 延续了这一思想,但针对动作捕捉数据通常没有控制动作标签的问题,将匹配对象改为状态转移:
(st,st+1)而不是(st,at)
(s_t,s_{t+1})\\quad\\text{而不是}\\quad(s_t,a_t)
(st,st+1)而不是(st,at)
这使 AMP 可以直接使用人体动作捕捉、关键帧动画或运动重定向后的机器人状态序列。
2.3 DeepMimic:高质量动作跟踪的代表方法
DeepMimic 通过相位变量定位参考动作中的目标帧,并设计关节姿态、关节速度、末端位置和质心等跟踪奖励:
rtimit=wqrtq+wvrtv+werte+wcrtc
r_t^{\\mathrm{imit}}
=w_qr_t^q+w_vr_t^v+w_er_t^e+w_cr_t^c
rtimit=wqrtq+wvrtv+werte+wcrtc
它能够学习翻转、奔跑、踢腿等高动态动作,并将模仿奖励与任务奖励结合。但其策略通常需要知道当前动作相位或目标姿态,且不同动作需要相应的跟踪指标和权重。AMP 不再要求“在时刻 ttt 跟踪参考动作的第几帧”,而是判断当前状态转移是否属于参考运动分布。
2.4 AMP 之后的扩展方向
AMP 之后的研究主要沿三个方向发展:
- 机器人 Sim2Real:将风格奖励与动力学随机化、时延建模和硬件约束结合;
- 多技能与潜变量控制:ASE、CALM 等方法学习可复用的技能嵌入;
- 更稳定的分布匹配:HumanMimic 使用 Wasserstein 对抗学习缓解模式坍塌,后续工作也尝试能量模型、得分匹配和状态依赖判别器。
3. 文献解决的关键科学问题与技术挑战
3.1 如何减少自然运动奖励的人工设计
双足运动是典型的欠约束控制问题。同一速度指令可以由大量运动模式完成,但其中只有部分模式符合人类步态、机械约束和部署需求。仅用任务奖励时,策略往往利用仿真器漏洞或奖励函数缺口获得高回报。
AMP 将“自然运动”定义为参考动作数据的统计分布,而不是手工编写一组固定规则。这样,奖励设计从“逐项描述自然步态”转化为“提供代表目标风格的运动数据”。
3.2 如何使用无任务标注、无动作标签的运动数据
动作捕捉数据通常只包含人体或角色的姿态序列,并不包含机器人控制力矩,也未必标注“这一段是起步、转弯还是停止”。传统跟踪方法还需要将每个仿真时刻与某个参考帧对齐。
AMP 希望直接使用未经任务分割的大规模动作片段:
M={mi},mi={q^0i,q^1i,…,q^Tii}
\\mathcal M=\\{m_i\\},\\qquad
m_i=\\{\\hat q_0^i,\\hat q_1^i,\\ldots,\\hat q_{T_i}^i\\}
M={mi},mi={q^0i,q^1i,…,q^Tii}
训练中随机从数据集采样相邻参考状态,构造真实状态转移,不要求任务标签、技能标签或固定播放顺序。
3.3 如何同时兼顾任务完成与运动风格
只优化模仿目标,机器人可能无法根据速度指令、目标位置或地形变化作出调整;只优化任务目标,又容易产生非自然动作。AMP 需要处理二者之间的权衡:
rt=wGrtG+wSrtS
r_t=w_G r_t^G+w_Sr_t^S
rt=wGrtG+wSrtS
其中 rtGr_t^GrtG 是目标相关任务奖励,rtSr_t^SrtS 是目标无关风格奖励。任务奖励决定“目标是什么”,运动先验决定“允许采用哪些运动策略”。
3.4 如何稳定训练对抗判别器
策略分布随 PPO 更新持续变化,判别器和策略构成非平稳博弈。若判别器过强,策略几乎得不到有效风格梯度;若判别器过弱,风格奖励无法区分自然与异常动作。此外,高维关节状态下容易出现模式坍塌:策略只学习数据集中的少量动作模式。
论文通过以下措施提高稳定性:
- 使用最小二乘 GAN 目标;
- 对参考数据施加梯度惩罚;
- 将风格奖励限制在 [0,1][0,1][0,1];
- 使用策略转移回放缓冲区;
- 采用参考状态初始化和合理的提前终止条件。
3.5 双足机器人中的额外困难
将图形学中的 AMP 迁移到双足机器人,还需要额外解决:
因此,双足 AMP 不能只复制判别器结构,还需要运动重定向、任务奖励、非对称 Actor–Critic、域随机化、观测噪声和时延模型共同构成完整系统。
4. AMP 总体框架

图 2 AMP 系统总体结构:任务奖励与学习得到的风格奖励共同训练策略(对应原文 Fig. 2)
给定参考运动数据集 M\\mathcal MM 和任务目标 ggg,策略写为:
at∼πθ(at∣st,g)
a_t\\sim\\pi_\\theta(a_t\\mid s_t,g)
at∼πθ(at∣st,g)
在原论文中,动作 ata_tat 是各关节 PD 控制器的目标位置。仿真器根据当前状态和动作产生下一状态:
st+1∼p(st+1∣st,at)
s_{t+1}\\sim p(s_{t+1}\\mid s_t,a_t)
st+1∼p(st+1∣st,at)
每一步同时计算两类奖励:
rtG=rG(st,at,st+1,g)
r_t^G=r^G(s_t,a_t,s_{t+1},g)
rtG=rG(st,at,st+1,g)
rtS=rS(st,st+1)
r_t^S=r^S(s_t,s_{t+1})
rtS=rS(st,st+1)
合成总奖励后,由 PPO 更新 Actor 和 Critic;判别器则使用专家状态转移与策略状态转移单独更新。
4.1 AMP 与 GAN 的对应关系
| 真实数据 | 专家动作状态转移 | 来自动捕或重定向后的运动数据 |
| 生成器 | 机器人控制策略与物理仿真共同构成的隐式生成过程 | Actor 只输出动作,最终运动由动力学产生 |
| 生成样本 | 策略产生的状态转移 | 受接触、惯性和执行器约束 |
| 判别器 | AMP Discriminator | 判断运动转移是否来自参考数据 |
| 生成器损失 | AMP 风格奖励 + PPO 策略更新 | 不能直接对物理环境反向传播 |
因此,“AMP 的核心是 GAN”只说对了一部分。更严格地说,AMP 的核心是:
利用 GAN 式判别器学习运动分布差异,把判别结果转化为奖励,再通过模型无关强化学习优化物理控制策略。
5. 算法原理与数学推导
5.1 目标条件强化学习
策略的目标是最大化折扣累计回报:
J(π)=Eg∼p(g)Eτ∼p(τ∣π,g)[∑t=0T−1γtrt]
J(\\pi)=
\\mathbb E_{g\\sim p(g)}
\\mathbb E_{\\tau\\sim p(\\tau\\mid\\pi,g)}
\\left[
\\sum_{t=0}^{T-1}\\gamma^t r_t
\\right]
J(π)=Eg∼p(g)Eτ∼p(τ∣π,g)[t=0∑T−1γtrt]
轨迹概率为:
p(τ∣π,g)=p(s0)∏t=0T−1π(at∣st,g) p(st+1∣st,at)
p(\\tau\\mid\\pi,g)
=p(s_0)\\prod_{t=0}^{T-1}
\\pi(a_t\\mid s_t,g)
\\,p(s_{t+1}\\mid s_t,a_t)
p(τ∣π,g)=p(s0)t=0∏T−1π(at∣st,g)p(st+1∣st,at)
这里不需要已知动力学解析模型,仿真器负责产生状态转移,PPO 通过采样数据优化策略。
5.2 状态转移分布匹配
由于参考动作通常没有专家控制动作,AMP 不采用 D(s,a)D(s,a)D(s,a),而采用:
Dψ(Φ(st),Φ(st+1))
D_\\psi\\big(\\Phi(s_t),\\Phi(s_{t+1})\\big)
Dψ(Φ(st),Φ(st+1))
其中 Φ(⋅)\\Phi(\\cdot)Φ(⋅) 是判别器特征映射。判别器希望区分:
(s,s′)∼dM与(s,s′)∼dπ
(s,s')\\sim d_{\\mathcal M}
\\quad\\text{与}\\quad
(s,s')\\sim d_\\pi
(s,s′)∼dM与(s,s′)∼dπ
前者来自参考运动,后者来自当前策略。若二者的状态转移分布接近,说明策略在局部运动规律上与参考动作一致。
对双足机器人而言,这种转移信息能够同时体现:
- 关节姿态与速度变化;
- 躯干平移和旋转趋势;
- 摆腿、落脚和支撑转换;
- 上下肢协调;
- 动作的短时连续性。
5.3 最小二乘判别器目标
论文采用 LSGAN 形式,将专家转移标签设置为 +1+1+1,策略转移标签设置为 −1-1−1:
LD=E(s,s′)∼dM[(Dψ(Φ(s),Φ(s′))−1)2]+E(s,s′)∼dπ[(Dψ(Φ(s),Φ(s′))+1)2]
\\mathcal L_D=
\\mathbb E_{(s,s')\\sim d_{\\mathcal M}}
\\left[
\\left(D_\\psi(\\Phi(s),\\Phi(s'))-1\\right)^2
\\right]
+
\\mathbb E_{(s,s')\\sim d_\\pi}
\\left[
\\left(D_\\psi(\\Phi(s),\\Phi(s'))+1\\right)^2
\\right]
LD=E(s,s′)∼dM[(Dψ(Φ(s),Φ(s′))−1)2]+E(s,s′)∼dπ[(Dψ(Φ(s),Φ(s′))+1)2]
相较于交叉熵判别目标,最小二乘形式在判别器高度自信时仍可提供更平滑的学习信号,并与论文定义的有界风格奖励自然衔接。
5.4 AMP 风格奖励
判别器输出被转换为:
rtS=max(0,1−14(Dψ(Φ(st),Φ(st+1))−1)2)
r_t^S=
\\max\\left(
0,
1-\\frac{1}{4}
\\left(D_\\psi(\\Phi(s_t),\\Phi(s_{t+1}))-1\\right)^2
\\right)
rtS=max(0,1−41(Dψ(Φ(st),Φ(st+1))−1)2)
其性质如下:
- 当判别器认为策略转移接近专家样本时,D→1D\\rightarrow1D→1,风格奖励接近 1;
- 当策略动作明显偏离参考运动时,奖励降低;
- max(0,·) 将风格奖励限制为非负,避免异常判别值产生过大负奖励;
- 判别器学习的是奖励函数,Actor 并不直接使用专家动作标签。
5.5 梯度惩罚
判别器的完整损失加入参考数据上的梯度惩罚:
LDtotal=LD+wgp2E(s,s′)∼dM[∥∇ϕDψ(ϕ)∥22]ϕ=(Φ(s),Φ(s′))
\\mathcal L_D^{\\mathrm{total}}
=\\mathcal L_D
+\\frac{w_{\\mathrm{gp}}}{2}
\\mathbb E_{(s,s')\\sim d_{\\mathcal M}}
\\left[
\\left\\|
\\nabla_{\\phi}D_\\psi(\\phi)
\\right\\|_2^2
\\right]_{\\phi=(\\Phi(s),\\Phi(s'))}
LDtotal=LD+2wgpE(s,s′)∼dM[∥∇ϕDψ(ϕ)∥22]ϕ=(Φ(s),Φ(s′))
该项约束判别器在真实数据流形附近不要产生剧烈梯度,降低策略更新后迅速脱离参考分布的风险。原论文的消融实验显示,移除梯度惩罚会显著降低训练稳定性和动作质量。
5.6 任务奖励与风格奖励融合
原论文使用线性组合:
rt=wGrtG+wSrtS
r_t=w_G r_t^G+w_S r_t^S
rt=wGrtG+wSrtS
工程中需要注意,wGw_GwG 与 wSw_SwS 并不直接等于两类奖励的实际贡献比例,因为二者数值尺度不同。通常需要记录训练期间:
- 任务奖励均值;
- 风格奖励均值;
- 判别器专家/策略输出;
- 速度跟踪误差;
- 步态成功率和跌倒率。
若风格权重过大,策略可能“动作像参考,但速度指令跟不上”;若任务权重过大,策略可能完成任务但重新出现滑步、屈膝或异常摆动。
5.7 PPO 策略更新
AMP 不替代 PPO。策略仍使用 PPO 的裁剪代理目标:
Lclip(θ)=Et[min(ρt(θ)A^t,clip(ρt(θ),1−ϵ,1+ϵ)A^t)]
L^{\\mathrm{clip}}(\\theta)=
\\mathbb E_t\\left[
\\min\\left(
\\rho_t(\\theta)\\hat A_t,
\\operatorname{clip}(\\rho_t(\\theta),1-\\epsilon,1+\\epsilon)\\hat A_t
\\right)
\\right]
Lclip(θ)=Et[min(ρt(θ)A^t,clip(ρt(θ),1−ϵ,1+ϵ)A^t)]
ρt(θ)=πθ(at∣ot)πθold(at∣ot)
\\rho_t(\\theta)=
\\frac{\\pi_\\theta(a_t\\mid o_t)}
{\\pi_{\\theta_{\\mathrm{old}}}(a_t\\mid o_t)}
ρt(θ)=πθold(at∣ot)πθ(at∣ot)
优势函数可由 GAE 计算:
δt=rt+γVϕ(ot+1)−Vϕ(ot)
\\delta_t=r_t+\\gamma V_\\phi(o_{t+1})-V_\\phi(o_t)
δt=rt+γVϕ(ot+1)−Vϕ(ot)
A^t=∑l=0T−t−1(γλ)lδt+l
\\hat A_t=
\\sum_{l=0}^{T-t-1}(\\gamma\\lambda)^l\\delta_{t+l}
A^t=l=0∑T−t−1(γλ)lδt+l
这里的 rtr_trt 已经包含任务奖励和 AMP 风格奖励。Critic 学习状态价值 V(ot)V(o_t)V(ot),为优势估计提供基线;它与 AMP 判别器的职责不同。
6. 网络输入、输出与非对称 Actor–Critic
6.1 原论文状态与动作表示
原论文的角色状态包含:
- 各刚体相对根节点的位置;
- 使用 6D normal–tangent 表示的刚体旋转;
- 刚体线速度和角速度;
- 所有特征转换到角色局部坐标系。
策略输出为关节 PD 目标位置。对于球形关节,使用三维指数映射表示目标旋转;对于单自由度转动关节,输出目标角度。
这种动作接口具有两个优点:
但对于真实双足机器人,PD 增益、电机带宽和时延必须在仿真中合理建模,否则会形成明显的 Sim2Real 偏差。
6.2 判别器输入为何通常使用运动历史
原始 AMP 使用相邻状态转移。Isaac Lab 等实现常将连续若干时刻的 AMP 特征拼接:
otAMP=[Φ(st−H+1),…,Φ(st)]
o_t^{\\mathrm{AMP}}=
[\\Phi(s_{t-H+1}),\\ldots,\\Phi(s_t)]
otAMP=[Φ(st−H+1),…,Φ(st)]
历史长度 H>1H>1H>1 后,判别器可以区分静态姿态相似但动态过程不同的运动。例如,两个时刻都处于单脚支撑状态,但一个是正常摆腿过程,另一个可能是突然抬腿后的失稳姿态。
6.3 非对称 Actor–Critic 的准确含义
在双足机器人训练中,非对称通常指 Actor 和 Critic 使用不同的信息:
otactor≠otcritic
o_t^{\\mathrm{actor}}\\neq o_t^{\\mathrm{critic}}
otactor=otcritic
Actor 只能使用实机可获得的观测,例如:
otactor=[ωt,g^t,ct,qt−q0,q˙t,at−1]
o_t^{\\mathrm{actor}}=
[\\omega_t,\\hat g_t,c_t,q_t-q_0,\\dot q_t,a_{t-1}]
otactor=[ωt,g^t,ct,qt−q0,q˙t,at−1]
Critic 在训练阶段可额外使用特权状态:
otcritic=[otactor,vt,contact,μ,external force,…]
o_t^{\\mathrm{critic}}=
[o_t^{\\mathrm{actor}},v_t,\\text{contact},\\mu,\\text{external force},\\ldots]
otcritic=[otactor,vt,contact,μ,external force,…]
Critic 不是 AMP 判别器。三者的关系为:
| Actor | 可部署、带噪本体感知观测与指令 | 关节目标动作 | 是 |
| Critic | Actor 观测 + 仿真特权信息 | 状态价值 VVV | 否 |
| AMP 判别器 | 参考/策略运动状态转移或历史 | 风格得分与风格奖励 | 否 |
非对称 Critic 能更准确地估计回报,从而降低 Actor 优势估计的方差;Actor 保持仅依赖可部署观测,避免训练时使用的信息在实机上不可获得。
7. AMP 训练技术路线
完整训练流程可概括为以下步骤。
7.1 参考动作准备与重定向
重定向不是简单复制关节角。由于腿长、髋宽、脚掌尺寸和自由度不同,目标应优先保持:
- 躯干方向;
- 脚底位置和接触时序;
- 膝、髋整体运动趋势;
- 质心相对支撑区域的位置;
- 上下肢协调风格。
7.2 并行环境采样
在 Isaac Lab/Isaac Gym 中并行运行数千环境。每一步:
at∼πθ(at∣otactor)
a_t\\sim\\pi_\\theta(a_t\\mid o_t^{\\mathrm{actor}})
at∼πθ(at∣otactor)
动作经缩放后形成关节偏移或关节目标:
qtdes=q0+saat
q_t^{\\mathrm{des}}=q_0+s_a a_t
qtdes=q0+saat
底层 PD 计算力矩:
τt=Kp(qtdes−qt)−Kdq˙t
\\tau_t=K_p(q_t^{\\mathrm{des}}-q_t)-K_d\\dot q_t
τt=Kp(qtdes−qt)−Kdq˙t
随后仿真器产生接触和下一状态。
7.3 计算任务奖励与风格奖励
任务奖励主要约束:
- 线速度和角速度跟踪;
- 躯干姿态与高度;
- 存活与跌倒;
- 关节速度、加速度、力矩和功率;
- 足端滑移、间距与异常接触;
- 动作变化率。
AMP 判别器则根据运动历史计算风格奖励。二者融合后存入 PPO rollout buffer。
7.4 交替更新判别器和 PPO
一个训练迭代中通常执行:
PPO 优化器与判别器优化器通常相互独立。判别器参数不会部署到实机,其作用仅限于训练阶段生成风格奖励。
7.5 Sim2Sim 与 Sim2Real
训练完成后只导出 Actor。Sim2Sim 用另一仿真器验证:
- 关节顺序与符号;
- URDF/MJCF 质量和惯量;
- 控制频率和 decimation;
- PD 增益;
- 动作缩放;
- 坐标系、重力方向和四元数约定。
实机部署时还需增加:
- 安全起始姿态;
- 动作限幅和力矩限幅;
- 状态估计滤波;
- 通信超时保护;
- 跌倒检测;
- 缓启动与急停;
- 关节温度、电流和速度监控。
8. 原论文实验设计与结果分析
8.1 任务体系与运动数据集
原论文通过多种任务检验 AMP 是否能把同一运动先验用于不同目标,以及是否能从多片段数据中自动组合技能。

图 3 不同运动数据集和任务下的 AMP 行为:目标位置、目标朝向、运球、击打、障碍与踏脚石(对应原文 Fig. 3)
| Target Heading | 按目标速度和方向移动 | 走、跑、转向 | 不同数据集对可达速度和风格的影响 |
| Target Location | 到达随机目标位置 | 导航、转弯、启停 | 任务条件下的自然移动 |
| Dribble | 将足球带到目标位置 | 行走、触球、连续调整 | 运动先验与物体交互结合 |
| Strike | 接近并击打目标 | 走近、切换、出拳 | 不同动作片段的时间组合 |
| Obstacles | 穿越间隙、台阶和低矮障碍 | 奔跑、跳跃、翻滚、下蹲 | 无高层技能规划器的动作组合 |
| Stepping Stones | 跨越离散落脚区域 | 跳跃、侧手翻等 | 运动风格对任务解法的塑造 |
| Single-Clip Imitation | 仅最大化风格奖励 | 翻转、旋转、踢腿等 | 与显式动作跟踪方法比较 |
论文中规模最大的 Locomotion 数据集约为 434.1 秒,包含 56 段动作、8 名表演者。重要之处不只是数据规模,而是其未经任务标签划分,AMP 需要从混合运动中学习可用于目标条件任务的先验。
8.2 运动数据覆盖范围决定策略能力边界

图 4 不同运动数据集训练的目标朝向策略及速度覆盖范围(对应原文 Fig. 4)
图 4 表明,运动先验并不是一个与数据无关的通用自然度模型。只包含行走数据时,策略倾向于采用较低速度步态;只包含跑步数据时,低速控制能力受到限制;使用多样化 locomotion 数据后,策略能够随目标速度在走、慢跑和跑步之间切换。
论文报告的目标朝向任务回报中,多样化 Locomotion 数据对应约 0.90±0.010.90\\pm0.010.90±0.01,高于仅使用 Walk 数据的约 0.46±0.010.46\\pm0.010.46±0.01 和仅使用 Run 数据的约 0.63±0.010.63\\pm0.010.63±0.01。这说明参考数据不仅决定动作“外观”,还决定策略可利用的速度和技能范围。
对于双足机器人,这一结论意味着:若训练数据只包含固定速度直行步态,不能期待 AMP 自动产生高质量转向、起停、后退和恢复动作。数据集覆盖范围必须与部署指令空间匹配。
8.3 AMP 对任务性能的影响

图 5 AMP、潜空间方法与无运动数据方法的任务学习曲线比较(对应原文 Fig. 5)
图 5 比较了 AMP、潜空间方法和不使用运动数据的方法。结果显示,运动先验并非只负责视觉风格,它还能限制策略探索到更合理的运动区域,在部分复杂任务中提高学习效率和最终任务性能。
原因在于,高维物理控制的动作空间中存在大量不稳定或非自然解。AMP 相当于给策略提供一个数据驱动的正则化项,使策略优先探索参考运动附近的可行状态转移。
8.4 单动作片段模仿

图 6 AMP 在单动作片段任务中学习的后空翻、侧空翻、侧手翻、旋转、旋踢和翻滚(对应原文 Fig. 6)
单片段实验用于检验 AMP 在没有显式相位和目标帧的情况下,能否学出高动态周期或非周期技能。结果表明,AMP 可学习多种复杂动作,并达到接近显式动作跟踪方法的质量。
不过,对于严格要求时序一致的非周期动作,显式跟踪仍具有优势。AMP 优化的是分布相似性,不保证策略按照参考片段的精确时间顺序逐帧复现。
8.5 不同角色形态上的泛化

图 7 AMP 在高自由度霸王龙和犬类角色上的运动学习结果(对应原文 Fig. 7)
图 7 说明 AMP 本身不依赖人形拓扑,只要能定义统一状态特征并提供相应运动数据,就能用于不同结构。这也为四足机器人和双足机器人使用同一类对抗运动先验框架提供了依据。
但“算法结构通用”不意味着运动数据可以跨形态直接复用。不同机器人仍需单独完成骨架映射、动作重定向、判别器特征选择和动力学约束设计。
8.6 关键消融实验

图 8 AMP、显式动作跟踪、移除速度特征和移除梯度惩罚的学习曲线(对应原文 Fig. 8)
图 8 的主要结论包括:
对于双足机器人,判别器至少应包含能描述步态动态的特征,如基座线/角速度、关节位置与速度、脚部或关键刚体相对位置。只输入静态关节角容易出现“姿势相似但动态错误”的策略。
8.7 附录实验完整曲线

图 9 AMP 与 Motion Tracking 在全部单片段任务上的学习曲线(对应原文 Fig. 9)
图 9 补充了不同单片段技能的完整对比。不同动作的学习难度差异较大,说明 AMP 的效果与动作周期性、接触复杂度、参考数据质量和初始化策略密切相关。

图 10 AMP 在不同任务与运动数据集上的完整学习曲线(对应原文 Fig. 10)
图 10 进一步展示了不同任务和数据集组合下的训练表现。该结果支持论文的核心主张:同一 AMP 形式可以在不逐项设计风格奖励的情况下,为多种任务提供运动先验;但策略性能仍受任务奖励、数据覆盖和训练稳定性共同影响。
9. 面向 RPO 双足机器人的 Isaac Lab 实现分析
roboparty_train 是一个面向 RPO 双足机器人的 Isaac Lab 工作区,其中 AMP 工作流采用定制 rsl_rl。其实现可用于理解 AMP 如何从图形学方法转化为双足机器人控制系统。
9.1 训练配置
根据项目配置,核心参数可概括如下:
| 策略算法 | PPOAMP | 在 PPO 基础上接入 AMP 奖励与判别器更新 |
| Runner | AMPRunner | 管理运动数据、策略采样和 AMP 训练流程 |
| Actor/Critic 隐藏层 | [512, 256, 128],ELU | 生成动作和估计状态价值 |
| PPO clip | 0.2 | 限制单次策略更新幅度 |
| 折扣因子 | 0.99 | 长期回报权重 |
| GAE 参数 | 0.95 | 偏差—方差折中 |
| PPO epoch / mini-batch | 5 / 4 | rollout 数据重复利用方式 |
| 判别器隐藏层 | [1024, 512],ELU | 区分参考与策略运动 |
| 对抗损失 | LSGAN | 提供较平滑的判别信号 |
| 风格奖励缩放 | 1.5 | 调节 AMP 奖励尺度 |
| 任务—风格插值 | 0.6 | 任务奖励与风格奖励融合 |
| 梯度惩罚 | 10.0 | 稳定判别器训练 |
| AMP 历史长度 | 3 | 利用连续运动信息判断风格 |
| 对称增强 | 镜像数据增强 + mirror loss | 利用双足结构对称性提高样本效率 |
其中任务—风格插值配置可写为:
rt=αrttask+(1−α)rtstyle,α=0.6
r_t=\\alpha r_t^{\\mathrm{task}}+(1-\\alpha)r_t^{\\mathrm{style}},
\\qquad \\alpha=0.6
rt=αrttask+(1−α)rtstyle,α=0.6
同时风格奖励内部还乘以缩放系数,因此不能简单把它解释为“任务奖励占 60%、风格奖励占 40%”。实际贡献还取决于两类奖励的统计范围。
9.2 AMP 判别器观测
项目设置连续 3 步 AMP 历史,并选取踝、膝、肘等关键刚体。对于双足机器人,这类特征有助于判别:
- 左右支撑交替是否符合参考步态;
- 膝关节屈伸与脚部摆动是否协调;
- 上肢摆动与下肢节奏是否一致;
- 运动是否存在高频抖动、拖脚或异常停顿。
历史越长,判别器获得的时序信息越充分,但输入维度、过拟合风险和判别器训练难度也会增加。通常应从 2—4 帧短历史开始,而不是盲目增加长序列。
9.3 任务奖励与 AMP 奖励的分工
项目任务奖励包括速度跟踪、存活、姿态、关节运动惩罚、能耗、足端滑移、足间距和异常接触等。AMP 并未完全删除工程奖励,其作用是减少难以精确描述的“自然风格”奖励。
推荐的分工方式为:
| 任务奖励 | 速度指令、转向、稳定、不跌倒、能耗、硬件约束、足底滑移 |
| AMP 风格奖励 | 步态形态、上下肢协调、自然过渡、整体动作分布 |
| 终止条件 | 严重跌倒、越界、非法接触和危险姿态 |
| 域随机化 | 模型误差与环境变化下的鲁棒性 |
不应把关节限位、最大力矩、危险碰撞等安全约束完全交给 AMP 学习,因为参考数据不能保证覆盖所有危险状态,判别器也不是硬约束求解器。
9.4 双足动作数据处理
项目通过 GMR 等工具进行动作重定向,并转换关节顺序。实际工程中应重点核对:
- 人体左右关节与机器人左右关节是否映射正确;
- 关节旋转轴和正负方向是否一致;
- 根节点高度是否与脚底接触匹配;
- 参考动作采样频率是否与 AMP 时间间隔一致;
- 关节速度是否由平滑差分获得;
- 运动循环首尾是否连续;
- 是否存在脚底穿透或长时间滑动;
- 上肢动作是否超出机器人关节限位。
动作数据质量会直接改变判别器学习到的“自然”定义。错误重定向数据可能使策略稳定地学出错误步态,因此数据可视化检查应在强化学习训练之前完成。
9.5 Sim2Sim 与 Sim2Real
该项目提供 MuJoCo Sim2Sim 路径。Sim2Sim 的意义不是重复播放效果,而是检验策略是否依赖训练仿真器的特定接触模型或参数。
双足 AMP 的迁移通常依赖以下机制:
- 基座质量、质心和惯量随机化;
- 地面摩擦和恢复系数随机化;
- 关节摩擦、阻尼、电机强度和 PD 增益随机化;
- IMU、编码器和速度估计噪声;
- 观测、动作和通信时延;
- 随机外力与基座推扰;
- 地形高度或坡度扰动;
- Actor 只使用实机可测观测。
其中执行器延迟可用动作历史队列模拟:
atexec=at−dt,dt∼U(dmin,dmax)
a_t^{\\mathrm{exec}}=a_{t-d_t},
\\qquad d_t\\sim\\mathcal U(d_{\\min},d_{\\max})
atexec=at−dt,dt∼U(dmin,dmax)
也可使用一阶执行器模型:
τtact=βτt−1act+(1−β)τtcmd
\\tau_t^{\\mathrm{act}}
=\\beta\\tau_{t-1}^{\\mathrm{act}}
+(1-\\beta)\\tau_t^{\\mathrm{cmd}}
τtact=βτt−1act+(1−β)τtcmd
二者分别描述离散通信/控制延迟和电机响应带宽,不能完全相互替代。
10. 主要创新点与学术贡献
10.1 将“动作风格”从人工奖励转化为数据驱动运动先验
论文最重要的贡献不是简单增加一个判别器,而是重新定义了自然运动控制的奖励构造方式。用户只需给出参考运动数据,系统便可学习任务无关的风格奖励,从而减少姿态、步频、摆臂等细粒度奖励的手工设计。
10.2 直接利用无结构动作片段
AMP 不要求动作标签、任务标签、技能分段、片段顺序或相位同步。相较显式动作跟踪,它更适合由大量不同表演者和不同技能组成的数据集。
10.3 将状态转移而非控制动作作为模仿对象
动作捕捉数据没有关节力矩或控制指令。AMP 通过匹配状态转移,绕开专家动作不可观测的问题,同时保留对动态运动规律的描述能力。
10.4 任务奖励与风格奖励解耦
运动先验在概念上与具体任务分离,同一类 locomotion 数据可以用于目标朝向、目标位置、运球和越障等不同任务;不同风格数据也可作用于相同任务。
10.5 展示了无显式技能规划器的动作组合能力
在 Strike 和 Obstacles 等任务中,策略可以根据环境自动组合行走、击打、跳跃和翻滚。动作组合不是由手工状态机指定,而是由任务目标和运动先验共同诱导。
10.6 为足式机器人奖励设计提供了可迁移范式
后续机器人研究表明,AMP 风格奖励可以减少四足和人形机器人复杂奖励函数的依赖,并与域随机化、运动重定向和 PPO 结合形成可部署系统。其影响已从计算机图形学扩展到足式机器人控制。
11. 局限性、失败模式与工程风险
11.1 模式坍塌
判别器只要求策略分布看起来像参考数据,并不保证覆盖数据集中的全部模式。多样化动作数据中,策略可能只学会少数容易获得高奖励的步态。
改进方向包括:
- 平衡动作片段采样权重;
- 使用条件判别器或技能标签;
- 引入潜变量和互信息约束;
- 监控每类动作的覆盖率;
- 采用 Wasserstein 距离或其他稳定分布匹配目标。
11.2 数据集外任务能力受限
AMP 不是万能动作生成器。若参考数据没有倒退、快速转向、蹲起或恢复动作,策略在这些状态下可能缺少合理先验。任务命令范围超出参考动作覆盖范围时,任务奖励和风格奖励会发生冲突。
11.3 判别器可能学习无关捷径
若专家数据与策略数据在坐标系、采样频率、噪声或归一化上存在系统性差异,判别器可能依靠这些差异分类,而不是学习真正的运动风格。例如:
- 专家数据速度通过平滑差分获得,策略数据速度含高频噪声;
- 两者根节点高度定义不同;
- 专家数据固定帧率,策略数据间隔不一致;
- 参考数据没有传感器噪声,但策略观测含噪。
因此,专家与策略输入必须采用相同特征构造、坐标系、时间间隔和归一化方式。
11.4 风格奖励不等于物理安全约束
判别器学习的是数据分布,不保证严格满足:
- 关节位置和速度限制;
- 力矩、电流和热限制;
- 足底摩擦锥;
- 碰撞安全;
- ZMP 或支撑多边形约束。
这些约束仍需通过动作限幅、奖励、终止条件或底层控制器显式处理。
11.5 原论文主要在仿真角色上验证
AMP 原论文面向物理角色控制,并未直接完成真实双足机器人部署。将其用于实机时,需要补充重定向、状态估计、执行器模型、域随机化和安全控制。不能仅凭原论文的动画结果推断真实机器人迁移必然成功。
11.6 训练成本较高
原论文每个任务需要约 1 亿至 3 亿环境样本。现代 GPU 并行仿真显著缩短了训练时间,但判别器更新、运动历史存储和大规模环境仍会增加显存与调参成本。
12. 相关文献系统梳理
| 2016 | Generative Adversarial Imitation Learning | NeurIPS | 理论基础 | 以对抗学习匹配专家与策略占用分布 |
| 2018 | DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills | ACM-TOG / SIGGRAPH | 前置代表工作 | 通过相位同步的显式动作跟踪学习高动态技能 |
| 2021 | AMP: Adversarial Motion Priors for Stylized Physics-Based Character Control | ACM-TOG / SIGGRAPH | 核心论文 | 从无结构动作数据学习任务无关风格奖励 |
| 2022 | Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions | IROS | 机器人落地 | 在真实四足机器人上验证 AMP 可替代部分复杂奖励,并产生自然步态过渡 |
| 2022 | ASE: Large-Scale Reusable Adversarial Skill Embeddings for Physically Simulated Characters | ACM-TOG / SIGGRAPH | 技能空间扩展 | 在对抗运动先验上学习可复用潜变量技能嵌入 |
| 2023 | CALM: Conditional Adversarial Latent Models for Directable Virtual Characters | ACM-TOG / SIGGRAPH | 条件化扩展 | 通过条件潜变量实现可定向、多风格角色控制 |
| 2023 | Advanced Skills through Multiple Adversarial Motion Priors in Reinforcement Learning | ICRA | 多先验扩展 | 使用多个运动先验学习并组合高级技能 |
| 2024 | HumanMimic: Learning Natural Locomotion and Transitions for Humanoid Robot via Wasserstein Adversarial Imitation | ICRA | 人形稳定化扩展 | 使用 Wasserstein 对抗模仿、统一骨架重定向和软边界约束,学习多步态及自然过渡 |
| 2024 | Learning to Walk and Fly with Adversarial Motion Priors | IROS | 多模态运动 | 在 iRonCub 上联合学习行走与飞行,并涌现平滑模式切换 |
| 2024 | Whole-body Humanoid Robot Locomotion with Human Reference | IROS | 全尺寸人形应用 | 基于人体参考和 AMP 框架学习全身人形运动,并开展实体机器人验证 |
| 2026 | Unified Walking, Running, and Recovery for Humanoids via State-Dependent Adversarial Motion Priors | arXiv 预印本 | 状态依赖扩展 | 使用状态依赖判别器在单策略中统一走、跑与恢复 |
| 2026 | Multi-Gait Learning for Humanoid Robots Using Reinforcement Learning with Selective Adversarial Motion Prior | arXiv 预印本 | 选择性先验 | 根据步态选择不同 AMP 约束,降低多步态先验冲突 |
| 2026 | Learning Roller-Skating Motions of Humanoid Robots Based on Adversarial Motion Priors | arXiv 预印本 | 特殊接触运动 | 以独立 AMP 流程学习 Pump Glide 与 Push Glide 两种轮滑步态 |
| 2026 | SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control | ACM-TOG / SIGGRAPH | 非对抗替代方向 | 以冻结的运动扩散模型和得分蒸馏构造可复用运动先验,避免每个策略重新训练判别器 |
12.1 AMP 与 DeepMimic 对比
| 模仿目标 | 跟踪特定参考帧 | 匹配参考运动分布 |
| 是否需要相位 | 通常需要 | 不需要显式相位 |
| 是否需要目标姿态 | 需要 | 不需要逐帧目标姿态 |
| 数据组织 | 单动作或结构化动作片段 | 可使用较大规模无结构数据集 |
| 奖励设计 | 需要姿态、速度、末端等跟踪权重 | 风格奖励由判别器学习 |
| 动作时序 | 更严格地跟随参考时序 | 允许在分布内调整节奏和组合动作 |
| 主要风险 | 跟踪权重和相位依赖 | 对抗不稳定与模式坍塌 |
12.2 AMP 与 GAIL 对比
AMP 可视为面向物理运动数据的 GAIL 变体,但并非简单复制:
- GAIL 常使用状态—动作对,AMP 使用状态转移;
- AMP 将判别器定义为任务无关运动先验;
- AMP 采用 LSGAN、有界风格奖励和梯度惩罚;
- AMP 与目标条件任务奖励显式组合;
- AMP 针对高自由度物理角色设计状态特征、PD 动作和初始化机制。
12.3 AMP 与 ASE/CALM 对比
AMP 输出单一风格奖励,策略是否覆盖多种技能由任务条件和训练过程决定。ASE 和 CALM 进一步引入潜变量,使高层控制器能够主动选择或组合技能。其代价是增加技能编码器、条件判别器或潜变量目标,训练和部署接口更复杂。
对于仅需自然行走与速度跟踪的双足项目,PPO+AMP 通常已经足够;若需要同一策略可控地执行走、跑、蹲、跳、恢复和表演动作,潜变量技能方法更具扩展性。
12.4 AMP 与 SMP 的关系
2026 年发表的 SMP(Score-Matching Motion Priors)针对 AMP 的可复用性问题提出了新的路线。经典 AMP 判别器与当前策略共同训练,新任务或新控制器通常需要重新进行对抗训练,并在训练期间访问参考运动数据。SMP 则先在动作数据上训练运动扩散模型,随后冻结该模型,通过 score distillation 误差构造奖励。
因此,两者的核心区别是:AMP 使用随策略共同演化的对抗判别器,SMP 使用预训练并冻结的生成式运动模型。SMP 提升了先验的模块化与复用性,但其扩散模型训练、噪声层级选择和得分奖励归一化也引入了新的工程复杂度。对于已有成熟 PPO+AMP 管线的双足项目,AMP 仍是直接、成熟的基线;对于需要在多个任务间重复使用同一大规模运动先验的系统,SMP 代表了值得关注的后续方向。
13. 双足 AMP 实验设计建议
为了验证 AMP 的实际作用,实验不能只展示训练视频,应至少包含以下对照。
13.1 基线设置
| PPO | 仅任务奖励 | 评估没有动作先验时的性能与动作质量 |
| PPO + 人工步态奖励 | 增加足端、对称、姿态等手工奖励 | 与传统奖励工程比较 |
| PPO + AMP | 任务奖励 + AMP 风格奖励 | 验证动作先验收益 |
| PPO + AMP 无梯度惩罚 | 去除 GP | 验证对抗训练稳定性 |
| PPO + AMP 无速度特征 | 判别器仅看姿态 | 验证动态特征必要性 |
| PPO + AMP 不同历史长度 | H=1,2,3,4H=1,2,3,4H=1,2,3,4 | 分析时序窗口影响 |
| PPO + AMP 不同风格权重 | 多组 wSw_SwS | 分析任务—风格权衡 |
13.2 评价指标
任务性能:
Ev=1T∑t∥vt−vtcmd∥2
E_v=\\frac{1}{T}\\sum_t\\|\\mathbf v_t-\\mathbf v_t^{\\mathrm{cmd}}\\|_2
Ev=T1t∑∥vt−vtcmd∥2
Eω=1T∑t∣ωz,t−ωz,tcmd∣
E_\\omega=\\frac{1}{T}\\sum_t|\\omega_{z,t}-\\omega_{z,t}^{\\mathrm{cmd}}|
Eω=T1t∑∣ωz,t−ωz,tcmd∣
稳定性与鲁棒性:
- 成功率与跌倒率;
- 平均无故障运行时间;
- 推扰恢复阈值;
- 不同摩擦、负载、坡度下成功率;
- Sim2Sim 性能下降幅度;
- 实机连续运行时间。
动作质量与效率:
- 足端滑移距离;
- 步长、步频、支撑周期和双支撑比例;
- 左右对称性;
- 机械功率或 Cost of Transport;
- 关节力矩峰值和变化率;
- AMP 判别器得分;
- 与参考数据的运动特征分布距离。
只报告判别器奖励不足以证明动作自然,因为策略可能利用判别器漏洞。应结合运动学、动力学和人工视觉评价。
13.3 泛化实验
建议在以下条件下测试:
- 未见过的速度和转向组合;
- 不同摩擦系数;
- 额外负载和质心偏移;
- 随机外力;
- 观测噪声与丢帧;
- 10—40 ms 不同控制时延;
- 平地、坡面和轻度不平地形;
- 不同初始姿态;
- 不同仿真器和真实机器人。
每组实验应报告多个随机种子的均值和标准差,避免只展示最好策略。
14. 训练调试与常见问题
14.1 判别器准确率迅速接近 100%
可能原因:
- 专家和策略特征预处理不一致;
- 专家数据过少;
- 判别器学习率或更新次数过大;
- 策略早期状态与专家数据差异过大;
- 未使用参考状态初始化。
处理方法:统一归一化,降低判别器更新强度,增加梯度惩罚,扩充参考数据,并让训练初期从参考状态附近开始。
14.2 风格奖励很高,但机器人不跟随速度指令
说明任务奖励相对过弱,或者参考数据速度范围窄。应调整任务—风格比例,并检查参考数据是否覆盖目标指令。
14.3 速度跟踪很好,但动作仍不自然
可能是风格权重过低、判别器特征缺少速度或关键刚体信息,也可能是策略利用了参考数据预处理差异。应检查专家与策略判别器输入分布,并观察不同身体部位对判别器的贡献。
14.4 训练中反复出现某一种步态
这通常是模式坍塌或任务条件不足。可对动作片段进行均衡采样,引入步态条件、速度条件或潜变量,必要时使用多个判别器或 Wasserstein 形式。
14.5 仿真自然,实机前倾或迈不出步
优先检查:
- URDF/MJCF 质量、惯量和质心;
- 初始关节角和零位;
- PD 增益与动作缩放;
- 基座速度估计;
- 控制频率和时延;
- 电机力矩是否饱和;
- 摩擦系数与足底接触参数;
- 训练时是否包含足够的质量、质心和时延随机化。
AMP 只能约束运动分布,不能修复错误的动力学模型或关节映射。
15. 对双足机器人项目表述的准确理解
对于“采用 PPO+AMP 实现自然步态生成与速度跟踪”这句话,准确的技术含义是:
- PPO 根据任务奖励和风格奖励优化 Actor;
- AMP 判别器从参考动作中学习运动先验;
- 任务奖励主要负责速度跟踪和稳定性;
- AMP 主要负责步态形态与全身协调;
- Critic 估计状态价值,不负责判断动作是否像专家;
- AMP 判别器和 Critic 均只用于训练,部署时保留 Actor;
- Sim2Real 主要依赖域随机化、噪声、时延和合理执行器建模,而不是 AMP 单独完成。
可将整个系统概括为:
动作数据→AMP风格奖励+任务奖励→PPO优化Actor–Critic→Actor实机部署
\\boxed{
\\text{动作数据}
\\rightarrow
\\text{AMP风格奖励}
\\quad+
\\text{任务奖励}
\\rightarrow
\\text{PPO优化Actor–Critic}
\\rightarrow
\\text{Actor实机部署}
}
动作数据→AMP风格奖励+任务奖励→PPO优化Actor–Critic→Actor实机部署
16. 总结
AMP 解决的核心问题,是如何让高自由度物理角色或足式机器人在完成任务的同时,产生接近参考动作分布的自然运动。其本质不是用 GAN 直接生成机器人关节轨迹,而是将策略与物理环境视为隐式生成器,训练判别器区分专家和策略状态转移,再把判别结果转化为风格奖励,由 PPO 更新控制策略。
相较传统动作跟踪,AMP 不需要逐帧相位同步和目标姿态;相较纯 PPO,它减少了对复杂步态风格奖励的依赖。对于双足机器人,AMP 的实际效果取决于参考动作重定向质量、判别器特征、任务—风格权重和对抗训练稳定性。完成实机迁移还必须配合非对称 Actor–Critic、域随机化、观测噪声、执行器时延、动作限幅和安全保护。
从技术发展脉络看,AMP 已从 SIGGRAPH 物理角色控制方法扩展为足式机器人运动学习的重要范式,并进一步演化出多先验、Wasserstein 对抗学习、技能嵌入和条件潜变量等方向。对于当前双足速度跟踪项目,PPO+AMP 是一种兼顾任务性能、自然动作和工程可部署性的合理方案,但其价值应通过严格的消融、跨仿真器测试和实机指标验证,而不能只依赖视觉效果判断。
参考文献
[1] Peng, X. B., Ma, Z., Abbeel, P., Levine, S., Kanazawa, A. AMP: Adversarial Motion Priors for Stylized Physics-Based Character Control. ACM Transactions on Graphics, 40(4), 2021. https://arxiv.org/abs/2104.02180
[2] Ho, J., Ermon, S. Generative Adversarial Imitation Learning. Advances in Neural Information Processing Systems, 2016. https://arxiv.org/abs/1606.03476
[3] Goodfellow, I. et al. Generative Adversarial Nets. Advances in Neural Information Processing Systems, 2014. https://arxiv.org/abs/1406.2661
[4] Peng, X. B., Abbeel, P., Levine, S., van de Panne, M. DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills. ACM Transactions on Graphics, 37(4), 2018. https://arxiv.org/abs/1804.02717
[5] Schulman, J. et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017. https://arxiv.org/abs/1707.06347
[6] Escontrela, A. et al. Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions. IEEE/RSJ International Conference on Intelligent Robots and Systems, 2022. https://arxiv.org/abs/2203.15103
[7] Peng, X. B. et al. ASE: Large-Scale Reusable Adversarial Skill Embeddings for Physically Simulated Characters. ACM Transactions on Graphics, 41(4), 2022. https://arxiv.org/abs/2205.01906
[8] Tessler, C. et al. CALM: Conditional Adversarial Latent Models for Directable Virtual Characters. ACM Transactions on Graphics, 42(4), 2023. https://arxiv.org/abs/2305.02195
[9] Vollenweider, E. et al. Advanced Skills through Multiple Adversarial Motion Priors in Reinforcement Learning. IEEE International Conference on Robotics and Automation, 2023.
[10] Tang, A. et al. HumanMimic: Learning Natural Locomotion and Transitions for Humanoid Robot via Wasserstein Adversarial Imitation. IEEE International Conference on Robotics and Automation, 2024. https://arxiv.org/abs/2309.14225
[11] L’Erario, G. et al. Learning to Walk and Fly with Adversarial Motion Priors. IEEE/RSJ International Conference on Intelligent Robots and Systems, 2024. https://arxiv.org/abs/2309.12784
[12] Zhang, Q. et al. Whole-body Humanoid Robot Locomotion with Human Reference. IEEE/RSJ International Conference on Intelligent Robots and Systems, 2024. https://arxiv.org/abs/2402.18294
[13] Roboparty. roboparty_train: RPO Locomotion Training Workspace Based on Isaac Lab. https://github.com/Roboparty/roboparty_train
[14] Peng, X. B. et al. MimicKit: A Motion Imitation Learning Toolkit for Isaac Lab. https://github.com/xbpeng/MimicKit
[15] Open-X-Humanoid. TienKung-Lab. https://github.com/Open-X-Humanoid/TienKung-Lab
[16] Unified Walking, Running, and Recovery for Humanoids via State-Dependent Adversarial Motion Priors. arXiv preprint, 2026. https://arxiv.org/abs/2605.18611
[17] Multi-Gait Learning for Humanoid Robots Using Reinforcement Learning with Selective Adversarial Motion Prior. arXiv preprint, 2026. https://arxiv.org/abs/2604.19102
[18] Cheng, Y. et al. Learning Roller-Skating Motions of Humanoid Robots Based on Adversarial Motion Priors. arXiv preprint, 2026. https://arxiv.org/abs/2607.10815
[19] Mu, Y. et al. SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control. ACM Transactions on Graphics(Proceedings of SIGGRAPH 2026), 45(4), 2026. https://arxiv.org/abs/2512.03028





