写在前面
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
魔方AI空间 猫先生 从零走向AGI 面试面经
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
导读
World Action Model(WAM)希望机器人在出动作前,不只看见当下,还能利用“物体接下来可能怎样变化”的内部表征。困难在于:若每一步动作去噪都与未来视频分支联合更新,鲁棒性可能更好,但推理成本很高;若部署时彻底删掉未来分支,速度上来了,面对光照、相机、背景等分布变化时又容易失去时间线索。
Faster-WAM 的立场很明确:未来表征不应只作为训练损失,它在推理期仍是鲁棒控制的条件信息。 它不再逐步生成完整未来视频,而是在高噪声未来 latent 上让视频专家只跑一次,缓存各层的 K/V 表征;动作专家在 10 步 flow matching 积分中复用这份缓存,并只在少数层读取它。
两项实现支撑这个折中:SparseMoT 把跨分支注意力限制在间隔层;Interval KV-Fusion 将一个间隔内多层视频 K/V 融合成同长度的一对 K/V,不拉长注意力序列。论文在 LIBERO-Plus 上报告 73.57% OOD 成功率,相比 Fast-WAM 的 49.14% 高出 24.43 个百分点;在 NVIDIA L20 的受控延迟测量里为 252.95 ms,是 Joint-WAM 的 2.21 倍加速。论文原文
猫先生认为,Faster-WAM 的价值不在于“再生成一段视频”,而在于把视频模型中已经包含的未来感知 K/V 当作可复用的控制记忆:保留它,但严格控制它被读取的频率。
- 论文标题:Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models
- 论文地址:https://arxiv.org/abs/2608.04404
原文脉络
文章依次完成四件事:先用同一实现下的 Joint-WAM 与 Fast-WAM 对比说明,推理期删除未来条件会显著伤害 OOD;随后回顾 VLA 与 WAM 的两条路线;方法部分提出一次性未来条件、SparseMoT、Interval KV-Fusion 与联合 flow matching;实验则覆盖 LIBERO、RoboTwin 2.0、LIBERO-Plus、真实双臂任务、延迟分解和消融。
1-2. 背景与相关工作:未来视觉到底该不该留到部署时
常规 VLA 主要把当前图像、语言和本体状态映射为动作。WAM 额外建模交互后的视觉演化,因此动作分支可以借助时间结构。现有路线在部署时形成了两端:Joint-WAM 在每一次去噪里联合更新未来视频与动作,信息最充分,却反复支付视频计算与跨分支注意力;Fast-WAM 则将未来建模留在训练期,部署时不再放入未来 temporal slots,延迟更低。
论文的 Figure 1 不是装饰性的总览,而是整篇文章的出发证据。在标准分布内,三种模型差距很小;到分布外,去掉未来条件的 Fast-WAM 明显下滑。Faster-WAM 由此选择第三条路:未来表征仍在场,但不再以“每步都重新联合去噪”的形式在场。
图 1:标准分布内、分布外成功率和推理延迟的并列对比。Fast-WAM 用删除未来条件换取效率,却在 OOD 上损失明显;来源:论文 Figure 1。
这份对比支持的是一个受控结论:在作者统一的视频骨干、数据、tokenization 和动作采样设定中,未来条件的保留与 OOD 鲁棒性相关。它并不证明任何未来生成都必然有用,更不等于已建立所有 WAM 的普适因果结论。
3. 方法:一次视频前向,供多步动作去噪反复读取
3.1 整体框架:把联合生成改成可缓存的条件接口
在控制时刻
t
t
t,策略输入图像
o
t
o_t
ot、语言
l
l
l、本体状态
s
t
s_t
st,输出长度为
H
H
H 的动作块
A
t
A_t
At。视频专家来自 Wan2.2-5B 的 Video DiT,动作专家是 30 层、隐藏维度 1024 的 Transformer;语言和本体状态同时作为两边条件。视觉序列有 9 帧,动作块有 32 个动作。
关键约束是非对称信息流:未来视频 slot 可以读取当前帧锚点和其他未来 slot;当前帧锚点不能读取未来 slot。动作 query 可读取视频特征,视频 query 不读取动作 token。于是视频侧的层级 K/V 与不断变化的动作轨迹无关,可以在动作积分前构造一次。
图 2:左侧为视频专家、Interval KV-Fusion 与动作专家组成的 Faster-WAM;右侧对比 Joint-WAM 的
N
N
N 次密集联合更新,以及 Faster-WAM 的一次 K/V 缓存加
N
N
N 次稀疏条件动作更新;来源:论文 Figure 2。
在部署时,作者把未来视频 slot 初始化为高斯噪声,在视频 flow 时间
τ
v
=
1
\\tau_v=1
τv=1 仅执行一次视频专家,收集每层注意力 K/V;之后不再更新、更不解码这些未来视频 latent。它们被压成动作可读的未来条件接口
C
^
t
,
1
v
\\hat C^v_{t,1}
C^t,1v。
猫先生认为,这套设计有一个很实用的判断:控制不一定需要像素级未来视频,可能只需要生成器在“推断未来”时形成的中间状态。 这也解释了为什么缓存对象选 K/V,而不是将预测帧再编码回动作网络。
3.2 SparseMoT:让所有动作层工作,但只让少数层跨分支通信
普通 Mixture-of-Transformers(MoT)会在
L
L
L 个对齐的视频—动作层全部做跨分支注意力。Faster-WAM 选择一个交互集合:
J
=
{
j
1
,
…
,
j
M
}
⊆
{
1
,
…
,
L
}
。
\\mathcal{J}=\\{j_1,\\ldots,j_M\\}\\subseteq\\{1,\\ldots,L\\}。
J={j1,…,jM}⊆{1,…,L}。
只有
j
m
∈
J
j_m\\in\\mathcal{J}
jm∈J 的动作层读取融合后的未来 K/V;其余层保留动作 self-attention、残差和前馈更新,用动作状态传递先前注入的未来信息。论文采用 30 层动作网络、每 4 层交互一次,即
M
=
8
M=8
M=8,而非让 30 层都做跨分支读取。
这一点很容易被误读成“跳过了动作层”。实际被稀疏化的是昂贵的video-action interaction,不是动作专家的深度计算。所有动作层仍参与去噪,只是中间层做较轻的 action-only refinement。
3.3 Interval KV-Fusion:不增加注意力长度地保留多深度未来信息
如果稀疏交互层只读取自己同深度的视频 K/V,中间视频层的信息会丢失;若直接串接一个间隔的所有 K/V,又会把 action attention 的上下文加长。Interval KV-Fusion 对每个交互层分配前一个深度区间
I
m
I_m
Im,以 softmax 归一化权重将该区间 K/V 加权为一对同形状 K/V:
(
K
ˉ
j
m
v
,
V
ˉ
j
m
v
)
=
∑
j
∈
I
m
W
m
,
j
fuse
(
K
j
v
,
V
j
v
)
。
(\\bar K^v_{j_m},\\bar V^v_{j_m})= \\sum_{j\\in I_m}W^{\\text{fuse}}_{m,j}(K^v_j,V^v_j)。
(Kˉjmv,Vˉjmv)=j∈Im∑Wm,jfuse(Kjv,Vjv)。
融合后,动作层读取的 token 长度仍等于一个视频层的长度,却获得了多个深度阶段的摘要。SparseMoT 决定“何时读”,KV-Fusion 决定“每次读到哪个深度区间的内容”,两者针对的是不同的效率损失。
3.4 联合训练与推理:两个 flow 时间独立采样
视频 latent 和动作都采用 flow matching。训练时分别采样视频和动作时间
τ
v
,
τ
a
\\tau_v,\\tau_a
τv,τa:
Z
t
,
τ
v
=
(
1
−
τ
v
)
Z
t
+
τ
v
ϵ
t
v
,
A
t
,
τ
a
=
(
1
−
τ
a
)
A
t
+
τ
a
ϵ
t
a
。
Z_{t,\\tau_v}=(1-\\tau_v)Z_t+\\tau_v\\epsilon_t^v, \\qquad A_{t,\\tau_a}=(1-\\tau_a)A_t+\\tau_a\\epsilon_t^a。
Zt,τv=(1−τv)Zt+τvϵtv,At,τa=(1−τa)At+τaϵta。
总损失是视频与动作两个、带时间权重的 MSE flow loss 之和。两个时间独立采样,使动作网络在各种“视频噪声程度 × 动作噪声程度”的组合下学习使用未来条件。测试阶段用 10 次积分和 guidance scale 1.0;缓存只构造一次,随后供每个动作 flow step 重用。
4. 实验:把“更快”拆成鲁棒性与延迟两项证据
4.1 标准基准:LIBERO 与 RoboTwin 2.0
LIBERO 四个任务族上,Faster-WAM 平均成功率为 99.0%,高于受控的 Joint-WAM(98.5%)和 Fast-WAM(97.6%)。RoboTwin 2.0 的 clean / randomized 平均为 92.6%,也略高于 Fast-WAM 的 91.9%。这些分数接近饱和,因而更重要的问题转到分布变化时是否仍能保持优势。
LIBERO-Plus 直接对在 LIBERO 训练的策略施加 7 类未见变化:相机、机器人初始状态、语言、光照、背景、传感器噪声和布局。Faster-WAM 的均值为 73.57%;Joint-WAM 为 66.27%,Fast-WAM 为 49.14%。作者还训练了结构相同、但不含显式 future temporal slots 的 C-O Faster-WAM,均值仅 51.00%。这组消融比“Faster-WAM 比 Fast-WAM 高”更有针对性:它将未来条件的贡献从架构差异中部分剥离出来。
4.2 真实双臂任务:常规成功率与 OOD 变化
真实平台使用两台 Piper 6-DoF 机械臂,覆盖 Pick Strawberries、Build Tower、Store Boxes、Stack Plates,每个任务 400 条示范。常规条件下 Faster-WAM 四项平均成功率为 95.8%,高于 Joint-WAM 的 90.8% 和 Fast-WAM 的 88.3%。
图 3:四个真实双臂操作任务的成功率;绿色 Faster-WAM 在四项任务均最高;来源:论文 Figure 3。
Pick Strawberries 的 OOD 设置进一步更换背景、改变光照、加入未见干扰物。Fast-WAM 从标准条件的 96.7% 降到三种未见条件平均 45.6%;Joint-WAM 为 55.6%;Faster-WAM 达到 71.1%。这与 LIBERO-Plus 的方向一致,但样本规模、置信区间与显著性检验没有在论文中展开,不能仅凭柱图将差距外推到所有真实操作场景。
图 4:同一抓草莓任务在标准、背景变化、光照变化和未见干扰物下的成功率;来源:论文 Figure 4。
4.3 延迟与组件消融:稀疏不是越少越好
作者在 NVIDIA L20、224×448 输入、10 步去噪下报告:Joint-WAM 总延迟 559.84 ms,Fast-WAM 320.97 ms,Faster-WAM 252.95 ms。Faster-WAM 的一次视觉上下文构建确实更慢(43.04 ms 对 27.67 ms),但动作去噪部分从 276.56 ms 降到 192.11 ms,抵消了前者。
消融也排除了一个直觉误区:不是交互越稀疏越好。密集交互(stride 1)在 LIBERO-Plus 为 69.78%,stride 2 为 71.65%,stride 4 为 73.57%,再稀疏到 stride 7 / 14 又分别降至 71.05% / 70.05%。因此论文更准确的结论是:未来上下文需要被多次注入,但频率存在任务与架构相关的甜点区。
5. 讨论、局限与可复现性
Faster-WAM 依赖一个很大的视频生成先验(Wan2.2-5B)以及 30 层动作专家。论文报告了端到端延迟,却没有给出显存、吞吐、能耗、不同 GPU 或不同动作积分步数下的完整成本曲线;“更快”应理解为给定 L20 与 10 步设定下对两种受控基线的结果。
此外,作者在真实机器人上展示了四个任务和若干变化条件,证据很有价值,但覆盖面仍有限。SparseMoT 的交互层位置由固定 stride 决定,论文也把“学习式选择交互层”列为后续方向。公开的 arXiv v1 页面仅标注 hustvl/FasterWAM 为 Code & Models,未给出可核验的公开仓库链接;复现实验前仍需等待代码、模型权重及完整训练配置。
总结:未来条件该保留,但不必逐帧生成
Faster-WAM 把 WAM 的工程矛盾转成了接口设计:
- 未来表征留在推理期,以应对分布变化时当前观测难以解释的时序不确定性;
- 一次视频前向形成可复用 K/V 缓存,避免每个动作去噪步都重跑视频分支;
- SparseMoT 与 Interval KV-Fusion 分别控制读取频率和读取内容,在 OOD 成功率与延迟之间找到中等稀疏度的折中。
如果只记住一句话:世界模型对控制的作用未必是输出一段可观看的未来视频;更可能是向动作模型提供一份在推理期仍可访问、且能被高效复用的未来上下文。
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列






