070、VLA在家庭服务机器人中的应用:从整理到烹饪的复杂任务
上周在实验室调试我们那台双机械臂家庭平台时,遇到了一个让人挠头的问题——机器人执行“把菜板上的番茄拿到灶台边”这个指令,动作分解完全正确,抓取姿态也计算得没问题,但就在机械臂接近番茄的瞬间,它突然改变轨迹,绕了一个大弧线才去抓取。后来查了半天,发现是视觉语言模型把“番茄”和背景里红色围裙上的图案搞混了,注意力权重分配出了问题。这种问题在家庭场景里太典型了——环境非结构化,目标物体周围全是干扰项,而且任务链越长,错误越容易被放大。
今天这篇笔记,咱们就聊聊VLA(Vision-Language-Action)模型在家庭服务机器人上做复杂任务时,那些论文里不会写、但调试时一定会撞上的东西。从整理房间到烹饪做饭,任务复杂度上了一个台阶,模型架构和训练策略都得跟着变。
家庭任务到底难在哪
先别急着上模型,得把问题定义清楚。家庭服务任务和桌面抓取最大的区别在于——任务层级深、状态空间大、动作序列长。拿“整理餐桌”来说,机器人得先识别哪些是餐具、哪些是垃圾,然后决定先收哪个后收哪个,最后还要规划怎么把碗碟放进洗碗机。这中间任何一个环节出错,后面全白搭。
我们实验室最初直接拿RT-2那套思路来跑,输入一张当前视角的图像加一句自然语言指令,输出一串动作token。结果在模拟环境里看着还行,一上真机就露馅——动作序列一长,误差累积得飞快,机械臂抖得跟帕金森似的。后来才意识到,家庭任务需要的是分层决策,不是端到端一把梭。
架构设计:别把鸡蛋放在一个篮子里
我们最终采用



