欢迎光临
我们一直在努力

185、数据飞轮与自监督学习:真实数据回流与模型自我提升

185、数据飞轮与自监督学习:真实数据回流与模型自我提升

调试间里那台UR5e又罢工了。不是硬件故障,是模型在抓取一个磨砂半透明的亚克力杯时,连续五次把夹爪怼到了杯壁内侧。我盯着终端里滚动的loss曲线,数值在0.31附近震荡,像极了上周在仿真环境里过拟合到0.05之后又掉回0.2的那种无力感。问题的根源不在网络结构,不在超参数,在于我们喂给VLA模型的数据——那些从真实产线采集的轨迹,和模型自己生成的伪标签,正在形成一个互相污染的闭环。今天想聊的,就是怎么把这个闭环从“死循环”改造成“飞轮”。

先说说数据飞轮最反直觉的地方。很多人以为自监督就是让模型自己给自己打标签,然后拿这些标签去训练,循环往复。但真实场景里,模型生成的伪标签质量参差不齐,尤其是动作分支——一个抓取姿态差个两厘米,视觉特征可能完全对不上。我们第一次尝试用模型在真实场景里采集的失败轨迹做自监督,结果模型越训越“自信”,抓取失败时夹爪闭合的力度反而更大了。后来才意识到,伪标签的置信度筛选不能只看softmax概率,要看动作执行后的物理反馈。

这里踩过坑:别用模型自己的预测概率当置信度。VLA模型输出的动作分布是高度峰值的,哪怕执行失败,概率也可能高达0.9。我们后来改成用“执行后状态变化”做筛选——比如抓取任务,看夹爪闭合后物体是否被抬起,或者力传感器读数是否超过阈值。这个信号来自真实物理世界,比任何网络输出的置信度都可靠。代码实现上,我们写了一个简单的回调函数,在每次episode结束后检查物理反馈,只有满足条件的轨迹才进入回放缓冲区:

def

赞(0)
未经允许不得转载:171主机测评 » 185、数据飞轮与自监督学习:真实数据回流与模型自我提升
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址