
LAWM:为什么动作标签会成为负担
一句话判断
LAWM:为什么动作标签会成为负担
论文解决什么问题
机器人学习有个几乎没人质疑的默认假设:监督信号越准越好。要教模型做动作,当然应该拿真实动作标签去训练它。
核心方法
LAWM测出来的结果是反的。
实验结果
同样一批数据,一组用BridgeData的真实动作标签做监督预训练,另一组完全不给标签、只让模型预测视频的下一帧。后者赢了。而且赢它的那一组里,还有一个更极端的变体:只用人类视频——没有一条机器人能直接执行的动作——真实任务成功率从84%涨到94%。
问题出在哪?
作者的解释是:拿动作标签做预训练,等于强迫模型学一件很具体的事——**这个机器人、这段轨迹、这个任务设置下,看到这幅画面该输出什么数值**。模型会把大量容量花在拟合这套特定映射上。而预测下一帧逼模型学的是另一件事:**推一下会倒、松手会掉、这个角度够不着**。前者绑死在特定本体上,后者是物理世界本身的规律,换个机器人依然成立。
标签越准,绑得越死。
这解释了另外两个数字为什么会出现。第一个:7M参数的小模型配上这套预训练,打平了7B参数的同类方法——如果学到的是通用动力学而非特定映射,确实不需要那么大容量去死记。第二个:20个演示配预训练(77%),超过50个演示从零训练(70.5%)——专家数据的作用被重新定位了,它不再负责"教会模型动作是什么",只负责把已经理解物理的模型对齐到具体动作空间,这件事不需要那么多样本。
这篇论文不是什么
作者自己列了三条没解决的:像素重建这个训练目标会奖励"画面像"而不是"任务相关动态",模型可能学到背景捷径;只用了单视角,没有本体感知和夹爪状态;最关键的是,当前只用了数据集的10%,成功率已经出现平台期——继续加数据能不能突破,论文明说了不知道。真实验证也只有单臂5个任务。
对机器人 / 世界模型 / VLA 的启发
💡这条线索在库里已经反复出现
同一个判断,不同团队用完全不同的方式撞上了:T-Rex走的是三阶段配方(2.29万小时人类视频打底,100小时触觉数据grounding);星海图Fast-WAM发现世界模型的能力主要来自训练时学到的表征,推理时的画面预测可以直接砍掉;库里还有工作测出"人类视频+1次机器人演示"就能超过纯机器人数据基线。
值得注意的是这些工作彼此并不知道对方在做什么,路线也不同,但都指向同一件事:**机器人真正缺的可能不是动作标签,是把规模大得多的"非动作数据"转化成可执行能力的方法。**
不过也别急着把它当定论。同样在库里,LAWM"小模型统一学"的结果支持自变量WUM那个"统一网络优于模块拼接"的赌注,而T-Rex的结论恰恰相反——它坚持触觉必须走独立通路,反对机械融合。同一个"要不要一个模型全包"的问题,两篇论文站在了不同侧。分歧的实质可能不是谁对,而是:哪些东西该统一(世界的物理规律),哪些东西不该(时间尺度差几个数量级的感知信号)。
论文关键页

