全部论文
世界模型不听话,是潜在动作被污染了

世界模型不听话,是潜在动作被污染了

一句话判断

世界模型不听话,是潜在动作被污染了

论文解决什么问题

机器人动作标注太贵,于是大家用潜在动作模型(LAM)从无标注视频里推断动作,再喂给世界模型。但 LAM 只用下一帧重建训练——只要求潜变量有助于预测下一帧,不要求它真的对应本体动作。于是背景延续、外观连续性、场景上下文都能挤进来。这些在观测历史里是合法证据,可一旦编码进动作变量,条件指定的就成了"视频怎么续"而不是"本体怎么动"。

核心方法

↳ ① 三个去偏目标:SAM3 前景掩码做本体中心加权重建;caption 动词聚成 12 类粗基元做成对对比,让同基元转移跨场景仍靠近;free-bits KL 加零转移校准,把重复帧输入的潜变量模长压到普通转移的一个小比例以下。
↳ ② 三阶段:1k 步去偏 LAM,2k 步让世界模型适配新潜空间,最后用轻量 MLP 桥接入可执行动作。世界模型的架构、潜变量维度、条件化格式全程不改。

实验结果

· 编码器审计:零转移响应中位数 0.527→0.043,捷径泄露 0.151→0.014,而跨片段同基元对相似度基本不动——是定向去偏,不是一律缩小
· 动作跟随误差:潜动作阶段 2B 降 42%、14B 降 26%;接入机器人动作后再降 35%、30%
· 零动作干预下的残余运动,14B 从 9.36 掉到 2.18
· 适配更新少 12 倍以上;1 小时去偏数据就拿到 1000 小时档约八成的收益

这篇论文不是什么

去偏阶段额外用了 SAM3 掩码和基元标签,基线没有,所以"只换潜在动作空间"在监督信号层面并不成立,也没做给基线同样监督的对照。核心指标是作者自定义的,多处评测设置各自独立、明说不可跨表比较。全部结论来自离线视频指标,没接进规划或策略评估的闭环。训练用了 96 张 H100。

对机器人 / 世界模型 / VLA 的启发

库里三条并排看,是同一件事的三层。最外层是已有判断:世界模型有没有用是个错问题,条件信号与输出结构才决定它帮忙还是添乱。中间层是另一篇的实测:无结构潜变量喂给 VLA 会掉点,换成有结构的中间表征反而稳定提升。这篇补上最里层——为什么掉点,以及怎么修。

更值得留意的是那条反常识:基线从 2B 到 14B,像素指标改善而动作跟随恶化。堆参数放大的是视觉能力,不是可控性。这跟"更严格的分割击败更宽松的分割"同理——对齐质量决定数据能不能变成能力。

还有个跨域彩蛋:相机条件化那篇发现背景会泄露相机位姿,看起来视角不变其实是捷径。同一个机制在两个不相干的地方各坑一次——凡是让网络从像素里自己猜某个量的,都值得查查它是不是在抄背景。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文