全部论文
预测误差更低,表征却已经塌了

预测误差更低,表征却已经塌了

一句话判断

世界模型会预测未来,不等于会控制——给动作能预测后果,给后果能反推动作,只用 0.47B

论文解决什么问题

VLA 把动作和它引起的观测变化之间的关系,只靠动作监督隐式学到,没写进表征。世界模型方向对,但像素级预测要建模背景纹理、光照这些跟下一个动作无关的细节,反而降低泛化;推理时再生成未来,还给控制回路加延迟。

核心方法

↳ ① 换掉建模单位。过去世界模型建的是"当前状态怎么变成未来状态",SLIM 改成"状态—动作—状态"三元组:动作不再是预测未来时顺带的条件,而是判断表征够不够格用于控制的核心变量。它不是第一个把动作喂进世界模型的,但把"动作可识别性"写成了表征的显式判据。
↳ ② 目标因此必须双向。掩掉动作,就得从前后观测反推出它;掩掉未来潜变量,就得从当前观测加动作预测出它。前向和逆向不是两个拼起来的 loss,是同一个控制关系的两个方向。
↳ ③ 未来预测只当训练信号,不当输出。Stage 2 把未来潜变量从输入和监督里整个撤掉,只留被塑形过的预测 slot 供动作流读,推理时不生成未来。

实验结果

· 0.47B:LIBERO 97.5%,零样本 LIBERO-Plus 77.45%,CALVIN ABC→D 4.556。
· 单次推理 60.6ms / 每动作块 490 GFLOPs,π0.5 是 193.1ms / 4715。注意两者用各自原生配置(SLIM 8 步块 4 次采样,π0.5 是 10 和 10),不是严格同配置对比。
· 真机五任务,标称、干扰物、光照三档平均 progress 均最高。

这篇论文不是什么

Stage 1 混入了 LIBERO-90,Stage 2 才只用四个目标套件——所以 Stage 1 的收益不能全记在双向掩码头上,论文没做数据量匹配消融。另外背景变化那档它是输的:49 对 π0.5 的 54,而它恰恰批评过像素预测浪费容量在背景纹理上。真机每格只跑 10 次,报的是部分分不是成功率。

对机器人 / 世界模型 / VLA 的启发

最反直觉的是 EMA 消融。去掉 EMA 目标后,未来潜变量的预测 MSE 从 0.245 降到 0.166——更低了。但有效秩从 61.28 塌到 13.95,LIBERO-Plus 掉 10.6 个点。只看损失,会得出"去掉 EMA 更好"的结论。

这已经是第三篇出现"离线预测指标与真机控制效果分离"的工作。LeapBot-WA 的 SIGReg 消融同样是维度坍缩:秩 38.1→92.3,成功率 42.5%→71.3%。而 omega-0 是另一种失败——换 Wan 编码器后离线未来重建更准,真机执行反而迟滞犹豫,那里并没有坍缩。

所以共同结论不是"潜变量预测都会塌",而是:单一预测损失不足以判断表征是否服务于控制。有效秩、能量集中度只能查出几何退化,动作可识别性、闭环成功率这类控制探针还得单独加。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文