
OpenWAM:正确答案会随规模变
一句话判断
OpenWAM:正确答案会随规模变
论文解决什么问题
世界动作模型(WAM)的核心假设是"世界预测和动作生成能协同学习",但既有工作大多是单体式系统——生成骨干、视觉表示、架构、信息流、训练数据这些设计维度紧密耦合,很难拆开单独验证哪个选择真正起作用。有用的知识可能散落在上游视频模型的不同部位,名义上的联合预测也未必真打通了有效信息通路。
核心方法
把WAM设计拆成模块化组件,逐个做受控实验,再把结论沉淀成一份配方
↳ 骨干容量越大越好但边际收益递减,最终选5B做默认;潜在空间质量的关键不是重建式vs表征式编码器的类别之争,是表示本身够不够紧凑、信息够不够丰富
↳ 世界流必须能被动作流看到,反过来影响很小;同步去噪明显优于任何异步方案
↳ 反直觉发现:从零训练时单向可见和双向互通几乎打平,具身预训练之后同一套协议明确转向偏好双向互通,分布内外都一致——数据规模够了,两个流才能可靠建立起双向对应关系,"正确"的架构选择本身会随数据规模改变
实验结果
· 最终模型OpenWAM-α在8个仿真基准里6个位居顶尖(移动双臂基准直接拿SOTA),真机上在预训练数据完全没见过的本体上依然明显超过π0.5
· 作者自报:双臂真机基准RoboDojo-Real(18项任务,覆盖三种双臂本体)上登顶第一,单臂和灵巧手真机也稳定超过代表性WAM/VLA基线
· 唯一明显掉队的是LIBERO-Plus,损失集中在相机和噪声扰动——像素级未来预测天然对视觉扰动敏感,这次的预训练数据配方没能完全补上
· WAM和VLA没有谁全面碾压谁:分布内WAM靠视频潜在监督拟合更紧,分布外VLA泛化更好,两边短板都能靠更大更多样的数据弥补
这篇论文不是什么
· 不代表小规模受控实验的结论能直接套用到大规模场景——信息流该单向还是双向这个"正确答案"本身会随数据规模反转
· 不代表OpenWAM-α全面碾压——LIBERO-Plus上的具体短板是作者主动指出、如实报告的,不是回避不谈
· 不代表WAM和VLA哪个范式该被淘汰——两者是互补优势区间,不是选边站的问题
对机器人 / 世界模型 / VLA 的启发
"结构/架构优势需要数据规模门槛才会显现"这条线,之前在HyperWorld和PRISM身上都单独验证过;这次OpenWAM给出了更精确的版本——不是"优势消失",是"优势方向本身发生反转",同一个问题在小数据和大数据下的最优答案截然不同。另外,OpenWAM主动报告LIBERO-Plus的具体短板,这个坦诚的态度和已经解读过的SLIM如出一辙——SLIM也没回避自己在背景变化这一项上输给基线,两篇论文都把"哪里不如人"讲得和"哪里领先"一样清楚。
论文关键页

