
预测式特征不能直接喂扩散模型
一句话判断
预测式特征不能直接喂扩散模型
论文解决什么问题
多数世界-动作模型沿用视频生成的思路:靠预测未来画面学动力学。作者认为这跟操作任务的目标错位——要把动作做好,不需要复现纹理、阴影和背景,需要的是"世界在干预下如何变化"的抽象知识。
搬进压缩潜空间只解决一半。更麻烦的是:预测式特征高度结构化且非高斯,而扩散模型要求各向同性先验才能稳定 flow matching。直接把 JEPA token 当扩散状态注入,会分布失配、去噪轨迹漂出流形。
核心方法
↳ ① 中间加一层各向同性语义自编码器,把 JEPA 特征压到 96 维。除重建和 KL 外,关键是切片各向同性正则——作者明说高度结构化的语义空间里单靠 KL 防不住维度坍缩。
↳ ② 世界模型分支只看意图不看动作:条件化在语言指令和本体感受上,不给它逐步的低层电机指令,防止语义表征塌成控制捷径。
↳ ③ 非对称掩码让世界模型分支看不到动作 token,动作分支却能读语义 token。训练时前者当特权专家,部署时整支剪掉,只留一次性算好的语义缓存。
实验结果
· 那层正则的消融最说明问题:潜空间秩 38.1→92.3,梯度方差 1.25→0.18;成功率从基础编码器 42.5%、未正则化适配器 58.2%,到 71.3%
· RoboTwin 2.0 均值 91.46%、随机化 92.34%;LIBERO 97.3%;LIBERO-Plus 零样本 73.1%——且没用大规模机器人轨迹预训练
这篇论文不是什么
"零开销"只说推理。训练要 24 张 H200、两个 30 层 DiT 同时跑,还必须三阶段渐进训练防坍缩。作者在局限里写明性能被底层预测基础模型的表征质量锁死。真机只有单台 UR5 取放果蔬,正文没给成功率也没有基线对比。
对机器人 / 世界模型 / VLA 的启发
"辅助信号不能不受约束地接进主干,得给它一个结构受限的位置"——这个思路最近在很不一样的方向上反复出现:有的做成残差项,有的做成预测目标,有的给专用通路加稀疏路由,这篇则用注意力掩码控制谁能看谁。触觉、传感器标定、世界模型,问题域差很远,解法却收敛成同一个形状。
没裁决的是另外两处。一是要不要经过像素:另一篇实测"把数值渲染成图像比用 MLP 注入坐标更有效",理由是能吃预训练视觉先验;这篇主张彻底离开像素。两边都有数据,方向相反。
二是想象该在何时发生。这篇部署时把世界模型分支剪掉,导航方向的工作却是"先想再走"。不过那类工作自己也承认,增益主要出现在遮挡和动态密度高的场景。那么操作剪掉合理、导航保留合理——分歧可能不在架构对错,而在任务不确定性够不够高。
论文关键页

