全部论文
世界模型:推理时到底要不要想象

世界模型:推理时到底要不要想象

一句话判断

SLIM、JEPA-WAM都说别在推理时干活——这篇消融显示:去掉那一步,精化器反而比不精化还差

论文解决什么问题

机器人只知道"该做什么"不够。策略是观测到动作的直接映射,动作会引出什么后果只隐式编码在参数里,执行前没法检查。世界模型理论上能补,但常见用法要么当训练时的辅助信号(推理时撤掉),要么做完整视频生成或多步rollout(对闭环控制太贵)。

核心方法

让策略先出一个动作提案,回灌给冻结的世界模型得到想象后果,用当前状态、想象后果、原始提案三者训一个精化器改写动作。只做一次潜空间前向,不解码画面,不做多步rollout。
三阶段:Stage1学动作条件的世界模型,顺带产出一个跟动作解耦的当前表征——专家、零、随机、打乱四种动作喂进去,输出数值完全相同(差值0.000,余弦相似度1.000)。Stage2在这个表征上出初始提案。Stage3冻结前两阶段,只用策略自己的提案训精化器,训练和推理用同一条数据流。

实验结果

0.8B、零机器人预训练,LIBERO 97.9%,加精化到98.6%,超过多个更大且有预训练的模型。
拆解消融最说明问题:去掉想象未来分支,掉到97.2%——比不精化基线97.9%还低。去掉提案分支(能看到未来但不知道是哪个动作导致的),掉到96.0%。两个分支都不是装饰。
1步去噪和5步相当(98.8对98.4),耗时从45ms砍到25ms。

这篇论文不是什么

增益真实但温和不均匀:LIBERO-Plus零样本下Language、Light两项反而略降。精化后潜变量保真度只涨了SSIM 0.0042、降FID 0.01,作者自己说不足以证明因果,具体机制留给后续研究。当前只在动作块边界精化一次,块内没有闭环,作者列为未来方向。

对机器人 / 世界模型 / VLA 的启发

这篇的核心主张跟SLIM、JEPA-WAM、TacWAM那整条阵营正面对立——那边说世界模型只该在训练时干活,部署时该撤干净;这篇说推理时仍要留一步,只是压到最便宜。它自己的消融给了硬证据:拆掉想象分支,精化器比不精化还差,不是持平。

但它另一半设计又站到了对手那边:当前表征和候选动作解耦这件事,它做了全库最干净的验证——这种"把辅助信号结构性隔离"的手法,跟TacWAM、JEPA-WAM共享主干那条思路是同类设计,只是隔离对象不同:那边隔离整个未来分支,这篇只隔离当前状态,留一条极轻的想象通道。争论不是要不要世界模型,是隔离到哪一层。

另有一条重复的模式:精化后保真度指标只涨一点点,作者不敢下因果结论——这是SLIM、omega-0之后,第三次看到"预测指标变好"和"控制真的变好"不能画等号。

半年后回看的锚点:块内闭环精化如果做出来,能不能把现在0.7到2.2个点的温和增益放大到量级级;做不出来,说明单次极轻量想象步的天花板就在这附近。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文