
JEPA-WAM:世界模型在特征空间预测状态转移
一句话判断
不靠堆数据 世界模型创新方法 竟让π0.5真机成功率最高提升12.8个百分点
论文解决什么问题
世界模型,其实更需要物理状态
机器人要做对动作,需要理解:动作会改变什么,变化发生在哪里。生成未来画面计算成本高;潜空间预测虽然更轻,却可能丢失空间细节。如果世界预测与动作策略彼此分离,学到的变化规律也未必真正进入动作
核心方法
不在策略旁边挂预测模块,而是让 Qwen2.5-0.5B 一个预测器同时干两件事:一次前向,视觉 token 位置的输出去预测转移,动作条件从专用 token 读出。两路走同一套权重,转移监督更新的就是生成动作的那套参数
预测的目标则是:冻结的 V-JEPA 2.1 把当前帧和 δ 步后的帧一起编码成一个联合目标,预测器去逼近它,损失是逐 patch 余弦距离,全程不生成画面
四个设计选择,各有消融兜底:
1️⃣ 目标用当前与未来的联合表示,不是孤立的未来——只预测未来低1.9%
2️⃣ 保留密集patch之间的空间对应——混合相邻patch低4.5%
3️⃣ 监督打在共享主干的最终输出——只打中间层低2.7%
4️⃣ 动作只读专用action token,隔离世界预测对控制的干扰——读全部预测隐状态低6.1%
部署时直接删掉预测头,不增加推理负担
实验结果
📚 仅换用V-JEPA 2.1,LIBERO-Plus便从73.2%升至77.0%;加入完整转移学习机制后达到79.2%
🧲 与LeapBot-WA的对比更说明问题:两者都用V-JEPA 2.1,但后者靠独立Anchor DiT学动态知识再蒸馏给Action DiT,JEPA-WAM让转移预测直接监督共享动作主干。同一零样本榜单79.2%对73.1%,高出6.1个百分点——收益不能只归因于视觉编码器,世界知识进入策略的方式同样关键!
接入π0.5后LIBERO-Plus从84.5%升至86.3%,证明能迁移到成熟VLA。五项真机双臂任务:ID从77.5%升至90.3%(+12.8个百分点),OOD从72.5%升至84.7%(+12.2个百分点)——转移知识最终兑现成了真实成功率
这篇论文不是什么
对机器人 / 世界模型 / VLA 的启发
更现实的意义在于:资金雄厚的企业可以靠数据和算力推进scaling,但资源有限的团队仍能从训练目标、监督信号和信息结构切入。正如DeepSeek-R1在算力受限时依靠训练方法创新提升效果
🧲 JEPA-WAM也证明:不与巨头硬拼规模,仍可通过方法创新提高成熟底座的能力转化效率
论文关键页

