全部论文
未来预测越准,机器人反而越迟滞

未来预测越准,机器人反而越迟滞

一句话判断

未来预测越准,机器人反而越迟滞

论文解决什么问题

擦大桌子要一边迈步一边前倾同时贴合接触,拖地要边移动底座边控制长杆工具,从冰箱或洗衣机低格取放要蹲、够、伸手协调。现有方法要么是手臂中心的VLA只管末端执行器,要么底盘和手臂分开处理——这类家庭任务需要的是并发的全身移动操作,不是先走到位再操作。

核心方法

未来预测不当视频生成目标,而是重建无关的紧凑预测信号:给当前观测和语言指令,预测紧凑的未来观测嵌入,不需要大型视频生成器也不需要测试时把视频逆推回动作。关键是让代表未来的query反过来去attend代表动作的query,把预测的未来视觉动态注入动作表征——促使动作分支去考虑自己动作引发的未来观测。

三阶段训练:先微调VLM学会用离散动作token表达全身动作语义;再冻结骨干联合训练视频-动作预测器,人类演示数据通过仿真回放转成机器人可执行的动作标签解决表示空间不兼容问题;最后真机微调加训练时的滚动窗口一致性约束。

实验结果

单一多任务策略(不是逐任务专用)在11个真机家庭任务上全面超过ACT、DP、GR00T-N1.7等基线,尤其在铰接物体交互、双手协调、长距离移动的任务上差距更明显。多视角版本比纯第一人称版本更好,第三人称观测只在训练时用,不影响部署。

这篇论文不是什么

每任务只有10次试验,单次成败就是10个百分点。推理刚过7Hz,明显低于同类做过延迟优化的世界模型。跨物体、跨场景、人类数据迁移三项泛化测试都只有定性描述,没给量化成功率。

对机器人 / 世界模型 / VLA 的启发

最反直觉的是一处消融:换个编码器处理当前帧,离线的未来预测准确度更高了,真机执行却变差——机器人变得过度静止犹豫。原因是那个编码器是为连续多帧视频设计的,单帧输入信息量不够。作者的结论是准确的未来预测本身不保证好的动作生成,这条和好几篇工作的发现同形:离线指标排不出真实部署质量的高低。

还有一处很直接的呼应。几天前那篇讲全身智能预训练范式的路线宣言主张过:原生人形不该理解成机械臂加移动底盘,也不该是VLM后接一个action head;人形任务里不存在清晰的先导航再操作的边界。这篇没有引用那篇宣言,却是一套真跑起来的系统,从架构设计到问题定位,几乎把那两条主张都实证了一遍——统一全身单模型联合生成移动和操作,正是路线宣言里说的"原生";擦桌拖地要求并发协调,正是"没有先导航再操作边界"的具体例子。一个是纯粹的路线判断,一个是拿数据和消融把判断落了地。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文