
异构数据的问题不是量,是监督格式不统一
一句话判断
异构数据的问题不是量,是监督格式不统一
论文解决什么问题
人类第一人称视频规模大也多样,但大多缺可靠的物理动作标签;机器人和仿真轨迹有标签,但不同本体的动作表示互不兼容。这不是单纯的数据不够,是监督格式错配——人类视频、仿真、真机三种数据根本没法直接混着训。
核心方法
按数据本身实际拥有的监督类型路由,而不是强行统一格式。无标签视频走隐式对齐:训一个跨人类/仿真/机器人共享的潜在动作模型,用视觉转移自己推出转移级的动力学监督。有可靠标签的轨迹走显式对齐:统一映射进130维跨本体动作空间,末端执行器动作表示成相机坐标系下的分块相对位姿。
架构上VLM管语义、冻结的世界模型管动力学,晚期融合喂给flow-matching动作专家。三阶段训练:先预训练世界模型,冻结后联合训练VLM和动作专家,最后在目标机器人上后训练。部署后还有内外双环强化学习,边缘端快速适配当前任务,中心端持续改进基座再同步回来。
实验结果
真机已见任务均分92.0,对照的VLA基线74.0,差距随任务难度增大而扩大。消融很干脆:两种对齐都去掉,未见任务分数崩到29.8;只去隐式对齐,未见分单独掉到46.8,已见分相对保住。人类视频规模化到全量语料,已见未见分数都在涨,且早期阶段未见任务的涨幅明显更大。
这篇论文不是什么
真机评测每任务只有20次已见、10次未见试验。对比只做了一个VLA基线,没有更广的方法谱系对照。内外环强化学习被称作自我改进系统,但作者自己承认外环同步频率被刻意压低,高频同步会训练不稳定,这个还没解决。
对机器人 / 世界模型 / VLA 的启发
这篇最站得住的地方是问题重新定性本身——把"数据不够"改成"监督格式不统一",这条判断和好几篇工作的路线呼应上了,尤其是那条"海量非动作数据预训练+少量动作数据对齐"的哲学,这篇算是给出了一个具体的工程实现。
但有个地方值得多想一步。这篇的消融显示只去掉无标签视频的隐式对齐,未见泛化掉得最多——暗示有标签数据对精度更关键。可另一篇工作的反直觉发现是,完全无动作标签的世界模型预训练,效果能持平甚至超过有标签监督预训练。两边都是实测,方向却相反。可能的差别在于两篇对"世界模型预训练"的用法不一样——一个是拿它补未见泛化的短板,一个是拿它整个替代有标签预训练,问的其实不是同一个问题。
论文关键页

