全部论文
1 天 1000 任务,靠的是归纳偏置

1 天 1000 任务,靠的是归纳偏置

一句话判断

1 天 1000 任务,靠的是归纳偏置

论文解决什么问题

主流模仿学习平均每任务要 175 到 250 条演示:BC-Z 为 100 个任务收了约 2.6 万条,RT-1 为 744 个任务收了约 13 万条,复杂双臂任务据称每个要 8000 条。而灵长类学会一个操作任务不到 5 次。

核心方法

↳ ① 把轨迹拆成对齐和交互两段。对齐只关心末端相对目标物的最终位姿,路径怎么走无所谓;交互才需要精确执行。
↳ ② 用检索代替行为克隆,而且是在测试时检索。这和训练前检索数据、以及全程用 RGB 检索图像动作对的做法都不同——这里是执行前用语言加几何检索一整条轨迹。

实验结果

受控实验 3450 次真机试验:只用 3 条演示就超过其他方法用 50 条。分解本身也有效,同一套行为克隆实现,分解版优于不分解版。

千任务评测:1000 个日常任务、400 多个物体、每任务一条演示、全部演示 24 小时内采完,2200 次试验下已见任务 78.25%、未见 68%。

这篇论文不是什么

单臂、单次交互,假设被抓物体在演示和测试时于夹爪中位姿相同,且明确没有评测干扰物挡住演示轨迹的情况——开环重放会忽略障碍物并可能碰撞。只有视觉没有触觉,推断不了可变形物体的刚度弹性。检索也无法在两条已演示轨迹之间插值,只会二选一。附录里作者自曝:让大模型串接技能时,开放式长程指令会幻觉出不连贯序列,比如调鸡尾酒时没放下酒瓶就开始倒酒。

对机器人 / 世界模型 / VLA 的启发

最值钱的不是那个 1000,是作者主动给出的失效方向。

这条判断有交叉点:同一套归纳偏置,在低数据区是资产,在高数据区变成负债。分解利用了内建的任务结构,所以小数据下强;也正因为结构约束,扩展容量被限制,检索只选单条演示,阻止了跨演示的知识共享。

这让它同时站在两派的对立面。主张统一模型、反对模块化拼接的那一派,被它的低数据结论反驳;而主张把切换逻辑交给规划器的那一派,被它的高数据趋势反驳。两边各对一半,取决于你在曲线的哪一段。

对比一下最近另一篇工作会更清楚:那篇用 200 条生成数据把成功率做到真机的 84%,通篇只报告收益。而这篇报告的是收益、交叉点、失败归因逐项拆解、以及自己终将被反超的预期。前者的可信度我打了折扣,后者没有。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文