全部论文
S1:机器人的GPT-3涌现时刻

S1:机器人的GPT-3涌现时刻

一句话判断

S1:机器人的GPT-3涌现时刻

论文解决什么问题

机器人基础模型想有"上下文学习"能力(看一段演示就能做新任务,不用微调),但这个能力具体从哪来——是架构设计出来的,还是数据堆出来的,业内一直没有干净的证据。

核心方法

↳ 公司自报的关键对比:预训练规模只有1000小时时,上下文学习(ICL)反而输给传统语言指令+微调(43% vs 53%);堆到10万小时,ICL反超到66% vs 9%,相差7倍。这不是随数据量线性变好,是一条到了某个规模才突然翻盘的曲线——和语言模型里"小模型怎么调也学不会强上下文学习,大模型突然就会了"的GPT-3现象是同一类
↳ 驱动这个涌现的具体是数据小时数,不是架构创新——博客里没有提任何针对ICL设计的新模块,模型结构和此前一样。公司自己的解释是:预训练真正学的不是任务本身,是"如何从少量样例里学习"这项元能力,量变到了某个点才转化成质变

实验结果

· 一条上下文演示的价值,官方估算约等于380条传统后训练演示
· 真机演示种花、煎饼、手冲咖啡等长时程未见任务,最长10分钟、几十步操作
· 扰动测试里,一旦任务需要根本改变执行方案(比如强制换手),传统语言提示VLA的性能下降幅度最多是ICL的3倍

这篇论文不是什么

不代表这些数字已被独立验证——7倍差距、380条演示当量,全部来自公司自建基准,标记为"需独立核实";也不代表规模是唯一变量,小数据量区间传统微调反而更好,涌现本身有个门槛,不是越早越好;评测里策略失败会有人工干预帮助恢复,报告的是逐步成功率,不等于整条长任务端到端一次成功的概率

对机器人 / 世界模型 / VLA 的启发

"用规模换涌现,不做专门机制设计"这个技术判断,和另一家美国公司Generalist AI在Gen-1.5博客里说的几乎一模一样——两家都承认自己也说不清为什么会涌现,只给了一个类比语言模型的假设,没有实证解释。两家公司各自单独端出同一套叙事,更像这个赛道正在形成的共享认知,而不是两次独立发现。真正该盯的问题是:这条"规模到了自然涌现"的路,会不会重演语言模型的历史——一旦涌现门槛被摸清,下一步就是拼谁能更便宜地把数据堆过那条线。

原论文入口

AI 摘要

相关方向

返回全部论文