全部论文
机器人的scaling law,走到第几步了

机器人的scaling law,走到第几步了

一句话判断

Generalist AI说GEN-1.5不用任何专门设计就学会单样本操作——官方自己写的原文是:10个任务,方差±10%,技能"比微调更脆弱"

论文解决什么问题

LLM靠堆数据堆规模走出了GPT-3那个时刻,具身智能能不能走通同一条路,一直没有公开、持续追踪的证据。

核心方法

Generalist AI给出的不是单次发布,是一条时间线:约14个月前他们说观察到可预测的规模化定律;9个月前发布GEN-1,验证了后训练到99%+成功率、出现早期即兴迹象;GEN-1.5的预训练跟GEN-1同期启动,同一套引擎持续跑了8个多月。
GEN-1.5处理30秒视频记忆窗口加多模态输入,输出100Hz动作。官方数字:单次演示零梯度,10个任务平均59%(±10%);10步梯度5分钟数据,83%(±9%);单步梯度66.5%,权重变化小于0.15%。官方原话:没有为此做任何架构改动、没有元学习循环,是意外涌现的。

实验结果

最值得看的不是这几个百分比,是产品线内部的对照:即兴纠错这个特质在GEN-1就有迹象,到GEN-1.5变得"更频繁、更精细"——这是一代代之间的组内证据,比单次快照硬。另外三项零样本演示:组合两个物理提示串成一段行为、仿真录制直接迁移真机、人手演示后机械手直接复现。工具即兴:刷子演示后换成香蕉当刷子,换成簸箕时用完全不同的接触方式完成任务。

这篇论文不是什么

这是公司的技术博客,不是论文,不该拿论文标准要求它——公开数字是讲给市场和投资人听的战略叙事。但官方自己没回避薄弱环节:样本只有10个任务,方差±9%到±10%,自称"modest";为什么会涌现,官方说"难以精确定位原因",只给了一个类比语言模型的假设,没做验证;上下文学出的技能承认"比微调版本更脆弱"。

对机器人 / 世界模型 / VLA 的启发

这是同一条规模化引擎上的第三个公开检查点,不是孤立发布——从"观察到可预测的规模化定律"到"GEN-1后训练99%+并显露即兴迹象"再到"GEN-1.5即兴更频繁更精细、涌现单样本学习",走的是同一条曲线。跟这个方向相反的是SLIM、JEPA-WAM、ω-EVA那批工作,押的是双向掩码、隔离机制、测试时精化——靠结构而不是靠规模。两条路线里唯一真正对撞的判断:有工作明确主张切换逻辑该交给规划器,不该让策略端到端学,这跟"纯规模不需要专门机制"直接矛盾。

半年后回看的锚点:不用等开源或被复现,看下一个检查点就够——即兴纠错是不是继续更频繁更精细,任务集和成功率是不是继续往上走。趋势断了,这条路线的说服力就断了;接着往上走,这就是机器人领域正在发生的GPT-3叙事。

原论文入口

AI 摘要

相关方向

返回全部论文