全部论文
被忽略的非共识是全身统一控制

被忽略的非共识是全身统一控制

一句话判断

被忽略的非共识是全身统一控制

论文解决什么问题

适配全新双臂本体,几小时、通常少于 200 条示例,对差异极大的平台同样有效。这个数字确实狠,但它是今晚最好写的一条。

核心方法

此前的模型只控人形上半身做桌面任务,这次第一次控制完整人形,从脚到指尖。官方例子是 Apollo 2 接到一句「把浇水壶放进底层货架的绿色箱子」,然后自己走到桌边、拿起壶、走几步到货架、精确放好。

关键不在于它会走路,而在于走路、弯腰、伸手是同一个模型出的。你要从货架深处拿东西,脚往哪落、髋怎么转、手臂怎么伸是耦合的,拆成"行走控制器 + 上肢操作模型"就会在衔接处出问题。更能说明问题的是:同一个 checkpoint 同时驱动装五指手的 Apollo 2、装夹爪的 Apollo 2 和 Franka Duo 三种本体。

实验结果

Gemini Robotics 2 是干活的 VLA,ER 2 是高层大脑负责对话和拆多步任务,On-Device 2 在本地跑。上层是分层的:开发者可以把 VLA 和导航 API 并列声明为 agent 的 tool。目前只有 ER 2 公开,另外两个限早期合作伙伴。

这篇论文不是什么

成功率全在图表里,文字只有"中到高成功率"这类定性描述,没点名竞品也没给基线。官方自己在图注里承认多指灵巧操作仍然困难,运动速度也还有待提升。安全报告是离线评测,约束数据集由模型合成,真机只测了安全停止。

对机器人 / 世界模型 / VLA 的启发

"分层还是统一"这个争论,可能一直问错了。行业里一种主张认为行为动作必须是统一模型、反对模块化拼接,另一种把物理智能拆成上下两层。Google 的做法是两个都要:上层拆开,推理和执行是两个模型靠工具调用连接;下层焊死,腿和手不给拆。

所以问题不是分不分层,是切口切在哪。切在语义和物理之间,两边各自受益;切在物理内部——比如把行走和操作分给两个模型——就会在最需要协同的地方留下缝。

顺带说一句:这个判断并不是 Google 发布后才有的。国内已经有团队把"人形操作不能理解成机械臂加移动底盘"写成了完整的技术路线,比这次发布还早半个多月。下一篇我拆那篇。

跨本体那条也别急着下结论:官方只对双臂给了几小时的数字,全身人形是否同样没说;也有工作发现原始轨迹很难表达接触模式、约束几何和受力方向,物理执行层的迁移远没那么轻松。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文