
李弘扬老师的全身智能高于GR的全身控制
一句话判断
李弘扬老师的全身智能高于GR的全身控制
论文解决什么问题
源策未来(Archon Robotics)7 月 13 日发的技术博客,比 Gemini Robotics 2 早 17 天
核心方法
✅ 先说清楚它反对什么
这篇最鲜明的是两次划界:全身智能不是全身控制的同义词,也不是把 VLA、行为基础模型和控制器简单拼在一起。作者要的是一套面向人形的预训练范式,产物是人形基础模型
实验结果
❇️ 人形操作不能简单理解成"机械臂 VLA + 人形底盘"。理由很具体——从低柜取物时,手的姿态取决于身体蹲多低、脚站在哪里、头部能不能看到目标、另一只手要不要支撑。很多看起来是"手"的问题,其实是全身问题
✅ 四层栈每层管什么
S2 任务与语义,把开放指令转成阶段目标;S1 原生人形基础模型,吃视觉、语言、本体感受和触觉,输出全身动作意图;S0.5 运动生成加行为基础模型,把意图变成可执行的参考运动;S0 跟踪器与控制器,在真机上管平衡、接触和力
"原生人形"是关键词:模型必须一开始就理解头部观察如何影响手部操作、脚步位置如何影响可达空间、躯干姿态如何为操作让位
✅ 数据与扩展
数据分工被概括成:人类数据提供规模,机器人数据提供边界,失败数据提供恢复能力。扩展的四个维度是模态、身体、任务、失败——参数量不在其中。作者还给了七条评估自查,核心是别看单次演示,要看在新场景、新硬件、新任务上提升能力的速度
这篇论文不是什么
对机器人 / 世界模型 / VLA 的启发
最有意思的不是它跟谁一致,是它在两个层面站了相反的队
📚 在"该不该拆"这个问题上,它跟主张统一模型、反对模块化拼接的那一派同向——都认为人形操作不能按模块边界切。但它自己给出的四层栈,恰恰又是一套分层架构,跟 GR那种上层拆开的做法同向
🧲 这两件事不矛盾,因为它们说的是不同的切口。反对的是按"导航模块加抓取模块"横着切功能,主张的是按"语义、身体先验、运动生成、执行"纵着切抽象层级。前者会把耦合的动作拆散,后者不会
🎯 所以这条判断可以更准确:分歧不在分不分层,在切口是切在功能边界还是抽象层级。切在功能边界,走路和伸手就被分给两个模型;切在抽象层级,全身协同仍在同一层完成
🧬 还有一处值得单独记:它主张模型必须知道自己站在什么硬件上,关节可达范围、力控精度、传感器视角都要进先验。这跟"同一个模型几小时换一台本体"是两个方向的下注,半年后能看出谁对!