
机器人失败,可能不是策略不够大
一句话判断
机器人失败,可能不是策略不够大
论文解决什么问题
我们习惯把机器人任务失败归因于策略:数据不够、模型不够大。Transformer Transformer 的反问是:如果身体本身就不适合这个动作,继续堆策略是不是只是在补偿一个物理劣势?
这篇把任务重新写成 motion-conditioned robot co-design:给定目标末端运动和奖励函数,生成完整本体,包括连杆、关节、电机、惯性参数和控制动作。也就是说,本体不再是固定前提,而是和控制器一起进入优化问题。
核心方法
↳ ① RoboTokens 把连杆、关节、电机、状态、动作和目标末端位姿压成统一连续 token。项目页报告,11 个 Menagerie 机器人覆盖 0.65–67.5 kg、6–35 个主动关节,每个只要 28–101 个 token,比 MJCF 文本少 27–110 倍。
↳ ② 同一个 DiT 通过改变条件掩码切换角色:不固定本体时是机器人生成器;给定本体和目标运动时是跨本体控制器;给定目标运动、扩散本体和动力学 token 时是任务设计器。
↳ ③ Dynamics Self-Guidance 让模型先预测候选本体的整段状态-动作轨迹,再把用户奖励函数的梯度反传到本体 token。它不为新奖励单独训练 critic,也不依赖可微模拟器,而是用模型自己的动力学预测做引导。
实验结果
真实 ALOHA2 甩布最有说服力:模型生成方案加长连杆,并把双臂倒置安装到工作区后方,让动作从过顶甩动变成更省力的下手摆动。项目页自报,真机跟踪误差降低 73%,最大关节速度降低 30%,原结构打不开的布料被展开。
速度也激进:CMA-ES 要在 MuJoCo 里逐代 rollout;这个方法在 GPU 上并行采样,一次预测整段 episode。项目页报告,多轨迹双臂优化从 3 小时以上降到 1 分钟内。
这篇论文不是什么
这不是开放世界 VLA。输入仍是预设末端轨迹和手写奖励,不是从语言、图像、物体状态里自动理解任务。
也不是可靠的最终验收器。设计质量依赖同一个模型做跨本体控制验证,而它和逐设计 RL oracle 的相关系数只有 0.53。证据又来自项目主页自报,真机只展示一种 ALOHA 变体和一个甩布任务。
对机器人 / 世界模型 / VLA 的启发
这篇挑战的是“做大脑不做身体”的路线。它说很多失败不是策略层问题,而是身体-控制器-任务分布没有一起设计。对通用机器人公司,这可能太重;但对固定工位、固定任务分布的工业系统,先改安装角度、连杆、工具几何和执行器,再做策略后训练,可能比扩大策略模型更像正解。