全部论文
英伟达的动作流:机器人动作新标准

英伟达的动作流:机器人动作新标准

一句话判断

英伟达把机器人动作定义成"动作流"——机械臂、人手、夹爪全部通用,误差直接降了90.40%

论文解决什么问题

现有动作条件世界模型大多绑死训练时那台机器人。关节指令直接编码机器人结构,同一个末端执行器指令换一台运动学不同的机器人会产生完全不同的可见运动。这些指令都不指定画面上最终怎么动,模型只能被迫学一个本体绑定的映射,没法迁移。

核心方法

Hydra-0不喂原生指令,把动作定义成"动作流"(action flow)——机器人表面可见点在画面里怎么移动的稀疏轨迹。机械臂、人手、夹爪用同一格式,不暴露各自的原生动作空间。
部署时:候选指令先过一遍控制器和物理仿真(英伟达自家的Isaac Lab),把结果的可见表面轨迹投影进相机画面——这就是SLAM、视觉里程计里那套经典的针孔投影公式,只是投影的是机器人自己的连杆,不是相机的运动。
训练时更省事:数据集没有机器人几何和相机标定时,直接用光流追踪器把轨迹从视频里抠出来。每步训练在四种策略里选一种:本体轨迹当动作条件、物体轨迹当任务意图、混合兜底、或不给轨迹只留文本图像。

实验结果

同一套接口装进英伟达自家的Cosmos 2.5和两个Wan2.2骨干都能用,不是哪个模型专属的改法。最佳配置比原生6D动作基线,机器人运动误差低90.40%,物体运动误差低60.16%。当仿真评估器也测过:五个预训练策略跑三百回合,生成成功率和真实成功率相关系数0.96,复现了五个策略排名。推理端加自回归转换和少步蒸馏,仅生成阶段62帧每秒,比双向采样快16倍。

这篇论文不是什么

厘米级抓取还是不准,作者怀疑是深度感知不够,但没验证。这不是这一篇独有的毛病——只靠视觉预测、没有触觉或力反馈的世界模型,几乎全在接触精度上撞墙。评测目前也只做开环,策略不会被生成画面反过来喂,闭环留给了以后。

对机器人 / 世界模型 / VLA 的启发

真正让我意外的是"该建模后果、不该复现行为"这句话——不是Hydra-0一家的说法。这几个月看过的论文里,好几篇用完全不同的机制——潜特征、双向掩码、测试时精化、意图剥离——最后写下同一句结论,方法不像,答案撞到了一起。
另一处呼应更具体:Hydra-0换掉原生动作、改用贴近视觉的条件信号,误差砍掉九成;另一篇论文测过同一件事的更小版本,动作条件换成中间表征,画面质量指标从18.26涨到21.05,方向一样,幅度小得多,两边互不知道对方存在。
部署路线的尺度和约束,说到底来自机器人自己的运动学,不是视觉模型凭空生出来的——跟之前"尺度不是模型给的,是机器人给的"是同一个思路。反过来逆向模式不走这条几何路子,不解重投影误差,是从配对轨迹里学出来的读出层——两者共享的是"稀疏轨迹能约束住运动状态"这个洞察,不是同一种解法。

半年后回看的锚点:厘米级抓取不准能不能靠加一种非视觉模态解决——能,说明天花板不在表征方式,在传感器;不能,说明物理精度有结构性上限,条件信号设计得再聪明也绕不过去。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文