全部论文
机器人 RL 的瓶颈是采样不是算法

机器人 RL 的瓶颈是采样不是算法

一句话判断

机器人 RL 的瓶颈是采样不是算法

论文解决什么问题

↳ ① RL for robotics 卡在物理 rollout 成本,不只是算法质量。1 分钟任务的 100 万条轨迹约合 700 robot-days,这让 PPO/GRPO 式方法的直接 scaling 与 LLM 后训练在性质上就不是一回事。
↳ ② 记忆仍是机器人基础模型的主要缺口。多数 SOTA 系统实际上零记忆;朴素塞视频历史又太贵——4 路相机、50Hz、10 秒约合 50 万 token。π 的做法是短期视频记忆加上对前 10–15 分钟的长期文本摘要,据称由此跑通了一个全自主多步厨房清理。
↳ ③ 通用模型可能已经在打败专用流水线。π0.7 混合演示、rollout、人类视频和网络数据,再用 rich prompting 加 metadata 把较低质量的数据也变得可用。

核心方法

· RL loop 被专门改造过:由人介入提前终止或改向已经走死的 rollout;value function 跨 prompt 和任务摊销,而不是每次尝试重新估计。
· 控制接口仍是结构化的:模型输出目标关节位置加 3D 夹爪位置,交给 PD 控制器,没有端到端到原始力矩。她把这说成刻意的权衡,不是核心限制。

实验结果

· RL loop 被专门改造过:由人介入提前终止或改向已经走死的 rollout;value function 跨 prompt 和任务摊销,而不是每次尝试重新估计。
· 控制接口仍是结构化的:模型输出目标关节位置加 3D 夹爪位置,交给 PD 控制器,没有端到端到原始力矩。她把这说成刻意的权衡,不是核心限制。

这篇论文不是什么

发帖人是现场听众,不是 π 的人,内容为二手转述。700 robot-days、50 万 token、10–15 分钟窗口都只能当作"据称的演讲口径",不是 π 官方发布的参数。

对机器人 / 世界模型 / VLA 的启发

把库里三条判断并排看,"瓶颈在哪"有三个不同答案:这次说是物理 rollout 成本;另一处判断是卡点不在硬件而在大脑;还有一条更狠——"世界模型跟智能上限无关"的隐含前提是数据管道已通,LLM 通了所以世界模型是绕路,机器人没通所以是桥。

三条其实不打架。说"大脑"的在讲能力上限,说"rollout 成本"的在讲怎么把能力做出来,是同一条路的不同段。而库里另一条"高质量参考让 RL 用极简公式就能训"恰好印证了这次的读法:主战场不是找更好的 policy gradient 变体,是提高每条真实轨迹的信息产出率。

半年后可以回来验:若 π 后续版本仍不走端到端力矩,说明结构化控制接口不是过渡态,是稳定选择。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文