全部论文
RL 不该从零学,该做后训练

RL 不该从零学,该做后训练

一句话判断

RL 不该从零学,该做后训练

论文解决什么问题

SERL、HIL-SERL 在桌面技能上效率和可靠性都不错,但代价是限制动作空间——约束腕部旋转、鼓励近平面运动。这对安全和采样效率务实,却压低了表达力,姿态关键、接触密集、双臂协调这类任务上不去。

核心方法

模仿学习打底,给一个物理可行的行为先验;迭代式离线 RL 在保守更新下配合数据渐进扩充,榨取大部分性能;简短在线微调只负责清理稀有的残余失败。三阶段共用同一个裁剪 PPO 目标,离线到在线不用换学习原语。

关键设计:把扩散去噪建成两级 MDP,同一个环境级 advantage 在全部去噪步骤间共享,解决只对最终动作打分导致的弱信用分配。离线阶段还有个门控——候选策略只有被保守预测为确有改进才推进,否则拒绝,防止性能突然崩溃。

实验结果

八个真机任务、1000 次试验,100% 成功。离线 RL 阶段贡献了从模仿基线到 91.8% 均值的大部分提升,在线阶段只清残余。数据预算上,人类演示平均每任务只要 1.8 小时,占总采集预算不到 13%,其余全是策略自主 rollout。部署时蒸馏成一步一致性策略,378Hz 推理,仅 3.9M 参数。

Push-T 上单位时间完成次数超过专家遥操作员 1.18 倍、新手 1.54 倍。

这篇论文不是什么

榨汁任务里按压那一步是运觉示教录的固定轨迹、部署时直接重放,不是学出来的——严格说"八任务"里有一小段是脚本。作者自己承认自主复位仍是未解决的瓶颈,列进了未来工作。摘要也写明在线探索阶段有"温和的人类引导",不是完全自主。

对机器人 / 世界模型 / VLA 的启发

这篇的核心主张——RL 该围绕部署指标做后训练、而不是从零学或纯粹逼近演示——独立地被另外两条判断印证了。一条是仿真为主、预训练几乎不碰真机、部署后靠少量真机 RL 补齐;另一条是数据金字塔倒置,人类数据打底而不是互联网视频打底。三条路线起点不同,落点却收敛到同一个形状:强先验加轻量真机后训练。

那个离线门控也接上了刚做完的另一篇工作——它的结论是 RL 该在哪一层介入,本身就是和改多少同等重要的设计变量。这篇的门控机制正是"介入点选择"的一个具体实现。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文