全部论文
SmoothRL:只对真正执行的动作算账

SmoothRL:只对真正执行的动作算账

一句话判断

SmoothRL:只对真正执行的动作算账

论文解决什么问题

真实部署要同时做到在线、异步、价值梯度(把Q函数对动作的梯度直接回传进策略参数)三件事,但现有方法总要牺牲其中一个:离线RL放弃"在线",同步在线RL放弃"异步",已有的异步RL方法又把优化变量限制在冻结解码器的潜在空间里,可提升的上限被锁死。

核心方法

策略生成的动作和机器人真正执行的动作,在异步执行下是两回事——只对真正执行的那段算梯度
↳ 每个动作块按执行状态分三段:已提交段(早被上一个块覆盖,永远不会触达环境)、执行段(唯一真正发给机器人、直接决定轨迹结果的部分)、丢弃段(还没执行就被下一个块取代)。用固定延迟预算把这三段边界变成由帧序号唯一确定的常量
↳ 价值梯度只对执行段计算——因为这段动作同时是当前策略的真实输出、也是机器人实际执行的动作,这个恒等关系让梯度对策略参数良定义。但critic的输入仍是完整动作块,用来保证无偏的跨块自举、并建模"上一个块还在飞行中"这个并发决策过程
↳ 异步循环在训练rollout时就照常运行,不是只在部署时才用——回放数据因此记录的是和目标函数完全一致的时序下真正执行过的动作,策略永远不会在部署时不会遇到的条件下被优化

实验结果

· 真机三项任务,250轮在线RL后大幅提升:动态投掷39%→94%,套笔帽8%→83%,开箱30%→90%——修正的都是系统性固定偏差(刀片持续左偏、释放速度没跟距离联动),不是随机噪声
· 原始动作空间让人类干预不用转换就能直接当训练数据:残差式干预(保留基座速度轮廓、只纠偏)在最难配置上成功率约80%,远超直接接管式的约30%
· 平滑性不是自动保证的——一旦价值目标开始推高Q值,必须把速度/加速度/加加速度约束重新显式加回优化目标

这篇论文不是什么

· 依赖固定的推理延迟预算,实际波动一旦超出预算,整条异步循环的时序会被打乱
· RL模块的表达能力被冻结基座双重锁死:感知上限受VLA内部表征信息量约束,修正幅度又被限定在参考动作附近的局部邻域内
· 真机评测规模较小(10-18个配置各跑一次,人工判定成功率),刻画的是这套具体设置下的结果,不是大规模统计结论

对机器人 / 世界模型 / VLA 的启发

这篇和已经解读过的RL-100形成一个值得记的分歧:RL-100自己的发现是离线RL阶段贡献了大部分提升,在线阶段只是清理残余失败;这篇却把在线RL当成修正系统性偏差(不是残余噪声)的核心手段。两边对"在线RL到底该扛多重的活"给出不同答案,可能取决于预训练阶段本身把策略带到了多接近成功。另外,这篇"训练时把异步循环也跑起来,让优化目标和部署时的真实时序对齐"这个原则,和刚解读过的Legato是同一个方向——两篇论文都在强调,训练阶段绝不能对部署时会遇到的时序结构视而不见。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文