
PAVE:失败数据也能喂饱策略
一句话判断
PAVE:失败数据也能喂饱策略
论文解决什么问题
纯未来预测方法有个盲点:预测器能精确算出一个糟糕动作会导致什么后果,却不会因此教会策略去避开它——预测准和行为好是两回事。反过来,纯价值重标注方法又不会显式改善策略对多时间尺度转移的表示能力。两条路各管一半,谁都没把两件事同时做好。
核心方法
从所有轨迹学"发生了什么",只从更好的轨迹学"该怎么做",两个目标分开处理
↳ 用JEPA式多时程预测对齐塑造共享表示:既保留固定偏移的局部监督,又加一组轨迹相对的归一化未来锚点(25%/50%/75%/100%),这条分支训练时塑造表示、推理时完全跳过
↳ 一个独立的分布式价值评判器把部署轨迹按动作块打成优势标签——关键是这个标签是相对的、片段级的:失败episode里的补救动作可能被标positive,成功episode里低效的那段也可能被标negative,不是简单继承整局成败
↳ 优势标签以文本条件("Advantage: positive/negative")注入,不是标量特征;每轮都从同一个固定基座重新训练,避免权重漂移带来的混杂因素
实验结果
· 相对最强基线JEPA-WAM:LIBERO+2.6分,LIBERO-Plus+6.0分(背景变化+7.9、传感器噪声+7.4),RoboTwin2.0+6.6分——分布偏移场景提升最大,全部基线由作者自己在同等条件下复现
· 在线部署效率跟基线完全打平,延迟只多0.2毫秒——多时程预测器和评判器只在训练/离线阶段用
· 两个反直觉消融:预测锚点不是越多越好(4个>6个>8个);69万参数的分布式评判器比682万参数的更大评判器还准
这篇论文不是什么
· 轨迹相对锚点只是时间进度标记,不是语义子目标,不保证是有效计划
· 评判器定位不到动作块内具体哪个动作有问题,标签是同批数据上的样本内预测,不是交叉验证,可能对评判器自身的过拟合和校准敏感
· 每轮都要重训完整策略,离线成本不小;真机只有一段定性演示,没有量化成功率或安全性评测
对机器人 / 世界模型 / VLA 的启发
这篇跟已经解读过的EVA正面对着干:EVA主张世界模型该在动作生成这一步内部当验证器,是推理时的组件;PAVE把预测和评判全部限制在训练/离线阶段,部署时只留一个直接策略——两边对"世界模型的价值该体现在哪个阶段"给出相反答案。跟Dyna-2是同一路线:把预测转移和挑选行为拆成两个独立目标,呼应了"让跨具身迁移涌现的因是世界建模本身、不只是数据量"这条判断。另外有个更具体的分歧:文献里常见的JWAM工作主张监督必须直接塑造生成动作的那个主干,外挂或当上下文都不行;但PAVE用文本条件注入优势信号,消融结果显示这套"当上下文"的做法确实管用(positive条件明显优于null和negative)——等于给"外挂不行"这条断言提供了一个反例。
论文关键页

