
VLA换动作块不再卡顿
一句话判断
VLA换动作块不再卡顿
论文解决什么问题
动作分块(chunking,一次推理预测一串未来动作)是VLA部署标配,能摊薄推理成本、支持高频控制。但推理延迟加上flow策略本身的多模态性,让相邻两个动作块衔接处经常不平滑,执行时看得出犹豫、突兀转向。现有RTC方案靠推理时打补丁缓解,但补丁不是策略自己学会的东西——这篇论文的方法名Legato,取自音乐里"连音"这个概念:音符之间平滑过渡、毫无间断。
核心方法
衔接不该是补丁,得是策略自己去噪动力学里原生的一部分
↳ 诊断实验先讲清楚这件事:只在去噪起点做一次性前缀引导,重叠区域动作会随多步去噪逐渐漂离参考值——证明引导必须每一步都重新施加,只做一次不够
↳ Legato的做法:定义一个横跨动作块时程的连续性向量(块开头强引导、逐渐坡降到零),据此重塑flow-matching的速度场本身,让"逐步引导"变成去噪动力学内生的一部分,不是套在标准速度场外面的推理时约束
↳ 调度由延迟、执行步幅、坡降长度三个参数刻画,训练时随机化并作为显式条件喂给策略,一个模型就能适应不同延迟波动
实验结果
· 真机五项操作任务全面优于RTC:完成时间更短、多项平滑度指标更好、任务完成分数也更高——平滑度提升没有拿成功率去换
· 跟同期的"训练时RTC"(同样在训练阶段引入约束,但只是加一道硬性前缀约束,底层动力学不变)比也全面胜出
· 方法不绑定骨干:π0、π0.5、GR00T N1.6,甚至基于UNet的仿真策略都验证有效
这篇论文不是什么
· 衡量全轨迹高阶平滑度的NLDLJ指标没有全部任务都显著提升——改善集中在块边界附近,不代表整条轨迹处处都更平滑
· 对部署延迟的鲁棒性是有前提的:训练时随机化范围没覆盖到的延迟值(尤其缺了"零延迟"这种极端情形),性能可能严重退化甚至接近完全失败
· 验证范围局限在flow-matching这类连续动作分块策略,离散动作表示的VLA架构没有涉及
对机器人 / 世界模型 / VLA 的启发
"训练时把部署期会变化的麻烦参数随机化、让策略自己适应"这个手法,和已解读过的PointWorld同源——PointWorld随机化相机数量、这篇随机化推理延迟,结果都是模型对该参数的各种取值反而最鲁棒。调度消融里步幅和坡降长度的权衡,也和PAVE的预测锚点数量非单调发现是同一个模式:给系统更多约束或参数不是无条件的好事,关键在找到那个恰好的权衡点。
论文关键页

