
切换逻辑不该让策略去学
一句话判断
切换逻辑不该让策略去学
论文解决什么问题
长程操作难,难在端到端策略被迫同时学两件事:每个技能怎么做,以及什么时候切、切哪个。N 个技能、M 步序列,策略要内化组合数量级的可能路径,数据需求跟着组合数涨。
而「怎么排序、何时切换」恰恰是符号规划最擅长、且完全不需要数据的部分。剥离出去后,演示预算只随技能种类数增长,不随组合数增长。
核心方法
↳ ① 按接触复杂度分三类:pick/place 用等变网络学开环基元;擦拭、翻转、折叠这类接触密集的用视觉运动策略,两端预测关键位姿;不涉及接触的直接走规划轨迹。
↳ ② VLM 只做语义 grounding,不决定切分点。切在哪由接触距离阈值判定——两个接触变化事件之间就是一段。
↳ ③ 执行不是一次算完就开环走。全局骨架算一次,但每个动作前重新感知、对该子目标解局部规划、执行后用接触检测器验证,没达到预期接触就重解同一步。
实验结果
· 仿真 peg-in-hole:50 条演示,分布内 100%,ACT 44%、DP 54%
· 双臂任务用 100 条演示打到 70% 和 90%,而基线用 1000 条只有 45% 和 70%
· 真机分布外测试,扩散策略掉到 30%
· 代价是慢:单次完成 10.21 秒,基线 7.5–8.7 秒
这篇论文不是什么
继承了 TAMP 的老账:目标仍需人工指定;搜索复杂度随符号数指数增长,阻挡物从 0 加到 3 个,规划时间从 9 秒涨到 145 秒,标准差 190 秒。受约束场景成功率明显低于分布内。物体中心基元需要标定过的深度传感器。VLM 那步输出要人工检查,还依赖无歧义的分步描述——真实任务里通常没有,是作者自己写的。开集分割也有词表限制,某个障碍物约一半试次没被认出来。
对机器人 / 世界模型 / VLA 的启发
这篇最可迁移的不是架构,是那句机制:与其让策略泛化到分布外,不如先把世界推回策略的分布内。基元把物体挪到分布内的接触状态,关键位姿把机械臂带到策略能接受的启动姿态。改变的不是模型的泛化能力,是它被调用时所处的状态。
顺着看,最近这几篇在同一个问题上给了不同答案。有主张统一模型、反对模块化拼接的;有反对按「导航模块加抓取模块」横切、主张按抽象层级纵切的;这篇则说切可以切,但切完得有人负责把状态推回分布内。
还有一处直接对立值得记:有篇触觉工作的部署契约是动作块一旦发出必须整段执行完,不许截断重规划;这篇正好相反,每个动作前都要重新感知再局部重解。一个赌预测足够准所以别打断,一个赌世界一定会漂所以每步都要校。这个分歧半年内应该能看出结果。
论文关键页

