
触觉预测只该用来训练,不该给动作看
一句话判断
触觉预测只该用来训练,不该给动作看
论文解决什么问题
现在的世界动作模型大多只预测视觉未来,但接触任务的关键信息在图像里几乎看不出来:看着稳的抓取可能已经接近打滑,看着对齐的插入可能已经机械受约束,易碎物体受力已经不安全时外观毫无变化。这些差别体现在力的累积、剪切、压力不对称和初始滑移上。
核心方法
↳ ① 未来触觉只当训练期的监督目标,不进部署期的动作输入。作者主动说明触觉预测本身不是新意,他们关心的是触觉未来怎么被表示、以及怎么在训练内部被使用。
↳ ② 注意力掩码严格隔离:动作 token 不能读未来视觉和触觉预测,视频 token 不能读触觉未来。作者明确定性——这是信息隔离机制,不是在主张动作条件下的触觉动力学。
↳ ③ 触觉编码融合触觉图像、稠密力场、网格形变流三路空间对齐信号,双侧合力与力矩当全局力学监督,预测的是潜状态而不是直接生成传感器流。
↳ ④ 近期触觉历史不作为额外 token 插入,而是通过自适应归一化调制触觉专家——同样的力幅值可能是稳定接触、压力增长、滑移恢复或即将捏坏,得靠历史才能分辨。
实验结果
真机四个接触密集任务各 20 次试验,均值 75.0%,最强基线 37.5%,每项全胜。擦白板和转笔提升最大,这两项最依赖持续接触和双侧动态推理。
真正值钱的是消融那条曲线:完整版 82.5%;去掉触觉历史掉到 55.0%;再放开动作流对触觉预测的可见性掉到 37.5%;再允许视觉与触觉未来双向交互,掉到 7.5%。
这篇论文不是什么
单臂平台、四个任务、每方法每任务只有 20 次试验——单次成败就是 5 个百分点,任务间的小差距落在两次试验的量级内。最强基线没有官方实现,是作者自己复现的,而它恰恰是那 37.5 个百分点提升的对照对象。另外触觉预测在部署时并没有闭环使用,全部收益来自训练期的表征改善,不是「机器人靠预测接触实时调整」。
对机器人 / 世界模型 / VLA 的启发
那条消融曲线值得单独拿出来说。后两级消融并没有减少任何可用信息,只是取消了信息流的结构限制,损失却大于第一级的信息缺失。「辅助信号不能不受约束地接进主干」这个判断,此前见到的都是「加了约束效果更好」的正向证据;这是第一次看到逐级放开约束的下降曲线。
还有一处同门分歧挺有意思。另一篇触觉工作同样主张把触觉当预测目标而不是观测输入,但它把预测出来的潜变量喂给动作专家去条件化动作;这篇则明确不让动作读触觉未来。两边的出发点一致,落到「预测出来的东西该不该给动作看」时给了相反答案。而这篇的消融正好在测这件事,掉了 17.5 个点。
论文关键页

