全部论文
触觉当预测目标而非观测输入

触觉当预测目标而非观测输入

一句话判断

触觉当预测目标而非观测输入

论文解决什么问题

VLA 已经很通用,但接触密集任务始终是短板。此前触觉扩展只训在几十小时的任务级采集上。更根本的是融合方式:把触觉当成"多一路相机"拼进视觉语言前缀,可这信号稀疏、大部分时间静默,占用为信息密集视图设计的容量收益很小;把当前触觉读数注入动作通路引导去噪,则只是记录动作已经造成的接触——策略永远慢自己的接触事件一步。

核心方法

↳ ① 触觉不当观测输入,当预测目标。预测器读视觉语言上下文+当前触觉 token,输出对未来接触变化的潜在估计 z,用 z 而非原始读数去条件化动作专家。
↳ ② 三阶段配方稳定上线。先冻结整个基座只训预测器(对比学习+重建损失锚定 z 的语义);再把视觉语言前缀 mask 掉,逼动作专家只能靠 z 拿触觉;最后全解冻联合训练。
↳ ③ ALTER:用触觉检测的物体掉落事件和阶段进度标注,把部署数据变成离线 RL 的优势标签。

实验结果

· Stage1 后 z 检索未来触觉目标 top-1 92.3%(随机 3.2%);换成仅用当前触觉编码只有 57%
· 触觉扰动对 z 的影响是视觉语言扰动的 4.3 倍
· 真机 9 任务均值 47.2% vs π0.5 的 29.4%;插座插拔 85% vs 60%;扩展卡插槽 25%,而 ACT 和 π0.5 双双 0%
· 仿真 20 任务 63.8% vs 44.0%

这篇论文不是什么

92.3% 是约 32 个候选池内的 top-1,作者自己写明不等于全库检索。方法要求每个夹爪手指都装自研视触觉传感器,配自建多平台语料和数据质量校验流水线,不是能套在现成夹爪上的方案。真机与仿真 benchmark 大半来自同一课题组的配套报告,ALTER 只在 3 个真机任务上验证过。双臂任务成功率比单臂腰斩:73.8% → 39.4%。

对机器人 / 世界模型 / VLA 的启发

库里早有一条判断:力/触觉不能直接拼接进 VLA 状态向量,会掉点。这篇印证了它——但真正值得看的是分歧。同样承认"别硬拼",三家给出三条路:MoDE-VLA 走专用通路+稀疏路由+残差校正,把触觉叠在基础预测上;T-Rex 走频率分离,慢视觉流粗去噪、快触觉流精修;这篇则把"注入动作通路"明确列为要排除的路线,理由是那只记录已发生的接触。

争的不是要不要触觉,是触觉在哪一层、以什么形式进。半年后回看:若预测式成立,后续工作应继续在"触觉作为预测目标"上叠加而非退回反应式;若双臂那 39.4% 迟迟不动,说明预测潜在触觉在多接触点协同上还有结构性缺口。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文