全部论文
N0-Foundation:开启触觉新时代

N0-Foundation:开启触觉新时代

一句话判断

N0-Foundation:开启触觉新时代

论文解决什么问题

不同触觉硬件(光学凝胶、电容阵列、压阻皮肤)信号单位、分辨率、感应几何互不相同,建立在某种原始信号上的表示都被锁死在产生它的设备上。触觉数据规模化,卡在了"没有一种通用语言"这一步。

核心方法

硬件+数据+表征+评测全套打通,作者称是迈向"触觉智能时代"的第一步
↳ 触觉传感器是视觉式的:弹性感应层受力形变,相机拍下纹理位移图像。多数工作直接拿这张图像当触觉表示,这篇多走一步:学一个逆映射还原成每个空间位置的三轴力场(2剪切力+1压力),用力场本身做统一表示——物理接地、跨传感器统一(校准过的传感器都能映射进同一空间)、空间语义丰富(保留完整分布,不摘要成一个数)
↳ 这套表示在按/拧/抓/提/持五种接触方式差异很大的技能间保持一致,因为表示空间由物理定义,不由设备或行为定义
↳ 配套手持设备N0-TacUMI贡献57%轨迹,加5个机器人平台遥操作,汇总成3万+小时、140万episode的NeoData

实验结果

· 真机10项任务,把力场喂给动作专家比不给触觉、比拼接原始图像都好,渐进得分38.1%升到47.5%
· 增益集中在力场幅值精度上,不是接触定位精度——这一环还有提升空间
· 仿真12项任务里,双臂持续接触的任务几乎无解(最好18%-25%);Fast-WAM真机三强,仿真12项全灭

这篇论文不是什么

· 双臂协同接触任务依然大幅落后,触觉是必要不是充分条件
· 只验证过平行夹爪视触觉手指,灵巧手和非相机式传感器是未来方向
· 手持设备采到的轨迹要靠逆运动学筛查确认可执行,不是采到就能用

对机器人 / 世界模型 / VLA 的启发

跟TacWAM对比最尖锐:TacWAM说未来触觉只能做训练期监督、不能进部署期动作输入,这篇消融却显示把力场喂给部署时的动作专家收益最大——两边给出相反答案;不过TacWAM那条"触觉存在结构性时间歧义、单帧不够"的诊断,这篇的力场表示专门在片段内聚合时序上下文来应对,算是间接认领了同一个问题。跟T-Rex是同一路线:触觉需要专门的异步处理、机械拼接无效,这篇没把原始触觉图像直接拼进策略,是同一判断的又一次独立印证;T-Rex真机12项任务成功率65%、比最强基线高出30个百分点,这篇量级更大,10项任务、3万+小时数据。跟N0-VTLA是同一脉络延续:两篇用同一个NeoReal基准,N0-VTLA当时47.2%对π0.5的29.4%,这篇扩到10任务、把π0.5拉到26.5%——但也继承了N0-VTLA同样的局限:评测主要在自建基准上做,强依赖自研传感器和自建数据管线。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文