
T-Rex:触觉为何要单独建模
一句话判断
T-Rex:触觉为何要单独建模
论文解决什么问题
很多机器人团队接入触觉时,第一反应是:多了一种传感器,把它和图像、语言、关节状态拼在一起训练不就行了?
核心方法
T-Rex给出的答案是:很可能不行。触觉不是另一张图片。
实验结果
视觉主要处理“物体是什么、目标在哪里、下一步大概要做什么”;触觉处理的却是接触瞬间的压力、滑动、形变和受力变化。前者偏低频语义推理,后者要求高频、局部、近乎反射式的闭环修正。一个以视觉数据为主训练出来的模型,即使接口上能输入触觉,也不等于真正学会使用触觉——新信号可能被视觉特征淹没,甚至反过来拖累策略。
T-Rex因此没有把触觉机械塞进视觉主干,而是专门为它建了一套通路:
① 慢速视觉动作专家负责理解场景、语言指令和粗粒度动作;
② 快速触觉专家绕开慢速视觉推理链,依据高频接触反馈修正精细动作;
③ 触觉内部仍继续拆分:动态力用时序编码,表面形变用空间编码,分别回答“力怎样变化”和“接触发生在哪里”。
这不是孤立的架构偏好。知识库中另一项独立研究发现,力/触觉信号直接拼进VLA状态向量会降低性能;另一些工作也转向专用编码器和专用通路。多个团队从不同实验走向同一方向:触觉难的不是有没有数据,而是以视觉为中心的表征和时间尺度很难直接、稳定地吸收它。
T-Rex的数据配方同样体现了分工:先用2.29万小时人类第一视角视频建立视觉与动作先验,再用约100小时机器人触觉数据做grounding,最后针对技能后训练。不是所有数据从第一天就混在一起,而是不同数据分别解决“理解世界”和“对齐触觉控制”。
实测中,T-Rex在12项真实任务上平均成功率达到65%,比最强基线高出30个百分点以上,并通过消融验证了触觉编码方式的独立贡献。
这篇论文不是什么
它还没有证明跨本体、家庭或产线环境的泛化;实验基于单一平台和受控环境,65%也是作者自评测,尚无第三方复现。
对机器人 / 世界模型 / VLA 的启发
💡真正的路线判断
统一机器人系统,不等于所有模态都必须塞进同一个编码器、使用同一个频率和同一种表征。
更可能的架构是:各类物理信号先按自身性质形成专门神经通路,再在动作决策或共享潜空间中协同。机器人可以拥有统一的大脑,但未必只能拥有一种感觉通路。
更深一层看,T-Rex的三阶段训练也在呼应知识库中另一条反复出现的路线:海量人类视频先建立物理与动作先验,少量机器人数据负责最终对齐。真正稀缺的未必只是动作标签,而是怎样把规模更大的“非动作数据”转化为可执行能力。