全部论文
别人堆传感器,这篇全拆了

别人堆传感器,这篇全拆了

一句话判断

别人堆传感器,这篇全拆了

论文解决什么问题

这两年人形机器人操作方案拼的是「感知堆料」——机身多目相机、指尖触觉皮肤、腕部六维力/力矩传感器几乎成了标配,越堆越像给机器人装上皮肤和神经。这篇论文反着来:把这些全部拆掉,只留机器人自带的关节编码器和IMU,看纯本体感知能把操作能力推到多远。

核心方法

合规控制下的关节偏差本身就是一条隐式触觉通道,但要看得见这个信号,得先把自己发出的指令也喂给自己
↳ 顺应性PD控制下,指令关节角和实测关节角的偏差正比于力矩,任何动作都会把接触信息暴露在编码器读数里。但要重构这个偏差,策略必须把上一步指令的动作也纳入观测——这是很多足式机器人强化学习里已经存在、却很少被点破价值的设计选择
↳ 在Unitree G1上,不用相机、标记点、力/力矩传感器、触觉阵列,训出无IMU抗推行走、脚部截停足球、动态登上滑板、摸到手柄提起手提箱这四类任务
↳ 盲策略展现出真正的主动交互式感知:抬脚扫描寻找目标,碰到滑板板头/板尾改善位置估计,拖动滑板改善朝向估计——不是被动等接触,是主动制造有信息量的接触

实验结果

· 本文自己的方法(全程不给特权信息、直接用强化学习从零训练盲策略)在三项任务上都拿到高成功率:足球92.9%、滑板88.2%、手提箱83-90%
· 反面案例:如果先训一个能看到物体真值状态的"特权教师"、再蒸馏出盲学生,结果反而惨得多(31.2%、8.2%、34.6%)——蒸馏学的是教师"直奔目标"的动作,学不会教师从没展示过的主动搜索行为
· 把估计器预测反馈进观测没有稳定收益,短时本体感知历史本身通常已够用;但估计器误差在接触后依然系统性下降,证明信息确实存在
· 让策略自己调节关节刚度,能稳定把手提箱倾翻率降低4-5个百分点

这篇论文不是什么

· 这条隐式触觉通道空间分辨率极低,定义在关节层面不是接触点,精确定位天然比稠密触觉皮肤更难
· 每个状态估计器只针对训练时用的具体物体家族,不宣称类别级泛化能力
· 真机结果只是定性演示,量化数字全部来自仿真——作者自己说这证明的是可迁移,不是可靠性

对机器人 / 世界模型 / VLA 的启发

这篇和已经解读过的N0-Foundation正面对着干:N0-Foundation的核心判断是纯视觉+本体感知既暴露不出接触状态、也提供不了执行中途纠错的信号,必须显式建模力/触觉;这篇却证明,只要观测里加上一步指令这一项,本体感知本身就能当一条够用的隐式触觉通道,完成截球、蹬滑板这类高度依赖接触反馈的任务,不需要任何专门的触觉硬件。两边谁更站得住,可能取决于任务对接触信息精度的要求——这篇自己也承认这条通道分辨率很低,恰好呼应了已经解读过的Touch论文的发现:触觉分辨率值不值钱,要看它和其他反馈渠道的冗余程度。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文