
遥操作数据的噪声得进损失函数
一句话判断
遥操作数据的噪声得进损失函数
论文解决什么问题
现有 VLA 要么面向双臂低自由度夹爪,要么面向单臂灵巧手。于是两类任务无解:本质需要双臂协调的(活塞插入),和需要高自由度手指的(开瓶盖、从塞满的书架抽书)。Dexora 是双臂双手 36 自由度,两只 6 自由度手臂配一对 12 关节全驱动的手。
核心方法
大臂用定制外骨骼背包采肩肘腕角度直接映射关节空间,手指用 Apple Vision Pro 的无标记 3D 骨架重定向,避开了纯视觉重定向常见的逆运动学抖动和奇异点。同一套接口同时驱动实体机器人和 MuJoCo 数字孪生,20Hz 时间对齐。
实验结果
遥操作数据质量参差是常识,但这篇把它做成了训练目标的一部分。做法分三步:先按运动学平滑度(加速度和 jerk 的 RMS)预筛,再回放验证保留无碰撞且完成任务的片段,得到约 15% 的高质量子集;然后用仿真预训练好的策略给每个片段算一个"被策略解释得多好"的分数;最后以那 15% 为正样本、其余为未标注池训判别器,输出的分数转成加权扩散损失。
消融是双向的:成功率 85%→95%、55%→80%,关节加速度和 jerk 同步下降,失败还能定位到具体关节——无判别器时左手第 5 关节高频振荡导致玉米掉落。
这篇论文不是什么
基线对比不完全对等:π0 需外接 2 层 MLP 投影器把输出升到 36 维,那 26.7% 里有多少来自这层临时适配没有区分;GR00T N1 用的是 6 自由度设定。真机数据规模文中出现两种口径,177.5 小时对 40.5 小时。标题主打开源,但正文里找不到仓库地址、许可证或释出时间。全程没有触觉,指尖垫硬且摩擦低会打滑,作者自己把触觉列为首要未来方向。
对机器人 / 世界模型 / VLA 的启发
最值得单独拎出来的是那个判别器。它不需要人工标注质量——用一个已经训好的策略当尺子,去量每条演示"有多像它认得的动作",再把这个分数变成训练权重。这套思路对任何靠人采数据的系统都可复用,而且和另一条判断是同构的:数据稀缺时别让一个模型同时学好几件事,能拆出去的就拆出去,质量筛选也算一件。
另一处是分歧。这篇的结论是仿真只能引导基础技能,灵巧能力必须靠真机数据——纯仿真在灵巧任务上接近于零。而另一条路线赌的正相反:预训练几乎不用真机数据,部署后靠失败重试加少量真机强化学习补齐。两边都有实证,赌的是"灵巧度到底能不能被仿真出来",这个半年内应该能看出走向。
论文关键页

