全部论文
尺度不是模型给的,是机器人给的

尺度不是模型给的,是机器人给的

一句话判断

让机器人拿自己当尺子,重建误差 3.31mm,生成式模型差了近 5 倍

论文解决什么问题

常规 real2sim 流程在低成本平台上直接断掉。作者在 ALOHA2 上实测:COLMAP 在多相机间给不出一致解;SAM2 能分场景物体,却分不出机械臂——大面积单色、铰接变形、夹爪开合时外观剧变。可用的只有 4 路 RGB,两路还装在动的手腕上。

核心方法

↳ ① SplatMesh:三角网格管几何、3DGS 管外观,高斯钉在网格面上随网格变形。球面网格 642 顶点起步,只形变顶点,连通性不变。
↳ ② 面元约束:高斯协方差与面法向对齐,法向尺度 clamp 到 float32 机器精度。去掉它 PSNR 从 30.91 掉到 25.82——无约束高斯会靠背景色或近全透明凑数。
↳ ③ 可微渲染 + 可微物理(MuJoCo MJX)串成一条链,像素误差的梯度同时反传到网格顶点、相机位姿和关节角。

实验结果

· 真机 YCB 几何误差(√CD):蓝金枪鱼罐头 3.31mm,本体感知基线 13.92,对齐尺度后的 TRELLIS 16.17。
· 标定:关节角加噪 0.01 弧度,工具位姿误差 10.9mm 修到 3.79mm。
· 单物体重建约 157 秒(H100),资产烘贴图后可直接进 MuJoCo。

这篇论文不是什么

物理是接进来了,但论文写明本文只用到物体重建与运动学,接触力和动力学辨识没做。网格只能与初始化拓扑同胚——球起步就只能是球,带孔洞或把手的不行。MJX 下只支持刚体,3DGS 也不能重光照,物体一挪光影就不对。标定是 sim-to-sim 加人造噪声,真机 PSNR 也做了额外的位姿对齐。

对机器人 / 世界模型 / VLA 的启发

上一篇 Video2Robo 的赌注是用运动学加照片级渲染绕开物理,这篇反着来。有意思的是同一条判断被两篇拉到两边:LeapBot-WA 主张世界建模的效用在抽象物理预期而非照片级渲染——Video2Robo 跟它对着干,这篇印证它。

尺度这条线串起来了。D4RT 的输出是 up-to-scale 不是 metric;Video2Robo 靠 VGGT 的单目深度补;这篇把 MJX 的运动学接进优化环,机器人自己的机械尺寸就是那把尺子——所以它敢说 metrically accurate,而 TRELLIS 连尺度和位姿都不给。

但两篇的天花板是同一块:都只支持刚体。

半年后回看的锚点:0.01 弧度的标定误差能修到 3.79mm,0.03 弧度只修到 18.5mm,作者没讨论这个衰减。接触密集任务吃不吃得下一两厘米的残留误差,是这条路线能不能真当物理底座的分水岭。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文