
闭的是运动学的环,不是物理的环
一句话判断
一段手机视频合成的数据,真机 62.5%,反超真机采集的 46.7%
论文解决什么问题
现有数据生成路线的门槛都卡在硬件上:轨迹变换要真机加遥操,仿真增广要调仿真器。Video2Robo 把输入压到最低一档——不要本体、不要仿真器、不要遥操、不要深度相机,手机拍一段单目 RGB 就够。
核心方法
↳ ① 技能被重新定义成物体间的相对运动,绕开人手到夹爪的重定向。倒水、清扫的核心就在物体相对位移里,动作分段靠物体间距离低于 3cm 判定。
↳ ② 6D 追踪全靠现成模型串:CoTracker3 追像素,TRELLIS 从单视图生成物体 3DGS,再吃 3DGS 可微的性质逐帧优化位姿。生成式 3DGS 无绝对尺度,靠 VGGT 的单目深度补。
↳ ③ 四类增广逐帧施加:物体重排、桌面背景纹理、光照、虚拟相机扰动。
实验结果
· 单目 6D 定位 BOP AR 均值 78.41,最强基线 MegaPose 68.13。
· 生成单条演示平均 5.23 秒(SkillGen 8.88、MimicGen 17.23),成功率六任务全 100%,基线掉的点是穿模滑脱。
· 真机 Franka 六任务:只变物体位姿 62.50% vs 真机采集 46.67%;再叠纹理背景光照视角,58.33% vs 27.50%,两个仿真增广基线只剩 5.83% 和 2.50%。
这篇论文不是什么
它避免穿模不是因为算得更准,是因为不做碰撞求解。耦合运动是脚本化的运动学流程,没有接触力、摩擦、质量、惯量。论文自陈只支持刚体,抓取位姿仍靠人工标注;免标定的前提也是先把相机桌面粗摆成合成布局,验证只在单臂桌面六任务上做。
对机器人 / 世界模型 / VLA 的启发
这篇的路线赌注跟最近几项工作正面对立。LeapBot-WA 主张世界建模的效用在抽象物理预期而非照片级渲染;Genesis 官方博客把仿真定位成评估引擎而非数据生成器;《From Passive Video to Editable Experience》主张本体鸿沟该在经验层弥合。而 Video2Robo 全反着来,真机数字还赢了。
它自己也没把话说满:论文写"不支持可变形物体,因为需要从视频学动力学模型",等于承认渲染替代不了物理。所以这不是对错之争——在桌面刚体这个带宽里,渲染加运动学脚本确实够用。
还有一条三方分歧:人类视频怎么用。Video2Robo 追物体相对运动,CAIP 追手部姿态,JoyAI-RA 0.5 学跨本体潜在动作空间。
半年后回看的锚点:能不能爬出桌面刚体。扩到接触密集装配、柔性、双臂还成立,"不需要物理"就成立;扩不出去,那 62.5% 说明的只是任务对物理不敏感。
论文关键页

