全部论文
跨本体迁移该在经验层做

跨本体迁移该在经验层做

一句话判断

跨本体迁移该在经验层做

论文解决什么问题

机器人数据的三条老路各有短板:真机采集贵,仿真有视觉 sim-to-real gap,从人类视频学则主要学到视觉表征而不是可执行的演示。这篇提出第四条:把人类经验翻译成机器人可学的数据。

核心判断是跨越本体鸿沟要迁移的是结构化经验,不是像素。人类视频里编码的目标、状态转移和 affordance 结构,很大程度上独立于人的形态。

核心方法

↳ ① 五级流水线,任务图 → 层级 affordance 潜变量 → 跨本体图翻译 → 物理约束验证 → 经验渲染。本体迁移因此变成图变换问题,而不是外观生成问题。
↳ ② 不变量选的是 affordance,不是物体身份或位姿。作者先排除三个候选:机器人位姿依赖本体,人类骨架同样依赖形态,物体身份无法泛化到新实例。
↳ ③ 生成器只管多样性,可行性交给独立验证器。违反逆运动学、碰撞或关节限位时,验证器产出结构化误差信号回灌,最多重试五轮。

实验结果

换五种数据源做对照:图条件化生成相对人类视频特征提升 25.8%,相对仅用文本 prompt 生成提升 13.5%。作者据此说增益来自图结构,不是视频生成模型本身。图组件逐个去掉也一致:去掉约束图,可执行性掉得最多。

这篇论文不是什么

这篇的可信度要打折扣,原因不止一条。生成的轨迹从未在真机上执行过——所谓物理有效性来自作者自建验证器的离线检查,作者也承认它只管运动学不管完整接触动力学。核心指标是自定义的,其中任务正确率由 VLM 参与判定,等于评判方和生成方同源。跨本体主表里五个本体的抓取稳定性一列全是 100%,而同表其他列都有正常波动。整条流水线的生成环节依赖商用视频生成 API,未讨论可复现性与成本。另外正文里出现了面向审稿人的表述,这在正式论文中不常见。

对机器人 / 世界模型 / VLA 的启发

撇开数字看方法,有一处真分歧值得记。另一篇工作主张:与其让策略泛化到没见过的情况,不如先用基元把世界推回策略的分布内——改变的不是模型的泛化能力,是它被调用时所处的状态。这篇正好相反,主张用 affordance 组合让模型自己推出没见过的物体该怎么操作。

两条路都在回答同一个问题,答案指向两端。一边把不确定性挡在策略之外,一边要求策略具备组合推理能力。前者工程上更可控,后者上限更高但难验证——而这篇恰恰缺少真机执行来支撑后者。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文