全部论文
VGEBench:可泛化视觉探索

VGEBench:可泛化视觉探索

一句话判断

VGEBench:可泛化视觉探索

论文解决什么问题

面对一台从没见过、没有说明书的设备,人类靠"看外观猜功能→动手试→根据反馈修正猜测"这套循环就能摸索出怎么用。这个能力现有评测体系里没人专门测过——机器人基准大多靠模仿/强化学习在特定环境里训练,泛化不到没见过的设备;LLM工具调用基准又依赖显式API和文档,绕开了"没有手册"这个物理世界的核心难点。

核心方法

968个跨26类设备的3D模型,不给手册,纯靠视觉感知+交互反馈摸索操作逻辑
↳ 每个设备实例化成一个具体状态机,精确定义哪个组件对应哪个动作、触发什么状态转移;智能体每步只能看图、选动作、看反馈,系统按坐标是否落在正确组件框内、动作类型和参数是否匹配转移条件做分层校验,判定成功看有没有按顺序达成目标状态,不限定必须走哪条路径
↳ 14953个任务episode,其中10005个是多轮交互,专门考验长时程探索推理

实验结果

· 最强模型Gemini-3-Flash成功率54.27%,第二名骤降到16.68%,其余全部模型不到15%
· 反例:MiMo-Embodied-7B导航效率全场最高(0.88,超过Gemini-3-Flash),任务成功率却只有1.48%——真正的瓶颈是精确定位交互组件,不是找对视角(定位误差差距63.9%,导航差距只有12.5%)
· 即便是最强模型,"一次做对"的比例只有12.94%,允许试错的成功率却高达62.86%——靠的是反复摸索,不是看一眼就懂

这篇论文不是什么

· 这是渲染视图+离散动作+固定视角的抽象仿真,不是真实机器人的连续控制,不完全覆盖物理部署的sim-to-real挑战
· 观测是干净的设备居中渲染图,不含真实背景/光照/遮挡,扰动测试不能完全替代真实场景
· 3D素材来自公开网站,作者自己承认无法排除闭源模型预训练时见过相关素材的可能

对机器人 / 世界模型 / VLA 的启发

最有意思的一条线:"给系统更多信息/更长上下文不是无条件的好事"这个判断,在完全不同的领域反复被独立证实。这篇发现更长的交互历史只对强模型有用,弱模型反而在短历史下表现更好——因为弱模型分不清有用反馈和历史噪声。这和之前解读过的几篇工作是同一个方向:What Matters for Latent Actions里,更懂运动的光流表示反而拖累效果;TacWAM发现让辅助模态"可见"比缺少信息损失更大;FLEX-π强调关键机制是强制重建缺失流本身,不只是"看过更多模态"。跨语言模型、触觉表示、潜在动作、VLM智能体四个不同领域,同一个判断反复出现:接收方有没有能力筛选和整合信息,比给多少信息更重要。另外,这篇对"没手册的探索能力"的定位判断,也呼应了另一条更大的判断——世界模型在机器人领域比在语言模型领域更被需要,隐含的前提正是机器人的"数据管道"还没打通,需要额外的桥,而不是像LLM那样可以绕过去。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文