全部论文
视频模型:会看运动,不懂物理

视频模型:会看运动,不懂物理

一句话判断

视频模型:会看运动,不懂物理

论文解决什么问题

V-JEPA、VideoMAE这类自监督视频基础模型内部到底学到了什么,业内一直没有系统答案——只知道下游任务效果不错,但不清楚这些表示编码了什么信息、编码在哪一层、以什么样的结构组织起来。这篇论文用逐层探针+几何分析+特征引导三件套,把这个黑箱打开来看。

核心方法

↳ 相机运动理解(15个任务)在V-JEPA 2和VideoMAE-v2上全部超过90%准确率,而且不只是线性可分——探测效果最强的中间层,单个片段的逐帧特征在表示空间里描出一条平滑连贯的曲线,说明时序推进被组织成了一条可读的几何轨迹
↳ 直觉物理(不穿模/保持恒常/连续运动/形状不变)在IntPhys2上,不管哪个模型哪一层,表现都停留在接近随机水平——不是"延迟到深层才出现",是全程都学不到
↳ 尊重这条几何轨迹的样条式引导,比两点间直线插值明显更连贯——直线插值会把表示推离真实数据流形,产生跳变或内容不匹配的画面

实验结果

· 两种预训练目标各有所长:VideoMAE-v2在相机运动上反而领先V-JEPA2;V-JEPA2在异常检测上明显反超,排名完全反转
· V-JEPA2从大模型扩到巨模型,相机运动表现反而略微下降
· 意外发现:部分单方向运动片段的特征轨迹呈正弦/振荡模式,作者坦诚没有确定解释,列为开放问题

这篇论文不是什么

· IntPhys2和UBnormal都是合成视频,不能完全排除域差距的影响
· 只测试了线性探针,非线性探针可能揭示未被读出的额外结构
· 引导实验只在一个模型、一个数据集上验证过

对机器人 / 世界模型 / VLA 的启发

这篇的核心判断(目标塑造表示擅长什么,不是整体强弱)在两篇已解读过的论文身上各有一次独立印证。JEPA-WAM换预训练目标后,相机相关表现大涨、语言条件化表现同步跌到全组最差——作者承认是目标设计的直接后果。N0-Foundation是另一种呈现:同一个任务内部多加一个潜在目标,收益集中在力场幅值精度上,接触定位精度没跟着涨——收益在任务内部也不是均匀分布的。三篇殊途同归。"学到统计规律、学不到因果结构"这条线也和PointWorld的坦承一致——它承认学到的只是相关性,不是被解耦出来的因果机制。

论文关键页

paper page
key figure

原论文入口

AI 摘要

相关方向

返回全部论文