全部论文
这句话缺了一个前提:你的数据管道通没通

这句话缺了一个前提:你的数据管道通没通

一句话判断

这句话缺了一个前提:你的数据管道通没通

论文解决什么问题

梁文峰在四小时投资人会议上说:「很多东西不在我们的主线上,比如3D、视频生成;又比如世界模型,跟智能的上限也没有太大的关系。」

核心方法

这话看起来是颗炸弹。极佳科技把世界模型写进公司定位,星海图有Fast-WAM,星动纪元迭代到第五代,破壳放弃VLA改押视频-动作世界模型;李飞飞的World Labs、LeCun的AMI Labs整个公司就建在这上面。

实验结果

但看他的完整排序:CoT(去年)→ Agent(今年)→ **持续学习** → 渐进奇点 → 具身智能。他还明确说:**「智能的终点可能都是具身。因为对一个正常人来讲,他的需求并不是电脑,而是人力。」**

所以他不是否定具身,是在排序——"不在主线上"指的是不在通往下一级台阶(持续学习)的主线上。

**那句话真正缺的,是一个前提:你的数据管道通没通。**

LLM的管道通了——互联网文本近乎无限,next-token预测直接把数据转成能力,中间不需要任何转换装置。这个前提下,世界模型确实是绕路。

机器人的管道没通——动作标签稀缺昂贵(星海图算过账:真机数据200-250元/小时),而视频和人类演示海量却**没有动作标签**。世界模型在这里干的是转换器的活。

有量化证据:LAWM实测,用**无动作标签**视频做世界模型预训练,效果**超过**用真实动作标签的监督预训练——动作标签会把模型绑死在特定本体上,预测下一帧学的却是可迁移的动力学。

**所以世界模型改变的不是智能的上限,是到达上限的成本。**

这个重述能不能站住?把它跟库里所有押世界模型的判断逐条比对:9条强关联全是支持或延伸,**零条矛盾**。冲突消失了——那些公司做的本来就是数据效率装置,不是"提高智能天花板的机制"。

更硬的旁证来自星海图Fast-WAM:世界模型的能力主要来自**训练时学到的表征**,不是推理时想象未来——把推理阶段的视频预测整个砍掉,效果不变、速度快4-5倍。这一点上梁文峰和星海图其实是一致的。

这篇论文不是什么

闭门会议,内容由媒体多方收集,原文写明「部分词句与原文可能略有出入」,无录音、无官方确认。最关键那句是否带限定条件(比如"在我们的资源约束下"),无从判断。

对机器人 / 世界模型 / VLA 的启发

💡真正的分歧在别处

比对里唯一一条强矛盾边不在世界模型上——是梁文峰的「智能的终点是具身」顶上了自变量机器人「做大脑不做身体」的赌注。**真问题不是要不要世界模型,是能不能只做大脑。**

还有一个没被消解的:LeCun认为LLM整条路径就是错的,JEPA式世界模型**就是**通往智能的路。那是定义澄清化解不了的真分歧——裁决时间可能比2028年还远。

原论文入口

AI 摘要

相关方向

返回全部论文