
这句话缺了一个前提:你的数据管道通没通
一句话判断
这句话缺了一个前提:你的数据管道通没通
论文解决什么问题
梁文峰在四小时投资人会议上说:「很多东西不在我们的主线上,比如3D、视频生成;又比如世界模型,跟智能的上限也没有太大的关系。」
核心方法
这话看起来是颗炸弹。极佳科技把世界模型写进公司定位,星海图有Fast-WAM,星动纪元迭代到第五代,破壳放弃VLA改押视频-动作世界模型;李飞飞的World Labs、LeCun的AMI Labs整个公司就建在这上面。
实验结果
但看他的完整排序:CoT(去年)→ Agent(今年)→ **持续学习** → 渐进奇点 → 具身智能。他还明确说:**「智能的终点可能都是具身。因为对一个正常人来讲,他的需求并不是电脑,而是人力。」**
所以他不是否定具身,是在排序——"不在主线上"指的是不在通往下一级台阶(持续学习)的主线上。
**那句话真正缺的,是一个前提:你的数据管道通没通。**
LLM的管道通了——互联网文本近乎无限,next-token预测直接把数据转成能力,中间不需要任何转换装置。这个前提下,世界模型确实是绕路。
机器人的管道没通——动作标签稀缺昂贵(星海图算过账:真机数据200-250元/小时),而视频和人类演示海量却**没有动作标签**。世界模型在这里干的是转换器的活。
有量化证据:LAWM实测,用**无动作标签**视频做世界模型预训练,效果**超过**用真实动作标签的监督预训练——动作标签会把模型绑死在特定本体上,预测下一帧学的却是可迁移的动力学。
**所以世界模型改变的不是智能的上限,是到达上限的成本。**
这个重述能不能站住?把它跟库里所有押世界模型的判断逐条比对:9条强关联全是支持或延伸,**零条矛盾**。冲突消失了——那些公司做的本来就是数据效率装置,不是"提高智能天花板的机制"。
更硬的旁证来自星海图Fast-WAM:世界模型的能力主要来自**训练时学到的表征**,不是推理时想象未来——把推理阶段的视频预测整个砍掉,效果不变、速度快4-5倍。这一点上梁文峰和星海图其实是一致的。
这篇论文不是什么
闭门会议,内容由媒体多方收集,原文写明「部分词句与原文可能略有出入」,无录音、无官方确认。最关键那句是否带限定条件(比如"在我们的资源约束下"),无从判断。
对机器人 / 世界模型 / VLA 的启发
💡真正的分歧在别处
比对里唯一一条强矛盾边不在世界模型上——是梁文峰的「智能的终点是具身」顶上了自变量机器人「做大脑不做身体」的赌注。**真问题不是要不要世界模型,是能不能只做大脑。**
还有一个没被消解的:LeCun认为LLM整条路径就是错的,JEPA式世界模型**就是**通往智能的路。那是定义澄清化解不了的真分歧——裁决时间可能比2028年还远。