结论:世界模型不是 Transformer 的同层替代品。它描述系统要学习空间、时间、状态转移与行动后果;Transformer、状态空间模型、循环网络、扩散或 JEPA 则是可参与实现的架构与训练范式。Q3“混合架构与复合系统优先”维持 65%。

三层必须拆开

能力目标

从观察推断隐状态,预测世界如何随时间和行动变化,并支持渲染、模拟或规划。这回答“系统要会什么”。

训练与表征范式

像素生成、latent diffusion、JEPA 表征预测、自监督视频学习、模型式强化学习等。这回答“学什么目标、在什么空间预测”。

底层架构

Transformer、卷积、循环网络、状态空间模型及其混合。这才回答“用什么网络计算”。把前三者并列成替代架构,是类别错误。

三个反例

功能也不是一个东西

World Labs 将当前世界模型拆为 renderer、simulator、planner:分别输出观察、状态和行动。渲染得漂亮不代表物理正确,能规划短动作也不代表拥有可靠模拟器。评测必须按功能合同分开。

判断修正

Q3 不再把“世界模型”放在 Mamba、xLSTM、Hyena 旁边当作同层候选。正确技术地图是二维的:横轴放主干架构,纵轴放能力目标与训练范式;世界模型可能横跨多种架构,并与语言模型、记忆、规划器、物理引擎组成复合系统。

唯一允许改变判断的数据包

若某个非 Transformer 主干在同一世界建模任务上,以近似数据、参数、算力和硬件,跨规模持续胜出,并同时改善几何/物理一致性、长时状态、行动条件预测、延迟与成本,才允许把“世界模型进展”结算为“替代架构进展”。

来源