结论:世界模型不是 Transformer 的同层替代品。它描述系统要学习空间、时间、状态转移与行动后果;Transformer、状态空间模型、循环网络、扩散或 JEPA 则是可参与实现的架构与训练范式。Q3“混合架构与复合系统优先”维持 65%。
三层必须拆开
能力目标
从观察推断隐状态,预测世界如何随时间和行动变化,并支持渲染、模拟或规划。这回答“系统要会什么”。
训练与表征范式像素生成、latent diffusion、JEPA 表征预测、自监督视频学习、模型式强化学习等。这回答“学什么目标、在什么空间预测”。
底层架构Transformer、卷积、循环网络、状态空间模型及其混合。这才回答“用什么网络计算”。把前三者并列成替代架构,是类别错误。
三个反例
- Genie 2:是 action-controllable 世界模型,也是自回归 latent diffusion;官方明确其动力学核心仍是 large transformer。它扩展 Transformer 的用途,不构成替代证据。
- V-JEPA 2:用联合嵌入预测学习世界表征;其 action-conditioned 世界模型仍是 3 亿参数 transformer,并采用 block-causal attention。JEPA 的新意主要在目标与表征空间,不等于放弃 Transformer。
- DreamerV3:学习环境模型并在想象中改进策略,证明世界模型也可从模型式强化学习路线实现;“世界模型”因此比任何单一主干架构更宽。
功能也不是一个东西
World Labs 将当前世界模型拆为 renderer、simulator、planner:分别输出观察、状态和行动。渲染得漂亮不代表物理正确,能规划短动作也不代表拥有可靠模拟器。评测必须按功能合同分开。
判断修正
Q3 不再把“世界模型”放在 Mamba、xLSTM、Hyena 旁边当作同层候选。正确技术地图是二维的:横轴放主干架构,纵轴放能力目标与训练范式;世界模型可能横跨多种架构,并与语言模型、记忆、规划器、物理引擎组成复合系统。
唯一允许改变判断的数据包
若某个非 Transformer 主干在同一世界建模任务上,以近似数据、参数、算力和硬件,跨规模持续胜出,并同时改善几何/物理一致性、长时状态、行动条件预测、延迟与成本,才允许把“世界模型进展”结算为“替代架构进展”。