结论:三个最接近候选,0 个完成模拟器五道闸。交互渲染、3D 导出和真实机器人短任务都在进步,但尚未证明生成式世界模型能输出跨视角、长时、物理可信且可迁移的可计算状态。Q3 维持 65%。

模拟器五道闸

1 · 显式状态

输出可由程序查询的几何、尺度、材质、速度、碰撞与约束,而不只是像素。

2 · 跨视角与长时一致

离开视野再返回、改变观察角度或延长轨迹后,同一对象与状态仍一致。

3 · 行动条件因果

同一初态下改变动作,后果按稳定动力学变化,而非只生成视觉上合理的下一帧。

4 · 物理约束

几何、碰撞、重力、刚体/软体/流体等规律可测,不以“看起来像”替代。

5 · Sim-to-real

在模拟器中训练或规划的策略,能以公开成功率、失败类型和安全边界迁移到真实环境。

三个候选

为什么漂亮视频不够

VBench-2.0 明确区分表面逼真与 intrinsic faithfulness:生成视频可以视觉连贯,却违反物理、常识、解剖或组合约束。视频分数提升只能证明 renderer 变好,除非同时通过状态和物理测试。

从模拟器到科学发明,还差“提出新框架”

Tom Zahavy 的立场论文《LLMs can’t jump》把科学发现拆成归纳、演绎与溯因,并主张当前文本 LLM 缺少从感知经验到新公理的 manipulative abduction。这个框架提示:通过上述五道模拟器闸仍不是终点;系统还要主动提出问题、干预环境、生成反事实、创造候选概念,并把新公理转化为可否证预测。

可采用

当前多数自动科研系统擅长在给定表示、目标和奖励内搜索;“优化已知框架”和“发明新的问题表述与概念原语”应分开验收。

不能采用

该文是 position paper,没有不可能性定理或受控实验,不能证明 LLM 永远无法原创发现。爱因斯坦也并非在无知识、无约束下凭空跳跃;麦克斯韦理论、狭义相对论、马赫思想、黎曼几何、合作与多年失败都进入了搜索过程。

新增第六道研究闸

在信息截止、无答案泄漏的任务中,系统能否提出训练语料中不存在的候选解释,设计能区分候选的干预实验,经真实数据否证后修订,并由独立专家确认概念和预测均有新增量。

当前结算

Genie 2:1/5 部分命中;Marble:1/5 明确、其余未公开;V-JEPA 2-AC:sim-to-real 有窄域正证据,但缺 simulator 状态合同。三者均标 BLOCKED,不做总分排名。

唯一允许升级的数据包

同一生成世界公开可查询状态与物理参数;通过多视角、遮挡返回、长轨迹和干预反事实测试;与真实传感器轨迹校准;并让至少三类真实任务报告迁移成功率、失败、接管、安全事件和单位训练成本。字段不足只能说 renderer/结构/规划分别进步。

来源