结论:四类最接近证据,0 个闭合“生成世界 → 真实 Agent 增益”因果链。生成环境、想象训练和真实机器人规划分别成立,但公开材料没有同一任务下加入生成世界前后的真实成功率、失败与成本对照。Q3 维持 65%。
唯一有效的因果链
输入
明确哪些训练轨迹来自生成世界,数量、覆盖范围与生成成本可核验。
对照同一策略、真实数据、算力与训练预算下,有生成世界 vs 无生成世界。
输出真实任务成功率、失败类型、接管、安全事件、样本效率和迁移成本同时披露。
四类候选为何不能结算
- Genie 2:展示 SIMA 在生成环境中行动,并称可用于未来训练与评估;没有公开“用 Genie 训练后”在真实或独立环境中的前后对照。
- RoboGen:可自动提出任务、生成场景与训练监督,证明生成式仿真流水线可运行;公开摘要没有给出真实机器人迁移成功率与失败账本。
- V-JEPA 2-AC:在两个实验室的真实 Franka 机械臂上有零样本抓取/放置正证据;但训练来自互联网视频与不到 62 小时真实机器人视频,不是生成世界数据,不能拿来证明 synthetic world 有效。
- DreamerV3:在学习到的环境模型内想象未来,并跨 150 多个任务胜出;这证明 latent imagination 能提高模型式强化学习,不等于外部生成环境能跨过 sim-to-real。
三种禁止偷换
- 生成场景数量 ≠ 有效训练覆盖;重复或错误物理可能放大偏差。
- 在生成世界内得分提高 ≠ 真实世界迁移提高。
- 真实机器人成功 ≠ 成功来自生成数据;必须做数据来源消融。
当前判断
“无限合成环境”目前是供给能力和研究方向,不是已经兑现的 Agent 价值。最可能先兑现的用途是稀有场景覆盖、危险事件复现和评测扩容,但这仍需真实任务对照。当前四类证据全部标 BLOCKED,不调整 Q3。
唯一允许升级的数据包
至少三个独立真实流程,随机或严格匹配比较 real-only、real+传统模拟、real+生成世界;公开真实成功率、长尾失败、接管、安全事件、所需真实样本、合成生成/筛选/训练成本与复现实验。只有真实增益覆盖新增成本和风险,才把生成世界结算为生产资产。