当前判断:下一代能力未必来自一个单独的新主干网络。架构创新与检索、记忆、工具、验证器、执行环境的复合,可能比“完全替代 Transformer”更早改变能力边界。

当前判断近期更可能出现混合架构与复合系统,而非单一路线全面替代
置信度65% · 中
最近变化2026-08-03:注意力路线出现同期反向实验(E-018 vs E-019),判断拆为中期方向与当前现状两层
最强正证据E-018:Kimi Linear 在 48B/1.4T 公平对照下首个自称全面胜出(权重开源可复测)
最强反证E-019:MiniMax M2 从混合线性回归全注意力的生产回退与四条一手理由
承认错误条件2027 年中前无一线实验室把混合线性用于旗舰主线 → 降至 50% 以下;Kimi 主线吸收 KDA 且长任务可靠性不降 → 上调至 75%+;第三方复测推翻 E-018 → 降级重估

查看证据坐标 →

状态空间模型

SSM / Mamba 类:线性序列扩展、状态压缩和流式处理。

现代循环网络

RWKV、xLSTM 等:持久状态、低延迟和长序列效率。

长卷积

Hyena 类:以隐式长卷积降低全注意力成本。

图神经网络

适合分子、关系网络、物理系统和组合结构。

生成动力学

扩散、流模型、世界模型和 JEPA 类方法,覆盖生成、规划与环境表征。

神经符号

把神经学习与规则、程序、搜索和形式验证结合。

复合系统

模型 + 检索 + 记忆 + 工具 + 验证器 + 执行环境。

统一比较标准

质量、训练成本、推理成本、长序列能力、持续状态、硬件适配、生态成熟度、可解释性和真实任务成功率。

024 分类修正

世界模型描述能力目标,不是与 Transformer 同层的主干架构。后续技术地图改为二维:主干架构 × 能力目标/训练范式。查看审计 →

025 模拟器闸门

交互 renderer、结构化 3D 输出和 planner 必须分别结算。只有显式状态、长时一致、行动因果、物理约束与 sim-to-real 同时成立,才升级为 simulator。查看审计 →

026 训练效用闸门

生成世界数量不等于真实 Agent 增益。必须比较有/无生成世界训练后的真实成功率、失败、样本效率、安全事件与完整迁移成本。查看审计 →

027 注意力路线反向实验(2026-08-03)

同一约束下两家一线公司走出相反方向:月之暗面发布 Kimi Linear(KDA 3:1 混合,48B/1.4T 公平对照、MIT 开源,自称首次全面不输全注意力,E-018);MiniMax M2 却从 M1 的混合线性回归 62 层全注意力,官方给出评测瓶颈、长上下文退化、RL 精度、基建不成熟四条一手理由,并预判算力放缓后线性收益将显现(E-019)。据此把判断拆两层:中期(2-3 年)混合/线性进入主流生产系统维持 65%;当前旗舰生产系统仍以全注意力为主,新增子判断 85%——注意 Kimi 自己的 K2/K2.5 主线也未采用 KDA,实验线与主线的距离是比演讲更诚实的信号。跟踪变量:Kimi 主线是否吸收 KDA、MiniMax M3+ 是否重新引入线性/稀疏、FLA/vLLM 生态真实采用率、E-018 是否被独立复测。