当前判断:下一代能力未必来自一个单独的新主干网络。架构创新与检索、记忆、工具、验证器、执行环境的复合,可能比“完全替代 Transformer”更早改变能力边界。
SSM / Mamba 类:线性序列扩展、状态压缩和流式处理。
现代循环网络RWKV、xLSTM 等:持久状态、低延迟和长序列效率。
长卷积Hyena 类:以隐式长卷积降低全注意力成本。
图神经网络适合分子、关系网络、物理系统和组合结构。
生成动力学扩散、流模型、世界模型和 JEPA 类方法,覆盖生成、规划与环境表征。
神经符号把神经学习与规则、程序、搜索和形式验证结合。
复合系统模型 + 检索 + 记忆 + 工具 + 验证器 + 执行环境。
统一比较标准
质量、训练成本、推理成本、长序列能力、持续状态、硬件适配、生态成熟度、可解释性和真实任务成功率。
024 分类修正
世界模型描述能力目标,不是与 Transformer 同层的主干架构。后续技术地图改为二维:主干架构 × 能力目标/训练范式。查看审计 →
025 模拟器闸门
交互 renderer、结构化 3D 输出和 planner 必须分别结算。只有显式状态、长时一致、行动因果、物理约束与 sim-to-real 同时成立,才升级为 simulator。查看审计 →
026 训练效用闸门
生成世界数量不等于真实 Agent 增益。必须比较有/无生成世界训练后的真实成功率、失败、样本效率、安全事件与完整迁移成本。查看审计 →
027 注意力路线反向实验(2026-08-03)
同一约束下两家一线公司走出相反方向:月之暗面发布 Kimi Linear(KDA 3:1 混合,48B/1.4T 公平对照、MIT 开源,自称首次全面不输全注意力,E-018);MiniMax M2 却从 M1 的混合线性回归 62 层全注意力,官方给出评测瓶颈、长上下文退化、RL 精度、基建不成熟四条一手理由,并预判算力放缓后线性收益将显现(E-019)。据此把判断拆两层:中期(2-3 年)混合/线性进入主流生产系统维持 65%;当前旗舰生产系统仍以全注意力为主,新增子判断 85%——注意 Kimi 自己的 K2/K2.5 主线也未采用 KDA,实验线与主线的距离是比演讲更诚实的信号。跟踪变量:Kimi 主线是否吸收 KDA、MiniMax M3+ 是否重新引入线性/稀疏、FLA/vLLM 生态真实采用率、E-018 是否被独立复测。