当前结论:没有证据证明 Transformer 已经技术死亡,也没有单一路线完成全面替代。替代架构对长序列成本和流式状态提出了真实改进,但规模、生态、硬件优化和通用质量仍由 Transformer 占优;当前“混合架构优先”的先验更稳妥。

判断Transformer 的经济瓶颈比技术死亡更确定
置信度65% · 中
最强支持Mamba、RWKV、xLSTM、Hyena 均展示线性或亚二次序列路线
最强反证跨论文缺少统一数据、训练 FLOPs、硬件和任务口径
承认错误条件某一路线在 10B+ / 100B+、多领域和单位成功任务成本上被独立复现并持续胜出

证据坐标 E-001 至 E-005 →

比较矩阵

路线 核心机制 训练并行 推理状态 长序列 论文规模 当前优势 主要缺口
Transformer 全局自注意力 KV cache 随上下文增长 标准 O(L²) 超大规模最充分 通用质量、生态、硬件优化 长上下文成本、KV cache、持续状态
Mamba 选择性 SSM + scan 固定状态递归 O(L) 原论文至 2.8B 论文报告 4–5× 生成吞吐、长序列 超大规模与复杂检索任务验证不足
RWKV 时间混合 + RNN 推理 常数计算/内存状态 O(L) 原论文至 14B 流式推理、低状态成本 训练生态、现代独立评测、状态压缩损失
xLSTM 指数门控;标量/矩阵记忆 mLSTM 强;sLSTM 弱 循环状态 O(L) 论文 scaling;独立大模型较少 显式记忆、循环推理 sLSTM 串行性、内核与规模复现
Hyena 隐式长卷积 + 门控 卷积/状态实现 亚二次 论文主要至 355M 论文报告约 20% 训练 FLOPs 节省 超大规模、生成部署、生态

各路线能证明什么

Mamba

原论文在 Pile 训练与零样本任务中报告同尺寸优于 Transformer、Mamba-2.8B 匹配更大 Transformer,并报告约 4–5 倍生成吞吐。它证明选择性 SSM 值得认真研究,不证明全部现代大模型任务已经胜出。

RWKV

原论文把并行训练与循环推理结合并扩展到 14B,强调推理时计算和内存状态不随上下文增长。它证明部署形态有吸引力,仍需更强独立评测和生态验证。

xLSTM

原论文以指数门控和矩阵记忆现代化 LSTM,并报告相对 Transformer 与 SSM 的有利 scaling。mLSTM 可并行,sLSTM 仍带串行限制。

Hyena

原论文在 355M / The Pile 条件下报告以约 20% 更少训练 FLOPs 匹配 Transformer perplexity,证明长卷积可逼近注意力;规模证据明显弱于 Transformer。

新增机制证据:受控任务中的贝叶斯推理

哥伦比亚大学研究者构建“Bayesian wind tunnels”:每条序列使用新采样的潜变量, 真实后验有闭式解,假设空间大到不能靠记忆覆盖。在双射消除、HMM 状态跟踪、贝叶斯回归和关联回忆中,约 2–3M 参数的小型 Transformer 能逼近完整后验;对照架构能实现的推理原语不同。

机制解释

论文把贝叶斯计算拆成信念累积、信念传递和随机访问绑定。 Transformer 在这些受控配置中覆盖三者;Mamba 擅长累积与传递, 但随机访问绑定较弱;注意力的 query-key 路由为按内容检索历史位置提供了直接机制。

可以推出

Transformer 架构具备实现精确贝叶斯更新的能力;其优势不只来自规模, 注意力、残差流和前馈网络的组合在特定任务中形成可诊断的概率推理几何。

不能推出

这不证明大型语言模型在自然语言、开放世界或 Agent 任务中普遍按贝叶斯最优方式推理。 作者明确承认实验只有 2–3M 参数、低维潜变量和受控合成任务; 同类几何是否存在于大型预训练模型仍是开放问题。

为什么不能排总榜

下一轮必须补的证据

统一参数、训练 token、数据、硬件与训练 FLOPs 的第三方比较;10B+ 规模复现;长上下文精确召回与状态压缩损失;真实代码/Agent 任务;最终比较指标应是单位成功任务成本,而不是单项 loss。

原始来源

  1. Vaswani et al., Attention Is All You Need
  2. Gu & Dao, Mamba
  3. Peng et al., RWKV
  4. Beck et al., xLSTM
  5. Poli et al., Hyena Hierarchy
  6. Dalal & Misra, The Bayesian Geometry of Transformer Attention