当前结论:没有证据证明 Transformer 已经技术死亡,也没有单一路线完成全面替代。替代架构对长序列成本和流式状态提出了真实改进,但规模、生态、硬件优化和通用质量仍由 Transformer 占优;当前“混合架构优先”的先验更稳妥。
比较矩阵
| 路线 | 核心机制 | 训练并行 | 推理状态 | 长序列 | 论文规模 | 当前优势 | 主要缺口 |
|---|---|---|---|---|---|---|---|
| Transformer | 全局自注意力 | 强 | KV cache 随上下文增长 | 标准 O(L²) | 超大规模最充分 | 通用质量、生态、硬件优化 | 长上下文成本、KV cache、持续状态 |
| Mamba | 选择性 SSM + scan | 强 | 固定状态递归 | O(L) | 原论文至 2.8B | 论文报告 4–5× 生成吞吐、长序列 | 超大规模与复杂检索任务验证不足 |
| RWKV | 时间混合 + RNN 推理 | 强 | 常数计算/内存状态 | O(L) | 原论文至 14B | 流式推理、低状态成本 | 训练生态、现代独立评测、状态压缩损失 |
| xLSTM | 指数门控;标量/矩阵记忆 | mLSTM 强;sLSTM 弱 | 循环状态 | O(L) | 论文 scaling;独立大模型较少 | 显式记忆、循环推理 | sLSTM 串行性、内核与规模复现 |
| Hyena | 隐式长卷积 + 门控 | 强 | 卷积/状态实现 | 亚二次 | 论文主要至 355M | 论文报告约 20% 训练 FLOPs 节省 | 超大规模、生成部署、生态 |
各路线能证明什么
原论文在 Pile 训练与零样本任务中报告同尺寸优于 Transformer、Mamba-2.8B 匹配更大 Transformer,并报告约 4–5 倍生成吞吐。它证明选择性 SSM 值得认真研究,不证明全部现代大模型任务已经胜出。
RWKV原论文把并行训练与循环推理结合并扩展到 14B,强调推理时计算和内存状态不随上下文增长。它证明部署形态有吸引力,仍需更强独立评测和生态验证。
xLSTM原论文以指数门控和矩阵记忆现代化 LSTM,并报告相对 Transformer 与 SSM 的有利 scaling。mLSTM 可并行,sLSTM 仍带串行限制。
Hyena原论文在 355M / The Pile 条件下报告以约 20% 更少训练 FLOPs 匹配 Transformer perplexity,证明长卷积可逼近注意力;规模证据明显弱于 Transformer。
新增机制证据:受控任务中的贝叶斯推理
哥伦比亚大学研究者构建“Bayesian wind tunnels”:每条序列使用新采样的潜变量, 真实后验有闭式解,假设空间大到不能靠记忆覆盖。在双射消除、HMM 状态跟踪、贝叶斯回归和关联回忆中,约 2–3M 参数的小型 Transformer 能逼近完整后验;对照架构能实现的推理原语不同。
论文把贝叶斯计算拆成信念累积、信念传递和随机访问绑定。 Transformer 在这些受控配置中覆盖三者;Mamba 擅长累积与传递, 但随机访问绑定较弱;注意力的 query-key 路由为按内容检索历史位置提供了直接机制。
可以推出Transformer 架构具备实现精确贝叶斯更新的能力;其优势不只来自规模, 注意力、残差流和前馈网络的组合在特定任务中形成可诊断的概率推理几何。
不能推出这不证明大型语言模型在自然语言、开放世界或 Agent 任务中普遍按贝叶斯最优方式推理。 作者明确承认实验只有 2–3M 参数、低维潜变量和受控合成任务; 同类几何是否存在于大型预训练模型仍是开放问题。
为什么不能排总榜
- 数据集、tokenizer、训练 token、优化器和模型宽深不同。
- 理论复杂度不等于实际墙钟时间;GPU 内核、内存访问和批量大小会改变结果。
- 小模型、合成任务或 perplexity 胜出,不等于代码、知识、工具调用和 Agent 长任务胜出。
- 论文自报结果是候选证据,不是独立复现。
下一轮必须补的证据
统一参数、训练 token、数据、硬件与训练 FLOPs 的第三方比较;10B+ 规模复现;长上下文精确召回与状态压缩损失;真实代码/Agent 任务;最终比较指标应是单位成功任务成本,而不是单项 loss。