当前判断:“混合架构优先”维持 65% 置信度,不上调。大规模证据增加了,但成功模型仍保留注意力;现有数据不足以证明某一路线拥有更低的单位成功任务成本。
可确认的数字
Jamba
52B 总参数、12B active;8-bit 权重下设计为单张 80GB GPU。论文自报长上下文吞吐约 Mixtral-8x7B 的 3 倍,但 Mamba、MoE、数据和训练配方无法拆开归因。
Mamba-2论文自报核心层相对初代 Mamba 快 2–8 倍。这是算子速度,不是整模型或单位任务成本。
Hymba1.5B 模型自报 KV cache 缩小 11.67 倍、吞吐提高 3.49 倍;吞吐口径为 A100、8K、batch 128,OOM 时降低 batch,因此不是等 batch 成本比较。
第三方横向研究400M 参数、24 层、保留 3 个注意力层,在 20B/100B code token 受控比较中,xLSTM 的 HumanEval pass@64 领先次优 1.43、0.90、1.81 个百分点;通用推理聚合领先较小。
这轮改变了什么
- “没有大模型证据”已不成立:Jamba 提供 10B+ active 的公开混合模型。
- “SSM 会单独替代注意力”仍不成立:Jamba、Hymba 和第三方受控模型都保留注意力。
- 非 Transformer 路线内部没有单一胜者;任务结构会改变 xLSTM、Mamba-2、Gated DeltaNet 的排序。
拒绝排名
没有来源同时报告等硬件、等训练 token、等质量下的训练成本、推理成本、显存、重试与任务成功率。核心层速度、最大吞吐和 KV cache 都不能单独转换成单位成功任务成本。
反证条件
若某条纯替代路线在 10B+、跨语言/代码/Agent 任务中被独立复现,并在统一硬件与完整单位经济上持续胜出,本站将放弃“混合优先”先验。