当前判断:“混合架构优先”维持 65% 置信度,不上调。大规模证据增加了,但成功模型仍保留注意力;现有数据不足以证明某一路线拥有更低的单位成功任务成本。

可确认的数字

Jamba

52B 总参数、12B active;8-bit 权重下设计为单张 80GB GPU。论文自报长上下文吞吐约 Mixtral-8x7B 的 3 倍,但 Mamba、MoE、数据和训练配方无法拆开归因。

Mamba-2

论文自报核心层相对初代 Mamba 快 2–8 倍。这是算子速度,不是整模型或单位任务成本。

Hymba

1.5B 模型自报 KV cache 缩小 11.67 倍、吞吐提高 3.49 倍;吞吐口径为 A100、8K、batch 128,OOM 时降低 batch,因此不是等 batch 成本比较。

第三方横向研究

400M 参数、24 层、保留 3 个注意力层,在 20B/100B code token 受控比较中,xLSTM 的 HumanEval pass@64 领先次优 1.43、0.90、1.81 个百分点;通用推理聚合领先较小。

这轮改变了什么

拒绝排名

没有来源同时报告等硬件、等训练 token、等质量下的训练成本、推理成本、显存、重试与任务成功率。核心层速度、最大吞吐和 KV cache 都不能单独转换成单位成功任务成本。

反证条件

若某条纯替代路线在 10B+、跨语言/代码/Agent 任务中被独立复现,并在统一硬件与完整单位经济上持续胜出,本站将放弃“混合优先”先验。

原始来源