当前判断:这是本站少见的一级证据且指向明确的一卡。mHC 用双随机矩阵约束把超连接的信号发散问题解掉,恢复了恒等映射性质;更重要的是它已经落地到 DeepSeek-V4-Pro(1.6T 参数),不再是 27B 上的实验室结论。含义与多数叙事相反:Transformer 的宏观架构红利尚未吃完,底座更替的紧迫性下降而非上升。据此下调 Q2 子项「技术瓶颈」45% → 38%,Q2 总判断 68% → 66%。Q1、Q3、Q4 不动。

先定证据等级:一级,且两处独立落地

材料构成

①《mHC: Manifold-Constrained Hyper-Connections》,arXiv:2512.24880 v2,DeepSeek-AI,作者 20 人,末位 Wenfeng Liang,已全文核验;②《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》技术报告;③ ICML 2026 已收录该论文(poster 61870);④ ICLR 2026 出现独立工作《Ablate and Rescue: A Causal Analysis of Residual Stream Hyper-Connections》,自述提供首个开源 mHC 语言模型

为什么定一级

核心数字全部取自论文正文与表格,非媒体转述;架构采用由 V4 技术报告直接陈述,非传言。这与本站此前多数三级材料(第三方监测、二手转述、AI 配音稿)处于完全不同的证据层。

入站触发路径提示

本卡的来源是一篇中文自媒体转述稿,其中时间框架与归因均有误,但线索本身有效。这印证 029 的闸门设计:二手稿只用于发现来源,事实一律回一手核验。

事实层:论文说了什么(已逐项对表核验)

问题

超连接(HC,2024)把残差流从单流拓宽为 n 流并引入可学习混合矩阵,性能确实涨,但复合映射 ∏Hres 不再保持特征全局均值,导致信号无界放大或衰减。论文 27B 实测:无约束 HC 的复合映射最大增益接近 3000,伴随梯度异常与训练崩溃。

做法

用 Sinkhorn-Knopp 算法(Sinkhorn & Knopp, 1967)把 Hres 熵投影到 Birkhoff 多胞体,即约束为双随机矩阵。行和列和均为 1,Hresx 成为输入特征的凸组合;因双随机矩阵在乘法下封闭,任意深度的复合映射仍守恒。n 退化为 1 时自然回到标准恒等映射。

结果(原文数值)

复合增益峰值由约 3000 降至约 1.6,三个数量级。1.6 而非 1,原因论文写明:为效率把 Sinkhorn 迭代截断在 20 次,只取近似解。27B 最终 loss 较基线低 0.021。n=4 时额外训练时间开销 6.7%

规模实验

3B / 9B / 27B 三点算力缩放,外加 3B 固定 1T token 的 token 缩放。论文自述优势在更高算力预算下「仅有边际衰减」(marginal attenuation)——衰减是论文自己承认的,转述稿未提

纠错层:一处归因错误,比时间错误严重

转述稿的说法

「mHC 在 BBH 上相对基线狂涨 7.2 分、DROP 暴涨 6.9 分、各主流榜单全面超越」。

论文原表(Table 4,27B)

BBH:基线 43.8 → HC 48.9 → mHC 51.0。DROP:基线 47.0 → HC 51.6 → mHC 53.9。

问题所在

+7.2 与 +6.9 确是相对基线的差值,数字没错,但归属错了。其中 +5.1 与 +4.6 来自 HC——HC 不是 DeepSeek 的工作,是 2024 年的既有方法。mHC 自身相对 HC 的边际贡献是 +2.1(BBH)与 +2.3(DROP),这也正是论文自己强调的口径。把全部涨幅记在 mHC 头上,等于把前人成果并入本次贡献。

并非全面超越

MATH 一项:HC 26.4 高于 mHC 26.0。转述稿「全面超越」不成立。mHC 的主贡献是稳定性与可扩展性,性能提升是附带项,不是主线。

时间框架

arXiv 编号 2512 = 2025 年 12 月提交,当前 v2。转述稿「过去几天海外极客被刷屏」把八个月前的成果写成新闻。这一点反而使证据更强,不是更弱——见下节。

转述稿做对的一处

它主动纠正了网传「1946 年算法」,指明论文引用的是 Sinkhorn & Knopp 1967 年《太平洋数学杂志》。此处与论文参考文献一致。

判断层:我的两条反证测试,全部被证伪

本卡入站前设了两道闸,两道都指向「先不动置信度」。核验结果是两道都倒向反面,因此必须动。

  1. 测试一:八个月过去,DeepSeek 自家主力模型有没有用 mHC?不用即是最强反证。
    结果:用了。DeepSeek-V4 技术报告在摘要与引言中明确列为三项关键升级之一——「Manifold-Constrained Hyper-Connections (mHC) that enhance conventional residual connections」,另两项为混合注意力(CSA+HCA)与 Muon 优化器。基础设施章节还专门写了 mHC 的 recomputation 与融合算子实现。自家上产线,是架构改动最硬的一种背书:它要通过成本、稳定性与工程复杂度三重内部审查。
  2. 测试二:27B 的结论能否外推到千亿级?
    结果:已外推,且跨度远超预期。V4-Pro 为 1.6T 参数(49B 激活)MoE,V4-Flash 为 284B(13B 激活),预训练 32T+ token。从论文的 27B 到 V4-Pro 的 1.6T,约 60 倍参数跨度。论文中「in-house large-scale training」的模糊表述,八个月后由 V4 补齐为具体值。

外部验证的第三条:论文已被 ICML 2026 收录;ICLR 2026 出现独立团队的因果分析工作并提供首个开源 mHC 语言模型。这不是媒体热度,是同行评议与独立复现两条通道同时走通——本站此前极少有材料能同时满足这两项。

与母题的关系

第二母题(Q2 · Transformer 到瓶颈期了吗,主归属):研究卡 021 把 Q2 拆为技术瓶颈 45%、经济瓶颈 78%、产品可靠性瓶颈 74%。本卡只作用于技术瓶颈一项。理由:过去十年,架构改进几乎全部发生在微观设计(注意力变体 MQA/GQA/MLA、FFN 稀疏化 MoE),而宏观拓扑自 ResNet 之后基本冻结;mHC 证明这条被冷落的主干仍能在千亿级模型上兑现真实收益,且代价仅 6.7%。技术余量的存在得到一级证据支持,技术瓶颈 45% → 38%

但经济与产品两项不动,且它们才是 Q2 的主导项。mHC 降低训练不稳定带来的重跑损失,属训练侧;它不改变推理单位成本结构,也不改变任务成功率、人工接管与责任归属。Q2 总判断 68% → 66%,移动幅度刻意小于子项,因为 Q2 的重量本就压在经济与产品侧。

第三母题(Q3 · Transformer 之外有什么,交叉引用):本卡对 Q3 是抑制信号而非加速信号——现役架构继续吸收改进,会推迟而非提前替代窗口。但它不提供任何关于 SSM、循环架构、世界模型等替代路线的新证据,方向性与强度均不足以移动判断。Q3 维持 65%。与研究卡 024 的类别错误结论一致:能力目标不等于主干架构,架构层的改进同样不应被读成路线更替。

Q1、Q4 不动。本材料不含商业化、留存、毛利或生产可靠性证据。

反证条件:什么会推翻本卡

  1. V4 后续版本或 V5 移除 mHC,或披露其在更大规模/更长训练下收益归零——论文自承的「边际衰减」若在 1.6T 之上转为消失,本卡的技术余量结论即失效。
  2. 独立团队在同等预算、同等基线下复现失败,或证明收益可由更简单手段(如单纯调整初始化、归一化或学习率)取得。
  3. 6.7% 开销在真实长训练、长上下文或推理侧被证明显著高于报告值,使收益不抵成本。
  4. 出现证据表明 +2.1/+2.3 的边际提升在后训练阶段被抹平,即架构收益不能穿透到最终产品能力。

后续跟踪变量

  1. ICLR 那份开源 mHC 模型的实际复现结论——是否支持论文的稳定性主张。
  2. 其他实验室(Qwen、Kimi、MiniMax、西方主要实验室)是否在下一代模型中采用宏观拓扑改动。
  3. Sinkhorn 迭代次数与增益上界的权衡曲线:20 次截断得到 1.6,是否存在更优工程点。
  4. mHC 的收益随参数量的衰减斜率——这是判断「技术余量还有多少」的直接量。
  5. 论文展望提出的其他流形约束是否出现后续工作,即这是一次性修补还是一个新的设计维度。

缺口与停止条件

本卡能回答与不能回答

能回答「宏观残差拓扑是否仍有可兑现的技术余量」——能,且已在 1.6T 规模落地。不能回答「这是否改变训练总成本、推理经济性或产品可靠性」——论文未测,V4 报告的效率提升主要来自注意力侧(CSA/HCA 带来 1M 上下文下 27% 推理 FLOPs、10% KV cache),不应记在 mHC 账上

下一次只接受

独立复现的对照结果,或多实验室的架构采用证据,或 mHC 收益随规模衰减的实测曲线。不再收集解释性博客与二次转述。

材料指纹

一手来源:arXiv:2512.24880v2(mHC 论文全文,含 Table 4 与 §5.4 稳定性分析)、DeepSeek-V4 技术报告(V4-Pro 1.6T/49B 激活,V4-Flash 284B/13B 激活,1M 上下文,32T+ token)。旁证:ICML 2026 poster 61870;ICLR 2026《Ablate and Rescue》。触发线索来自中文自媒体转述稿(三级,已抓取存档,含归因与时间双重错误,不作为事实来源)。核验日期 2026-08-19。证据账本登记为 E-027(一级)