当前判断:TileLang 与 AI 编程可能降低 CUDA 的软件迁移壁垒,但没有消除芯片性能、互联、产能、能耗和集群工程差距。梁文锋的原话构成重要内部人判断,不构成独立性能验证,因此 Q1“模型层偏弱、系统层可能很强”的 70% 暂不调整。

原始材料说了什么

资源约束 · 约 01:26

DeepSeek 披露约两万张 H 等效算力,并表示合理价格下“能买多少卡就买多少卡”;训练同等大模型估算需要约五万张 GB300 或二十万张华为 950。该数字来自管理层交流,尚未由采购、集群或财务文件交叉验证。

迁移层 · 约 01:56–02:08

梁文锋称 TileLang 可用高级语言重写 CUDA 算子生态,并计划把该路径迁移到华为卡;同时明确工作“还没有完成”。这支持软件锁定可能下降,不支持已经完成国产替代。

硬件差距 · 第 22 页

其口径是华为 950 超节点可完成 GB200/GB300 的任务,但代价约为“四张顶一张、落后两年”。“任务可完成”不能改写成单位性能、能效或总拥有成本相等。

标题最容易造成的误读

“英伟达在掘自己的坟墓”确为原话,但语境指向出口限制迫使中国团队建设替代生态,从而削弱 CUDA 锁定;它不是对英伟达收入、利润或公司存亡的完整预测。

三个分开的护城河

芯片—电力是动态约束栈

Elon Musk 在 2026 年 7 月 29 日《经济学人》访谈中,把 AI 当前主要约束概括为芯片与电力,并判断中国当前更缺芯片、中国以外更缺供电和冷却。这项内部人判断提示我们:不能用 GPU 采购量直接代替有效算力;并网、电气设备、冷却、内存、互联和集群稳定性会轮流成为约束。

可采用

约束具有地域性和时变性。芯片供给增加后,电力与冷却可能先卡住部署;供电扩张后,约束又可能回到芯片、互联或产能。

不能采用

中国总发电量较高,不等于电力在所有地区、时段和数据中心项目中“完全不构成制约”;Musk 关于中国接近解决光刻问题的说法没有工艺节点、良率、设备产能或第三方验证。

升级或否证条件

上调“CUDA 锁定削弱”

公开 TileLang—CUDA 同任务基准、华为大集群训练完成记录、稳定利用率、故障率、迁移工时与完整成本,并由外部团队复现。

下调

适配长期依赖手工特调,性能损失、调试成本、算子覆盖或集群稳定性无法接近 CUDA,或量产持续不能满足训练需求。

当前停止条件

不再收集重复转述;下一次更新只接受代码、基准、集群运行、交付或成本数据。

证据等级(2026-08-03 更正,已下调)

更正:本卡此前称该材料为「带时间码录音转写、一级转写材料」,这个等级给高了。后续核验发现该视频发布者自述音频系「依据文字稿制作的 AI 音频还原,并非梁文锋本人现场原声」,全网无现场原音。可核验的传播链条是:流传文字稿 → 第三方精校排版 → AI 配音。因此它只能作三级材料,用于提炼假说与建立验证清单,不可写「梁文锋亲口说」,不可把其中数字当公司披露

这不改变本卡的结论方向——本卡本来就没有据此调整 Q1 的 70%,且已要求以第三方基准、集群运行和成本数据为准;但引用本卡的算力数字(两万张 H 等效、五万张 GB300、二十万张华为 950、「四张顶一张、落后两年」)时,必须一并带上该证据标签。完整审计见 研究卡 034

公众号《梁文锋:英伟达在掘自己的坟墓》为更下一级的摘编,仅用于发现和核对原文,不单独改变判断。

补充来源