当前判断:TileLang 与 AI 编程可能降低 CUDA 的软件迁移壁垒,但没有消除芯片性能、互联、产能、能耗和集群工程差距。梁文锋的原话构成重要内部人判断,不构成独立性能验证,因此 Q1“模型层偏弱、系统层可能很强”的 70% 暂不调整。
原始材料说了什么
DeepSeek 披露约两万张 H 等效算力,并表示合理价格下“能买多少卡就买多少卡”;训练同等大模型估算需要约五万张 GB300 或二十万张华为 950。该数字来自管理层交流,尚未由采购、集群或财务文件交叉验证。
迁移层 · 约 01:56–02:08梁文锋称 TileLang 可用高级语言重写 CUDA 算子生态,并计划把该路径迁移到华为卡;同时明确工作“还没有完成”。这支持软件锁定可能下降,不支持已经完成国产替代。
硬件差距 · 第 22 页其口径是华为 950 超节点可完成 GB200/GB300 的任务,但代价约为“四张顶一张、落后两年”。“任务可完成”不能改写成单位性能、能效或总拥有成本相等。
标题最容易造成的误读
“英伟达在掘自己的坟墓”确为原话,但语境指向出口限制迫使中国团队建设替代生态,从而削弱 CUDA 锁定;它不是对英伟达收入、利润或公司存亡的完整预测。
三个分开的护城河
- 软件生态:若 TileLang 在多种硬件上稳定实现接近 CUDA 的开发效率和运行效率,壁垒下调。
- 硬件与集群:单卡性能、互联、内存、能耗、良率、集群稳定性与供货仍需独立验证。
- 资源规模:算力数量决定可并行实验次数和模型尺度;人才接近不能自动补足实验预算。
芯片—电力是动态约束栈
Elon Musk 在 2026 年 7 月 29 日《经济学人》访谈中,把 AI 当前主要约束概括为芯片与电力,并判断中国当前更缺芯片、中国以外更缺供电和冷却。这项内部人判断提示我们:不能用 GPU 采购量直接代替有效算力;并网、电气设备、冷却、内存、互联和集群稳定性会轮流成为约束。
约束具有地域性和时变性。芯片供给增加后,电力与冷却可能先卡住部署;供电扩张后,约束又可能回到芯片、互联或产能。
不能采用中国总发电量较高,不等于电力在所有地区、时段和数据中心项目中“完全不构成制约”;Musk 关于中国接近解决光刻问题的说法没有工艺节点、良率、设备产能或第三方验证。
升级或否证条件
公开 TileLang—CUDA 同任务基准、华为大集群训练完成记录、稳定利用率、故障率、迁移工时与完整成本,并由外部团队复现。
下调适配长期依赖手工特调,性能损失、调试成本、算子覆盖或集群稳定性无法接近 CUDA,或量产持续不能满足训练需求。
当前停止条件不再收集重复转述;下一次更新只接受代码、基准、集群运行、交付或成本数据。
证据等级(2026-08-03 更正,已下调)
更正:本卡此前称该材料为「带时间码录音转写、一级转写材料」,这个等级给高了。后续核验发现该视频发布者自述音频系「依据文字稿制作的 AI 音频还原,并非梁文锋本人现场原声」,全网无现场原音。可核验的传播链条是:流传文字稿 → 第三方精校排版 → AI 配音。因此它只能作三级材料,用于提炼假说与建立验证清单,不可写「梁文锋亲口说」,不可把其中数字当公司披露。
这不改变本卡的结论方向——本卡本来就没有据此调整 Q1 的 70%,且已要求以第三方基准、集群运行和成本数据为准;但引用本卡的算力数字(两万张 H 等效、五万张 GB300、二十万张华为 950、「四张顶一张、落后两年」)时,必须一并带上该证据标签。完整审计见 研究卡 034。
公众号《梁文锋:英伟达在掘自己的坟墓》为更下一级的摘编,仅用于发现和核对原文,不单独改变判断。
补充来源
- The Economist:The full-length interview with Elon Musk,2026-07-29(17:05–21:20;只作管理层判断,不作独立基础设施统计)