9月30日,DeepSeek官宣与华为合作,围绕昇腾芯片开源一套编程工具链:计算库、芯片间数据传输库,以及核心的算子语言 TileLang。双方还联合优化了128颗昇腾950组成的超节点集群。Reuters 的报道把它解读为"减少依赖",The Decoder 称之为"中国AI行业的抱团"。这些解读都对,但都停在贸易战的层面。真正值得深挖的是另一个问题:为什么打破 CUDA 垄断的突破口,是一家模型公司贡献的一门编程语言,而不是芯片厂商的硬件参数?
一、CUDA的护城河到底挖在哪里
过去十年,“挑战英伟达"的故事我们听过太多次:TPU、Trainium、MI300、Gaudi……硬件性价比屡屡逼近甚至局部反超,但市场份额纹丝不动。原因早已不是算力,而是算力之上的那一层——编程模型。
CUDA 的垄断本质是三层的叠加:
- 语言与编译器层:CUDA C++ 及其 17 年积累的编译优化;
- 算子生态层:cuDNN、CUTLASS、FlashAttention 等几十万开发者的持续贡献;
- 迁移成本层:一个团队的既有代码、调试经验、性能直觉,全部绑定在这套栈上。
第三层最致命。芯片可以买,语言可以学,但一个组织十年攒下的 CUDA 肌肉记忆无法平移。所以此前所有"兼容 CUDA"的路线(ROCm 的 HIP、各家芯片的转译层)都在第一层打转,试图让 CUDA 代码"免费"跑在自家硬件上——结果永远在追赶英伟达新指令集的尾灯。
TileLang 走的是完全相反的方向:不是让 CUDA 代码跑过来,而是让 CUDA 这一层变得不必要。
二、TileLang:把硬件细节"关进"语言里
TileLang 由北京大学开发,2024 年开源,是一门以"瓦片"为中心的 DSL:Python 做前端,开发者用几十行代码描述计算的分块、内存层级映射和并行策略,编译器负责生成针对具体后端的代码。用 DeepSeek 的话说,“编程模型比 CUDA 更简洁”。
这不是客套。传统 CUDA 写一个高性能 Attention kernel,需要手工管理 shared memory、warp 调度、bank conflict、流水线同步,代码上千行,调优数周。而 TileLang 把"tile 级编程"作为一等公民:你只说清楚"数据怎么切、块放哪、怎么搬”,剩下的交给编译器在不同硬件上各自落地。它已经在 FlashAttention、MLA(DeepSeek 自己的多头潜在注意力)等关键 kernel 上验证过性能。DeepSeek 透露已在 AGI 研发中实际使用约一年——也就是说,这不是实验室玩具,而是 V3.2 以来自家训练栈的一部分。
更值得注意的是适配广度:TileLang 已经与昇腾、摩尔线程、算能、沐曦等国产厂商完成适配合作。一门语言,多个硬件后端——这正是它对 CUDA 的结构性差异。CUDA 是"一家硬件的语言",TileLang 想做"一层计算的通用接口"。
三、128颗950超节点:真正的试验场
这次合作里最容易被忽略、其实信息量最大的细节,是"联合优化128颗昇腾950组成的超节点集群"。
大模型时代,单芯片性能的权重在下降,互联与系统级优化的权重在飙升。DeepSeek 的技术路线(MoE、MLA、大规模专家并行)对芯片间通信极其敏感,这也是他们开源芯片间数据传输库的原因。128 颗 950 的超节点,对标的是英伟达 NVLink/NVSwitch 的系统级能力——而验证这套系统能不能跑通前沿模型训练的,恰恰是 DeepSeek 的真实负载。
这里有一个反直觉的判断:对华为而言,DeepSeek 的价值可能大于任何一笔采购订单。 因为模型公司是算子工具链最苛刻的用户——训练前沿模型逼出的 kernel 优化,会沉淀回开源工具链,让所有昇腾用户受益。这相当于英伟达与下游共建 cuDNN 的过程被开源重演了一遍,而英伟达当年是花了十几年、靠闭源商业生态才完成的。
四、为什么是DeepSeek来做这件事
一个朴素的问题:华为有海思、有自己的 CANN 软件栈,为什么需要 DeepSeek?
因为芯片厂商写不好框架,正如数据库厂商写不好 ORM。CANN 的问题是所有硬件厂商软件栈的共同问题:以自家硬件为中心,生态是封闭的,开发者迁移意愿低。而 TileLang 的中立性(北大开源、多后端适配)加上 DeepSeek 的信用(过去两年全球最被信任的 AI 开源品牌),构成了生态引燃的火种。DeepSeek 用 V3/R1 证明了"开源即广告",现在把同样的打法复制到软件栈:我把自家训练在用的工具链开源给你,你信不信?
这背后还有一个更深的产业逻辑转变:模型公司的核心竞争力正在从"用最好的芯片"转向"自持系统软件能力"。 OpenAI 与 Synopsys 合作做会操作 EDA 工具的芯片设计模型,是模型向下渗透到芯片设计;DeepSeek 与华为合作算子工具链,是模型向下渗透到芯片编程。前沿玩家都在把"软硬接口"这个战略高地收回自己手里——差别只在 OpenAI 选择闭源合作,DeepSeek 选择开源建生态。
五、冷思考:第二条路不会一蹴而就
需要泼的冷水也要泼足。
第一,编译器 DSL 的生态位历史上非常脆弱。TVM、Triton(OpenAI)、Mojo……这一层的尝试不少,活下来且成为事实标准的只有 Triton——而且 Triton 的成功高度依赖 PyTorch 的绑定和英伟达后端的成熟度。TileLang 要跨过的不只是技术关,还有"开发者习惯"关。
第二,CUDA 生态的护城河仍在拓宽。CUDA 12.x、cuDNN 的新算子、TensorRT-LLM 的迭代速度,意味着"追赶者"永远面对一个移动靶。TileLang 在 Attention 类 kernel 上的性能验证是好的开始,但前沿模型的算子长尾(自定义 MoE 路由、通信融合、异构流水线)才是日常。
第三,工具链开源解决的是"能不能用",不解决"好不好买"。昇腾产能、供应稳定性、超节点的实际 MFU 数据,这些都要靠时间验证。
但即便如此,这次的结构性意义仍然成立:这是 CUDA 诞生以来,第一次有"模型侧最强需求方 + 多家国产硬件 + 中立开源语言"的三方合力,从编程模型这一层而非兼容层发起的解耦。 以前的所有挑战者都在问"怎么让 CUDA 程序跑在我的芯片上",现在的问题变成了"为什么还要写 CUDA"。
结语
算力竞争正在经历一次重心转移:从芯片的制程与带宽,转移到编程模型与系统软件。DeepSeek 押注 TileLang 的深层含义在于——它相信未来 AI 基础设施的分水岭不是你用谁的 GPU,而是你的计算栈能不能用一套语言描述、在多种硬件上落地。这条路很长,但方向第一次是对的。
本文基于2026年10月1日AI洞察日报选题深挖,原始信源:DeepSeek 官方公告、Reuters、The Decoder、tile-ai/tilelang。