← 返回博客
News预计阅读 8 分钟

DeepSeek 把跑万亿模型的工程经验开源了:国产算力这次补的是软件层

发布于 2026年10月3日
DeepSeek 把跑万亿模型的工程经验开源了:国产算力这次补的是软件层

9 月 30 日,DeepSeek 在官方公众号上放出一组代码,给华为昇腾平台开源了六个模块:TileLang、DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA、DeepSelect。名字听着零碎,覆盖的范围其实很整:一种编程语言,一批计算内核,再加分布式通信。

这件事不太像一次常规开源。它开源的不是模型,是把模型跑起来所需要的那层地基。

芯片够用之后,卡住的是别的东西

国产算力这几年被讨论得最多的是算力数值。参数表一年比一年好看,但真正动手迁移过模型的工程师都知道,麻烦很少出在峰值算力上。

英伟达的 CUDA 生态做了二十多年。编译器、数学库、通信库,一层压一层,开发者拿到卡就能用,文档、社区、踩坑记录都是现成的。换到另一套硬件,同样一个算子可能得自己写,调度得自己调,多机多卡通信的库还得自己对着实现。芯片跑分不低,但把模型搬上去这件事本身,成本高得离谱。

这种差距还有一层不太被提及的地方。硬件可以一次性投入买到,软件生态只能靠人一年一年磨出来。买卡是采购问题,补齐工具链是时间问题,而且时间只能靠真实项目去换。谁的模型先在某个平台上跑通、跑稳、跑到规模,谁才可能攒出可复用的经验。这也是为什么这次开源值得单独拿出来谈:它不是买了什么,是有人把攒下来的东西交出来了。

所以国产算力长期的真实短板是软件。芯片能算,但不好用。DeepSeek 这次开源的东西,正好落在这段空白上。

六个模块里,最值得看的是 TileLang

六个模块里分量最重的是 TileLang。这是 DeepSeek 自研的高层编程语言,此前主要面向英伟达后端,这一次正式支持昇腾 950,提供原生代码生成、自动调度与同步。DeepSeek 对它的定位很直接:CUDA 的替代方案,而且"编程模型更简单"。

配套的 TileKernels 解决了另一个老问题。它可以自动选择英伟达或华为后端,对上层暴露同一套 Python API。换句话说,同一份代码在两个硬件平台上跑,切换的成本被压到了配置层面,而不是重写一遍内核。

公开的内测数据也不算含糊。部分内核在昇腾 950DT 上达到了标称硬件上限的很高比例:BF16 稠密矩阵乘 99.8%,FP8 大约 99.5%;面向 DeepSeek V4.1 的稀疏注意力实现,在 prefill 阶段跑到 410 TFLOPS,约为理论值的 95%。两家还联合优化了一套基于 128 颗昇腾 950 的超节点方案,专门在计算和数据搬运之间做平衡。

这些数字的价值在于证明这条路走得通。以前大家谈国产算力,谈的是能不能用;现在开始有团队愿意把自己压榨硬件的经验公开出来,说明至少有人已经用到了可以分享的程度。

一套 API 同时挂两家后端,价值在哪里

TileLang 和 TileKernels 放在一起看,用处会更清楚。TileKernels 能自动选择英伟达或华为后端,对上暴露同一套 Python API。这意味着团队维护的是一份代码,而不是两份。

现实里,一个稍微像样的推理服务通常要同时跑在几种硬件上。云端可能还是英伟达,自建或信创场景是国产卡,边缘设备又是另一套。如果每换一种硬件都要重写一遍内核,团队就得维持几套并行的实现,测试也要各测一遍。同一套 API 把这件事从"重写"降级成"改配置",省下来的不只是人力,还有出错的机会。

深色电路板上的一枚发光芯片,光线沿细密走线向外扩散,冷青色调

对一个只想把产品做出来的团队来说,这类改动不会写进任何发布稿,但它决定了他们愿不愿意去试国产硬件。

真正的变化发生在迁移成本上

对一个普通开发者来说,这次开源最实际的影响是迁移成本。

过去把训练或推理迁到昇腾,底层算子要自己补、工具要自己适配,一个项目几个月耗在上面的情况并不罕见。现在这些工具链直接开源,很多坑已经被人踩过、修过,能被直接复用。门槛从"得有一支专门做算子适配的团队",降到"团队里得有人看得懂这套工具"。

这也解释了为什么这次发布在开发者社区里的反应不小。模型这两天已经出得够多了,真正稀缺的是少走一段路。

接下来该看的是别人用不用

判断这次开源的分量,不能只看 DeepSeek 自己说了什么,要看接下来半年别人做什么。

一个工具链能不能立住,取决于有没有第三方愿意在它上面投入。如果 TileLang 只服务 DeepSeek 自家的模型,它的意义就停在这家公司内部;如果有别的团队拿它写算子、提 issue、往外扩硬件后端,它才开始变成公共设施。数值再漂亮,也要经过几个月真实负载的检验才算数。

另一个变量是其他国产芯片会不会跟着接进来。目前公开的信息集中在昇腾,如果这套高层语言能按同一套逻辑迁到更多平台,它的价值会再上一个台阶。这一点现在还没有答案。

开源地基这件事,比开源模型更慢

过去两年,国产开源的主战场一直是模型权重。参数、榜单、下载量,都是能立刻看到的东西。底层工具链不一样,它不出现在榜单里,短期也不带来话题。但没有这层东西,上面堆多少模型都悬着。

DeepSeek 把自己在昇腾上跑通万亿级模型的工程经验交出来,做的正是这种不显眼、但决定行业能不能往下走的补课。

要不要现在就把手里英伟达的项目迁到昇腾,答案仍然取决于具体场景,也要看团队有没有人在底层花时间。但至少从这一天起,"生态不好用"这个理由,开始变得没那么站得住脚了。而生态一旦开始能用了,后面发生的事往往会比预期快。

相关文章