← 返回部落格
News預計閱讀 8 分鐘

DeepSeek 把跑兆級模型的工程經驗開源了:國產算力這次補的是軟體層

發布於 2026年10月3日
DeepSeek 把跑兆級模型的工程經驗開源了:國產算力這次補的是軟體層

9 月 30 日,DeepSeek 在官方公眾號上放出一組程式碼,為華為昇騰平台開源了六個模組:TileLang、DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA、DeepSelect。名字聽起來零碎,涵蓋的範圍其實很完整:一種程式語言、一批運算核心,再加上分散式通訊。

這件事不太像一次常規開源。它開源的不是模型,而是把模型跑起來所需要的那層地基。

晶片夠用之後,卡住的是別的東西

國產算力這幾年最常被討論的是算力數值。參數表一年比一年好看,但真正動手遷移過模型的工程師都知道,麻煩很少出在峰值算力上。

輝達的 CUDA 生態系做了二十多年。編譯器、數學函式庫、通訊函式庫,一層壓一層,開發者拿到卡就能用,文件、社群、踩坑紀錄都是現成的。換到另一套硬體,同樣一個算子可能得自己寫,排程得自己調,多機多卡通訊的函式庫還得自己對著實作。晶片跑分不低,但把模型搬上去這件事本身,成本高得離譜。

這種差距還有一層不太被提及的地方。硬體可以一次性投入買到,軟體生態系只能靠人一年一年磨出來。買卡是採購問題,補齊工具鏈是時間問題,而且時間只能靠真實專案去換。誰的模型先在某個平台上跑通、跑穩、跑到規模,誰才可能累積出可重複使用的經驗。這也是為什麼這次開源值得單獨拿出來談:它不是買了什麼,是有人把累積下來的東西交出來了。

所以國產算力長期真正的短板是軟體。晶片能算,但不好用。DeepSeek 這次開源的東西,正好落在這段空白上。

六個模組裡,最值得看的是 TileLang

六個模組裡分量最重的是 TileLang。這是 DeepSeek 自研的高階程式語言,先前主要面向輝達後端,這一次正式支援昇騰 950,提供原生程式碼生成、自動排程與同步。DeepSeek 對它的定位很直接:CUDA 的替代方案,而且「程式設計模型更簡單」。

配套的 TileKernels 解決了另一個老問題。它可以自動選擇輝達或華為後端,對上層暴露同一套 Python API。換句話說,同一份程式碼在兩個硬體平台上跑,切換的成本被壓到了設定層面,而不是重寫一遍核心。

公開的內測資料也不算含糊。部分核心在昇騰 950DT 上達到了標稱硬體上限的極高比例:BF16 稠密矩陣乘 99.8%,FP8 大約 99.5%;面向 DeepSeek V4.1 的稀疏注意力實作,在 prefill 階段跑到 410 TFLOPS,約為理論值的 95%。兩家還聯合優化了一套基於 128 顆昇騰 950 的超節點方案,專門在運算與資料搬移之間做平衡。

這些數字的價值在於證明這條路走得通。以前大家談國產算力,談的是能不能用;現在開始有團隊願意把自己壓榨硬體的經驗公開出來,說明至少有人已經用到了可以分享的程度。

一套 API 同時掛兩家後端,價值在哪裡

TileLang 和 TileKernels 放在一起看,用處會更清楚。TileKernels 能自動選擇輝達或華為後端,對上層暴露同一套 Python API。這意味著團隊維護的是一份程式碼,而不是兩份。

現實裡,一個稍微像樣的推論服務通常要同時跑在幾種硬體上。雲端可能還是輝達,自建或信創場景是國產卡,邊緣裝置又是另一套。如果每換一種硬體都要重寫一遍核心,團隊就得維持幾套並行的實作,測試也要各測一遍。同一套 API 把這件事從「重寫」降級成「改設定」,省下來的不只是人力,還有出錯的機會。

深色電路板上的一枚發光晶片,光線沿著細密走線向外擴散,冷青色調

對一個只想把產品做出來的團隊來說,這類改動不會寫進任何發布稿,但它決定了他們願不願意去試國產硬體。

真正的變化發生在遷移成本上

對一個普通開發者來說,這次開源最實際的影響是遷移成本。

過去把訓練或推論遷到昇騰,底層算子要自己補、工具要自己適配,一個專案幾個月耗在上面的情況並不罕見。現在這些工具鏈直接開源,很多坑已經被人踩過、修過,能被直接重複使用。門檻從「得有一支專門做算子適配的團隊」,降到「團隊裡得有人看得懂這套工具」。

這也解釋了為什麼這次發布在開發者社群裡的反應不小。模型這兩天已經出得夠多了,真正稀缺的是少走一段路。

接下來該看的是別人用不用

判斷這次開源的分量,不能只看 DeepSeek 自己說了什麼,要看接下來半年別人做什麼。

一個工具鏈能不能立得住,取決於有沒有第三方願意在它上面投入。如果 TileLang 只服務 DeepSeek 自家的模型,它的意義就停在該公司內部;如果有別的團隊拿它寫算子、提 issue、往外擴充硬體後端,它才開始變成公共基礎設施。數值再漂亮,也要經過幾個月真實負載的檢驗才算數。

另一個變數是其他國產晶片會不會跟著接進來。目前公開的資訊集中在昇騰,如果這套高階語言能按同一套邏輯遷到更多平台,它的價值會再上一個台階。這一點現在還沒有答案。

開源地基這件事,比開源模型更慢

過去兩年,國產開源的主戰場一直是模型權重。參數、榜單、下載量,都是能立刻看到的東西。底層工具鏈不一樣,它不出現在榜單裡,短期也不帶來話題。但沒有這層東西,上面堆多少模型都懸著。

DeepSeek 把自己在昇騰上跑通兆級模型的工程經驗交出來,做的正是這種不顯眼、但決定產業能不能往下走的補課。

要不要現在就把手裡輝達的專案遷到昇騰,答案仍然取決於具體場景,也要看團隊有沒有人在底層花時間。但至少從這一天起,「生態系不好用」這個理由,開始變得沒那麼站得住腳了。而生態系一旦開始能用了,後面發生的事往往會比預期快。

相關文章