DeepSeek open-sourcet Engineering-Erfahrung für Billionen-Parameter-Modelle: Diesmal wird bei heimischer Rechenleistung die Software-Ebene nachgeholt

Am 30. September veröffentlichte DeepSeek im offiziellen WeChat-Kanal eine Reihe von Code und stellte sechs Module für Huaweis Ascend-Plattform als Open Source bereit: TileLang, DeepGEMM-Ascend, DeepEP-Ascend, TileKernels, FlashMLA und DeepSelect. Die Namen klingen verstreut, doch der abgedeckte Bereich ist recht geschlossen: eine Programmiersprache, eine Sammlung von Rechenkernen und dazu verteilte Kommunikation.
Das wirkt nicht wie ein gewöhnliches Open-Source-Projekt. Open Source gemacht wurde nicht das Modell, sondern das Fundament, das nötig ist, um das Modell laufen zu lassen.
Wenn die Chips ausreichen, hakt es an etwas anderem
Bei heimischer Rechenleistung wurde in den letzten Jahren vor allem über die Rechenleistungswerte diskutiert. Die Datenblätter werden Jahr für Jahr besser, doch Ingenieure, die tatsächlich schon Modelle migriert haben, wissen: Die Probleme entstehen selten bei der Spitzenrechenleistung.
NVIDIAs CUDA-Ökosystem wurde über zwanzig Jahre aufgebaut. Compiler, Mathematikbibliotheken, Kommunikationsbibliotheken – Schicht über Schicht; Entwickler bekommen die Karte und können sie nutzen, Dokumentation, Community und dokumentierte Stolperfallen sind vorhanden. Wechselt man auf eine andere Hardware, muss derselbe Operator womöglich selbst geschrieben, die Ablaufsteuerung selbst abgestimmt und die Bibliothek für Multi-Node-Multi-GPU-Kommunikation selbst implementiert werden. Der Chip-Score ist nicht niedrig, aber das Modell selbst auf diese Hardware zu bringen, ist unverhältnismäßig teuer.
Diese Kluft hat noch eine weniger erwähnte Dimension. Hardware lässt sich mit einer Einmalinvestition kaufen, ein Software-Ökosystem kann nur über Jahre von Menschen erarbeitet werden. Karten zu kaufen ist eine Beschaffungsfrage, eine Toolchain zu vervollständigen eine Zeitfrage – und Zeit lässt sich nur durch echte Projekte gewinnen. Wer sein Modell zuerst auf einer Plattform zum Laufen, zum stabilen Laufen und zur Skalierung bringt, kann überhaupt erst wiederverwendbare Erfahrung ansammeln. Deshalb lohnt es sich, dieses Open-Source-Release gesondert zu betrachten: Es geht nicht darum, was gekauft wurde, sondern darum, dass jemand das Angesammelte herausgibt.
Die eigentliche langfristige Schwäche heimischer Rechenleistung ist also Software. Die Chips können rechnen, aber sie sind nicht gut benutzbar. Genau in diese Lücke fällt das, was DeepSeek diesmal als Open Source veröffentlicht hat.
Von den sechs Modulen lohnt sich TileLang am meisten
Das gewichtigste der sechs Module ist TileLang. Es ist eine von DeepSeek selbst entwickelte High-Level-Programmiersprache, die bisher vor allem auf das NVIDIA-Backend ausgerichtet war und nun offiziell Ascend 950 unterstützt, mit nativer Codegenerierung, automatischem Scheduling und Synchronisation. DeepSeek positioniert sie ganz direkt: als Alternative zu CUDA, und mit „einem einfacheren Programmiermodell“.
Das dazugehörige TileKernels löst ein weiteres altes Problem. Es kann automatisch das NVIDIA- oder das Huawei-Backend auswählen und exponiert nach oben hin dieselbe Python-API. Anders gesagt: Derselbe Code läuft auf zwei Hardwareplattformen, und die Umstellungskosten werden auf die Konfigurationsebene gedrückt, statt den Kernel neu schreiben zu müssen.
Die veröffentlichten Beta-Testdaten sind ebenfalls nicht vage. Einige Kernel erreichten auf dem Ascend 950DT einen sehr hohen Anteil der nominellen Hardware-Obergrenze: 99,8 % bei BF16-dichter Matrixmultiplikation, etwa 99,5 % bei FP8; die für DeepSeek V4.1 entwickelte Implementierung von Sparse Attention erreichte in der Prefill-Phase 410 TFLOPS, rund 95 % des theoretischen Werts. Beide Seiten haben zudem gemeinsam eine Supernode-Lösung auf Basis von 128 Ascend-950-Chips optimiert, die gezielt zwischen Berechnung und Datenbewegung ausbalanciert.
Der Wert dieser Zahlen liegt darin, zu belegen, dass dieser Weg gangbar ist. Früher ging es in Diskussionen über heimische Rechenleistung darum, ob sie überhaupt nutzbar ist; jetzt beginnen Teams, ihre Erfahrung im Ausreizen der Hardware offenzulegen – ein Zeichen dafür, dass zumindest jemand sie bereits so weit nutzt, dass er sie teilen kann.
Eine API für zwei Backends – worin liegt der Wert?
Betrachtet man TileLang und TileKernels zusammen, wird der Nutzen klarer. TileKernels kann automatisch das NVIDIA- oder Huawei-Backend wählen und exponiert nach oben dieselbe Python-API. Das bedeutet, dass ein Team nur eine Codebasis pflegt statt zwei.
In der Praxis muss ein einigermaßen ordentlicher Inferenzdienst meist auf mehreren Hardwaretypen gleichzeitig laufen. In der Cloud ist es womöglich weiterhin NVIDIA, in Xinchuang-Szenarien sind es heimische Karten, und Edge-Geräte sind wieder eine andere Kategorie. Müsste man für jeden Hardwarewechsel die Kernel neu schreiben, müsste das Team mehrere parallele Implementierungen pflegen und jede separat testen. Dieselbe API stuft dies von „Neuschreiben“ auf „Konfiguration ändern“ herunter – gespart werden nicht nur Arbeitskraft, sondern auch Fehlerquellen.

Für ein Team, das einfach nur ein Produkt auf den Markt bringen will, taucht diese Art von Änderung in keiner Pressemitteilung auf, aber sie entscheidet darüber, ob sie bereit sind, heimische Hardware auszuprobieren.
Die eigentliche Veränderung liegt bei den Migrationskosten
Für einen durchschnittlichen Entwickler sind die Migrationskosten der praktischste Effekt dieses Open-Source-Releases.
Früher musste man beim Migrieren von Training oder Inferenz auf Ascend die darunterliegenden Operatoren selbst ergänzen und Werkzeuge selbst anpassen; es war nicht selten, dass ein Projekt monatelang damit verbrachte. Jetzt sind diese Toolchains direkt Open Source, viele Fallstricke wurden bereits von anderen getroffen und behoben und können direkt wiederverwendet werden. Die Hürde sinkt von „man braucht ein eigenes Team für Operator-Anpassung“ auf „jemand im Team muss diese Tools verstehen“.
Das erklärt auch, warum dieses Release in der Entwickler-Community für spürbare Resonanz sorgt. In letzter Zeit wurden genug Modelle veröffentlicht; wirklich knapp ist, einen Umweg zu sparen.
Als Nächstes kommt es darauf an, ob andere es nutzen
Um das Gewicht dieses Open-Source-Releases einzuschätzen, darf man nicht nur darauf schauen, was DeepSeek selbst sagt, sondern darauf, was andere im kommenden halben Jahr tun.
Ob sich eine Toolchain etablieren kann, hängt davon ab, ob Dritte bereit sind, in sie zu investieren. Wenn TileLang nur den eigenen Modellen von DeepSeek dient, bleibt seine Bedeutung innerhalb dieses Unternehmens; wenn andere Teams damit Operatoren schreiben, Issues einreichen und weitere Hardware-Backends erschließen, beginnt es, zu einer öffentlichen Infrastruktur zu werden. So schön die Zahlen auch sind, sie zählen erst, wenn sie sich über Monate unter realer Last bewährt haben.
Eine weitere Variable ist, ob andere heimische Chips nachziehen und sich anschließen. Die derzeit öffentlichen Informationen konzentrieren sich auf Ascend; wenn diese High-Level-Sprache nach derselben Logik auf weitere Plattformen übertragen werden kann, steigt ihr Wert noch einmal. Darauf gibt es derzeit noch keine Antwort.
Das Fundament zu öffnen, ist langsamer als Modelle zu öffnen
In den vergangenen zwei Jahren war der Hauptschauplatz heimischer Open-Source-Aktivitäten stets die Modellgewichte. Parameter, Ranglisten, Downloadzahlen – alles Dinge, die sofort sichtbar sind. Die darunterliegende Toolchain ist anders: Sie taucht in keiner Rangliste auf und bringt kurzfristig keine Schlagzeilen. Doch ohne diese Schicht hängt alles in der Schwebe, egal wie viele Modelle obenauf gestapelt werden.
DeepSeek gibt seine Engineering-Erfahrung heraus, mit der es Billionen-Parameter-Modelle auf Ascend zum Laufen gebracht hat – genau diese unauffällige, aber entscheidende Aufholarbeit, die darüber entscheidet, ob die Branche weiterkommen kann.
Ob man die eigenen NVIDIA-Projekte jetzt auf Ascend migrieren sollte, hängt weiterhin vom konkreten Szenario ab und davon, ob im Team jemand Zeit in die unteren Ebenen investiert. Aber zumindest ab diesem Tag beginnt das Argument „das Ökosystem ist nicht gut benutzbar“ weniger stichhaltig zu werden. Und wenn ein Ökosystem erst einmal benutzbar wird, geschehen die Dinge danach oft schneller als erwartet.
Verwandte Artikel
13.000 interne Screenshots landeten auf öffentlichem GitHub – und kein Angreifer hat sie dort abgelegt
Ein Standardverhalten, über eine ganze Flotte hinweg wiederholt, ist das Ergebnis einer Richtlinie.
Amazon will, dass Investoren Nvidia-Chips im Wert von 8 Milliarden Dollar besitzen, die es weiterhin nutzt
Fluggesellschaften haben Flugzeuge jahrzehntelang zurückgeleast. Nun wird dieselbe Idee auf GPUs übertragen.
OpenAI führte eine Kampagne zur Reasoning-Extraktion auf Personen mit Verbindungen zu Moonshot AI zurück
Das Modell wurde zum Entschlüsselungs-Orakel für sein eigenes verborgenes Reasoning.
Das erste KI-Filmfestival zahlte 450.000 Dollar aus und lehrte eine Lektion über das Erzählen
Die Gewinnerfilme nutzten die Werkzeuge, um einer bereits existierenden Idee zu dienen.