Der Speicherchip ist jetzt der Engpass beim KI-Computing

Das aufschlussreichste Ereignis in der KI-Hardware dieses Monats war ein Treffen und keine Produktvorstellung: AMDs Vorstandsvorsitzende Lisa Su setzte sich persönlich mit dem Chef von Samsungs Halbleitersparte zusammen. Wenn sich zwei CEOs dieser Ebene treffen, steht selten eine Marketingpartnerschaft auf der Tagesordnung. Es geht um Liefermengen.
Worüber sie sprachen, war laut Berichten von Bloomberg High-Bandwidth-Memory. HBM ist der gestapelte Speicher, der neben einem KI-Beschleuniger sitzt und ihn schnell genug mit Daten versorgt, um den Siliziumchip auszulasten. Hergestellt wird er von drei Unternehmen – SK Hynix, Samsung und Micron – und SK Hynix hält derzeit den dominanten Anteil an der HBM3E-Liefermenge, die Nvidia verwendet. Wer verstehen will, warum KI-Compute knapp ist, findet die Antwort zunehmend weniger bei den Logikchips und mehr bei der Frage, wer Speicher zuverlässig in großen Stückzahlen stapeln kann.
Warum HBM die Auslieferungszahl bestimmt
Ein KI-Beschleuniger ist nur so nützlich wie die Speicherbandbreite, die an ihm hängt. Die Token-Generierung ist speicherintensiv: Das System liest wiederholt Modellgewichte und den Key-Value-Cache, weshalb On-Chip-SRAM und Speicherlokalität wichtiger sind als reine Rechendichte. Deshalb sagt die FLOPS-Kennzahl eines Chips weniger über die Inferenzkosten aus als seine Speicherkonfiguration – und deshalb geht Nvidias eigene Roadmap inzwischen dahin, um Speicherkapazität und Thermik zu kämpfen.
Samsungs Problem zeigt, um was es geht. Das Unternehmen hatte mit HBM-Ausbeuten zu kämpfen, was seine Qualifizierung für Nvidias Lieferkette verzögerte. Für AMD ist die Vertiefung der Beziehung eine Absicherung. Wenn es sich eine bevorzugte HBM-Zuteilung von Samsung sichern kann, hat seine MI-Roadmap einen Wettbewerbsanspruch, der nicht vom selben Zulieferer abhängt, den der Rivale bereits gebunden hat.
Die Spezifikationen zeigen, wie sehr es inzwischen um den Speicher geht. AMDs MI450 nutzt die CDNA-5-Architektur im 2-nm-Prozess von TSMC und trägt bis zu 432 Gigabyte HBM4 pro Chip. Diese Zahl hat echtes Gewicht: Sie entscheidet darüber, ob ein großes Mixture-of-Experts-Modell auf einem einzigen Beschleuniger läuft oder über mehrere aufgeteilt werden muss, was sowohl die Hardware-Rechnung als auch die Netzwerkkomplexität vervielfacht.
Warum die Inferenz und nicht das Training den Engpass antreibt
Das Training bekommt die Aufmerksamkeit, aber die Inferenz bestimmt den Speicherbedarf. Trainingsläufe sind endliche Projekte, die abgeschlossen werden, während Inferenz endlos läuft und mit den Nutzern skaliert. Die Erzeugung eines Tokens erfordert das Lesen der Modellgewichte und des Key-Value-Cache aus dem Speicher, und der Cache wächst mit der Kontextlänge, sodass ein langes Gespräch pro Nutzer mehr Speicher kostet als ein kurzes. Analysten, die schätzen, dass ein KI-Nutzer etwa fünfmal so viele Tokens verbraucht wie ein gewöhnlicher Servicenutzer, beschreiben eine Maschine, die pro Person weit mehr Zustand halten muss.
Die Antwort der Architekturbranche heißt Disaggregation: die Trennung von Prefill, der den Prompt verarbeitet, und Decode, der die Tokens erzeugt, sodass jeder Teil auf Hardware läuft, die zu seinem Profil passt. AMD und Cerebras sollen an einer Kombination arbeiten, die hohen Durchsatz mit niedriglatiger Generierung verbindet. Das hilft auf Rack-Ebene und ändert nichts am Angebot der Speicherchips, die beide Hälften brauchen. Solange sich die Packaging-Ausbeuten bei drei Zulieferern nicht verbessern, erkauft jeder Architekturtrick Effizienz, ohne den Engpass zu lösen.
AMD überschritt die Billionengrenze auf Basis von Hardware-Bestellungen
Die kommerzielle Nachricht kam im selben Zeitfenster. AMD schloss am 2. Oktober mit einem Rekordwert von 633,91 Dollar, womit der Börsenwert über eine Billion Dollar stieg und ein Plus von mehr als 180 Prozent für das Jahr markiert wurde. Die Rally hat einen konkreten Auslöser und nicht bloß sentimentale Gründe. OpenAI verpflichtete sich zu einem generationsübergreifenden Ausbau von sechs Gigawatt rund um den MI450, mit Einsatzbeginn in der zweiten Hälfte von 2026 und einem Warrant, der den an Meilensteine gekoppelten Kauf von bis zu 160 Millionen AMD-Aktien erlaubt. Oracle kam als Startpartner für einen Supercluster mit 50.000 MI450-GPUs ab dem dritten Quartal hinzu.
Liest man die Struktur, wirkt sie weniger wie eine Chipbestellung und mehr wie eine Finanzierungskonstruktion. Ein an Deployment-Meilensteine geknüpfter Warrant gibt dem Käufer eine Beteiligung am Erfolg des Lieferanten, was ein Weg ist, Anreize in Einklang zu bringen, wenn die Volumina groß genug sind, um beide Seiten zu beunruhigen. Nvidia fährt ein paralleles Spiel und plant mindestens 10 Gigawatt eigener Systeme für OpenAI mit potenziellen Investitionen von bis zu 100 Milliarden Dollar. Die Zwei-Lieferanten-Dynamik ist keine Beschaffungsstrategie mehr. Sie ist eine Joint-Venture-Struktur.
Microns Quartal und das Superzyklus-Argument
Die Speicherzahlen gaben von der anderen Seite dasselbe Signal. Microns Quartalsergebnisse lagen deutlich über den Erwartungen, getrieben von KI-bedingter HBM- und DRAM-Nachfrage, und mehrere Institute beschrieben den Moment als Beginn eines Speicher-Superzyklus und nicht als einmalige Spitze. Ein unterstützendes Argument ist der Verbrauch. Analysten, die Inferenz-Workloads verfolgen, setzen den Token-Verbrauch pro KI-Nutzer auf etwa das Fünffache eines Menschen, der einen normalen Dienst durchstöbert, was den Speicher von einem Bauteilkostenfaktor zu laufenden Kosten pro Nutzer macht.
Das ist wichtig dafür, wie sich die Knappheit auflöst. Logikkapazität lässt sich durch den Bau von Fabs erweitern, was ein paar Jahre dauert. HBM-Kapazität ist schwieriger, weil sie von fortgeschrittenem Packaging und von Stapelausbeuten abhängt, deren Beherrschung nur wenige Zulieferer gelernt haben. Samsungs Ausbeuteprobleme sind weniger ein Managementversagen als vielmehr ein Beleg dafür, wie schmal die Basis an Fachkräften ist. Einen dritten qualifizierten Zulieferer hinzuzufügen, ist ein mehrjähriges Projekt, und die Nachfragekurve wartet nicht.
Die Deskside-Version derselben Geschichte
Der Engpass zeigt sich auch in kleineren Formfaktoren. Nvidias GB300 Blackwell Ultra demonstrierte in Deskside-Tests mit 800-Gbps-Netzwerk mehr als 2,2 Milliarden Tokens pro Tag, eine beeindruckende Zahl für eine Maschine, die unter einem Schreibtisch steht. Es ist zugleich eine Maschine, deren Preis zum Teil davon bestimmt wird, wie viel Speicher hineinpasst. Dieselbe Physik, die ein Rechenzentrumsrack begrenzt, begrenzt auch eine Workstation.
Die langfristige Antwort, auf die die Anbieter setzen, ist architektonisch. Nvidias Vera-Rubin-Plattform, auf der CES vorgestellt, kombiniert Rubin-GPUs mit Vera-CPUs, NVLink-Scale-up-Netzwerk und einem kompletten Software-Stack, und das Unternehmen bewegt sich auf Kennzahlen wie Tokens pro Sekunde pro Watt statt auf rohe FLOPS zu. Es hat zudem seinen Interconnect über NVLink Fusion geöffnet, sodass Partner eigene CPUs und eigenes Silizium integrieren können. Berichten zufolge gibt es auch Anstrengungen für einen eigenen Speichercontroller, ein Signal dafür, dass das Unternehmen erwartet, dass die Speicherversorgung eine strategische Variable bleibt und keine eingekaufte Ware.
Worauf man achten sollte
Drei Dinge werden entscheiden, ob sich der Speicherengpass bis 2027 entspannt oder verschärft. Erstens Samsungs Qualifizierungszeitplan für HBM4 bei AMD und Nvidia, denn ein wirklich qualifizierter dritter Zulieferer verändert die Preisdynamik stärker als jede einzelne Produktvorstellung. Zweitens, ob Micron als Alternative die Lücke schließt, was Druck von den beiden koreanischen Zulieferern nähme. Drittens, ob disaggregierte Inferenz, bei der Prompt-Verarbeitung und Token-Generierung auf unterschiedlichen Beschleunigertypen laufen, so verbreitet wird, dass der Speicherdruck auf einen einzelnen Chip sinkt.
Nichts davon löst sich schnell. In der Zwischenzeit gilt für jeden, der KI-Compute kauft oder darauf aufbaut, die praktische Erkenntnis, dass der Speicher und nicht die Rechenleistung die Zahl ist, die Ihre Kosten bewegt. Die Logik-Roadmap ist öffentlich und vorhersehbar. Die Speicher-Roadmap wird von Packaging-Ausbeuten, einer über Jahre aufgebauten Talentbasis und den Investitionsplänen dreier Unternehmen begrenzt – und sie ist diejenige, die entschieden hat, wie viele Beschleuniger tatsächlich ausgeliefert werden.
Verwandte Artikel
KI-Musik hat eine Lizenz erhalten. Lesen Sie, was sie tatsächlich abdeckt.
Billige Tracks gibt es noch. Was verschwindet, ist die Annahme, dass ein aus einem Prompt generierter Track frei von Ansprüchen ist – was nie stimmte und jetzt nachweislich falsch ist.
Hengdians Studios stehen leer, während Asiens KI-Filmpipeline läuft
Hengdians leere Studios sind der Beweis, dass die Branche ihre Wette bereits gesetzt hat, ob das Publikum zustimmt oder nicht.
Google kauft 890 Megawatt Kernkraft für seine Rechenzentren
Die Rechenleistung ist verfügbar. Der Strom ist das, was Jahre im Voraus organisiert werden muss, so wie eine Lieferkette organisiert wird.
Meta hat den Buch-Rechtsstreit beigelegt. Die Erlaubnis hat jetzt einen Preis.
Metas Einigung entfernt einen Orientierungspunkt von der Karte. Sie zeichnet den Rest nicht, und die nächsten paar Einigungen werden entscheiden, ob Erlaubnis zu einem Markt wird oder eine Reihe von Ausnahmen bleibt.