Die seltsame Ökonomie von KI-Chips: Neue Racks senken Kosten, während alte Chips teurer werden

Im September sind im KI-Hardware-Bereich zwei Dinge passiert, die in entgegengesetzte Richtungen zu weisen scheinen. Nvidia begann, seine neuesten Rack-Scale-Systeme an die großen Cloud-Anbieter auszuliefern, und verspricht deutlich günstigere Inferenz. Gleichzeitig stieg der Preis für die Miete seiner drei Jahre alten H100-Chips. Beides ist wahr, und zusammen erklärt es etwas darüber, wie die KI-Wirtschaft tatsächlich funktioniert.
Die neuen Racks
Nvidia bestätigte, dass seine Vera-Rubin-NVL144-Rack-Systeme in großem Umfang ausgeliefert werden, wobei die ersten großen Bereitstellungen bei Microsoft, Google, Amazon und Oracle online gehen und CoreWeave angibt, dass seine ersten Rubin-Cluster vor Ende September für Kunden verfügbar sein würden. Dies ist der größte Hardware-Übergang, den die Branche je versucht hat, und ersetzt die Blackwell-Generation, die in den vergangenen zwei Jahren den größten Teil des Trainings von Frontier-Modellen angetrieben hat.
Die Architektur besteht nicht aus einem einzelnen Chip. Vera Rubin kombiniert eine Vera-CPU mit zwei Rubin-GPUs pro Node und verbindet sie so, dass ein ganzes Rack wie ein großer Prozessor wirkt. Die NVL144-Konfiguration verbindet 144 Rubin-GPUs über 72 Nodes in einem Rack, erstmals mit HBM4-Speicher in einem Produktionssystem und rund 13 Terabyte pro Sekunde Speicherbandbreite pro GPU. Nvidia beansprucht rund 3,6 Exaflops FP4-Inferenzleistung pro Rack, etwa dreimal so viel wie ein vergleichbares Blackwell-NVL72-Rack. Das sind Idealwerte, und konservative unabhängige Schätzungen gehen eher von einem realen Zugewinn um den Faktor zwei bis zweieinhalb aus.
Die Zahl, die für alle außerhalb des Rechenzentrums zählt, sind die Kosten pro Token. Erste Cloud-Preise deuten darauf hin, dass Rubin-basierte Instanzen die Blackwell-Inferenz zum Start um 30 bis 40 Prozent unterbieten könnten, wobei die Preise mit steigender Kapazität typischerweise weiter fallen. Diese Zahl wirkt sich auf den Preis eines API-Aufrufs aus, auf die Größe eines Abonnements und darauf, ob eine Videogenerierungsfunktion in einem 20-Dollar-Tarif existieren kann.
Die alten Chips, die teurer wurden
Hier ist der kontraintuitive Teil. Im September stieg der Stundenmietpreis für die H100, den Chip, der die erste Welle von KI-Produkten angetrieben hat, um 22 Prozent auf 3,28 Dollar pro Stunde. Nvidias Vorstandsvorsitzender verwies auf den Anstieg als Beweis dafür, dass Compute ein langlebiger, umsatzgenerierender Vermögenswert ist und nicht etwas, das planmäßig an Wert verliert.
Der Grund ist das Angebot. Neue Blackwell- und Rubin-Chips werden für die größten Käufer reserviert, sodass ältere H100-Cluster die alltäglichen Inferenz-Workloads übernehmen. Knappe Strom- und Speicherkapazitäten in Rechenzentren halten die ältere Hardware beschäftigt und die Mietpreise hoch. Die H100 ist immer noch weit günstiger als zum Start, als große Cloud-Firmen sie für sieben bis acht Dollar pro Stunde mieteten, doch der jüngste Anstieg widerspricht der Standardbuchhaltung, die den Chipwert über fünf bis sechs Jahre abschreibt.
Diese Lücke hat Aufmerksamkeit erregt. Leerverkäufer argumentieren, dass die tatsächliche Lebensdauer von Chips kürzer sei als die offiziellen Zeitpläne annehmen, was bedeuten würde, dass die Abschreibung in den Büchern der Cloud-Anbieter zu langsam erfolgt. Nvidia meldete im August einen Rekordquartalsumsatz von 96,2 Milliarden Dollar, und der steigende Mietpreis liefert dem Unternehmen ein frisches Argument, dass seine Chips lange nach ihrem Neuheitswert weiter Geld verdienen.
Das Rennen um die Skalierung der neuen Racks
Die Geschwindigkeit des Rollouts sagt ebenso viel aus wie die Spezifikationen. CoreWeave wurde der erste Cloud-Anbieter, der die neue Hardware in Multi-Rack-Maßstab betreibt, und fuhr am 16. September sieben Vera-Rubin-NVL72-Racks mit insgesamt 504 GPUs als einen Produktionscluster über zwei Regionen hoch. Der Sprung von einem einzelnen validierten Rack zu einem Multi-Rack-Fabric ist wichtig, weil agentische KI-Workloads viele kleine, latenzempfindliche Aufrufe erzeugen und sich Verzögerungen über wiederholte Modell- und Tool-Interaktionen summieren. Jedes NVL72-Rack kombiniert 72 GPUs mit 36 Vera-CPUs, und das Fabric-Design unterstützt rund 128.000 GPUs pro Rail ohne Redesign, was bedeutet, dass Kapazitätserweiterung eine Konfigurationsänderung statt eines Neuaufbaus ist.
Auch das Angebotsmuster sieht diesmal anders aus. In der Blackwell-Generation überstieg die Nachfrage das Angebot so stark, dass kleinere Cloud-Anbieter und nationale KI-Programme sechs Monate oder länger warteten. Nvidia hat die Rubin-Produktion früher hochgefahren, und mehrere souveräne KI-Projekte in Europa und im Nahen Osten befinden sich Berichten zufolge in der ersten Lieferwelle statt in der dritten. Nvidia kündigte außerdem eine Partnerschaft mit australischen Cloud- und Rechenzentrumsbetreibern an, um bis 2027 bis zu zwei Gigawatt KI-Fabrikkapazität aufzubauen. Wenn das hält, wird das Mieten von GPU-Zeit deutlich einfacher, was die gesamte Kostenkurve für alle nachgelagerten Akteure nach unten zieht.
Warum beides wahr ist
Der scheinbare Widerspruch löst sich auf, sobald man Training und Inferenz trennt. Training braucht die neuesten, größten Cluster, und diese Nachfrage rechtfertigt den Bau von Racks wie Vera Rubin. Inferenz ist alles, was ein Modell nach dem Training tut: jede Chatbot-Antwort, jedes generierte Bild, jeder Coding-Vorschlag. Mit wachsender Nutzung können die wiederkehrenden Kosten für die Bedienung dieser Anfragen größer werden als die ursprüngliche Trainingsrechnung.
Deshalb öffnet Nvidia einen Teil seines Ökosystems, anstatt jeden Sockel zu verteidigen. Am 10. September kündigte das Unternehmen eine Zusammenarbeit mit d-Matrix an, einem Startup, das Chips speziell für Inferenz entwickelt. Im Rahmen der Vereinbarung werden d-Matrix' Raptor-Chips der nächsten Generation über NVLink Fusion an Nvidias Rack-Architektur angebunden. Raptor ist für KI-Inferenz gebaut, insbesondere für latenzarme Arbeiten wie Chatbots, Coding-Assistenten und Voice-Agents, mit einem speicherzentrierten Design, das Latenz und Kosten senken soll. Nvidia gibt nichts auf, was ihm vollständig gehörte, denn es liefert weiterhin die CPUs, das Networking, die Switches und die Software rund um das Rack, gewinnt aber einen Platz im Inferenzmarkt, selbst wenn es nicht jeden Beschleuniger für sich entscheidet.
Darunter liegt eine härtere Einschränkung. Ein einzelnes Vera-Rubin-NVL144-Rack zieht rund 600 Kilowatt, etwa so viel wie 500 durchschnittliche Haushalte. Strom, nicht Chips, wird zur bindenden Grenze für das KI-Wachstum, weshalb Microsoft, Google und Amazon im vergangenen Jahr alle Verträge über Kern- und Geothermiekraftwerke unterzeichnet haben, um Cluster wie diese zu versorgen. Wenn Sie wissen wollen, wohin die KI-Kapazität geht, achten Sie eher auf Stromabnahmeverträge als auf Benchmark-Ergebnisse.
Was das für den Preis von KI bedeutet
Für Nutzer bedeutet das praktisch, dass die Kosten für den Betrieb eines Modells weiter sinken sollten, selbst wenn die Kosten für die neueste Hardware hoch bleiben. Günstigere Inferenz ermöglicht es, dass Funktionen, die letztes Jahr zu teuer waren, dieses Jahr zum Standard werden. Lange, sorgfältige Chatbot-Antworten, Coding-Assistenten, die eine gesamte Codebasis lesen, und On-Demand-Videogenerierung hängen alle davon ab, dass sich diese Kostenkurve nach unten neigt.
Die Frage, die Investoren immer wieder stellen, ist, ob sich die enormen Rechenzentrumsausgaben jemals bezahlt machen werden. Rubin ist Teil der Antwort. Wenn es etwa alle achtzehn Monate ungefähr doppelt so günstig wird, dasselbe Modell zu betreiben, beginnen die Ausgaben weniger wie eine Blase und mehr wie Infrastruktur auszusehen. Wenn diese Kurve ins Stocken gerät, bekommen die Skeptiker ihren Moment. Die nächsten zwei Quartale der Cloud-Preise werden zeigen, wohin die Reise geht, und diese Zahl erreicht Sie lange vor jedem Benchmark – in Form der Kosten Ihrer KI-Tools.
Verwandte Artikel
Japan stellt 101,6 Billionen Yen hinter KI. Der konkrete Teil ist ein Rechenzentrum bei Tokio
Ein Energieversorger ist der Anker. JERA erzeugt Strom, und seine Rolle sorgt dafür, dass das erste Problem auf der Erzeugungsebene gelöst wird.
Broadcom leiht Anthropic bis zu 42 Milliarden Dollar für die Miete von Broadcoms eigenen Chips
Ein Hardware-Anbieter leiht seinem Kunden das Geld, um Hardware vom selben Anbieter zu mieten.
Tencent mietete 100.000 KI-Chips von Oracle. Der interessante Teil ist die Route.
Die Chips haben sich nicht bewegt. Deshalb ist es schwieriger, auf diesen Deal zu reagieren, als auf eine an einem Hafen abgefangene Lieferung.
China hat begonnen, Regeln für Agenten-Identität zu schreiben, und die Frage ist, für wen der Agent arbeitet
Identität ist die leichte Hälfte. Die schwierige Hälfte ist die Zurechnung.