Il chip di memoria è ora il collo di bottiglia nel calcolo AI

L'evento più rivelatore nell'hardware AI di questo mese è stato un incontro piuttosto che un lancio: l'amministratrice delegata di AMD, Lisa Su, seduta di persona con il capo della divisione semiconduttori di Samsung. Quando due CEO di quel livello si incontrano, il tema sul tavolo raramente è una partnership di marketing. È l'approvvigionamento.
Ciò di cui stavano discutendo, secondo quanto riportato da Bloomberg, è la memoria ad alta larghezza di banda. HBM è la memoria impilata che si trova accanto a un acceleratore AI e gli fornisce dati abbastanza velocemente da mantenere il silicio occupato. È prodotta da tre aziende, SK Hynix, Samsung e Micron, e SK Hynix attualmente detiene la quota dominante della fornitura HBM3E che Nvidia utilizza. Se vuoi capire perché il calcolo AI scarseggia, la risposta ha sempre meno a che fare con i chip logici e sempre più con chi può impilare memoria in modo affidabile su larga scala.
Perché l'HBM decide il numero di spedizioni
Un acceleratore AI è utile solo quanto la larghezza di banda di memoria che vi è collegata. La generazione di token è ad alta intensità di memoria: il sistema legge ripetutamente i pesi del modello e la cache chiave-valore, quindi la SRAM on-chip e la località della memoria contano più della densità di calcolo grezza. Ecco perché il numero di FLOPS di punta di un chip ti dice meno sul costo di inferenza di quanto faccia la sua configurazione di memoria, e perché la roadmap di Nvidia stessa si è spostata verso la competizione su capacità di memoria e termiche.
Il problema di Samsung illustra la posta in gioco. L'azienda ha lottato con i rendimenti HBM che hanno ritardato la sua qualificazione per la catena di fornitura di Nvidia. Per AMD, approfondire la relazione è una copertura. Se riesce a garantirsi un'assegnazione preferenziale di HBM di Samsung, la sua roadmap della serie MI ottiene una pretesa competitiva che non dipende dallo stesso fornitore che il suo rivale ha già legato.
Le specifiche mostrano quanto la memoria sia ormai il punto centrale. L'MI450 di AMD utilizza l'architettura CDNA 5 sul processo a 2nm di TSMC e trasporta fino a 432 gigabyte di HBM4 per chip. Quel numero ha un peso reale: è la differenza tra eseguire un grande modello mixture-of-experts su un acceleratore e doverlo dividere su diversi, il che moltiplica sia il conto hardware che la complessità di rete.
Perché è l'inferenza, non l'addestramento, a guidare la stretta
L'addestramento riceve l'attenzione, ma è l'inferenza a determinare la domanda di memoria. Le esecuzioni di addestramento sono progetti finiti che terminano, mentre l'inferenza dura per sempre e scala con gli utenti. Generare un token richiede la lettura dei pesi del modello e della cache chiave-valore dalla memoria, e la cache cresce con la lunghezza del contesto, quindi una conversazione lunga costa più memoria per utente rispetto a una breve. Gli analisti che stimano che un utente AI consumi circa cinque volte i token di un utente di un servizio ordinario stanno descrivendo una macchina che deve mantenere molto più stato per persona.
La risposta dell'industria delle architetture è la disaggregazione: separare la prefill, che elabora il prompt, dalla decode, che genera i token, in modo che ciascuna venga eseguita su hardware adatto al proprio profilo. Si è riportato che AMD e Cerebras stanno lavorando a un abbinamento che combina elaborazione ad alto throughput con generazione a bassa latenza. Questo aiuta a livello di rack e non fa nulla per la fornitura dei chip di memoria di cui entrambe le metà hanno bisogno. Finché i rendimenti del packaging non miglioreranno presso tre fornitori, ogni trucco architetturale compra efficienza senza alleviare il vincolo.
AMD ha superato i mille miliardi di dollari grazie agli ordini hardware
La notizia commerciale è arrivata nello stesso periodo. AMD ha chiuso a un record di $633,91 il 2 ottobre, portando il suo valore di mercato sopra i mille miliardi di dollari e segnando un guadagno di oltre il 180 percento per l'anno. Il rally ha una causa specifica, non di sentimento. OpenAI si è impegnata per una costruzione multi-generazionale da sei gigawatt centrata sull'MI450, con distribuzione a partire dalla seconda metà del 2026 e un warrant che consente l'acquisto di fino a 160 milioni di azioni AMD legate a milestone. Oracle si è unita come partner di lancio per un supercluster che utilizza 50.000 GPU MI450 a partire dal terzo trimestre.
Leggi la struttura e sembra meno un ordine di chip e più un accordo di finanziamento. Un warrant legato a milestone di distribuzione dà all'acquirente una partecipazione azionaria nel successo del fornitore, che è un modo per allineare gli incentivi quando i volumi sono abbastanza grandi da preoccupare entrambe le parti. Nvidia sta operando una mossa parallela, pianificando almeno 10 gigawatt di sistemi propri per OpenAI con potenziale investimento fino a 100 miliardi di dollari. La dinamica a due fornitori non è più una strategia di approvvigionamento. È una struttura di joint venture.
Il trimestre di Micron e l'argomento del superciclo
Gli utili della memoria hanno dato lo stesso segnale dall'altro lato. I risultati trimestrali di Micron sono arrivati ben al di sopra delle aspettative grazie alla domanda di HBM e DRAM guidata dall'AI, e diverse istituzioni hanno descritto il momento come l'inizio di un superciclo della memoria piuttosto che un picco. Un argomento a supporto è il consumo. Gli analisti che tracciano i carichi di lavoro di inferenza collocano il consumo di token per utente AI a circa cinque volte quello di un umano che naviga un servizio normale, il che ridescrive la memoria da costo componente a costo operativo per utente.
Questo è importante per come si risolve la carenza. La capacità logica può essere aggiunta costruendo fabbriche, il che richiede un paio d'anni. La capacità HBM è più difficile perché dipende dal packaging avanzato e dai rendimenti di impilamento che un piccolo numero di fornitori ha imparato a controllare. I problemi di rendimento di Samsung non sono tanto un fallimento gestionale quanto la prova di quanto sia ristretta la base di competenze. Aggiungere un terzo fornitore qualificato è un progetto pluriennale, e la curva della domanda non aspetta.
La versione da scrivania della stessa storia
Il vincolo si manifesta anche in formati più piccoli. Il GB300 Blackwell Ultra di Nvidia ha dimostrato più di 2,2 miliardi di token al giorno in test da scrivania con networking a 800 Gbps, un numero sorprendente per una macchina che sta sotto una scrivania. È anche una macchina il cui prezzo è determinato in parte da quanta memoria può essere stipata al suo interno. La stessa fisica che limita un rack di data center limita una workstation.
La risposta a lungo termine su cui i fornitori scommettono è architetturale. La piattaforma Vera Rubin di Nvidia, presentata al CES, abbina GPU Rubin con CPU Vera, networking scale-up NVLink e uno stack software completo, e l'azienda sta spingendo verso metriche come token al secondo per watt piuttosto che FLOPS grezzi. Ha anche aperto il suo interconnect tramite NVLink Fusion, consentendo ai partner di integrare le proprie CPU e silicio. C'è anche una riportata iniziativa per un controller di memoria personalizzato, che è un segnale che l'azienda si aspetta che la fornitura di memoria rimanga una variabile strategica piuttosto che una merce acquistata.
Cosa tenere d'occhio
Tre cose decideranno se il vincolo di memoria si allenterà o si irrigidirà fino al 2027. La prima è la tempistica di qualificazione di Samsung per HBM4 con entrambi AMD e Nvidia, perché un terzo fornitore genuinamente qualificato cambia la dinamica dei prezzi più di qualsiasi singolo lancio di prodotto. La seconda è se Micron colmerà il divario come alternativa, il che toglierebbe pressione ai due fornitori coreani. La terza è se l'inferenza disaggregata, in cui l'elaborazione del prompt e la generazione di token vengono eseguite su tipi di acceleratori diversi, diventerà abbastanza comune da ridurre la pressione di memoria su qualsiasi singolo chip.
Nessuna di queste si risolverà rapidamente. Nel frattempo, la lettura pratica per chiunque acquisti o costruisca su calcolo AI è che la memoria, non il calcolo, è il numero che muoverà i tuoi costi. La roadmap logica è pubblica e prevedibile. La roadmap della memoria è vincolata dai rendimenti del packaging, da una base di talenti che richiede anni e dai piani di capitale di tre aziende, ed è quella che ha deciso quanti acceleratori vengono effettivamente spediti.
Articoli correlati
La musica AI ha ottenuto una licenza. Ecco cosa copre davvero.
Le tracce economiche esistono ancora. Ciò che sta scomparendo è l'assunto che una traccia generata da un prompt sia priva di rivendicazioni, cosa che non è mai stata vera e ora è dimostrabilmente falsa.
Gli studi di Hengdian sono vuoti mentre la pipeline del cinema AI asiatico corre
I teatri di posa vuoti di Hengdian sono la prova che l'industria ha già scommesso, che il pubblico sia d'accordo o no.
Google ha comprato 890 megawatt di nucleare per alimentare i suoi data center
La capacità di calcolo è disponibile. L'elettricità è ciò che deve essere organizzato, con anni di anticipo, come si organizza una catena di approvvigionamento.
Meta ha chiuso la causa sui libri. Ora il permesso ha un prezzo.
L'accordo di Meta rimuove un punto di riferimento dalla mappa. Non disegna il resto, e i prossimi accordi decideranno se il permesso diventa un mercato o resta una serie di eccezioni.