← Torna al blog
Newscirca 7 min di lettura

La strana economia dei chip per l'IA: i nuovi rack riducono i costi mentre i vecchi chip diventano più cari

Pubblicato 2 ott 2026
La strana economia dei chip per l'IA: i nuovi rack riducono i costi mentre i vecchi chip diventano più cari

A settembre sono successe due cose nel mondo dell'hardware per l'IA, e sembrano puntare in direzioni opposte. Nvidia ha iniziato a spedire i suoi nuovissimi sistemi rack-scale ai grandi provider cloud, promettendo un'inferenza molto più economica. Allo stesso tempo, il prezzo per noleggiare i suoi chip H100, ormai vecchi di tre anni, è aumentato. Entrambe le cose sono vere, e insieme spiegano qualcosa su come funziona davvero l'economia dell'IA.

I nuovi rack

Nvidia ha confermato che i suoi sistemi rack Vera Rubin NVL144 stanno arrivando in volume, con le prime grandi implementazioni che entreranno in funzione presso Microsoft, Google, Amazon e Oracle, e CoreWeave che ha dichiarato che i suoi primi cluster Rubin saranno disponibili per i clienti prima della fine di settembre. Questa è la più grande transizione hardware mai tentata dal settore, che sostituisce la generazione Blackwell che ha alimentato gran parte dell'addestramento dei modelli frontier negli ultimi due anni.

L'architettura non è un singolo chip. Vera Rubin abbina una CPU Vera a due GPU Rubin per nodo e le collega in modo che un intero rack funzioni come un unico grande processore. La configurazione NVL144 connette 144 GPU Rubin su 72 nodi in un rack, con memoria HBM4 per la prima volta in un sistema di produzione e circa 13 terabyte al secondo di larghezza di banda di memoria per GPU. Nvidia dichiara circa 3,6 exaflop di prestazioni di inferenza FP4 per rack, circa tre volte un rack Blackwell NVL72 comparabile. Sono numeri in condizioni ideali, e stime indipendenti prudenti collocano il guadagno nel mondo reale più vicino a due o due volte e mezzo.

Il numero che conta per tutti coloro che stanno fuori dal data center è il costo per token. I prezzi cloud iniziali suggeriscono che le istanze basate su Rubin potrebbero costare dal 30 al 40 per cento in meno rispetto all'inferenza Blackwell al lancio, con prezzi che in genere scendono ulteriormente man mano che la capacità aumenta. Quel dato si ripercuote a valle sul prezzo di una chiamata API, sull'entità di un abbonamento e sulla possibilità che una funzione di generazione video esista all'interno di un piano da venti dollari.

I vecchi chip che sono diventati più costosi

Ecco la parte controintuitiva. A settembre, il prezzo di noleggio orario dell'H100, il chip che ha alimentato la prima ondata di prodotti di IA, è aumentato del 22 per cento fino a 3,28 dollari l'ora. L'amministratore delegato di Nvidia ha indicato questo aumento come prova che la potenza di calcolo è un asset durevole e generatore di ricavi, piuttosto che qualcosa che si deprezza secondo il previsto.

Il motivo è l'offerta. I nuovi chip Blackwell e Rubin vengono riservati ai compratori più grandi, il che lascia ai vecchi cluster H100 il compito di gestire i carichi di lavoro di inferenza quotidiani. L'offerta limitata di energia e memoria nei data center tiene occupato il vecchio hardware e mantiene alti i prezzi di noleggio. L'H100 è ancora molto più economico di quanto fosse al lancio, quando le grandi aziende cloud lo noleggiavano a sette o otto dollari l'ora, ma il recente aumento va contro la contabilità standard, che svaluta il valore dei chip nell'arco di cinque o sei anni.

Questa discrepanza ha attirato l'attenzione. Gli short seller hanno sostenuto che la durata di vita reale dei chip è più breve di quanto presuppongano i calendari ufficiali, il che significherebbe che l'ammortamento nei bilanci dei provider cloud è troppo lento. Nvidia ha registrato ricavi trimestrali record di 96,2 miliardi di dollari ad agosto, e il prezzo di noleggio in aumento offre all'azienda un nuovo argomento: i suoi chip continuano a generare ricavi a lungo dopo essere diventati vecchi.

La corsa per scalare i nuovi rack

La velocità del rollout dice tanto quanto le specifiche. CoreWeave è diventata il primo provider cloud a eseguire il nuovo hardware su scala multi-rack, attivando sette rack Vera Rubin NVL72, per un totale di 504 GPU, come un unico cluster di produzione distribuito su due regioni il 16 settembre. Il salto da un singolo rack convalidato a un fabric multi-rack è importante perché i carichi di lavoro di IA agentica effettuano molte chiamate piccole e sensibili alla latenza, e i ritardi si accumulano attraverso ripetute interazioni tra modelli e strumenti. Ogni rack NVL72 abbina 72 GPU a 36 CPU Vera, e il design del fabric supporta circa 128.000 GPU per rail senza riprogettazione, il che significa che aggiungere capacità è un cambio di configurazione, non una ricostruzione.

Anche il modello di offerta questa volta sembra diverso. Nella generazione Blackwell, la domanda ha superato talmente tanto l'offerta che i provider cloud più piccoli e i programmi nazionali di IA hanno aspettato sei mesi o più. Nvidia ha aumentato prima la produzione di Rubin, e diversi progetti di IA sovrana in Europa e Medio Oriente sarebbero nella prima ondata di spedizioni anziché nella terza. Nvidia ha anche annunciato una partnership con operatori cloud e data center australiani per costruire fino a due gigawatt di capacità di AI factory entro il 2027. Se questo regge, noleggiare tempo GPU diventa sensibilmente più facile, il che abbassa l'intera curva dei costi per tutti a valle.

Perché entrambe le cose sono vere

L'apparente contraddizione si risolve una volta separato l'addestramento dall'inferenza. L'addestramento richiede i cluster più nuovi e più grandi, ed è quella domanda a giustificare la costruzione di rack come Vera Rubin. L'inferenza è tutto ciò che un modello fa dopo essere stato addestrato: ogni risposta di chatbot, ogni immagine generata, ogni suggerimento di codice. Man mano che l'uso cresce, il costo ricorrente di servire quelle richieste può diventare superiore alla fattura di addestramento originale.

Ecco perché Nvidia sta aprendo parte del suo ecosistema invece di difendere ogni socket. Il 10 settembre ha annunciato una collaborazione con d-Matrix, una startup che costruisce chip specificamente per l'inferenza. Nell'ambito dell'accordo, i chip Raptor di prossima generazione di d-Matrix si collegheranno all'architettura rack di Nvidia tramite NVLink Fusion. Raptor è progettato per l'inferenza AI, in particolare per lavori a bassa latenza come chatbot, assistenti di programmazione e agenti vocali, con un design incentrato sulla memoria pensato per ridurre latenza e costi. Nvidia non cede nulla di ciò che possiede interamente, perché fornisce ancora CPU, networking, switch e software attorno al rack, guadagnando allo stesso tempo una posizione nel mercato dell'inferenza anche se non vince ogni acceleratore.

C'è un vincolo più duro sotto tutto questo. Un singolo rack Vera Rubin NVL144 assorbe circa 600 kilowatt, all'incirca la potenza di 500 case medie. L'elettricità, non i chip, sta diventando il limite vincolante alla crescita dell'IA, ed è per questo che Microsoft, Google e Amazon hanno tutti firmato accordi per energia nucleare e geotermica nell'ultimo anno per alimentare cluster come questi. Se volete sapere dove sta andando la capacità di IA, guardate gli accordi di acquisto di energia piuttosto che i punteggi dei benchmark.

Che cosa significa per il prezzo dell'IA

Per gli utenti, la lettura pratica è che il costo di eseguire un modello dovrebbe continuare a scendere, anche se il costo dell'hardware più recente resta alto. Un'inferenza più economica rende possibile che funzionalità troppo costose l'anno scorso diventino standard quest'anno. Risposte lunghe e accurate dei chatbot, assistenti di programmazione che leggono un intero codebase e generazione video on demand dipendono tutti dal fatto che questa curva dei costi si pieghi verso il basso.

La domanda che gli investitori continuano a porsi è se l'enorme spesa per i data center riuscirà mai a ripagarsi da sola. Rubin fa parte della risposta. Se eseguire lo stesso modello diventa circa due volte più economico ogni diciotto mesi circa, la spesa inizia a sembrare meno una bolla e più un'infrastruttura. Se quella curva si blocca, gli scettici hanno il loro momento. I prossimi due trimestri di prezzi cloud diranno in quale direzione va, e quel numero ti raggiungerà molto prima di qualsiasi benchmark, sotto forma di quanto costano i tuoi strumenti di IA.

Articoli correlati