I chip Ascend di Huawei stanno costruendo una via alternativa per i modelli di immagini AI

La maggior parte delle conversazioni sull'hardware per l'AI passa attraverso una sola azienda e un solo tipo di chip. Huawei sta cercando di costruire una seconda strada, e il suo ultimo passo emerge dagli annunci sull'infrastruttura di questo mese.
Huawei ha presentato l'Ascend 960 SuperPoD, un cluster basato sui suoi processori Ascend e commercializzato attorno alla tecnologia NPO per l'infrastruttura AI di prossima generazione. L'annuncio è mirato all'addestramento e all'erogazione di modelli di grandi dimensioni e, sebbene la generazione di immagini non sia il caso d'uso principale, rientra in pieno nella sua area di impatto. I modelli testo-immagine sono tra i carichi di lavoro più avidi di calcolo nell'AI, e qualsiasi alternativa allo stack hardware dominante ridefinisce chi può permettersi di costruirli ed eseguirli.
Lo sfondo strategico è rappresentato dai controlli sulle esportazioni statunitensi, che hanno limitato l'accesso ai chip più avanzati per le aziende cinesi. Ciò ha spinto le aziende cinesi a sviluppare alternative nazionali, e la linea Ascend di Huawei è la più avanzata di questi sforzi. Il 960 SuperPoD è l'ultima affermazione che il divario si sta riducendo, o almeno che esiste un percorso praticabile senza l'hardware soggetto a restrizioni. È una scommessa sul fatto che il futuro dell'AI cinese non debba per forza girare su chip che qualcun altro può tagliare fuori.
Per i modelli di immagini in particolare, questo conta sotto diversi aspetti. Primo, addestrare un grande modello di immagini è costoso in un modo che risente del silicio sottostante. I modelli di diffusione alla base dei generatori di immagini sono avidi di calcolo durante l'addestramento, richiedendo molte iterazioni su grandi set di dati, e il costo è direttamente legato all'efficienza dei chip e dello stack software. Se i chip nazionali possono addestrare ed erogare modelli a costi accettabili, i laboratori cinesi possono continuare a rilasciare modelli aperti come Qwen-Image 2.1 senza dipendere da hardware straniero. È una questione di resilienza tanto quanto di prestazioni.
Secondo, l'erogazione conta più di quanto si pensi. La generazione di immagini è interattiva. Gli utenti digitano un prompt e si aspettano un risultato in pochi secondi, e un modello popolare riceve milioni di richieste simili al giorno. L'efficienza di inferenza, non solo il throughput di addestramento, determina se un servizio di immagini gratuito o economico è economicamente sostenibile. Uno stack di inferenza nazionale cambia i calcoli dei costi per app e API di immagini cinesi, ed è il motivo per cui aziende come Huawei investono così tanto nell'infrastruttura di erogazione, non solo nei cluster di addestramento.
Terzo, c'è una dimensione legata agli standard. I modelli di immagini a livello globale presuppongono sempre più un particolare ecosistema software per l'addestramento e l'erogazione, un insieme specifico di framework, kernel e librerie di ottimizzazione. Uno stack hardware rivale ha bisogno del proprio livello software, dei propri ottimizzatori, della propria comunità, e il divario tra hardware e hardware utilizzabile è per lo più software. Huawei lo sta costruendo, e ogni annuncio sull'infrastruttura è un passo verso un ecosistema che non dipende dalla toolchain dell'operatore dominante.
Niente di tutto ciò significa che i chip di Huawei stiano per sostituire il player dominante in capacità grezza. La lettura onesta è che offrono una seconda fonte, e le seconde fonti contano anche quando non sono le migliori, perché cambiano la posizione negoziale di tutti a valle. Un laboratorio che può addestrare su silicio nazionale è meno esposto a shock dell'offerta. Un'azienda che può erogare su di esso ha maggiore libertà di prezzo. Un paese che può fare entrambe le cose ha più autonomia strategica, che è il punto centrale dell'esercizio.
La dimensione geopolitica qui è inevitabile. I modelli di immagini non sono solo giocattoli per consumatori. Sono usati nella progettazione, nella produzione, nei media e sempre più in applicazioni vicine allo Stato, dalla propaganda alla sorveglianza alla disinformazione. Il controllo sull'hardware che li addestra ed esegue è il controllo su una capacità strategica, che è esattamente il motivo per cui esistono i controlli sulle esportazioni ed esattamente il motivo per cui si persegue con tanta aggressività un'alternativa nazionale. I due sono bloccati in un ciclo: le restrizioni accelerano lo sforzo nazionale, e lo sforzo nazionale dà un obiettivo alle restrizioni.
Per le persone fuori dalla Cina, gli annunci Ascend sono facili da ignorare come questione interna. Sarebbe un errore. Se lo stack alternativo raggiunge una soglia in cui i modelli aperti si addestrano ed erogano bene su di esso, il prossimo Qwen-Image, o quello successivo, potrebbe non toccare mai l'hardware che si presume universale. L'economia della generazione di immagini sta silenziosamente acquisendo una seconda storia hardware, e questa plasmerà quali modelli vengono rilasciati, quanto economicamente girano e chi controlla l'infrastruttura sotto tutto ciò.
C'è anche una dimensione legata ai talenti e alla comunità. Uno stack hardware alternativo ha bisogno di persone che sappiano usarlo, e quelle persone sono attualmente concentrate nell'ecosistema dell'operatore dominante. Costruire quella comunità richiede anni, ed è il vero gioco a lungo termine. Gli annunci sull'infrastruttura di Huawei, da questo punto di vista, riguardano tanto il reclutamento e la segnalazione quanto le specifiche grezze. Stanno dicendo al mondo: qui c'è un percorso praticabile, vieni a costruirci sopra.
L'angolazione della generazione di immagini è la parte che la maggior parte degli osservatori manca. Leggono «SuperPoD» e pensano a modelli linguistici e chatbot. Ma gli stessi cluster addestrano ed erogano i modelli che generano immagini, e l'economia della generazione di immagini, alto calcolo, alta interattività, alto volume, la rende uno dei primi carichi di lavoro in cui uno stack alternativo può dimostrarsi commercialmente valido. Osservate quanto rapidamente i modelli di immagini nazionali adottano il silicio nazionale. Questo vi dirà più sulla traiettoria di questa seconda strada di qualsiasi grafico di benchmark.
C'è anche un punto sottile su dove sia il vero collo di bottiglia. Il chip è solo metà della storia. L'altra metà è il software che rende utile il chip, i compilatori, i kernel, i framework e le implementazioni dei modelli ottimizzate per un'architettura specifica. Un chip senza software è un fermacarte. Questo è il motivo per cui gli annunci di Huawei abbinano l'hardware a una spinta sull'ecosistema software, e perché il divario tra lo stack dominante e l'alternativa si misura tanto in strumenti per sviluppatori quanto in teraflop. Per i modelli di immagini, ciò significa che la domanda non è solo «il chip può eseguire la diffusione», ma «il chip può eseguire bene la diffusione, attraverso strumenti che uno sviluppatore già conosce, senza una squadra di specialisti che ottimizzi a mano ogni livello».
Questo divario software è il motivo per cui lo stack alternativo ha tardato a decollare nonostante anni di investimenti. L'hardware può essere costruito in laboratorio, ma un ecosistema di sviluppatori deve essere costruito dagli sviluppatori, e gli sviluppatori vanno dove gli strumenti sono buoni e l'attrito è basso. Ogni modello aperto che offre supporto dal giorno zero per lo stack alternativo, ogni framework che aggiunge un backend, ogni tutorial che accompagna un principiante, erode quel divario. La comunità della generazione di immagini, con la sua forte dipendenza da framework aperti come ComfyUI e Diffusers, è in realtà uno dei luoghi più promettenti in cui lo stack alternativo può guadagnare terreno, perché la comunità è già abituata a eseguire modelli su hardware diversificato.
Questo è il gioco a lungo termine, ed è per questo che gli annunci del mese contano più come direzione che come destinazione. L'Ascend 960 SuperPoD non cambierà il panorama della generazione di immagini da un giorno all'altro. Ma è un paletto piantato nel terreno, un segnale che la strada alternativa viene costruita, finanziata e dotata di personale, e che il futuro della generazione di immagini, come il futuro dell'AI più in generale, potrebbe non girare per sempre su una sola storia hardware. Le persone che presumono che lo farà stanno facendo una scommessa che la storia ha ripetutamente dimostrato essere rischiosa.
Articoli correlati
Apple ora vuole addestrare l'IA sui tuoi dati, e i modelli di immagini sono nel mirino
L'azienda della privacy ora vuole addestrare sulle tue foto. L'inversione di rotta segnalata di Apple è un segnale su da dove arriveranno i prossimi dati di addestramento.
Il pasticcio della generazione di immagini di Grok sta riscrivendo le regole per tutti gli altri
Milioni di deepfake non consensuali, indagini in tre continenti e una toppa dell'abbonamento a pagamento. Cosa ha chiarito la crisi Grok sulla responsabilità delle immagini AI.
I modelli cinesi di immagini AI stanno conquistando fan all'estero, e Washington osserva
L'adozione è tecnica prima che politica. Gli sviluppatori scaricano ciò che funziona, e al momento proviene sempre più spesso da laboratori cinesi.
Cosa scommettono i mercati predittivi sulle immagini AI
Soldi veri scommettono su chi vincerà nelle immagini AI. OpenAI guida sulle immagini statiche, MiniMax sul video, e i modelli aperti sono il jolly che nessuno prezza.