Alibaba apre il codice di un modello multimodale 30B: 3 miliardi di parametri attivi, sfida diretta a GPT-5-Mini

Il 4 ottobre il team Tongyi Qianwen di Alibaba Cloud ha rilasciato in un colpo solo le versioni Instruct e Thinking di Qwen3-VL-30B-A3B, insieme ai pesi quantizzati in FP8; nella stessa occasione ha presentato anche la versione FP8 del più grande Qwen3-VL-235B-A22B. Il report ufficiale è diretto: su cinque fronti — ragionamento STEM, visual question answering, riconoscimento ottico dei caratteri (OCR), comprensione video e task di Agent — il confronto è con GPT-5-Mini e Claude 4-Sonnet, con risultati persino migliori su alcuni punti.
Ciò su cui vale davvero la pena soffermarsi è quella sigla A3B nel nome.
Un guscio da 30B con l'appetito di un 3B
Qwen3-VL-30B-A3B ha un totale di 30 miliardi di parametri, ma a ogni inferenza solo circa 3 miliardi partecipano effettivamente al calcolo. È la classica architettura Mixture of Experts (MoE): al proprio interno il modello prepara moltissimi esperti e, per ogni token, seleziona solo una piccola schiera dei più adatti a lavorare, mentre gli altri restano a riposo.

Pensarlo come un'azienda è più immediato. L'azienda ha trentamila dipendenti, ma ogni singolo progetto richiede di assegnare solo circa tremila esperti del settore giusto, mentre gli altri restano in attesa. La riserva di competenze dell'azienda è di livello trentamila persone, eppure il costo del personale per un singolo progetto si avvicina a quello di tremila.
I vantaggi di questa struttura sono molto concreti. L'occupazione di memoria video e la velocità di inferenza si avvicinano a quelle di un modello denso molto più piccolo di 30B, mentre il tetto delle capacità conserva comunque una base di livello 30B. Per i team che devono eseguire capacità multimodali in locale o in ambienti privati, è esattamente la combinazione più difficile da mettere insieme negli ultimi anni: prestazioni paragonabili ai flagship a codice chiuso, senza dover disporre di una scheda dalla memoria video stracolma.
Perché il report è suddiviso proprio in queste cinque direzioni
Le direzioni scelte ufficialmente per il confronto sono esattamente i terreni più densamente occupati dall'applicazione reale del multimodale.
L'OCR è un'esigenza imprescindibile per la digitalizzazione dei documenti, il riconoscimento delle ricevute e l'estrazione di testo dagli screenshot. La comprensione video è il punto d'ingresso della produzione di contenuti nell'era dei video brevi: chi sa capire i video può trasformarli in materiale ricercabile e modificabile. Gli Agent fanno sì che il modello non si limiti a capire, ma sappia anche agire: è la linea principale su cui quest'anno quasi tutti nel settore stanno puntando. STEM e VQA sono invece il biglietto d'ingresso per scenari ad alto valore come l'istruzione, la ricerca scientifica e il controllo qualità industriale.
Un modello con soli 3 miliardi di parametri attivi capace di competere su queste linee con i flagship a codice chiuso è, di per sé, un segnale più significativo di qualsiasi punteggio su un singolo benchmark. Significa che la densità di capacità continua a essere ricompressa: a parità di risultati, la potenza di calcolo necessaria diminuisce; o, detto altrimenti, a parità di calcolo si ottengono capacità maggiori.
La carta dell'open source punta sui costi di deployment
In questo ciclo Tongyi non ha rilasciato una sola versione. Instruct è pensata per il normale seguito di istruzioni e per le domande-risposte, Thinking segue un percorso di ragionamento che prima pensa e poi risponde, mentre i pesi FP8 sono pensati per chi vuole far entrare l'intero modello in una memoria video limitata.
Tre versioni insieme puntano tutte alla stessa cosa: spostare il multimodale dalla «chiamata alle API nel cloud» al «deploy in proprio». Una volta che i pesi si possono scaricare, quantizzare e far girare su un server privato, la logica di acquisto cambia. In passato le aziende calcolavano quanto costa ogni milione di token; ora c'è un'opzione in più: quanto costa ogni milione di token ammortizzando le proprie GPU. Per i team con volumi elevati il secondo conto è spesso più conveniente, e in più i dati non escono dalla rete interna.
È anche la direzione d'attacco più costante dei modelli open source cinesi nell'ultimo anno. Non si tratta più semplicemente di chi ha più parametri o punteggi più alti in classifica, ma di chi riesce a far usare il modello a più persone con una soglia d'ingresso più bassa. Quando il divario di capacità viene compresso entro limiti accettabili, prezzo e accessibilità diventano i veri fattori decisivi.
L'altra faccia dell'open source
Pubblicare i pesi significa che chiunque può scaricarli, fare fine-tuning e ridistribuirli. Il vantaggio è un'espansione rapidissima dell'ecosistema: versioni quantizzate, fine-tuning settoriali e adattamenti per dispositivi edge spunteranno presto nella comunità. Il rischio è altrettanto chiaro: una volta che il modello esce dal campo visivo di chi lo rilascia, questi non ha quasi alcun modo di vincolare dove e come venga usato.
Per gli sviluppatori, questo significa al contrario che la scelta passa nelle loro mani. Devi conoscere i tuoi confini di conformità, sapere se i dati possono uscire dal paese, capire i termini di licenza della ridistribuzione. L'open source ti consegna lo strumento e, con esso, anche la responsabilità.
Cosa guardare adesso
Il confronto su queste cinque direzioni è solo un punto di partenza. Ciò che determina davvero se un modello multimodale può reggere in produzione raramente è il punteggio su un singolo benchmark: è se dopo decine di turni consecutivi di task cede di colpo, è la sua stabilità su documenti reali, video reali e input reali e caotici.
Se la strada dei 3 miliardi di parametri attivi possa continuare a salire dipende dall'efficienza di scheduling degli esperti della prossima generazione, dalla qualità dei dati di training e dalle strategie di post-training. Se questa strada funziona, a essere riscritta non sarà solo una classifica, ma l'assunto predefinito di tutto il settore su «quanto grande deve essere un modello per essere sufficiente».
Un modello con capacità vicine a quelle di un flagship, se costa in esecuzione solo una frazione di quest'ultimo, rende davvero scarso non più il calcolo, ma le persone che hanno le idee chiare su cosa farne.
Articoli correlati
Un unico framework per linguaggio e visione: il modello aperto da 1,6 miliardi di Horizon
Una scommessa sul fatto che i ponti tra linguaggio e visione non siano mai stati necessari.
Il muro fotonico della memoria è la scommessa da 88 milioni di dollari che Volantis ha appena fatto
Il compromesso con cui tutti hanno imparato a convivere è la cosa che sta cercando di eliminare.
Le immagini di prodotto AI stanno colpendo un muro di conformità che nessuno aveva messo in conto
Il costo è sempre stato indicato per generazione. Il costo reale è prezzato per asset che sopravvive alla revisione.
I robot possono svolgere il 74 per cento del lavoro fisico, ma quasi nulla di tutto ciò è economicamente conveniente
La capacità c'è in larga misura. L'economia no. Quarant'anni per arrivare al dieci per cento non è una previsione che giustifica il panico.