← Torna al blog
Aicirca 7 min di lettura

A settembre i grandi modelli cinesi aprono in massa: stavolta la sfida è “poterseli permettere”

Pubblicato 2 ott 2026
A settembre i grandi modelli cinesi aprono in massa: stavolta la sfida è “poterseli permettere”

Settembre è a metà e chi fa valutazioni fa già fatica a tenere il passo con il ritmo di aggiornamento dei grandi modelli cinesi. Le novità di Zhipu, Meituan, ModelBest, Tencent e Ant sono arrivate quasi tutte nella stessa finestra temporale, con tipologie che spaziano dai modelli generalisti ai piccoli modelli on-device, fino alla generazione di immagini e all'intelligenza embodied. Al di là del fermento, ciò che merita davvero attenzione è la strada scelta da tutti loro: non hanno puntato solo ad aumentare i parametri, ma hanno spinto su “come renderli economicamente accessibili e distribuibili”.

Iniziamo da Zhipu. GLM-5.3-Flash, rilasciato a settembre, ha 320 miliardi di parametri totali, ma solo 18 miliardi di parametri attivi partecipano effettivamente al calcolo a ogni passaggio. L'approccio dell'attivazione sparsa è diretto: si ingrandisce il modello, ma per ogni inferenza se ne attiva solo una piccola parte, riducendo costi e latenza. È open source con licenza MIT, supporta nativamente il multimodale e costa circa 0,25 dollari per milione di token in output. La frase più pesante nelle note di rilascio è un'altra: il servizio di inferenza gira interamente su chip AI cinesi, con prestazioni end-to-end circa triplicate rispetto al benchmark iniziale, e ha raggiunto la scala di 100.000 miliardi di token gratuiti al giorno. Per gli sviluppatori, questa frase pesa più di qualsiasi numero nella tabella dei parametri.

Meituan ha presentato LongCat-2.0, con 1.600 miliardi di parametri totali e supporto nativo per una finestra di contesto di 1 milione di token. Il suo punto di forza non è la dimensione, ma il terreno su cui è stato addestrato: secondo l'azienda è il primo grande modello open source da mille miliardi di parametri a completare l'intero ciclo di addestramento e inferenza su un cluster di calcolo cinese su scala da 10.000 schede. Insieme arrivano anche la piattaforma AI per la gestione operativa CatPaw e l'agente per la vita locale “Xiaotuan”, che ha già risposto a oltre 700 milioni di richieste degli utenti. Il fatto che un'azienda nata nei servizi locali porti sul palco un modello da mille miliardi di parametri indica che la struttura dei costi di questo settore si sta allentando.

Il MiniCPM5-2B di ModelBest va nella direzione opposta: comprime i parametri a circa 2 miliardi e punta all'on-device. Prosegue la linea storica di MiniCPM: pochi parametri, concreta applicabilità, capace di lavorare anche installata su uno smartphone o un dispositivo edge. Quasi nello stesso periodo, MiniMax ha reso open source Code CLI con licenza MIT, mentre Zhipu ha aggiunto GLM-5.3-FlashX, orientato all'alto throughput, con una velocità di inferenza di circa 200 token al secondo. Modelli on-device, accelerazione dell'inferenza e strumenti di programmazione: coprendo tutte e tre le linee, questo insieme dice molto di più sulla maturità dell'ecosistema rispetto a un singolo “flagship”.

Mettendo tutto insieme, emerge una tendenza chiara: l'open source sta diventando uno strumento di competizione, non una questione di idealismo. MIT, pesi aperti, quote gratuite: queste mosse hanno un obiettivo molto pratico: chi per primo porta sviluppatori e PMI nel proprio ecosistema, per primo si assicura il volume di chiamate del prossimo ciclo. Un vantaggio nei parametri può reggere una conferenza stampa, ma non un ambiente di produzione quotidiano.

Non manca nemmeno la linea delle immagini. Il 4 settembre, Bailing Lab di Ant Group ha rilasciato e reso open source la serie LLaDA-Image, composta dalle versioni Base e Turbo, con circa 7 miliardi di parametri: un singolo checkpoint supporta contemporaneamente text-to-image, editing con immagini di riferimento e rendering di testo in cinese e inglese, senza bisogno di rami di editing aggiuntivi. Il punto di forza è la versione Turbo, che con la distillazione Twin-DMD riduce i passi di campionamento a 2-4, mantenendo qualità e velocità e senza dipendere da GPU di fascia alta per l'inferenza. Su Qwen-Image-Bench ottiene 53,53 punti negli scenari in inglese e 53,38 in quelli in cinese; secondo l'azienda sono i migliori risultati attuali. Ridurre i passi dai tipici 50 a una cifra singola non significa solo velocità: rende possibile la generazione in tempo reale su hardware di livello consumer.

Sul fronte dell'intelligenza embodied, Zidong Taichu ha reso open source ZDTaichu5.0-9B il 15 settembre. Questo modello da 9 miliardi di parametri ha ottenuto 8 primi posti mondiali nella stessa categoria di parametri in comprensione spaziale e compiti embodied, con 78,27 punti su MindCube-tiny, 20,67 punti percentuali in più rispetto a Qwen3.5-9B. Colma il segmento del robot relativo a “cosa fare dopo aver visto”: riconoscere una tazza risponde solo a “che cos'è”; valutare l'orientamento del manico e se accanto c'è spazio per appoggiare qualcosa si avvicina a “che cosa può fare”.

C'è poi Tencent, impossibile da ignorare. Il 22 settembre Hunyuan ha pubblicato l'anteprima di Image 3.5, con miglioramenti su generazione di testo, composizione dell'immagine, realismo e editing continuo; si possono caricare fino a 5 immagini di riferimento per volta e ottenere output fino a 2K. Il prezzo è di 0,15 yuan per immagine 2K, e si paga solo l'output finale. Anche la data di uscita è scelta con cura: coincide con il giorno di apertura della Yunqi Conference di Alibaba Cloud. Questo tipo di “rilascio a orologeria” non è più una novità in Cina, ma applicato ai modelli di immagini equivale a spostare la concorrenza dal piano tecnico direttamente a quello dell'attenzione e delle porte d'ingresso all'ecosistema.

Mettendo in fila queste mosse, la linea principale di settembre si può riassumere in tre punti: accelerazione dell'open source, calo dei prezzi dell'inferenza e autonomia del calcolo. I tre aspetti in realtà si incastrano tra loro. L'open source abbassa la soglia d'uso, l'inferenza a basso costo trasforma quella soglia in volumi reali di chiamate, e la sostituzione con calcolo cinese determina se questo basso costo può durare. GLM-5.3-Flash osa usare MIT più quote gratuite, LongCat-2.0 osa far girare mille miliardi di parametri su un cluster cinese da 10.000 schede: dietro c'è lo stesso giudizio: solo con costi controllabili si ha il coraggio di cedere il modello.

Per i creator comuni e le PMI, l'effetto diretto di questa ondata di cambiamenti è che ora i conti tornano. In passato, per usare modelli all'avanguardia bisognava o sopportare bollette API non proprio economiche, oppure mettere insieme GPU proprie: due barriere che fermavano la maggior parte delle persone. Oggi un'immagine 2K a 0,15 yuan, la generazione in tempo reale in 2-4 passi e modelli on-device che girano con 2 miliardi di parametri hanno compresso questi costi in una fascia in cui molti proveranno davvero. Quando gli strumenti costano meno, i tentativi aumentano, e la qualità delle opere spesso si affina proprio in questo ciclo di prove ed errori.

Una porta di caveau aperta che rivela rack di server e un microchip luminoso, a rappresentare modelli AI open source su silicio nazionale

Ci sono anche aspetti su cui mantenere lucidità. Licenze open source sempre più permissive non significano che l'uso commerciale sia senza costi: clausole non commerciali, conformità dei dati e controllabilità del comportamento del modello vanno comunque verificate una per una in contesti aziendali reali. L'aumento di tre volte delle prestazioni di inferenza su chip cinesi si basa su confronti con i rispettivi benchmark, e la riproduzione da parte di terzi non è ancora al passo; esistono ancora casi di modelli “open source” senza codice di addestramento pubblico, il che limita riproduzione e sviluppo secondario. Che i numeri siano belli è una cosa, che si riesca a consegnare in modo stabile è un'altra.

Il vero segnale di questa ondata fitta di aggiornamenti a settembre non è “la Cina ha sfornato altri primati”, ma il fatto che la logica dei costi dell'intero lato dell'offerta si sta riorganizzando. Quando il modello stesso assomiglia sempre più a un'infrastruttura, la competizione si sposta a valle: chi ha un flusso di lavoro più fluido, chi coglie con più precisione lo scenario giusto, chi riesce a trasformare calcolo economico in opere stabili. L'open source ha solo sparato il colpo di partenza; la corsa vera è ancora lunga.

Articoli correlati