A settembre i modelli cinesi open source per la generazione di immagini hanno fatto sul serio: SenseTime, Ant e Shusheng non sono rimasti a guardare

Il settembre appena trascorso ha portato un cambiamento poco appariscente ma cruciale per la generazione di immagini AI in Cina: l'open source. Nel giro di una sola settimana, SenseTime, Ant e il team Shusheng dello Shanghai AI Laboratory hanno rilasciato uno dopo l'altro modelli open source di generazione di immagini, mettendo sul tavolo capacità che prima erano saldamente nelle mani dei grandi player closed source. L'impatto potrebbe essere molto più grande del lancio di un singolo nuovo modello.
Le carte in tavola dei tre protagonisti
SenseTime SenseNova U1.5 Lite è stato rilasciato open source l'8 settembre: è un modello di generazione di immagini da 8B. Il suo punto di forza è la generazione diretta in 4K e la comunicazione ufficiale lo definisce «al livello dei grandi modelli closed source». La scala da 8B è cruciale: significa che può girare anche sulle GPU di uno sviluppatore normale, senza dover puntare subito a 12G o 24G di VRAM.
Il modello unificato di immagini da 6B di Ant è stato rilasciato open source il 6 settembre. Segue una strada più «comoda»: generazione da testo ed editing tramite istruzioni sono riuniti in un unico modello. In altre parole, puoi chiedergli sia di creare un'immagine da zero, sia di dargli un'immagine e dirgli «cambia lo sfondo» o «schiarisci i colori», senza dover passare da due modelli. Ancora più raro, Ant ha reso pubblica anche l'intera ricetta di addestramento. Di modelli open source ce ne sono tanti, ma non molti mettono sul tavolo i dettagli del training.
Shusheng InternLumina-U2 è stato presentato il 3 settembre: è un grande modello visivo incentrato sull'unificazione tra comprensione e generazione delle immagini, con pesi che verranno resi disponibili. Il suo posizionamento è più orientato a «un unico modello che sa sia capire le immagini sia disegnarle», un vantaggio rispetto ai modelli puramente generativi negli scenari in cui serve che il modello comprenda prima un'immagine di riferimento e poi la modifichi di conseguenza.

Perché l'open source merita un discorso a parte
Molti potrebbero pensare che i modelli open source siano lontani dagli utenti comuni: «tanto io non addestro modelli». Ma la vera catena dell'impatto è questa: i modelli open source diventano le fondamenta di molti strumenti gratuiti.
Uno sviluppatore indipendente, o un piccolo team, che non ha i soldi per comprare le API dei big e vuole aggiungere la generazione di immagini al proprio prodotto, cosa fa? La risposta è andare su Hugging Face, scaricare un modello open source e farlo girare in locale o su una GPU a noleggio economica. Modelli della scala di SenseTime 8B o Ant 6B rientrano esattamente nella fascia di quelli che «possono entrare in una macchina consumer». Più modelli open source ci sono, più sono piccoli e più sono potenti, più soluzioni gratuite di generazione di immagini possono essere messe in piedi dalle persone comuni.
Vista dall'altro lato, è anche una risposta dei modelli cinesi alle strade open source già consolidate come Stable Diffusion e Flux. In passato, quando si parlava di generazione di immagini open source, il default era l'ecosistema Stable Diffusion. Ora i player cinesi stanno entrando in questo spazio, portando vantaggi locali come la comprensione del cinese e il rendering dei caratteri cinesi: per gli utenti di lingua cinese è un valore aggiunto concreto.
Dopo l'open source, su cosa si compete?
L'open source non è un traguardo, ma un punto di partenza. Una volta rilasciato un modello, che riesca davvero a essere usato dipende da tre fattori.
Il primo è l'ecosistema. Non bastano i pesi del modello: servono strumenti di inferenza abbinati, script di addestramento per LoRA e supporto WebUI. Se Stable Diffusion è ancora oggi la scelta predefinita per molti, non è merito di una singola versione, ma di tutta la catena di strumenti che le sta dietro.
Il secondo è la capacità con la lingua cinese. La principale differenziazione dei modelli cinesi sta nella comprensione dei prompt in cinese e nel rendering del testo cinese. È un punto su cui i modelli open source stranieri sono stati a lungo carenti, ed è il punto che i modelli open source cinesi dovrebbero presidiare con più forza.
Il terzo è la via alla monetizzazione. Far guadagnare un modello open source è da sempre un problema difficile. Player come SenseTime, Ant e Shusheng molto probabilmente non fanno beneficenza: vogliono far crescere l'ecosistema con l'open source e poi monetizzare tramite servizi enterprise, API cloud e personalizzazioni. Per gli utenti questo significa sempre più strumenti gratuiti, ma se «gratuito» coincida con «mantenuto nel tempo» è tutto da vedere.
Vale la pena aggiungere un elemento di contesto: questa ondata open source arriva proprio in una fase in cui l'ecosistema open source all'estero sta vivendo una specie di stallo. Stable Diffusion non riceve da molto tempo un aggiornamento maggiore vero e proprio, mentre Flux non ha ancora rilasciato pesi open source completi. In questo momento i modelli cinesi open source da 6B e 8B, dimensioni che «possono entrare in una macchina domestica», di fatto posano le fondamenta della generazione di immagini open source in cinese mentre gli avversari riprendono fiato.
Il significato pratico per i creatori comuni
Concretamente, per le persone reali, il cambiamento portato da questi modelli open source è che il costo della generazione di immagini continua a scendere.
Prima, per usare in modo stabile l'AI per creare immagini in modo serio, dovevi abbonarti a uno strumento o pagare le API a consumo. Con l'aumento dei modelli open source sono comparse una serie di soluzioni gratuite e locali. È vero che in genere hanno una barriera d'ingresso: bisogna saper configurare l'ambiente e regolare i parametri, ma anche quella barriera viene progressivamente limata dalla community.
La mia valutazione è che, nel breve periodo, per i creatori comuni lo strumento web resta la soluzione più comoda. Ma se stai costruendo un piccolo prodotto o una piccola applicazione e devi integrare funzionalità di generazione immagini, la densità e la scala di questa ondata di modelli open source meritano una seconda occhiata. Almeno, l'affermazione «in Cina non esistono modelli open source di generazione immagini davvero utilizzabili» da settembre non è più vera.
Articoli correlati
Meta Muse Image: L'immagine AI da un centesimo | ChatPicture
Circa un centesimo per immagine, rivolto agli inserzionisti: cosa significa il prezzo di Meta Muse per la creatività pubblicitaria e il mercato delle immagini a due corsie.
DALL-E non c'è più. Ecco perché il nome che ha dato il via all'arte AI è svanito
OpenAI ha ritirato il GPT DALL-E il 30 agosto 2026. Cosa è cambiato, perché ora e cosa ha significato il nome per l'arte AI.
Google Pics porta Nano Banana in Documenti e Presentazioni, e Canva dovrebbe preoccuparsi
Isolamento degli oggetti, traduzione del testo nelle immagini e integrazione con Workspace: cosa significa Google Pics per Canva e Adobe Express.
Grok Imagine Image 2.0 è la tesi di xAI: il fotoritocco è il vero lavoro
Image 2.0 è secondo in entrambe le arene con editing per regioni, fusione di 5 immagini e ridimensionamento intelligente. La scommessa incentrata sull'editing, spiegata.