← Torna al blog
Aicirca 7 min di lettura

Alibaba ha reso open source un modello che scompone un'immagine piatta in livelli modificabili

Pubblicato 6 ott 2026
Alibaba ha reso open source un modello che scompone un'immagine piatta in livelli modificabili

Il team Qwen di Alibaba ha pubblicato Qwen-Image-Layered su ModelScope e Hugging Face all'inizio di ottobre, con una licenza che ne consente l'uso commerciale. L'annuncio cinese del 2 ottobre lo ha descritto come il primo modello di immagini con comprensione e modifica dei livelli native, in stile Photoshop. Vale la pena di analizzare questa affermazione, perché il meccanismo che ne sta alla base non è quello verso cui la maggior parte degli editor di immagini ha lavorato finora.

Il modo standard di modificare un'immagine generata consiste nel selezionare una regione e rigenerarla al suo interno. L'inpainting funziona così. Anche FLUX 3 Image, pubblicato il giorno prima, funziona così, con bounding box che definiscono esattamente quali pixel il modello può toccare. L'approccio ha una debolezza nota: il modello non ha idea di cosa sia un livello. Vede una regione rettangolare e un prompt, e riempie il buco.

Qwen-Image-Layered parte da una rappresentazione diversa. Scompone un'immagine finita in un insieme di livelli RGBA, ciascuno a piena risoluzione e ciascuno con la propria trasparenza. Un oggetto diventa un livello, un testo un altro, lo sfondo un terzo. Puoi spostare un livello, ricolorarlo o sostituirlo, e poi ricomporre la pila. È l'obiettivo di addestramento a rendere tutto questo misurabile: il modello impara a produrre livelli la cui ricomposizione riproduce l'immagine di input, quindi la qualità della scomposizione ha un punteggio diretto.

Tre sottili vetri smerigliati impilati con un leggero scarto su una lastra di pietra chiara

Perché questo è un problema diverso dalla segmentazione

Segmentare un'immagine in oggetti è un compito vecchio, e i modelli sono bravi a farlo da un po'. La scomposizione in livelli richiede qualcosa di più specifico. L'output deve essere utilizzabile come primitiva di editing, il che significa che ogni livello ha bisogno di bordi alpha puliti, di un ordine di sovrapposizione corretto e di nessun doppio conteggio dei pixel che compaiono in due livelli contemporaneamente.

Entrambe queste modalità di errore sono comuni. Un ritaglio di una persona in piedi davanti a un muro, con una segmentazione ingenua, lascerà un fantasma della persona quando il livello viene rimosso. Il livello del muro deve aver appreso che la persona lo occlude, e deve ricostruire com'era il muro dietro la persona. È un problema di generazione, non di etichettatura, ed è per questo che la rappresentazione RGBA conta. Ogni livello porta con sé il proprio canale alpha, quindi il modello deve decidere, pixel per pixel, quale livello possiede cosa.

Il rapporto cinese attribuisce il merito a due elementi architetturali: un encoder RGBA-VAE realizzato appositamente e un positional encoding 3D a livello di livello. Il secondo è la parte interessante. Se i livelli sono impilati in profondità, il modello ha bisogno di una nozione di dove si trovi ciascuno in quella pila, ed è ciò che fornisce il positional encoding.

L'affermazione del «drift zero»

La promessa è che le modifiche causano quasi nessun drift: cambi un livello e tutto il resto resta fermo.

Il drift è il difetto che chiunque abbia modificato un'immagine generata conosce. Chiedi di sostituire lo sfondo e il modello restituisce un volto leggermente diverso, o una camicia di una tonalità diversa, o un'ombra che si è spostata. Ogni modifica basata sulla diffusione ne porta con sé un po', perché il modello rigenera più di quanto gli hai chiesto. La nuova funzione Prompt to Edit di Adobe in Lightroom ha esattamente questo problema, ed è il motivo per cui i fotografi la guardano con diffidenza.

Un modello a livelli aggira il problema per struttura. Se l'oggetto che non stai modificando esiste come livello RGBA separato, e la modifica tocca solo un livello diverso, il livello non toccato viene copiato anziché rigenerato. Il drift diventa un bug del compositore, non una proprietà del modello.

È una garanzia più pulita di qualsiasi approccio di inpainting possa offrire, ed è per questo che la notizia qui è la scelta architetturale, non i numeri dei benchmark.

Cosa cambia nel lavoro reale

Tre flussi di lavoro si accorciano.

Riuso degli asset esistenti. Uno scatto di prodotto incorporato in un banner può essere estratto e riutilizzato senza che qualcuno debba tracciare un percorso di ritaglio. Il livello è già lì, con l'alpha.

Output trasparente. Un modello che genera livelli RGBA per impostazione predefinita può produrre PNG trasparenti come effetto collaterale del suo normale funzionamento. Questo elimina un passaggio che attualmente richiede un modello di segmentazione o una mascheratura manuale.

Variazioni in batch. Se l'immagine master è una pila di livelli, un team può rigenerare varianti sostituendo un livello e ricomponendo. Il resto dell'immagine resta intatto, il che conta quando le linee guida del brand fissano tutto tranne il prodotto.

Un quarto è meno ovvio. I livelli sono dati strutturati. Una pila di componenti RGBA con nome si inserisce in un editor o in una pipeline automatizzata in modo molto più pulito di quanto faccia una bitmap piatta, il che rende il modello utile come componente anziché come destinazione.

Dove sono i limiti

Il modello scompone un'immagine. Non sa come dovrebbero chiamarsi i livelli e non deduce le intenzioni. Chiedigli di separare la fotografia di una scrivania disordinata e il risultato potrà separare bene gli oggetti e male l'illuminazione. I materiali semitrasparenti sono il caso difficile, dato che un bicchiere d'acqua appartiene presumibilmente a più livelli contemporaneamente.

Anche l'ordine di profondità resta ambiguo per riflessi e ombre. Un'ombra proiettata su un muro è una proprietà di un oggetto, ma vive sul livello di sfondo, e decidere da quale parte di quella linea collocarla è un giudizio che il modello deve dare senza che gli venga detto.

Niente di tutto questo rende il rilascio meno significativo. Lo rende una base anziché uno strumento finito.

Perché il formato a livelli viaggia meglio di un inpainter migliore

Negli ultimi due anni, la corsa ai modelli di immagini si è svolta sullo stesso percorso. Ogni generazione ha prodotto un inpainting più preciso, una migliore aderenza al prompt e meno artefatti evidenti.

Quel percorso ha dei limiti, e sono strutturali. Per quanto l'inpainter possa migliorare, il modello di interazione resta lo stesso: l'utente definisce una regione, il modello la riempie, e l'utente giudica il risultato. La qualità migliora, ma il flusso di lavoro non cambia. La prova è che la stessa lamentela continua a ripetersi di generazione in generazione: una modifica locale produce cambiamenti da un'altra parte.

I livelli attaccano il flusso di lavoro invece della metrica di qualità. Una volta che un'immagine è una pila, l'unità di lavoro diventa il livello anziché la selezione, e l'utente manipola direttamente i componenti. È così che i designer lavorano in strumenti dedicati da trent'anni, e il motivo per cui i modelli di immagini non lo facevano era che la rappresentazione non era disponibile.

Costruire quella rappresentazione è costoso. Un modello deve apprendere occlusione, ordine di profondità e alpha da dati che per lo più non contengono scomposizioni in livelli, ed è per questo che l'obiettivo di addestramento, la ricostruzione dell'input dalla pila predetta, è la parte portante del progetto.

Se l'approccio funziona, le conseguenze vanno oltre i prodotti di Alibaba. Uno strumento di compositing che accetta una pila di livelli può essere collegato a una pipeline che prima richiedeva un essere umano per ritagliare le maschere. Una libreria di immagini stock che distribuisce scomposizioni diventa più preziosa di una che distribuisce JPEG piatti. Il modello è il primo pezzo di quella catena, e l'ecosistema non ha ancora il resto.

Il quadro competitivo

La scomposizione in livelli non è esclusiva di Alibaba. Ming-Image di Ant Group assume una posizione simile, generando design come composizioni a livelli anziché come immagini piatte. Stability e altri hanno rilasciato modelli di segmentazione che approssimano parti del flusso di lavoro. Ciò che cambia è l'impegno sui livelli RGBA come formato di output nativo, e la decisione di rilasciare pesi che chiunque può eseguire.

Quest'ultima scelta conta per la rapidità con cui l'idea si diffonde. Il mercato degli strumenti per immagini ha passato due anni a convergere sull'interazione «seleziona una regione, descrivi un cambiamento», e i risultati si sono stabilizzati in qualità per il semplice motivo che la rappresentazione di fondo non è cambiata. Consegnare all'ecosistema una pila modificabile invece di una bitmap è il tipo di svolta che compare nei prodotti altrui prima che in una tabella di benchmark.

La cosa da osservare è se gli strumenti di compositing inizieranno ad accettare pile di livelli come formato di input, e se gli editor cominceranno a trattare la scomposizione come il primo passo di un progetto anziché come un'operazione di riparazione. Il punteggio del benchmark è una questione secondaria.

Articoli correlati