Dividere un JPG in livelli sta diventando un normale passaggio di progettazione

Sta avvenendo un cambiamento silenzioso negli strumenti a cui i designer ricorrono. Per gran parte dell'ultimo anno, l'azione interessante nel lavoro sulle immagini AI è stata la generazione: creare qualcosa che non esisteva. Gli strumenti che ora si moltiplicano partono da un'immagine già esistente e la scompongono.
Il cambiamento è facile da non notare perché non produce spettacolari demo reel. Nessuno condivide uno screenshot di uno stack di livelli ben separato. Ma è il cambiamento che decide se le immagini generate sono utilizzabili in ambito professionale, perché il valore di un asset di design dipende meno da come appare e più dalla possibilità di modificarlo in seguito.
LayerGrab è apparso il 2 ottobre. Converte un PNG, JPG o WebP piatto in un massimo di sedici livelli trasparenti indipendenti, con nomi descrittivi in inglese, e ricostruisce lo sfondo dietro gli elementi estratti tramite inpainting. Esporta PNG singoli, uno ZIP o un PSD a livelli per Photoshop, con plugin per Photoshop, Figma e Sketch e un'estensione Chrome per acquisire immagini dal browser. Non c'è esportazione .psd dallo strumento browser stesso; i livelli arrivano come PNG numerati che si impilano in un editor.
L'elaborazione richiede dai 60 ai 100 secondi. Si basa su modelli di segmentazione e generativi tra cui Qwen-Image-Layered, il modello che Alibaba ha reso open source il 2 ottobre con una licenza permissiva. I file di input sono limitati a 20 MB e un'estensione Chrome consente a un designer di fare clic con il tasto destro su un'immagine in qualsiasi sito e inviarla direttamente al pannello di separazione.
Perché la scomposizione in livelli è la metà utile
La generazione ha risolto un problema con cui i designer avevano convissuto per anni e ne ha creato uno nuovo. Un'immagine generata dall'AI sembra la fotografia piatta di un progetto, non un file di lavoro. Non puoi spostare il prodotto dall'altro lato del banner, perché è saldato nei pixel. Non puoi sostituire il testo del titolo, perché non esiste un oggetto testo, solo l'aspetto del testo.
È esattamente il vuoto che la scomposizione in livelli colma. Il punto qui è recuperare la struttura che un'immagine piatta nasconde, così che l'immagine possa essere modificata come si modifica un file di design, invece di produrre qualcosa di nuovo.
La descrizione di Qwen-Image-Layered fornita da Alibaba definisce il problema come «accoppiamento piatto dei pixel». Il modello usa un encoder RGBA-VAE e una codifica posizionale 3D a livello di livelli per identificare livelli spaziali e relazioni di occlusione, quindi scompone l'immagine in livelli indipendenti modificabili. L'azienda afferma una deriva quasi nulla nelle modifiche precise, il che affronta il problema di coerenza che emerge ogni volta che si cambia una parte di un'immagine e si vedono altre parti spostarsi.
Nello stesso giorno, inclusionAI di Ant Group ha rilasciato una coppia correlata: Ming-Image-0.1-Design per generare progetti visivi completi e Ming-Image-0.1-Design-Layer per scomporre progetti appiattiti in livelli trasparenti, entrambi con 6B parametri ed entrambi richiedenti una GPU da 80 GB per la distribuzione predefinita.
Che cosa ci fanno davvero i creativi
Le descrizioni degli strumenti sembrano un elenco di piccoli lavori poco glamour. Dividere un annuncio finito in livelli e spostare il prodotto dall'altro lato per un nuovo formato. Separare un'illustrazione in livelli per animare un effetto parallasse. Separare il prodotto e lo sfondo di una foto così da poterli animare su slide diverse. Estrarre elementi da un poster per cambiare il testo o riutilizzare la grafica in un nuovo progetto.
Nessuno di questi è un compito che ha fatto finire qualcuno su una demo reel. Sono i compiti che consumano il pomeriggio di un designer e in precedenza non erano affatto automatizzabili, perché nessuno strumento riusciva a recuperare la struttura da un'immagine renderizzata. Un designer di fronte a un JPG piatto aveva esattamente un'opzione: ridisegnarlo a mano, livello per livello, indovinando cosa c'era dietro ogni elemento.
Il motivo per cui questo conta più di quanto sembri è che la maggior parte degli asset che un designer riceve è piatta. Un cliente invia un JPG del poster dell'anno scorso e chiede una versione in un nuovo formato. Un team di brand ha l'esportazione finale ma ha perso il file sorgente. Un asset di campagna esiste solo come screenshot. La scomposizione in livelli trasforma quei vicoli ciechi in punti di partenza, un tipo di valore diverso da quello fornito dalla generazione.
Ci sono limiti dichiarati onestamente. LayerGrab non preserva le ombre proiettate. Il testo molto fine può mostrare leggere variazioni di colore quando viene ridisegnato dal modello, e il testo viene estratto come livello immagine anziché come testo modificabile. Come per qualsiasi sistema di segmentazione, la suddivisione può variare leggermente tra esecuzioni sullo stesso input.
Lo strumento Image Layer di Kenerate adotta un approccio simile con un'enfasi diversa, producendo da due a otto livelli con l'utente che sceglie il numero, oppure un numero automatico che spesso si colloca tra sei e dodici nel suo piano Pro. Esporta anche PNG anziché un PSD, e la documentazione è esplicita su questo limite, il tipo di onestà da cui uno strumento di questa categoria trae vantaggio. I designer che si aspettano un file PSD funzionante e ricevono una cartella di PNG perdono un pomeriggio a scoprire la differenza.
La variazione tra gli strumenti è istruttiva. Uno ottimizza per un numero fisso di livelli controllato dal designer; un altro lascia decidere al modello. Entrambi aggirano lo stesso vincolo, cioè che la segmentazione in livelli è una questione di giudizio e strumenti diversi la affrontano in modo diverso.
La direzione più ampia
Guardando a ciò che è stato rilasciato questo mese nel suo insieme, emerge uno schema. Alibaba ha reso open source un modello per i livelli. Ant Group ha rilasciato una coppia progetta-e-scomponi. Uno strumento commerciale ha incapsulato la capacità in plugin per gli editor che i designer già usano. La capacità è passata da risultato di ricerca a funzionalità di prodotto in circa due settimane.
La velocità è la parte interessante. Quando un modello viene reso open source con una licenza permissiva, la finestra tra «questo esiste in un paper» e «questo è un pulsante in Figma» si riduce a zero. I designer non adottano architetture; adottano pulsanti. Il modello che vince raramente è quello con il miglior punteggio di benchmark. È quello che compare nel software già aperto sul secondo monitor del designer.
L'effetto pratico è che le immagini AI smettono di essere artefatti terminali. Un'immagine generata oggi può essere smontata domani, riorganizzata giovedì e consegnata in un formato che il team del cliente può ancora modificare il trimestre successivo. Questa flessibilità è ciò che rende gli asset generati utilizzabili nei flussi di lavoro professionali, ed è il motivo per cui la scomposizione in livelli è passata da novità a passaggio standard.
La prossima domanda è se la scomposizione in livelli finirà dentro il modello di generazione o accanto a esso. Se un modello produce direttamente un output a livelli, il passaggio separato di scomposizione scompare. Fino ad allora, gli strumenti che recuperano la struttura da immagini piatte sono il ponte tra l'output di un generatore e le esigenze di un designer, e il ponte viene costruito abbastanza rapidamente che la maggior parte dei team di design lo userà senza mai decidere di adottarlo.
Articoli correlati
Le foto satellitari sono ora dati di addestramento per i robot
Il collo di bottiglia nell'addestramento dell'IA fisica ha smesso di essere la potenza di calcolo o la capacità del modello. È diventata la qualità del mondo sintetico.
Gemini 3.5 Live Translate di Google elimina la pausa
Una traduzione che funziona in continuo, con la voce di chi parla, su un telefono già nella tua tasca, sposta la funzione da qualcosa che apri a qualcosa che è semplicemente attiva.
La Cina ha scritto il primo standard di sicurezza obbligatorio per gli agenti AI
La sicurezza passa dall'essere una funzionalità che pubblicizzi a un cancello che devi superare. L'inventario dei rischi si attesta su 13 categorie e 97 voci.
I contenuti generati dall'AI iniziano a dover dichiarare la propria identità
Questo passo non risolve tutti i problemi, ma trasforma «generato dall'AI» da un'opzione che si poteva nascondere a una domanda a cui è obbligatorio rispondere.