Dieci immagini di riferimento in una volta: l'editing AI passa dalle singole immagini alle composizioni

Per molto tempo, l'editing di immagini con AI ha significato un'immagine di riferimento e un'istruzione. Mostri al modello una foto, gli dici cosa cambiare, ottieni un risultato. Questo copriva molte cose, ma mancava il modo in cui le persone pensano davvero alle immagini, che spesso consiste nel combinare più fonti in una sola.
Qwen-Image 2.1 porta il numero di riferimenti fino a dieci. Il modello può prendere sei ritratti separati e fonderli in un'unica foto di gruppo, oppure comporre un outfit completo a partire da una modella, una camicia, scarpe, una borsa e un cappello, un riferimento ciascuno. È un tipo di attività diverso dall'editing a immagine singola, ed è il tipo di attività che compare costantemente nel lavoro reale.
Pensa ai casi pratici. Un brand vuole un'immagine di campagna con tre dei suoi prodotti disposti in una scena, ogni prodotto fornito come foto separata. Un fotografo di matrimoni vuole combinare diversi scatti in uno. Un venditore di moda vuole mostrare un look completo costruito da pezzi di catalogo. Un character designer vuole mantenere un volto coerente attraverso una dozzina di varianti. L'editing a riferimento singolo ti obbliga a rigenerare e rattoppare, alimentando un'immagine alla volta e sperando che il modello mantenga tutto il resto coerente. L'editing multi-riferimento ti permette di fornire al modello i pezzi e lasciargli comporre.
La parte difficile è sempre stata computazionale. Più immagini di riferimento significa più token, e più token di solito significa generazione più lenta e più memoria. Se alimenti ingenuamente dieci riferimenti in un modello e li ricodifichi a ogni passo del processo di diffusione, il costo esplode e la funzione diventa inutilizzabile su qualsiasi cosa che non sia una GPU da datacenter. L'approccio di Qwen a questo è uno schema di attenzione a granularità mista. Le istruzioni testuali ricevono una maschera causale a livello di token, mentre la generazione di immagini riceve una maschera a livello di chunk. Uno schema di riutilizzo della cache KV permette di calcolare una sola volta le immagini di riferimento e le istruzioni e di riutilizzarle come contesto statico tra i passi, invece di ricalcolarle a ogni passo.

L'idea è abbastanza semplice. Se i riferimenti non cambiano durante la generazione, non c'è motivo di ricodificarli a ogni passo. Calcolali una volta, mettili in cache e spendi la potenza di calcolo sulle parti che cambiano davvero. È quel tipo di ingegneria che non fa notizia ma determina se una funzione è davvero utilizzabile su hardware consumer. La differenza tra "supporta dieci riferimenti" su una scheda tecnica e "supporta dieci riferimenti senza andare in timeout" nella pratica è esattamente questo tipo di caching.
Il salto da due riferimenti a dieci è più di un numero più grande. Cambia ciò che puoi descrivere. L'editing a immagine singola produce variazioni, la stessa immagine modificata. L'editing multi-immagine produce combinazioni, nuove immagini assemblate da parti, e nelle combinazioni risiede molto valore commerciale. Fotografia di prodotto, ritratti di gruppo, lookbook, composizione di scene, storyboard a partire da una serie di asset: tutto si apre quando il modello può tenere più input contemporaneamente e ragionare su come si incastrano insieme.
Questo segnala anche una direzione più ampia per i modelli di immagini. I primi modelli erano text-to-image: descrivi una scena, ottieni un'immagine. Poi è arrivato l'editing image-to-image: dagli un'immagine, descrivi un cambiamento. Ora la frontiera è la composizione, alimentare un modello con molti input e lasciargli ragionare su come si combinano. È più vicino a come lavora un designer umano, assemblando da pezzi anziché descrivendo da zero, e punta verso modelli che si comportano meno come generatori e più come collaboratori.
C'è un aspetto di privacy e controllo che vale la pena notare. Quando un modello può comporre da dieci riferimenti, l'utente mantiene il controllo degli input. Invece di descrivere un prodotto e sperare che il modello lo renda accuratamente, gli fornisci la foto reale del prodotto. Invece di descrivere una persona, gli fornisci la sua immagine reale, entro i limiti di consenso applicabili. L'editing multi-riferimento è, in un certo senso, un passo verso la generazione ancorata, in cui il modello è agganciato ad asset reali anziché allucinare da una descrizione testuale.
Ci sono ancora limiti reali. La conservazione dell'identità attraverso più persone in una sola immagine resta complicata, e più riferimenti fornisci, maggiori sono le possibilità che il modello confonda gli attributi tra loro, il volto sbagliato sul corpo sbagliato, il colore sbagliato sull'oggetto sbagliato. Il tetto di dieci immagini è un passo, non un problema risolto, e le modalità di errore diventano più strane man mano che il numero di input cresce. Il team ha chiaramente fatto il lavoro ingegneristico per renderlo veloce, ma il lavoro sulla qualità è in corso.
I controlli di modifica locale fanno parte dello stesso pacchetto. Puoi disegnare cerchi, dipingere annotazioni o passare un'immagine di maschera separata per indirizzare una modifica a una regione senza toccare il resto. Combinato con l'input multi-riferimento, questo inizia a sembrare un vero strumento di compositing, il tipo di cosa che una volta richiedeva livelli in un editor grafico, ora esprimibile come un insieme di riferimenti e istruzioni a un singolo modello.
Per chiunque costruisca strumenti creativi, la lezione è semplice. La prossima ondata di differenziazione non è "immagini singole migliori". È "quante cose può tenere e combinare il modello contemporaneamente, e con quanta precisione puoi dirgli cosa cambiare". Dieci riferimenti è la risposta attuale. Non resterà dieci a lungo.
C'è una cornice più ampia che vale la pena mettere attorno a questo. Per anni, la promessa della generazione di immagini AI è stata "descrivilo, ottienilo". Quella promessa funzionava per l'uso occasionale, ma non ha mai funzionato davvero per i professionisti, perché i professionisti raramente partono da una descrizione vuota. Partono da asset, una foto di prodotto, un'immagine di riferimento, una linea guida di brand, un volto che deve rimanere coerente. Il passaggio verso l'editing multi-riferimento è, nel suo nucleo, una concessione a quella realtà. Al modello viene insegnato a partire da ciò che l'utente già possiede, piuttosto che da ciò che l'utente sa descrivere.
Ecco perché l'ingegneria conta. Tenere dieci riferimenti nel contesto e mantenerli distinti non è solo una versione più grande di tenerne uno. È un problema diverso, la differenza tra ricordare un singolo volto e ricordare dieci persone abbastanza bene da distinguerle in una foto di gruppo. La mascheratura a livello di chunk e il riutilizzo della cache KV che Qwen descrive sono le tecniche specifiche per risolvere quel problema, e sono il tipo di dettaglio che determina se la funzione funziona nella pratica o solo in una demo.
L'implicazione commerciale è diretta. I flussi di lavoro che l'editing multi-riferimento sblocca, compositing di prodotto, ritrattistica di gruppo, lookbook, generazione di asset di brand, sono tutte cose per cui le persone attualmente pagano, o in strumenti o in manodopera. Se un modello può farle abbastanza bene, il valore si sposta dal lavoro umano di compositing alla capacità del modello di tenere e combinare. È un vero spostamento economico, ed è per questo che questa funzione, più di quelle adatte ai benchmark, è quella da osservare per capire dove sta effettivamente andando il settore.
C'è anche un aspetto creativo facile da trascurare. L'editing multi-riferimento cambia ciò che conta come "prompting". Un utente che fornisce dieci riferimenti non sta scrivendo una descrizione, sta curando un set, facendo scelte su cosa includere e cosa lasciare fuori. Questo è più vicino alla direzione artistica che al prompt engineering, e punta verso un futuro in cui l'atto creativo nel lavoro di immagini AI riguarda tanto la selezione e la combinazione quanto il linguaggio. Il tetto di dieci riferimenti è, in questo senso, il primo vero passo verso modelli di immagini che trattano l'utente come un regista anziché come un richiedente.
Articoli correlati
L'addestramento dei modelli text-to-image è appena diventato 3,6 volte più veloce
La frontiera dell'efficienza si muove alla stessa velocità della frontiera delle capacità. Un'accelerazione di 3,6 volte nell'addestramento è il tipo di progresso che in seguito si manifesta come un modello che puoi davvero eseguire.
La trasparenza nativa è silenziosamente la nuova funzionalità più utile nelle immagini AI
Tutti chiedono realismo. I designer chiedono uno sfondo trasparente. Perché la generazione nativa del canale alpha è la funzionalità silenziosa che cambia i flussi di lavoro reali.
Il Qwen-Image 2.1 di Alibaba ha appena cambiato il dibattito sulle licenze dei modelli aperti
Le specifiche tecniche sono impressionanti, ma la licenza è la vera storia. Qwen-Image 2.1 abbandona Apache 2.0 per una licenza di ricerca, e le clausole in piccolo ora contano più che mai.
Tongyi Wanxiang Qwen-Image 2.1 open source: come un piccolo modello da 7B mette immagini trasparenti ed editing con 10 immagini in una singola GPU consumer
Un modello open source da 7B per generare immagini: come fa a mettere immagini trasparenti ed editing multi-immagine in una GPU da 6 GB? Analizziamo gli aggiornamenti chiave e la svolta nella licenza di Qwen-Image 2.1.