Alibaba veröffentlicht Open-Source-Modell, das ein flaches Bild in editierbare Ebenen zerlegt

Das Qwen-Team von Alibaba hat Qwen-Image-Layered Anfang Oktober auf ModelScope und Hugging Face veröffentlicht, mit einer Lizenz, die kommerzielle Nutzung erlaubt. Die chinesische Ankündigung vom 2. Oktober beschrieb es als das erste Bildmodell mit nativem, Photoshop-ähnlichem Ebenenverständnis und entsprechender Bearbeitung. Diese Behauptung lohnt eine genauere Betrachtung, denn der dahinterstehende Mechanismus ist nicht der, auf den die meisten Bildeditoren hingearbeitet haben.
Der übliche Weg, ein generiertes Bild zu bearbeiten, besteht darin, einen Bereich auszuwählen und ihn neu generieren zu lassen. Inpainting funktioniert so. FLUX 3 Image, einen Tag zuvor veröffentlicht, funktioniert ebenfalls so, mit Begrenzungsrahmen, die genau festlegen, welche Pixel das Modell berühren darf. Dieser Ansatz hat eine bekannte Schwäche: Das Modell hat keine Ahnung, was eine Ebene ist. Es sieht einen rechteckigen Bereich und einen Prompt, und es füllt das Loch.
Qwen-Image-Layered geht von einer anderen Repräsentation aus. Es zerlegt ein fertiges Bild in eine Reihe von RGBA-Ebenen, jede in voller Auflösung und jede mit eigener Transparenz. Ein Objekt wird zu einer Ebene, ein Textstück zu einer weiteren, der Hintergrund zu einer dritten. Man kann eine Ebene verschieben, umfärben oder austauschen und dann den Stapel neu zusammensetzen. Das Trainingsziel macht dies messbar: Das Modell lernt, Ebenen zu erzeugen, deren Neuzusammensetzung das Eingabebild reproduziert, sodass die Zerlegungsqualität direkt bewertet werden kann.

Warum dies ein anderes Problem als Segmentierung ist
Ein Bild in Objekte zu segmentieren, ist eine alte Aufgabe, und Modelle sind darin seit einiger Zeit gut. Die Ebenenzerlegung verlangt etwas Spezifischeres. Die Ausgabe muss als Grundbaustein für die Bearbeitung nutzbar sein, was bedeutet, dass jede Ebene saubere Alpha-Kanten, die richtige Stapelreihenfolge und keine Doppelzählung von Pixeln benötigt, die gleichzeitig in zwei Ebenen vorkommen.
Beide Fehlerarten sind häufig. Ein Freisteller einer Person, die vor einer Wand steht, hinterlässt bei einer naiven Segmentierung ein Geisterbild der Person, wenn die Ebene entfernt wird. Die Wandebene muss gelernt haben, dass die Person sie verdeckt, und sie muss rekonstruieren, wie die Wand hinter der Person aussah. Das ist ein Generierungsproblem, kein Beschriftungsproblem, und deshalb ist die RGBA-Repräsentation wichtig. Jede Ebene trägt ihren eigenen Alpha-Kanal, also muss das Modell Pixel für Pixel entscheiden, welche Ebene was besitzt.
Der chinesische Bericht schreibt dies zwei Architekturkomponenten zu: einem eigens entwickelten RGBA-VAE-Encoder und einer 3D-Positionskodierung auf Ebenenebene. Der zweite ist der interessante Teil. Wenn Ebenen in der Tiefe gestapelt sind, braucht das Modell eine Vorstellung davon, wo jede in diesem Stapel liegt, und genau das liefert die Positionskodierung.
Die „Zero-Drift“-Behauptung
Das Versprechen lautet, dass Änderungen fast keinen Drift verursachen: Ändere eine Ebene, und alles andere bleibt an Ort und Stelle.
Drift ist der Fehler, den jeder kennt, der schon einmal ein generiertes Bild bearbeitet hat. Man bittet um einen Hintergrundaustausch, und das Modell liefert ein leicht anderes Gesicht, ein Hemd in einem anderen Farbton oder einen Schatten, der sich verschoben hat. Jede diffusionbasierte Bearbeitung bringt etwas davon mit, weil das Modell mehr neu generiert, als man angefordert hat. Adobes neue Funktion „Prompt to Edit“ in Lightroom hat genau dieses Problem, und deshalb sind Fotografen damit vorsichtig.
Ein Ebenenmodell umgeht das Problem strukturell. Wenn das Objekt, das man nicht bearbeitet, als separate RGBA-Ebene vorliegt und die Bearbeitung nur eine andere Ebene betrifft, wird die unberührte Ebene kopiert statt neu generiert. Drift wird dann zu einem Fehler im Compositor statt zu einer Eigenschaft des Modells.
Das ist eine sauberere Garantie, als sie ein Inpainting-Ansatz bieten kann, und deshalb ist hier die architektonische Entscheidung die Geschichte und nicht die Benchmark-Zahlen.
Was sich für die praktische Arbeit ändert
Drei Workflows werden kürzer.
Wiederverwendung vorhandener Assets. Ein Produktfoto, das in ein Banner eingebettet ist, kann herausgelöst und wiederverwendet werden, ohne dass jemand einen Beschneidungspfad nachzeichnen muss. Die Ebene ist bereits da, mit Alpha.
Transparente Ausgabe. Ein Modell, das standardmäßig RGBA-Ebenen ausgibt, kann transparente PNGs als Nebenprodukt seines normalen Betriebs erzeugen. Das eliminiert einen Schritt, der derzeit entweder ein Segmentierungsmodell oder manuelles Maskieren erfordert.
Batch-Variation. Wenn das Master-Bild ein Ebenenstapel ist, kann ein Team Variationen erzeugen, indem es eine Ebene austauscht und neu zusammensetzt. Der Rest des Bildes bleibt unberührt, was wichtig ist, wenn die Markenrichtlinien alles außer dem Produkt festlegen.
Ein vierter Punkt ist weniger offensichtlich. Ebenen sind strukturierte Daten. Ein Stapel benannter RGBA-Komponenten lässt sich weit sauberer in einen Editor oder eine automatisierte Pipeline einspeisen als eine flache Bitmap, was das Modell als Komponente statt als Endpunkt nützlich macht.
Wo die Grenzen liegen
Das Modell zerlegt ein Bild. Es weiß nicht, wie die Ebenen heißen sollten, und es leitet keine Absicht ab. Bittet man es, ein Foto eines unaufgeräumten Schreibtischs aufzuteilen, kann es die Objekte gut und die Beleuchtung schlecht trennen. Halbtransparente Materialien sind der schwierige Fall, da ein Glas Wasser wohl zu mehreren Ebenen gleichzeitig gehört.
Auch die Tiefenreihenfolge bleibt bei Reflexionen und Schatten mehrdeutig. Ein auf eine Wand geworfener Schatten ist eine Eigenschaft eines Objekts, aber er liegt auf der Hintergrundebene, und zu entscheiden, auf welche Seite dieser Grenze er gehört, ist ein Urteil, das das Modell ohne Anweisung fällen muss.
Nichts davon macht die Veröffentlichung weniger bedeutend. Es macht sie zu einer Grundlage statt zu einem fertigen Werkzeug.
Warum sich das Ebenenformat besser durchsetzt als ein besserer Inpainter
In den vergangenen zwei Jahren wurde das Rennen der Bildmodelle auf derselben Strecke ausgetragen. Jede Generation brachte schärferes Inpainting, bessere Prompt-Treue und weniger offensichtliche Artefakte.
Diese Strecke hat Grenzen, und sie sind struktureller Natur. Egal, wie gut der Inpainter wird, das Interaktionsmodell bleibt gleich: Der Nutzer definiert einen Bereich, das Modell füllt ihn, und der Nutzer beurteilt das Ergebnis. Die Qualität verbessert sich, aber der Workflow ändert sich nicht. Der Beweis dafür ist, dass dieselbe Beschwerde über Modellgenerationen hinweg immer wiederkehrt: Eine lokale Bearbeitung erzeugt Änderungen an einer anderen Stelle.
Ebenen setzen beim Workflow an statt bei der Qualitätsmetrik. Sobald ein Bild ein Stapel ist, wird die Arbeitseinheit die Ebene statt der Auswahl, und der Nutzer manipuliert Komponenten direkt. So arbeiten Designer seit dreißig Jahren in spezialisierten Werkzeugen, und der Grund, warum Bildmodelle das nicht taten, war, dass die Repräsentation nicht verfügbar war.
Diese Repräsentation aufzubauen, ist teuer. Ein Modell muss Verdeckung, Tiefenreihenfolge und Alpha aus Daten lernen, die größtenteils keine Ebenenzerlegungen enthalten, weshalb das Trainingsziel – die Rekonstruktion der Eingabe aus dem vorhergesagten Stapel – der tragende Teil des Designs ist.
Wenn der Ansatz funktioniert, reichen die Konsequenzen über Alibabas eigene Produkte hinaus. Ein Compositing-Tool, das einen Ebenenstapel akzeptiert, kann in eine Pipeline eingebunden werden, die zuvor einen Menschen benötigte, um Masken zu schneiden. Eine Stockfoto-Bibliothek, die Zerlegungen mitliefert, wird wertvoller als eine, die flache JPEGs liefert. Das Modell ist das erste Glied dieser Kette, und das Ökosystem hat den Rest davon noch nicht.
Die Wettbewerbslage
Die Ebenenzerlegung ist nicht einzigartig für Alibaba. Ming-Image von Ant Group vertritt eine verwandte Position und generiert Designs als geschichtete Kompositionen statt als flache Bilder. Stability und andere haben Segmentierungsmodelle veröffentlicht, die Teile des Workflows näherungsweise abdecken. Was sich unterscheidet, ist das Festhalten an RGBA-Ebenen als nativem Ausgabeformat und die Entscheidung, Gewichte freizugeben, die jeder ausführen kann.
Diese letzte Entscheidung ist wichtig dafür, wie schnell sich die Idee verbreitet. Der Markt für Bildwerkzeuge hat zwei Jahre damit verbracht, sich auf die Interaktion „Bereich auswählen, Änderung beschreiben“ einzupendeln, und die Ergebnisse haben sich in der Qualität eingependelt, aus dem einfachen Grund, dass sich die zugrunde liegende Repräsentation nicht geändert hat. Dem Ökosystem einen editierbaren Stapel statt einer Bitmap zu übergeben, ist die Art von Wandel, der zuerst in den Produkten anderer Leute auftaucht und erst danach in einer Benchmark-Tabelle.
Zu beobachten ist, ob Compositing-Tools beginnen, Ebenenstapel als Eingabeformat zu akzeptieren, und ob Editoren die Zerlegung als ersten Schritt eines Projekts statt als Reparaturvorgang behandeln. Der Benchmark-Wert ist Nebensache.
Verwandte Artikel
Salesforce gibt seinen Agenten eine Laufzeitumgebung, die wochenlang läuft
Die Besetzung ist der am wenigsten interessante Teil. Die Laufzeitumgebung darunter verändert, wofür ein Agent da ist.
Cohere setzt eine harte Obergrenze für das, was ein Enterprise-Agent ausgeben darf
Ein Agent, der unbeaufsichtigt läuft, ist ein Agent, der unbeaufsichtigt eine Rechnung hochtreiben kann. North 2 macht das Budget zu einem Teil des Produkts.
Adobe bringt generative Bearbeitung in Lightroom, und Fotografen sind zu Recht nervös
Ein Werkzeug, das zwischen den Reglern sitzt, fördert die Annahme, dass es sich um eine routinemäßige Anpassung handelt. Es schreibt das Foto neu.
JetBrains packt einen Agent-Orchestrator in jede IDE, die es ausliefert
JetBrains konkurriert nicht über Modellqualität. Es konkurriert um die Ebene, auf der Agents gestartet und überprüft werden.