Das Aufteilen eines JPGs in Ebenen wird zu einem normalen Designschritt

In den Tools, zu denen Designer greifen, vollzieht sich ein leiser Wandel. Fast das gesamte letzte Jahr über lag die spannende Entwicklung bei der KI-Bildarbeit in der Generierung: etwas zu erschaffen, das es noch nicht gab. Die Tools, die jetzt wie Pilze aus dem Boden schießen, beginnen mit einem bereits existierenden Bild und zerlegen es.
Der Wandel ist leicht zu übersehen, weil er keine dramatischen Demo-Reels produziert. Niemand teilt einen Screenshot eines sauber getrennten Ebenenstapels. Doch genau diese Veränderung entscheidet darüber, ob generierte Bilder in der professionellen Arbeit nutzbar sind, denn der Wert eines Design-Assets hängt weniger davon ab, wie es aussieht, als vielmehr davon, ob es später bearbeitet werden kann.
LayerGrab erschien am 2. Oktober. Es wandelt ein flaches PNG, JPG oder WebP in bis zu sechzehn unabhängige transparente Ebenen mit beschreibenden englischen Namen um und rekonstruiert den Hintergrund hinter extrahierten Elementen durch Inpainting. Es exportiert einzelne PNGs, eine ZIP-Datei oder ein Ebenen-PSD für Photoshop, mit Plugins für Photoshop, Figma und Sketch sowie einer Chrome-Erweiterung zum Greifen von Bildern aus einem Browser. Aus dem Browser-Tool selbst gibt es keinen .psd-Export; die Ebenen kommen als nummerierte PNGs, die man in einem Editor stapelt.
Die Verarbeitung dauert 60 bis 100 Sekunden. Sie läuft auf Segmentierungs- und generativen Modellen, darunter Qwen-Image-Layered, das Modell, das Alibaba am 2. Oktober unter einer permissiven Lizenz als Open Source veröffentlichte. Eingabedateien sind auf 20 MB begrenzt, und eine Chrome-Erweiterung ermöglicht es Designern, mit der rechten Maustaste auf ein Bild auf einer beliebigen Website zu klicken und es direkt an das Trennungspanel zu senden.
Warum die Ebenenzerlegung die nützliche Hälfte ist
Die Generierung löste ein Problem, das Designer jahrelang umgangen hatten, und schuf ein neues. Ein KI-generiertes Bild sieht wie ein flaches Foto eines Designs aus, nicht wie eine Arbeitsdatei. Man kann das Produkt nicht auf die andere Seite des Banners verschieben, weil es in die Pixel eingeschweißt ist. Man kann den Überschriftentext nicht ersetzen, weil es kein Textobjekt gibt, nur die Erscheinung von Text.
Genau diese Lücke füllt die Ebenenzerlegung. Hier geht es darum, die Struktur wiederherzustellen, die ein flaches Bild verbirgt, damit das Bild so bearbeitet werden kann, wie eine Designdatei bearbeitet wird, anstatt etwas Neues zu produzieren.
Alibabas Darstellung von Qwen-Image-Layered beschreibt das Problem als „flache Pixelkopplung“. Das Modell verwendet einen RGBA-VAE-Encoder und 3D-Positionskodierung auf Ebenenebene, um räumliche Ebenen und Verdeckungsbeziehungen zu identifizieren, und zerlegt das Bild dann in unabhängige, bearbeitbare Ebenen. Das Unternehmen behauptet nahezu null Drift bei präzisen Bearbeitungen, was das Konsistenzproblem adressiert, das auftritt, wenn man einen Teil eines Bildes ändert und andere Teile sich verschieben.
Ant Groups inclusionAI veröffentlichte am selben Tag ein verwandtes Paar: Ming-Image-0.1-Design zur Generierung vollständiger visueller Designs und Ming-Image-0.1-Design-Layer zur Zerlegung abgeflachter Designs in transparente Ebenen, beide mit 6B Parametern, beide mit einer 80-GB-GPU für die Standardbereitstellung erforderlich.
Was Kreative tatsächlich damit machen
Die Tool-Beschreibungen lesen sich wie eine Liste kleiner, unspektakulärer Aufgaben. Eine fertige Anzeige in Ebenen aufteilen und das Produkt für ein neues Format auf die andere Seite verschieben. Eine Illustration in Ebenen trennen, um einen Parallaxeffekt zu animieren. Produkt und Hintergrund eines Fotos voneinander trennen, damit sie auf separaten Folien animiert werden können. Elemente aus einem Poster extrahieren, um den Text zu ändern oder die Grafiken in einem neuen Projekt wiederzuverwenden.
Nichts davon sind Aufgaben, die jemandes Demo-Reel zieren. Es sind die Aufgaben, die den Nachmittag eines Designers verschlingen, und sie waren zuvor überhaupt nicht automatisierbar, weil kein Tool Struktur aus einem gerenderten Bild zurückgewinnen konnte. Ein Designer, der vor einem flachen JPG stand, hatte genau eine Option: es von Hand neu zeichnen, Ebene für Ebene, und raten, was sich hinter jedem Element befand.
Der Grund, warum dies wichtiger ist, als es klingt, ist, dass die meisten Assets, die ein Designer erhält, flach sind. Ein Kunde schickt ein JPG des letztjährigen Posters und bittet um eine Version in einem neuen Format. Ein Brand-Team hat den finalen Export, aber die Quelldatei verloren. Ein Kampagnen-Asset existiert nur als Screenshot. Die Ebenenzerlegung verwandelt diese Sackgassen in Ausgangspunkte, was eine andere Art von Wert ist als die Generierung bietet.
Es gibt ehrliche Einschränkungen. LayerGrab bewahrt keine Schlagschatten. Sehr feiner Text kann leichte Farbabweichungen zeigen, wenn er vom Modell neu gezeichnet wird, und Text wird als Bildebene extrahiert, nicht als bearbeitbarer Text. Wie bei jedem Segmentierungssystem kann die Aufteilung bei demselben Eingabebild von Lauf zu Lauf leicht variieren.
Das Image-Layer-Tool von Kenerate verfolgt einen ähnlichen Ansatz mit anderer Gewichtung: Es erzeugt zwei bis acht Ebenen, wobei der Nutzer die Anzahl wählt, oder eine automatische Anzahl, die in der Pro-Stufe oft zwischen sechs und zwölf liegt. Es exportiert ebenfalls PNGs statt eines PSD, und die Dokumentation ist ausdrücklich über diese Einschränkung, was die Art von Ehrlichkeit ist, von der ein Tool in dieser Kategorie profitiert. Designer, die eine funktionierende PSD-Datei erwarten und einen Ordner mit PNGs erhalten, verschwenden einen Nachmittag damit, den Unterschied zu entdecken.
Die Unterschiede zwischen den Tools sind aufschlussreich. Das eine optimiert auf eine feste Ebenenanzahl, die der Designer steuert; das andere lässt das Modell entscheiden. Beide umgehen dieselbe Einschränkung, nämlich dass die Ebenensegmentierung eine Ermessensfrage ist und verschiedene Tools sie unterschiedlich beantworten.
Die größere Richtung
Betrachtet man, was in diesem Monat als Gruppe veröffentlicht wurde, zeigt sich ein Muster. Alibaba hat ein Ebenenmodell als Open Source freigegeben. Ant Group veröffentlichte ein Design-und-Zerlege-Paar. Ein kommerzielles Tool packte die Fähigkeit in Plugins für die Editoren, die Designer bereits verwenden. Die Fähigkeit entwickelte sich in etwa zwei Wochen von einem Forschungsergebnis zu einem Produktfeature.
Das Interessante ist diese Geschwindigkeit. Wenn ein Modell unter einer permissiven Lizenz als Open Source veröffentlicht wird, schrumpft das Fenster zwischen „Das existiert in einem Paper“ und „Das ist ein Button in Figma“ zusammen. Designer übernehmen keine Architekturen; sie übernehmen Buttons. Das Modell, das gewinnt, ist selten das mit der besten Benchmark-Punktzahl. Es ist das, das in der Software auftaucht, die bereits auf dem zweiten Monitor des Designers geöffnet ist.
Der praktische Effekt ist, dass KI-Bilder aufhören, Endartefakte zu sein. Ein heute generiertes Bild kann morgen zerlegt, am Donnerstag neu angeordnet und in einem Format ausgeliefert werden, das das Team des Kunden im nächsten Quartal noch bearbeiten kann. Diese Flexibilität macht generierte Assets in professionellen Workflows nutzbar, und deshalb ist die Ebenenzerlegung von einer Neuheit zu einem Standardschritt geworden.
Die nächste Frage ist, ob die Ebenenzerlegung im Generierungsmodell oder daneben landet. Wenn ein Modell direkt eine Ebenenausgabe erzeugt, entfällt der separate Zerlegungsschritt. Bis dahin sind Tools, die Struktur aus flachen Bildern zurückgewinnen, die Brücke zwischen der Ausgabe eines Generators und den Anforderungen eines Designers, und diese Brücke wird schnell genug gebaut, dass die meisten Design-Teams sie nutzen werden, ohne sich jemals für ihre Einführung zu entscheiden.
Verwandte Artikel
Satellitenbilder sind jetzt Trainingsdaten für Roboter
Der Engpass beim Training physischer KI ist nicht mehr die Rechenleistung oder die Modellfähigkeit. Er wurde die Qualität der synthetischen Welt.
Googles Gemini 3.5 Live Translate beseitigt die Pause
Übersetzung, die kontinuierlich läuft, in der Stimme der sprechenden Person, auf einem Telefon, das ohnehin schon in der Tasche steckt, macht das Feature von etwas, das man öffnet, zu etwas, das einfach an ist.
China hat den ersten verbindlichen Sicherheitsstandard für KI-Agenten geschrieben
Sicherheit wird von einem Feature, mit dem man wirbt, zu einer Hürde, die man passieren muss. Das Risikoinventar umfasst 13 Kategorien und 97 Punkte.
KI-generierte Inhalte müssen jetzt ihre Identität offenlegen
Dieser Schritt löst nicht alle Probleme, aber er macht „KI-generiert“ von einer Option, die man verbergen konnte, zu einer Frage, die beantwortet werden muss.