← Zurück zum Blog
Aica. 7 Min. Lesezeit

FLUX 3 Image verwandelte Bildgenerierung in eine Layout-Datei

Veröffentlicht 3. Okt. 2026
FLUX 3 Image verwandelte Bildgenerierung in eine Layout-Datei

Black Forest Labs hat FLUX 3 Image am 1. Oktober veröffentlicht, und die meisten Berichte begannen mit der Auflösung: native Ausgabe bis zu 4K, rund 16,8 Megapixel, kein Upscaler im Prozess. Das ist ein echtes Upgrade. Es ist zugleich das am wenigsten interessante Detail an diesem Release.

Der Teil, für den es sich lohnt, die Doku zu lesen, ist das Eingabeformat. FLUX 3 Image will keinen Absatz und einen Wunsch. Es will eine Tabelle.

Jedes Element bekommt eine Adresse

Eine Generierungsanfrage ist ein JSON-Array von Elementen. Jedes Element trägt eine eindeutige ID, eine Bounding Box, geschrieben als `[y_min, x_min, y_max, x_max]` auf einem normalisierten Raster von 0 bis 1000, und eine Beschreibung in natürlicher Sprache, was dorthin gehört. Ein Hintergrundblock erstreckt sich über die gesamte Leinwand. Ein Produkt sitzt bei `[400, 200, 950, 800]`. Ein Logo lebt in der oberen linken Ecke. Der Szenen-Prompt existiert weiterhin, aber er ist jetzt eine Eingabe unter mehreren statt des gesamten Briefings.

Das Raster ist auflösungsunabhängig. Dasselbe Layout-JSON rendert dieselbe Komposition bei 768 Pixeln Breite oder in nativem 4K, was bedeutet: Ein Layout, das Sie an einem günstigen Entwurf getestet haben, ist das Layout, das Sie im teuren Finale erhalten.

Das klingt nach einem Komfortmerkmal. In der Praxis verändert es, wer das Modell aufrufen kann. BFL hat die Elementtabelle so entworfen, dass ein Sprachmodell sie aus einem einzeiligen Briefing und einem Zielseitenverhältnis schreiben kann. Ein Agent muss Absicht nicht in Prosa übersetzen und auf das Beste hoffen. Er kann das Bild so anordnen, wie er eine Tabelle anordnet, und die Element-IDs bleiben als Handles erhalten, auf die er in späteren Turns verweisen kann.

Ein leeres Blatt Papier, das auf einem Holzschreibtisch zu einem gleichmäßigen Raster abgeklebt ist, mit einigen kleinen abstrakten Objekten in manchen der Quadrate

Es gibt auch eine günstigere Konsequenz. Weil das Raster auflösungsunabhängig ist, kann ein Layout bei 768 Pixeln für einen Bruchteil des Preises validiert und dann in 4K mit intakter Komposition gerendert werden. Iteration und finale Auslieferung müssen nicht mehr über das Budget miteinander streiten, was für alle wichtig ist, die Dutzende Bilder nach derselben Vorlage produzieren.

Pixel-Locking und das Drift-Problem

Die Bearbeitung folgt derselben Logik. Sie geben eine Quell-Bounding-Box und eine Ziel-Bounding-Box an, wählen das Element aus, das verschoben, ersetzt oder entfernt werden soll, und die Pixel außerhalb dieses Bereichs sollen genau dort bleiben, wo sie waren. BFLs eigene Messung beziffert unberührte Bereiche mit 67,8 bis 89,7 Prozent bit-identischer Treue – eine Spanne, die davon abhängt, wie komplex die Bearbeitung ist.

Der ehrliche Teil ist die Formulierung. Die Launch-Demo verspricht Bearbeitungen "ohne einen anderen Pixel zu verändern". Die API-Dokumentation sagt, unberührte Pixel bleiben "im Allgemeinen" unverändert, und BFL räumt ein, dass Bearbeitungen über die angegebene Box hinausgehen können. Grenzartefakte sind real. Jedes Team, das dies in eine Pipeline einbaut, sollte einen Abnahmetest erstellen, statt der Demo zu vertrauen.

Dennoch ist der Vergleich mit gewöhnlichem Inpainting nicht knapp. Traditionelles Inpainting hinterlässt selbst in Bereichen, die unangetastet bleiben sollten, eine subtile Drift. Nach einer Bearbeitung bemerkt das niemand. Nach einem zehnstufigen Freigabezyklus hat sich der Hintergrund verschoben, die Typografie ist weicher geworden, und die Komposition entspricht nicht mehr dem, was ein Kunde vor drei Runden abgesegnet hat. Diese Akkumulation macht lange Bearbeitungsketten unbrauchbar, und genau das sollen Bounding Boxes verhindern.

Was Creator tatsächlich herausfanden

Ein Creator, der dieselben Bearbeitungsanweisungen mit Midjourney, Ideogram 4.5 und FLUX 3 Image ausführte, veröffentlichte einen nützlichen Vergleich. In einem Test, der ein Kleidungsstück in rosa Seide mit weißen Blumen und einer vanillegelben Schleife umfärben sollte, dann Makro-Nahaufnahmen von Gesicht und Händen verlangte, meisterte Midjourney die Nahaufnahmen, verfehlte aber die weißen Blumen und den exakten Farbton. Ideogram 4.5 traf die Kleidungsänderungen, doch die Beleuchtung in den Makroaufnahmen wirkte daneben. FLUX 3 Image traf die Kleidungsänderungen und wurde für Beleuchtung und Kontext in den Nahaufnahmen gelobt. In einem separaten Test hielt es eine Bearbeitung einer winzigen Spalte auf die beabsichtigten Objekte beschränkt, während die anderen beiden die Änderung weiter ausbreiteten.

Ein Thread eines Creators ist kein Benchmark. Betrachten Sie ihn als Signal dafür, wo das Modell stark ist: offenbar beim Befolgen feinteiliger Anweisungen statt bei breiter Stilisierung.

Was Bounding Boxes nicht beheben

Platzierung und Drift sind zwei Probleme, nicht alle. Eine Box sagt dem Modell, wohin etwas gehört. Sie sagt dem Modell nicht, wie das Ding aussehen soll, und sie verhindert nicht, dass ein Referenzelement seinen Stil ändert, sobald es platziert ist. Teams, die ein einzelnes Produkt vor dreißig verschiedenen Hintergründen generieren, müssen das Produkt selbst weiterhin konsistent halten, und diese Arbeit steckt in den Referenzbildern und dem Prompt, nicht in den Koordinaten.

Text-Rendering ist die andere offene Naht. BFLs eigene Demo-Bilder stammen aus einem Prompt, den ein Mensch kuratiert hat. Ob ein Layoutmodell zuverlässig lesbaren Text in einer kleinen Box in einer bestimmten Schriftart platziert, ist eine separate Frage, und das Launch-Material beantwortet sie nicht. Für Magazin-Layout- und E-Commerce-Arbeit, also die Zielgruppe dieses Releases, ist das das Detail, das über die Akzeptanz entscheidet.

Und eine strukturierte Eingabe macht das Modell in ästhetischen Fragen auch nicht weniger zu einer Blackbox. Sie können festlegen, dass ein Logo in die obere linke Ecke gehört. Sie können nicht festlegen, dass die Komposition ruhig wirken soll.

Die Trade-offs, die niemand in die Schlagzeile setzte

Bounding Boxes kosten mehr Einrichtung als das Tippen von "mach den Hintergrund blau". Sie müssen wissen, wohin die Dinge gehören. Für ein einmaliges Bild lohnt sich dieser Aufwand wahrscheinlich nicht. Für eine Pipeline, die dasselbe Layout über zwanzig Produktfotos hinweg neu generiert, oder einen Agenten, der ein Logo zuverlässig irgendwo platzieren muss, zahlt es sich schnell aus.

Die Launch-Preise sind bis zum 8. Oktober um 50 Prozent reduziert: etwa 0,0205 US-Dollar für ein 768-Pixel-Bild bis zu 0,3035 US-Dollar für 4K, inklusive Referenzen und Prompts, fehlgeschlagene Generierungen werden nicht berechnet. Kommerzielle selbst gehostete Gewichte sind auf Anfrage bei BFL erhältlich, und eine Open-Weights-Edition wird in den kommenden Wochen versprochen.

Die Referenzbehandlung ist eine eigene Anmerkung wert. Ein einzelner Aufruf akzeptiert bis zu 10 Referenzbilder, und jedem Element kann gesagt werden, von welcher Referenz es stammt und wohin es gehört. Zehn Referenzen allein sind nicht ungewöhnlich. Zehn Referenzen, die jeweils auf eine bestimmte Box auf der Leinwand abgebildet werden, sind ein Workflow, um eine Komposition aus vorhandenen Assets zusammenzusetzen – näher daran, wie ein Designer arbeitet, als daran, wie ein Prompt arbeitet. Kombiniert man das mit dem Layout-Raster, wirkt das Modell weniger wie ein Maler und mehr wie ein Compositor mit Meinungen.

Das größere Bild ist, dass Bild-APIs jahrelang um eine Frage herum optimiert wurden: Wie gut sieht das Bild aus? FLUX 3 Image fügt eine zweite Frage hinzu, die Agenten stärker interessiert. Kann man einen Teil des Bildes adressieren, ihn ändern und alles andere unangetastet lassen? Sobald die Antwort ja lautet, hört Bildgenerierung auf, ein Spielautomat zu sein, und beginnt, sich wie eine Datei zu verhalten, die man bearbeiten kann.

Dieser Unterschied ist der Grund, warum der Vergleich mit Midjourney und Ideogram weniger wichtig ist, als er zunächst scheint. Diese Modelle konkurrieren darum, wie schön ein frisches Bild ist, und darin sind sie weiterhin sehr gut. BFL konkurriert darum, ob ein generiertes Bild als Dokument mit stabilen Regionen behandelt werden kann, und das ist ein anderer Wettbewerb mit einem anderen Sieger. Der erste Wettbewerb ist nahezu entschieden, und der zweite hat gerade erst begonnen – ungefähr dort, wo eine Infrastruktur-Wette stehen möchte.

Verwandte Artikel