← Zurück zum Blog
Aica. 6 Min. Lesezeit

FLUX 3 Image: Bounding Boxes, 4K-Ausgabe und Layout als Konfigurationsdatei

Veröffentlicht 7. Okt. 2026
FLUX 3 Image: Bounding Boxes, 4K-Ausgabe und Layout als Konfigurationsdatei

Black Forest Labs hat FLUX 3 Image am 1. Oktober veröffentlicht und damit die Bildkomponente der FLUX-3-Familie vervollständigt. Es ist über die API und das Playground des Unternehmens verfügbar, mit einem Einführungsrabatt von 50 Prozent bis zum 8. Oktober und einer für die kommenden Wochen versprochenen Open-Weights-Veröffentlichung.

Die drei zentralen Versprechen sind native 4K-Ausgabe, Layoutsteuerung auf Elementebene und regionenerhaltende Bearbeitungen. Jedes davon ist es wert, auseinandergenommen zu werden, denn das dritte leistet mehr, als das Marketing nahelegt.

Das Raster ersetzt die Prosa

FLUX 3 Image nimmt ein JSON-Array aus Bounding Boxes entgegen, das an den Prompt angehängt wird und auf einem normalisierten Koordinatenraster von 0–1000 angegeben ist. Jedes Element erhält eine ID, eine Textbeschreibung und eine Box im Format [y_min, x_min, y_max, x_max]. Das Modell platziert dieses Element dann innerhalb dieser Box, unabhängig von der Ausgabeauflösung.

Das ist der Teil, um den herum die Veröffentlichung aufgebaut ist, und es ist eine echte Verschiebung dessen, wie Layout spezifiziert wird. In den meisten Text-zu-Bild-Workflows wird die räumliche Anordnung in natürlicher Sprache beschrieben („eine Flasche im linken Drittel, eine Hand, die von rechts hineinreicht“), und das Modell interpretiert das als weiche Präferenz. Das Ergebnis ist eine Verteilung von Ausgaben, die meist irgendwo in der Nähe der Beschreibung landet, manchmal aber nicht.

Ein Koordinatenraster entfernt den Interpretationsschritt. Man beschreibt ein Layout nicht mehr und hofft; man deklariert es. Für eine Designerin, die in einem Layoutwerkzeug arbeitet, passt das zu einem bestehenden mentalen Modell. Für eine Pipeline, die Hunderte Produktfotos generiert, bei denen das Modell stets an derselben Position stehen muss, verwandelt es ein ästhetisches Problem in ein Konfigurationsproblem.

Mit jedem Koordinatensystem kommt ein Vorbehalt: Die Boxen sagen dem Modell nicht, was hineingehört, und eine Beschreibung, die das falsche Objekt angibt, wird selbstsicher an der falschen Stelle gerendert. Geometrische Präzision erzeugt nicht automatisch semantische Präzision.

4K ohne Upscaling-Schritt

FLUX 3 Image generiert nativ bis zu 5.456 × 3.072 Pixel (etwa 16,8 Megapixel) über mehrere Seitenverhältnisse hinweg, ohne Super-Resolution-Durchlauf.

Die meisten Bildmodelle enden nativ bei etwa 1024 bis 2048 Pixeln; alles Größere wird anschließend per Upscaling behandelt. Für die Bildschirmauslieferung ist das in Ordnung, doch für Druckmaterialien, E-Commerce-Hero-Bilder und Großformatdisplays wird es zunehmend unangenehm, weil der Nachbearbeitungsschritt genau die Texturdetails wegschmiert, die die Auflösung rechtfertigen.

Die Generierung in 4K verändert zudem, was ein Workflow validieren muss. Ein Upscaler ist eine separate Stufe mit eigenen Fehlermodi, und das Entfernen einer Stufe entfernt eine ganze Kategorie der Qualitätskontrolle. Ob die native Ausgabe in voller Größe überzeugt, statt bloß offensichtliche Artefakte zu vermeiden, kann nur praktisches Testen klären.

Regionsbearbeitungen und die Behauptung zur Pixelidentität

Die dritte Funktion ist partielle Bearbeitung: Nur eine angegebene Bounding-Box-Region wird neu generiert, während alles außerhalb unangetastet bleibt. Black Forest Labs berichtet, dass nach einer Bearbeitung 67,8 bis 89,7 Prozent der Pixel bitidentisch bleiben.

Diese Spanne ist weit, und die Streuung trägt Information. Das untere Ende impliziert eine deutliche Drift über den unberührten Bereich; das obere Ende kommt einer echten Maskenbearbeitung nahe. Wo eine bestimmte Bearbeitung landet, hängt wahrscheinlich davon ab, wie stark die neu generierte Region ihre Umgebung einschränkt; Lichtüberlauf, Schatten und Kontaktkanten erzeugen allesamt Druck, benachbarte Pixel für die Kohärenz zu verändern.

Dennoch ist es ein nützlicher Schritt, überhaupt eine Pixelidentitäts-Zahl zu veröffentlichen. Das Driftproblem bei iterativer Bildbearbeitung ist seit zwei Jahren die zentrale Beschwerde gegen Diffusion-Editing: Jede weitere Überarbeitungsrunde verschlechtert die Teile, mit denen man zufrieden war, bis man aufgibt und von vorn beginnt. Ein Modell, das quantifiziert, wie viel es bewahrt, hat zumindest das Ziel benannt.

FLUX 3 Image akzeptiert außerdem bis zu zehn Referenzbilder in einer einzigen Anfrage und positioniert Motive gemäß dem Prompt und dem Bounding-Box-Layout. Diese Kombination (mehrere Referenzen plus deklarierte Platzierung) ist der Punkt, an dem das Modell weniger wie ein Bildgenerator und mehr wie ein Compositing-Werkzeug mit Generierungs-Backend wirkt.

Zehn Referenzen werfen zudem die Frage auf, wofür eine „Referenz“ dient. In den meisten aktuellen Workflows bedeutet ein Referenzbild Stiltransfer: Man gibt dem Modell einen Look, und es nähert ihn an. Jedes referenzierte Motiv in eine deklarierte Box zu setzen, ist ein engeres und mechanischeres Versprechen. Es besagt: dieses Objekt, hier. Ob das Modell dies unter Last einhält (zehn Motive, eine 4K-Leinwand, überlappende Boxen), zeigt sich eher im Produktiveinsatz als in einem Launch-Beitrag.

Die erwähnenswerte Trainingsnotiz

In den technischen Details vergraben: FLUX 3 Image wurde mit der Self-Flow-Architektur von Black Forest Labs gemeinsam auf Bild-, Video- und Audiodaten trainiert. Die FLUX-3-Basis ist ein multimodales Flow-Modell, das alle drei Modalitäten abdeckt, und das Bildmodell ist eine Facette davon.

Das ist wichtig dafür, wie die Roadmap zu lesen ist. Wenn Bild, Video und Audio ein gemeinsames Trainingssubstrat teilen, reicht das Versprechen „Open Weights in einigen Wochen“ über diese Veröffentlichung hinaus und spricht für eine Modellfamilie, die auf derselben Basis aufgebaut wird, sowie für ein Unternehmen, das sich als Open-Weight-Alternative zu den geschlossenen multimodalen Stacks von Google und OpenAI positioniert.

Es erklärt auch die Reihenfolge. Black Forest Labs hat zuerst die Video- und Audiokomponenten von FLUX 3 ausgeliefert und das Standbildmodell zuletzt. Für ein Unternehmen, dessen Ruf auf Bildgenerierung aufgebaut wurde, ist es eine seltsame Reihenfolge, das Bildmodell nach dem Videomodell zu veröffentlichen, es sei denn, das Bildmodell ist das schwierigste, das auf der gemeinsamen Basis richtig hinzubekommen ist. Die Bounding-Box-Steuerungen sind vielleicht weniger eine Funktion als ein Workaround dafür, was gemeinsames Training über drei Modalitäten hinweg mit der feinkörnigen räumlichen Treue macht.

Worauf zu achten ist

Vorerst ist die praktische Lesart enger. FLUX 3 Image ist ein kostenpflichtiges API-Produkt mit Layoutsteuerungen, die zuvor einen Compositing-Schritt erforderten, nativer Auflösung, die einen Upscaler überflüssig macht, und Regionsbearbeitungen, die mit einer veröffentlichten Treuezahl einhergehen. Die Frage, ob irgendetwas davon besser ist als die Alternativen, ist eine Benchmarking-Frage, und Benchmarks sind genau das, wofür die nächsten Wochen unabhängiger Tests da sind.

Drei Dinge lohnen sich zu verfolgen, sobald die Gewichte veröffentlicht werden. Erstens, ob die Bounding-Box-API die Open-Release unverändert überlebt oder zu einer reinen API-Funktion wird, was eine bedeutsame Trennung zwischen Bezahl- und kostenlosen Tarifen wäre. Zweitens, ob Community-Fine-Tunes dieselbe Layoutpräzision auf kleinerer Hardware erreichen können oder ob das Koordinatenverhalten von der Skalierung abhängt. Drittens, ob die Pixelidentitäts-Zahl einer unabhängigen Reproduktion standhält oder sich als Best-Case-Messung bei günstigen Bearbeitungen erweist.

Das breitere Signal ist das, was die Versionshinweise fast beiläufig feststellen: Der Wettbewerb in der Bildgenerierung hat sich davon verschoben, wie beeindruckend eine einzelne Ausgabe sein kann, hin zu der Frage, ob die hundertste Ausgabe zur ersten passt. Layoutraster, Regionenerhalt und Pixelidentitäts-Metriken sind alles Antworten auf diese Frage. Keine davon macht ein Bild schön. Sie machen es wiederholbar.

Verwandte Artikel