← Retour au blog
AiEnviron 8 min de lecture

FLUX 3 Image : boîtes englobantes, sortie 4K et mise en page comme fichier de configuration

Publié le 7 oct. 2026
FLUX 3 Image : boîtes englobantes, sortie 4K et mise en page comme fichier de configuration

Black Forest Labs a publié FLUX 3 Image le 1er octobre, complétant ainsi la composante image de la famille FLUX 3. Le modèle est disponible via l'API et le Playground de l'entreprise, avec une remise de lancement de 50 % valable jusqu'au 8 octobre et une publication en poids ouverts promise dans les semaines à venir.

Trois promesses phares : une sortie 4K native, un contrôle de la mise en page au niveau des éléments et des retouches préservant les zones non modifiées. Chacune mérite d'être décortiquée, car la troisième fait plus de travail que ne le laisse entendre le marketing.

La grille remplace la prose

FLUX 3 Image accepte un tableau JSON de boîtes englobantes ajouté au prompt, exprimé sur une grille de coordonnées normalisée de 0 à 1000. Chaque élément reçoit un ID, une description textuelle et une boîte au format [y_min, x_min, y_max, x_max]. Le modèle place ensuite cet élément à l'intérieur de cette boîte, indépendamment de la résolution de sortie.

C'est le cœur de cette publication, et il s'agit d'un véritable changement dans la façon dont la mise en page est spécifiée. Dans la plupart des workflows texte-image, l'agencement spatial est décrit en langage naturel (« une bouteille sur le tiers gauche, une main entrant par la droite ») et le modèle l'interprète comme une préférence souple. Le résultat est une distribution de sorties qui atterrit généralement quelque part près de la description, parfois pas.

Une grille de coordonnées supprime l'étape d'interprétation. Vous ne décrivez plus une mise en page en espérant qu'elle soit respectée ; vous la déclarez. Pour un designer travaillant dans un outil de mise en page, cela correspond à un modèle mental déjà existant. Pour un pipeline qui génère des centaines de photos produit nécessitant toutes le mannequin à la même position, cela transforme un problème esthétique en problème de configuration.

Il y a une mise en garde inhérente à tout système de coordonnées : les boîtes n'indiquent pas au modèle ce qu'elles doivent contenir, et une description désignant le mauvais objet sera rendue avec assurance au mauvais endroit. La précision géométrique ne produit pas automatiquement une précision sémantique.

La 4K sans étape d'agrandissement

FLUX 3 Image génère nativement jusqu'à 5 456 par 3 072 pixels (environ 16,8 mégapixels) sur plusieurs formats d'image, sans passe de super-résolution.

La plupart des modèles d'image plafonnent nativement autour de 1024 à 2048 pixels, tout ce qui est plus grand étant traité par un upscale en aval. Cela convient pour une diffusion à l'écran, mais devient de plus en plus gênant pour les supports imprimés, les visuels héros du e-commerce et l'affichage grand format, où l'étape de post-traitement a tendance à lisser précisément le détail de texture qui justifie la résolution.

Générer en 4K change aussi ce qu'un workflow doit valider. Un upscaler est une étape distincte avec ses propres modes de défaillance, et supprimer une étape supprime une catégorie de contrôle qualité. Savoir si la sortie native tient la route en taille réelle, et non si elle évite simplement un artefact évident, est une question que seule une prise en main réelle permettra de trancher.

Les retouches par zone et la promesse d'identité pixel

La troisième fonctionnalité est la retouche partielle : régénérer uniquement une zone délimitée par une boîte englobante spécifiée, en laissant tout ce qui se trouve à l'extérieur intact. Black Forest Labs indique que 67,8 à 89,7 % des pixels restent identiques au bit près après une retouche.

Cette fourchette est large, et son amplitude est porteuse d'information. Le bas de la fourchette implique une dérive notable sur la zone non touchée ; le haut se rapproche d'une véritable retouche par masque. L'endroit où se situe une retouche donnée dépend probablement de la mesure dans laquelle la zone régénérée contraint son environnement : les débordements de lumière, les ombres et les bords de contact créent tous une pression pour modifier les pixels voisins au nom de la cohérence.

Néanmoins, publier un chiffre d'identité pixel est déjà un geste utile. Le problème de la dérive en retouche d'image itérative est la critique centrale adressée à l'édition par diffusion depuis deux ans : chaque cycle de révision successif dégrade les parties dont vous étiez satisfait, jusqu'à ce que vous abandonniez et repartiez de zéro. Un modèle qui quantifie ce qu'il préserve a au moins énoncé l'objectif.

FLUX 3 Image accepte également jusqu'à dix images de référence en une seule requête, positionnant les sujets selon le prompt et la disposition des boîtes englobantes. C'est dans cette combinaison (références multiples et placement déclaré) que le modèle commence à ressembler moins à un générateur d'images qu'à un outil de compositing doté d'un moteur de génération.

Dix références posent aussi la question de la finalité d'une « référence ». Dans la plupart des workflows actuels, une image de référence signifie transfert de style : on donne un rendu au modèle et il s'en approche. Positionner chaque sujet référencé à l'intérieur d'une boîte déclarée est une promesse plus étroite et plus mécanique. Elle dit : cet objet, ici. Savoir si le modèle honore cela sous charge (dix sujets, un canevas 4K, des boîtes qui se chevauchent) est le genre de chose qui se révèle en production plutôt que dans un billet de lancement.

La note d'entraînement qui mérite l'attention

Enfoui dans les détails techniques : FLUX 3 Image a été entraîné avec l'architecture Self-Flow de Black Forest Labs, conjointement sur des données image, vidéo et audio. La base FLUX 3 est un modèle de flux multimodal couvrant les trois modalités, et le modèle d'image n'en est qu'une facette.

Cela compte pour savoir comment lire la feuille de route. Si l'image, la vidéo et l'audio partagent un même substrat d'entraînement, la promesse de « poids ouverts dans quelques semaines » dépasse cette publication et renvoie à une famille de modèles qui seront construits sur la même base, ainsi qu'à une entreprise qui se positionne comme l'alternative à poids ouverts face aux piles multimodales fermées de Google et d'OpenAI.

Cela explique aussi l'ordre de publication. Black Forest Labs a livré les composantes vidéo et audio de FLUX 3 en premier, et le modèle d'image fixe en dernier. Pour une entreprise dont la réputation s'est bâtie sur la génération d'images, publier le modèle d'image après le modèle vidéo est un ordre étrange, à moins que le modèle d'image ne soit le plus difficile à réussir sur la base partagée. Les contrôles par boîtes englobantes relèvent peut-être moins d'une fonctionnalité que d'un contournement de ce que l'entraînement conjoint sur trois modalités fait à la fidélité spatiale à grain fin.

Ce qu'il faut surveiller

Pour l'instant, la lecture pratique est plus étroite. FLUX 3 Image est un produit API payant doté de contrôles de mise en page qui nécessitaient auparavant une étape de compositing, d'une résolution native qui supprime l'upscaler, et de retouches par zone accompagnées d'un chiffre de fidélité publié. La question de savoir si tout cela vaut mieux que les alternatives est une question de benchmarking, et c'est précisément à cela que serviront les prochaines semaines de tests indépendants.

Trois choses méritent d'être suivies une fois les poids publiés. Premièrement, si l'API de boîtes englobantes survit intacte à la publication ouverte ou devient une fonctionnalité réservée à l'API, ce qui constituerait une séparation significative entre les offres payante et gratuite. Deuxièmement, si les fine-tunes communautaires peuvent atteindre la même précision de mise en page sur du matériel plus modeste, ou si le comportement des coordonnées dépend de l'échelle. Troisièmement, si le chiffre d'identité pixel résiste à une reproduction indépendante ou s'avère être une mesure dans le meilleur des cas sur des retouches favorables.

Le signal plus large est celui que les notes de publication énoncent presque en passant : la concurrence en génération d'images est passée de la question de savoir à quel point une sortie unique peut être frappante à celle de savoir si la centième sortie correspond à la première. Grilles de mise en page, préservation des zones et métriques d'identité pixel sont autant de réponses à cette question. Aucune ne produit une belle image. Toutes produisent une image reproductible.

Articles associés