FLUX 3 Image transforme la génération d'images en fichier de mise en page

Black Forest Labs a lancé FLUX 3 Image le 1er octobre, et l'essentiel de la couverture médiatique a mis en avant la résolution : une sortie native jusqu'à la 4K, environ 16,8 mégapixels, sans upscaler dans la chaîne. C'est une vraie amélioration. C'est aussi l'aspect le moins intéressant de cette sortie.
La partie qui mérite qu'on lise la documentation, c'est le format d'entrée. FLUX 3 Image ne veut pas un paragraphe et un souhait. Il veut un tableau.
Chaque élément obtient une adresse
Une requête de génération est un tableau JSON d'éléments. Chaque élément porte un ID unique, une boîte englobante écrite sous la forme `[y_min, x_min, y_max, x_max]` sur une grille normalisée de 0 à 1000, et une description en langage naturel de ce qui doit s'y trouver. Un bloc d'arrière-plan couvre toute la toile. Un produit se situe à `[400, 200, 950, 800]`. Un logo réside dans le coin supérieur gauche. Le prompt de scène existe toujours, mais il n'est désormais qu'une entrée parmi d'autres plutôt que tout le brief.
La grille est indépendante de la résolution. Le même JSON de mise en page produit la même composition en 768 pixels de large ou en 4K native, ce qui signifie qu'une mise en page testée sur un brouillon bon marché est celle que vous obtenez sur le rendu final coûteux.
Cela ressemble à une fonctionnalité de confort. En pratique, cela change qui peut appeler le modèle. BFL a conçu le tableau d'éléments pour qu'un modèle de langage puisse l'écrire à partir d'un brief d'une ligne et d'un ratio d'image cible. Un agent n'a pas besoin de traduire son intention en prose en espérant que ça passe. Il peut disposer l'image comme il dispose un tableur, et les ID des éléments subsistent comme des poignées auxquelles il peut se référer lors des tours suivants.

Il y a aussi une conséquence plus économique. Comme la grille est indépendante de la résolution, une mise en page peut être validée en 768 pixels pour une fraction du prix, puis rendue en 4K avec la composition intacte. L'itération et la livraison finale cessent de se disputer le budget, ce qui compte pour quiconque produit des dizaines d'images à partir du même modèle.
Verrouillage des pixels et problème de dérive
L'édition suit la même logique. Vous spécifiez une boîte englobante source et une boîte englobante cible, choisissez l'élément à déplacer, remplacer ou supprimer, et les pixels en dehors de cette région sont censés rester exactement où ils étaient. La mesure de BFL elle-même situe les zones non touchées entre 67,8 et 89,7 % de fidélité bit à bit, une fourchette qui dépend de la complexité de l'édition.
La partie honnête réside dans la formulation. La démo de lancement promet des modifications « sans changer aucun autre pixel ». La documentation de l'API indique que les pixels non touchés « généralement » restent inchangés, et BFL reconnaît que les modifications peuvent dépasser la boîte spécifiée. Les artefacts de bordure sont réels. Toute équipe qui intègre cela dans un pipeline devrait mettre en place un test d'acceptation plutôt que de faire confiance à la démo.
Pourtant, la comparaison avec l'inpainting ordinaire est loin d'être serrée. L'inpainting traditionnel laisse une dérive subtile même dans les régions qu'on lui a demandé de ne pas toucher. Sur une seule édition, personne ne le remarque. Sur un cycle d'approbation en dix étapes, l'arrière-plan a bougé, la typographie s'est adoucie et la composition ne correspond plus à ce qu'un client a validé trois tours plus tôt. C'est cette accumulation qui rend les longues chaînes d'édition inutilisables, et c'est précisément ce que les boîtes englobantes sont censées arrêter.
Ce que les créateurs ont réellement constaté
Un créateur qui a appliqué les mêmes instructions d'édition à Midjourney, Ideogram 4.5 et FLUX 3 Image a publié une comparaison utile. Sur un test demandant qu'un vêtement soit recoloré en soie rose avec des fleurs blanches et un nœud jaune crème, puis des gros plans macro du visage et des mains, Midjourney a géré les gros plans mais a raté les fleurs blanches et la nuance exacte. Ideogram 4.5 a reproduit les changements du vêtement, bien que l'éclairage des plans macro semble incorrect. FLUX 3 Image a reproduit les changements du vêtement et a été salué pour l'éclairage et le contexte des gros plans. Dans un autre test, il a maintenu une édition sur une minuscule colonne limitée aux objets prévus, tandis que les deux autres ont étendu la modification plus loin.
Le fil d'un créateur n'est pas un benchmark. Considérez-le comme un signal indiquant où le modèle est fort : apparemment le suivi d'instructions de détail fin plutôt que la stylisation globale.
Ce que les boîtes englobantes ne règlent pas
Le placement et la dérive sont deux problèmes, pas tous les problèmes. Une boîte indique au modèle où va quelque chose. Elle ne lui dit pas à quoi la chose doit ressembler, et elle n'empêche pas un élément de référence de changer de style une fois placé. Les équipes qui génèrent un seul produit sur trente arrière-plans différents doivent encore garder le produit lui-même cohérent, et ce travail réside dans les images de référence et le prompt, pas dans les coordonnées.
Le rendu de texte est l'autre faille ouverte. Les images de démo de BFL proviennent d'un prompt qu'un humain a soigné. Savoir si un modèle de mise en page place de manière fiable du texte lisible dans une petite boîte, dans une police spécifique, est une question distincte, et les documents de lancement n'y répondent pas. Pour le travail de mise en page de magazine et d'e-commerce, qui est le public visé par cette sortie, c'est le détail qui décide de l'adoption.
Une entrée structurée ne rend pas non plus le modèle moins opaque sur le plan esthétique. Vous pouvez spécifier qu'un logo va dans le coin supérieur gauche. Vous ne pouvez pas spécifier que la composition doit inspirer le calme.
Les compromis que personne n'a mis dans le titre
Les boîtes englobantes coûtent plus de préparation que taper « rendre l'arrière-plan bleu ». Vous devez savoir où vont les choses. Pour une image unique, cette surcharge n'en vaut probablement pas la peine. Pour un pipeline qui régénère la même mise en page sur vingt photos de produits, ou un agent qui doit placer un logo de manière fiable, le retour sur investissement est rapide.
Le tarif de lancement est à -50 % jusqu'au 8 octobre : environ 0,0205 $ pour une image de 768 pixels jusqu'à 0,3035 $ pour la 4K, références et prompts inclus, et les générations échouées ne sont pas facturées. Les poids commerciaux auto-hébergés sont disponibles en contactant BFL, et une édition open-weights est promise dans les semaines à venir.
La gestion des références mérite une note à part. Un seul appel accepte jusqu'à 10 images de référence, et chaque élément peut se voir indiquer de quelle référence il provient et où il doit aller. Dix références seules, ce n'est pas inhabituel. Dix références qui correspondent chacune à une boîte précise sur la toile constituent un flux de travail pour assembler une composition à partir de ressources existantes, ce qui est plus proche de la façon dont travaille un designer que de celle d'un prompt. Combinez cela avec la grille de mise en page et le modèle commence à ressembler moins à un peintre et plus à un compositeur qui a des opinions.
La vue d'ensemble, c'est que les API d'images ont été optimisées pendant des années autour d'une seule question : à quel point l'image est-elle belle ? FLUX 3 Image ajoute une deuxième question, qui importe davantage aux agents. Pouvez-vous cibler une partie de l'image, la modifier et laisser tout le reste intact ? Une fois que la réponse est oui, la génération d'images cesse d'être une machine à sous et commence à se comporter comme un fichier que vous pouvez éditer.
Cette distinction explique pourquoi la comparaison avec Midjourney et Ideogram compte moins qu'il n'y paraît au premier abord. Ces modèles rivalisent sur la beauté d'une image nouvelle, et ils restent très bons dans ce domaine. BFL rivalise sur la question de savoir si une image générée peut être traitée comme un document aux régions stables, et c'est une compétition différente avec un vainqueur différent. La première compétition est presque réglée et la seconde vient de commencer, ce qui correspond à peu près à l'endroit où un pari d'infrastructure veut se trouver.
Articles associés
Agility Digit 5 arrive avec un dossier de sécurité, pas seulement une fiche technique
Un entrepôt n'est pas un laboratoire. La certification est la porte d'entrée, pas la démo.
Les agents de pointe ont terminé 30 % d’un flux de travail de recherche. C’est le chiffre qui compte.
Les agents peuvent exécuter de la recherche. Inventer la procédure reste hors de portée.
Figure AI engage 3,5 milliards de dollars de capacité de calcul avant même d'avoir un produit à vendre
Le pari : la généralisation est un problème de calcul. Le secteur n'a pas tranché.
OpenAI ajoute enfin les arrière-plans transparents à son API d’images
Une petite fonctionnalité qui supprime toute une étape du pipeline.