Flux 3 et Imagen 4 débarquent sur Replicate, et l'étagère des modèles d'image se remplit

Le 1er octobre, Black Forest Labs et Google ont tous deux mis en ligne de nouveaux modèles d'image sur Replicate. Black Forest Labs a publié Flux 3 pour la génération d'images à partir de texte et l'édition, avec la prise en charge de jusqu'à dix images de référence. Google en propose quatre : Imagen 4 fast pour la vitesse et le coût, Imagen 4 ultra pour le détail, Imagen 3 fast pour les travaux sensibles au prix, et Imagen 3 pour une qualité de sortie optimale. Appelez-les via la même API que vous utilisez déjà.
Le titre ressemble à un lancement de modèle. Il s'agit plutôt d'une annonce de distribution. Chacun de ces modèles existait déjà quelque part. Ce qui change, c'est qu'un développeur disposant d'un jeton Replicate peut désormais y accéder sans ouvrir de compte chez Black Forest Labs ni configurer un projet Google Cloud.
Ce que dix images de référence vous apportent réellement
Le chiffre sur lequel il vaut la peine de s'arrêter, ce sont les dix images de référence de Flux 3. Il y a un an, l'édition d'image se résumait à une image d'entrée et à une instruction textuelle. Dix références changent ce que l'on peut demander au modèle. Vous pouvez lui fournir une photo de produit, une texture issue d'une deuxième image, une palette de couleurs tirée d'une troisième et un visage provenant d'une quatrième, puis demander une composition qui respecte l'ensemble.
C'est la capacité vers laquelle tout le marché court. Nano Banana Pro fusionne jusqu'à quatorze images et cinq personnes. GPT Image 2.5 Sunburst domine le classement d'édition d'Artificial Analysis en modifiant une seule zone sans perturber le reste. Seedream 5.0 fait appel à la recherche web en direct lorsqu'une édition a besoin d'une référence du monde réel. La ligne de concurrence est passée de la qualité de la première image à la manière dont le modèle suit les instructions à la dixième édition.

Pour quiconque construit un produit sur ces outils, le nombre d'images de référence est une spécification plus utile que les scores de benchmark. Il indique le degré de contrôle que vous pouvez confier à un utilisateur. Un modèle qui accepte une référence convient à un simple bouton de génération texte-image. Un modèle qui en accepte dix convient à un outil de design où l'utilisateur assemble des éléments de marque à partir d'un dossier d'actifs approuvés.
Les quatre modèles de Google ne sont en réalité que deux niveaux
La gamme de Google ressemble à quatre sorties. Regardez les noms : ce sont deux modèles séparés par le coût. Imagen 4 fast et Imagen 4 ultra exécutent la même génération, l'un optimisé pour le prix, l'autre pour le détail. Idem pour Imagen 3 fast et Imagen 3. Les variantes fast ne sont pas de moins bons modèles au sens propre. Ce sont les mêmes modèles avec un budget de calcul réduit, vendus moins cher.
C'est une façon sensée de vendre la génération d'images, et c'est aussi un indice sur l'endroit où se situe le coût. Quand la seule différence entre un palier fast et un palier ultra est le temps de réflexion accordé au modèle, le modèle lui-même a cessé d'être le produit. Le calcul est devenu le produit, et le modèle n'est que ce qui le dépense.
Pour une équipe qui décide quoi exécuter en production, cela change le calcul. La question n'est pas de savoir lequel des quatre est le meilleur, mais quel niveau de qualité votre cas d'usage exige réellement, car payer pour ultra sur un cas d'usage qui n'a besoin que de fast revient à brûler de l'argent sans rien améliorer que l'utilisateur remarquera.
Ce que vaut réellement un référencement sur une plateforme
Il vaut la peine d'être précis sur ce qui fait qu'un modèle débarquant sur Replicate est une nouvelle. Replicate loue de l'inférence hébergée. Un développeur s'inscrit une fois, obtient un jeton et appelle n'importe quel modèle du catalogue via la même interface. Pour Black Forest Labs et Google, être référencé signifie atteindre des développeurs qui n'ouvriront jamais un compte séparé pour un seul modèle, et payer une plateforme pour cette portée.
C'est le compromis dans lequel les créateurs de modèles ouverts ont été poussés. Publiez les poids et les technophiles pourront les exécuter, sans coût pour personne et sans revenu pour le laboratoire. Référencez-les sur une plateforme hébergée et l'audience s'élargit à ceux qui veulent un point de terminaison et une facture mensuelle, mais un intermédiaire prend sa part et le modèle se retrouve à côté d'une douzaine de concurrents dans un sélecteur.
L'alternative consiste à vendre l'accès directement, ce que fait un modèle fermé et ce que la plupart des laboratoires ne peuvent pas faire à grande échelle. La plateforme hébergée devient donc le terrain neutre où modèles ouverts et fermés se disputent le même développeur, jugés sur la même page. Un petit laboratoire avec de bons poids peut désormais apparaître à côté d'une sortie Google, ce qui est soit une concurrence saine, soit une course à la banalisation, selon le camp dans lequel on se trouve.
Pour un acheteur, cela a une conséquence pratique. Le modèle que vous choisissez aujourd'hui est accessible via une interface que vous connaissez déjà, ce qui réduit les coûts de changement et rend l'expérimentation peu coûteuse. Cela signifie aussi que le modèle que vous choisissez n'a probablement rien de spécial, puisque la même étagère est ouverte à tous.
Le reste de la journée
La même journée a produit un large éventail de sorties plus modestes. Cloudflare a mis Clef, un modèle image-texte-vers-texte, sur Hugging Face. ISTA-DASLab a publié une compilation GGUF de Qwen3.8 Flash, ce qui importe surtout à ceux qui exécutent des modèles en local. La passerelle IA de Vercel a ajouté un modèle de décision nommé Laya qui oriente les demandes d'assistance et les flux d'agents avec des scores de probabilité, gratuit jusqu'à la fin octobre, aux côtés des modèles audio de Microsoft et des outils de recherche de Browserbase. Google a ajouté une assistance visuelle en temps réel à Gemini Live, conçue avec des utilisateurs aveugles et malvoyants.
Aucune de ces annonces ne modifiera à elle seule un pipeline d'images. Ensemble, elles montrent où poussent les fournisseurs de plateformes. Replicate, Vercel et Hugging Face rivalisent pour être l'endroit où un développeur choisit un modèle, et leur façon de rivaliser consiste à élargir le catalogue et à simplifier la facturation. Les laboratoires de modèles y gagnent, car la distribution via une plateforme est le moyen pour un petit laboratoire d'atteindre des développeurs qui ne signeront jamais de contrat séparé.
C'est le dilemme auquel tout créateur de modèle ouvert fait face. Publier les poids et laisser la communauté les exécuter, ce qui ne coûte rien et touche les technophiles. Ou se faire référencer sur une plateforme hébergée et atteindre les développeurs qui veulent un point de terminaison et une facture, ce qui touche plus de monde et cède une part à la plateforme. Flux 3 est sur Replicate, ce qui suggère que Black Forest Labs veut la seconde audience assez fort pour partager.
Ce que cela signifie si vous devez choisir
L'effet pratique de tout cela, c'est que l'étagère est encombrée et que les étiquettes deviennent de plus en plus difficiles à lire. Quatre modèles Imagen, une sortie Flux et une longue traîne de compilations communautaires se disputent la même place dans un pipeline. Les différences qui comptent sont plus ténues que ne le suggère le marketing.
Trois choses méritent d'être vérifiées avant de vous engager. Le nombre d'images de référence que le modèle accepte, car cela détermine le plafond de contrôle. Si la licence autorise un usage commercial, car c'est là que se séparent Apache-2.0 et les compilations non commerciales. Et si le modèle est disponible à un endroit compatible avec votre mode de déploiement, puisqu'un excellent modèle derrière une plateforme que vous ne pouvez pas utiliser est un modèle que vous ne pouvez pas utiliser.
Rien de tout cela n'est glamour, et rien de tout cela ne figurera dans un article de lancement. C'est pourtant la partie qui décide si un modèle fonctionne dans un produit six mois après que l'annonce a défilé hors de l'écran.
Articles associés
Huawei Cloud a reconstruit sa stack autour des agents, puis a fixé une date aux factures
La capacité des modèles a convergé, et la valeur s'est déplacée vers ce qui les entoure.
Xiaomi publie un modèle omnimodal qui égale la frontière, recette d'entraînement comprise
Les poids permettent d'exécuter un modèle. Les environnements permettent de le réentraîner.
Cadence intègre des agents à la conception de puces et ramène un cycle de vérification de cinq semaines à un jour
Les agents appellent donc davantage les moteurs sous-jacents, et non moins.
Roblox Build a publié 9 000 jeux en six semaines. Le chiffre intéressant, c'est 71
Lisez ce chiffre comme un chiffre de recrutement, non comme un indicateur de qualité.