← Retour au blog
AiEnviron 8 min de lecture

La course aux armements des modèles d'image : Midjourney, Nano Banana et la montée discrète des poids ouverts

Publié le 1 oct. 2026
La course aux armements des modèles d'image : Midjourney, Nano Banana et la montée discrète des poids ouverts

Si vous vous êtes éloigné de la génération d'images par IA pendant quelques mois, le paysage dans lequel vous revenez est presque méconnaissable. Les grands noms ont changé de version, un ancien chouchou du grand public est en train d'être retiré, et le domaine des poids ouverts s'est beaucoup renforcé. Voici où en sont les choses à l'automne 2026.

Midjourney est passé à la V8, et la V8.2 est devenue la version par défaut en juillet. C'est toujours l'outil vers lequel les gens se tournent lorsque l'objectif est la direction artistique plutôt que la capacité brute, le modèle qui interprète l'ambiance et l'éclairage comme le ferait un directeur humain. Sortie native en 2K sans upscaling, meilleure lecture des prompts, et un système de personnalisation qui apprend vos goûts à partir des images que vous choisissez. Les compromis n'ont pas changé : pas d'offre gratuite, trois procès actifs pour violation de droits d'auteur, et un rendu de texte meilleur mais toujours peu fiable pour la typographie complexe.

Le Nano Banana de Google a connu la trajectoire la plus déroutante. L'original a été discrètement remplacé par Nano Banana 2, construit sur Gemini 3.1 Flash, en février 2026, et il est devenu la version par défaut dans l'application Gemini. L'ancien Gemini 2.5 Flash Image est en cours de dépréciation et s'arrêtera le 2 octobre. Le surnom donné par la communauté masque le fait que Nano Banana n'est pas du tout un produit autonome. C'est la génération d'images intégrée à Gemini, ce qui est soit pratique, soit frustrant selon que vous voulez une interface de chat ou un outil dédié. Ses atouts sont réels : une édition multi-tours qui se souvient du contexte, et une capacité éprouvée à maintenir jusqu'à cinq personnes et quatorze objets cohérents à travers les éditions.

L'astuce avec Nano Banana, comme le formule un guide communautaire, est de donner à chaque image de référence une seule fonction : une pour l'identité, une pour la pose, une pour le style. Entassez tout dans une seule référence et le résultat devient confus. C'est une petite discipline qui compte plus que la plupart des astuces de prompt, et c'est le même principe derrière l'édition multi-références dans tout le domaine.

La gamme GPT Image d'OpenAI pousse l'édition ciblée par instruction avec jusqu'à seize images de référence, et ses nouvelles variantes Sunburst et Flare occupent le sommet de l'arène d'édition d'images de LMArena, qui a désormais recueilli plus de 30 millions de votes sur 57 modèles. Grok Imagine Image 2.0, de xAI, a fait des éditions précises et d'un rendu de texte net son argument de vente, se positionnant comme l'option prête pour la production après que le scandale de deepfakes antérieur a forcé une refonte de ses garde-fous.

L'histoire qui compte le plus pour le long terme se joue dans les poids ouverts. FLUX.2 de Black Forest Labs domine désormais le domaine des modèles ouverts modifiables et haute résolution, avec une variante klein 4B et une variante turbo pour la vitesse. Z-Image, Qwen-Image et Ideogram 4.0 complètent les options sous licence Apache 2.0, et la qualité de rendu des poids ouverts d'Ideogram pousse les développeurs à la qualifier de haut de gamme. Les licences sont devenues le véritable facteur différenciant : FLUX.2 dev est non commercial, tandis que FLUX.2 klein, Z-Image et Qwen-Image autorisent l'usage commercial sous Apache 2.0. Choisir un modèle de base commence désormais par la licence, pas par le benchmark.

Le point sur les licences mérite d'être souligné, car c'est là que la plupart des gens se font piéger. Deux modèles peuvent obtenir le même score sur un benchmark et être à des années-lumière en ce qui concerne ce que vous êtes autorisé à faire avec le résultat. Un modèle que vous pouvez fine-tuner et déployer pour des clients vaut plus qu'un modèle légèrement meilleur que vous ne pouvez utiliser que pour la recherche. Le domaine ouvert s'est scindé exactement sur cette ligne, et le niveau commercialement utilisable, Apache 2.0 ou équivalent, est celui où l'écosystème se construit réellement.

Le changement sous-jacent à tout cela est que l'édition a remplacé la génération comme frontière. Il y a un an, la course consistait à savoir qui pouvait produire l'image la plus photoréaliste à partir de texte. Aujourd'hui, tout le monde peut le faire. La nouvelle course consiste à savoir qui peut vous permettre de modifier une chose sans tout régénérer, qui peut maintenir un personnage sur cent images, qui peut mettre un texte net et correct sur une affiche. Les modèles qui gagnent sont ceux optimisés pour l'itération, pas pour l'effet wow de la première génération.

L'histoire du matériel est parallèle à tout cela. Les modèles ouverts sont devenus assez petits pour qu'un modèle de classe 7B tourne sur un GPU grand public, et la communauté a répondu avec des packs d'intégration en un clic qui promettent une génération locale à des personnes qui ne veulent jamais toucher à un terminal. Le benchmark « tourne sur une carte 6 Go » est devenu un argument marketing au même titre que n'importe quel score de classement, car c'est ce qui détermine si un modèle est une curiosité ou un outil.

Il y a aussi un changement discret dans la façon dont les gens pensent la cohérence, devenue le véritable champ de bataille. Un modèle qui produit une belle image est le minimum requis. Un modèle qui produit le même personnage sur cent images, ou le même produit sous une douzaine d'angles, est celui qui mérite une place dans un vrai workflow. L'approche par référence, joindre de une à quatorze images d'un personnage et laisser le modèle le reproduire, est le départ rapide. L'entraînement LoRA, un petit adaptateur fine-tuné sur vos propres images sélectionnées, est le marteau plus lourd lorsque les références dérivent. Le compromis est entre contrôle et temps de configuration, et la réponse honnête est qu'aucune méthode ne garantit un visage stable, ce qui explique pourquoi tout créateur sérieux teste sur une liste de plans fixe avant de s'engager.

La catégorie a aussi développé un vocabulaire utile pour le profane. L'édition multi-tours signifie que le modèle se souvient de ce qu'il a fait et itère avec vous. L'édition ciblée par instruction signifie que vous pouvez lui dire exactement quoi changer et qu'il laisse le reste intact. La composition multi-références signifie fournir plusieurs images et indiquer à chacune sa fonction. Rien de tout cela n'est exotique ; ce sont désormais des fonctionnalités standard, et les modèles se concurrencent sur la qualité de leur exécution plutôt que sur leur existence même.

Pour quiconque choisit un outil aujourd'hui, le conseil honnête n'a pas changé et ne changera probablement pas. Faites correspondre le modèle à la tâche. Midjourney pour l'esthétique, Nano Banana pour l'édition multi-tours au sein de l'écosystème Google, GPT Image ou Grok pour les éditions de production ciblées par instruction, les poids ouverts lorsque vous avez besoin de contrôle, de résidence des données ou d'un personnage fine-tuné que vous pouvez conserver pour toujours. L'époque où un seul modèle était la bonne réponse à tout s'est terminée discrètement, et personne ne l'a vraiment annoncé. Ce qui l'a remplacée est un marché où la bonne réponse dépend entièrement de ce que vous essayez de créer, et les personnes qui s'en sortent le mieux sont celles qui ont cessé de courir après un seul gagnant et ont appris à faire leur marché.

La seule constante à travers tous ces changements est que le facteur différenciant a cessé d'être la qualité brute de l'image pour devenir le workflow qui l'entoure. Cohérence, facilité d'édition, clarté des licences et intégration avec les outils que vous utilisez déjà. C'est ce qui détermine réellement si un modèle apparaît dans votre travail quotidien ou dans un dossier de démos impressionnantes que vous ne rouvrez jamais. La course aux armements est réelle, mais les gagnants ne sont pas les modèles au meilleur benchmark. Ce sont ceux qui s'intègrent à la façon dont les gens travaillent réellement, et c'est une chose plus difficile à mesurer et un bien meilleur prédicteur de ce qui perdure.

Articles associés