← Retour au blog
AiEnviron 9 min de lecture

Nano Banana 2.1 de Google est une mise à jour de fonctionnalités, pas un modèle phare

Publié le 7 oct. 2026
Nano Banana 2.1 de Google est une mise à jour de fonctionnalités, pas un modèle phare

Google a publié Nano Banana 2.1 le 7 octobre, une mise à niveau de son modèle d’IA de génération et d’édition d’images. L’entreprise la présente comme une amélioration générale, avec trois domaines mis en avant : le design visuel, l’édition par masque et la cohérence du sujet.

Si on la replace dans la position qu’elle occupe sur le marché, la description plus juste est que Google fait descendre des comportements de niveau Pro dans un modèle moins cher.

Ce qui a réellement changé

Selon Google, Nano Banana 2.1 génère des éléments visuels mieux composés. C’est l’affirmation la plus vague des trois et la plus difficile à vérifier, car « une meilleure composition » n’est pas une mesure que quiconque publie.

L’édition par masque est plus concrète. Les utilisateurs peuvent sélectionner et modifier une région précise d’une image existante sans tout régénérer. C’est la fonctionnalité qui, depuis deux ans, sépare les modèles d’édition sérieux des démos de génération, et son intégration dans le modèle de milieu de gamme plutôt que dans le niveau Pro constitue la substance de cette version.

La cohérence du sujet est la troisième, et c’est celle qui compte pour quiconque produit en volume. Lors de l’édition d’une image ou de la génération par lot d’un ensemble d’images liées, le modèle préserve mieux l’apparence et les caractéristiques du sujet principal. Pour un utilisateur de Gemini qui génère un personnage cohérent sur dix images, c’est la différence entre une bibliothèque d’éléments utilisable et un tas de quasi-ratés.

Le modèle est déployé dans l’application Gemini, le mode IA de Google Search, Google AI Studio, Google Flow, Stitch, Google Ads et la plateforme Gemini pour les entreprises. Pour les développeurs, il est disponible sous l’ID de modèle gemini-nano-banana-2.1, accepte des entrées texte, image, audio et vidéo, et produit des sorties en 1K, 2K ou 4K.

Cette liste d’entrées mérite qu’on s’y arrête. Un modèle qui prend en entrée de l’audio et de la vidéo et renvoie des images appartient à une catégorie différente d’un générateur texte-image accompagné d’un paragraphe marketing. C’est un système multimodal dont la sortie se trouve être une image fixe.

Où se situe ce niveau

Plus tôt cette année, Google a publié Nano Banana 2, également connu sous le nom de Gemini 3.1 Flash Image. Il combinait la vitesse de la lignée Flash avec une qualité de sortie comparable à Nano Banana Pro, et Google y a fait descendre plusieurs fonctionnalités Pro : la connaissance du monde réel, un rendu de texte amélioré et une meilleure cohérence des personnages et des objets.

Nano Banana 2.1 poursuit cette migration. Le schéma est suffisamment constant pour constituer une stratégie : Google utilise le niveau Flash comme produit de volume, continue de faire descendre des capacités depuis Pro, et laisse le niveau Pro définir le plafond.

Le cadrage concurrentiel que les propres supports de Google soutiennent est que ChatGPT Images 2.5 d’OpenAI reste le principal modèle mondial de génération et d’édition d’images, en particulier pour le travail itératif. Son avantage est précis et technique : lorsqu’un utilisateur affine une image sur plusieurs tours, il préserve mieux les modifications précédentes, laisse intactes les régions non touchées et maintient la qualité d’image stable à mesure que les itérations s’accumulent.

C’est encore le problème de la dérive, et c’est le défi d’ingénierie central en édition d’images aujourd’hui. Tout le monde s’y attaque. Ideogram 4.5 a ajouté les modes Precise Edit et Generate + Edit. Black Forest Labs a livré des éditions préservant les régions avec des chiffres publiés sur l’identité des pixels. La réponse de Google avec 2.1 est la cohérence du sujet dans le milieu de gamme.

MAI-Image-2.6 de Microsoft, publié en août, se place juste derrière OpenAI dans la même conversation. La gamme s’est stabilisée en quelque chose de lisible : OpenAI mène sur l’édition itérative, Google mène sur la distribution et le prix, et le camp des modèles à poids ouverts mené par Qwen-Image 2.1 se tient à portée de tir sur la qualité, pour une fraction du coût.

Il vaut la peine d’être précis sur ce qu’est réellement la « dérive », car le terme couvre plusieurs échecs distincts. Il y a la dérive de pixels, où les régions non touchées se décalent légèrement entre les itérations. Il y a la dérive d’identité, où un visage ou un produit change au fil d’une chaîne de modifications. Il y a la dérive de style, où l’esthétique de rendu migre vers un aspect générique à mesure que le modèle régénère une plus grande partie de l’image à chaque tour. Et il y a la dérive de qualité, où l’image accumule du bruit et du flou comme une photocopie de photocopie.

Chacune a une solution différente. La préservation des pixels est un problème de masquage. La préservation de l’identité est un problème de conditionnement. La préservation du style et de la qualité dépend largement de la quantité d’original que le modèle est autorisé à écarter. Un modèle excellent sur trois des quatre échouera encore sur une chaîne d’édition de cinq tours, c’est pourquoi les affirmations des fournisseurs sur la cohérence doivent préciser de quel type il s’agit.

Nano Banana 2.1 de Google traite explicitement la cohérence d’identité et l’édition par masque, et ne dit rien de précis sur le style ou la qualité sur de longues chaînes. Ce silence est révélateur.

Pourquoi la version de milieu de gamme est celle qui compte

Une sortie de modèle phare vous dit ce qu’un laboratoire peut accomplir. Une sortie de milieu de gamme vous dit ce qu’il pense que la plupart de ses utilisateurs ont réellement besoin.

Le fait que Google intègre l’édition par masque et la cohérence du sujet dans le modèle qui tourne sur Search, Ads et l’application Gemini grand public est une déclaration que ce sont des attentes de base, pas des fonctionnalités premium. Le mode IA de Search, à lui seul, place la génération d’images devant une audience mesurée en milliards de sessions. Ads la place devant des annonceurs qui produiront des créations en volume et sauront immédiatement si cela fonctionne.

Cet avantage de distribution n’est pas une capacité du modèle, et il vaut probablement plus qu’une capacité. Un modèle qui est 5 % moins bon que le leader mais disponible dans la barre de recherche là où l’utilisateur se trouve déjà générera bien plus d’images. L’avance d’OpenAI sur la qualité d’édition itérative est réelle, et c’est aussi une avance qui ne compte que pour les utilisateurs ayant déjà décidé d’utiliser un outil d’image.

Pour les développeurs, la lecture pratique concerne les choix par défaut. Si un produit a besoin d’édition d’images et utilise déjà Gemini, la mise à niveau vers 2.1 est presque gratuite et supprime une raison d’intégrer un second fournisseur. Si un produit a besoin de l’édition itérative la plus solide disponible, la question de l’évaluation vient de devenir plus difficile, car l’écart entre le niveau Flash et le leader s’est réduit dans la dimension précise qui compte le plus pour le travail multi-tours.

Ce qu’il faut tester soi-même

Trois choses méritent d’être vérifiées plutôt que supposées.

Premièrement, la précision du masque sur les bords. Les affirmations générales sur l’édition régionale ont tendance à tenir au milieu d’une grande région et à se dégrader à la frontière, là où le modèle décide à quel côté d’un bord chaque pixel appartient. Testez sur des structures fines : cheveux, verre, feuillage, fines lanières.

Deuxièmement, la cohérence sur plus de deux tours. Les affirmations de cohérence du sujet sont généralement validées sur une courte chaîne d’édition. Le problème de dérive s’accumule, donc le test utile consiste en cinq ou six modifications successives, en vérifiant si le sujet survit.

Troisièmement, si la sortie 4K est native ou suréchantillonnée. Google liste 1K, 2K et 4K comme options de sortie sans préciser la résolution de génération, et la différence se voit dans la texture fine plutôt que dans la netteté globale.

La conclusion stratégique est moins nuancée. Google ne court pas après le classement des modèles d’image avec cette version. L’objectif est de rendre le milieu de gamme suffisamment bon pour que le classement cesse d’être la raison pour laquelle quiconque choisit un autre outil. Que cela fonctionne dépend de la part du travail du marché qui relève de l’édition de précision itérative par rapport à tout le reste, et la réponse honnête est que la plupart de la génération d’images en 2026 relève encore de la seconde catégorie.

Articles associés