← Retour au blog
AiEnviron 9 min de lecture

Google réduit de moitié le prix de sortie de Nano Banana 2.1 et corrige ses fonctionnalités les plus faibles

Publié le 6 oct. 2026
Google réduit de moitié le prix de sortie de Nano Banana 2.1 et corrige ses fonctionnalités les plus faibles

--- titre : Google réduit de moitié le prix de sortie de Nano Banana 2.1 et corrige ses fonctionnalités les plus faibles meta_title : Nano Banana 2.1 divise le prix par deux et reconstruit l’édition meta_description : Nano Banana 2.1 de Google cible le design visuel, l’édition par masque et la cohérence des sujets, avec un prix de sortie réduit de moitié environ en résolutions 1K et 4K. ---

Google a publié Nano Banana 2.1 le 6 octobre, et le détail le plus déterminant se situe en dehors de la liste des fonctionnalités : le prix.

Le coût de sortie est passé de 0,067 $ à 0,0336 $ par image 1K, et de 0,151 $ à 0,0756 $ par image 4K, selon la tarification standard de l’API Gemini. Les deux baisses approchent la moitié, ce qui change l’économie de tout flux de travail qui génère des images en volume, et le nouveau modèle repose sur l’architecture Gemini 3.6 Flash.

À première vue, l’entreprise a amélioré trois choses : le design visuel, l’édition par masque et la cohérence des sujets.

Design visuel et rendu du texte

Les démonstrations de Google ciblent la partie de la génération d’images qui a toujours été la plus faible : bien rendre le texte et la mise en page. Les exemples montrent une typographie brutaliste suisse avec des lettres qui se chevauchent et des chaînes de coordonnées, une affiche de road-trip des années 1970 où une silhouette masque un mot derrière elle, une page d’accueil de studio de design et une affiche produit inspirée d’une photo de produit existante.

L’affirmation va au-delà d’un rendu propre de ces éléments : le modèle respecte des instructions précises de texte et de mise en page plutôt que de produire des approximations plausibles. Le respect des invites en typographie a toujours été un point faible, et c’est dans le travail de design que l’échec est le plus visible, car un caractère mal placé ruine la création.

Le modèle prend également en charge des ratios d’image inhabituels, notamment 1:4, 4:1, 1:8 et 8:1, et Google affirme que les artefacts d’assemblage dans les sorties 2K et 4K ont été corrigés.

L’édition par masque et pourquoi elle compte plus qu’il n’y paraît

L’édition par masque consiste à marquer une région dans une image et à laisser le modèle ne modifier que cette région. La démonstration de Google utilise une tête de pissenlit avec des gouttes d’eau, avec une ligne dessinée à la main autour de la graine, et une invite demandant d’extraire l’objet entouré dans un environnement entièrement différent.

C’est la fonctionnalité qui compte le plus pour le travail de production, même si elle attire moins l’attention que la qualité d’image. La différence entre un modèle qui régénère une image entière quand vous voulez modifier un seul élément et un modèle qui ne change que la zone marquée est la différence entre un outil que vous utilisez pour les brouillons et un outil que vous utilisez pour les révisions. C’est dans l’itération que passe la majeure partie du temps créatif réel.

La barre technique est ici plus élevée qu’il n’y paraît. Laisser le reste de l’image intact signifie que le modèle doit préserver un voisinage de pixels spécifique tout en générant du nouveau contenu qui se fond de manière convaincante à la frontière. Black Forest Labs a publié ce mois-ci une capacité comparable avec FLUX 3 Image, où les modifications partielles laissent entre 67,8 % et 89,7 % des pixels identiques au bit près. Cette fourchette est la façon honnête de le rapporter, car la fraction dépend de la taille de la région modifiée.

Cohérence des sujets

Google affirme que le modèle maintient la cohérence des personnages sur jusqu’à 14 images de référence, couvrant jusqu’à quatre personnages. Ce chiffre est élevé pour un modèle d’image généraliste et indique des usages où la même personne ou le même produit doit apparaître dans un ensemble d’images : cases de bande dessinée, variantes de campagne, catalogues de produits.

La cohérence entre les références est un problème difficile, car le modèle doit dissocier l’identité du style, de la pose et de l’éclairage. Y parvenir avec 14 références suggère que ce chiffre correspond à une capacité réelle plutôt qu’à un maximum marketing, bien que l’entreprise n’ait pas publié de vérification indépendante de la limite supérieure.

Une seule goutte d’eau sur une feuille vert foncé, à moitié couverte par une tache givrée mate

La valeur pratique dépend de l’endroit où se situe réellement le plafond. Quatre personnages maintenus de manière cohérente suffisent pour un catalogue de produits avec plusieurs mannequins, ou une campagne avec une petite distribution récurrente. Ce n’est pas assez pour une bande dessinée avec un grand ensemble, qui nécessiterait soit plusieurs appels, soit un fine-tuning. Des tests indépendants seraient ce qui permettrait de trancher.

Il y a une capacité connexe à signaler dans la même fenêtre de sortie. Qwen-Image-2.1-Pro d’Alibaba, disponible sur Alibaba Cloud depuis le 2 octobre, met l’accent sur la génération de calques RGBA transparents et l’extraction de sujets à partir de photos, en utilisant un composant de génération visuelle 7B avec une architecture DiT à flux unique de 32 couches. Les deux modèles convergent vers le même problème par des directions différentes, ce qui est un signe raisonnable que la cohérence et la localité des modifications sont désormais ce que les acheteurs demandent.

L’écart de benchmark est la réserve honnête

La couverture par des tiers de la sortie contient une note importante que la présentation de Google omet. Les rapports décrivent le modèle comme surpassant le précédent modèle Pro sur certains benchmarks de génération d’images, tout en notant que le prédécesseur obtenait de bons scores aux tests et que le modèle Pro produisait, selon les rapports, de meilleures images en usage réel.

Cet écart entre les performances aux benchmarks et les résultats pratiques est un trait récurrent de l’évaluation des modèles d’image. Un modèle peut obtenir de bons scores à des tests structurés et néanmoins décevoir sur les tâches que les utilisateurs tentent réellement. Le prix plus bas aggrave le problème : un modèle moins cher qui sous-performe en pratique ne correspond pas à la proposition de valeur que le prix laisse entendre.

La réponse viendra de tests indépendants. Si les utilisateurs qui comparent Nano Banana 2.1 au modèle Pro préfèrent systématiquement le plus récent, les benchmarks gagnent en crédibilité. Si le modèle Pro continue de gagner sur les résultats réels, les scores deviennent un signal plus faible.

Il y a aussi un détail pratique à signaler. La couverture du lancement signale une divergence entre la documentation officielle de Google, qui indique une disponibilité générale, et certains agrégateurs tiers qui listent le modèle comme bientôt disponible sur certaines plateformes. Des premiers rapports suggèrent également que les requêtes peuvent encore être acheminées vers des versions précédentes du modèle dans certains cas, malgré les mises à jour de l’interface. Toute personne intégrant le modèle devrait vérifier quelle version répond réellement.

Retrait du modèle et taxe de maintenance

Un détail qui compte pour quiconque utilise le modèle actuel en production : la version API de Nano Banana 2 sera retirée le 29 octobre.

C’est une fenêtre courte. Les équipes qui utilisent Nano Banana 2 dans un pipeline ont environ trois semaines pour tester la 2.1, comparer la qualité des sorties sur leur propre corpus et migrer. Étant donné que le nouveau modèle est moins cher, la migration vaut probablement le coup, mais le calendrier est plus serré que ce que la plupart des équipes choisiraient.

Ce rythme de retrait devient routinier et constitue en soi une raison pour laquelle certaines équipes préfèrent les modèles d’image à poids ouverts. Quand les poids vous appartiennent, le modèle ne disparaît pas selon le calendrier d’un fournisseur. Le compromis est que vous assumez le déploiement, les mises à jour et les régressions de qualité, ce qui représente un coût réel que les modèles hébergés par un fournisseur absorbent pour vous.

Ce qu’il faut surveiller

Si l’écart entre les benchmarks et la pratique se réduit lors de tests indépendants. C’est la question centrale, et la réponse viendra des utilisateurs qui réalisent des comparaisons sur leur propre travail plutôt que des documents de presse.

Si la cohérence sur 14 références tient en pratique. Si c’est le cas, le modèle ouvre des cas d’usage qui nécessitaient auparavant un fine-tuning : des personnages cohérents sur une série, des ensembles de produits, des variantes de campagne. Si elle tient pour quatre personnages mais pas pour quatorze, le plafond pratique est inférieur à ce que suggère la spécification.

Si la réduction de prix est durable ou promotionnelle. Une baisse d’environ moitié est agressive, et si les concurrents s’alignent, la génération d’images à grande échelle devient sensiblement moins chère pour tous. S’il s’agit d’une fenêtre promotionnelle, les équipes qui construisent leurs projections de coûts autour d’elle devront les revoir.

Nano Banana 2.1 est une itération solide qui s’attaque aux bonnes faiblesses et se positionne au prix qui encourage l’usage plutôt que l’essai. La réduction de prix est la vraie histoire, et c’est probablement la partie à laquelle les autres fournisseurs réagiront.

Articles associés