Google redujo a la mitad el precio de salida de Nano Banana 2.1 y corrigió sus funciones más débiles

--- title: Google redujo a la mitad el precio de salida de Nano Banana 2.1 y corrigió sus funciones más débiles meta_title: Nano Banana 2.1 reduce el precio a la mitad y reconstruye la edición meta_description: Nano Banana 2.1 de Google se centra en diseño visual, edición con máscaras y consistencia del sujeto, con precios de salida reducidos aproximadamente a la mitad en resoluciones 1K y 4K. ---
Google lanzó Nano Banana 2.1 el 6 de octubre, y el detalle más trascendental está fuera de la lista de funciones: el precio.
El costo de salida bajó de $0.067 a $0.0336 por imagen 1K, y de $0.151 a $0.0756 por imagen 4K, con el precio estándar de la API de Gemini. Ambos recortes se acercan a la mitad, lo que cambia la economía de cualquier flujo de trabajo que genere imágenes en volumen, y el nuevo modelo se basa en la arquitectura Gemini 3.6 Flash.
A primera vista, la compañía mejoró tres cosas: diseño visual, edición con máscaras y consistencia del sujeto.
Diseño visual y renderizado de texto
Las demostraciones de Google apuntan a la parte de la generación de imágenes que ha sido más débil: acertar con el texto y la maquetación. Los ejemplos muestran tipografía brutalista suiza con formas de letras superpuestas y cadenas de coordenadas, un póster de viaje por carretera de los años 70 donde una figura oculta una palabra detrás de ella, la página de inicio de un estudio de diseño y un póster de producto modelado a partir de una foto de producto existente.
La afirmación va más allá de renderizarlos limpiamente: el modelo respeta instrucciones específicas de texto y maquetación en lugar de producir aproximaciones que parecen plausibles. El cumplimiento de las indicaciones en tipografía ha sido una brecha persistente, y el trabajo de diseño es donde el fallo es más visible, porque un carácter mal colocado arruina la pieza.
El modelo también admite relaciones de aspecto inusuales, incluidas 1:4, 4:1, 1:8 y 8:1, y Google dice que los artefactos de unión en la salida 2K y 4K se han corregido.
Edición con máscaras y por qué importa más de lo que parece
La edición con máscaras significa marcar una región en una imagen y permitir que el modelo cambie solo esa región. La demostración de Google usa una cabeza de semillas de diente de león con gotas de agua, con una línea dibujada a mano alrededor de la semilla, y una indicación que pide extraer el objeto rodeado por el círculo a un entorno completamente diferente.
Esta es la función que más importa para el trabajo de producción, aunque recibe menos atención que la calidad de imagen. La diferencia entre un modelo que regenera una imagen completa cuando quieres cambiar un elemento y un modelo que cambia solo el área marcada es la diferencia entre una herramienta que usas para borradores y una que usas para revisiones. La iteración es donde se va la mayor parte del tiempo creativo real.
El listón técnico aquí es más alto de lo que parece. Dejar el resto de la imagen intacto significa que el modelo tiene que preservar un vecindario de píxeles específico mientras genera contenido nuevo que se mezcle de forma convincente en el límite. Black Forest Labs publicó este mes una capacidad comparable con FLUX 3 Image, donde las ediciones parciales dejan entre el 67.8% y el 89.7% de los píxeles idénticos bit a bit. Ese rango es la forma honesta de reportarlo, porque la fracción depende de cuán grande sea la región editada.
Consistencia del sujeto
Google dice que el modelo mantiene la consistencia de los personajes a lo largo de hasta 14 imágenes de referencia, cubriendo hasta cuatro personajes. Esa cifra es alta para un modelo de imágenes general y apunta a usos donde la misma persona o producto tiene que aparecer en un conjunto de imágenes: viñetas de cómic, variaciones de campaña, catálogos de productos.
La consistencia entre referencias es un problema difícil porque el modelo tiene que mantener la identidad separada del estilo, la pose y la iluminación. Acertar con 14 referencias sugiere que la cifra es una capacidad real y no un máximo de marketing, aunque la compañía no ha publicado una verificación independiente del límite superior.

El valor práctico depende de dónde esté realmente el techo. Cuatro personajes mantenidos de forma consistente son suficientes para un catálogo de productos con varios modelos, o una campaña con un elenco recurrente pequeño. No es suficiente para un cómic con un elenco grande, que necesitaría múltiples llamadas o ajuste fino. Las pruebas independientes serían lo que lo resuelva.
Hay una capacidad relacionada que vale la pena señalar de la misma ventana de lanzamiento. Qwen-Image-2.1-Pro de Alibaba, disponible en Alibaba Cloud desde el 2 de octubre, enfatiza la generación de capas RGBA transparentes y la extracción de sujetos a partir de fotos, usando un componente de generación visual de 7B con un diseño DiT de flujo único de 32 capas. Los dos modelos convergen en el mismo problema desde direcciones diferentes, lo cual es una señal razonable de que la consistencia y la localidad de edición son ahora lo que los compradores preguntan.
La brecha de los benchmarks es la advertencia honesta
La cobertura de terceros sobre el lanzamiento contiene una nota importante que el propio planteamiento de Google omite. Los informes describen al modelo como superior al modelo Pro anterior en algunos benchmarks de generación de imágenes, aunque también señalan que el predecesor obtuvo buenos resultados en las pruebas y que, según se informa, el modelo Pro producía mejores imágenes en uso real.
Esa brecha entre el rendimiento en benchmarks y la salida práctica es una característica recurrente de la evaluación de modelos de imágenes. Un modelo puede obtener buenos resultados en pruebas estructuradas y aun así decepcionar en tareas que los usuarios realmente intentan. El precio más bajo agrava el problema: un modelo más barato que rinde por debajo de lo esperado en la práctica no es la propuesta de valor que implica el precio.
La resolución vendrá de pruebas independientes. Si los usuarios que comparan Nano Banana 2.1 con el modelo Pro favorecen consistentemente al más nuevo, los benchmarks ganan credibilidad. Si el modelo Pro sigue ganando en salidas reales, las puntuaciones se convierten en una señal más débil.
También hay un detalle práctico que vale la pena señalar. La cobertura del lanzamiento señala una discrepancia entre la documentación oficial de Google, que indica disponibilidad general, y algunos agregadores de terceros que listan el modelo como disponible próximamente en ciertas plataformas. Los primeros informes también sugieren que las solicitudes aún pueden dirigirse a versiones anteriores del modelo en algunos casos, a pesar de las actualizaciones de la interfaz. Cualquiera que integre el modelo debería verificar qué versión está respondiendo realmente.
Retiro del modelo y el impuesto de mantenimiento
Un detalle que importa para cualquiera que tenga el modelo actual en producción: la versión de API de Nano Banana 2 se retirará el 29 de octubre.
Esa es una ventana corta. Los equipos con Nano Banana 2 en un pipeline tienen aproximadamente tres semanas para probar 2.1, comparar la calidad de salida en su propio corpus y migrar. Dado que el modelo más nuevo es más barato, probablemente valga la pena migrar, pero el calendario es más ajustado de lo que la mayoría de los equipos elegiría.
Esta cadencia de retiro se está volviendo rutinaria y es en sí misma una razón por la que algunos equipos se inclinan por modelos de imágenes de pesos abiertos. Cuando los pesos son tuyos, el modelo no desaparece según el calendario de un proveedor. La contrapartida es que tú eres responsable del despliegue, las actualizaciones y las regresiones de calidad, lo cual es un costo real que los modelos alojados por el proveedor absorben por ti.
Qué observar
Si la brecha entre benchmarks y práctica se reduce bajo pruebas independientes. Esta es la pregunta central, y la respuesta vendrá de usuarios que hagan comparaciones con su propio trabajo, no de materiales de prensa.
Si la consistencia con 14 referencias se mantiene en la práctica. Si es así, el modelo abre casos de uso que antes requerían ajuste fino: personajes consistentes a lo largo de una serie, conjuntos de productos, variantes de campaña. Si se mantiene para cuatro personajes pero no para catorce, el techo práctico es más bajo de lo que sugiere la especificación.
Si el recorte de precio es duradero o introductorio. Un descuento de aproximadamente la mitad es agresivo, y si los competidores lo igualan, la generación de imágenes a escala se vuelve sustancialmente más barata en general. Si es una ventana promocional, los equipos que construyan proyecciones de costos en torno a él tendrán que revisarlas.
Nano Banana 2.1 es una iteración sólida que aborda las debilidades correctas y se pone un precio para ser usado en lugar de probado. El recorte de precio es la verdadera historia, y es probable que sea la parte a la que respondan otros proveedores.
Artículos relacionados
Google Flow y Adobe Firefly sacan el video con IA de la ventana de chat
La calidad del modelo base ha convergido lo suficiente como para que el diferenciador se haya trasladado a lo que rodea al modelo.
Vida quiere facturar por agentes de IA según resultados en lugar de por uso
La facturación basada en uso alinea los ingresos del proveedor con que el agente tarde más. El precio por resultados invierte eso.
Voice 3 y PACT de Decagon preparan el soporte al cliente para agentes al otro lado
Los sistemas de soporte pasaron décadas modelando el comportamiento humano. Ahora una fracción de las solicitudes entrantes son máquinas que actúan por personas.
Creatify post-entrena MiniMax H3 para anuncios y reduce el costo a cuatro centavos por segundo
Un anunciante no necesita un modelo que renderice un documental. Necesita uno en el que el producto se vea bien y la persona no se transforme a mitad de frase.