← Volver al blog
Aiaprox. 7 min de lectura

La carrera armamentística de los modelos de imagen: Midjourney, Nano Banana y el ascenso silencioso de los pesos abiertos

Publicado 1 oct 2026
La carrera armamentística de los modelos de imagen: Midjourney, Nano Banana y el ascenso silencioso de los pesos abiertos

Si te alejaste de la generación de imágenes con IA durante unos meses, el panorama al que vuelves es casi irreconocible. Los grandes nombres cambiaron de versión, una antigua favorita de los consumidores está siendo retirada y el campo de los pesos abiertos se volvió mucho más fuerte. Este es el estado de las cosas en el otoño de 2026.

Midjourney pasó a V8, y V8.2 se convirtió en la versión predeterminada en julio. Sigue siendo la herramienta a la que la gente recurre cuando el objetivo es la dirección de arte más que la capacidad bruta, el modelo que interpreta el estado de ánimo y la iluminación como lo haría un director humano. Salida nativa en 2K sin escalado, mejor lectura de prompts y un sistema de personalización que aprende tu gusto a partir de las imágenes que eliges. Las contrapartidas no han cambiado: sin plan gratuito, tres demandas activas por derechos de autor y un renderizado de texto que es mejor pero aún poco fiable para tipografía compleja.

Nano Banana de Google atravesó el arco más confuso. El original fue sustituido discretamente por Nano Banana 2, construido sobre Gemini 3.1 Flash, en febrero de 2026, y se convirtió en el predeterminado en la app de Gemini. El antiguo Gemini 2.5 Flash Image está siendo obsoleto y se apaga el 2 de octubre. El apodo de la comunidad oculta el hecho de que Nano Banana no es un producto independiente en absoluto. Es la generación de imágenes integrada en Gemini, lo cual es conveniente o frustrante según si quieres una interfaz de chat o una herramienta dedicada. Sus fortalezas son reales: edición multiturno que recuerda el contexto y una capacidad probada de mantener hasta cinco personas y catorce objetos consistentes a lo largo de las ediciones.

El truco con Nano Banana, como lo expresa una guía de la comunidad, es darle a cada imagen de referencia una sola función: una para la identidad, una para la pose, una para el estilo. Si metes todo en una única referencia, la salida se enturbia. Es una pequeña disciplina que importa más que la mayoría de los trucos de prompts, y es el mismo principio detrás de la edición con múltiples referencias en todo el campo.

La línea GPT Image de OpenAI está impulsando la edición con alcance de instrucciones con hasta dieciséis imágenes de referencia, y sus variantes más nuevas Sunburst y Flare se sitúan en lo más alto de la arena de edición de imágenes de LMArena, que ahora ha recogido más de 30 millones de votos en 57 modelos. Grok Imagine Image 2.0, de xAI, ha convertido las ediciones precisas y el renderizado nítido de texto en su propuesta, posicionándose como la opción lista para producción después de que el escándalo anterior de deepfakes forzara un replanteamiento de sus salvaguardas.

La historia que más importa para el largo plazo está ocurriendo en los pesos abiertos. FLUX.2 de Black Forest Labs ahora encabeza el campo de los modelos abiertos editables de alta resolución, con una variante klein 4B y una variante turbo para velocidad. Z-Image, Qwen-Image e Ideogram 4.0 completan las opciones con licencia Apache-2.0, y la calidad de renderizado de pesos abiertos de Ideogram ha llevado a los desarrolladores a llamarla de primer nivel. El licenciamiento se ha convertido en el verdadero diferenciador: FLUX.2 dev es no comercial, mientras que FLUX.2 klein, Z-Image y Qwen-Image permiten uso comercial bajo Apache 2.0. Elegir un modelo base ahora empieza por la licencia, no por el benchmark.

El punto de la licencia merece énfasis porque es donde la mayoría de la gente tropieza. Dos modelos pueden obtener la misma puntuación en un benchmark y estar a mundos de distancia en lo que se te permite hacer con la salida. Un modelo que puedes ajustar y desplegar para clientes vale más que un modelo ligeramente mejor que solo puedes usar para investigación. El campo abierto se ha dividido exactamente por esta línea, y el nivel comercialmente usable, Apache 2.0 o equivalente, es donde el ecosistema está construyendo realmente.

El cambio por debajo de todo esto es que la edición reemplazó a la generación como la frontera. Hace un año la carrera era quién podía renderizar la imagen más fotorrealista a partir de texto. Ahora todos pueden. La nueva carrera es quién puede dejarte cambiar una cosa sin regenerarlo todo, quién puede mantener un personaje a lo largo de cien imágenes, quién puede poner texto nítido y correcto en un póster. Los modelos que están ganando son los optimizados para la iteración, no para el efecto wow de la primera generación.

La historia del hardware corre en paralelo a todo esto. Los modelos abiertos se han vuelto lo bastante pequeños como para que un modelo de clase 7B se ejecute en una GPU de consumo, y la comunidad ha respondido con paquetes de integración de un clic que prometen generación local a personas que nunca quieren tocar una terminal. El benchmark de "se ejecuta en una tarjeta de 6GB" se ha convertido en una afirmación de marketing tanto como cualquier puntuación de una tabla de clasificación, porque es lo que determina si un modelo es una curiosidad o una herramienta.

También hay un cambio silencioso en cómo la gente piensa sobre la consistencia, que se ha convertido en el verdadero campo de batalla. Un modelo que renderiza una imagen hermosa es lo mínimo esperado. Un modelo que renderiza el mismo personaje a lo largo de cien imágenes, o el mismo producto desde una docena de ángulos, es el que se gana un lugar en un flujo de trabajo real. El enfoque basado en referencias, adjuntar de una a catorce imágenes de un personaje y dejar que el modelo lo reproduzca, es el inicio rápido. El entrenamiento de LoRA, un pequeño adaptador ajustado con tus propias imágenes seleccionadas, es el martillo más pesado para cuando las referencias se desvían. La disyuntiva es control frente a tiempo de configuración, y la respuesta honesta es que ningún método garantiza una cara estable, por lo que todo creador serio prueba contra una lista fija de tomas antes de comprometerse.

La categoría también ha desarrollado un vocabulario útil para el profano. Edición multiturno significa que el modelo recuerda lo que hizo e itera contigo. Edición con alcance de instrucciones significa que puedes decirle exactamente qué cambiar y deja el resto en paz. Composición con múltiples referencias significa alimentar varias imágenes y decirle a cada una su función. Ninguna de estas es exótica; ahora son las características estándar, y los modelos compiten por qué tan bien las ejecutan en lugar de por si existen o no.

Para cualquiera que elija una herramienta hoy, el consejo honesto no ha cambiado y probablemente no cambiará. Haz coincidir el modelo con la tarea. Midjourney para estética, Nano Banana para edición multiturno dentro del ecosistema de Google, GPT Image o Grok para ediciones de producción con alcance de instrucciones, pesos abiertos cuando necesitas control, residencia de datos o un personaje ajustado que puedas conservar para siempre. Los días en que un solo modelo era la respuesta correcta para todo terminaron en silencio, y nadie lo anunció realmente. Lo que lo reemplazó es un mercado donde la respuesta correcta depende enteramente de qué intentas crear, y a quienes mejor les va es a los que dejaron de perseguir un único ganador y aprendieron a comparar y elegir.

La única constante en todos estos cambios es que el diferenciador dejó de ser la calidad de imagen bruta y pasó a ser el flujo de trabajo a su alrededor. Consistencia, editabilidad, claridad de licencia e integración con las herramientas que ya usas. Eso es lo que realmente determina si un modelo aparece en tu trabajo diario o en una carpeta de demos impresionantes que nunca vuelves a visitar. La carrera armamentística es real, pero los ganadores no son los modelos con el mejor benchmark. Son los que encajan en cómo trabaja la gente realmente, y eso es algo más difícil de medir y un predictor mucho mejor de lo que perdura.

Artículos relacionados