← Volver al blog
News6 min

Repaso a los modelos chinos open source de generación de imágenes en septiembre: SenseTime, Ant y Shusheng | ChatPicture

Publicado 26 sept 2026
Repaso a los modelos chinos open source de generación de imágenes en septiembre: SenseTime, Ant y Shusheng | ChatPicture

En el pasado mes de septiembre, hubo un cambio en la generación de imágenes con IA en China no muy llamativo pero bastante clave: el open source. En apenas una semana, SenseTime, Ant y el equipo Shusheng del Laboratorio de Inteligencia Artificial de Shanghái lanzaron sucesivamente modelos open source de generación de imágenes, poniendo sobre la mesa capacidades que antes solo estaban en manos de grandes empresas de código cerrado. El impacto de esto puede ser mucho mayor que el lanzamiento de un nuevo modelo concreto.

Qué plantea cada uno de los tres

SenseTime SenseNova U1.5 Lite, liberado el 8 de septiembre, es un modelo de generación de imágenes de 8B. Su principal atractivo es la salida directa a 4K y, según la propia compañía, está «a la altura de los grandes modelos cerrados». El tamaño de 8B es clave: significa que puede funcionar con las GPU que ya tienen los desarrolladores comunes, sin necesidad de ir de entrada a por 12 GB o 24 GB de VRAM.

El modelo unificado de imágenes 6B de Ant, liberado el 6 de septiembre, apuesta por un camino más «cómodo»: la generación texto-imagen y la edición por instrucciones están integradas en un solo modelo. Es decir, puedes pedirle que dibuje una imagen desde cero o darle una imagen para que «cambie el fondo» o «suba el brillo» sin cambiar de modelo. Más inusual aún es que Ant también publicó toda la receta de entrenamiento. Hay muchos modelos open source, pero no tantos que revelen los detalles de entrenamiento.

InternLumina-U2, presentado el 3 de septiembre, es un gran modelo visual centrado en unificar la comprensión y la generación de imágenes, y sus pesos se abrirán. Su posicionamiento se orienta más a «un modelo que entiende imágenes y también las dibuja», lo cual resulta más ventajoso que un modelo puramente generativo en escenarios donde primero hay que entender una imagen de referencia y luego modificarla en consecuencia.

Diagrama del ecosistema de modelos open source chinos de generación de imágenes con IA

Por qué merece la pena hablar específicamente del open source

Mucha gente puede pensar que los modelos open source están lejos del usuario común: al fin y al cabo, uno no entrena modelos. Pero la verdadera cadena de impacto es esta: los modelos open source se convierten en la base de todo tipo de herramientas gratuitas.

Un desarrollador independiente, o un equipo pequeño, sin dinero para pagar las API de las grandes tecnológicas pero que quiere añadir generación de imágenes a su producto, ¿qué hace? La respuesta es ir a Hugging Face, descargar un modelo open source y ejecutarlo en local o en una GPU barata alquilada. Tamaños como el 8B de SenseTime o el 6B de Ant caen justo en esa franja que «cabe en una máquina de consumo». Cuantos más modelos open source haya, más pequeños y más potentes, más soluciones gratuitas de generación de imágenes podrán montar las personas comunes.

Visto en sentido contrario, esto también es una respuesta de los modelos chinos a rutas open source veteranas como Stable Diffusion y Flux. Antes, cuando se hablaba de generación de imágenes open source, la opción por defecto era el ecosistema de Stable Diffusion. Ahora los actores chinos empiezan a meterse en ese espacio, y además traen ventajas locales como la comprensión del chino y el renderizado de tipografía china, lo que supone una mejora real para los usuarios chinos.

Después del open source, ¿qué es lo que está en juego?

El open source no es el final, sino el punto de partida. Que un modelo se libere no garantiza que vaya a usarse; depende de tres cosas.

La primera es el ecosistema. No basta con liberar los pesos: hacen falta herramientas de inferencia, scripts de entrenamiento LoRA y soporte para WebUI. Si Stable Diffusion sigue siendo hoy la opción por defecto para mucha gente, no es por una versión concreta, sino por toda la cadena de herramientas que hay detrás.

La segunda es la capacidad en chino. La mayor diferenciación de los modelos chinos está en la comprensión de prompts en chino y en el renderizado de texto chino. Es un punto que los modelos open source extranjeros llevan mucho tiempo sin resolver bien, y es justo donde los modelos open source chinos deberían insistir.

La tercera es la vía de comercialización. Cómo ganar dinero con modelos open source siempre ha sido una pregunta difícil. Lo más probable es que SenseTime, Ant, Shusheng y los demás no liberen modelos por filantropía, sino para hacer crecer un ecosistema mediante el open source y luego monetizarlo con servicios empresariales, API en la nube y personalización. Para los usuarios, esto significa que habrá cada vez más cosas gratuitas, pero habrá que ver con el tiempo si «gratis» y «mantenimiento continuo» pueden ir de la mano.

Hay otro contexto que conviene añadir: esta ola de open source llega justo en un momento en que el ecosistema open source extranjero está algo estancado. Stable Diffusion lleva mucho tiempo sin una actualización de versión mayor de verdad, y Flux aún no ha liberado los pesos open source completos. Al liberar ahora modelos de 6B y 8B, de un tamaño que «cabe en una máquina doméstica», los modelos chinos están aprovechando ese respiro del rival para asentar primero las bases de la generación de imágenes open source en chino.

Qué significa en la práctica para los creadores comunes

Para las personas concretas, el cambio que traen estos modelos open source es que el coste de generar imágenes sigue bajando.

Antes, si querías usar la IA para generar imágenes de forma estable en algo serio, o bien te suscribías a una herramienta o pagabas por número de imágenes vía API. Con más modelos open source han aparecido soluciones gratuitas que se ejecutan en local. Aunque suelen tener barrera de entrada —hay que saber instalar entornos y ajustar parámetros—, la propia comunidad está limando poco a poco esa barrera.

Mi impresión es que, a corto plazo, lo más cómodo para un creador normal sigue siendo usar herramientas web. Pero si estás construyendo un producto pequeño o una aplicación pequeña y necesitas integrar generación de imágenes, la densidad y el tamaño de esta hornada de modelos open source merecen que le eches otro vistazo. Al menos, la afirmación de que «en China no hay buenos modelos open source de generación de imágenes» dejó de ser cierta a partir de septiembre.

Artículos relacionados