← Volver al blog
Aiaprox. 8 min de lectura

Ming-Image de Ant Group diseña por capas, no con imágenes planas

Publicado 2 oct 2026
Ming-Image de Ant Group diseña por capas, no con imágenes planas

La mayoría de los modelos de imagen se juzgan por lo bien que se ve una imagen. Ant Group lanzó dos modelos el 22 de septiembre que invitan a una prueba distinta: si lo que recibes se puede seguir editando cuando terminas de mirarlo.

El laboratorio inclusionAI de Ant publicó Ming-Image-0.1-Design y Ming-Image-0.1-Design-Layer en Hugging Face, ambos de seis mil millones de parámetros y bajo licencia MIT. Esa licencia importa más de lo habitual en este caso, porque permite que una empresa use el resultado con fines comerciales sin negociar nada antes. El dúo está orientado al trabajo de diseño más que a la fotografía. Pantallas de interfaz, infografías, pósteres y ese tipo de maquetación en la que las palabras tienen que ser realmente legibles.

Las tipografías pequeñas son donde los modelos de imagen abiertos suelen venirse abajo. Ming-Image-0.1-Design genera toda la composición, texto incluido, y puede escribir archivos RGBA, así que el fondo sale transparente en lugar de un rectángulo blanco plano. La ficha del modelo sugiere 2048 por 2048, o 1024 por 1024 si lo quieres más rápido, con 12 pasos de muestreo y una escala CFG de 1.0. Doce pasos es poco para un modelo de difusión. Una vez cargados los pesos, el resultado llega rápido. Funciona con la biblioteca estándar diffusers y admite vLLM-Omni para servirlo.

El segundo modelo es el interesante. Ming-Image-0.1-Design-Layer toma un diseño terminado y aplanado y lo vuelve a dividir en capas transparentes, siguiendo un plan de capas que le entregas y que indica cuántas piezas quieres. Lo que acabas obteniendo se parece más a un archivo de diseño de trabajo que a un único PNG plano.

Un diseño gráfico plano que se divide en cinco paneles transparentes apilados en el espacio tridimensional, cada uno con un elemento visual distinto

Esa brecha es la razón por la que la mayoría de los modelos de imagen se quedan cortos ante el trabajo de diseño real. Si un cliente quiere que se mueva el titular y se cambie el logotipo, un PNG plano obliga a regenerarlo todo, y con ello todo lo demás del lienzo. Las capas te permiten cambiar solo esa cosa. Ant evalúa esto con el conjunto de pruebas Crello, midiendo qué tan cerca está cada capa recuperada en color y en forma.

Las cifras que Ant no publicó

No hay ninguna cifra que puedas citar. La ficha del modelo remite a la clasificación de diseño UI/UX de Artificial Analysis y a los resultados de Crello, pero ambos aparecen solo como imágenes de gráficos. Sin números en el texto y sin competidores nombrados. No puedes saber por el lanzamiento cómo se compara Ming-Image-0.1-Design con Qwen-Image, Seedream o cualquier modelo comercial, y ninguna de las dos afirmaciones se puede verificar sin volver a ejecutar la evaluación por tu cuenta.

La guía de hardware también tiene una laguna. Ant validó el modelo de 6B en una única GPU CUDA con 80 GiB de VRAM, un margen mucho mayor de lo que sugiere el número de parámetros. La ficha no ofrece ninguna indicación para tarjetas de consumo de 24 GB, aunque las cuantizaciones de la comunidad creadas justo para esas tarjetas ya estaban disponibles en pocas horas. Las versiones INT4, INT8, FP8, GGUF y ComfyUI aparecieron todas el mismo día.

Ese último detalle merece que nos detengamos en él. Un laboratorio de modelos publica un requisito de 80 GiB, y la comunidad responde haciendo que el modelo funcione en una tarjeta de un tercio de ese tamaño. La cifra oficial describe lo que Ant probó, no lo que el modelo necesita. Cualquier equipo que se plantee adoptarlo debería tratar la configuración validada como un punto de partida y comprobar qué hacen realmente las versiones cuantizadas en su propio hardware.

Por qué las capas cambian el flujo de trabajo

El trabajo de diseño no es una secuencia de imágenes terminadas. Es una secuencia de revisiones. Un cliente ve un borrador, pide el titular más grande y el fondo más frío, y luego decide que el logotipo debería ir al otro lado. Cada una de esas peticiones es pequeña. En una imagen plana, cada una también es cara, porque cambiar un elemento implica regenerar una composición que ya estaba aprobada en todo lo demás.

La salida por capas le da la vuelta a eso. Una vez que el diseño existe como piezas separadas, una revisión toca la pieza a la que se refiere y deja el resto intacto. Para una agencia que factura por horas, la diferencia se nota en los márgenes. Para un diseñador que trabaja solo, se nota en si la herramienta es más rápida que hacerlo a mano.

El otro punto donde las capas compensan es la entrega. Un PNG aplanado es un callejón sin salida. Cualquiera que venga después y necesite ajustarlo empieza de cero. Un archivo por capas puede pasar a las herramientas que un equipo de diseño ya usa, y esa es la diferencia entre una herramienta de IA que se queda al lado de un flujo de trabajo y otra que se integra en él.

La carrera de edición a la que pertenece

Ant no lanza esto al vacío. En todo el mercado de la imagen, la edición se ha convertido en el terreno donde los modelos se diferencian. GPT Image 2.5 Sunburst está en lo más alto de las clasificaciones de edición, con su hermano Flare muy cerca. Nano Banana Pro sigue siendo la vía fácil para fijar una identidad sin ajuste fino, y combina hasta catorce imágenes y cinco personas. Seedream 5.0 une la edición con búsqueda web en vivo, lo que ayuda cuando una edición necesita una referencia real. En el lado abierto, FLUX.1 Kontext se encarga de las ediciones que preservan la maquetación y que ejecutas tú mismo, y Qwen-Image-Edit lidera la clasificación de edición de pesos abiertos.

Frente a ese panorama, Ming-Image hace una apuesta estrecha. No intenta ganar la arena general de la edición. Apuesta a que el diseño con mucho texto es una porción del mercado lo bastante grande como para sostener un modelo especializado, y a que la descomposición en capas es una función que los modelos generales no se molestarán en construir porque no luce en un vídeo de demostración.

Esa apuesta tiene una historia detrás. Los modelos de imagen abiertos han pasado dos años persiguiendo el fotorrealismo, y la brecha de calidad entre pesos abiertos y cerrados se ha cerrado mucho. Lo que no se ha cerrado es la brecha entre un modelo que produce una imagen y un modelo que produce un recurso. Una imagen está terminada cuando se ve bien. Un recurso está terminado cuando se puede entregar a otra persona y modificar. Ming-Image apunta a la segunda categoría, algo más difícil de demostrar en una publicación de lanzamiento y más útil de tener un martes por la tarde.

Para quién es esto en realidad

Si produces recursos de diseño en volumen y el texto que contienen tiene que ser legible, merece la pena probarlo ya. Un equipo pequeño de marketing que saca tarjetas para redes sociales, variantes de anuncios y presentaciones internas es el encaje más claro, y la licencia MIT no interpone nada en los términos entre tú y el uso comercial.

Por el modelo de capas empezaría yo, porque la salida por capas es justo lo que tu herramienta de imagen actual casi con toda seguridad no puede hacer. Todo lo demás aquí, un modelo de texto a imagen que renderiza tipografía legible, tiene competencia. La capacidad de tomar un diseño plano terminado y devolver un archivo editable, no.

La primera prueba que merece la pena hacer es el renderizado de texto en tamaños pequeños en un idioma distinto del inglés. Ahí es donde los modelos de esta clase suelen fallar, y el lanzamiento no dice nada al respecto. La tipografía multilingüe es el requisito oculto detrás de la mayoría del trabajo de diseño real, y un modelo que solo maneja bien la escritura latina es un modelo con techo.

Si tu resultado es fotográfico y no tipográfico, nada de esto aplica. Ming-Image no intenta competir con los modelos que renderizan personas y paisajes hermosos. Apunta a la mitad poco glamurosa del diseño, esa parte en la que un póster necesita un titular en el lugar correcto y una ficha de producto necesita un precio que un humano pueda leer. Esa mitad lleva un tiempo esperando un modelo que se la tome en serio.

Artículos relacionados