Quién los usa realmente: los modelos chinos se llevan más de la mitad del uso de generación de imágenes y video en el extranjero

Del 24 de agosto al 5 de octubre, Overchat AI registró 1,09 millones de usuarios y 31,6 millones de interacciones con modelos. Al desglosar estas estadísticas anónimas, lo más llamativo no es quién subió un punto en alguna clasificación, sino a quién le votaron las personas cuando se pusieron manos a la obra: la generación de imágenes y la generación de video, las dos tareas que más cómputo consumen y más cuestan, se entregaron en más de la mitad de los casos a modelos chinos.
Esto no son puntuaciones de evaluación, es volumen de uso. Las puntuaciones se pueden inflar con una sola prueba ampliada; el uso solo se acumula clic tras clic.
Conviene aclarar primero el alcance de estos datos, para no tomarlos como un censo de mercado. Provienen de una plataforma que integra varios modelos en un mismo miniprograma, y contabilizan 31,6 millones de interacciones de 1,09 millones de usuarios en 1,2 millones de sesiones entre el 24 de agosto y el 5 de octubre; la cuota se calcula como «cada vez que un usuario usa un modelo, cuenta como uno», y no acumulando según cada llamada. La muestra favorece de forma natural a los usuarios dispuestos a probar varios modelos a la vez, así que se parece más a una instantánea de «quién se abre una y otra vez» que a la factura de ingresos de todo el sector. Pero precisamente porque todos los modelos están en una misma entrada y frente al mismo grupo de personas, esta comparación resulta más convincente que los benchmarks que publica cada fabricante por separado.
El texto sigue siendo estadounidense; la imagen está cambiando de manos
Veamos lo que no ha cambiado. En las interacciones de texto, Gemini, GPT, Claude y Grok suman el 86,2 %, y los fabricantes estadounidenses casi no tienen rival en este terreno. Lo que cambia es la imagen: la cuota de generación de imágenes de los modelos chinos subió del 54,0 % del periodo anterior al 59,5 %, y la de generación de video, del 43,5 % al 53,6 %. En el mismo periodo, los modelos chinos representaron el 36,9 % de todas las interacciones.
Si acercamos la lente a familias concretas, el reparto se ve más claro. En el lado de la imagen, Seedream de ByteDance se mantiene firme en el primer puesto con un 33,5 %, Nano Banana de Google con un 26,1 % y Qwen Image de Alibaba con un 26,0 %, este último casi el doble del 12,3 % del periodo anterior. En el lado del video, Grok Imagine de xAI sigue siendo el número uno por producto (30,6 %, aunque por debajo del 39,6 % anterior), Seedance de ByteDance saltó del 10,8 % al 25,2 % y Kling se mantiene en el 21,9 %.
Lo que realmente merece una pausa es la ventana de dos semanas: del 22 de septiembre al 5 de octubre, Qwen Image se convirtió en la familia de modelos más usada de todas las categorías, con un 17,2 %, por encima del 10,9 % del texto de GPT y del 10,8 % de Gemini. Una familia nacida de pesos abiertos y especializada en edición de imágenes fue abierta más veces que todos los modelos de texto en una entrada que agrega a todos los fabricantes.

Que sea barato no significa que se use; las cifras de Qwen dicen otra cosa
La explicación más fácil es el precio. Overchat AI añadió expresamente que Qwen Image y GPT Image 2.5 tienen el mismo precio unitario en esa plataforma y que ambos están incluidos en el plan gratuito. Con precios iguales, la diferencia de uso es de unas cuatro veces. Así que lo que influye aquí no es quién es más barato, sino otra cosa: la tasa de resultados utilizables, el grado en que se conserva la imagen original al editar y si el usuario quiere volver a intentarlo después de la primera prueba.
Un dato complementario explica bien esta adherencia. Entre las elecciones de modelo de los usuarios nuevos, OpenAI y Anthropic suman el 23,8 %; entre los usuarios recurrentes, esa cifra cae al 19,8 %. Al mismo tiempo, Google sube del 20,9 % al 28,0 % y los fabricantes chinos, del 36,3 % al 39,8 %. La primera elección depende de la familiaridad; las siguientes, de la experiencia real. La gente cambia, y lo hace en dirección a la capacidad visual.
El uso cambia y los dispositivos también
Las diferencias regionales son mayores de lo que se imagina. En Japón, el 74,4 % del uso de IA proviene de Gemini, casi un dominio absoluto; España e Indonesia se inclinan claramente por Qwen Image. Estados Unidos es la excepción: es el único mercado principal que sitúa la generación de video como primera categoría, con un 36,8 %. Brasil es el más inclinado al texto, con un 49,3 %.
El móvil concentra alrededor del 74 % de las sesiones, y el texto, la imagen y el video se reparten casi en tercios iguales, en torno al 33 % cada uno. El escritorio, en cambio, se inclina claramente al texto, un 51,3 %, con GPT, Gemini y Claude como familias dominantes. Esta comparación revela algo: la generación de imágenes y video se está convirtiendo en algo que se hace «sobre la marcha»; el usuario lo prueba en el móvil cuando se le ocurre, en lugar de esperar a sentarse frente al ordenador para hacerlo en serio. Las familias preferidas en móvil lo confirman: Seedream, Grok Imagine, Seedance.
No confundas el volumen de uso con la calidad del producto
Los puntos donde hay que contenerse también están claros. Esta es una muestra de una sola plataforma, y la composición de usuarios tiende a quienes están dispuestos a probar modelos nuevos, así que no puede extrapolarse directamente a todo el mercado. Un uso alto solo indica que se abre una y otra vez, no que cada imagen sea mejor. El coste de Seedance es aproximadamente el triple que el de Grok Imagine 1.5, y aun así su cuota se multiplicó por más de tres, lo que demuestra que a los usuarios nunca les importó solo el precio.
Pero si se ponen esta muestra y otras señales en conjunto, la dirección no es ambigua. En el mismo periodo, Alibaba liberó los pesos de Qwen-Image (aunque la licencia pasó a ser solo para investigación), ByteDance introdujo en Seedance un modo de generar primero un borrador en 480P y, si convence, el video final, y Shengshu Technology rebajó el precio de lanzamiento de su modelo de video insignia a 0,09 yuanes por segundo. Todos estos movimientos apuntan al mismo objetivo: que «intentarlo varias veces» resulte asequible.
Ampliando un poco más el enfoque, estos datos también explican algo más macro: la adopción del texto a video y del texto a imagen está bajando de los estudios profesionales a las manos del público general. Que el móvil concentre más de siete de cada diez sesiones y que las tres categorías de contenido se repartan casi por igual significa que la mayoría de la gente no está montando flujos de trabajo, sino probando sobre la marcha. Este grupo no decide el techo de puntuación de los modelos de vanguardia, pero sí decide con qué frecuencia se usan y a cuántas personas se recomiendan. Quien logre ser más consistente en eso de «probar una vez y obtener un resultado utilizable», más fácil lo tendrá para quedarse en la primera pantalla del móvil.
En la competencia de imagen y video, al final no se compara el techo de una sola pieza final, sino cuántas veces puedes probar, cuántas veces puedes modificar y cuántas estás dispuesto a conservar con el mismo presupuesto. Los datos de uso solo escriben esta sencilla verdad con treinta millones de clics.
Artículos relacionados
El protocolo PACT de Decagon quiere que el consentimiento sea un estandar
Decagon abrio un protocolo para verificar la identidad de un agente personal y los permisos que un cliente le concedio. Es fontaneria, y decide si la economia de los agentes funciona.
La ola de reencuentros con IA: un debate que China aun no sabe como sentir
Peliculas homenaje hechas con IA devolvieron a figuras fallecidas a las pantallas chinas y reunieron cientos de miles de me gusta. Luego llego la reaccion, y era sobre el consentimiento.
Apple publico un modelo multimodal abierto y casi no lo conto
Este lanzamiento centrado en la investigacion paso desapercibido, pero su anclaje visual de grano fino dice mucho de hacia donde va la pila de IA de Apple.
OpenCut y el momento del CapCut de codigo abierto
Un editor de video gratuito con licencia MIT sigue subiendo en las tendencias de GitHub, y su hoja de ruta incluye un servidor MCP para agentes de IA. Las herramientas en torno a los medios con IA alcanzan a los modelos.