La clasificación de modelos de video que nadie promociona: adónde van realmente las solicitudes

Cada semana aparece una nueva clasificación de generación de video, y casi todas se construyen de la misma manera. Los investigadores reúnen resultados de modelos competidores, los ponen frente a votantes y publican una tabla Elo. Esas tablas son útiles para comparar calidad. No dicen casi nada sobre lo que hacen los compradores.
Ahora se ha hecho público un tipo diferente de clasificación. OpenRouter publica los volúmenes de solicitudes de modelos de video en su servicio de enrutamiento, agregados a partir del uso real. Las cifras de la semana que finalizó el 1 de octubre cuentan una historia que las clasificaciones de calidad no cuentan.
La tabla de volumen
El Veo 3.1 Lite de Google ocupó el primer puesto con aproximadamente 41.000 solicitudes, un aumento de alrededor del 15 %. El Seedance 2.5 de ByteDance quedó segundo con unas 30.000 solicitudes, un aumento de en torno al 28 %. Seedance 2.0 Fast fue tercero con 22.000. Veo 3.1 Fast fue cuarto con 17.000, con un aumento de casi el 95 % de una semana a otra. HeyGen Video entró en la lista como nuevo participante con alrededor de 17.000 solicitudes.
Por debajo de los cinco primeros, el Wan 2.7 de Alibaba registró el mayor cambio de la tabla, con un aumento de más del 300 % hasta unas 12.000 solicitudes. Wan 3.0 se mantuvo en un volumen aproximadamente similar. El Video v3.0 Pro de Kling entró en los diez primeros con alrededor de 10.000 solicitudes.

Ahora comparemos eso con las tablas de calidad. En la tabla de texto a video de Arena, Gemini Omni 1.1 Flash lidera. MiniMax H3 lidera en imagen a video. Kling 3.0 encabeza varias clasificaciones comerciales en cuanto a valor. Ninguno de esos modelos aparece en lo más alto de la lista de volumen de solicitudes.
Los niveles Lite están ganando porque el trabajo cambió
El patrón que explica la mayor parte de la tabla es el precio y la velocidad. Veo 3.1 Lite es el nivel más barato y rápido de Google, y es el modelo más solicitado del servicio. Veo 3.1 Fast casi duplicó su volumen en una semana. Seedance 2.0 Fast y Mini, ambos niveles de eficiencia, juntos suman más solicitudes que el Seedance 2.0 completo.
Así se ve un mercado que pasa de la evaluación a la producción. Cuando la gente prueba un modelo, elige el mejor. Cuando está lanzando algo, elige el que hace que la economía unitaria funcione. Un modelo que produce un clip un poco menos impresionante por una fracción del costo gana cuando el resultado va a un pipeline en lugar de a un reel de demostración.
La entrada de HeyGen Video es la misma señal desde otro ángulo. HeyGen lanzó su modelo de video universal con un precio por segundo de alrededor de un centavo durante el período promocional, aproximadamente la mitad de la tarifa estándar, y lo puso a disposición a través de routers para desarrolladores de inmediato. En pocos días estaba entre los cinco primeros por volumen. El precio y la distribución, no la posición en los benchmarks, produjeron ese resultado.
El salto de Wan tiene que ver con la apertura
El mayor cambio de una semana a otra corresponde al Wan 2.7 de Alibaba, que creció más del 300 %. La familia Wan incluye modelos de pesos abiertos, y los pesos abiertos cambian cómo se propaga un modelo. Cualquiera puede alojarlo, fijar su propio precio y ofrecerlo como opción. Cuando los pesos están disponibles, el modelo no necesita el permiso del proveedor original para llegar a los usuarios.
Ese es el mecanismo detrás de la estrategia de video con pesos abiertos. El volumen de un modelo cerrado está limitado por la capacidad y las decisiones de precios del proveedor. El volumen de un modelo abierto está limitado por cuántos proveedores eligen servirlo. El segundo techo suele ser más alto.
El crecimiento de Wan también sugiere algo sobre dónde se está usando la generación de video. Los modelos de bajo costo y autoalojables tienden a aparecer en aplicaciones de gran volumen: contenido para redes sociales, variaciones para comercio electrónico, recursos para juegos. Esos no necesitan calidad cinematográfica. Necesitan suficiente producción a bajo costo, y un modelo abierto servido por muchos proveedores encaja.
El uso y la calidad miden cosas distintas
Nada de esto significa que los líderes en calidad estén fracasando. Significa que compiten por un segmento diferente. Un estudio que produce un comercial necesita el mejor resultado y pagará por él. Una plataforma que genera miles de clips al día necesita costo por clip, latencia y disponibilidad.
Los dos segmentos son grandes y tiran en direcciones opuestas. Por eso, una única clasificación de modelos de video es engañosa. Un modelo puede liderar una tabla y ser casi invisible en la otra, y ambos resultados pueden ser correctos.
Hay una tercera consideración que los datos de volumen capturan bien: la fiabilidad. Los recuentos de solicitudes reflejan trabajo completado, y un modelo que produce un clip utilizable al primer intento vale más que uno que requiere tres regeneraciones. A lo largo de millones de solicitudes, esa diferencia se manifiesta como volumen.
Lo que los números no pueden decirte
El volumen de solicitudes tiene puntos ciegos, y vale la pena nombrarlos antes de sacar conclusiones.
Los datos cubren modelos servidos a través de un servicio de enrutamiento, no todo el mercado. Un laboratorio que sirve su propio modelo a su propia aplicación, como hacen varios de los más grandes, no aparece en absoluto. Un modelo popular dentro de un único cliente grande queda subrepresentado. Y los recuentos de solicitudes no distinguen entre un usuario que genera mil clips y mil usuarios que generan uno cada uno, lo cual es una diferencia significativa para un proveedor que decide dónde invertir.
Las cifras también van por detrás de los lanzamientos. Un modelo lanzado la semana pasada y otro lanzado el año pasado pueden mostrar el mismo volumen mientras se mueven en direcciones opuestas, y los cambios porcentuales capturan eso solo si los lees. Que el Veo 3.1 Fast de Google casi se duplique en una semana dice más que su puesto absoluto.
Así que la tabla se lee mejor como una señal direccional sobre adónde va el tráfico de producción, no como una medición de cuota de mercado. Responde la pregunta de a qué modelos llama realmente la gente, una pregunta que las clasificaciones de calidad nunca hicieron.
Cómo se ve el mercado a finales de 2026
Cuatro observaciones, extraídas de los números y no de las afirmaciones de ningún proveedor.
Los niveles Fast ahora impulsan la categoría. Los modelos de video más solicitados son los económicos, lo que significa que los compradores con más volumen están optimizando el costo por segundo utilizable.
Los pesos abiertos tienen una ventaja de distribución. La tasa de crecimiento de Wan es la evidencia más clara de que liberar los pesos amplía el mercado direccionable más rápido de lo que un modelo cerrado puede ampliar su propia capacidad.
Los nuevos participantes pueden alcanzar escala en días. HeyGen pasó del lanzamiento a una posición entre los cinco primeros en una semana combinando un precio bajo, una integración amigable para desarrolladores y una base de clientes existente. Los canales de distribución se han convertido en la vía más rápida hacia el volumen.
Las clasificaciones de calidad siguen importando para el segmento alto. Los modelos en lo más alto de las tablas de Arena sirven a clientes para quienes un mejor clip vale más que uno más barato.
Quien elija un modelo de video debería leer ambas cosas. Las tablas de calidad dicen qué puede lograr un modelo, y los volúmenes de solicitudes dicen cuánto cuesta lograrlo a escala. Ninguna clasificación única captura ambas cosas, y esa es una razón por la que los proveedores siguen publicando las tablas de calidad.
Artículos relacionados
Ai2 publicó como código abierto el stack de entrenamiento, no otro conjunto de pesos
Los pesos son fáciles de regalar y difíciles de aprender de ellos.
Qwen3.8-Max de Alibaba afirma que puede programar por sí solo durante dos semanas
Los recuentos de parámetros dejaron de ser noticia hace tiempo. Doce días es la cifra que vale la pena examinar.
PixelUMM descarta los dos componentes de los que depende todo modelo visual de IA
La difusión a nivel de píxeles se ha propuesto antes y se ha topado repetidamente con el cómputo.
Los centros de datos de IA ahora dependen de las líneas eléctricas, no de los envíos de chips
Los proyectos que abran a tiempo en 2027 serán los que hayan resuelto primero la conexión y la asignación de memoria.