Wan 3.0 acaba de encabezar la clasificación de video. La historia de los pesos abiertos ahora es una historia de video.

Durante la mayor parte del auge de la IA generativa, la conversación sobre pesos abiertos perteneció a las imágenes. Stable Diffusion demostró que se podía ejecutar un modelo real en tu propia GPU, y todo un ecosistema de LoRAs y ControlNets creció a su alrededor. El video era diferente. Los mejores modelos de video permanecían encerrados detrás de APIs, y "video de código abierto" significaba modelos pequeños que iban por detrás de los líderes cerrados.
Eso cambió este mes. Wan 3.0, el modelo de video de Alibaba, ocupó el primer puesto en el benchmark AA-Video-T2V v2.0 de nueva generación de Artificial Analysis, construido a partir de más de 68.000 votos de preferencia humana en alrededor de mil prompts. Wan 3.0 obtuvo un Elo de 1157 y ganó el primer lugar en 10 de 20 clasificaciones por categoría. La misma tabla también colocó a Wan 3.0 primero en edición de video, por delante de Seedance de ByteDance y H3 de MiniMax.
La importancia tiene menos que ver con una cifra y más con lo que representa. Un modelo chino de pesos abiertos ahora es competitivo con Google Veo 3.1 y el resto del campo cerrado, y en varias clasificaciones está por delante. El precio cuenta la misma historia. Wan 3.0 cuesta de $0,05 a $0,20 por segundo según la resolución, frente a los $0,40 de Veo 3.1 en el nivel estándar. Alibaba recaudó 10.000 millones de dólares en una colocación de acciones en Hong Kong para financiar exactamente este impulso, y la estrategia es legible: vender barato, ganar cuota, hacer del cliente empresarial el motor de crecimiento.
Técnicamente, Wan 3.0 está diseñado para la consistencia y la entrada estructurada. Genera clips de hasta 30 segundos en una sola pasada, duplicando el límite de 15 segundos de su predecesor, a hasta 1080p con microexpresiones sincronizadas y voz multilingüe. Más interesante aún, acepta documentos, PDF, PowerPoints y hojas de cálculo como entrada, convirtiendo una presentación de diapositivas o un informe en video. Ese enfoque de documento a video apunta directamente a flujos de trabajo empresariales, no solo a creadores individuales.
La función de documento a video merece más atención de la que recibe. La mayoría de los modelos de video quieren un prompt de texto o una imagen. Wan 3.0 quiere tus activos existentes, la presentación que ya hiciste, el informe que ya escribiste, y los trata como la fuente de verdad. Para una empresa que vive en documentos, eso reduce la fricción de pasar de "tenemos un informe" a "tenemos un video" a casi nada. Es el primer modelo que convierte el flujo de documentos empresariales en la puerta de entrada, y es un movimiento silenciosamente inteligente.
Para un equipo que elige un stack de video, esto reordena la decisión. La vieja suposición de que los modelos abiertos son a lo que recurres cuando no puedes permitirte o no puedes usar los cerrados se está debilitando. Ahora puedes autoalojar un modelo que encabeza la clasificación, lo que importa para los casos que no tienen nada que ver con la calidad y todo que ver con el control. Un cliente cuyos datos no pueden salir de su infraestructura no tiene ninguna opción que cumpla, salvo un modelo autoalojado, y por primera vez esa opción no es un compromiso en la calidad de salida.
Hay una advertencia que se omite en el entusiasmo. El autoalojamiento no es gratis solo porque los pesos lo sean. Pagas en GPUs, en trabajo de integración, en la tarea continua de mantener una pipeline saludable al volumen que tu trabajo realmente alcance. El modelo es gratis; la ingeniería no. Para la mayoría de los equipos pequeños, un endpoint alojado sigue ganando en costo total hasta que el volumen justifique el hardware.
El contexto del benchmark importa para leer la victoria correctamente. El benchmark AA-Video-T2V v2.0 es la nueva generación de evaluación por preferencia humana, y juzga cada modelo a 1080p, lo que elimina el viejo truco de ganar en baja resolución. Wan 3.0 quedó primero en diez de veinte clasificaciones por categoría y obtuvo el Elo general más alto con 1157. Eso no es una victoria de nicho ni una categoría favorable; es un resultado amplio y competitivo contra todo el campo, incluidos los modelos que cuestan ocho veces más por segundo. Cuando un modelo abierto que cuesta $0,05 por segundo supera a un modelo cerrado que cuesta $0,40, la propuesta de valor es difícil de discutir.
También hay una dimensión política difícil de ignorar. La carrera de video con IA se ha convertido en un proxy de una competencia mayor entre laboratorios chinos y estadounidenses, y la corona de Wan 3.0 en el benchmark es el tipo de resultado que se cita en ambos países por razones distintas. En China es prueba de que el stack nacional puede competir en calidad, no solo en precio. En EE. UU. es evidencia de que el costo de cómputo no es lo único que está cambiando. Ninguno de los dos enfoques captura del todo lo que está ocurriendo, que es una convergencia competitiva genuina que beneficia a los usuarios en forma de precios más bajos y modelos abiertos más capaces.
El cruce de los pesos abiertos hacia el video también tiene implicaciones para la geopolítica más amplia de la IA. Los laboratorios chinos llevan un tiempo ganando la guerra de precios, y ahora también ganan en los benchmarks, lo que cambia la narrativa de "imitación barata" a "genuinamente competitivos". La misma dinámica ya se dio en la generación de imágenes con Qwen-Image y Z-Image, y en modelos de lenguaje con DeepSeek y Qwen. El video era el último gran bastión de los laboratorios occidentales cerrados, y Wan 3.0 acaba de mostrar que la puerta está abierta.
La corona del benchmark es el titular, pero la verdadera historia es que la generación de video ahora tiene un camino abierto creíble. Las mismas dinámicas que siguieron a Stable Diffusion probablemente seguirán aquí: ajustes finos, nodos de control comunitarios, despliegues regionales y una larga cola de casos de uso que los proveedores de API nunca se molestaron en atender. Los modelos abiertos ajustados ya son la forma estándar de mantener un personaje o estilo específico en trabajo de imagen, y los creadores de video querrán la misma capacidad de entrenar con su propia marca o producto.
Ya hay evidencia temprana de que ese ecosistema se está formando. El ecosistema de MiniMax H3 ha producido un generador de prompts de código abierto y una ola de ajustes finos de la comunidad orientados al anime y al trabajo de personajes, replicando el manual de Stable Diffusion. Cuando los pesos abiertos son lo bastante buenos para encabezar un benchmark, la comunidad que se forma a su alrededor deja de ser un nicho; es la corriente principal, y las innovaciones que surgen de ella, nodos de control, alojamiento regional, inferencia local que preserva la privacidad, tienden a llegar más rápido de lo que cualquier proveedor puede lanzar.
La implicación práctica para un equipo es concreta y vale la pena repetirla. Si estás eligiendo un stack de video a finales de 2026, la pregunta ya no es "abierto o cerrado" como cuestión de calidad. Es una cuestión de control, costo y riesgo de salida. Los pesos abiertos te dan lo primero y reducen lo tercero, a costa de lo segundo. Las APIs cerradas te dan comodidad a costa de las tres. Los equipos que superarán sin dolor el próximo retiro de un modelo son los que ya decidieron dónde se sitúan en esa disyuntiva, en lugar de descubrirlo por las malas cuando su proveedor anuncie un cierre.
Para cualquiera que construya sobre video generativo, la lección práctica es dejar de tratar los pesos abiertos como un último recurso. Trátalos como una opción estratégica. La próxima vez que un proveedor cerrado retire un modelo como OpenAI acaba de hacer con Sora, los equipos que no estén corriendo a la desesperada serán los que mantuvieron al menos un pie en el camino abierto. Los pesos abiertos solían ser el premio de consolación. En video, acaban de convertirse en la vitrina de trofeos.
Artículos relacionados
Huawei Cloud reconstruyó su stack en torno a los agentes y después puso fecha a las facturas
La capacidad de los modelos ha convergido y el valor se ha desplazado a lo que los rodea.
Xiaomi lanzó un modelo omnimodal que iguala a la frontera, además de la receta de entrenamiento
Los pesos te permiten ejecutar un modelo. Los entornos te permiten reentrenarlo.
Cadence introduce agentes en el diseño de chips y reduce un ciclo de verificación de cinco semanas a un día
Por lo tanto, los agentes llaman a más motores subyacentes, no a menos.
Roblox Build publicó 9.000 juegos en seis semanas. El número interesante es 71
Léelo como una cifra de captación más que como una cifra de calidad.