Alibaba abre 30B multimodal: 3.000 millones de parámetros activos para desafiar de frente a GPT-5-Mini

El 4 de octubre, el equipo de Qwen (Tongyi Qianwen) de Alibaba Cloud publicó de una sola vez las dos versiones, Instruct y Thinking, de Qwen3-VL-30B-A3B, acompañadas de pesos cuantizados en FP8; en la misma tanda también lanzó la versión FP8 del más grande Qwen3-VL-235B-A22B. La tabla de resultados que ofrece la propia compañía es muy directa: en cinco direcciones —razonamiento STEM, respuesta visual a preguntas, reconocimiento de texto OCR, comprensión de video y tareas de agente— se compara con GPT-5-Mini y Claude 4-Sonnet, e incluso los supera en algunos apartados.
Lo que de verdad merece una pausa es esa cadena A3B del nombre.
Un envoltorio de 30B, un apetito de 3B
El número total de parámetros de Qwen3-VL-30B-A3B es de 30.000 millones, pero en cada inferencia solo participan en el cálculo unos 3.000 millones. Se trata de una arquitectura típica de mezcla de expertos (MoE): el modelo prepara internamente un gran número de expertos y, cada vez que procesa un token, solo selecciona a un pequeño puñado de los más adecuados para hacer el trabajo, mientras el resto permanece inactivo.

Pensarlo como una empresa resulta más intuitivo. La empresa tiene 30.000 empleados, pero para cada proyecto concreto solo hace falta movilizar a 3.000 especialistas adecuados, mientras el resto sigue en espera. La capacidad acumulada de la empresa es de nivel 30.000 personas, pero el coste laboral de un proyecto concreto se acerca al de 3.000.
Las ventajas de esta estructura son muy prácticas. El uso de memoria gráfica y la velocidad de inferencia se parecen más a los de un modelo denso mucho menor que 30B, mientras que el techo de capacidad conserva una base de nivel 30B. Para los equipos que necesitan ejecutar capacidades multimodales en local o en un entorno privado, esta es justo la combinación más difícil de reunir en los últimos años: tener un rendimiento equiparable al de los buques insignia de código cerrado sin exigir una tarjeta repleta de memoria.
Por qué la tabla de resultados se presenta en estas cinco direcciones
Las direcciones que la propia compañía eligió para la comparación son precisamente los campos donde el despliegue multimodal es más intensivo.
El OCR es una necesidad básica en la digitalización de documentos, el reconocimiento de facturas y la extracción de texto de capturas de pantalla. La comprensión de video es la puerta de entrada a la producción de contenido en la era de los videos cortos: quien sepa entender el video podrá convertirlo en material consultable y editable. Los agentes permiten que el modelo no solo entienda, sino que también actúe, y esa es la línea principal en la que casi todos los actores del sector están apostando este año. STEM y VQA son, a su vez, el billete de entrada a escenarios de alto valor como la educación, la investigación científica y el control de calidad industrial.
Que un modelo con solo 3.000 millones de parámetros activos pueda medirse de tú a tú con los buques insignia de código cerrado en estas líneas tiene, en sí mismo, más valor de señal que cualquier puntuación individual. Indica que la densidad de capacidad se sigue recomprimiendo: para un mismo resultado, la potencia de cómputo necesaria disminuye; o, dicho de otro modo, con la misma potencia de cómputo se obtiene cada vez más capacidad.
La carta del código abierto se juega en el coste de despliegue
Tongyi no lanzó una sola versión en esta ronda. Instruct está orientada al seguimiento convencional de instrucciones y a las preguntas y respuestas; Thinking sigue la ruta de razonamiento de pensar primero y responder después; y los pesos FP8 están pensados para quienes quieren meter el modelo completo en una memoria gráfica limitada.
Lanzar las tres versiones a la vez apunta a lo mismo: llevar lo multimodal del «consumo mediante API en la nube» al «despliegue propio». En cuanto los pesos se pueden descargar, cuantificar y ejecutar en servidores privados, la lógica de compra cambia. Antes las empresas calculaban cuánto costaba cada millón de tokens; ahora hay una opción más, que calcula cuánto cuesta cada millón de tokens amortizando las tarjetas gráficas propias. Para los equipos con un uso intensivo, esa segunda cuenta suele salir más rentable, y además los datos no salen de la red interna.
Esta ha sido también la dirección de ataque más estable de los modelos abiertos chinos durante el último año. Ya no se trata simplemente de ver quién tiene más parámetros o mejores puestos en las clasificaciones, sino de ver quién consigue que más gente use el modelo con un umbral de entrada más bajo. Cuando la brecha de capacidad se reduce a un rango aceptable, el precio y la disponibilidad se convierten en el verdadero factor decisivo.
La otra cara del código abierto
Que los pesos sean públicos significa que cualquiera puede descargarlos, ajustarlos y redistribuirlos. La ventaja es que el ecosistema se expande muy rápido: las versiones cuantizadas, los ajustes para sectores concretos y las adaptaciones para dispositivos de borde brotarán pronto en la comunidad. El riesgo es igual de claro: el modelo sale del campo de visión de quien lo publica, y este apenas puede controlar dónde se usa ni cómo se usa.
Para los desarrolladores, esto pone la capacidad de decisión en sus propias manos. Debes tener claro tu límite de cumplimiento normativo, si los datos pueden salir del país y los términos de licencia de la redistribución. El código abierto te entrega la herramienta y, al mismo tiempo, te entrega la responsabilidad.
Qué observar a continuación
La comparación en estas cinco direcciones es solo el punto de partida. Lo que realmente decide si un modelo multimodal se mantiene en producción rara vez es la puntuación de un benchmark concreto, sino si falla de repente tras decenas de rondas de tareas, y su estabilidad ante documentos reales, videos reales y entradas reales y desordenadas.
Que el camino de los 3.000 millones de parámetros activos pueda seguir subiendo depende de la eficiencia de enrutamiento de expertos de la próxima generación, de la calidad de los datos de entrenamiento y de las estrategias de postentrenamiento. Si este camino funciona, lo que se reescribirá no será solo una clasificación, sino la suposición por defecto de todo el sector sobre «qué tamaño de modelo hace falta para ser suficiente».
Si un modelo con una capacidad cercana a la de un buque insignia cuesta en funcionamiento solo una fracción de lo que cuesta este, entonces lo verdaderamente escaso ya no será la potencia de cómputo, sino las personas que tengan claro qué hacer con él.
Artículos relacionados
Agility Digit 5 llega con un caso de seguridad, no solo una hoja de especificaciones
El suelo de un almacén no es un laboratorio. La certificación es la puerta de entrada, no la demo.
Los agentes de frontera completaron el 30 por ciento de un flujo de trabajo de investigación. Ese es el número.
Los agentes pueden ejecutar investigación. Inventar el procedimiento sigue estando fuera de su alcance.
Figure AI aseguró 3.500 millones de dólares en cómputo antes de tener un producto que vender
La apuesta es que la generalización es un problema de cómputo. El sector aún no lo ha resuelto.
OpenAI por fin incorpora fondos transparentes a la API de imágenes
Una función pequeña que elimina todo un paso del flujo de trabajo.