← Volver al blog
Aiaprox. 8 min de lectura

El Ling 3.1 Flash de Ant Group activa 25B de 560B parámetros y alcanza 41

Publicado 6 oct 2026
El Ling 3.1 Flash de Ant Group activa 25B de 560B parámetros y alcanza 41

--- title: Ling 3.1 Flash de Ant Group pone 560B parámetros detrás de una factura de 25B meta_title: Ling 3.1 Flash pone 560B parámetros detrás de una factura de 25B meta_description: El Ling 3.1 Flash de Ant Group obtiene 41 en el Intelligence Index con 25B parámetros activos de 560B totales, mostrando hasta dónde puede llegar el MoE disperso. ---

AntLingAGI, de Ant Group, lanzó Ling 3.1 Flash el 6 de octubre. La cifra que destaca son los 25.000 millones de parámetros que realmente se activan cuando el modelo se ejecuta, de un total de 560.000 millones.

El modelo obtuvo 41 en el Intelligence Index de Artificial Analysis, un avance claro respecto a su predecesor. La evaluación destacó las capacidades agénticas como el área de mejora más acusada, que es la categoría que los compradores empresariales han empezado a valorar con más peso.

La arquitectura es el argumento

Ling 3.1 Flash es un modelo de mezcla de expertos. Incluye 560.000 millones de parámetros en total, pero activa aproximadamente 25.000 millones por token, y admite una ventana de contexto de hasta un millón de tokens.

Esa proporción es todo el argumento de venta. Un modelo denso de capacidad comparable tendría que mover todos los parámetros por cada token generado. Al enrutar cada token a través de un pequeño subconjunto de expertos, un modelo disperso ofrece una salida similar tocando mucho menos cómputo. El compromiso está en la memoria: los 560.000 millones de parámetros siguen teniendo que residir en algún sitio, aunque la mayoría permanezca inactiva en cualquier pasada hacia delante.

Un pequeño grupo de nodos dorados brillantes conectados por finos trazos de luz a través de una matriz de nodos grises apagados

La consecuencia práctica es un modelo que puede servirse a una fracción del coste de un equivalente denso con el mismo nivel de calidad, siempre que el equipo disponga del hardware para alojar los pesos. Es la misma historia de ingeniería que ha impulsado la mayoría de los lanzamientos de pesos abiertos de frontera este año, y es la razón por la que la métrica interesante ha pasado de los parámetros totales a los parámetros activos.

Qué cubren los benchmarks

Ant Group publicó resultados en diversas evaluaciones: GDPVal-AA v2.1 con 1673 Elo, FrontierSWE con 75,16, HealthBench con 65,35 y Design Arena, donde se sitúa cerca de lo más alto en aplicaciones móviles y generación de SVG.

La puntuación de 41 en el Intelligence Index es el titular, y sitúa al modelo en la compañía de lanzamientos de laboratorios mucho más grandes. Ant Group afirma que el modelo completo se publicará como código abierto, con documentación ya publicada. Mientras tanto, hay una prueba gratuita de dos semanas en marcha.

Las demostraciones de ingeniería dicen más que las puntuaciones

Ant Group también describió tres ejemplos prácticos, y estos dicen más sobre el uso previsto que una tabla de clasificación.

El primero: construir desde cero un compilador de Lua a x86, superando 178 de 182 pruebas. Es una tarea en la que el modelo debe mantener en mente una especificación extensa, producir código internamente coherente en muchos archivos y hacer seguimiento de los casos límite en todo momento. Este trabajo penaliza a los modelos con un manejo débil del contexto largo.

El segundo: acelerar la comprobación de tipos en una gran base de código Python. Se trata de una tarea de mantenimiento y no de un proyecto desde cero, que es donde se va en realidad la mayor parte del tiempo de ingeniería. Un modelo capaz de razonar sobre las relaciones de tipos de un repositorio existente es útil de una forma en que no lo es un modelo que escribe funciones nuevas.

El tercero: construir un agente de escritorio que coordina un navegador, archivos locales y herramientas de terminal. La orquestación de múltiples herramientas es la frontera actual del trabajo agéntico, y es la capacidad a la que apunta el salto en los benchmarks.

Los tres son reportados por la empresa y no han sido reproducidos de forma independiente. La afirmación del compilador con 182 pruebas, en particular, necesitaría verificación externa, ya que superar pruebas solo tiene sentido si las pruebas son representativas. Un compilador que maneja la sintaxis común y falla en los casos inusuales puede aun así obtener buenos resultados en una batería escrita la misma semana que el modelo.

Aquí también hay un patrón más amplio que conviene señalar. Los laboratorios chinos han recurrido cada vez más a demostraciones de ingeniería en lugar de puntuaciones de benchmarks como su marketing principal, porque los benchmarks se han vuelto ambiguos y las demostraciones son concretas. El compromiso es que una demostración muestra una única trayectoria por el espacio del problema, y nada sobre la distribución de resultados.

El arco más largo: lo que los pesos abiertos chinos siguen haciendo

Ling 3.1 Flash encaja en un patrón que se ha mantenido todo el año. Los laboratorios chinos publican pesos abiertos a escala de frontera con licencias permisivas a un ritmo que ningún laboratorio occidental ha igualado, y compiten en eficiencia más que en escala bruta.

Vale la pena decir el contexto con claridad. Un desarrollador que ejecuta uno de estos modelos es dueño de la pila de inferencia, lo que significa que no hay coste por token en API, que ningún dato sale del edificio y que ningún tercero decide cuándo cambia el modelo. Para equipos con restricciones de privacidad o cargas de trabajo predecibles pero intensas, eso vale dinero real.

Victor Taelin señaló este mes que ningún modelo abierto permanece en el top 25 de las clasificaciones de Artificial Analysis, y que el mejor, MiMo de Xiaomi, se sitúa en el puesto 26. El 41 de Ling 3.1 Flash en el Intelligence Index es una puntuación de inteligencia y no un puesto, así que ambas cifras miden cosas distintas, y la brecha entre el mejor modelo abierto y el mejor modelo cerrado sigue siendo real. Lo que ha cambiado es que ahora la brecha se mide en puntos y no en si un modelo abierto puede hacer el trabajo o no.

Qué significa esto para quien elige un modelo

Hay tres consideraciones que importan más que la proporción de parámetros.

Licencia y términos de despliegue. Ant Group afirma que el modelo será abierto, pero la licencia concreta determina si el uso comercial es irrestricto. Dado lo a menudo que «pesos abiertos» y «licencia permisiva» se usan de forma intercambiable cuando no son lo mismo, conviene leer los términos con atención antes de depender de él en producción. La misma cautela se aplica a la documentación publicada antes del lanzamiento, que describe capacidades y no obligaciones.

La afirmación sobre la ventana de contexto. Un millón de tokens es una cifra elevada, pero el contexto utilizable suele ser más corto de lo que se anuncia. Si el modelo mantiene la calidad en toda la ventana, o se degrada mucho antes, es la pregunta que determina su utilidad para el trabajo con documentos largos y repositorios grandes. Las propias demostraciones de contexto largo de Ant Group sugieren que el modelo maneja entradas grandes, aunque, de nuevo, son pruebas del proveedor.

El requisito de memoria. Un modelo disperso de 560B no es un despliegue de portátil. El relato de los parámetros activos reduce el cómputo por token, no la huella de los pesos, y quien planee autoalojarlo debería dimensionar el hardware según el total y no según el recuento activo. Esa distinción hace tropezar a la gente con regularidad. Un modelo descrito como de 25B parámetros activos suena pequeño hasta que intentas cargarlo, momento en el que los 560B completos tienen que caber en algún sitio.

También hay una cuestión práctica de soporte. Un modelo de un laboratorio que publica con frecuencia quedará superado, y los equipos deberían prever una ruta de migración. La cadencia de lanzamientos de Ant Group sugiere que Ling 3.2 o Ling 4 llegarán en cuestión de meses, lo que es bueno para la capacidad e incómodo para quien haya construido un ajuste fino o un script de despliegue en torno a una versión.

Ling 3.1 Flash es un lanzamiento capaz de un laboratorio que ha estado publicando de forma constante. La verdadera noticia es estructural: un modelo con 25B activos puede ahora sentarse con credibilidad en la misma conversación que sistemas densos mucho mayores. Ese es el argumento que toda la línea de trabajo de MoE disperso ha estado defendiendo, y los benchmarks por fin empiezan a respaldarlo.

Artículos relacionados