GLM-5.2 de Zhipu se abre por completo: 744.000 millones de parámetros, entrenado en chips nacionales

Zhipu AI, el laboratorio de Pekín también conocido como Z.AI, lanzó GLM-5.2 y publicó los pesos abiertos completos en cuestión de días. El modelo tiene 744.000 millones de parámetros totales, con aproximadamente 40.000 millones activos por token, y utiliza una arquitectura de mezcla de expertos con una optimización distintiva de atención dispersa llamada IndexShare.
La licencia es MIT. Ese es el titular para cualquiera que planee construir sobre él: sin exclusiones territoriales, sin activador por ingresos, sin límite de usuarios activos mensuales. El despliegue comercial, la modificación y la redistribución no requieren permiso adicional.
Qué te aporta IndexShare
La arquitectura IndexShare reutiliza indexadores de atención dispersa entre capas, lo que, según los análisis técnicos, supone una reducción de 2,9 veces en el cómputo por token en la ventana de contexto completa de un millón de tokens del modelo. Esa cifra importa menos como benchmark aislado y más como un hecho económico. Las sesiones de agentes con contexto largo son donde se acumulan los costos por token, y una reducción de 2,9 veces en la parte alta de la ventana de contexto cambia qué cargas de trabajo son viables en un clúster determinado.
GLM-5.2 admite de forma nativa un millón de tokens y figura como el modelo de pesos abiertos mejor situado en el Artificial Analysis Intelligence Index. En SWE-bench Pro obtuvo un 62,1 por ciento, por delante del 58,6 por ciento de GPT-5.5. En Terminal-Bench 2.1 registró 81,0, la puntuación más alta reportada entre los modelos de pesos abiertos.
La historia del hardware es la geopolítica
La parte de GLM-5.2 que perdurará más allá de la conversación sobre benchmarks es dónde se ejecuta. Toda la serie GLM-5 se entrenó en chips Huawei Ascend usando el framework MindSpore. Es una afirmación que ningún laboratorio occidental puede hacer, y es la razón por la que el modelo atrae la atención de compradores que piensan en la resiliencia de la cadena de suministro más que en las puntuaciones brutas.
Los materiales de lanzamiento de Zhipu añaden que la inferencia en línea se ejecuta en múltiples plataformas de cómputo nacionales, con compatibilidad desde el primer día para Huawei Ascend, T-Head, Moore Threads, Cambricon, Kunlun, Muxi, Hygon y Biren. La empresa lo presenta como una operación estable con alto rendimiento, baja latencia y gran concurrencia en clústeres de chips nacionales.
Para una empresa fuera de China, la pregunta práctica es si los pesos ofrecen una vía autoalojada que elimine los costos por token. Para una empresa dentro de China, la pregunta es más amplia: si se puede construir y servir un modelo con capacidad de frontera sin depender de hardware que no puede comprar de forma fiable.
Cuánto cuesta y qué cambia el autoalojamiento
Los niveles de precios se separan con claridad. El acceso directo a la API cuesta alrededor de 1,40 $ por millón de tokens de entrada y 4,40 $ por millón de tokens de salida, con la entrada en caché a 0,26 $. A través de OpenRouter, las tarifas son de aproximadamente 1,00 $ y 4,00 $. La suscripción GLM Coding Plan se sitúa entre 10 $ y 18 $ al mes para un nivel enfocado en desarrolladores, que no está pensado para escala de producción.
El autoalojamiento es donde cambia la aritmética. El despliegue en las instalaciones conlleva costos de infraestructura y ninguna tarifa por token. Para una carga de trabajo que procesa millones de tokens al día, esa diferencia es sustancial. La contrapartida es el clúster de GPU, el mantenimiento y el trabajo de escalado que una API gestionada oculta. La licencia MIT reduce la fricción legal, además de la económica.

La cuantización es la otra palanca. Con pesos cuantizados, el modelo, según se informa, se ejecuta en hardware de gama de consumo, lo que abre una vía autoalojada para aplicaciones sensibles a la privacidad, como agentes que manejan historiales médicos o bases de código propietarias.
La nota de seguridad que vale la pena leer
Hay un hallazgo que merece atención antes de que alguien trate los pesos abiertos como una comida gratis. La evaluación del equipo rojo de Anthropic informó que GLM-5.3 muestra capacidades cibernéticas autónomas de clase Mythos con salvaguardas débiles contra el uso indebido de pesos abiertos. Los pesos abiertos no se pueden recuperar. Una vez descargado, el modelo permanece indefinidamente en posesión de la organización que lo despliega.
Eso crea un problema de despliegue específico. Un modelo de pesos abiertos que se ejecuta dentro de un framework de agentes necesita capas de contención que un proveedor de API cerrada gestiona de su lado. La licencia MIT elimina la dependencia del proveedor y también elimina las garantías de seguridad proporcionadas por el proveedor. Los equipos que despliegan GLM-5.2 en un bucle de agentes deberían presupuestar la contención en tiempo de ejecución, no tratarla como un problema ajeno.
Por qué este lanzamiento tiene un impacto distinto
Muchos modelos abiertos se lanzan cada mes. GLM-5.2 tiene un impacto distinto por tres razones que se refuerzan entre sí.
La licencia es genuinamente permisiva a una escala de parámetros donde eso es raro. La mayoría de los lanzamientos abiertos de clase frontera vienen con una condición comercial, un límite territorial o un tope de usuarios. GLM-5.2 no tiene nada de eso.
La ruta de hardware es independiente de NVIDIA. Para los compradores que consideran el riesgo de la cadena de suministro una preocupación de primer orden, eso cambia la lista corta independientemente del puesto en los benchmarks.
Y la eficiencia de cómputo en contextos largos hace que las sesiones sostenidas de varios pasos sean económicamente viables en clústeres más pequeños que los que necesita un modelo como Nemotron 3 Ultra de NVIDIA, que requiere nodos 8xH100 como mínimo documentado.
GLM-5.2 no es el mejor modelo en todas las tareas, y la advertencia de seguridad es real. Pero como señal de lo que un lanzamiento abierto puede ser ahora —competitivo en la frontera, con licencia permisiva y construido sin GPU fabricadas en EE. UU.—, es la más clara de este ciclo.
La familia en torno al modelo insignia
Ayuda a ver GLM-5.2 como la cima de una escalera en lugar de un lanzamiento independiente. La familia GLM abarca desde el ligero GLM-4.6V-Flash de 9B, orientado al despliegue en el borde, hasta el buque insignia de 744B. Las variantes especializadas incluyen GLM-5V-Turbo para tareas de visión multimodal y el framework de agentes AutoGLM para planificación compleja de varios pasos.
La licencia permisiva se aplica en toda esa escalera, que es la parte que importa para los equipos que eligen un stack. Una empresa puede prototipar con el modelo pequeño de borde, escalar al buque insignia y moverse entre ellos sin renegociar derechos en cada paso. Esa continuidad es inusual en el ecosistema abierto, donde las licencias a menudo difieren entre los lanzamientos pequeños y grandes de un laboratorio.
Qué significa en la práctica la afirmación de eficiencia
La reducción de 2,9 veces en el cómputo por token con el contexto completo es el tipo de cifra que se lee como una especificación hasta que se vincula a una carga de trabajo.
Pensemos en un agente que razona sobre una base de código grande o un conjunto extenso de documentos. Cada paso relee un contexto que crece, y el costo de esa relectura es lo que hace caras las sesiones largas. Una reducción de casi tres veces en la parte alta de la ventana de contexto baja el punto en el que una sesión de larga duración deja de valer la pena. La sesión sigue costando dinero, pero el punto de equilibrio se desplaza.
Eso también explica por qué importa la vía de cuantización. Con pesos cuantizados, el modelo, según se informa, se ejecuta en hardware de gama de consumo, lo que convierte a un agente de contexto largo de algo que necesita un clúster en algo que un equipo pequeño puede ejecutar localmente. Para una aplicación que maneja datos sensibles, como historiales médicos o código fuente propietario, ejecutarse localmente es el único despliegue que cumple la restricción de cumplimiento, y el costo es un beneficio secundario.
Dónde muerde la advertencia de seguridad
El hallazgo del equipo rojo es fácil de archivar como un problema ajeno. No lo es, y la razón es estructural.
Un proveedor de API cerrada puede actualizar un modelo, cambiar una política o cortar un caso de uso indebido después de que ocurra. Un lanzamiento de pesos abiertos elimina esa palanca. Los pesos, una vez descargados, permanecen en posesión de la organización que los despliega, y ningún proveedor puede revocarlos. Ese es precisamente el sentido de los pesos abiertos, y también es la razón por la que la contención tiene que construirla el equipo que los despliega.
En la práctica, eso significa que un agente que ejecuta GLM-5.2 necesita la misma disciplina de tiempo de ejecución que un equipo aplicaría a cualquier herramienta potente con acceso de escritura: permisos acotados, un sandbox para acciones no confiables, registro que sobreviva a una caída y una vía de escalado humana para decisiones trascendentales. Nada de eso lo proporciona la licencia, y nada de eso viene gratis con los pesos. Los términos MIT eliminan la dependencia del proveedor en el plano legal y, por diseño, eliminan la seguridad proporcionada por el proveedor en el plano operativo.
Artículos relacionados
Meta licencia la tecnología de imagen y vídeo de Midjourney, y la razón es reveladora
Los benchmarks se mueven cada trimestre. El juicio de una comunidad sobre lo que se ve bien, no.
AssemblyAI redujo la latencia del habla en tiempo real a 91 milisegundos. Esta es la razón por la que esa cifra importa
La restricción en la voz nunca ha sido la tasa de error de palabras. Ha sido la toma de turnos.
Nano Banana 2.1 de Google es una actualización de funciones, no un buque insignia
Un lanzamiento de gama media te dice lo que un laboratorio cree que la mayoría de sus usuarios realmente necesita, lo cual es una señal más útil que un producto insignia.
El stack de anuncios de video se dividió en especialistas, y Boreal-H3 muestra por qué
La calidad cinematográfica y el rendimiento de iteración son productos diferentes, y una sola capa de generación no puede liderar en ambos.