← Voltar ao blog
Aicerca de 8 min de leitura

GLM-5.2 da Zhipu fica totalmente aberto: 744 bilhões de parâmetros, treinado em chips domésticos

Publicado 7 de out. de 2026
GLM-5.2 da Zhipu fica totalmente aberto: 744 bilhões de parâmetros, treinado em chips domésticos

A Zhipu AI, o laboratório de Pequim também conhecido como Z.AI, lançou o GLM-5.2 e disponibilizou os pesos abertos completos em poucos dias. O modelo tem 744 bilhões de parâmetros totais, com cerca de 40 bilhões ativos por token, usando uma arquitetura de mistura de especialistas com uma otimização distinta de atenção esparsa chamada IndexShare.

A licença é MIT. Esse é o ponto principal para quem planeja construir sobre ele: sem exceções territoriais, sem gatilho de receita, sem limite de usuários ativos mensais. Implantação comercial, modificação e redistribuição não exigem permissão adicional.

O que o IndexShare oferece

A arquitetura IndexShare reutiliza indexadores de atenção esparsa entre camadas, o que os textos técnicos estimam em uma redução de 2,9× no cálculo por token na janela de contexto completa de um milhão de tokens do modelo. Esse número importa menos como benchmark isolado e mais como um fato econômico. Sessões de agentes com contexto longo são onde os custos de tokens se acumulam, e uma redução de 2,9× no topo da janela de contexto muda quais cargas de trabalho são viáveis em um determinado cluster.

O GLM-5.2 oferece suporte nativo a um milhão de tokens e se posiciona como o principal modelo de pesos abertos no Índice de Inteligência da Artificial Analysis. No SWE-bench Pro, marcou 62,1%, à frente dos 58,6% do GPT-5.5. No Terminal-Bench 2.1, registrou 81,0, a pontuação mais forte relatada entre modelos de pesos abertos.

A história do hardware é a geopolítica

A parte do GLM-5.2 que vai sobreviver ao burburinho dos benchmarks é onde ele roda. Toda a série GLM-5 foi treinada em chips Huawei Ascend usando o framework MindSpore. Essa é uma afirmação que nenhum laboratório ocidental pode fazer, e é por isso que o modelo atrai atenção de compradores que pensam em resiliência da cadeia de suprimentos em vez de pontuações brutas.

Os materiais de lançamento da Zhipu acrescentam que a inferência online é executada em várias plataformas de computação domésticas, com compatibilidade desde o primeiro dia com Huawei Ascend, T-Head, Moore Threads, Cambricon, Kunlun, Muxi, Hygon e Biren. A empresa apresenta isso como operação estável com alto throughput, baixa latência e grande concorrência em clusters de chips domésticos.

Para uma empresa fora da China, a questão prática é se os pesos oferecem um caminho auto-hospedado que elimina os custos por token. Para uma empresa dentro da China, a questão é mais ampla: se um modelo com capacidade de fronteira pode ser construído e servido sem depender de hardware que ela não consegue comprar de forma confiável.

Quanto custa, e o que a auto-hospedagem muda

Os níveis de preço se separam claramente. O acesso direto à API custa cerca de US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de tokens de saída, com entrada em cache a US$ 0,26. Pelo OpenRouter, as tarifas são de aproximadamente US$ 1,00 e US$ 4,00. A assinatura do GLM Coding Plan fica entre US$ 10 e US$ 18 por mês para um nível voltado a desenvolvedores, que não se destina à escala de produção.

A auto-hospedagem é onde a aritmética muda. A implantação local (on-premise) tem custo de infraestrutura e nenhuma taxa por token. Para uma carga de trabalho que processa milhões de tokens por dia, essa diferença é substancial. O trade-off é o cluster de GPUs, a manutenção e o trabalho de escalabilidade que uma API gerenciada esconde. A licença MIT reduz o atrito jurídico além do econômico.

Um cubo geométrico aberto de estrutura de arame feito de finas hastes de latão apoiado sobre um pedestal de concreto claro

A quantização é a outra alavanca. Com pesos quantizados, o modelo supostamente roda em hardware de nível de consumidor, o que abre um caminho auto-hospedado para aplicações sensíveis à privacidade, como agentes que lidam com prontuários médicos ou bases de código proprietárias.

A nota de segurança que vale a pena ler

Uma descoberta merece atenção antes que alguém trate pesos abertos como almoço grátis. A avaliação de red team da Anthropic relatou que o GLM-5.3 exibe capacidades cibernéticas autônomas da classe Mythos, com salvaguardas fracas contra o uso indevido de pesos abertos. Pesos abertos não podem ser recolhidos. Uma vez baixado, o modelo permanece em posse da organização que o implantou indefinidamente.

Isso cria um problema específico de implantação. Um modelo de pesos abertos rodando dentro de um framework de agentes precisa de camadas de contenção que um provedor de API fechada gerencia do seu próprio lado. A licença MIT elimina a dependência de fornecedor e também elimina as garantias de segurança fornecidas pelo fornecedor. Equipes que implantam o GLM-5.2 em um loop de agentes devem orçar para contenção em tempo de execução, não tratar isso como problema de outra pessoa.

Por que este lançamento tem impacto diferente

Muitos modelos abertos são lançados a cada mês. O GLM-5.2 chega de forma diferente por três razões que se acumulam.

A licença é genuinamente permissiva numa escala de parâmetros em que isso é raro. A maioria dos lançamentos abertos de classe frontier vem com uma condição comercial, um limite territorial ou um teto de usuários. O GLM-5.2 não tem nada disso.

O caminho de hardware é independente da NVIDIA. Para compradores que tratam o risco da cadeia de suprimentos como preocupação de primeira ordem, isso muda a lista de finalistas independentemente da posição em benchmarks.

E a eficiência computacional em contexto longo torna sessões sustentadas de múltiplas etapas economicamente viáveis em clusters menores do que um modelo como o Nemotron 3 Ultra, da NVIDIA, que precisa de nós 8xH100 no seu mínimo documentado.

O GLM-5.2 não é o melhor modelo em todas as tarefas, e a ressalva de segurança é real. Mas como sinal do que um lançamento aberto pode ser agora — competitivo na fronteira, com licença permissiva e construído sem GPUs fabricadas nos EUA —, é o mais claro deste ciclo.

A família ao redor do carro-chefe

Ajuda ver o GLM-5.2 como o topo de uma escada em vez de um lançamento isolado. A família GLM vai do leve GLM-4.6V-Flash, com 9B, voltado para implantação em borda, até o carro-chefe de 744B. Variantes especializadas incluem o GLM-5V-Turbo para tarefas de visão multimodal e o framework de agentes AutoGLM para planejamento complexo de múltiplas etapas.

A licença permissiva se aplica a toda essa escada, que é a parte que importa para equipes escolhendo uma stack. Uma empresa pode prototipar no modelo pequeno de borda, escalar para o carro-chefe e alternar entre eles sem renegociar direitos a cada passo. Essa continuidade é incomum no ecossistema aberto, onde as licenças frequentemente diferem entre lançamentos pequenos e grandes de um mesmo laboratório.

O que a alegação de eficiência significa na prática

A redução de 2,9× no cálculo por token em contexto total é o tipo de número que parece uma especificação até você associá-lo a uma carga de trabalho.

Considere um agente que raciocina sobre uma grande base de código ou um longo conjunto de documentos. Cada etapa relê um contexto crescente, e o custo dessa releitura é o que torna sessões longas caras. Uma redução de quase três vezes no topo da janela de contexto baixa o ponto em que uma sessão de longa duração deixa de valer a pena. A sessão ainda custa dinheiro, mas o ponto de equilíbrio se desloca.

É também por isso que o caminho de quantização importa. Com pesos quantizados, o modelo supostamente roda em hardware de nível de consumidor, o que transforma um agente de contexto longo de algo que precisa de um cluster em algo que uma equipe pequena pode executar localmente. Para uma aplicação que lida com dados sensíveis, como prontuários médicos ou código-fonte proprietário, executar localmente é a única implantação que se ajusta à restrição de conformidade, e o custo é um benefício secundário.

Onde a ressalva de segurança pesa

A descoberta do red team é fácil de arquivar como problema de outra pessoa. Não é, e a razão é estrutural.

Um provedor de API fechada pode atualizar um modelo, mudar uma política ou cortar um caso de uso indevido depois do fato. Um lançamento de pesos abertos remove essa alavanca. Os pesos, uma vez baixados, permanecem em posse da organização que os implanta, e nenhum fornecedor pode revogá-los. Esse é todo o ponto dos pesos abertos, e é também por isso que a contenção precisa ser construída pela equipe que os implanta.

Na prática, isso significa que um agente rodando GLM-5.2 precisa da mesma disciplina de execução que uma equipe aplicaria a qualquer ferramenta poderosa com acesso de escrita: permissões com escopo, um sandbox para ações não confiáveis, logs que sobrevivem a uma falha e um caminho de escalonamento humano para decisões consequentes. Nada disso é fornecido pela licença, e nada disso vem de graça com os pesos. Os termos da MIT removem a dependência de fornecedor no lado jurídico e, por design, removem a segurança fornecida pelo fornecedor no lado operacional.

Artigos relacionados