Ling 3.1 Flash, da Ant Group, ativa 25B de 560B parâmetros e alcança 41

--- title: Ling 3.1 Flash, da Ant Group, ativa 25B de 560B parâmetros e alcança 41 meta_title: Ling 3.1 Flash coloca 560B parâmetros por trás de uma conta de 25B meta_description: O Ling 3.1 Flash, da Ant Group, pontua 41 no Intelligence Index com 25B parâmetros ativos de 560B no total, mostrando até onde o MoE esparso consegue chegar. ---
A AntLingAGI, da Ant Group, lançou o Ling 3.1 Flash em 6 de outubro. O número que se destaca são os 25 bilhões de parâmetros que realmente são ativados quando o modelo roda, de um total de 560 bilhões.
O modelo pontuou 41 no Índice de Inteligência da Artificial Analysis, um avanço claro em relação ao seu antecessor. A avaliação destacou as capacidades agênticas como a área de melhoria mais acentuada, que é a categoria que os compradores corporativos começaram a ponderar com mais força.
A arquitetura é o argumento
O Ling 3.1 Flash é um modelo de mistura de especialistas. Ele contém 560 bilhões de parâmetros no total, mas ativa cerca de 25 bilhões por token, e oferece suporte a uma janela de contexto de até um milhão de tokens.
Essa proporção é todo o argumento de venda. Um modelo denso de capacidade comparável precisaria mover todos os parâmetros para cada token gerado. Ao encaminhar cada token por um pequeno subconjunto de especialistas, um modelo esparso entrega uma saída semelhante tocando em muito menos computação. O trade-off é a memória: todos os 560 bilhões de parâmetros ainda precisam estar residentes em algum lugar, mesmo que a maioria fique ociosa em qualquer forward pass.

A consequência prática é um modelo que pode ser servido a uma fração do custo de um equivalente denso no mesmo nível de qualidade, desde que a equipe tenha o hardware para manter os pesos. É a mesma história de engenharia que impulsionou a maioria dos lançamentos abertos de fronteira neste ano, e é por isso que a métrica interessante passou de parâmetros totais para parâmetros ativos.
O que os benchmarks cobrem
A Ant Group publicou resultados em uma série de avaliações: GDPVal-AA v2.1 com 1673 Elo, FrontierSWE com 75.16, HealthBench com 65.35, e Design Arena, onde ele fica perto do topo para aplicativos móveis e geração de SVG.
A pontuação de 41 no Intelligence Index é a manchete, e coloca o modelo na companhia de lançamentos de laboratórios muito maiores. A Ant Group afirma que o modelo completo terá código aberto, com documentação já publicada. Enquanto isso, está em andamento um teste gratuito de duas semanas.
As demonstrações de engenharia são mais reveladoras do que as pontuações
A Ant Group também descreveu três exemplos práticos, e eles dizem mais sobre o uso pretendido do que um ranking.
O primeiro: construir um compilador de Lua para x86 do zero, passando em 178 de 182 testes. É uma tarefa em que o modelo precisa manter uma grande especificação em mente, produzir código internamente consistente em vários arquivos e acompanhar casos de borda o tempo todo. O trabalho pune modelos com tratamento fraco de contexto longo.
O segundo: acelerar a verificação de tipos em uma grande base de código Python. Esta é uma tarefa de manutenção, e não um projeto a partir do zero, que é onde a maior parte do tempo real de engenharia de fato vai. Um modelo que consegue raciocinar sobre as relações de tipo de um repositório existente é útil de uma forma que um modelo que escreve funções novas não é.
O terceiro: construir um agente de desktop que coordena um navegador, arquivos locais e ferramentas de terminal. A orquestração de múltiplas ferramentas é a fronteira atual do trabalho agêntico, e é a capacidade para a qual o salto nos benchmarks aponta.
Todos os três são relatos da empresa e não foram reproduzidos de forma independente. A alegação do compilador com 182 testes, em particular, precisaria de verificação externa, já que passar nos testes só é significativo se os testes forem representativos. Um compilador que lida com sintaxe comum e falha nos casos incomuns ainda pode ter uma boa pontuação em uma suíte escrita na mesma semana que o modelo.
Há também um padrão mais amplo a observar aqui. Laboratórios chineses têm usado cada vez mais demonstrações de engenharia, em vez de pontuações de benchmark, como sua principal estratégia de marketing, porque os benchmarks se tornaram ambíguos e as demonstrações são concretas. O trade-off é que uma demonstração mostra uma trajetória pelo espaço do problema, e nada sobre a distribuição dos resultados.
O arco mais longo: o que os pesos abertos chineses continuam fazendo
O Ling 3.1 Flash se encaixa em um padrão que se manteve o ano todo. Laboratórios chineses lançam pesos abertos em escala de fronteira com licenças permissivas em um ritmo que nenhum laboratório ocidental igualou, e competem em eficiência, e não em escala bruta.
Vale explicitar o contexto. Um desenvolvedor que roda um desses modelos é dono da pilha de inferência, o que significa nenhum custo de API por token, nenhum dado saindo do prédio e nenhum terceiro decidindo quando o modelo muda. Para equipes com restrições de privacidade ou cargas de trabalho previsíveis, mas pesadas, isso vale dinheiro de verdade.
Victor Taelin observou neste mês que nenhum modelo aberto permanece no top 25 dos rankings da Artificial Analysis, com o melhor, o MiMo da Xiaomi, na 26ª posição. O Ling 3.1 Flash, com 41 no Intelligence Index, é uma pontuação de inteligência, e não um ranking, então os dois números medem coisas diferentes, e a lacuna entre o melhor modelo aberto e o melhor modelo fechado ainda é real. O que mudou é que a lacuna agora é medida em pontos, e não em se um modelo aberto consegue ou não fazer o trabalho.
O que isso significa para quem escolhe um modelo
Três considerações importam mais do que a proporção de parâmetros.
Termos de licença e implantação. A Ant Group afirma que o modelo será aberto, mas a licença específica determina se o uso comercial é irrestrito. Dado que “pesos abertos” e “licença permissiva” são usados de forma intercambiável com tanta frequência, quando não são a mesma coisa, os termos merecem uma leitura cuidadosa antes de qualquer dependência em produção. A mesma cautela se aplica à documentação publicada antes do lançamento, que descreve capacidades, e não obrigações.
A alegação da janela de contexto. Um milhão de tokens é um número grande, mas o contexto utilizável costuma ser menor do que o anunciado. Se o modelo mantém a qualidade ao longo de toda a janela, ou se degrada bem antes disso, é a pergunta que determina a utilidade para trabalho com documentos longos e repositórios grandes. As próprias demonstrações de contexto longo da Ant Group sugerem que o modelo lida com entradas grandes, embora, de novo, sejam testes do fornecedor.
O requisito de memória. Um modelo esparso de 560B não é uma implantação em laptop. A história dos parâmetros ativos reduz a computação por token, não o espaço ocupado pelos pesos, e quem planeja hospedar por conta própria deve dimensionar o hardware pelo total, não pela contagem de ativos. Essa distinção confunde as pessoas com frequência. Um modelo descrito como ativando 25B parâmetros parece pequeno até você tentar carregá-lo, momento em que os 560B completos precisam caber em algum lugar.
Há também uma questão prática de suporte. Um modelo de um laboratório que lança com frequência será substituído, e as equipes devem planejar um caminho de migração. O ritmo de lançamentos da Ant Group sugere que Ling 3.2 ou Ling 4 é questão de meses, o que é bom para a capacidade e incômodo para quem construiu um fine-tune ou um script de implantação em torno de uma versão.
O Ling 3.1 Flash é um lançamento competente de um laboratório que vem entregando de forma constante. A verdadeira notícia é estrutural: um modelo com 25B ativos agora pode, de forma crível, sentar-se na mesma conversa que sistemas densos muito maiores. Esse é o argumento que toda a linha de trabalho de MoE esparso vem defendendo, e os benchmarks finalmente estão começando a sustentá-lo.
Artigos relacionados
Google Flow e Adobe Firefly tiram o vídeo com IA da caixa de chat
A qualidade dos modelos de base convergiu o suficiente para que o diferencial tenha se deslocado para o que cerca o modelo.
Google corta pela metade o preço de saída do Nano Banana 2.1 e corrige seus recursos mais fracos
O detalhe mais consequente está fora da lista de recursos, e é o preço.
Vida quer cobrar por agentes de IA por resultados em vez de uso
A cobrança baseada em uso alinha a receita do fornecedor ao fato de o agente levar mais tempo. A precificação por resultados inverte isso.
Voice 3 e PACT da Decagon preparam o suporte ao cliente para agentes do outro lado da linha
Os sistemas de suporte passaram décadas modelando o comportamento humano. Agora, uma fração das solicitações recebidas são máquinas agindo em nome de pessoas.