← Voltar ao blog
Aicerca de 8 min de leitura

Modelos domésticos de grande porte se abrem em código aberto em setembro: desta vez, a disputa é por “ser acessível”

Publicado 2 de out. de 2026
Modelos domésticos de grande porte se abrem em código aberto em setembro: desta vez, a disputa é por “ser acessível”

Setembro ainda não chegou à metade e quem faz avaliações já está um pouco atrás do ritmo de atualizações dos grandes modelos domésticos chineses. Os lançamentos de Zhipu, Meituan, ModelBest, Tencent e Ant caíram quase todos na mesma janela de tempo, cobrindo desde grandes modelos de propósito geral até modelos pequenos de borda, passando por geração de imagens e IA incorporada. Além do burburinho, o que realmente merece atenção é o caminho que escolheram em uníssono: os parâmetros não foram empilhados sem critério; pelo contrário, o esforço foi em “como tornar o modelo acessível e implantável”.

Começando pela Zhipu. O GLM-5.3-Flash, lançado em setembro, tem 320 bilhões de parâmetros totais, mas apenas 18 bilhões de parâmetros ativos participam de fato do cálculo a cada vez. A ideia de ativação esparsa é direta: aumentar o modelo e ativar apenas uma pequena parte em cada inferência, reduzindo custo e latência. Ele é aberto sob licença MIT, tem suporte nativo a multimodalidade e custa cerca de US$ 0,25 por milhão de tokens de saída. Uma frase ainda mais pesada na nota de lançamento: o serviço de inferência roda inteiramente em chips de IA nacionais, com desempenho ponta a ponta cerca de três vezes superior ao benchmark inicial, além de alcançar a escala de 100 trilhões de tokens gratuitos por dia. Para desenvolvedores, essa frase pesa mais do que qualquer número na tabela de parâmetros.

Do lado da Meituan, veio o LongCat-2.0, com 1,6 trilhão de parâmetros totais e suporte nativo a contexto de 1 milhão de tokens. Seu destaque não está no tamanho, mas no terreno de treinamento: segundo a empresa, é o primeiro grande modelo de código aberto com parâmetros de escala de trilhão do setor a concluir todo o fluxo de treinamento e inferência em um cluster de computação nacional de dez mil GPUs. Vieram junto a bancada de operações com IA CatPaw e o agente de vida local “Xiaotuan”, que já respondeu a mais de 700 milhões de solicitações de usuários. Uma empresa que começou no setor de vida local levar um modelo de trilhão de parâmetros ao palco mostra que a estrutura de custos desse mercado está se afrouxando.

O MiniCPM5-2B da ModelBest segue a direção oposta: comprime os parâmetros para a casa dos 2 bilhões e mira os dispositivos de borda. Mantém a abordagem de sempre do MiniCPM — poucos parâmetros e aplicabilidade real —, podendo rodar em celulares ou dispositivos de borda. Quase na mesma época, a MiniMax abriu o Code CLI sob licença MIT, e a Zhipu acrescentou o GLM-5.3-FlashX, focado em alta taxa de transferência, com velocidade de inferência de cerca de 200 tokens por segundo. Com as três frentes — borda, aceleração de inferência e ferramentas de programação — completadas juntas, esse conjunto diz mais sobre o grau de maturidade do ecossistema do que um único “carro-chefe”.

Juntando tudo isso, uma tendência começa a ficar clara: o código aberto está se tornando um meio de competição, não uma questão de idealismo. MIT, pesos abertos, cotas gratuitas — essas ações têm um alvo bem prático: quem trouxer primeiro desenvolvedores e pequenas e médias empresas para seu ecossistema sai na frente na próxima rodada de volume de chamadas. Liderança em parâmetros sustenta um lançamento, mas não sustenta o ambiente de produção do dia a dia.

A linha de imagens também não ficou de fora. Em 4 de setembro, o Laboratório Bailing, do Ant Group, lançou e abriu o código da série LLaDA-Image, com versões Base e Turbo, cerca de 7 bilhões de parâmetros e um único checkpoint que suporta simultaneamente geração de imagem a partir de texto, edição com imagem de referência e renderização de texto em chinês e inglês, sem precisar de um ramo de edição adicional. O destaque é a versão Turbo, que usa destilação Twin-DMD para reduzir os passos de amostragem para 2 a 4, mantendo qualidade e velocidade ao mesmo tempo, e cuja inferência não depende de GPUs de ponta. No Qwen-Image-Bench, ela obteve 53,53 pontos em cenários em inglês e 53,38 em cenários em chinês, e a empresa afirma que são os melhores resultados atuais. Reduzir os passos dos usuais 50 para um dígito significa não apenas mais velocidade, mas também viabilizar a geração em tempo real em hardware de consumo.

No campo da IA incorporada, o Zidong Taichu abriu o código do ZDTaichu5.0-9B em 15 de setembro. Esse modelo de 9 bilhões de parâmetros conquistou oito primeiros lugares globais em sua categoria de parâmetros em compreensão espacial e tarefas incorporadas, alcançando 78,27 pontos no MindCube-tiny, 20,67 pontos percentuais acima do Qwen3.5-9B. Ele preenche a lacuna do “o que fazer depois de ver” nos robôs: reconhecer uma xícara responde apenas “o que é”; julgar a direção do cabo e se dá para colocar algo ao lado se aproxima de “o que é possível fazer”.

E há também a Tencent, impossível de ignorar. Em 22 de setembro, o Hunyuan lançou a prévia do Image 3.5, com melhorias focadas em geração de texto, composição visual, realismo e edição contínua, permitindo upload de até 5 imagens de referência por vez e saída de até 2K. O preço é de 0,15 yuan por imagem 2K, e a cobrança é apenas sobre a saída final. A data de lançamento também foi escolhida a dedo: bem no dia de abertura da Conferência Apsara da Alibaba Cloud. Esse tipo de “lançamento sincronizado” já não é novidade na China, mas, no caso de modelos de imagem, equivale a levar a competição do campo técnico diretamente para o campo da atenção e das portas de entrada do ecossistema.

Juntando todas essas ações, a linha principal de setembro pode ser resumida em três coisas: aceleração do código aberto, redução do preço da inferência e autonomia de computação. As três, na verdade, se encaixam. O código aberto reduz a barreira de uso; a inferência de baixo custo transforma essa barreira em volume real de chamadas; e a substituição por computação nacional determina se esse baixo custo pode se sustentar. O GLM-5.3-Flash ousa adotar MIT e cota gratuita; o LongCat-2.0 ousa rodar parâmetros de escala de trilhão em um cluster nacional de dez mil GPUs; por trás de ambos está o mesmo julgamento: só com custo controlável é possível entregar o modelo.

Para criadores comuns e pequenas e médias empresas, o impacto direto desta rodada de mudanças é que agora as contas fecham. No passado, quem queria usar modelos de ponta ou arcava com uma conta de API nada barata, ou juntava GPUs por conta própria; essas duas barreiras excluíam a maioria. Agora, uma imagem 2K por 0,15 yuan, geração de imagem em tempo real com 2 a 4 passos e modelos de borda que rodam com 2 bilhões de parâmetros comprimiram esses custos para uma faixa em que muitas pessoas realmente vão experimentar. Quando as ferramentas ficam mais baratas, o número de tentativas e erros aumenta, e a qualidade do trabalho costuma ser lapidada justamente nesse processo repetitivo.

Uma porta de cofre aberta revelando racks de servidores e um microchip brilhante, representando modelos de IA de código aberto em silício nacional

Também há pontos que exigem prudência. Licenças de código aberto cada vez mais permissivas não significam que o uso comercial não tenha custos: cláusulas não comerciais, conformidade de dados e controlabilidade do comportamento do modelo ainda precisam ser verificadas caso a caso em negócios reais. O aumento de três vezes no desempenho de inferência em chips nacionais baseia-se em comparações com benchmarks próprios, e a reprodução por terceiros ainda não acompanhou; ainda existem casos de modelos “abertos” cujo código de treinamento não foi divulgado, o que limita a reprodução e o desenvolvimento secundário. Números bonitos são uma coisa; entrega estável é outra.

Nesta onda densa de atualizações de setembro, o verdadeiro sinal não é “a China conseguiu mais alguns primeiros lugares”, mas sim que a lógica de custos de todo o lado da oferta está sendo reorganizada. Quando o próprio modelo se parece cada vez mais com infraestrutura, a disputa se desloca para o downstream: quem tem o fluxo de trabalho mais fluido, quem captura o cenário com mais precisão, quem consegue transformar computação barata em obras estáveis. O código aberto apenas disparou o tiro de largada; ainda há um longo caminho a percorrer.

Artigos relacionados