← Voltar ao blog
Aicerca de 8 min de leitura

Os Novos Modelos Abertos da China Estão Sendo Treinados para Ser Substratos de Agentes

Publicado 3 de out. de 2026
Os Novos Modelos Abertos da China Estão Sendo Treinados para Ser Substratos de Agentes

Três lançamentos de modelos de laboratórios chineses na última semana compartilham um instinto de design que é fácil de ignorar se você os ler como uma lista de contagens de parâmetros. Nenhum deles foi construído para ser bom em conversação.

Eles foram construídos para ser aquilo sobre o que um agente roda. Esse é um alvo diferente, e as escolhas de treinamento que decorrem disso parecem estranhas se você assume que o objetivo é um chatbot melhor.

Treinando a tarefa e o mundo ao seu redor

O exemplo mais claro é o IQuest-Q1, lançado pelo ZhiZhi Innovation Research Institute em 29 de setembro. É um modelo esparso de mistura de especialistas com 320 bilhões de parâmetros totais, 15 bilhões ativos e uma janela de contexto de 524.288 tokens. A arquitetura é desinteressante perto de seu método de treinamento.

Em vez de ajustar em transcrições de conversas humanas ou em conjuntos de instruções estáticos, a equipe sintetizou tarefas e os ambientes em que elas acontecem juntos. O modelo então treinou em vários scaffolds de agentes diferentes. Ele manteve as ferramentas nativas e o gerenciamento de contexto de cada scaffold intactos, e tratou apenas os erros do próprio modelo como sinal de aprendizado. O harness não teve permissão para se tornar a lição. Depois, quatro modelos especialistas foram fundidos em um por meio de destilação multi-professor on-policy.

Isso importa por causa de um problema que qualquer pessoa que constrói agentes já encontrou. Um modelo que pontua bem em um benchmark pode desmoronar quando você o envolve em suas próprias ferramentas, porque ele aprendeu as peculiaridades do harness de outra pessoa. Treinar em vários scaffolds mantendo o harness constante ataca essa falha específica. O resultado relatado é um modelo que fica logo atrás do Claude Opus 5 em tarefas de linguagem natural para repositório, o que é uma coisa estranha de se ser bom e exatamente o que um agente de codificação precisa.

Ver e decidir no mesmo passo

O segundo lançamento toma uma rota diferente para o mesmo objetivo. No mesmo dia, o Shanghai AI Laboratory introduziu um modelo de decisão chamado Shusheng Mingjue, em três tamanhos: 0,8B, 2B e 4B. Ele é pequeno de propósito.

O princípio de design é que percepção e decisão não devem ser estágios separados. A maioria das pilhas de agentes tira uma captura de tela, entrega-a a um modelo de visão, obtém uma descrição, passa a descrição para um planejador e age. Cada salto adiciona latência e perde detalhes. Mingjue funde a percepção visual nativa com o seguimento de instruções para que o modelo olhe para uma tela e tome uma decisão em uma única passada. O laboratório relata que ele supera o Jev e modelos abertos comparáveis em qualidade de decisão. Para um agente que precisa agir dentro de um ambiente dinâmico, o tamanho é o ponto: um modelo de 4B pode rodar perto do loop, e um de 320B não.

Excluindo a camada de atenção para alcançar um milhão de tokens

O terceiro lançamento é o mais agressivo arquiteturalmente. O Naive N0.5 Flash, do laboratório de Pequim NaiveAI, é um modelo de mistura de especialistas com 309 bilhões de parâmetros, com 15,5 bilhões de parâmetros ativos, construído sobre o MiMo-V2.5 da Xiaomi. Ele suporta nativamente um contexto de um milhão de tokens e é distribuído sob a licença MIT.

A parte interessante é o que ele removeu. O modelo usa um híbrido de atenção de janela deslizante e atenção esparsa do DeepSeek, e não tem nenhuma camada de atenção completa. A atenção padrão do transformer escala quadraticamente com o comprimento da sequência, razão pela qual contexto longo tem sido historicamente caro. Remover a atenção completa é uma aposta de que a informação útil em uma sequência longa pode ser alcançada através de esparsidade estruturada, e se isso se sustentar, muda o que um agente pode manter em vista de uma só vez. Um milhão de tokens é aproximadamente um grande repositório, ou o equivalente ao histórico de uma longa sessão de trabalho, mantido sem truncamento.

Os lançamentos menores apontam na mesma direção

O padrão aparece além desses três. O Puro-2B da Tsinghua foi treinado por cerca de US$ 4.400 e supera um modelo Qwen maior em quinze tarefas, em média. Um laboratório de telecomunicações lançou o TeleOCR, um modelo de análise de documentos de 1,2B que liderou um benchmark de compreensão de documentos. Stanford e NVIDIA lançaram um verificador contrastivo que escolhe a melhor ação candidata por alinhamento de embeddings em vez de raciocínio, e relata grandes ganhos de velocidade sobre um modelo juiz comparável.

Cada um desses é um componente em um agente, não um destino para um usuário. Um verificador que classifica ações candidatas de forma barata, um modelo pequeno que analisa documentos, um modelo minúsculo que decide o que clicar. As peças estão se especializando e ficando pequenas, enquanto o modelo que mantém o contexto de toda a sessão fica muito grande.

O problema de avaliação que ninguém resolveu

Há um buraco atravessando tudo isso. Os benchmarks para modelos base de agentes ainda são em sua maioria emprestados da avaliação de chatbots, que mede as coisas erradas. Um modelo pode pontuar bem em um teste de raciocínio e ainda assim ser um substrato ruim para um agente, porque as propriedades que importam só aparecem ao longo de uma sessão: quantos turnos passam antes de o contexto se degradar, se uma chamada de ferramenta que falha é repetida de forma sensata, se o modelo percebe que perdeu o rastro do objetivo original.

A maioria dos números relatados aqui vem dos próprios laboratórios, em benchmarks que eles ajudaram a definir. IQuest-Q1 "logo atrás do Claude Opus 5" em tarefas de linguagem natural para repositório é uma comparação de fornecedor. Mingjue "superando o Jev" é uma alegação de fornecedor. A ausência de atenção completa no Naive N0.5 Flash é um fato arquitetural fácil de verificar e cujas consequências práticas ainda não foram medidas em escala. Nada disso torna a direção errada. Significa que o estado honesto do jogo é que temos três designs interessantes e muito pouca evidência independente sobre qual deles se sustenta quando um agente roda por seis horas.

A lacuna está começando a ser reconhecida. Grupos independentes têm construído benchmarks voltados para serviço em produção em vez de geração de código, e para sequestro de agentes em vez de segurança de modelos, o que sugere que o campo sabe que tem medido a camada errada. Até que esses amadureçam, o sinal útil de um lançamento como este não é a pontuação. É o método de treinamento, porque um método que aborda um modo de falha conhecido de agentes tem mais probabilidade de ser real do que um número que aborda um leaderboard.

Há mais uma consequência da mudança que é fácil de ignorar. Se os modelos importantes se tornarem pequenos componentes em vez de grandes destinos, então a vantagem de um laboratório deixa de vir de ter o maior modelo e começa a vir de saber como as peças se encaixam. Uma equipe que consegue treinar um modelo de decisão rápido, um analisador de documentos barato e um verificador, e conectá-los em um loop que roda em hardware modesto, tem algo que um único checkpoint gigante não consegue igualar. Esse é um tipo diferente de competição, mais próximo de engenharia de sistemas do que de escalonamento, e os lançamentos deste mês sugerem que pelo menos algumas equipes chinesas já se reorientaram nessa direção.

Por dois anos, a corrida de pesos abertos foi medida por quão perto um modelo gratuito conseguia chegar de um chatbot de fronteira. Esse enquadramento está perdendo força. A qualidade de chat tornou-se uma linha de base, e as perguntas que decidem se o software funciona mudaram para um terreno diferente: quantos turnos antes de o contexto se degradar, quão rápido o modelo pode agir dentro de um loop, quão bem ele tolera ser inserido no ferramental de outra pessoa.

Os modelos que respondem a essas perguntas não vencerão muitos leaderboards. Eles vencerão a competição menos visível de qual deles um desenvolvedor procura quando o chatbot já fez seu trabalho e o trabalho precisa realmente acontecer. Essa competição se desenrolou silenciosamente esta semana, em três lançamentos que não estavam tentando impressionar ninguém com conversação.

Artigos relacionados