← Voltar ao blog
Aicerca de 7 min de leitura

Qwen3.8-Max, da Alibaba, afirma que consegue programar sozinho por uma quinzena

Publicado 5 de out. de 2026
Qwen3.8-Max, da Alibaba, afirma que consegue programar sozinho por uma quinzena

Em 2 de outubro, a equipe Qwen da Alibaba lançou o Qwen3.8-Max, um modelo de mistura de especialistas com 2,4 trilhões de parâmetros que a empresa descreve como competente em centenas de tipos de tarefas, incluindo direito, finanças e design. A afirmação que mais chamou atenção era mais restrita do que a contagem de parâmetros. Segundo o anúncio, o modelo consegue trabalhar de forma autônoma em programação por mais de uma dúzia de dias para entregar um projeto completo.

Contagens de parâmetros deixaram de ser novidade há algum tempo. "Doze dias" é o número que vale examinar, porque descreve um tipo diferente de capacidade em relação às demos que a maioria dos modelos traz.

Uma tarefa versus um projeto

A maioria dos benchmarks de modelos de programação mede uma única unidade de trabalho: escrever uma função, corrigir um bug, responder a uma pergunta sobre um repositório. O horizonte é de minutos. Um modelo que passa nesses testes demonstrou que consegue produzir uma saída correta quando o problema está totalmente especificado e o resultado é verificável em uma única etapa.

Um projeto que leva doze dias não é uma função mais longa. É uma sequência de decisões em que cada uma restringe a seguinte e em que o modelo precisa manter um projeto em mente ao longo de milhares de edições. Os modos de falha mudam. Um modelo 95% correto por etapa é um assistente excelente para uma tarefa de cinco minutos e um risco em uma de duas semanas, porque os erros se acumulam e ninguém está acompanhando cada edição.

É por isso que a afirmação sobre o horizonte importa mais do que a contagem de parâmetros. Ela desloca a questão da capacidade para a confiabilidade.

O que um horizonte longo realmente exige

Três coisas precisam funcionar, e nenhuma delas é puramente uma propriedade do modelo.

Memória e gestão de estado vêm primeiro. Doze dias de trabalho não cabem em uma janela de contexto, por maior que ela seja. O sistema precisa externalizar o estado da tarefa, gravar resultados intermediários em disco e retomar a partir de um checkpoint após uma interrupção. Isso é infraestrutura em torno do modelo, e sua correção determina se uma execução longa sobrevive a um reinício.

A autocorreção vem em segundo lugar. Ao longo de um horizonte longo, o modelo vai tomar caminhos errados. Sem um humano revisando cada etapa, ele precisa de uma forma de perceber que uma abordagem está falhando e revisá-la antes que a falha se espalhe. Isso significa que o modelo precisa avaliar sua própria saída intermediária em relação ao objetivo original, o que é uma tarefa mais difícil do que gerar a saída em si.

A estabilidade das ferramentas vem em terceiro lugar. Um projeto de vários dias vai tocar em uma base de código, um executor de testes, documentação e, provavelmente, um gerenciador de pacotes. Cada chamada de ferramenta é uma chance de incompatibilidade entre o que o modelo espera e o que o ambiente retorna. Ao longo de milhares de chamadas, a cauda dessa distribuição é o que encerra a execução.

Somadas, a afirmação dos doze dias é uma afirmação sobre um sistema inteiro: o modelo, mais a estrutura de execução (harness), mais o ambiente. Essa é uma maneira útil de lê-la, porque indica onde procurar quando algo falha.

O debate sobre o harness é o subtexto

O momento do lançamento não é acidental. Há um debate ativo entre pesquisadores de agentes sobre quanta estrutura (scaffolding) um modelo forte ainda precisa. A questão é se modelos melhores tornam obsoletos os frameworks elaborados de agentes, ou se é do framework que vem a confiabilidade.

Uma afirmação de trabalho autônomo ao longo de doze dias fica de um lado desse argumento. Ela implica que o modelo pode carregar o peso e que o framework é um coadjuvante. Mas os três requisitos acima sugerem o contrário: é o framework que torna o horizonte possível, e o modelo é um componente dentro dele.

As duas leituras podem ser verdadeiras ao mesmo tempo, o que provavelmente é a maneira mais justa de colocar a questão. Modelos mais fortes reduzem quanta orientação constante uma tarefa exige e também elevam o teto do que um harness bem construído pode realizar. Um modelo capaz de planejar em um horizonte longo vale mais dentro de um bom harness, não menos.

A metade de escritório da afirmação

O anúncio combina programação com trabalho de escritório, e essa combinação não é casual. Ambas são categorias em que a saída é verificável, e é isso que torna a autonomia viável. Uma planilha com erro de fórmula pode ser testada. Um contrato com uma cláusula faltante pode ser revisado com base em uma lista de verificação. O modelo não precisa estar certo sobre o mundo em geral, apenas sobre uma tarefa com resposta verificável.

É também por isso que a afirmação é mais restrita do que parece à primeira vista. Um modelo que consegue operar de forma autônoma por duas semanas em uma base de código não é o mesmo que um modelo que consegue operar de forma autônoma por duas semanas em uma questão de pesquisa aberta, em que ninguém consegue dizer se o trabalho está correto até muito depois. O enquadramento divulgado mantém a promessa dentro do domínio em que existe feedback.

Lida dessa forma, a cifra de doze dias se torna uma declaração tanto sobre verificação quanto sobre capacidade. Quanto mais longo o horizonte, mais o sistema depende de conseguir verificar seu próprio trabalho.

Há uma lógica comercial na escolha desses dois domínios. Programação e trabalho de escritório são áreas em que as empresas já têm orçamento e em que a saída pode ser avaliada sem um especialista. Um modelo que automatiza uma tarefa de desenvolvimento de duas semanas tem retorno mensurável. Um modelo que escreve poesia, não.

Como avaliar a afirmação

Ignore a contagem de parâmetros e procure três detalhes específicos.

Pergunte o que "autônomo" significa na prática. Uma execução de doze dias com checkpoints humanos ocasionais é um produto diferente de uma que segue sem supervisão. As empresas raramente informam onde estão os checkpoints, e esse detalhe determina a utilidade mais do que a duração total.

Pergunte o que a execução produziu. Um projeto concluído é um artefato testável. Um repositório, uma suíte de testes que passa e uma implantação funcional podem ser verificados. Capturas de tela e demos narradas, não.

Pergunte o que aconteceu quando quebrou. Execuções longas falham, e a informação interessante está em como. Um modelo que detecta um beco sem saída e retrocede é muito mais útil do que um que segue em frente e produz um resultado aparentemente plausível que não roda.

O que isso diz sobre o mercado

O fato de a Alibaba lançar um modelo de ponta voltado para programação e trabalho de escritório, em vez de chat geral, é uma declaração sobre onde está o valor. O mercado de chatbots de consumo está saturado e é difícil de monetizar. O trabalho pelo qual as empresas pagarão é o trabalho que substitui ou amplia horas, e esse trabalho tem horizontes longos.

Se a afirmação dos doze dias se sustentar, mesmo que parcialmente, o efeito prático é que uma equipe pequena pode tentar projetos que antes exigiam uma equipe maior. Se não se sustentar, o modelo continua sendo um forte assistente de programação com um contexto grande, e a frase dos doze dias vai desaparecer do marketing por conta própria. De qualquer forma, o enquadramento é a parte útil. A capacidade agora é medida tanto por quanto tempo um modelo consegue continuar trabalhando sem supervisão quanto pelo que ele consegue fazer de uma só vez.

Artigos relacionados