Alibaba abre o código do multimodal 30B: 3 bilhões de parâmetros ativados, desafiando o GPT-5-Mini de frente

Em 4 de outubro, a equipe do Tongyi Qianwen da Alibaba Cloud lançou de uma só vez as versões Instruct e Thinking do Qwen3-VL-30B-A3B, acompanhadas de pesos quantizados em FP8; na mesma ocasião, também apresentou a versão FP8 do Qwen3-VL-235B-A22B, um degrau acima. O boletim oficial é direto: em cinco frentes — raciocínio STEM, perguntas e respostas visuais, reconhecimento de texto por OCR, compreensão de vídeo e tarefas de Agent —, o modelo é colocado frente a frente com o GPT-5-Mini e o Claude 4-Sonnet, e em alguns itens sai até na frente.
O que realmente merece uma pausa é aquele A3B no nome.
Casca de 30B, apetite de 3B
O Qwen3-VL-30B-A3B tem um total de 30 bilhões de parâmetros, mas a cada inferência apenas cerca de 3 bilhões realmente participam do cálculo. Trata-se da típica arquitetura de mistura de especialistas (MoE): o modelo mantém internamente um grande número de especialistas e, ao processar cada token, seleciona apenas um pequeno punhado dos mais adequados para trabalhar, enquanto os demais ficam parados.

Pensar nisso como uma empresa torna tudo mais intuitivo. A empresa tem trinta mil funcionários, mas cada projeto específico só precisa destacar três mil especialistas adequados, enquanto os demais continuam de prontidão. A reserva de capacidade da empresa é de nível trinta mil pessoas, mas o custo de mão de obra de um projeto específico fica próximo de três mil pessoas.
Os benefícios dessa estrutura são bastante práticos. O consumo de memória de vídeo e a velocidade de inferência ficam mais próximos de um modelo denso bem menor que 30B, enquanto o teto de capacidade ainda preserva uma base de nível 30B. Para equipes que precisam rodar capacidades multimodais localmente ou em ambiente privado, essa é justamente a combinação mais difícil de reunir nos últimos anos: ter um desempenho comparável ao dos modelos proprietários de ponta sem exigir uma placa abarrotada de memória de vídeo.
Por que o boletim é divulgado nessas cinco direções
As direções escolhidas oficialmente para comparação são exatamente os campos de batalha onde a aplicação do multimodal é mais intensa.
O OCR atende a necessidades essenciais como digitalização de documentos, reconhecimento de notas fiscais e extração de texto de capturas de tela. A compreensão de vídeo é a porta de entrada da produção de conteúdo na era dos vídeos curtos: quem consegue entender vídeo consegue transformá-lo em material pesquisável e editável. O Agent faz com que o modelo não apenas entenda, mas também aja — esta é a linha principal em que praticamente todo o setor está apostando este ano. STEM e VQA são o passaporte para cenários de alto valor como educação, pesquisa científica e inspeção de qualidade industrial.
O fato de um modelo com apenas 3 bilhões de parâmetros ativados conseguir medir forças com as flagships de código fechado nessas frentes tem, por si só, um significado muito mais revelador do que qualquer pontuação isolada. Isso mostra que a densidade de capacidade continua sendo recomprimida: para o mesmo desempenho, a computação necessária está caindo; ou, dito de outra forma, com a mesma computação é possível obter mais capacidade.
A carta do código aberto: o alvo é o custo de implantação
Nesta rodada, o Tongyi não lançou apenas uma versão. A Instruct é voltada para o acompanhamento de instruções e perguntas e respostas convencionais; a Thinking segue o caminho de raciocínio de pensar primeiro e responder depois; e os pesos em FP8 são destinados a quem quer encaixar o modelo inteiro em uma memória de vídeo limitada.
As três versões lançadas juntas apontam para a mesma coisa: levar o multimodal de “chamadas de API na nuvem” para “implantação própria”. Assim que os pesos podem ser baixados, quantizados e executados em servidores privados, a lógica de compra muda. Antes, as empresas calculavam quanto custava cada milhão de tokens; agora há mais uma opção, que calcula quanto custa cada milhão de tokens diluindo o custo das próprias placas de vídeo. Para equipes com alto volume de uso, a conta da segunda opção costuma ser mais vantajosa — e os dados não saem da rede interna.
Essa também tem sido a direção de ataque mais consistente dos modelos de código aberto chineses no último ano. Não se trata mais apenas de comparar quem tem mais parâmetros ou melhor posição nos rankings, mas de ver quem consegue fazer mais pessoas usarem o modelo com uma barreira de entrada menor. Quando a diferença de capacidade é reduzida a uma faixa aceitável, preço e disponibilidade passam a ser os verdadeiros fatores decisivos.
O outro lado do código aberto
A divulgação dos pesos significa que qualquer pessoa pode baixá-los, ajustá-los finamente e redistribuí-los. A vantagem é que o ecossistema se expande rapidamente: versões quantizadas, versões ajustadas para setores específicos e versões adaptadas para dispositivos de borda surgirão logo na comunidade. O risco também é claro: uma vez que o modelo sai do campo de visão de quem o publicou, quem o publicou praticamente não tem como restringir onde e como ele é usado.
Para os desenvolvedores, isso, na verdade, coloca o poder de escolha em suas próprias mãos. Você precisa conhecer seus limites de conformidade, saber se os dados podem sair do país e entender os termos de licença de redistribuição. O código aberto lhe entrega a ferramenta e, ao mesmo tempo, a responsabilidade.
O que observar a seguir
A comparação nessas cinco direções é apenas o ponto de partida. O que realmente determina se um modelo multimodal consegue se firmar em produção raramente é a pontuação em um determinado benchmark, mas sim se ele vai falhar de repente ao longo de dezenas de tarefas consecutivas, e a sua estabilidade diante de documentos reais, vídeos reais e entradas reais e confusas.
Se esse caminho dos 3 bilhões de parâmetros ativados pode continuar subindo depende da eficiência de roteamento de especialistas da próxima geração, da qualidade dos dados de treinamento e das estratégias de pós-treinamento. Se esse caminho der certo, o que será reescrito não é apenas um ranking qualquer, mas a suposição padrão de todo o setor sobre “qual tamanho de modelo é suficiente”.
Se um modelo com capacidade próxima à de uma flagship custa apenas uma fração do custo de operação dela, então o que se torna verdadeiramente escasso já não é poder de computação, mas sim pessoas capazes de pensar com clareza sobre o que fazer com ele.
Artigos relacionados
Um único framework para linguagem e visão: o modelo aberto de 1,6 bilhão da Horizon
Uma aposta de que as pontes entre linguagem e visão nunca foram necessárias.
Uma parede de memória fotônica é a aposta de US$ 88 milhões que a Volantis acaba de fazer
O trade-off com que todo mundo aprendeu a conviver é justamente o que ela tenta eliminar.
As Imagens de Produtos com IA Estão Batendo em um Muro de Conformidade que Ninguém Precificou
O custo sempre foi cotado por geração. O custo real é medido por ativo que sobrevive à revisão.
Robôs podem fazer 74% do trabalho físico, e quase nada disso compensa
A capacidade está amplamente presente. A economia não. Quarenta anos para dez por cento não é uma previsão que justifique pânico.