Alibaba enfia seu grande modelo em seu próprio silício: Zhenwu V900 é três vezes mais rápido, Qwen 4 já está em treinamento

Na conferência Apsara, em Hangzhou, no final de setembro, a Alibaba colocou três coisas sobre a mesma mesa: um novo chip, uma versão de modelo em treinamento e uma conta de data center até 2032. Em anos anteriores, esse tipo de conferência costumava ter os modelos como protagonistas; este ano, o que foi realmente mencionado repetidamente foram os chips de silício.
A T-Head, subsidiária da Alibaba, lançou o chip de IA Zhenwu V900, que integra treinamento e inferência. Segundo a versão oficial, sua capacidade de computação é três vezes a do Zhenwu M890, com 216 GB de memória de vídeo, largura de banda de interconexão entre chips de 1200 GB/s e suporte nativo aos formatos de baixa precisão FP8 e FP4. O Zhenwu M890 foi lançado apenas em maio deste ano, com um intervalo de somente quatro meses. O V900 só entrará em produção e será vendido no primeiro trimestre de 2027, portanto o que está no palco agora ainda é uma ficha técnica, e não um produto em estoque pronto para encomenda.
O que realmente vale a pena observar é o modo de interconexão por trás dele. A T-Head equipou o V900 com o chip de interconexão ICNSwitch, desenvolvido internamente, que trabalha com semântica de memória e endereçamento unificado de memória, e promete que mais de mil V900 podem operar de forma coordenada como um "superchip". No servidor de supernó lançado em conjunto, além do V900, também foram incluídos a placa de rede inteligente e o chip controlador de SSD da própria empresa — computação, armazenamento e rede, tudo o que querem ter em suas próprias mãos. Segundo os números divulgados pela Alibaba, um único cluster pode ser expandido até a escala de 500 mil placas.

A Alibaba já tem em mãos um conjunto de cargas de trabalho reais. Os supernós baseados no Zhenwu M890 já executaram com sucesso modelos como o Qwen3.8 e o Kimi K3, com mais de dois trilhões de parâmetros, e os chips da série Zhenwu já atenderam cumulativamente mais de 650 clientes corporativos, abrangendo setores como direção inteligente, finanças, energia e manufatura. Esses números explicam por que a Alibaba ousa anunciar a escala de sua próxima geração de clusters em 500 mil placas.
Do lado dos modelos, as ações são ainda mais diretas. A Alibaba confirmou que o Qwen 4 já está em treinamento, e que as escalas de parâmetros alvo do Qwen 4.5 e do Qwen 5 ficam entre 5 trilhões e 10 trilhões. Como referência, o Qwen3.8-Max, atualmente o mais forte da Alibaba, tem 2,4 trilhões de parâmetros. Aumentar os parâmetros e aumentar o cluster são dois lados da mesma questão: sem placas suficientes, o ciclo de treinamento de modelos de escala trilionária se prolongaria a ponto de perder o sentido.
A Alibaba Cloud estabeleceu como meta de infraestrutura ultrapassar 20 GW de escala global de data centers até 2032, e planeja abrir três novas regiões — Turquia, Finlândia e Holanda — no próximo ano, além de expandir capacidades na Malásia, Alemanha, Emirados Árabes Unidos, França e outros locais. Apresentar chips, modelos e nuvem dentro de uma mesma estratégia foi a linha principal mais clara desta conferência.
Os números são bonitos, mas a referência de comparação é a própria empresa
Ao avaliar este roteiro, há dois pontos de referência de medição que merecem atenção.
Primeiro, o aumento de três vezes compara o V900 ao M890 da própria empresa, e não ao Blackwell da Nvidia, nem a qualquer acelerador de terceiros. A capacidade de memória de vídeo e a largura de banda de interconexão não podem ser convertidas diretamente em taxa de transferência real de treinamento, latência de inferência e custo por token. A Alibaba também não divulgou resultados de benchmarks sob testes independentes de terceiros.
Segundo, o ecossistema de software. O código de treinamento dos principais grandes modelos do mundo há muito tempo é escrito em torno do CUDA, e as bibliotecas de drivers, contêineres e ferramentas de orquestração baseiam-se em anos de acúmulo. Migrar um conjunto de cargas de trabalho que rodam na plataforma da Nvidia para um novo chip costuma ter um custo que não aparece nos parâmetros de hardware, mas sim nas semanas em que engenheiros reescrevem código e ajustam desempenho. Desta vez, a Alibaba não explicou a dificuldade de migração entre o V900 e a atual cadeia de ferramentas da Nvidia, nem divulgou preços, tipos de instâncias disponíveis e suporte por região.
Esse não é um problema exclusivo da Alibaba. A capacidade de produção em processos avançados, o rendimento (yield) e o desempenho por watt são restrições reais que os chips desenvolvidos internamente na China precisam enfrentar. O significado do Zhenwu V900 está mais em ter dado um passo adiante na questão de "ser capaz de fabricar por conta própria" do que em igualar em um único ponto.
Por que agora
O momento merece ser analisado em detalhes. Nos últimos dois anos, as restrições dos Estados Unidos à exportação de GPUs avançadas para a China vêm se apertando continuamente, e as provedoras de nuvem nacionais não tiveram escolha senão acelerar o investimento em aceleradores próprios. A Alibaba, a Huawei, além de players menores como a Enflame e a Iluvatar CoreX, todos estão empenhados na mesma direção. No mesmo período, houve relatos de que a Huawei também está antecipando o ritmo de lançamento de sua próxima geração de chips de IA. A retórica externa das duas empresas é semelhante: antes de serem ainda mais bloqueadas pelas regras, substituir a posição da Nvidia no mercado chinês.
Para a própria Alibaba, o desenvolvimento de silício próprio traz dois níveis de benefícios. Um é reduzir a exposição às oscilações da política americana, fazendo com que o planejamento de capacidade de computação não dependa mais das idas e vindas das regras de exportação; o outro é reter internamente a parte do lucro de chip mais nuvem que historicamente era absorvida pela Nvidia.
Se olharmos apenas para os lançamentos de modelos, pode-se pensar que esta rodada de competição ainda é sobre quem tem mais parâmetros e quem tem a maior pontuação em benchmarks. Mas, olhando em conjunto os chips, os supernós, as regiões de nuvem e o roteiro de modelos, o campo de batalha da competição já se deslocou para a camada do silício e das salas de servidores. Os modelos são a fachada; ser capaz de fabricar as próprias placas, montar a própria rede e fornecer a própria energia é o que determina a altura que este edifício pode alcançar.
Os desafios vêm depois
Nos próximos doze a dezoito meses, três coisas darão as respostas. Se a afirmação do supernó de 500 mil placas resiste ao teste em implantações de clientes reais; se o Qwen 4.5 e o Qwen 5 realmente conseguirão atingir a escala de quase dez trilhões de parâmetros; e se a meta de 20 GW de data centers conseguirá obter o financiamento e a energia elétrica correspondentes.
Se qualquer uma dessas promessas se concretizar pela metade, já será suficiente para mostrar que a pilha de hardware de IA da China está reduzindo a distância em relação à Nvidia. Essa redução não necessariamente se manifestará na equivalência de um indicador específico, mas mais provavelmente na própria escala de implantação. A Alibaba já disse o que tinha a dizer em Hangzhou; o restante será respondido pelas linhas de produção e pelos medidores de eletricidade.
Artigos relacionados
Salesforce paga US$ 2 bilhões por uma empresa que entrevista seus clientes para você
Entrevistas são evidências. Gêmeos digitais são uma previsão. A linha entre eles é o teste.
AMD compra World Labs, de Fei-Fei Li, por US$ 8,2 bilhões para dominar a IA física
A AMD está comprando um laboratório de pesquisa — e pagando por ele o preço de uma fabricante de chips.
O Google colocou uma TPU em órbita e começou a calcular o custo dos data centers espaciais
Um chip funcionando prova que a viagem é sobrevivível. Diz pouco sobre o lucro.
Alguém catalogou 13.000 maneiras de a escrita de IA se denunciar
Os sinais não desapareceram. Eles se mudaram para um lugar mais difícil de ver.