Os chips Ascend da Huawei estão construindo um caminho alternativo para modelos de imagem de IA

A maior parte da conversa sobre hardware de IA passa por uma única empresa e um único tipo de chip. A Huawei está tentando construir um segundo caminho, e seu passo mais recente aparece nos anúncios de infraestrutura deste mês.
A Huawei apresentou o Ascend 960 SuperPoD, um cluster construído sobre seus processadores Ascend e comercializado em torno da tecnologia NPO para a infraestrutura de IA de próxima geração. O anúncio é voltado para o treinamento e o serving de grandes modelos e, embora a geração de imagens não seja o caso de uso principal, ela está bem no centro do raio de impacto. Modelos de texto para imagem estão entre as cargas de trabalho mais intensivas em computação da IA, e qualquer alternativa à pilha de hardware dominante remodela quem pode pagar para construí-los e executá-los.
O pano de fundo estratégico são os controles de exportação dos EUA que restringiram o acesso das empresas chinesas aos chips mais avançados. Isso levou empresas chinesas a desenvolver alternativas domésticas, e a linha Ascend da Huawei é a mais avançada dessas iniciativas. O 960 SuperPoD é a mais recente alegação de que a lacuna está se estreitando, ou pelo menos de que existe um caminho viável sem o hardware restrito. É uma aposta de que o futuro da IA chinesa não precisa rodar em chips que outra pessoa pode cortar.
Para modelos de imagem especificamente, isso importa de algumas maneiras. Primeiro, treinar um grande modelo de imagem é caro de uma forma sensível ao silício subjacente. Os modelos de difusão por trás dos geradores de imagem são intensivos em computação durante o treinamento, exigindo muitas iterações sobre grandes conjuntos de dados, e o custo está diretamente atrelado a quão eficientes são os chips e a pilha de software. Se chips domésticos conseguirem treinar e servir modelos a um custo aceitável, laboratórios chineses poderão continuar lançando modelos abertos como o Qwen-Image 2.1 sem depender de hardware estrangeiro. Essa é uma questão de resiliência tanto quanto de desempenho.
Segundo, o serving importa mais do que as pessoas pensam. A geração de imagens é interativa. Os usuários digitam um prompt e esperam um resultado em segundos, e um modelo popular recebe milhões dessas solicitações por dia. A eficiência de inferência, e não apenas a vazão de treinamento, determina se um serviço de imagem gratuito ou barato é economicamente viável. Uma pilha de inferência doméstica muda a matemática de custos para apps e APIs de imagem chineses, e é por isso que empresas como a Huawei estão investindo tanto em infraestrutura de serving, e não apenas em clusters de treinamento.
Terceiro, há uma dimensão de padrões. Os modelos de imagem do mundo cada vez mais pressupõem um ecossistema de software específico para treinamento e serving, um conjunto específico de frameworks, kernels e bibliotecas de otimização. Uma pilha de hardware rival precisa de sua própria camada de software, seus próprios otimizadores, sua própria comunidade, e a lacuna entre hardware e hardware utilizável é principalmente software. A Huawei vem construindo isso, e cada anúncio de infraestrutura é um passo em direção a um ecossistema que não depende da toolchain do incumbente.
Nada disso significa que os chips da Huawei estão prestes a substituir o player dominante em capacidade bruta. A leitura honesta é que eles oferecem uma segunda fonte, e segundas fontes importam mesmo quando não são as melhores, porque mudam a posição de negociação de todos os elos seguintes. Um laboratório que consegue treinar em silício doméstico fica menos exposto a choques de suprimento. Uma empresa que consegue servir nele tem mais liberdade de precificação. Um país que consegue fazer ambos tem mais autonomia estratégica, que é o objetivo central do exercício.
O ângulo geopolítico é inevitável aqui. Modelos de imagem não são apenas brinquedos de consumo. Eles são usados em design, manufatura, mídia e, cada vez mais, em aplicações ligadas ao Estado, da propaganda à vigilância e à desinformação. O controle sobre o hardware que os treina e executa é o controle sobre uma capacidade estratégica, que é exatamente por que os controles de exportação existem e exatamente por que uma alternativa doméstica está sendo buscada de forma tão agressiva. Os dois estão presos em um ciclo: as restrições aceleram o esforço doméstico, e o esforço doméstico dá às restrições um alvo.
Para pessoas fora da China, os anúncios do Ascend são fáceis de ignorar como uma questão interna. Isso seria um erro. Se a pilha alternativa atingir um patamar em que modelos abertos treinem e sirvam bem nela, o próximo Qwen-Image, ou o seguinte, pode nunca tocar o hardware que você presume ser universal. A economia da geração de imagens está silenciosamente ganhando uma segunda história de hardware, e ela moldará quais modelos serão lançados, quão barato eles rodam e quem controla a infraestrutura por baixo de tudo isso.
Há também uma dimensão de talento e comunidade. Uma pilha de hardware alternativa precisa de pessoas que saibam como usá-la, e essas pessoas estão atualmente concentradas no ecossistema do incumbente. Construir essa comunidade leva anos, e é o verdadeiro jogo de longo prazo. Os anúncios de infraestrutura da Huawei são, nesse sentido, tanto sobre recrutamento e sinalização quanto sobre especificações brutas. Eles estão dizendo ao mundo: há um caminho viável aqui, venha construir sobre ele.
O ângulo da geração de imagens é a parte que a maioria dos observadores perde. Eles leem "SuperPoD" e pensam em modelos de linguagem e chatbots. Mas os mesmos clusters treinam e servem os modelos que geram imagens, e a economia da geração de imagens, alta computação, alta interatividade, alto volume, faz dela uma das primeiras cargas de trabalho em que uma pilha alternativa pode provar seu valor comercialmente. Observe com que rapidez modelos de imagem domésticos adotam silício doméstico. Isso lhe dirá mais sobre a trajetória deste segundo caminho do que qualquer gráfico de benchmark.
Há também um ponto sutil sobre onde está o verdadeiro gargalo. O chip é só metade da história. A outra metade é o software que torna o chip útil, os compiladores, os kernels, os frameworks e as implementações de modelos ajustadas para uma arquitetura específica. Um chip sem software é um peso de papel. É por isso que os anúncios da Huawei combinam hardware com um impulso de ecossistema de software, e por que a lacuna entre a pilha do incumbente e a alternativa é medida tanto em ferramentas de desenvolvedor quanto em teraflops. Para modelos de imagem, isso significa que a pergunta não é apenas "o chip consegue rodar difusão", mas "o chip consegue rodar difusão bem, por meio de ferramentas que um desenvolvedor já conhece, sem uma equipe de especialistas ajustando manualmente cada camada".
Essa lacuna de software é a razão pela qual a pilha alternativa tem demorado a decolar, apesar de anos de investimento. Hardware pode ser construído em laboratório, mas um ecossistema de desenvolvedores precisa ser construído por desenvolvedores, e desenvolvedores vão para onde as ferramentas são boas e a fricção é baixa. Cada modelo aberto que lança suporte no day zero para a pilha alternativa, cada framework que adiciona um backend, cada tutorial que guia um iniciante por ela, corrói essa lacuna. A comunidade de geração de imagens, com sua forte dependência de frameworks abertos como ComfyUI e Diffusers, é na verdade um dos lugares mais promissores para a pilha alternativa ganhar espaço, porque a comunidade já está acostumada a rodar modelos em uma variedade de hardwares.
Esse é o jogo de longo prazo, e é por isso que os anúncios deste mês importam mais como direção do que como destino. O Ascend 960 SuperPoD não vai mudar o cenário da geração de imagens da noite para o dia. Mas é uma estaca fincada no chão, um sinal de que o caminho alternativo está sendo construído, financiado e dotado de pessoal, e de que o futuro da geração de imagens, como o futuro da IA de modo mais amplo, pode não rodar sobre uma única história de hardware para sempre. As pessoas que presumem que sim estão fazendo uma aposta que a história repetidamente mostrou ser arriscada.
Artigos relacionados
A Apple agora quer treinar IA com seus dados, e os modelos de imagem estão na mira
A empresa da privacidade agora quer treinar com as suas fotos. A suposta reviravolta da Apple é um sinal sobre de onde virão os próximos dados de treinamento.
A bagunça da geração de imagens do Grok está reescrevendo as regras para todos os outros
Milhões de deepfakes não consensuais, investigações em três continentes e um paliativo de assinatura paga. O que a crise do Grok definiu sobre a responsabilidade na geração de imagens por IA.
Modelos chineses de imagem por IA estão conquistando fãs no exterior, e Washington está de olho
A adoção é técnica em primeiro lugar, política em segundo. Os desenvolvedores baixam o que funciona, e no momento isso vem cada vez mais de laboratórios chineses.
O que os mercados de previsão estão apostando sobre imagens de IA
Dinheiro de verdade está apostando em quem vence em imagens de IA. A OpenAI lidera em imagens estáticas, a MiniMax lidera em vídeo, e os modelos abertos são o curinga que ninguém precifica.