← Voltar ao blog
Newscerca de 8 min de leitura

O chip de memória agora é o gargalo na computação de IA

Publicado 7 de out. de 2026
O chip de memória agora é o gargalo na computação de IA

O evento mais revelador no hardware de IA neste mês foi uma reunião, e não um lançamento: a CEO da AMD, Lisa Su, sentou-se pessoalmente com o chefe da divisão de semicondutores da Samsung. Quando dois CEOs desse nível se encontram, o assunto na mesa raramente é uma parceria de marketing. É fornecimento.

O que eles discutiam, segundo reportagem da Bloomberg, é a memória de alta largura de banda. A HBM é a memória empilhada que fica ao lado de um acelerador de IA e lhe entrega dados rápido o suficiente para manter o silício ocupado. Ela é produzida por três empresas — SK Hynix, Samsung e Micron —, e a SK Hynix detém atualmente a fatia dominante do fornecimento de HBM3E usado pela Nvidia. Se você quer entender por que a computação de IA é escassa, a resposta tem cada vez menos a ver com chips de lógica e mais com quem consegue empilhar memória de forma confiável em escala.

Por que a HBM determina o número de embarques

Um acelerador de IA só é tão útil quanto a largura de banda de memória conectada a ele. A geração de tokens consome muita memória: o sistema lê repetidamente os pesos do modelo e o cache de chave-valor, de modo que a SRAM no chip e a localidade de memória importam mais do que a densidade bruta de computação. É por isso que o número de FLOPS de destaque de um chip diz menos sobre o custo de inferência do que sua configuração de memória, e por isso o próprio roteiro da Nvidia passou a disputar capacidade de memória e questões térmicas.

O problema da Samsung ilustra o que está em jogo. A empresa enfrentou dificuldades com rendimentos de HBM que atrasaram sua qualificação para a cadeia de fornecimento da Nvidia. Para a AMD, aprofundar a relação é uma proteção. Se conseguir garantir alocação preferencial de HBM da Samsung, seu roteiro da série MI ganha uma vantagem competitiva que não depende do mesmo fornecedor que sua rival já amarrou.

As especificações mostram o quanto a memória é agora o ponto central. O MI450 da AMD usa a arquitetura CDNA 5 no processo de 2 nm da TSMC e carrega até 432 gigabytes de HBM4 por chip. Esse número tem peso real: é a diferença entre executar um grande modelo de mistura de especialistas em um único acelerador e ter de dividi-lo entre vários, o que multiplica tanto a conta de hardware quanto a complexidade de rede.

Por que a inferência, e não o treinamento, impulsiona a escassez

O treinamento recebe a atenção, mas é a inferência que define a demanda por memória. Execuções de treinamento são projetos finitos que terminam, enquanto a inferência roda para sempre e escala com os usuários. Gerar um token exige ler os pesos do modelo e o cache de chave-valor da memória, e o cache cresce com o comprimento do contexto, então uma conversa longa custa mais memória por usuário do que uma curta. Os analistas que estimam que um usuário de IA consome cerca de cinco vezes os tokens de um usuário comum de serviços estão descrevendo uma máquina que precisa manter muito mais estado por pessoa.

A resposta da indústria de arquitetura é a desagregação: separar o prefill, que processa o prompt, do decode, que gera os tokens, para que cada um rode em hardware adequado ao seu perfil. AMD e Cerebras teriam trabalhado em um pareamento que combina processamento de alto rendimento com geração de baixa latência. Isso ajuda no nível do rack e não faz nada pelo fornecimento dos chips de memória de que as duas metades precisam. Enquanto os rendimentos de empacotamento não melhorarem nos três fornecedores, cada truque arquitetural compra eficiência sem aliviar a restrição.

A AMD ultrapassou um trilhão de dólares com pedidos de hardware

A notícia comercial chegou na mesma janela. A AMD fechou a US$ 633,91, um recorde, em 2 de outubro, elevando seu valor de mercado acima de um trilhão de dólares e marcando um ganho de mais de 180% no ano. A alta tem uma causa específica, e não de sentimento. A OpenAI comprometeu-se com uma expansão de seis gigawatts e várias gerações centrada no MI450, com implantação começando no segundo semestre de 2026 e um warrant que permite a compra de até 160 milhões de ações da AMD vinculado a marcos. A Oracle entrou como parceira de lançamento de um supercluster que usará 50.000 GPUs MI450 a partir do terceiro trimestre.

Leia a estrutura e ela parece menos um pedido de chips e mais um arranjo de financiamento. Um warrant vinculado a marcos de implantação dá ao comprador uma participação acionária no sucesso do fornecedor, o que é uma forma de alinhar incentivos quando os volumes são grandes o suficiente para preocupar ambos os lados. A Nvidia está jogando de forma paralela, planejando pelo menos 10 gigawatts de seus próprios sistemas para a OpenAI, com investimento potencial de até US$ 100 bilhões. A dinâmica de dois fornecedores já não é uma estratégia de compras. É uma estrutura de joint venture.

O trimestre da Micron e o argumento do superciclo

Os resultados de memória deram o mesmo sinal pelo outro lado. Os resultados trimestrais da Micron vieram bem acima das expectativas, impulsionados pela demanda de HBM e DRAM para IA, e várias instituições descreveram o momento como o início de um superciclo da memória, e não um pico. Um argumento de apoio é o consumo. Analistas que acompanham cargas de trabalho de inferência estimam o consumo de tokens por usuário de IA em cerca de cinco vezes o de um humano navegando em um serviço comum, o que reenquadra a memória de custo de componente para custo operacional por usuário.

Isso importa para como a escassez se resolve. A capacidade de lógica pode ser ampliada com a construção de fábricas, o que leva alguns anos. A capacidade de HBM é mais difícil, porque depende de empacotamento avançado e de rendimentos de empilhamento que um pequeno número de fornecedores aprendeu a controlar. Os problemas de rendimento da Samsung não são tanto uma falha de gestão quanto evidência de quão estreita é a base de mão de obra qualificada. Adicionar um terceiro fornecedor qualificado é um projeto de vários anos, e a curva de demanda não está esperando.

A versão de mesa da mesma história

A restrição também aparece em formatos menores. O GB300 Blackwell Ultra da Nvidia demonstrou mais de 2,2 bilhões de tokens por dia em testes de mesa com rede de 800 Gbps, um número impressionante para uma máquina que fica embaixo de uma escrivaninha. É também uma máquina cujo preço é definido em parte por quanta memória consegue comportar. A mesma física que limita um rack de data center limita uma estação de trabalho.

A resposta de longo prazo em que os fornecedores apostam é arquitetural. A plataforma Vera Rubin da Nvidia, apresentada na CES, combina GPUs Rubin com CPUs Vera, rede de escala NVLink e uma pilha de software completa, e a empresa está avançando para métricas como tokens por segundo por watt, em vez de FLOPS brutos. Ela também abriu sua interconexão por meio do NVLink Fusion, permitindo que parceiros integrem suas próprias CPUs e silício. Há também um esforço relatado de controlador de memória personalizado, o que é um sinal de que a empresa espera que o fornecimento de memória continue sendo uma variável estratégica, e não uma commodity comprada.

O que observar

Três coisas decidirão se a restrição de memória vai aliviar ou se endurecer até 2027. A primeira é o cronograma de qualificação da Samsung para a HBM4 tanto com a AMD quanto com a Nvidia, porque um terceiro fornecedor genuinamente qualificado altera a dinâmica de preços mais do que qualquer lançamento de produto isolado. A segunda é se a Micron fecha a lacuna como alternativa, o que tiraria pressão dos dois fornecedores coreanos. A terceira é se a inferência desagregada, em que o processamento do prompt e a geração de tokens rodam em tipos diferentes de aceleradores, se torna comum o suficiente para reduzir a pressão de memória sobre qualquer chip individual.

Nenhuma delas se resolve rapidamente. Nesse meio-tempo, a leitura prática para quem compra ou constrói sobre computação de IA é que a memória, e não a computação, é o número que vai mexer nos seus custos. O roteiro da lógica é público e previsível. O roteiro da memória é limitado por rendimentos de empacotamento, por uma base de talentos que leva anos para se formar e pelos planos de capital de três empresas, e é ele que vem decidindo quantos aceleradores de fato são enviados.

Artigos relacionados