A economia estranha dos chips de IA: novos racks reduzem custos enquanto chips antigos ficam mais caros

Duas coisas aconteceram no mundo do hardware de IA em setembro, e elas parecem apontar em direções opostas. A Nvidia começou a enviar seus mais novos sistemas em escala de rack para os grandes provedores de nuvem, prometendo inferência bem mais barata. Ao mesmo tempo, o preço para alugar seus chips H100, de três anos, subiu. Ambas são verdadeiras e, juntas, explicam algo sobre como a economia da IA realmente funciona.
Os novos racks
A Nvidia confirmou que seus sistemas de rack Vera Rubin NVL144 estão sendo enviados em volume, com as primeiras grandes implantações entrando em operação na Microsoft, Google, Amazon e Oracle, e a CoreWeave dizendo que seus primeiros clusters Rubin estariam disponíveis para clientes antes do fim de setembro. Esta é a maior transição de hardware que a indústria já tentou, substituindo a geração Blackwell que alimentou a maior parte do treinamento de modelos de fronteira nos últimos dois anos.
A arquitetura não é um único chip. O Vera Rubin combina uma CPU Vera com duas GPUs Rubin por nó e as conecta de modo que um rack inteiro funcione como um único processador grande. A configuração NVL144 conecta 144 GPUs Rubin em 72 nós em um rack, com memória HBM4 pela primeira vez em um sistema de produção e cerca de 13 terabytes por segundo de largura de banda de memória por GPU. A Nvidia afirma cerca de 3,6 exaflops de desempenho de inferência FP4 por rack, aproximadamente três vezes um rack Blackwell NVL72 comparável. Esses são números em condições ideais, e estimativas independentes conservadoras colocam o ganho no mundo real mais perto de 2 a 2,5 vezes.
O número que importa para todos fora do data center é o custo por token. Os primeiros preços de nuvem sugerem que instâncias baseadas em Rubin podem ser 30% a 40% mais baratas que a inferência com Blackwell no lançamento, com preços normalmente caindo ainda mais conforme a capacidade aumenta. Esse valor chega até o preço de uma chamada de API, o tamanho de uma assinatura e se um recurso de geração de vídeo pode existir dentro de um plano de vinte dólares.
Os chips antigos que ficaram mais caros
Aqui está a parte contraintuitiva. Em setembro, o preço de aluguel por hora do H100, o chip que alimentou a primeira onda de produtos de IA, subiu 22%, para US$ 3,28 por hora. O CEO da Nvidia apontou o aumento como prova de que computação é um ativo durável e gerador de receita, e não algo que se deprecia no prazo previsto.
O motivo é a oferta. Chips novos, Blackwell e Rubin, estão sendo reservados para os maiores compradores, o que deixa clusters H100 mais antigos cuidando das cargas de inferência do dia a dia. A oferta apertada de energia e memória nos data centers mantém o hardware mais antigo ocupado e os preços de aluguel altos. O H100 ainda é bem mais barato do que era no lançamento, quando grandes empresas de nuvem o alugavam por sete a oito dólares a hora, mas o aumento recente vai contra a contabilidade padrão, que deprecia o valor do chip ao longo de cinco a seis anos.
Essa diferença tem chamado atenção. Vendedores a descoberto argumentam que a vida útil real dos chips é mais curta do que os cronogramas oficiais presumem, o que significaria que a depreciação nos livros dos provedores de nuvem é lenta demais. A Nvidia registrou receita trimestral recorde de 96,2 bilhões de dólares em agosto, e o preço de aluguel em alta dá à empresa um argumento novo de que seus chips continuam gerando receita muito depois de deixarem de ser novos.
A corrida para escalar os novos racks
A velocidade da implantação diz tanto quanto as especificações. A CoreWeave se tornou o primeiro provedor de nuvem a rodar o novo hardware em escala de vários racks, colocando no ar sete racks Vera Rubin NVL72, 504 GPUs no total, como um único cluster de produção abrangendo duas regiões em 16 de setembro. O salto de um único rack validado para uma malha de vários racks importa porque cargas de trabalho de IA agêntica fazem muitas chamadas pequenas e sensíveis à latência, e os atrasos se acumulam em interações repetidas entre modelo e ferramentas. Cada rack NVL72 combina 72 GPUs com 36 CPUs Vera, e o design da malha suporta cerca de 128.000 GPUs por rail sem redesenho, o que significa que adicionar capacidade é uma mudança de configuração, não uma reconstrução.
O padrão de oferta também parece diferente desta vez. Na geração Blackwell, a demanda superou tanto a oferta que provedores de nuvem menores e programas nacionais de IA esperaram seis meses ou mais. A Nvidia acelerou a produção do Rubin mais cedo, e vários projetos soberanos de IA na Europa e no Oriente Médio estariam, segundo relatos, na primeira onda de embarques, e não na terceira. A Nvidia também anunciou uma parceria com operadores australianos de nuvem e data centers para construir até dois gigawatts de capacidade de fábrica de IA até 2027. Se isso se mantiver, alugar tempo de GPU fica significativamente mais fácil, o que puxa toda a curva de custos para baixo para todos os envolvidos na cadeia.
Por que as duas coisas são verdadeiras
A contradição aparente se resolve quando você separa treinamento de inferência. Treinamento precisa dos clusters mais novos e maiores, e é essa demanda que justifica construir racks como o Vera Rubin. Inferência é tudo o que um modelo faz depois de treinado: cada resposta de chatbot, cada imagem gerada, cada sugestão de código. À medida que o uso cresce, o custo recorrente de atender essas solicitações pode se tornar maior que a conta original de treinamento.
É por isso que a Nvidia está abrindo parte de seu ecossistema em vez de defender cada soquete. Em 10 de setembro, anunciou uma colaboração com a d-Matrix, uma startup que constrói chips especificamente para inferência. No acordo, os chips Raptor de próxima geração da d-Matrix se conectarão à arquitetura de rack da Nvidia por meio do NVLink Fusion. O Raptor é feito para inferência de IA, especialmente trabalhos de baixa latência como chatbots, assistentes de código e agentes de voz, com um design centrado em memória para reduzir latência e custo. A Nvidia não abre mão de nada que já controlava totalmente, porque ainda fornece as CPUs, a rede, os switches e o software ao redor do rack, enquanto ganha um lugar no mercado de inferência mesmo que não vença com todos os aceleradores.
Há uma restrição mais dura por baixo de tudo isso. Um único rack Vera Rubin NVL144 consome cerca de 600 quilowatts, aproximadamente a energia de 500 casas médias. Eletricidade, não chips, está se tornando o limite determinante para o crescimento da IA, e é por isso que Microsoft, Google e Amazon assinaram acordos de energia nuclear e geotérmica no último ano para alimentar clusters como esses. Se você quer saber para onde vai a capacidade de IA, acompanhe os contratos de compra de energia, não as pontuações de benchmark.
O que isso significa para o preço da IA
Para os usuários, a leitura prática é que o custo de rodar um modelo deve continuar caindo, mesmo com o custo do hardware mais novo permanecendo alto. Inferência mais barata torna possível que recursos caros demais no ano passado se tornem padrão neste ano. Respostas longas e cuidadosas de chatbot, assistentes de código que leem uma base de código inteira e geração de vídeo sob demanda dependem todos dessa curva de custos em queda.
A pergunta que investidores não param de fazer é se os enormes gastos com data centers algum dia se pagarão. Rubin faz parte da resposta. Se o mesmo modelo ficar cerca de duas vezes mais barato de rodar a cada dezoito meses ou mais, os gastos começam a parecer menos uma bolha e mais infraestrutura. Se essa curva estagnar, os céticos terão seu momento. Os próximos dois trimestres de preços de nuvem dirão para que lado isso vai, e esse número chegará até você muito antes de qualquer benchmark, na forma do que suas ferramentas de IA custam.
Artigos relacionados
13.000 capturas de tela internas acabaram em repositórios públicos do GitHub, e nenhum invasor as colocou lá
Um comportamento padrão, repetido em toda uma frota, é um resultado de política.
Amazon quer que investidores possuam US$ 8 bilhões em chips Nvidia que ela ainda usa
Companhias aéreas fazem leaseback de aviões há décadas. Agora a mesma ideia está sendo aplicada a GPUs.
OpenAI rastreou uma campanha de extração de raciocínio até pessoas ligadas à Moonshot AI
O modelo se tornou o oráculo de descriptografia de seu próprio raciocínio oculto.
O primeiro festival de cinema com IA pagou US$ 450 mil e deu uma lição sobre história
Os filmes vencedores usaram as ferramentas para servir a uma ideia que já existia.