La extraña economía de los chips de IA: los nuevos racks reducen costos mientras los chips antiguos se encarecen

En septiembre ocurrieron dos cosas en el mundo del hardware de IA, y parecen apuntar en direcciones opuestas. Nvidia comenzó a enviar sus sistemas más nuevos a escala de rack a los grandes proveedores de nube, prometiendo una inferencia mucho más barata. Al mismo tiempo, el precio de alquiler de sus chips H100, de tres años de antigüedad, subió. Ambas cosas son ciertas y, juntas, explican algo sobre cómo funciona realmente la economía de la IA.
Los nuevos racks
Nvidia confirmó que sus sistemas de rack Vera Rubin NVL144 se están enviando en volumen, con los primeros despliegues importantes entrando en funcionamiento en Microsoft, Google, Amazon y Oracle, y con CoreWeave diciendo que sus primeros clústeres Rubin estarían disponibles para los clientes antes de finales de septiembre. Esta es la mayor transición de hardware que la industria ha intentado, reemplazando a la generación Blackwell que ha impulsado la mayor parte del entrenamiento de modelos de frontera durante los últimos dos años.
La arquitectura no es un solo chip. Vera Rubin combina una CPU Vera con dos GPU Rubin por nodo y las enlaza para que todo un rack actúe como un único procesador grande. La configuración NVL144 conecta 144 GPU Rubin a través de 72 nodos en un rack, con memoria HBM4 por primera vez en un sistema de producción y aproximadamente 13 terabytes por segundo de ancho de banda de memoria por GPU. Nvidia afirma alrededor de 3,6 exaflops de rendimiento de inferencia FP4 por rack, unas tres veces un rack Blackwell NVL72 comparable. Esas son cifras en condiciones ideales, y estimaciones independientes conservadoras sitúan la ganancia en el mundo real más cerca de duplicar o multiplicar por 2,5.
El número que importa a todos fuera del centro de datos es el costo por token. Los precios tempranos de la nube sugieren que las instancias basadas en Rubin podrían abaratar la inferencia con Blackwell entre un 30 y un 40 por ciento en el lanzamiento, y los precios suelen bajar aún más a medida que aumenta la capacidad. Esa cifra se traslada aguas abajo al precio de una llamada a la API, al tamaño de una suscripción y a si una función de generación de video puede existir dentro de un plan de veinte dólares.
Los chips viejos que se volvieron más caros
Aquí está la parte contraintuitiva. En septiembre, el precio de alquiler por hora del H100, el chip que impulsó la primera ola de productos de IA, subió un 22 por ciento hasta 3,28 dólares la hora. El director ejecutivo de Nvidia señaló el aumento como prueba de que el cómputo es un activo duradero y generador de ingresos, más que algo que se deprecia según lo previsto.
La razón es la oferta. Los nuevos chips Blackwell y Rubin se reservan para los compradores más grandes, lo que deja a los clústeres H100 más antiguos encargándose de las cargas de trabajo de inferencia cotidianas. La escasez de energía y memoria en los centros de datos mantiene ocupado al hardware más antiguo y mantiene altos los precios de alquiler. El H100 sigue siendo mucho más barato que en su lanzamiento, cuando las grandes empresas de nube lo alquilaban por siete u ocho dólares la hora, pero la subida reciente va en contra de la contabilidad estándar, que deprecia el valor de los chips a lo largo de cinco o seis años.
Esa brecha ha llamado la atención. Los vendedores en corto han argumentado que la vida útil real de los chips es más corta de lo que asumen los calendarios oficiales, lo que significaría que la depreciación en los libros de los proveedores de nube es demasiado lenta. Nvidia registró ingresos trimestrales récord de 96.200 millones de dólares en agosto, y el precio de alquiler en ascenso le da a la empresa un argumento renovado de que sus chips siguen generando ingresos mucho después de ser nuevos.
La carrera por escalar los nuevos racks
La velocidad del despliegue dice tanto como las especificaciones. CoreWeave se convirtió en el primer proveedor de nube en ejecutar el nuevo hardware a escala de múltiples racks, levantando siete racks Vera Rubin NVL72, 504 GPU en total, como un único clúster de producción que abarca dos regiones el 16 de septiembre. El salto de un único rack validado a una infraestructura de múltiples racks importa porque las cargas de trabajo de IA agéntica hacen muchas llamadas pequeñas y sensibles a la latencia, y los retrasos se acumulan a través de interacciones repetidas entre modelos y herramientas. Cada rack NVL72 combina 72 GPU con 36 CPU Vera, y el diseño de la infraestructura admite aproximadamente 128.000 GPU por rail sin rediseño, lo que significa que añadir capacidad es un cambio de configuración en lugar de una reconstrucción.
El patrón de suministro también parece diferente esta vez. En la generación Blackwell, la demanda superó tanto a la oferta que los proveedores de nube más pequeños y los programas nacionales de IA esperaron seis meses o más. Nvidia aceleró antes la producción de Rubin, y varios proyectos soberanos de IA en Europa y Oriente Medio estarían, según los informes, en la primera ola de envíos en lugar de la tercera. Nvidia también anunció una asociación con operadores australianos de nube y centros de datos para construir hasta dos gigavatios de capacidad de fábrica de IA para 2027. Si eso se mantiene, alquilar tiempo de GPU se vuelve notablemente más fácil, lo que empuja toda la curva de costos hacia abajo para todos los actores posteriores.
Por qué ambas cosas son ciertas
La aparente contradicción se resuelve cuando separas el entrenamiento de la inferencia. El entrenamiento necesita los clústeres más nuevos y grandes, y esa demanda es lo que justifica construir racks como Vera Rubin. La inferencia es todo lo que hace un modelo después de ser entrenado: cada respuesta de chatbot, cada imagen generada, cada sugerencia de código. A medida que crece el uso, el costo recurrente de atender esas solicitudes puede volverse mayor que la factura original de entrenamiento.
Por eso Nvidia está abriendo parte de su ecosistema en lugar de defender cada zócalo. El 10 de septiembre, anunció una colaboración con d-Matrix, una startup que construye chips específicamente para inferencia. Según el acuerdo, los chips Raptor de próxima generación de d-Matrix se conectarán a la arquitectura de racks de Nvidia a través de NVLink Fusion. Raptor está diseñado para la inferencia de IA, especialmente trabajos de baja latencia como chatbots, asistentes de código y agentes de voz, con un diseño centrado en la memoria destinado a reducir la latencia y el costo. Nvidia no renuncia a nada que poseía por completo, porque sigue suministrando las CPU, la red, los switches y el software alrededor del rack, mientras gana un lugar en el mercado de inferencia aunque no gane todos los aceleradores.
Hay una restricción más dura debajo de todo esto. Un solo rack Vera Rubin NVL144 consume alrededor de 600 kilovatios, aproximadamente la energía de 500 hogares promedio. La electricidad, no los chips, se está convirtiendo en el límite determinante para el crecimiento de la IA, y por eso Microsoft, Google y Amazon han firmado acuerdos de energía nuclear y geotérmica en el último año para alimentar clústeres como estos. Si quieres saber hacia dónde va la capacidad de IA, observa los acuerdos de compra de energía en lugar de las puntuaciones de los benchmarks.
Qué significa para el precio de la IA
Para los usuarios, la lectura práctica es que el costo de ejecutar un modelo debería seguir bajando, incluso mientras el costo del hardware más nuevo se mantiene alto. Una inferencia más barata hace posible que funciones que eran demasiado caras el año pasado se vuelvan estándar este año. Las respuestas largas y cuidadosas de los chatbots, los asistentes de código que leen toda una base de código y la generación de video bajo demanda dependen de que esta curva de costos se incline a la baja.
La pregunta que los inversores siguen haciendo es si el enorme gasto en centros de datos llegará alguna vez a pagarse por sí solo. Rubin es parte de la respuesta. Si el mismo modelo se vuelve aproximadamente dos veces más barato de ejecutar cada dieciocho meses más o menos, el gasto empieza a parecer menos una burbuja y más infraestructura. Si esa curva se estanca, los escépticos tendrán su momento. Los próximos dos trimestres de precios de la nube dirán hacia dónde va, y esa cifra te llegará mucho antes que cualquier benchmark, en forma de lo que cuestan tus herramientas de IA.
Artículos relacionados
Salesforce paga 2.000 millones de dólares por una empresa que entrevista a tus clientes por ti
Las entrevistas son evidencia. Los gemelos digitales son una predicción. La línea entre ambos es la prueba.
AMD compra World Labs, de Fei-Fei Li, por 8200 millones de dólares para dominar la IA física
AMD compra un laboratorio de investigación, y paga por él el precio de un fabricante de chips.
Google puso una TPU en órbita y empezó a calcular el costo de los centros de datos espaciales
Un chip funcional demuestra que el viaje es sobrevivible. Dice poco sobre las ganancias.
Alguien catalogó 13.000 formas en que la escritura de IA se delata
Las señales no desaparecieron. Se mudaron a un lugar más difícil de ver.