← Volver al blog
Newsaprox. 8 min de lectura

El chip de memoria es ahora el cuello de botella del cómputo de IA

Publicado 7 oct 2026
El chip de memoria es ahora el cuello de botella del cómputo de IA

El acontecimiento más revelador del hardware de IA este mes fue una reunión y no un lanzamiento: la consejera delegada de AMD, Lisa Su, sentándose en persona con el responsable de la división de semiconductores de Samsung. Cuando se reúnen dos consejeros delegados de ese nivel, el tema sobre la mesa rara vez es una alianza de marketing. Es el suministro.

Lo que estaban discutiendo, según informaciones de Bloomberg, es la memoria de alto ancho de banda. La HBM es la memoria apilada que se sitúa junto a un acelerador de IA y le entrega datos lo bastante rápido como para mantener el silicio ocupado. La producen tres empresas —SK Hynix, Samsung y Micron—, y SK Hynix posee actualmente la cuota dominante del suministro de HBM3E que utiliza Nvidia. Si se quiere entender por qué el cómputo de IA escasea, la respuesta tiene cada vez menos que ver con los chips lógicos y más con quién puede apilar memoria de forma fiable y a volumen.

Por qué la HBM decide la cifra de envíos

Un acelerador de IA es tan útil como el ancho de banda de memoria que tiene conectado. La generación de tokens consume mucha memoria: el sistema lee repetidamente los pesos del modelo y la caché de clave-valor, por lo que la SRAM en chip y la localidad de memoria importan más que la densidad de cómputo bruta. Por eso la cifra de FLOPS destacada de un chip dice menos sobre el coste de inferencia que su configuración de memoria, y por eso la propia hoja de ruta de Nvidia ha virado hacia la pugna por la capacidad de memoria y la disipación térmica.

El problema de Samsung ilustra lo que está en juego. La compañía ha tenido dificultades con los rendimientos de la HBM, lo que retrasó su cualificación para la cadena de suministro de Nvidia. Para AMD, profundizar la relación es una cobertura. Si logra asegurarse una asignación preferente de HBM de Samsung, su hoja de ruta de la serie MI obtiene una baza competitiva que no depende del mismo proveedor que su rival ya tiene atado.

Las especificaciones muestran hasta qué punto la memoria es ahora lo esencial. El MI450 de AMD utiliza la arquitectura CDNA 5 en el proceso de 2 nm de TSMC y soporta hasta 432 gigabytes de HBM4 por chip. Esa cifra tiene un peso real: es la diferencia entre ejecutar un gran modelo de mezcla de expertos en un solo acelerador y tener que repartirlo entre varios, lo que multiplica tanto la factura de hardware como la complejidad de red.

Por qué la inferencia, y no el entrenamiento, impulsa la escasez

El entrenamiento acapara la atención, pero es la inferencia la que determina la demanda de memoria. Las ejecuciones de entrenamiento son proyectos finitos que terminan, mientras que la inferencia no acaba nunca y escala con los usuarios. Generar un token exige leer los pesos del modelo y la caché de clave-valor desde la memoria, y la caché crece con la longitud del contexto, de modo que una conversación larga cuesta más memoria por usuario que una corta. Los analistas que estiman que un usuario de IA consume aproximadamente cinco veces más tokens que un usuario de un servicio corriente están describiendo una máquina que debe mantener mucho más estado por persona.

La respuesta de la industria de la arquitectura es la desagregación: separar el prefill, que procesa el prompt, del decode, que genera tokens, de modo que cada uno se ejecute en hardware adaptado a su perfil. Se ha informado de que AMD y Cerebras trabajan en un emparejamiento que combina procesamiento de alto rendimiento con generación de baja latencia. Eso ayuda a nivel de rack y no sirve de nada para el suministro de los chips de memoria que ambas mitades necesitan. Hasta que mejoren los rendimientos de empaquetado en los tres proveedores, cada truco arquitectónico aporta eficiencia sin aliviar la restricción.

AMD superó el billón de dólares gracias a los pedidos de hardware

La noticia comercial llegó en la misma ventana temporal. AMD cerró en un máximo histórico de 633,91 dólares el 2 de octubre, lo que elevó su valor de mercado por encima del billón de dólares y supuso una ganancia de más del 180 por ciento en el año. El rally tiene una causa concreta y no de sentimiento. OpenAI se comprometió a un despliegue multigeneracional de seis gigavatios centrado en el MI450, cuya implementación comenzará en el segundo semestre de 2026, junto con un warrant que permite adquirir hasta 160 millones de acciones de AMD vinculado al cumplimiento de hitos. Oracle se sumó como socio de lanzamiento de un superclúster que usará 50.000 GPU MI450 a partir del tercer trimestre.

Si se analiza la estructura, se parece menos a un pedido de chips y más a un acuerdo de financiación. Un warrant vinculado a hitos de despliegue otorga al comprador una participación en el éxito del proveedor, lo que es una forma de alinear incentivos cuando los volúmenes son lo bastante grandes como para preocupar a ambas partes. Nvidia está jugando una carta paralela, con planes de al menos 10 gigavatios de sus propios sistemas para OpenAI y una posible inversión de hasta 100.000 millones de dólares. La dinámica de dos proveedores ya no es una estrategia de compras. Es una estructura de empresa conjunta.

El trimestre de Micron y el argumento del superciclo

Los resultados de memoria dieron la misma señal desde el otro lado. Los resultados trimestrales de Micron superaron ampliamente las expectativas gracias a la demanda de HBM y DRAM impulsada por la IA, y varias instituciones describieron el momento como el inicio de un superciclo de la memoria y no como un repunte puntual. Un argumento que lo respalda es el consumo. Los analistas que siguen las cargas de trabajo de inferencia sitúan el consumo de tokens por usuario de IA en aproximadamente cinco veces el de una persona que navega por un servicio normal, lo que reformula la memoria: de un coste de componente a un coste operativo por usuario.

Eso importa para saber cómo se resolverá la escasez. La capacidad de lógica se puede añadir construyendo fábricas, lo que lleva un par de años. La capacidad de HBM es más difícil porque depende del empaquetado avanzado y de unos rendimientos de apilado que un número reducido de proveedores ha aprendido a controlar. Los problemas de rendimiento de Samsung no son tanto un fallo de gestión como la prueba de lo estrecha que es la base de talento cualificado. Añadir un tercer proveedor cualificado es un proyecto de varios años, y la curva de demanda no espera.

La versión de sobremesa de la misma historia

La restricción también aparece en formatos más pequeños. El GB300 Blackwell Ultra de Nvidia demostró más de 2.200 millones de tokens al día en pruebas de sobremesa con red de 800 Gbps, una cifra llamativa para una máquina que cabe bajo un escritorio. También es una máquina cuyo precio se fija en parte por cuánta memoria se puede meter en ella. La misma física que limita un rack de centro de datos limita una estación de trabajo.

La respuesta a más largo plazo por la que apuestan los fabricantes es arquitectónica. La plataforma Vera Rubin de Nvidia, presentada en el CES, combina GPU Rubin con CPU Vera, red de escalado NVLink y una pila de software completa, y la compañía avanza hacia métricas como tokens por segundo por vatio en lugar de FLOPS brutos. También ha abierto su interconexión mediante NVLink Fusion, lo que permite a los socios integrar sus propias CPU y su propio silicio. Se ha informado asimismo de un esfuerzo en controladores de memoria personalizados, lo que es una señal de que la compañía espera que el suministro de memoria siga siendo una variable estratégica y no una materia prima comprada.

Qué hay que vigilar

Tres cosas decidirán si la restricción de memoria se relaja o se endurece de aquí a 2027. La primera es el calendario de cualificación de Samsung para la HBM4 tanto con AMD como con Nvidia, porque un tercer proveedor verdaderamente cualificado cambia la dinámica de precios más que cualquier lanzamiento de producto. La segunda es si Micron cierra la brecha como alternativa, lo que quitaría presión a los dos proveedores coreanos. La tercera es si la inferencia desagregada, en la que el procesamiento del prompt y la generación de tokens se ejecutan en tipos distintos de acelerador, se generaliza lo suficiente como para reducir la presión de memoria sobre cualquier chip individual.

Ninguna de esas cosas se resolverá rápidamente. Mientras tanto, la lectura práctica para cualquiera que compre o construya sobre cómputo de IA es que la memoria, y no el cómputo, es la cifra que moverá sus costes. La hoja de ruta de la lógica es pública y predecible. La de la memoria está condicionada por los rendimientos de empaquetado, una base de talento que se tarda años en formar y los planes de inversión de tres empresas, y es la que ha estado decidiendo cuántos aceleradores se envían realmente.

Artículos relacionados