← 블로그로
News약 13 분 읽기

AI 컴퓨팅의 병목은 이제 메모리 칩이다

게시일 2026년 10월 7일
AI 컴퓨팅의 병목은 이제 메모리 칩이다

이달 AI 하드웨어 분야에서 가장 많은 것을 시사한 사건은 신제품 발표가 아니라 회동이었다. AMD 최고경영자 리사 수가 삼성전자 반도체 부문 수장과 직접 만난 것이다. 그 정도 위치의 CEO 두 사람이 만나면 테이블에 오르는 주제는 좀처럼 마케팅 제휴가 아니다. 그것은 공급이다.

블룸버그 보도에 따르면 두 사람이 논의한 것은 고대역폭 메모리(HBM)다. HBM은 AI 가속기 옆에 자리해 실리콘이 계속 바쁘게 돌아가도록 충분히 빠르게 데이터를 공급하는 적층형 메모리다. 이는 SK하이닉스, 삼성전자, 마이크론 세 회사가 생산하며, 현재 엔비디아가 사용하는 HBM3E 공급에서 SK하이닉스가 지배적인 점유율을 쥐고 있다. AI 컴퓨팅이 왜 부족한지 이해하고 싶다면, 그 답은 갈수록 로직 칩보다는 누가 대량으로 메모리를 안정적으로 적층할 수 있는가에 더 가까이 있다.

HBM이 출하량을 결정하는 이유

AI 가속기의 쓸모는 그에 연결된 메모리 대역폭만큼이다. 토큰 생성은 메모리 집약적이다. 시스템은 모델 가중치와 키-값 캐시를 반복적으로 읽어야 하므로, 온칩 SRAM과 메모리 지역성이 원시 연산 밀도보다 더 중요하다. 그래서 칩의 대표 FLOPS 수치보다 메모리 구성이 추론 비용을 더 잘 설명하며, 엔비디아 자체 로드맵도 메모리 용량과 발열을 둘러싼 경쟁으로 옮겨간 것이다.

삼성전자의 상황은 이 판돈이 얼마나 큰지를 보여준다. 이 회사는 HBM 수율 문제로 엔비디아 공급망 자격 승인이 지연됐다. AMD에게 이 관계 심화는 위험 분산책이다. 삼성 HBM 물량을 우선적으로 확보할 수 있다면, MI 시리즈 로드맵은 경쟁사가 이미 선점한 것과 같은 공급업체에 의존하지 않는 경쟁력 있는 근거를 얻게 된다.

사양을 보면 메모리가 이제 얼마나 핵심인지 알 수 있다. AMD의 MI450은 TSMC 2나노 공정의 CDNA 5 아키텍처를 사용하며 칩당 최대 432GB의 HBM4를 탑재한다. 이 숫자는 실질적인 무게를 지닌다. 대규모 전문가 혼합(MoE) 모델을 가속기 한 대에서 실행할 수 있느냐, 여러 대로 쪼개야 하느냐의 차이이며, 후자는 하드웨어 비용과 네트워킹 복잡성을 모두 배로 늘린다.

학습이 아니라 추론이 압박을 몰고 오는 이유

학습이 주목을 받지만, 메모리 수요를 결정하는 것은 추론이다. 학습 실행은 끝나는 유한한 프로젝트인 반면, 추론은 영원히 돌아가고 사용자 수에 따라 확장된다. 토큰 하나를 생성하려면 모델 가중치와 키-값 캐시를 메모리에서 읽어야 하고, 캐시는 컨텍스트 길이에 따라 커지므로 긴 대화는 짧은 대화보다 사용자당 더 많은 메모리를 소모한다. AI 사용자가 일반 서비스 사용자보다 약 5배의 토큰을 소비한다는 분석가들의 추정은, 사람당 훨씬 더 많은 상태를 유지해야 하는 기계를 설명하는 것이다.

아키텍처 업계의 답은 분리(disaggregation)다. 프롬프트를 처리하는 프리필과 토큰을 생성하는 디코드를 분리해 각각에 맞는 하드웨어에서 실행하는 것이다. AMD와 Cerebras가 고처리량 처리와 저지연 생성을 결합한 조합을 작업 중이라는 보도가 있었다. 이는 랙 수준에서는 도움이 되지만, 두 절반 모두에 필요한 메모리 칩 공급에는 아무 도움이 되지 않는다. 세 공급업체 모두에서 패키징 수율이 개선되기 전까지는, 어떤 아키텍처적 기교도 제약을 풀지 못한 채 효율만 사들일 뿐이다.

AMD, 하드웨어 수주로 시가총액 1조 달러 돌파

상업적 뉴스도 같은 시기에 나왔다. AMD는 10월 2일 사상 최고가인 633.91달러에 마감하며 시가총액을 1조 달러 위로 끌어올렸고, 올해 들어 180% 넘는 상승률을 기록했다. 이 랠리에는 심리가 아닌 구체적인 원인이 있다. 오픈AI는 MI450을 중심으로 한 6기가와트 규모의 다세대 구축에 합의했으며, 2026년 하반기부터 배치가 시작되고 마일스톤에 연동해 최대 1억 6,000만 주의 AMD 주식을 살 수 있는 워런트가 포함됐다. 오라클은 3분기부터 5만 개의 MI450 GPU를 사용하는 슈퍼클러스터의 출시 파트너로 합류했다.

구조를 들여다보면 이는 칩 주문이라기보다 자금 조달 약정에 가깝다. 배치 마일스톤에 연동된 워런트는 구매자에게 공급업체의 성공에 대한 지분을 주는 것으로, 물량이 양측 모두를 걱정시킬 만큼 커졌을 때 이해관계를 정렬하는 방식이다. 엔비디아도 비슷한 전략을 펴고 있으며, 오픈AI를 위해 최소 10기가와트 규모의 자사 시스템을 계획하고 최대 1,000억 달러를 투자할 가능성이 있다. 두 공급업체 구도는 더 이상 조달 전략이 아니다. 그것은 합작투자 구조다.

마이크론의 분기 실적과 슈퍼사이클 논쟁

메모리 실적은 반대편에서 같은 신호를 보냈다. 마이크론의 분기 실적은 AI가 이끄는 HBM과 DRAM 수요에 힘입어 예상을 크게 웃돌았고, 여러 기관은 이 순간을 일시적 급등이 아닌 메모리 슈퍼사이클의 시작으로 묘사했다. 이를 뒷받침하는 논거 하나는 소비량이다. 추론 워크로드를 추적하는 분석가들은 AI 사용자 한 명당 토큰 소비량이 일반 서비스를 이용하는 사람의 약 5배라고 추정하는데, 이는 메모리를 부품 원가에서 사용자당 운영 비용으로 재정의한다.

이는 공급 부족이 어떻게 해소될지에 중요하다. 로직 생산 능력은 팹을 지어 늘릴 수 있고, 여기에는 2년 정도가 걸린다. HBM 생산 능력은 더 어렵다. 첨단 패키징과, 소수 공급업체만이 통제하는 법을 익힌 적층 수율에 달려 있기 때문이다. 삼성의 수율 문제는 경영 실패라기보다 숙련 기반이 얼마나 좁은지를 보여주는 증거다. 자격을 갖춘 세 번째 공급업체를 추가하는 것은 수년이 걸리는 프로젝트이며, 수요 곡선은 기다려주지 않는다.

같은 이야기의 데스크사이드 버전

이 제약은 더 작은 폼팩터에서도 나타난다. 엔비디아의 GB300 블랙웰 울트라는 800Gbps 네트워킹으로 데스크사이드 테스트에서 하루 22억 개 이상의 토큰을 시연했는데, 책상 아래 놓이는 기계로서는 놀라운 수치다. 또한 가격이 얼마나 많은 메모리를 집어넣을 수 있는지에 부분적으로 좌우되는 기계이기도 하다. 데이터센터 랙의 한계를 정하는 동일한 물리 법칙이 워크스테이션의 한계도 정한다.

업체들이 걸고 있는 장기적 해답은 아키텍처에 있다. CES에서 공개된 엔비디아의 베라 루빈 플랫폼은 루빈 GPU를 베라 CPU, NVLink 스케일업 네트워킹, 완전한 소프트웨어 스택과 결합하며, 이 회사는 원시 FLOPS보다 와트당 초당 토큰 같은 지표를 향해 나아가고 있다. 또한 NVLink Fusion을 통해 상호 연결을 개방해 파트너가 자체 CPU와 실리콘을 통합할 수 있게 했다. 맞춤형 메모리 컨트롤러 개발 노력도 보도되었는데, 이는 이 회사가 메모리 공급을 구매하는 상품이 아니라 전략적 변수로 계속 볼 것이라는 신호다.

주목할 점

2027년까지 메모리 제약이 완화될지 심화될지를 결정할 세 가지가 있다. 첫째는 AMD와 엔비디아 양쪽을 상대로 한 삼성의 HBM4 자격 승인 일정이다. 진정으로 자격을 갖춘 세 번째 공급업체의 등장이 어떤 단일 제품 출시보다 가격 역학을 더 크게 바꾸기 때문이다. 둘째는 마이크론이 대안으로서 격차를 좁히는지 여부이며, 그러면 한국 두 공급업체의 부담이 줄어들 것이다. 셋째는 프롬프트 처리와 토큰 생성이 서로 다른 가속기 유형에서 실행되는 분리형 추론이 단일 칩의 메모리 압박을 줄일 만큼 보편화되는지 여부다.

이 중 어느 것도 빠르게 해결되지 않는다. 그동안 AI 컴퓨팅을 사거나 그 위에 무언가를 만드는 사람에게 실질적인 결론은, 비용을 움직이는 숫자가 연산이 아니라 메모리라는 점이다. 로직 로드맵은 공개돼 있고 예측 가능하다. 메모리 로드맵은 패키징 수율, 수년에 걸쳐 쌓아야 하는 인력 기반, 세 회사의 자본 계획에 막혀 있으며, 실제로 얼마나 많은 가속기가 출하될지를 결정해온 것은 바로 이 로드맵이다.

관련 글