AI 칩의 기묘한 경제학: 새 랙은 비용을 낮추지만 구형 칩은 더 비싸진다

9월 AI 하드웨어 업계에서는 두 가지 일이 일어났는데, 서로 반대 방향을 가리키는 것처럼 보인다. 엔비디아는 최신 랙 규모 시스템을 대형 클라우드 제공업체에 출하하기 시작했고, 추론 비용을 크게 낮출 것이라고 약속했다. 동시에 3년 된 H100 칩의 임대 가격은 올랐다. 둘 다 사실이며, 함께 보면 AI 경제가 실제로 어떻게 작동하는지에 대한 무언가를 설명해 준다.
새로운 랙
엔비디아는 베라 루빈 NVL144 랙 시스템이 대량 출하되고 있으며, 마이크로소프트, 구글, 아마존, 오라클에서 첫 주요 배치가 가동되고, 코어위브는 첫 루빈 클러스터를 9월 말 이전에 고객이 이용할 수 있게 할 것이라고 밝혔다. 이는 업계가 시도한 가장 큰 하드웨어 전환으로, 지난 2년간 대부분의 프런티어 모델 학습을 뒷받침해 온 블랙웰 세대를 대체한다.
이 아키텍처는 단일 칩이 아니다. 베라 루빈은 노드당 베라 CPU 하나와 루빈 GPU 두 개를 짝지어 연결함으로써 랙 전체가 하나의 대형 프로세서처럼 작동하게 한다. NVL144 구성은 한 랙의 72개 노드에 걸쳐 144개의 루빈 GPU를 연결하며, 생산 시스템 최초로 HBM4 메모리를 사용하고 GPU당 약 초당 13테라바이트의 메모리 대역폭을 제공한다. 엔비디아는 랙당 약 3.6 엑사플롭스의 FP4 추론 성능을 주장하는데, 이는 비슷한 블랙웰 NVL72 랙의 약 3배다. 이는 이상적인 조건의 수치이며, 보수적인 독립 추정치는 실제 이득을 2배에서 2.5배에 가깝게 본다.
데이터센터 밖의 모든 사람에게 중요한 숫자는 토큰당 비용이다. 초기 클라우드 가격은 루빈 기반 인스턴스가 출시 시점에 블랙웰 추론보다 30~40% 저렴할 수 있음을 시사하며, 용량이 늘어나면 가격은 보통 더 떨어진다. 이 수치는 API 호출 가격, 구독 규모, 그리고 20달러 요금제 안에 비디오 생성 기능이 존재할 수 있는지 여부로 이어진다.
더 비싸진 구형 칩
여기 반직관적인 부분이 있다. 9월에, 첫 AI 제품 물결을 뒷받침한 칩인 H100의 시간당 임대 가격이 22% 올라 3.28달러가 되었다. 엔비디아 CEO는 이 상승을 컴퓨트가 정해진 일정에 따라 감가상각되는 대상이 아니라 수익을 창출하는 내구성 자산이라는 증거로 지목했다.
이유는 공급이다. 새로운 블랙웰과 루빈 칩은 최대 구매자들을 위해 예약되고 있어, 더 오래된 H100 클러스터가 일상적인 추론 워크로드를 처리하게 된다. 데이터센터 전반의 전력과 메모리 공급 부족은 구형 하드웨어를 계속 바쁘게 만들고 임대 가격을 높게 유지한다. H100은 대형 클라우드 기업들이 시간당 7~8달러에 임대하던 출시 당시보다 여전히 훨씬 저렴하지만, 최근의 상승은 칩 가치를 5~6년에 걸쳐 상각하는 표준 회계와 어긋난다.
그 격차는 주목을 끌었다. 공매도 투자자들은 실제 칩 수명이 공식 일정이 가정하는 것보다 짧다고 주장해 왔으며, 이는 클라우드 제공업체 장부의 감가상각이 너무 느리다는 뜻이 된다. 엔비디아는 8월에 962억 달러의 기록적인 분기 매출을 올렸고, 임대 가격 상승은 자사 칩이 새것이 된 지 한참 지나서도 계속 수익을 낸다는 새로운 논거를 회사에 제공한다.
새 랙을 확장하기 위한 경쟁
출시 속도는 사양만큼이나 많은 것을 말해 준다. 코어위브는 새 하드웨어를 멀티 랙 규모로 운영한 첫 클라우드 제공업체가 되었으며, 9월 16일 두 리전에 걸친 하나의 프로덕션 클러스터로 7개의 베라 루빈 NVL72 랙, 총 504개의 GPU를 가동했다. 검증된 단일 랙에서 멀티 랙 패브릭으로 도약하는 것은 중요하다. 에이전트형 AI 워크로드는 지연에 민감한 작은 호출을 많이 발생시키고, 반복되는 모델 및 도구 상호작용 전반에 걸쳐 지연이 누적되기 때문이다. 각 NVL72 랙은 72개의 GPU와 36개의 베라 CPU를 짝지으며, 패브릭 설계는 재설계 없이 레일당 약 128,000개의 GPU를 지원하므로 용량 추가는 재구축이 아니라 구성 변경이다.
공급 패턴도 이번에는 달라 보인다. 블랙웰 세대에서는 수요가 공급을 너무 앞질러 소규모 클라우드 제공업체와 국가 AI 프로그램이 6개월 이상 기다려야 했다. 엔비디아는 루빈 생산을 더 일찍 늘렸고, 유럽과 중동의 여러 소버린 AI 프로젝트가 세 번째가 아닌 첫 출하 물결에 포함된 것으로 알려졌다. 엔비디아는 또한 호주 클라우드 및 데이터센터 운영업체들과 파트너십을 맺고 2027년까지 최대 2기가와트의 AI 팩토리 용량을 구축한다고 발표했다. 이것이 유지된다면 GPU 시간 임대가 상당히 쉬워져, 다운스트림에 있는 모두에게 전체 비용 곡선을 끌어내린다.
두 가지가 모두 사실인 이유
겉보기 모순은 훈련과 추론을 분리하면 해소된다. 훈련에는 가장 새롭고 가장 큰 클러스터가 필요하며, 그 수요가 바로 베라 루빈 같은 랙을 구축하는 이유다. 추론은 모델이 훈련된 후 하는 모든 일이다. 모든 챗봇 응답, 생성된 모든 이미지, 모든 코딩 제안이 여기에 해당한다. 사용량이 늘면서 그러한 요청을 처리하는 반복 비용은 원래의 훈련 비용보다 커질 수 있다.
그래서 엔비디아는 모든 소켓을 지키기보다 생태계의 일부를 개방하고 있다. 9월 10일, 엔비디아는 추론 전용 칩을 만드는 스타트업 d-Matrix와 협업을 발표했다. 이 계약에 따라 d-Matrix의 차세대 Raptor 칩은 NVLink Fusion을 통해 엔비디아의 랙 아키텍처에 연결된다. Raptor는 AI 추론, 특히 챗봇, 코딩 어시스턴트, 음성 에이전트처럼 지연이 낮아야 하는 작업을 위해 만들어졌으며, 지연과 비용을 줄이기 위한 메모리 중심 설계를 갖췄다. 엔비디아는 완전히 소유했던 것을 포기하지 않는다. 여전히 랙 주변의 CPU, 네트워킹, 스위치, 소프트웨어를 공급하면서, 모든 가속기를 차지하지 못하더라도 추론 시장에서 한 자리를 확보하는 것이다.
이 모든 것 아래에는 더 강한 제약이 있다. 베라 루빈 NVL144 랙 한 대는 약 600킬로와트를 소비하며, 이는 대략 일반 가정 500가구의 전력량이다. AI 성장의 실질적 한계는 칩이 아니라 전력이 되고 있으며, 그래서 마이크로소프트, 구글, 아마존이 지난해 이런 클러스터에 전력을 공급하기 위해 원자력 및 지열 전력 계약을 모두 체결했다. AI 용량이 어디로 가는지 알고 싶다면, 벤치마크 점수보다 전력 구매 계약을 지켜보라.
AI 가격에 의미하는 것
사용자 입장에서 실질적인 해석은 최신 하드웨어 비용이 높게 유지되더라도 모델 실행 비용은 계속 떨어져야 한다는 것이다. 더 저렴한 추론은 작년에는 너무 비쌌던 기능이 올해 표준이 될 수 있게 한다. 길고 신중한 챗봇 답변, 전체 코드베이스를 읽는 코딩 어시스턴트, 주문형 비디오 생성은 모두 이 비용 곡선이 아래로 휘어지는 데 달려 있다.
투자자들이 계속 묻는 질문은 막대한 데이터센터 지출이 언젠가 스스로 비용을 회수할 수 있느냐는 것이다. 루빈은 그 답의 일부다. 같은 모델의 실행 비용이 약 18개월마다 대략 절반으로 떨어진다면, 그 지출은 버블이라기보다 인프라처럼 보이기 시작한다. 그 곡선이 멈춘다면 회의론자들의 때가 온다. 향후 두 분기의 클라우드 가격이 방향을 말해 줄 것이며, 그 숫자는 어떤 벤치마크보다 훨씬 먼저 AI 도구 비용의 형태로 여러분에게 다가올 것이다.
관련 글
Anthropic, 이제 답변을 거부한 요청에도 비용을 청구한다
비용이 들지 않는 차단된 요청은 무료 탐침이다.
중국이 황매희를 세로 화면에 올렸고, 그 노래는 살아남았다
모델이 실제 그것으로 학습되었거나, 그렇지 않으면 알아차릴 유일한 관객에게 출력이 잘못 들릴 뿐이다.
13,000장의 내부 스크린샷이 공개 GitHub에 올라갔고, 그걸 올린 공격자는 없었다
플릿 전체에서 반복되는 기본 동작은 정책의 결과다.
아마존, 자사가 계속 쓰는 80억 달러어치 엔비디아 칩을 투자자들이 보유하길 원해
항공사들은 수십 년간 항공기를 매각 후 임차해 왔다. 이제 같은 아이디어가 GPU에 적용되고 있다.