3일간의 세 건의 계약이 엔비디아를 디폴트에서 여러 선택지 중 하나로 바꿔 놓았다

10월 2일, 아마존과 시놉시스는 10억 달러 이상 규모의 다년 파트너십을 발표했으며, 이는 아마존에 시놉시스의 AI 가속 칩 설계 도구에 대한 독점 라이선스를 제공한다. 같은 날, 보도들은 오픈AI가 랙 규모 구성에서 AMD EPYC Turin CPU와 함께 Jalapeno ASIC 프로세서를 배치하여 엔비디아의 고성능 에이전트형 칩을 우회하고 있다고 전했다. 10월 3일, General Compute는 Cerebras의 웨이퍼 스케일 프로세서를 자사 GPU 클라우드에 도입하는 다년 계약을 체결했다.
세 개의 별개 회사, 세 가지 다른 경로, 하나의 방향. AI 컴퓨트의 최대 구매자들은 거의 모든 것을 공급해 온 공급업체에 대한 대안을 구축하거나 구매하고 있다.
이 중 어느 것도 엔비디아가 지고 있다는 뜻은 아니다. 이는 시장이 더 이상 단일 공급원이 아니라는 뜻이며, 그것은 다른 종류의 위험이다.
아마존, 칩을 뒷받침하는 툴링을 사다
시놉시스 계약은 가장 극적이지 않지만 아마도 가장 중대한 계약이다. 아마존은 이미 Trainium과 Inferentia 라인을 포함해 자체 실리콘을 설계하고 있다. 설계 도구를 소유하는 것은 한 단계 더 상류로 올라가는 것이다. 칩 설계 소프트웨어는 기업이 얼마나 빠르게 반복할 수 있는지를 결정하며, AI 가속 설계 도구에 대한 독점적 접근은 아이디어와 테스트 가능한 부품 사이의 루프를 단축한다.
핵심 단어는 독점성이다. 아마존이 경쟁사가 얻을 수 없는 라이선스를 보유한다면, 아마존의 내부 설계 주기는 경쟁사보다 더 빠르게 복리처럼 쌓인다. 그 이점은 단일 칩에 관한 것이 아니다. 경쟁사가 한 세대를 생산하는 동안 아마존이 몇 세대를 생산할 수 있는지에 관한 것이다.
이 접근법에는 비용이 따른다. 가속기를 자체 설계한다는 것은 소프트웨어 스택, 컴파일러, 그리고 개발자들이 채택해야 하는 라이브러리 세트를 유지해야 한다는 뜻이다. 엔비디아의 진정한 해자는 결코 실리콘만이 아니었다. 그것은 CUDA, 그 위에 쌓인 수년간의 툴링, 그리고 엔지니어들이 먼저 엔비디아를 찾는 습관이다. 아마존의 10억 달러는 설계 속도를 산다. 그 습관을 사지는 않는다.
오픈AI, 의도적으로 최상위 계층을 우회하다
오픈AI의 Jalapeno 배치는 더 직접적이다. 랙 규모에서 맞춤형 ASIC을 AMD EPYC Turin CPU와 결합한다는 것은 오픈AI가 엔비디아의 차세대 고성능 부품을 기다리지 않는다는 뜻이다. 오픈AI는 자체 조건으로 조달할 수 있는 구성 요소로 추론 용량을 조립하고 있다.
추론에서는 그것이 합리적인 베팅이다. 프런티어 모델을 훈련하려면 가장 빠른 인터커넥트와 가장 큰 메모리 풀이 필요하며, 이는 엔비디아의 최상위 부품이 가격을 정당화하는 지점이다. 완성된 모델을 수백만 사용자에게 제공하는 것은 다른 워크로드이며, 이는 원시 최고 성능보다 토큰당 비용을 더 중요하게 여긴다. 맞춤형 ASIC과 범용 CPU가 동일한 트래픽을 더 저렴하게 처리할 수 있다면, 절감 효과는 볼륨에 따라 확대된다.
오픈AI는 투자를 정당화할 트래픽과 엔지니어링 인력 모두를 갖추고 있다. 또한 비용 외의 이유도 있다. 단일 공급업체에 대한 모든 의존은 그 공급업체에 영향력을 넘겨주며, 어떤 연구소도 자신의 로드맵이 다른 누군가의 할당 결정에 의해 정해지기를 원하지 않는다.
세레브라스, 유통 채널을 찾다
General Compute 계약은 대안들이 연구에서 소매로 이동하고 있다는 가장 명확한 신호다. Cerebras는 웨이퍼 스케일 프로세서를 만드는데, 이는 GPU 랙과는 진정으로 다르다. 이를 GPU 클라우드 플랫폼에 넣는다는 것은 이미 컴퓨트를 임대하는 고객이 다른 머신 유형을 선택하듯 Cerebras 인스턴스를 선택할 수 있다는 뜻이다.
이는 도입에 유통 문제가 있기 때문에 중요하다. 시간 단위로 임대할 방법이 없는 더 나은 가속기는 연구 프로젝트에 불과하다. 드롭다운 메뉴에 나타나는 더 나쁜 가속기는 비즈니스다. General Compute는 그 드롭다운을 공급하고 있다.
웨이퍼 스케일 실리콘이 실제 워크로드에서 승리할지는 아직 미지수다. 핵심은 추론 용량이 더 이상 고객에게 도달하기 위해 한 공급업체의 제품 라인에서 나올 필요가 없다는 것이다.
소프트웨어 해자가 사기 더 어려운 이유
대안 가속기를 추구하는 모든 기업은 같은 벽에 부딪히는데, 그 벽은 실리콘으로 만들어지지 않았다. 엔비디아의 이점은 개발자들이 이미 알고 있는 라이브러리, 컴파일러, 디버깅 도구 스택에 기반한다. 새 가속기를 위해 훈련 스크립트를 다시 작성하는 것은 주말 작업이다. 전체 프로덕션 시스템을 다시 작성하고, 팀을 재교육하며, 성능이 더 나빠지는 기간을 감수하는 것은 누군가에게 정당화해야 하는 결정이다.
그래서 세 계약이 서로 다른 계층에 초점을 맞춘다. 아마존은 부품 생산 비용을 줄여 주는 설계 툴링을 사들이고 있다. 오픈AI는 소프트웨어 표면이 훈련보다 좁은 추론 실리콘을 배치하고 있다. General Compute는 메뉴 항목을 추가하여 고객이 마이그레이션을 약속하지 않고도 대안을 시험해 볼 수 있게 한다.
도전자들에게 가장 가능성 높은 경로는 훈련에서 기존 업체를 대체하는 것이 아니다. 워크로드가 더 표준화되어 있고 토큰당 비용을 측정하기 더 쉬운 추론에서 승리하는 것이다. 대안에서 대규모 추론이 실행되기 시작하면 그 주변의 툴링이 개선되고, 차세대를 위한 격차가 좁혀진다.
유용한 역사적 유사점이 있다. 리눅스는 데스크톱에서 유닉스를 대체하지 않았고, 그럴 필요도 없었다. 리눅스는 워크로드가 표준화되어 있고 구매자가 작업 단위당 비용을 중요시하는 서버에서 승리했다. 도전자 생태계는 다른 범주로 성장하기 전에 단 하나의 워크로드 범주에서 자리 잡기만 하면 된다.
패턴은 반엔비디아가 아니라 이질적이다
세 가지 움직임을 함께 놓고 보면 전략은 엔비디아를 대체하는 것이 아니다. 단일 공급 곡선에 의존하지 않는 것이다. 아마존은 설계 속도를 원한다. 오픈AI는 추론 경제성을 원한다. General Compute는 차별화된 메뉴를 원한다. 각 구매자는 서로 다른 제약을 최적화하고 있으며, 그들 중 누구도 벤치마크에서 이기려 하지 않는다.
성숙한 컴퓨트 시장은 그렇게 행동한다. 메인프레임, x86, 그리고 결국 모바일은 모두 볼륨이 커지고 구매자가 교섭력을 얻으면서 분화되었다. AI 가속기 시장도 그 지점에 도달했고, 분화는 제품 발표가 아니라 조달에서 나타나고 있다.

엔비디아에 대한 함의는 내일 점유율을 잃는다는 것이 아니다. 가격과 할당이 받아들여지는 것이 아니라 협상될 것이라는 점이다. 고객이 작동하는 대안을 가지고 있다고 설득력 있게 말할 수 있을 때, 대화는 달라진다.
지켜볼 것
아마존의 설계 도구가 외부 개발자들이 사용하고 싶어 하는 부품을 만들어낼지 여부다. 독점성은 아마존 내부에 도움이 된다. 진정한 대안은 외부 생태계가 필요하며, 그러려면 문서, 컴파일러, 인내가 필요하다.
오픈AI의 Jalapeno 랙이 사용자들이 기대하는 안정성으로 프로덕션 트래픽을 처리할 수 있을지 여부다. 맞춤형 실리콘은 발표하기는 쉽고 운영하기는 어렵다. 한 번의 세간의 이목을 끄는 장애가 대안 전략을 1년 뒤로 밀어낼 수 있다.
다른 클라우드들이 General Compute를 따라 비GPU 가속기를 목록에 올릴지 여부다. 유통은 모든 도전자에게 병목이며, 추가되는 각 스토어프런트는 다음 스토어프런트를 더 쉽게 만든다.
흥미로운 세부 사항은 시점이다. 이 세 계약은 서로 조율하지 않는 회사들로부터 약 72시간 안에 나왔다. 독립적인 구매자들이 같은 주에 같은 결론에 도달할 때, 그 결론은 보통 우연이 아니라 근본 조건의 실제 변화를 반영한다.
컴퓨트 조달은 이제 포트폴리오 결정이 되었으며, 이는 어떤 단일 칩 출시보다 더 조용한 변화이고 차세대 제품보다 더 오래 지속될 변화다.
관련 글
아무도 홍보하지 않는 비디오 모델 리더보드: 요청은 실제로 어디로 가는가
매주 새로운 비디오 생성 순위가 나오고, 그 거의 전부가 같은 방식으로 만들어진다.
Ai2가 오픈소스로 공개한 것은 또 다른 가중치가 아니라 학습 스택이다
가중치는 나누기 쉽지만 배우기는 어렵다.
알리바바의 Qwen3.8-Max, 2주 동안 스스로 코딩할 수 있다고 주장
파라미터 수는 이미 오래전부터 뉴스거리가 아니게 되었다. 주목할 만한 숫자는 12일이다.
PixelUMM, 모든 비주얼 AI 모델이 의존하는 두 가지 구성 요소를 버리다
픽셀 수준 확산은 이전에도 제안되었지만 반복적으로 연산 한계에 부딪혔습니다.