화웨이 클라우드, 에이전트 중심으로 스택을 재구축하고 청구서에 날짜를 못 박다

화웨이 클라우드는 9월 연례 커넥트(Connect) 콘퍼런스에서 자사의 엔터프라이즈 AI 포트폴리오가 이제 완전히 시장에 출시되었으며, 그 포트폴리오의 설계 중심은 에이전트라고 밝혔다. 화웨이 클라우드 CEO 저우웨펑(Zhou Yuefeng)은 이 전환을 산업용 에이전트 시대를 위한 “에이전틱 클라우드” 구축으로 규정했고, 함께 발표된 내용은 대부분 기반 기술에 관한 것이었다.
정확히 네 가지 기반 요소다. 화웨이 클라우드는 새로운 인프라 패러다임을 효율적인 토큰, 강화된 메모리, 범용 워크로드와 AI의 통합 스케줄링, 안전한 자율성으로 설명했다. 그 결과로 탄생한 플랫폼이 이미 전 세계 3,500개 이상 고객에게 서비스되고 있다고 밝혔다. 이 문구는 마케팅처럼 들리지만, 각 요소가 무엇을 겨냥하는지 보면 다르다. 각각은 챗봇이 아니라 프로덕션 환경의 에이전트가 겪는 실패를 해결하기 위한 것이기 때문이다.
토큰, 메모리, 그리고 10분 복구
컴퓨팅 계층은 링취(Lingqu) 어센드 950 클러스터 서비스다. 화웨이 클라우드는 이 서비스가 전 구간 관측성을 갖춘 5단계 고속 복구 메커니즘을 사용하며, 이 위에서 실행된 학습 작업이 40일 동안 중단 없이 돌아갔고, 장애는 10분 이내에 복구된다고 말한다. 토큰 처리량은 이전 세대보다 20% 높다고 제시한다. 이 서비스는 9월 30일 중국에서 상용화되었으며, 해외 출시는 11월 30일로 예정되어 있다.

10분 복구 목표는 벤치마크 점수와는 다른 사양이다. 장기 학습은 실패하며, 실패 비용은 손실된 GPU 시간과 재시작 오버헤드로 측정된다. 따라서 복구 시간은 고객의 재무팀이 실제로 신경 쓰는 숫자다.
메모리 계층은 장시간 실행되는 에이전트의 특정 실패 모드를 겨냥한다. 화웨이 클라우드는 이 제품을 CMS 메모리 스토리지라고 부르며, 페타바이트 규모의 메모리 공간을 제공해 유사 제품보다 약 두 배 용량이고, 테라바이트급 읽기 속도로 고속 접근을 지원하며 성능은 50% 개선됐다고 설명한다. 핵심 주장은 장기 작업을 수행하는 에이전트가 학습한 내용을 컨텍스트 윈도우가 아닌 곳에 보관할 공간이 필요하다는 것이다. 끝없이 커지는 컨텍스트 윈도우는 비용이 많이 들고 신뢰할 수 없기 때문이다.
다음은 모델 접근 계층이다. AgenticMaaS는 개발자가 배포 작업 없이 클릭 한 번으로 주류 최첨단 모델을 호출할 수 있게 해준다고 설명된다. MiniMax는 같은 행사에서 플랫폼 위에서 실행되는 멀티모달 모델을 시연했는데, 이는 중국에서 모델 벤더와 클라우드 벤더가 종종 같은 엔터프라이즈 구매자를 대상으로 판매한다는 점을 상기시킨다.
상용과 오픈소스, 함께 판매하다
애플리케이션 계층은 화웨이 클라우드의 접근 방식이 순수 인프라 사업과 갈리는 지점이다. 이 회사는 상용 지궈(ZhiGuo) AgentArts 플랫폼과 오픈소스 대응판인 openJiuwen이라는 이중 전략을 운영한다. 두 플랫폼을 합쳐 5,000개 이상의 범용 자산과 1,000개 이상의 산업별 자산을 공개했다고 밝히며, 이는 원시 모델이 아니라 재사용 가능한 스킬, 템플릿, 커넥터를 의미한다.
이 플랫폼은 선전 룽강구 정부, 중국우정저축은행, 중국남방전력망, 킹소프트 오피스를 포함해 100개 이상의 정부 기관, 은행, 연구 기관 및 기업에서 사용되고 있다. 킹소프트는 WPS 365 문서 센터와 Comate 어시스턴트를 결합해 플랫폼 위에 오피스 중심 에이전트를 구축했는데, 이는 클라우드 벤더 혼자서는 만들 수 없고 애플리케이션 벤더 혼자서는 호스팅할 수 없는 종류의 통합이다.
지궈 AgentArts는 12월 30일 해외 시장에서 상용 출시될 예정이다. openJiuwen을 둘러싼 오픈소스 커뮤니티는 5만 개 이상의 스타와 329만 건의 다운로드를 보고했다. 상용 플랫폼과 오픈 버전을 동시에 제공하는 것은 결국 유료 등급이 필요해질 개발자 기반을 미리 키우는 방법이며, 여러 중국 벤더가 따르는 패턴이기도 하다.
온프레미스를 위한 또 다른 논거
화웨이 클라우드만 중국에서 에이전트 인프라를 판매하는 것은 아니며, 9월의 더 조용한 일련의 행사들은 시장의 나머지를 보여준다. 미타크(Mitac)는 AMD와 협력해 Agent Builder라는 엔터프라이즈 에이전트 어플라이언스를 위해 우시와 구이양에서 배포 세미나를 열었다. 이 어플라이언스는 AMD의 라이젠 AI 맥스 프로세서를 기반으로 하며 데이터 주권을 내세운다. 여기서의 제안은 퍼블릭 클라우드와 정반대다. 모델, 컴퓨팅, 지식 베이스, 비즈니스 시스템을 회사 안에 두고 사무실의 박스에서 에이전트를 실행하라는 것이다.
두 접근 방식 모두 같은 구매 반대에 대응하고 있다. 기업은 실제 비즈니스 프로세스에 닿는 에이전트를 원하지만, 실제 비즈니스 프로세스에는 다른 사람의 엔드포인트 뒤에 두기를 꺼리는 데이터가 포함되어 있다.
구매자가 이미 추적하는 네 가지 숫자
네 가지 인프라 기둥은 네 가지 비용에 대응한다. 토큰은 모든 추론의 가격이며, 그래서 발표가 벤치마크 점수가 아니라 처리량을 앞세우는 이유다. 메모리는 컨텍스트 윈도우가 더는 충분하지 않을 때 장기 실행 작업에 드는 비용이다. 스케줄링은 공유 하드웨어에서 범용 워크로드와 AI 워크로드를 함께 돌릴 때 발생하는 활용률 페널티다. 보안은 무엇이든 프로덕션 데이터에 닿기 전에 규정 준수 부서가 묻는 사항이다.
화웨이 클라우드의 주장은 이 네 가지를 하나의 스택에서 해결했으며, 실리콘을 직접 보유하기 때문에 가능하다는 것이다. 이는 경쟁사가 따라가기 더 어려운 약속이고, 고객이 확인하기는 더 쉬운 약속이다. 결과가 구매팀이 이미 측정하는 세 가지 지표에 나타나기 때문이다: 백만 토큰당 비용, 장기 실행 실패율, 실제로 작업을 수행하는 GPU 시간 비율.
왜 모델이 아니라 인프라가 핵심인가
올해 중국 에이전트 논의에서 나온 흥미로운 주장은 모델 역량이 수렴했고 가치가 이를 둘러싼 것들로 이동했다는 것이다. 상하이 고급금융연구원(Shanghai Advanced Institute of Finance)의 실무 교수는 9월 상하이 포럼에서 이 주장의 경제학적 버전을 제시했다. 한계비용이 0에 가깝고 네트워크 효과가 강한 인터넷 플랫폼과 달리, 대규모 모델은 추론할 때마다 자원을 소비하며 사용자는 몇 분 만에 모델을 바꿀 수 있다. 모델만으로 구축한 해자는 얇다.
그 해석이 맞다면, 방어 가능한 계층은 옮기기에 비싼 계층이다. 즉 가중치가 아니라 토큰, 메모리, 스케줄링, 보안이다.
그 구도에서 화웨이의 장점은 수직 통합이다. 칩, 인터커넥트, 클라우드, 모델 플랫폼을 모두 보유하고 있으며, 그래서 어센드 950 발표가 리더보드 순위가 아니라 복구 시간과 토큰 처리량을 앞세우는 것이다. 칩 사업이 없는 경쟁사는 통합 스토리를 팔고 있고, 통합 스토리는 복제하기가 더 쉽다.
반론은 통합되어 있다는 것이 단일 실패 지점이 되기도 하며, 기업들이 점점 더 벤더에 종속된 형태가 아니라 이식 가능한 에이전트 계층을 원한다는 것이다. 이 긴장이 향후 두 분기에 시험대에 오르며, 9월 30일 중국 상용화와 11월 말 해외 출시를 시작으로 진행된다. 해외 일정은 국내 일정보다 더 중요하다. 국내 실리콘을 중심으로 구축된 스택은 데이터가 자국 관할권을 떠날 수 없는 고객에게 서비스를 제공할 수 있음을 증명해야 하기 때문이다.
관련 글
샤오미, 프런티어에 맞먹는 옴니모달 모델과 학습 레시피까지 공개
가중치는 모델을 실행하게 해줍니다. 환경은 모델을 다시 학습시킬 수 있게 해줍니다.
Cadence, 칩 설계에 에이전트를 투입해 5주 검증 주기를 하루로 단축
따라서 에이전트는 하위 엔진을 더 적게가 아니라 더 많이 호출한다.
로블록스 빌드, 6주 만에 9,000개 게임 공개. 흥미로운 숫자는 71
이것은 품질 지표가 아니라 유입 지표로 읽어야 한다.
9월에 두 에이전트가 프로덕션에 투입됐다. 이들이 공통으로 가진 것
9월에 프로덕션과의 접촉에서 살아남은 에이전트는 기존 프로세스에 맞춘 에이전트였다.