Zhipu의 GLM-5.2, 완전 공개: 7,440억 파라미터, 국산 칩으로 학습

베이징의 연구소이자 Z.AI로도 알려진 Zhipu AI가 GLM-5.2를 출시하고 며칠 만에 전체 오픈 웨이트를 공개했다. 이 모델은 총 7,440억 개 파라미터를 갖추고 토큰당 약 400억 개가 활성화되며, IndexShare라는 독특한 희소 어텐션 최적화를 사용하는 전문가 혼합(MoE) 아키텍처를 채택했다.
라이선스는 MIT다. 이 모델을 기반으로 무언가를 만들 계획이라면 이것이 핵심이다. 지역별 예외 조항도, 매출 기준 발동 조건도, 월간 활성 사용자 상한도 없다. 상업적 배포, 수정, 재배포에 추가 허가가 필요하지 않다.
IndexShare가 주는 이점
IndexShare 아키텍처는 레이어 전반에 걸쳐 희소 어텐션 인덱서를 재사용하며, 기술 문서에서는 이를 모델의 최대 100만 토큰 컨텍스트 창에서 토큰당 연산량을 2.9배 줄인 것으로 설명한다. 이 숫자는 개별 벤치마크로 보기보다 경제적 사실로 볼 때 더 중요하다. 토큰 비용은 장문맥 에이전트 세션에서 누적되며, 컨텍스트 창 최상단에서의 2.9배 절감은 주어진 클러스터에서 어떤 워크로드가 실행 가능한지를 바꾼다.
GLM-5.2는 100만 토큰을 기본 지원하며 Artificial Analysis Intelligence Index에서 최상위 오픈 웨이트 모델로 등록되었다. SWE-bench Pro에서는 62.1%를 기록해 GPT-5.5의 58.6%를 앞섰다. Terminal-Bench 2.1에서는 81.0을 기록해 오픈 웨이트 모델 중 보고된 가장 강력한 점수를 받았다.
하드웨어 이야기가 곧 지정학적 이야기다
GLM-5.2에서 벤치마크 논란보다 오래 남을 부분은 어디서 실행되는가다. GLM-5 시리즈 전체는 MindSpore 프레임워크를 사용해 화웨이 Ascend 칩에서 학습되었다. 이는 어떤 서구 연구소도 할 수 없는 주장이며, 원점수보다 공급망 회복력을 고려하는 구매자들이 이 모델에 주목하는 이유다.
Zhipu의 발표 자료에 따르면 온라인 추론은 여러 국산 컴퓨팅 플랫폼에서 실행되며, 화웨이 Ascend, T-Head, Moore Threads, Cambricon, Kunlun, Muxi, Hygon, Biren에 대해 출시 첫날부터 호환된다. 회사는 이를 국산 칩 클러스터에서 높은 처리량, 낮은 지연 시간, 대규모 동시성으로 안정적으로 운영된다고 설명한다.
중국 밖의 기업에게 실질적인 질문은 이 가중치가 토큰당 비용을 없애는 자체 호스팅 경로를 제공하느냐다. 중국 안의 기업에게 질문은 더 넓다. 안정적으로 구매할 수 없는 하드웨어에 의존하지 않고도 최전선급 모델을 구축하고 서빙할 수 있는가 하는 점이다.
비용은 얼마이며, 자체 호스팅이 바꾸는 것
가격 계층은 명확히 구분된다. 직접 API 접근은 입력 토큰 100만 개당 약 $1.40, 출력 토큰 100만 개당 $4.40이며, 캐시된 입력은 $0.26이다. OpenRouter를 통하면 요율은 대략 $1.00와 $4.00이다. GLM Coding Plan 구독은 개발자 중심 계층으로 월 $10에서 $18이며, 프로덕션 규모를 위한 것은 아니다.
자체 호스팅에서 계산이 달라진다. 온프레미스 배포는 인프라 비용을 수반하지만 토큰당 요금은 없다. 하루에 수백만 토큰을 처리하는 워크로드라면 그 차이는 상당하다. 대가로 GPU 클러스터, 유지보수, 그리고 관리형 API가 숨겨주는 확장 작업이 필요하다. MIT 라이선스는 경제적 장점 위에 법적 마찰까지 줄여준다.

양자화는 또 다른 지렛대다. 양자화된 가중치를 사용하면 이 모델은 소비자용 하드웨어에서 실행된다고 하며, 이는 의료 기록이나 독점 코드베이스를 다루는 에이전트처럼 프라이버시에 민감한 애플리케이션에 자체 호스팅 경로를 열어준다.
읽어볼 만한 보안 각주
누구든 오픈 웨이트를 공짜 점심으로 여기기 전에 주목할 만한 발견이 하나 있다. Anthropic의 레드팀 평가는 GLM-5.3이 오픈 웨이트 오용에 대한 보호 장치가 약한 상태에서 Mythos급 자율 사이버 능력을 보인다고 보고했다. 오픈 웨이트는 회수할 수 없다. 한 번 다운로드되면 그 모델은 배포 조직의 소유로 무기한 남는다.
이는 특정한 배포 문제를 만든다. 에이전트 프레임워크 내부에서 실행되는 오픈 웨이트 모델에는 폐쇄형 API 제공자가 자체 측에서 처리하는 격리 계층이 필요하다. MIT 라이선스는 벤더 종속을 제거하는 동시에 벤더가 제공하는 보안 보장도 제거한다. GLM-5.2를 에이전트 루프에 배포하는 팀은 런타임 격리 비용을 예산에 반영해야 하며, 이를 남의 문제로 치부해서는 안 된다.
이번 공개가 다르게 다가오는 이유
매달 수많은 오픈 모델이 출시된다. GLM-5.2가 다르게 다가오는 이유는 서로 맞물리는 세 가지다.
라이선스는 이 파라미터 규모에서 보기 드문 진정한 허용형이다. 대부분의 최전선급 오픈 릴리스는 상업적 조건, 지역 제한 또는 사용자 상한을 동반한다. GLM-5.2에는 그런 것이 없다.
하드웨어 경로는 NVIDIA와 무관하다. 공급망 위험을 일차적 고려 사항으로 여기는 구매자에게는 벤치마크 순위와 관계없이 후보 목록이 달라진다.
그리고 장문맥에서의 연산 효율성은 문서상 최소 8xH100 노드가 필요한 NVIDIA의 Nemotron 3 Ultra 같은 모델보다 더 작은 클러스터에서도 지속적인 다단계 세션을 경제적으로 실행 가능하게 만든다.
GLM-5.2가 모든 작업에서 최고의 모델은 아니며 보안 유의사항도 실제다. 하지만 오픈 릴리스가 이제 무엇이 될 수 있는지를 보여주는 신호로서, 최전선 경쟁력, 허용적 라이선스, 미국산 GPU 없이 구축이라는 점에서 이번 주기에서 가장 명확한 사례다.
플래그십을 둘러싼 패밀리
GLM-5.2를 단독 릴리스가 아니라 사다리의 꼭대기로 보면 이해가 쉽다. GLM 패밀리는 엣지 배포를 겨냥한 경량 GLM-4.6V-Flash 9B부터 744B 플래그십까지 아우른다. 특화 변형으로는 멀티모달 비전 작업용 GLM-5V-Turbo와 복잡한 다단계 계획용 AutoGLM 에이전트 프레임워크가 있다.
허용적 라이선스는 그 사다리 전체에 적용되며, 이것이 스택을 선택하는 팀에 중요한 부분이다. 기업은 소형 엣지 모델에서 프로토타이핑하고 플래그십으로 확장하며, 각 단계마다 권리를 다시 협상하지 않고 이들 사이를 오갈 수 있다. 이러한 연속성은 연구소의 소형 릴리스와 대형 릴리스 간에 라이선스가 다른 경우가 많은 오픈 생태계에서는 이례적이다.
효율성 주장이 실제로 의미하는 것
전체 컨텍스트에서 토큰당 연산량이 2.9배 줄어든다는 것은 워크로드에 붙여 보기 전까지는 스펙처럼 읽히는 종류의 숫자다.
대규모 코드베이스나 긴 문서 집합을 추론하는 에이전트를 생각해 보자. 각 단계는 점점 커지는 컨텍스트를 다시 읽고, 그 재읽기 비용이 긴 세션을 비싸게 만든다. 컨텍스트 창 최상단에서 거의 3배에 가까운 절감은 장시간 실행 세션이 더 이상 가치 없어지는 지점을 낮춘다. 세션은 여전히 비용이 들지만 손익분기점이 이동한다.
양자화 경로가 중요한 이유도 여기에 있다. 양자화된 가중치를 사용하면 이 모델은 소비자용 하드웨어에서 실행된다고 하며, 이는 장문맥 에이전트를 클러스터가 필요한 무언가에서 소규모 팀이 로컬에서 실행할 수 있는 무언가로 바꾼다. 의료 기록이나 독점 소스 코드처럼 민감한 데이터를 다루는 애플리케이션에서 로컬 실행은 규정 준수 제약에 맞는 유일한 배포 방식이며, 비용은 부차적 이점이다.
보안 유의사항이 실제로 문제가 되는 지점
레드팀 발견을 남의 문제로 치부하기는 쉽다. 하지만 그렇지 않으며, 이유는 구조적이다.
폐쇄형 API 제공자는 사후에 모델을 업데이트하거나 정책을 바꾸거나 오용 사례를 차단할 수 있다. 오픈 웨이트 릴리스는 그 지렛대를 없앤다. 가중치는 한 번 다운로드되면 배포 조직의 소유로 남고, 어떤 벤더도 회수할 수 없다. 이것이 오픈 웨이트의 핵심이며, 격리를 배포하는 팀이 직접 구축해야 하는 이유이기도 하다.
실제로 이는 GLM-5.2를 실행하는 에이전트에 쓰기 권한이 있는 강력한 도구에 팀이 적용할 것과 동일한 런타임 규율이 필요하다는 뜻이다. 범위가 제한된 권한, 신뢰할 수 없는 작업을 위한 샌드박스, 충돌 후에도 남는 로깅, 중대한 결정을 위한 인간 에스컬레이션 경로가 그것이다. 그중 어느 것도 라이선스가 제공하지 않으며, 가중치와 함께 무료로 따라오지도 않는다. MIT 조건은 법적 측면에서 벤더 종속을 제거하고, 설계상 운영 측면에서 벤더가 제공하는 안전성을 제거한다.
관련 글
메타, 미드저니의 이미지·영상 기술 라이선스… 그 이유가 말해주는 것
벤치마크는 분기마다 바뀐다. 무엇이 보기 좋은지에 대한 커뮤니티의 판단은 그렇지 않다.
AssemblyAI, 실시간 음성 지연 시간을 91밀리초로 단축했다. 이 숫자가 중요한 이유
음성의 제약은 결코 단어 오류율이 아니었다. 그것은 턴 테이킹이었다.
Google의 Nano Banana 2.1은 플래그십이 아닌 기능 드롭이다
중간 등급 릴리스는 연구소가 대부분의 사용자가 실제로 무엇을 필요로 한다고 생각하는지 알려주며, 이는 플래그십보다 더 유용한 신호다.
동영상 광고 스택은 전문 모델들로 분화했고, Boreal-H3가 그 이유를 보여준다
시네마틱 품질과 반복 처리량은 서로 다른 제품이며, 하나의 생성 레이어가 둘 모두에서 앞설 수는 없다.