← 블로그로
Ai약 12 분 읽기

9월 중국산 대형 모델, 잇달아 오픈소스 공개: 이번에 겨루는 것은 ‘쓸 수 있는 가격’

게시일 2026년 10월 2일
9월 중국산 대형 모델, 잇달아 오픈소스 공개: 이번에 겨루는 것은 ‘쓸 수 있는 가격’

9월이 절반밖에 지나지 않았는데, 평가를 하는 사람들은 이미 중국산 대형 모델의 업데이트 속도를 따라가기 벅차다. 즈푸(智谱), 메이투안, 몐비(面壁), 텐센트, 앤트几家의 새로운 결과물이 거의 같은 시간대에 쏟아졌고, 유형도 범용 대형 모델부터 온디바이스 소형 모델, 다시 이미지 생성과 임바디드 AI까지 넓게 펼쳐진다. 이런 활기 뒤에서 정말 곱씹어 볼 것은 이들이 저마다 같은 길을 택했다는 점이다. 파라미터를 무작정 키우는 대신 ‘어떻게 하면 사람들이 쓸 수 있고 배포할 수 있는가’에 힘을 쏟았다.

먼저 즈푸다. 9월 공개한 GLM-5.3-Flash는 총 파라미터가 3200억 개지만, 매번 실제로 연산에 참여하는 활성 파라미터는 180억 개에 불과하다. 희소 활성화 방식은 단순명료하다. 모델은 크게 만들되 단일 추론에서는 일부만 깨워 비용과 지연을 낮추는 것이다. MIT 라이선스로 오픈소스화했고 멀티모달을 네이티브 지원하며, 100만 출력 토큰당 약 0.25달러다. 발표문에서 더 무게 있는 문장은 이것이다. 추론 서비스 전 과정이 중국산 AI 칩에서 돌아가며, 엔드투엔드 성능이 최초 기준 대비 약 3배 향상됐고, 하루 100조 개 무료 토큰 규모까지 달성했다. 개발자에게 이 문장의 무게는 파라미터 표의 어떤 숫자보다 크다.

메이투안은 LongCat-2.0을 내놨다. 총 파라미터 1.6조 개, 100만 토큰 컨텍스트를 네이티브 지원한다. 이 모델의 관전 포인트는 크기가 아니라 학습의 토양이다. 공식 설명에 따르면 업계 최초로 만 카드급 중국산 컴퓨팅 클러스터에서 전 과정 학습과 추론을 완료한 조 단위 파라미터 오픈소스 대형 모델이다. 함께 공개된 AI 경영 워크벤치 CatPaw와 로컬 생활 에이전트 ‘샤오투안(小团)’도 있다. 후자는 누적 사용자 요청 응답이 7억 건을 넘었다. 로컬 생활 서비스로 시작한 회사가 조 단위 모델을 무대에 올렸다는 것은 이 분야의 비용 구조가 흔들리고 있음을 보여준다.

몐비의 MiniCPM5-2B는 반대 방향으로 간다. 파라미터를 20억 수준으로 낮추고 온디바이스로 향한다. MiniCPM 특유의 노선을 이어받아 파라미터는 작지만 실제 적용이 가능하고, 스마트폰이나 엣지 기기에 넣어도 작동한다. 거의 같은 시기, MiniMax는 Code CLI를 MIT 라이선스로 오픈소스화했고, 즈푸는 높은 처리량을 내세운 GLM-5.3-FlashX를 추가했다. 추론 속도는 초당 약 200 토큰이다. 온디바이스, 추론 가속, 코딩 도구까지 세 축이 함께 채워졌다. 이 조합은 단일 ‘플래그십’보다 생태계가 얼마나 성숙했는지를 더 잘 보여준다.

이것들을 한데 모아 보면 하나의 추세가 선명해진다. 오픈소스가 이제 낭만이 아니라 경쟁 수단이 되고 있다. MIT 라이선스, 오픈 웨이트, 무료 할당량, 이런 움직임의 방향은 매우 실용적이다. 누가 먼저 개발자와 중소기업을 자기 생태계로 끌어들이느냐가 다음 라운드의 호출량을 먼저 가져가는 문제다. 파라미터 우위는 발표회는 떠받칠 수 있어도 일상적인 프로덕션 환경은 떠받치지 못한다.

이미지 계열도 빠지지 않았다. 9월 4일, 앤트그룹 산하 바이링(百灵) 랩은 LLaDA-Image 시리즈를 발표하고 오픈소스화했다. Base 버전과 Turbo 버전을 포함하며 파라미터는 약 70억 개다. 단일 체크포인트가 텍스트-투-이미지, 참조 이미지 편집, 중·영문 텍스트 렌더링을 동시에 지원하며 별도의 편집 분기가 필요 없다. 하이라이트는 Turbo 버전으로, Twin-DMD 증류를 통해 샘플링 스텝을 2~4스텝으로 압축해 품질과 속도를 동시에 확보했고 추론에 고급 GPU가 필요 없다. Qwen-Image-Bench에서 영어 시나리오 53.53점, 중국어 시나리오 53.38점을 받았으며 공식 측은 모두 현재 최고 성능이라고 밝혔다. 스텝 수가 일반적인 50스텝에서 한 자릿수로 줄어든 것은 단순히 빠르다는 의미를 넘어, 소비자용 하드웨어에서 실시간 생성이 성립하게 한다는 뜻이다.

임바디드 AI 쪽에서는 즈둥타이추(紫东太初)가 9월 15일 ZDTaichu5.0-9B를 오픈소스화했다. 90억 파라미터 모델인 이 모델은 공간 이해와 임바디드 작업에서 동일 파라미터 그룹 기준 8개 부문 세계 1위를 차지했고, MindCube-tiny에서 78.27점으로 Qwen3.5-9B보다 20.67%포인트 높다. 이 모델이 메우는 것은 로봇이 ‘본 뒤에 어떻게 해야 하는가’ 하는 구간이다. 컵을 알아보는 것은 ‘무엇인가’에 답하는 것일 뿐이고, 컵 손잡이 방향과 옆에 물건을 놓을 수 있는지를 판단해야 ‘무엇을 할 수 있는가’에 가까워진다.

빼놓을 수 없는 텐센트도 있다. 9월 22일 훈위안(混元)은 이미지 3.5 프리뷰 버전을 발표했다. 텍스트 생성, 화면 레이아웃, 사실감, 연속 편집을 중점 개선했고 한 번에 최대 5장의 참조 이미지를 업로드할 수 있으며 최대 2K 출력을 지원한다. 가격은 2K 이미지 한 장당 0.15위안이고 최종 출력에만 과금한다. 발표 날짜도 절묘하게 잡았다. 바로 알리윈 치시(云栖) 콘퍼런스 개막 당일이다. 이런 ‘타이밍 저격 발표’는 중국에서 이미 새롭지 않지만, 이미지 모델에 적용되면 경쟁을 기술 차원에서 곧장 주목도와 생태계 진입점 차원으로 끌어올리는 셈이다.

이런 움직임을 엮어 보면 9월의 주된 흐름은 세 가지로 요약된다. 오픈소스 가속, 추론 가격 인하, 컴퓨팅 자립. 세 가지는 사실 서로 맞물려 있다. 오픈소스는 사용 문턱을 낮추고, 저가 추론은 그 문턱을 실제 호출량으로 전환하며, 중국산 컴퓨팅 대체는 이 저가가 지속 가능한지를 결정한다. GLM-5.3-Flash가 MIT 라이선스에 무료 할당량까지 내걸 수 있고, LongCat-2.0이 중국산 만 카드 클러스터에서 조 단위 파라미터를 돌릴 수 있는 배경에는 같은 판단이 있다. 비용이 통제돼야 모델을 내줄 수 있다.

일반 크리에이터와 중소기업 입장에서 이번 변화의 직접적인 영향은 이제 계산이 맞아떨어진다는 것이다. 예전에 최전선 모델을 쓰려면 적지 않은 API 청구서를 감당하거나 GPU를 직접 마련해야 했고, 이 두 문턱이 대부분을 걸러냈다. 지금은 2K 이미지 한 장 0.15위안, 2~4스텝 실시간 이미지 생성, 20억 파라미터만 채우면 돌아가는 온디바이스 모델이 이런 비용을 많은 사람이 실제로 시도해 볼 만한 구간까지 끌어내렸다. 도구가 싸지면 시행착오 횟수가 늘고, 작품 품질은 대개 그런 반복 속에서 다듬어진다.

An open vault door revealing server racks and a glowing microchip, representing open-source AI models on domestic silicon

냉정하게 볼 지점도 있다. 오픈소스 라이선스가 점점 느슨해진다고 해서 상용화에 대가가 없다는 뜻은 아니다. 비상업 조항, 데이터 컴플라이언스, 모델 행동의 통제 가능성은 모두 실제 비즈니스에서 하나씩 검증해야 한다. 중국산 칩에서 추론 성능이 3배 향상됐다는 것은 각자의 기준에 따른 비교이며, 제3자 재현은 아직 따라오지 못했다. 모델은 ‘오픈소스’지만 학습 코드는 공개되지 않은 경우도 여전히 존재해 재현과 2차 개발이 제한된다. 숫자가 좋은 것과 안정적으로 공급할 수 있는 것은 별개의 문제다.

9월의 이 폭발적인 업데이트에서 진짜 신호는 ‘중국산이 또 몇 개의 1위를 냈다’가 아니라, 공급 측 전체의 비용 논리가 재편되고 있다는 점이다. 모델 자체가 점점 인프라에 가까워질수록 겨루는 대상은 하류로 이동한다. 누구의 워크플로가 더 매끄러운지, 누가 장면을 더 정확히 포착하는지, 누가 값싼 컴퓨팅을 안정적인 결과물로 바꾸는지. 오픈소스는 출발 신호를 쏘았을 뿐이고, 앞으로 달릴 길은 길다.

관련 글