알리바바, 30B 멀티모달 오픈소스 공개: 30억 활성 파라미터로 GPT-5-Mini에 정면 도전

10월 4일, 알리바바 클라우드 통이치엔원(Qwen) 팀은 Qwen3-VL-30B-A3B의 Instruct와 Thinking 두 버전을 한꺼번에 공개했으며, FP8 양자화 가중치도 함께 제공했다. 같은 자리에서 한 단계 더 큰 Qwen3-VL-235B-A22B의 FP8 버전도 선보였다. 공식 성적표는 매우 직관적이다: STEM 추론, 시각 질의응답, OCR 문자 인식, 영상 이해, Agent 작업이라는 다섯 방향에서 GPT-5-Mini와 Claude 4-Sonnet에 맞서며 일부 항목에서는 더 우수하다.
정말 눈여겨봐야 할 것은 이름에 들어 있는 A3B다.
30B의 껍데기, 3B의 식성
Qwen3-VL-30B-A3B의 전체 파라미터 수는 300억 개지만, 추론할 때마다 실제로 계산에 참여하는 것은 약 30억 개뿐이다. 이는 전형적인 전문가 혼합(MoE) 아키텍처다. 모델 내부에 수많은 전문가를 준비해 두고, 토큰 하나를 처리할 때마다 가장 적합한 소수만 골라 일을 시키며 나머지는 움직이지 않는다.

이를 한 회사로 생각하면 더 직관적이다. 회사 전체 직원은 3만 명이지만, 각각의 구체적인 프로젝트에는 그중 3천 명의 적합한 전문가만 차출하면 되고 나머지는 대기한다. 회사의 역량 저변은 3만 명 수준이지만, 특정 프로젝트의 인건비는 3천 명에 가깝다.
이 구조가 가져오는 이점은 매우 실질적이다. VRAM 점유와 추론 속도는 30B보다 훨씬 작은 dense 모델에 가깝고, 능력 상한은 여전히 30B급의 기반을 유지한다. 로컬이나 프라이빗 환경에서 멀티모달 능력을 돌려야 하는 팀에게 이는 지난 몇 년간 가장 갖추기 어려웠던 조합이다. 즉, 폐쇄형 플래그십에 맞설 만한 효과를 내면서도 VRAM을 가득 채운 카드 한 장을 요구하지 않는다.
성적표를 왜 이 다섯 방향으로 공개했을까
공식적으로 비교 대상으로 삼은 방향은 마침 멀티모달이 가장 활발하게 실제 적용되는 전장이다.
OCR은 문서 디지털화, 영수증·청구서 인식, 스크린샷 문자 추출 같은 필수 수요다. 영상 이해는 숏폼 시대의 콘텐츠 생산 관문으로, 누가 영상을 이해하느냐에 따라 영상을 검색하고 편집할 수 있는 소재로 바꿀 수 있다. Agent는 모델이 단지 이해하는 데 그치지 않고 직접 행동하게 하는 것으로, 올해 업계 거의 모든 이가 걸고 있는 메인 라인이다. STEM과 VQA는 교육, 연구, 산업 품질 검사 같은 고부가가치 시나리오의 입장권이다.
활성 파라미터가 30억 개에 불과한 모델이 이 몇 가지 라인에서 폐쇄형 플래그십과 힘겨루기를 할 수 있다는 사실 자체가 어떤 단일 점수보다 훨씬 큰 신호다. 이는 능력 밀도가 여전히 다시 압축되고 있음을 보여준다. 같은 효과를 내는 데 필요한 연산량은 줄고 있거나, 같은 연산량으로 얻을 수 있는 능력은 커지고 있다.
오픈소스라는 카드, 노리는 것은 배포 비용
통이치엔원(Qwen)은 이번에 한 버전만 내놓지 않았다. Instruct는 일반적인 지시 수행과 질의응답을 겨냥하고, Thinking은 먼저 생각한 뒤 답하는 추론 경로를 택했으며, FP8 가중치는 제한된 VRAM에 전체 모델을 밀어 넣고 싶은 사람을 위해 준비됐다.
세 버전을 함께 내놓은 것은 같은 목표를 향한다. 멀티모달을 ‘클라우드 API 호출’에서 ‘직접 배포 가능’으로 밀어내는 것이다. 일단 가중치를 다운로드하고 양자화해 프라이빗 서버에서 돌릴 수 있게 되면 구매 논리가 바뀐다. 과거 기업은 100만 토큰당 얼마인지를 계산했지만, 이제는 자체 GPU를 100만 토큰당 얼마로 환산하는 선택지가 하나 더 생겼다. 사용량이 많은 팀에는 후자의 계산이 더 유리한 경우가 많고, 데이터가 내부망을 벗어나지 않는다.
이 또한 중국산 오픈소스 모델이 지난 1년간 가장 꾸준히 밀어온 공격 방향이다. 더 이상 누구의 파라미터가 더 큰지, 벤치마크 순위가 더 높은지만 겨루지 않고, 누가 더 많은 사람이 더 낮은 장벽으로 모델을 사용하게 할 수 있는지를 겨룬다. 능력 격차가 용인 가능한 범위로 좁혀지면 가격과 접근성이 진짜 승부처가 된다.
오픈소스의 이면
가중치가 공개된다는 것은 누구나 다운로드하고 미세조정하고 재배포할 수 있다는 뜻이다. 장점은 생태계가 매우 빠르게 확장된다는 점으로, 양자화 버전, 산업별 미세조정 버전, 엣지 디바이스 적응 버전이 곧 커뮤니티에서 자라날 것이다. 위험도 똑같이 명확하다. 모델이 배포자의 손을 떠나면, 어디에 어떻게 쓰이는지 배포자가 거의 제약할 수 없다.
개발자 입장에서는 오히려 선택권이 자신에게로 넘어온다. 자신의 규제 경계를 명확히 알아야 하고, 데이터가 국외로 나갈 수 있는지, 재배포 라이선스 조항이 무엇인지 분명히 해야 한다. 오픈소스는 도구를 건네주는 동시에 책임도 건네준다.
다음으로 지켜볼 것
이 다섯 방향에서의 비교는 시작일 뿐이다. 멀티모달 모델이 실제 프로덕션에서 자리 잡을 수 있는지를 진짜로 좌우하는 것은 특정 벤치마크 점수 하나가 아니라, 수십 라운드의 연속 작업에서 갑자기 문제를 일으키지 않는지, 실제 문서와 실제 영상, 실제로 혼란스러운 입력 아래에서의 안정성이다.
30억 활성 파라미터라는 이 경로가 계속 위로 나아갈 수 있을지는 차세대 전문가 라우팅 효율, 훈련 데이터 품질, 후속 훈련 전략에 달려 있다. 이 길이 통한다면 다시 쓰이는 것은 특정 리더보드뿐만 아니라 ‘얼마나 큰 모델이 있어야 충분한가’에 대한 업계 전체의 기본 가정일 것이다.
능력이 플래그십에 근접한 모델의 운영 비용이 플래그십의 얼마 안 되는 수준이라면, 진짜 희소한 것은 더 이상 연산력이 아니라 그것으로 무엇을 할지 명확히 생각해내는 사람이다.
관련 글
언어와 비전을 위한 단일 프레임워크: Horizon의 16억 파라미터 오픈 모델
언어와 비전 사이의 다리는 애초에 필요하지 않았다는 내기.
포토닉 메모리 벽: 볼란티스가 방금 건 8,800만 달러의 승부수
모두가 당연하게 여기며 살아온 트레이드오프, 볼란티스가 없애려는 바로 그것이다.
AI 제품 이미지, 아무도 비용으로 계산하지 않은 컴플라이언스 장벽에 부딪히다
비용은 항상 생성당으로 견적되었습니다. 실제 비용은 검토를 통과한 자산당으로 책정됩니다.
로봇은 육체 노동의 74퍼센트를 할 수 있지만, 그중 수익성이 있는 일은 거의 없다
역량은 대체로 갖춰져 있다. 경제성은 그렇지 않다. 10퍼센트까지 40년은 공포를 정당화하는 예측이 아니다.