Qwen-Image 2.1 오픈소스 공개: 7B 파라미터로 구글과 OpenAI에 도전하는 이유

9월 20일, 알리바바 통이(Tongyi) 팀이 조용히 '작은 핵폭탄' 하나를 공개했다 — Qwen-Image 2.1. 고작 70억 파라미터의 텍스트-이미지 생성 모델이지만, 자체 평가에서 구글의 Nano Banana 2.0을 앞질렀고, OpenAI와 Meta의 클로즈드소스 모델들이 뒤를 돌아보게 만들었다. 소식이 전해지자 빌리빌리(B站), 즈후, 그리고 해외의 Hacker News와 Reddit이 모두 들끓었다.
왜 '작지만 강하다'고 하는가
이미지 생성 모델은 최근 몇 년간 점점 더 커져서, 클로즈드소스 모델은 수십~수백억 파라미터에 달해 돌리려면 전문 그래픽카드 한 장이 필요하다. Qwen-Image 2.1은 반대로 갔다. 생성 부분을 7B로 압축했는데도 자체 Qwen-Image-Bench 리더보드에서 60.28점을 받았다. 이 점수가 전체 리더보드에서 어느 정도 수준이냐면, 구글 Nano Banana 2.0은 59.82점으로 반 걸음 뒤처졌고, 오픈소스 진영 2위는 메이투안의 LongCat-Image(6B)로 54점대 초반에 그쳤다. 즉, 현재 가중치를 내려받을 수 있는 모델 중 가장 강력한 하나다.
독립 제3자 평가인 AI Arena의 결론은 좀 더 냉정하다. 그쪽에서는 Nano Banana 2.0이 1260점, Qwen-Image 2.1이 1228점, 클로즈드소스 GPT Image 2.5 Sunburst가 1423점으로 정상에 올랐다. 격차는 여전히 있지만, 이미 '발뒤꿈치를 물고 따라붙는' 수준까지 좁혀졌다. 오픈소스 모델로서 이 위치 자체가 승리다.
실제로 유용한 세 가지 능력
첫째는 네이티브 투명 배경이다. 예전에는 스티커, 인쇄 맞춤 제작, 디자인 시안을 만들 때 AI로 생성한 뒤 다시 누끼를 따야 했다. Qwen-Image 2.1은 알파 채널이 있는 RGBA 이미지를 곧바로 출력하고, 하나의 모델이 생성과 편집을 동시에 하며, 투명 레이어를 병합하지 않고 바로 편집할 수 있다. 문구·굿즈를 만드는 사람에게는 이 하나로 일이 훨씬 줄어든다.
둘째는 참조 이미지 10장을 동시에 편집하는 기능이다. 인물 사진 한 장을 넣고 옷 사진 몇 장을 더 넣으면 '이 사람이 이 옷들을 입은' 모습을 합성해 낸다. 여섯 장의 초상화를 한 장의 단체 사진으로 합치거나, 열 장의 가구 이미지를 같은 방 안에 배치할 수도 있다. 빌리빌리에는 이미 '인물 일관성 + 의상 교체'를 시연한 크리에이터가 있고, 댓글창은 '이건 너무 자연스러운데'로 가득했다.
셋째는 가정용 그래픽카드에서 돌아갈 만큼 가볍다는 점이다. RTX 4090에서 1메가픽셀 이미지는 약 5초, 50 시리즈 그래픽카드는 25초 정도이며, 심지어 RTX 3060에 64GB 램으로 2K 이미지를 50초에 한 장 뽑는 사람도 있다. 알리바바 공식 최소 사양은 VRAM 6GB를 요구하며, 빌리빌리에는 '원클릭 통합팩' 튜토리얼이 이미 줄을 서기 시작했다.

가장 눈에 띄는 건 성능이 아니라 라이선스
커뮤니티를 실제로 뜨겁게 만든 건 라이선스다. 이전 Qwen-Image 시리즈는 Apache 2.0이라 마음대로 상업적 이용이 가능했다. 이번에는 '연구 목적 한정'인 Qwen Research License로 바뀌어, 상업적 이용은 별도로 알리바바와 협의해야 한다. Reddit과 HN에서는 의견이 갈렸다. 누군가는 후진이라고 생각했고, 누군가는 '가중치는 내려주고 이미지는 마음대로 써도 된다'는 것만으로 충분하다고 봤다.
알리바바 측은 곧바로 한마디로 해명했다. 모델 가중치의 상업적 재배포는 안 되지만, 그것으로 생성한 이미지의 저작권은 사용자에게 있고 상업적 이용에 문제가 없다는 것이다. 이 구분점이 핵심이다 — 이미지만 만들고 싶은 대다수에게는 실질적 영향이 그리 크지 않다.
이 일이 지닌 더 큰 의미
Qwen-Image 2.1은 한 가지를 증명했다. 아키텍처 증류와 더 깨끗한 학습 데이터를 통해 소형 모델이 대형 모델의 이미지 생성 수준을 따라잡을 수 있다는 것이다. 빌리빌리 크리에이터 '爱分享的剑二十七'의 그 영상 제목은 아주 직설적이었다 — '알리바바가 오픈소스로 공개한 AI 그림 모델, 성능이 수많은 유료 도구를 압도한다'. 다소 과장이지만 방향은 틀리지 않았다.
이미지 한 장이 가정용 그래픽카드에서 몇 초 만에 나온다면, 매달 구독료를 낼지 말지는 모든 크리에이터가 다시 계산해야 할 문제가 된다. 클로즈드소스 업체들은 이제 속도, 워크플로 통합, 멀티모달 협업으로 돈값을 증명해야 하며, 더 이상 '내가 더 예쁘게 그린다'만으로는 안 된다.
일반 사용자에게 좋은 소식은 이것이다. 오픈소스 이미지 생성의 천장이 이번 달 또 한층 높아졌다.
관련 글
AI 이미지와 진짜 사진을 아직도 구별할 수 있을까? 솔직히 말하면, 아니다.
단서는 사라졌고 탐지기는 믿을 수 없다. AI 이미지를 찾아내는 것에 대한 솔직한 답은 ‘아니오’이며, 해법은 당신의 눈보다 상류에 있다.
오픈소스 AI 이미지를 바꿀 수 있는 조용한 라이선스 전환
오픈 가중치는 더 이상 1년 전과 같은 의미가 아닙니다. 모델이 더 좋아지는 바로 그 시점에 라이선스 세부 약관은 더 복잡해지고 있습니다.
로컬 모델의 압박: 크리에이터들이 제한 없는 이미지 모델을 계속 좇는 이유
매주 또 다른 크리에이터가 무제한 모델을 요청한다. 그 수요는 요청하는 사람들보다 클라우드 도구에 대해 더 많은 것을 말해준다.
오픈소스 AI 이미지 스택이 워크플로 하나씩 재구축되고 있다
Workflow1111은 73개 노드와 11개 파이프라인으로 AUTOMATIC1111을 재현한다. 커뮤니티 재구축이 로컬 이미지 생성에 의미하는 바.