← 블로그로
News12 분

Qwen-Image 2.1 vs Nano Banana 2.0: 7B 오픈 모델, 구글의 코앞까지 따라붙다

게시일 2026년 9월 27일
Qwen-Image 2.1 vs Nano Banana 2.0: 7B 오픈 모델, 구글의 코앞까지 따라붙다

알리바바가 9월 20일 Qwen-Image 2.1을 공개한 이후, 벤치마크를 둘러싼 논쟁의 양상은 완전히 달라졌다. 가중치를 직접 내려받을 수 있는 70억 파라미터 이미지 생성기가 알리바바 자체 순위에서 구글의 Nano Banana 2.0을 앞질렀고, 독립 리더보드에서도 충분히 근접해 사람들이 두 번씩 다시 확인하고 있다. 이번 발표를 다룬 Hacker News 스레드는 하루 만에 700점이 넘는 추천과 약 200개의 댓글을 끌어모았는데, 이 카테고리에 쌓여 있던 관심이 얼마나 컸는지를 보여준다.

숫자, 그리고 그것이 중요한 이유

알리바바의 Qwen-Image-Bench에서 새 모델은 60.28점을 기록해 Nano Banana 2.0의 59.82점을 앞섰다. 0.5점 차이는 기술적 주장이라기보다 신호에 가깝다. 알리바바가 이제 구글을 넘어서야 할 기준으로 지목하고 있다는 뜻이기 때문이다. 파라미터 수가 더 적은 유일한 오픈 웨이트 모델인 메이투안의 6B LongCat-Image는 약 54점으로 뒤처진다. 비교하자면 오픈AI의 GPT Image 2.5 Sunburst가 67점으로 알리바바 차트 1위이고, Muse Image는 62.34점이며, 둘 다 클로즈드 모델이다.

사람 대 사람 블라인드 투표를 진행하는 AI Arena는 좀 더 겸손한 이야기를 들려준다. Nano Banana 2.0이 1260 Elo로 Qwen-Image 2.1의 1228을 앞서고, GPT Image Sunburst가 1423으로 1위, Muse가 1276이다. 아직 오픈 모델이 그 싸움에서 이기고 있는 것은 아니다. 하지만 이미지 편집 아레나와 텍스트→이미지 아레나 두 곳 모두에서 전체 오픈 웨이트 모델 중 1위이며, 이는 많은 사람들이 실제로 신경 쓰는 부문이다. Qwen 측 계정은 이를 "the number one open source model"이라고 표현했는데, 그 좁은 범위의 주장만 놓고 보면 독립 데이터가 그들을 뒷받침한다.

진짜로 빛나는 지점

가장 많이 언급되는 기능은 투명도다. Qwen-Image 2.1은 RGBA 이미지를 네이티브로 출력하기 때문에, 투명 배경을 프롬프트로 요청하면 배경 제거 도구를 한 번 더 거치지 않고도 깔끔한 컷아웃을 얻을 수 있다. 스티커 판매자, 주문형 인쇄(POD) 상점, 그리고 에셋을 더 큰 디자인에 합성하는 모든 사람에게 이는 실제로 줄어드는 단계 하나다. 이 모델은 투명 레이어를 평탄화하지 않고 편집할 수도 있는데, 예전에는 이를 위해 별도의 레이어 지원 모델이 필요했다.

최대 10장의 참조 이미지로 편집할 수 있다는 점도 또 하나의 헤드라인이다. 인물 사진 한 장과 옷 사진 몇 장을 넣으면 그 사람이 그 옷을 입은 모습으로 합성해 준다. 인물 사진 여섯 장을 하나의 단체 사진으로 합칠 수도 있다. 가구 이미지 열 장을 하나의 방으로 조립할 수도 있다. 편집할 영역을 지정하는 방법은 세 가지다. 색이 있는 원을 그리거나, 해당 영역 위에 칠하거나, 원본과 별도의 마스크를 함께 넘기는 방식이다. 원본 픽셀을 덮어쓰면 안 되는 경우에는 마스크 방식이 정답이다.

그리고 적당한 하드웨어에서의 속도도 있다. 얼리 어답터들에 따르면 RTX 4090에서 100만 화소(1MP) 이미지가 약 5초, 50 시리즈 카드에서는 약 25초, RTX 3060과 시스템 RAM 64GB 환경에서는 2K 이미지가 대략 50초 걸린다. Hacker News의 한 댓글 작성자는 4090에서 1MP 이미지를 약 5초에 변환했다고 밝혔다. r/StableDiffusion의 한 사용자는 5070 또는 5080에서 1MP 이미지가 약 25초 걸린다고 보고하면서, 편집이 가장 느린 작업이며 참조 이미지를 많이 넣을수록 지연이 눈에 띄게 늘어난다고 덧붙였다. 클라우드처럼 빠르지는 않지만, 변명거리가 되지 않을 만큼은 빠르다.

렌더링 중인 이미지 썸네일 옆에 놓인 스톱워치, 로컬 생성 속도를 상징

라이선스라는 함정

커뮤니티를 갈라놓은 부분이 여기다. 이전 Qwen 이미지 모델들은 Apache 2.0으로 배포되어, 무엇을 만들든 파인튜닝하고 판매할 수 있었다. Qwen-Image 2.1은 연구 전용 라이선스로 배포되며, 알리바바와 별도 계약 없이는 가중치의 상업적 사용을 금지한다. HN 스레드는 이 모호함 때문에 뜨거워졌고, 알리바바 계정이 직접 나서서 해명했다. 가중치는 제한되지만, 이를 통해 생성한 이미지는 상업적 용도를 포함해 사용자 소유라는 것이다.

이 구분은 사소해 보이지만 중요하다. 고객용, 제품용, 혹은 자기 프로젝트용 이미지를 만들고 싶은 사람이라면 문제가 없으며, 알리바바도 출력물에는 라이선스 의무가 없다고 확인했다. 모델을 파인튜닝해 재배포하려는 사람이라면 협상을 해야 하는 쪽이다. 대부분은 전자에 해당하기 때문에, 반발은 컸지만 결국 수위가 정리됐다.

더 넓은 효율성 논쟁

여기서 흥미로운 지점은 원점수가 아니라 효율성이다. Qwen-Image 2.1은 자기보다 몇 배나 크고 완전히 클로즈드인 모델들과 불과 몇 Elo 차이 안쪽까지 따라붙는다. 이 생성기는 32개의 Single-Stream DiT 레이어를 갖추고, Qwen3-VL 8B 텍스트 인코더로 프롬프트를 읽으며, 최대 2752 x 2752 픽셀의 2K 해상도로 네이티브 렌더링한다. 효율성 측면에서 이 모델은 아키텍처 증류와 더 깔끔한 학습 데이터만으로도, 그동안 규모가 있어야만 가능하다고 여겨졌던 격차의 대부분을 좁힐 수 있음을 증명한다.

이는 어떤 마케팅 슬라이드도 하지 못한 방식으로 구독 모델에 압박을 가한다. 소비자용 GPU가 몇 초 만에 스튜디오급 결과물을 렌더링할 수 있다면, "우리가 가장 좋은 이미지를 생성합니다"는 더 이상 월 구독료를 낼 충분한 이유가 되지 못한다. 구글과 오픈AI는 가장 어려운 의미·공간 추론 작업에서는 여전히 앞서고, 블라인드 평가도 계속 그쪽에 우위를 준다. Qwen-Image 2.1이 그 격차를 좁힌 것은 아니다. 다만 일상적인 작업의 상당 부분에서 그 격차가 선택 사항처럼 느껴지게 만들었을 뿐이고, 그것이 어떤 단일 벤치마크 점수보다 더 큰 파괴력이다.

커뮤니티의 실사용 평가

벤치마크 논쟁만으로는 한계가 있다. 더 근거 있는 신호는 사람들이 직접 돌려본 뒤 보고하는 내용이고, 이번 주 보고들은 이례적으로 일관된다. r/StableDiffusion에서 한 사용자는 Qwen-Image 2.1과 Krea 2를 비교한 192장의 생성 이미지를 나란히 올리며, 텍스트 생성과 인체 구조 같은 카테고리별로 정리했다. 결론은 오픈 모델이 구조 면에서는 잘 버텼지만, 5090에서 디노이저를 올리기 위해 양자화된 텍스트 인코더를 우회해야 했다는 것이었다.

또 다른 사용자는 메모리 32GB의 M1 Max 맥북 프로에서 모델을 구동해, 네이티브 애플 실리콘 런타임으로 512 x 512 이미지를 약 24초에 생성했다. 데스크톱 기준으로는 느리지만, 이 모델이 엔비디아 하드웨어에 묶여 있지 않다는 것을 증명하며, 이는 상당수 캐주얼 사용자에게 중요하다. 세 번째 사용자는 여기에 마스크, 주석, 아웃페인팅, OpenPose 포즈 참조를 더한 Fooocus 스타일의 로컬 스튜디오를 만들고, 칭찬이 아닌 솔직한 비판을 요청했다.

가장 큰 호응을 얻은 것은 편집 기능이었다. 한 게시물은 LoRA 없이 캐릭터 디자인 시트를 생성한 사례를 설명하며, 모델의 참조 이미지 편집으로 포즈와 의상이 달라져도 캐릭터 일관성을 유지했다고 밝혔다. 예전이라면 파인튜닝된 모델을 여러 개 쌓아 올리고 수작업 정리를 많이 해야 했던 일이다. 7B 모델 하나가 이를 별도 설정 없이 해낸다는 사실이, 대부분의 벤치마크 차트가 담지 못하는 조용한 헤드라인이다.

다음에 지켜볼 것

초기 결과는 아직 정리되는 중이다. Qwen은 자체 벤치마크를 만들었지만 프롬프트나 카테고리별 점수는 공개하지 않았기 때문에, 내부 수치는 측정이라기보다 주장에 가깝다. 독립적인 AI Arena 수치는 더 신뢰할 만하고, 조금 덜 후하다. 지금 시점의 정직한 해석은 이렇다. Qwen-Image 2.1은 현존하는 최고의 오픈 웨이트 이미지 모델이고, 클로즈드 선두주자들과는 실제로 한 단계 차이가 있으며, 작고 개방적인 모델도 경쟁력이 있다는 진짜 증거라는 것이다. Nano Banana 2.0에 대한 그 0.5점 우위가 지속될지, 아니면 벤치마크에서 유리하게 잘려나온 한 조각이었는지는 앞으로 몇 주간의 독립 테스트가 판가름할 것이다.

관련 글