← 블로그로
News14 분

Qwen Image 2.1: 7B 오픈 가중치 모델이 Nano Banana 2.0을 위협하는 이유

게시일 2026년 9월 27일
Qwen Image 2.1: 7B 오픈 가중치 모델이 Nano Banana 2.0을 위협하는 이유

알리바바가 Qwen Image 2.1을 조용히 공개했을 때, 헤드라인 숫자는 별로 대단해 보이지 않았다. 70억 개의 파라미터. 오픈 가중치. 또 한 주, 또 하나의 모델. 그러던 중 벤치마크가 나왔고, Tom's Hardware의 보도는 이 작은 모델이 여러 이미지 벤치마크에서 구글의 Nano Banana 2.0을 앞서면서도 OpenAI와 Meta의 제품과 경쟁력 있는 성능을 유지했다고 주장했다. 공식 Qwen 블로그 게시물에 달린 Hacker News 스레드는 739점과 거의 200개의 댓글을 끌어모았는데, 이는 평범한 모델 출시가 얻는 종류의 트래픽이 아니다.

여기에는 뭔가 벌어지고 있고, 파헤쳐 볼 가치가 있다. 흥미로운 부분은 누가 리더보드 정상을 차지하느냐가 아니라 이미지 생성이 어디로 향하고 있느냐에 있기 때문이다.

작은 모델, 진지한 결과물

파라미터 수가 핵심이다. 대부분의 최전선 이미지 모델은 수백억 개 규모에 있다. 경쟁력 있는 벤치마크를 기록하는 7B 모델은 자체 하드웨어에서 추론을 돌리는 사람들의 계산법을 바꿔 놓는다. RTX 5090에서는 아무것도 양자화하지 않고 전체 BF16 디노이저를 실행할 수 있다. M1 Max와 32GB 메모리를 갖춘 MacBook Pro에서는 한 개발자가 텍스트-투-이미지와 이미지 편집을 Apple Silicon에서 네이티브로 실행해 512x512 출력에 약 24초가 걸렸고, 그 데모를 r/StableDiffusion에 올렸다. 그것은 노트북에서 나오는 데이터센터 성능이 아니다. 영상 편집용으로 산 기계에서, 최고의 폐쇄형 시스템과 견준다는 모델을 취미 삼아 돌리는 사람이 있다는 이야기다.

커뮤니티 포팅은 며칠 안에 뒤따랐다. 누군가는 GGUF 양자화와 LoRA 설정을 갖춘 Qwen-Image 2.1 지원을 TensorSharp에 추가했고, 생성 단계를 몇 단계로 줄여주는 더 빠른 드래프트 변형도 포함했다. 또 다른 개발자는 마스크, 주석, 아웃페인팅, OpenPose 레퍼런스, 스케치를 입력으로 받는 Fooocus 스타일의 Gradio 스튜디오를 그 위에 만들었다. 패턴은 반복된다. 가중치가 열려 있으면, 생태계가 공식 팀이 미처 손대지 못한 도구를 만들어낸다.

벤치마크 회의론은 건강한 현상이다

물론 벤더의 벤치마크는 의심받아 마땅하고, Hacker News 댓글러들도 기대를 저버리지 않았다. 늘 그렇듯 단서가 붙는다. 벤치마크 선택이 중요하고, 프롬프트 세트가 중요하며, “Nano Banana를 이긴다”는 것은 어떤 작업을 측정하느냐에 크게 좌우된다. Qwen Image 2.1과 Krea 2를 192장의 이미지로 나란히 비교한 자료가 카테고리별로 정렬되어 공개된 것은, 보도자료보다 이런 논쟁을 더 잘 정리해주는 군중 검증의 바로 그런 사례다. 이를 진행한 사람은 메모리 예산에 맞추기 위해 텍스트 인코더를 NF4로 양자화해야 했는데, 이는 벤치마크 조건과 실제 환경 사이의 간극을 말해준다.

텍스트 렌더링은 여전히 가장 주목받는 능력 중 하나이며, Qwen 모델이 역사적으로 영어뿐 아니라 CJK 문자에서도 강세를 보여온 지점이다. 편집은 또 다른 전선이다. Qwen의 편집 모드로 LoRA 없이 캐릭터 디자인 시트를 생성한 r/StableDiffusion 게시물 하나가 주목을 받았는데, 그 워크플로는 예전에는 여러 개의 파인튜닝과 주말 내내 이어지는 ComfyUI 배선 작업을 요구했기 때문이다.

이것이 한 모델을 넘어 중요한 이유

여기서 두 가지 더 큰 흐름이 보인다. 첫째는 오픈 가중치 커뮤니티에 새로운 기본값이 생겼다는 것이다. 한동안 로컬 생성이라 하면 Stable Diffusion 파생 모델과 Flux 변형들이었고, 가장 덜 나쁜 체크포인트를 찾는 싸움이 끊이지 않았다. Qwen Image 2.1은 현대적인 편집 능력을 내장한 채 그 생태계에 들어맞았고, 도구들은 거의 즉시 따라왔다. 둘째 흐름은 지리적이다. “중국 AI 모델, 글로벌 인기 급상승 — 그리고 워싱턴은 우려한다”라는 제목의 별도 r/singularity 스레드가 논의를 쌓은 것은, 바로 이런 모델들이 벤더가 의뢰한 테스트가 아니라 사용자가 직접 돌리는 선호도 테스트에서 계속 상위권에 오르기 때문이다.

지금 당장 일상적으로 쓸 모델을 고르는 사람에게 실용적인 결론은 명확하다. 호스팅 API에서 최고의 편집 품질을 원한다면, 폐쇄형 선두 주자들은 여전히 그 가격만 한 가치가 있다. 직접 실행하고, 파인튜닝하고, 양자화하고, 허락을 구하지 않고 자기 파이프라인에 연결하고 싶다면, 이 7B 도전자를 무시하기 어렵다. 그냥 궁금하다면, 가중치는 Hugging Face에 있다. 2년 된 노트북에서의 24초는 첫 실험을 시작하기에 낮은 문턱이다.

새로운 격전지로서의 편집

가장 중요한 기능은 텍스트-투-이미지가 전혀 아니다. 편집이다. 이전 이미지 모델들은 수정을 별개의 문제로 취급했다. 이 영역을 인페인팅하고, ControlNet을 연결하고, 이음새가 사라지기를 바라는 식이었다. Qwen Image 2.1은 편집을 네이티브 모드로 취급한다. 그리는 모델이 다시 그릴 수 있는 것이다. r/StableDiffusion에 돌던 한 데모는 캐릭터 디자인 시트, 즉 같은 캐릭터가 여러 포즈와 의상에 걸쳐 일관되게 등장하는 여러 뷰를 LoRA나 레퍼런스 장치 없이 만들어냈다. 1년 전에 그 워크플로를 시도해본 사람이라면 그 비용을 안다. 캐릭터마다 파인튜닝 하나, 몇 시간의 마스크 페인팅, 그리고 각도마다 달라지는 결과.

편집은 상업적 가치가 집중되는 곳이기도 하다. 마케팅 팀은 이미지를 원하지 않는다. 그들의 이미지가 조정되기를 원한다. 배경이 바뀐 제품 사진. 헤드라인이 다른 언어로 재생성된 포스터. 네이티브 편집은 그 파이프라인을 무너뜨리고, 그것이 이제 다운로드 가능한 모델에 존재한다는 사실은 API에 결코 돈을 내지 않을 사람들에게도 그 붕괴가 닿는다는 뜻이다.

같은 일러스트 캐릭터를 일관된 네 가지 시점으로 보여주는 AI 생성 캐릭터 디자인 시트

커뮤니티 도구도 이를 반영한다. TensorSharp 포팅은 편집 설정을 나중에 덧붙이는 것이 아니라 첫날부터 함께 제공한다. Fooocus 스타일 스튜디오는 마스크, 주석, 아웃페인팅, 포즈 레퍼런스를 일급 입력으로 노출한다. 포팅하는 사람들이 편집을 보너스가 아니라 핵심 기능으로 다룬다는 것은, 무엇이 중요한지에 대한 시장의 투표다.

커뮤니티는 실제로 주장을 어떻게 검증하는가

벤더의 벤치마크는 누군가 재현하기 전까지는 마케팅이다. 그래서 이번 달 더 흥미로운 산출물은 군중이 만든 것들이었다. 동일한 프롬프트로 생성해 카테고리별로 정리한 192장의 Qwen 대 Krea 2 비교는 논쟁을 실제로 정리하는 형식이다. 블라인드 시음 테스트와 같은 미덕을 지닌다. 어떤 순위도 그와 맞닥뜨린 뒤 그대로 남지 않는다. 한 모델이 압도하는 카테고리가 한눈에 보이고, 둘 다 실패하는 카테고리도 마찬가지다.

Hacker News는 헤드라인을 액면 그대로 받아들이기를 거부함으로써 자기 역할을 해냈다. 출시 스레드와 Tom's Hardware 제보의 댓글창은 늘 그렇듯 취약한 지점을 파고들었다. 어느 벤치마크 스위트인지, 누구의 프롬프트 세트인지, 테스트된 분포 밖에서는 어떻게 되는지. 그 회의주의는 오픈 가중치 커뮤니티의 면역 체계이며, 그래서 거기서 살아남은 주장은 무게를 지닌다. Qwen Image 2.1의 평판은 현재 알리바바의 숫자보다, 수백 명이 직접 돌려보고 대부분 굴욕적인 스레드를 올리지 않았다는 사실 위에 세워져 있다.

충분히 좋음과 오픈의 경제학

모델 품질을 넘어서는 비즈니스적 해석도 있다. 호스팅 이미지 생성은 최전선을 기준으로 가격이 매겨지고, 최전선은 운영 비용이 비싸다. 전력 비용만으로 최전선 품질의 대부분을 제공하는 7B 모델은 고객이 기꺼이 지불할 용인 수준을 바꾼다. 개발자가 무엇 위에 만들지를 바꾸기도 한다. 가중치가 안정적인 오픈 모델은 API 계약을 협상하거나 서비스 종료를 걱정하지 않고 고정하고, 파인튜닝하고, 제품 안에 출시할 수 있다.

마지막 지점은 강조할 가치가 있다. 업계가 방금 실물 교훈을 제공했기 때문이다. OpenAI는 8월 말에 독립형 DALL·E 제품을 종료하고 이미지 생성을 ChatGPT Images로 통합했다. 기술적으로 잃은 것은 없지만, 옛 인터페이스 위에 만들어진 모든 통합은 남의 일정에 맞춰 마이그레이션해야 했다. 오픈 가중치는 그런 이메일을 보내지 않는다.

이 중 어느 것도 Qwen Image 2.1을 세계 최고의 이미지 모델로 만들지는 않는다. 대신 아마 더 파괴적인 무엇을 만든다. 평범한 사람이 온전히 소유할 수 있는 최고의 이미지 모델. 리더보드 논쟁은 어차피 다음 릴리스, 그다음 릴리스에서 정리될 것이다. 오래 남는 것은 소유권의 변화다.

속도도 체화해야 할 부분이다. 최근 한 r/PromptEngineering 게시자가 세어본 대로 한 달에 20개가 넘는 이미지 모델이 릴리스된다는 것은, 어떤 “최고의 모델” 주장이든 수명이 몇 주에 불과하다는 뜻이다. Qwen Image 2.1은 작고 열린 것이 크고 닫힌 것을 당황하게 만들 수 있다는 현재의 증거다. 한 달만 지나면 흥미로운 질문은 무엇이 이것을 대체할지가 될 것이다.

관련 글