통이완샹 Qwen-Image 2.1 오픈소스: 7B 소형 모델이 투명 이미지와 10개 이미지 편집을 어떻게 소비자용 그래픽카드 한 장에 담았나

9월 20일, 알리바바 치엔원(Qwen) 팀이 Qwen-Image 2.1을 오픈소스 플랫폼에 공개했다. 소식이 전해지자 빌리빌리(B站)에는 통합 패키지 영상이 그날 바로 늘어났고, 제목에는 대부분 같은 문구가 붙었다: 최저 6GB VRAM으로 실행 가능. 과거 '그래픽카드를 먹는' 분야로 자주 낙인찍혔던 텍스트-투-이미지(text-to-image) 시장에서 이 숫자 자체가 뉴스다.
많은 사람이 첫눈에 이것을 Qwen-Image 3.0 이후의 차세대 모델로 생각할 것이다. 사실 아니다. 치엔원은 올해 7월 Qwen-Image 3.0을 예고하며 4,500 토큰의 초장문 프롬프트를 지원한다고 밝혔지만, 그건 프리뷰였을 뿐 가중치도, 벤치마크 점수도 공개되지 않았다. 2.1은 2.0 오픈소스 라인의 정식 후속 버전으로, 시각 생성 부분은 여전히 32층 Single-Stream DiT이고 파라미터는 7B이며, 2월에 공개된 2.0과 동일한 경량 아키텍처를 유지한다.
정말 의외인 것은 파라미터가 아니라 기능이다. 이번 세 가지 업그레이드를 함께 놓고 보면 같은 방향을 가리킨다: 이미지 생성 도구가 '인상적인 데모' 단계에 머무르지 않고 실제 프로덕션 워크플로에 진입하게 하는 것이다.
첫째는 네이티브 투명 이미지다. 예전에 투명 채널이 있는 PNG를 생성하려면 별도 모델에 의존해야 했다. 치엔원은 작년 12월 전용 Qwen-Image-Layered를 내놓은 바 있다. 2.1은 투명 이미지 기능을 통합 모델에 병합해, 한 줄의 프롬프트로 일반 이미지와 RGBA 사이를 전환하고 투명 레이어를 직접 편집할 수 있다. 표정을 바꿔도 배경은 투명하게 유지되며, 사진 속 피사체를 오려내 소재로 활용할 수 있다. 이커머스 이미지나 UI 소재를 만드는 사람에게 이 단계는 여러 도구를 오가는 번거로움을 꽤 줄여준다.
둘째는 참조 이미지가 몇 장에서 10장으로 늘어난 것이다. 2.0에서는 다중 이미지 편집이 여전히 소량 입력에 국한됐지만, 2.1은 서로 다른 인물 사진 여섯 장을 한 장의 단체 사진으로 합성하거나, 모델·옷·신발·가방·모자 이미지를 각각 한 장씩 넣어 한 벌의 코디를 만들어낼 수 있다. 구현에는 혼합 입자(그래뉼래리티) 어텐션 메커니즘을 사용한다. 텍스트는 토큰 수준의 인과 마스크를, 이미지 생성은 청크 수준의 마스크를 적용하고, 여기에 KV 캐시 재사용을 더해 참조 이미지와 지시를 한 번만 계산하고 반복 재사용한다. 쉽게 말해 '이미지가 많아지면 느려진다'는 문제를 엔지니어링으로 눌러낸 것이다.
셋째는 국소 편집의 정교화다. 이제 원을 그리거나, 주석을 칠하거나, 별도로 마스크 이미지를 하나 전달해 수정 지시를 특정 작은 영역에 국한하고 화면의 다른 부분은 건드리지 않을 수 있다. 작업 범위도 파노라마, 인포그래픽, 스토리보드 초안까지 확장됐다.

하지만 이번 오픈소스에는 과거에는 드물었던 조건이 붙었다. Qwen-Image 2.1은 Qwen Research License를 사용하며, 연구와 평가만 허용하고 상용화하려면 별도로 유료 라이선스를 협의해야 한다. 이는 알리바바의 최근 대다수 오픈소스 프로젝트가 걸어온 Apache 2.0 노선과 다르고, Z-Image, Ideogram 4.0처럼 완전히 관대한 오픈 웨이트 모델과도 거리를 둔다. 상용 프로젝트를 수주하거나 제품을 만들려는 팀에게 라이선스는 그래픽카드 장벽보다 먼저 명확히 확인해야 할 사항이다.
중국어 커뮤니티의 반응은 '돌아간다'는 점에 집중됐다. 빌리빌리의 일부 UP主(크리에이터)들은 원클릭 통합 패키지를 만들고 있으며, 압축 해제 후 바로 사용, 최소 6GB VRAM, 배치 이미지 생성과 이미지 편집 지원을 내세운다. 댓글창에서는 흔히 이것을 유료 도구와 비교한다. 이런 분위기에는 배경이 있다. 지난 2년간 가장 성능 좋은 이미지 생성 모델은 대부분 API와 구독 장벽 뒤에 갇혀 있었고, 로컬에서 돌아가는 모델은 대개 한 단계씩 뒤처졌다. Qwen-Image 2.1은 바로 그 교차점을 짚었다. 작은 크기, 오픈소스, 그리고 성능이 클로즈드소스 경쟁자와 비교 대상이 되면서 '유료 도구를 압도한다'는 말이 퍼질 토양이 생겼다. 그 말 자체에는 물음표를 붙여야 하지만 말이다.
객관적으로 보면 Qwen-Image 2.1의 가치는 누군가를 '압도'하는 데 있지 않다. 디자이너가 매일 하는 투명 이미지 작업, 다중 이미지 편집, 국소 제어를 소비자용 그래픽카드로 돌릴 수 있는 소형 모델에 밀어 넣었다는 데 있다. 실제 납품 단계에 이르면 AI가 생성한 이미지는 사용 가능해지기까지 무엇이 부족할까? 인물은 누끼를 따야 하고, 소재의 글자는 바꿔야 하고, 상품 배치는 조정해야 하며, 포장의 글자와 병 모양은 따라 변하면 안 된다. 2.1은 바로 이런 '마지막 1마일'을 겨냥한다. 정말로 유료 도구 일부를 대체할 수 있는지는 제목에 무엇이 쓰였는지가 아니라 사용자가 그것으로 무엇을 했는지에 달려 있다.
적어도 오픈소스 커뮤니티의 열기로 보면 답은 낙관 쪽에 가깝다. 7B 소형 모델과 6GB 그래픽카드 한 장이 '쓸 만한 이미지 생성 모델을 로컬에서 돌린다'는 일을 씨름에서 압축 해제 후 더블클릭으로 바꿔놓았다. 이것이 전체 시장에 미치는 영향은 어느 한 번의 벤치마크 점수보다 더 오래갈 수 있다.
관련 글
한 번에 참조 이미지 10장: AI 이미지 편집이 단일 이미지에서 합성으로 이동하다
단일 이미지 편집은 변형을 만든다. 다중 이미지 편집은 조합을 만든다. 한 번에 10장의 참조 이미지를 사용하는 것이 우리가 프롬프트를 쓰고 구성을 만드는 방식을 어떻게 바꾸는가.
네이티브 투명도는 AI 이미지에서 조용히 가장 유용한 새 기능이다
모두가 사실감을 원한다. 디자이너는 투명 배경을 원한다. 네이티브 알파 채널 생성이 실제 워크플로를 바꾸는 조용한 기능인 이유.
알리바바의 Qwen-Image 2.1이 오픈 모델 라이선스 논의를 바꿔 놓았다
기술 사양은 인상적이지만, 진짜 이야기는 라이선스입니다. Qwen-Image 2.1은 Apache 2.0을 버리고 연구 라이선스를 택했으며, 이제 세부 조항이 그 어느 때보다 중요해졌습니다.
AI 이미지와 진짜 사진을 아직도 구별할 수 있을까? 솔직히 말하면, 아니다.
단서는 사라졌고 탐지기는 믿을 수 없다. AI 이미지를 찾아내는 것에 대한 솔직한 답은 ‘아니오’이며, 해법은 당신의 눈보다 상류에 있다.