한 번에 참조 이미지 10장: AI 이미지 편집이 단일 이미지에서 합성으로 이동하다

오랫동안 AI 이미지 편집은 참조 이미지 한 장과 지시 한 줄을 의미했다. 모델에 사진을 보여주고 무엇을 바꿀지 말하면 결과가 나왔다. 이 방식으로 많은 것을 해결할 수 있었지만, 사람들이 실제로 이미지를 떠올리는 방식, 즉 여러 소스를 하나로 결합하는 사고방식은 담아내지 못했다.
Qwen-Image 2.1은 참조 이미지 수를 최대 10장까지 끌어올린다. 이 모델은 6장의 개별 인물 사진을 하나의 단체 사진으로 합치거나, 모델, 셔츠, 신발, 가방, 모자에서 각각 한 장씩 참조 이미지를 받아 완전한 의상 착장을 구성할 수 있다. 이는 단일 이미지 편집과는 다른 종류의 작업이며, 실제 업무에서 끊임없이 등장하는 유형의 작업이다.
실용적인 사례를 생각해 보자. 한 브랜드가 자사 제품 세 개를 한 장면에 배치한 캠페인 이미지를 원한다고 하자. 각 제품은 별도의 사진으로 제공된다. 결혼식 사진작가는 여러 장의 사진을 하나로 합치고 싶어 한다. 패션 판매자는 카탈로그 조각들로 구성된 완전한 스타일링을 보여주고 싶어 한다. 캐릭터 디자이너는 십여 가지 변형에서도 얼굴을 일관되게 유지하고 싶어 한다. 단일 참조 편집은 한 번에 한 장씩 넣고 모델이 나머지 모든 것을 일관되게 유지해주기를 바라면서 재생성하고 패치해야 한다. 다중 참조 편집은 모델에 구성 요소들을 넣고 모델이 합성하게 한다.
어려운 부분은 항상 계산량이었다. 참조 이미지가 많아질수록 토큰이 늘어나고, 토큰이 늘어나면 일반적으로 생성 속도가 느려지고 메모리 사용량이 커진다. 순진하게 10장의 참조 이미지를 모델에 넣고 확산 과정의 매 단계마다 다시 인코딩하면 비용이 폭발하고, 데이터센터 GPU가 아닌 이상 이 기능은 사용할 수 없게 된다. Qwen의 접근 방식은 혼합 세분성 어텐션(mixed-granularity attention) 기법이다. 텍스트 지시에는 토큰 수준의 인과 마스크가 적용되고, 이미지 생성에는 청크 수준의 마스크가 적용된다. KV 캐시 재사용 기법을 통해 참조 이미지와 지시를 한 번만 계산하고 매 단계마다 다시 계산하는 대신 정적 컨텍스트로 재사용할 수 있다.

아이디어는 아주 단순하다. 생성 중에 참조 이미지가 변하지 않는다면 매 단계마다 다시 인코딩할 이유가 없다. 한 번 계산해 캐시하고, 실제로 변하는 부분에 계산 자원을 쓰면 된다. 이런 종류의 엔지니어링은 헤드라인을 장식하지 않지만, 소비자용 하드웨어에서 기능이 실제로 사용 가능한지를 결정한다. 스펙 시트의 “참조 이미지 10장 지원”과 실제 환경의 “타임아웃 없이 참조 이미지 10장 지원”의 차이는 바로 이런 종류의 캐싱에 달려 있다.
참조 이미지가 2장에서 10장으로 늘어나는 것은 단순히 더 큰 숫자가 아니다. 그것은 당신이 설명할 수 있는 것 자체를 바꾼다. 단일 이미지 편집은 변형을 만들어낸다. 같은 그림이 바뀌는 것이다. 다중 이미지 편집은 조합을 만들어낸다. 여러 부분에서 새 그림을 조립하는 것이며, 조합에는 많은 상업적 가치가 깃들어 있다. 제품 사진, 단체 인물 사진, 룩북, 장면 구성, 에셋 세트로부터의 스토리보드 제작 등 모델이 여러 입력을 동시에 붙들고 그것들이 어떻게 어울리는지 추론할 수 있을 때 모두 가능해진다.
이것은 또한 이미지 모델의 더 넓은 방향을 보여준다. 초기 모델은 텍스트-투-이미지였다. 장면을 설명하면 그림을 얻었다. 그다음에는 이미지-투-이미지 편집이 등장했다. 그림을 주고 변경 사항을 설명하는 방식이다. 이제 최전선은 합성이다. 모델에 많은 입력을 제공하고 그것들이 어떻게 결합되는지 추론하게 하는 것이다. 이는 인간 디자이너가 작업하는 방식, 즉 처음부터 설명하기보다 조각을 조립하는 방식에 더 가깝다. 그리고 이는 생성기보다 협업자처럼 행동하는 모델을 향한다.
주목할 만한 프라이버시와 제어 관점도 있다. 모델이 10장의 참조 이미지로 합성할 수 있을 때 사용자는 입력에 대한 통제권을 유지한다. 제품을 설명하고 모델이 정확히 렌더링해주기를 바라는 대신 실제 제품 사진을 넣는다. 사람을 설명하는 대신 적용되는 동의 범위 안에서 그 사람의 실제 이미지를 넣는다. 다중 참조 편집은 어떤 의미에서 텍스트 설명으로부터 환각을 일으키기보다 실제 자산에 모델을 고정하는, 근거 기반 생성(grounded generation)을 향한 한 걸음이다.
여전히 실제 한계가 있다. 한 이미지 안에서 여러 사람의 정체성을 유지하는 것은 여전히 까다롭고, 참조 이미지를 많이 넣을수록 모델이 서로의 속성을 혼동할 가능성이 커진다. 엉뚱한 얼굴이 엉뚱한 몸에 붙거나, 엉뚱한 색이 엉뚱한 객체에 적용되는 식이다. 10장이라는 상한은 한 단계일 뿐 해결된 문제가 아니며, 입력 수가 늘어날수록 실패 양상은 더 이상해진다. 팀은 분명히 속도를 높이기 위한 엔지니어링 작업을 해냈지만, 품질 작업은 계속 진행 중이다.
로컬 편집 컨트롤도 같은 패키지의 일부다. 원을 그리거나, 주석을 칠하거나, 별도의 마스크 이미지를 전달해 나머지는 건드리지 않고 한 영역에만 편집을 적용할 수 있다. 다중 참조 입력과 결합하면 이것은 실제 합성 도구처럼 보이기 시작한다. 예전에는 그래픽 편집기에서 레이어가 필요했던 작업을 이제는 하나의 모델에 대한 참조 이미지와 지시 세트로 표현할 수 있다.
크리에이티브 도구를 만드는 사람이라면 교훈은 명확하다. 다음 차별화의 물결은 “더 나은 단일 이미지”가 아니다. “모델이 한 번에 얼마나 많은 것을 붙들고 결합할 수 있으며, 무엇을 바꿀지 얼마나 정밀하게 지시할 수 있는가”다. 10장의 참조 이미지가 현재의 답이다. 오래 10장에 머물지는 않을 것이다.
이를 둘러싼 더 넓은 프레임이 있다. 수년간 AI 이미지 생성의 약속은 “설명하면 얻는다”였다. 그 약속은 캐주얼한 사용에는 통했지만 전문가에게는 좀처럼 통하지 않았다. 전문가들은 빈 설명에서 출발하는 경우가 거의 없기 때문이다. 그들은 에셋, 제품 사진, 참조 이미지, 브랜드 가이드라인, 일관성을 유지해야 하는 얼굴에서 출발한다. 다중 참조 편집으로의 전환은 핵심적으로 그 현실에 대한 양보다. 모델은 사용자가 설명할 수 있는 것보다 이미 가지고 있는 것에서 출발하도록 가르침을 받고 있다.
그래서 엔지니어링이 중요하다. 10장의 참조 이미지를 컨텍스트에 유지하고 서로 구별되게 하는 것은 한 장을 유지하는 것의 더 큰 버전이 아니다. 그것은 다른 문제다. 한 사람의 얼굴을 기억하는 것과 단체 사진에서 구별할 수 있을 만큼 10명을 기억하는 것의 차이다. Qwen이 설명하는 청크 수준 마스킹과 KV 캐시 재사용은 그 문제를 해결하기 위한 구체적인 기법이며, 기능이 실제로 작동하는지 아니면 데모에서만 작동하는지를 결정하는 종류의 세부 사항이다.
상업적 함의는 직접적이다. 다중 참조 편집이 열어주는 워크플로, 즉 제품 합성, 단체 인물 사진, 룩북, 브랜드 에셋 생성은 모두 사람들이 현재 도구나 인건비로 비용을 지불하는 일들이다. 모델이 이를 충분히 잘할 수 있다면 가치는 합성의 인간 노동에서 모델이 붙들고 결합하는 능력으로 이동한다. 이는 실제 경제적 변화이며, 벤치마크에 친화적인 기능보다 이 기능이 업계가 실제로 향하는 방향을 보여주는 지표인 이유다.
놓치기 쉬운 창의적 관점도 있다. 다중 참조 편집은 “프롬프팅”의 정의를 바꾼다. 10장의 참조 이미지를 넣는 사용자는 설명문을 쓰는 것이 아니라 세트를 큐레이션하고, 무엇을 포함하고 무엇을 뺄지 선택한다. 이는 프롬프트 엔지니어링보다 아트 디렉션에 가깝고, AI 이미지 작업에서 창의적 행위가 언어만큼이나 선택과 결합에 관한 것이 되는 미래를 가리킨다. 그런 의미에서 10장 참조 이미지 상한은 사용자를 요청자가 아니라 감독으로 대우하는 이미지 모델을 향한 첫 번째 진정한 걸음이다.
관련 글
네이티브 투명도는 AI 이미지에서 조용히 가장 유용한 새 기능이다
모두가 사실감을 원한다. 디자이너는 투명 배경을 원한다. 네이티브 알파 채널 생성이 실제 워크플로를 바꾸는 조용한 기능인 이유.
알리바바의 Qwen-Image 2.1이 오픈 모델 라이선스 논의를 바꿔 놓았다
기술 사양은 인상적이지만, 진짜 이야기는 라이선스입니다. Qwen-Image 2.1은 Apache 2.0을 버리고 연구 라이선스를 택했으며, 이제 세부 조항이 그 어느 때보다 중요해졌습니다.
통이완샹 Qwen-Image 2.1 오픈소스: 7B 소형 모델이 투명 이미지와 10개 이미지 편집을 어떻게 소비자용 그래픽카드 한 장에 담았나
7B 오픈소스 이미지 생성 모델이 어떻게 투명 이미지와 다중 이미지 편집을 6GB 그래픽카드 한 장에 담았을까? Qwen-Image 2.1의 핵심 업그레이드와 라이선스 전환점을 분석한다.
AI 이미지와 진짜 사진을 아직도 구별할 수 있을까? 솔직히 말하면, 아니다.
단서는 사라졌고 탐지기는 믿을 수 없다. AI 이미지를 찾아내는 것에 대한 솔직한 답은 ‘아니오’이며, 해법은 당신의 눈보다 상류에 있다.