네이티브 투명도는 AI 이미지에서 조용히 가장 유용한 새 기능이다

AI 이미지 생성기에서 무엇을 원하느냐고 물으면 사람들은 사실감, 스타일, 속도를 말한다. 하지만 실제로 작업을 납품하는 디자이너에게 물으면 다른 답이 돌아온다. 바로 투명 배경이다.
그 소박한 기능인 알파 채널은 처음부터 AI 이미지 모델의 공백이었다. 대부분의 생성기는 평평한 사각형을 만들어낸다. 로고, 제품 누끼, 또는 다른 디자인 위에 얹을 수 있는 요소를 얻으려면, 이후에 배경 제거 도구에 이미지를 돌려야 했다. 이는 그 자체로 아티팩트와 가장자리 문제를 동반하는 별도의 단계였다. 배경 제거 도구는 머리카락 가장자리를 갉아먹고, 반투명 소재를 번지게 하며, 이전 배경의 후광을 남기곤 했다. 그러면 손으로 고쳐야 했다. 이런 종류의 마찰 때문에 AI 이미지 생성은 실제 작업을 위한 도구라기보다 완성된 그림을 위한 장난감처럼 느껴졌다.
Qwen-Image 2.1은 투명도를 모델 자체에 내장함으로써 그 공백을 메운다. 하나의 프롬프트로 일반 이미지나 실제 알파 채널이 있는 RGBA 이미지를 요청할 수 있다. 별도 모델도, 후처리 단계도 필요 없다. 사소해 보이지만, 실제 디자인 작업에서 얼마나 많은 부분이 요소 위에 요소를 겹치는 일인지 생각하면 그렇지 않다. 투명 이미지는 빌딩 블록이다. 평평한 사각형은 막다른 길이다.
알리바바는 실제로 2025년 12월에 전용 투명도 모델인 Qwen-Image-Layered를 선보인 바 있다. 2.1의 의의는 그 기능을 통합 생성·편집 모델에 접어 넣었다는 점이다. 이제 투명 레이어를 직접 편집할 수 있다. 배경은 투명하게 유지한 채 캐릭터의 표정을 바꿀 수 있다. 투명 레이어에 포함된 텍스트를 교체할 수 있다. 실제 사진에서 피사체를 RGBA 누끼로 추출해 어디든 배치할 수 있다. 이 모델은 단순히 투명도를 생성하는 것이 아니라 편집 과정에서도 투명도를 보존한다. 바로 이 부분이 워크플로에 실제로 중요한 지점이다.

활용 사례는 즉각적이다. 이커머스 판매자는 배너와 상품 목록에 합성할 수 있는 깨끗한 배경의 제품 사진이 필요하다. UI 디자이너는 배경 없는 아이콘과 일러스트가 필요하다. 게임 개발자는 가장자리가 깨끗한 스프라이트 애셋이 필요하다. 콘텐츠 제작자는 썸네일, 커버, 오버레이에 넣을 요소가 필요하다. 이 모든 작업은 이전에는 도구 체인, 즉 생성기 → 배경 제거기 → 정리 → 합성 순으로 거쳐야 했다. 네이티브 투명도가 있으면 생성기가 바로 사용할 수 있는 레이어를 건네주므로 중간 단계를 건너뛸 수 있다.
여기에는 이미지 모델이 무엇으로 변해가는지에 대한 더 깊은 전환이 있다. 첫 번째 물결은 하나의 완결된 그림을 만들어내는 것이었고, '와, 이걸 만들어냈어'의 시대였다. 다음 물결은 워크플로에 맞는 애셋을 생산하는 것이며, '이걸로 내가 뭘 할 수 있는지 봐'의 시대다. 투명도, 편집, 다중 이미지 합성은 모두 같은 방향을 가리킨다. 모델이 완성된 그림을 뽑아주는 자판기에서 멈추지 않고, 당신이 조합할 수 있는 원재료를 건네주는 도구가 되기 시작하는 것이다.
이는 사람들이 이미지 모델을 판단하는 방식에 중요하다. 출시 글에서 인용되는 벤치마크 점수는 대부분 단일 이미지가 보기 좋은지, 사실적인지, 텍스트를 읽을 수 있는지, 손가락 개수가 맞는지를 측정한다. 알파 채널이 깨끗한지, 누끼 가장자리가 날카로운지, 투명 레이어가 편집 후에도 살아남는지, 또는 모델이 변경을 요청하지 않은 이미지 부분을 존중하는지는 측정하지 않는다. 이런 품질은 전문가가 실제 사용 5분 안에 알아차리는 것들이며, 리더보드에는 거의 나타나지 않는다.
AI 이미지 담론이 계속 둘로 갈라지는 이유이기도 하다. 모델, 벤치마크, 돌파구에 대한 공개적 담론이 있고, 이 도구를 생업으로 쓰는 사람들 사이의 사적 담론, 즉 워크플로, 가장자리, 레이어, 제어에 대한 담론이 있다. 투명도는 두 번째 담론에 속한다. 그래서 그토록 중요한데도 언론의 주목을 거의 받지 못한다. 사진발이 안 받기 때문이다. 사실적인 용을 자랑하듯 트윗에서 알파 채널을 자랑할 수는 없다.
오픈 소스 생태계에서 70억 매개변수 모델의 네이티브 투명도는 하한선이 올라가고 있다는 또 다른 신호다. 1년 전만 해도 깨끗한 투명 출력을 얻으려면 특화 모델이나 유료 API가 필요했다. 이제는 중급 GPU에서 로컬로 실행할 수 있는 모델의 기능이다. 실질적인 효과는 소규모 팀과 1인 제작자가 과거에는 기업용 기능이었던 역량에 접근할 수 있게 되었고, 레이어 기반의 조합 가능한 이미지 작업을 실험하는 비용이 사실상 제로로 떨어졌다는 점이다.
한계도 여전히 있다. 투명도 생성은 미세한 디테일, 머리카락, 털, 연기, 반투명하거나 가느다란 것 주변에서 까다롭다. 모델은 단단한 물체에 대해서는 깨끗한 누끼를 만들 수 있지만, 캐릭터의 삐져나온 머리카락에는 애를 먹는다. 이는 배경 제거 도구를 괴롭혔던 바로 그 가장자리들이며, 모델이 이를 마법처럼 해결한 것이 아니라 생성 단계 안으로 옮겨서 더 쉽게 반복 개선할 수 있게 만든 것뿐이다. 진전이지만 완벽은 아니다.
이 기능은 눈에 보이지 않아서 과소평가되기 쉽다. 투명 배경은 거기에 없는 것으로 정의되며, 히어로 이미지에서 배경이 없다는 점을 가리킬 수는 없다. 하지만 제품 누끼를 따고, 피사체를 분리하고, 레이어 구성을 만드는 일이 일상인 사람들에게 이것은 그림을 만드는 모델과 애셋을 만드는 모델의 차이다. 화려하지 않은 약어 뒤에 숨은 업그레이드이며, 이번 달 발표된 대부분의 더 화려한 기능보다 조용히 더 유용하다.
투명도가 왜 이렇게 오래 걸렸는지 전체를 조망해볼 가치가 있다. 알파 채널은 컴퓨터 그래픽스에서 이미 수십 년 전에 해결된 문제다. AI 이미지 모델이 뒤처진 이유는 원리적으로 어려워서가 아니라, 모델이 웹에서 긁어온 평면화된 RGB 이미지로 학습되었고, 웹은 대부분 레이어가 있는 작업 파일이 아니라 완성된 그림을 저장하기 때문이다. 사람들이 자신의 Photoshop 파일을 공개하지 않으니 학습할 투명 이미지 데이터가 많지 않다. 그래서 모델은 사각형을 만드는 법을 배웠고, 투명도는 별도 모델이나 합성 투명 데이터의 신중한 큐레이션을 통해 사후에 공학적으로 넣어야 했다.
그것은 Qwen-Image-Layered가 메인 모델에 접어 넣어지기 전에 별도 모델로 존재했던 이유를 설명한다. 훈련 데이터에서 개념이 충분히 대표되지 않을 때 모델에게 '투명'이 무엇인지 가르치는 데는 실제 노력이 들고, 그 이해가 편집 후에도 유지되게 만드는 데는 더 많은 노력이 든다. 2.1이 70억 매개변수의 통합 모델에서 두 가지를 모두 해낸다는 사실은, 팀이 화려한 벤치마크 리더보드에는 결코 오르지 않을 역량에 상당한 공을 들였음을 시사한다.
그런 투자 자체가 신호다. 한 연구소가 벤치마크 점수만 좇는 대신 투명도와 로컬 편집 같은 워크플로 기능에 공을 들인다면, 이미지 생성 시장은 단순한 참신함이 아니라 전문적 사용이라는 데 걸고 있는 것이다. 중요한 사람들은 한 번 게시할 멋진 그림을 만들고 싶은 사람들이 아니라, 마감 안에 깨끗한 애셋을 납품해야 하는 사람들이라는 베팅이다. 그 베팅이 성공할지는 이미지 생성 산업 전체의 핵심 질문이며, 네이티브 투명도는 이를 가장 명확하게 보여주는 표현 중 하나다.
관련 글
한 번에 참조 이미지 10장: AI 이미지 편집이 단일 이미지에서 합성으로 이동하다
단일 이미지 편집은 변형을 만든다. 다중 이미지 편집은 조합을 만든다. 한 번에 10장의 참조 이미지를 사용하는 것이 우리가 프롬프트를 쓰고 구성을 만드는 방식을 어떻게 바꾸는가.
알리바바의 Qwen-Image 2.1이 오픈 모델 라이선스 논의를 바꿔 놓았다
기술 사양은 인상적이지만, 진짜 이야기는 라이선스입니다. Qwen-Image 2.1은 Apache 2.0을 버리고 연구 라이선스를 택했으며, 이제 세부 조항이 그 어느 때보다 중요해졌습니다.
통이완샹 Qwen-Image 2.1 오픈소스: 7B 소형 모델이 투명 이미지와 10개 이미지 편집을 어떻게 소비자용 그래픽카드 한 장에 담았나
7B 오픈소스 이미지 생성 모델이 어떻게 투명 이미지와 다중 이미지 편집을 6GB 그래픽카드 한 장에 담았을까? Qwen-Image 2.1의 핵심 업그레이드와 라이선스 전환점을 분석한다.
AI 이미지와 진짜 사진을 아직도 구별할 수 있을까? 솔직히 말하면, 아니다.
단서는 사라졌고 탐지기는 믿을 수 없다. AI 이미지를 찾아내는 것에 대한 솔직한 답은 ‘아니오’이며, 해법은 당신의 눈보다 상류에 있다.