알리바바, 평면 이미지를 편집 가능한 레이어로 분해하는 모델 오픈소스로 공개

알리바바의 Qwen 팀은 10월 초 Qwen-Image-Layered를 ModelScope와 Hugging Face에 공개했으며, 상업적 사용을 허용하는 라이선스를 적용했습니다. 10월 2일 중국어 발표에서는 이 모델을 네이티브 포토샵 스타일의 레이어 이해 및 편집 기능을 갖춘 최초의 이미지 모델이라고 설명했습니다. 이 주장은 자세히 살펴볼 가치가 있습니다. 그 뒤에 있는 메커니즘이 대부분의 이미지 편집기가 지향해 온 방식과 다르기 때문입니다.
생성된 이미지를 편집하는 표준 방식은 영역을 선택하고 그 안을 다시 생성하는 것입니다. 인페인팅이 이렇게 작동합니다. 하루 전에 공개된 FLUX 3 Image도 모델이 건드릴 수 있는 픽셀을 정확히 정의하는 바운딩 박스를 사용해 같은 방식으로 작동합니다. 이 접근법에는 알려진 약점이 있습니다. 모델은 레이어가 무엇인지 전혀 모릅니다. 직사각형 영역과 프롬프트를 보고 구멍을 채울 뿐입니다.
Qwen-Image-Layered는 다른 표현에서 출발합니다. 완성된 이미지를 각각 전체 해상도를 가지며 자체 투명도를 지닌 RGBA 레이어 집합으로 분해합니다. 객체는 하나의 레이어가 되고, 텍스트 조각은 또 다른 레이어, 배경은 세 번째 레이어가 됩니다. 레이어를 이동하거나 색을 바꾸거나 교체한 다음 스택을 다시 합성할 수 있습니다. 이를 측정 가능하게 만드는 것은 훈련 목표입니다. 모델은 재합성했을 때 입력 이미지를 재현하는 레이어를 생성하도록 학습하므로, 분해 품질에 직접적인 점수가 매겨집니다.

이것이 세그멘테이션과 다른 문제인 이유
이미지를 객체로 분할하는 것은 오래된 작업이며, 모델들은 한동안 이 작업을 잘해 왔습니다. 레이어 분해는 더 특정한 것을 요구합니다. 출력이 편집 기본 요소로 사용 가능해야 하므로, 각 레이어는 깨끗한 알파 가장자리, 올바른 스택 순서, 그리고 동시에 두 레이어에 나타나는 픽셀의 이중 계산이 없어야 합니다.
이 두 가지 실패 모드는 흔합니다. 벽 앞에 서 있는 사람을 오려낸 경우, 순진한 세그멘테이션에서는 레이어를 제거할 때 사람의 잔상이 남습니다. 벽 레이어는 사람이 자신을 가린다는 것을 학습해야 하고, 사람 뒤에 벽이 어떻게 보였는지 재구성해야 합니다. 이는 라벨링 문제가 아니라 생성 문제이며, RGBA 표현이 중요한 이유입니다. 각 레이어는 자체 알파 채널을 가지므로 모델은 픽셀 단위로 어느 레이어가 무엇을 소유하는지 결정해야 합니다.
중국어 보고서는 이를 가능하게 한 두 가지 아키텍처로 전용 RGBA-VAE 인코더와 레이어 수준 3D 위치 인코딩을 꼽습니다. 두 번째가 흥미로운 부분입니다. 레이어가 깊이 방향으로 쌓이면 모델은 각 레이어가 스택에서 어디에 위치하는지에 대한 개념이 필요하며, 이를 위치 인코딩이 제공합니다.
“제로 드리프트” 주장
핵심 주장은 편집이 거의 드리프트를 일으키지 않는다는 것입니다. 한 레이어를 바꿔도 나머지는 그대로 유지됩니다.
드리프트는 생성 이미지를 편집해 본 사람이라면 누구나 아는 실패입니다. 배경 교체를 요청했는데 모델이 조금 달라진 얼굴, 다른 색조의 셔츠, 또는 움직인 그림자를 반환하는 식입니다. 모든 확산 기반 편집에는 어느 정도 이런 문제가 따릅니다. 모델이 요청한 것보다 더 많은 부분을 다시 생성하기 때문입니다. Adobe의 Lightroom 신규 Prompt to Edit 기능도 정확히 이 문제를 갖고 있으며, 사진작가들이 이를 경계하는 이유입니다.
레이어 모델은 이 문제를 구조적으로 피해 갑니다. 편집하지 않는 객체가 별도의 RGBA 레이어로 존재하고 편집이 다른 레이어만 건드린다면, 건드리지 않은 레이어는 재생성되지 않고 복사됩니다. 드리프트는 모델의 속성이 아니라 합성기의 버그가 됩니다.
이는 어떤 인페인팅 접근법도 제공할 수 없는 더 깔끔한 보장이며, 여기서 벤치마크 수치보다 아키텍처 선택이 핵심인 이유입니다.
실제 작업에서 달라지는 점
세 가지 워크플로가 더 짧아집니다.
기존 자산 재사용. 배너에 포함된 제품 사진을 누군가 클리핑 패스를 따라 그리지 않고도 추출해 재사용할 수 있습니다. 레이어가 이미 알파와 함께 존재합니다.
투명 출력. 기본적으로 RGBA 레이어를 출력하는 모델은 정상 작동의 부산물로 투명 PNG를 만들 수 있습니다. 이는 현재 세그멘테이션 모델이나 수동 마스킹이 필요한 단계를 없애줍니다.
일괄 변형. 마스터 이미지가 레이어 스택이라면 팀은 한 레이어를 교체하고 다시 합성해 변형을 재생성할 수 있습니다. 나머지 이미지는 그대로 유지되며, 이는 브랜드 가이드라인이 제품을 제외한 모든 것을 고정할 때 중요합니다.
네 번째는 덜 명확합니다. 레이어는 구조화된 데이터입니다. 이름이 지정된 RGBA 구성 요소 스택은 평면 비트맵보다 편집기나 자동화 파이프라인에 훨씬 깔끔하게 입력되므로, 모델이 최종 목적지가 아니라 구성 요소로서 유용해집니다.
한계는 어디인가
이 모델은 이미지를 분해합니다. 레이어의 이름이 무엇이어야 하는지는 알지 못하고, 의도를 추론하지도 않습니다. 어수선한 책상을 찍은 사진을 나누라고 하면 객체는 잘 분리하지만 조명은 잘못 분리할 수 있습니다. 반투명 재질이 어려운 사례인데, 물 한 잔은 여러 레이어에 동시에 속한다고 볼 수 있기 때문입니다.
반사와 그림자의 깊이 순서도 모호하게 남습니다. 벽에 드리운 그림자는 객체의 속성이지만 배경 레이어에 존재하며, 이를 어느 쪽에 둘지 결정하는 것은 모델이 별도 지시 없이 내려야 하는 판단입니다.
이 중 어느 것도 이번 공개가 덜 중요하다는 뜻은 아닙니다. 오히려 완성된 도구라기보다 기반이라는 의미입니다.
더 나은 인페인터보다 레이어 형식이 더 잘 전파되는 이유
지난 2년 동안 이미지 모델 경쟁은 같은 코스에서 진행되었습니다. 각 세대는 더 선명한 인페인팅, 더 나은 프롬프트 준수, 더 적은 눈에 띄는 아티팩트를 만들어냈습니다.
그 코스에는 한계가 있으며, 이는 구조적입니다. 인페인터가 아무리 좋아져도 상호작용 모델은 그대로입니다. 사용자가 영역을 정의하고, 모델이 채우고, 사용자가 결과를 판단합니다. 품질은 좋아지지만 워크플로는 바뀌지 않습니다. 증거는 모델 세대를 거쳐도 같은 불만이 반복된다는 점입니다. 즉 국소 편집이 다른 곳에 변화를 만든다는 것입니다.
레이어는 품질 지표 대신 워크플로를 공략합니다. 이미지가 스택이 되면 작업 단위는 선택 영역이 아니라 레이어가 되고, 사용자는 구성 요소를 직접 조작합니다. 이는 디자이너들이 30년 동안 전용 도구에서 일해 온 방식이며, 이미지 모델이 이를 하지 못한 이유는 해당 표현을 사용할 수 없었기 때문입니다.
그 표현을 구축하는 것은 비용이 많이 듭니다. 모델은 대부분 레이어 분해를 포함하지 않는 데이터에서 가림, 깊이 순서, 알파를 학습해야 하며, 그래서 예측된 스택으로부터 입력을 재구성하는 훈련 목표가 설계의 핵심 지지대입니다.
이 접근법이 효과가 있다면 그 영향은 알리바바 자체 제품을 넘어섭니다. 레이어 스택을 받아들이는 합성 도구는 이전에는 사람이 마스크를 잘라야 했던 파이프라인에 연결될 수 있습니다. 분해 결과를 제공하는 스톡 이미지 라이브러리는 평면 JPEG를 제공하는 라이브러리보다 더 가치 있어집니다. 이 모델은 그 사슬의 첫 번째 조각이며, 생태계에는 아직 나머지가 없습니다.
경쟁 구도
레이어 분해는 알리바바만의 것이 아닙니다. 앤트 그룹의 Ming-Image는 평면 그림이 아니라 레이어 구성으로 디자인을 생성하며 관련 입장을 취합니다. Stability 등은 워크플로의 일부를 근사하는 세그멘테이션 모델을 출시했습니다. 차이는 RGBA 레이어를 네이티브 출력 형식으로 삼는 헌신과 누구나 실행할 수 있는 가중치를 공개하기로 한 결정입니다.
그 마지막 선택은 이 아이디어가 얼마나 빨리 퍼지는지에 중요합니다. 이미지 도구 시장은 2년 동안 '영역을 선택하고 변경을 설명하라'는 상호작용으로 수렴해 왔고, 근본적인 표현이 바뀌지 않았다는 단순한 이유로 결과 품질은 정체되었습니다. 비트맵 대신 편집 가능한 스택을 생태계에 제공하는 것은 벤치마크 표에 나타나기 전에 다른 사람들의 제품에 먼저 나타나는 종류의 전환입니다.
지켜볼 것은 합성 도구가 레이어 스택을 입력 형식으로 받아들이기 시작하는지, 그리고 편집기들이 분해를 수리 작업이 아니라 프로젝트의 첫 단계로 취급하기 시작하는지입니다. 벤치마크 점수는 부차적인 문제입니다.
관련 글
Salesforce, 에이전트에게 몇 주간 실행되는 런타임을 부여하다
라인업은 가장 흥미롭지 않은 부분이다. 그 아래의 런타임이 에이전트의 존재 목적을 바꾼다.
Cohere, 엔터프라이즈 에이전트 지출에 확실한 상한선을 씌우다
무인으로 실행되는 에이전트는 무인으로 요금을 쌓아올릴 수 있는 에이전트다. North 2는 예산을 제품의 일부로 만든다.
Adobe가 Lightroom에 생성형 편집을 넣었고, 사진가들이 불안해하는 것은 당연하다
슬라이더들 사이에 자리한 도구는 그것이 일상적인 조정이라는 믿음을 부추깁니다. 그것은 사진을 재작성합니다.
JetBrains, 출시하는 모든 IDE에 에이전트 오케스트레이터를 탑재하다
JetBrains는 모델 품질로 경쟁하지 않는다. 에이전트가 실행되고 검토되는 계층을 두고 경쟁한다.