앤트 그룹의 Ming-Image, 평면 이미지가 아닌 레이어로 디자인하다

대부분의 이미지 모델은 한 장의 그림이 얼마나 잘 보이는지로 평가받습니다. 앤트 그룹은 9월 22일 두 개의 모델을 선보이며 다른 테스트를 제안합니다. 바로 결과물을 다 보고 난 뒤에도 여전히 편집할 수 있는지입니다.
앤트의 inclusionAI 연구소는 Hugging Face에 Ming-Image-0.1-Design과 Ming-Image-0.1-Design-Layer를 공개했습니다. 둘 다 60억 파라미터에 MIT 라이선스입니다. 이 라이선스는 여기서 평소보다 더 중요합니다. 기업이 먼저 아무것도 협상하지 않고도 결과물을 상업적으로 사용할 수 있게 해주기 때문입니다. 두 모델은 사진이 아니라 디자인 작업을 겨냥합니다. 인터페이스 화면, 인포그래픽, 포스터, 그리고 문자가 실제로 읽을 수 있어야 하는 종류의 레이아웃입니다.
작은 글씨는 오픈 이미지 모델이 보통 무너지는 지점입니다. Ming-Image-0.1-Design은 텍스트를 포함한 전체 구도를 생성하며, RGBA 파일을 쓸 수 있어 배경이 평평한 흰 사각형 대신 투명하게 나옵니다. 모델 카드는 2048x2048, 더 빠르게 원하면 1024x1024를 권장하며, 샘플링 스텝 12와 CFG 스케일 1.0을 제시합니다. 디퓨전 모델에서 12 스텝은 낮은 편입니다. 가중치가 로드된 뒤에는 출력이 빠르게 나옵니다. 표준 diffusers 라이브러리에서 실행되며 서빙을 위해 vLLM-Omni를 지원합니다.
두 번째 모델이 흥미로운 쪽입니다. Ming-Image-0.1-Design-Layer는 완성된 평면 디자인을 입력받아, 원하는 조각 수를 알려주는 레이어 계획에 따라 이를 다시 투명 레이어로 분할합니다. 결과물은 단일 평면 PNG보다 실제 작업 가능한 디자인 파일에 가깝습니다.

이 간극 때문에 대부분의 이미지 모델은 실제 디자인 작업에 이르지 못합니다. 클라이언트가 헤드라인을 옮기고 로고를 바꾸길 원하면, 평면 PNG는 전체 재생성을 강제하고 캔버스의 다른 모든 요소도 함께 바뀝니다. 레이어가 있으면 원하는 한 가지만 바꿀 수 있습니다. 앤트는 Crello 테스트 세트에서 이를 평가하며, 복원된 각 레이어가 색상과 형태에서 얼마나 가까운지 측정합니다.
앤트가 공개하지 않은 숫자들
인용할 수 있는 수치는 없습니다. 모델 카드는 Artificial Analysis UI/UX Design 리더보드와 Crello 결과를 가리키지만, 둘 다 차트 이미지로만 등장합니다. 본문에 숫자도, 이름이 밝혀진 경쟁 모델도 없습니다. 이번 공개만으로는 Ming-Image-0.1-Design이 Qwen-Image, Seedream 또는 어떤 상용 모델과 비교해 어떤지 알 수 없으며, 직접 평가를 다시 돌리지 않고는 어느 주장도 확인할 수 없습니다.
하드웨어 안내에도 빈틈이 있습니다. 앤트는 6B 모델을 80GiB VRAM의 단일 CUDA GPU에서 검증했는데, 이는 파라미터 수가 시사하는 것보다 훨씬 많은 여유입니다. 모델 카드는 24GB 소비자용 카드에 대한 안내를 전혀 주지 않았지만, 바로 그런 카드를 겨냥해 만들어진 커뮤니티 양자화 빌드는 몇 시간 안에 올라왔습니다. INT4, INT8, FP8, GGUF, ComfyUI 빌드가 모두 같은 날 등장했습니다.
마지막 세부 사항은 곱씹어볼 만합니다. 한 모델 연구소가 80GiB 요구 사항을 공개하자, 커뮤니티는 그 3분의 1 크기 카드에서도 모델이 돌아가게 만듭니다. 공식 수치는 앤트가 테스트한 환경을 설명할 뿐, 모델이 필요로 하는 사양을 뜻하지는 않습니다. 도입을 저울질하는 팀이라면 검증된 구성을 출발점으로 삼고, 양자화 빌드가 자신들의 하드웨어에서 실제로 어떻게 동작하는지 확인해야 합니다.
레이어가 워크플로를 바꾸는 이유
디자인 작업은 완성된 이미지의 연속이 아닙니다. 수정의 연속입니다. 클라이언트가 초안을 보고 헤드라인을 더 크게, 배경을 더 차갑게 해달라고 요청한 뒤, 로고가 반대쪽에 있어야겠다고 결정합니다. 이런 요청은 하나하나 작습니다. 하지만 평면 이미지에서는 각각이 비싼 작업이기도 합니다. 한 요소를 바꾸면 나머지 모든 부분에서 이미 승인된 구도까지 다시 생성해야 하기 때문입니다.
레이어 출력은 이를 뒤집습니다. 디자인이 개별 조각으로 존재하면, 수정은 해당 조각만 건드리고 나머지는 그대로 둡니다. 시간당 청구하는 에이전시라면 그 차이가 마진으로 나타납니다. 1인 디자이너라면 그 차이는 이 도구가 손으로 하는 것보다 빠른지로 나타납니다.
레이어가 빛을 발하는 또 다른 지점은 핸드오프입니다. 평면 PNG는 막다른 길입니다. 이후에 이를 조정해야 하는 사람은 처음부터 다시 시작해야 합니다. 레이어 파일은 디자인 팀이 이미 쓰는 도구로 넘어갈 수 있으며, 이는 워크플로 옆에 놓이는 AI 도구와 워크플로에 합류하는 AI 도구의 차이입니다.
이 모델이 속한 편집 경쟁
앤트는 빈 공간에 제품을 내놓는 게 아닙니다. 이미지 시장 전반에서 편집은 모델들이 차별화되는 지점이 되었습니다. GPT Image 2.5 Sunburst가 편집 리더보드 정상에 있고, 형제 모델인 Flare가 바짝 뒤따릅니다. Nano Banana Pro는 파인튜닝 없이 정체성을 고정하는 쉬운 경로로 남아 있으며, 최대 14개의 이미지와 5명의 사람을 블렌딩합니다. Seedream 5.0은 편집과 실시간 웹 검색을 결합해, 편집에 실제 참조가 필요할 때 도움이 됩니다. 오픈 쪽에서는 FLUX.1 Kontext가 직접 실행하는 레이아웃 보존 편집을 처리하고, Qwen-Image-Edit가 오픈 가중치 편집 순위를 이끕니다.
이러한 경쟁 구도 속에서 Ming-Image는 좁은 승부수를 던집니다. 일반 편집 경쟁에서 이기려는 것이 아닙니다. 텍스트가 많은 디자인이 전문화된 모델을 지탱할 만큼 큰 시장이며, 레이어 분해는 데모 영상에 잘 드러나지 않기 때문에 범용 모델들이 굳이 만들지 않을 기능이라는 데 거는 것입니다.
그 승부수에는 배경이 있습니다. 오픈 이미지 모델은 2년 동안 포토리얼리즘을 좇아왔고, 오픈 가중치와 클로즈드 가중치 사이의 품질 격차는 많이 줄었습니다. 줄지 않은 것은 그림을 만들어내는 모델과 자산을 만들어내는 모델 사이의 격차입니다. 그림은 보기 좋으면 끝입니다. 자산은 다른 사람에게 넘겨서 바꿀 수 있을 때 끝납니다. Ming-Image는 두 번째 범주를 겨냥하며, 이는 출시 글에서 보여주기 더 어렵고 화요일 오후에 갖고 있으면 더 유용한 것입니다.
이 모델은 실제로 누구를 위한 것인가
디자인 자산을 대량으로 만들고 그 안의 텍스트가 읽을 수 있어야 한다면, 지금 테스트해볼 가치가 있습니다. 소셜 카드, 광고 변형, 내부 덱을 쏟아내는 작은 마케팅 팀이 가장 잘 맞으며, MIT 라이선스는 상업적 사용과 당신 사이에 아무 조건도 두지 않습니다.
저라면 레이어 모델부터 시작하겠습니다. 레이어 출력은 기존 이미지 도구가 거의 확실히 할 수 없는 일이기 때문입니다. 여기서 다른 모든 것, 즉 읽을 수 있는 글자를 렌더링하는 텍스트-투-이미지 모델은 경쟁자가 있습니다. 완성된 평면 디자인을 받아 편집 가능한 파일로 돌려주는 능력은 그렇지 않습니다.
가장 먼저 돌려볼 만한 테스트는 영어가 아닌 언어에서 작은 크기의 텍스트 렌더링입니다. 이 부류의 모델이 보통 실패하는 지점인데, 이번 공개에서는 이에 대해 아무 말도 없습니다. 다국어 타이포그래피는 대부분의 실제 디자인 작업 뒤에 숨은 요구 사항이며, 라틴 문자만 잘 처리하는 모델은 한계가 있는 모델입니다.
결과물이 타이포그래피보다 사진에 가깝다면, 여기 해당하는 내용은 없습니다. Ming-Image는 아름다운 사람과 풍경을 렌더링하는 모델과 경쟁하려는 것이 아닙니다. 그것은 포스터에 헤드라인이 올바른 위치에 있어야 하고, 제품 카드에 사람이 읽을 수 있는 가격이 있어야 하는, 디자인의 화려하지 않은 절반을 겨냥합니다. 그 절반은 자신을 진지하게 다루는 모델을 꽤 오래 기다려왔습니다.
관련 글
Step 5, 버전 번호 네 개를 건너뛰고 오픈 모델 2위에 올랐지만 아무도 호출하지 않는다
벤치마크 위치는 생산자가 모델을 판단하는 데 쓰는 신호다. 호출량은 소비자가 사용함으로써 만들어내는 신호다.
Gemini Omni 1.1 Flash는 네 번의 요청을 연결해 40초짜리 샷을 만들었다. 제품은 바로 워크플로다.
Google은 가격표에 검수 관문을 내장한 제작 파이프라인을 내놓았다.
마이크로소프트가 부분 전사 지연 시간을 100밀리초로 줄였다. 이것은 전사의 용도를 바꾼다.
100밀리초 아래에서는 전사 제품이 누군가 아직 말하는 동안에도 반응할 수 있습니다.
Synthesia는 10년 동안 아바타를 녹화해 왔다. 이제는 그 아바타가 말을 받아치길 원한다
사람들이 자발적으로 반복하는 교육 도구는 누군가 배정해서 마치는 도구와는 다른 제품이다.