네 단계로 실행되는 오픈 이미지 모델, 들리는 것보다 훨씬 큰 의미다

9월 4일, 앤트 그룹(Ant Group)의 바이링(Bailing) 랩은 오픈 이미지 생성·편집 모델 제품군인 LLaDA-Image를 공개하고 가중치와 추론 코드를 함께 배포했다. 헤드라인만 보면 오픈소스 공개가 쏟아진 달에 또 하나가 추가된 것처럼 읽힐 것이다. 정작 중요한 세부 사항은 아키텍처 속에 묻혀 있다. Turbo 버전은 2~4개의 샘플링 단계로 실행된다.
확산(diffusion) 이미지 모델을 써봤다면 그 숫자가 무슨 뜻인지 알 것이다. 대부분은 수십 단계에 걸쳐 샘플링하며, 각 단계는 네트워크를 한 번 통과하는 과정이다. 품질 좋은 이미지를 얻으려면 50단계가 흔하다. 그것을 두 단계나 네 단계로 줄이는 것은 작은 최적화가 아니다. 모델의 용도 자체를 바꾼다.
이 모델의 정체
LLaDA-Image는 두 가지 버전으로 나온다. Base 버전은 50개의 샘플링 단계를 사용하며 고충실도 생성을 목표로 한다. Turbo 버전은 Twin-DMD 증류를 사용해 품질을 거의 유지하면서 샘플링을 몇 단계로 압축한다. 두 버전은 단일 아키텍처를 공유하며, 팀에 따르면 하나의 체크포인트가 별도의 편집 백본 없이 텍스트-투-이미지 생성, 참조 이미지 편집, 중국어와 영어 텍스트 렌더링을 모두 처리한다. 파라미터 수는 약 70억 개이며, 다양한 하드웨어에 배포할 수 있도록 BF16과 FP8 가중치를 모두 제공한다.
학습 방식은 단계적으로 진행된다. 팀은 먼저 이미지만으로 사전 학습해 시각적 사전 지식(prior)을 익힌 뒤, 쌍을 이룬 언어 지도 학습과 생성-편집 공동 학습을 추가한다. 모델이 언어와 정렬되기 전에 시각적 구조를 먼저 파악하게 하려는 것으로, 팀은 이것이 생성 품질과 편집 일관성을 모두 높인다고 말한다. 학습 코드는 추후 공개하겠다고 예고했는데, 즉 \"완전히 열린 레시피\"라는 주장은 아직 완성되지 않았다.
Qwen-Image-Bench에서 이 모델은 영어 53.53점, 중국어 53.38점을 기록했으며, 팀은 이를 최고 수준(state of the art)이라고 설명한다. 자연스러운 조명, 세밀한 디테일, 장면 일관성, 창의적인 포스터 생성이 강점으로 꼽힌다. 독립적인 검증에는 시간이 걸릴 것이고, 모델이 나온 지 얼마 되지 않아 커뮤니티가 아직 이 수치를 검증하지는 못했다.
단계 수가 줄면 용도가 달라지는 이유
단계 수는 추상적인 벤치마크 지표가 아니다. 지연 시간과 직결되며, 지연 시간은 어떤 기능이 존재할 수 있는지를 결정한다.
고급 GPU에서 50단계 모델은 이미지 한 장당 몇 초가 걸린다. 사용자가 진행 표시줄을 보며 기다리는 데스크톱 도구라면 괜찮다. 즉각적으로 느껴져야 하는 무엇이든 그렇지 않다. 4단계 모델은 같은 하드웨어에서 1초 훨씬 안쪽으로 이미지를 반환할 수 있을 법하며, 이는 전혀 다른 제품군을 열어준다. 슬라이더를 드래그하는 대로 갱신되는 실시간 디자인 도구, 앱 내 카메라 효과, 대기열 없이 수천 개의 에셋을 처리하는 배치 파이프라인, 각 변경이 즉시 렌더링되는 인터랙티브 편집 등이다.
Turbo 설계는 이미지당 필요한 연산량도 줄여주는데, 이는 비용에 직결된다. 규모 있게 이미지를 생성하는 서비스를 운영한다면 GPU 비용은 단계 수와 토큰 수에 비례한다. 50단계에서 4단계로 줄이는 것은 하드웨어를 바꾸지 않고도 요청당 서비스 비용을 크게 낮춘다. 이는 폐쇄형 모델들이 자체적인 저렴하고 빠른 등급(tier)으로 대응해 온 것과 같은 경제적 압력이다.
더 조용한 두 번째 이점도 있다. 소비자용 하드웨어에서 몇 단계로 실행되는 모델은 로컬에서 돌릴 수 있다. 오픈 가중치 논쟁은 항상 통제권에 관한 것이었다. 데이터가 내 기계에 남고, 비용이 종량제가 아니라 고정되며, 어떤 벤더도 가격을 바꾸거나 API를 꺼버릴 수 없다. 4단계 모델은 노트북이나 중급 GPU가 데모가 아니라 실제 작업용으로 호스팅할 수 있는 지점에 훨씬 가까이 다가선다. 팀 스스로도 이 저단계 설계가 고급 GPU에 대한 의존을 줄이고 소비자용 하드웨어에서 실시간 생성을 가능하게 한다고 설명한다.
더 넓은 오픈 이미지 물결
LLaDA-Image는 혼자 등장하지 않았다. 9월은 오픈 이미지 모델이 쏟아진 달이었고, 시점이 중요하다. 알리바바는 Qwen-Image-2.1을 오픈 가중치로 공개했는데, 9B 프롬프트 재작성 체크포인트 두 개를 갖춘 7B 모델이지만 이 계열이 이전에 사용했던 허용적 조건이 아니라 비상업적 연구 라이선스로 배포됐다. 바이트댄스는 Seedream 모델들을 폐쇄형 진영에서 계속 밀어붙였고, 텐센트의 Hunyuan Image 3.5는 클라우드 API를 통한 임대 방식으로 갔다.
이런 배경 속에서 앤트의 발표가 흥미로운 이유는 무엇을 최적화했는가에 있다. 업계 대부분은 최상위 품질을 두고 경쟁한다. 더 나은 텍스트 렌더링, 더 강한 피사체 일관성, 단일 대표 이미지에서의 더 풍부한 디테일 같은 것이다. LLaDA-Image-Turbo는 하한선에서 경쟁한다. 설계 전체가 유능한 이미지 모델을 데모가 아니라 일상적인 제품 안에 넣을 수 있을 만큼 저렴하고 빠르게 만드는 데 초점을 둔다. 덜 화려한 목표지만, 사람들이 실제로 어떤 도구를 쓰는지를 결정하는 쪽은 대개 이쪽이다.
텍스트 렌더링 측면도 주목할 만하다. 이 모델은 동일한 체크포인트에서 중국어와 영어 텍스트 생성을 지원하며, 이는 오래된 공백을 메운다. 오픈 이미지 모델은 역사적으로 서구 언어 간판에는 강하고 한자에는 약했는데, 이 한계 때문에 중국어권 시장을 겨냥한 포스터, 포장, 인포그래픽에 쓰기 어려웠다. 팀에 따르면 두 언어를 모두 처리하는 단일 아키텍처는 해당 사용자를 위해 만드는 이들에게 의미 있는 진전이며, 헤드라인 벤치마크에는 드러나지 않지만 실제로 도구를 쓸 수 있는지를 결정하는 종류의 세부 사항이다.
라이선스 문제
가중치를 다운로드할 수 있다는 점에서 이번 공개는 진정으로 열려 있으며, 이는 1년 내내 이동해 온 스펙트럼에서 허용적인 쪽에 위치한다. 하지만 더 넓은 라이선스 논쟁의 한가운데에 떨어진다. 비슷한 시기에 알리바바의 Qwen-Image-2.1은 비상업적 연구 라이선스로 오픈 가중치가 배포되며 이전의 허용적 접근에서 멀어졌다. 이 분기는 지켜볼 가치가 있다. 이제 \"오픈 가중치\"는 완전 허용부터 연구 전용까지의 범위를 아우르며, 그 위치 사이의 간격은 곧 그 위에 사업을 세울 수 있는 모델과 그럴 수 없는 모델의 차이다.
개발자에게 9월이 남긴 교훈은 벤치마크보다 라이선스를 먼저 읽으라는 것이다. 4단계로 실행되고 이미지 벤치마크에서 좋은 점수를 받는 모델은 흥미롭다. 그것을 상업적 제품 안에 넣어 출시할 수 있는지는 별개의 질문이고 별개의 답이며, 프로젝트의 성패를 좌우하는 쪽은 대개 이 질문이다.
이것이 어디에 맞는가
효율적인 이미지 모델 트렌드는 독립적으로 일어나는 것이 아니다. 업계 전반의 흐름과 맞물려 있다. 텐센트의 Hunyuan Image 3.5는 최종 이미지 기준으로 과금하고 다중 턴 편집을 밀어붙이며, 가치가 첫 렌더링이 아니라 반복(이터레이션)에 있다고 본다. OpenAI는 플래그십을 빠른 모델과 정밀한 모델로 나누고, 워크로드에 따라 선택하라고 개발자에게 명시적으로 요구했다. 앤트의 LLaDA-Image-Turbo는 호출당 가격이 아니라 이미지당 연산량을 줄이면서 오픈 진영에서 같은 문제를 공략한다.
공통된 흐름은 원시적인 생성 품질이 이제 기본 전제가 되었다는 점이다. 더 나은 조명과 더 선명한 질감만으로는 더 이상 이기지 못한다. 경쟁은 실행 비용, 응답 속도, 그리고 통제 가능성으로 옮겨갔다. 4단계 오픈 모델은 이러한 전환에 거는 베팅이며, 하드웨어와 라이선스가 협조할 때만 의미가 있는 베팅이다. 그렇다면 내년의 흥미로운 이미지 도구는 가장 큰 렌더 팜을 뒤에 둔 것이 아닐 수도 있다. 바로 눈앞의 기계에서 돌릴 만큼 저렴한 것들일 수 있다.
관련 글
Agility Digit 5, 단순한 스펙 시트가 아닌 안전성 입증 자료와 함께 출시되다
창고 현장은 실험실이 아니다. 관문은 인증이지 데모가 아니다.
프론티어 에이전트가 연구 워크플로의 30퍼센트를 완료했다. 그 숫자가 핵심이다.
에이전트는 연구를 운영할 수 있다. 절차를 새로 고안하는 일은 아직 요원하다.
Figure AI, 판매할 제품도 없이 35억 달러어치 컴퓨팅을 확보하다
베팅의 핵심은 일반화가 컴퓨팅 문제라는 것이다. 업계는 아직 결론을 내리지 못했다.
OpenAI, 마침내 이미지 API에 투명 배경 추가
파이프라인에서 한 단계를 통째로 없애는 작은 기능.