2억 6천만 파라미터 이미지 모델, 같은 블록 반복으로 6.5배 큰 경쟁 모델을 앞서다

새 논문은 텍스트-이미지 모델을 확장하는 다른 방식을 제안하며, 그 결과는 사람들이 두 번 보게 만드는 종류의 수치다. 각 디노이징 단계 내에서 공유 트랜스포머 블록 세트를 반복 실행함으로써, 새로운 파라미터를 추가하는 대신, 2억 6천만 파라미터 모델이 약 4.9배 적은 연산을 사용하면서 6.5배 더 큰 경쟁 모델을 이겼다고 보고된다. 이 기법은 루프형 디퓨전 트랜스포머(Looped Diffusion Transformer)라고 불리며, 그 아이디어의 배경은 머신러닝의 다른 곳에서 익숙할 만큼 오래되었다.
원리는 깊이 전반에 걸친 가중치 공유다. 표준 이미지 모델은 더 많은 블록을 쌓아 강해지며, 모든 블록은 자체 파라미터를 갖는다. 루프형 모델은 단일 디노이징 단계 내에서 더 작은 블록 세트를 반복 실행하므로, 이미지가 완성되기 전에 동일한 가중치가 더 많은 일을 한다. 연산량은 루프 수에 따라 증가하지만 파라미터 수는 평평하게 유지되며, 이는 모델이 어디에서 실행될지 고민하는 사람들의 계산을 바꾼다.
파라미터가 어디에 존재하는지가 중요한 이유
파라미터 수와 연산량은 보통 함께 논의되지만, 이들은 서로 다른 요소를 제약한다. 파라미터는 모델이 차지하는 메모리 크기를 결정하고, 흔히 개인이 실제로 보유한 하드웨어에 들어가는지를 좌우한다. 연산량은 생성에 걸리는 시간과 서비스 제공 비용을 결정한다.
루프 횟수를 파라미터와 맞바꾸는 설계는 두 번째 제약을 무시하지 않으면서 첫 번째 제약을 겨냥한다. 보고된 4.9배 연산 절감은 이 벤치마크에서 그 맞바꿈이 유리함을 시사하지만, 논문의 결과가 배포되는 체크포인트의 결과와 같지는 않으며, 루프형 아키텍처의 학습 안정성은 초기 연구에서 반복적으로 제기된 우려였다.
이제 오픈 이미지 경쟁은 메모리 사용량 싸움이다
시점이 관련 있는 이유는 오픈 이미지 커뮤니티가 지난 한 해 동안 다른 축에서 경쟁해 왔기 때문이다. 메모리 사용량이 명시적 목표가 되었고, 모델들은 얼마나 적은 VRAM을 요구하는지, 샘플링 단계 수를 줄이는 증류 기법을 내세워 광고되었다. 단계를 줄이는 접근과 파라미터를 줄이는 접근은 같은 파이프라인의 양 끝에서 문제를 공략한다. 루프형 디퓨전 트랜스포머는 파라미터 쪽 끝에 자리한다.
스탠퍼드 NLP의 관련 결과도 비슷한 방향으로 움직인다. UniEvo-VL이라는 방법은 단일 모델이 교사와 학생 역할을 모두 하는 온폴리시 자기 증류(on-policy self-distillation)를 사용해, 외부 교사 모델 없이 Qwen 기반 이미지 모델의 GenEval 점수를 0.747에서 0.808로 끌어올렸다. 관통하는 흐름은 같다: 더 큰 모델을 학습시키기보다 주어진 모델에서 더 많은 능력을 끌어내는 것이다.
이는 단순한 연구 취향 이상이다. 오픈 웨이트 텍스트-이미지 리더보드 최상위권은 적당한 크기에 촘촘하게 모여 있다. Qwen-Image-2.1이 70억 파라미터 생성 컴포넌트로 약 1,036 Elo로 선두이며, FLUX.2 dev와 HunyuanImage 3.0 Instruct를 앞선다. 최고의 오픈 모델은 약 1,197에 위치한 OpenAI의 GPT Image 2.5 Sunburst를 여전히 큰 차이로 뒤진다. 규모 면에서 최전선에 닿을 수 없다면, 효율성 기법이 더 작은 연구실이 대화에 남는 방법이 된다.
솔직한 단서들
첫째, 헤드라인 비교는 단일 벤치마크다. 6.5배 더 큰 경쟁 모델이 한 평가에서 루프형 모델에 진다고 해서 이 기법이 모든 곳에서 이긴다는 뜻은 아니며, 이미지 품질은 프롬프트와 샘플러 선택에 극도로 민감한 것으로 악명 높다. 둘째, 이 분야의 자기 보고식 승리는 독립 테스트에서 줄어드는 습성이 있으며, 특히 추론이 동일한 하드웨어와 설정에서 실행되지 않을 때 그렇다. 셋째, 루프는 추론 효율을 위해 학습 단순성을 맞바꾸며, 루프 횟수가 잘못 설정되었을 때의 실패 양상은 출시 요약만으로는 분명하지 않다.
그렇다고 해서 방향이 무효가 되는 것은 아니다. 실제로 작업하는 창작자에게 흥미로운 질문은 2억 6천만 파라미터 모델이 표에서 6.5배 경쟁 모델을 이기느냐가 아니다. 그 설계가 네 시간의 설정 없이 소비자용 GPU에서 실행되는 다운로드 가능한 체크포인트로 나오느냐이다. 효율성 기법의 패턴은 그랬다: 논문으로 시작해 커뮤니티 파인튜닝에 흡수되고, 몇 달 안에 기능이라기보다 기대치가 된다.
지켜볼 점
루프형 또는 가중치 공유 설계가 논문에만 머무르지 않고 공개된 가중치에 나타나는지, 그리고 어텐션 비용이 지배적인 더 높은 해상도에서도 연산 절감이 유지되는지 주목하라. 파라미터 하한을 낮추는 기법은 여러 새 모델이 동시에 같은 효율 구간에 안착하는 모습으로 나타나는 경향이 있으므로, 다음 오픈 릴리스 이후 리더보드를 지켜보라.
이번 연구 묶음에서 얻는 더 넓은 교훈은 이미지 생성에서의 스케일링 논의가 성숙해졌다는 것이다. 파라미터를 더하는 것은 여전히 효과가 있다. 하지만 더 활발한 작업은 주어진 모델이 더 적은 것으로 더 많은 일을 하게 만드는 것이며, 그것이 데이터센터보다 노트북에 더 먼저 도달하는 종류의 진보다.
루프가 새로운 주목을 받는 오래된 아이디어인 이유
깊이 전반에 걸친 가중치 공유는 새로운 것이 아니다. 수년 전의 순환 신경망과, 고유한 층을 쌓기보다 한 블록의 층을 재사용하는 여러 언어 모델에서 나타난다. 지금 디퓨전에서 이것이 흥미로운 이유는 생성 과정의 구조 때문이다. 이미지 생성은 여러 디노이징 단계에 걸쳐 일어나며, 각 단계는 이미 전체 네트워크를 실행한다. 단계 내에서 루프를 도는 것은 두 번째 반복 축을 추가하며, 이는 연산 배수와 품질 향상을 어느 정도 독립적으로 조정할 수 있음을 의미한다.
트레이드오프는 실재한다. 가중치를 재사용하면 모든 루프의 그래디언트가 동일한 파라미터를 통해 역류해야 하므로 학습이 더 어려워지고, 너무 공격적으로 루프를 도는 모델은 세부 디테일을 잃을 수 있다. 보고된 결과는 논문이 조정할 여유가 있는 특정 루프 횟수를 사용한다. 배포된 체크포인트는 다양한 사용자의 프롬프트 전반에서 작동해야 하며, 이는 더 엄격한 테스트다.
커뮤니티가 벤치마크가 시사하는 것보다 더 신경 쓸 실용적인 이유도 있다. 유통되는 거의 모든 오픈 이미지 모델은 필요한 VRAM이 얼마나 적은지로 부분적으로 평가받는데, 이를 실행하는 사람들이 클러스터가 아니라 한두 개의 소비자용 GPU를 사용하기 때문이다. 품질에 비례하는 타격 없이 파라미터 하한을 낮추는 설계는 그 사용자층에 직접적으로 와닿으며, 그 사용자층은 이제 어떤 기법이 채택될지를 좌우할 만큼 충분히 크다.
효율성 군비 경쟁에는 두 개의 전선이 있다
“효율성”으로 묶이는 두 지렛대를 분리해 보면 도움이 된다. 디노이징 패스 수를 줄이는 단계 증류는 주로 생성 시간과 이미지당 비용을 줄인다. 루프형 설계가 겨냥하는 파라미터 감소는 주로 메모리와 다운로드 크기를 줄인다. 모델은 빠르고 클 수도, 느리고 작을 수도 있으며, 가장 적합한 선택은 기기에 달려 있다.
지난 한 해의 오픈 이미지 릴리스는 첫 번째 지렛대를 강하게 밀어붙였고, 대화형으로 실행될 것을 목표로 하는 모델에서는 4단계 및 2단계 변형이 표준이 되었다. 두 번째 지렛대는 더 느리게 움직였고, 그래서 파라미터 효율성에 관한 결과가 눈에 띈다. 이 결과가 유지된다면, 증류된 샘플러와 결합되어 충분히 작아서 들어가고 충분히 빨라서 쓸 수 있는 모델이 나올 것으로 예상할 수 있으며, 이는 온디바이스 이미지 생성 이야기가 한동안 향해 온 대략적인 지점이다.
그 중 어느 것도 논문 하나로 보장되지는 않는다. 하지만 방향은 분명하며, 이미지 하나를 생성하려고 대기열에서 기다려 본 사람이라면 그 보상이 체감될 것이다.
관련 글
AI 비디오 가격 전쟁: Luma, Seedance 요금 최대 73% 인하하고 Runway는 경쟁사 모델 판매 시작
이제 엔진들은 서로 충분히 비슷해서 리더보드보다 청구서가 더 나은 길잡이다.
두 음성 모델이 방금 기준을 새로 세웠다: 첫 오디오까지 50ms, 노트북 CPU에서 구동되는 99M 모델
품질이 수렴하고, 경쟁은 모델이 어디에서 실행되는지, 얼마나 빨리 시작하는지, 호출당 비용이 얼마인지로 이동했다.
문샷의 Kimi K2.6, 한 번에 천 개의 에이전트를 구동하며 10시간 만에 컴파일러 구축
각각 감독이 필요한 천 개의 에이전트는 역량이 아니라 감독 부담을 천 배로 늘린다.
오라클이 에이전트 오케스트레이션을 ERP 안에 넣었다, 그리고 그것은 거버넌스의 계산법을 바꾼다
에이전트 역량은 더 이상 헤드라인이 아니다. 이제 헤드라인은 기업이 사후에 자사 에이전트가 정확히 무엇을 했는지 입증할 수 있는지다.