40단계 대신 4단계: 증류가 오픈 이미지 모델을 소비자용 GPU로 압축하는 방법

강력한 오픈 이미지 모델과 소비자용 그래픽 카드 사이의 격차는 몇 달째 좁혀지고 있다. 그 메커니즘은 더 적은 디노이징 단계다. 한때 노이즈를 그림으로 바꾸는 데 40번의 패스가 필요했던 모델도, 올바른 어댑터를 붙이면 이제 4단계, 6단계, 또는 8단계로 거기에 도달할 수 있다.
10월 초의 두 가지 공개는 서로 반대 방향에서 그 한계를 다시 밀어냈다: 증류가 어떻게 학습되는지 재고한 연구 논문과, 그 아이디어를 널리 쓰이는 오픈 모델에 적용한 프로덕션 LoRA다.
DMAD, 분포 매칭을 분류 문제로 바꾸다
이 논문은 텍사스 A&M과 ByteDance 연구진이 만든 DMAD, 즉 Distribution Matching as Adversarial Distillation의 약자다. 10월 1일 처음 공개되었으며 증류에서 잘 알려진 비용 문제를 다룬다.
표준 레시피는 이렇게 작동한다. 교사 모델이 여러 단계에 걸쳐 고품질 샘플을 생성한다. 학생 모델은 1~4단계 안에 같은 분포를 근사해야 한다. 학생을 안내하기 위해, 학생의 현재 분포에 계속 맞춰지는 보조 확산 모델을 학습시킨 다음, 교사의 점수와 학생의 점수 간 차이를 사용해 학생을 업데이트한다. 문제는 학생이 계속 변하기 때문에 보조 모델이 계속 그 뒤를 쫓아야 한다는 점이다. 메모리와 연산량이 치솟는다.
DMAD는 목적 함수를 분류로 다시 쓴다. 공유 특징 백본 위에 두 개의 판별기 헤드가 있다. 하나는 실제 데이터와 학생 샘플을 구분한다. 다른 하나는 교사 샘플과 학생 샘플을 구분한다. 최적 조건에서 판별기의 출력 점수는 로그 밀도 비율에 대응하며, 이는 학생이 판별기 점수에서 도출된 선형 목적 함수를 따라 업데이트할 수 있음을 의미한다. 별도의 보조 점수 모델이 필요 없다.
두 번째 요소는 노이즈 수준에 따른 감독이다. 교사는 어떤 노이즈 수준에서는 실제 분포에 가깝고, 다른 수준에서는 눈에 띄게 벗어난다. DMAD는 첫 번째 판별기 헤드로 실제 샘플과 교사 샘플 사이의 경험적 점수 차이를 측정한 다음, 그에 따라 학생의 학습 가중치를 재조정한다. 그래서 학생은 교사가 가장 약한 노이즈 수준에서 교사의 편향을 덜 물려받는다. 이는 '교사는 항상 옳다'는 가정을 측정 가능한 것으로 바꾼다.
결과는 세 가지 규모에 걸쳐 있다. ImageNet에서의 이미지 분류 학습에서 1단계 64x64 생성은 FID 1.04에 도달했다. FID는 생성된 분포가 실제 분포와 얼마나 다른지 측정하며, 낮을수록 좋다.
프로덕션 버전은 이미 출시되고 있다
같은 아이디어는 논문보다 LoRA 어댑터를 통해 사용자에게 도달한다. Alibaba PAI는 Hugging Face에 Qwen-Image-2.1-Fun-Acc-LoRAs를 공개했는데, 병렬 디코딩 증류를 적용해 교사의 40회 신경 함수 평가(NFE)에서 4회로 추론을 줄였으며, 텍스트-투-이미지와 명령 기반 편집 모두를 지원한다. 어댑터는 BF16에서 rank 64, network alpha 64이며, 모델 카드는 Diffusers와 VideoX-Fun용 빠른 시작 스크립트를 제공한다.
모델 카드는 트레이드오프에 대해 솔직하다. 촘촘한 작은 텍스트는 교사에 비해 품질이 떨어지고, 이미지 편집은 약간 더 흐리거나 어둡게 나온다. 작은 글씨 한 단락이 들어간 포스터에는 4단계가 맞는 도구가 아니다. 텍스트가 짧고 큰 소셜 미디어용 크기 이미지에는 맞다.
두 번째 어댑터는 품질에서 더 나아간다. Qwen-Image-2.1 Turbo v0.2.1은 약 648MB의 rank-128, 6단계 LoRA로, 기본 flow-matching 모델의 긴 probability-flow ODE를 1.0에서 0.25로 실행되는 시그마 스케줄로 압축한다. 6단계는 중간 설정이다: 디테일을 유지할 만큼 충분한 패스이면서, 빠르게 유지할 만큼 적다.
커뮤니티 증류들이 나머지 사다리를 채운다. Viggle turbo 어댑터는 4단계를 목표로 한다. PrunaAI의 어댑터는 5단계 또는 8단계를 목표로 한다. 둘 다 진행 중인 작업임을 솔직히 밝히고 있으며, Pruna의 노트에 따르면 저단계 버전은 다중 참조 구성, 얼굴 교체, 여러 제약이 있는 편집에서 아직 기본 모델과 맞먹지 못한다.
Krea 2 Turbo는 라이선싱에서 다른 길을 택했다. 이제 2단계 및 4단계 증류 어댑터가 Comfy Cloud, 로컬 ComfyUI, Apple MLX용 Apache-2.0 ComfyUI 워크플로와 함께 제공되며, 자동 단계 전환을 지원한다. 워크플로 계층의 Apache-2.0은 법률 검토 없이 그 위에 제품을 만들고 싶은 누구에게나 중요하다.
이것을 실행하는 사람에게 실제로 달라지는 것
실질적인 효과는 같은 하드웨어가 더 많은 이미지를 생성하고, 중요한 설정이 달라진다는 점이다. Qwen 2.1 관련 커뮤니티 스레드는 LoRA를 로드했을 때 CFG 2.0~3.0과 40단계, 그리고 약 676MB의 텍스처 수정 VAE를 권장한다. 다른 이들은 LoRA 없이 2.0메가픽셀에서 표준 워크플로를 돌리면 이전 오픈 모델이 거의 도달하지 못했던 렌더링 품질이 나온다고 보고한다.
솔직히 해석하자면 저단계 증류는 공짜 점심이 아니라 트레이드오프다. 텍스트 충실도, 편집 정밀도, 다중 참조 일관성은 가장 먼저 희생되는데, 이들이 해결에 가장 많은 패스를 필요로 하는 작업이기 때문이다. 명확한 단일 피사체에 대한 프롬프트 준수는 잘 유지된다.

이는 단일 설정보다 워크플로를 시사한다. 4단계로 초안을 만들고, 원하는 구도를 고른 다음, 선택한 프레임을 전체 단계 수로 다시 렌더링하라. 증류 어댑터는 탐색을 저렴하게 만들고 최종 패스는 최고 품질로 남겨둔다.
연구가 어댑터를 넘어 더하는 것
사용자가 다운로드하는 LoRA는 이 작업의 눈에 보이는 끝이지만, DMAD 논문은 다음 세대 어댑터가 왜 더 나아야 하는지 설명한다. 기존 레시피는 학생의 변하는 분포를 추적할 살아 있는 보조 모델이 필요했고, 그 오버헤드는 훈련 단계마다 커졌다. 목적 함수를 한 쌍의 판별기로 다시 자르면 보조 모델이 사라지므로, 같은 GPU 예산으로 더 강한 학생을 훈련할 수 있다.
재가중치 아이디어는 더 오래가는 기여다. 교사를 균일하게 옳다고 취급하는 것이 증류된 학생이 얼마나 좋아질 수 있는지를 제한하는 가정인데, 교사의 최악의 순간에 맞춰 훈련된 학생은 그 오류를 물려받기 때문이다. 교사가 실제 데이터에서 벗어나는 곳을 측정하고 그 영역의 가중치를 낮추는 것은 일반적인 기법이며, 추론 비용을 줄이기 위해 증류가 사용되는 비디오 확산, 오디오 및 기타 모든 생성 모달리티로 전이되어야 한다.
증류된 어댑터로 충분한지 판단하는 방법
결정은 작업 유형에 달려 있다. 저단계 어댑터는 단일 피사체, 명확한 조명, 큰 포맷의 구도를 잘 처리한다. 많은 패스가 필요한 것은 어려워한다: 작은 텍스트 문단, 정교한 타이포그래피, 여러 참조에 걸쳐 정체성을 보존해야 하는 편집, 여러 제약을 한꺼번에 쌓은 지시 등이다. 이는 바로 모델 카드가 경고하는 사례이며, 경고는 벤더 전반에서 일관된다.
라이선싱은 또 다른 변수다. 이런 어댑터 중 일부는 연구용 또는 기타 제한 조건을 가지며, 상업적 사용 가능 여부가 항상 모델 카드에 정리되어 있지는 않다. Alibaba PAI의 릴리스는 라이선스를 'other'로 표기하면서 상업적 조건을 명시하지 않았는데, 이는 제품에 배포하는 팀이 출시 전에 숙제를 해야 함을 의미한다. Krea의 Apache-2.0 워크플로는 예외이며, 그 허용성은 그 위에 상업 서비스를 만드는 누구에게나 중요할 가능성이 크다.
나아가는 방향은 분명하다. 오픈 이미지 모델은 사람들이 이미 보유한 하드웨어로 압축되고 있으며, 그 압축은 가중치, 모델 카드, 명시된 한계와 함께 공개적으로 일어나고 있다. 그 개방성 자체가 유용한데, 구매자가 결정하기 전에 트레이드오프를 판단할 수 있게 해주기 때문이다. 폐쇄적인 벤더는 업데이트에서 품질을 낮추고도 속도 개선이라고 부를 수 있다. 약점을 명시한 모델 카드와 함께 공개된 어댑터는 그럴 수 없다.
무엇을 측정할지에 대한 메모
이 분야의 속도 주장은 과장되기 쉽다. 단계 수는 지연 시간에 영향을 주는 입력 중 하나일 뿐이기 때문이다. 해상도, 배치 크기, 샘플러, 프롬프트당 생성 이미지 수는 모두 헤드라인 단계 수가 시사하는 것보다 실제 시간을 훨씬 더 많이 바꾼다. 중급 카드에서 고해상도로 돌리는 4단계 어댑터는 같은 하드웨어에서 초안 해상도로 돌리는 40단계 실행보다 느릴 수 있다.
구매자에게 중요한 비교는 실제로 필요한 품질과 실제로 보유한 하드웨어에서의 분당 이미지 수다. 모델 카드는 그 숫자를 거의 보고하지 않으므로 로컬에서 측정해야 한다. 어댑터는 측정을 저렴하게 만드는데, 그것이 진짜 이점이다. 4단계는 4단계가 충분했는지 알려주는 실험을 돌리기에 충분히 빠르다.
다음에 지켜볼 것
어댑터와 논문은 같은 방향을 가리킨다. 오픈 이미지 모델의 추론 비용은 계속 떨어지고, 새로운 증류가 나올 때마다 소비자용 카드와 임대 가속기 사이의 격차가 좁혀진다. 추적할 가치가 있는 질문은 다음 라운드 어댑터가 텍스트 렌더링과 참조 충실도 격차를 좁히는지, 아니면 그 한계가 저단계 생성 자체에 내재된 것으로 드러나는지다. 그것이 정리될 때까지 현명한 태도는 단계 수를 여러 다이얼 중 하나로 취급하고, 실제로 보유한 하드웨어에서 분당 이미지 수를 측정하는 것이다.
관련 글
BOSSFIGHT, 프런티어 모델을 24주간 커피숍 사장으로 돌려보았다. 대부분은 '아무것도 하지 않기'에 졌다.
퀴즈에서 뇌물을 거절하는 것과 실제 분기에서 흔들리지 않는 것은 서로 다른 두 가지 능력이며, 현재의 평가는 더 쉬운 쪽을 측정하는 경향이 있다.
NASA와 IBM, 17년간의 궤도선 데이터로 훈련된 달 파운데이션 모델을 오픈소스로 공개
이 모델은 지형지를 찾고 특성화하는 데 유용하지만, 그것들이 정확히 어디에 있는지 높은 정밀도로 말하는 데는 신뢰할 수 없다.
이번 주, 에이전트들이 단편 영화를 연출하기 시작했다. 병목은 품질 관리로 옮겨갔다.
생성은 저렴하고, 오케스트레이션이 제품이며, 파이프라인이 유용한지를 결정하는 것은 실패했을 때를 알아차릴 수 있는지 여부다.
Reka Rho-1, 이해와 생성을 동일한 KV 캐시에 담다
카메라 이미지를 예측하는 동일한 가중치가 로봇 움직임도 구동합니다. 둘 다 같은 표현 공간에 존재하기 때문입니다.