한 번 증류해 54개 모델에 연결: NVIDIA의 비디오용 LongLive-Plug

모든 특화 비디오 모델은 같은 비용을 치르는 경향이 있습니다. 큰 확산 모델로 시작해, 깊이 조건화 생성기나 로보틱스 시뮬레이터처럼 특정 용도로 미세 조정한 다음, 유용할 만큼 빠르게 실행되도록 증류합니다. 증류 단계는 비싸고, 지금까지는 새 모델을 만들 때마다 그 비용을 다시 치렀습니다. NVIDIA의 LongLive-Plug는 이 단계를 한 번만 치를 수 있는지 묻습니다.
논문 arXiv 2609.38154는 9월 29일 Hugging Face의 6개 어댑터 파일과 함께 공개되었습니다. MIT와 협업하는 NVIDIA의 Efficient-Large-Model 그룹에서 나왔으며, 저자들이 once-for-all distillation이라고 부르는 프레임워크를 설명합니다.
증류는 실제로 무엇을 위한 것인가
비디오 확산 모델은 잠재 표현을 여러 단계에 걸쳐 노이즈 제거하여 생성합니다. 이 논문의 모델들에서는 30~50단계가 일반적이며, 각 단계는 수십억 개 파라미터의 트랜스포머를 완전히 순전파하는 과정입니다. 단계 수가 곧 지연 시간이므로, 이를 줄이는 것이 가장 직접적인 속도 레버입니다.
그 옆에는 두 가지 다른 비용이 있습니다. 샘플이 프롬프트를 얼마나 밀접하게 따르는지 날카롭게 만드는 기법인 classifier-free guidance는 보통 단계마다 모델을 두 번 실행합니다. 한 번은 프롬프트에 조건화하고, 한 번은 조건화하지 않은 뒤, 둘 사이를 외삽합니다. 이는 매 단계의 연산을 두 배로 만듭니다. 그리고 긴 클립을 청크 단위로 생성하는 자기회귀 비디오 모델은 진행할수록 오류가 누적되므로, 무언가 드리프트를 보정하지 않으면 후반 프레임이 흐려집니다.
이 세 가지 문제에는 각각 고유한 훈련 레시피가 있습니다. 일반적인 워크플로는 특화 체크포인트마다 적합한 레시피를 다시 실행합니다. LongLive-Plug의 가설은 그 레시피들이 재사용 가능한 무언가를 만들어내므로, 그럴 필요가 없어야 한다는 것입니다.
핵심 전환: 증류된 능력을 LoRA로 취급하기
아이디어는 백본 패밀리를 위한 기본 모델을 고정하고, 어떤 능력을 한 번 LoRA 파라미터로 증류한 다음, 그 LoRA를 추가 훈련 없이 패밀리 내의 호환되는 모든 다운스트림 모델에 붙이는 것입니다. 어댑터는 기본 모델의 동작에 맞춰 적합되었고, 주장은 패밀리의 후속 모델들이 같은 업데이트가 적용될 만큼 그 동작을 충분히 공유한다는 것입니다.
LongLive-Plug는 작업을 백본당 세 개의 개별 어댑터로 나눕니다. few-step 어댑터는 샘플링 단계를 줄이며, CFG-guided teacher 아래에서 분포 매칭 증류로 훈련됩니다. CFG 어댑터는 가이던스를 단일 조건부 패스에 접어 넣습니다. long-context 어댑터는 인과적 롤아웃에서의 오류 누적을 보정합니다. 중요한 설계 선택은 이것들이 하나의 내장 모듈이 아니라 별도 파일이라는 점입니다. 하나의 가이던스 스케일에서 훈련된 단일 LoRA는 거기에 고정되기 때문입니다. 분리하면 CFG 가중치가 다이얼이 됩니다. 이를 올리면 무조건부 분기를 다시 실행하지 않고도 프롬프트 속성을 강화합니다. 논문이 권장하는 비율은 few-step 대 CFG가 1대 0.5입니다. 결합된 하나의 LoRA를 스케일링하면 다른, 더 나쁜 일이 벌어집니다. 업데이트와 단계 수가 함께 움직이고 출력이 저하됩니다.
어댑터는 다운스트림 모델이 가하는 변경에도 견디도록 만들어졌습니다. 조건화 분기를 추가하거나 출력 채널을 확장해도 어댑터가 무효화되지 않으므로, 동일한 파일 세트가 전체 미세 조정, 작업 LoRA, 추가 제어 모듈이 있는 모델에 붙습니다.
출시된 것, 그리고 테스트 비용
공개된 컬렉션에는 MiniMax H3, Wan2.1-T2V-14B, Wan2.2-TI2V-5B 각각에 대해 few-step 파일 하나와 CFG 파일 하나씩, 총 6개의 어댑터가 들어 있습니다. Wan2.1-14B few-step 파일이 가장 쉽게 시도할 수 있는데, ComfyUI의 Wan LoRA 로더가 이미 읽는 lightx2v 명명 방식으로 내보내졌기 때문입니다. 다른 속도 LoRA처럼 loras 폴더에 넣으면 작동합니다. MiniMax H3 어댑터는 PEFT 내보내기이므로 ComfyUI가 로드하기 전에 변환 단계가 필요하며, 모델 카드는 지금은 few-step 파일과 CFG 파일을 결합하지 말고 별도로 사용하라고 안내합니다.
검증 주장의 핵심 숫자는 54개 다운스트림 모델 전반에 걸친 훈련 없는 배포입니다. 이는 월드 모델링, 로보틱스, 편집, 멀티모달 생성을 포함한 8개 작업 범주와 3개 백본 패밀리에 걸쳐 있습니다. 논문의 비용 비교는 공유 기본 증류를 대략 80 GPU-hours로 산정하며, 그 이후의 모든 작업은 대상별 훈련 실행을 피한다는 것이 논지입니다.
결과에는 두 가지 솔직한 주의점이 따릅니다. 기본 증류된 LoRA가 새로운 분기를 키운 후속 모델에서도 유효하다는 전이 가능성 가정은 이론에서 도출된 것이 아니라 그 54개 모델에서 경험적으로 검증되었습니다. 그리고 별도로 훈련된 CFG와 few-step 어댑터의 가산적 구성이 간섭하지 않는다고 가정하는데, 이는 전이 결과로 뒷받침되지만 증명되지는 않았습니다. 이런 종류의 가정은 벤치마크에서는 대체로 유지되다가 프로덕션에서는 때때로 실패하곤 합니다.
오늘 실제로 실행할 수 있는 것
이번 공개는 사용자가 무엇을 얻는지 구체적으로 말할 가치가 있을 만큼 작습니다. 백본당 두 개씩, 6개 파일입니다. Wan2.1-T2V-14B의 경우 few-step 어댑터가 ComfyUI의 Wan LoRA 로더가 이미 이해하는 lightx2v 명명 방식으로 내보내져, 기존 워크플로와 함께 드롭인 속도 LoRA로 작동합니다. 이것이 가장 마찰이 적은 진입점이며, 아마 대부분의 사람이 이 아이디어를 처음 시도하는 방식일 것입니다.
나머지 두 백본은 더 많은 작업이 필요합니다. MiniMax H3 어댑터는 PEFT 내보내기로 제공되므로 ComfyUI가 로드하기 전에 변환 단계가 필요하고, 모델 카드는 지금은 few-step 파일과 CFG 파일을 쌓지 말고 별도로 사용하라고 권합니다. Wan2.2-TI2V-5B도 PEFT 어댑터 명명 방식으로 제공됩니다. 이 모든 것이 도구에 익숙한 팀에게는 장벽이 아니지만, 프레임워크가 완성된 플러그인이라기보다 연구 공개에 더 가깝다는 뜻입니다.
더 흥미로운 질문은 재사용 가능한 어댑터가 속도 외에 무엇을 가능하게 하는가입니다. 증류된 능력이 기본 모델과 그 후속 모델 사이를 이동할 수 있다면, 같은 백본으로 만든 로보틱스 시뮬레이터, 깊이 조건화 생성기, 토킹헤드 모델이 각자 증류 비용을 치르지 않고도 동일한 few-step 동작과 동일한 가이던스 제어를 물려받을 수 있습니다. 월드 모델링부터 편집까지 8개 작업 범주에 걸친 54개 모델에서의 논문 검증이 이 주장의 증거입니다. 이것이 프로덕션에서도 유지된다면 실제 효과는 연구실이 새 전문 모델을 몇 주가 아니라 며칠 만에 사용 가능한 속도로 끌어올릴 수 있다는 것입니다. 비싼 부분은 이미 한 번 끝났기 때문입니다.
왜 이것이 흥미로운 방향인가
LoRA는 이미 미세 조정을 이식 가능한 무언가로 바꿈으로써 이미지와 비디오 커뮤니티의 작업 방식을 바꿨습니다. 파일을 다운로드해 기본 모델에 붙이면 아무것도 훈련하지 않고 새 능력을 얻습니다. LongLive-Plug는 같은 논리를 한 단계 위인 증류 단계 자체에 적용합니다. 능력 어댑터가 정말 패밀리 전체에 전이된다면, 특화 비디오 모델을 출시하는 경제성도 달라집니다. 모델마다 증류 실행을 예산에 넣는 대신, 연구실은 백본당 하나를 예산에 넣고 재사용합니다.
이것은 전문 모델이 늘어나는 곳에서 가장 중요합니다. 월드 모델, 로보틱스 시뮬레이터, 깊이 조건화 제어, 토킹헤드 생성기, 편집 파이프라인은 모두 소수의 비디오 백본을 확장한 것입니다. 각각은 예전에는 자체적인 속도 비용을 짊어졌습니다. 그 비용을 재사용 가능한 구성 요소로 취급하는 것은 자연스러운 다음 단계이며, 나머지 분야가 얼마나 빠르게 움직일 수 있는지를 결정하는 종류의 화려하지 않은 인프라 작업입니다.
관련 글
바퀴 달린 세미휴머노이드, 도움 없이 한 시간 동안 세탁 마쳐
개별 작업은 성공해도 워크플로는 여전히 실패할 수 있다. Dyna는 측정 지표를 바꿨다.
LTX 2.5, 투박한 블렌더 초안을 완성된 샷으로 렌더링하려 한다
텍스트-투-비디오에서는 무슨 일이 일어날지 통제할 수 없다. 이것이 그 문제를 해결하려 한다.
ServiceNow, 에이전트 실패를 학습 데이터로 전환하다
검증 없는 생성은 잡음이다. 게이트가 제품이다.
언어와 비전을 위한 단일 프레임워크: Horizon의 16억 파라미터 오픈 모델
언어와 비전 사이의 다리는 애초에 필요하지 않았다는 내기.