← 블로그로
Ai약 12 분 읽기

PixelUMM과 Sana가 가리키는 같은 아이디어: 비전 모델에서 보조 구조 걷어내기

게시일 2026년 10월 7일
PixelUMM과 Sana가 가리키는 같은 아이디어: 비전 모델에서 보조 구조 걷어내기

NVIDIA의 두 연구 결과물이 며칠 간격으로 공개되었고, 같은 논지를 공유한다. PixelUMM은 10월 1일 21:40 UTC에 Hugging Face에 요란 없이 등장했다. 블로그 글도, 보도자료도, 기조연설 슬라이드도 없는 152억 개 파라미터 체크포인트다. NVIDIA와 MIT, 칭화대 연구진의 Sana는 더 오래 공개되어 있었고, 같은 배관 문제에 반대 방향에서 접근한다.

PixelUMM: 인코더 없는 통합 모델

저장소 이름이 프로젝트를 말해준다: nv-tlabs/PixelUMM. 자체 한 줄 요약에는 “인코더 없는 통합 이미지 및 비디오 이해와 생성”이라고 설명되어 있다. Qwen3-8B 백본 위에 있으며 Apache-2.0 저장소 라이선스를 따른다.

“인코더 없는” 부분이 흥미로운 주장이다. 오늘날 대부분의 비주얼 AI 시스템은 별도 구성 요소를 연쇄한다: 이미지를 언어 모델이 읽을 수 있는 토큰으로 바꾸는 비전 인코더, 픽셀 데이터를 디퓨전 모델이 작업할 수 있는 잠재 공간으로 압축하는 VAE, 시퀀스를 처리하는 비주얼 트랜스포머. PixelUMM은 그러한 중간 단계 없이 작동하도록 만들어졌기에, 가중치를 다운로드할 수 있는데도 자체 프로젝트 페이지에는 여전히 “preview”라고 적혀 있다.

존재하는 결과물과 아무 말도 하지 않은 벤더 사이의 이 간극이 이번 릴리스의 전부다. GitHub 저장소가 있고, 9월 29일자 arXiv 프리프린트 2609.38597이 있으며 NVIDIA와 워털루 대학 소속 저자들이 있다. 그리고 로더가 이것 없이는 실행을 거부하는 숨겨진 인덱스와 함께 128개 파일로 나뉜 체크포인트가 있다. NVIDIA가 PixelUMM을 발표된 것으로 간주하는지는 회사가 답하지 않은 질문이다.

릴리스 패턴은 이 분야를 추적하는 누구에게나 중요하다. 한때 블로그 글, 데모 페이지, 조율된 보도 주기와 함께 도착하던 연구가 이제는 저장소와 논문으로 도착하기도 한다. 결과물은 공개되어 인용 가능하지만 벤더 자체의 커뮤니케이션은 침묵한다. 그래서 모델을 사용하는 것은 가능하지만 공식 벤치마크를 인용하는 것은 불가능하다. 이를 평가하는 팀들은 논문과 자체 테스트에 의존한다.

Sana: 하나의 모듈 대신 비용 사슬을 압축하다

Sana는 스택의 같은 계층을 반대 방향에서 공격한다. 고해상도 텍스트-투-이미지가 비싸지는 이유는 픽셀 수와 거의 관련이 없다: 디퓨전 트랜스포머에 들어가는 잠재 토큰 수가 해상도와 함께 빠르게 증가하기 때문이다. 표준 셀프 어텐션은 모든 토큰을 다른 모든 토큰과 연결해야 하므로 비용, 메모리, 지연 시간이 함께 증가한다.

NVIDIA 자체의 1024픽셀 비교에서 FLUX-dev는 120억 개 파라미터를 갖고, 초당 0.04 샘플로 실행되며 이미지당 23초가 걸린다. 2K 또는 4K로 밀어붙일 때, 모델을 줄이거나 샘플링 단계를 줄이는 것으로는 근본 문제가 해결되지 않는다.

Sana는 하나의 구성 요소가 아니라 전체 사슬을 압축한다. 32배 심층 압축 오토인코더가 잠재 토큰 수를 줄인다. 선형 어텐션이 각 트랜스포머 레이어의 비용을 줄인다. 효율적인 솔버와 소수 단계 증류는 샘플링 패스 수를 줄인다. 슬라이싱, 오프로딩, 저비트 양자화는 배포 메모리를 줄인다. 공개된 모델에는 최대 4K를 겨냥한 0.6B 및 1.6B 버전이 포함되며, Sana-1.5는 4.8B로 확장된다. 공식 1024픽셀 비교에서 0.6B 버전은 0.9초 지연 시간으로 실행된다.

사슬 압축 접근법은 단일 모듈 수정이 갖지 못한 매력적인 속성을 지닌다. 모든 단계가 기여하기 때문에 팀은 자신의 하드웨어에 맞는 부분을 적용하고 나머지는 건너뛸 수 있다. 워크스테이션은 있지만 양자화 경험이 없는 사람은 효율적인 솔버를 택할 수 있다. 대규모로 배포하는 사람은 슬라이싱, 오프로딩, 저비트 양자화를 쌓아 훨씬 작은 카드에 맞출 수 있다. 트레이드오프는 전부 아니면 전무의 단일 결정으로 묶이지 않고 단계별로 문서화되어 있다.

Sana의 계보는 또한 연구 결과가 얼마나 빨리 제품 표면이 되는지 보여준다. 원래 모델은 4K 텍스트-투-비디오 출력을 목표로 했다. 그 저장소는 이후 Sana-Sprint, 비디오 생성, ControlNet, LoRA, 양자화, ComfyUI 통합, 온라인 서비스를 포함하도록 성장했다. 이는 이미지 도구들이 따랐던 것과 같은 궤적이다: 논문에서 저장소로, 그리고 사람들이 이미 사용하는 인터페이스의 노드로.

두 접근법의 공통점

두 릴리스를 나란히 놓으면 진행 방향이 분명하다. 둘 다 이 분야 초창기부터 픽셀과 모델 사이에 자리 잡아 온 중간 기계장치를 제거하려 한다. PixelUMM은 인코더가 과연 필요한지 묻는다. Sana는 품질이 무너지기 전에 계산 사슬을 얼마나 압축할 수 있는지 묻는다.

두 경우 모두 트레이드오프는 같으며, 어느 연구소도 이를 숨기지 않는다. 인코더를 제거한다는 것은 모델이 인코더가 제공하던 것을 학습해야 함을 의미하며, 이는 훈련 컴퓨트를 소모하고 인코더가 잘 처리했던 작업에서 품질을 떨어뜨릴 수 있다. 사슬을 공격적으로 압축하면 품질 상한이 달라지며, Sana 자체 자료도 그 지연 시간 수치 이면의 하드웨어와 측정 조건에 대해 신중하다.

두 연구소가 이 계층을 공략하는 이유는 중간자들이 비싼 부분이 되었기 때문이다. 비전 인코더와 VAE는 별도로 훈련되고, 별도로 튜닝되며, 별도로 서빙된다. 각각은 파이프라인의 나머지와 동기화가 어긋날 수 있는 구성 요소이며, 각각은 모든 요청의 앞단에서 지연 시간을 추가한다. 이들을 제거하는 것은 연구 트릭이 아니라 아키텍처 단순화이며, 모든 배포에서 이득을 준다.

이미지로 무언가를 만드는 사람에게 중요한 이유

실무자에게 실질적 결과는 더 낮은 하드웨어 최소 사양이다. NVIDIA의 Sana 작업은 올해 더 넓은 패턴의 일부다: 예전에는 데이터센터 카드가 필요했던 모델들이 소비자 하드웨어에 맞게 재작업되고 있으며, 오픈 커뮤니티는 6GB VRAM 최소 사양을 보너스가 아니라 요구 사항으로 취급하기 시작했다.

아키텍처 다이어그램에 나타나는 두 번째 결과도 있다. 인코더와 VAE가 별도 서비스가 아니게 되면, 버전 관리하고 모니터링하고 비용을 지불해야 할 모델이 세 개였던 파이프라인이 하나가 된다. 이는 지연 시간 수치보다 덜 눈에 띄지만, 실제 제품의 유지보수 부담을 바꾸는 것이다.

이 모델들 위에 구축하는 팀에게 실질적인 질문은 어떤 단순화를 먼저 도입할 수 있는가이다. 인코더 없는 접근법은 더 깔끔한 아키텍처를 약속하지만, 모델 자체의 표현 처리가 전용 인코더가 제공하던 것과 맞는다고 신뢰해야 한다. 사슬 압축 접근법은 기존 아키텍처를 그대로 유지하면서 오늘날 측정 가능한 속도와 메모리 이점을 약속한다. 하나는 이 분야가 향하는 방향에 대한 베팅이고, 다른 하나는 이미 보유한 하드웨어에 대한 베팅이다.

두 베팅 모두 합리적이며, 이를 추구하는 연구소들은 같은 배포를 놓고 경쟁하지 않는다. PixelUMM의 통합 프레이밍은 이해와 생성을 위한 하나의 모델을 원하는 팀에 적합하다. Sana는 제한된 하드웨어에서 고해상도 출력이 필요한 팀에 적합하다. 겹치는 부분은 두 접근법 모두 삭제하려는 스택의 일부다.

NVIDIA는 PixelUMM이 완성되었는지 말하지 않았다. Sana의 코드는 공개되어 있고, 저장소는 스프린트 변형, 비디오 생성, ControlNet, LoRA, 양자화, ComfyUI 지원, 온라인 서비스를 포함하도록 성장했다. 두 연구 팀, 두 경로, 하나의 목표: 아무도 생각하고 싶어 하지 않던 비주얼 스택의 부분들이 설계에서 제거되고 있다.

관련 글