PixelUMM, 모든 비주얼 AI 모델이 의존하는 두 가지 구성 요소를 버리다

10월 1일, CongWei1230이라는 이름으로 활동하는 개발자가 이미지와 비디오 이해 및 생성을 픽셀 공간에서 직접 처리하는 인코더 없는 멀티모달 모델 PixelUMM을 공개했습니다. 코드와 학습된 가중치가 공개되어 있습니다. 흥미로운 점은 이 모델에 포함되지 않은 부분입니다.
지난 몇 년간 구축된 대부분의 비주얼 AI 시스템은 두 가지 구성 요소를 공유합니다. 변분 오토인코더(VAE)는 이미지를 압축된 잠재 표현으로 압축하고, 생성 모델은 원시 픽셀이 아니라 그 압축된 공간에서 작동합니다. 별도로, 비전 트랜스포머(ViT)는 이미지를 언어 모델이 추론할 수 있는 패치로 변환합니다. PixelUMM은 둘 다 버립니다. 생성에 사용되는 잠재 공간과 이해에 사용되는 패치 인코더를 제거하고 픽셀을 직접 처리합니다.
그 주장은 아키텍처에 관한 것이며, 다른 거의 모든 모델이 왜 그 구성 요소들을 유지했는지 이해할 가치가 있습니다.
두 구성 요소가 하던 일
VAE는 생성을 감당할 수 있게 하기 위해 존재합니다. 3개 색상 채널을 가진 1024x1024 사진은 약 300만 개의 숫자입니다. 매 단계마다 300만 개의 값에 확산 과정을 실행하는 것은 비용이 많이 들기 때문에, VAE는 이미지를 더 작은 잠재 그리드로 압축하고 모델은 그곳에서 노이즈를 제거합니다. 대가는 VAE가 손실이 있는 병목을 도입한다는 점입니다. 미세한 디테일과 정확한 텍스트 렌더링은 압축 과정에서 정보를 잃기 쉬우며, 이는 초기 이미지 모델이 작은 글씨에 어려움을 겪은 이유 중 하나입니다.
ViT는 이해를 가능하게 하기 위해 존재합니다. 언어 모델은 토큰을 소비하며, ViT는 이미지를 토큰처럼 보이는 패치 임베딩 시퀀스로 변환합니다. 이것이 멀티모달 모델이 그림에 대한 질문에 답할 수 있는 방식입니다. 대가는 패치 그리드가 고정되어 있고, 패치 경계의 정보가 뒤섞일 수 있다는 점입니다.

PixelUMM의 승부수는 둘 다 제거함으로써 이해와 생성을 하나의 프레임워크로 통합하고 각 구성 요소가 도입하는 아티팩트를 피할 수 있다는 것입니다.
왜 이것이 어려운가
픽셀 수준 확산은 이전에도 제안되었지만 반복적으로 컴퓨팅 한계에 부딪혔습니다. 잠재 모델이 128x128 잠재 그리드의 노이즈를 제거한다면, 픽셀 모델은 1024x1024 이미지 그리드의 노이즈를 제거해야 하며, 이는 단계당 대략 64배 더 많은 위치를 처리하는 것입니다. 시퀀스 길이가 폭발하고, 어텐션 비용은 시퀀스 길이의 제곱으로 증가하며, 그 결과는 대부분의 연구소가 적당한 품질 향상을 위해 지불하지 않을 학습 및 추론 비용입니다.
인코더 없는 이해에는 다른 문제가 있습니다. 원시 픽셀에 대해 직접 추론하도록 모델을 학습시키는 것은 사전 학습된 비전 인코더에서 시작하는 대신 시각적 특징을 처음부터 학습해야 함을 의미합니다. 이는 되찾아야 할 막대한 양의 지도 신호이며, 그 이점이 비용을 능가한다는 것은 자명하지 않습니다.
PixelUMM은 아키텍처적 단순성과 충실도가 연산 비용을 지불할 가치가 있다는 승부수입니다. 공개된 가중치는 이를 평가할 증거입니다. 달러당 품질에서 승리할지는 이를 실행해 보는 사람들이 결정할 열린 질문이며, 릴리스 게시물이 결정하지 않습니다. 이는 아키텍처 제안의 정상적인 수명 주기입니다. 누군가 벤치마크할 때까지 흥미롭고, 그다음에는 유용하거나 잊히는 것입니다.
진정으로 새로운 부분
이번 릴리스가 주목할 만한 이유는 통합 주장입니다. 이미지와 비디오를 위한 대부분의 프로덕션 스택은 각각 따로 설계된 부품으로 조립됩니다. 한 목적을 위해 학습된 VAE, 다른 목적을 위한 확산 트랜스포머, 세 번째 목적을 위한 비전 인코더가 있습니다. 이들 사이의 모든 연결부는 학습과 배포 사이에 동작이 달라질 수 있고 오류가 누적될 수 있는 지점입니다.
생성과 이해를 동일한 표현으로 처리하는 단일 프레임워크는 그러한 연결부를 제거합니다. 효과가 있다면 멀티모달 파이프라인 디버깅이 더 간단해집니다. 네 가지가 아니라 하나의 표현과 하나의 실패 모드 집합이 있기 때문입니다.
데이터 측면의 이야기도 있습니다. 압축을 전혀 하지 않는 모델은 압축 아티팩트를 물려받지 않으므로 원칙적으로 별도의 정교화 단계 없이 텍스트와 미세한 질감을 포함한 정확한 디테일을 보존할 수 있습니다. 이는 작은 오류도 치명적인 문서, UI 또는 제품 이미지 파이프라인을 구축하는 사람에게 관련이 있습니다.
시점은 우연이 아니다
PixelUMM은 여러 상용 시스템이 디테일 보존을 대표 기능으로 내세운 같은 주에 등장했습니다. Black Forest Labs는 4K 출력과 픽셀 보존 지역 편집을 지원하는 FLUX 3 Image를 출시했고, Google의 Imagen 4 변형 모델들은 호스팅 플랫폼에 출시되었습니다. 시장은 사용자가 가진 것을 유지하면서 사용자가 요청한 것만 바꾸는 모델에 분명히 보상을 주고 있습니다.
픽셀 공간 생성은 연구자가 내놓은 답이며, 같은 질문에 그 제품들은 산업 공학으로 답하고 있습니다. 상용 경로는 잠재 아키텍처 위에 해상도와 편집 제어를 추가합니다. 연구 경로는 잠재 아키텍처를 제거하고 그 대가를 연산으로 지불합니다. 둘 다 생성된 디테일이 정밀한 검증을 견디는 지점에 도달하려 하며, 같은 사용자들에게 평가받을 것입니다.
누군가 지금 이것을 공개한 이유
이번 릴리스는 오픈 생태계의 현주소에 대한 논평이기도 합니다. 2년 동안 오픈 모델 커뮤니티는 주로 규모로 경쟁하며 더 많은 데이터로 학습된 더 큰 모델을 계속 공개해 왔습니다. 그 경쟁은 진정으로 유능한 시스템을 만들어냈고, 동시에 매우 유사한 아키텍처를 많이 만들어냈습니다. 거의 모두 동일한 잠재 확산 설계와 동일한 비전 인코더 계열을 사용하기 때문입니다.
인코더 없는 모델을 공개하는 것은 규모 대신 구조로 경쟁하는 방법입니다. 가장 큰 연구소보다 학습 데이터에 더 많은 돈을 쓰는 것보다 다른 아키텍처를 시도하는 것이 더 저렴하며, 효과가 있다면 더 유용한 기여입니다. 기존 설계만 확장하는 커뮤니티는 하나의 접근법으로 수렴합니다. 대안을 테스트하는 커뮤니티는 더 많은 선택지를 살려 둡니다.
그것이 호의적인 해석이며, 아마도 맞는 해석일 것입니다. 공개된 가중치는 이 접근법에 공정한 심사를 제공하며, 이는 대부분의 아키텍처 제안이 받는 것보다 더 나은 대우입니다.
무엇이 성공으로 간주될까
가중치가 공개되었으므로 테스트는 실행하기 저렴하고 속이기 어렵습니다.
텍스트 렌더링을 보십시오. 인코더 없는 생성은 같은 예산의 잠재 모델보다 작은 글자를 더 잘 처리해야 하며, 그렇지 않다면 연산 비용을 받아들일 이유가 없습니다.
단일 소비자용 가속기에서 메모리와 지연 시간을 보십시오. 모델이 평범한 이미지를 생성하는 데 데이터센터 하드웨어가 필요하다면 연구 결과물로 남습니다. 고급 워크스테이션 카드에서 유용한 속도로 실행된다면 도구가 됩니다.
비디오 경로를 보십시오. 이번 릴리스는 통합 이미지 및 비디오 처리를 주장하며, 비디오는 연산 논쟁이 가장 강하게 작용하는 곳입니다. 시간적 시퀀스 길이가 모든 것을 증폭시키기 때문입니다. 픽셀 공간에서 생성된 신뢰할 수 있는 짧은 클립은 이 접근법에 대한 가장 강력한 증거가 될 것입니다.
결과는 엇갈릴 것으로 예상됩니다. 새로운 아키텍처는 대개 그렇고, 첫 공개 벤치마크는 좀처럼 전체 이야기를 들려주지 않습니다. 이런 릴리스가 중요한 이유는 기존 설계의 가정을 명시적으로 드러내기 때문이며, 그 가정들은 충분히 오랫동안 확정된 것으로 취급되어 왔기에 누군가 직접 검증하는 모습을 보는 것이 유용합니다.
관련 글
아무도 홍보하지 않는 비디오 모델 리더보드: 요청은 실제로 어디로 가는가
매주 새로운 비디오 생성 순위가 나오고, 그 거의 전부가 같은 방식으로 만들어진다.
Ai2가 오픈소스로 공개한 것은 또 다른 가중치가 아니라 학습 스택이다
가중치는 나누기 쉽지만 배우기는 어렵다.
알리바바의 Qwen3.8-Max, 2주 동안 스스로 코딩할 수 있다고 주장
파라미터 수는 이미 오래전부터 뉴스거리가 아니게 되었다. 주목할 만한 숫자는 12일이다.
AI 데이터센터는 이제 칩 배송이 아니라 전력선을 기다린다
2027년에 제때 문을 여는 프로젝트는 연결과 메모리 할당을 먼저 해결한 곳이 될 것이다.