← Torna al blog
Aicirca 7 min di lettura

PixelUMM e Sana indicano la stessa idea: togliere l'impalcatura dai modelli di visione

Pubblicato 7 ott 2026
PixelUMM e Sana indicano la stessa idea: togliere l'impalcatura dai modelli di visione

Due rilasci di ricerca NVIDIA sono arrivati a pochi giorni di distanza l'uno dall'altro, e condividono una tesi. PixelUMM è apparso senza clamore su Hugging Face il 1° ottobre alle 21:40 UTC, un checkpoint da 15,2 miliardi di parametri senza post sul blog, senza comunicato stampa, senza slide di keynote. Sana, di ricercatori NVIDIA, MIT e Tsinghua, è pubblico da più tempo e adotta l'approccio opposto allo stesso problema infrastrutturale.

PixelUMM: un modello unificato senza encoder

Il nome del repository dice cosa è il progetto: nv-tlabs/PixelUMM, descritto nel suo riassunto in una riga come "comprensione e generazione unificata di immagini e video senza encoder". Si basa su un backbone Qwen3-8B con licenza di repository Apache-2.0.

La parte "senza encoder" è l'affermazione interessante. La maggior parte dei sistemi di IA visiva oggi concatena componenti separati: un encoder di visione per trasformare un'immagine in token che un modello linguistico può leggere, un VAE per comprimere i dati dei pixel in uno spazio latente in cui un modello di diffusione può lavorare, e un transformer visivo per gestire la sequenza. PixelUMM è stato costruito per operare senza quelle fasi intermedie, ed è per questo che la sua stessa pagina del progetto riporta ancora "preview" mentre i pesi sono scaricabili.

Quel divario tra un artefatto che esiste e un fornitore che non ha detto nulla è l'intera storia del rilascio. C'è un repo GitHub, un preprint arXiv numerato 2609.38597 datato 29 settembre con autori di NVIDIA e dell'Università di Waterloo, e un checkpoint diviso in 128 file con un indice nascosto senza il quale i loader si rifiutano di funzionare. Se NVIDIA consideri PixelUMM annunciato è una domanda a cui l'azienda non ha risposto.

Lo schema di rilascio è importante per chiunque segua questo campo. La ricerca che un tempo arrivava con un post sul blog, una pagina demo e un ciclo stampa coordinato ora a volte arriva come un repository e un articolo. L'artefatto è pubblico e citabile mentre la comunicazione del fornitore è silenziosa, il che rende possibile usare il modello e impossibile citare un benchmark ufficiale per esso. I team che lo valutano lavorano da un articolo e dai propri test.

Sana: comprimere la catena dei costi invece di un solo modulo

Sana attacca lo stesso strato dello stack dalla direzione opposta. Il text-to-image ad alta risoluzione diventa costoso per una ragione che ha poco a che fare con il numero di pixel: il numero di token latenti che entrano nel transformer di diffusione cresce rapidamente con la risoluzione. L'auto-attenzione standard deve mettere in relazione ogni token con ogni altro token, quindi costo, memoria e latenza aumentano insieme.

Nel confronto a 1024 pixel di NVIDIA, FLUX-dev ha 12 miliardi di parametri, gira a 0,04 campioni al secondo e impiega 23 secondi per immagine. Spingendosi verso 2K o 4K, ridurre il modello o tagliare i passaggi di campionamento non risolve il problema di fondo.

Sana comprime l'intera catena invece di un solo componente. Un autoencoder a compressione profonda 32x riduce il numero di token latenti. L'attenzione lineare riduce il costo di ogni strato del transformer. Un risolutore efficiente e la distillazione in pochi passaggi riducono il numero di passaggi di campionamento. Lo slicing, l'offloading e la quantizzazione a bassi bit riducono la memoria di deployment. I modelli pubblicati includono versioni da 0,6B e 1,6B mirate fino a 4K, con Sana-1.5 che si estende a 4,8B. Nel confronto ufficiale a 1024 pixel, la versione da 0,6B gira a 0,9 secondi di latenza.

L'approccio di compressione della catena ha una proprietà attraente che una correzione a singolo modulo non ha. Poiché ogni fase contribuisce, un team può applicare le parti che si adattano al proprio hardware e saltare il resto. Chi ha una workstation e nessuna esperienza di quantizzazione può prendere il risolutore efficiente. Chi distribuisce su larga scala può impilare slicing, offloading e quantizzazione a bassi bit per adattarsi a una scheda molto più piccola. I compromessi sono documentati per fase invece di essere raggruppati in un'unica decisione tutto-o-niente.

La discendenza di Sana mostra anche quanto rapidamente un risultato di ricerca diventi una superficie di prodotto. Il modello originale mirava a un output text-to-video in 4K. Il repository è cresciuto fino a includere Sana-Sprint, generazione video, ControlNet, LoRA, quantizzazione, integrazione con ComfyUI e un servizio online. È lo stesso arco che hanno seguito gli strumenti per immagini: da un articolo, a un repository, a un nodo nell'interfaccia che le persone già usano.

Cosa condividono i due approcci

Mettendo i rilasci fianco a fianco, la direzione di marcia è chiara. Entrambi cercano di rimuovere il macchinario intermediario che si è frapposto tra pixel e modelli fin dai primi giorni del campo. PixelUMM si chiede se l'encoder sia necessario del tutto. Sana si chiede quanto della catena di calcolo possa essere compresso prima che la qualità si rompa.

Il compromesso è lo stesso in entrambi i casi, e nessuno dei due laboratori lo nasconde. Rimuovere un encoder significa che il modello deve imparare ciò che l'encoder forniva, il che costa calcolo di addestramento e può costare qualità su compiti che l'encoder gestiva bene. Comprimere aggressivamente la catena significa che il tetto di qualità si sposta, e i materiali di Sana sono attenti all'hardware e alle condizioni di misurazione dietro quei numeri di latenza.

La ragione per cui entrambi i laboratori attaccano questo strato è che gli intermediari sono diventati la parte costosa. Un encoder di visione e un VAE sono addestrati separatamente, ottimizzati separatamente e serviti separatamente. Ognuno è un componente che può andare fuori sincrono con il resto della pipeline, e ognuno aggiunge latenza all'inizio di ogni richiesta. Rimuoverli è una semplificazione architetturale più che un trucco di ricerca, e ripaga in ogni distribuzione.

Perché è importante per chiunque costruisca con le immagini

Per i professionisti, la conseguenza pratica è un abbassamento delle soglie hardware. Il lavoro di NVIDIA su Sana fa parte di uno schema più ampio quest'anno: modelli che prima richiedevano una scheda da data center vengono rielaborati per adattarsi a hardware di consumo, e la comunità open ha iniziato a trattare una soglia di 6 GB di VRAM come un requisito anziché un bonus.

C'è una seconda conseguenza che emerge nei diagrammi di architettura. Quando l'encoder e il VAE smettono di essere servizi separati, una pipeline che prima aveva tre modelli da versionare, monitorare e pagare diventa uno. È meno visibile di un numero di latenza, ma è ciò che cambia il carico di manutenzione su un prodotto reale.

Per i team che costruiscono su questi modelli, la domanda pratica è quale semplificazione possono adottare per prima. L'approccio senza encoder promette un'architettura più pulita ma richiede di fidarsi che la gestione della rappresentazione del modello corrisponda a ciò che forniva un encoder creato ad hoc. L'approccio di compressione della catena promette miglioramenti misurabili in velocità e memoria oggi, mantenendo intatta l'architettura esistente. Uno è una scommessa sulla direzione in cui si muove il campo; l'altro è una scommessa sull'hardware che già possiedi.

Entrambe le scommesse sono ragionevoli, e i laboratori che le perseguono non competono per la stessa distribuzione. L'inquadramento unificato di PixelUMM si adatta ai team che vogliono un unico modello per comprensione e generazione. Sana si adatta ai team che necessitano di output ad alta risoluzione su hardware vincolato. La sovrapposizione è la parte dello stack che entrambi cercano di eliminare.

NVIDIA non ha detto se PixelUMM sia finito. Il codice di Sana è disponibile, e il repo è cresciuto fino a includere varianti sprint, generazione video, ControlNet, LoRA, quantizzazione, supporto ComfyUI e un servizio online. Due team di ricerca, due percorsi, un obiettivo: le parti dello stack visivo a cui nessuno voleva pensare vengono progettate fuori.

Articoli correlati