L'Atlas di Fei-Fei Li trasforma una foto in una stanza che puoi attraversare a piedi

World Labs ha reso Atlas disponibile in accesso anticipato il 1° settembre. L'azienda, co-fondata da Fei-Fei Li, lo definisce un modello del mondo omni per l'intelligenza spaziale, e la dimostrazione consiste in alcune normali foto scattate con il telefono che entrano in ingresso e in una scena 3D interattiva che ne esce. Puoi spostare una camera virtuale ovunque al suo interno. Puoi leggerne la profondità. Puoi consegnare la geometria a un robot e usarla come luogo in cui fare pratica.
Li sostiene da anni che la prossima frontiera dell'IA non è il linguaggio ma il mondo fisico. Il suo termine è intelligenza spaziale, e l'affermazione è che un modello addestrato solo su testo e immagini piatte manca di qualcosa di fondamentale. I modelli linguistici descrivono un mondo che non possono vedere. Atlas è il tentativo più chiaro finora di costruirne uno che possa farlo.
Cosa fa Atlas
World Labs descrive Atlas come un transformer di diffusione autoregressivo multimodale, un'unica architettura che accetta testo, immagini, video e dati 3D all'interno di un unico quadro spaziale e genera attraverso lo stesso insieme. Gli output sono più ampi di quelli di un generatore video: immagini e video con controllo della camera fino a 1440p per clip di circa un minuto, più nuovi punti di vista, mappe di profondità, nuvole di punti e Gaussian splat 3D.
L'output volumetrico è ciò che lo distingue da un modello text-to-video. Un generatore video predice il fotogramma successivo. Non necessariamente sa dove si trovi qualcosa nello spazio o come appaia una scena da un'angolazione che la camera non ha mai occupato. Atlas porta con sé una rappresentazione 3D interna, così un ambiente resta coerente mentre l'osservatore si muove al suo interno. La differenza tra una clip plausibile e uno spazio navigabile è l'intero punto di chiamare questo un modello del mondo.
Da un input sparso, in alcune dimostrazioni solo pochi fotogrammi di video girato con il telefono, il modello ricostruisce una scena abbastanza bene da collocarvi dentro una camera virtuale. World Labs riporta un errore di ricostruzione da viste sparse di 25,3, inferiore a quello del miglior modello specializzato, 28,7. Nelle valutazioni in cieco che ha commissionato, i valutatori umani hanno preferito l'aderenza di Atlas a un movimento di camera richiesto rispetto a MiniMax H3 nel 75% dei casi, a Gemini Omni Flash nell'81% e a Seedance 2.5 nel 94%.
Questi sono i numeri della stessa azienda, provenienti da valutazioni che ha eseguito, cosa che vale la pena dire chiaramente. Atlas è in accesso anticipato, quindi nessuno fuori dal gruppo di partner può ancora riprodurli.
Real-to-sim, e perché ai robot interessa
Le applicazioni commerciali più ovvie sono gli effetti visivi, i giochi e la produzione virtuale. Un regista può allestire un'inquadratura dopo le riprese. La cornice su cui World Labs insiste, però, è la robotica.
Il flusso di lavoro si chiama real-to-sim. Catturi il video di uno spazio reale e Atlas lo converte in una simulazione 3D in cui un robot può essere addestrato o testato senza il costo e il rischio di far operare quello reale. Un team di robotica che vuole mille varianti di un corridoio di magazzino può scansionare il corridoio una volta e generare le varianti invece di filmare ciascuna.
Questo è un problema limitato ma reale. I dati di addestramento per i robot sono costosi perché raccoglierli significa far operare dei robot. La simulazione è economica, ma di solito richiede che qualcuno costruisca l'ambiente a mano, il che è lento e spesso non assomiglia per niente al luogo reale. Un modello che trasforma una stanza reale in un file di simulazione riduce due passaggi costosi a uno. Spiega anche perché Nvidia e AMD siano investitori. Entrambe vendono la potenza di calcolo su cui girano addestramento e simulazione.
Il problema della trasparenza
C'è un divario tra l'ambizione e la documentazione. World Labs non ha pubblicato alcun articolo di ricerca, alcuna model card, alcun conteggio dei parametri e alcun dato sul calcolo di addestramento insieme ad Atlas. Non ha reso noto alcun prezzo né una data di disponibilità generale. Per un sistema che avanza affermazioni comparative rispetto a concorrenti ben documentati, questa omissione è insolita, e rende impossibile verificare i risultati delle valutazioni in cieco.
Gli scettici hanno sollevato una domanda più pungente: se Atlas simuli davvero il mondo o ne renderizzi viste convincenti. Sono capacità diverse, e la distinzione conta per ogni caso d'uso che dipende dalla fisica. Un modello che renderizza una stanza da una nuova angolazione è utile per un film. Un modello che un robot impara ad attraversare ha bisogno che gli oggetti al suo interno si comportino come si comportano gli oggetti, altrimenti la policy impara qualcosa che funziona solo nel modello.
World Labs afferma che Atlas alimenterà le versioni future di Marble, il suo prodotto esistente. Questo gli dà una casa commerciale, cosa che la maggior parte degli annunci di ricerca non ha. Se la geometria regga oltre le demo curate è ciò che i partner dell'accesso anticipato scopriranno per primi.
La controparte cinese
Atlas non è l'unico modello del mondo con un'ambizione grande quanto una città. Il 10 settembre, la società cinese di mappe Amap ha rilasciato ABot-Earth 0.7, che definisce il primo world model urbano nativo 3D al mondo. Prende immagini satellitari o una descrizione testuale e le trasforma in una scena 3D interattiva e percorribile a piedi, generando a più scale, da un pianeta fino a un punto di riferimento a livello stradale, all'interno di un unico modello. Amap afferma che può produrre una scena urbana 3D su scala chilometrica in circa dieci minuti su una GPU consumer, nel formato 3D Gaussian splatting, e che la capacità è già integrata nel suo prodotto Flight Street View.
I due indicano la stessa idea da estremità opposte. Atlas lavora da una manciata di foto verso l'alto, ricostruendo una stanza con alta fedeltà. ABot-Earth lavora dai dati satellitari verso il basso, generando una città su scala. Insieme delineano la gamma che un modello spaziale può coprire, e mostrano anche quanto diversamente i due mercati distribuiscano i prodotti: uno tramite un programma per partner senza benchmark pubblici, l'altro integrato in un prodotto consumer dove chiunque può guardare l'output.
Cosa devono ancora dimostrare i modelli spaziali
Il settore ha slancio. V-JEPA 2 di Meta è stato addestrato su più di un milione di ore di video. Genie 2 di Google genera ambienti 3D interattivi, e Gemini Robotics lavora sul ragionamento e sulla manipolazione nello spazio fisico. L'argomento di Li, secondo cui geometria e prospettiva devono essere native del modello anziché inferite dal testo, è passato da posizione di ricerca a categoria di prodotto.
Ciò che nulla di tutto questo ha chiarito è se un modello che produce geometria coerente sia la stessa cosa di un modello che comprende uno spazio fisico. La ricostruzione è misurabile. La simulazione è più difficile, ed è quella di cui la robotica ha davvero bisogno. Atlas porta argomenti solidi per la prima. I risultati dei partner nel prossimo anno decideranno quanta della seconda arrivi con essa.
Per designer e sviluppatori, l'effetto a breve termine è più modesto di quanto suggerisca il linguaggio del lancio. Uno strumento che ricostruisce una stanza da tre foto e ti permette di far volare una camera attraverso di essa è davvero utile, e comparirà dentro il software creativo prima che dentro un robot. È così che i modelli spaziali raggiungono la maggior parte delle persone: attraverso il lavoro di creare una scena, non quello di navigarla.
Articoli correlati
Step 5 ha saltato quattro numeri di versione, è arrivato secondo tra i modelli aperti e nessuno lo sta chiamando
La posizione nel benchmark è un segnale che i produttori usano per giudicare un modello. Il volume di chiamate è un segnale che i consumatori producono usandolo.
Gemini Omni 1.1 Flash ha concatenato quattro richieste in un'inquadratura da 40 secondi. Il flusso di lavoro è il prodotto.
Google ha rilasciato una pipeline di produzione con un gate di revisione integrato nel prezzo.
Microsoft riduce la latenza delle trascrizioni parziali a 100 millisecondi. Questo cambia lo scopo della trascrizione.
Al di sotto dei 100 millisecondi, un prodotto di trascrizione può rispondere mentre qualcuno sta ancora parlando.
Synthesia ha passato un decennio a registrare avatar. Ora vuole che rispondano.
Uno strumento di formazione che le persone ripetono volontariamente è un prodotto diverso da uno che completano perché qualcuno gliel'ha assegnato.