Una foto, un mondo percorribile: InSpatio-World 1.5 trasforma le immagini in spazi

La maggior parte dei modelli di immagini e video ti offre un fotogramma fisso o una clip fissa. Guardi quello che il modello ha deciso di mostrarti. Questo mese un'azienda cinese, InSpatio, ha rilasciato un modello che prende una singola foto, oppure un panorama, oppure un video esistente, e la trasforma in uno spazio in cui puoi muoverti.
InSpatio-World 1.5 è stato presentato al Shanghai International Audiovisual Arts Carnival alla fine di settembre, e l'azienda ha reso il codice open source con licenza Apache 2.0. Il video dimostrativo è la spiegazione più chiara di cosa sia diverso. Inizia all'interno del porticato coperto di un palazzo cinese. La camera avanza, supera una balaustra e una scalinata, e sbocca in un cortile. I padiglioni che erano nascosti dietro le colonne entrano nell'inquadratura man mano che il punto di vista cambia. Quello che il modello ha prodotto è uno spazio che continua a essere renderizzato mentre continui a esplorarlo, invece di una clip con un percorso di camera prestabilito.

Tre cose sono cambiate in questa versione
La prima riguarda ciò che il modello accetta in input. I modelli di mondo precedenti volevano per lo più una singola immagine. La versione 1.5 accetta una singola immagine, un insieme di immagini, un panorama o un video. Questo conta perché definisce il punto di ingresso. Una singola foto è un punto di partenza alla portata di chiunque. Gli insiemi multi-immagine e i video esistenti sono ciò che un team cinematografico o pubblicitario ha già in mano, e accettarli amplia la platea di chi può usare lo strumento.
La seconda è l'esplorazione in tempo reale. Una volta dentro lo spazio generato, puoi continuare a spostare il punto di vista, aggirare le occlusioni e raggiungere aree che non erano nel fotogramma iniziale. Ogni volta che il punto di vista cambia, il modello deve riempire le parti della scena prima invisibili, e farlo in modo coerente con quello che hai già visto. È un problema più difficile che generare una clip piacevole, perché al modello viene chiesto di mantenere un modello mentale di un luogo, non una sequenza di immagini.
La terza è la coerenza spazio-temporale, che è la vera linea di demarcazione tra un modello di mondo e un generatore di video. Se la camera esce da una stanza e poi ci ritorna, la stanza non dovrebbe essersi riorganizzata. InSpatio afferma di aver rafforzato questo aspetto nella 1.5 per supportare percorsi di esplorazione più lunghi e scene più complesse, e la demo si appoggia a questa affermazione tornando più volte sulle stesse aree da angolazioni nuove.
I numeri dietro la demo
InSpatio descrive il modello come compatto, con 1,3 miliardi di parametri, e riporta un punteggio di 68,72 su WorldScore-Dynamic, che secondo l'azienda lo colloca al primo posto tra i metodi interattivi in tempo reale valutati, fino a 24 fotogrammi al secondo. Sono dati dell'azienda stessa, e le riproduzioni indipendenti sono ancora scarse, quindi vanno presi come punto di partenza e non come risultato consolidato.
L'approccio tecnico ha un paio di componenti che vale la pena nominare. Per gli input video, la pipeline usa Depth Anything 3 per stimare la profondità mancante e i parametri intrinseci ed estrinseci della camera per ogni fotogramma, ed è questo che le permette di ricostruire una scena da footage che non è stato girato come cattura 3D. Un processo autoregressivo spazio-temporale è ciò che mantiene uno stato persistente del mondo mentre la vista cambia, invece di rigenerare la scena da zero ogni volta.
Dove una scena percorribile si guadagna il suo posto
L'uso più immediato è quello che la demo indica. Nel cinema e nella pubblicità, la posizione della camera di solito è bloccata nel momento in cui giri. Se vuoi un'altra angolazione, rigiri, e rigirare costa. Un modello di mondo permette a un team di continuare a cercare posizioni di camera a posteriori, ricavando copertura da footage che esiste già. InSpatio cita il bullet-time pubblicitario come esempio diretto: invece di sincronizzare un rig di camere attorno a un soggetto, dai in input un insieme di immagini e progetti un nuovo percorso di camera attorno allo stesso soggetto.
Il secondo uso sono i dati di addestramento per i robot. Un problema nell'AI embodied è che la maggior parte dei video forniti da internet è girata in terza persona, mentre un robot vede il mondo in prima persona. InSpatio afferma che il modello può prendere footage in terza persona di un'operazione e prevedere una vista in prima persona più vicina a quella che percepirebbe un robot, e può riosservare lo stesso processo da direzioni diverse con le relazioni di occlusione modificate. Se funziona su larga scala, è un modo per trasformare video disponibili in materiale di addestramento per i robot senza girare nuovo footage per ogni ambiente.
Oltre a questi, l'azienda punta al turismo e alle esperienze culturali, ai gemelli digitali e alla simulazione industriale, quei contesti in cui uno spazio che si comporta come uno spazio è più utile di un'immagine che ne ha l'aspetto.
Una corsa affollata, con definizioni diverse di vittoria
InSpatio non è sola in questa corsa, e gli approcci concorrenti non sono d'accordo nemmeno su a cosa serva un modello di mondo. Alcuni laboratori ottimizzano per l'output cinematografico, generando un minuto di footage meravigliosamente coerente con un unico movimento narrativo di camera. Altri inseguono l'interattività, dando priorità alla capacità di muoversi liberamente e di far rispondere la scena senza un percorso prestabilito. Un terzo schieramento, più vicino al gaming, vuole motori in tempo reale che tengano un mondo in memoria come luogo navigabile.
Questi obiettivi tirano in direzioni diverse. Un modello di mondo tarato sulla qualità cinematografica può permettersi di spendere potenza di calcolo su una sequenza predeterminata e far apparire giusto ogni fotogramma. Uno tarato sull'interazione deve renderizzare qualunque cosa l'utente guardi dopo, il che spinge verso la velocità e verso una memoria della scena che sopravviva a movimenti arbitrari. InSpatio-World 1.5 è chiaramente nello schieramento interattivo, e la scelta di un modello piccolo da 1,3 miliardi di parametri è una scommessa sul fatto che restare in tempo reale conti più che vincere un concorso di bellezza su fotogramma singolo.
Il confronto che conta per chi acquista è con gli altri sistemi navigabili, e qui il campo è abbastanza agli inizi che la maggior parte delle affermazioni è auto-dichiarata. Un benchmark come WorldScore-Dynamic cerca di dare un numero alla parte più sfuggente, cioè se il mondo resta coerente mentre lo attraversi, ma un benchmark misura solo ciò che i suoi progettisti hanno scelto di misurare. La coerenza su un'esplorazione lunga, la fedeltà alla foto originale e il frame rate tirano tutti in direzioni opposte, e ogni sistema sceglierà compromessi diversi.
Questa è la vera ragione per seguire il rilascio open source. Quando decine di ricercatori metteranno alla prova il modello sui propri input, il quadro di dove tiene e dove si rompe sarà molto più utile della demo di lancio, e permetterà al resto del settore di confrontare gli approcci su un terreno condiviso invece che su showreel in competizione.
Perché l'open source è la strategia, non il regalo
InSpatio ha rilasciato il codice insieme al modello, e sta stuzzicando l'idea di un nuovo Topos-Pro 1.0 per test su invito. Il ragionamento è quello che ricorre in tutta l'intelligenza spaziale: le applicazioni utili sono sparse tra cinema, turismo, robotica e gemelli digitali, e nessuna singola azienda può coprirle tutte. Pubblicare la capacità di base permette ai ricercatori di verificarne i limiti e ai partner di costruire sopra lo strato verticale. È un modo per essere il piano terra invece che l'intero edificio.
Il rischio è quello abituale di un rilascio open source precoce. La demo è impressionante e il benchmark è auto-dichiarato, e il divario tra una demo controllata e uno strumento che regge su un input reale e disordinato è spesso ampio. I prossimi mesi, quando ricercatori e creatori indipendenti avranno il codice tra le mani, mostreranno quali parti della promessa sopravvivono al contatto con i dati di altri.
Articoli correlati
Un semi-umanoide su ruote ha completato un'ora di lavanderia senza aiuto
I singoli compiti possono riuscire mentre un flusso di lavoro fallisce comunque. Dyna ha cambiato la metrica.
LTX 2.5 vuole renderizzare la tua bozza Blender a blocchi in un'inquadratura finita
Non controlli ciò che accade nel text-to-video. Questo prova a rimediare.
ServiceNow trasforma i fallimenti degli agenti in dati di addestramento
La generazione senza verifica è rumore. I cancelli sono il prodotto.
Un unico framework per linguaggio e visione: il modello aperto da 1,6 miliardi di Horizon
Una scommessa sul fatto che i ponti tra linguaggio e visione non siano mai stati necessari.