Une seule photo, un monde parcourable : InSpatio-World 1.5 transforme les images en espaces

La plupart des modèles d'image et de vidéo vous donnent une image fixe ou un clip figé. Vous regardez ce que le modèle a décidé de vous montrer. Une entreprise chinoise appelée InSpatio a publié ce mois-ci un modèle qui prend une seule photo, ou un panorama, ou une vidéo existante, et la transforme en un espace dans lequel vous pouvez vous déplacer.
InSpatio-World 1.5 a été lancé au Carnaval international des arts audiovisuels de Shanghai fin septembre, et l'entreprise a ouvert son code sous licence Apache 2.0. La vidéo de démonstration est l'explication la plus claire de ce qui est différent. Elle commence à l'intérieur d'une galerie couverte d'un palais chinois. La caméra avance, passe une rambarde et une volée de marches, puis débouche dans une cour. Des pavillons cachés derrière des colonnes apparaissent à mesure que le point de vue se déplace. Ce que le modèle a produit est un espace qui continue de s'afficher pendant que vous l'explorez, plutôt qu'un clip avec un trajet de caméra choisi.

Trois choses ont changé dans cette version
La première concerne ce que le modèle accepte en entrée. Les modèles du monde antérieurs voulaient surtout une seule image. La version 1.5 prend une seule image, un ensemble d'images, un panorama ou une vidéo. C'est important car cela définit le point d'entrée. Une seule photo constitue un point de départ accessible au grand public. Les ensembles multi-images et les vidéos existantes sont ce qu'une équipe de cinéma ou de publicité a déjà sous la main, et les accepter élargit le nombre de personnes pouvant utiliser l'outil.
La deuxième est l'exploration en temps réel. Une fois dans l'espace généré, vous pouvez continuer à déplacer le point de vue, contourner les occlusions et atteindre des zones qui n'étaient pas dans l'image initiale. À chaque changement de point de vue, le modèle doit combler les parties de la scène jusque-là invisibles, et le faire de manière cohérente avec ce que vous avez déjà vu. C'est un problème plus difficile que de générer un joli clip, car on demande au modèle de maintenir un modèle mental d'un lieu plutôt qu'une séquence d'images.
La troisième est la cohérence spatio-temporelle, qui est la véritable ligne de démarcation entre un modèle du monde et un générateur vidéo. Si la caméra quitte une pièce et y revient, la pièce ne devrait pas s'être réorganisée. InSpatio affirme avoir renforcé cet aspect dans la 1.5 pour prendre en charge des chemins d'exploration plus longs et des scènes plus complexes, et la démo s'appuie sur cette affirmation en revisitant à plusieurs reprises des zones sous de nouveaux angles.
Les chiffres derrière la démo
InSpatio décrit le modèle comme compact, avec 1,3 milliard de paramètres, et rapporte un score de 68,72 sur WorldScore-Dynamic, ce qui, selon l'entreprise, le classe premier parmi les méthodes interactives en temps réel évaluées, avec jusqu'à 24 images par seconde. Ce sont les chiffres de l'entreprise elle-même, et la reproduction indépendante reste limitée, donc à considérer comme un point de départ plutôt qu'un résultat établi.
L'approche technique comporte quelques éléments mobiles qu'il vaut la peine de nommer. Pour les entrées vidéo, le pipeline utilise Depth Anything 3 pour estimer la profondeur manquante ainsi que les paramètres intrinsèques et extrinsèques de la caméra pour chaque image, ce qui lui permet de reconstruire une scène à partir de séquences qui n'ont pas été tournées comme une capture 3D. Un processus autorégressif spatio-temporel maintient un état persistant du monde à mesure que la vue change, plutôt que de régénérer la scène à partir de zéro à chaque fois.
Là où une scène parcourable gagne sa place
L'usage le plus immédiat est celui que la démo met en avant. Au cinéma et dans la publicité, une position de caméra est généralement verrouillée au moment du tournage. Si vous voulez un autre angle, vous tournez à nouveau, et les reprises coûtent cher. Un modèle du monde permet à une équipe de continuer à chercher des positions de caméra après coup, en extrayant des plans de couverture de séquences déjà existantes. InSpatio cite le bullet-time publicitaire comme exemple direct : au lieu de synchroniser un ensemble de caméras autour d'un sujet, vous fournissez un ensemble d'images et concevez un nouveau trajet de caméra autour du même sujet.
Le deuxième usage concerne les données d'entraînement pour les robots. Un problème en IA incarnée est que la plupart des vidéos fournies par Internet sont tournées à la troisième personne, alors qu'un robot perçoit le monde à la première personne. InSpatio affirme que le modèle peut prendre des séquences à la troisième personne d'une opération et prédire une vue à la première personne plus proche de ce qu'un robot percevrait, et peut réobserver le même processus sous différentes directions avec des relations d'occlusion modifiées. Si cela fonctionne à grande échelle, c'est un moyen de transformer la vidéo disponible en matériel d'entraînement pour les robots sans tourner de nouvelles séquences pour chaque environnement.
Au-delà de ces usages, l'entreprise vise le tourisme et les expériences culturelles, les jumeaux numériques et la simulation industrielle, les domaines où un espace qui se comporte comme un espace est plus utile qu'une image qui y ressemble.
Une course très disputée, avec différentes définitions de la victoire
InSpatio n'est pas seul à poursuivre cet objectif, et les approches concurrentes ne s'accordent pas sur la finalité même d'un modèle du monde. Certains laboratoires optimisent pour un rendu cinématographique, générant une minute de séquences magnifiquement cohérente avec un seul mouvement de caméra narratif. D'autres recherchent l'interactivité, en privilégiant la capacité à se déplacer librement et à faire réagir la scène sans trajet fixe. Un troisième camp, plus proche du jeu vidéo, veut des moteurs en temps réel qui gardent un monde en mémoire comme un lieu navigable.
Ces objectifs tirent dans des directions différentes. Un modèle du monde réglé pour la qualité cinématographique peut se permettre de dépenser du calcul sur une séquence prédéterminée et de faire en sorte que chaque image soit parfaite. Un modèle réglé pour l'interaction doit rendre ce que l'utilisateur regarde ensuite, ce qui pousse vers la vitesse et vers une mémoire de la scène qui survive à un mouvement arbitraire. InSpatio-World 1.5 se situe clairement dans le camp interactif, et son choix d'un petit modèle de 1,3 milliard de paramètres est un pari que rester en temps réel compte plus que gagner un concours de beauté sur image fixe.
La comparaison qui compte pour les acheteurs est celle avec les autres systèmes navigables, et ici le domaine est encore assez jeune pour que la plupart des affirmations soient autodéclarées. Un benchmark comme WorldScore-Dynamic tente de mettre un chiffre sur la partie insaisissable : le monde reste-t-il cohérent lorsque vous le traversez. Mais un benchmark ne mesure que ce que ses concepteurs ont choisi de mesurer. La cohérence sur une longue exploration, la fidélité à la photo d'origine et la fréquence d'images tirent toutes dans des directions opposées, et chaque système fera des compromis différents.
C'est la vraie raison de suivre cette publication ouverte. Quand des dizaines de chercheurs testeront le modèle sur leurs propres entrées, l'image de ce qui tient et de ce qui casse sera bien plus utile que la démo de lancement, et elle permettra au reste du domaine de comparer les approches sur un terrain commun plutôt que sur des bandes démo concurrentes.
Pourquoi l'open source relève de la stratégie, pas du cadeau
InSpatio a publié le code en même temps que le modèle, et laisse entrevoir un nouveau Topos-Pro 1.0 pour des tests sur invitation. Le raisonnement est celui qui revient dans toute l'intelligence spatiale : les applications utiles sont dispersées entre le cinéma, le tourisme, la robotique et les jumeaux numériques, et aucune entreprise seule ne peut toutes les couvrir. Publier la capacité de base permet aux chercheurs de vérifier les limites et aux partenaires de construire la couche verticale par-dessus. C'est une façon d'être le rez-de-chaussée plutôt que tout l'immeuble.
Le risque est le risque habituel d'une publication ouverte précoce. La démo est impressionnante et le benchmark est autodéclaré, et l'écart entre une démo contrôlée et un outil qui tient sur une entrée réelle désordonnée est souvent large. Les prochains mois, lorsque des chercheurs et créateurs indépendants auront le code en main, montreront quelles parties de la promesse survivent au contact des données des autres.
Articles associés
Un semi-humanoïde à roues a terminé une heure de lessive sans aide
Des tâches individuelles peuvent réussir alors qu'un flux de travail échoue encore. Dyna a changé la métrique.
LTX 2.5 veut transformer votre brouillon Blender en un plan finalisé
En texte-vidéo, vous ne contrôlez pas ce qui se passe. Cet outil tente d'y remédier.
ServiceNow transforme les échecs des agents en données d'entraînement
La génération sans vérification est du bruit. Les portes sont le produit.
Un seul cadre pour le langage et la vision : le modèle ouvert 1,6B d’Horizon
Un pari : les ponts entre le langage et la vision n’ont jamais été nécessaires.