L'Atlas de Fei-Fei Li transforme une photo en une pièce dans laquelle on peut marcher

World Labs a mis Atlas en accès anticipé le 1er septembre. L'entreprise, cofondée par Fei-Fei Li, le présente comme un modèle de monde omni au service de l'intelligence spatiale, et la démonstration consiste en quelques photos ordinaires d'une pièce prises au téléphone en entrée, et en une scène 3D interactive en sortie. On peut y déplacer une caméra virtuelle partout. On peut en lire la profondeur. On peut transmettre la géométrie à un robot et l'utiliser comme lieu d'entraînement.
Li soutient depuis des années que la prochaine frontière de l'IA n'est pas le langage mais le monde physique. Son terme est celui d'intelligence spatiale, et l'idée est qu'un modèle entraîné uniquement sur du texte et des images plates passe à côté de quelque chose de fondamental. Les modèles de langage décrivent un monde qu'ils ne peuvent pas voir. Atlas est la tentative la plus claire à ce jour d'en construire un qui le peut.
Ce que fait Atlas
World Labs décrit Atlas comme un transformer de diffusion autorégressif multimodal, une architecture unique qui absorbe du texte, des images, de la vidéo et des données 3D dans un même cadre spatial et génère à travers ce même ensemble. Les sorties sont plus larges que celles d'un générateur vidéo : des images et des vidéos à caméra contrôlée jusqu'à 1440p pour des clips d'environ une minute, ainsi que des points de vue inédits, des cartes de profondeur, des nuages de points et des splats gaussiens 3D.
C'est la sortie volumétrique qui distingue Atlas d'un modèle texte-vers-vidéo. Un générateur vidéo prédit l'image suivante. Il ne sait pas nécessairement où se trouve chaque chose dans l'espace, ni à quoi ressemble une scène depuis un angle que la caméra n'a jamais occupé. Atlas porte une représentation 3D interne, si bien qu'un environnement tient debout lorsqu'un spectateur le traverse. La différence entre un clip plausible et un espace navigable, c'est tout l'enjeu de l'appeler un modèle de monde.
À partir d'une entrée parcellaire — dans certaines démonstrations, quelques images de vidéo tournée au téléphone — le modèle reconstruit une scène suffisamment fidèlement pour y placer une caméra virtuelle. World Labs rapporte une erreur de reconstruction à vues éparses de 25,3, en dessous du meilleur modèle spécialisé à 28,7. Dans des évaluations à l'aveugle qu'elle a commandées, des évaluateurs humains ont préféré le respect par Atlas d'un mouvement de caméra demandé à celui de MiniMax H3 dans 75 % des cas, à Gemini Omni Flash dans 81 %, et à Seedance 2.5 dans 94 %.
Ce sont les chiffres de l'entreprise elle-même, issus d'évaluations qu'elle a menées, et il vaut la peine de le dire clairement. Atlas est en accès anticipé, donc personne en dehors du groupe de partenaires ne peut encore les reproduire.
Du réel à la simulation, et pourquoi les robots s'y intéressent
Les applications commerciales évidentes sont les effets visuels, le jeu vidéo et la production virtuelle. Un cinéaste peut recomposer un plan après le tournage. L'angle sur lequel World Labs insiste, cependant, c'est la robotique.
Ce flux de travail s'appelle le real-to-sim. On capture la vidéo d'un espace réel, et Atlas la convertit en une simulation 3D où un robot peut être entraîné ou testé sans le coût ni le risque d'exploiter l'original. Une équipe de robotique qui veut mille variantes d'une allée d'entrepôt peut scanner l'allée une fois et générer les variantes au lieu de filmer chacune d'elles.
C'est un point de douleur étroit mais bien réel. Les données d'entraînement pour les robots coûtent cher, car les collecter suppose de faire fonctionner des robots. La simulation est bon marché, mais elle exige généralement que quelqu'un construise l'environnement à la main, ce qui est lent et souvent sans rapport avec le lieu réel. Un modèle qui transforme une pièce réelle en fichier de simulation fait tenir deux étapes coûteuses en une seule. Cela explique aussi pourquoi Nvidia et AMD figurent parmi les investisseurs. Les deux vendent la puissance de calcul sur laquelle reposent l'entraînement et la simulation.
Le problème de la transparence
Il y a un écart entre l'ambition et les traces écrites. World Labs n'a publié aucun article de recherche, aucune fiche de modèle, aucun nombre de paramètres et aucun chiffre sur le calcul d'entraînement en même temps qu'Atlas. Elle n'a divulgué ni prix ni date de disponibilité générale. Pour un système qui avance des comparaisons face à des concurrents bien documentés, cette omission est inhabituelle, et elle rend les résultats des évaluations à l'aveugle impossibles à vérifier.
Les sceptiques ont soulevé une question plus incisive : Atlas simule-t-il véritablement le monde, ou en produit-il des vues convaincantes ? Ce sont deux capacités différentes, et la distinction compte pour tout cas d'usage qui dépend de la physique. Un modèle qui restitue une pièce sous un nouvel angle est utile pour un film. Un modèle dans lequel un robot apprend à se déplacer a besoin que les objets s'y comportent comme des objets, sinon la politique apprise ne fonctionne que dans le modèle.
World Labs indique qu'Atlas alimentera les futures versions de Marble, son produit existant. Cela lui donne un débouché commercial, ce dont la plupart des annonces de recherche sont dépourvues. Savoir si la géométrie tient la route au-delà de démos soigneusement choisies est ce que les partenaires de l'accès anticipé découvriront en premier.
Le pendant chinois
Atlas n'est pas le seul modèle de monde à ambitionner l'échelle d'une ville. Le 10 septembre, l'entreprise chinoise de cartographie Amap a publié ABot-Earth 0.7, qu'elle présente comme le premier modèle de monde urbain 3D natif au monde. Il prend une image satellite ou une description textuelle et la transforme en une scène 3D interactive et explorable, générant à plusieurs échelles, d'une planète jusqu'à un point de repère au niveau de la rue, au sein d'un seul modèle. Amap affirme pouvoir produire une scène urbaine 3D à l'échelle du kilomètre en une dizaine de minutes sur un GPU grand public, au format de splatting gaussien 3D, et que cette capacité tourne déjà dans son produit Flight Street View.
Les deux visent la même idée par des extrémités opposées. Atlas part de quelques photos et remonte, reconstruisant une pièce avec une grande fidélité. ABot-Earth part de données satellites et descend, générant une ville à grande échelle. Ensemble, ils esquissent l'étendue que peut couvrir un modèle spatial, et ils montrent aussi à quel point les deux marchés ne livrent pas de la même façon : l'un via un programme partenaire sans benchmarks publics, l'autre intégré à un produit grand public où chacun peut examiner le résultat.
Ce que les modèles spatiaux doivent encore prouver
Le domaine a de l'élan. V-JEPA 2 de Meta a été entraîné sur plus d'un million d'heures de vidéo. Genie 2 de Google génère des environnements 3D interactifs, et Gemini Robotics travaille sur le raisonnement et la manipulation dans l'espace physique. L'argument de Li — la géométrie et la perspective doivent être natives du modèle plutôt qu'inférées à partir du texte — est passé d'une position de recherche à une catégorie de produits.
Ce qu'aucun d'eux n'a tranché, c'est de savoir si un modèle qui produit une géométrie cohérente équivaut à un modèle qui comprend un espace physique. La reconstruction est mesurable. La simulation est plus difficile, et c'est elle dont la robotique a réellement besoin. Atlas plaide fortement pour la première. Les résultats des partenaires au cours de l'année à venir détermineront quelle part de la seconde l'accompagne.
Pour les designers et les développeurs, l'effet à court terme est plus modeste que ne le suggère le discours de lancement. Un outil qui reconstruit une pièce à partir de trois photos et permet d'y faire voler une caméra est réellement utile, et il apparaîtra dans les logiciels créatifs avant d'apparaître dans un robot. C'est ainsi que les modèles spatiaux atteindront la plupart des gens d'abord : par le travail de création d'une scène plutôt que par celui de la parcourir.
Articles associés
Step 5 a sauté quatre numéros de version, s'est hissé au deuxième rang des modèles ouverts, et personne ne l'appelle
La position dans les benchmarks est un signal que les producteurs utilisent pour juger un modèle. Le volume d'appels est un signal que les consommateurs produisent en l'utilisant.
Gemini Omni 1.1 Flash a enchaîné quatre requêtes en un plan de 40 secondes. Le workflow est le produit.
Google a livré un pipeline de production avec une étape de validation intégrée à la tarification.
Microsoft réduit la latence des transcriptions partielles à 100 millisecondes. Cela change la vocation de la transcription.
En dessous de 100 millisecondes, un produit de transcription peut répondre pendant que quelqu'un parle encore.
Synthesia a passé une décennie à filmer des avatars. Aujourd'hui, elle veut qu'ils lui répondent.
Un outil de formation que les gens répètent volontairement est un produit différent de celui qu'ils terminent parce qu'on le leur a assigné.