El Atlas de Fei-Fei Li convierte una foto en una habitación por la que puedes caminar

World Labs puso Atlas en acceso anticipado el 1 de septiembre. La empresa, cofundada por Fei-Fei Li, lo describe como un modelo del mundo omni para la inteligencia espacial, y la demostración consiste en que entran unas cuantas fotos corrientes de móvil de una habitación y sale una escena 3D interactiva. Puedes mover una cámara virtual a cualquier punto. Puedes extraer profundidad de ella. Puedes entregar la geometría a un robot y usarla como un lugar para practicar.
Li lleva años sosteniendo que la próxima frontera de la IA no es el lenguaje, sino el mundo físico. Su término es inteligencia espacial, y la afirmación es que a un modelo entrenado solo con texto e imágenes planas le falta algo fundamental. Los modelos de lenguaje describen un mundo que no pueden ver. Atlas es el intento más claro hasta ahora de construir uno que sí pueda.
Qué hace Atlas
World Labs describe Atlas como un transformer de difusión autorregresivo multimodal, una única arquitectura que recibe texto, imágenes, vídeo y datos 3D dentro de un mismo marco espacial y genera a través del mismo conjunto. Sus resultados son más amplios que los de un generador de vídeo: imágenes y vídeo controlados por cámara de hasta 1440p para clips de aproximadamente un minuto, además de puntos de vista novedosos, mapas de profundidad, nubes de puntos y splats gaussianos 3D.
La salida volumétrica es lo que lo separa de un modelo de texto a vídeo. Un generador de vídeo predice el siguiente fotograma. No necesariamente sabe dónde se sitúa cada cosa en el espacio ni cómo se ve una escena desde un ángulo que la cámara nunca ocupó. Atlas porta una representación 3D interna, de modo que un entorno se mantiene coherente mientras un espectador se mueve por él. La diferencia entre un clip plausible y un espacio navegable es justamente lo que lleva a llamarlo modelo del mundo.
A partir de una entrada dispersa, en algunas demostraciones solo unos pocos fotogramas de vídeo grabado con el móvil, el modelo reconstruye una escena lo bastante bien como para colocar una cámara virtual dentro de ella. World Labs informa de un error de reconstrucción con vistas dispersas de 25,3, por debajo del mejor modelo especializado, con 28,7. En evaluaciones ciegas que encargó, los evaluadores humanos prefirieron la adherencia de Atlas a un movimiento de cámara solicitado frente a MiniMax H3 el 75 % de las veces, Gemini Omni Flash el 81 % y Seedance 2.5 el 94 %.
Son cifras de la propia empresa, procedentes de evaluaciones que ella misma realizó, y conviene decirlo sin rodeos. Atlas está en acceso anticipado, así que nadie fuera del grupo de socios puede reproducirlas todavía.
Real-to-sim, y por qué les importa a los robots
Las aplicaciones comerciales obvias son los efectos visuales, los videojuegos y la producción virtual. Un cineasta puede montar un plano después del rodaje. Sin embargo, el enfoque en el que insiste World Labs es la robótica.
El flujo de trabajo se llama real-to-sim. Capturas vídeo de un espacio real y Atlas lo convierte en una simulación 3D donde se puede entrenar o probar un robot sin el coste y el riesgo de operar con el objeto real. Un equipo de robótica que quiera mil variaciones de un pasillo de almacén puede escanear el pasillo una vez y generar las variaciones en lugar de filmarlas todas.
Es un punto de dolor concreto pero real. Los datos de entrenamiento para robots son caros porque recopilarlos implica operar robots. La simulación es barata, pero normalmente requiere que alguien construya el entorno a mano, lo cual es lento y a menudo no se parece en nada al lugar real. Un modelo que convierte una habitación real en un archivo de simulación reduce dos pasos caros a uno. También explica por qué Nvidia y AMD son inversores. Ambos venden la capacidad de cómputo sobre la que se ejecutan el entrenamiento y la simulación.
El problema de la divulgación
Hay una brecha entre la ambición y el rastro documental. World Labs no publicó ningún artículo de investigación, ninguna ficha de modelo, ningún recuento de parámetros ni ninguna cifra de cómputo de entrenamiento junto con Atlas. No reveló precio ni fecha de disponibilidad general. Para un sistema que hace afirmaciones comparativas frente a competidores bien documentados, esa omisión es inusual, y hace imposible verificar los resultados de las evaluaciones ciegas.
Los escépticos han planteado una pregunta más incisiva: si Atlas simula genuinamente el mundo o representa vistas convincentes de él. Son capacidades distintas, y la distinción importa para todos los casos de uso que dependen de la física. Un modelo que representa una habitación desde un ángulo nuevo es útil para una película. Un modelo por el que un robot aprende a caminar necesita que los objetos que contiene se comporten como se comportan los objetos, o la política aprende algo que solo funciona en el modelo.
World Labs dice que Atlas impulsará futuras versiones de Marble, su producto existente. Eso le da un encaje comercial, más de lo que tienen la mayoría de los anuncios de investigación. Si la geometría se sostiene más allá de las demos seleccionadas es lo que los socios de acceso anticipado descubrirán primero.
La contraparte china
Atlas no es el único modelo del mundo con una ambición del tamaño de una ciudad. El 10 de septiembre, la empresa china de cartografía Amap lanzó ABot-Earth 0.7, que describe como el primer modelo de mundo urbano nativo en 3D del mundo. Toma imágenes de satélite o una descripción de texto y las convierte en una escena 3D interactiva y transitable, generando a múltiples escalas, desde un planeta hasta un punto de referencia a pie de calle, dentro de un mismo modelo. Amap afirma que puede producir una escena urbana 3D a escala de un kilómetro en unos diez minutos en una GPU de consumo, en el formato de splatting gaussiano 3D, y que la capacidad ya funciona en su producto Flight Street View.
Los dos apuntan a la misma idea desde extremos opuestos. Atlas trabaja de abajo hacia arriba a partir de un puñado de fotos, reconstruyendo una habitación con alta fidelidad. ABot-Earth trabaja de arriba hacia abajo a partir de datos satelitales, generando una ciudad a escala. Juntos esbozan el alcance que puede cubrir un modelo espacial, y también muestran lo diferente que llegan al mercado los dos: uno mediante un programa de socios sin benchmarks públicos, el otro integrado en un producto de consumo donde cualquiera puede ver el resultado.
Lo que los modelos espaciales aún tienen que demostrar
El campo tiene impulso. V-JEPA 2 de Meta se entrenó con más de un millón de horas de vídeo. Genie 2 de Google genera entornos 3D interactivos, y Gemini Robotics trabaja en razonamiento y manipulación en el espacio físico. El argumento de Li, según el cual la geometría y la perspectiva tienen que ser nativas del modelo en lugar de inferirse del texto, ha pasado de ser una postura de investigación a una categoría de producto.
Lo que nada de esto ha resuelto es si un modelo que produce geometría coherente es lo mismo que un modelo que entiende un espacio físico. La reconstrucción es medible. La simulación es más difícil, y es la que la robótica realmente necesita. Atlas presenta un argumento sólido a favor de lo primero. Los resultados de los socios durante el próximo año decidirán cuánto de lo segundo viene con ello.
Para diseñadores y desarrolladores, el efecto a corto plazo es más modesto de lo que sugiere el lenguaje del lanzamiento. Una herramienta que reconstruye una habitación a partir de tres fotos y te permite hacer volar una cámara por ella es genuinamente útil, y aparecerá dentro del software creativo antes que dentro de un robot. Así es como los modelos espaciales llegan primero a la mayoría de la gente: a través del trabajo de crear una escena, no del trabajo de recorrerla.
Artículos relacionados
Las herramientas de video con IA obtienen un 9 sobre 10 en facilidad de uso. La puntuación de cumplimiento es otra historia.
Los usuarios adoran los generadores de video con IA. A los departamentos legales todavía no se les ha preguntado.
InternLumina-U2 pone texto, imágenes, video y 3D en un único modelo de 16B y luego distribuye dos conjuntos de pesos
La lista de tareas es ambiciosa. El formato de publicación transmite más señal.
HappyOyster vende un mundo en el que puedes entrar, no un clip que solo miras
La mayoría de los modelos de video te entregan un archivo. Este te entrega una habitación con una puerta.
Luma Ray3 Modify conserva la actuación y renegocia el mundo a su alrededor
El problema más difícil de la edición de video con IA no es el efecto. Es no arruinar la toma que ya pagaste.