Una foto, un mundo transitable: InSpatio-World 1.5 convierte imágenes en espacios

La mayoría de los modelos de imagen y video te dan un fotograma fijo o un clip fijo. Miras lo que el modelo decidió mostrarte. Una empresa china llamada InSpatio lanzó este mes un modelo que toma una sola foto, o un panorama, o un video existente, y lo convierte en un espacio por el que puedes moverte.
InSpatio-World 1.5 se presentó en el Shanghai International Audiovisual Arts Carnival a finales de septiembre, y la empresa publicó el código como open source bajo Apache 2.0. El video de demostración es la explicación más clara de qué es diferente. Comienza dentro del pasillo cubierto de un palacio chino. La cámara avanza, pasa una barandilla y unos escalones, y gira hacia un patio. Los pabellones que estaban ocultos detrás de las columnas aparecen a la vista a medida que cambia el punto de vista. Lo que produjo el modelo es un espacio que sigue renderizándose a medida que lo sigues explorando, en lugar de un clip con una trayectoria de cámara elegida.

Tres cosas cambiaron en esta versión
Lo primero es lo que el modelo acepta como entrada. Los modelos de mundo anteriores normalmente querían una sola imagen. La versión 1.5 acepta una sola imagen, un conjunto de imágenes, un panorama o un video. Eso importa porque define el punto de entrada. Una sola foto es un punto de partida de nivel consumidor. Los conjuntos de varias imágenes y el video existente son lo que un equipo de cine o publicidad ya tiene a mano, y aceptarlos amplía quién puede usar la herramienta.
Lo segundo es la exploración en tiempo real. Una vez dentro del espacio generado, puedes seguir moviendo el punto de vista, rodear oclusiones y llegar a áreas que no estaban en el fotograma inicial. Cada vez que cambia el punto de vista, el modelo tiene que rellenar las partes de la escena que antes eran invisibles, y hacerlo de forma consistente con lo que ya has visto. Ese es un problema más difícil que generar un clip agradable, porque se le pide al modelo que mantenga un modelo mental de un lugar en lugar de una secuencia de imágenes.
Lo tercero es la consistencia espacio-temporal, que es la verdadera línea divisoria entre un modelo de mundo y un generador de video. Si la cámara sale de una habitación y vuelve, la habitación no debería haberse reordenado. InSpatio dice que reforzó esto en la versión 1.5 para admitir rutas de exploración más largas y escenas más complejas, y la demo se apoya en esa afirmación al revisitar repetidamente áreas desde nuevos ángulos.
Los números detrás de la demo
InSpatio describe el modelo como compacto, con 1.3 mil millones de parámetros, y reporta una puntuación de 68.72 en WorldScore-Dynamic, que según dice ocupa el primer lugar entre los métodos interactivos en tiempo real evaluados, a hasta 24 fotogramas por segundo. Esas son las cifras de la propia empresa, y la reproducción independiente aún es escasa, así que trátalas como un punto de partida y no como un resultado definitivo.
El enfoque técnico tiene un par de piezas móviles que vale la pena nombrar. Para las entradas de video, el pipeline utiliza Depth Anything 3 para estimar la profundidad faltante y los intrínsecos y extrínsecos de cámara por fotograma, lo que le permite reconstruir una escena a partir de material que no se rodó como una captura 3D. Un proceso autorregresivo espacio-temporal es lo que mantiene un estado persistente del mundo a medida que cambia la vista, en lugar de regenerar la escena desde cero cada vez.
Dónde una escena transitable justifica su valor
El uso más inmediato es el que señala la demo. En cine y publicidad, la posición de cámara normalmente queda fijada en el momento de rodar. Si quieres otro ángulo, vuelves a rodar, y los reshoots son caros. Un modelo de mundo permite que un equipo siga buscando posiciones de cámara después del hecho, extrayendo cobertura de material que ya existe. InSpatio destaca el bullet-time publicitario como ejemplo directo: en lugar de sincronizar un rig de cámaras alrededor de un sujeto, introduces un conjunto de imágenes y diseñas una nueva trayectoria de cámara alrededor del mismo sujeto.
El segundo uso son datos de entrenamiento para robots. Un problema en la IA encarnada es que la mayor parte del video que ofrece internet está rodado en tercera persona, mientras que un robot ve el mundo en primera persona. InSpatio dice que el modelo puede tomar material en tercera persona de una operación y predecir una vista en primera persona más cercana a lo que percibiría un robot, y puede reobservar el mismo proceso desde diferentes direcciones con las relaciones de oclusión cambiadas. Si eso funciona a escala, es una forma de convertir video disponible en material de entrenamiento para robots sin rodar nuevo material para cada entorno.
Más allá de esos, la empresa apunta a turismo y experiencias culturales, gemelos digitales y simulación industrial, los lugares donde un espacio que se comporta como un espacio es más útil que una imagen que se ve como uno.
Una carrera concurrida, con definiciones diferentes de ganar
InSpatio no es el único que persigue esto, y los enfoques competidores no coinciden en para qué sirve siquiera un modelo de mundo. Algunos laboratorios optimizan para la salida cinematográfica, generando un minuto de metraje bellamente consistente con un único movimiento de cámara narrativo. Otros persiguen la interactividad, priorizando la capacidad de moverse libremente y que la escena responda sin una trayectoria fija. Un tercer grupo, más cercano a los videojuegos, quiere motores en tiempo real que mantengan un mundo en memoria como un lugar navegable.
Esos objetivos tiran en direcciones diferentes. Un modelo de mundo ajustado para calidad cinematográfica puede permitirse gastar cómputo en una secuencia predeterminada y hacer que cada fotograma se vea bien. Uno ajustado para la interacción tiene que renderizar lo que el usuario mire a continuación, lo que empuja hacia la velocidad y hacia una memoria de la escena que sobreviva al movimiento arbitrario. InSpatio-World 1.5 está claramente en el bando interactivo, y su elección de un modelo pequeño de 1.3 mil millones de parámetros es una apuesta a que mantenerse en tiempo real importa más que ganar un concurso de belleza de fotogramas fijos.
La comparación que importa para los compradores es contra los otros sistemas navegables, y aquí el campo es tan incipiente que la mayoría de las afirmaciones son autoinformadas. Un benchmark como WorldScore-Dynamic intenta poner un número a la parte resbaladiza, si el mundo se mantiene consistente a medida que te mueves por él, pero un benchmark solo mide lo que sus diseñadores eligieron medir. La consistencia a lo largo de una exploración larga, la fidelidad a la foto original y la tasa de fotogramas tiran unas contra otras, y cada sistema elegirá compensaciones diferentes.
Esa es la verdadera razón para seguir el lanzamiento abierto. Cuando docenas de investigadores sometan el modelo a pruebas de estrés con sus propias entradas, la imagen de dónde aguanta y dónde se rompe será mucho más útil que la demo de lanzamiento, y permitirá al resto del campo comparar enfoques sobre una base compartida en lugar de sobre carretes de momentos destacados que compiten entre sí.
Por qué publicar como open source es la estrategia, no el regalo
InSpatio publicó el código junto con el modelo, y está dejando entrever un nuevo Topos-Pro 1.0 para pruebas por invitación. El razonamiento es el que aparece en toda la inteligencia espacial: las aplicaciones útiles están dispersas entre cine, turismo, robótica y gemelos digitales, y ninguna empresa puede cubrirlas todas. Publicar la capacidad base permite a los investigadores verificar los límites y a los socios construir la capa vertical encima. Es una forma de ser la planta baja en lugar del edificio entero.
El riesgo es el habitual de un lanzamiento abierto temprano. La demo es impresionante y el benchmark es autoinformado, y la brecha entre una demo controlada y una herramienta que resiste una entrada desordenada del mundo real suele ser amplia. Los próximos meses, a medida que investigadores y creadores independientes tengan acceso al código, mostrarán qué partes de la promesa sobreviven al contacto con los datos de otras personas.
Artículos relacionados
Agility Digit 5 llega con un caso de seguridad, no solo una hoja de especificaciones
El suelo de un almacén no es un laboratorio. La certificación es la puerta de entrada, no la demo.
Los agentes de frontera completaron el 30 por ciento de un flujo de trabajo de investigación. Ese es el número.
Los agentes pueden ejecutar investigación. Inventar el procedimiento sigue estando fuera de su alcance.
Figure AI aseguró 3.500 millones de dólares en cómputo antes de tener un producto que vender
La apuesta es que la generalización es un problema de cómputo. El sector aún no lo ha resuelto.
OpenAI por fin incorpora fondos transparentes a la API de imágenes
Una función pequeña que elimina todo un paso del flujo de trabajo.