Agora-2 defiende que un modelo del mundo es una máquina multijugador

Odyssey lanzó Agora-2 el 25 de septiembre y lo describió con una frase que merece detenerse a considerar: un motor de juego aprendido. No un generador de vídeo que da la casualidad de que acepta entrada. Un motor que predice cómo las acciones de todos en un espacio compartido cambian el estado de ese espacio.
La vista previa de investigación jugable es pequeña a propósito. Cuatro humanos contra dieciséis agentes, en un entorno compartido que admite hasta veinte participantes en total. No es una escala de producto. Es la configuración mínima donde aparece el problema interesante.
Un clip no es un mundo
La mayoría de los modelos de vídeo responden a una pregunta: ¿cómo deberían verse los siguientes fotogramas? Se les da un prompt o un primer fotograma, se espera y se obtiene un resultado que se puede ver. No hay ningún estado que mantener, porque nada de lo que haga el espectador cambia nada.
Un modelo del mundo tiene que responder a una pregunta más difícil. Dado el estado actual y las acciones de todos los que están en él, ¿en qué se convierte el estado? Eso implica mantener una representación coherente del entorno a lo largo del tiempo y actualizarla en tiempo real a medida que llegan las entradas. Cuando solo una persona se mueve por una escena, se puede simular gran parte de esto. La cámara va adonde va la cámara, y el modelo solo tiene que mantener el mundo creíble a lo largo de un único recorrido.
Añadir personas rompe la ilusión de maneras útiles. Dos participantes pueden querer cosas incompatibles. Uno bloquea una puerta que el otro necesita. Uno lanza algo que cae en un lugar que cambia lo que puede hacer un tercero. El estado ya no es un recorrido por una escena. Es un objeto compartido en el que varios actores escriben a la vez, y el modelo tiene que resolver esas escrituras como lo haría un motor de físicas, salvo que no hay motor. Hay una red neuronal que predice el siguiente estado.

Por eso dieciséis agentes contra cuatro humanos es la prueba específica que eligió Odyssey. Los agentes son baratos de generar, actúan de forma continua y harán cosas que a un probador humano no se le ocurriría intentar. Si el modelo solo parece plausible desde un punto de vista que se mueve a ritmo humano, un pequeño enjambre encontrará la costura en cuestión de minutos.
Los motores aprendidos son la apuesta interesante
Los videojuegos llevan décadas simulando estado compartido. La diferencia está en cómo se produce ese estado. Un motor convencional tiene código que define qué ocurre cuando dos objetos colisionan, cómo viaja un proyectil y qué hace una superficie bajo los pies. Las reglas están escritas, así que el resultado es determinista y barato de calcular. La mayor parte del trabajo se dedica al contenido, no a decidir qué es verdad.
Un motor aprendido sustituye las reglas por un modelo que predice resultados a partir de ejemplos. Eso invierte la estructura de costes. Ya no escribes qué ocurre cuando se bloquea una puerta, porque el modelo ha visto suficientes puertas bloqueadas como para inferirlo. Lo que sacrificas es la certeza. Un motor escrito no alucina una pared que no estaba ahí. Uno aprendido sí puede hacerlo, y en una sesión compartida ese error no se queda en la pantalla de un espectador. Todos ven la misma pared equivocada, lo cual es un mundo compartido o un error compartido según si el modelo adivinó lo que querías.
Conseguir un comportamiento en tiempo real sobre eso es la otra parte difícil. Predecir el siguiente estado una vez es un problema de investigación. Predecirlo lo bastante rápido como para que cuatro personas con mandos no noten que están esperando a la inferencia es un problema de sistemas, y es el que decide si algo así llega a convertirse en producto.
Para qué sirve realmente la vista previa
Publicar una vista previa jugable en lugar de un vídeo de demostración es un movimiento deliberado. Una demo muestra el modelo en su mejor momento en un recorrido elegido por los creadores. Una vista previa con participantes reales, incluido un enjambre de agentes, genera los casos de fallo que el equipo necesita y que no puede imaginar fácilmente.
También pone a prueba lo que un benchmark no puede medir. Normalmente se juzga a los modelos del mundo por lo convincente que parece un minuto generado. Esa métrica no dice casi nada sobre si el entorno se mantiene coherente cuando alguien hace algo inesperado, o sobre si dos participantes que no están de acuerdo sobre el estado obtienen la misma respuesta.
La mitad del experimento dedicada a los agentes es la elección más reveladora. Las instituciones que entrenan robots y agentes de software necesitan entornos donde muchos actores interactúen a la vez, y en su mayoría los construyen a mano o reutilizan motores de juego que vienen con un conjunto fijo de reglas. Un modelo del mundo aprendido prometía sustituir eso, y la promesa solo cuenta si se sostiene bajo veinte escritores simultáneos. Cuatro humanos dirigiendo a dieciséis agentes es una compresión de ese problema en algo que realmente se puede observar.
Dónde encaja esto
Es fácil interpretar un motor de juego aprendido como un paso hacia juegos que se generan a sí mismos. El uso a más corto plazo es menos glamuroso y más probable: entornos para entrenar y evaluar agentes. Un modelo del mundo que puede mantener un estado compartido y responder a muchos actores a la vez es un entorno donde puedes poner a cien agentes y observar qué hacen, que es exactamente lo que necesitan los equipos que construyen software de agentes y que actualmente en su mayoría construyen a mano.
Que Agora-2 se convierta en infraestructura o en una curiosidad de laboratorio depende de los números aburridos que la vista previa no resuelve. La consistencia del estado a lo largo de sesiones largas, el coste por participante por hora y la elegancia con que maneja el caso de que un participante haga algo que el modelo nunca ha visto. El concepto de un entorno compartido y aprendido pasó este mes del papel a una versión jugable. Hacer que se sostenga bajo veinte escritores simultáneos es la parte que llevará el próximo año.
La razón para seguirlo de cerca es lo que sustituiría una versión funcional. Hoy, cualquiera que entrene un agente contra un entorno rico o bien construye a mano un simulador, que es lento y limitado, o bien toma prestado un motor de juego, que impone un conjunto fijo de reglas que el agente no puede sorprender. Un motor aprendido elimina ambas restricciones a la vez: no hay reglas que escribir y no hay techo para las situaciones que pueden surgir, porque las situaciones se generan en lugar de escribirse. La vista previa de cuatro contra dieciséis es la prueba más pequeña de esa idea que aún produce un conflicto significativo, que es el lugar correcto para empezar.
También hay un coste que la vista previa deja al descubierto. La predicción en tiempo real para veinte participantes implica ejecutar inferencia de forma continua para cada uno de ellos, y eso es lo contrario de la generación por lotes que hace que los modelos de vídeo sean asequibles hoy. Servir un mundo cuesta dinero cada segundo que está vivo, mientras que servir un vídeo cuesta dinero una sola vez. Si los entornos aprendidos se van a usar para ejecuciones de entrenamiento que duran días, la economía tiene que mejorar en órdenes de magnitud, y eso es un problema de hardware y eficiencia tanto como de modelado.
Artículos relacionados
Un semihumanoide con ruedas completó una hora de lavandería sin ayuda
Las tareas individuales pueden salir bien mientras un flujo de trabajo sigue fallando. Dyna cambió la métrica.
LTX 2.5 quiere renderizar tu tosco borrador de Blender y convertirlo en un plano terminado
No controlas lo que ocurre en el texto a vídeo. Esto intenta solucionarlo.
ServiceNow convierte los fallos de los agentes en datos de entrenamiento
La generación sin verificación es ruido. Los controles son el producto.
Un marco para lenguaje y visión: el modelo abierto de 1.6B de Horizon
Una apuesta a que los puentes entre lenguaje y visión nunca fueron necesarios.