← Volver al blog
Newsaprox. 7 min de lectura

Siete universidades publican OpenWAM en código abierto: los robots no solo necesitan «ver», también «predecir el siguiente segundo»

Publicado 6 oct 2026
Siete universidades publican OpenWAM en código abierto: los robots no solo necesitan «ver», también «predecir el siguiente segundo»

A principios de octubre, un equipo formado por investigadores de siete universidades, entre ellas la Universidad Nacional de Singapur, la Universidad de Tsinghua y la Universidad de Pekín, publicó OpenWAM en GitHub y Hugging Face. La definición del proyecto es clara: una pila completa de investigación de código abierto orientada a los modelos de acción del mundo (World Action Model, WAM), además de un modelo base. El artículo ya está en arXiv, con el número 2609.07398, y el repositorio tenía alrededor de 940 estrellas para el 1 de octubre.

La noticia no tardó mucho en circular en China, pero lo que realmente merece una segunda mirada es el viejo problema que busca resolver: a un robot no le basta con reconocer lo que tiene delante.

Los simuladores tradicionales calculan la física y la visión por separado

En el pasado, para hacer políticas robóticas había dos caminos habituales. Uno era aprender simultáneamente las regularidades visuales y las señales de control directamente de demostraciones robóticas; el otro era preentrenar primero con imágenes y texto para incorporar conocimiento semántico y lingüístico, es decir, la ruta VLA.

Los modelos de acción del mundo tomaron un tercer camino: primero heredan de un preentrenamiento de generación de video el prior de «cómo cambiará el mundo» y, después, mediante experiencia encarnada, aprenden «qué hacer en ese mundo». Suena a un rodeo, pero evita la vieja grieta entre simulación y robot real. En los simuladores tradicionales, la física y la visión suelen calcularse por separado, y el efecto de una acción no coincide con lo que se ve en pantalla; el enfoque de OpenWAM hace que el modelo aprenda directamente de los datos «cómo una acción cambia el mundo» y, a partir de ello, prediga la posición de los objetos, la semántica de la escena y el estado de la tarea.

Dividido en tres capas para que los experimentos sean reproducibles

El equipo dividió el problema en tres capas, cada una correspondiente a un componente.

OpenWAM-Infra es una infraestructura modular que desacopla cuatro capas: modelos componibles, entorno de ejecución de entrenamiento, entorno de ejecución de despliegue y protocolos de evaluación. La función de esta capa es transformar el modelo de acción del mundo, de una implementación única fuertemente acoplada, en un banco de pruebas con piezas intercambiables.

OpenWAM-Study se encarga de destilar las reglas de diseño. No construye modelos, sino experimentos controlados: mediante una serie de comparaciones convierte «qué diseño funciona» en conclusiones reproducibles.

OpenWAM-α es el modelo base en sí, y valida todo el esquema con videos en primera persona de humanos a gran escala y datos de robots.

Tres principios de diseño, cada uno con cifras de control

Este tipo de artículos teme, sobre todo, quedarse en consignas. Las tres conclusiones que presenta OpenWAM vienen acompañadas de experimentos comparativos.

La primera: se necesita un prior generativo del mundo suficientemente fuerte. El backbone de video de 14B alcanzó 93.79%, mientras que el de 1.3B solo llegó a 90.14%; la configuración predeterminada eligió 5B, apenas 1.4 puntos porcentuales por debajo de 14B. Combinado con un espacio latente visual compacto comprimido por DINOv3 y S-VAE, el efecto se acerca al VAE propio de Wan2.2.

La segunda: durante el entrenamiento debe establecerse un flujo de información claro del mundo a la acción. Al hacer que «el flujo de acción vea el flujo del mundo», la precisión fue del 92.39%; al cambiarlo por una máscara aislada, solo del 87.41%, una diferencia de 5 puntos porcentuales enteros. En inferencia, la eliminación conjunta de ruido sincronizada dio el mejor resultado.

La tercera: los datos deben usarse según su fuente. Los datos de robots se encargan de preservar el grounding de las acciones; los videos en primera persona de humanos, de ampliar la cobertura del mundo; y el entrenamiento colaborativo de una sola etapa integra ambos. Curiosamente, dentro del dominio de preentrenamiento la mejora fue limitada, pero la tasa de éxito fuera de distribución (OOD) subió del 14.50% al 26.62%.

Especificaciones reales del modelo base

OpenWAM-α se compone de dos partes: Wan2.2-TI2V-5B como flujo de video, más un DiT de acción de 1B. El espacio de acción se unifica en 80 dimensiones y es compatible con 17 plataformas físicas. Los datos de preentrenamiento suman 14,300 horas, de las cuales el 30% son videos en primera persona de humanos, el 30% datos sintéticos y el 40% datos reales.

Una hoja en blanco de registro de experimentos sobre un banco de carpintería de madera clara, junto a tres componentes de articulación de metal pulido en fila

En cuanto a la velocidad de inferencia, un solo bloque de acción tarda 170 milisegundos en una RTX 5090. La evaluación abarca 8 benchmarks de simulación como LIBERO, RoboTwin2.0 y RoboDojo, con morfologías que van desde un brazo y dos brazos hasta manipulación móvil y manos diestras. En la categoría de dos brazos móviles de EBench, actualmente es el mejor, con una ventaja de unos 4 puntos porcentuales sobre el segundo. En validación con robot real, se ejecutaron seis tareas con un brazo único Franka, con una tasa de éxito promedio del 82.5%, superior al 77.5% de LingBot-VA y al 55.0% de π0.5, y en dos de ellas alcanzó el 100%. Al cambiar a una mano diestra que no había visto durante el entrenamiento, tras el ajuste fino también superó de forma integral a π0.5.

No declara que VLA haya quedado fuera de juego

Hay una conclusión en el artículo que merece destacarse por separado: WAM, al supervisarse con variables latentes de video futuro, se ajusta mejor dentro de la distribución; VLA es más robusto ante perturbaciones fuera de distribución. La contienda entre ambos aún no está decidida.

Esta frase es mucho más honesta que «tal paradigma ha muerto». Quienes leen el artículo tienden a recordar solo las puntuaciones, pero lo que más deberían recordar es esto: las dos rutas tienen ahora sus propias fortalezas y todavía no ha llegado el momento de dar un veredicto definitivo.

El umbral se baja un escalón

Visto en un contexto más amplio, en la línea de los modelos del mundo, Gemini Robotics 2 de Google proclamó «un cerebro, válido para cualquier robot», y Jim Fan, de Nvidia, lanzó que «VLA ha muerto; ha llegado la era de los modelos de acción del mundo». El 3 de octubre, Nvidia amplió además su pila abierta de IA física y publicó juntos el modelo del mundo Cosmos, Isaac Lab Arena, Alpamayo para conducción autónoma, la herramienta de orquestación OSMO y la biblioteca OpenUSD; Caterpillar, LEM Surgical y Neura Robotics se convirtieron en sus primeros usuarios. El 4 de octubre, varios robots humanoides de Deep Robotics, con sede en Hangzhou, Zhejiang, salieron a la calle para probar la regulación del tráfico en intersecciones y la consulta de visitantes, incluso bajo la lluvia.

Con semejante densidad de avances, que universidades abran la base de pila completa equivale a bajar un escalón el umbral de entrada a esta dirección, y hace que «aprender el mundo con video y aprender las acciones con trayectorias» sea una ruta más abierta al público.

No está pensado para desplegarse directamente

Hay que dejar claro que OpenWAM se posiciona como infraestructura de investigación, no como un producto listo para usar. El README oficial recomienda preparar unos 640 GB de datos de entrenamiento; el entorno ocupa aproximadamente 6.5 GB, y el repositorio sigue cambiando activamente. Es adecuado para equipos que ya tienen GPU y datos y quieren investigar modelos de acción del mundo sobre esta base; no lo es para escenarios de implementación a pequeña escala.

Los puntos de observación que merecen seguirse después también son concretos: qué tan alta será la tasa de reproducción de este lote, cuánta gente seguirá enviando mejoras al repositorio medio año después, y si algún equipo realmente lo ajustará finamente para incorporarlo a su línea de productos. El revuelo del día del lanzamiento se disipará; lo que queda es el código que sigue en uso.

Artículos relacionados