← Volver al blog
Aiaprox. 8 min de lectura

La apuesta de Runway con Praxis-1: el preentrenamiento con vídeo como atajo hacia cerebros robóticos

Publicado 2 oct 2026
La apuesta de Runway con Praxis-1: el preentrenamiento con vídeo como atajo hacia cerebros robóticos

Todo programa de robótica con ambiciones serias de despliegue choca con el mismo muro, y no es un muro de hardware. Los datos del mundo real son escasos y caros de recopilar al volumen que necesita una política generalista. Para los dominios repletos de casos límite, como la conducción autónoma, la robótica doméstica y el trabajo en almacenes en entornos desordenados, no existe una forma práctica de reunir las demostraciones necesarias para entrenar un modelo capaz de manejar lo que ocurrirá en realidad.

Runway anunció Praxis-1 el 30 de septiembre, y su argumento comienza con ese muro. Praxis-1 es un modelo de acción del mundo de pesos abiertos que convierte el preentrenamiento de vídeo a gran escala de Runway en políticas de control para robots reales. La empresa lo está probando con los primeros socios Noble Machines, Standard Bots y Ultra, cada uno ejecutando el modelo en su propio hardware, con un lanzamiento público bajo pesos abiertos previsto para los próximos meses.

El vídeo como sustituto de la teleoperación

La premisa es sencilla una vez enunciada. El vídeo es prácticamente ilimitado, y lo es cada vez más a medida que los modelos generativos alcanzan la paridad con el metraje real en calidad y velocidad. Cada día la gente graba y sube más fragmentos de la vida cotidiana de los que cualquier laboratorio de robótica podría capturar mediante demostraciones teleoperadas. Si un modelo puede aprender la estructura del mundo físico a partir de ese metraje, el cuello de botella se desplaza de los escasos datos de robots al abundante vídeo general.

La afirmación que le da peso es empírica. Runway informa de que simular políticas de robots dentro de su modelo del mundo predice los resultados del mundo real con una correlación de 0,95, lo que se compara favorablemente con técnicas más costosas basadas en reconstrucción 3D. Un modelo del mundo que puede usarse como entorno de prueba fiel cambia la economía del desarrollo de políticas, porque la evaluación deja de requerir hardware físico en cada iteración.

La empresa también descubrió que el rendimiento de la política mejora a medida que aumenta la escala del vídeo en tercera persona, y extrae la conclusión de que el cuello de botella de una política capaz pasa a ser cuánto vídeo general puede usar un modelo para entrenarse. Es el mismo argumento de escalado que impulsó los modelos de lenguaje, aplicado al control motor. Una política que ya entiende la plausibilidad física y el comportamiento de los objetos a partir del preentrenamiento con vídeo parte de una posición mucho más fuerte que una construida solo con datos de acciones.

La arquitectura detrás de la apuesta

Praxis-1 se construye sobre el mismo preentrenamiento con vídeo que dio lugar a los modelos del mundo generales de Runway y a su trabajo interactivo y en tiempo real, como Solaris y la línea GWM Worlds. La lógica de ese linaje importa. Enseñar a un modelo cómo se comportan los objetos, cómo se mueven las manos y qué aspecto tiene una tarea a mitad de camino crea entornos dinámicos para entrenar agentes tanto en entornos digitales como físicos.

Runway lo presenta como una ventaja acumulativa. Cuanto más entiende el modelo cómo funciona el mundo a partir del vídeo, mejor puede controlar un robot en entornos que difieren de todo lo que vio durante el entrenamiento. El objetivo declarado es un modelo de política generalista para desarrolladores e investigadores de robótica que funcione con cualquier corporización o entorno, en lugar de una política ajustada a un brazo o una pinza concretos.

Ahí es donde entra la lectura escéptica. «Funciona con cualquier corporización» es una afirmación fuerte, y la evidencia hasta ahora proviene de tres socios nombrados que ejecutan el modelo en su propio hardware, antes de un lanzamiento más amplio. La cifra de correlación de 0,95 se mide entre la simulación dentro del modelo del mundo de Runway y los resultados del mundo real, lo que valida tanto el simulador como la política. Ambas cosas son útiles, y ambas son cifras de la propia Runway en esta etapa.

Por qué pesos abiertos, y por qué es un argumento estratégico

Runway lanza Praxis-1 con pesos abiertos en lugar de como un modelo cerrado, y el razonamiento es inusualmente explícito para una empresa que ha mantenido la mayoría de sus modelos como propietarios. El anuncio lo plantea como una cuestión de competitividad de EE. UU. en la IA física: recuperar el liderazgo en manufactura, acelerar la productividad y asegurar aliados requerirá, en palabras de Runway, un nivel de interoperabilidad y apertura por parte de los modelos estadounidenses que actualmente no existe para los casos de uso físico.

Es un argumento con sabor político, y aterriza en medio de un debate activo sobre cuánta parte del stack de IA debería ser abierta. En el caso concreto de la robótica, el argumento a favor de los pesos abiertos es más fuerte que en el de los modelos de lenguaje de frontera. Los desarrolladores de hardware necesitan ejecutar las políticas en sus propias máquinas, con sus propios sensores y actuadores, y una API en la nube que exija enviar esas señales fuera encaja mal. Los modelos del mundo abiertos dan a los fabricantes de hardware una flexibilidad y un control que no pueden obtener de un modelo alojado.

También hay una dimensión competitiva que el anuncio no declara abiertamente. Gran parte del impulso en los modelos de vídeo y del mundo de pesos abiertos ha venido de laboratorios chinos. Que una empresa estadounidense prominente lance pesos abiertos en la misma categoría se lee en parte como un intento de definir el centro de gravedad del ecosistema antes de que lo haga otro.

Una correlación de 0,95 es una cifra sólida y merece una traducción. Significa que cuando Runway ejecuta una política candidata dentro de su modelo del mundo y mide su rendimiento, el robot real se comporta casi de la misma manera. Si eso se mantiene en distintas tareas, la consecuencia práctica es que un equipo de robótica puede realizar la mayor parte de sus experimentos en simulación y reservar el hardware físico para la comprobación final. Dado lo caros y lentos que son los ensayos físicos, esa es la diferencia entre ejecutar cien iteraciones en una semana y ejecutar un puñado en un mes.

La pregunta más difícil es la generalización. El vídeo enseña a un modelo cómo es el mundo y cómo tienden a comportarse los objetos, pero un robot también necesita saber qué hacer con un brazo concreto, en una tarea concreta y con una tolerancia al fallo concreta. El argumento de Runway es que el prior entrenado con vídeo reduce la cantidad de datos específicos de la tarea necesarios para llegar hasta ahí. Es plausible, y no está demostrado a escala.

Dónde encaja esto en la carrera robótica más amplia

Praxis-1 llega en un año en el que la robótica humanoide y de manufactura ha pasado de las demostraciones a los despliegues. Figure ha estado entrenando humanoides retirados para tareas extremas. Los fabricantes de humanoides han estado firmando pilotos en fábricas con automovilísticas, y Boston Dynamics ha comenzado a probar su robot Atlas dentro de una instalación de Hyundai con planes de despliegue a gran escala para 2030. El hilo común es que la capacidad mejora más rápido que el canal de datos que la alimenta.

La contribución de Runway es sostener que el problema del canal de datos tiene un atajo, y que ese atajo pasa por el vídeo. Si la correlación entre los resultados simulados y los reales se mantiene entre socios y tareas, el efecto práctico es que los equipos de robótica pueden iterar en un modelo del mundo, reservar las pruebas físicas para la validación final y aprender de una categoría de datos que no deja de crecer por sí sola.

Es una afirmación significativa y no demostrada. La empresa está ofreciendo acceso previo al lanzamiento a socios seleccionados e invitando a los investigadores a probarlo en su propio hardware. La evidencia que importará no será la cifra de correlación del trabajo interno de Runway. Será si laboratorios independientes reproducen el resultado, y si una política entrenada en gran medida con vídeo de internet en tercera persona maneja una tarea que nunca ha visto en una habitación en la que nunca ha estado. Esa es la prueba que decide si el preentrenamiento con vídeo se convierte en la base predeterminada de los cerebros robóticos o sigue siendo una dirección de investigación interesante.

Artículos relacionados