← Torna al blog
Aicirca 7 min di lettura

La scommessa di Runway su Praxis-1: il pretraining video come scorciatoia verso i cervelli robotici

Pubblicato 2 ott 2026
La scommessa di Runway su Praxis-1: il pretraining video come scorciatoia verso i cervelli robotici

Ogni programma di robotica con ambizioni di deployment serie si scontra con lo stesso muro, e non è un muro hardware. I dati del mondo reale sono scarsi e costosi da raccogliere nel volume di cui ha bisogno una policy generalista. Per domini pieni di casi limite, tra cui guida autonoma, robotica domestica e lavoro in magazzino in ambienti disordinati, non esiste un modo pratico di raccogliere le dimostrazioni necessarie per addestrare un modello in grado di gestire ciò che accadrà davvero.

Runway ha annunciato Praxis-1 il 30 settembre, e il suo argomento parte proprio da quel muro. Praxis-1 è un modello world action a pesi aperti che converte il pretraining video su larga scala di Runway in policy di controllo per robot reali. L'azienda lo sta testando con i partner iniziali Noble Machines, Standard Bots e Ultra, ciascuno dei quali esegue il modello sul proprio hardware, con un rilascio pubblico con pesi aperti previsto nei prossimi mesi.

Il video come sostituto della teleoperazione

La premessa è semplice una volta enunciata. Il video è praticamente illimitato, e lo sta diventando sempre di più man mano che i modelli generativi raggiungono la parità con filmati reali in qualità e velocità. Ogni giorno le persone filmano e caricano più vita quotidiana di quanta qualsiasi laboratorio di robotica potrebbe catturare con dimostrazioni teleoperate. Se un modello può apprendere la struttura del mondo fisico da quei filmati, il collo di bottiglia si sposta dai dati robotici scarsi al video generale abbondante.

L'affermazione che dà peso a tutto ciò è empirica. Runway riporta che simulare policy robotiche all'interno del suo world model predice i risultati nel mondo reale con una correlazione di 0,95, un dato che si confronta favorevolmente con tecniche più costose basate su ricostruzione 3D. Un world model che può essere usato come ambiente di test fedele cambia l'economia dello sviluppo delle policy, perché la valutazione smette di richiedere hardware fisico per ogni iterazione.

L'azienda ha anche scoperto che le prestazioni delle policy migliorano all'aumentare della scala del video in terza persona, e ne trae la conclusione che il collo di bottiglia per una policy capace diventa quanto video generale un modello può usare per l'addestramento. È lo stesso argomento di scaling che ha guidato i modelli linguistici, applicato al controllo motorio. Una policy che comprende già la plausibilità fisica e il comportamento degli oggetti dal pretraining video parte da una posizione molto più forte rispetto a una costruita solo su dati di azione.

L'architettura dietro la scommessa

Praxis-1 è costruito sullo stesso pretraining video che ha prodotto i world model generali di Runway e il suo lavoro interattivo in tempo reale come Solaris e la linea GWM Worlds. La logica di quella discendenza conta. Insegnare a un modello come si comportano gli oggetti, come si muovono le mani e che aspetto ha un compito a metà strada crea ambienti dinamici per addestrare agenti sia in contesti digitali sia fisici.

Runway inquadra tutto questo come un vantaggio cumulativo. Più il modello comprende come funziona il mondo dal video, meglio può controllare un robot in ambienti diversi da qualsiasi cosa abbia visto in addestramento. L'obiettivo dichiarato è un modello di policy generalista per sviluppatori e ricercatori di robotica che funzioni su qualsiasi embodiment o ambiente, piuttosto che una policy ottimizzata per un singolo braccio o una singola pinza.

È qui che entra la lettura scettica. «Funziona su qualsiasi embodiment» è un'affermazione forte, e le prove finora provengono da tre partner nominati che eseguono il modello sul proprio hardware, in vista di un lancio più ampio. La cifra di correlazione di 0,95 è misurata tra la simulazione all'interno del world model di Runway e i risultati nel mondo reale, il che è una validazione tanto del simulatore quanto della policy. Entrambe sono utili, ed entrambe sono numeri di Runway in questa fase.

Perché pesi aperti, e perché è un argomento strategico

Runway distribuisce Praxis-1 con pesi aperti anziché come modello chiuso, e il ragionamento è insolitamente esplicito per un'azienda che ha mantenuto proprietaria la maggior parte dei suoi modelli. L'annuncio lo inquadra come una questione di competitività degli Stati Uniti nell'AI fisica: riprendere la leadership nella manifattura, accelerare la produttività e assicurarsi alleati richiederà, nelle parole di Runway, un livello di interoperabilità e apertura da parte dei modelli americani che attualmente non esiste per i casi d'uso fisici.

È un argomento di sapore politico, e arriva nel mezzo di un dibattito acceso su quanto dello stack AI debba essere aperto. Per la robotica in particolare, la tesi a favore dei pesi aperti è più forte che per i modelli linguistici di frontiera. Gli sviluppatori hardware devono eseguire policy sulle proprie macchine, con i propri sensori e attuatori, e un'API cloud che richiede di inviare quei segnali altrove è poco adatta. I world model aperti danno ai produttori hardware flessibilità e controllo che non possono ottenere da un modello ospitato.

C'è anche una dimensione competitiva che l'annuncio non dichiara apertamente. Gran parte dello slancio nei modelli video e world open-weight è venuto da laboratori cinesi. Un'importante azienda statunitense che distribuisce pesi aperti nella stessa categoria si legge in parte come un tentativo di definire il centro di gravità dell'ecosistema prima che lo faccia qualcun altro.

Una correlazione di 0,95 è un numero forte e merita una traduzione. Significa che quando Runway esegue una policy candidata all'interno del suo world model e ne misura le prestazioni, il robot reale si comporta quasi allo stesso modo. Se ciò vale tra compiti diversi, la conseguenza pratica è che un team di robotica può eseguire la maggior parte dei suoi esperimenti in simulazione e riservare l'hardware fisico alla verifica finale. Dato quanto sono costosi e lenti i test fisici, è la differenza tra eseguire cento iterazioni in una settimana e eseguirne una manciata in un mese.

La domanda più difficile è la generalizzazione. Il video insegna a un modello che aspetto ha il mondo e come tendono a comportarsi gli oggetti, ma un robot deve anche sapere cosa fare con un braccio specifico, su un compito specifico, con una tolleranza specifica al fallimento. L'argomentazione di Runway è che il prior addestrato sul video riduce la quantità di dati specifici per il compito necessari per arrivarci. È plausibile, e non provato su scala.

Dove si colloca nella più ampia corsa alla robotica

Praxis-1 arriva in un anno in cui la robotica umanoide e manifatturiera si è spostata dalle demo alle implementazioni. Figure ha addestrato robot umanoidi dismessi per compiti estremi. I produttori di umanoidi hanno firmato piloti in fabbrica con case automobilistiche, e Boston Dynamics ha iniziato a testare il suo robot Atlas all'interno di uno stabilimento Hyundai con piani di implementazione su larga scala entro il 2030. Il filo comune è che la capacità migliora più rapidamente della pipeline di dati che la alimenta.

Il contributo di Runway è sostenere che il problema della pipeline di dati ha una scorciatoia, e che la scorciatoia passa attraverso il video. Se la correlazione tra risultati simulati e reali regge tra partner e compiti, l'effetto pratico è che i team di robotica possono iterare in un world model, riservare i test fisici alla validazione finale e apprendere da una categoria di dati che continua a crescere da sola.

È un'affermazione significativa e non provata. L'azienda sta fornendo accesso pre-lancio a partner selezionati e invitando i ricercatori a testarlo sul proprio hardware. Le prove che contano non saranno il dato di correlazione dal lavoro interno di Runway. Sarà se laboratori indipendenti riproducono il risultato, e se una policy addestrata in gran parte su video internet in terza persona gestisce un compito che non ha mai visto in una stanza in cui non è mai stata. Questo è il test che decide se il pretraining video diventa la base predefinita per i cervelli robotici o resta una direzione di ricerca interessante.

Articoli correlati