Sette università rilasciano in open source OpenWAM: ai robot non basta «vedere», devono anche «prevedere il secondo successivo»

All'inizio di ottobre, un team composto da ricercatori di sette università tra cui Università Nazionale di Singapore, Università Tsinghua e Università di Pechino ha pubblicato OpenWAM su GitHub e Hugging Face. La posizione del progetto è chiara: uno stack open source completo per la ricerca sui World Action Model (WAM), più un modello di base. Il paper è già su arXiv, numero 2609.07398, e il repository al 1° ottobre conta circa 940 stelle.
La notizia si è diffusa in Cina piuttosto rapidamente, ma ciò che merita davvero un secondo sguardo è il vecchio problema che intende risolvere: per un robot non basta riconoscere ciò che ha davanti.
I simulatori tradizionali calcolano fisica e visione separatamente
In passato, per sviluppare policy robotiche c'erano due strade comuni. Una consisteva nell'imparare simultaneamente regolarità visive e segnali di controllo direttamente dalle dimostrazioni robotiche; l'altra nel partire da un pre-addestramento su immagini e testo, per introdurre conoscenza semantica e linguistica: è la strada VLA.
Il World Action Model segue una terza via: eredita prima dal pre-addestramento alla generazione video il prior su «come cambierà il mondo», poi apprende dall'esperienza incarnata «cosa fare in questo mondo». Sembra un percorso più lungo, ma evita la vecchia frattura tra simulazione e robot reale. Nei simulatori tradizionali fisica e visione vengono spesso calcolate separatamente, e l'effetto dell'azione non corrisponde all'aspetto visivo; l'approccio di OpenWAM è far apprendere direttamente al modello dai dati «come l'azione cambia il mondo» e, su questa base, prevedere posizione degli oggetti, semantica della scena e stato del compito.
Scomposto in tre livelli per rendere gli esperimenti riproducibili
Il team ha scomposto il problema in tre livelli, ciascuno corrispondente a un componente.
OpenWAM-Infra è un'infrastruttura modulare che disaccoppia quattro livelli: modelli componibili, runtime di addestramento, runtime di deployment e protocolli di valutazione. Il ruolo di questo livello è trasformare il World Action Model da un'implementazione singola e strettamente accoppiata in un banco di prova in cui si possono sostituire i componenti.
OpenWAM-Study si occupa di consolidare i principi di progettazione. Non costruisce modelli, ma conduce esperimenti controllati, usando gruppi di confronti per trasformare «quale progettazione funziona» in conclusioni riproducibili.
OpenWAM-α è il modello di base stesso, che convalida l'intera soluzione su video egocentrici umani su larga scala e dati robotici.
Tre principi di progettazione, ciascuno con numeri di confronto
Il rischio maggiore di questo tipo di paper è che siano solo slogan. Le tre conclusioni di OpenWAM sono tutte accompagnate da esperimenti di confronto.
Primo: serve un prior generativo del mondo sufficientemente forte. Il backbone video da 14B raggiunge il 93,79%, mentre quello da 1,3B solo il 90,14%; la configurazione predefinita sceglie il 5B, che rispetto al 14B perde solo 1,4 punti percentuali. Abbinato a uno spazio latente visivo compatto compresso con DINOv3 e S-VAE, le prestazioni si avvicinano al VAE integrato in Wan2.2.
Secondo: durante l'addestramento è necessario stabilire un flusso informativo chiaro dal mondo all'azione. Facendo sì che «il flusso d'azione veda il flusso del mondo», l'accuratezza è del 92,39%; con una maschera isolata scende all'87,41%, ben 5 punti percentuali in meno. In inferenza, il denoising congiunto sincronizzato dà i risultati migliori.
Terzo: i dati vanno usati distinguendo per fonte. I dati robotici servono a preservare il grounding dell'azione, i video egocentrici umani ad ampliare la copertura del mondo, e l'addestramento congiunto in singola fase integra entrambi. Curiosamente, il miglioramento nel dominio di pre-addestramento è limitato, ma il tasso di successo out-of-distribution (OOD) passa dal 14,50% al 26,62%.
Le specifiche effettive del modello di base
OpenWAM-α è composto da due parti: Wan2.2-TI2V-5B come flusso video, più un DiT per l'azione da 1B. Lo spazio delle azioni è unificato a 80 dimensioni ed è compatibile con 17 piattaforme fisiche. I dati di pre-addestramento ammontano a 14.300 ore, di cui il 30% video egocentrici umani, il 30% dati sintetici e il 40% dati reali.

Sul fronte della velocità di inferenza, su RTX 5090 un singolo blocco d'azione richiede 170 millisecondi. La valutazione copre 8 benchmark di simulazione tra cui LIBERO, RoboTwin2.0 e RoboDojo, con morfologie che vanno dal braccio singolo, al doppio braccio, alla manipolazione mobile e alla mano robotica multiarticolata. Nel benchmark EBench relativo al doppio braccio mobile, attualmente è il migliore, con circa 4 punti percentuali di vantaggio sul secondo. Nella validazione su robot reale, con un braccio singolo Franka ha eseguito sei compiti, con un tasso di successo medio dell'82,5%, superiore al 77,5% di LingBot-VA e al 55,0% di π0.5, e due dei compiti hanno raggiunto il 100%. Passando a una mano robotica multiarticolata mai vista in addestramento, dopo il fine-tuning supera nettamente anche π0.5.
Non dichiara VLA fuori dai giochi
Nel paper c'è una conclusione che merita di essere evidenziata separatamente: WAM, facendo supervisione con le variabili latenti dei video futuri, è più adatto in-distribution; VLA è più robusto sotto perturbazioni out-of-distribution. Tra i due, la partita è ancora aperta.
Questa frase è molto più onesta di «un certo paradigma è morto». Chi legge il paper tende a ricordare solo i punteggi, ma ciò che dovrebbe ricordare di più è questa frase: le due strade hanno ora ciascuna i propri punti di forza, e non è ancora il momento di emettere un verdetto definitivo.
La soglia d'ingresso si è abbassata di un gradino
In un contesto più ampio, sulla linea dei world model, Gemini Robotics 2 di Google ha proclamato «un solo cervello, adatto a qualsiasi robot», mentre Jim Fan di NVIDIA ha lanciato «VLA è morto, è il momento dei World Action Model». Il 3 ottobre NVIDIA ha inoltre ampliato lo stack aperto di AI fisica, rilasciando insieme il world model Cosmos, Isaac Lab Arena, Alpamayo per la guida autonoma, lo strumento di orchestrazione OSMO e la libreria OpenUSD; Caterpillar, LEM Surgical e Neura Robotics sono stati tra i primi utilizzatori. Il 4 ottobre, diversi robot umanoidi di DEEP Robotics, azienda di Hangzhou, Zhejiang, sono scesi in strada per testare il controllo del traffico agli incroci e l'informazione ai visitatori, funzionando anche con la pioggia.
Con una tale densità di annunci, il fatto che le università rendano open source l'intero stack di base equivale ad abbassare di un gradino la soglia d'ingresso in questa direzione, e rende «imparare il mondo dai video, imparare le azioni dalle traiettorie» una strada più aperta.
Non è pensato per il deployment diretto
Va chiarito che OpenWAM è pensato come infrastruttura di ricerca, non come prodotto pronto all'uso. Il README ufficiale consiglia di predisporre circa 640 GB di dati di addestramento e l'ambiente occupa circa 6,5 GB; il repository è ancora in attiva evoluzione. È adatto a team che dispongono già di GPU e dati e vogliono fare ricerca sui World Action Model partendo da questa base, non a scenari di implementazione su piccola scala.
I punti da monitorare in seguito sono anch'essi molto concreti: quanto alta sarà la riproducibilità di questa ondata, quante persone continueranno a proporre miglioramenti sei mesi dopo, e se qualche team lo avrà davvero integrato tramite fine-tuning nella propria linea di prodotti. L'entusiasmo del giorno del rilascio svanirà; ciò che resterà sarà il codice che viene ancora usato.
Articoli correlati
Un giudice federale ha definito la rete di targhe di Flock «sorveglianza di massa indiscriminata»
Un singolo avvistamento di un'auto rivela poco. Un mese di avvistamenti aggregati da molte agenzie rivela una vita.
I procuratori federali affermano che server Nvidia per 300 milioni di dollari sono finiti in Cina attraverso la Malesia
I casi di applicazione misurano il flusso anziché fermarlo, e la rotta di transito è la parte che le politiche non hanno risolto.
Supabase ha acquistato Turso perché gli agenti hanno bisogno di un database per ogni attività
Un database per agente ha senso solo quando la più piccola unità di storage diventa abbastanza economica da distribuire come un token di sessione.
Gli attori hanno ottenuto un contratto che regola le loro repliche digitali. La parte difficile è l'applicazione.
Un contratto può definire che cos'è una replica digitale. Dimostrare che una è stata creata senza consenso è un problema diverso.