Unitree ha open-sourcato la base umanoide 6B: un solo modello gestisce mani e piedi, l'IA incarnata inizia a fare i conti per mansione

Il 3 ottobre, Unitree Technology ha rilasciato su GitHub e Hugging Face UnifoLM-WLA-1.0, il modello di base di nuova generazione per robot umanoidi general-purpose: 6 miliardi di parametri, messo a punto su circa 2.500 ore di dati reali raccolti da robot. La notizia ha girato piuttosto in fretta nel circuito robotico cinese, ma il punto che si tende a saltare è che ha infilato «manipolare» e «camminare» dentro lo stesso modello.
Nell'ultimo anno, i momenti di gloria dei robot umanoidi si sono fermati per lo più a brevi video dimostrativi: fare capriole, ballare, reggere un bicchiere d'acqua. Ma per entrare davvero in fabbrica, nei negozi e nelle case, il test cambia. Che un singolo gesto sia spettacolare o meno è una cosa; che un modello riesca a gestire contemporaneamente la manipolazione fine sul tavolo e i compiti di locomozione dell'intero corpo è un'altra. I numeri che Unitree mette sul tavolo stavolta sono 64 task, di cui 10 di corpo intero e 54 da tavolo, con adattamento sia a pinze parallele sia a due diverse configurazioni di mani robotiche multi-dita.
Anche la strada tecnologica scelta merita uno sguardo. Parte da un motore di ragionamento incarnato basato su Qwen3-VL, vi sovrappone la previsione delle regioni dinamiche future tramite flusso ottico e VQ-VAE, la discretizzazione residuale delle azioni con VQ, e infine aggancia un esperto di azione MMDiT. Detto senza giri di parole: prima si fa capire al modello cosa accadrà nell'immagine subito dopo, poi si spezza «l'azione da compiere» in mattoncini riutilizzabili, e infine si lascia che il modulo preposto all'esecuzione li assembli.

Perché «un solo modello che gestisce mani e piedi» è uno spartiacque
Nella pratica ingegneristica dell'IA incarnata, mani e piedi sono stati a lungo due squadre separate. Afferrare, inserire componenti, avvitare viti sono azioni ad alta frequenza e piccola ampiezza, che richiedono precisione e controllo di forza; camminare, girarsi, salire e scendere pendenze sono azioni a bassa frequenza e grande ampiezza, che devono gestire equilibrio e terreno. Separarle su modelli diversi ha il vantaggio di poter ottimizzare al massimo ogni canale, ma al prezzo di dover passare lo stato a ogni commutazione, e ogni passaggio può perdere informazione e aggiungere latenza.
Comprimere 64 task in un unico modello da 6B significa, in sostanza, scommettere che i benefici di una «rappresentazione unificata» superino quelli dell'ottimizzazione separata. La scommessa, su una GPU generica, non è economica, ma su un robot ha senso: nel deployment su macchina reale memoria video, potenza di calcolo e consumo hanno vincoli rigidi, e un modello in meno è un costo in meno.
Non è solo Unitree a spingere in questa direzione
Mettendo in fila alcuni fatti di inizio e fine ottobre, si capisce che non si tratta di un rilascio isolato.
Il 29 settembre il BAAI (Beijing Academy of Artificial Intelligence) ha open-sourcato RoboBrain-X0, estendendo le capacità dei grandi modelli alla percezione e al controllo del movimento dei robot. I progetti open source di IA incarnata si fermavano prima soprattutto al livello di ambienti di simulazione e dataset; la comparsa di modelli direttamente orientati alle policy d'azione indica che questa strada sta passando dai paper ad asset ingegneristici riproducibili.
Il 4 ottobre, diversi robot umanoidi di DEEP Robotics (Yunshenchu Technology), con sede a Hangzhou, nello Zhejiang, sono scesi in strada per testare la gestione del traffico agli incroci, il mantenimento dell'ordine e l'assistenza ai turisti. Lo scenario di test è stato scelto in un incrocio reale, non su uno stand, e i robot hanno girato anche con la pioggia. Il valore di test simili non sta nella fluidità dei movimenti, ma nel mettere un robot umanoide in un ambiente reale che non gli lascerà la strada libera.
Ancora prima, sette università tra cui la National University of Singapore, l'Università Tsinghua e l'Università di Pechino hanno open-sourcato congiuntamente OpenWAM, una base di world-action model. Il problema che affronta è la vecchia crepa tra simulazione e macchina reale: i simulatori tradizionali tendono a calcolare fisica e visione ognuno per conto proprio, mentre OpenWAM fa imparare al modello direttamente dai dati «come l'azione cambia il mondo» e su questa base predice posizione degli oggetti, semantica della scena e stato del task. Il README ufficiale indica circa 640 GB di dati di training consigliati e la posiziona come infrastruttura di ricerca, non come prodotto pronto all'uso.
Da «si muove o no» a «può andare a lavorare o no»
La narrazione dell'IA incarnata sta cambiando binario. Fino a due anni fa si confrontava la capacità del corpo di camminare e la spettacolarità dei gesti; oggi si confronta se un robot riesce a lavorare per diverse ore di fila senza intoppi.
Questa svolta ha un indicatore molto concreto: il tempo medio tra due interventi umani. Un produttore ha reso pubblica una sorta di «aritmetica dell'affidabilità»: un ciclo di lavaggio mette in fila circa 79 sotto-task e, con un tasso di successo del 95% per ogni passo, la probabilità di completare l'intero ciclo senza intervento umano è solo di circa l'1,7%. Il 95% di ogni singolo sotto-task è già alto, ma moltiplicato crolla. Per questo il settore ha iniziato a spostare l'obiettivo di ottimizzazione dal tasso di successo per singolo task a quanto a lungo regge un flusso di lavoro completo.
È qui anche il valore della base da 6B open-sourcata da Unitree. Il suo senso è offrire un punto di partenza comune e riproducibile. Gli sviluppatori successivi possono fare fine-tuning su questa base, cambiare hardware, aggiungere task, senza dover accumulare dati da zero. La competizione nell'IA incarnata sta passando dal «costruire un corpo che si muove» al «il cervello può essere riutilizzato su hardware e task diversi».
In conclusione
Open-sourcare una base umanoide da 6 miliardi di parametri non mostra ritorni commerciali nel breve periodo, e il costo dei dati resta lì. Ma risolve una questione più di fondo: dare a ricercatori e sviluppatori un punto di riferimento con cui sincronizzarsi.
Nel campo della robotica, l'esame decisivo si gioca nelle migliaia di ore dentro fabbriche e negozi; il giorno della presentazione è solo l'inizio. Chi rende davvero concreto il «funzionare in modo continuativo» è l'unico che entra davvero in partita.
I punti da osservare per il settore sono molto concreti: quanto è alta la riproducibilità di questo rilascio, quanto è rapida l'iterazione nei progetti reali e quanti, sei mesi dopo, staranno ancora contribuendo miglioramenti. Il fermento del giorno del lancio svanirà; resterà solo il codice che viene ancora usato.
Articoli correlati
L'Ottavo Circuito ha sospeso il divieto di nudificazione AI del Minnesota. La vera battaglia riguarda chi è responsabile.
La sentenza non stabilisce che la legge è incostituzionale. Sospende l'applicazione in attesa dell'appello.
La California ha firmato 13 disegni di legge sull'IA in un giorno. SB 1000 ha eliminato la soglia del milione di utenti.
Per una categoria di startup che presumeva di essere troppo piccola per essere regolamentata, quell'assunto è appena scaduto.
Tre aziende hanno creato prodotti video su MiniMax H3 in un giorno. La licenza esclude gli Stati Uniti.
Un prodotto venduto a imprese statunitensi da un'azienda statunitense, costruito su pesi la cui licenza esclude gli Stati Uniti, è una domanda che una dichiarazione di MiniMax risolverebbe.
Claude Sonnet 5.5 costa il 30% in meno. È una storia di procurement, non una storia di modello.
Le affermazioni di sconto dei fornitori sono di solito misurate su un carico di lavoro rappresentativo, e il vostro non è rappresentativo.