Unitree e ZDTaichu in corsa per essere il cervello spaziale del robot

I robot sono bravi con i corpi da un po' di tempo. Un umanoide sa camminare, mantenersi in equilibrio e afferrare. Quello in cui è scarso è la parte che decide cosa fare dopo, soprattutto quando la stanza non è la stanza in cui è stato addestrato. Sposta una tazza, cambia il banco di lavoro, affida al robot un compito già a metà e la demo va in pezzi.
Due rilasci cinesi di settembre hanno puntato proprio a quella parte. Unitree ha presentato UnifoLM-WLA-1.0, un modello fondazionale per umanoidi da sei miliardi di parametri, addestrato su circa 2.500 ore di dati reali di robot, rivendicando sette risultati open source all'avanguardia nel ragionamento incarnato. ZDTaichu, nata come spin-off dall'Accademia Cinese delle Scienze e dal Wuhan AI Research Institute, ha reso open source ZDTaichu5.0-9B il 15 settembre, un modello multimodale da nove miliardi di parametri che ha conquistato il primo posto in otto dei nove benchmark internazionali di comprensione spaziale nella sua classe di parametri.
La scommessa di Unitree sulla generalità
Il numero che salta all'occhio nel rilascio di Unitree è 64. Un singolo modello dichiara di coordinare 64 compiti diversi, dal piegare gli asciugamani e riporre i piatti al rifare il letto, portare fuori la spazzatura e caricare una lavatrice. Il punto di quell'elenco non è un singolo compito. È che gli stessi pesi gestiscono tutti quanti.
Questo è stato il problema centrale della robotica per anni. La maggior parte delle dimostrazioni è a compito singolo, scena singola e fortemente ottimizzata. Sembrano impressionanti e non si trasferiscono. Una policy che piega un asciugamano in una condizione di illuminazione non piega un asciugamano di colore diverso su un tavolo diverso. Scalare una forza lavoro robotica su quel modello significa insegnargli ogni variazione, il che non è scalare.
L'approccio di Unitree si basa su una base di ragionamento incarnato chiamata UnifoLM-ER-1-4B, costruita sopra Qwen3-VL-4B e addestrata su più di cinque milioni di campioni di ragionamento incarnato. Su 16 benchmark di percezione e comprensione multimodale, guida il campo in sette di essi. Su due test spaziali, Where2Place ed EmbSpatial, ottiene 82,0 e 88,9 contro i 69,0 e 83,3 di GPT-6 Astra. Sono confronti specifici con un modello chiuso, il che li rende più facili da dibattere rispetto a una dichiarazione generale di superiorità.
Unitree afferma che aprirà il modello, il codice e il dataset. Quest'ultimo elemento è quello che conta. Una policy robotica con pesi aperti ma dataset chiuso non può essere riprodotta, solo usata. Rilasciare i dati è ciò che permette a un altro laboratorio di verificare l'affermazione o costruirci sopra.
La scommessa di ZDTaichu sul ragionamento spaziale
ZDTaichu5.0-9B attacca il problema dal lato della percezione. Il modello gestisce testo, immagini singole, immagini multiple, video lunghi e risoluzioni arbitrarie, e il suo punto di forza è il ragionamento spaziale: capire dove sono gli oggetti, come sono in relazione e come cambia una scena quando il punto di vista si sposta.
Il divario di benchmark che mette in evidenza è su MindCube-tiny, dove ottiene 78,27, davanti a Qwen3.5-9B di più di 20 punti e a STEP3-VL-10B di più di 15. In una dimostrazione, quando gli viene chiesto di trovare la seconda scatola argentata da sinistra, restituisce le coordinate corrette mentre altri modelli aperti di dimensioni simili indicano tutti il posto sbagliato. In un test di cambiamento del punto di vista, solo questo modello mantiene coerente il sistema di riferimento quando l'angolo della telecamera cambia.
Questi sono i fallimenti che mettono fuori uso i robot reali. Un modello che riconosce una tazza ha risposto a che oggetto è. Un modello che sa da che parte è rivolto il manico e se c'è spazio per appoggiarla lì accanto ha iniziato a rispondere a cosa se ne può fare. Quando un compito si protrae a lungo, questi giudizi devono concatenarsi: oggetto raccolto, identità ricordata, contenitore aperto, stato aggiornato. Basta un passo mancato e il resto del compito va alla deriva.
Il trucco ingegneristico di ZDTaichu è il ragionamento adattivo in loop. Le domande facili ricevono meno calcolo. Quelle difficili, come trasformazioni spaziali e relazioni tra oggetti, ricevono più passaggi di ragionamento interno senza chiamare uno strumento esterno, il che evita che il costo in token esploda sulla maggioranza semplice degli input.
La parte del rilascio che potrebbe contare di più è ciò che non viene bloccato. Insieme ai pesi, ZDTaichu ha pubblicato l'intera pipeline di produzione di dati multimodali spaziali, che copre pre-addestramento, fine-tuning supervisionato e apprendimento per rinforzo. Istituzioni e aziende possono riutilizzarla per trasformare i propri dati di fabbrica o di laboratorio in campioni di addestramento. Questo risponde a una critica che accompagna i rilasci di modelli aperti da due anni: ottieni i pesi, ma non puoi adattarli ai tuoi dati perché la ricetta resta privata. Il modello è stato eseguito in campi di addestramento incarnato a Pechino, Foshan e Qingdao.
Due strade verso lo stesso divario
Metti i due rilasci fianco a fianco e la differenza è istruttiva. Unitree lavora dal lato dell'azione verso l'esterno: prendi una policy che deve eseguire compiti, addestrala su 2.500 ore di movimento reale di robot e misura se generalizza su 64 lavori. ZDTaichu lavora dal lato della percezione verso l'interno: prendi un modello multimodale che deve capire una scena, addestralo su benchmark spaziali e misura se mantiene corretta la geometria quando il punto di vista si sposta.
Un robot ha bisogno di entrambe le cose. Deve sapere dov'è la tazza e deve sapere come raccoglierla. I due laboratori attaccano lo stesso divario da lati opposti, e il fatto che entrambi abbiano pubblicato nello stesso mese suggerisce che il campo ha concordato su quale sia il divario: lo strato intermedio in cui la percezione si trasforma in azione, e in cui un compito che durava otto secondi diventa uno che dura otto minuti.
La questione dei dati li separa di nuovo. Unitree ha addestrato il modello su movimento reale di robot, che è costoso da raccogliere e raro. ZDTaichu si è affidata alla sua pipeline di dati e a compiti spaziali sintetici, che scalano diversamente e comportano un rischio diverso: che un modello diventi bravo nelle scene di test e ci rimanga. Qualunque strada produca una policy che sopravvive al contatto con un magazzino reale stabilirà quale fonte di dati fosse la scommessa giusta.
Il contesto del settore
Entrambi i rilasci arrivano in un campo che di recente ha riorganizzato le proprie assunzioni. Gemini Robotics 2 di Google propone "un cervello per qualsiasi robot". Jim Fan di Nvidia ha sostenuto che i modelli visione-linguaggio-azione sono morti e che i world action model sono i successori. Il rapporto di settembre di Gartner sulle tendenze dell'IA in Cina ha inserito l'IA fisica e i modelli del mondo tra le direzioni diventate requisiti strutturali anziché esperimenti.
Questa riformulazione è il motivo per cui un benchmark spaziale conta più di un punteggio di chat. La competizione nell'IA incarnata si è spostata da quanto bene un modello parla del mondo fisico a se sa agire in esso, e le metriche sono seguite. Accuratezza delle coordinate, coerenza del punto di vista e completamento dei compiti attraverso scene diverse sono il nuovo tabellone dei punteggi.
Cosa tenere d'occhio
L'avvertenza onesta su entrambi i rilasci è che la leadership nei benchmark di ragionamento spaziale non è la stessa cosa di un robot che funziona in un magazzino. Un modello può posizionare correttamente gli oggetti in un set di test e comunque fallire su un braccio reale con una pinza bloccata o un'illuminazione scarsa. Il divario tra ragionamento e azione è dove è morta la maggior parte delle promesse della robotica.
Ciò che rende questi due progetti degni di essere seguiti è la combinazione di pesi aperti e pipeline di dati aperte. Se un laboratorio esterno a Unitree o ZDTaichu può prendere uno dei due modelli, riaddestrarlo sul proprio hardware e pubblicare il risultato, le affermazioni vengono testate pubblicamente. Se i rilasci restano benchmark e demo mentre i concorrenti tengono chiusi i loro dati, il campo resterà dov'è stato: molti video impressionanti e pochissimi robot che svolgono un lavoro utile di martedì.
Articoli correlati
La classifica dei modelli video che nessuno pubblicizza: dove vanno davvero le richieste
Ogni settimana porta una nuova classifica di generazione video, e quasi tutte sono costruite allo stesso modo.
Ai2 ha reso open source lo stack di training, non l'ennesimo set di pesi
È facile regalare i pesi, difficile imparare da essi.
Il Qwen3.8-Max di Alibaba sostiene di poter programmare da solo per due settimane
Il numero di parametri ha smesso da tempo di fare notizia. Dodici giorni è il numero che vale la pena esaminare.
PixelUMM elimina i due componenti da cui dipende ogni modello AI visivo
La diffusione a livello di pixel è stata proposta prima e si è ripetutamente scontrata con la potenza di calcolo.