← Retour au blog
AiEnviron 9 min de lecture

Unitree et ZDTaichu en course pour devenir le cerveau spatial du robot

Publié le 2 oct. 2026
Unitree et ZDTaichu en course pour devenir le cerveau spatial du robot

Les robots savent faire des corps depuis un moment. Un humanoïde peut marcher, s'équilibrer et saisir. Ce qui lui manque, c'est la partie qui décide quoi faire ensuite, surtout quand la pièce n'est pas celle sur laquelle il a été entraîné. Déplacez une tasse, changez l'établi, confiez une tâche au robot en cours de route, et la démonstration s'effondre.

Deux sorties chinoises en septembre s'attaquent à cette partie. Unitree a dévoilé UnifoLM-WLA-1.0, un modèle de fondation humanoïde de six milliards de paramètres entraîné sur environ 2 500 heures de données de robots réels, revendiquant sept résultats de pointe en open source sur le raisonnement incarné. ZDTaichu, essaimé de l'Académie chinoise des sciences et de l'Institut de recherche en IA de Wuhan, a publié en open source ZDTaichu5.0-9B le 15 septembre, un modèle multimodal de neuf milliards de paramètres qui s'est classé premier dans huit des neuf benchmarks internationaux de compréhension spatiale de sa classe de paramètres.

Ni l'un ni l'autre n'est un robot. Tous deux tentent de construire le cerveau qui le fait tourner, et tous deux ont été publiés plutôt que montrés derrière un mur de démonstration.

Le pari d'Unitree sur la généralité

Le chiffre qui ressort de la publication d'Unitree, c'est 64. Un seul modèle revendique la coordination de 64 tâches différentes, du pliage de serviettes et du rangement de la vaisselle à la confection d'un lit, à la sortie des poubelles et au chargement d'une machine à laver. Ce qui compte dans cette liste n'est aucune tâche en particulier. C'est que les mêmes poids les gèrent toutes.

C'est le problème central de la robotique depuis des années. La plupart des démonstrations portent sur une seule tâche, une seule scène, et sont finement ajustées. Elles impressionnent et ne se transfèrent pas. Une politique qui plie une serviette sous un certain éclairage ne pliera pas une serviette d'une autre couleur sur une autre table. Passer à l'échelle sur ce modèle implique d'enseigner chaque variation au robot, ce qui n'est pas passer à l'échelle.

L'approche d'Unitree s'appuie sur une base de raisonnement incarné appelée UnifoLM-ER-1-4B, construite au-dessus de Qwen3-VL-4B et entraînée sur plus de cinq millions d'échantillons de raisonnement incarné. Sur 16 benchmarks de perception et de compréhension multimodales, elle mène le peloton dans sept d'entre eux. Sur deux tests spatiaux, Where2Place et EmbSpatial, elle obtient 82,0 et 88,9 contre 69,0 et 83,3 pour GPT-6 Astra. Ce sont des comparaisons précises face à un modèle fermé, ce qui les rend plus faciles à discuter qu'une revendication générale de supériorité.

Unitree annonce qu'il ouvrira le modèle, le code et le jeu de données. C'est ce dernier point qui compte. Une politique robotique aux poids ouverts mais au jeu de données fermé ne peut pas être reproduite, seulement utilisée. C'est en publiant les données qu'un autre laboratoire peut vérifier l'affirmation ou s'appuyer dessus.

Le pari de ZDTaichu sur le raisonnement spatial

ZDTaichu5.0-9B attaque le problème par le versant de la perception. Le modèle traite le texte, les images isolées, les images multiples, la vidéo longue et les résolutions arbitraires, et son argument de vente est le raisonnement spatial : comprendre où se trouvent les objets, comment ils sont liés et comment une scène change lorsque le point de vue se déplace.

L'écart mis en avant porte sur MindCube-tiny, où il obtient 78,27, devançant Qwen3.5-9B de plus de 20 points et STEP3-VL-10B de plus de 15. Dans une démonstration, invité à trouver la deuxième boîte argentée en partant de la gauche, il produit les bonnes coordonnées tandis que les autres modèles ouverts de taille comparable pointent tous au mauvais endroit. Dans un test multi-points de vue, seul ce modèle garde le référentiel cohérent lorsque l'angle de caméra change.

Ce sont ces défaillances qui mettent en échec les robots réels. Un modèle qui reconnaît une tasse a répondu à la question de savoir ce qu'est l'objet. Un modèle qui sait de quel côté pointe l'anse, et s'il y a la place de la poser à côté, a commencé à répondre à ce qu'on peut en faire. Quand une tâche dure, ces jugements doivent s'enchaîner : objet saisi, identité mémorisée, contenant ouvert, état mis à jour. Une étape manquée et le reste de la tâche dérive.

L'astuce d'ingénierie de ZDTaichu est le raisonnement en boucle adaptatif. Les questions faciles consomment moins de calcul. Les questions difficiles, comme les transformations spatiales et les relations entre objets, bénéficient de plusieurs passes de raisonnement internes sans appel à un outil externe, ce qui évite que le coût en tokens explose sur la majorité simple des entrées.

Ce qui compte peut-être le plus dans cette publication, c'est ce qu'elle ne verrouille pas. Outre les poids, ZDTaichu a publié l'intégralité de sa chaîne de production de données multimodales spatiales, couvrant le pré-entraînement, l'affinage supervisé et l'apprentissage par renforcement. Les institutions et les entreprises peuvent la réutiliser pour transformer leurs propres données d'atelier ou de laboratoire en échantillons d'entraînement. Cela répond à un reproche qui accompagne les publications de modèles ouverts depuis deux ans : on obtient les poids, mais on ne peut pas les adapter à ses propres données parce que la recette reste privée. Le modèle tourne déjà sur des terrains d'entraînement incarné à Pékin, Foshan et Qingdao.

Deux voies vers le même vide

Mettez les deux publications côte à côte et la différence est instructive. Unitree part du côté de l'action vers l'extérieur : prenez une politique qui doit exécuter des tâches, entraînez-la sur 2 500 heures de mouvements réels de robots, et mesurez si elle généralise sur 64 travaux. ZDTaichu part du côté de la perception vers l'intérieur : prenez un modèle multimodal qui doit comprendre une scène, entraînez-le sur des benchmarks spatiaux, et mesurez s'il garde la géométrie droite lorsque le point de vue change.

Un robot a besoin des deux. Il doit savoir où est la tasse, et il doit savoir comment la saisir. Les deux laboratoires attaquent le même vide par les deux bouts, et le fait que tous deux aient publié le même mois suggère que le domaine s'est accordé sur la nature de ce vide : la couche intermédiaire où la perception se transforme en action, et où une tâche qui durait huit secondes devient une tâche qui dure huit minutes.

La question des données les sépare à nouveau. Unitree s'est entraîné sur des mouvements réels de robots, coûteux à collecter et rares. ZDTaichu s'est appuyé sur sa chaîne de données et sur des tâches spatiales synthétiques, qui passent à l'échelle différemment et portent un risque différent : qu'un modèle devienne bon sur des scènes de test et y reste. La voie qui produira une politique capable de survivre au contact d'un vrai entrepôt tranchera la question de la bonne source de données.

Le contexte sectoriel

Les deux publications arrivent dans un domaine qui a réorganisé ses postulats récemment. Gemini Robotics 2 de Google met en avant « un cerveau pour n'importe quel robot ». Jim Fan, chez Nvidia, soutient que les modèles vision-langage-action sont morts et que les modèles d'action du monde leur succèdent. Le rapport de septembre de Gartner sur les tendances de l'IA en Chine classe l'IA physique et les modèles du monde parmi les directions devenues des exigences structurelles plutôt que des expérimentations.

C'est ce recadrage qui explique pourquoi un benchmark spatial compte plus qu'un score de conversation. La compétition en IA incarnée est passée de la qualité du discours d'un modèle sur le monde physique à sa capacité d'agir dans ce monde, et les métriques ont suivi. Précision des coordonnées, cohérence des points de vue et achèvement des tâches d'une scène à l'autre constituent le nouveau tableau de scores.

Ce qu'il faut surveiller

La réserve honnête à apporter aux deux publications est que la première place à un benchmark de raisonnement spatial n'équivaut pas à un robot qui travaille dans un entrepôt. Un modèle peut placer correctement des objets dans un jeu de test et échouer malgré tout sur un vrai bras avec une pince bloquée ou un mauvais éclairage. C'est dans l'écart entre le raisonnement et l'action que la plupart des promesses de la robotique sont mortes.

Ce qui rend ces deux sorties dignes d'intérêt, c'est la combinaison de poids ouverts et de chaînes de données ouvertes. Si un laboratoire extérieur à Unitree ou à ZDTaichu peut prendre l'un ou l'autre modèle, le réentraîner sur son propre matériel et publier le résultat, les affirmations seront testées publiquement. Si les publications restent des benchmarks et des démos tandis que les concurrents gardent leurs données fermées, le domaine restera là où il est : beaucoup de vidéos impressionnantes et très peu de robots accomplissant un travail utile un mardi.

Articles associés