← Volver al blog
Aiaprox. 8 min de lectura

Unitree y ZDTaichu compiten por ser el cerebro espacial del robot

Publicado 2 oct 2026
Unitree y ZDTaichu compiten por ser el cerebro espacial del robot

Los robots llevan tiempo siendo buenos en lo que respecta al cuerpo. Un humanoide puede caminar, mantener el equilibrio y agarrar. En lo que ha fallado es en la parte que decide qué hacer a continuación, sobre todo cuando la habitación no es la habitación en la que fue entrenado. Mueve una taza, cambia el banco de trabajo, entrega al robot una tarea a mitad de camino y la demostración se desmorona.

Dos lanzamientos chinos en septiembre fueron a por esa parte. Unitree presentó UnifoLM-WLA-1.0, un modelo fundacional para humanoides de seis mil millones de parámetros entrenado con unas 2500 horas de datos reales de robots, y afirma haber logrado siete resultados de vanguardia de código abierto en razonamiento corporizado. ZDTaichu, escindida de la Academia China de Ciencias y del Instituto de Investigación de IA de Wuhan, publicó como código abierto ZDTaichu5.0-9B el 15 de septiembre, un modelo multimodal de nueve mil millones de parámetros que alcanzó el primer puesto en ocho de nueve benchmarks internacionales de comprensión espacial dentro de su clase de parámetros.

Ninguno de los dos es un robot. Ambos son intentos de construir el cerebro sobre el que se ejecuta uno, y ambos se publicaron en lugar de mostrarse tras un muro de demos.

La apuesta de Unitree por la generalidad

La cifra que destaca en el lanzamiento de Unitree es 64. Un solo modelo afirma coordinar 64 tareas distintas, desde doblar toallas y guardar los platos hasta hacer la cama, sacar la basura y cargar una lavadora. Lo relevante de esa lista no es ninguna tarea concreta. Es que los mismos pesos se encargan de todas ellas.

Ese ha sido el problema central de la robótica durante años. La mayoría de las demostraciones son de una sola tarea, una sola escena y muy ajustadas. Parecen impresionantes y no se transfieren. Una política que dobla una toalla con una condición de iluminación no dobla una toalla de otro color en una mesa distinta. Escalar una plantilla de robots con ese modelo significa enseñarle cada variación, lo que no es escalar.

El enfoque de Unitree se apoya en una base de razonamiento corporizado llamada UnifoLM-ER-1-4B, construida sobre Qwen3-VL-4B y entrenada con más de cinco millones de muestras de razonamiento corporizado. En 16 benchmarks de percepción y comprensión multimodal, lidera el campo en siete de ellos. En dos pruebas espaciales, Where2Place y EmbSpatial, obtiene 82,0 y 88,9 frente a los 69,0 y 83,3 de GPT-6 Astra. Son comparaciones concretas contra un modelo cerrado, lo que las hace más fáciles de discutir que una afirmación general de superioridad.

Unitree afirma que abrirá el modelo, el código y el conjunto de datos. Ese último elemento es el que importa. Una política robótica con pesos abiertos pero un conjunto de datos cerrado no se puede reproducir, solo usar. Publicar los datos es lo que permite que otro laboratorio verifique la afirmación o construya sobre ella.

La apuesta de ZDTaichu por el razonamiento espacial

ZDTaichu5.0-9B ataca el problema desde el lado de la percepción. El modelo maneja texto, imágenes individuales, múltiples imágenes, vídeo largo y resoluciones arbitrarias, y su punto de venta es el razonamiento espacial: entender dónde están los objetos, cómo se relacionan y cómo cambia una escena cuando se mueve el punto de vista.

La brecha en benchmarks que destaca está en MindCube-tiny, donde obtiene 78,27, por delante de Qwen3.5-9B por más de 20 puntos y de STEP3-VL-10B por más de 15. En una demostración, al pedirle que encuentre la segunda caja plateada desde la izquierda, genera las coordenadas correctas mientras que otros modelos abiertos de tamaño similar señalan todos el lugar equivocado. En una prueba entre puntos de vista, solo este modelo mantiene el sistema de referencia correcto cuando cambia el ángulo de la cámara.

Esos son los fallos que rompen a los robots reales. Un modelo que reconoce una taza ha respondido qué es el objeto. Un modelo que sabe hacia dónde mira el asa, y si hay espacio para dejarla a su lado, ha empezado a responder qué se puede hacer con ella. Cuando una tarea se alarga, esos juicios tienen que encadenarse: objeto recogido, identidad recordada, recipiente abierto, estado actualizado. Un paso omitido y el resto de la tarea se desvía.

El truco de ingeniería de ZDTaichu es el razonamiento en bucle adaptativo. Las preguntas fáciles reciben menos cómputo. Las difíciles, como las transformaciones espaciales y las relaciones entre objetos, reciben múltiples pasadas internas de razonamiento sin llamar a una herramienta externa, lo que evita que el coste de tokens se dispare en la mayoría simple de las entradas.

La parte del lanzamiento que puede importar más es lo que no restringe. Junto con los pesos, ZDTaichu publicó toda su canalización de producción de datos multimodales espaciales, que abarca el preentrenamiento, el ajuste fino supervisado y el aprendizaje por refuerzo. Las instituciones y empresas pueden reutilizarla para convertir sus propios datos de planta de fábrica o de laboratorio en muestras de entrenamiento. Eso responde a una queja que ha acompañado a los lanzamientos de modelos abiertos durante dos años: obtienes los pesos, pero no puedes adaptarlos a tus propios datos porque la receta sigue siendo privada. El modelo ha estado funcionando en campos de entrenamiento corporizado en Pekín, Foshan y Qingdao.

Dos rutas hacia la misma brecha

Si se ponen los dos lanzamientos uno al lado del otro, la diferencia es instructiva. Unitree trabaja desde el lado de la acción hacia fuera: toma una política que tiene que realizar tareas, entrénala con 2500 horas de movimiento real de robots y mide si generaliza a lo largo de 64 trabajos. ZDTaichu trabaja desde el lado de la percepción hacia dentro: toma un modelo multimodal que tiene que entender una escena, entrénalo con benchmarks espaciales y mide si mantiene la geometría correcta cuando se mueve el punto de vista.

Un robot necesita ambas cosas. Tiene que saber dónde está la taza y tiene que saber cómo recogerla. Los dos laboratorios atacan la misma brecha desde extremos opuestos, y el hecho de que ambos publicaran el mismo mes sugiere que el sector se ha puesto de acuerdo sobre cuál es esa brecha: la capa intermedia donde la percepción se convierte en acción, y donde una tarea que duraba ocho segundos se convierte en una que dura ocho minutos.

La cuestión de los datos vuelve a separarlos. Unitree entrenó con movimiento real de robots, que es caro de recopilar y escaso. ZDTaichu se apoyó en su canalización de datos y en tareas espaciales sintéticas, que escalan de forma distinta y conllevan un riesgo diferente: que un modelo se vuelva bueno en escenas de prueba y se quede ahí. La ruta que produzca una política que sobreviva al contacto con un almacén real determinará cuál era la fuente de datos correcta.

El contexto del sector

Ambos lanzamientos llegan a un sector que ha reorganizado sus supuestos hace poco. Gemini Robotics 2 de Google propone "un cerebro para cualquier robot". Jim Fan, de Nvidia, ha sostenido que los modelos de visión-lenguaje-acción están muertos y que los modelos de acción del mundo son su sucesor. El informe de Gartner de septiembre sobre las tendencias de IA en China situó la IA física y los modelos del mundo entre las direcciones que se han convertido en requisitos estructurales y no en experimentos.

Ese replanteamiento es la razón por la que un benchmark espacial importa más que una puntuación de chat. La competencia en IA corporizada ha pasado de lo bien que un modelo habla del mundo físico a si puede actuar en él, y las métricas han seguido ese cambio. La precisión de coordenadas, la consistencia entre puntos de vista y la finalización de tareas en distintas escenas son el nuevo marcador.

Qué hay que observar

La advertencia honesta sobre ambos lanzamientos es que liderar los benchmarks de razonamiento espacial no es lo mismo que ser un robot que funciona en un almacén. Un modelo puede colocar objetos correctamente en un conjunto de pruebas y aun así fallar en un brazo real con una pinza atascada o una iluminación mala. La brecha entre razonar y actuar es donde han muerto la mayoría de las promesas de la robótica.

Lo que hace que valga la pena seguir a estos dos es la combinación de pesos abiertos y canalizaciones de datos abiertas. Si un laboratorio ajeno a Unitree o ZDTaichu puede tomar cualquiera de los modelos, reentrenarlo con su propio hardware y publicar el resultado, las afirmaciones se ponen a prueba en público. Si los lanzamientos se quedan en benchmarks y demos mientras los competidores mantienen sus datos cerrados, el sector se quedará donde ha estado: mucho vídeo impresionante y muy pocos robots haciendo trabajo útil un martes.

Artículos relacionados