← Volver al blog
Newsaprox. 6 min de lectura

Unitree libera la base humanoide 6B como código abierto: un solo modelo gestiona manos y pies, y la IA encarnada empieza a rendir cuentas por puesto de trabajo

Publicado 6 oct 2026
Unitree libera la base humanoide 6B como código abierto: un solo modelo gestiona manos y pies, y la IA encarnada empieza a rendir cuentas por puesto de trabajo

El 3 de octubre, Unitree Technology publicó en GitHub y Hugging Face UnifoLM-WLA-1.0, el modelo base de nueva generación para robots humanoides generalistas: 6.000 millones de parámetros, ajustado con unas 2.500 horas de datos reales de robots. La noticia no tardó demasiado en circular por el sector robótico chino, pero el punto que más fácilmente pasa desapercibido es que metió «mover las manos» y «caminar» dentro de un mismo modelo.

Durante el último año, los grandes momentos de los robots humanoides se quedaron casi siempre en vídeos de demostración: dar volteretas, bailar, sostener un vaso de agua. Pero para entrar de verdad en fábricas, tiendas y hogares, el examen cambia. Que una acción aislada sea o no lo bastante espectacular es una cosa; que un solo modelo pueda atender a la vez la manipulación fina sobre la mesa y las tareas de desplazamiento de todo el cuerpo es otra. Las cifras que presenta Unitree esta vez son 64 tareas, de las cuales 10 son de cuerpo completo y 54 de mesa, y además es compatible simultáneamente con pinzas paralelas y con manos diestras de dos configuraciones distintas.

La ruta del stack técnico también merece un vistazo. Parte de un razonador encarnado basado en Qwen3-VL, sobre el que añade predicción de regiones dinámicas futuras mediante flujo óptico y VQ-VAE, discretización de acciones con VQ residual y, por último, conecta un experto de acciones MMDiT. Dicho sin rodeos: primero se hace que el modelo entienda qué va a pasar a continuación en la imagen, después se descompone «la acción a realizar» en bloques reutilizables y, finalmente, se entregan al módulo encargado de la ejecución para que los ensamble.

Módulos de articulaciones metálicas dispersos sobre una mesa de trabajo junto a una nota adhesiva en blanco, con luz lateral suave

Por qué «un solo modelo que gestiona manos y pies» es un punto de inflexión

En la práctica de ingeniería de la IA encarnada, las manos y los pies han sido durante mucho tiempo dos equipos separados. Agarrar, insertar y atornillar son movimientos de alta frecuencia y pequeña amplitud, que exigen gran precisión y control de fuerza; caminar, girar y subir o bajar pendientes son movimientos de baja frecuencia y gran amplitud, que deben gestionar equilibrio y terreno. Repartir ambos entre modelos distintos tiene la ventaja de poder llevar cada vía al extremo, pero el precio es que al conmutar hay que transferir estado, y cada transferencia puede perder información y añadir latencia.

Unitree comprime 64 tareas en un único modelo de 6B; en esencia, apuesta a que el beneficio de una «representación unificada» supera al de la optimización por separado. Esa apuesta no sale barata en GPU de uso general, pero en un robot tiene sentido: al desplegar sobre hardware real, la memoria de vídeo, la capacidad de cómputo y el consumo tienen restricciones duras, y un modelo menos supone un gasto menos.

No solo Unitree lo está impulsando

Si se encadenan varios acontecimientos de alrededor de octubre, se ve que no se trata de un lanzamiento aislado.

El Instituto de Inteligencia Artificial de Pekín (BAAI) publicó en abierto RoboBrain-X0 el 29 de septiembre, extendiendo las capacidades de los grandes modelos hacia la percepción y el control de acciones de los robots. Los proyectos de código abierto de IA encarnada se habían detenido antes, en su mayoría, en el nivel de entornos de simulación y conjuntos de datos; la aparición de modelos orientados directamente a políticas de acción indica que esta ruta está pasando de los artículos a activos de ingeniería reproducibles.

El 4 de octubre, varios robots humanoides de la empresa Deep Robotics, con sede en Hangzhou, Zhejiang, salieron a la calle para probar la regulación del tráfico en intersecciones, el mantenimiento del orden y la atención a turistas. El escenario de prueba se eligió en una intersección real y no en un stand, y también se probó con lluvia. El valor de este tipo de pruebas no está en la fluidez de los movimientos, sino en poner al robot humanoide en un entorno real que no le cede el paso.

Más atrás, siete universidades —entre ellas la Universidad Nacional de Singapur, la Universidad de Tsinghua y la Universidad de Pekín— publicaron conjuntamente en abierto el modelo base mundo-acción OpenWAM. Lo que busca resolver es la vieja grieta entre simulación y máquina real: los simuladores tradicionales suelen calcular la física y la visión por separado, mientras que OpenWAM hace que el modelo aprenda directamente de los datos «cómo la acción cambia el mundo» y, sobre esa base, prediga la posición de los objetos, la semántica de la escena y el estado de la tarea. El README oficial ofrece una recomendación de unos 640 GB de datos de entrenamiento, y su enfoque es ser infraestructura de investigación, no un producto listo para usar.

De «puede moverse» a «puede incorporarse al puesto de trabajo»

La narrativa de la IA encarnada está cambiando de vía. Hace dos años se comparaba si el cuerpo podía caminar y si los movimientos eran lo bastante vistosos; ahora se compara si un robot puede trabajar varias horas seguidas sin fallos.

Este giro tiene un indicador muy concreto: el tiempo medio entre dos intervenciones humanas. Un fabricante hizo pública cierta «aritmética de la fiabilidad»: un ciclo de lavado encadena unos 79 subtareas y, calculando con una tasa de éxito del 95 % por paso, la probabilidad de completar toda la ronda sin intervención humana es de apenas un 1,7 %. Visto por separado, un 95 % por subtarea ya es alto, pero al multiplicarlo se derrumba. Por eso el sector empieza a cambiar el objetivo de optimización: de la tasa de éxito de una sola tarea a cuánto tiempo aguanta un flujo de trabajo completo.

La base 6B que Unitree abre ahora tiene su valor precisamente aquí. Su significado está en ofrecer un punto de partida común que se puede reproducir. Los desarrolladores posteriores pueden hacer ajustes finos sobre esta base, cambiar hardware o añadir tareas sin tener que reunir datos desde cero. La competencia en IA encarnada está pasando de «construir un cuerpo que se mueva» a «si el cerebro puede reutilizarse entre hardware y tareas».

Para terminar

Abrir un modelo base humanoide de 6.000 millones de parámetros no muestra retorno comercial a corto plazo, y el coste de los datos también pesa. Pero resuelve algo más básico: dar a investigadores y desarrolladores un lugar con el que contrastar.

En el asunto de la robótica, la prueba definitiva son esos miles de horas en fábricas y tiendas; el examen de la rueda de prensa es solo el comienzo. Quien consolide de verdad la «disponibilidad continua» será quien realmente haya entrado en el juego.

Los puntos de observación que quedan para el sector son muy concretos: cuánta gente reproduce el modelo, a qué velocidad se itera en proyectos reales y cuánta gente sigue enviando mejoras medio año después. El revuelo del día del lanzamiento se disipará; solo queda lo que se sigue usando: el código.

Artículos relacionados