← Voltar ao blog
Newscerca de 6 min de leitura

Unitree abre o código do modelo base humanoide de 6B: um único modelo controla mãos e pés, e a inteligência incorporada começa a fazer contas por função

Publicado 6 de out. de 2026
Unitree abre o código do modelo base humanoide de 6B: um único modelo controla mãos e pés, e a inteligência incorporada começa a fazer contas por função

Em 3 de outubro, a Unitree Technology disponibilizou no GitHub e no Hugging Face o UnifoLM-WLA-1.0, a nova geração do modelo base para robôs humanoides de uso geral, com 6 bilhões de parâmetros e ajuste fino baseado em cerca de 2.500 horas de dados reais de robôs. A notícia circulou rápido no meio robótico chinês, mas o ponto mais fácil de passar despercebido é que ela colocou o "mover as mãos" e o "andar" dentro do mesmo modelo.

No último ano, os grandes momentos dos robôs humanoides ficaram quase todos em vídeos de demonstração: dar cambalhotas, dançar, segurar um copo d'água. Mas para realmente entrar em fábricas, lojas e casas, a prova muda. Uma coisa é um movimento isolado ser impressionante o suficiente; outra é um modelo dar conta ao mesmo tempo de operações delicadas sobre a mesa e de tarefas de locomoção de corpo inteiro. Os números apresentados pela Unitree são 64 tarefas, das quais 10 de corpo inteiro e 54 de mesa, com adaptação simultânea a garras paralelas e a dois tipos de mãos ágeis de configurações diferentes.

A rota da pilha tecnológica também merece uma olhada. Ela parte de um raciocinador incorporado baseado no Qwen3-VL, sobrepõe previsão de regiões dinâmicas futuras com fluxo óptico e VQ-VAE, discretização residual de ações com VQ, e por fim conecta um especialista de ação MMDiT. Traduzindo sem enrolação: primeiro o modelo entende o que vai acontecer na imagem a seguir, depois decompõe "a ação a executar" em blocos reutilizáveis, e por fim entrega tudo ao módulo responsável pela execução para montar o quebra-cabeça.

Módulos de juntas metálicas espalhados sobre uma bancada e um post-it em branco, luz lateral suave

Por que "um modelo que controla mãos e pés" é um divisor de águas

Na prática de engenharia da inteligência incorporada, mãos e pés sempre foram duas equipes distintas. Agarrar, encaixar e parafusar são movimentos de alta frequência e pequena amplitude, que exigem precisão e controle de força; andar, girar e subir e descer rampas são movimentos de baixa frequência e grande amplitude, que precisam lidar com equilíbrio e terreno. Separar os dois em modelos diferentes tem a vantagem de permitir ajustar cada via ao extremo, mas o custo é que a troca exige transferência de estado, e cada transferência pode perder informação e adicionar latência.

Ao comprimir 64 tarefas em um único modelo de 6B, a Unitree aposta essencialmente que o ganho de uma "representação unificada" supera o de otimizações separadas. Essa aposta não é barata em GPUs de uso geral, mas faz sentido no corpo de um robô: na implantação real, memória de vídeo, capacidade de processamento e consumo de energia têm restrições rígidas, e um modelo a menos é um custo a menos.

Não é só a Unitree que está empurrando

Juntando alguns acontecimentos em torno de outubro, percebe-se que este não é um lançamento isolado.

Em 29 de setembro, o Instituto de Pesquisa BAAI abriu o código do RoboBrain-X0, estendendo capacidades de grandes modelos para a percepção e o controle de movimento de robôs. Projetos de código aberto de inteligência incorporada paravam antes no nível de ambientes de simulação e conjuntos de dados; o surgimento de modelos voltados diretamente para políticas de ação mostra que essa rota está saindo dos artigos para se tornar um ativo de engenharia reproduzível.

Em 4 de outubro, vários robôs humanoides da Yunshën Chushi Technology, de Hangzhou, Zhejiang, foram às ruas para testar orientação de tráfego em cruzamentos, manutenção da ordem e atendimento a turistas. Os cenários de teste foram cruzamentos reais, não estandes, e os testes rodaram até debaixo de chuva. O valor desse tipo de teste não está na fluidez dos movimentos, mas em colocar o robô humanoide num ambiente real que não abre caminho para ele.

Mais atrás, sete universidades, incluindo a Universidade Nacional de Singapura, a Universidade Tsinghua e a Universidade de Pequim, abriram conjuntamente o código da base de modelo mundo-ação OpenWAM. Ele quer resolver aquela velha fissura entre simulação e robô real: simuladores tradicionais costumam calcular física e visão cada um por si, e o OpenWAM faz o modelo aprender diretamente dos dados "como a ação transforma o mundo", prevendo a partir daí posição de objetos, semântica de cena e estado da tarefa. O README oficial recomenda cerca de 640 GB de dados de treinamento, com posicionamento de infraestrutura de pesquisa, não de produto pronto para usar.

De "consegue se mover" para "consegue assumir um posto"

A narrativa da inteligência incorporada está mudando de trilho. Nos dois anos anteriores, a comparação era se o corpo conseguia andar e se os movimentos eram legais o bastante; agora, é se um robô consegue trabalhar horas seguidas sem falhar.

Essa mudança tem um indicador bem concreto: o tempo médio entre duas intervenções humanas. Uma fabricante já divulgou publicamente uma "aritmética da confiabilidade": um ciclo de lavanderia encadeia cerca de 79 subtarefas; com 95% de sucesso por etapa, a probabilidade de completar todo o ciclo sem intervenção é de apenas cerca de 1,7%. Isoladamente, 95% por subtarefa já é alto, mas, multiplicado, desaba. Por isso o setor começou a mudar o objetivo de otimização da taxa de sucesso de uma única tarefa para quanto tempo um fluxo de trabalho completo se sustenta.

O valor do modelo base de 6B aberto pela Unitree está justamente aí. Seu significado é oferecer um ponto de partida comum e reproduzível. Desenvolvedores podem, sobre essa base, fazer ajuste fino, trocar hardware e adicionar tarefas, sem precisar acumular dados do zero. A competição da inteligência incorporada está migrando de "construir um corpo que se move" para "o cérebro consegue ser reutilizado entre hardwares e tarefas".

Para terminar

Abrir o código de uma base humanoide de 6 bilhões de parâmetros não mostra retorno comercial no curto prazo, e o custo dos dados continua pesando. Mas isso resolve algo mais básico: dar a pesquisadores e desenvolvedores um lugar onde possam comparar referências.

No fim das contas, a prova que o setor robótico precisa passar são aquelas milhares de horas dentro de fábricas e lojas; o dia do lançamento é só a abertura. Quem tornar "disponibilidade contínua" algo concreto é quem realmente entrou em campo.

O que resta para o setor observar é bem específico: qual é a taxa de reprodução desse lançamento, quão rápido é a iteração em projetos reais e quantas pessoas ainda estarão enviando melhorias seis meses depois. A agitação do dia do lançamento vai passar; só fica o que continua sendo usado.

Artigos relacionados