Unitree e ZDTaichu correm para ser o cérebro espacial do robô

Há já algum tempo que os robôs são bons no corpo. Um humanoide consegue andar, equilibrar-se e agarrar. Aquilo em que tem sido mau é a parte que decide o que fazer a seguir, especialmente quando a sala não é a sala em que foi treinado. Mude um copo de sítio, altere a bancada de trabalho, entregue ao robô uma tarefa a meio, e a demonstração desfaz-se.
Dois lançamentos chineses em setembro foram atrás dessa parte. A Unitree apresentou o UnifoLM-WLA-1.0, um modelo de base para humanoides com seis mil milhões de parâmetros, treinado com cerca de 2.500 horas de dados reais de robôs, alegando sete resultados de state-of-the-art de código aberto em raciocínio incorporado. A ZDTaichu, derivada da Academia Chinesa de Ciências e do Wuhan AI Research Institute, abriu o código do ZDTaichu5.0-9B a 15 de setembro, um modelo multimodal de nove mil milhões de parâmetros que conquistou o primeiro lugar em oito de nove benchmarks internacionais de compreensão espacial dentro da sua classe de parâmetros.
Nenhum deles é um robô. Ambos são tentativas de construir o cérebro com que um robô funciona, e ambos foram lançados em vez de mostrados atrás de uma parede de demonstração.
A aposta da Unitree na generalidade
O número que se destaca no lançamento da Unitree é 64. Um único modelo afirma coordenar 64 tarefas diferentes, desde dobrar toalhas e guardar a louça até fazer uma cama, tirar o lixo e carregar uma máquina de lavar. O objetivo dessa lista não é nenhuma tarefa individual. É que os mesmos pesos dão conta de todas elas.
Esse tem sido o problema central na robótica durante anos. A maioria das demonstrações é de tarefa única, cena única e fortemente ajustada. Parecem impressionantes e não transferem. Uma política que dobra uma toalha sob uma condição de iluminação não dobra uma toalha de cor diferente numa mesa diferente. Escalar uma força de trabalho robótica com esse modelo significa ensinar-lhe cada variação, o que não é escalar.
A abordagem da Unitree assenta numa base de raciocínio incorporado chamada UnifoLM-ER-1-4B, construída sobre o Qwen3-VL-4B e treinada com mais de cinco milhões de amostras de raciocínio incorporado. Em 16 benchmarks de perceção e compreensão multimodal, lidera o setor em sete deles. Em dois testes espaciais, Where2Place e EmbSpatial, obtém 82,0 e 88,9 contra 69,0 e 83,3 do GPT-6 Astra. São comparações específicas com um modelo fechado, o que as torna mais fáceis de contestar do que uma alegação geral de superioridade.
A Unitree diz que vai abrir o modelo, o código e o conjunto de dados. Este último item é o que importa. Uma política de robô com pesos abertos mas um conjunto de dados fechado não pode ser reproduzida, apenas utilizada. Divulgar os dados é o que permite a outro laboratório verificar a alegação ou construir sobre ela.
A aposta da ZDTaichu no raciocínio espacial
O ZDTaichu5.0-9B ataca o problema pelo lado da perceção. O modelo lida com texto, imagens únicas, imagens múltiplas, vídeo longo e resoluções arbitrárias, e o seu argumento de venda é o raciocínio espacial: compreender onde estão os objetos, como se relacionam e como uma cena muda quando o ponto de vista se desloca.
A diferença de benchmark que destaca está no MindCube-tiny, onde obtém 78,27, mais de 20 pontos à frente do Qwen3.5-9B e mais de 15 à frente do STEP3-VL-10B. Numa demonstração, quando lhe pedem para encontrar a segunda caixa prateada a contar da esquerda, devolve as coordenadas corretas, enquanto outros modelos abertos de tamanho semelhante apontam todos para o lugar errado. Num teste entre pontos de vista, só este modelo mantém o referencial correto quando o ângulo da câmara muda.
Essas são as falhas que quebram robôs reais. Um modelo que reconhece um copo respondeu ao que é o objeto. Um modelo que sabe para que lado está virada a pega, e se há espaço para o pousar ao lado, já começou a responder ao que se pode fazer com ele. Quando uma tarefa se prolonga, esses juízos têm de se encadear: objeto levantado, identidade memorizada, recipiente aberto, estado atualizado. Um passo falhado e o resto da tarefa desvia-se.
O truque de engenharia da ZDTaichu é o raciocínio em ciclo adaptativo. As perguntas fáceis recebem menos computação. As difíceis, como transformações espaciais e relações entre objetos, recebem múltiplas passagens de raciocínio internas sem recorrer a uma ferramenta externa, o que evita que o custo em tokens dispare na maioria simples das entradas.
A parte do lançamento que pode importar mais é aquilo a que não impõe barreiras. A par dos pesos, a ZDTaichu publicou todo o seu pipeline de produção de dados multimodais espaciais, abrangendo pré-treino, ajuste fino supervisionado e aprendizagem por reforço. Instituições e empresas podem reutilizá-lo para transformar os seus próprios dados de fábrica ou de laboratório em amostras de treino. Isso responde a uma queixa que acompanha os lançamentos de modelos abertos há dois anos: recebe os pesos, mas não os pode adaptar aos seus próprios dados porque a receita permanece privada. O modelo tem estado a funcionar em campos de treino incorporado em Pequim, Foshan e Qingdao.
Dois caminhos para a mesma lacuna
Coloque os dois lançamentos lado a lado e a diferença é instrutiva. A Unitree trabalha do lado da ação para fora: pega numa política que tem de executar tarefas, treina-a com 2.500 horas de movimento real de robôs e mede se generaliza por 64 tarefas. A ZDTaichu trabalha do lado da perceção para dentro: pega num modelo multimodal que tem de compreender uma cena, treina-o em benchmarks espaciais e mede se mantém a geometria correta quando o ponto de vista se desloca.
Um robô precisa de ambos. Tem de saber onde está o copo e tem de saber como pegá-lo. Os dois laboratórios estão a atacar a mesma lacuna a partir de extremos opostos, e o facto de ambos terem publicado no mesmo mês sugere que o setor chegou a acordo sobre qual é a lacuna: a camada intermédia onde a perceção se transforma em ação, e onde uma tarefa que durava oito segundos se transforma numa que dura oito minutos.
A questão dos dados volta a separá-los. A Unitree treinou com movimento real de robôs, que é caro de recolher e raro. A ZDTaichu apoiou-se no seu pipeline de dados e em tarefas espaciais sintéticas, que escalam de forma diferente e carregam um risco diferente: o de um modelo ficar bom em cenas de teste e aí permanecer. Qualquer que seja o caminho que produza uma política capaz de sobreviver ao contacto com um armazém real, será ele a decidir qual fonte de dados era a aposta certa.
O contexto do setor
Ambos os lançamentos chegam a um setor que reorganizou recentemente os seus pressupostos. O Gemini Robotics 2, da Google, defende «um cérebro para qualquer robô». Jim Fan, da Nvidia, argumentou que os modelos visão-linguagem-ação estão mortos e que os modelos de ação sobre o mundo são o sucessor. O relatório da Gartner de setembro sobre as tendências de IA na China colocou a IA física e os modelos de mundo entre as direções que se tornaram requisitos estruturais em vez de experiências.
Essa reformulação é a razão pela qual um benchmark espacial importa mais do que uma pontuação de conversa. A competição em IA incorporada passou de quão bem um modelo fala sobre o mundo físico para se consegue agir nele, e as métricas acompanharam. Precisão de coordenadas, consistência de ponto de vista e conclusão de tarefas em diferentes cenas são o novo placar.
O que observar
A ressalva honesta sobre ambos os lançamentos é que a liderança em benchmarks de raciocínio espacial não é o mesmo que um robô que funciona num armazém. Um modelo pode colocar objetos corretamente num conjunto de teste e ainda assim falhar num braço real com uma garra presa ou má iluminação. A lacuna entre raciocinar e agir é onde morreu a maioria das promessas da robótica.
O que torna estes dois dignos de acompanhamento é a combinação de pesos abertos e pipelines de dados abertos. Se um laboratório fora da Unitree ou da ZDTaichu conseguir pegar em qualquer dos modelos, treiná-lo novamente no seu próprio hardware e publicar o resultado, as alegações são testadas em público. Se os lançamentos ficarem por benchmarks e demonstrações enquanto os concorrentes mantêm os dados fechados, o setor ficará onde tem estado: muitos vídeos impressionantes e muito poucos robôs a fazer trabalho útil numa terça-feira.
Artigos relacionados
As Imagens de Produtos com IA Estão Batendo em um Muro de Conformidade que Ninguém Precificou
O custo sempre foi cotado por geração. O custo real é medido por ativo que sobrevive à revisão.
Robôs podem fazer 74% do trabalho físico, e quase nada disso compensa
A capacidade está amplamente presente. A economia não. Quarenta anos para dez por cento não é uma previsão que justifique pânico.
Modelo agêntico de pesos abertos com 744B é lançado sob licença MIT
A licença é o marketing. Um modelo de 744B que qualquer um pode baixar redefine o cálculo entre comprar e construir.
Modelos de vídeo com IA da China chegam a Hollywood: 73 planos nos efeitos visuais da série da Amazon
O que cruza fronteiras não são as séries, mas as ferramentas para fazê-las.