O Atlas de Fei-Fei Li transforma uma foto em uma sala pela qual você pode caminhar

A World Labs colocou o Atlas em acesso antecipado em 1º de setembro. A empresa, cofundada por Fei-Fei Li, o chama de modelo de mundo omni para inteligência espacial, e a demonstração consiste em algumas fotos comuns de celular de uma sala entrando e uma cena 3D interativa saindo. Você pode mover uma câmera virtual para qualquer lugar dela. Você pode extrair profundidade dela. Você pode entregar a geometria a um robô e usá-la como um lugar para praticar.
Li defende há anos que a próxima fronteira da IA não é a linguagem, mas o mundo físico. Seu termo é inteligência espacial, e a alegação é que um modelo treinado apenas com texto e imagens planas está perdendo algo fundamental. Modelos de linguagem descrevem um mundo que não conseguem ver. O Atlas é a tentativa mais clara até agora de construir um que consiga.
O que o Atlas faz
A World Labs descreve o Atlas como um transformer de difusão autorregressivo multimodal, uma única arquitetura que recebe texto, imagens, vídeo e dados 3D dentro de um mesmo arcabouço espacial e gera através do mesmo conjunto. As saídas são mais amplas que as de um gerador de vídeo: imagens e vídeos com controle de câmera em até 1440p para clipes de cerca de um minuto, além de novos pontos de vista, mapas de profundidade, nuvens de pontos e splats gaussianos 3D.
A saída volumétrica é o que separa isso de um modelo de texto para vídeo. Um gerador de vídeo prevê o próximo quadro. Ele não necessariamente sabe onde cada coisa fica no espaço nem como uma cena se parece a partir de um ângulo que a câmera nunca ocupou. O Atlas carrega uma representação 3D interna, então um ambiente se mantém coeso conforme o espectador se move por ele. A diferença entre um clipe plausível e um espaço navegável é justamente o motivo de chamar isso de modelo de mundo.
A partir de uma entrada esparsa, em algumas demonstrações apenas alguns quadros de filmagem de celular, o modelo reconstrói uma cena bem o suficiente para posicionar uma câmera virtual dentro dela. A World Labs relata um erro de reconstrução de vistas esparsas de 25,3, abaixo do melhor modelo especializado, com 28,7. Em avaliações cegas que encomendou, avaliadores humanos preferiram a aderência do Atlas a um movimento de câmera solicitado à do MiniMax H3 em 75% das vezes, à do Gemini Omni Flash em 81% e à do Seedance 2.5 em 94%.
Esses são os números da própria empresa, provenientes de avaliações que ela mesma realizou, o que vale dizer com todas as letras. O Atlas está em acesso antecipado, então ninguém fora do grupo de parceiros pode reproduzi-los ainda.
Real-to-sim, e por que os robôs se importam
As aplicações comerciais óbvias são efeitos visuais, jogos e produção virtual. Um cineasta pode encenar uma tomada depois da filmagem. O enquadramento que a World Labs privilegia, porém, é a robótica.
O fluxo de trabalho é chamado de real-to-sim. Você captura vídeo de um espaço real, e o Atlas o converte em uma simulação 3D na qual um robô pode ser treinado ou testado sem o custo e o risco de operar o ambiente real. Uma equipe de robótica que quer mil variações de um corredor de armazém pode escanear o corredor uma vez e gerar as variações em vez de filmar cada uma.
Esse é um ponto de dor restrito, mas genuíno. Dados de treinamento para robôs são caros porque coletá-los significa operar robôs. A simulação é barata, mas geralmente exige que alguém construa o ambiente à mão, o que é lento e muitas vezes não se parece em nada com o lugar real. Um modelo que transforma uma sala real em um arquivo de simulação funde duas etapas caras em uma. Isso também explica por que Nvidia e AMD são investidoras. Ambas vendem o poder computacional no qual treinamento e simulação rodam.
O problema da divulgação
Há uma lacuna entre a ambição e o rastro documental. A World Labs não publicou nenhum artigo de pesquisa, nenhuma ficha de modelo, nenhuma contagem de parâmetros e nenhum número de computação de treinamento junto com o Atlas. Não divulgou preço nem data de disponibilidade geral. Para um sistema que faz alegações comparativas contra concorrentes bem documentados, essa omissão é incomum, e torna os resultados das avaliações cegas impossíveis de verificar.
Céticos levantaram uma questão mais afiada: se o Atlas de fato simula o mundo ou apenas renderiza visões convincentes dele. Essas são capacidades diferentes, e a distinção importa para todo caso de uso que depende de física. Um modelo que renderiza uma sala a partir de um novo ângulo é útil para um filme. Um modelo pelo qual um robô aprende a caminhar precisa que os objetos nele se comportem como os objetos se comportam, ou a política aprende algo que só funciona no modelo.
A World Labs diz que o Atlas alimentará versões futuras do Marble, seu produto existente. Isso lhe dá um lar comercial, o que é mais do que a maioria dos anúncios de pesquisa tem. Se a geometria se sustenta além de demonstrações curadas é o que os parceiros de acesso antecipado descobrirão primeiro.
A contraparte chinesa
O Atlas não é o único modelo de mundo com uma ambição do tamanho de uma cidade. Em 10 de setembro, a empresa chinesa de mapas Amap lançou o ABot-Earth 0.7, que chama de primeiro modelo de mundo de cidade nativo em 3D do mundo. Ele recebe imagens de satélite ou uma descrição em texto e transforma isso em uma cena 3D interativa e navegável, gerando em múltiplas escalas, de um planeta até um ponto de referência em nível de rua, dentro de um único modelo. A Amap diz que consegue produzir uma cena 3D de cidade em escala de quilômetro em cerca de dez minutos em uma GPU de consumidor, no formato de splatting gaussiano 3D, e que o recurso já roda em seu produto Flight Street View.
Os dois apontam para a mesma ideia a partir de extremos opostos. O Atlas trabalha de um punhado de fotos para cima, reconstruindo uma sala com alta fidelidade. O ABot-Earth trabalha de dados de satélite para baixo, gerando uma cidade em escala. Juntos, eles esboçam o alcance que um modelo espacial pode cobrir, e também mostram como os dois mercados lançam de maneiras diferentes: um por meio de um programa de parceiros sem benchmarks públicos, o outro embutido em um produto de consumo no qual qualquer pessoa pode olhar o resultado.
O que os modelos espaciais ainda precisam provar
O campo tem impulso. O V-JEPA 2, da Meta, foi treinado com mais de um milhão de horas de vídeo. O Genie 2, do Google, gera ambientes 3D interativos, e o Gemini Robotics trabalha com raciocínio e manipulação no espaço físico. O argumento de Li, de que geometria e perspectiva precisam ser nativas do modelo em vez de inferidas do texto, passou de uma posição de pesquisa para uma categoria de produto.
O que nada disso resolveu é se um modelo que produz geometria coerente é a mesma coisa que um modelo que entende um espaço físico. A reconstrução é mensurável. A simulação é mais difícil, e é a que a robótica realmente precisa. O Atlas apresenta um argumento forte a favor da primeira. O próximo ano de resultados dos parceiros decidirá quanto da segunda vem junto.
Para designers e desenvolvedores, o efeito de curto prazo é mais modesto do que a linguagem de lançamento sugere. Uma ferramenta que reconstrói uma sala a partir de três fotos e permite voar com uma câmera por ela é genuinamente útil, e aparecerá dentro de softwares criativos antes de aparecer dentro de um robô. É assim que os modelos espaciais chegam à maioria das pessoas primeiro, pelo trabalho de criar uma cena, e não pelo trabalho de navegar por uma.
Artigos relacionados
O ranking de modelos de vídeo que ninguém divulga: para onde as requisições realmente vão
Toda semana surge um novo ranking de geração de vídeo, e quase todos são construídos da mesma forma.
A Ai2 Tornou Open Source o Stack de Treinamento, e Não Mais um Conjunto de Pesos
Pesos são fáceis de distribuir e difíceis de aprender com eles.
Qwen3.8-Max, da Alibaba, afirma que consegue programar sozinho por uma quinzena
Contagens de parâmetros deixaram de ser novidade há algum tempo. Doze dias é o número que vale examinar.
PixelUMM descarta os dois componentes dos quais todo modelo de IA visual depende
A difusão em nível de pixel já foi proposta antes e repetidamente esbarrou no custo computacional.