← Voltar ao blog
Aicerca de 7 min de leitura

Agora-2 defende que um modelo de mundo é uma máquina multijogador

Publicado 3 de out. de 2026
Agora-2 defende que um modelo de mundo é uma máquina multijogador

A Odyssey lançou o Agora-2 em 25 de setembro e o descreveu com uma frase que merece ser digerida com calma: um motor de jogo aprendido. Não um gerador de vídeo que por acaso aceita entradas. Um motor que prevê como as ações de todos em um espaço compartilhado alteram o estado desse espaço.

A prévia de pesquisa jogável é pequena de propósito. Quatro humanos contra dezesseis agentes, em um ambiente compartilhado que comporta até vinte participantes no total. Essa não é uma escala de produto. É a configuração mínima em que o problema interessante aparece.

Um clipe não é um mundo

A maioria dos modelos de vídeo responde a uma única pergunta: como devem ser os próximos quadros? Você fornece um prompt ou um primeiro quadro, espera e recebe um resultado que pode assistir. Não há estado a manter, porque nada do que o espectador faz muda coisa alguma.

Um modelo de mundo precisa responder a uma pergunta mais difícil. Dado o estado atual e as ações de todos os que estão nele, no que o estado se transforma? Isso significa manter uma representação consistente do ambiente ao longo do tempo e atualizá-la em tempo real conforme as entradas chegam. Quando apenas uma pessoa se move por uma cena, dá para simular boa parte disso. A câmera vai para onde a câmera vai, e o modelo só precisa manter o mundo verossímil ao longo de um único caminho.

Adicionar pessoas quebra a ilusão de formas úteis. Dois participantes podem querer coisas incompatíveis. Um bloqueia a porta de que o outro precisa. Um arremessa algo que cai em um lugar que muda o que um terceiro pode fazer. O estado deixa de ser um caminho por uma cena. Ele passa a ser um objeto compartilhado no qual vários atores escrevem ao mesmo tempo, e o modelo precisa resolver essas escritas como um motor de física faria — exceto que não há motor. Há uma rede neural prevendo o próximo estado.

Uma mesa redonda escura vista de um ângulo baixo, dezenas de pequenas peças brilhantes flagradas em pleno movimento com finas linhas de luz traçando seus caminhos

É por isso que dezesseis agentes contra quatro humanos é o teste específico que a Odyssey escolheu. Agentes são baratos de gerar, agem continuamente e farão coisas que um testador humano não pensaria em tentar. Se o modelo só parece plausível a partir de um ponto de vista se movendo no ritmo de um humano, um pequeno enxame vai encontrar a costura em poucos minutos.

Motores aprendidos são a aposta interessante

Os jogos eletrônicos simulam estado compartilhado há décadas. A diferença está em como o estado é produzido. Um motor convencional tem código que define o que acontece quando dois objetos colidem, como um projétil viaja e o que uma superfície faz sob os pés. As regras são escritas, então o resultado é determinístico e barato de calcular. A maior parte do trabalho vai para o conteúdo, não para decidir o que é verdade.

Um motor aprendido substitui as regras por um modelo que prevê resultados a partir de exemplos. Isso inverte a estrutura de custos. Você já não escreve o que acontece quando uma porta está bloqueada, porque o modelo já viu portas bloqueadas o suficiente para inferir isso. O que você abre mão é da certeza. Um motor escrito não alucina uma parede que não estava lá. Um aprendido pode alucinar, e em uma sessão compartilhada esse erro não fica na tela de um único espectador. Todos veem a mesma parede errada, o que é ou um mundo compartilhado ou um bug compartilhado, dependendo de o modelo ter adivinhado o que você queria.

Obter comportamento em tempo real em cima disso é a outra parte difícil. Prever o próximo estado uma vez é um problema de pesquisa. Prevê-lo rápido o suficiente para que quatro pessoas com controles não percebam que estão esperando por inferência é um problema de sistemas, e é ele que decide se algo assim vira produto.

Para que serve de fato a prévia

Lançar uma prévia jogável em vez de um vídeo de demonstração é um movimento deliberado. Uma demonstração mostra o modelo em seu melhor momento, em um caminho escolhido pelos criadores. Uma prévia com participantes reais, incluindo um enxame de agentes, gera os casos de falha de que a equipe precisa e que não consegue imaginar facilmente.

Ela também testa aquilo que um benchmark não consegue medir. Modelos de mundo costumam ser avaliados por quão convincente parece um minuto gerado. Essa métrica quase não diz nada sobre se o ambiente permanece coerente quando alguém faz algo inesperado, ou se dois participantes que discordam sobre o estado recebem a mesma resposta.

A metade do experimento composta por agentes é a escolha mais reveladora. Instituições que treinam robôs e agentes de software precisam de ambientes onde muitos atores interajam ao mesmo tempo, e em geral os constroem à mão ou reutilizam motores de jogos que vêm com um conjunto fixo de regras. Um modelo de mundo aprendido prometeu substituir isso, e a promessa só vale se ele aguentar vinte escritores simultâneos. Quatro humanos comandando dezesseis agentes é uma compressão desse problema em algo que você consegue de fato assistir.

Onde isso desemboca

É fácil ler um motor de jogo aprendido como um passo rumo a jogos que se geram sozinhos. O uso mais próximo é menos glamouroso e mais provável: ambientes para treinar e avaliar agentes. Um modelo de mundo capaz de manter um estado compartilhado e responder a muitos atores ao mesmo tempo é um ambiente onde você pode colocar cem agentes e observar o que eles fazem, que é exatamente o que equipes que desenvolvem software de agentes precisam e hoje, em grande parte, constroem à mão.

Se o Agora-2 se torna infraestrutura ou uma curiosidade de pesquisa depende dos números entediantes que a prévia não resolve. Consistência de estado ao longo de sessões longas, custo por participante por hora e a elegância com que lida com o caso em que um participante faz algo que o modelo nunca viu. O conceito de um ambiente compartilhado e aprendido passou do papel para uma build jogável neste mês. Fazer com que ele aguente vinte escritores simultâneos é a parte que vai consumir o próximo ano.

A razão para acompanhar isso de perto é o que uma versão funcional substituiria. Hoje, qualquer pessoa que treine um agente contra um ambiente rico ou constrói um simulador à mão, o que é lento e limitado, ou pega emprestado um motor de jogo, o que impõe um conjunto fixo de regras que o agente não consegue surpreender. Um motor aprendido remove as duas restrições de uma vez: nenhuma regra a escrever e nenhum teto para as situações que podem surgir, porque as situações são geradas em vez de escritas. A prévia de quatro contra dezesseis é o menor teste dessa ideia que ainda produz conflito significativo, o que é o lugar certo para começar.

Há um custo que a prévia também expõe. Previsão em tempo real para vinte participantes significa rodar inferência continuamente para cada um deles, e isso é o oposto da geração em lote que torna os modelos de vídeo acessíveis hoje. Servir um mundo custa dinheiro a cada segundo em que ele está vivo, enquanto servir um vídeo custa dinheiro uma vez. Se ambientes aprendidos forem usados em execuções de treinamento que duram dias, a economia precisa melhorar em ordens de magnitude, e isso é tanto um problema de hardware e eficiência quanto de modelagem.

Artigos relacionados