Agora-2 défend l'idée qu'un modèle du monde est une machine multijoueur

Odyssey a publié Agora-2 le 25 septembre et l'a décrit en une phrase qui mérite qu'on s'y attarde : un moteur de jeu appris. Pas un générateur de vidéo qui se trouve accepter des entrées. Un moteur qui prédit comment les actions de chacun dans un espace partagé modifient l'état de cet espace.
L'aperçu de recherche jouable est volontairement petit. Quatre humains contre seize agents, dans un environnement partagé qui accueille jusqu'à vingt participants au total. Ce n'est pas une échelle de produit. C'est la configuration minimale où le problème intéressant apparaît.
Un clip n'est pas un monde
La plupart des modèles vidéo répondent à une seule question : à quoi doivent ressembler les prochaines images ? Donnez-leur un prompt ou une première image, attendez, et vous obtenez un résultat que vous pouvez regarder. Il n'y a aucun état à maintenir, parce que rien de ce que fait le spectateur ne change quoi que ce soit.
Un modèle du monde doit répondre à une question plus difficile. Étant donné l'état actuel et les actions de tous ceux qui s'y trouvent, que devient cet état ? Cela implique de maintenir une représentation cohérente de l'environnement dans le temps, et de la mettre à jour en temps réel à mesure que les entrées arrivent. Quand une seule personne traverse une scène, on peut simuler une grande partie de cela. La caméra va là où va la caméra, et le modèle n'a qu'à garder le monde crédible le long d'un seul chemin.
Ajouter des personnes brise l'illusion de manière utile. Deux participants peuvent vouloir des choses incompatibles. L'un bloque une porte dont l'autre a besoin. L'un lance un objet qui atterrit à un endroit qui change ce que peut faire un troisième. L'état n'est plus un chemin à travers une scène. C'est un objet partagé dans lequel plusieurs acteurs écrivent en même temps, et le modèle doit résoudre ces écritures comme le ferait un moteur physique, sauf qu'il n'y a pas de moteur. Il y a un réseau de neurones qui prédit l'état suivant.

C'est pourquoi seize agents contre quatre humains est le test précis qu'Odyssey a choisi. Les agents coûtent peu à créer, ils agissent en continu et ils feront des choses auxquelles un testeur humain ne penserait pas. Si le modèle ne paraît plausible que depuis un seul point de vue se déplaçant au rythme d'un humain, une petite nuée d'agents trouvera la faille en quelques minutes.
Les moteurs appris, voilà le pari intéressant
Les jeux vidéo simulent un état partagé depuis des décennies. La différence réside dans la façon dont cet état est produit. Un moteur classique contient du code qui définit ce qui se passe quand deux objets entrent en collision, comment se déplace un projectile, et comment se comporte une surface sous les pieds. Les règles sont écrites, donc le résultat est déterministe et peu coûteux à calculer. L'essentiel du travail porte sur le contenu, pas sur la détermination de ce qui est vrai.
Un moteur appris remplace les règles par un modèle qui prédit les résultats à partir d'exemples. Cela inverse la structure des coûts. Vous n'écrivez plus ce qui se passe quand une porte est bloquée, parce que le modèle a vu assez de portes bloquées pour l'inférer. Ce que vous perdez, c'est la certitude. Un moteur écrit n'hallucine pas un mur qui n'était pas là. Un moteur appris le peut, et dans une session partagée, cette erreur ne reste pas sur l'écran d'un seul spectateur. Tout le monde voit le même mur erroné, ce qui est soit un monde partagé, soit un bug partagé, selon que le modèle a deviné ou non ce que vous vouliez.
Obtenir un comportement en temps réel par-dessus tout cela est l'autre partie difficile. Prédire l'état suivant une fois est un problème de recherche. Le prédire assez vite pour que quatre personnes avec des manettes ne s'aperçoivent pas qu'elles attendent une inférence est un problème de systèmes, et c'est celui qui décide si quoi que ce soit de ce genre devient un produit.
À quoi sert réellement l'aperçu
Livrer un aperçu jouable plutôt qu'une vidéo de démonstration est un choix délibéré. Une démo montre le modèle sous son meilleur jour, sur un parcours choisi par ses créateurs. Un aperçu avec de vrais participants, dont une nuée d'agents, génère les cas d'échec dont l'équipe a besoin et qu'elle ne peut pas facilement imaginer.
Il teste aussi ce qu'un benchmark ne peut pas mesurer. Les modèles du monde sont généralement jugés sur le réalisme d'une minute générée. Cette métrique ne dit presque rien sur la cohérence de l'environnement quand quelqu'un fait quelque chose d'inattendu, ni sur le fait que deux participants en désaccord sur l'état obtiennent la même réponse.
La moitié « agents » de l'expérience est le choix le plus révélateur. Les institutions qui entraînent des robots et des agents logiciels ont besoin d'environnements où de nombreux acteurs interagissent simultanément, et elles les construisent le plus souvent à la main ou réutilisent des moteurs de jeu dotés d'un ensemble fixe de règles. Un modèle du monde appris promettait de remplacer cela, et cette promesse ne compte que s'il tient face à vingt rédacteurs simultanés. Quatre humains dirigeant seize agents, c'est la compression de ce problème en quelque chose que l'on peut réellement observer.
Où cela nous mène
Il est facile de voir dans un moteur de jeu appris une étape vers des jeux qui se génèrent eux-mêmes. L'usage à plus court terme est moins glamour et plus probable : des environnements pour entraîner et évaluer des agents. Un modèle du monde capable de maintenir un état partagé et de répondre à de nombreux acteurs simultanément est un environnement où l'on peut placer cent agents et observer ce qu'ils font, ce dont les équipes qui conçoivent des logiciels d'agents ont précisément besoin et qu'elles construisent aujourd'hui surtout à la main.
Que Agora-2 devienne une infrastructure ou une curiosité de recherche dépend des chiffres ennuyeux que l'aperçu ne tranche pas. La cohérence de l'état sur de longues sessions, le coût par participant et par heure, et la façon plus ou moins élégante dont il gère le cas où un participant fait quelque chose que le modèle n'a jamais vu. Le concept d'environnement partagé et appris est passé du papier à une version jouable ce mois-ci. Le faire tenir face à vingt rédacteurs simultanés, voilà la partie qui occupera l'année à venir.
La raison de le suivre de près, c'est ce qu'une version fonctionnelle remplacerait. Aujourd'hui, quiconque entraîne un agent dans un environnement riche soit construit un simulateur à la main, ce qui est lent et étroit, soit emprunte un moteur de jeu, qui impose un ensemble de règles fixe que l'agent ne peut pas surprendre. Un moteur appris lève les deux contraintes d'un coup : aucune règle à écrire, et aucun plafond sur les situations qui peuvent survenir, puisque ces situations sont générées plutôt qu'écrites. L'aperçu quatre contre seize est le plus petit test de cette idée qui produise encore un conflit significatif, ce qui en fait le bon point de départ.
L'aperçu expose aussi un coût. La prédiction en temps réel pour vingt participants signifie exécuter une inférence en continu pour chacun d'eux, et c'est l'inverse de la génération par lots qui rend les modèles vidéo abordables aujourd'hui. Servir un monde coûte de l'argent à chaque seconde où il est actif, tandis que servir une vidéo coûte de l'argent une seule fois. Si les environnements appris doivent servir à des entraînements qui durent des jours, l'économie doit s'améliorer de plusieurs ordres de grandeur, et c'est un problème de matériel et d'efficacité autant que de modélisation.
Articles associés
Les images produits par IA se heurtent à un mur de conformité que personne n’avait intégré dans ses coûts
Le coût a toujours été annoncé à la génération. Le coût réel se compte par visuel qui passe le contrôle.
Les robots peuvent effectuer 74 % du travail physique, et presque rien de tout cela n'est rentable
La capacité est largement présente. L'économie ne l'est pas. Quarante ans pour atteindre dix pour cent n'est pas une prévision qui justifie la panique.
Un modèle agentique à poids ouverts de 744 Md arrive sous licence MIT
La licence est le marketing. Un modèle de 744 Md que tout le monde peut télécharger rebat les cartes de l’arbitrage entre achat et construction.
Les modèles vidéo IA chinois débarquent à Hollywood : 73 plans dans les effets visuels de la série d'Amazon
Ce ne sont pas les séries qui s'exportent, mais les outils qui servent à les fabriquer.