Agora-2 untermauert die These, dass ein Weltmodell eine Mehrspieler-Maschine ist

Odyssey hat Agora-2 am 25. September veröffentlicht und mit einer Formulierung beschrieben, die es wert ist, sacken zu lassen: eine gelernte Spiel-Engine. Kein Videogenerator, der zufällig auch Eingaben annimmt. Sondern eine Engine, die vorhersagt, wie die Handlungen aller in einem gemeinsamen Raum den Zustand dieses Raums verändern.
Die spielbare Forschungsvorschau ist bewusst klein. Vier Menschen gegen sechzehn Agenten in einer gemeinsamen Umgebung, die insgesamt bis zu zwanzig Teilnehmer fasst. Das ist keine Produktgröße. Es ist die minimale Konfiguration, in der das interessante Problem sichtbar wird.
Ein Clip ist keine Welt
Die meisten Videomodelle beantworten eine Frage: Wie sollen die nächsten Frames aussehen? Man gibt ihnen einen Prompt oder ein erstes Bild, wartet und bekommt ein Ergebnis, das man sich ansehen kann. Es gibt keinen Zustand, den man pflegen müsste, weil nichts, was der Betrachter tut, irgendetwas verändert.
Ein Weltmodell muss eine schwierigere Frage beantworten. Was wird aus dem Zustand, wenn man den aktuellen Zustand und die Handlungen aller darin berücksichtigt? Das bedeutet, über die Zeit eine konsistente Repräsentation der Umgebung zu halten und sie in Echtzeit zu aktualisieren, sobald Eingaben eintreffen. Wenn sich nur eine Person durch eine Szene bewegt, lässt sich viel davon vortäuschen. Die Kamera bewegt sich dorthin, wohin die Kamera sich bewegt, und das Modell muss die Welt nur entlang eines Pfades glaubwürdig halten.
Weitere Personen hinzuzufügen zerstört die Illusion auf nützliche Weise. Zwei Teilnehmer können Unvereinbares wollen. Einer blockiert eine Tür, die der andere braucht. Einer wirft etwas, das an einer Stelle landet, die verändert, was ein Dritter tun kann. Der Zustand ist kein Pfad durch eine Szene mehr. Er ist ein gemeinsames Objekt, in das mehrere Akteure gleichzeitig schreiben, und das Modell muss diese Schreibzugriffe so auflösen, wie es eine Physik-Engine täte – nur dass es keine Engine gibt. Es gibt ein neuronales Netz, das den nächsten Zustand vorhersagt.

Deshalb ist sechzehn Agenten gegen vier Menschen genau der Test, für den Odyssey sich entschieden hat. Agenten lassen sich billig erzeugen, sie handeln kontinuierlich, und sie tun Dinge, auf die ein menschlicher Tester nicht kommen würde. Wenn das Modell nur aus einer Perspektive glaubhaft aussieht, die sich in menschlichem Tempo bewegt, findet ein kleiner Schwarm die Nahtstelle innerhalb von Minuten.
Gelernte Engines sind die interessante Wette
Videospiele simulieren seit Jahrzehnten gemeinsame Zustände. Der Unterschied liegt darin, wie der Zustand erzeugt wird. Eine herkömmliche Engine hat Code, der definiert, was passiert, wenn zwei Objekte kollidieren, wie ein Projektil fliegt und was eine Oberfläche unter den Füßen tut. Die Regeln sind geschrieben, also ist das Ergebnis deterministisch und günstig zu berechnen. Der größte Teil der Arbeit fließt in Inhalte, nicht in die Entscheidung, was wahr ist.
Eine gelernte Engine ersetzt die Regeln durch ein Modell, das Ergebnisse aus Beispielen vorhersagt. Das kehrt die Kostenstruktur um. Man schreibt nicht mehr auf, was passiert, wenn eine Tür blockiert ist, weil das Modell genug blockierte Türen gesehen hat, um es abzuleiten. Was man aufgibt, ist Gewissheit. Eine geschriebene Engine halluziniert keine Wand, die nicht da war. Eine gelernte kann das, und in einer gemeinsamen Sitzung bleibt dieser Fehler nicht auf dem Bildschirm eines Betrachters. Alle sehen dieselbe falsche Wand, was entweder eine gemeinsame Welt oder ein gemeinsamer Bug ist – je nachdem, ob das Modell erraten hat, was man wollte.
Echtzeitverhalten obendrauf zu bekommen, ist der andere schwierige Teil. Den nächsten Zustand einmal vorherzusagen, ist ein Forschungsproblem. Ihn schnell genug vorherzusagen, dass vier Menschen mit Controllern nicht merken, dass sie auf Inferenz warten, ist ein Systemproblem – und genau das entscheidet, ob so etwas zu einem Produkt wird.
Wofür die Vorschau tatsächlich gedacht ist
Eine spielbare Vorschau statt eines Demo-Videos zu veröffentlichen, ist eine bewusste Entscheidung. Eine Demo zeigt das Modell von seiner besten Seite auf einem Pfad, den die Entwickler ausgewählt haben. Eine Vorschau mit echten Teilnehmern, einschließlich eines Schwarms von Agenten, erzeugt genau die Fehlerfälle, die das Team braucht und sich nicht leicht vorstellen kann.
Sie testet außerdem das, was ein Benchmark nicht messen kann. Weltmodelle werden üblicherweise danach beurteilt, wie überzeugend eine generierte Minute aussieht. Diese Kennzahl sagt fast nichts darüber aus, ob die Umgebung kohärent bleibt, wenn jemand etwas Unerwartetes tut, oder ob zwei Teilnehmer, die sich über den Zustand uneinig sind, dieselbe Antwort bekommen.
Die Agenten-Hälfte des Experiments ist die aufschlussreichere Wahl. Institutionen, die Roboter und Softwareagenten trainieren, brauchen Umgebungen, in denen viele Akteure gleichzeitig interagieren, und sie bauen diese meist von Hand oder greifen auf Spiel-Engines mit einem festen Regelsatz zurück. Ein gelerntes Weltmodell versprach, das zu ersetzen, und dieses Versprechen zählt nur, wenn es zwanzig gleichzeitigen Schreibern standhält. Vier Menschen, die sechzehn Agenten steuern, sind eine Verdichtung dieses Problems zu etwas, das man tatsächlich beobachten kann.
Wo das landet
Es ist leicht, eine gelernte Spiel-Engine als Schritt zu Spielen zu lesen, die sich selbst generieren. Der näher liegende Nutzen ist weniger glamourös und wahrscheinlicher: Umgebungen zum Trainieren und Evaluieren von Agenten. Ein Weltmodell, das einen gemeinsamen Zustand halten und auf viele Akteure gleichzeitig reagieren kann, ist eine Umgebung, in die man hundert Agenten setzen und beobachten kann, was sie tun – genau das, was Teams, die Agenten-Software bauen, brauchen und derzeit meist von Hand erstellen.
Ob Agora-2 Infrastruktur oder eine Forschungsbesonderheit wird, hängt von den langweiligen Zahlen ab, die die Vorschau nicht klärt. Zustandskonsistenz über lange Sitzungen, Kosten pro Teilnehmer und Stunde und wie souverän es mit dem Fall umgeht, dass ein Teilnehmer etwas tut, das das Modell noch nie gesehen hat. Das Konzept einer gemeinsamen, gelernten Umgebung ist diesen Monat vom Papier zu einem spielbaren Build geworden. Dafür zu sorgen, dass es zwanzig gleichzeitigen Schreibern standhält, ist der Teil, der das nächste Jahr in Anspruch nimmt.
Der Grund, es genau zu beobachten, ist das, was eine funktionierende Version ersetzen würde. Heute baut jeder, der einen Agenten gegen eine reichhaltige Umgebung trainiert, entweder von Hand einen Simulator, was langsam und eng ist, oder leiht sich eine Spiel-Engine, die einen festen Regelsatz vorgibt, den der Agent nicht überraschen kann. Eine gelernte Engine beseitigt beide Einschränkungen auf einmal: keine Regeln zu schreiben und keine Obergrenze für die Situationen, die entstehen können, weil die Situationen generiert statt verfasst werden. Die Vier-gegen-sechzehn-Vorschau ist der kleinste Test dieser Idee, der noch bedeutsamen Konflikt erzeugt – der richtige Ausgangspunkt.
Die Vorschau legt auch einen Kostenfaktor offen. Echtzeitvorhersage für zwanzig Teilnehmer bedeutet, kontinuierlich Inferenz für jeden einzelnen von ihnen auszuführen, und das ist das Gegenteil der Batch-Generierung, die Videomodelle heute bezahlbar macht. Eine Welt zu betreiben kostet Geld in jeder Sekunde, in der sie lebt, während ein Video zu erzeugen einmalig Geld kostet. Wenn gelernte Umgebungen für Trainingsläufe genutzt werden sollen, die Tage dauern, muss sich die Wirtschaftlichkeit um Größenordnungen verbessern – und das ist ebenso ein Hardware- und Effizienzproblem wie ein Modellierungsproblem.
Verwandte Artikel
KI-Produktbilder treffen auf eine Compliance-Hürde, die niemand eingepreist hat
Die Kosten wurden immer pro Generierung angegeben. Die echten Kosten werden pro Asset bemessen, das die Prüfung übersteht.
Roboter können 74 Prozent der körperlichen Arbeit erledigen – und fast nichts davon rechnet sich
Die Fähigkeit ist weitgehend vorhanden. Die Wirtschaftlichkeit nicht. Vierzig Jahre bis zehn Prozent sind keine Prognose, die Panik rechtfertigt.
Ein offenes agentisches 744B-Modell erscheint unter MIT-Lizenz
Die Lizenz ist das Marketing. Ein 744B-Modell, das jeder herunterladen kann, setzt die Kaufen-oder-selbst-bauen-Kalkulation neu.
Chinesische KI-Videomodelle in Hollywood: 73 Einstellungen in den Visual Effects dieser Amazon-Serie
Was ins Ausland geht, sind nicht die Serien, sondern die Werkzeuge, mit denen sie gemacht werden.