Agora-2 sostiene che un modello del mondo è una macchina multiplayer

Odyssey ha rilasciato Agora-2 il 25 settembre e l'ha descritto con una frase su cui vale la pena soffermarsi: un motore di gioco appreso. Non un generatore video che per caso accetta input. Un motore che prevede come le azioni di tutti in uno spazio condiviso cambiano lo stato di quello spazio.
L'anteprima di ricerca giocabile è piccola di proposito. Quattro umani contro sedici agenti, in un ambiente condiviso che ospita fino a venti partecipanti in totale. Non è una scala da prodotto. È la configurazione minima in cui emerge il problema interessante.
Una clip non è un mondo
La maggior parte dei modelli video risponde a una domanda: che aspetto dovrebbero avere i fotogrammi successivi? Gli dai un prompt o un primo fotogramma, aspetti e ottieni un risultato che puoi guardare. Non c'è alcuno stato da mantenere, perché nulla di ciò che fa lo spettatore cambia qualcosa.
Un modello del mondo deve rispondere a una domanda più difficile. Dato lo stato attuale e le azioni di tutti coloro che vi si trovano, in che cosa si trasforma lo stato? Ciò significa mantenere una rappresentazione coerente dell'ambiente nel tempo e aggiornarla in tempo reale man mano che arrivano gli input. Quando solo una persona si muove in una scena, puoi simulare gran parte di questo. La telecamera va dove va la telecamera, e il modello deve solo mantenere il mondo credibile lungo un unico percorso.
Aggiungere persone rompe l'illusione in modi utili. Due partecipanti possono volere cose incompatibili. Uno blocca una porta di cui l'altro ha bisogno. Uno lancia qualcosa che atterra in un punto che cambia ciò che un terzo può fare. Lo stato non è più un percorso attraverso una scena. È un oggetto condiviso su cui diversi attori scrivono contemporaneamente, e il modello deve risolvere quelle scritture come farebbe un motore fisico, tranne che non c'è alcun motore. C'è una rete neurale che prevede lo stato successivo.

Ecco perché sedici agenti contro quattro umani è il test specifico scelto da Odyssey. Gli agenti sono economici da generare, agiscono in continuazione e faranno cose a cui un tester umano non penserebbe di provare. Se il modello sembra plausibile solo da un punto di vista che si muove a passo umano, un piccolo sciame troverà la falla in pochi minuti.
I motori appresi sono la scommessa interessante
I videogiochi simulano stati condivisi da decenni. La differenza sta in come viene prodotto lo stato. Un motore convenzionale ha codice che definisce cosa succede quando due oggetti si scontrano, come viaggia un proiettile e cosa fa una superficie sotto i piedi. Le regole sono scritte, quindi il risultato è deterministico ed economico da calcolare. La maggior parte del lavoro va nei contenuti, non nel decidere cosa è vero.
Un motore appreso sostituisce le regole con un modello che prevede i risultati a partire da esempi. Questo inverte la struttura dei costi. Non scrivi più cosa succede quando una porta è bloccata, perché il modello ha visto abbastanza porte bloccate da dedurlo. Quello a cui rinunci è la certezza. Un motore scritto non allucina un muro che non c'era. Uno appreso può farlo, e in una sessione condivisa quell'errore non resta sullo schermo di un solo spettatore. Tutti vedono lo stesso muro sbagliato, che è o un mondo condiviso o un bug condiviso, a seconda che il modello abbia indovinato ciò che volevi.
Ottenere un comportamento in tempo reale su tutto questo è l'altra parte difficile. Prevedere lo stato successivo una volta è un problema di ricerca. Prevederlo abbastanza velocemente perché quattro persone con i controller non si accorgano di aspettare l'inferenza è un problema di sistemi, ed è quello che decide se qualcosa del genere diventerà un prodotto.
A cosa serve davvero l'anteprima
Rilasciare un'anteprima giocabile invece di un video dimostrativo è una mossa deliberata. Una demo mostra il modello al suo meglio su un percorso scelto dai creatori. Un'anteprima con partecipanti reali, incluso uno sciame di agenti, genera i casi di fallimento di cui il team ha bisogno e che non riesce facilmente a immaginare.
Mette anche alla prova ciò che un benchmark non può misurare. I modelli del mondo vengono di solito giudicati da quanto convincente appare un minuto generato. Questa metrica non dice quasi nulla sulla capacità dell'ambiente di restare coerente quando qualcuno fa qualcosa di inaspettato, o se due partecipanti che non concordano sullo stato ricevono la stessa risposta.
La metà dell'esperimento dedicata agli agenti è la scelta più rivelatrice. Le istituzioni che addestrano robot e agenti software hanno bisogno di ambienti in cui molti attori interagiscono contemporaneamente, e per lo più li costruiscono a mano o riutilizzano motori di gioco che hanno un insieme fisso di regole. Un modello del mondo appreso prometteva di sostituire tutto ciò, e la promessa vale solo se regge sotto venti scrittori simultanei. Quattro umani che dirigono sedici agenti sono una compressione di quel problema in qualcosa che puoi davvero guardare.
Dove questo ci porta
È facile leggere un motore di gioco appreso come un passo verso giochi che si generano da soli. L'uso a breve termine è meno affascinante e più probabile: ambienti per addestrare e valutare agenti. Un modello del mondo che può mantenere uno stato condiviso e rispondere a molti attori contemporaneamente è un ambiente in cui puoi mettere cento agenti e osservare cosa fanno, esattamente ciò di cui hanno bisogno i team che costruiscono software per agenti e che attualmente per lo più costruiscono a mano.
Se Agora-2 diventerà infrastruttura o una curiosità di ricerca dipende dai numeri noiosi che l'anteprima non chiarisce. La coerenza dello stato su sessioni lunghe, il costo per partecipante all'ora e quanto gestisce con eleganza il caso in cui un partecipante fa qualcosa che il modello non ha mai visto. Il concetto di un ambiente condiviso e appreso è passato dalla carta a una build giocabile questo mese. Farlo reggere sotto venti scrittori simultanei è la parte che richiederà il prossimo anno.
Il motivo per osservarlo da vicino è ciò che una versione funzionante sostituirebbe. Oggi, chiunque addestri un agente in un ambiente ricco o costruisce a mano un simulatore, che è lento e limitato, oppure prende in prestito un motore di gioco, che impone un insieme fisso di regole che l'agente non può sorprendere. Un motore appreso rimuove entrambi i vincoli in una volta: nessuna regola da scrivere e nessun tetto alle situazioni che possono presentarsi, perché le situazioni sono generate anziché scritte da un autore. L'anteprima quattro contro sedici è il test più piccolo di quell'idea che produca ancora un conflitto significativo, ed è il punto giusto da cui partire.
C'è anche un costo che l'anteprima mette in luce. La previsione in tempo reale per venti partecipanti significa eseguire l'inferenza in continuazione per ognuno di loro, ed è l'opposto della generazione in batch che rende oggi convenienti i modelli video. Servire un mondo costa denaro ogni secondo in cui è vivo, mentre servire un video costa denaro una volta sola. Se gli ambienti appresi verranno usati per sessioni di addestramento che durano giorni, l'economia deve migliorare di ordini di grandezza, e questo è un problema di hardware ed efficienza tanto quanto di modellazione.
Articoli correlati
Le immagini di prodotto AI stanno colpendo un muro di conformità che nessuno aveva messo in conto
Il costo è sempre stato indicato per generazione. Il costo reale è prezzato per asset che sopravvive alla revisione.
I robot possono svolgere il 74 per cento del lavoro fisico, ma quasi nulla di tutto ciò è economicamente conveniente
La capacità c'è in larga misura. L'economia no. Quarant'anni per arrivare al dieci per cento non è una previsione che giustifica il panico.
Un modello agentico open-weight da 744 miliardi di parametri arriva con licenza MIT
La licenza è il marketing. Un modello da 744B che chiunque può scaricare rimette in discussione il calcolo comprare-o-costruire.
I modelli video AI cinesi entrano a Hollywood: 73 inquadrature negli effetti visivi della serie Amazon
A espatriare non sono le serie, ma gli strumenti con cui si fanno.