Agora-2, 월드 모델이 멀티플레이어 머신임을 논증하다

Odyssey는 9월 25일 Agora-2를 공개하며 한 문장으로 설명했다. 곱씹어볼 만한 표현이다: 학습된 게임 엔진. 입력을 받아들이는 비디오 생성기가 아니다. 공유 공간에 있는 모든 사람의 행동이 그 공간의 상태를 어떻게 바꾸는지 예측하는 엔진이다.
플레이 가능한 연구 프리뷰는 의도적으로 작다. 네 명의 인간 대 열여섯 개의 에이전트, 총 스무 명까지 수용하는 공유 환경에서 진행된다. 이는 제품 규모가 아니다. 흥미로운 문제가 드러나는 최소 구성이다.
클립은 월드가 아니다
대부분의 비디오 모델은 한 가지 질문에 답한다: 다음 프레임은 어떤 모습이어야 하는가? 프롬프트나 첫 프레임을 입력하고 기다리면 시청할 수 있는 결과가 나온다. 유지할 상태가 없는데, 시청자가 무엇을 해도 아무것도 바뀌지 않기 때문이다.
월드 모델은 더 어려운 질문에 답해야 한다. 현재 상태와 그 안에 있는 모든 이의 행동이 주어졌을 때, 상태는 어떻게 되는가? 이는 시간에 걸쳐 환경의 일관된 표현을 유지하고, 입력이 들어오는 대로 실시간으로 갱신한다는 뜻이다. 한 사람만 장면을 이동할 때는 이 많은 부분을 속일 수 있다. 카메라는 카메라가 가는 곳으로 가고, 모델은 한 경로를 따라 세계를 그럴듯하게 유지하기만 하면 된다.
사람을 추가하면 환상이 유용한 방식으로 깨진다. 두 참가자가 양립할 수 없는 것을 원할 수 있다. 한 명이 다른 사람에게 필요한 문을 막는다. 한 명이 던진 물건이 떨어진 위치가 세 번째 사람이 할 수 있는 일을 바꾼다. 상태는 더 이상 장면을 통과하는 경로가 아니다. 여러 행위자가 동시에 쓰는 공유 객체이며, 모델은 물리 엔진이 하듯 그 쓰기 작업을 해결해야 한다. 다만 엔진은 없다. 다음 상태를 예측하는 신경망이 있을 뿐이다.

그래서 Odyssey가 선택한 구체적 테스트가 열여섯 에이전트 대 네 인간이다. 에이전트는 생성 비용이 저렴하고, 지속적으로 행동하며, 인간 테스터가 시도할 생각을 못 하는 일을 벌인다. 모델이 인간의 속도로 움직이는 한 시점에서만 그럴듯해 보인다면, 작은 군집이 몇 분 안에 이음새를 찾아낼 것이다.
학습된 엔진이라는 흥미로운 베팅
비디오 게임은 수십 년 동안 공유 상태를 시뮬레이션해 왔다. 차이는 상태가 만들어지는 방식이다. 전통적인 엔진에는 두 물체가 충돌할 때 무슨 일이 일어나는지, 발사체가 어떻게 이동하는지, 발밑의 표면이 어떤 역할을 하는지 정의하는 코드가 있다. 규칙이 작성되어 있으므로 결과는 결정적이고 계산 비용이 저렴하다. 대부분의 작업은 무엇이 참인지 결정하는 데가 아니라 콘텐츠에 들어간다.
학습된 엔진은 규칙을 예시로부터 결과를 예측하는 모델로 대체한다. 이는 비용 구조를 뒤집는다. 문이 막혔을 때 무슨 일이 일어나는지 더 이상 작성하지 않아도 된다. 모델이 막힌 문을 충분히 많이 봐서 추론할 수 있기 때문이다. 포기하는 것은 확실성이다. 작성된 엔진은 없던 벽을 환각하지 않는다. 학습된 엔진은 그럴 수 있으며, 공유 세션에서는 그 오류가 한 시청자의 화면에 머물지 않는다. 모두가 같은 잘못된 벽을 본다. 이는 모델이 당신이 원한 것을 추측했는지에 따라 공유 세계가 되기도 하고 공유 버그가 되기도 한다.
그 위에 실시간 동작을 얹는 것이 또 다른 어려운 부분이다. 다음 상태를 한 번 예측하는 것은 연구 문제다. 컨트롤러를 든 네 사람이 추론을 기다리고 있다는 것을 눈치채지 못할 만큼 빠르게 예측하는 것은 시스템 문제이며, 이런 것이 제품이 될 수 있는지를 결정하는 문제다.
프리뷰의 실제 목적
데모 영상이 아니라 플레이 가능한 프리뷰를 내놓는 것은 의도적인 선택이다. 데모는 제작자가 고른 경로에서 모델의 최고 모습을 보여준다. 에이전트 군집을 포함한 실제 참가자가 있는 프리뷰는 팀이 필요로 하지만 쉽게 상상할 수 없는 실패 사례를 만들어낸다.
또한 벤치마크가 측정할 수 없는 것을 테스트한다. 월드 모델은 보통 생성된 1분이 얼마나 설득력 있게 보이는지로 평가된다. 그 지표는 누군가 예상치 못한 일을 했을 때 환경이 일관성을 유지하는지, 또는 상태에 대해 의견이 다른 두 참가자가 같은 답을 얻는지에 대해서는 거의 말해주지 않는다.
실험의 에이전트 절반이 더 많은 것을 드러내는 선택이다. 로봇과 소프트웨어 에이전트를 훈련하는 기관은 여러 행위자가 동시에 상호작용하는 환경이 필요하며, 대부분 이를 직접 만들거나 고정된 규칙 세트가 딸린 게임 엔진을 재사용한다. 학습된 월드 모델은 그것을 대체하겠다고 약속했고, 그 약속은 스무 명의 동시 작성자 아래에서 버틸 때만 의미가 있다. 네 명의 인간이 열여섯 에이전트를 지휘하는 것은 그 문제를 실제로 지켜볼 수 있는 형태로 압축한 것이다.
이것이 도달하는 지점
학습된 게임 엔진을 스스로 생성되는 게임을 향한 한 걸음으로 읽기 쉽다. 더 가까운 시기의 용도는 덜 화려하고 더 가능성이 높다: 에이전트를 훈련하고 평가하기 위한 환경. 공유 상태를 유지하고 여러 행위자에게 동시에 반응할 수 있는 월드 모델은 백 개의 에이전트를 넣고 무엇을 하는지 지켜볼 수 있는 환경이며, 이는 에이전트 소프트웨어를 만드는 팀이 필요로 하고 현재 대부분 직접 만드는 바로 그것이다.
Agora-2가 인프라가 될지 연구적 호기심으로 남을지는 프리뷰가 해결하지 못한 지루한 숫자들에 달려 있다. 장시간 세션 전반의 상태 일관성, 참가자 한 명당 시간당 비용, 참가자가 모델이 한 번도 본 적 없는 행동을 했을 때 얼마나 우아하게 처리하는지다. 공유되고 학습된 환경이라는 개념은 이번 달 논문에서 플레이 가능한 빌드로 옮겨갔다. 스무 명의 동시 작성자 아래에서 그것을 버티게 만드는 것이 내년이 걸리는 부분이다.
이것을 면밀히 지켜봐야 하는 이유는 작동하는 버전이 무엇을 대체할지에 있다. 오늘날 풍부한 환경을 상대로 에이전트를 훈련하려는 사람은 느리고 협소한 시뮬레이터를 직접 만들거나, 에이전트가 깜짝 놀라게 할 수 없는 고정 규칙 세트를 강제하는 게임 엔진을 빌린다. 학습된 엔진은 두 제약을 한 번에 없앤다: 작성할 규칙이 없고, 상황은 작성되는 것이 아니라 생성되므로 발생할 수 있는 상황에 천장이 없다. 4 대 16 프리뷰는 그 아이디어가 여전히 의미 있는 갈등을 만들어내는 가장 작은 테스트이며, 시작하기에 알맞은 지점이다.
프리뷰가 드러내는 비용도 있다. 스무 명의 참가자에 대한 실시간 예측은 그들 각각에 대해 추론을 연속적으로 실행한다는 뜻이며, 이는 오늘날 비디오 모델을 저렴하게 만드는 배치 생성과 정반대다. 월드를 서빙하는 것은 살아 있는 매초마다 비용이 들지만, 비디오를 서빙하는 것은 한 번만 비용이 든다. 학습된 환경이 며칠씩 지속되는 훈련 실행에 사용되려면 경제성이 수 자릿수만큼 개선되어야 하며, 이는 모델링 문제만큼이나 하드웨어와 효율성 문제다.
관련 글
AI 제품 이미지, 아무도 비용으로 계산하지 않은 컴플라이언스 장벽에 부딪히다
비용은 항상 생성당으로 견적되었습니다. 실제 비용은 검토를 통과한 자산당으로 책정됩니다.
로봇은 육체 노동의 74퍼센트를 할 수 있지만, 그중 수익성이 있는 일은 거의 없다
역량은 대체로 갖춰져 있다. 경제성은 그렇지 않다. 10퍼센트까지 40년은 공포를 정당화하는 예측이 아니다.
744B 오픈 웨이트 에이전틱 모델, MIT 라이선스로 등장
라이선스가 곧 마케팅이다. 누구나 다운로드할 수 있는 744B 모델은 구매 대 자체 구축 계산을 다시 세운다.
중국 AI 비디오 모델, 할리우드 진출: 아마존 드라마의 시각효과에 73개 샷
해외로 나가는 것은 드라마가 아니라 드라마를 만드는 도구입니다.