← 블로그로
News약 11 분 읽기

7개 대학이 공동 오픈소스로 공개한 OpenWAM: 로봇에게 필요한 것은 '보는 것'만이 아니라 '다음 1초를 예측하는 것'

게시일 2026년 10월 6일
7개 대학이 공동 오픈소스로 공개한 OpenWAM: 로봇에게 필요한 것은 '보는 것'만이 아니라 '다음 1초를 예측하는 것'

10월 초, 싱가포르국립대학(NUS), 칭화대학, 베이징대학 등 7개 대학 연구진으로 구성된 팀이 OpenWAM을 GitHub와 Hugging Face에 공개했다. 프로젝트의 포지셔닝은 명확하다. 세계 행동 모델(World Action Model, WAM)을 위한 오픈소스 연구 풀스택에, 기반 모델 하나를 더한 것이다. 논문은 이미 arXiv에 올라와 있으며 번호는 2609.07398, 저장소는 10월 1일 기준 약 940개 스타를 기록했다.

이 소식이 중국 내에서 퍼지는 속도는 그리 느리지 않았지만, 정말 눈여겨볼 지점은 그것이 해결하려는 오래된 문제다. 로봇이 눈앞에 있는 것이 무엇인지 인식하는 것만으로는 충분하지 않다는 것.

기존 시뮬레이터는 물리와 시각을 따로 계산한다

과거에 로봇 정책(policy)을 만들 때는 흔히 두 가지 길이 있었다. 하나는 로봇 시연에서 시각적 규칙과 제어 신호를 동시에 직접 학습하는 것이고, 다른 하나는 이미지-텍스트 사전 학습을 먼저 거쳐 의미론과 언어 지식을 끌어들이는 것으로, 이것이 바로 VLA 노선이다.

세계 행동 모델은 세 번째 길을 택했다. 먼저 비디오 생성 사전 학습에서 '세계가 어떻게 변하는가'라는 사전 지식(프라이어)을 물려받고, 그다음 구현(embodiment) 경험을 통해 '이 세계에서 무엇을 해야 하는가'를 배운다. 멀리 돌아가는 것처럼 들리지만, 시뮬레이션과 실제 로봇 사이의 오래된 균열을 피해 간다. 기존 시뮬레이터는 물리와 시각을 각자 계산하는 경우가 많아 동작의 효과와 화면의 느낌이 맞지 않는다. OpenWAM의 방식은 모델이 데이터에서 '동작이 세계를 어떻게 바꾸는가'를 직접 학습하고, 이를 바탕으로 물체 위치, 장면 의미론, 작업 상태를 예측하게 하는 것이다.

세 개의 층으로 나눠 실험 재현성을 확보하다

팀은 문제를 세 개의 층으로 나눴고, 각 층은 하나의 컴포넌트에 대응한다.

OpenWAM-Infra는 모듈형 인프라로, 조합 가능한 모델, 학습 런타임, 배포 런타임, 평가 프로토콜이라는 네 계층을 분리한다. 이 층의 역할은 세계 행동 모델을 강하게 결합된 단일 구현에서, 부품을 교체할 수 있는 실험대로 바꾸는 것이다.

OpenWAM-Study는 설계 원칙을 축적하는 역할을 맡는다. 모델을 만드는 것이 아니라 통제된 실험을 수행하며, 대조군 실험을 통해 '어떤 설계가 효과적인가'를 재현 가능한 결론으로 만든다.

OpenWAM-α는 기반 모델 자체로, 대규모 인간 1인칭 시점 영상과 로봇 데이터에서 전체 방식을 검증한다.

세 가지 설계 원칙, 각각 대조 수치가 있다

이런 논문에서 가장 두려운 것은 전부 구호로만 채워지는 것이다. OpenWAM이 제시한 세 가지 결론에는 모두 대조 실험이 붙어 있다.

첫째, 충분히 강력한 생성적 세계 사전 지식이 필요하다. 14B 비디오 백본은 93.79%를 기록했고 1.3B는 90.14%에 그쳤다. 기본 설정은 5B를 택했는데, 14B보다 1.4%포인트 낮을 뿐이다. DINOv3와 S-VAE로 압축한 콤팩트한 시각 잠재 공간을 결합하면 효과가 Wan2.2에 내장된 VAE에 근접한다.

둘째, 학습 시 세계에서 행동으로 향하는 명확한 정보 흐름을 구축해야 한다. '행동 스트림이 세계 스트림을 보게' 하면 정확도 92.39%, 이를 분리된 마스킹으로 바꾸면 87.41%에 그쳐 무려 5%포인트 차이가 난다. 추론 시에는 동기화된 공동 디노이징(joint denoising)이 가장 좋은 효과를 낸다.

셋째, 데이터는 출처별로 나눠 써야 한다. 로봇 데이터는 행동의 그라운딩(grounding)을 지키는 역할을, 인간 1인칭 시점 영상은 세계의 커버리지를 넓히는 역할을 맡고, 단일 단계 공동 학습이 둘을 통합한다. 흥미로운 점은 사전 학습 도메인 내에서는 향상이 제한적이었지만, 분포 외(OOD) 성공률은 14.50%에서 26.62%로 올랐다는 것이다.

기반 모델의 실제 사양

OpenWAM-α는 두 부분으로 구성된다. Wan2.2-TI2V-5B가 비디오 스트림을 담당하고, 여기에 1B 규모의 액션 DiT를 붙인다. 행동 공간은 80차원으로 통일해 17개 물리 플랫폼과 호환된다. 사전 학습 데이터는 14,300시간이며, 이 중 인간 1인칭 시점이 30%, 합성 데이터가 30%, 실제 데이터가 40%를 차지한다.

밝은 색 목공 작업대 위에 놓인 빈 실험 기록지 한 장과, 옆에 나란히 놓인 광택 나는 금속 관절 부품 세 개

추론 속도는 RTX 5090에서 단일 액션 블록 기준 170밀리초이다. 평가는 LIBERO, RoboTwin2.0, RoboDojo 등 8개 시뮬레이션 벤치마크를 아우르며, 형태는 단일 암, 양팔부터 이동 조작과 정교한 손(dexterous hand)까지 포함한다. EBench의 이동 양팔 항목에서 현재 최고 성능으로, 2위를 약 4%포인트 앞선다. 실제 로봇 검증은 Franka 단일 암으로 여섯 개 작업을 수행했고 평균 성공률 82.5%로, LingBot-VA의 77.5%, π0.5의 55.0%보다 높았으며 그중 두 개 작업은 100%를 달성했다. 학습 때 보지 못한 정교한 손으로 바꿔도 미세 조정 후에는 π0.5를 전방위로 앞선다.

VLA의 퇴장을 선언하지는 않았다

논문에는 따로 짚어볼 만한 결론 한 단락이 있다. WAM은 미래 비디오 잠재 변수를 감독 신호로 삼아 분포 내에서는 더 잘 맞고, VLA는 분포 외 교란 상황에서 더 견고하다. 두 방식의 승부는 아직 나지 않았다.

이 문장은 '어떤 패러다임이 죽었다'는 말보다 훨씬 정직하다. 논문을 읽는 사람은 점수만 기억하기 쉽지만, 사실 더 기억해야 할 것은 이 문장이다. 두 노선은 지금 각자 장점을 지니고 있으며, 아직 한 방에 결론을 내릴 때가 아니다.

진입 장벽이 한 단계 낮아졌다

더 큰 배경에서 보면, 세계 모델 계열에서 구글의 Gemini Robotics 2는 '하나의 두뇌, 모든 로봇에 적용'을 내세웠고, 엔비디아의 Jim Fan은 'VLA는 죽었다, 세계 행동 모델이 설 것이다'를 던졌다. 10월 3일 엔비디아는 개방형 피지컬 AI 스택을 확장해 Cosmos 세계 모델, Isaac Lab Arena, 자율주행용 Alpamayo, 오케스트레이션 도구 OSMO, OpenUSD 라이브러리를 함께 공개했고, Caterpillar, LEM Surgical, Neura Robotics가 첫 사용자가 되었다. 10월 4일에는 저장성 항저우의 DEEP Robotics(云深处科技) 휴머노이드 로봇 여러 대가 거리로 나와 교차로 교통 정리와 관광객 안내를 시험했으며, 비 오는 날에도 가동되었다.

이런 밀도 속에서 대학이 풀스택 기반을 오픈소스로 공개한 것은, 이 방향의 진입 장벽을 한 단계 낮춘 것과 같으며 '영상으로 세계를 배우고 궤적으로 행동을 배운다'는 노선을 더 공개적인 길로 만들었다.

바로 배포하기 위한 것이 아니다

분명히 해둘 점은 OpenWAM의 포지셔닝이 연구 인프라이며, 개봉 즉시 쓸 수 있는 제품이 아니라는 것이다. 공식 README는 약 640GB의 학습 데이터와 약 6.5GB의 환경 용량을 준비하라고 권장하며, 저장소는 여전히 활발히 수정되고 있다. GPU와 데이터를 이미 갖추고 이를 바탕으로 세계 행동 모델 연구를 하려는 팀에 적합하며, 소규모 실사용 도입을 위한 시나리오에는 맞지 않는다.

앞으로 지켜볼 만한 관찰 지점도 구체적이다. 이번 공개가 얼마나 많이 재현될지, 반년 뒤에도 얼마나 많은 사람이 개선 사항을 제출할지, 그리고 실제로 이를 미세 조정해 제품 라인에 넣는 팀이 있는지다. 공개 당일의 열기는 사라지겠지만, 남는 것은 여전히 쓰이고 있는 그 코드다.

관련 글