TwelveLabs Pegasus 1.6, 1인칭 영상을 로봇 학습 데이터로 바꾸다

로봇에게 빨래 개는 법을 가르치는 일은 누군가 사람이 빨래를 개는 영상을 몇 시간씩 보며 모든 동작을 받아 적는 것에서 시작된다. TwelveLabs는 그 두 번째 작업을 없애려 한다.
10월 6일, 이 비디오 인텔리전스 기업은 1인칭(egocentric) 영상을 네이티브로 지원하는 모델 Pegasus 1.6을 공개했다. 이는 작업을 수행하는 사람의 1인칭 시점에서 촬영된 영상을 뜻하며, 요리나 공장 라인에서의 부품 조립, 원격 로봇 조작 등이 해당한다.
1인칭 영상이 다른 문제인 이유
1인칭 영상은 고정된 오버헤드 카메라나 3인칭 카메라 영상과는 다른 공간적 단서와 움직임 패턴을 담는다. 모션 블러, 변화하는 조명, 착용자가 움직임에 따라 나타났다 사라지는 물체 등이 포함된다. 일반 영상 데이터로 학습된 모델은 이를 잘 처리하지 못하는 경향이 있다.
Pegasus 1.6은 그렇게 정돈되지 않은 입력을 받아 로봇이 움직이고, 집고, 이동하는 법을 가르치는 데 중요한 세부 정보를 추출하도록 만들어졌다. 이 모델은 다섯 가지 워크플로를 직접 지원한다.
동작 분할 및 라벨링은 원시 영상에서 작업, 단계, 물체, 손-물체 상호작용에 대한 타임스탬프 라벨을 생성하며, 도메인 특화 분류 체계에 매핑한다. 밀집 캡션 라벨링은 공간 관계, 장면 맥락, 손-물체 상호작용에 대한 서술적 언어를 생성하여 언어 조건부 로봇 정책 학습을 겨냥한다. 품질 점수화는 영상이 사람 검토자에게 도달하기 전에 동작 명확성, 프레이밍, 안정성을 평가해 저품질 클립을 걸러낸다. 검색 및 큐레이션은 자연어 질의를 통해 대규모 영상 저장소 전반에서 희귀 이벤트와 롱테일 시나리오를 찾아낸다. 동의 및 규정 준수 플래깅은 영상이 다운스트림 파이프라인에 들어가기 전에 얼굴, 주변인, 화면 또는 종이에 담긴 민감 데이터를 탐지한다.
인력 비용 계산
이 제품을 설명하는 숫자는 수동 라벨링 비용이다. 1인칭 영상을 수작업으로 라벨링하면 영상 1시간당 70~155시간의 인력이 소요될 수 있다. 이를 2시간짜리 클립 하나에 적용하면, 사람 주석자는 파일 하나에 몇 주에 걸친 작업을 해야 하는 셈이다.
Pegasus 1.6은 261,120 토큰의 컨텍스트 윈도를 갖춰 최대 2시간 길이의 영상을 처리할 수 있다. 접근은 TwelveLabs API를 통해 이루어지며, 가격은 영상 1시간당 1.75달러, 이미지 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러로, 이는 Pegasus 1.5의 두 배 요율이다.
대규모 작업을 계획하는 팀을 위한 한 가지 유의점: 배치 분석은 여전히 Pegasus 1.5가 담당하므로, 대용량 일괄 처리가 아직 새 모델로 완전히 옮겨가지는 않았다.
이해와 실행의 구분
이 회사의 CEO Jae Lee는 당장의 기회를 학습 인프라로 설명했다. 동작을 이해하는 것은 그것을 가르치는 일의 일부일 뿐이다. Pegasus는 팔다리 움직임을 설명하고 궤적에 대한 대략적인 이해를 제공할 수 있지만, 이를 실행하는 데 필요한 모든 정보를 제공하지는 않는다. 압력, 촉각, 정밀 제어는 여전히 별개의 문제다.
이는 경계를 솔직하게 규정한 것이며, 기억해 둘 가치가 있다. 로보틱스 팀은 영상에서 얻은 정보를 다른 데이터와 결합하고, 이를 행동으로 옮기는 시스템을 구축해야 한다. Pegasus는 업스트림에 위치해 학습 과정에 데이터를 공급할 뿐, 로보틱스 스택을 대체하지는 않는다.

Lee는 처리 규모를 시사하는 한 가지 사례를 언급하며, 약 17년 분량의 1인칭 영상을 18시간 만에 실패한 영상 없이 처리한 실행을 떠올렸다. 그는 컴퓨팅 자원이나 평가 조건을 밝히지 않았기에, 이는 재현 가능한 벤치마크라기보다 일화적인 처리량 주장에 해당한다. 회사의 기술 자료는 동작 식별과 수행하는 손 인식에 대한 내부 평가를 설명하지만, 수치 점수나 경쟁사 대비 재현 가능한 비교는 제시하지 않는다.
대안들과의 위치
경쟁 구도는 로보틱스 개발 파이프라인의 여러 부분에 걸쳐 있다. NVIDIA의 Cosmos Curator는 필터링, 주석, 중복 제거를 통한 데이터 준비에서 직접 겹치며, 개방형 툴링은 관리형 서비스에 대한 대안을 팀에 제공한다. Encord의 NVIDIA Cosmos Reason 2 및 Embed 통합은 주석 및 큐레이션 작업에서 경쟁하며, 행동 기반 검색과 함께 사람 검토용 예비 라벨을 생성한다. Google의 Gemini Robotics ER 2는 영상 해석과 작업 진행 추적에서 겹치지만, 계획과 조정을 강조하며 모터 실행은 하위 수준 동작 모델에 맡긴다. Black Forest Labs와 mimic의 FLUX-mimic은 비디오 모델 기반을 활용해 로봇 동작을 생성하며, 데이터 준비보다는 실행을 다룬다.
이 도구들은 청구 단위와 제품 범위가 서로 달라, 요율만으로 특정 워크로드에서 무엇이 가장 저렴한지는 결정되지 않는다. Pegasus는 영상을 길이로, 텍스트 출력을 토큰으로 청구하며, 이는 동작 생성보다 라벨링이 병목인 팀에 적합하다.
이번 출시가 입증하는 것과 그렇지 않은 것
Pegasus 1.6은 TwelveLabs의 영상 이해 연구 뒤에 구체적인 제품을 내놓았으며, 실제 병목을 겨냥한다. 원시 인간 영상에서 사용 가능한 로봇 학습 데이터로 가는 경로는 정말로 느리고 비싸며, 그 일부를 자동화하는 것은 임바디드 AI를 구축하는 누구에게나 중요할 것이다.
아직 불확실한 것은 이 모델이 기존 대안보다 의미 있게 더 나은 결과를 내는지다. 이번 발표에는 제3자 벤치마크, 전체 경쟁 구도를 아우르는 가격 비교, 공개된 고객 결과가 함께 제공되지 않았다. 다음으로 주목할 가장 명확한 것은 로보틱스 개발자들이 실제 라벨링 워크플로에서 Pegasus 1.6을 사용한 결과를 공개하는지 여부다. 그런 증거가 있어야 논의가 발표에서 평가로 넘어갈 수 있으며, 절약된 노동에 대한 주장을 정리할 수 있는 것은 그런 종류의 증거뿐이다.
인간 영상이 피라미드의 밑변인 이유
Pegasus 1.6의 전략은 로봇 행동 지식이 어디서 오는가에 대한 논증에 기초하며, 이를 분명히 말할 가치가 있다.
사람들이 육체 노동을 수행하는 방법에 대해 아는 것의 대부분은 기계가 학습할 수 있는 형태로 포착된 적이 없다. 요리사는 무의식적으로 손잡이를 조정한다. 작업자는 도구를 떨어뜨린 뒤 아무도 기록하지 않는 방식으로 무게중심과 팔 길이를 바꿔 복구한다. 이런 조정이야말로 동작을 수행하는 로봇과 작업을 완수하는 로봇의 차이다.
인간 영상은 그러한 조정의 가장 풍부한 원천 중 하나이며, 엄청난 양으로 존재한다. 이들의 베팅은 인간 영상에서 추출한 폭넓은 행동 지식 기반을 원격조작 시연을 통해 특정 로봇에 맞게 적응시키는 것이, 각 작업마다 처음부터 시작하는 것보다 유능한 기계에 이르는 더 빠른 경로라는 것이다.
이는 입증된 보장이 아니라 개발 전략이며, CEO도 그렇게 말했다. 영상이 더 많다고 해서 자동으로 폭넓게 유능한 로봇이 탄생하지는 않으며, 이해한 동작을 실행된 동작으로 옮기는 일은 힘, 촉각, 제어를 포함하는 별개의 문제로 남는다.
동의라는 차원
Pegasus 1.6이 지원하는 다섯 워크플로 중 하나는 특히 짚어볼 만한데, 이 영역에 따라오는 거버넌스 질문을 가리키기 때문이다. 동의 및 규정 준수 플래깅은 영상이 다운스트림 파이프라인에 들어가기 전에 얼굴, 주변인, 화면 또는 종이에 담긴 민감 데이터를 탐지한다.
이 기능이 존재하는 이유는 1인칭 영상이 작업 중인 사람의 시점에서 촬영되어, 그 화면이 작업 외의 것까지 담기 때문이다. 사원증, 화면, 배경의 얼굴, 책상 위 문서 등이 잡힌다. 산업 규모로 영상을 수집하는 로보틱스 팀에게 플래깅 단계는 학습 파이프라인이 섭취해서는 안 되는 자료를 들여오지 않게 막아준다.
라벨링 워크플로와 함께 이 워크플로를 포함한 것은 데이터 파이프라인에 규정 준수 표면이 있고, 그 표면을 수작업으로 관리하기 어렵다는 조용한 인정이다. 규제 산업의 팀에게 플래깅 기능은 라벨링 속도만큼 중요해질 수 있는데, 입력을 걸러낼 수 없는 파이프라인은 아예 사용할 수 없기 때문이다.
확장되는 것과 그렇지 않은 것
TwelveLabs는 이번 출시를 작고 정교하게 큐레이션된 데이터셋에서 실제 인간 경험에 기반한 확장 가능한 파이프라인으로의 이동으로 규정한다. 솔직한 단서는 라벨링 단계의 확장이 학습 단계의 확장으로 자동 이어지지는 않는다는 점이다.
빠르고 저렴한 라벨링 파이프라인조차 로봇이 필요로 하는 촉각 및 제어 신호와 결합되어야 하고, 특정 기계의 신체 구조에 맞게 적응되어야 하는 데이터를 생산한다. Pegasus 1.6은 라벨링 노동이라는 하나의 병목을 제거하고, 다른 병목에는 아무것도 하지 않는다. 이는 완전한 해결책이라기보다 유용한 기여이며, 가장 큰 혜택을 보는 팀은 라벨링 단계가 결정적 제약이었던 팀일 것이다. 그것이 대부분의 로보틱스 팀을 설명하는지는 실제 배포에서 나온 결과가 답할 바로 그 질문이다.
관련 글
메타, 미드저니의 이미지·영상 기술 라이선스… 그 이유가 말해주는 것
벤치마크는 분기마다 바뀐다. 무엇이 보기 좋은지에 대한 커뮤니티의 판단은 그렇지 않다.
AssemblyAI, 실시간 음성 지연 시간을 91밀리초로 단축했다. 이 숫자가 중요한 이유
음성의 제약은 결코 단어 오류율이 아니었다. 그것은 턴 테이킹이었다.
Google의 Nano Banana 2.1은 플래그십이 아닌 기능 드롭이다
중간 등급 릴리스는 연구소가 대부분의 사용자가 실제로 무엇을 필요로 한다고 생각하는지 알려주며, 이는 플래그십보다 더 유용한 신호다.
동영상 광고 스택은 전문 모델들로 분화했고, Boreal-H3가 그 이유를 보여준다
시네마틱 품질과 반복 처리량은 서로 다른 제품이며, 하나의 생성 레이어가 둘 모두에서 앞설 수는 없다.