← 블로그로
Ai약 12 분 읽기

아무도 측정하지 않던 지표를 내세운 TaoMate-H3: 첫 세그먼트까지의 시간

게시일 2026년 10월 3일
아무도 측정하지 않던 지표를 내세운 TaoMate-H3: 첫 세그먼트까지의 시간

대부분의 비디오 모델은 얼마나 긴 클립을 만들 수 있는지를 두고 경쟁한다. 알리바바 TaoLive AIGC 팀이 오픈소스로 공개한 TaoMate-H3는 결과물의 첫 조각이 존재하기까지 얼마나 기다려야 하는지를 두고 경쟁한다.

이 모델은 비디오와 오디오를 함께, 작은 세그먼트 단위로 차례차례 생성한다. 각 세그먼트는 저스텝 LoRA를 통한 3단계 디노이징을 거치며, 모델은 전체가 완성되기 전에 다음 세그먼트로 넘어간다. 추론 코드와 LoRA 가중치는 허용적인 라이선스 아래 GitHub와 Hugging Face에 공개되어 있는데, 바로 그 점 때문에 이 설계는 그냥 읽어보는 것을 넘어 들여다볼 가치가 있다.

한 번에 전체가 아니라 세그먼트 단위로

기존 텍스트-투-비디오 파이프라인은 전체 클립을 하나의 블록으로 디노이징한다. 깔끔한 추상화지만 사람이 실제로 기다리는 방식과는 잘 맞지 않는다. 30초짜리 비디오를 요청하면, 모델이 모든 프레임을 거의 동시에 다듬어 왔기 때문에 전체 디노이징 패스가 끝날 때까지 쓸 만한 결과물은 존재하지 않는다.

TaoMate-H3는 순서를 뒤집는다. 짧은 세그먼트를 먼저 완성해 건네주고, 계속 이어간다. 각 세그먼트가 작기 때문에 디노이징 예산도 아주 작게 잡을 수 있고, 여기서 3단계 LoRA가 등장한다. 보고된 효과는 첫 번째 쓸 만한 조각이 훨씬 빨리 도착하고, 나머지가 그 뒤를 따라 스트리밍된다는 것이다.

이 단 한 번의 변화가 한 부류의 애플리케이션을 상상 가능하게 만든다. 발표자가 말하는 동안 그 발표자의 영상이 생성되는 라이브 내레이션. 공연이 만들어지는 중에도 계속 공연할 수 있는 가상 캐릭터. 아무것도 보여주기 전에 완성된 파일을 만들어 놓고 있을 여유가 없는 인터랙티브 비디오.

오디오는 나중에 덧칠하는 것이 아니다

더 어려운 엔지니어링은 오디오다. TaoMate-H3는 비디오를 만든 뒤 트랙을 얹는 대신 같은 과정에서 소리와 화면을 함께 생성한다. 대사, 노래, 그리고 파도·교통·폭발음 같은 환경음이 모두 생성기에서 나오며, 소리가 생성을 뒤따르는 것이 아니라 생성에 참여하기 때문에 입 모양, 표정, 움직임의 타이밍이 사후 보정이 아니라 원천에서 정렬된다.

이 모델은 또한 세그먼트 수준의 오디오 가이던스와 함께 계속 유지되는 오디오-비디오 KV 캐시를 사용하는데, 이것이 세그먼트 경계를 넘어 연속성이 살아남는 방식이다. 새 조각은 이전 조각이 확립한 인물, 목소리, 장면을 이어받으므로, 1분짜리 결과물이 끝날 무렵 다른 사람으로 변해버리는 일이 없다. 인접한 세그먼트가 동일한 정체성을 공유하는 것이야말로 세그먼트 생성이 어려운 이유이며, 대부분의 시스템이 이를 피하는 이유다.

솔직한 한계

여러 사양은 소박하다. 출력 해상도는 480p, 768p, 1080p까지이며 가로·세로 프레이밍을 모두 지원한다. 연장은 무제한이 아니라 분 단위 수준으로 설명된다. 새로운 베이스에서 시작한 것이 아니라 MiniMax H3를 기반으로 하므로, 근본적인 시각 품질은 그 모델에서 물려받은 것이고 여기서의 기여는 그 위에 얹힌 스트리밍 및 공동 생성 레이어다.

ComfyUI에서 NVIDIA의 최근 원스텝 리파인먼트 모델을 테스트한 한 개발자는 이 범주 전체에 대해 기억해둘 만한 관련 관찰을 남겼다. 그 리파인먼트는 초해상도라기보다 입력을 다시 상상하는 것처럼 느껴졌는데, 모델이 디테일을 복원하는 것이 아니라 재구성하고 있었기 때문이다. 스트리밍 오디오-비디오 생성은 다른 지점에서 같은 질문을 제기한다. 각 세그먼트가 작은 디노이징 예산으로 빠르게 생성되고, 다음 세그먼트가 그것을 참조해 생성될 때, 작은 오류는 이후 모든 것의 전제가 되는 경향이 있다. 빠른 첫 세그먼트는 스무 번째 세그먼트가 여전히 첫 번째처럼 보일 때만 쓸모가 있다.

어두운 슬레이트 테이블 위에 일직선으로 놓인 작은 빈 필름 프레임들, 한 프레임에서 다음 프레임으로 부드러운 호박색 빛의 맥동이 옮겨간다

그 위험 속에 실질적인 한계가 숨어 있다. 흐르는 스트리밍 생성기는 사람의 검문 지점을 필요로 하게 되고, 30초마다 사람이 개입한다면 속도 이점은 상당 부분 사라진다. 세그먼트 생성을 실제로 작동하게 만드는 모델은 긴 세션 동안 감독 없이도 연속성이 유지되는 모델일 것이고, 그것은 데모 클립만으로는 아무도 확인할 수 없는 속성이다.

스트리밍이 편집 워크플로를 바꾸는 지점

대기 시간 외에도 스트리밍이 중요한 실질적인 이유가 있다. 생성은 전통적으로 배치 작업이었다. 프롬프트를 확정하고, 기다리고, 완성된 파일을 받는다. 무엇이든 바꾸려면 처음부터 다시 시작해야 한다. 출력이 세그먼트 단위로 도착하면 제작자가 개입할 수 있는 지점이 더 앞으로 이동한다. 세 번째 세그먼트가 마음에 들지 않는 감독은 모델이 나머지를 생성하느라 예산을 다 써버리기 전에 조정할 수 있고, 그 수정이 새로운 테이크를 찍는 대신 이후의 모든 것으로 흘러 들어갈 수 있다.

이는 이미지 편집을 멀티턴 워크플로로 밀어낸 것과 같은 논리이며, 재생성된 테이크의 비용이 재생성된 프레임보다 훨씬 큰 비디오에서는 더 강하게 적용된다. 문제는 조기 개입이 가치 있으려면 연속성을 깨뜨리지 않고 남은 세그먼트를 조종할 수 있어야 한다는 점이다. TaoMate-H3의 오디오-비디오 캐시가 연속성을 유지하려는 방식이고, 그것이 스트림 중간의 수정에도 견디는지가 미해결 질문이다. 스트리밍하지만 방향을 바꿀 수 없는 모델은 그냥 버릴지도 모를 것을 더 빨리 만드는 방법일 뿐이다.

여기서 오픈 공개가 중요한 이유

세그먼트 스트리밍 아이디어는 모델 자체보다 더 흥미롭다. 그것을 구현하려면 모달리티 간 KV 캐싱, 세그먼트 경계를 위한 오디오 가이던스, 그리고 3단계 추론이 품질을 유지하게 만드는 학습 설정을 해결해야 하는데, 논문 초록만으로는 어느 것도 명확하지 않다. 추론 코드와 LoRA 가중치를 공개한다는 것은 다른 팀들이 이 접근이 자기들의 콘텐츠에서도 통하는지 시험해볼 수 있고, API를 기다리지 않고 이 릴리스가 겨냥한 인터랙티브 애플리케이션을 만들 수 있다는 뜻이다.

올해 비디오 생성에서 더 조용한 변화가 바로 이것이다. 최전선의 데모는 여전히 인상적인 클립 하나에 관한 것이지만, 그 아래의 도구들은 프로덕션이 실제로 필요로 하는 속성 쪽으로 갈라져 나가고 있다. 첫 결과까지의 시간. 경계를 넘는 연속성. 생성된 콘텐츠 1분당 비용. TaoMate-H3는 이 세 가지 모두에 대해 특정한 입장을 취하고, 자기 시도를 공개하고, 세그먼트 스트리밍이 옳은 베팅이었는지는 시장이 판단하게 둔다. 인터랙티브한 무언가를 만드는 사람에게는 또 하나의 리더보드 항목보다 이것이 더 유용하다. 6개월 뒤 제품 팀이 어떤 모델을 고를지를 결정하는 스펙 시트에는 해상도가 아니라 지연 시간과 드리프트가 적힐 것이고, 이와 같은 릴리스가 바로 그 숫자들을 페이지에 올려놓는다.

그것은 또한 이름 붙일 만한 패턴에 들어맞는다. 지난 2년을 지배한 모델들은 비교에서 이기도록 만들어졌다. 더 긴 클립, 더 깨끗한 렌더, 선호도 테스트에서 더 높은 점수. 지금 등장하는 모델들은 제약에 맞춰 만들어졌다. 지연 예산, 메모리 상한, 경계를 넘는 연속성 요구. 제약은 광고하기는 더 어렵고 검증하기는 더 쉽다. 그리고 기술이 데모 릴이 아니라 제품 안에 들어가게 되는지를 결정하는 것도 바로 제약이다. 세그먼트 스트리밍은 제약 주도 설계이며, 그것이 비디오가 아니라 코드와 함께 나왔다는 사실이 이 설계에 기회를 준다.

관련 글