Taobao TaoMate-H3 오픈소스: 분 단위 음영상 연속 생성을 세그먼트당 3단계 디노이징으로 압축

알리바바 TaoLive AIGC 팀이 TaoMate-H3의 추론 코드와 LoRA 가중치를 GitHub와 Hugging Face에 공개했다. 이 모델이 하는 일 자체는 새롭지 않다. 화면과 소리를 같은 생성 과정에서 함께 만들어내는 것이다. 하지만 자신을 평가하는 방식은 바뀌었다. 누구의 단일 세그먼트 화질이 더 압도적인지를 겨루는 대신, 프롬프트를 입력한 뒤 첫 번째 결과물을 보기까지 얼마나 기다려야 하는지를 비교한다.
첫 세그먼트 대기 시간, 이전에는 아무도 신경 쓰지 않던 지표
주류 비디오 모델의 생성 방식은 전체 구간 디노이징이다. 30초짜리 설명을 작성하면 모델은 30초 분량의 모든 프레임을 한꺼번에 확산 과정에 넣고 반복 계산하며, 중간에는 아무것도 주지 않고 전체 구간 계산이 끝난 뒤에야 한 번에 결과를 넘겨준다. 이 방식의 문제는 아주 명확하다. 대기 시간이 영상 길이에 정비례한다는 점이다. 더 긴 영상을 원하면 더 오래 기다려야 한다.
TaoMate-H3는 세그먼트 단위로 나아가는 방식을 택했다. 생성을 작은 조각으로 쪼개고, 각 조각은 3단계 디노이징만 거치면 된다. 모델은 먼저 현재 세그먼트를 명확히 처리한 뒤, 이어서 다음 내용을 생성한다. 기술적으로는 3단계 LoRA 추론과 자기회귀 생성을 연결했으며, 이전 세그먼트의 인물, 소리, 장면이 컨텍스트로 다음 세그먼트에 전달된다.
이 변화가 가져오는 실질적 차이는 "언제 무언가를 볼 수 있는가"에 있다. 라이브 해설, 가상 캐릭터 공연, 또는 즉각적인 피드백이 필요한 어떤 장면이든, 사용자는 전체 영상 생성이 끝날 때까지 기다리지 않고도 처음으로 화면을 볼 수 있다. 첫 세그먼트 콘텐츠 산출 시간이 줄어들었는데, 이 지표를 주요 셀링 포인트로 내세운 모델은 이전에 거의 없었다. 机器之心는 보도에서 TaoMate-H3가 내세우는 것이 바로 "첫 세그먼트 생성 시간"이라고 언급했다.
소리는 어떻게 생성에 참여하는가
음영상 동시 생성에는 업계에서 두 가지 방식이 있다. 하나는 먼저 화면을 생성한 뒤 다른 모델로 소리를 입히고, 후반 작업에서 두 트랙을 정렬하는 것이다. 다른 하나는 생성 과정에 소리가 처음부터 참여해 입모양, 표정, 동작에 시간적 제약을 제공하는 것이다.

TaoMate-H3는 후자다. 동일한 생성 과정에서 소리와 화면을 함께 처리하며, 인물의 말하기, 노래, 캐릭터 대사가 모두 이 프레임워크 안에 있고, 파도, 차량 움직임, 폭발 같은 환경음과 동작 효과음도 포함된다. 대사와 화면의 시간 정합성을 후반 작업까지 기다려 수정할 필요가 없다.
출력 사양은 480p, 768p, 1080p 세 단계를 지원하며 가로 화면과 세로 화면 모두 출력할 수 있다. 장면 설명은 하나의 완전한 프롬프트로 작성할 수도 있고, 세그먼트별로 대사와 동작, 줄거리를 배치할 수도 있으며, 모델은 이전 컨텍스트를 유지한 채로 이어서 생성한다. 분 단위 연속 생성이 목표 구간이다.
파라미터는 크지 않지만, 실제 워크플로에 넣어야 이해된다
TaoMate-H3는 MiniMax H3를 기반으로 후속 학습(post-training)을 진행했다. 베이스는 다른 곳에서 이미 오픈소스로 공개한 기초 모델이며, TaoMate 팀은 그 위에 스트리밍 생성 기능을 얹었다. 이것이 가중치를 이렇게 빠르게 공개할 수 있었던 이유이기도 하다. 대규모 모델을 처음부터 학습시킬 필요 없이, 핵심은 추론 파이프라인과 LoRA에 있다.
개발자 입장에서 실질적 가치는 여러 층위로 나뉜다. 가장 직접적인 것은 자신의 하드웨어에서 실행할 수 있어, 클라우드 API에 의존하지 않고도 스트리밍 생성 연구를 할 수 있다는 점이다. 다음으로 스트리밍 생성 자체가 이전에는 하기 어려웠던 장면들을 열어준다. 생성하면서 동시에 재생하기, 장시간 캐릭터 연속 연기, 시청자 반응에 따라 이후 내용을 조정해야 하는 인터랙티브 영상 등이다.
한 가지 한계는 분명히 짚고 넘어갈 만하다. 3단계 디노이징은 각 세그먼트의 연산량을 매우 낮게 압축한다는 뜻이며, 그 대가는 단일 세그먼트 화질의 상한선이다. 공식 데모에서의 결과는 한 가지이고, 화질 요구가 높은 완성본 납품에 투입하는 것은 또 다른 문제다. 이 모델은 "연속 생성"이라는 요구에 쓸 만한 오픈소스 기반을 제공하는 쪽에 가깝지, 최정상 폐쇄형 모델과 단일 프레임 품질을 겨루러 나온 것이 아니다.
중국산 오픈소스 비디오의 이번 한 해 경로
TaoMate-H3를 올해의 타임라인에 되돌려 놓고 보면 비교적 선명한 경로가 보인다. 연초에는 모두가 파라미터와 리더보드 점수를 비교했다. 하반기에 들어서면서 초점은 모델을 실제 워크플로에 밀어 넣는 것으로 옮겨갔다. 더 낮은 VRAM, 더 빠른 첫 프레임, 더 저렴한 초당 비용이다.
MiniMax H3가 기초 모델을 오픈소스로 공개했고, TaoLive는 그 위에서 음영상 스트리밍을 구현했으며, 알리바바 PAI는 여덟 가지 제어 조건과 비디오 인페인팅을 지원하는 ControlNet-Union 브랜치를 내놓았다. 하나의 모델이 나오면 곧바로 누군가 상위 기능을 이어서 만든다. 이러한 분업은 폐쇄형 생태계보다 오픈소스 커뮤니티에서 더 빠르게 돌아가는데, 누가 인터페이스를 열어주기를 기다릴 필요가 없기 때문이다.
콘텐츠를 만드는 사람에게 이러한 변화는 결국 아주 구체적인 지점으로 귀결된다. 연속 연기가 필요한 영상을 만들 때, 예전에는 열 개의 세그먼트를 따로 생성한 뒤 이어 붙여야 했지만, 이제는 단락별로 작성하면 모델이 스스로 컨텍스트를 지니고 이어 나간다. 완성 후에 어딘가 잘못됐다면 그 세그먼트만 수정할 수도 있다.
마지막으로
TaoMate-H3 이번 발표에서 가장 기억할 만한 점은 "첫 세그먼트 대기"를 전면에 내세웠다는 것이다. 비디오 생성은 지난 몇 년간 "생성할 수 있는가"와 "얼마나 잘 생성하는가"를 풀어왔는데, 이제는 "언제 첫 프레임을 볼 수 있는가"를 진지하게 계산하기 시작한 누군가가 나타났다. 이 질문에 대한 답이 비디오 모델이 데모 무대를 벗어나 매일 업데이트되는 워크플로로 들어갈 수 있는지를 결정한다.
가중치와 추론 코드는 이미 공개됐다. 앞으로는 커뮤니티가 그 위에서 더 많은 것을 키워낼지, 특히 장시간 연속 출력이 필요하면서 전체 구간 렌더링을 기다릴 수 없는 장면에서 어떤 결과가 나올지가 관건이다.
관련 글
위성 사진이 이제 로봇 훈련 데이터가 되다
피지컬 AI 학습의 병목은 더 이상 컴퓨팅이나 모델 성능이 아니었다. 그것은 합성 세계의 품질이 되었다.
구글 Gemini 3.5 라이브 번역, 멈춤을 없애다
화자 자신의 목소리로, 이미 주머니에 있는 휴대폰에서 연속 실행되는 번역은 기능을 열어야 하는 것에서 그냥 켜져 있는 것으로 옮긴다.
중국, AI 에이전트 최초의 강제 안전 표준을 제정하다
안전은 홍보하는 기능에서 통과해야 하는 관문으로 바뀐다. 위험 목록은 13개 범주, 97개 항목에 이른다.
AI 생성 콘텐츠, 이제 신분을 밝혀야 한다
이 한 걸음이 모든 문제를 해결하지는 않지만, 'AI 생성'을 숨길 수 있는 선택지에서 반드시 답해야 하는 질문으로 바꿔놓았다.