← 블로그로
News약 10 분 읽기

HeyGen Video 1 vs Tavus Griffin: 생성된 인간 1초의 가치는 얼마인가

게시일 2026년 10월 2일
HeyGen Video 1 vs Tavus Griffin: 생성된 인간 1초의 가치는 얼마인가

9월 말, 서로 36시간 이내에 같은 시장 구석에서 두 제품이 출시됐다. 둘 다 화면에서 설득력 있는 인간을 생성한다. 이 조합에서 가장 유용한 점은 구매자가 둘 중 하나를 고르게 된다는 게 아니다. 출시 시점에 둘 중 하나만 구매할 수 있었기 때문이다. 오히려 둘의 차이가 각 제품이 무엇을 하도록 만들어졌는지, 그리고 각 경우에서 합성 인간 1초의 가치가 얼마인지를 설명해 준다는 점이다.

HeyGen Video는 9월 30일 공개됐고, 10월까지 초당 1센트로 책정됐다. Tavus Griffin은 10월 1일 발표됐으며, 실시간 대면 연구에서 참가자 54명 중 26명이 대화 상대가 실제 사람이라고 믿었다. Griffin은 요청 양식 뒤의 일부 신뢰 테스터에게만 제공되며, 공개 식별자도, 엔드포인트도, 가격도 없다.

하나는 클립을 팔고, 다른 하나는 대화를 판다

HeyGen Video는 사람을 유난히 잘 다루는 범용 비디오 모델이다. 프롬프트를 받거나, 프롬프트와 이미지 한 장, 또는 프롬프트와 최대 9장의 참조 이미지, 3개의 참조 비디오, 3개의 참조 오디오 클립을 받는다. 길이 5~15초의 클립을 480p 또는 768p, 초당 24프레임으로 반환하며, AAC 오디오에는 생성된 대사, 분위기음, 효과음이 담긴다. 세 가지 모드가 조건 지정을 담당한다: 텍스트-투-비디오, 이미지-투-비디오, 참조-투-비디오이며, 참조-투-비디오가 기본값이다. 요청에 알 수 없는 필드가 있으면 무시하지 않고 거부하며, 시드는 한 번에 한 조항씩 바꾸면서 샷을 재현할 수 있게 해 준다.

즉, 결정적 결과 범위를 가진 제작 도구다. 무엇을 요청했는지 알고, 무엇이 돌아왔는지 알며, 재현할 수 있다.

Griffin은 그런 속성의 거의 전부를 뒤집는다. 참조 사진 한 장으로부터 초당 25프레임으로 720p를 320밀리초 단위 청크로 생성하고, 각 청크를 디코딩되는 즉시 재생한다. 지정할 클립 길이도, 돌려받는 파일도 없다. 연속 대화 모델링 엔진은 오디오와 비디오를 입력받아 1초 미만 간격으로 대화를 재평가하며, 침묵할지, 신호를 보낼지, 맞장구를 칠지, 발언권을 가져갈지 결정한다. 표현 제어는 스트리밍 음성 생성기와 스트리밍 비디오 생성기를 병렬로 구동하므로, 문장 중간에 내린 결정이 같은 미니 턴 안에서 목소리와 얼굴에 나타난다.

프롬프트를 쓰지 않는다. 말을 걸면, 침묵이나 잠깐 다른 데로 향한 시선, 또는 끼어들기에 반응한다. 둘 다 인간을 생성하지만 서로 대체재가 아닌 이유가 여기 있다. HeyGen Video에는 묘사된 순간이 어떻게 보이는지를 묻는다. Griffin에는 다음에 무슨 일이 일어나야 하는지를 묻는다.

가격, 그리고 그것이 헤드라인인 이유

HeyGen의 출시 가격은 초당 1센트이며, 회사는 이를 표준 2센트에서 50% 할인이라고 설명한다. 같은 페이지의 비용 차트에는 출시 프로모션 전, 오디오 포함 768p 기준 초당 정가로 각주가 달려 있으며 3센트로 표시되어 있다. 이는 공급업체 자체 자료에서 문구와 차트 사이에 50%의 차이가 있다는 뜻이다. HeyGen이 API 가격 페이지를 공개할 때까지 안전한 해석은 1센트 수치가 실제로 적용 중이므로 확정적이고, 10월 이후 숫자는 2~3센트 사이 어딘가에 있다는 것이다.

1,000초를 계산해 보자. 이는 10초 클립 100개이며, 대량 제작 팀이 실제로 생각하는 단위다. 10월의 HeyGen Video는 10달러가 된다. 10월 이후에는 2센트 기준 20달러, 차트의 3센트 기준 30달러다. HeyGen Video가 튜닝된 기반 모델인 MiniMax H3는 초당 8센트로 책정되어 있으므로, 같은 1,000초는 80달러가 된다. Kling 3.0 Pro는 168달러, Veo 3.1은 400달러에 이른다.

그 산수가 헤드라인인 이유는 폐기율이다. 비디오 생성에서 남기는 클립은 처음 생성한 클립인 경우가 드물다. 팀들은 여러 테이크를 생성하고 대부분을 버린다. 초당 저렴하지만 여섯 번의 시도가 필요한 모델은 더 비싸더라도 첫 번째나 두 번째 시도에서 성공하는 모델보다 비용이 더 든다. HeyGen은 사실상 초당 1센트라면 반복 생성이 더 이상 비싼 부분이 아니게 된다는 데 걸고 있다.

주의 문구가 따라붙어야 할 숫자

Tavus의 헤드라인 수치는 참가자 54명 중 26명이 대화 상대가 인간이라고 믿었다는 것이다. 이는 통제된 연구에서 나온 실제 결과이며, 동시에 지나치게 확대 해석하기 쉬운 종류의 숫자이기도 하다. 연구의 조건은 배포 환경의 조건이 아니다. 대면 실험의 참가자는 대화를 감사하려는 것이 아니라 대화를 나누도록 유도된 상태다. 유리한 환경에서 제시된 인간으로 통과하는 48% 성공률은 기술이 발전하고 있다는 것을 말해 주지만, 누군가 이를 탐지하려 할 때, 또는 대화가 몇 분이 아니라 20분 동안 이어질 때 어떻게 행동할지는 말해 주지 않는다.

Griffin을 흥미롭게 만드는 것은 기만율이 아니라 상호작용 모델이다. 말할지 말지를 실시간으로 결정하고, 문장 중간의 결정을 같은 박자 안에 얼굴에 반영하는 디지털 휴먼은 비디오 생성기와는 다른 부류의 제품이다. 이는 콜센터, 튜터, 또는 컴패니언 애플리케이션을 위한 실시간 아바타에 더 가깝다. 그런 시장에서는 가치가 클립이 아니라 루프에 있다.

Griffin을 구매할 수 없다는 점도 작은 단서가 아니다. 신뢰 테스터 프로그램은 제품이 아직 판매할 만큼 안정적이거나 예측 가능하지 않기 때문에 존재한다. 이는 합리적인 단계이며, 동시에 오늘날 HeyGen Video와의 비교는 출시된 제품과 약속을 비교하는 것이라는 뜻이기도 하다.

각 제품은 실제로 무엇을 위한 것인가

둘을 나란히 놓으면 시장은 깔끔하게 갈린다.

광고 스팟, 소셜 비디오, 현지화된 마케팅 조각 등 완성된 클립 라이브러리가 필요하다면, HeyGen Video는 오늘날 존재하는 도구이며, 스프레드시트에 넣을 수 있는 가격과 파이프라인을 구축할 수 있는 결정적 결과 범위를 제공한다.

실시간 통화에서 사람처럼 행동하는 것, 렌더링하기보다 반응하는 것이 필요하다면, Griffin이 그 방향을 가리키는 제품이며, 아직 통합할 수 있는 제품은 아니다.

더 큰 요점은 합성 비디오가 어디로 향하는가에 관한 것이다. 2년 동안 벤치마크는 단일 프레임의 사실성이었다. 이제 최전선은 시간에 따른 행동이다. 생성된 사람이 어떻게 반응하고, 기억하고, 상호작용 전반에 걸쳐 일관성을 유지하는가다. HeyGen은 렌더링하고 남기는 워크플로에서 비용과 안정성으로 경쟁한다. Tavus는 상호작용이 애초에 상호작용처럼 느껴지는지로 경쟁한다. 둘 다 이길 수 있다. 같은 1초를 팔고 있지 않기 때문이다.

관련 글