← 블로그로
Ai약 13 분 읽기

동영상 광고 스택은 전문 모델들로 분화했고, Boreal-H3가 그 이유를 보여준다

게시일 2026년 10월 7일
동영상 광고 스택은 전문 모델들로 분화했고, Boreal-H3가 그 이유를 보여준다

Creatify Labs는 10월 2일 Boreal-H3를 출시했다. 이 비디오 모델은 MiniMax와 협력해 MiniMax H3를 포스트트레이닝하여 만들었으며, 광고 클립 제작이라는 단 하나의 작업을 목표로 한다. 흥미로운 점은 이를 판매하기 위해 Creatify가 만들어낸 벤치마크와, 그 벤치마크가 비디오 생성의 향방에 대해 시사하는 바에 있다.

숫자로 본 피치

Boreal-H3는 Creatify의 Ads Quality Index에서 133.3점을 기록했는데, 이 지수에서는 MiniMax H3가 100으로 정규화된다. 비교군에서 Boreal-H3는 Gemini Omni 1.1 Flash(122.2), Seedance 2.5(118.1), Wan 3.0 Prime(111.1)을 앞섰다.

참조 충실도(reference fidelity)에서는 더 엄격한 기준인 10점 만점에 7점을 적용했을 때 Boreal-H3가 85.3%에 도달해 MiniMax H3(82.4%), Wan 3.0 Prime(79.4%), Seedance 2.5(71.9%), Omni 1.1 Flash(70.6%)를 앞섰다.

자체 베이스 모델과 비교하면, 포스트트레이닝 루프는 피사체 일관성을 83.3%에서 94.4%로 끌어올렸고, 어려운 제작 브리프 세트에서 브리프 완수율을 27.8%에서 50.0%로 높였으며, 클립당 눈에 띄는 결함을 1.11건에서 0.33건으로 줄여 70% 감소를 달성했다.

비용과 속도 수치에서 피치는 더 선명해진다. 768p에서 Boreal-H3는 영상 1초당 1.1초로 생성하므로, 10초 클립은 약 11초가 걸리고 비용은 0.40달러다. Seedance 2.5는 영상 1초당 46.5초가 걸리고 초당 약 0.47달러다. 15초 제품 데모에서 Boreal-H3는 84초에 렌더링됐고, Seedance 2.5는 411초가 걸렸다.

왜 모델보다 벤치마크가 더 중요한가

Ads Quality Index는 특정한 것을 측정한다. 바로 모델이 광고로 기능하는 클립을 얼마나 자주 만들어내는가이다. 클립은 프롬프트 준수, 참조 일관성, 시각적 사실성이 각각 10점 만점에 6점 이상일 때만 통과한다. 그런 다음 각 모델의 통과율을 MiniMax H3 기준으로 지수화한다.

이는 대부분의 비디오 벤치마크가 던지는 질문과 다르다. Artificial Analysis와 유사한 리더보드는 일반적 품질과 미적 매력으로 출력을 순위화한다. 한 클립이 제품 라벨을 읽을 수 있게 유지하는지, 패키지 실루엣을 안정적으로 유지하는지, 첫 프레임부터 마지막 프레임까지 크리에이터의 얼굴을 보존하는지는 그러한 순위가 측정하는 것이 아니며, 광고주가 가장 먼저 확인하는 것이다.

솔직한 단서는 Creatify가 이 지수를 만들고 운영하며, 그 지수에서 이기는 모델을 판매하고 있다는 점이다. 회사는 자동 심사가 인간 선호도에 대해 검증됐고, 인간 연구는 익명화되고 무작위화된 출력을 사용했다고 말한다. 이는 합리적인 방법론 주장이지만, 여전히 공급업체가 자사 제품에 대해 하는 자사 주장(first-party claim)이다. 아직 독립적 재현은 없다.

더 조용한 세부 사항도 있다. 비교에는 Seedance 2.5와 Wan 3.0 Prime이 포함되는데, 둘 다 강력한 범용 비디오 모델이면서 광고 특화 기준으로 평가되고 있다. 특화 벤치마크에서 특화 모델이 이기는 것은 예상된 일이다. 우려스러울 숫자는 Boreal-H3가 자신의 홈그라운드에서 범용 모델에 진다면 나올 것이다.

전문 분화는 실제이며 구조적이다

Boreal-H3가 어디에 들어맞는지는 그것이 이기는지 여부보다 더 흥미롭다.

2026년의 비디오 생성은 눈에 띄게 분화했다. 한쪽에는 시네마틱 범용 모델(Google의 Veo, Kling, Runway의 Gen-4.5)이 있어, 이야기를 들려주려는 누구에게나 품질, 카메라 제어, 네이티브 오디오를 판다. 다른 쪽에는 광고 전문 모델이 있다. Creatify, Arcads, HeyGen 모두 UGC 스타일 크리에이터 영상과 제품 데모를 중심으로 만들어졌으며, 히어로 샷보다 물량과 반복 속도를 필요로 하는 퍼포먼스 마케터에게 판매된다.

경제성이 이 분화를 설명한다. 퍼포먼스 광고 캠페인은 효과가 있는 훅을 찾기 위해 수십 개의 변형이 필요하다. 각 변형이 5달러라면 계산이 맞지 않는다. 각 변형이 40센트이고 11초에 렌더링된다면, 점심 전에 수십 개의 훅을 테스트할 수 있다. 시네마틱 품질과 반복 처리량은 서로 다른 제품이며, 하나의 모델로 둘 다 팔려고 하면 구매자가 더 중요하게 여기는 쪽에서 타협하게 된다.

HeyGen은 같은 주에 비슷한 길을 걸었다. 초당 1센트의 범용 비디오 모델을 출시했고, 역시 MiniMax H3를 포스트트레이닝했다. 두 회사가 독립적으로 MiniMax의 베이스가 특화하기에 적합한 기반이라고 판단했다는 점은 오픈 가중치 최전선이 어디에 있는지 말해준다.

이 모델이 여전히 하지 못하는 것

대부분의 공급업체가 건너뛰는 부분: 제품 형태 왜곡.

병의 모양은 프레임 사이에서, 또는 동일 제품의 개별 생성 변형들 사이에서 미묘하게 달라질 수 있다. 브랜드 마크는 그럴듯해 보이지만 기술적으로 틀리게 렌더링된다. 비율이 잘못된 로고, 존재하지 않는 글자가 들어간 돌출 워드마크 같은 식이다. 생성 전반에 걸친 패키징 일관성 문제는 충분히 흔해서, 진지한 워크플로는 텍스트 설명을 믿는 대신 참조 이미지를 고정해 제약한다.

Creatify는 이 문제를 해결했다고 주장하며 결함률 감소를 발표했다. 그 주장이 다루지 않는 것은 유료 캠페인에서 가장 중요한 실패 모드다. 바로 썸네일 크기에서는 맞아 보이고 전체 크기에서는 틀려 보여서 검토를 통과하는 결함이다. 시각적 사실성에 10점 만점에 6점을 주는 자동 심사는 잘못 그려진 로고를 안정적으로 잡아내지 못한다. 출력을 실제 제품과 비교하는 사람은 잡아낼 수 있다.

따라오는 워크플로 조언은 화려하지 않다. 모든 제품 샷을 텍스트 설명이 아니라 실제 제품 사진에서 시작하라. 텍스트만 있는 프롬프트는 모델이 물체와 함께 라벨까지 지어내게 만들기 때문이다. 모션(무엇이 움직이는지, 카메라가 어떻게 움직이는지, 빛이 어떻게 변하는지)에 대해 프롬프트를 작성하라. 사진이 이미 제품을 담고 있기 때문이다. 각 클립을 출시 전에 실제 물체 옆에 놓아 비교하라.

특화가 주는 것과 치르는 비용

Boreal-H3 같은 모델을 지지하는 논리는 간단하다. 당신의 결과물이 광고라면, 광고에 맞춰 튜닝된 모델은 범용 모델이 당신에게 필요 없는 능력에 쓰는 반복 사이클을 절약해준다.

반대 논리는 특정한 종류의 락인(lock-in)이다. 한 회사의 평가 루프로 포스트트레이닝된 모델은 그 회사의 좋은 광고 정의에 최적화되며, 그 정의는 다른 누구도 감사할 수 있는 형태로 공개되지 않는다. Ads Quality Index는 “이것이 광고로서 기능하는가”에 대한 합리적인 대리 지표다. 그것이 “이 캠페인이 성과를 내는가”와 상관관계가 있는지는 미디어 바이어만 답할 수 있는 질문이며, 그들은 향후 두 분기에 예산으로 답할 것이다.

예상할 가치가 있는 2차 효과가 있다. 모델이 특정 상업적 목표로 포스트트레이닝되면, 그 목표가 보상하는 패턴에는 더 능숙해지고 측정하지 않는 패턴에는 더 서투르게 되는 경향이 있다. 제품 충실도와 크리에이터 일관성에 최적화된 광고 중심 모델은 캠페인을 기억에 남게 만드는 시각적 독창성에서 멀어질 수 있다. Ads Quality Index에는 클립이 흥미로운지를 측정하는 구성 요소가 없으며, 이는 결과를 수반하는 의도적인 범위 설정 선택이다.

참조 소재 요건은 또 다른 실질적 제약이다. 키프레임 제어와 다중 참조 제어는 모두 광고주가 좋은 입력을 제공해야 한다. 깨끗한 제품 샷, 일관된 크리에이터, 확립된 시각 스타일이다. 이는 이미 사진 라이브러리와 디자인 시스템을 갖춘 브랜드에는 괜찮다. 크리에이티브를 처음부터 생성하는 작은 판매자에게는 특화가 덜 유용하다. 모델이 필요로 하는 입력이 바로 그 판매자에게 없는 입력이기 때문이다.

Boreal-H3가 실제로 보여주는 것은 비디오 생성 시장이 단일 리더보드가 무언가를 결정해주는 단계를 지나 성숙했다는 점이다. 2026년 후반의 구매자에게 관련 질문은 더 이상 어느 모델이 최고인가가 아니다. 당신이 만드는 특정한 것에 어느 모델이 가장 뛰어난가, 그리고 공급업체의 지수를 믿는 대신 그것을 스스로 측정할 수 있는가이다.

마지막 구절이 가장 중요하다. 광고 모델을 만드는 공급업체는 그 모델의 순위를 매기는 벤치마크를 파는 공급업체이기도 하다. 유일하게 신뢰할 수 있는 평가 방법은 자체 제품 세트에 대한 통제된 테스트, 자체 검토 기준, 그리고 각 출력을 실제 물체와 비교하는 사람이다. 리더보드를 읽는 것보다 느리지만 훨씬 더 유용하다.

관련 글