動画広告スタックは専門特化型へと分裂した——Boreal-H3が示すその理由

Creatify Labsは10月2日、Boreal-H3を発表した。MiniMaxと提携し、MiniMax H3をポストトレーニングして構築された動画モデルで、目的はただ一つ、広告クリップの生成に絞られている。興味深いのは、それを売り込むためにCreatifyが考案したベンチマークと、そのベンチマークが動画生成の行き先について何を示唆しているかだ。
数字で見る売り込み
Boreal-H3はCreatifyのAds Quality Indexで133.3を記録する。この指標ではMiniMax H3が100に正規化されている。比較対象の中では、Gemini Omni 1.1 Flashの122.2、Seedance 2.5の118.1、Wan 3.0 Primeの111.1を上回った。
参照画像忠実度(10点満点中7点という厳しいしきい値で測定)では、Boreal-H3は85.3%に達し、MiniMax H3の82.4%、Wan 3.0 Primeの79.4%、Seedance 2.5の71.9%、Omni 1.1 Flashの70.6%を上回った。
自社のベースモデルと比較すると、ポストトレーニングのループによって被写体の一貫性は83.3%から94.4%へと向上し、難易度の高い制作ブリーフ群におけるブリーフ達成率は27.8%から50.0%へ上がり、目に見える欠陥はクリップあたり1.11件から0.33件へ、70%削減された。
コストとスピードの数字で、この売り込みは鋭さを増す。768pで、Boreal-H3は動画1秒あたり1.1秒で生成するため、10秒のクリップは約11秒で完成し、コストは0.40ドル。Seedance 2.5は動画1秒あたり46.5秒、1秒あたりおよそ0.47ドルかかる。15秒の製品デモでは、Boreal-H3が84秒でレンダリングしたのに対し、Seedance 2.5は411秒だった。
なぜモデルよりもベンチマークが重要なのか
Ads Quality Indexは、ある特定のことを測定している。モデルが広告として機能するクリップをどれだけの頻度で生成するか、だ。クリップは、プロンプト追従性、参照一貫性、視覚的リアリズムのそれぞれが10点満点中6点以上の場合にのみ合格となる。そして各モデルの合格率が、MiniMax H3を基準に指数化される。
これは、ほとんどの動画ベンチマークが問うものとは別の問いだ。Artificial Analysisなどのリーダーボードは、出力を総合的な品質と美的魅力で順位付けする。クリップが製品ラベルを読める状態に保っているか、パッケージのシルエットを安定して維持しているか、クリエイターの顔を最初のフレームから最後まで保っているか——そうしたことはこれらのランキングでは測定されておらず、そして広告主が真っ先に確認するのはそこなのだ。
正直な留保点は、このインデックスを作ったのも、運営しているのも、そしてそれに勝つモデルを売っているのもCreatifyだということだ。同社は、自動評価が人間の選好に対して検証されており、人間による調査では匿名化・ランダム化された出力を用いたと述べている。それは妥当な方法論上の主張であり、同時にベンダー自身が自社製品について述べるファーストパーティの主張でもある。独立した再現はまだ存在しない。
もう一つ、静かな細部がある。比較対象にはSeedance 2.5とWan 3.0 Primeが含まれており、いずれも強力な汎用動画モデルが広告特有の基準で評価されている。専門特化型のベンチマークで専門特化型モデルが敗れるのは想定内だ。警戒すべき数字とは、Boreal-H3がおひざ元で汎用モデルに負けた場合である。
専門特化の分裂は現実であり、構造的だ
Boreal-H3がどこに位置するかは、それが勝つかどうかよりも興味深い。
2026年の動画生成は、目に見える形で分裂している。片側にはシネマティックな汎用モデル(GoogleのVeo、Kling、RunwayのGen-4.5)があり、語りたい物語を持つあらゆる人に、品質、カメラ制御、ネイティブ音声を売り込んでいる。もう片側には広告特化型がある。Creatify、Arcads、HeyGenで、いずれもUGC風のクリエイター動画と製品デモを軸に構築され、ヒーローショットよりも量と反復速度を必要とするパフォーマンスマーケターに売られている。
この分裂は経済性で説明できる。パフォーマンス広告キャンペーンでは、効くフックを見つけるために数十本のバリエーションが必要だ。各バリエーションが5ドルなら、計算が成り立たない。1本40セントで11秒でレンダリングされるなら、昼食前に十数本のフックを試せる。シネマティックな品質と反復のスループットは別の製品であり、一つのモデルから両方を売ろうとすれば、買い手がより重視する方で妥協することになる。
HeyGenも同じ週に似た道をたどり、1秒1セントのユニバーサル動画モデルを投入した。これもMiniMax H3をポストトレーニングしたものだ。2社が独立に、MiniMaxのベースこそ特化のための適切な土台だと判断したことは、オープンウェイトのフロンティアがどこにあるかを物語っている。
このモデルにまだできないこと
ほとんどのベンダーが飛ばす項目、それが製品の変形だ。
瓶の形は、フレーム間で、あるいは同じ製品を別々に生成したバリエーション間で、微妙に変わることがある。ブランドマークは、もっともらしく見えるが技術的には誤って描画される。比率の狂ったロゴ、存在しない文字が混じった押し出し加工風のワードマークなどだ。生成ごとのパッケージの一貫性の問題は十分に一般的で、真剣なワークフローではテキスト記述を信用せず、参照画像を固定して制約をかけている。
Creatifyはこれに対処したと主張し、欠陥率の削減を公表している。この主張がカバーしていないのは、有料キャンペーンで最も重要な失敗モードだ。つまり、サムネイルサイズでは正しく見え、原寸では誤って見えるために、レビューをすり抜けてしまう欠陥である。視覚的リアリズムを10点中6点と採点する自動評価が、描き間違えられたロゴを確実に捉えることはない。実物の製品と出力を比較する人間なら捉えられる。
そこから導かれるワークフロー上の助言は、華やかではない。すべての製品ショットは、テキスト記述ではなく実物の写真から始めること。テキストだけのプロンプトでは、モデルが物体と一緒にラベルまで捏造してしまうからだ。プロンプトは動き(何が動くか、カメラがどう動くか、光がどう変化するか)について書くこと。製品そのものは写真がすでに担っているからだ。そして、出荷前に各クリップを実物の隣に並べて確認すること。
専門特化がもたらすもの、そしてその代償
Boreal-H3のようなモデルを支持する論拠は単純だ。もしあなたの出力が広告なら、広告で調整されたモデルは、汎用モデルが不要な能力に費やす反復サイクルを節約してくれる。
反対の論拠は、ある種のロックインだ。ある企業の評価ループでポストトレーニングされたモデルは、その企業が定義する「良い広告」に最適化されており、その定義は他者が検証できる形では公開されていない。Ads Quality Indexは「これはCMとして機能するか」のかなり妥当な代理指標だ。それが「このキャンペーンは成果を出すか」と相関するかどうかは、メディアバイヤーにしか答えられない問いであり、彼らは今後2四半期で予算をもって答えるだろう。
先を見越しておく価値のある二次的効果がある。モデルを特定の商業的目的でポストトレーニングすると、その目的が報いるパターンは得意になり、測定しないパターンは苦手になる傾向がある。製品忠実度とクリエイターの一貫性に最適化された広告特化モデルは、キャンペーンを記憶に残るものにする視覚的な独創性から離れていくかもしれない。Ads Quality Indexには、クリップが面白いかどうかを測る要素がない。それは意図的なスコープ設定であり、結果を伴う。
もう一つの実務上の制約は、参照素材の要件だ。キーフレーム制御とマルチ参照制御はどちらも、広告主が良質な入力——クリーンな製品写真、一貫したクリエイター、確立されたビジュアルスタイル——を用意することを求める。すでに写真ライブラリとデザインシステムを持つブランドにとっては問題ない。ゼロからクリエイティブを生成する小規模な販売者にとっては、この専門特化はあまり役に立たない。モデルが必要とする入力こそ、その販売者が持っていないものだからだ。
Boreal-H3が本当に示しているのは、動画生成市場が、単一のリーダーボードで何かが決着する段階を超えて成熟したということだ。2026年後半の買い手にとっての問いは、もはやどのモデルが最良かではない。あなたが作っている特定のものにおいてどのモデルが最良か、そしてそれをベンダーのインデックスを信じるのではなく自分で測定できるかどうか、である。
最後の節が最も重要だ。広告モデルを作っているベンダーは、それらを順位付けるベンチマークを売っているベンダーでもある。唯一信頼できる評価は、自社の製品セットでの統制されたテスト、自社のレビュー基準、そして各出力を実物と比較する人間だ。リーダーボードを読むより遅いが、はるかに有用である。
関連記事
MetaがMidjourneyの画像・動画技術をライセンス、その理由は示唆に富む
ベンチマークは四半期ごとに動く。何が見た目に良いかについてのコミュニティの判断は動かない。
AssemblyAI、リアルタイム音声のレイテンシを91ミリ秒に短縮。この数字が重要な理由
音声の制約は単語誤り率ではなかった。それはターンテイキングだった。
GoogleのNano Banana 2.1はフラッグシップではなく機能追加リリースだ
ミッドティアのリリースは、ラボが大多数のユーザーに実際に何が必要だと考えているかを教えてくれる。それはフラッグシップよりも有用なシグナルだ。
OpenAI、AI由来の数学的成果722件を公開。数学者たちは功績は誰のものかと問う
証明支援系が検証するのは、議論が帰結することであり、その議論が誰かの思うものであることではない。