← 返回部落格
Ai預計閱讀 10 分鐘

影片廣告技術堆疊分裂成專用模型,而 Boreal-H3 說明了原因

發布於 2026年10月7日
影片廣告技術堆疊分裂成專用模型,而 Boreal-H3 說明了原因

Creatify Labs 於 10 月 2 日推出 Boreal-H3,這是一款與 MiniMax 合作、以 MiniMax H3 後訓練而成的影片模型,目標只有一個:產出廣告短片。真正有趣的地方在於 Creatify 為了推銷它而自創的基準,以及這個基準對影片生成未來走向所暗示的意義。

用數字說明賣點

Boreal-H3 在 Creatify 的 Ads Quality Index 拿下 133.3 分,該指數將 MiniMax H3 標準化為 100。比較組中,它領先 Gemini Omni 1.1 Flash 的 122.2、Seedance 2.5 的 118.1,以及 Wan 3.0 Prime 的 111.1。

在參考保真度方面(以更嚴格的 10 分中 7 分門檻衡量),Boreal-H3 達到 85.3%,領先 MiniMax H3 的 82.4%、Wan 3.0 Prime 的 79.4%、Seedance 2.5 的 71.9%,以及 Omni 1.1 Flash 的 70.6%。

與自身基礎模型相比,後訓練循環將主體一致性從 83.3% 提升到 94.4%,在一組困難的製作需求上把需求完成度從 27.8% 提高到 50.0%,並將每段影片的可見瑕疵從 1.11 個降到 0.33 個,減少 70%。

成本與速度數字是賣點最銳利之處。在 768p 下,Boreal-H3 的生成速度為每影片秒 1.1 秒,因此一段 10 秒短片約需 11 秒,成本為 0.40 美元。Seedance 2.5 則為每影片秒 46.5 秒,約每秒 0.47 美元。在一段 15 秒產品展示中,Boreal-H3 以 84 秒渲染完成,Seedance 2.5 則需 411 秒。

為什麼基準比模型本身更重要

Ads Quality Index 衡量的是一件很具體的事:模型產出的短片有多常能真正當廣告用。一段短片只有在提示遵循、參考一致性與視覺真實感三項都拿到 10 分中 6 分以上時才算通過。接著再把各模型的通過率對照 MiniMax H3 進行指數化。

這與大多數影片基準所問的問題不同。Artificial Analysis 及類似排行榜是就整體品質與美學吸引力來排名輸出。一段短片是否讓產品標籤保持可讀、包裝輪廓維持穩定,以及從第一幀到最後一幀都保住創作者的臉,這些都不是那些排名所衡量的,卻是廣告主最先檢查的事。

誠實的但書是:Creatify 建立了這個指數、負責運行它,也在販售贏得該指數的模型。該公司表示其自動評審已對照人類偏好驗證過,且人類研究使用的是匿名、隨機化的輸出。這是合理的方法論主張,但它仍是第一方主張,由供應商針對自家產品提出。目前尚無獨立複現。

還有一個較不明顯的細節:比較組包含 Seedance 2.5 與 Wan 3.0 Prime,兩者都是在廣告專用標準下受評的強大通用影片模型。在專門基準上輸給專門模型是意料中事。真正會令人警覺的數字,是 Boreal-H3 在自己的主場上輸給通用模型。

專用模型的分裂真實存在,且是結構性的

Boreal-H3 落在什麼位置,比它是否勝出更有趣。

2026 年的影片生成已明顯分裂。一邊是電影級通用模型(Google 的 Veo、Kling、Runway 的 Gen-4.5),向任何有故事要說的人販售品質、鏡頭控制與原生音訊。另一邊是廣告專用模型:Creatify、Arcads、HeyGen,全都圍繞 UGC 風格的創作者影片與產品展示打造,賣給需要量產與迭代速度、而非單一主視覺鏡頭的成效行銷人員。

經濟因素解釋了這種分裂。一支成效廣告活動需要數十個版本才能找到有效的鉤子。如果每個版本要價 5 美元,這筆帳就划不來。如果每個版本只要 40 美分、11 秒就能渲染完成,你可以在午餐前測試十幾個鉤子。電影級品質與迭代吞吐量是兩種不同產品,想用同一個模型賣這兩者,就意味著必須在買家更在意的那一項上妥協。

HeyGen 在同一週走了類似路線,推出一款每秒一美分的通用影片模型,同樣以 MiniMax H3 後訓練而成。兩家公司獨立決定 MiniMax 的基礎模型是適合特化的底材,這說明了開放權重前沿目前落在何處。

這個模型仍做不到的事

大多數供應商會跳過的一節:產品變形。

瓶子的形狀可能在影格之間微妙變動,或在同一產品分開生成的版本之間改變。品牌標記會渲染得看似合理、技術上卻錯誤:比例不對的標誌、立體字標中出現一個不太存在的字母。跨生成結果的包裝一致性問題相當常見,因此認真的工作流程會鎖定一張參考圖來約束,而不是信任文字描述。

Creatify 聲稱已解決這個問題,並公布了瑕疵率下降。這項主張沒有涵蓋的,是付費廣告活動中最要命的失敗模式:一個瑕疵因為在縮圖尺寸下看起來正確、在全尺寸下才顯得錯誤,而躲過審查。把視覺真實感評為 10 分中 6 分的自動評審,無法可靠地抓出畫錯的標誌。對照實體產品檢查輸出的人類可以。

隨之而來的工作流程建議並不光鮮。每個產品鏡頭都從真實產品的照片開始,而不是文字描述,因為純文字提示會讓模型連同物件一起虛構出標籤。提示詞要針對動態來寫(什麼在動、鏡頭怎麼動、光線如何變化),因為照片已經承載了產品。每段短片交付前,都把它放在實體物件旁邊比對。

專業化買到什麼,又要付出什麼代價

支持像 Boreal-H3 這類模型的理由很直接:如果你的產出是廣告,一個針對廣告調校的模型能替你省下迭代週期,而通用模型則會把這些週期花在你不需要的能力上。

反對的理由則是一種特定的鎖定。一個以某家公司評估迴圈進行後訓練的模型,是針對該公司對「好廣告」的定義最佳化,而那個定義並未以任何人能稽核的形式公開。Ads Quality Index 是「這能不能當商業廣告」的合理代理指標。它是否與「這支活動能不能帶來成效」相關,只有媒體採購能回答,而他們會在接下來兩季用預算回答。

有一個值得預先設想的二階效應。當模型針對特定商業目標進行後訓練,它往往會更擅長該目標獎勵的模式,並更不擅長它未衡量的模式。一個為產品保真度與創作者一致性最佳化的廣告導向模型,可能會偏離讓活動令人記住的視覺創造力。Ads Quality Index 沒有任何一項在衡量短片是否有趣,而那是個帶有後果的刻意範圍選擇。

參考素材要求是另一項實務限制。關鍵影格控制與多參考控制都要求廣告主提供良好的輸入:乾淨的產品照、一致的創作者、既定的視覺風格。對已有攝影圖庫與設計系統的品牌來說沒問題。對從零開始生成素材的小型賣家而言,這種專業化就沒那麼有用,因為模型需要的輸入,正是賣家沒有的輸入。

Boreal-H3 真正展示的是,影片生成市場已經成熟到不再是單一排行榜就能決定一切。對 2026 年底的買家而言,相關問題不再是哪個模型最好,而是哪個模型最擅長你正在製作的特定事物,以及你是否能自行衡量那件事,而不是信任供應商的指數。

最後那個子句最重要。打造廣告模型的供應商,同時也是販售用來排名這些模型的基準的供應商。唯一可靠的評估,是在你自己的產品集上進行受控測試,用你自己的審查標準,並由人類把每項輸出與實體物件比對。這比讀排行榜慢,卻有用得多。

相關文章