视频广告技术栈分裂为专业模型,Boreal-H3 说明了原因

Creatify Labs 于 10 月 2 日发布了 Boreal-H3,这是一个与 MiniMax 合作、基于 MiniMax H3 进行后期训练构建的视频模型,只专注于一项任务:制作广告短片。真正有意思的地方在于 Creatify 为推销它而发明的基准测试,以及该基准测试对视频生成未来走向的暗示。
用数字说话的宣传
在 Creatify 的 Ads Quality Index(广告质量指数)上,Boreal-H3 得分为 133.3,其中 MiniMax H3 被归一化为 100。对比集合中,它领先于 Gemini Omni 1.1 Flash 的 122.2、Seedance 2.5 的 118.1,以及 Wan 3.0 Prime 的 111.1。
在参考保真度方面(以更严格的十分之七阈值衡量),Boreal-H3 达到 85.3%,领先于 MiniMax H3 的 82.4%、Wan 3.0 Prime 的 79.4%、Seedance 2.5 的 71.9%,以及 Omni 1.1 Flash 的 70.6%。
与其自身基础模型相比,后期训练循环将主体一致性从 83.3% 提升到 94.4%,在一组困难的制作简报上将简报完成度从 27.8% 提升到 50.0%,并将可见缺陷从每个片段 1.11 个减少到 0.33 个,降幅达 70%。
成本和速度数据才是宣传真正犀利之处。在 768p 下,Boreal-H3 的生成速度为每视频秒 1.1 秒,因此一个 10 秒片段大约需要 11 秒,成本为 0.40 美元。Seedance 2.5 则达到每视频秒 46.5 秒,大约每秒 0.47 美元。在一个 15 秒产品演示中,Boreal-H3 渲染耗时 84 秒,而 Seedance 2.5 为 411 秒。
为什么基准测试比模型本身更重要
Ads Quality Index 衡量的是一个具体问题:一个模型产出可用作广告的片段的频率有多高。只有当提示词遵循、参考一致性和视觉真实感每项得分都达到十分之六或更高时,片段才算通过。然后每个模型的通过率会以 MiniMax H3 为基准进行指数化。
这与大多数视频基准测试所问的问题不同。Artificial Analysis 和类似排行榜根据总体质量和美学吸引力对输出进行排名。一个片段能否让产品标签保持可读、包装轮廓保持稳定,并在第一帧到最后一帧之间保留创作者的面部,并不是这些排名所衡量的内容,而这恰恰是广告主首先检查的东西。
坦诚的保留意见是:这个指数由 Creatify 构建、由 Creatify 运行,而它又在销售赢得该指数的模型。该公司表示,其自动评判器已根据人类偏好进行验证,并且人类研究使用了匿名、随机化的输出。这是一个合理的方法论主张,但它仍然是来自供应商、关于供应商产品的第一方主张。目前尚无独立复现。
还有一个不那么显眼的细节:对比中包括 Seedance 2.5 和 Wan 3.0 Prime,二者都是强大的通用视频模型,却在广告特定的标准上接受评估。在专业基准上输给专业模型是意料之中的。真正令人警惕的数字,是如果 Boreal-H3 在自己的主场输给一个通用模型。
专业模型的分化是真实存在且结构性的
Boreal-H3 的定位比它是否获胜更有意思。
2026 年的视频生成已经明显分化。一边是电影级通用模型(Google 的 Veo、Kling、Runway 的 Gen-4.5),向任何有故事要讲的人销售质量、镜头控制和原生音频。另一边是广告专业模型:Creatify、Arcads、HeyGen,全都围绕 UGC 风格的创作者视频和产品演示构建,面向需要量和迭代速度、而非主打镜头的效果营销人员销售。
经济账解释了这种分化。一个效果广告活动需要数十个变体才能找到有效的钩子。如果每个变体成本 5 美元,这笔账就算不过来。如果每个成本 40 美分、11 秒渲染完成,你可以在午饭前测试十几个钩子。电影级质量和迭代吞吐量是两种不同的产品,试图用一个模型同时销售两者,就意味着要在买家更在意的那一项上妥协。
HeyGen 在同一周走了类似路线,发布了一个每秒一美分的通用视频模型,同样基于 MiniMax H3 进行后期训练。两家公司独立决定,MiniMax 的基础模型是适合专业化的基座,这说明开放权重前沿所处的位置。
这个模型仍然做不到的事
大多数供应商会跳过的一节:产品变形。
瓶子的形状可能在帧与帧之间、或同一产品的不同生成变体之间发生细微变化。品牌标识渲染出来看似合理,但技术上却是错误的:比例不对的 logo、立体字标中存在一个并不真正存在的字母。跨生成结果的包装一致性如此常见,以至于严肃的工作流会锁定一张参考图像来约束它,而不是信任文本描述。
Creatify 声称已经解决了这个问题,并公布了缺陷率下降的数据。但该主张并未覆盖付费广告活动中最要紧的失败模式:一种缺陷之所以能通过审核,是因为它在缩略图尺寸下看起来没问题,而在完整尺寸下却是错的。以十分之六给视觉真实感打分的自动评判器,无法可靠地捕捉到一个画错的 logo。人类将输出与实体产品进行对比则可以。
随之而来的工作流建议并不光鲜。每一个产品镜头都从真实产品的照片开始,而不是从文本描述开始,因为纯文本提示会让模型连同物体一起虚构标签。为运动写提示词(什么在动、镜头如何移动、光线如何变化),因为照片已经承载了产品。在每个片段发布前,把它和实体物品放在一起对照。
专业化能换来什么,代价又是什么
支持 Boreal-H3 这类模型的理由很直接:如果你的产出是广告,那么一个针对广告调优的模型会为你节省迭代周期,而通用模型则会把那些周期花在你不需要的能力上。
反对的理由则是一种特定类型的锁定。一个在某家公司评估循环上后期训练的模型,会针对该公司对“好广告”的定义进行优化,而这个定义并没有以其他人可以审计的形式公布。Ads Quality Index 是“这能否作为商业广告成立”的合理代理指标。它是否与“这场活动是否表现良好”相关,只有媒介买家能回答,而他们将在接下来的两个季度用预算来回答。
还有一个值得预判的二阶效应。当一个模型针对特定商业目标进行后期训练时,它往往会在该目标奖励的模式上变得更好,而在它不衡量的模式上变得更差。一个专注于广告、并针对产品保真度和创作者一致性优化的模型,可能会偏离让活动令人难忘的视觉创造力。Ads Quality Index 没有任何组成部分衡量一个片段是否有趣,而这是一个经过深思熟虑的范围选择,并且会带来后果。
参考素材要求是另一个实际约束。关键帧控制和多参考控制都要求广告主提供良好的输入:干净的产品照片、一致的创作者、既定的视觉风格。对于已经拥有摄影库和设计系统的品牌来说,这没问题。对于从零开始生成创意的小卖家来说,这种专业化就没那么有用,因为模型需要的输入,正是卖家没有的输入。
Boreal-H3 真正证明的是,视频生成市场已经成熟到单一排行榜无法决定一切的程度。对于 2026 年底的买家来说,相关问题不再是什么模型最好,而是哪个模型最擅长你正在制作的特定内容,以及你是否能自己衡量这一点,而不是信任供应商的指数。
最后这一句才是最重要的。构建广告模型的供应商,同时也是销售对这些模型进行排名的基准测试的供应商。唯一可靠的评估,是在你自己的产品集上进行对照测试,使用你自己的审核标准,并由人类将每一个输出与实体物品进行对比。这比阅读排行榜更慢,却有用得多。