HeyGen Video 1 对比 Tavus Griffin:一秒钟的生成真人值多少钱

九月下旬,相隔不到三十六小时,同一市场角落先后落地了两场产品发布。二者都能在屏幕上生成一个以假乱真的人。将这两者放在一起,最有用的地方并不在于买家会在它们之间做选择,因为发布时只有一款可以购买。真正有用的是,它们之间的差异解释了各自被打造来做什么,以及在各自场景中,一秒钟的合成真人值多少钱。
HeyGen Video 于 9 月 30 日上线,整个 10 月定价为每秒一美分。Tavus Griffin 于 10 月 1 日发布,并附带一项实时面对面研究:54 名参与者中有 26 人相信自己的对话伙伴是真人。Griffin 仅通过申请表单向部分受信任的测试者开放,没有公开标识符、没有端点,也没有价格。
一个卖的是片段,另一个卖的是对话
HeyGen Video 是一个通用视频模型,只不过它在人物方面异常出色。它可以接收提示词,或提示词加一张图像,或提示词加最多九张参考图像、三段参考视频和三段参考音频。它返回一段 5 到 15 秒的片段,分辨率为 480p 或 768p,每秒 24 帧,并带有 AAC 音频,承载生成的对话、环境声和音效。三种模式覆盖条件控制:文生视频、图生视频和参考生视频,其中参考生视频是默认模式。请求中的未知字段会被拒绝,而不是被忽略;同时提供种子值,让你在每次只改一个子句时,让某个镜头保持可复现。
这是一个具有确定性边界的生产工具。你知道自己要的是什么,你知道返回了什么,而且你可以复现它。
Griffin 几乎把这些特性全部颠倒过来。它基于单张参考照片,以 25 帧每秒生成 720p 内容,每块 320 毫秒,并在解码时逐块播放。没有需要指定的片段长度,也不会交回一个文件。一个持续运行的对话建模引擎会接收音频和视频,并以亚秒级间隔重新评估交流,判断应该保持沉默、发出信号、附和还是接过话轮。它的表情控制并行驱动流式语音生成器和流式视频生成器,因此在一句话说到一半时做出的决定,会在同一个小回合内体现在声音和面容上。
你不需要写提示词。你与它交谈,它会对停顿、移开的目光或打断做出回应。这就是为什么尽管两者都能生成人,它们并不是彼此的替代品。HeyGen Video 被问的是:所描述的那一刻看起来是什么样。Griffin 被问的是:接下来应该发生什么。
定价,以及它为何成为头条
HeyGen 的发布价是每秒一美分,公司称这是标准价两美分的五折。同一页面上的成本图表则在脚注中标注为发布促销前、768p 带音频的每秒标价,显示为三美分。在厂商自己的材料中,正文和图表之间出现了 50% 的差距。在 HeyGen 发布 API 定价页之前,稳妥的理解是:一美分的数字因为已经上线而得到确认,而 10 月之后的价格在二到三美分之间。
按一千秒来算,也就是一百段十秒片段,这是批量团队实际会采用的单位。10 月的 HeyGen Video 合计十美元。10 月之后,按两美分算是二十美元,按图表上的三美分算是三十美元。它微调所基于的基础模型 MiniMax H3 标价为每秒八美分,因此同样一千秒要花费八十美元。Kling 3.0 Pro 达到 168 美元,Veo 3.1 则达到 400 美元。
这一定价算术之所以成为头条,原因在于废弃率。在视频生成中,你最终保留的那段片段,很少是你第一次生成的那段。团队会生成多次尝试,然后丢掉其中的大部分。一个每秒便宜但需要六次尝试的模型,成本会高于一个更贵、但第一次或第二次就能命中的模型。HeyGen 实际上是在押注:当每秒只要一美分时,迭代不再是最昂贵的部分。
那个应当附带说明的数字
Tavus 的头条数字是 54 名参与者中有 26 人相信自己的伙伴是真人。这是来自一项受控研究的一个真实结果,同时也是那种很容易被过度解读的数字。研究的条件并不等于部署的条件。面对面实验中的参与者被引导去进行对话,而不是去审查对话。在一个有利环境中呈现出的 48% 冒充真人成功率,告诉你这项技术正在进步,却没有告诉你:当有人试图检测它,或者当对话持续二十分钟而不是几分钟时,它会如何表现。
Griffin 真正有趣的地方是交互模型,而不是欺骗率。一个能实时决定是否开口,并且能在同一拍内把句中决定反映到脸上的数字人,与视频生成器属于不同类别的产品。它更接近呼叫中心、辅导老师或陪伴应用的实时化身。在这些市场里,价值在于闭环,而不在于片段。
Griffin 无法购买这一点也不是小问题。可信测试者计划之所以存在,正是因为产品还不够稳定或可预测,尚不足以售卖。处在这个阶段是合理的,同时这也意味着,今天拿它与 HeyGen Video 做任何比较,都是在一个已交付产品和一个承诺之间做比较。
它们各自到底适合什么
把两者并排放在一起,市场就清晰地分开了。
如果你需要的是一个成品片段库,无论是广告片、社交视频还是本地化营销素材,HeyGen Video 是今天已经存在的工具,它的价格可以放进电子表格,它的确定性边界可以让你围绕它构建流水线。
如果你需要的是在实时通话中表现得像一个人、进行回应而不是渲染的东西,Griffin 指向的就是这个方向,但它还不是一个你能集成的产品。
更大的要点在于合成视频将走向何方。两年来,基准测试关注的是单帧的逼真度。如今的前沿在于随时间变化的行为:一个生成的人如何回应、记忆,并在一次互动中保持一致。HeyGen 在“渲染出来并保留下来”的工作流中,竞争的是成本和可靠性。Tavus 竞争的则是互动是否真的感觉像一次互动。两者都可以赢,因为它们卖的不是同一秒。