← 返回部落格
News預計閱讀 9 分鐘

HeyGen Video 1 vs Tavus Griffin:一秒生成的人類值多少

發布於 2026年10月2日
HeyGen Video 1 vs Tavus Griffin:一秒生成的人類值多少

兩項產品在九月底相隔三十六小時內於市場的同一個角落發布。兩者都能在螢幕上生成逼真的人類。將它們放在一起比較,最有用的一點並不是買家會從中二選一,因為發布時只有其中一款買得到。而是它們之間的差異說明了各自是為了什麼而打造,以及在各自情況下,一秒合成人類的價值是多少。

HeyGen Video 於 9 月 30 日正式上線,整個 10 月定價為每秒一美分。Tavus Griffin 於 10 月 1 日發布,並附上一項即時面對面研究,其中 54 名參與者有 26 人相信他們的對話對象是真實的人。Griffin 僅透過申請表提供給少數受信任測試者,沒有公開識別碼、沒有端點,也沒有價格。

一個賣的是片段,另一個賣的是對話

HeyGen Video 是一款通用影片模型,恰好在人物方面表現得異常出色。它接受提示詞,或提示詞加上一張圖片,或提示詞加上最多九張參考圖片、三段參考影片和三段參考音訊片段。它會回傳一段五到十五秒的片段,解析度為 480p 或 768p,每秒 24 影格,並帶有 AAC 音訊,包含生成的對話、環境音和音效。三種模式涵蓋條件控制:文字轉影片、圖像轉影片,以及參考轉影片,其中參考轉影片是預設模式。請求中的未知欄位會被拒絕,而不是忽略;種子(seed)則用來讓你在每次只改一個子句時,仍能重現同一個鏡頭。

那是一款具有確定性範圍的製作工具。你知道自己要求了什麼,你知道回傳了什麼,而且你可以重現它。

Griffin 幾乎顛覆了上述每一項特性。它從單一張參考照片生成 720p、每塊 320 毫秒、每秒 25 影格的內容,並在解碼時逐塊播放。沒有片長可供指定,也不會交回檔案。一個持續運作的對話建模引擎會吸收音訊與視訊,並以不到一秒的間隔重新評估交流,決定要沉默、示意、發出簡短回應,還是接過發話權。它的表達控制會並行驅動串流語音生成器和串流視訊生成器,因此句子講到一半所做的決定,會在同一個迷你回合內反映在聲音和臉上。

你不需要寫提示詞。你對它說話,而它會對停頓、目光移開或打斷做出回應。這就是為什麼兩者雖然都能生成人類,卻不是彼此的替代品。HeyGen Video 被問的是,一個被描述出來的時刻看起來是什麼樣子。Griffin 被問的則是,接下來應該發生什麼事。

定價,以及為什麼它是頭條

HeyGen 的上市價格是每秒一美分,該公司將其描述為標準價每秒兩美分的五折。同一頁面上的成本圖表則標示為三美分,其註腳寫明那是 768p 含音訊、上市促銷之前的每秒定價。這是同一份廠商自家素材中,文字敘述與圖表之間出現的百分之五十落差。在 HeyGen 公布 API 定價頁之前,安全的解讀是:一美分這個數字已獲確認,因為它正在實施;而十月之後的價格則落在兩到三美分之間。

以一千秒來計算,也就是一百支十秒片段,而這正是大量生產團隊實際思考的單位。HeyGen Video 在十月是十美元。十月之後,若以兩美分計算就是二十美元,若以圖表上的三美分計算則是三十美元。MiniMax H3 是它微調所依據的基礎模型,定價為每秒八美分,所以同樣一千秒要價八十美元。Kling 3.0 Pro 則要 168 美元,Veo 3.1 要 400 美元。

這套算術之所以是頭條,原因在於丟棄率。在影片生成中,你最終保留的片段,很少是你第一次生成的那一段。團隊會生成好幾個版本,然後把大部分丟掉。一個每秒便宜但需要嘗試六次的模型,成本會高於一個較貴、但第一次或第二次就命中的模型。HeyGen 實際上是在押注:當價格降到每秒一美分,反覆迭代就不再是昂貴的部分。

那個應該附帶但書的數字

Tavus 的頭條數字是 54 名參與者中有 26 人相信自己的對話對象是人類。這是來自對照研究的真實結果,但它也是那種很容易被過度解讀的數字。研究的條件不等於部署的條件。面對面實驗的參與者被引導去進行對話,而不是去審查對話。在有利情境下呈現的 48% 冒充人類成功率,告訴你技術正在進步,卻沒有告訴你,當有人試圖偵測它時,或當對話持續二十分鐘而不是幾分鐘時,它會如何表現。

Griffin 真正有趣的地方是互動模型,而不是欺騙率。一個能即時決定是否開口,並在同一拍點內把句子講到一半所做的決定反映在臉上的數位人類,是與影片生成器不同類別的產品。它更接近客服中心、家教或陪伴應用的即時虛擬化身。那些市場的價值在於互動循環,而不是片段。

Griffin 無法購買,這也不是一個小小的但書。受信任測試者計畫之所以存在,正是因為產品還不夠穩定或可預測,不足以販售。這是一個合理的階段,但也意味著,今天任何與 HeyGen Video 的比較,都是拿一個已出貨的產品和一個承諾相比。

兩者實際上各自的用途

把兩者並排放在一起,市場就清楚地一分為二。

如果你需要的是一批完成的影片片段,無論是廣告、社群影片或本地化行銷素材,HeyGen Video 是今天已經存在的工具,有可以放進試算表的價格,以及可以圍繞它打造流程的確定性範圍。

如果你需要的是在即時通話中表現得像個人、會回應而不是只做渲染的東西,Griffin 是指向那個方向的產品,而且它還不是你能整合的產品。

更大的重點在於合成影片的走向。過去兩年,基準測試關注的是單一影格中的真實感。如今前沿關注的是隨時間變化的行為:一個生成的人如何回應、記憶,並在整段互動中保持一致。HeyGen 競爭的是「渲染後保留」工作流程中的成本與可靠性。Tavus 競爭的是互動究竟感覺像不像互動。兩者都能勝出,因為它們賣的不是同一秒。

相關文章