← 返回部落格
Ai預計閱讀 10 分鐘

Vidu Q3 將參考圖生影片拆成三款產品。這既是模型決策,也是產品包裝決策。

發布於 2026年10月5日
Vidu Q3 將參考圖生影片拆成三款產品。這既是模型決策,也是產品包裝決策。

大多數影片模型發表後只會宣布一次,接著就以單一名稱出現在各處。Vidu 對其 Q3 參考圖生影片系列的做法正好相反。

9 月 14 日,阿里雲的 Model Studio 上架了三款獨立的 Vidu Q3 參考圖生影片模型。第一款 viduq3-mix 是通用型模型,可接收參考圖片與文字提示,並將圖片中的主體融入所描述的場景。第二款 viduq3-ad 為廣告用途打造,具備行銷級場景剪接、鏡頭運動與直接音訊輸出;上傳產品圖片就能取得廣告影片。第三款 viduq3-drama 鎖定戲劇與 AI 漫畫製作,針對角色一致性、動態效果與情感表達進行調校,適合故事驅動的內容。

三款模型在 720p 或 1080p 下皆為每秒 0.14 美元,速率限制為每秒 5 次請求。三者定價完全相同,這說明差異不在成本,而在輸出行為。

Vidu 真正想解決的問題

Vidu 來自北京的生數科技。其 Q3 模型於 2026 年 1 月 30 日推出,隨即登上基準測試圈。Artificial Analysis 在發表時將其列為中國第一、全球第二,領先 Runway Gen-4.5、Google Veo 3.1 與 OpenAI 的 Sora 2,得分為 1241。

支撐這項排名的三項技術轉變值得點名。Q3 是最早一批能在生成視覺的同一輪流程中,同步產出對白、音效與背景音樂的長篇影片模型之一,而不是在後製階段才把音訊加上去。它將單次生成的片段延長至 16 秒,在當時是主要模型中最長的。它也打造了參考圖生影片系統,使用者可上傳三到七張角色、物件或風格的圖片,模型會在後續生成中將這些圖片用作視覺錨點。

參考系統是其中最有意思的一環。2026 年大多數影片模型都在同一條軸線上競爭:讓單一片段看起來夠驚豔。Vidu 的賭注不同。它訴求的從來不是「看看這一個絕美鏡頭」,而是「看看同一個角色在十個鏡頭中的表現,並注意到他們看起來仍像同一個人。」

這是更難的問題,也正是系列內容真正仰賴的能力。在一項與 Runway Gen-4、Kling 3.0、Luma Ray、Pika 2.0 和 Sora 2 的比較中,使用相同角色提示詞跨六種場景變化,Vidu Q3 在六項測試中有五項維持了臉部與服裝一致性。

一致性正是區分「一次性片段工具」與「系列內容工具」的關鍵。對動畫創作者、短劇製作人,以及任何圍繞固定角色打造品牌內容的人來說,這改變了能做到什麼。

為什麼拆成三個 SKU 很重要

把同一個模型家族拆成三款具名產品,看起來像行銷選擇,但更接近採購決策。

三個素色深色圓柱排成一列,立在反光表面上,周圍有飄散的煙霧

廣告團隊和短劇工作室買的不是同一種東西,即使底層的 transformer 相似也一樣。廣告買家需要產品保真度、乾淨的場景轉換,以及能搭配品牌口吻的音訊。戲劇買家則需要角色在每一集與每一個鏡頭中維持身分,並讓表情讀起來像表演。將這些需求包裝成各自獨立的模型 ID 與獨立文件,能讓每位買家針對正好一項工作進行評估與編列預算,而不是讀著通用功能清單自行猜測。

通用型的 mix 模型則服務這兩個框框之外的所有人;在買家越來越常是有截止期限的製作團隊、而非測試提示詞的業餘愛好者的市場裡,這是合理的結構。

Vidu Claw 與流程層

把模型分裝只是策略的一半。另一半是組裝層。Vidu Claw 是以開源 OpenClaw 框架為基礎、並由 Q3 驅動的 AI 創作自動化引擎。你連接自己的 Vidu token、定義 Skills,就能自動化從想法到完成影片的流程。像「為一款跑鞋製作一支鎖定 Instagram 年輕女性的短影音廣告」這樣的單一提示詞,就足以讓 Vidu Claw 生成概念、腳本、分鏡、視覺、旁白、音樂與最終剪輯。

獨立評論呈現出有用但不一的評價。一位以產品廣告測試它的評論者發現,該平台對學生與初學者來說確實免費且容易上手,但也回報它在精確的結構細節上表現吃力。在其中一個案例中,即使反覆修正提示詞,它仍持續以某種突兀的方式渲染一個細節,而且輸出帶有明顯的 AI 感,光線與色彩感覺廉價。

這是誠實的取捨。Vidu Claw 是給個人創作者與小型行銷團隊的生產力工具,他們需要快速從概念推進到可用的草稿,而不是用來取代專業製作團隊。當它運作良好時,能把五天的廣告製作週期壓縮成一天;當它運作不佳時,品質問題也很難被忽略。

Vidu 正在打造的周邊生態系

對參考圖生影片的專注,與一套通路故事相連。2026 年 2 月,軟體公司 Wondershare(萬興科技)宣布對生數科技進行策略投資,雙方計畫合作開發 AI 漫畫。Vidu Q3 模型被整合進一套全流程 AI 漫畫製作平台,用來讓角色、聲音與場景在每一集之間保持一致。阿里雲的百鍊平台也在 2026 年 5 月將 Vidu Q3 納入為第三方模型。

因此,這個模型至少會透過三個通路流通:直接的網頁與 API 存取、鎖定漫畫與短劇的創作平台,以及雲端模型市集。每個通路都有不同的買家,對「夠好」也有不同定義。

錢實際上在哪裡

轉向系列內容不是創作偏好,而是預算所在。短劇是擁有多集與固定演員陣容的產品,其經濟效益取決於產出遠比單支廣告或一次性片段更多的影片素材。如果模型迫使創作者每個鏡頭都得從零處理角色外觀,那麼生成影片素材省下的成本,就會被一致性修正吃掉。Vidu 的賭注是:願意支付每秒 0.14 美元的團隊,買的不是單一顆漂亮鏡頭,而是一種能讓同一個人在整部作品中保持可辨識的方法。

這也是為什麼參考系統比原始品質分數更重要。一個在基準測試中排名全球第二的模型確實令人印象深刻,但基準測試衡量的是片段,參考功能衡量的則是系列。兩者不是同一種採購,而 Vidu 賣的是後者。

目前尚未達標之處

參考一致性並非完美,六分之五不等於六分之六。在第六個案例失敗的地方,工具產出的臉部與服裝偏離了來源,而這正是會讓系列崩掉的失誤。成本也是真實的,每秒 0.14 美元在一段 16 秒的片段中很快就會累積,到了動輒數百顆鏡頭的系列規模時更會變得可觀。流程層產出的是草稿,而非完成的廣告;評論者也發現,即使反覆修正提示詞,它也無法可靠地修正某個結構細節。

還有一個值得點名的結構性限制。參考圖生影片能錨定身分,但尚未解決整部製作的連貫性。仍然必須有人做出導演選擇,把一組一致的片段變成一個故事,而模型對節奏、鏡頭涵蓋或某場戲是否該存在,都沒有意見。

值得觀察什麼

三 SKU 結構是其他廠商很可能會複製的部分。如果參考圖生影片成為系列內容製作的預設方式,預期會有更多模型家族推出針對特定工作的變體,而非單一旗艦款。接下來重要的問題是:一致性能否在更長時長與更困難的鏡頭調度下維持,以及流程層是否會好到能賣給工作室,而不只是個人創作者。

相關文章