Kling VIDEO O1 讓影片生成成為參考系統

--- title: Kling VIDEO O1 讓影片生成成為參考系統 slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1 讓參考成為介面 meta_description: 快手的 Kling VIDEO O1 接受文字、圖像、影片、關鍵影格與參考素材的任意組合,接著讓你將某段影片中的元素拉進另一段影片。 category: ai tags: Kling VIDEO O1,快手,影片生成,參考系統,關鍵影格,多模態,Veo 3.1,Runway Aleph,一致性 ---
快手的影片業務在過去一個月持續發布新產品。Kling 4.0 向測試者開放,隨後獲得更大的發布窗口。如今 VIDEO O1 登場,更像是一次品類轉移:一個模型可接受文字、圖像、影片片段、關鍵影格與角色參考作為輸入,並把它們全視為單一請求中可互換的組成部分。
該公司使用的標籤是「統一多模態」。實際做法更容易說明。你可以附上三段影片並寫道:把第一段影片中的角色、第二段影片的攝影機運動拿來,將兩者放進第三段影片,並把風格切換為像素藝術。
一年前,這個單一請求需要三個獨立工具,還要小心匯出中間檔案,每一次轉換都會多一次壓縮,也讓角色有偏移的機會。
一體式參考實際上帶來什麼
角色與道具一致性一直是 AI 影片中難解的問題。早期變通做法是把多個模型串接起來,這意味著每一步都要付費,並接受它們之間累積的偏移。Kling 的做法把這條鏈折疊進單次生成,因此參考圖像、關鍵影格與風格方向都會一次解決。
Kling 自家數據顯示,O1 在圖像參考任務上對 Google Veo 3.1 的「Ingredients to Video」功能取得 247% 勝率,在轉換任務上對 Runway Aleph 則為 230%。那些是內部評估,因此僅供方向性參考。能力宣稱更可驗證:在需要讓多個主體各自保持鎖定的群體場景中,每個主體會分別處理,而不是混成一個平均值。
影片長度為三到十秒,可調整,讓你能掌控鏡頭節奏,而不是接受模型自行決定的一切。在底層,該公司描述了一種具備長多模態上下文的多模態 Transformer,以及一種新的內部格式,稱為多模態視覺語言,能在 Transformer 本身內部融合文字、視覺與音訊訊號。內建的思維鏈推理旨在讓生成的動作在物理上合理。
列出的生成類型讀起來像是一份清單,涵蓋這個類別過去拆分成獨立工具的所有項目:文字轉影片、圖像轉影片、影片轉影片、關鍵影格轉影片、多圖轉影片,以及參考轉影片轉影片。這些過去各自是一項產品。O1 的主張是,它們只是一個系統的不同模式。
為何介面比基準測試更重要
有趣之處在於 O1 竟然能在比較中勝出,而更重要的是模型輸入介面的改變。它現在是一座可重複使用資產的庫。用多個角度建立的角色,會變成一個可用名稱附加的元素,而不是每次提示都要重新描述。攝影機運動變成可從某段影片借用的東西,而不是用形容詞去近似。

這改變了工作流程的形狀。從圖像模型到影片模型再到剪輯師的線性鏈結,每一跳都有成本,如今會壓縮成更少的環節。它也改變了工具的目標對象:後製團隊能用自然語言指令取代追蹤與遮罩工序,廣告團隊則能取代實拍,而不必從頭重建每個鏡頭。
詞彙是介面的另一半。用名稱附加元素意味著團隊可以在撰寫任何鏡頭提示之前,先對角色的稱呼達成共識,然後在整個廣告活動中重複使用該名稱。用形容詞近似同一件事只能成功一次,之後每次修改都會更難,因為沒有紀錄顯示是哪種形容詞組合產出了大家喜歡的版本。
供應商文件以類似措辭描述專業用例。AI 電影製作仰賴元素庫,讓角色與道具在整場拍攝中保持一致。廣告與時尚業用它替代外景作業,包括虛擬伸展台。後製用它做出過去需要逐格轉描的修改。
這裡存在一種自我選擇效應。擁有這麼多輸入類型的模型,對初學者並不更友善;它更友善的對象是已經知道自己要什麼的人。對一個花了兩年優化首次使用體驗的類別來說,這是意義重大的轉變。
參考系統取代了什麼
理解這項轉變最清楚的方式,是看看團隊過去如何圍繞一個能力較弱的模型建立流程。一致性流程就像組裝線:生成角色設定圖,將它作為圖像提示餵進每個鏡頭,生成動態分鏡,然後用動態分鏡中的起始影格重新生成每個鏡頭。每個階段之所以存在,是因為前一階段無法把足夠的上下文帶到下一階段。
O1 的參考系統針對的正是那些階段存在的原因。如果模型能在群體場景中維持角色身分,同時從另一段影片取得攝影機運動,那麼其中一些階段就會從必要變成可選。可選階段才是預算真正會變動的地方,因為圍繞某項限制建立的流程,不會因為限制放寬就自動消失。
同樣的邏輯也適用於鏡頭排序。根據現有素材生成前一個或下一個鏡頭的程式,會把影片片段庫變成更接近場景的東西。已經在時間軸上工作的剪輯師會認同其價值:嘗試替代角度的成本,從重拍降到一次生成。
取捨確實存在
Kling 表示 O1 的學習曲線比 Sora 2 或 Veo 3.1 更陡峭,因為在這些能力變得有用之前,需要先理解更多功能。這是更具表現力介面的標準代價。一個什麼都能當參考的模型,會要求你決定什麼才該被參考。
該公司尚未在 O1 中解決聲音問題。Kling 2.6 是該平台負責音訊生成的模型,具備同步對白、音樂與音效。因此完整製作仍意味著要搭配兩個模型,一個負責視覺語言,一個負責配樂。Kling 對 2.6 的行銷訴求圍繞著「看見聲音、聽見畫面」的概念,這也貼切描述了 O1 之外的一項能力。
定價也反映了該平台想占據的位置。Kling 公布的每秒點數從 720p 無音訊的六點,上升到 1080p 含音訊的十二點,且該平台推廣的商業使用政策也涵蓋免費生成。對一款定位於專業工作流程的模型而言,入門門檻仍夠低,讓小型團隊能在投入前先測試。
值得觀察的重點
O1 的參考系統在受控示範之外是否仍站得住腳。一致性宣稱通常能通過短片與短時段測試,但當專案持續數週並累積數十個元素時就會退化。元素庫概念唯有在元素於這段期間保持穩定時才真正有價值。
快手已表示 4.0 帶來 30 秒原生生成,以及最多 10 個關鍵影格。如果 O1 的參考層能與這些限制相輔相成,而不是互相競爭,兩者加起來就能同時回答「多長」與「是誰的臉」這兩個問題。這種組合正是各家工作室一直在等待的。
短期競爭態勢也很重要。Gemini Omni 1.1 Flash 以 1516 分在 Arena 的文字轉影片排行榜居首,MiniMax H3 在圖像轉影片領先,Wan 3.0 則在 Artificial Analysis 的影片榜居冠。O1 並非進入一片空白的領域。它的差異化在於輸入介面,而不是排行榜位置;一旦團隊圍繞它建立元素庫,這種差異就更難被取代。