Kandinsky 6.0 開源能在同一輪生成聲音的影片權重

--- title: Kandinsky 6.0 開源能在同一輪生成聲音的影片權重 meta_title: Kandinsky 6.0 開源原生音訊影片 meta_description: Kandinsky Lab 以 MIT 授權發布 3B 與 29B 影片模型,能在單次生成中產生同步音訊,並獲得 vLLM-Omni 首日支援。 ---
多數開源文字轉影片系統都把聲音當成別人的問題。你先產生無聲影片,之後再補上配樂,而嘴型很少能對上對白。Kandinsky Lab 本週在 fal 發布的解法,是同時對兩者進行建模。
Kandinsky 6.0 Video 推出兩種規模:鎖定電影級輸出的 29B Pro 模型,以及用於快速迭代的 3B Lite 版本。程式碼與權重以 MIT 授權釋出,對任何打算商業使用的人來說,這比參數量更重要。
兩個等級實際上能提供什麼
兩個模型都鎖定短片生成。影片長度最高約五秒,音訊以 44kHz 取樣率輸出。Pro 是品質等級;Lite 則鎖定需要快速迭代、且願意以保真度換取速度與成本的團隊。
最受矚目的能力是聯合生成。語言、視覺與音訊是一起建模,而非串成流程管線,因此腳步聲、環境音效與嘴型都能與畫面上發生的事情對齊。這種原生同步大多屬於封閉商業系統的範疇,也因此開源釋出格外引人注目。

vLLM-Omni 提供首日推論支援。這不只是方便與否的問題。當推論堆疊在發布當天就支援,而非數週後才跟上,團隊就能在最初的熱潮消退前,用自己的工作負載評估模型。
在 fal 上,模型搭配整合式放大功能與獨立影片超解析度工具。因此實務上的流程是:輸入文字或圖片,輸出五秒短片,然後再放大。
授權條款需要仔細解讀
以下是值得注意的部分。相關報導將此釋出描述為 MIT,而 Kandinsky Lab 自己的公告也說程式碼與權重是在 MIT 授權下提供。然而,一個獨立模型追蹤網站卻將其授權列為自訂,而非標準寬鬆授權。
在任何人在這些權重之上打造產品前,這個差異值得先釐清。真正的寬鬆授權意味著商業使用、修改與再散布都不需要另外簽約。自訂授權乍看之下可能同樣開放,卻仍帶有日後才會浮現的限制,通常與地區、規模或下游再散布有關。
今年的模式是中國實驗室發布開放權重,名稱聽起來很寬鬆,但條款裡藏著排除條款。例如 MiniMax 的 H3 授權就排除美國、歐盟、英國與韓國。任何要從模型卡走向部署計畫的人,都應該閱讀實際條款。
如果這些描述屬實,MIT 授權的影片權重會是意義重大的一步。寬鬆的影片授權比寬鬆的語言模型授權更罕見,部分原因是影片模型在訓練資料的來源追溯上有更複雜的問題,另一部分原因是產出這些模型的實驗室往往更偏商業化。一個真正開放、又能處理音訊的影片模型,將為小型工作室提供一條不必簽 API 合約的路。
為什麼同步音訊是更難的問題
從文字提示生成看似合理的動作,已經解決到一定程度,以至於有趣的工作已轉往別處。開源影片生成中一直令人不滿的部分,就是音訊。
想想無聲生成把什麼推給使用者。角色在說話,但下顎卻按自己的節奏移動。有人在走路,但腳步聲得在後製加上,還得逐格手動對齊。門關上了,卻沒有聲音,而隨手放個現成音效也很少落在正確的畫格上。這些問題個別來看都很小,合起來卻是一筆持續的負擔,因為每一項都需要剪輯師的注意力。
聯合建模改變了任務的形態。模型在內部處理時間軸,因此輸出會更接近完成品。對短片內容、社群廣告與角色動畫來說,這就是 demo 與可交付成果之間的差別。
Pro 是否真的達到緊密同步,與架構是否支援這件事是兩回事,而能定論的獨立評估尚未出爐。這次釋出提出了主張並提供示範;把這些當成證明還言之過早。
它在開源影片陣營中的位置
五秒短片讓 Kandinsky 6.0 穩穩落在當前開源影片生成領域之中,而非領先群倫。阿里巴巴的 Wan 3.0 以 Elo 1157 在 Artificial Analysis 重建的文字轉影片排行榜上位居第一,而值得自己執行的開放權重選項,尤其是 MiniMax H3,也早已站穩腳步。
因此公平的說法是,它具競爭力,而非革命性。Kandinsky 6.0 增添的是在開放授權下提供原生音訊,以及涵蓋嚴肅品質等級與輕量等級的規模範圍。尤其是 3B Lite 模型,為那些永遠無法合理化自行託管 29B 擴散模型的團隊打開了大門。
雙層結構也讓團隊能明確權衡取捨。在迭代提示與分鏡腳本時使用 Lite,此時五秒短片只需要存在,不必好看。一旦序列定稿,就改用 Pro。這種工作流程形態,封閉供應商已支援一段時間,而開放權重則大多付之闕如。
值得觀察的重點
有三件事能告訴你,這次釋出在六個月後是否仍具重要性。
第一,授權條款。如果結果真的是寬鬆授權,這個模型會成為商業開源影片工作的預設選項。如果限制具有實質意義,採用情況就會集中在限制不造成影響的地區。
第二,獨立基準測試。Artificial Analysis 正以新的規模重建其圖片轉影片排行榜,而每當排行榜更新,Elo 都會變動。在 Kandinsky 6.0 出現在那樣的排行榜之前,品質主張仍仰賴廠商示範。目前的文字轉影片排行榜由 Wan 3.0 居首,Elo 為 1157,成本為每分鐘 12 美元,並在 20 個類別中拿下 10 勝,這讓人看出該領域頂端有多擁擠。Kandinsky 6.0 並不是在那個層級競爭,而誠實的問題是:它需要嗎?
第三,音訊在嚴格檢視下是否站得住腳。同步在一個人對著鏡頭說話的五秒短片中很容易展示,但在有重疊聲音的擁擠場景中卻很難展現。目前發布的示範都是簡單版本。
還有一點要考慮,適用於任何打算以此為基礎打造的團隊。影片生成模型的執行成本很高,而 29B 擴散模型是相當可觀的部署。透過 fal 租用算力能移除這個負擔,但也移除了開放權重的主要優勢:自己執行。對多數團隊來說,3B Lite 等級是更有趣的選項,因為它是比較有可能跑在小工作室現有硬體上的版本。
就目前而言,有趣的事實在於結構。一個能同時產生影像與聲音的開放模型,其授權可能完全寬鬆,也可能不是,而推論支援更在同一天到來。開源與封閉影片生成之間的差距本週縮小了,而授權問題將決定這個差距有多少仍會保持封閉。