← 返回部落格
Ai預計閱讀 11 分鐘

Vibe Video:以撰寫前端程式碼製作影片的程式模型

發布於 2026年10月10日
Vibe Video:以撰寫前端程式碼製作影片的程式模型

過去一個月,全球討論度最高的 AI 影片並不是由影片模型製作的。它是由一個程式碼模型製作的:它持續編寫前端程式碼,直到動畫成形。

這些短片來自 Claude Opus 5.5。在一個廣為流傳的案例中,一位創作者使用參考提示詞、Midjourney 的使用權限,以及情緒板,在大約十二小時內製作出一部電影感反烏托邦短片。該貼文突破 2,000 萬次觀看。另一位創作者只下了一道指令,就生成一支 2 分 16 秒的文明史作品;它在兩天內突破 1,000 萬次觀看。一個 GitHub 上的 Opus 5.5 影片合輯已蒐集超過 400 筆條目,其中大多數都附有公開的提示詞與程式碼。

人們開始稱之為 Vibe Video。這個名字有點笨拙,但這套技術值得理解,因為它是一條與其他人正在走的道路截然不同的動態影像製作途徑。

以程式碼作為渲染引擎

常見的 AI 影片流程是擴散模型預測像素。你餵給它一段提示詞或一張靜態影像,它回傳影格。該模型以影片訓練,其運動感是從那些資料中學來的。

程式碼渲染的運作方式不同。語言模型撰寫會繪製動畫的 HTML、CSS、SVG 或 JavaScript,再由瀏覽器渲染。沒有任何東西是逐格預測的。動態來自明確描述位置、時間與緩動的程式碼。

這項差異很重要,因為它讓某些擴散模型覺得困難的事變得容易。精確的圖形、字體排印、圖表、幾何動態,以及畫面之間的轉場,只要是程式碼就輕而易舉。這些恰恰是影片模型做出來會顯得模糊不清的東西。代價是,程式碼渲染無法產生動態中寫實逼真的人臉。它只能畫出程式碼能描述的東西。

左側的程式碼編輯器面板,將內容饋送給右側清晰銳利的動畫影格

為何創作者一頭栽進去

有兩個特性解釋了這股熱潮。第一是可重現性。擴散模型產出的短片是一次取樣;再跑一次,你得到的會是表親,而不是雙胞胎。程式碼動畫則是一支程式。改一個數值,你就知道會發生什麼事。這讓修改變得便宜,而大部分實際工作正存在於修改之中。

第二是輸出已經是可讓工作流程其餘環節使用的格式。瀏覽器動畫可以被擷取、嵌入網站,或串接到資料來源。它天生就能放在產品頁或儀表板裡,而許多對動態的商業需求其實正是來自這些地方。

還有一個供給面的原因。Claude Opus 5.5 於 9 月 22 日推出,附有 230 頁的系統卡,API 定價為每百萬輸入 token 四美元、每百萬輸出 token 二十美元。它在多數任務上的基準測試表現接近前一代旗艦模型,成本卻明顯更低。更便宜的前沿模型讓長時間、反覆迭代的程式碼生成對個人而言變得可行,而這正是十二小時建構流程實際需要的條件。

另一條賽道

同一週,另一個通用模型正從不同方向進軍影片領域。據報導,GPT-6 Astra 會扮演某種 AI 導演,負責分鏡規劃與白模預覽,並深入 Blender、Unreal Engine 與 DaVinci Resolve 來搭建場景、安排鏡頭走位與處理剪輯。

把兩者放在一起看,就會浮現一個模式。通用模型並不是想在寫實動態上擊敗 Seedance、Kling 或 MiniMax。它們正往上游移動,進入規劃與製作流程,同時也往側邊移動,切入以程式化而非攝影方式生成的動態。這讓專門的影片模型繼續推進寫實度,而通用模型則接手流程中看起來像軟體的那些部分。

工作流程實際上怎麼跑

做出好成果的創作者所描述的程序,更接近軟體開發,而不是電影製作。你寫一段設定氛圍與限制條件的提示詞,模型產出程式碼,程式碼在瀏覽器中渲染,然後你查看結果。接著你改一件事,再跑一次。這個循環很短,而且輸出可以被檢查,這正是十二小時建構之所以可能的原因。花十二小時把一段文字交給影片模型,只會產生雜訊。花十二小時編輯程式碼,則會產出一件完成品。

情緒板與參考模型之所以重要,原因與構圖無關。它們讓靜態影像擁有一致的色調與主體,這樣當程式碼放置它們、並圍繞它們製作動態時,各片段看起來才像屬於同一部片。程式碼提供動態與字體排印。靜態影像提供世界。少了任何一半,另一半都無法成立。

成本真正落在何處

人們很容易以為程式碼渲染影片是免費的,因為渲染是在你自己電腦上的瀏覽器裡發生。模型呼叫並不免費,而且這個循環很長。每一次重寫都是一次付費請求,而一件有數百次編輯的作品,就是數百次附帶大量上下文的請求。Anthropic 把價格降到每百萬輸入 token 四美元,才讓這個循環對個人而不只是工作室來說變得負擔得起。模型越便宜,創作者就越能自由迭代,而迭代正是整套方法的核心。

這帶來一個奇怪的後果。這種風格的瓶頸不是渲染所需的算力,而是審查。必須有人觀看每一次渲染,並決定要改什麼,而這種注意力不會因為 API 價格降低而跟著規模化。成功運用 Vibe Video 的創作者,功能上就是盯著每日毛片、給出意見的導演,只不過這些意見會變成 diff。

程式碼渲染與生成式影片,並列比較

精確區分哪種風格擅長什麼會有幫助。程式碼渲染可重現、修改成本低、在圖形與文字上銳利清晰,而且很能處理資料。它無法生成寫實逼真的演員、群眾或自然捕捉的瞬間。擴散影片擅長這些,並把其他一切當成近似值。由影片模型渲染的標誌會看起來幾乎正確。由程式碼渲染的標誌則分毫不差。

這種分工意味著兩者會共存,而不是互相競爭。一件作品可能以生成的建立鏡頭開場,切到程式碼製作的動畫圖表,再以生成畫面收尾。有趣的創意問題不再是該用哪個工具,而是該在哪裡切換。能搞清楚這些接縫的團隊,將做出讓人覺得刻意為之的作品。

行不通的地方

程式碼渲染不是影片生成的替代品,若把它當成替代品,會讓人失望。它無法拍攝演員。它無法產生紀錄片式的畫面或可信的群眾。它擅長設計、抽象動態、資訊與介面,而不擅長任何需要看起來像有攝影機在場的東西。

它還有一種沒人談論的成本結構。在單一影格看起來正確之前,你可能會燒掉大量模型 token,因為這個循環是撰寫、渲染、檢查、重寫。更便宜的模型會降低這項成本,但不會讓它消失。做出驚人成果的創作者不只是在下提示詞;他們是在審查程式碼。

它告訴我們這個領域的什麼事

Vibe Video 有趣的地方,不在於程式碼模型能做出好看的短片。而在於「影片生成」與「讓東西動起來的軟體」之間的界線,結果比任何人以為的都更模糊。當語言模型能直接寫出動畫,部分對生成式影片的需求就被程式碼滿足了。

對製作視覺的人來說,實際的問題已不再是該挑哪一個工具。而是作品中的哪些部分最適合用預測出來的影格,哪些最適合用寫出來的影格。現在就想清楚這一點的團隊,他們的作品會看起來像是精心設計,而不只是生成出來的。

相關文章