← 返回部落格
Ai預計閱讀 11 分鐘

雙幀法:首尾幀插值如何改變 AI 影片規劃

發布於 2026年10月10日
雙幀法:首尾幀插值如何改變 AI 影片規劃

Google 於 10 月 9 日更新了 Veo 3.1 的「首尾幀轉影片」(First and Last Frame to Video)功能。你上傳兩張靜態圖,開場幀與收尾幀,模型便會生成其間的動態。輸出最高可達 4K、60fps,並支援原生音訊,也支援 9:16 直式格式,還能接受三或四張參考圖,以維持角色與風格一致。

單看之下,這聽起來像是個小更新。但實際上,它改變了人們規劃鏡頭的方式,因為它把真正重要的兩項決策重新放回流程的最前端。

純提示詞影片的問題

過去兩年大部分時間裡,AI 影片就像吃角子老虎機。你寫下一段文字,等待,然後看著某個成果跑出來。結果往往還算堪用、足以發文,卻很少好到能拿來正式使用。如果角色走樣,或鏡頭出現奇怪的動作,你就改寫提示詞,再試一次。

創作者學會繞過這個問題。他們先生成一張有力的靜態圖,再請模型將它動起來,也就是圖生影片。這固定了開場幀,但沒人控制得了鏡頭在哪裡結束。片段往往不是後繼無力,就是自己發明了一個沒人要求的結尾。

把兩端都定義清楚,就能消除一大部分這種猜測。你決定觀眾從哪裡開始看、在哪裡結束觀看。模型的工作變得更狹窄:把這兩端連接起來。

為什麼分鏡思維回來了

動畫工作室這樣工作已經有一個世紀了。動畫師畫出一個關鍵姿勢,再畫另一個關鍵姿勢,然後補上其間的圖畫。工藝在於選擇姿勢,而不是把每一格都畫出來。AI 影片正以不同的路徑,抵達同樣的分工方式。

這不是 Veo 獨有。可控性競賽已經醞釀數月。Kling 4.0 推出時支援十個關鍵幀與 30 秒原生片段。Seedance 2.5 能從新的攝影機角度重拍既有素材。Wan 3.0 以 Elo 1157 登上 Artificial Analysis 的 AA-Video-T2V v2.0 基準測試榜首,價格約為每分鐘 12 美元。Vidu 的 Q4 預覽版於 10 月 7 日發布,起價約為每秒 0.014 美元,並可接受最多 15 張圖像參考。最強模型之間的共同點,與其說在於原始品質,不如說在於你能多精準地操控它們。

時間軸上有兩個關鍵幀,由一道發光的動態弧線相連

一套可行的工作配置看起來如何

雙幀法唯有在兩個影格值得相連時才有回報。幾個習慣會有幫助。

用圖像模型生成這些影格,而不是從先前的片段截圖。你要在兩端都能控制構圖、光線與服裝。Google 的 Veo 接受參考圖,正是為了讓臉孔或產品在轉換過程中保持一致,而這只有在參考圖從一開始就一致時才奏效。

讓攝影機運動保持簡單。插值能好好處理推近、拉遠、揭示或緩慢漂移。當你要求在單一片段內做出硬切時,它會很吃力,因為沒有切點可供插值。如果一個鏡頭需要剪接,就做成兩段片段。

讓音訊規劃配合鏡頭。Veo 3.1 會合成原生音訊,這對環境音與簡單音效很實用。如果場景需要特定台詞或授權音樂,請打算之後再加,而不是跟生成的音效硬碰硬。

把這個方法保留給承載故事節拍的鏡頭。沒有理由為了一個兩秒的過場,花費兩個精心建構的影格。把它用在觀眾理應注意到變化的地方。

多出兩幀實際上要付出什麼成本

以影格來規劃,是一項帶有價格標籤的決定,而這個價格現在比一年前更容易看清。影片市場一直在每秒成本上向下競逐。Vidu 的 Q4 預覽版於 10 月 7 日發布,起價約為每秒 0.014 美元,並可接受最多十五張圖像參考。xAI 的 Grok Imagine Video 1.5 Lite 於 10 月 8 日加入其 API,480p 定價為每秒 0.02 美元,1080p 則升至 0.14 美元。HeyGen 新的通用影片模型以 10 月促銷價每秒一美分推出。Wan 3.0 以 Elo 1157 登上 Artificial Analysis 影片基準測試榜首,定價約為每分鐘 12 美元,換算下來是每秒二十美分。

由此可得出兩件事。第一,現在生成本身很少是昂貴的部分。幾秒的插值動態只需幾美分,而不是幾美元。第二,稀缺資源是影格。生成並挑選兩張有力的靜態圖,需要人的時間,而 API 變便宜並不會讓這段時間跟著變便宜。這樣的經濟邏輯獎勵規劃,而不是產量,這與純提示詞工具訓練人們養成的行為恰好相反。

在真實專案中站得住腳的工作流程

以下是這個方法如何套進小型製作,而不必把所有事情都改掉。先從概念開始,決定這個鏡頭必須打中的單一節拍。把開場幀與收尾幀做成圖像,並使用相同的參考圖,讓臉孔、服裝與道具一致。生成插值,然後先看一遍結構,再看一遍細節。如果動態曲線不對,修正影格,而不是修正提示詞,因為模型真正讀取的是影格。依鏡頭需要加入或替換音訊。接著將它剪進序列中,並在脈絡裡評判它,因為單看很驚人的片段,放在鄰居旁邊仍可能顯得緩慢。

這裡的紀律在於,每一次修正都是關於故事的決定,而不是擲骰子。這是人們第一次試用這項功能時會錯過的部分。它感覺像捷徑,卻悄悄恢復了第一代 AI 影片工具讓人們跳過的前製作業。

一般攝影機仍勝出的地方

這一切並不是在說實拍已經過時。當兩端很強、其間動態很簡單時,插值最為強大,這涵蓋了許多產品鏡頭、過場、標題卡與氛圍建立鏡頭。當現實正在做某件具體且不可預測的事時,它最為薄弱:一匹真正全速奔馳的馬、一群正在反應的群眾、以必須看起來真實的方式烹調中的食物。面對這些,攝影機加上一位稱職的剪輯師,仍然能結束爭論。

合理的立場很無趣。在控制很重要、動態可預測的地方使用插值;在場景需要真實感的地方使用攝影機。大多數在職創作者最後會在同一個專案裡兩者並用,而這種混合並不是妥協。它就只是製作。

誠實的限制

插值終究還是插值。如果兩個影格暗示的中間過程在物理上很複雜,例如一個人轉整整一圈,或液體改變形狀,模型就會發明某個東西,而它不見得總是對的。讓暗示的動態維持在攝影機可能合理拍到的範圍內。

它也會推高成本。兩張精緻的靜態圖加上一段生成片段,比單一提示詞更費工。以目前市場上的每秒價格來看,這比一年前更負擔得起,但規劃時間是真實存在的。這個方法獎勵已經以鏡頭思考的人。

而且中間仍然沒有保證。這項功能真正賣的,是更小的搜尋空間,而不是已經解決的問題。這是意義重大的一步。它意味著,一段可用片段與一段令人難忘的片段之間的差異,現在主要取決於你選擇的影格,而那是人做出的決定。

接下來該留意什麼

可以預期同樣的模式會擴散。一旦某個主要模型把影格視為主要輸入,競爭者往往會跟進,而有趣的問題就變成:誰的插值在接縫處看起來最自然。留意那些能讓你加入中間關鍵幀的工具,那會讓導演不必離開時間軸,就能擁有第三個錨點。

就目前而言,實用的結論並不光鮮。如果你做 AI 影片,別再把提示詞當成主要的創作行為。先建構影格,挑出能說故事的兩張,讓模型處理它們之間的旅程。

相關文章