← 返回部落格
Tutorial預計閱讀 10 分鐘

為什麼 AI 影片仍會在手部與臉部出錯,以及能修正它的順序

發布於 2026年10月4日
為什麼 AI 影片仍會在手部與臉部出錯,以及能修正它的順序

問問任何曾為客戶交付 AI 影片的人,同樣的抱怨總會回來。手不對。臉會飄移。一切看起來驚豔,直到角色拿起某個東西的那一刻,然後幻覺就在觀眾無法移開視線的地方崩塌。

解決方法與其說取決於模型,不如說取決於你的工作順序。能穩定產出成果的工作室,會先產生靜態影像、檢查、修復,然後才進行動畫生成。

順序比模型更重要

在靜態影像中抓到壞掉的大拇指,只需要一次影像編輯。在影片生成後才抓到,就得把整段影片重新跑一次。以目前價格來看,一支八秒影片依模型不同,可能只要少量點數,也可能要數百點,而一次影像編輯只是其中一小部分。從影片往回推的工作方式,會把昂貴資源浪費在一個你原本幾乎不花成本就能看出的瑕疵上。

不同模型能鎖定多少人體結構,差別很大

目前每個影片模型都接受某種形式的圖像輸入,而一致性的上限取決於它能接受多少參考資料,以及是否支援首尾幀控制。這項控制是未被充分利用的槓桿。與其讓模型自行發明動作的終點,你提供兩端,讓模型在你已核准的兩個影格之間進行插值。

Veo 3.1 最多可接受同一人物或產品的三張素材圖像,以及首幀和尾幀。當臉部和音訊都必須到位時,它就是你會選擇的模型;Veo 3.1 Fast 以較低價格提供相同的參考輸入,讓你在花費旗艦模型點數之前先做動作走位。Seedance 2.0 最多可接受九張圖像、三段影片剪輯和三段音訊剪輯作為參考,執行生成最長可達十五秒,不過真實人臉需要 ByteDance 的同意與臉部檢查。Kling 3.0 以每組二到四張參考圖像建立 Elements,每段剪輯最多三組,這就是讓同一主體在多鏡頭序列中維持一致的方法。Runway Gen-4.5 只接受首幀。

從這項比較得出的實用規則:在快速模型上跑一次草稿,是你最便宜的診斷方式。如果手部在 Veo Fast 上就失敗了,那它在旗艦模型上也不太可能撐住,而你只花了更少點數就知道了。

從產品已經被拿著的狀態開始

有一項技巧在製作筆記中反覆出現,而且簡單到幾乎不可思議。從產品已經在手中的狀態開始,然後再移動鏡頭。模型保留既有握持狀態的可靠度,遠高於讓它形成一個新的握持。要求模型自行想出人類如何拿起東西,等於要它解決一個和這個鏡頭目的毫無關係的問題。

同樣的邏輯也適用於臉部。如果鏡頭需要一個可辨識的人物,請提供參考圖,讓模型進行插值,而不是用文字描述臉部然後祈禱。文字描述產生的臉,乍看之下合理,盯久了卻令人不安,對任何觀眾會反覆觀看的內容來說,這是最糟的結果。

片段長度逼你做出選擇

若單一鏡頭超過約八秒,可選範圍就縮小到 Seedance 2.0 和 Kling 3.0,它們最長可執行十五秒。其他模型都需要接續生成,而接續正是角色與物件一致性再次崩壞的地方。這就是首尾幀控制如此重要的原因:它是一種機制,讓握持狀態能跨越剪接延續下去,而不用讓模型重新發明一次。

靜態優先的順序,其實是經濟考量

把它當成一種製作方法,算術就很明顯。相較於跑一次影片,圖像生成和圖像編輯都很便宜。影片成本會隨長度和解析度增加,而且它是整條流程中唯一一個一旦犯錯、你已經付了錢才發現的步驟。上游的一切,都是為了確保這個昂貴步驟不必重來。

這顛倒了大多數人從提示詞帶來的直覺。自然做法是用文字描述整個場景,然後直接生成影片,因為那感覺像是在以最強大的方式使用模型。但那也是最花錢、保障最少的做法。先核准一個影格,會把開放式生成變成受控生成,因為模型現在動畫化的是你已經判定為正確的東西。

同樣的順序也能防止一種更細微的失敗:那個逐格看都很好、一動起來就錯的鏡頭。一隻在靜態影像中看起來沒問題的手,可能一移動就崩壞,而唯一知道的方法就是觀看它,這也表示你無論如何都會看它。問題在於,你正在看的是一段有問題但你可以修正的影片,還是一段有問題、你只能付錢重做的影片。

模型真正仍有差異的地方

模型之間的差異不全是價格等級。可接受的參考圖像數量,以及是否具備首尾幀控制,會改變能做到什麼,而不只是花多少錢。只限於單一首幀的模型,無法讓主體跨越剪接維持一致,因為模型沒有第二個參考點可以對準。

這就是為什麼參考規格值得和品質評分受到同樣關注。能接受九張參考圖像的模型,可以用只接受首幀的模型做不到的方式,讓角色貫穿整個序列,即使後者能產出更漂亮的單段影片。若是人物講話的頭部特寫,較漂亮的模型勝出。若是帶有反覆出現產品的短序列,參考圖像額度更高的模型勝出。

首尾幀控制是多數團隊最未充分利用的槓桿,而且它直指每個影片模型的核心弱點:模型會發明一個你無法預測的終點。提供兩端,意味著模型在你已經檢查過的兩個影格之間插值。動作之所以保持合理,是因為端點是真實的,而一致性問題也不再是對模型想像力的賭博。

這對誰能做這份工作意味著什麼

這個順序和參考控制合在一起,擴大了能產出合格 AI 影片的族群。沒有後製流程的小型工作室,現在可以產生一張靜態影像,在圖像編輯器中修好它,然後製作一段撐得住的動畫鏡頭,不必再依賴過去不可或缺的專業清理。技能從修補壞掉的影格,轉移到規劃能避開模型仍會失敗情況的鏡頭。

這和兩年前衝擊靜態圖像生成的轉變一樣。當工具變得夠可靠,工藝就向上游移動到藝術指導,向下游移動到審查,而中間那個得靠人與工具搏鬥、硬讓它配合的步驟則縮小了。影片現在正進入那個階段,而最先調整流程的團隊,將能在其他人還在重跑影片時準時交付。

所以這套紀律值得寫下來。產生靜態影像、修好手部、核准影格,然後才做動畫。模型得到功勞,順序換來成果。

相關文章