代理程式本週開始執導短片。瓶頸轉移到了品質控制。

一位開發者於 10 月 5 日透露,一部名為《The Clockwork Moth》的動畫短片由一條在單張 RTX 5090 上運行的 14 代理程式管線端到端製作完成。約十分鐘的管線時間涵蓋了九個場景中的 106 個鏡頭,以及四個反覆出現角色的 19 個場景狀態。自動化品質控制通過了 102 項檢查中的 102 項。資產包大小為 2.4 GB。工具鏈未披露。
有趣的部分與運行時間關係不大。引人注目的是開發者所說的難題所在:保持角色身份在鏡頭之間的一致性,以及自動化品質控制。而不是第一幀。
這一結論與同週的第二個項目相符。一位 Reddit 用戶發布了《DOGNAPPED》,一部三分鐘的會說話的狗喜劇,幾乎完全由 Claude 在基於開源 Video Builder 節點構建的 ComfyUI 設置中運行 Claude Code 製作而成。人類貢獻了簡報、兩隻真實狗的參考照片以及工具。Claude 編寫了故事,發明了第三隻狗角色,生成了地點和角色參考,編寫了帶有鏡頭說明的 22 場景劇本,通過 MiniMax H3 渲染了每個場景的視頻、配音和音效,用 MiniMax Music 3 創作了配樂,並剪輯了影片。渲染耗時約四個半小時。
然後模型進行了自己的重拍。品質控制迴圈將每句台詞轉錄並與劇本比對,檢查音高,審查幀和剪輯,並運行幀精確的音視頻同步檢查。在小狗咿呀學語或狗盯著鏡頭的地方,它重新拍攝了場景。

為什麼品質控制迴圈是重點
生成單個令人信服的鏡頭已經是一個足夠解決的問題,演示已是常態。將一百零六個這樣的鏡頭組裝起來,使得同一個角色在所有鏡頭中看起來都是同一個角色,則並非如此。
身份漂移是破壞長篇 AI 視頻的故障模式。一個在孤立情況下能很好地渲染角色的模型,仍然會在鏡頭之間改變面部、服裝或髮際線,因為每次生成都是從分佈中重新抽取。常見的修復方法是參考條件、針對特定角色訓練的 LoRA 以及手動選擇。所有這些都在管線本應消除人工勞動的地方增加了人工勞動。
自動化品質控制是另一半。一條能產出素材但無法區分好壞輸出的管線會將審查負擔轉移到人身上,而一個人審查一百個鏡頭正是整個方法旨在消除的瓶頸。《DOGNAPPED》工作流通過將劇本轉化為驗證預言機來解決這個問題:轉錄每一行,與所寫內容進行比較,檢查音高,檢查同步,標記失敗,重新渲染。這是一種程式化的「可接受」定義,不需要人工觀看所有內容。
本週的模式
幾個項目都呈現出相同的形態。一位用戶名為 konte 的用戶將 Claude Code 變成了一位執行製片人,並在單張 RTX 5090 上生成了一段兩分五十四秒的音樂視頻:61 個鏡頭,342 項任務,約兩小時的人工參與和約四個半小時的生成。鏡頭是根據歌曲的節奏和節拍編寫的,因此剪輯落在音樂上。
另一條路線完全跳過了文本到視頻。Claude Opus 5.5 為每一幀和每一段音樂編寫代碼,製作了一部名為《I Have Never Seen the Sun》的短片,提示詞被設定為一部三到五分鐘、面向電影節的作品。
最後一種方法指向了該領域的一個真實分歧。代碼生成的動態是確定性的。如果第 420 幀看起來不對,你可以更改代碼並重新渲染第 420 幀。擴散視頻是隨機的。如果一個鏡頭不對,你只能重新生成並希望好運。對於動態字體、UI 動畫、圖表和標誌揭示等設計運動,確定性路徑更強。對於照片級真實的人類、自然表演和現實世界物理,擴散模型仍然勝出,因為代碼無法模擬它從未建模過的內容。
轉變背後的工具
這些項目的共同點是將編碼代理連接到生成管線中。Video Builder 節點、自定義 ComfyUI 圖以及通過 API 調用開源模型的代理技能,賦予語言模型與開發者相同的渲染訪問權限。模型本身不需要是視頻模型。它需要能夠編寫和運行驅動視頻模型的代碼。
這就是為什麼成本概況看起來如此。在一次公開的會話中,一位創作者向 Claude Opus 5.5 提供了超過 7,000 張 Midjourney 圖像和一首 Suno 曲目,並運行了一個持續約兩小時的自主創意會話,花費約 6.80 美元。在《DOGNAPPED》項目中,主要成本是本地渲染時間而非 API 調用。當基礎模型是開放權重且編排是代碼時,實驗的邊際成本急劇下降。
對技能產生了二階效應。留給人的工作已從操作時間線或盯著渲染,轉向精確指定簡報,以便自動檢查器可以決定輸出是否滿足要求。本週發布的每個項目都在某處編碼了其驗收標準,因為管線無法在「讓它更好」上進行迭代。
仍然行不通的地方
這些演示對其局限性很誠實,而且局限性是一致的。角色身份在少數鏡頭中保持,但在數十個鏡頭中會漂移,這就是為什麼參考條件和每個角色的適配器是標準做法。長遠結構是脆弱的:一部看起來連貫三十秒的電影,到第三分鐘可能會失去空間或時間一致性。而自動化品質控制只能檢查它被告知要檢查的內容,這意味著一條驗證對話和同步的管線會愉快地通過一個沒有人編寫檢查的連續性錯誤場景。
這些限制解釋了為什麼本週發布的項目都是短片。一部三分鐘的喜劇,演員陣容小,場景簡單,是一個可解決的問題。一部有幾十個角色、不斷變化的服裝和復雜舞台佈景的長片則不是,至少目前不是,除非人工審查的輸出量遠超自動化本應節省的量。
這對製作預算的改變
經濟性正在以一種特定的方式轉變。當一部短片只需幾美元的計算費用和一個下午的編排時,限制就不再是金錢,而是簡報的清晰度。倖存下來的人類貢獻是知道你想要什麼,並能夠精確地表達出來,以便代理可以驗證它。
這也引發了一個治理問題。一個編寫劇本、渲染、判斷自己的輸出並重拍失敗鏡頭的代理,在沒有人參與的情況下做出創意決策。品質控制迴圈使輸出更可靠,這也意味著模型自己的標準定義了「完成」的樣子。
本週的項目是演示,其工具鏈部分未披露。但方向是一致的。生成是廉價的,編排是產品,決定一條管線是否有用的因素是它能否判斷自己何時失敗。
相關文章
Boston Dynamics 砍掉 Atlas 的一根手指,還稱之為進步
放棄小指不是為了成本的妥協,而是來自一場用膠帶和一天的打字實驗。
Spira Maxima 跳過片段,直接交付整支影片
生成變便宜了。完稿仍靠人力。這個落差就是 Spira Maxima 鎖定的市場。
Cloudflare 推出 270 億參數決策模型,在 Jev 的主場擊敗 Jev
有些模型呼叫應該回傳一個數字,而不是一段文字。一個類別正圍繞這個想法成形。
BOSSFIGHT 讓前沿模型當了 24 週咖啡店老闆,多數輸給了「什麼都不做」
在測驗中拒絕賄賂,與在真實季度中拒絕妥協,是兩種不同的能力,而目前的評測往往只衡量了較容易的那一種。