← 返回部落格
Ai預計閱讀 10 分鐘

Gemini Omni 1.1 Flash 將四次請求串接成 40 秒鏡頭。工作流程才是產品。

發布於 2026年10月5日
Gemini Omni 1.1 Flash 將四次請求串接成 40 秒鏡頭。工作流程才是產品。

Google 的 Gemini Omni 1.1 Flash 是個很難評估的產品,因為模型本身並不新。它於 2026 年 8 月 27 日以 gemini-omni-1.1-flash 這個 ID 正式推出,較舊的預覽端點已於 9 月 30 日退役。生成周遭的一切都變了;生成品質大致仍停留在原來的水準。

功能清單讀起來就像一份製作檢查表。場景延伸現在會分析最多十秒的前後文,Google 稱這是相較於先前模型的一大躍進,因為舊模型只會參照最後一秒。影片以十秒為單位延伸,累計上限為四十秒。首尾影格控制讓開發者能指定鏡頭的起點與終點,並生成兩者之間的運動,鎖定攝影機環繞、變焦轉場,以及沒有可見接縫的循環。360p 草稿模式生成速度快上 60%,成本僅標準 720p 的三分之一。最終輸出可升頻至 1080p 或 4K。最多可提供三秒的影片作為角色與場景一致性的參考素材。

仔細閱讀延伸功能,因為行銷說法把它修飾掉了。一段四十秒的 Omni 片段是四次串接的請求,每次都以最後十秒作為上下文,而不是一次四十秒的生成。個別生成仍落在三到十秒之間。這個差別對任何要根據交付成果來估算延遲與推論成本的人來說都很重要,而這正是決定四十秒鏡頭是切實可行,還是只是理論上可行的細節。

單一金屬底片捲盤直立在深色桌面上,暖光穿透其間

定價設計就是要讓你反覆迭代

Google 的價格結構鼓勵草稿作業。API 定價為每百萬輸入 token 1.50 美元,以及每百萬影片輸出 token 17.50 美元,並以 720p 影片每秒 5,792 個 token 計費,換算下來大約是每秒 0.10 美元,或每分鐘 6 美元。以每段十秒片段來看,方案階梯從 360p 約 0.30 美元,到 720p 的 1.00 美元,到 1080p 的 1.50 美元,再到 4K 的 3.00 美元。

這個價格梯度並非偶然。360p 草稿與 4K 成品之間的差距達到一個數量級,這會促使團隊採用一種工作方法:在低解析度層級便宜地反覆迭代,只為最終成品付費。對比大多數人帶進影片生成領域的習慣——寫提示詞、等待、看結果、重寫提示詞,並為每一次擲骰子付全額費用。Google 正透過定價,把第二種行為從工作流程中淘汰。

也比較一下各通路的差異,因為功能分布並不平均。Google 將完整功能集定位為面向開發者且可透過 API 取得:五項功能透過 AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 提供給開發者,而 Gemini 應用程式中的消費者版本則僅限場景延伸。同一款模型也內建於 Google Flow,供 AI Plus、Pro 和 Ultra 訂閱者使用,並在 YouTube Shorts Remix 和 YouTube Create 應用程式中免費提供。一款模型,五種存取層級,其中四種拿不到有趣的功能。

四十秒鏡頭的算術

串接式延伸改變了一個鏡頭的成本,而且這個改變不是線性的。

單次三到十秒的生成既便宜又快速。四十秒的連續片段則是四次串聯的請求,而且每一次都可能獨立失敗。如果第三次請求產出的鏡次破壞了連貫性,你不會重新生成四十秒。你會從出問題那一小段的第一個影格重新生成,然後把後面所有內容重新串接,而犯錯的代價會隨著在序列中的位置而倍增。前十秒重做的成本很低。最後十秒則很昂貴,因為重做它們意味著要重做其下游的一切。

這就是關鍵影格控制的實際論據。能夠指定起始與結束影格,會把每個區段變成一個有界的問題,並在兩端各有一個驗證步驟。團隊不必再靠觀看整個序列、祈禱連貫性有維持住來判斷,而是可以檢查該區段是否落在它應該落到的影格上。對攝影機環繞或變焦轉場來說,這比自由形式的提示詞是更容易測試的工作單位。

360p 草稿層級也符合同樣的邏輯。以大約一美元而非六美元來製作四十秒序列的原型,讓反覆迭代變得可負擔,而升頻到 1080p 或 4K 則成為另一個刻意進行的步驟。Google 實際上推出的是一條把審核關卡內建於定價中的製作流程。

基準測試現在怎麼說

Gemini Omni 1.1 Flash 以 1516 分在 Arena 的文字轉影片排行榜領先,僅略勝自家前代 Gemini Omni Flash 的 1513 分,而 Arena 自己對較新模型的排名區間為一到四名,這是一種委婉的說法,表示兩者在信賴區間內並列。

其他地方的排行榜情況,並不像發表報導所暗示的那麼風光。這款模型在 2026 年 7 月中橫掃 Artificial Analysis 全部四個排行榜。那次橫掃已經結束。在重建後的文字轉影片排行榜上,截至十月初,Gemini Omni Flash 1.1 在有聲版本排名第八,無聲版本也排名第八,而在 Arena 的圖片轉影片排行榜上則排名第二,落後 MiniMax H3。Artificial Analysis 尚未在其文字轉影片排行榜上直接評比 1.1 Flash,該榜目前由較舊的 Flash 模型領先,阿里巴巴的 Wan 3.0 和 MiniMax H3 緊追在後。

在一個快速變動的類別裡,這是正常的結果,並不會削弱工作流程方面的新增功能。這確實意味著,對這次發表最誠實的定位是:Google 是在可控性與價格層級上競爭,而不是在原始輸出品質上競爭,而排行榜已不再是它勝出的地方。

這次發表沒有解決的兩件事

原生同步音訊尚未確認。Google 的發表資料並未詳細說明與影片一起生成的配樂,而音訊輸出被列為會在後續版本中推出。輸入音訊在推出時僅限於語音參考。對於一個名稱如此、號稱 any-to-any 的模型系列來說,缺少音訊輸出是特別顯眼的缺口,尤其是對製作短影音內容的團隊而言,因為聲音占了交付成果的一半。

第二個是時長。由四次串接請求組裝而成的四十秒,是一項真實能力,同時也是敘事型影片格式很快就會碰到的上限。Google 已預告更高階的 Gemini Omni Pro,但沒有公布發布日期,而延伸機制暗示,通往更長鏡頭的路徑是更好的上下文處理,而不是單次更長的生成。

每項輸出預設都帶有 SynthID 浮水印與 C2PA Content Credentials,而已退役的預覽端點不再出現在 Google 的模型清單中。Google 現在建議使用 Omni 1.1,而非 Veo 3.1 預覽端點,這是一次值得注意的內部交棒。Veo 3.1 仍是目前的旗艦 Veo,且尚未宣布任何 Veo 4。

實際上該用什麼來打造

解讀這次發表的有用方式,是把它看成產品定位的轉變。一個能產出十秒短片的影片模型,只是新奇玩意兒產生器。一個能分析十秒先前上下文、接受起始與結束影格、以三分之一價格用 360p 製作草稿,並升頻到 4K 的模型,是可以放進時間軸裡的元件。

這才是製作團隊可以據以規劃的生成式影片版本,也是有趣的工程從提示詞撰寫轉向流程設計的版本。就這次發表而言,組裝比單一片段更重要。

相關文章