AI 影片的下一個戰場:對世界的理解

過去兩年來,評判 AI 影片模型的方式一直很簡單:看畫面有多漂亮。但這套標準已經快不夠用了。當好幾款模型都能生成一段可信的五秒鐘人物走過城市片段時,畫質就不再能區分高下,必須有別的東西來分勝負。
九月,一家名為 HiDream.ai 的中國新創公司發布了 HiDream-O1-Video-1.0(簡稱 HD-V1),並把那個「別的東西」當成全部賣點。該公司表示,這款模型的設計目標是理解事件該如何展開,而不只是單一畫面該長什麼樣子。
漂亮畫面的問題
任何花時間生成過影片的人,都知道那些失敗模式。你下提示詞要一個角色推開一扇厚重的木門,模型卻讓手往左推、門往右開。你要某人在五秒內從一個地方跑到另一個地方,結果角色把台詞講完、時間不夠用,直接瞬移。片段在你真的坐下來看之前,看起來都沒問題。
反覆重新生成會燒掉時間和點數,一段十五秒的影片成本可能遠遠超出原本的預算。這個落差不在解析度,也不在長度,而在物理與因果。模型只是把每個畫面畫出來,卻不了解門必須往手推的方向轉,也不了解在兩點之間移動需要時間。
這正是 HD-V1 鎖定的落差。HiDream 表示,這款模型在生成之前,會先強化對動作時長、物件關係、事件邏輯與影音對齊的理解,因此輸出能成為一串連貫的序列,而不是一疊靜態畫面。

四款中國模型,三條路線
要理解這件事為何重要,不妨看看排行榜上還有誰。到了 2026 年 9 月,已有四款中國模型擠進全球影片生成的第一梯隊:字節跳動的 Seedance 2.0 與 2.5、MiniMax 的 H3、阿里巴巴的 Wan 3.0,以及 HiDream 的 HD-V1。一年前,中國影片模型在主要國際基準測試上幾乎不見蹤影,如今卻群聚在頂端附近。
它們走的路線各不相同。Seedance 依靠字節跳動完整的算力、工程與產品堆疊。MiniMax H3 建立在龐大的模型基礎與使用者基礎之上,再延伸到影片。Wan 3.0 則嵌在阿里巴巴更廣闊的 Qwen 與阿里雲生態系裡。HiDream 是其中的異類:一家沒有巨頭資源與通路的新創,改為押注一種它稱為「原生全模態世界模型」的架構,目標是讓圖像、影片、3D 互動與具身智慧共用同一個基礎。
HD-V1 支援文字、圖像與影片輸入,可生成 5 到 20 秒的 1080p 影片。團隊表示它在兩個國際排行榜上表現良好,而其中最引人注目的說法是「世界理解」:模型之所以能生成更連貫的序列,是因為它對事件如何推演進行了建模。
為什麼「理解」成了新前沿
當好幾個團隊都能達到同樣的品質水準,競爭就會轉向模型對世界知道些什麼。解析度與長度變成基本配備,而非差異點。更難的問題是畫質無法回答的那些:移動物體是否遵守物理定律、動作與聲音是否同步、一個事件是否由前一個事件推導而來。
業界對同一個概念有不同的稱呼。競品與整體市場會談一致性、意圖理解與穩定交付。中國一家影片公司智象未來甚至發布了一套針對影片代理的五部分評估框架,涵蓋一致性、意圖、影音完整性、時間軸與敘事,以及穩定交付。名稱各異,目標相同:模型要能被信任完成一整段序列,而不只是起個頭。
這背後有錢在推動。高盛估計,全球 AI 影片生成市場將在五年內成長約十倍,到 2030 年達到約 290 億美元。這類預測會把投資拉向任何看起來像下一次真正能力躍升的方向,而「理解世界」正是目前的候選者。
排行榜彼此不一致
影片領域難以評判的部分原因,在於各家計分板彼此不一致。九月時,社群競技場把冠軍給了某一個家族,為個別片段評分的人類評審偏好另一個,而用使用量投票的提示詞作者又選了第三個。一份社群 Elo 快照把 Google 的 Gemini Omni 系列放在首位,Black Forest Labs 的 Flux 3 Video 是最強的準開源選手,字節跳動的 Seedance 2.0 與 2.5 緊追在後。相較之下,以一到五分品質尺度為片段打分的人類評審,則把 Seedance 2.0 排在第一位,領先 Kling、Wan,甚至領先它自己的後繼版本。若以原始使用量來看,Seedance 與 Google 的 Veo 3 主導了提示詞數量,而 Wan 則獨占本地與開源的利基市場。
這三份資料集給出的教訓是:「最佳模型」完全取決於你在衡量什麼。Veo 在無聲片段的人類評分中排名低於競技場排名,因為它的強項是原生音訊與對白,而無聲評分標準看不見這些。Seedance 2.5 在單片段品質上低於 2.0,提醒我們較新的版本未必對人們實際寫出的提示詞更令人驚豔。任何要為專案挑工具的人,都該多看幾個榜再決定,並以最貼近自己工作性質的那個榜為主。
這個轉變對創作者的意義
對真正在用這些工具創作的人來說,實際影響在於「壞掉的地方變了」。當模型理解事件邏輯,失敗就從明顯的問題移到細微的問題。你不再需要跟瞬移的角色、往錯方向開的門搏鬥,而開始注意到更小的毛病:某個動作多持續了一拍、某個反應並非由前一句台詞推導而來。這些正是人類導演該抓出來的問題。
這也是中國短劇熱潮早已教過我們的同一堂課。AI 現在能生成鏡頭,但一集完成的劇集仍然需要有人決定哪些鏡頭該留下、以什麼順序排列、以及為什麼。模型在畫面上越來越好,但判斷哪些畫面重要,仍然是人類的工作,而且這個狀態可能比樂觀主義者預期的維持得更久。
這場四強競賽還有一個較不張揚的重要性。不同公司從不同方向攻擊同一個問題——這裡是巨頭的堆疊,那裡是新創的架構——降低了整個產業對單一技術路線的依賴。如果世界理解真是正確的目標,現在已有不只一個團隊對準它;而如果它其實是錯的目標,這個領域也已經做了對沖。
就目前而言,誠實的解讀是:HD-V1 只是擁擠賽場中又一張強牌,而且它的說法尚未經過第三方檢驗。但方向是毋庸置疑的。贏得下一輪的模型,不會是畫出最漂亮單一畫面的那些,而是能讓一個故事撐住二十秒而不出狀況的那些。理解世界是更難的問題,而這是第一次,有這麼多資金充裕的團隊同時在做這件事。