← 返回部落格
Ai預計閱讀 9 分鐘

PixVerse R2 將影片生成化為可漫步其中的世界

發布於 2026年10月2日
PixVerse R2 將影片生成化為可漫步其中的世界

大多數影片生成工具對你的要求都一樣:描述場景、等待、取得短片、決定是否保留。輸出結果是一個檔案,每次播放都一模一樣。如果你想要不同結局,就得寫不同的提示詞,然後從頭來過。

PixVerse R2 於 9 月 23 日由 PixVerse 影片平台背後的公司 AIsphere 發布,建立在不同的前提上。它不會回傳固定短片,而是生成一個持續運行的視聽世界,並在你與之互動時繼續運作。你可以用文字或圖片建立世界,使用 WASD 鍵移動角色、變更攝影機視角,並輸入提示詞來替換角色、加入物件或改變環境。場景不會重新開始。先前的動作會持續留存,並形塑接下來發生的事。

最後這點正是整個核心概念。在大多數生成式影片中,每次請求都是獨立的。在 R2 中,提示詞會更新世界的狀態。在與創作者 Xiaolongbao 共同打造的互動示範影片 *Zero Mark* 中,向生物贈送禮物時,結果會根據你選擇的禮物即時生成。給牠一條龍或一片葉子,故事就會產生分歧。另一位創作者 Jade Wu 則圍繞一位名為 Eve 的即時數位角色打造了一段序列,Eve 在多次交流中維持一致的身分與記憶。

一個孤獨的剪影人物走過超現實的平原,朝向懸浮在消融地平線上方、發光的風景入口

AIsphere 稱 R2 為通用即時世界模型,並已在 world.pixverse.video 開放遊戲、互動電影與數位人的示範空間。R2 是接續公司於 1 月推出的 R1。

它試圖打破的取捨

即時生成向來迫使我們做出選擇。小而快的模型能跟上即時互動,卻做不了太多事。大而強大的模型能產出更好的畫面,但運行速度太慢,無法對任何輸入做出反應。團隊通常選擇其中一邊,並接受其限制。

R2 將問題分成兩層。基礎是一個名為 Omni Causal AR 的因果自迴歸主幹,持續以短影片與長影片、多模態參考、音訊與動作控制進行訓練。它沿著五個維度擴展:模型、資料、任務、控制訊號與時間範圍。在此之上是即時加速層,將同一個主幹蒸餾成可在即時運行中使用的超少步版本。

這個區別很重要。AIsphere 不是訓練一個獨立的小模型來處理互動性,並接受它會比較弱,而是將其強大的模型蒸餾成更快的形式。這兩層共享同一血統,因此快速版本並非從零開始學習。

輔助技術補足了細節。動態分塊處理不同時間尺度上運作的訊號,因此模型不必以相同方式對待緩慢的環境變化和快速的角色移動。三個記憶通道分別追蹤持續存在的世界規則、近期動作與物件狀態。錯誤庫會在訓練期間重播模型自身的失敗狀態。

該公司報告,在內部測試中,錯誤庫將長時程亮度漂移指標降低了 35.8%,而區塊稀疏注意力在稀疏度高於 90% 時仍能幾乎完整保持品質。亮度漂移是一項不引人注目卻很能說明問題的指標。在長序列中,誤差的細微累積正是破壞「你正在看著一個連貫地點」這個錯覺的原因。

它不是什麼

AIsphere 對其限制相當坦率,這在行銷通常跑得比產品快的類別中令人耳目一新。在嚴格的即時與延遲限制下,R2 的單次輸出品質仍落後於領先的離線影片模型。如果你想要最銳利的短片,最好還是離線生成並耐心等待。

因此,其價值主張不是品質,而是連續性與反應性。模型犧牲了一些每幀畫面的精緻度,換取讓世界保持運作並對輸入做出反應的能力,而這場賭注在於,有大量用途更在意後者。

這樣的定位也說明了 R2 在中國實驗室及其他地方湧現的更廣泛世界模型浪潮中的位置。我們先前介紹過的 HiDream HD-V1,將自身定位在離線生成中的物理一致性與敘事連貫性。Google 的互動世界模型則朝可遊玩環境的方向推進。R2 的訴求最用力地傾向「你進入的環境」這個隱喻。AIsphere 創辦人暨執行長王長虎直接表示:即時互動影片不是世界建模的全部,但它是人們最早能體驗到的途徑。他預期 R2 將從創作工具演化為使用者隨時可進入的環境。

為何遊戲引擎很重要

PixVerse 遊戲引擎於 7 月首次推出,現在運行於 R2 上。這是研究領域之外任何人都值得關注的部分。附加到遊戲引擎的即時世界模型,與影片生成器是截然不同的產品。它意味著精心設計的互動、存檔狀態,以及玩家早已期望軟體而非媒體所能提供的某種工作階段持續性。

示範用例都圍繞這個概念:遊戲、互動電影、數位人。這三種都是觀眾會做出某種行動的格式,而固定短片無法提供這種體驗。記得上次交流內容的數位人,在客戶服務或陪伴方面的用處,是一次性影片永遠做不到的。觀眾選擇會真正產生分歧的互動電影,是傳統影片流程完全無法製作的形態。

示範空間與正式部署之間存在實際落差,而 AIsphere 尚未揭露商業可用時程、定價,或一場即時 R2 工作階段會消耗多少算力。這些數字將決定該模型會成為平台,還是停留在示範階段。

這次發布背後的模式

退一步看,R2 符合過去一年 AI 影片中一個可辨識的模式。前沿不斷從「生成更漂亮的短片」轉向「隨時間維持連貫的事物」。無論這個事物是五分鐘的敘事、在不同鏡頭間保持一致的角色,或是 R2 的情況——一個在你施加影響時仍維持自身規則的世界,皆是如此。

這些都是同一個根本問題的不同面貌:在時間與互動不斷累積時,保持生成式系統的狀態一致。離線模型在單次算繪中逐幀解決這個問題。R2 則在輸入持續到來的即時工作階段中解決它。

無論 R2 會成為廣泛使用的工具,還是資金充裕的實驗,它都標示了這個類別認為下一個優勢所在。能在即時輸入下維持連貫世界的公司將佔據有利位置,因為正是這種能力,讓生成式影片從你觀看的東西,變成你使用的東西。

相關文章