預測市場正用真金白銀押注誰能贏得圖像 AI,而賠率明顯一面倒

Polymarket 上有一系列持續進行的問題,放在兩年前聽起來會荒謬至極:哪家公司會在十月底擁有最佳的圖像編輯 AI?哪家公司會在十一月底前擁有最佳的文字轉圖像模型?這些問題的答案有真實資金在交易,而目前的賠率告訴你,去掉新聞稿的粉飾之後,群眾真正相信的是什麼。
截至九月底,情況相當直白。在十一月底前最佳文字轉圖像模型這一項,OpenAI 約為 84%。圖像編輯市場則把 OpenAI 放在接近 90%。在圖像轉影片方面,資金已轉向 MiniMax,其最佳圖像轉影片 AI 的交易價格高於 90%,考慮到今年稍早這個類別看起來多麼擁擠,這是一次顯著的躍升。
賠率衡量的是什麼,又不是什麼
這些市場是群眾基準。交易者反應的是我們其他人也看到的相同訊號:發行說明、使用者比較、競技場排行榜、讓某個模型的編輯看起來神奇無比的爆紅貼文。這使得賠率成為還不錯的情緒指標,卻是很差的基準真相。「最佳」從設計上就沒有定義,而群眾會用網際網路一貫的方式來解決它:那週什麼比較爆紅,就採用什麼。
不過,這種一面倒仍然帶有資訊。OpenAI 在兩個類別中獲得 84% 到 90% 的共識,等於市場在說差距很大。MiniMax 在圖像轉影片的部位,則是市場在說某個專才在那裡擊敗了通才,至少目前如此。這些市場背後的交易量——較大型市場有數萬美元的流動性——太薄弱,稱不上機構級,但方向每週都維持一致。
這些類別實際上涵蓋什麼
精確理解每個市場中「最佳」的意義會有幫助,因為這些類別不能互換。文字轉圖像衡量的是原始生成品質:模型根據提示詞畫出的圖片有多好。圖像編輯衡量的是修改:餵入一張現有照片,要求模型改變它,這會測試一致性、指令遵循,以及模型多能保留它未被要求改變的部分。圖像轉影片是最年輕、技術上最困難的類別:它要求模型連貫地讓靜態圖像動起來,而隨時間維持的連貫性,其嚴苛程度是單一影格所沒有的。
賠率沿著這些界線清楚分裂,而這種分裂很合理。原始生成與編輯獎勵最大規模的訓練和最多的使用者回饋,這有利於最大的實驗室。圖像轉影片獎勵的是不同的最佳化目標:時間一致性,而專注的團隊可以在此超車。MiniMax 交易價格高於 90%,同時 OpenAI 領先另外兩個類別,這正是若專業化仍然重要時你會預期的模式;這本身也是關於這個領域的一種主張:前沿不是一場競賽,而是好幾場,且領先者因賽道而異。
關於群眾準確度的一點警告
預測市場在具有明確結果的離散事件上——選舉與利率決策——有不錯的紀錄,但在連續性的品質判斷上紀錄較差,而這些市場正是後者。「最佳圖像編輯 AI」沒有官方評分者,所以市場會按照結算規則指定的方式結算,通常是在到期時引用排行榜或競技場排名。這使得賠率成為對參考排名會怎麼說的預測,而這與交易者想必真正關心的事實又隔了一步。
2021 年 1 月的迷因股事件以及各種加密貨幣市場都證明,薄弱的市場可以被推高。這些圖像市場沒有那麼薄弱,但深度遠遠不及政治市場,而且參與者池子小到,若有一個有動機的社群協同推動,只有在事後回看時才會看得出來。把這些價位解讀為帶有資金的情緒,而不是衡量結果。
仔細解讀市場結構
這一系列事件逐月進行,讓每次到期都變成對前一次的公投。九月底的圖像轉影片市場在十月底的市場開盤時結算,而逐週變動才是資訊所在:十月影片市場在單一週內上漲 15%,這表示有某個東西出貨或外洩,改變了群眾的想法。十一月文字轉圖像市場則在一週內微升 4%。像那樣安靜的漂移,通常是小型證據——競技場結果與使用者比較——的累積,而不是對某個頭條的反應。
這些市場的流動性真實但有限,交易量數萬美元,流動性也大致如此,所以幾筆大部位就能推動短期價格。請用你對薄弱山寨幣圖表會有的同樣懷疑,來看待突然的尖峰。緩慢形成的共識——持續數週的賠率——才是更耐久的訊號。
為什麼開放權重陣營應該在意
這裡有個轉折:這些市場都沒有追蹤開放模型,而開放社群才剛度過喧騰的一個月。Qwen Image 2.1,一個 7B 的開放權重模型,帶著號稱與 Nano Banana 2.0 平起平坐的基準測試登場,並在 Hacker News 上引來 739 分的討論串。本地工具、移植版本和並排比較在幾天內就出現了。一個你可以下載的模型,並不符合市場所框架的「哪家公司擁有最佳」的資格,這意味著群眾共識只衡量了託管式前沿。
這個落差會影響你如何解讀賠率。市場說 OpenAI 領先託管式陣營。r/StableDiffusion 的動態則說有個免費模型能在筆電上跑,還讓某些託管式輸出難堪。兩者都可能是真的,因為它們回答的是不同問題:整體最佳 vs. 每美元最佳、最精緻 vs. 最好控制。預測市場把這些細微差異壓縮成一個數字,而這個數字會美化揭露最多發行資訊的一方。
這些市場也編碼了提交截止日。「十月底」是真正的截止點,之後發布的模型無論多好都不算數。真實使用者沒有截止日。一個在 11 月 1 日推出的更好模型,在 11 月 1 日就已經更好。這是事件市場套用到軟體上的一般性弱點:它們衡量的是快照競賽,而軟體品質是移動平均。
以使用者身分解讀市場
如果你正在決定要把錢或注意力花在哪裡,最好把賠率當成「什麼有動能」的捷徑。動能對 API 使用者很重要,因為模型品質每月都在變,而轉換成本是真實的。OpenAI 編輯的 90% 賠率表示,轉而不用它等於是在和群眾唱反調。MiniMax 的影片賠率則表示,他們的圖像轉影片管線正是人們現在真正在測試的對象。
具體就採購決策而言,賠率可作為盡職調查前的篩選器。如果市場在你正在採購的類別中給某個供應商 90%,那麼舉證責任就落在替代方案身上。如果市場是 50-50,你正處於真正有爭議的領域,這通常意味著該類別還年輕,正確答案取決於你的使用情境,而不是排行榜。
更有趣的押注,是群眾尚未開盤的那些:開放模型對上託管式模型的基準測試,或是哪個類別會出現下一波品質躍升的市場。在那之前,這些市場扮演著社群炒作的一個奇妙誠實的聚合器。它們可能出錯。但它們很少困惑。
相關文章
中國 AI 圖像模型正在海外贏得粉絲,華府正密切關注
這種採用首先是技術性的,政治其次。開發者下載的是真正有用的東西,而現在這越來越常來自中國實驗室。
預測市場正在押注 AI 圖像的什麼事
真金白銀正在押注誰能贏得 AI 圖像。OpenAI 在靜態圖像領先,MiniMax 在影片領先,而開源模型是沒人定價的變數。
Qwen-Image 2.1 對決 Nano Banana 2.0:7B 開源模型已緊追 Google 其後
一款 70 億參數的開源模型如今在阿里巴巴的基準測試中領先 Google 的 Nano Banana 2.0,在其他排行榜上也已逼近到隨時可能超車的距離。
中國 AI 圖像模型正走向全球,而這個月,風向變了
中國圖像模型正走向全球。這個月,基準測試、留言區與華府如何改變了整個討論。