中國 AI 圖像模型正走向全球,而這個月,風向變了

過去兩年多數時間裡,西方對中國 AI 圖像模型的討論一直繞著同一個循環打轉:抄襲、審查、然後翻頁。過去三十天打破了這個循環,而轉變同時出現在三個地方:基準測試、留言區,以及華府的政策辯論。
基準測試的關鍵時刻
扛起重擔的是 Qwen Image 2.1。Tom's Hardware 在九月底的一篇報導指出,這個 7B 開放權重模型在多項基準測試上勝過 Google 的 Nano Banana 2.0,同時與 OpenAI 和 Meta 的系統互有勝負。該版本發布時在 Hacker News 上的討論串拿下 739 分、近 200 則留言——這對任何東西來說都是前沿模型等級的熱度,更何況是一個你可以下載、在筆電上跑的模型。幾天後就出現了 M1 Max 的實測示範:完整的文字生圖與編輯功能,每張 512x512 輸出約 24 秒,完全不碰雲端。
最能反映整體氛圍的是 r/singularity 上的一則討論串,標題為「中國 AI 模型全球人氣飆升——華府開始擔憂」。標題借自新聞報導,但底下的討論與其說在談地緣政治,不如說在談一種親身體驗:那些對哪些模型值得一試早有預設答案的人,在自己的比較中一再看到中國模型名列前茅,或緊追在後。
這些模型究竟擅長什麼
這些強項與社群的實證相符。Qwen 的編輯功能是最多人拿來示範的特點,能生成角色設定表與多參考圖合成,而且不需要過去那套工作流程必備的 LoRA 堆疊。文字渲染,尤其是 CJK 字系,一直是 Qwen 的穩定優勢,這對任何在亞洲市場製作包裝或行銷素材的人來說都有商業價值。位元組跳動的 Seedream 系列——也就是即夢背後的模型家族——在直式格式生成與照片級寫實度上備受好評,並驅動了中國最多人使用的消費級創作 App 之一。Z-Image Turbo 之所以成為西方社群預設的輕量本機模型,正是因為它能在中低階 GPU 上跑。
移植速度本身就是一種訊號。Qwen 發布後一週內,這個模型就能在搭載 GGUF 量化的 TensorSharp 上運行、在原生 Apple Silicon 執行環境中運行,也能在具備遮罩與姿態參考的 Fooocus 風格工作室中使用。這樣的生態系採用不是廠商買得到的。它會發生,是因為一群維護者認定某個模型值得他們犧牲週末;而這是最強有力的採用證據,因為採用者付出的是真實的時間。
中國平台上的討論補上了英文資訊流所遺漏的質地。節慶驅動的工作流程是當地最主要的消費級使用場景:中秋與國慶接連到來,豆包、即夢、通義萬相等工具正被數百萬製作宣傳海報的小商家即時檢驗,並出現那套熟悉的分流判斷——哪個工具處理中文字體編排、哪個處理產品照、哪個處理直式影片封面。在那些討論串裡,商業使用條款是摩擦點,與西方社群對授權的爭論如出一轍。有一個實務細節放諸四海皆準:中國的消費級工具在每日免費額度上殺得激烈,這讓一般用戶的每張圖成本趨近於零,也把競爭推向了編輯便利性與風格控制。
消費級產品層在一個特定面向上領先
值得直說:中國的消費級 App 一直在進行一場西方服務大多跳過的產品實驗,而且成功了。豆包把圖像生成放進聊天介面,提供免費無限生成與對話式編輯,使用者只要說「把月亮變成金色」,不必從頭重新下提示詞。即夢把生成直接接進短影音剪輯流程,海報不必匯出就能變成影片封面。通義萬相為服飾商家打造了虛擬模特功能,用一次上傳取代一場拍攝。
這些都屬於狹窄、不起眼、針對特定任務的整合,但每一個所帶來的日常使用量,都超過那些更炫目的示範。西方服務正從另一個方向匯流到同樣的想法——Gemini 的對話式編輯、生產力套裝軟體內建的生成功能——但中國 App 先一步在消費級規模上跑了這場實驗,而且是在一個使用者願意為便利付費、而非為訂閱付費的市場。對任何地方的產品人來說,這堂課是:免費額度加上緊密嵌入既有工作流程,在大規模普及上勝過一道付費牆後面更大的模型;而品質差距已經縮小到,現在決定勝負的是整合,而不是模型本身。
華府方面的變數
政策層面值得比一則標題更細緻的對待。Heise 一篇在 HN 上流傳的報導指出,德國企業幾乎完全依賴美國模型,中國模型鮮少被使用——這描述的是歐洲。r/singularity 的擔憂則不同:開放權重的中國模型正憑實力在那些自我篩選出高度懷疑論者的社群裡勝出,而這些社群正是以拆解廠商基準測試為業的人。當技術含量最高的受眾自願採用某個模型時,那套慣用的「這只是炒作」折扣就不再適用了。
對華府而言,這種張力是結構性的。限制封閉 API 很直接;限制早已躺在 Hugging Face 上的權重則不然。那個基準測試表現優異的 7B 模型,就其構造而言,也早已無所不在。任何政策回應至少都會落後採用曲線數個月,而德國那筆數據則顯示,企業採用端另有自己的時滯,比技術社群落後數年。
還有一個關於基準測試正當性的角度,會在下一輪新聞週期中變得重要。當阿里巴巴宣稱自家模型勝過 Google 的模型,西方報導會附上「廠商自行發布的基準測試」這類但書。這些但書是合理的。但當權重開放、任何人都能跑比較時,這些但書也越來越站不住腳。開放權重實驗室的廠商宣稱,被驗證或推翻的速度都比封閉實驗室的宣稱更快,而這是一項會複利累積的結構性優勢。
接下來值得觀察什麼
有三個指標值得追蹤。第一,下一次 Qwen 或 Seedream 的發布,能否在保住基準測試優勢的同時,補上批評者指出的缺口,尤其是在複雜的多主體構圖上。第二,西方托管平台會不會在價格上做出回應,因為一個免費、表現有九成好的本機模型是一個定價事件,不只是技術事件;第一個被歸因於開放競爭的托管平台降價,就是關鍵訊號。第三,預測市場會不會加入開放模型的類別;目前 Polymarket 上「最佳圖像 AI」的選項只追蹤托管型廠商,這越來越低估了整個領域。
關於這個故事怎麼被訴說的一點補充
有一種敘事上的危險值得點名。關於中國 AI 的報導一直在輕蔑與驚慌之間擺盪,而這兩種模式都會模糊真實圖像。輕蔑低估了真實的工程實力,尤其是在訓練效率與消費級產品整合上。驚慌則把每一項基準測試都膨脹成戰略事件,恰恰招來那種過度反應,而這反應隨後又被引用為證據。這個月最健康的訊號既不來自前者也不來自後者:它來自使用者用自己的硬體跑自己的比較,然後報告他們所見。那個管道無法被任何一方操弄,而真正移動的正是它。
對話之所以改變,是因為證據變了。一個能在筆電上跑、在基準測試中勝出、而且試用零成本的模型,很難用老套的模板打發掉。寫下新模板的,正是那些親手試過的人。
相關文章
中國 AI 圖像模型正在海外贏得粉絲,華府正密切關注
這種採用首先是技術性的,政治其次。開發者下載的是真正有用的東西,而現在這越來越常來自中國實驗室。
預測市場正在押注 AI 圖像的什麼事
真金白銀正在押注誰能贏得 AI 圖像。OpenAI 在靜態圖像領先,MiniMax 在影片領先,而開源模型是沒人定價的變數。
Qwen-Image 2.1 對決 Nano Banana 2.0:7B 開源模型已緊追 Google 其後
一款 70 億參數的開源模型如今在阿里巴巴的基準測試中領先 Google 的 Nano Banana 2.0,在其他排行榜上也已逼近到隨時可能超車的距離。
預測市場正用真金白銀押注誰能贏得圖像 AI,而賠率明顯一面倒
預測市場正在押注誰能贏得圖像 AI。一面倒的賠率實際上衡量了什麼,以及該如何解讀。