← 返回部落格
Ai預計閱讀 9 分鐘

Apple 發布了一個開源多模態模型,卻幾乎沒告訴任何人

發布於 2026年10月11日
Apple 發布了一個開源多模態模型,卻幾乎沒告訴任何人

蘋果在 2026 年 10 月發布了一個開源多模態語言模型,卻幾乎沒人注意到。沒有主題演講,沒有炫目的演示,也沒有為頭條設計的跑分圖。模型以蘋果通常發布研究的方式出現:透過一個倉庫、技術文件,以及面向開發者和學術用戶而非消費者的模型產物。結果是一次真實存在的發布,它在密切關注機器學習倉庫的人之間迅速流傳,在其他地方卻幾乎沒有激起水花。

這個模型叫 Ferret,它做的正是多模態系統該做的事。它同時接收圖像和文字,把視覺區域和詞語連接起來,並且能針對畫面中某個具體部分進行推理,而不是把整張圖當成一片模糊的輸入。你可以指向一張雜亂照片裡的一個小物件問它是什麼,問一個人手裡拿的是哪樣東西,或者比較同一張圖裡的兩個區域。這就是細粒度的視覺 grounding,它把一個有用的視覺模型和一個小把戲區分開來。

為什麼「安靜」本身才是故事

這種安靜不是意外。蘋果擁有世界上最大規模的已部署 AI 版圖之一,數億台裝置在跑機器學習功能,但它很少把原始模型當作獨立產品來行銷。它公開的 AI 表現為相機處理、鍵盤建議、照片理解、無障礙功能和 Siri 改進。一個開源模型並不貼合那套面向消費者的敘事,所以它得不到一個 iPhone 功能或一個開發者框架那樣的推廣力度。

還有一個時機問題。到了十月,開發者早就在一大堆多模態發布的洪流中翻揀,從中國實驗室更強的開源檢查點到把圖像理解內建進對話的閉源前沿系統。在那樣一個背景下,一個研究優先的發布很容易被歸為又一個產物,除非你正好在盯著蘋果的倉庫。

Ferret 在和什麼競爭

Ferret 屬於其他開源視覺語言系統所在的同一個大範疇,而這個比較很有啟發性。當阿里這樣的公司或 LLaVA 背後的研究團隊甩出一個模型時,第一個問題通常是它在標準跑分上排到哪,而答案往往幾天內就出現。蘋果的發布招來同樣的問題,卻提供了更少的材料去回答,這對研究優先的發布來說是常態。價值不在於 Ferret 打敗了這個領域,而在於蘋果至少把一個可跑分、可微調的東西擺到了檯面上。

{{INLINE1}}

端側那個問題

這裡,蘋果的發布就不只是一個慷慨的姿態了。一個開源多模態模型給公司提供了一條影響 AI 應用如何被構建的路径,同時讓外部研究者去測試和改造它的方法。對蘋果來說,這個方向並不是紙上談兵。它最有價值的運算場景中,很多天然就是多模態的:照片、截圖、文件、鏡頭畫面,以及 Vision Pro 上的空間內容。一個能在語言和圖像之間推理的模型,比一個純文字系統更貼合這些場景。

這次開源發布還填補了蘋果公開姿態與技術野心之間的一個缺口。Apple Intelligence 與 Siri 代表消費層。Core ML、MLX 和開源模型發布代表基礎設施層。Ferret 屬於第二類,它傳遞出的訊號是:蘋果想要支持的那類系統是高效、可適配、注重隱私,並且貼近它最有優勢的硬體的。

隱私是蘋果停不下來的話題,它也塑造了技術選擇。一個在裝置上運行的模型從不把你的照片發往任何地方,這是唯一能完全兌現隱私承諾的答案。開放權重讓那種端側部署對想要在蘋果工作上搭建、又不想請求許可的開發者成為可能。

蘋果為什麼這樣發布研究

蘋果習慣在不附帶產品的情況下發布研究,很容易被解讀為弱勢,其實不是。多年以來,公司一直透過學者常用的那些渠道發布論文、框架和模型組件,讓社群去測試。這種做法把預期壓低、把學習抬高。如果這項工作成了,蘋果就悄悄推進了一個它關心的方向;如果沒成,也從來沒有一場發布會需要收回。

還有一層競爭維度。最喧鬧的實驗室靠把模型當作事件發布來定義敘事,配齊跑分和訪問層級。而蘋果在另一條軸上競爭:硬體、隱私,以及軟體與人們已經擁有的裝置之間的緊密整合。一次開源研究發布貼合這條軸,因為它影響了開發者如何構建,卻不把公司綁在一個它也許並不想兌現的消費者承諾上。

研究者從中得到的很直接。Ferret 可以被檢視、微調、跑分,並與其他開源視覺語言模型對比。這比一篇論文更有用,因為它給社群的是可以運行的東西,而不是可以閱讀的東西。對一個很少開放自家模型的公司來說,這是一個值得注意的轉變。

細粒度 grounding 有什麼用

細粒度 grounding 有些容易被低估的實際用途。把一張圖整個交給模型,你得到的是一段描述。把模型指向一個框選的區域,你得到的更像是某個真實問題的答案:這個包裹上的標籤是否清晰可讀,這張截圖裡那個部件是否被選中,這一角裡的物體和上一幀裡出現的是不是同一個。這些正是讓一個視覺模型在某個工作流裡變得有用、而不只是演示的檢查。它也是一種往往會進入無障礙功能的能力,因為描述螢幕上的某個具體元素,比描述整個螢幕更重要。

一個克制的讀法

這一切並不意味著蘋果已經追上了前沿。Ferret 不是一個成型的助手,一個開源研究模型也不等於人們能用的產品。在交付頭條級 AI 功能這件事上,公司一直比對手慢,一次發布並不能改變這一點。研究者會測試 Ferret、微調它,並報告它在哪裡失手,那些差距會是真實的。

但它確實證明了蘋果在參與關於模型設計的共同討論,而不只是在牆後搭專有功能。對一家戰略建立在隱私、效率和緊密硬體整合上的公司來說,一個開源多模態模型是天然的契合。它只是沒有配一場發布會。蘋果十月最重要的發布,也許正是它從未宣布的那一個。

相關文章