EmbeddingGemma 2 將照片、音訊與影片搜尋帶到你的手機

10 月 6 日,Google DeepMind 發布了 EmbeddingGemma 2,這是一個 7.4 億參數的模型,能接收文字、程式碼、圖像、音訊和影片,並將它們全部放入同一個共享的數學空間中。真正重要的數字不是模型大小,而是這麼小的模型竟然能在手機上運行,這意味著對你自己媒體的搜尋可以完全在裝置上進行,不必讓任何資料離開裝置。
嵌入是許多日常事物背後默默運作的機制。嵌入模型會把一段內容轉換成一串數字,並讓相似的東西彼此靠近。這就是搜尋引擎知道「如何修理漏水的水龍頭」和「修復滴水的龍頭」講的是同一件事的方法。推薦系統也是靠它決定接下來要顯示什麼給你。到目前為止,若要在圖像、音訊和影片之間把這件事做好,通常意味著把資料送到伺服器,並為這趟來回付出代價。
一個空間,容納萬物
EmbeddingGemma 2 有趣的地方在於「共享」這個詞。許多模型只擅長處理一種模態:文字在這裡,圖像在那裡。共享空間意味著單一模型可以拿句子和照片相比、拿照片和一段音訊相比,或拿影片畫面和文字描述相比。Google 提供的實際例子是:用語音備忘錄搜尋,找到某個特定影片片段。你用音訊描述你記得的內容,系統就會找到相符的畫面。
這種跨模態搜尋在雲端服務中已經存在一段時間。新的是規模。擁有 7.4 億個參數,這個模型小到足以放進手機,這扭轉了隱私上的考量。如果搜尋在本機運行,你的照片、音訊和影片永遠不會離開裝置。對於任何曾猶豫是否要只為了讓個人媒體可被搜尋,而把它們上傳到雲端服務的人來說,這改變了整個盤算。

為什麼裝置端不斷贏得小勝利
這裡有一個超越單一模型的模式。過去一年,一連串小巧但能力不錯的模型,把過去需要資料中心才能完成的任務,搬到了人們已經擁有的裝置上。Google 自家的 Gemma 系列一直朝這個方向推進,其他實驗室也跟進,推出針對特定工作調整的小型模型。吸引人的不只是隱私。還包括延遲、離線可用性和成本。在手機上運行的搜尋能立即回答,而且在飛機上也能用。
這樣的轉變也改變了誰能打造產品。當某項能力存在於雲端,開發者需要帳號、預算和網路才能使用。當它在裝置上運行,開發者只需要一個模型檔案和一些巧思。某些以前做起來很彆扭的產品類型變得可行:一個從不回傳資料的個人照片整理工具、一個沒有訊號也能運作的現場工具、一個在本機索引你的音訊和圖像的筆記應用程式。這些都不光鮮亮麗,而且每一個都依賴同一項安靜的進展:一個小到能放進手機的模型,如今已經好到足以被信任來做真正的工作。
對開發者而言,這開啟了一扇特定的門:永遠不離開機器的檢索增強生成。RAG 是一種讓模型使用你自己的文件來回答問題的技術,通常得先靠嵌入模型找出相關段落。如果這個嵌入步驟能在本機運行,那麼本機助理就能在不發出網路請求的情況下,回答關於你的檔案和媒體的問題。對受監管的產業,或任何處理敏感資料的人來說,這就是一個工具被允許使用與不被允許之間的差別。
不該被忽略的取捨
小模型不是大模型,而差距會出現在困難案例的準確度上。參數多得多的託管式嵌入模型,通常能檢索出更好的結果,尤其是在雜亂、模糊或不尋常的內容上。如果你的應用程式仰賴幾乎每次都要把最頂端的結果做對,那麼一個在手機上運行的 7.4 億參數模型可能不夠,你應該先拿實際資料測試,再做出承諾。
第二個限制是這個模型不做什麼。EmbeddingGemma 2 是搜尋與整理工具,不是生成器。它不能製作圖像或影片。它能幫你找到你已經擁有的東西。當整個產業的注意力都固定在生成上時,這個區別很重要,因為不那麼光鮮的搜尋與檢索層,往往才是讓生成式功能從一開始就能用的關鍵。
也有實際限制。索引龐大的個人媒體庫需要儲存空間和電力,而手機在這兩方面都不是無限的。7.4 億參數模型對 AI 模型來說很小,對手機應用程式來說卻很大,所以開發者需要仔細思考它何時運行,以及索引多少內容。這些都不是決定性的障礙。它們是決定一項功能感覺起來是即時的,還是像在耗電的細節。
多語言能力也值得一提。一個涵蓋多種語言和多種媒體類型的共享空間,會隨著你的媒體庫越多元而越有價值。一個擁有來自三個國家的照片、兩種語言的語音備忘錄,以及第三種語言文件的人,從跨模態搜尋得到的好處,會遠比一個擁有整齊單一語言收藏的人多。對全球性產品來說,這就是重點。對個人來說,這是一項功能只能在整理得最好的資料夾裡運作,還是能在人們實際儲存東西的雜亂現實中運作的差別。
這對未來發展的啟示
解讀這次發布最實用的方式,是把它看成多模態 AI 走向何處的指標。生成佔據新聞頭條,但真正會塑造日常體驗的,往往是那些負責整理、檢索和連結的較小型模型。一個能讓你用描述記憶來搜尋自己的照片、音訊和影片,且不必上傳任何東西的模型,聽起來是項樸素的能力,影響範圍卻很廣。
它也填補了單靠生成無法填補的缺口。生成式功能只是產品的一半;另一半是找到你想改變的東西。任何曾在數千張照片中滑來滑去只為找一張的人,都感受過那個缺口。共享嵌入空間把不可能的搜尋變成一句話:描述它,相符的項目就會浮現。這在紙上只是小小的便利,在實務上卻是巨大的便利,因為這是擁有一座媒體庫,與能夠真正使用它之間的差別。
如果這個模式持續下去,接下來一年會有更多任務被帶回裝置上。每一項都會把目前需要伺服器才能做的事,再多一點變成能離線運作、就在你手中、按你的條件運作的東西。EmbeddingGemma 2 是朝這個方向邁出的一步,而且是安靜的一步。安靜的那些,往往才是會留下來的。
相關文章
Decagon 的 PACT 協議,想讓「同意」成為一個標準
Decagon 開源了一個協議,用來驗證個人智能體的身分,以及客戶授予它的權限。這是管道工程,而它決定了智能體經濟能不能跑起來。
AI「重逢」熱潮:一場還沒想好該如何感受的討論
AI 致敬短片把逝去的公眾人物帶回中國螢幕,拿下數十萬點讚。然後反彈來了,而它爭論的是「同意」。
Apple 發布了一個開源多模態模型,卻幾乎沒告訴任何人
蘋果的這次「研究優先」式發布悄然越過了主流視野,但模型那種細粒度的視覺 grounding,透露了它的 AI 棧正走向哪裡。
OpenCut 與「開源剪映」的那一刻
一款免費、MIT 授權的影片剪輯器持續衝上 GitHub 趨勢榜,而它的路線圖裡包含一個面向 AI 智能體的 MCP server。圍繞 AI 媒體的工具,正在追上模型本身。