← 返回博客
Ai预计阅读 10 分钟

EmbeddingGemma 2 将照片、音频和视频搜索装进你的手机

发布于 2026年10月11日
EmbeddingGemma 2 将照片、音频和视频搜索装进你的手机

10 月 6 日,Google DeepMind 发布了 EmbeddingGemma 2,这是一个拥有 7.4 亿参数的模型,可将文本、代码、图像、音频和视频全部放入同一个共享数学空间。真正重要的数字不是它的规模,而是如此小的模型竟然能在手机上运行,这意味着对你自己媒体内容的搜索可以在无需任何数据离开设备的情况下完成。

嵌入是许多日常使用产品背后的安静机器。嵌入模型将一段内容转化为一串数字,并通过排列让相似的内容彼此靠近。搜索引擎正是借此知道“如何修理漏水的水龙头”和“维修滴水的龙头”说的是同一件事。推荐系统也借此决定接下来向你展示什么。到目前为止,要在图像、音频和视频之间做好这件事,通常意味着把数据发送到服务器,并为这次往返付出代价。

一个空间,容纳一切

EmbeddingGemma 2 的特别之处在于“共享”这个词。许多模型只擅长处理一种模态:这边处理文本,那边处理图像。共享空间意味着单个模型就可以把一句话和一张照片、一张照片和一段音频片段、一帧视频和一段文字描述进行比较。谷歌给出的实际例子是:用一段语音备忘录搜索,找到某个特定的视频片段。你用音频描述自己记得的内容,系统就会找到匹配的片段。

这类跨模态搜索在云服务中已经存在一段时间了。新的是它的规模。7.4 亿参数的模型小到可以放进手机,这就翻转了隐私等式。如果搜索在本地运行,你的照片、音频和视频就无需离开设备。对于那些曾犹豫是否要把个人媒体上传到云服务、只为让它可被搜索的人来说,这改变了权衡结果。

四个媒体图块(文本、照片、音频波形、视频)汇聚到一个发光点

为什么设备端在一次次小战役中持续胜出

这里有一个超越单一模型的模式。过去一年,一批批小巧而强大的模型不断将过去需要数据中心的任务,迁移到人们已经拥有的设备上。谷歌自家的 Gemma 系列一直在朝这个方向推进,其他实验室也紧随其后,推出针对特定任务调优的小模型。其吸引力不只是隐私,还有延迟、离线可用性和成本。在手机上运行的搜索能即时给出答案,在飞机上也能使用。

这一转变也改变了谁能参与构建。当某种能力存在于云端时,开发者需要账户、预算和网络才能使用它。当它在设备上运行时,开发者只需要一个模型文件和一些巧思。某些以前很别扭的产品类型变得可行:一个从不向外回传数据的个人照片整理器,一个无信号也能工作的现场工具,一个在本地索引你的音频和图像的笔记应用。这些都不炫目,而且每一个都依赖同一种安静的进步:一个小到能放进手机的模型,如今已经好到足以被信任来处理真实工作。

对开发者而言,这打开了一扇具体的门:永不离开本机的检索增强生成。RAG 这种让模型利用你自己的文档来回答问题的技术,通常依赖嵌入模型先找到相关段落。如果这个嵌入步骤能在本地运行,那么本地助手就能在没有网络调用的情况下,回答关于你的文件和媒体的问题。对于受监管行业,或任何处理敏感材料的人来说,这就是一个工具被允许使用还是不被允许的区别。

不容忽视的权衡

小模型不是大模型,差距会在困难案例的准确率上显现。参数多得多的托管嵌入模型通常能检索到更好的结果,尤其是在杂乱、模糊或不寻常的内容上。如果你的应用依赖于几乎每次都能得到正确的首要结果,那么一个在手机上运行的 7.4 亿参数模型可能还不够,在投入之前,你应该用实际数据对它进行测试。

第二个局限是模型做不到的事。EmbeddingGemma 2 是搜索和组织工具,不是生成器。它不能制作图像或视频。它能帮你找到你已经拥有的那些。当行业的注意力都集中在生成上时,这一区别很重要,因为不起眼的搜索与检索层,往往才是让生成式功能真正可用的前提。

还有实际约束。索引一个庞大的个人媒体库需要存储空间和能量,而手机在这两方面都不是无限的。7.4 亿参数的模型对 AI 模型来说很小,对手机应用来说却很大,因此开发者需要仔细考虑它何时运行、索引多少内容。这些都不是致命问题。它们只是决定一个功能是感觉即时,还是感觉像在耗电的细节。

多语言能力也值得提一句。一个覆盖多种语言和多种媒体类型的共享空间,在你的媒体库越多样时就越有价值。一个人如果有来自三个国家的照片、两种语言的语音笔记,还有第三种语言的文档,那么他从跨模态搜索中获得的收益,远高于一个只有整齐单语言收藏的人。对全球性产品来说,这正是重点。对个人来说,这决定了一个功能是只能在你整理得最好的文件夹里工作,还是能应对人们实际保存内容时的杂乱现实。

这对前路意味着什么

解读这次发布最有用的方式,是把它视为多模态 AI 走向何方的标志。生成占据了头条,但真正塑造日常体验的,往往是那些更小、负责组织、检索和连接的模型。一个让你通过描述记忆来搜索自己的照片、音频和视频,而无需上传任何东西的模型,听起来能力不大,影响却很广。

它还填补了仅靠生成无法填补的空白。生成式功能只是产品的一半;另一半是找到你想修改的东西。任何在成千上万张照片里翻找过某一张的人,都感受过这个缺口。共享嵌入空间把一场不可能完成的搜索变成一句话:描述它,匹配的内容就会浮现。这在纸面上只是小小的便利,在实践中却很大,因为它决定了你是拥有一个媒体库,还是能够真正用上它。

如果这一模式延续下去,接下来一年会有更多任务回到设备上。每一个任务都会把目前需要服务器的一部分能力,变成能离线运行、握在你手中、按你的条件工作的东西。EmbeddingGemma 2 是朝这个方向迈出的一步,而且是很安静的一步。而往往正是安静的那一步,最后留了下来。

相关文章