← 返回博客
Ai预计阅读 9 分钟

Apple 发布了一个开源多模态模型,却几乎没告诉任何人

发布于 2026年10月11日
Apple 发布了一个开源多模态模型,却几乎没告诉任何人

苹果在 2026 年 10 月发布了一个开源多模态语言模型,却几乎没人注意到。没有主题演讲,没有炫目的演示,也没有为头条设计的跑分图。模型以苹果通常发布研究的方式出现:通过一个仓库、技术文档,以及面向开发者和学术用户而非消费者的模型产物。结果是一次真实存在的发布,它在密切关注机器学习仓库的人之间迅速流传,在其他地方却几乎没有激起水花。

这个模型叫 Ferret,它做的正是多模态系统该做的事。它同时接收图像和文本,把视觉区域和词语连接起来,并且能针对画面中某个具体部分进行推理,而不是把整张图当成一片模糊的输入。你可以指向一张杂乱照片里的一个小物件问它是什么,问一个人手里拿的是哪样东西,或者比较同一张图里的两个区域。这就是细粒度的视觉 grounding,它把一个有用的视觉模型和一个小把戏区分开来。

为什么「安静」本身才是故事

这种安静不是意外。苹果拥有世界上最大规模的已部署 AI 版图之一,数亿台设备在跑机器学习功能,但它很少把原始模型当作独立产品来营销。它公开的 AI 表现为相机处理、键盘建议、照片理解、无障碍功能和 Siri 改进。一个开源模型并不贴合那套面向消费者的叙事,所以它得不到一个 iPhone 功能或一个开发者框架那样的推广力度。

还有一个时机问题。到了十月,开发者早就在一大堆多模态发布的洪流中翻拣,从中国实验室更强的开源检查点到把图像理解内置进对话的闭源前沿系统。在那样一个背景下,一个研究优先的发布很容易被归为又一个产物,除非你正好在盯着苹果的仓库。

Ferret 在和什么竞争

Ferret 属于其他开源视觉语言系统所在的同一个大范畴,而这个比较很有启发性。当阿里这样的公司或 LLaVA 背后的研究团队甩出一个模型时,第一个问题通常是它在标准跑分上排到哪,而答案往往几天内就出现。苹果的发布招来同样的问题,却提供了更少的材料去回答,这对研究优先的发布来说是常态。价值不在于 Ferret 打败了这个领域,而在于苹果至少把一个可跑分、可微调的东西摆到了台面上。

{{INLINE1}}

端侧那个问题

这里,苹果的发布就不只是一个慷慨的姿态了。一个开源多模态模型给公司提供了一条影响 AI 应用如何被构建的路径,同时让外部研究者去测试和改造它的方法。对苹果来说,这个方向并不是纸上谈兵。它最有价值的计算场景中,很多天然就是多模态的:照片、截图、文档、摄像头画面,以及 Vision Pro 上的空间内容。一个能在语言和图像之间推理的模型,比一个纯文本系统更贴合这些场景。

这次开源发布还填补了苹果公开姿态与技术野心之间的一个缺口。Apple Intelligence 与 Siri 代表消费层。Core ML、MLX 和开源模型发布代表基础设施层。Ferret 属于第二类,它传递出的信号是:苹果想要支持的那类系统是高效、可适配、注重隐私,并且贴近它最有优势的硬件的。

隐私是苹果停不下来的话题,它也塑造了技术选择。一个在设备上运行的模型从不把你的照片发往任何地方,这是唯一能完全兑现隐私承诺的答案。开放权重让那种端侧部署对想要在苹果工作上搭建、又不想请求许可的开发者成为可能。

苹果为什么这样发布研究

苹果习惯在不附带产品的情况下发布研究,很容易被解读为弱势,其实不是。多年以来,公司一直通过学者常用的那些渠道发布论文、框架和模型组件,让社区去测试。这种做法把预期压低、把学习抬高。如果这项工作成了,苹果就悄悄推进了一个它关心的方向;如果没成,也从来没有一场发布会需要收回。

还有一层竞争维度。最喧闹的实验室靠把模型当作事件发布来定义叙事,配齐跑分和访问层级。而苹果在另一条轴上竞争:硬件、隐私,以及软件与人们已经拥有的设备之间的紧密整合。一次开源研究发布贴合这条轴,因为它影响了开发者如何构建,却不把公司绑在一个它也许并不想兑现的消费者承诺上。

研究者从中得到的很直接。Ferret 可以被检视、微调、跑分,并与其他开源视觉语言模型对比。这比一篇论文更有用,因为它给社区的是可以运行的东西,而不是可以阅读的东西。对一个很少开放自家模型的公司来说,这是一个值得注意的转变。

细粒度 grounding 有什么用

细粒度 grounding 有些容易被低估的实际用途。把一张图整个交给模型,你得到的是一段描述。把模型指向一个框选的区域,你得到的更像是某个真实问题的答案:这个包裹上的标签是否清晰可读,这张截图里那个部件是否被选中,这一角里的物体和上一帧里出现的是不是同一个。这些正是让一个视觉模型在某个工作流里变得有用、而不只是演示的检查。它也是一种往往会进入无障碍功能的能力,因为描述屏幕上的某个具体元素,比描述整个屏幕更重要。

一个克制的读法

这一切并不意味着苹果已经追上了前沿。Ferret 不是一个成型的助手,一个开源研究模型也不等于人们能用的产品。在交付头条级 AI 功能这件事上,公司一直比对手慢,一次发布并不能改变这一点。研究者会测试 Ferret、微调它,并报告它在哪里失手,那些差距会是真实的。

但它确实证明了苹果在参与关于模型设计的共同讨论,而不只是在墙后搭专有功能。对一家战略建立在隐私、效率和紧密硬件整合上的公司来说,一个开源多模态模型是天然的契合。它只是没有配一场发布会。苹果十月最重要的发布,也许正是它从未宣布的那一个。

相关文章