أبل نشرت نموذجا متعدد الوسائط مفتوحا ولم تخبر أحدا تقريبا

نشرت أبل في أكتوبر 2026 نموذجا لغويا متعدد الوسائط مفتوح المصدر، ولم يلاحظه أحد تقريبا. لا كلمة رئيسية، ولا عرضا مبهرا، ولا جدول مقاييس مُعدّا للعناوين. ظهر النموذج بالطريقة التي تنشر بها أبل أبحاثها عادة: عبر مستودع وتوثيق تقني ومخرجات موجّهة إلى المطورين والأكاديميين لا إلى المستهلكين. وكانت النتيجة إصدارا حقيقيا انتشر بسرعة بين من يتابعون مستودعات تعلّم الآلة عن قرب، ولم يُحدِث تقريبا أي صدى خارجها.
يُدعى النموذج Ferret، وهو يفعل ما يفترض بنظام متعدد الوسائط أن يفعله. يأخذ الصور والنص معا، ويربط المناطق البصرية بالكلمات، ويستطيع التفكير في جزء محدد من صورة بدل معاملة المشهد كله كمدخل ضبابي. فيمكنك الإشارة إلى جسم صغير في صورة مزدحمة وتسأل ما هو، أو تسأل ما الجسم الذي يحمله شخص، أو تقارن منطقتين في الصورة نفسها. هذا هو التأصيل البصري الدقيق، وهو ما يفصل نموذج رؤية نافعا عن خُدعة.
لماذا الصمت هو الخبر
هذا الصمت ليس مصادفة. فلأبل واحدة من أكبر بصمات الذكاء الاصطناعي المنشورة في العالم، بمئات الملايين من الأجهزة تشغّل وظائف تعلّم الآلة، لكنها نادرا ما تسوّق نماذج خاما كمنتجات مستقلة. ويظهر ذكاؤها العلني كمعالجة للكاميرا واقتراحات لوحة المفاتيح وفهم للصور ووظائف وصول ومحسّنات Siri. والنموذج المفتوح لا يناسب تلك السردية الاستهلاكية، فلا يحصل على دفعة ترويجية كتلك التي تحصل عليها ميزة في آيفون أو إطار مطورين جديد.
وهناك أيضا مشكلة توقيت. فبحلول أكتوبر كان المطورون يغربلون سيلا من الإصدارات المتعددة الوسائط، من نقاط تفتيش مفتوحة أقوى من مختبرات صينية إلى أنظمة حدودية مغلقة بفهم صور مدمج في المحادثة. وعلى هذا الخلفية يسهل تصنيف إصدار موجّه للبحث كأثر آخر، إلا إن كنت تراقب مستودعات أبل تحديدا.
بماذا ينافس Ferret
ينتمي Ferret إلى العائلة الواسعة نفسها التي تنتمي إليها أنظمة الرؤية واللغة المفتوحة، والمقارنة مفيدة. فعندما تطلق شركة كعلي بابا أو الفريق وراء LLaVA نموذجا، يكون السؤال الأول أين يقع في المقاييس المعيارية، ويصل الجواب عادة في أيام. ودعوة إصدار أبل إلى السؤال نفسه لكنها تقدم مادة أقل للإجابة، وهذا معتاد في الإصدارات الموجّهة للبحث. والقيمة ليست في أن Ferret يتفوق على المجال، بل في أن أبل تضع شيئا قابلا للقياس والضبط في العلن.
{{INLINE1}}
مسألة الجهاز
هنا يصبح إصدار أبل أكثر من بادرة كريمة. فالنموذج المتعدد الوسائط المفتوح يمنح الشركة طريقا للتأثير في كيفية بناء تطبيقات الذكاء الاصطناعي، بينما يترك للباحثين الخارجيين اختبار نهجها وتكييفه. وهذا الاتجاه ليس نظريا بالنسبة لأبل. فكثير من سياقاتها الحاسوبية الأكثر قيمة متعدد الوسائط بطبيعته: الصور ولقطات الشاشة والمستندات وبثّ الكاميرا والمحتوى المكاني على Vision Pro. ونموذج قادر على التفكير بين اللغة والصور يناسب تلك السياقات أفضل من نظام نصي صرف.
كما يسدّ النشر المفتوح فجوة بين موقف أبل العلني وطموحها التقني. فـ Apple Intelligence وSiri يمثلان طبقة المستهلك. أما Core ML وMLX وإصدارات النماذج المفتوحة فتمثل طبقة البنية التحتية. ويقع Ferret في الفئة الثانية، ويشير إلى نوع الأنظمة التي تريد أبل دعمها: كفؤة وقابلة للتكيّف وواعية بالخصوصية وقريبة من العتاد الذي تملك فيه أكبر ميزة.
والخصوصية موضوع لا تكفّ أبل عن الحديث عنه، وهو يصوغ الخيارات التقنية أيضا. فالنموذج الذي يعمل على الجهاز لا يرسل صورك إلى أي مكان أبدا، وهذا هو الجواب الوحيد الذي يفي بوعد الخصوصية كاملا. والأوزان المفتوحة تجعل ذلك النشر على الجهاز ممكنا للمطورين الذين يريدون البناء على عمل أبل دون طلب إذن.
لماذا تنشر أبل أبحاثها هكذا
يسهل قراءة عادة أبل في نشر أبحاث بلا منتج مصاحب كضعف، لكنها ليست كذلك. فعلى مدى سنوات أصدرت الشركة أوراقا وأطرا ومكوّنات نماذج عبر القنوات نفسها التي يستخدمها الأكاديميون، تاركة للمجتمع أن يختبر. وهذا النهج يبقي التوقعات منخفضة والتعلّم مرتفعا. فإن نجح العمل تكون أبل قد دفعت بهدوء اتجاها يهمها، وإن لم ينجح لم يكن هناك حدث إطلاق يُسحب.
وهناك أيضا بُعد تنافسي. فأكثر المختبرات ضجيجا تعرّف السردية بإطلاق النماذج كأحداث، بمقاييس وطبقات وصول. أما أبل فتنافس على محور آخر: العتاد والخصوصية والاندماج الوثيق للبرمجيات مع الأجهزة التي يملكها الناس أصلا. والنشر البحثي المفتوح يناسب هذا المحور، لأنه يؤثر في كيفية بناء المطورين دون إلزام الشركة بوعد استهلاكي قد لا تريد الوفاء به.
وما يكسبه الباحثون مباشر. فـ Ferret قابل للفحص والضبط والقياس والمقارنة بنماذج رؤية ولغة مفتوحة أخرى. وهذا إسهام أنفع من ورقة بحثية وحدها، لأنه يمنح المجتمع شيئا يشغّله بدل شيء يقرؤه. ولمن يقلّما يفتح نماذجه، هذا تحوّل جدير بالملاحظة.
فيم يفيد التأصيل البصري الدقيق
للتأصيل البصري الدقيق استخدامات عملية يسهل التقليل منها. أعطِ نموذجا صورة كاملة فتحصل على وصف. أشِر إلى منطقة محيطة فتحصل على شيء أقرب إلى جواب سؤال حقيقي: هل يُقرأ الملصق على هذه الحزمة، وهل القطعة في لقطة الشاشة محددة، وهل الجسم في هذه الزاوية هو نفسه الذي ظهر في الإطار السابق. وهذه هي الفحوص التي تجعل نموذج الرؤية نافعا داخل سير عمل لا في عرض. وهو أيضا من القدرات التي تنتهي عادة في وظائف الوصول، حيث وصف عنصر محدد على الشاشة أهم من وصف الشاشة كلها.
قراءة متوازنة
لا شيء من ذلك يعني أن أبل لحقت بالطليعة. فـ Ferret ليس مساعدا مكتملا، ونموذج بحث مفتوح ليس كمنتج يستطيع الناس استخدامه. وقد كانت الشركة أبطأ من منافسيها في تسليم ميزات ذكاء اصطناعي بارزة، وإصدار واحد لا يغيّر ذلك. وسيختبر الباحثون Ferret ويضبطونه ويبلغون عن مواضع سقوطه، وستكون الفجوات حقيقية.
لكنه يثبت أن أبل تشارك في الحديث المشترك حول تصميم النماذج، لا أن تبني ميزات احتكارية خلف جدار فقط. ولمن استراتيجيتها قائمة على الخصوصية والكفاءة والاندماج الوثيق بالعتاد، فإن نموذجا متعدد الوسائط مفتوحا ملاءمة طبيعية. غير أنه لا يأتي مع حدث إطلاق. وربما أهم ما سلّمته أبل في أكتوبر هو ما لم تعلن عنه قط.
مقالات ذات صلة
بروتوكول PACT من Decagon يريد أن تصبح «الموافقة» معيارا
فتحت Decagon بروتوكولا للتحقق من هوية الوكيل الشخصي والصلاحيات التي منحها العميل له. إنه عمل بنيوي، وهو الذي يحدد ما إذا كان اقتصاد الوكلاء يعمل.
موجة «اللقاء» بالذكاء الاصطناعي: جدل لم تقرر الصين بعد كيف تشعر تجاهه
أفلام تحية بالذكاء الاصطناعي أعادت شخصيات راحلة إلى الشاشات الصينية وجمعت مئات الآلاف من الإعجابات. ثم جاء الارتداد، وكان عن «الموافقة».
OpenCut ولحظة «CapCut مفتوح المصدر»
محرر فيديو مجاني بترخيص MIT يواصل الصعود في اتجاهات GitHub، وخارطة طريقه تتضمن خادم MCP لوكلاء الذكاء الاصطناعي. الأدوات المحيطة بوسائط الذكاء الاصطناعي تلحق بالنماذج.
المنصات الصينية تراهن على المحتوى التفاعلي بالذكاء الاصطناعي
مع بلوغ انتشار الفيديو القصير 92.6 في المئة، تحركت Bilibili وشياوهونغشو وكوايشو ودويين معا نحو الشكل الجديد نفسه. الحماس يسبق الاقتصاد.