Iris-3B يولّد البكسلات دون VAE

تعمل كل مولّدات الصور الشائعة تقريبا بالطريقة نفسها تحت الغطاء. فهي لا ترسم البكسلات مباشرة، بل تضغط الصورة أولا إلى تمثيل مجرد أصغر عبر مكوّن يسمى المشفّر التلقائي التبايني، أو VAE، ثم تولّد في ذلك الفضاء المضغوط وتعيد فك الترميز إلى بكسلات. هذا التصميم على مرحلتين فعّال، ومنه تأتي أيضا عيوب صغيرة كثيرة. النص الدقيق يتلطخ، والخطوط الرقيقة تتموج، والتفاصيل تضيع في رحلة الذهاب والإياب.
في أكتوبر 2026 أصدر مختبر صغير يدعى Speridlabs نموذج Iris-3B بثلاثة مليارات معامل، يتجاوز الرحلة كلها. فهو يولّد البكسلات مباشرة. الأوزان مفتوحة بترخيص Apache 2.0، والبناء كله يقوم على محوّل flow matching. ليس أكبر نموذج صور ولا أبهرها هذا الشهر، لكنه على الأرجح الأكثر إثارة للاهتمام بما يقوله عن اتجاه المجال.
لماذا يهم تجاوز VAE
وُجد VAE لجعل التوليد رخيصا. فالعمل في فضاء كامن مضغوط يقلل الحساب المطلوب كثيرا، ولهذا يستخدمه كل نموذج انتشار تقريبا. والمقايضة أن المشفّر يتخلى عن معلومات قبل أن يبدأ التوليد، وعلى فاكّ الترميز أن يخمّنها. وفي الدقة المنخفضة تكون الخسارة غير مرئية. أما في الدقة العالية، أو في صور مكتظة بالنص وذات حواف دقيقة، فتظهر كالعجينة التي تتركها المولّدات عادة حول التفاصيل الصغيرة.
التوليد في فضاء البكسل يزيل هذه العقبة، لأن لا مرحلة ضغط كي تفقد شيئا. والثمن أن العمل يجري الآن على شبكة قيم أكبر بكثير، وهذا مكلف. وحجة Iris-3B أنه صغير بما يكفي لجعل هذه الكلفة قابلة للإدارة. وهل يصمد ذلك عمليا سيجربه المجتمع، لكن الاتجاه واضح: كلما تحسنت الكفاءة ضعف سبب قبول تضحية VAE في الجودة.
{{INLINE1}}
الحيلة الثانية: توزيع مسبق توليدي لمهام الرؤية
الأمر الأكثر غرابة في Iris-3B هو ما يفعله أيضا. إذ يطبّق النموذج توزيعه المسبق التوليدي على مهام رؤية حساسة للتفاصيل، ومنها تقدير العمق وترميم الصور. وبعبارة أوضح: نموذج مدرَّب على إنتاج الصور يمكن تكليفه أيضا باستخلاص معلومات منها: تقدير بُعد الأشياء، أو تنظيف صورة متدهورة.
وهذا مزيج ذو دلالة، لأنه يشير إلى اتجاه أوسع. فلفترة طويلة جرى التعامل مع التوليد والفهم كمشكلتين ونموذجين منفصلين. وفي الآونة الأخيرة يندمجان. فالنظام القادر على إنتاج صورة معقولة يفهم أصلا الكثير عن بنية المشاهد وسقوط الضوء وعلاقات الأجسام في الفضاء. وإعادة استخدام هذا الفهم لمهام التحليل أرخص من تدريب نموذج مخصص لكل مهمة.
ماذا يعني flow matching
يقوم Iris-3B على محوّل flow matching، والفكرة أبسط من الاسم. تتعلّم نماذج الصور الأقدم بعكس عملية تضيف ضوضاء عشوائية إلى الصورة، خطوة خطوة، حتى تختفي. ثم يُساق هذا في التوليد بالاتجاه المعاكس، بإزالة الضوضاء تدريجيا حتى تنبثق الصورة. أما flow matching فيسلك طريقا أكثر مباشرة. يتعلّم مسارا شبه مستقيم من الضوضاء إلى الصورة بدل مسار متعرج، وهذا نظريا يحتاج خطوات أقل وحسابا أقل للوصول إلى نتيجة جيدة.
وهذا مهم خصوصا لنموذج في فضاء البكسل. فالعمل على البكسلات الخام مكلف، والطريقة المعتادة لكبح هذه الكلفة هي جعل كل خطوة فعّالة. والمسار الأكثر استقامة يعني خطوات أقل، وهو ما يفسر جزئيا كيف يستطيع نموذج بثلاثة مليارات معامل أن يخوض مهمة يحلها أكبر منه عبر اختصار VAE. واختيار المعمارية والحجم متلازمان، فلا يكفي أحدهما وحده.
وستقرر الاختبارات المستقلة هل تستحق المقايضة. فإن تساوى التوليد في فضاء البكسل مع التوليد الكامن بكلفة مشابهة لم يعد VAE الافتراضي بل خيارا. وإن لم يتساو يبقى Iris-3B نقطة بيانات مفيدة عن موقع الحائط.
ما فائدة نموذج مفتوح صغير حقا
لن يتفوق Iris-3B على أي عملاق في أي تصنيف. فثلاثة مليارات معامل جزء مما يشغّله القادة التجاريون، والنموذج العام بهذا الحجم سيخسر في أصعب الأوامر. والحكم عليه بهذا المعيار يفوّت المقصد.
تكسب النماذج المفتوحة بهذا الحجم مكانها بثلاث طرق. فهي تعمل على عتاد يملكه الناس أصلا، بلا فاتورة لكل صورة وبلا بيانات تغادر المبنى. ويمكن ضبطها لمهمة ضيقة، وهنا غالبا ما يتفوق الصغير على الكبير: نموذج مدرَّب خصيصا على تصوير منتجات شركة سيتفوق على نموذج عام في تلك المهمة بالتحديد. وهي قابلة للفحص، وهذا مهم للفرق التي عليها أن تشرح مصدر المخرجات.
ورخصة Apache 2.0 هي التفصيل الذي يجعل الثلاثة ممكنة. فالترخيص المتساهل يتيح لشركة ناشئة بناء منتج فوق Iris-3B بلا تفاوض على الشروط وبلا خشية تغيّر السعر. ولمختبر يريد تبنّي معماريته، هذا أسرع طريق إلى الصلة. فالنموذج لا يحتاج إلى الفوز بالتصنيف، بل إلى أن يكون ما يبني به الآخرون.
تحذير ينطبق على كل إصدار مفتوح
ثمة تحذير ينطبق على كل نموذج مفتوح، وIris-3B ليس استثناء. فالترخيص المتساهل يغطي الأوزان، لا بيانات التدريب ولا المخرجات. وعلى الفرق التي تريد التسليم التجاري أن تبقى تفكر في ما تعلّمه النموذج وفي الحقوق المرتبطة بصورة مولّدة. وهذه مسألة قانونية لا يجيب عنها الترخيص، وهي السؤال نفسه الذي يطرحه كل نموذج مفتوح. وحريّة تشغيل النموذج بنفسك حرية حقيقية وقيّمة، لكنها لا تساوي التحرر من المسؤولية.
الصورة الأكبر
يبدو مجال الصور في أكتوبر 2026 مزدحما من الأعلى. فأصدرت Nano Banana 2.1 وGPT Image 2.5 وFLUX 3 وSeedream 5.0 تحديثات حديثة، وتُقاس المكاسب في الطليعة بهوامش صغيرة. وفي الأسفل تبدو الحركة الأكثر إثارة معمارية. فالتوليد في فضاء البكسل يشكك في فرضية صمدت منذ أول نماذج الانتشار: أن على المرء أن يضغط قبل أن يبتكر. والنماذج المفتوحة الصغيرة تواصل إثبات أن أسرع طريقة لنشر فكرة في المجال هي إهداؤها.
قد ينتهي Iris-3B كحاشية، أو يصبح النسخة التي ينسخها آخرون. وفي الحالين يستحق السؤالان اللذان يطرحهما المتابعة: هل يمكن توليد الصور بكامل التفاصيل دون مرحلة وسيطة فاقدة، وهل يستطيع نموذج واحد أن يبتكر ويحلّل في الوقت نفسه؟ وإن صارت الأجوبة نعم، فسيُبنى الجيل القادم من أدوات الصور على أساس مختلف عن سابقه.
مقالات ذات صلة
بروتوكول PACT من Decagon يريد أن تصبح «الموافقة» معيارا
فتحت Decagon بروتوكولا للتحقق من هوية الوكيل الشخصي والصلاحيات التي منحها العميل له. إنه عمل بنيوي، وهو الذي يحدد ما إذا كان اقتصاد الوكلاء يعمل.
موجة «اللقاء» بالذكاء الاصطناعي: جدل لم تقرر الصين بعد كيف تشعر تجاهه
أفلام تحية بالذكاء الاصطناعي أعادت شخصيات راحلة إلى الشاشات الصينية وجمعت مئات الآلاف من الإعجابات. ثم جاء الارتداد، وكان عن «الموافقة».
أبل نشرت نموذجا متعدد الوسائط مفتوحا ولم تخبر أحدا تقريبا
هذا الإصدار الموجّه للبحث مرّ تحت الرادار، لكن تأصيله البصري الدقيق يقول الكثير عن اتجاه حزمة الذكاء الاصطناعي لدى أبل.
OpenCut ولحظة «CapCut مفتوح المصدر»
محرر فيديو مجاني بترخيص MIT يواصل الصعود في اتجاهات GitHub، وخارطة طريقه تتضمن خادم MCP لوكلاء الذكاء الاصطناعي. الأدوات المحيطة بوسائط الذكاء الاصطناعي تلحق بالنماذج.