← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

نانو بنانا 2.1 من جوجل إصدار ميزات وليس نموذجاً رائداً

نُشر في 7 أكتوبر 2026
نانو بنانا 2.1 من جوجل إصدار ميزات وليس نموذجاً رائداً

أصدرت جوجل نانو بنانا 2.1 في 7 أكتوبر، وهو ترقية لنموذجها لتوليد وتحرير الصور بالذكاء الاصطناعي. وتصفه الشركة بأنه تحسين واسع، مع تحديد ثلاثة مجالات: التصميم البصري، والتحرير القائم على الأقنعة، واتساق الموضوع.

عند قراءته مقابل موقع السوق الذي يشغله، فإن الوصف الأدق هو أن جوجل تدفع بسلوك فئة Pro إلى نموذج أرخص.

ما الذي تغير فعلاً

يولّد نانو بنانا 2.1 أصولاً بصرية أفضل تركيباً، وفقاً لجوجل. هذا هو أغمض الادعاءات الثلاثة وأصعبها في التحقق، لأن “تركيباً أفضل” ليس مقياساً ينشره أحد.

التحرير القائم على الأقنعة أكثر تحديداً. يمكن للمستخدمين تحديد وتعديل منطقة معينة من صورة موجودة دون إعادة توليد الصورة كاملة. هذه هي الميزة التي فصلت نماذج التحرير الجادة عن عروض التوليد لمدة عامين، وإدخالها في النموذج المتوسط بدلاً من فئة Pro هو جوهر هذا الإصدار.

اتساق الموضوع هو الثالث، وهو ما يهم أي شخص ينتج بكميات كبيرة. عند تحرير صورة أو توليد مجموعة من الصور المترابطة دفعة واحدة، يحافظ النموذج بشكل أفضل على مظهر وملامح الموضوع الرئيسي. بالنسبة لمستخدم Gemini الذي يولّد شخصية متسقة عبر عشر صور، هذا هو الفرق بين مكتبة أصول قابلة للاستخدام وكومة من المحاولات القريبة من الصواب.

يتم طرح النموذج عبر تطبيق Gemini، ووضع الذكاء الاصطناعي في بحث Google، وGoogle AI Studio، وGoogle Flow، وStitch، وGoogle Ads، ومنصة Gemini للمؤسسات. وللمطورين، هو متاح تحت معرّف النموذج gemini-nano-banana-2.1، ويقبل مدخلات نصية وصورية وصوتية ومرئية، ويُخرج بدقة 1K أو 2K أو 4K.

قائمة المدخلات هذه تستحق التوقف عندها. نموذج يأخذ مدخلات صوتية ومرئية ويعيد صوراً ينتمي إلى فئة مختلفة عن مولّد نص-إلى-صورة مرفق بفقرة تسويقية. إنه نظام متعدد الوسائط تصادف أن مخرجاته إطار ثابت.

أين تقع الطبقة

في وقت سابق من هذا العام أصدرت جوجل نانو بنانا 2، المعروف أيضاً باسم Gemini 3.1 Flash Image. جمع بين سرعة سلالة Flash وجودة إخراج مماثلة لنانو بنانا Pro، ونقلت جوجل عدة ميزات من Pro إليه: معرفة بالعالم الحقيقي، وعرض نص محسّن، واتساق أفضل للشخصيات والأشياء.

يواصل نانو بنانا 2.1 هذا الانتقال. النمط متسق بما يكفي ليكون استراتيجية: تستخدم جوجل طبقة Flash كمنتج ضخم الحجم، وتستمر في سحب القدرات من Pro، وتدع طبقة Pro تحدد السقف.

التأطير التنافسي الذي تدعمه مواد جوجل نفسها هو أن ChatGPT Images 2.5 من OpenAI يظل النموذج الرائد عالمياً لتوليد وتحرير الصور، خاصة للعمل التكراري. ميزته محددة وتقنية: عندما يواصل المستخدم تحسين صورة عبر جولات متعددة، يحافظ بشكل أفضل على التعديلات السابقة، ويترك المناطق غير الملموسة دون مساس، ويبقي جودة الصورة ثابتة مع تراكم التكرارات.

هذه مشكلة الانحراف مرة أخرى، وهي التحدي الهندسي المركزي في تحرير الصور الآن. الجميع يهاجمها. أضاف Ideogram 4.5 وضعي Precise Edit وGenerate + Edit. أطلقت Black Forest Labs تعديلات تحافظ على المنطقة مع أرقام منشورة لهوية البكسل. جواب جوجل مع 2.1 هو اتساق الموضوع في الطبقة المتوسطة.

MAI-Image-2.6 من مايكروسوفت، الذي صدر في أغسطس، يقع خلف OpenAI مباشرة في نفس النقاش. استقرت التشكيلة إلى شيء واضح: OpenAI تتصدر في التحرير التكراري، وجوجل تتصدر في التوزيع والسعر، ومعسكر الأوزان المفتوحة بقيادة Qwen-Image 2.1 يقف على مسافة قريبة في الجودة بجزء بسيط من التكلفة.

يجدر التحديد بدقة ما هو “الانحراف” فعلاً، لأن المصطلح يغطي عدة إخفاقات متمايزة. هناك انحراف البكسل، حيث تتغير المناطق غير الملموسة قليلاً بين التكرارات. وهناك انحراف الهوية، حيث يتغير وجه أو منتج عبر سلسلة تعديلات. وهناك انحراف الأسلوب، حيث تنتقل جمالية العرض نحو مظهر عام مع إعادة النموذج توليد المزيد من الإطار في كل جولة. وهناك انحراف الجودة، حيث تتراكم الصورة الضوضاء والنعومة كما تفعل نسخة من نسخة من نسخة.

لكل منها حل مختلف. الحفاظ على البكسل مشكلة أقنعة. الحفاظ على الهوية مشكلة تكييف. الحفاظ على الأسلوب والجودة يتعلقان إلى حد كبير بمقدار ما يُسمح للنموذج بالتخلي عنه من الأصل. النموذج الممتاز في ثلاثة من الأربعة سيفشل مع ذلك في سلسلة تحرير من خمس جولات، ولهذا تحتاج ادعاءات البائعين حول الاتساق إلى تحديد أي نوع.

يعالج 2.1 من جوجل اتساق الهوية بشكل صريح والتحرير بالأقنعة بشكل صريح، ولا يقول شيئاً محدداً عن الأسلوب أو الجودة عبر السلاسل الطويلة. هذا الصمت مفيد.

لماذا إصدار الطبقة المتوسطة هو المهم

إصدار رائد يخبرك بما يستطيع مختبر تحقيقه. إصدار الطبقة المتوسطة يخبرك بما يعتقد أن معظم مستخدميه يحتاجونه فعلاً.

وضع جوجل للتحرير بالأقنعة واتساق الموضوع في النموذج الذي يعمل عبر البحث والإعلانات وتطبيق Gemini الاستهلاكي هو تصريح بأن هذه توقعات أساسية، وليست ميزات متميزة. وضع الذكاء الاصطناعي في البحث وحده يضع توليد الصور أمام جمهور يقاس بمليارات الجلسات. الإعلانات تضعه أمام معلنين سينتجون محتوى إبداعياً بكميات كبيرة وسيعرفون فوراً ما إذا كان يعمل.

ميزة التوزيع هذه ليست قدرة نموذج، وربما تساوي أكثر من قدرة واحدة. نموذج أسوأ بنسبة 5 في المئة من الرائد لكنه متاح في مربع البحث حيث يوجد المستخدم بالفعل سيولّد صوراً أكثر بكثير. تفوق OpenAI في جودة التحرير التكراري حقيقي، وهو أيضاً تفوق لا يهم إلا المستخدمين الذين قرروا بالفعل استخدام أداة صور.

للمطورين، القراءة العملية تتعلق بالإعدادات الافتراضية. إذا كان منتج يحتاج تحرير صور ويستخدم Gemini بالفعل، فإن ترقية 2.1 شبه مجانية وتزيل سبباً لدمج مزوّد ثانٍ. إذا كان منتج يحتاج أقوى تحرير تكراري متاح، فقد أصبح سؤال التقييم أصعب للتو، لأن الفجوة بين طبقة Flash والرائد ضاقت في البعد المحدد الأكثر أهمية للعمل متعدد الجولات.

ما يجب اختباره بنفسك

ثلاثة أشياء تستحق التحقق بدلاً من الافتراض.

أولاً، دقة القناع عند الحواف. الادعاءات العريضة حول التحرير الإقليمي تميل إلى الصمود في وسط منطقة كبيرة وتتدهور عند الحدود، حيث يقرر النموذج لأي جانب من الحافة تنتمي كل بكسل. اختبر على البنى الدقيقة: الشعر، الزجاج، أوراق الشجر، الأشرطة الرقيقة.

ثانياً، الاتساق عبر أكثر من جولتين. عادة ما يتم التحقق من ادعاءات اتساق الموضوع على سلسلة تحرير قصيرة. مشكلة الانحراف تتراكم، لذا الاختبار المفيد هو خمس أو ست تعديلات متتالية، مع التحقق مما إذا كان الموضوع ينجو.

ثالثاً، ما إذا كان إخراج 4K أصلياً أم محسّناً بالرفع. تدرج جوجل 1K و2K و4K كخيارات إخراج دون تحديد دقة التوليد، ويظهر الفرق في النسيج الدقيق بدلاً من الحدّة العامة.

الاستنتاج الاستراتيجي أقل تحفظاً. جوجل لا تلاحق لوحة صدارة نماذج الصور بهذا الإصدار. الهدف هو جعل الطبقة المتوسطة جيدة بما يكفي بحيث تتوقف لوحة الصدارة عن كونها سبب اختيار أي شخص لأداة مختلفة. ما إذا كان ذلك ينجح يعتمد على مقدار عمل السوق الذي هو تحرير دقيق تكراري مقابل كل شيء آخر، والجواب الصادق هو أن معظم توليد الصور في 2026 لا يزال الفئة الثانية.

مقالات ذات صلة