GPT Image 2 في مواجهة Nano Banana Pro: صراع 2026 الذي لا يتفق حوله أحد

قضى نموذجان خلال عام 2026 في تبادل الصدارة على لوحات متصدرين توليد الصور من النص، وما زالت المجتمع غير قادر على حسم الأفضل بينهما. يتصدر GPT Image 2 من OpenAI ساحة Artificial Analysis بمعدل Elo قدره 1,370 في سبتمبر. أما Nano Banana Pro من Google فيحتفظ بالتاج في الواقعية الفوتوغرافية في كثير من نقاشات ريديت. وبحسب من تسأل، فأحدهما أعظم نموذج صنع على الإطلاق أو مبالغ في تقديره.
الحقيقة في المنتصف، وتنقسم على محور واحد: السرعة والنص في مقابل الدقة والاتساق.
ما هو كل نموذج فعلياً
GPT Image 2 هو نموذج الصور المخصص من OpenAI، صدر في 21 أبريل 2026 ضمن مظلة «ChatGPT Images 2.0». اختفى اسم DALL-E. وهو مدمج في ChatGPT ومتاح عبر واجهة برمجية بتسعير قائم على الرموز. أبرز نقطتي قوته: سرعة التوليد بنحو ثلاث ثوانٍ لكل صورة، وإخراج النصوص الذي أصبح شبه محسوم.
أما Nano Banana Pro فهو نموذج الصور القائم على Gemini من Google، صدر أول مرة في 20 نوفمبر 2025. تتميز نقاط قوته بدقة 4K الأصلية، ونظام مرجعي يستوعب 14 صورة للحفاظ على اتساق الشخصيات والأنماط، وإخراج مواد يبدو فوتوغرافياً حقاً. وهو أبطأ، إذ يستغرق عادة من 10 إلى 15 ثانية لكل توليد.

الأرقام المهمة
منح تقييم ZDNET المبني على 30 عاملاً GPT Image 2 درجة 150 مقابل 131 لـ Nano Banana. لكن الدرجات الخام تخفي الانقسام: يفوز GPT Image 2 بالسرعة والاتساق المنطقي والنص، بينما يفوز Nano Banana بالدقة ومعالجة المراجع وتفاصيل البشرة والمواد.
وتحكي لوحات التصويت الأعمى قصة مختلفة قليلاً: يتصدر GPT Image 2 في دقة الالتزام بالوصف وإخراج النص، لكن Midjourney غير موجود أصلاً في هذه اللوحات، وهو ما يكشف مدى تغطيتها للسوق الفعلي.
السعر خط فاصل آخر: يكلف Nano Banana Pro نحو 0.24 دولار للصورة بدقة 4K، بينما يبلغ GPT Image 2 نحو 0.21 دولار. كلاهما في النطاق نفسه، لكنك تحصل على أشياء مختلفة: سرعة وتكرار من الأول، دقة واتساق من الثاني.
ما يقوله المجتمع فعلاً
كانت ردود الفعل على ريديت صاخبة. في r/singularity، حين ظهرت نماذج سلسلة «tape» الأولى على ساحة الاختبار الأعمى، كتب أحد المستخدمين إن النموذج «مجنون تماماً، ويتجاوز Nano Banana بكثير». وقوف نماذج تحمل أسماء مثل maskingtape-alpha وgaffertape-alpha على أنها GPT Image 2 متخفياً جذبت نقاشاً حصد 366 تصويتاً وأكثر من 200 تعليق في يوم واحد.
لكن الحكم لم يكن بالإجماع. حين أجرى أحدهم مقارنة ثلاثية بين Nano Banana Pro وGPT Image 2 وGPT Image 1.5 الأقدم، كانت خلاصته متحفظة: «في هذه الحالة ما زال NBP أفضل، لكن GPT Image 2 يمثل بلا شك قفزة كبيرة مقارنة بالإصدار 1.5».
إخراج النصوص هو ما غيّر النقاش. نشر المستخدم @PlayingGodAGI صورتين اختباريتين: مخططاً تشريحياً كانت فيه تسميات كل عضلة وعظم وعصب دقيقة كما في الكتب الجامعية، ولقطة شاشة للصفحة الرئيسية ليوتيوب ظهرت فيها الواجهة والعناوين دون أي تشويه. وكانت خلاصته: «هذا يزيل آخر عيوب الصور المولدة بالذكاء الاصطناعي».
كما اختبر المدون الياباني @masahirochaen النموذج نفسه على النصوص اليابانية فوجدها تُخرج الحرفين الكانا والكانجي بشكل صحيح، وهو ما لاحظه مستخدمو ريديت أيضاً. علّق أحدهم بأن «الكانجي والكاتاكانا كلاهما صحيح»، وهي جملة كانت ستبدو عبثية قبل عامين.
فجوة الصور المرجعية
أقل الفروق نقاشاً بين النموذجين هي طريقة تعاملهما مع الصور المرجعية، وهي ليست صغيرة.
يدعم Nano Banana Pro ما يصل إلى 14 صورة مرجعية، وهو الأقوى في المجال. يمكنك تغذيته بورقة تصميم شخصية ولوحة أنماط وصورة منتج، فيحافظ على هوية العنصر عبر سلسلة كاملة من التوليدات. لعلامة تجارية تبني مجموعة أصول متسقة، هذه هي الميزة الحاسمة.
يدعم GPT Image 2 المراجع أيضاً لكن بحد يبلغ نحو أربع صور. وهو مناسب لتعديل لمرة واحدة من نوع «اجعل هذا المنتجاً يبدو وكأنه في مطبخ»، لكنه غير مبني لسير عمل متعدد الصور مع اتساق الشخصيات.
يعكس هذا فرقاً فلسفياً: بنت Google نموذجها حول التكرار عبر المراجع والربط بالسياق الواقعي، بينما بنت OpenAI نموذجها حول المحادثة والسرعة، حيث تنقّح النتيجة عبر الحوار بدل كومة من ملفات المراجع.
مسألة العلامة المائية والمصدر
ثمة نقطة أخرى تستحق الطرح، وهي تتعلق بالثقة لا بالجودة.
يأتي Nano Banana Pro بعلامة SynthID المائية مدمجة، نهج Google لتعليم محتوى الذكاء الاصطناعي بشكل غير مرئي لإمكانية تتبعه لاحقاً. ولدى OpenAI جهودها الخاصة في هذا المجال، لكن التزام Google هو الأوضح.
للمستخدمين العاديين لا يغير هذا شيئاً. أما للمنصات والناشرين المهتمين بوسم المحتوى المولد، فالفرق في العلامة المائية قد يحسم القرار.
أيهما تختار
اختر GPT Image 2 إذا كنت في مرحلة التجريب والتكرار. التوليد خلال ثلاث ثوانٍ يغير طريقة عملك: تجرب عشرة أوصاف في الوقت الذي ينتج فيه Nano Banana صورتين. وإذا كنت بحاجة إلى لافتات وشعارات وتنسيق نصوص، فهي الأداة الأفضل. وإذا كنت تعيش داخل ChatGPT أصلاً، فهو الخيار الطبيعي.
اختر Nano Banana Pro إذا كان مشروعك يقوم على الاتساق البصري. نظام المراجع ذو 14 صورة هو الأقوى في المجال لإبقاء وجه الشخصية ثابتاً عبر مجموعة أصول كاملة، ودقة 4K الأصلية تمنع فقدان التفاصيل عند التكبير. لتصور المنتجات وأصول العلامات والسرد بشخصية متكررة، هو الخيار الأكثر أماناً.
الآن صار الفرق بينهما صغيراً بحيث تعتمد الإجابة «الصحيحة» على الوصف المحدد نفسه، وهو ما قاله أحد المختبرين. وهذا مكان أصح للسوق من وجود فائز واضح، حتى لو جعل قرارات الشراء أصعب.
وإن كنت ما زلت متردداً، فالعارض بسيط: اختر ما يناسب طريقة عملك. من يعيش في ChatGPT يأخذ GPT Image 2 ولا يتأمل، ومن يبني مكتبة متسقة لعلامة أو شخصيات يوفر وقتاً أكبر بنظام مراجع Nano Banana Pro من أي فرق في السرعة. النماذج متقاربة بما يكفي لأن يناسب سير العمل على المواصفات.
مقالات ذات صلة
إعادة بناء منظومة أدوات توليد الصور بالذكاء الاصطناعي مفتوحة المصدر، سير عمل تلو الآخر
يعيد Workflow1111 إنشاء AUTOMATIC1111 بـ 73 عقدة و11 خط أنابيب. ماذا تعني إعادة البناء المجتمعية لتوليد الصور محليًا.
الأرقام وراء توليد الصور بالذكاء الاصطناعي: انخفاض الأسعار بنسبة 99% التهم صور الستوك
حجم السوق، واضطراب صور ستوك، وأرقام الاعتماد، وسير العمل الهجين، مشروحة من خلال الإحصاءات.
الحدود التالية للذكاء الاصطناعي هي تحويل صورة ثابتة واحدة إلى مشهد متحرك
كيف حُلّت مشكلة الفيزياء، وأدوات المصدر المفتوح الجديدة، وأي أدوات تحويل الصورة إلى فيديو قابلة للاستخدام فعلياً اليوم.
Flux 2 مقابل Stable Diffusion 3.5: سباق الصور مفتوحة المصدر له متصدر واضح
يتصدر Flux 2 في الجودة، ويحتفظ Stable Diffusion 3.5 بأعمق نظام بيئي. كيف تختار بينهما في 2026.