Qwen-Image 2.1 مقابل Nano Banana 2.0: نموذج مفتوح بـ7B يهبط على أعقاب Google

أطلقت Alibaba نموذج Qwen-Image 2.1 في 20 سبتمبر، ولم تعد محادثة المقارنات كما كانت منذ ذلك الحين. مولّد صور بـ7 مليارات معامل وأوزان قابلة للتنزيل يتقدم الآن على Nano Banana 2.0 من Google في تصنيف Alibaba الخاص، وقريب بما يكفي في لوحات الصدارة المستقلة ليجعل الناس ينظرون مرتين. جمع موضوع Hacker News حول الإصدار أكثر من 700 نقطة وحوالي 200 تعليق في يوم واحد، ما يخبرك بحجم الاهتمام المكبوت لدى هذه الفئة.
الأرقام، ولماذا تهم
في Qwen-Image-Bench من Alibaba، يسجل النموذج الجديد 60.28 مقابل 59.82 لـ Nano Banana 2.0. هذا فارق نصف نقطة، وهو يهم أقل كادعاء تقني وأكثر كإشارة: Alibaba الآن تسمي Google كمعيار تنوي تجاوزه. النموذج المفتوح الوحيد بأوزان وعدد معاملات أقل، LongCat-Image من Meituan بـ6 مليارات، يتخلف عند نحو 54 نقطة. للمقارنة، يتصدر GPT Image 2.5 Sunburst من OpenAI مخطط Alibaba عند 67، ويأتي Muse Image عند 62.34، وكلاهما مغلق.
AI Arena، الذي يجري تصويتاً بشرياً أعمى بين الصور، يروي قصة أكثر تواضعاً. يملك Nano Banana 2.0 1260 إيلو مقابل 1228 لـ Qwen-Image 2.1، مع تصدر GPT Image Sunburst عند 1423 و Muse عند 1276. النموذج المفتوح لا يفوز في تلك المعركة بعد. لكنه، مع ذلك، يحتل المرتبة الأولى بين جميع النماذج المفتوحة الأوزان في كل من Image Edit Arena و Text-to-Image Arena، وهي الفئة التي يهتم بها كثير من الناس فعلاً. وقد صاغ حساب Qwen نفسه الأمر بأنه "النموذج المفتوح المصدر رقم واحد"، وفي هذا الادعاء الأضيق، تدعمه البيانات المستقلة.
حيث يتألق حقاً
الشفافية هي الميزة التي يواصل الجميع ذكرها. يُخرج Qwen-Image 2.1 صور RGBA أصلاً، لذا يمكنك أن تطلب خلفية شفافة وتحصل على قصّ نظيف دون تمريرة ثانية عبر أداة إزالة الخلفية. بالنسبة لبائعي الملصقات، ومتاجر الطباعة عند الطلب، وأي شخص يركّب عناصر في تصميم أكبر، فإن ذلك يزيل خطوة حقيقية. يستطيع النموذج أيضاً تحرير طبقة شفافة دون تسطيحها، وهو ما كان يتطلب سابقاً نموذجاً منفصلاً للطبقات.
التحرير بما يصل إلى عشر صور مرجعية هو العنوان الآخر. أعطِه صورة لشخص وبضع صور لملابس، وسيركّب الشخص وهو يرتدي تلك الملابس. ادمج ست صور شخصية في صورة جماعية. جمّع عشر صور أثاث في غرفة واحدة. يمكنك تحديد المنطقة المراد تحريرها بثلاث طرق: رسم دوائر ملوّنة، أو الرسم فوق المنطقة، أو تمرير الأصل مع قناع منفصل. مسار القناع هو الذي تستخدمه عندما لا يمكنك تحمّل الكتابة فوق البكسلات الأصلية.
ثم هناك السرعة على أجهزة متواضعة. يفيد المستخدمون الأوائل بأن صورة بدقة 1 ميغابكسل تستغرق نحو خمس ثوانٍ على RTX 4090، وحوالي 25 ثانية على بطاقات الفئة 50، ونحو 50 ثانية لصورة 2K على RTX 3060 مع 64GB من ذاكرة النظام. قال أحد المعلّقين في Hacker News إنه أنتج صورة 1MP في نحو خمس ثوانٍ على 4090. أفاد مستخدم على r/StableDiffusion بصور 1MP في حوالي 25 ثانية على 5070 أو 5080، مع الإشارة إلى أن التحرير هو أبطأ عملية وأن إضافة صور مرجعية كثيرة يزيد زمن الاستجابة بشكل ملحوظ. هذه ليست سرعة السحابة، لكنها سريعة بما يكفي لتتوقف عن كونها عذراً.

مشكلة الترخيص
إليك الجزء الذي قسّم المجتمع. صدرت نماذج Qwen للصور السابقة تحت Apache 2.0، مما سمح لك بضبطها وبيع ما تبنيه. يصدر Qwen-Image 2.1 بموجب ترخيص للأبحاث فقط، يحظر الاستخدام التجاري للأوزان دون اتفاق منفصل مع Alibaba. اشتعل موضوع HN بسبب الغموض، وتدخّل حساب Alibaba للتوضيح: الأوزان مقيّدة، لكن الصور التي تولّدها بها ملكك، بما في ذلك للاستخدام التجاري.
هذا التمييز يبدو صغيراً لكنه يهم كثيراً. إذا كنت تريد فقط توليد صور للعملاء أو المنتجات أو مشاريعك الخاصة، فلا مشكلة، وقد أكدت Alibaba أن المخرجات لا تحمل أي التزامات ترخيص. أما إذا أردت الضبط الدقيق وإعادة توزيع النموذج، فأنت من يتبقى عليه التفاوض. معظم الناس يقعون في المعسكر الأول، ولهذا كان رد الفعل الغاضب صاخباً لكنه احتُوي في النهاية.
حجة الكفاءة الأوسع
السطر المثير هنا ليس النتيجة الخام. بل الكفاءة. يقترب Qwen-Image 2.1 ضمن بضع نقاط إيلو من نماذج تفوقه حجماً بمرات عديدة ومغلقة بالكامل. يحتوي المولّد على 32 طبقة Single-Stream DiT، ويقرأ الأوامر عبر مشفّر نصي Qwen3-VL 8B، ويعرض أصلاً بدقة 2K تصل إلى 2752 في 2752 بكسل. على صعيد الكفاءة، يثبت أن التقطير المعماري وبيانات التدريب الأنظف يمكن أن يغلقا معظم الفجوة التي افترض الجميع أنها تتطلب حجماً كبيراً.
وهذا يضع ضغطاً على نموذج الاشتراك بطريقة لم تستطع أي شريحة تسويقية فعلها. إذا كانت وحدة معالجة رسومات استهلاكية قادرة على إنتاج مخرجات بجودة الاستوديو في ثوانٍ، فإن "نحن نولّد أفضل الصور" يتوقف عن كونه سبباً كافياً للدفع شهرياً. ما زالت Google و OpenAI تتصدران في أصعب مهام الاستدلال الدلالي والمكاني، حيث تواصل التقييمات العمياء منحهما الأفضلية. لم يغلق Qwen-Image 2.1 تلك الفجوة. لكنه فقط جعل الفجوة تبدو اختيارية لحصة كبيرة من العمل اليومي، وهذا اضطراب أكبر من أي نتيجة معيارية منفردة.
حكم المجتمع بعد التجربة العملية
لا توصلك جدالات المعايير إلا إلى حد معين. الإشارة الأكثر واقعية هي ما يبلغ عنه الناس فعلاً بعد تشغيله بأنفسهم، وتقارير هذا الأسبوع متسقة بشكل غير معتاد. على r/StableDiffusion، نشر أحد المستخدمين مقارنة جنباً إلى جنب لـ192 صورة مولّدة تقارن Qwen-Image 2.1 مع Krea 2، مرتبة حسب الفئة مثل توليد النص وتشريح الإنسان. كان الاستنتاج أن النموذج المفتوح صمد جيداً في البنية لكنه اضطر للالتفاف حول مشفّر نصي مكمّم ليتسع مزيل الضوضاء على 5090.
شغّل مستخدم آخر النموذج على MacBook Pro M1 Max بذاكرة 32GB، مولّداً صورة 512 في 512 في حوالي 24 ثانية باستخدام بيئة تشغيل أصلية لـ Apple Silicon. هذا بطيء بمعايير الحواسيب المكتبية، لكنه يثبت أن النموذج ليس حبيس عتاد Nvidia، وهذا يهم شريحة كبيرة من المستخدمين العاديين. وبنى ثالث استوديو محلياً بأسلوب Fooocus حوله، مضيفاً أقنعة وتعليقات وتوسيع الصورة ومراجع وضعيات OpenPose، وطلب نقداً صادقاً بدلاً من الثناء.
جذبت قدرات التحرير أكبر حماس. وصف أحد المنشورات توليد أوراق تصميم شخصيات دون أي LoRAs، باستخدام تحرير الصور المرجعية في النموذج للحفاظ على اتساق الشخصية عبر الأوضاع والأزياء. كان ذلك يتطلب سابقاً مجموعة من النماذج المضبوطة بدقة والكثير من التنظيف اليدوي. كون نموذج واحد بـ7B يفعل ذلك مباشرة هو العنوان الهادئ الذي لا تلتقطه معظم مخططات المعايير.
ما يجب متابعته بعد ذلك
ما زالت النتائج المبكرة تستقر. بنى Qwen معياره الخاص ولم ينشر الأوامر أو النتائج حسب الفئة، لذا فالأرقام الداخلية ادعاء أكثر منها قياس. أرقام AI Arena المستقلة أكثر موثوقية وأقل تملقاً قليلاً. القراءة الصادقة الآن هي أن Qwen-Image 2.1 هو أفضل نموذج صور مفتوح الأوزان متاح، وأقل بمستوى حقيقي من المتصدرين المغلقين، ونقطة إثبات حقيقية على أن الصغير والمفتوح يمكن أن يكونا تنافسيين. ستخبرنا الأسابيع القليلة القادمة من الاختبار المستقل ما إذا كانت أفضلية نصف النقطة على Nano Banana 2.0 مستدامة أم كانت مجرد شريحة متملقة من المعيار.
مقالات ذات صلة
نماذج الصور بالذكاء الاصطناعي الصينية تكسب معجبين في الخارج، وواشنطن تراقب
التبني تقني أولاً، وسياسي ثانياً. يقوم المطورون بتنزيل ما ينجح، والآن أصبح ذلك بشكل متزايد من مختبرات صينية.
ما الذي تراهن عليه أسواق التنبؤ بشأن صور الذكاء الاصطناعي
أموال حقيقية تراهن على من يفوز في صور الذكاء الاصطناعي. OpenAI تتصدر الصور الثابتة، وMiniMax تتصدر الفيديو، والنماذج المفتوحة هي المتغير المجهول الذي لا يسعّره أحد.
نماذج الصور الصينية تتجه نحو العالمية، وهذا الشهر تغيّرت المحادثة
نماذج الصور الصينية تتجه نحو العالمية. كيف تغيّرت اختبارات الأداء وأقسام التعليقات وواشنطن هذا الشهر.
أسواق التنبؤات تضع أموالاً حقيقية على من يفوز في الذكاء الاصطناعي للصور، والاحتمالات غير متكافئة
أسواق التنبؤات تراهن على من سيفوز في الذكاء الاصطناعي للصور. ما الذي تقيسه الاحتمالات غير المتكافئة فعلاً، وكيف تُقرأ.