← العودة إلى المدونة
Ai1 دقيقة

تونغي وانشيانغ Qwen-Image 2.1 مفتوح المصدر: كيف يجرؤ نموذج بـ7B معلمة على تحدي جوجل وOpenAI

نُشر في 27 سبتمبر 2026
تونغي وانشيانغ Qwen-Image 2.1 مفتوح المصدر: كيف يجرؤ نموذج بـ7B معلمة على تحدي جوجل وOpenAI

في 20 سبتمبر، أطلقت فريق Tongyi في علي بابا بهدوء «قنبلة نووية صغيرة» — Qwen-Image 2.1. نموذج تحويل النص إلى صورة لا يملك سوى 7 مليارات معلمة، لكنه تفوّق في تقييماتهم الخاصة على Nano Banana 2.0 من جوجل، وأجبر النماذج المغلقة من OpenAI وMeta على الالتفات. بمجرد انتشار الخبر، انفجرت Bilibili وZhihu، وكذلك Hacker News وReddit في الخارج.

لماذا يقال إنه «صغير لكن شرس»

على مدى السنوات الماضية، أصبحت نماذج توليد الصور أكبر وأكبر؛ فالنماذج المغلقة تصل بسهولة إلى عشرات أو مئات المليارات من المعلمات، وتحتاج بطاقة رسومات احترافية لتشغيلها. سار Qwen-Image 2.1 في الاتجاه المعاكس، فضغط جزء التوليد إلى 7B، وحصل في قائمة Qwen-Image-Bench الخاصة به على 60.28 نقطة. ماذا يعني هذا الرقم على مستوى القائمة كاملة؟ Nano Banana 2.0 من جوجل حصل على 59.82 نقطة، متأخراً عنه بفارق ضئيل؛ وفي معسكر المصادر المفتوحة، جاء LongCat-Image (6B) من Meituan في المرتبة الثانية بنحو 54 نقطة فقط. أي أنه حالياً الأقوى بين كل النماذج القابلة للتنزيل.

لكن استنتاجات التقييم المستقل من طرف ثالث AI Arena كانت أكثر تحفظاً. هناك حصل Nano Banana 2.0 على 1260 نقطة، وQwen-Image 2.1 على 1228 نقطة، بينما وصل GPT Image 2.5 Sunburst المغلق إلى 1423 نقطة. الفجوة لا تزال موجودة، لكنها صارت صغيرة إلى حد «ملاحقة كعب القدم». وبالنسبة لنموذج مفتوح المصدر، فإن هذا الموقع بحد ذاته انتصار.

ثلاث قدرات مفيدة حقاً

الأولى هي الخلفية الشفافة الأصلية. في السابق، عند صنع الملصقات أو المطبوعات المخصصة أو التصاميم، كان لا بد من إزالة الخلفية مرة أخرى بعد توليدها بالذكاء الاصطناعي. ينتج Qwen-Image 2.1 مباشرة صوراً RGBA بقناة alpha، فيقوم نموذج واحد بمهام التوليد والتحرير معاً، ويمكن تحرير الطبقات الشفافة مباشرة دون دمجها. ولمن يعملون في المنتجات الثقافية والإبداعية والملحقات، هذه الميزة توفر الكثير من العناء.

الثانية هي التحرير بعشر صور مرجعية في آن واحد. ضع صورة شخص، ثم أطعمه عدة صور لملابس، وسيولّف مشهد «هذا الشخص يرتدي هذه الملابس». ويمكنه أيضاً دمج ست صور شخصية في صورة جماعية واحدة، أو تجميع عشر صور أثاث في غرفة واحدة. على Bilibili، عرض بعض المبدعين بالفعل «اتساق الشخصية + تغيير الملابس»، وامتلأت التعليقات بعبارات «هذا طبيعي للغاية».

الثالثة هي خفة النموذج لدرجة التشغيل على بطاقات المستهلك. على RTX 4090، تستغرق صورة بدقة 1 ميغابكسل حوالي 5 ثوانٍ، وعلى بطاقات سلسلة 50 حوالي 25 ثانية، بل إن البعض يشغّل صور 2K على RTX 3060 مع 64GB من الذاكرة ليحصل على صورة كل 50 ثانية. الحد الأدنى الرسمي من علي بابا وصل إلى 6GB من ذاكرة الرسومات، وبدأت دروس «الحزمة المدمجة بنقرة واحدة» بالظهور على Bilibili.

حاسوب مكتبي يولّد صورة، والمشهد على الشاشة يتشكل تدريجياً من جسيمات تتجمع

الأمر الأبرز ليس الأداء، بل الترخيص

ما أثار الجدل فعلاً في المجتمع هو الترخيص. كانت سلسلة Qwen-Image السابقة تحت Apache 2.0، ما يسمح بالاستخدام التجاري بحرية. هذه المرة تغيّر الأمر إلى Qwen Research License «لأغراض البحث فقط»، ويتطلب الاستخدام التجاري التفاوض مع علي بابا بشكل منفصل. اشتعل الجدل على Reddit وHN؛ فرأى البعض أن هذه خطوة إلى الوراء، ورأى آخرون أن «الأوزان متاحة لك، والصور واستخدامها كما تشاء» كافية.

سرعان ما خرجت علي بابا لتوضح: لا يمكن إعادة توزيع أوزان النموذج تجارياً، لكن الصور التي تولدها به ملكيتها لك، ويمكن استخدامها تجارياً دون مشكلة. هذا التمييز مهم جداً — فبالنسبة لغالبية من يريدون فقط صنع الصور، التأثير ليس كبيراً في الواقع.

المعنى الأكبر لهذا الأمر

أثبت Qwen-Image 2.1 أمراً واحداً: عبر تقطير البنية وتحسين نظافة بيانات التدريب، يمكن للنماذج الصغيرة أن تلحق بمستوى النماذج الكبيرة في توليد الصور. على Bilibili، كان عنوان فيديو المبدع «جيان 27 المحب للمشاركة» مباشراً — «نموذج الرسم بالذكاء الاصطناعي مفتوح المصدر من علي بابا يسحق مجموعة من الأدوات المدفوعة». العبارة فيها بعض المبالغة، لكن الاتجاه صحيح.

عندما يمكن إنتاج صورة على بطاقة رسومات منزلية في ثوانٍ، تصبح مسألة دفع اشتراك شهري حساباً يجب على كل مبدع إعادة تقديره. على الشركات المغلقة أن تثبت لاحقاً أنها تستحق هذا المال عبر السرعة، وتكامل سير العمل، والتعاون متعدد الوسائط، لا عبر «صورتي تبدو جميلة» فقط.

بالنسبة للعامة، الخبر السار هو أن سقف توليد الصور مفتوح المصدر قد ارتفع مرة أخرى هذا الشهر.

مقالات ذات صلة

هل ما زال بإمكانك التمييز بين صورة مولّدة بالذكاء الاصطناعي وصورة حقيقية؟ الجواب الصادق هو لا.

اختفت العلامات الدالة وأصبحت أدوات الكشف غير موثوقة. الجواب الصادق عن اكتشاف صور الذكاء الاصطناعي هو لا، والإصلاح يقع في المنبع، قبل عينيك.

التحوّل الصامت في الترخيص الذي قد يغيّر صور الذكاء الاصطناعي مفتوحة المصدر

لم تعد الأوزان المفتوحة تعني ما كانت تعنيه قبل عام. تزداد بنود الترخيص الدقيقة تعقيداً في الوقت الذي تتحسّن فيه النماذج.

ضغط النماذج المحلية: لماذا يواصل المبدعون السعي وراء نماذج الصور غير المقيّدة

كل أسبوع يسأل مبدع آخر عن نموذج غير مقيّد. الطلب يقول عن أدوات السحابة أكثر مما يقول عن الأشخاص الذين يسألون.

Qwen-Image 2.1 من Tongyi Wanxiang مفتوح المصدر: لماذا يجرؤ نموذج بـ7 مليارات معلمة على تحدي Google وOpenAI؟

نموذج مفتوح المصدر لتوليد الصور بحجم 7B فقط؛ فكيف يقارع Google وOpenAI؟ يحلّل هذا المقال نتائج Qwen-Image 2.1 وقدراته الأساسية والجدل حول ترخيصه.