Qwen-Image 2.1 من Tongyi Wanxiang مفتوح المصدر: لماذا يجرؤ نموذج بـ7 مليارات معلمة على تحدي Google وOpenAI؟

في 20 سبتمبر، أطلقت فريق Tongyi التابع لـعلي بابا بهدوء «قنبلة نووية صغيرة» — Qwen-Image 2.1. إنه نموذج تحويل النص إلى صورة لا يملك سوى 7 مليارات معلمة، ومع ذلك تفوّق في تقييماتهم الداخلية على Nano Banana 2.0 من Google، وأجبر النماذج المغلقة من OpenAI وMeta على الالتفات. بمجرد انتشار الخبر، انفجرت منصات Bilibili وZhihu، وكذلك Hacker News وReddit في الخارج.
لماذا يوصف بأنه «صغير لكن شرس»
على مدى السنوات الأخيرة، تضخمت نماذج توليد الصور، إذ تصل النماذج المغلقة إلى عشرات ومئات المليارات من المعلمات وتحتاج إلى بطاقة رسومات احترافية لتشغيلها. سار Qwen-Image 2.1 في الاتجاه المعاكس، فقلّص جزء التوليد إلى 7B، ونتيجة لذلك حصل على 60.28 نقطة في قائمة Qwen-Image-Bench الخاصة به. ماذا يعني هذا الرقم على مستوى القائمة كاملة؟ حصل Nano Banana 2.0 من Google على 59.82 نقطة، أي إنه تفوّق عليه بفارق ضئيل؛ وفي معسكر المصادر المفتوحة، جاء LongCat-Image من Meituan (6B) في المركز الثاني بحدود 54 نقطة فقط. بعبارة أخرى، إنه أقوى نموذج بين كل النماذج القابلة للتنزيل حاليًا.
لكن استنتاجات التقييم المستقل من طرف ثالث AI Arena كانت أكثر تحفّظًا. هناك حصل Nano Banana 2.0 على 1260 نقطة، وQwen-Image 2.1 على 1228 نقطة، بينما وصل GPT Image 2.5 Sunburst المغلق إلى 1423 نقطة. الفجوة ما زالت موجودة، لكنها صارت صغيرة إلى حد «ملاحقة الكعب». وبالنسبة لنموذج مفتوح المصدر، فإن هذا الموقع بحد ذاته انتصار.
ثلاث قدرات عملية حقًا
الأولى هي الخلفية الشفافة الأصلية. في السابق، عند صنع الملصقات أو المطبوعات المخصصة أو التصاميم، كان لا بد من إزالة الخلفية مرة أخرى بعد توليد الصورة بالذكاء الاصطناعي. أما Qwen-Image 2.1 فيُخرج مباشرة صور RGBA بقناة alpha، إذ يقوم نموذج واحد بمهمتي التوليد والتحرير معًا، ويمكن تحرير الطبقات الشفافة مباشرة دون دمجها. بالنسبة لمن يعملون في المنتجات الثقافية والإبداعية والمنتجات المرافقة، يوفّر هذا البند الكثير من العناء.
الثانية هي التحرير بعشر صور مرجعية في الوقت نفسه. ألقِ صورة شخص، ثم أضف عدة صور لملابس، فيستطيع تركيب «هذا الشخص وهو يرتدي هذه الملابس». ويمكنه أيضًا دمج ستة بورتريهات في صورة جماعية واحدة، أو تجميع عشر صور أثاث داخل الغرفة نفسها. على Bilibili، عرض بعض منشئي المحتوى بالفعل «اتساق الشخصية + تغيير الملابس»، وامتلأ قسم التعليقات بعبارات مثل «هذا طبيعي أكثر من اللازم».
الثالثة هي خفته الشديدة حتى إنه يعمل على بطاقات المستهلكين المنزلية. على RTX 4090 تستغرق صورة بدقة مليون بكسل نحو 5 ثوانٍ، وعلى بطاقات سلسلة 50 حوالي 25 ثانية، بل إن بعضهم شغّل صور 2K باستخدام RTX 3060 مع 64GB من الذاكرة، بمعدل صورة كل 50 ثانية. وقد أعلنت علي بابا رسميًا أن الحد الأدنى للإعدادات يصل إلى 6GB من ذاكرة الرسومات، وبدأت تظهر على Bilibili دروس «الحزم المدمجة بنقرة واحدة» واحدًا تلو الآخر.

أكثر ما يلفت الأنظار ليس الأداء، بل الترخيص
ما أثار الجدل فعليًا في المجتمع هو الترخيص. كانت سلسلة Qwen-Image السابقة تحت Apache 2.0، ويمكن استخدامها تجاريًا بحرية. أما هذه المرة فقد تغيّر إلى Qwen Research License «لأغراض البحث فقط»، ويتطلب الاستخدام التجاري التفاوض مع علي بابا بشكل منفصل. انقسمت الآراء على Reddit وHN، إذ رأى بعضهم أن هذه خطوة إلى الوراء، ورأى آخرون أن «إتاحة الأوزان لك وترك استخدام الصور كما تشاء» كافية.
سرعان ما خرجت علي بابا رسميًا لتوضح بجملة واحدة: لا يمكن إعادة توزيع أوزان النموذج تجاريًا، لكن الصور التي تولّدها به تعود حقوقها إليك، ولا مشكلة في استخدامها تجاريًا. هذا التمييز جوهري — فبالنسبة للغالبية العظمى ممن يريدون فقط صنع الصور، ليس للأثر أهمية كبيرة في الواقع.
الدلالة الأكبر لهذا الأمر
أثبت Qwen-Image 2.1 أمرًا واحدًا: عبر تقطير البنية المعمارية وبيانات تدريب أنظف، يمكن للنماذج الصغيرة أن تبلغ مستوى النماذج الكبيرة في توليد الصور. كان عنوان الفيديو الذي نشره منشئ المحتوى على Bilibili «السيف 27 المحب للمشاركة» مباشرًا — «نموذج الرسم بالذكاء الاصطناعي مفتوح المصدر من علي بابا يسحق مجموعة من الأدوات المدفوعة». فيه بعض المبالغة، لكن الاتجاه صحيح.
عندما يمكن توليد صورة على بطاقة رسومات منزلية في ثوانٍ، يصبح قرار دفع رسوم اشتراك شهرية أو عدمه حسابًا جديدًا على كل مبدع أن يعيد تقديره. سيتعين على الشركات المغلقة أن تثبت استحقاقها لهذا المال بالسرعة وتكامل سير العمل والتعاون متعدد الوسائط، لا أن تعتمد فقط على «صورتي تبدو جميلة».
بالنسبة للعامة، الخبر السار هو أن سقف توليد الصور مفتوح المصدر ارتفع مرة أخرى هذا الشهر.
مقالات ذات صلة
هل ما زال بإمكانك التمييز بين صورة مولّدة بالذكاء الاصطناعي وصورة حقيقية؟ الجواب الصادق هو لا.
اختفت العلامات الدالة وأصبحت أدوات الكشف غير موثوقة. الجواب الصادق عن اكتشاف صور الذكاء الاصطناعي هو لا، والإصلاح يقع في المنبع، قبل عينيك.
التحوّل الصامت في الترخيص الذي قد يغيّر صور الذكاء الاصطناعي مفتوحة المصدر
لم تعد الأوزان المفتوحة تعني ما كانت تعنيه قبل عام. تزداد بنود الترخيص الدقيقة تعقيداً في الوقت الذي تتحسّن فيه النماذج.
ضغط النماذج المحلية: لماذا يواصل المبدعون السعي وراء نماذج الصور غير المقيّدة
كل أسبوع يسأل مبدع آخر عن نموذج غير مقيّد. الطلب يقول عن أدوات السحابة أكثر مما يقول عن الأشخاص الذين يسألون.
تونغي وانشيانغ Qwen-Image 2.1 مفتوح المصدر: كيف يجرؤ نموذج بـ7B معلمة على تحدي جوجل وOpenAI
نموذج توليد صور مفتوح المصدر بحجم 7B، فلماذا يجرؤ على مصارعة جوجل وOpenAI؟ يحلل هذا المقال نتائج Qwen-Image 2.1 وقدراته الأساسية والجدل حول ترخيصه.