Qwen Image 2.1: لماذا يشكل نموذج مفتوح الأوزان بحجم 7B منافسًا شرسًا لـ Nano Banana 2.0؟

عندما أطلقت علي بابا Qwen Image 2.1 بهدوء، بدت الأرقام الرئيسية غير ملحوظة. سبعة مليارات معامل. أوزان مفتوحة. أسبوع آخر، ونموذج آخر. ثم وصلت اختبارات الأداء، وادّعى تقرير من Tom's Hardware أن النموذج الصغير تفوّق على Nano Banana 2.0 من جوجل في عدة اختبارات صور مع بقائه منافسًا لعروض OpenAI وMeta. وقد حصد خيط على Hacker News حول منشور مدونة Qwen الرسمي 739 نقطة ونحو 200 تعليق، وهو نوع من التفاعل لا تحصل عليه إطلالة نموذج روتينية.
هناك شيء يحدث هنا، ويستحق التفكيك، لأن الجزء المثير ليس من يتصدر لوحة الصدارة بقدر ما هو إلى أين يتجه توليد الصور.
نماذج صغيرة، مخرجات جدية
عدد المعاملات هو القصة. معظم نماذج الصور الرائدة تقع في نطاق عشرات المليارات. نموذج بحجم 7B ينافس في اختبارات الأداء يغيّر الحسابات لأي شخص يشغّل الاستدلال على عتاده الخاص. على RTX 5090 يمكنك تشغيل مزيل الضوضاء BF16 كاملًا دون تكميم أي شيء. وعلى MacBook Pro بمعالج M1 Max و32 غيغابايت من الذاكرة، شغّل مطوّر توليد النص إلى صورة وتحرير الصور أصليًا على Apple Silicon في نحو 24 ثانية لمخرج 512x512، ونشر العرض على r/StableDiffusion. هذه ليست أداء مركز بيانات على حاسوب محمول. هذا هاوٍ يشغّل نموذجًا يُقال إنه ينافس أفضل الأنظمة المغلقة، على جهاز اشتراه لمونتاج الفيديو.
تبعته نُسخ مجتمعية خلال أيام. أضاف أحدهم دعم Qwen-Image 2.1 إلى TensorSharp مع تكميم GGUF وإعدادات LoRA، بما في ذلك متغيرات مسودة أسرع تقلّص التوليد إلى بضع خطوات. وبنى مطوّر آخر استوديو Gradio على طراز Fooocus حوله، مع أقنعة وتعليقات ورسم خارجي ومراجع OpenPose ورسومات أولية كمدخلات. ويتكرر النمط: عندما تكون الأوزان مفتوحة، يبني النظام البيئي الأدوات التي لا يجد الفريق الرسمي وقتًا لبنائها.
التشكيك في اختبارات الأداء صحي
بالطبع، تستحق اختبارات أداء البائعين الشك، ولم يخيّب معلّقو Hacker News الظن. تنطبق التحذيرات المعتادة: اختيار اختبار الأداء مهم، ومجموعات المطالبات مهمة، و«يتفوق على Nano Banana» يعتمد بشدة على المهام التي تقيسها. ومقارنة جانبية من 192 صورة بين Qwen Image 2.1 وKrea 2، مرتبة حسب الفئة ومنشورة علنًا، هي بالضبط نوع التحقق الجماعي الذي يحسم هذه الجدالات أفضل من البيانات الصحفية. اضطر من أجراها إلى تكميم مُرمِّز النص إلى NF4 ليتسع لميزانية ذاكرته، وهذا يخبرك بشيء عن الفجوة بين ظروف اختبار الأداء والإعدادات الواقعية.
يظل عرض النص من أكثر القدرات مراقبة، وهو مجال أبلى فيه نموذج Qwen بلاءً حسنًا تاريخيًا مع النصوص CJK وكذلك الإنجليزية. التحرير هو الجبهة الأخرى. حظي منشور على r/StableDiffusion يعرض أوراق تصميم شخصيات مولّدة بوضع التحرير في Qwen ودون أي LoRAs باهتمام، لأن سير العمل هذا كان يتطلب سابقًا كومة من النماذج المضبوطة بعناية وعطلة نهاية أسبوع من الربط في ComfyUI.
لماذا يتجاوز هذا الأمر نموذجًا واحدًا
يظهر هنا تياران أكبر. الأول أن مجتمع الأوزان المفتوحة صار لديه خيار افتراضي جديد. لفترة طويلة، كان التوليد المحلي يعني مشتقات Stable Diffusion ومتغيرات Flux، مع بحث دائم عن أقل نقاط الحفظ سوءًا. ويدخل Qwen Image 2.1 هذا النظام البيئي بقدرات تحرير حديثة مدمجة، وتبعت الأدوات على الفور تقريبًا. التيار الثاني جغرافي. وقد جمع خيط منفصل على r/singularity بعنوان «نماذج الذكاء الاصطناعي الصينية تنتشر عالميًا — وواشنطن قلقة» نقاشًا كبيرًا تحديدًا لأن نماذج كهذه تظل تصل إلى قرب قمة اختبارات التفضيل التي يجريها المستخدمون بأنفسهم، لا تلك التي يكلّف بها البائعون.
بالنسبة لأي شخص يختار نموذجه اليومي الآن، الخلاصة العملية واضحة. إذا أردت أفضل جودة تحرير مطلقة من API مستضاف، فلا تزال النماذج المغلقة الرائدة تستحق سعرها. وإذا أردت شيئًا يمكنك تشغيله وضبطه وتكميمه وربطه بخط أنابيبك الخاص دون طلب إذن، فمن الصعب تجاهل المنافس بحجم 7B. وإن كنت فضوليًا فقط، فالأوزان على Hugging Face. أربع وعشرون ثانية على حاسوب محمول عمره سنتان عتبة منخفضة لتجاوزها في أول تجربة.
التحرير كساحة المعركة الجديدة
أكثر ميزة ذات أثر ليست توليد النص إلى صورة على الإطلاق. إنها التحرير. تعاملت نماذج الصور الأقدم مع التعديل كمشكلة منفصلة: أعد رسم هذه المنطقة داخليًا، واربط ControlNet، وتمنَّ أن تختفي الوصلات. يتعامل Qwen Image 2.1 مع التحرير كوضع أصلي؛ النموذج نفسه الذي يرسم يمكنه أن يعيد الرسم. عرض توضيحي انتشر على r/StableDiffusion أظهر أوراق تصميم شخصيات، بزوايا متعددة متناسقة للشخصية نفسها عبر أوضاع وملابس مختلفة، أُنتجت دون LoRAs ودون تجهيز مراجع. أي شخص جرّب سير العمل هذا قبل عام يعرف كلفته: ضبط دقيق لكل شخصية، وساعات من رسم الأقنعة، ونتائج تتغير بين الزوايا.
التحرير هو أيضًا حيث تتركز القيمة التجارية. فرق التسويق لا تريد صورًا؛ إنها تريد صورتها، معدّلة. لقطة منتج مع تبديل الخلفية. ملصق مع إعادة توليد العنوان بلغة مختلفة. التحرير الأصلي يطوي خط الأنابيب هذا، وكونه موجودًا الآن في نموذج قابل للتنزيل يعني أن هذا الطي يصل إلى أشخاص لن يدفعوا أبدًا مقابل API.

تعكس الأدوات المجتمعية ذلك. تأتي نسخة TensorSharp مزودة بإعدادات التحرير من اليوم الأول، لا كملحق لاحق. ويعرض الاستوديو على طراز Fooocus الأقنعة والتعليقات والرسم الخارجي ومراجع الأوضاع كمدخلات من الدرجة الأولى. عندما يتعامل ناشرو النسخ مع التحرير كميزة أساسية لا كمكافأة إضافية، فهذا هو السوق يصوّت على ما يهم.
كيف يختبر المجتمع الادعاءات فعليًا
اختبارات الأداء من البائعين تسويق حتى يعيد أحد إنتاجها، لذا كانت القطع الأكثر إثارة للاهتمام هذا الشهر هي تلك الجماعية. مقارنة الـ192 صورة بين Qwen وKrea 2، المولّدة بمطالبات متطابقة والمرتبة حسب الفئة، هي الصيغة التي تحسم الجدالات فعليًا. ولها نفس فضيلة اختبار التذوق الأعمى: لا يبقى ترتيب أحد على حاله عند ملامستها. تظهر الفئات التي يهيمن عليها أحد النموذجين بلمحة، وكذلك الفئات التي يفشل فيها كلاهما.
أدّى Hacker News دوره برفض قبول العنوان الرئيسي كما هو. ركّزت أقسام التعليقات في خيط الإصدار ومشاركة Tom's Hardware على نقاط الضعف المعتادة: أي مجموعة اختبارات أداء، ومجموعة مطالبات مَن، وماذا يحدث خارج التوزيع المُختبَر. هذا التشكيك هو الجهاز المناعي لمجتمع الأوزان المفتوحة، ولهذا تحمل الادعاءات التي تنجو هناك وزنًا. سمعة Qwen Image 2.1 مبنية حاليًا أقل على أرقام علي بابا وأكثر على حقيقة أن مئات الأشخاص شغّلوه ولم ينشروا في الغالب خيوط تشهير.
اقتصاد الجيد بما يكفي والمفتوح
هناك قراءة تجارية تتجاوز جودة النموذج. يُسعّر توليد الصور المستضاف مقابل النماذج الرائدة، وتشغيل النماذج الرائدة مكلف. نموذج بحجم 7B يقدّم معظم جودة النموذج الرائد بتكلفة الكهرباء يغيّر ما سيتحمّل العملاء دفعه. كما يغيّر ما يبنيه المطورون عليه: نموذج مفتوح بأوزان مستقرة يمكن تثبيته وضبطه وتضمينه داخل منتج دون التفاوض على اتفاقية API أو الخوف من إيقاف الدعم.
تستحق هذه النقطة الأخيرة التأكيد لأن الصناعة قدّمت للتو درسًا عمليًا. أوقفت OpenAI منتج DALL·E المستقل في نهاية أغسطس، ودمجت توليد الصور داخل ChatGPT Images. لم يُفقد شيء تقنيًا، لكن كل تكامل مبني على الواجهة القديمة اضطر إلى الانتقال وفق جدول شخص آخر. الأوزان المفتوحة لا ترسل تلك الرسالة.
لا شيء من هذا يجعل Qwen Image 2.1 أفضل نموذج صور في العالم. لكنه يجعله شيئًا أكثر إحداثًا للاضطراب على الأرجح: أفضل نموذج صور يمكن لشخص عادي أن يملكه ملكية كاملة. ستحسم حجة لوحة الصدارة بالإصدار التالي على أي حال، ثم الذي يليه. تحوّل الملكية هو الجزء الذي يدوم.
الوتيرة هي الشيء الآخر الذي يجب استيعابه. أكثر من عشرين إصدار لنماذج صور في شهر واحد، كما أحصى منشور على r/PromptEngineering مؤخرًا، يعني أن أي ادعاء بـ«أفضل نموذج» له عمر افتراضي يُقاس بالأسابيع. Qwen Image 2.1 هو الدليل الحالي على أن الصغير والمفتوح يمكنه إحراج الكبير والمغلق. امنحه شهرًا، وسيكون السؤال المثير هو ما الذي سيحلّ محله.
مقالات ذات صلة
نماذج الصور الصينية تتجه نحو العالمية، وهذا الشهر تغيّرت المحادثة
نماذج الصور الصينية تتجه نحو العالمية. كيف تغيّرت اختبارات الأداء وأقسام التعليقات وواشنطن هذا الشهر.
أسواق التنبؤات تضع أموالاً حقيقية على من يفوز في الذكاء الاصطناعي للصور، والاحتمالات غير متكافئة
أسواق التنبؤات تراهن على من سيفوز في الذكاء الاصطناعي للصور. ما الذي تقيسه الاحتمالات غير المتكافئة فعلاً، وكيف تُقرأ.
هل ما زال بإمكانك التمييز بين صورة ذكاء اصطناعي وصورة حقيقية؟ سباق تسلح الكشف يزداد إزعاجًا
لماذا يخسر البشر والكواشف سباق تسلح صور الذكاء الاصطناعي، وما الذي يفعله الإسناد والمجتمع فعليًا.
صور Meta Muse تكلّف نحو سنت للصورة وتستهدف المعلنين
نحو سنت لكل صورة، ويستهدف المعلنين: ماذا يعني تسعير Meta Muse للإبداع الإعلاني وسوق الصور ذي المسارين.