← العودة إلى المدونة
Ai1 دقيقة

Tongyi Wanxiang Qwen-Image 2.1 مفتوح المصدر: كيف يضع نموذج صغير بحجم 7B الصور الشفافة وتحرير 10 صور في بطاقة رسومات استهلاكية واحدة

نُشر في 27 سبتمبر 2026
Tongyi Wanxiang Qwen-Image 2.1 مفتوح المصدر: كيف يضع نموذج صغير بحجم 7B الصور الشفافة وتحرير 10 صور في بطاقة رسومات استهلاكية واحدة

في 20 سبتمبر، نشر فريق Qwen من علي بابا Qwen-Image 2.1 على منصات المصادر المفتوحة. بمجرد انتشار الخبر، تكاثرت في اليوم نفسه مقاطع الفيديو على منصة بيليبيلي عن حزم الدمج الجاهزة، وغالباً ما حملت عناوينها الجملة نفسها: يمكن تشغيله بذاكرة رسومات لا تقل عن 6 جيجابايت. وبالنسبة لمجال توليد الصور من النص الذي طالما وُسم بأنه «يستهلك بطاقة الرسومات»، فإن هذا الرقم بحد ذاته خبر.

قد يظنه كثيرون للوهلة الأولى جيلاً جديداً تالياً لـ Qwen-Image 3.0. لكنه ليس كذلك. فقد أعلن فريق Qwen في يوليو من هذا العام عن Qwen-Image 3.0 مسبقاً، بادعاء دعم أوامر نصية فائقة الطول تصل إلى 4500 توكن (token)، لكن ذلك كان مجرد معاينة، دون إتاحة الأوزان أو نتائج التقييم. أما 2.1 فهو الخلف الشرعي لـ 2.0 على خط المصادر المفتوحة، ولا يزال جزء التوليد البصري فيه مبنياً على DiT أحادي المسار بـ 32 طبقة، بمعاملات 7B، محافظاً على البنية الخفيفة نفسها التي جاء بها 2.0 في فبراير.

المفاجئ الحقيقي هو الوظائف، لا المعاملات. وعند النظر إلى الترقيات الثلاث معاً، فإنها تشير إلى الاتجاه نفسه: أن تدخل أدوات توليد الصور فعلياً في سير الإنتاج، لا أن تبقى في مرحلة «العرض التجريبي المبهر».

الأول هو الصور الشفافة الأصلية. في السابق، لتوليد ملف PNG بقناة شفافية، كان لا بد من نموذج منفصل، وقد أصدر فريق Qwen في ديسمبر الماضي نموذج Qwen-Image-Layered المخصص لذلك. أما 2.1 فقد دمج قدرة الصور الشفافة في نموذج موحّد، بحيث يكفي أمر نصي واحد للتبديل بين الصور العادية وRGBA، بل ويمكن تحرير طبقات شفافة مباشرة — فيبقى الخلفية شفافة عند تغيير تعبير الوجه، أو يمكن اقتطاع العنصر الرئيسي من صورة لاستخدامه كمادة. وبالنسبة لمن يصنعون صور التجارة الإلكترونية أو مواد واجهات المستخدم، يوفّر ذلك الكثير من عناء التبديل ذهاباً وإياباً.

الثاني هو ارتفاع عدد الصور المرجعية من بضع صور إلى 10 صور. في زمن 2.0، كان تحرير الصور المتعددة محصوراً في مدخلات قليلة، أما 2.1 فيمكنه دمج ست صور شخصية مختلفة في صورة جماعية واحدة، أو تجميع طقم ملابس كامل من صورة عارض وصورة ملابس وصورة حذاء وحقيبة وقبعة. وعلى مستوى التنفيذ، تُستخدم آلية انتباه مختلطة الدقة: النص يمر عبر قناع سببي على مستوى التوكن (token)، وتوليد الصور يمر عبر قناع على مستوى القطع (chunk)، إضافة إلى إعادة استخدام ذاكرة KV المؤقتة (KV cache)، بحيث تُحسب الصور المرجعية والتعليمات مرة واحدة وتُعاد استخدامها مراراً. ببساطة، إنها طريقة هندسية لكبح مشكلة «كلما زادت الصور، زاد البطء».

الثالث هو تحسين التحرير الموضعي. الآن يمكن رسم دائرة، أو وضع علامات، أو رفع صورة قناع (mask) منفصلة، لتحديد أمر التعديل في منطقة صغيرة بعينها دون المساس ببقية الصورة. كما توسّعت المهام لتشمل الصور البانورامية والإنفوجرافيك ولوحات القصة المصورة (storyboard).

على مكتب مصمم، تعرض الشاشة تحرير صور بالذكاء الاصطناعي وتراكب طبقات شفافة

لكن هذا الإصدار المفتوح يأتي بشرط نادر سابقاً. يستخدم Qwen-Image 2.1 رخصة Qwen Research License، التي تسمح بالبحث والتقييم فقط، بينما يتطلب الاستخدام التجاري تفاوضاً منفصلاً على ترخيص مدفوع. وهذا يختلف عن مسار Apache 2.0 الذي سارت عليه معظم مشاريع علي بابا المفتوحة الأخيرة، كما يبتعد عن النماذج ذات الأوزان المفتوحة المتسامحة كلياً مثل Z-Image وIdeogram 4.0. وبالنسبة للفرق التي تريد استخدامه لتنفيذ أعمال تجارية أو بناء منتجات، فإن الترخيص جدير بأن يُفحص أولاً أكثر من عتبة بطاقة الرسومات.

تركّز تفاعل المجتمع الصيني على مسألة «القدرة على التشغيل». يعمل مجموعة من منشئي المحتوى على بيليبيلي على حزم دمج بنقرة واحدة، تركز على الاستخدام الفوري بعد فك الضغط، وبذاكرة رسومات لا تقل عن 6 جيجابايت، ودعم توليد الصور بالجملة وتحرير الصور، وكثيراً ما يقارن المعلقون في قسم التعليقات بينه وبين الأدوات المدفوعة. لهذه المشاعر خلفية: خلال العامين الماضيين، كانت أفضل نماذج توليد الصور حبيسة واجهات API وجدران الاشتراكات، بينما كانت النماذج القابلة للتشغيل محلياً غالباً أدنى بدرجة. وقد صادف Qwen-Image 2.1 تلك النقطة التقاطعية — حجم صغير، مفتوح المصدر، وتُقارَن نتائجه بالمنافسين المغلقين، فوجدت عبارة «يسحق الأدوات المدفوعة» تربة لنشرها، حتى لو كانت هذه العبارة نفسها تحتاج إلى علامة استفهام.

وبنظرة أكثر موضوعية، لا تكمن قيمة Qwen-Image 2.1 في «سحق» أحد، بل في أنه وضع الصور الشفافة وتحرير الصور المتعددة والتحكم الموضعي — وهي أمور يفعلها المصممون كل يوم — داخل نموذج صغير يمكن تشغيله على بطاقة رسومات استهلاكية. وعند بلوغ مرحلة التسليم الفعلي، ما الذي لا يزال ينقص صورة مولّدة بالذكاء الاصطناعي لتكون قابلة للاستخدام؟ يجب اقتطاع الأشخاص، وتعديل النصوص في المواد، وضبط وضع المنتجات، بحيث لا تتغير النصوص على العبوة ولا شكل الزجاجة تبعاً لذلك. و2.1 يتجه تحديداً نحو هذه «الميل الأخير». أما هل يمكنه فعلاً أن يحل محل بعض الأدوات المدفوعة، فهذا يتوقف على ما يفعله به المستخدمون، لا على ما تقوله العناوين.

على الأقل من زاوية حماس مجتمع المصادر المفتوحة، تبدو الإجابة متفائلة. نموذج صغير بحجم 7B، مع بطاقة بسعة 6 جيجابايت، يجعل «تشغيل نموذج توليد صور قابل للاستخدام محلياً» ينتقل من العناء إلى فك الضغط والنقر المزدوج. وقد يكون تأثير ذلك على المجال كله أطول عمراً من نتيجة تقييم واحدة.

مقالات ذات صلة

عشر صور مرجعية دفعة واحدة: تحرير الصور بالذكاء الاصطناعي ينتقل من اللقطات المفردة إلى التركيبات

تحرير الصورة الواحدة يصنع تنويعات. وتحرير الصور المتعددة يصنع تركيبات. ما الذي يغيّره وجود عشر مراجع دفعة واحدة في طريقة صياغتنا للأوامر وتركيبنا للمشاهد.

الشفافية الأصلية هي الميزة الجديدة الأكثر فائدة بهدوء في صور الذكاء الاصطناعي

الجميع يطلب الواقعية. أما المصممون فيطلبون خلفية شفافة. لماذا يُعد توليد قناة ألفا الأصلية الميزة الهادئة التي تغيّر سير العمل الحقيقي.

Qwen-Image 2.1 من علي بابا يغيّر للتو الحديث حول تراخيص النماذج المفتوحة

المواصفات التقنية مبهرة، لكن الترخيص هو القصة الحقيقية. يتخلى Qwen-Image 2.1 عن Apache 2.0 لصالح ترخيص بحثي، وأصبحت التفاصيل الدقيقة الآن أكثر أهمية من أي وقت مضى.

هل ما زال بإمكانك التمييز بين صورة مولّدة بالذكاء الاصطناعي وصورة حقيقية؟ الجواب الصادق هو لا.

اختفت العلامات الدالة وأصبحت أدوات الكشف غير موثوقة. الجواب الصادق عن اكتشاف صور الذكاء الاصطناعي هو لا، والإصلاح يقع في المنبع، قبل عينيك.