← العودة إلى المدونة
Ai1 دقيقة

الشفافية الأصلية هي الميزة الجديدة الأكثر فائدة بهدوء في صور الذكاء الاصطناعي

نُشر في 27 سبتمبر 2026
الشفافية الأصلية هي الميزة الجديدة الأكثر فائدة بهدوء في صور الذكاء الاصطناعي

اسأل أي شخص عما يريده من مُولّد صور بالذكاء الاصطناعي وسيقول الواقعية أو الأسلوب أو السرعة. لكن اسأل مصممًا يسلّم أعمالًا فعلًا وستحصل على إجابة مختلفة: خلفية شفافة.

هذه الميزة المتواضعة، قناة ألفا، ظلت ثغرة في نماذج صور الذكاء الاصطناعي منذ البداية. معظم المولدات تنتج مستطيلًا مسطحًا. للحصول على شعار، أو قصاصة منتج، أو عنصر يمكن إدراجه فوق تصميم آخر، كان عليك تمرير الصورة عبر مزيل خلفية لاحقًا، وهي خطوة منفصلة لها عيوبها ومشكلاتها على الحواف. كان المزيل يقضم حواف الشعر، أو يلطخ المواد شبه الشفافة، أو يترك هالة من الخلفية القديمة. ثم كنت تصلح ذلك يدويًا. كان هذا نوعًا من الاحتكاك الذي جعل توليد صور الذكاء الاصطناعي يبدو كأداة لعب للصور النهائية بدلًا من أداة للعمل الحقيقي.

يسدّ Qwen-Image 2.1 هذه الفجوة عبر بناء الشفافية داخل النموذج نفسه. يمكن لأمر نصي واحد أن يطلب صورة عادية أو صورة RGBA بقناة ألفا حقيقية. لا نموذج منفصل، ولا خطوة معالجة لاحقة. يبدو ذلك بسيطًا حتى تفكر في مقدار العمل التصميمي الحقيقي الذي يقوم على تكديس عناصر فوق عناصر أخرى. الصورة الشفافة لبنة بناء. أما المستطيل المسطح فطريق مسدود.

كانت علي بابا قد أطلقت بالفعل نموذجًا مخصصًا للشفافية قبل ذلك، هو Qwen-Image-Layered، في ديسمبر 2025. تكمن أهمية 2.1 في أنه يدمج هذه القدرة داخل النموذج الموحّد للتوليد والتحرير. أصبح من الممكن الآن تحرير الطبقات الشفافة مباشرة. غيّر تعبير شخصية مع إبقاء الخلفية صافية. استبدل النص المضمّن في طبقة شفافة. اقتطع العنصر من صورة فوتوغرافية حقيقية كقصاصة RGBA يمكنك وضعها في أي مكان. النموذج لا يولّد الشفافية فحسب، بل يحافظ عليها عبر التعديلات، وهذا هو الجزء المهم فعليًا لسير العمل.

لوحة زجاجية عائمة على خلفية رقعة شطرنج شفافة، توضح شفافية أصلية في صور الذكاء الاصطناعي

حالات الاستخدام فورية. يحتاج بائعو التجارة الإلكترونية إلى صور منتجات على خلفيات نظيفة يمكنهم تركيبها في اللافتات والقوائم. يحتاج مصممو واجهات المستخدم إلى أيقونات ورسوم بلا خلفيات. يحتاج مطورو الألعاب إلى أصول رسومية بحواف نظيفة. يحتاج منشئو المحتوى إلى عناصر لإدراجها في الصور المصغرة والأغلفة والتراكبات. كل هذه الأمور كانت تتطلب سابقًا سلسلة من الأدوات: المولّد، ثم المزيل، ثم التنظيف، ثم التركيب. مع الشفافية الأصلية، يسلمك المولّد الطبقة جاهزة للاستخدام، وتتخطى الخطوات الوسيطة.

هناك تحول أعمق هنا بشأن ما الذي تصبح عليه نماذج الصور. كانت الموجة الأولى تدور حول إنتاج صورة واحدة مكتفية بذاتها، عصر «واو، انظر ماذا أنتج». أما الموجة التالية فتتعلق بإنتاج أصول تنسجم مع سير العمل، عصر «انظر ماذا يمكنني أن أفعل بهذا». الشفافية والتحرير وتركيب صور متعددة تشير كلها إلى الاتجاه نفسه: يتوقف النموذج عن كونه آلة بيع للصور النهائية ويبدأ كأداة تسلمك مادة خام يمكنك دمجها.

وهذا مهم للطريقة التي يحكم بها الناس على نماذج الصور. تقيس درجات المعايير التي تُقتبس في منشورات الإطلاق في الغالب ما إذا كانت الصورة الواحدة تبدو جيدة، أو واقعية، أو النص مقروءًا، أو عدد أصابع اليدين صحيحًا. لكنها لا تقيس ما إذا كانت قناة ألفا نظيفة، أو حواف القصاصة حادة، أو الطبقة الشفافة تنجو من التعديل، أو ما إذا كان النموذج يحترم أجزاء الصورة التي لم تطلب تغييرها. هذه هي الصفات التي يلاحظها المحترف خلال خمس دقائق من الاستخدام الفعلي، ونادرًا ما تظهر في لوحة المتصدرين.

هذا جزء من سبب انقسام الحديث عن صور الذكاء الاصطناعي باستمرار إلى قسمين. هناك الحديث العام عن النماذج والمعايير والاختراقات، وهناك الحديث الخاص بين من يستخدمون هذه الأدوات لكسب عيشهم، عن سير العمل والحواف والطبقات والتحكم. تنتمي الشفافية إلى الحديث الثاني، ولهذا تحصل على تغطية إعلامية ضئيلة رغم أهميتها الكبيرة. إنها ليست جاذبة بصريًا. لا يمكنك التباهى بقناة ألفا في تغريدة كما يمكنك التباهى بتنين واقعي.

بالنسبة لمشهد المصادر المفتوحة، تُعد الشفافية الأصلية في نموذج بسبعة مليارات معامل إشارة أخرى إلى ارتفاع الحد الأدنى. قبل عام كنت تحتاج إلى نموذج متخصص أو واجهة برمجة تطبيقات مدفوعة للحصول على مخرجات شفافة نظيفة. الآن أصبحت ميزة في نموذج يمكنك تشغيله محليًا على وحدة معالجة رسومات متوسطة. الأثر العملي هو أن الفرق الصغيرة والمنشئين الأفراد يحصلون على قدرة كانت ميزة للمؤسسات، وتنخفض تكلفة التجربة في العمل المصمم بالطبقات والقابل للتركيب إلى لا شيء تقريبًا.

لا تزال هناك حدود. توليد الشفافية دقيق وصعب حول التفاصيل الدقيقة، والشعر، والفراء، والدخان، وأي شيء شبه شفاف أو خفيف. يمكن للنموذج إنتاج قصاصة نظيفة لجسم صلب بينما يعاني مع شعر شخصية متطاير. هذه هي الحواف نفسها التي أربكت مزيلات الخلفية، ولم يحلها النموذج بأعجوبة، بل نقلها فقط إلى داخل خطوة التوليد حيث يسهل تحسينها بالتكرار. هذا تقدم، لكنه ليس كمالًا.

يسهل التقليل من قيمة هذه الميزة لأنها غير مرئية. تُعرَّف الخلفية الشفافة بما هو غير موجود فيها، ولا يمكنك الإشارة إلى غياب الخلفية في صورة رئيسية. لكن بالنسبة لمن تتضمن أعمالهم اليومية قص منتج، أو عزل عنصر، أو بناء تركيبة طبقية، فهي الفرق بين نموذج يصنع صورًا ونموذج يصنع أصولًا. هذا هو الترقية المختبئة خلف اختصار غير جذاب، وهي بهدوء أكثر فائدة من معظم الميزات اللافتة المعلنة هذا الشهر.

يجدر التوسع في سبب تأخر وصول الشفافية كل هذا الوقت. قناة ألفا مشكلة محلولة في رسوميات الحاسوب، وقد كانت كذلك لعقود. سبب تخلف نماذج صور الذكاء الاصطناعي عنها ليس أنها صعبة من حيث المبدأ، بل أن النماذج دُرّبت على صور RGB مسطحة مجمعة من الويب، والويب يخزن في الغالب صورًا نهائية، لا ملفات عمل طبقية. ببساطة لا توجد بيانات كثيرة لصور شفافة للتدريب عليها، لأن الناس لا ينشرون ملفات فوتوشوب الخاصة بهم. لذا تعلمت النماذج إنتاج مستطيلات، وكان لا بد من هندسة الشفافية لاحقًا، إما عبر نموذج منفصل أو عبر تنسيق دقيق لبيانات شفافة اصطناعية.

وهذا يفسر لماذا وُجد Qwen-Image-Layered كنموذج منفصل قبل أن يُدمج في النموذج الرئيسي. يتطلب الأمر عملًا حقيقيًا لتعليم نموذج ما معنى «شفاف» أصلًا عندما يكون المفهوم قليل التمثيل في بيانات التدريب، ويتطلب المزيد من العمل لجعل هذا الفهم يصمد أمام التعديل. كون 2.1 يفعل الأمرين في نموذج موحّد بسبعة مليارات معامل يشير إلى أن الفريق استثمر جهدًا جادًا في قدرة لن تصنع أبدًا لوحة متصدرين مبهجة للمعايير.

هذا النوع من الاستثمار إشارة بحد ذاته. عندما يصرف مختبر جهدًا على ميزات سير العمل مثل الشفافية والتحرير المحلي بدلًا من مجرد مطاردة درجات المعايير، فهو يراهن على أن سوق توليد الصور هو للاستخدام المهني، لا لمجرد الطرافة. إنه رهان على أن الأشخاص المهمين هم من يحتاجون إلى تسليم أصل نظيف في موعد نهائي، لا من يريدون توليد صورة رائعة لنشرها مرة واحدة. ما إذا كان هذا الرهان سيؤتي ثماره هو السؤال المركزي لصناعة توليد الصور بأكملها، والشفافية الأصلية من أوضح تعبيرات ذلك.

مقالات ذات صلة

عشر صور مرجعية دفعة واحدة: تحرير الصور بالذكاء الاصطناعي ينتقل من اللقطات المفردة إلى التركيبات

تحرير الصورة الواحدة يصنع تنويعات. وتحرير الصور المتعددة يصنع تركيبات. ما الذي يغيّره وجود عشر مراجع دفعة واحدة في طريقة صياغتنا للأوامر وتركيبنا للمشاهد.

Qwen-Image 2.1 من علي بابا يغيّر للتو الحديث حول تراخيص النماذج المفتوحة

المواصفات التقنية مبهرة، لكن الترخيص هو القصة الحقيقية. يتخلى Qwen-Image 2.1 عن Apache 2.0 لصالح ترخيص بحثي، وأصبحت التفاصيل الدقيقة الآن أكثر أهمية من أي وقت مضى.

Tongyi Wanxiang Qwen-Image 2.1 مفتوح المصدر: كيف يضع نموذج صغير بحجم 7B الصور الشفافة وتحرير 10 صور في بطاقة رسومات استهلاكية واحدة

نموذج مفتوح المصدر لتوليد الصور بحجم 7B، كيف يضع الصور الشفافة وتحرير صور متعددة داخل بطاقة رسومات بسعة 6 جيجابايت؟ تحليل للترقيات الجوهرية في Qwen-Image 2.1 ومنعطف الترخيص.

هل ما زال بإمكانك التمييز بين صورة مولّدة بالذكاء الاصطناعي وصورة حقيقية؟ الجواب الصادق هو لا.

اختفت العلامات الدالة وأصبحت أدوات الكشف غير موثوقة. الجواب الصادق عن اكتشاف صور الذكاء الاصطناعي هو لا، والإصلاح يقع في المنبع، قبل عينيك.