في سبتمبر، تتوالى الإطلاقات المحلية مفتوحة المصدر لنماذج توليد الصور: سنس تايم وآنت وشوشينغ لم يعودوا قادرين على التزام الهدوء

في سبتمبر الذي مضى للتو، شهد مجال توليد الصور بالذكاء الاصطناعي المحلي تغييرًا قد لا يلفت النظر كثيرًا لكنه بالغ الأهمية: المصدر المفتوح. خلال أسبوع واحد فقط، أطلقت سنس تايم وشركة آنت وفريق شوشينغ من مختبر شنغهاي للذكاء الاصطناعي نماذج مفتوحة المصدر لتوليد الصور تباعًا، واضعةً على الطاولة قدرات كانت حتى الآن حكرًا على الشركات الكبرى ذات النماذج المغلقة. قد يكون أثر ذلك أكبر بكثير من إطلاق أي نموذج جديد بعينه.
ماذا تقدم كل جهة من الجهات الثلاث؟
سنس تايم SenseNova U1.5 Lite، أصبح مفتوح المصدر في 8 سبتمبر، وهو نموذج لتوليد الصور بحجم 8B. نقطة بيعه الرئيسية هي الإخراج المباشر بدقة 4K، والوصف الرسمي أنه «يضاهي النماذج المغلقة الكبيرة». حجم 8B بالغ الأهمية؛ فهو يعني أن بطاقات الرسوميات المتوفرة لدى المطورين العاديين قادرة على تشغيله، دون الحاجة إلى التوجه مباشرة نحو ذاكرة فيديو 12G أو 24G.
نموذج الصور الموحد 6B من آنت، أصبح مفتوح المصدر في 6 سبتمبر. يسلك نهجًا أكثر «توفيرًا للجهد»: دمج التوليد من النص وتحرير الصور بالأوامر في نموذج واحد. بمعنى آخر، يمكنك إما أن تطلب منه رسم صورة من الصفر، أو أن تعطيه صورة وتطلب «تغيير الخلفية» أو «زيادة سطوع الألوان»، دون الحاجة إلى التبديل بين نموذجين. والأكثر ندرة أن آنت كشفت أيضًا عن وصفة التدريب كاملة. فالنماذج مفتوحة المصدر كثيرة، لكن من يكشف تفاصيل التدريب قليلون.
شوشينغ InternLumina-U2، صدر في 3 سبتمبر، وهو نموذج رؤية كبير يركز على توحيد فهم الصور وتوليدها، وستكون أوزانه مفتوحة. يتموضع أقرب إلى «نموذج واحد يفهم الصور ويستطيع رسمها أيضًا»، وهذا يمنحه أفضلية على نماذج التوليد الخالص في السيناريوهات التي تتطلب أن يفهم النموذج صورة مرجعية أولًا ثم يعدلها بناءً عليها.

لماذا يستحق المصدر المفتوح الحديث عنه على حدة؟
قد يظن كثيرون أن النماذج مفتوحة المصدر بعيدة عن المستخدم العادي، فهم لا يدربون النماذج على أي حال. لكن سلسلة التأثير الحقيقية هي كالتالي: النماذج مفتوحة المصدر ستصبح الأساس الذي تُبنى عليه أدوات مجانية متنوعة.
مطور مستقل أو فريق صغير لا يملك المال لشراء واجهات API من الشركات الكبرى، ويريد إضافة ميزة توليد الصور إلى منتجه، فماذا يفعل؟ الإجابة هي سحب نموذج مفتوح المصدر من Hugging Face وتشغيله محليًا أو على وحدة معالجة رسوميات مستأجرة رخيصة. أحجام مثل 8B من سنس تايم و 6B من آنت تقع في النطاق الذي «يمكن حشره في جهاز استهلاكي» تمامًا. كلما زادت النماذج مفتوحة المصدر وصغُرت وقويت، زادت حلول توليد الصور المجانية التي يستطيع الأشخاص العاديون بناؤها.
من الزاوية المقابلة، يمثل هذا أيضًا استجابة من النماذج المحلية لمسارات المصدر المفتوح العريقة مثل Stable Diffusion و Flux. في الماضي، عندما يُذكر توليد الصور مفتوح المصدر، كان الخيار الافتراضي هو منظومة Stable Diffusion. الآن بدأ اللاعبون المحليون ينضمون إلى الساحة، حاملين مزايا محلية مثل فهم اللغة الصينية وعرض الخطوط الصينية، وهذا يمثل إضافة حقيقية للمستخدمين الناطقين بالصينية.
بعد المصدر المفتوح، ما هو ميدان المنافسة؟
المصدر المفتوح ليس نقطة النهاية، بل نقطة البداية. فمجرد فتح نموذج مصدره لا يعني أنه سيُستخدم فعلًا؛ إذ يتوقف ذلك على ثلاثة أمور.
الأول هو المنظومة (Ecosystem). الأوزان وحدها لا تكفي؛ يجب أن تتوفر أدوات استدلال مرافقة، وسكربتات تدريب LoRA، ودعم واجهات WebUI. سبب بقاء Stable Diffusion خيارًا افتراضيًا للكثيرين حتى اليوم ليس إصدارًا بعينه، بل سلسلة الأدوات الكبيرة التي تقف خلفه.
الثاني هو القدرة على اللغة الصينية. أكبر تمييز للنماذج المحلية يكمن في فهم التوجيهات النصية الصينية وعرض النصوص الصينية داخل الصور. هذا مجال لم تتقنه النماذج الأجنبية مفتوحة المصدر منذ وقت طويل، وهو أيضًا أكثر ما ينبغي أن تتمسك به النماذج المحلية مفتوحة المصدر.
الثالث هو مسار التحول التجاري. كيف تجني النماذج مفتوحة المصدر المال؟ لطالما كان هذا لغزًا صعبًا. لاعبون مثل سنس تايم وآنت وشوشينغ لا يفتحون المصدر على الأرجح بدافع العمل الخيري، بل يريدون من خلال المصدر المفتوح تنمية المنظومة، ثم تحقيق الإيرادات لاحقًا عبر خدمات الشركات وواجهات API السحابية والتخصيص. بالنسبة للمستخدمين، يعني ذلك أن الأشياء المجانية ستزداد أكثر فأكثر، لكن ما إذا كان «المجاني» مرادفًا لـ «الصيانة المستمرة» أم لا، فهذا ما يجب مراقبته مع الوقت.
هناك خلفية أخرى تستحق الإضافة: موجة المصدر المفتوح هذه جاءت في لحظة يعاني فيها المشهد الأجنبي مفتوح المصدر من فترة انتقالية. لم يشهد Stable Diffusion تحديثًا كبيرًا حقيقيًا منذ فترة طويلة، كما أن Flux لم تصدر أوزانها مفتوحة المصدر بالكامل حتى الآن. في هذه الأثناء، أطلقت النماذج المحلية أحجامًا مثل 6B و 8B التي «يمكن وضعها في جهاز منزلي»، وهو ما يعني أنها وضعت أساس توليد الصور الصيني مفتوح المصدر بينما يلتقط الآخرون أنفاسهم.
المعنى العملي للمبدعين العاديين
بالنسبة للأشخاص العاديين، التغيير الذي تجلبه هذه النماذج مفتوحة المصدر هو أن تكلفة توليد الصور ما زالت تواصل الانخفاض.
في السابق، إذا أردت استخدام توليد الصور بالذكاء الاصطناعي بشكل ثابت لإنجاز عمل جاد، كان عليك إما الاشتراك في أداة، أو الدفع حسب عدد الصور عبر واجهة API. بعد ازدياد النماذج مفتوحة المصدر، ظهرت مجموعة من الحلول المجانية التي تعمل محليًا. ورغم أن هذه الحلول تنطوي عمومًا على عتبة دخول، تتطلب تثبيت البيئة وضبط المعاملات، إلا أن المجتمع يعمل على تذليل هذه العتبة شيئًا فشيئًا.
تقديري أنه على المدى القصير، سيظل استخدام الأدوات عبر الويب هو الخيار الأكثر راحة للمبدعين العاديين. لكن إذا كنت تعمل على منتج صغير أو تطبيق صغير وتحتاج إلى تضمين قدرة توليد الصور فيه، فإن كثافة هذه الموجة من النماذج مفتوحة المصدر وأحجامها تستحق منك إعادة النظر. على الأقل، المقولة السابقة «لا توجد نماذج محلية جيدة لتوليد الصور مفتوحة المصدر» لم تعد صحيحة منذ سبتمبر.
مقالات ذات صلة
تينسنت هونيوان تُدخل توليد الصور بالذكاء الاصطناعي إلى مواقع تصوير الأفلام والدراما: تجربة HyImage 3.5 Preview
تحسن HyImage 3.5 preview بنحو 30% في الاختبار الأعمى، ويدعم 5 صور مرجعية وإخراج 2K، وقد دُمج في WorkRally وخاض تجربة فعلية في «شينغ بياو»؛ يستعرض المقال قدراته وطرق استخدامه.
أفضل مولدات الصور بالذكاء الاصطناعي في سبتمبر 2026، مصنفة
GPT Image 2.5 وMidjourney V8.2 وNano Banana 2 وFLUX.2 وغيرها، مصنفة مع الأسعار واختيارات حسب المهمة.
نموذج مايكروسوفت MAI-Image-2.6 يقترب بهدوء من GPT Image 2
قلّص منافس مايكروسوفت الفارق في Elo إلى 21 نقطة. ما الذي يعنيه صعود MAI-Image-2.6 لسوق صور الذكاء الاصطناعي.
التكلفة الحقيقية لصور الذكاء الاصطناعي في 2026: من سنت واحد إلى 48 سنتاً
من سنت واحد إلى 48 سنتاً للصورة: كيف تحكم على التكلفة لكل أصل معتمد بدل كل توليد.