نماذج الصور الصينية تتجه نحو العالمية، وهذا الشهر تغيّرت المحادثة

طوال معظم العامين الماضيين، دار النقاش الغربي حول نماذج الصور الصينية للذكاء الاصطناعي في حلقة بسيطة: نسخ مقلّدة، رقابة، ثم الانتقال إلى غيره. وقد كسرت الأيام الثلاثون الماضية هذه الحلقة، ويظهر التحول في ثلاثة أماكن في آنٍ واحد: اختبارات الأداء، وأقسام التعليقات، والنقاش السياسي في واشنطن.
لحظة اختبارات الأداء
قام Qwen Image 2.1 بالعمل الشاق. ذكر تقرير لـ Tom's Hardware في أواخر سبتمبر أن النموذج مفتوح الأوزان بحجم 7B يتفوق على Nano Banana 2.0 من جوجل في عدة اختبارات أداء، بينما يثبت جدارته أمام أنظمة OpenAI وMeta. حصد موضوع Hacker News حول الإصدار 739 نقطة وما يقرب من 200 تعليق، وهي حركة مرور تليق بأي نموذج رائد، ناهيك عن نموذج يمكنك تنزيله وتشغيله على حاسوب محمول. وتلا ذلك عرض توضيحي على M1 Max خلال أيام: توليد كامل للنص إلى صورة وتحرير، بنحو 24 ثانية لكل مخرج 512x512، دون أي سحابة.
كان موضوع r/singularity الذي التقط المزاج الأوسع بعنوان «نماذج الذكاء الاصطناعي الصينية تتصدر الشعبية عالميًا — وواشنطن قلقة». استُعير العنوان من التغطية الإخبارية، لكن النقاش تحته كان أقل عن الجغرافيا السياسية وأكثر عن تجربة معيشة: أشخاص كانت لديهم افتراضات مسبقة حول النماذج التي تستحق الاختبار، ظلوا يجدون إدخالات صينية في القمة أو قريبًا منها في مقارناتهم الخاصة.
ما تجيده النماذج فعلاً
تتوافق نقاط القوة مع الأدلة المجتمعية. تحرير Qwen هو الميزة التي يعرضها الناس أكثر من غيرها، إذ يولّد أوراق تصميم الشخصيات وتركيبات متعددة المراجع دون حزمة LoRA التي كانت سير العمل تتطلبها سابقًا. كان عرض النص، خصوصًا بالنصوص الصينية واليابانية والكورية (CJK)، ميزة ثابتة لـ Qwen، وهو أمر مهم تجاريًا لأي شخص ينتج تغليفًا أو مواد تسويقية في الأسواق الآسيوية. وتحظى سلسلة Seedream من ByteDance، عائلة النماذج التي تقف خلف Jimeng، بإشادة لتوليد التنسيق العمودي والواقعية الفوتوغرافية، وهي تشغّل أحد أكثر تطبيقات الإنشاء الاستهلاكية استخدامًا في الصين. أصبح Z-Image Turbo النموذج المحلي الخفيف الافتراضي في المجتمعات الغربية تحديدًا لأنه يعمل على وحدات معالجة رسومات متواضعة.
سرعة النقل بحد ذاتها مؤشر. خلال أسبوع من إصدار Qwen، عمل النموذج في TensorSharp مع تكميم GGUF، وفي بيئة تشغيل أصلية لـ Apple Silicon، وفي استوديو بأسلوب Fooocus مع أقنعة ومراجع أوضاع. هذا النوع من تبنّي المنظومة ليس شيئًا يمكن لمورّد أن يشتريه. يحدث عندما يقرر مجتمع من المشرفين أن نموذجًا يستحق عطلات نهايتهم الأسبوعية، وهو أقوى دليل على التبنّي، لأنه يكلف المتبنّين وقتًا حقيقيًا.
تضيف نقاشات المنصات الصينية نسيجًا تفتقده التغذيات الإنجليزية. سير العمل المرتبط بالمهرجانات هو حالة الاستخدام الاستهلاكي السائدة هناك: مع حلول عيد منتصف الخريف واليوم الوطني معًا، يجري تقييم أدوات مثل Doubao وJimeng وTongyi Wanxiang في الوقت الفعلي من قبل ملايين التجار الصغار الذين يصنعون ملصقات ترويجية، مع الفرز المعتاد لأي أداة تتعامل مع الطباعة الصينية، وأيها تتعامل مع صور المنتجات، وأيها تتعامل مع أغلفة الفيديو العمودية. تُعد شروط الاستخدام التجاري نقطة الاحتكاك في تلك الموضوعات، بما يعكس النقاشات التي تخوضها المجتمعات الغربية حول الترخيص. ثمة تفصيل عملي ينتقل جيدًا: تتنافس الأدوات الاستهلاكية الصينية بشدة على الحصص اليومية المجانية، ما يبقي تكلفة الصورة الواحدة قرب الصفر للمستخدمين العابرين وينقل المنافسة إلى سهولة التحرير والتحكم في الأسلوب.
طبقة المنتجات الاستهلاكية متقدمة بطريقة محددة
يجدر القول بوضوح: كانت تطبيقات الاستهلاك الصينية تجري تجربة منتج تجاوزتها الخدمات الغربية في معظمها، وقد نجحت. وضعت Doubao توليد الصور داخل واجهة محادثة مع توليد مجاني غير محدود وتحرير حواري، فيقول المستخدم «اجعل القمر ذهبيًا» بدل إعادة الصياغة من الصفر. وربطت Jimeng التوليد مباشرة بمسار تحرير الفيديو القصير، فيتحول الملصق إلى غلاف فيديو دون تصدير أي شيء. وبنَت Tongyi Wanxiang ميزة العارض الافتراضي لتجار الملابس، وهي تستبدل جلسة التصوير برفع صورة.
كل واحد من هذه تكامل ضيق وغير براق يستهدف مهمة محددة، وكل منها حصد استخدامًا يوميًا أكثر مما حققته العروض الأكثر إبهارًا. كانت الخدمات الغربية تتقارب نحو الأفكار نفسها من الاتجاه المعاكس، تحرير قائم على المحادثة في Gemini، وتوليد داخل حزم الإنتاجية، لكن التطبيقات الصينية أجرت التجربة على نطاق المستهلك أولًا، في سوق يدفع فيه المستخدمون مقابل الراحة لا مقابل الاشتراكات. الدرس لأهل المنتجات في أي مكان: الحصة المجانية مع تكامل محكم في سير عمل موجود تتغلب على نموذج أكبر خلف جدار دفع من أجل التبنّي الجماهيري، وقد ضاقت فجوة الجودة بما يكفي ليصبح التكامل الآن أكثر حسمًا من النموذج نفسه.
التعقيد في واشنطن
تستحق زاوية السياسات عناية أكبر مما يمنحها عنوان رئيسي. أشار تقرير لـ Heise يتداول على HN إلى أن الشركات الألمانية تعتمد بشكل شبه حصري على النماذج الأمريكية، مع استخدام ضئيل للنماذج الصينية، وهو ما يصف أوروبا. كان قلق r/singularity مختلفًا: أن النماذج الصينية مفتوحة الأوزان تفوز بجدارتها في مجتمعات تختار نفسها على أساس التشكك، المجتمعات نفسها التي تفكك اختبارات أداء الموردين كعمل يومي. وعندما يتبنى الجمهور الأكثر تقنية نموذجًا طوعًا، يتوقف تطبيق الخصم المعتاد «إنه مجرد ضجيج».
بالنسبة إلى واشنطن، التوتر بنيوي. تقييد واجهات API المغلقة أمر مباشر؛ أما تقييد الأوزان الموجودة بالفعل على Hugging Face فليس كذلك. النموذج بحجم 7B الذي يحقق نتائج جيدة في اختبارات الأداء هو أيضًا، بحكم بنيته، موجود في كل مكان بالفعل. سيتأخر أي رد سياسي عن منحنى التبنّي بأشهر على الأقل، وتُظهر نقطة البيانات الألمانية أن جانب تبنّي الشركات له تأخره الخاص، إذ يتخلف سنوات عن المجتمع التقني.
ثمة أيضًا زاوية تتعلق بشرعية اختبارات الأداء ستهم في الدورة الإخبارية المقبلة. عندما تدّعي علي بابا أن نموذجها يتفوق على نموذج جوجل، تورد التغطية الغربية ذلك مرفقًا بتحفظات حول اختبارات أداء المورد. هذه التحفظات مناسبة. لكنها تصبح أصعب في الصمود عندما تكون الأوزان مفتوحة ويمكن لأي شخص تشغيل المقارنات. الادعاءات الصادرة عن مختبرات مفتوحة الأوزان يجري التحقق منها أو دحضها أسرع من ادعاءات المختبرات المغلقة، وهي ميزة بنيوية تتراكم.
ما يجب مراقبته تاليًا
هناك ثلاثة مؤشرات تستحق المتابعة. أولًا، هل يحافظ الإصدار التالي من Qwen أو Seedream على مكاسب اختبارات الأداء مع إغلاق الفجوات التي يشير إليها النقاد، خاصة في التركيب المعقد متعدد الموضوعات. ثانيًا، هل تستجيب المنصات الغربية المستضيفة من حيث السعر، لأن نموذجًا محليًا مجانيًا جيدًا بنسبة 90 بالمئة هو حدث تسعيري، وليس تقنيًا فحسب؛ وأول تخفيض سعر مستضاف يُعزى إلى المنافسة المفتوحة سيكون الإشارة. ثالثًا، هل تضيف أسواق التنبؤ فئات للنماذج المفتوحة؛ فالتشكيلة الحالية في Polymarket حول أفضل ذكاء اصطناعي للصور تتابع الموردين المستضيفين فقط، وهو ما يقلل من تقدير المجال بشكل متزايد.
ملاحظة حول طريقة رواية القصة
هناك خطر سردي يستحق التسمية. تأرجحت التغطية للذكاء الاصطناعي الصيني بين الاستخفاف والإنذار، وكلاهما يطمس الصورة الفعلية. قلّل الاستخفاف من هندسة حقيقية، خصوصًا في كفاءة التدريب وتكامل المنتجات الاستهلاكية. وينفخ الإنذار كل اختبار أداء ليصبح حدثًا استراتيجيًا، ما يستدعي بالضبط رد الفعل المبالغ فيه الذي يُقتبس لاحقًا كدليل. لم تأتِ أصح إشارة هذا الشهر من أيٍّ من النمطين: جاءت من مستخدمين يشغّلون مقارناتهم الخاصة، على أجهزتهم الخاصة، ويبلغون عما رأوه. لا يمكن التلاعب بتلك القناة من أي اتجاه، وهي التي تحركت.
تغيّرت المحادثة لأن الأدلة تغيّرت. يصعب تجاهل نموذج يعمل على حاسوب محمول، ويتفوق في اختبارات الأداء، ولا يكلف شيئًا لتجربته، باستخدام قالب قديم. والأشخاص الذين جرّبوه هم من يكتبون القالب الجديد.
مقالات ذات صلة
نماذج الصور بالذكاء الاصطناعي الصينية تكسب معجبين في الخارج، وواشنطن تراقب
التبني تقني أولاً، وسياسي ثانياً. يقوم المطورون بتنزيل ما ينجح، والآن أصبح ذلك بشكل متزايد من مختبرات صينية.
ما الذي تراهن عليه أسواق التنبؤ بشأن صور الذكاء الاصطناعي
أموال حقيقية تراهن على من يفوز في صور الذكاء الاصطناعي. OpenAI تتصدر الصور الثابتة، وMiniMax تتصدر الفيديو، والنماذج المفتوحة هي المتغير المجهول الذي لا يسعّره أحد.
Qwen-Image 2.1 مقابل Nano Banana 2.0: نموذج مفتوح بـ7B يهبط على أعقاب Google
نموذج مفتوح بـ7 مليارات معامل يتقدم الآن على Nano Banana 2.0 من Google في معيار Alibaba وعلى مسافة قريبة في كل مكان آخر.
أسواق التنبؤات تضع أموالاً حقيقية على من يفوز في الذكاء الاصطناعي للصور، والاحتمالات غير متكافئة
أسواق التنبؤات تراهن على من سيفوز في الذكاء الاصطناعي للصور. ما الذي تقيسه الاحتمالات غير المتكافئة فعلاً، وكيف تُقرأ.