حرب أسعار نماذج الصور في أكتوبر: GPT Image 2.5 ينقسم إلى فئتين

تغيّر شكل تشكيلة صور OpenAI في سبتمبر، واستغرق أثر ذلك على التكلفة بضعة أسابيع ليظهر في المقارنات العامة. صدرت ChatGPT Images 2.5 في 8 سبتمبر كنموذجين API بدلاً من واحد: GPT-Image-2.5 Flare وGPT-Image-2.5 Sunburst.
عرض OpenAI واضح ومباشر. زمن استجابة أقل بنسبة تصل إلى 50 بالمئة، ومخرجات بدقة 2K، وتحرير متعدد الجولات أفضل، والحفاظ على العنصر الرئيسي بشكل أفضل عبر التعديلات. Flare هو الافتراضي السريع. Sunburst هو الفئة الأبطأ والأكثر دقة.
المفاجأة في عمود السعر. يبدأ كل من Flare وSunburst عند 4 أرصدة لكل عملية توليد، مع فئة 4K عند 7. أما GPT Image 2 السابق فيبدأ عند 9. بعبارة أخرى، نموذج OpenAI الأحدث هو أيضاً نموذج OpenAI الأرخص. وهذا يقلب الافتراضي للأعمال الجديدة إلى 2.5.
كيف تفرّق بين Flare وSunburst
القاعدة العملية لفريق الإنتاج بسيطة. استخدم Flare للمسودات والدفعات وكل ما يكفي فيه أول إطار مقبول. استخدم Sunburst عندما يجب أن يحافظ التعديل على وجه أو ملصق أو تخطيط بدقة تامة، ويمكنك تحمّل الانتظار.
مبرر البقاء على GPT Image 2 أضيق مما يبدو. إذا كانت حملة قد اعتُمدت بالفعل على النموذج الأقدم، فإن التبديل في منتصف الحملة يغيّر درجات لون البشرة ووزن الخط والإضاءة بطرق سيلاحظها العميل قبلك. نصيحة الممارسين هي إنهاء الحملة الحالية حيث هي وبدء الحملة التالية على 2.5.
بقية الميدان لم تبقَ ساكنة
أصدرت Tencent نموذج Hy Image 3.5 Preview في 22 سبتمبر. يتولى نموذج واحد عمليات التوليد والتحرير متعدد الجولات معاً. يصل إلى 4096 × 4096، ويقبل 20 صورة مرجعية، وهو مدرج بسعر يقارب 0.024 دولار للصورة عند 1K إلى 2K على واجهة API الدولية لـ Tencent.
كلمة «Preview» تحمل ثقلاً حقيقياً هنا. لا توجد أوزان ولا تقرير تقني. ومعاينة بلا هذين يمكن أن يتغير سلوكها من أسبوع لآخر. اختبرها على API إذا كانت حزمة الـ20 مرجعاً مهمة لسير عملك. لا تبنِ عليها قالباً متكرراً بعد.
أصدر فريق Qwen التابع لـ Alibaba نموذج Qwen-Image-2.1 في 20 سبتمبر: أوزان مفتوحة بحجم 7B، ودقة 2K أصلية، ومخرجات RGBA بقناة ألفا حقيقية، وحتى 10 صور مرجعية. لكن الترخيص أصبح الآن للبحث فقط دون استخدام تجاري. هذا يعني أن وكالة أو علامة تجارية لا يمكنها إصدار مخرجات 2.1 في أعمال مدفوعة وفق شروط الأوزان المفتوحة. إذا سحبت الأوزان متوقعاً الشروط القديمة، فاقرأ الترخيص قبل أن يغادر ملف العميل الجهاز.
نشرت Recraft نموذج V4.1 Flash في 23 سبتمبر ووصفته بأنه «أسرع نموذج صور في السوق». لا دقة معلنة، ولا رقم لزمن الاستجابة، ولا سعر. مصدر واحد، بلا أرقام. تعامل معه كإعلان لا كورقة مواصفات.
لماذا غيّرت شروط الترخيص المعادلة
القصة الهادئة في سبتمبر هي أن البديلين المفتوحين تحركا في اتجاهين متعاكسين بشأن الترخيص، وكلاهما تحرك بطرق تهم أكثر من ترتيب المعايير القياسية.
حافظ Qwen-Image-2.1 على الوعد التقني الذي جعل هذه العائلة شائعة. سبعة مليارات معامل حجم صغير بما يكفي للتشغيل على محطة عمل في الاستوديو، ودقة 2K الأصلية تتجنب خطوة رفع الدقة، ومخرجات RGBA بقناة ألفا حقيقية تعني أن العنصر المولّد يأتي بخلفية شفافة مدمجة بالفعل بدلاً من الحاجة إلى تمريرة قص. وعشر صور مرجعية في توليد واحد سقف مفيد حقاً لأعمال المنتجات، حيث يكون الحفاظ على عنصر متسق عبر مجموعة لقطات هو الجزء الصعب.

ثم أغلق الترخيص الباب التجاري. للبحث فقط، دون استخدام تجاري. بالنسبة لوكالة، يعني ذلك أن شروط الأوزان المفتوحة لا يمكن أن تغطي عملاء مدفوعين. لا تزال الأوزان تعمل، ولا يزال المصمم قادراً على استخدامها للاستكشاف، لكن المخرجات لا يمكن إصدارها وفق تلك الشروط. الممارسون الذين بنوا خط أنابيب حول إصدارات Qwen السابقة، التي كانت أكثر تسامحاً، يقرؤون الآن البنود الدقيقة في ملف سبق أن حمّلوه.
يحمل Hy Image 3.5 Preview من Tencent المشكلة المعاكسة. إنه متاح على API، لذا فإن الاستخدام التجاري مسألة دفع مقابل كل صورة وليس مسألة ترخيص. لكن «Preview» تعني عدم وجود أوزان ولا تقرير تقني، ما يعني أن السلوك قد يتغير من أسبوع لآخر. بناء قالب متكرر عليه، مثل لقطة منتج ثابتة بإعداد إضاءة ثابت، هو رهان على أن النموذج الكامن لن يتغير. اللعب الأكثر أماناً هو اختباره على مهام محددة، والاحتفاظ بالنتائج، ومعاودته عندما تتحول المعاينة إلى إصدار.
المبرر العملي لإبقاء نموذجين جاهزين
الاستنتاج المعقول لأي استوديو هو الإبقاء على فئة سريعة وأخرى دقيقة مهيأتين، ومعرفة المهمة التي يتولاها كل منهما، بدلاً من الاستقرار على فائز واحد.
الفئة السريعة، التي تعني اعتباراً من أكتوبر GPT Image 2.5 Flare أو نموذجاً مكافئاً، تغطي توليد الأفكار ولوحات الإلهام والإطارات الأولية والتنويعات كثيفة العدد. السرعة والتكلفة هما الغالبان، والمخرجات نقطة انطلاق لا عملاً نهائياً.
الفئة الدقيقة تتولى التعديلات التي يجب أن يبقى فيها وجه أو ملصق أو تخطيط دون مساس. هنا يبرر مسار Sunburst الأبطأ نفسه، وهنا يصبح انحراف نموذج سريع أرخص في درجة لون البشرة أو وزن الخط مرئياً للعميل.
الفئة المحلية المفتوحة هي خانة ثالثة، مفيدة عندما يجب أن يعمل سير العمل دون إرسال الأصول إلى API خارجي. مخرجات RGBA من Qwen-Image-2.1 تناسب تلك الخانة جيداً، ما دامت المهمة غير تجارية وفق شروط الأوزان المفتوحة.
قد تبدو ثلاث فئات مهيأة كعبء إضافي. لكنها عملياً عكس ذلك. الفريق الذي يعرف أي نموذج يتولى أي مهمة يتوقف عن إعادة الجدل حول الاختيار في كل موجز، ويتوقف عن اكتشاف منتصف الحملة أن النموذج الذي انتقل إليه يعرض اللون المميز للعلامة بشكل مختلف قليلاً.
ما الذي تقوله لوحة الصدارة وما الذي لا تقوله
لوحات الصدارة من Artificial Analysis، التي جرى تفقدها في 6 أكتوبر، وضعت OpenAI في المراكز الثلاثة الأولى على كل من لوحتي تحويل النص إلى صورة وتحرير الصور. وهذا تقدم أوضح مما كانت الشركة تملكه في أغسطس.
الترتيب | النموذج | تحويل النص إلى صورة | تحرير الصور --- | --- | --- | --- 1 | GPT-Image-2.5 Sunburst | 1425 | 1524 2 | GPT-Image-2.5 Flare | 1398 | 1481 3 | GPT Image 2 | 1383 | 1462 4 | MAI-Image-2.6 (Microsoft) | 1333 | 1428 5 | Nano Banana 2.1 (Google) | 1328 | 1428
الاكتشاف الأكثر فائدة من حيث التكلفة يقع في أسفل القائمة. Nano Banana Pro، عند 2K، يحل في المرتبة 16، تحت Nano Banana 2.1 وبسعر يقارب ربع سعر Pro عند 1K. وتُظهر بطاقة النموذج الخاصة بـ Google أن 2.1 يتفوق على نموذج Pro الأقدم في بعض تقييمات التحرير الداخلية. ويشير مراجعون مستقلون إلى أن Pro لا يزال ينتج صوراً أفضل في بعض الاختبارات العملية.
هذه الفجوة بين الترتيب والواقع هي الجزء الذي يستحق التمسك به. لا يقول ترتيب Arena الكثير عن نقاط القوة التخصصية لنموذج. FLUX 3 Image وMidjourney وIdeogram 4.0 عند أعلى إعداد له إما غائبة عن اللوحات أو منخفضة الترتيب، ومع ذلك لكل منها مجال تتقدم فيه. Ideogram 4.0 Quality مثلاً يحل في المرتبة 20.
ماذا يعني هذا لميزانية الاستوديو
ثلاثة أشياء تغيرت في سبتمبر وتؤثر في كيفية تخطيط الفريق.
لم يعد النموذج الافتراضي للأعمال الجديدة هو الفئة المتميزة. GPT Image 2.5 Flare عند 4 أرصدة يفعل معظم ما كان GPT Image 2 يفعله عند 9، ويفعله أسرع.
أصبحت الأوزان المفتوحة أكثر فائدة وأكثر تقييداً في الوقت نفسه. أوزان Qwen-Image-2.1 بحجم 7B ومخرجاته RGBA مفيدة حقاً لخطوط الأنابيب المحلية، لكن ترخيص البحث فقط يغلق الباب التجاري الذي تركته إصدارات Qwen السابقة مفتوحاً. اقرأ التراخيص قبل البناء عليها، لا بعده.
ولوحة الصدارة نقطة انطلاق، لا حكم نهائي. النموذج الذي يحل في المرتبة 16 على لوحة إجمالية يمكنه مع ذلك التغلب على صاحب المرتبة الأولى في المهمة المحددة التي أمامك. اختبره على موجزاتك الخاصة قبل تحويل خط إنتاج بأكمله إليه.
قصة الشهر هي أن أرخص فئة في توليد الصور المتقدم أصبحت أرخص بشكل ملحوظ، بينما أصبحت شروط الترخيص حول البدائل المفتوحة أكثر تقييداً بشكل ملحوظ. كلا التغييرين يدفع الفرق إلى إعادة فحص الافتراضات التي وضعتها منذ أشهر.
مقالات ذات صلة
ميتا ترخّص تقنية الصور والفيديو من ميدجورني، والسبب ذو دلالة
تتحرك معايير القياس كل ربع سنة. أما حكم مجتمع على ما يبدو جيدًا فلا.
AssemblyAI تخفض زمن استجابة الكلام في الوقت الفعلي إلى 91 مللي ثانية. إليك لماذا يهم هذا الرقم
القيد على الصوت لم يكن أبدًا معدل خطأ الكلمات. بل كان تبادل الأدوار.
نانو بنانا 2.1 من جوجل إصدار ميزات وليس نموذجاً رائداً
إصدار الطبقة المتوسطة يخبرك بما يعتقد مختبر أن معظم مستخدميه يحتاجونه فعلاً، وهو إشارة أكثر فائدة من إصدار رائد.
طبقة إعلانات الفيديو انقسمت إلى متخصصين، وBoreal-H3 يوضح السبب
الجودة السينمائية وسرعة التكرار منتجان مختلفان، ولا يمكن لطبقة توليد واحدة أن تتصدر في كليهما.