FLUX 3 Image: مربعات الإحاطة، إخراج بدقة 4K، والتخطيط كملف إعدادات

أطلقت Black Forest Labs نموذج FLUX 3 Image في 1 أكتوبر، لتكمل بذلك مكوّن الصور في عائلة FLUX 3. وهو متاح عبر واجهة برمجة التطبيقات (API) وPlayground الخاصين بالشركة، مع خصم تعريفي بنسبة 50 بالمئة سارٍ حتى 8 أكتوبر، وإصدار مفتوح الأوزان موعود به خلال الأسابيع المقبلة.
الادعاءات الرئيسية الثلاثة هي الإخراج الأصلي بدقة 4K، والتحكم في التخطيط على مستوى العناصر، والتعديلات الحافظة للمناطق. كل واحد منها يستحق التفكيك، لأن الثالث يؤدي عملًا أكثر مما توحي به المواد التسويقية.
الشبكة تحل محل النص الوصفي
يأخذ FLUX 3 Image مصفوفة JSON من مربعات الإحاطة ملحقة بالوصف النصي (prompt)، معبّرًا عنها على شبكة إحداثيات مُطبّعة من 0 إلى 1000. يحصل كل عنصر على معرّف، ووصف نصي، ومربع بالصيغة [y_min, x_min, y_max, x_max]. ثم يضع النموذج ذلك العنصر داخل ذلك المربع، بصرف النظر عن دقة الإخراج.
هذا هو الجزء الذي بُني حوله الإصدار، وهو تحوّل حقيقي في كيفية تحديد التخطيط. في معظم مسارات العمل من النص إلى الصورة، يُوصف الترتيب المكاني باللغة الطبيعية («زجاجة في الثلث الأيسر، ويد تدخل من اليمين») ويفسّر النموذج ذلك كتفضيل مرن. والنتيجة هي توزيع من المخرجات يقع عادةً في مكان قريب من الوصف، وأحيانًا لا يقع.
تزيل شبكة الإحداثيات خطوة التفسير. لم تعد تصف تخطيطًا وتأمل؛ بل تعلنه. بالنسبة لمصمم يعمل في أداة تخطيط، يتوافق ذلك مع نموذج ذهني موجود. وبالنسبة لمسار عمل يولّد مئات من صور المنتجات التي تحتاج جميعها إلى العارضة في الموضع نفسه، فإنه يحوّل مشكلة جمالية إلى مشكلة إعدادات.
هناك تحذير يرافق أي نظام إحداثيات: المربعات لا تخبر النموذج بما يوضع داخلها، والوصف الذي يحدد الكائن الخطأ سيُرسم بثقة في المكان الخطأ. الدقة في الهندسة لا تنتج تلقائيًا دقة في الدلالة.
دقة 4K دون خطوة التحسين بالتكبير
يولّد FLUX 3 Image أصليًا حتى 5,456 × 3,072 بكسل (حوالي 16.8 ميغابكسل) عبر نسب أبعاد متعددة، دون تمريرة دقة فائقة.
معظم نماذج الصور توقفت أصليًا عند حوالي 1024 إلى 2048 بكسل، مع التعامل مع أي شيء أكبر عبر التكبير اللاحق. هذا مناسب للعرض على الشاشة، لكنه يصبح متعثرًا بشكل متزايد للمطبوعات، وصور التجارة الإلكترونية الرئيسية، وشاشات العرض كبيرة الحجم، حيث تميل خطوة المعالجة اللاحقة إلى إزالة تفاصيل الملمس تحديدًا التي تبرر الدقة.
يغيّر التوليد بدقة 4K أيضًا ما يجب أن يتحقق منه مسار العمل. فالمُكبِّر مرحلة منفصلة لها أنماط فشلها الخاصة، وإزالة مرحلة تزيل فئة كاملة من ضبط الجودة. أما هل يصمد الإخراج الأصلي بالحجم الكامل، بدلًا من مجرد تجنب عيب واضح، فهذا شيء لن يحسمه إلا الاختبار العملي.
تعديلات المناطق وادعاء تطابق البكسلات
الميزة الثالثة هي التحرير الجزئي: إعادة توليد منطقة محددة بمربع إحاطة فقط مع ترك كل ما هو خارجها دون مساس. وتفيد Black Forest Labs بأن 67.8 إلى 89.7 بالمئة من البكسلات تبقى متطابقة بتًا ببت بعد التعديل.
هذا النطاق واسع، واتساعه يحمل معلومة. الطرف الأدنى يعني انزياحًا ذا دلالة عبر المنطقة غير الملموسة؛ والطرف الأعلى قريب من تحرير بقناع حقيقي. ومن المحتمل أن يعتمد موقع تعديل معين على مقدار تقييد المنطقة المُعاد توليدها لمحيطها، فتسرب الإضاءة والظلال وحواف التلامس كلها تخلق ضغطًا لتغيير البكسلات المجاورة من أجل التماسك.
ومع ذلك، فإن نشر رقم لتطابق البكسلات هو بذاته خطوة مفيدة. فقد كانت مشكلة الانزياح في التحرير التكراري للصور الشكوى المركزية ضد التحرير بالانتشار لمدة عامين: كل جولة مراجعة متتالية تُدهور الأجزاء التي كنت راضيًا عنها، حتى تستسلم وتبدأ من جديد. النموذج الذي يحدد كم يحافظ على البكسلات قد أعلن الهدف على الأقل.
يقبل FLUX 3 Image أيضًا ما يصل إلى عشر صور مرجعية في طلب واحد، مع وضع العناصر وفقًا للوصف النصي وتخطيط مربعات الإحاطة. هذا المزيج (مراجع متعددة بالإضافة إلى وضع معلن) هو حيث يبدأ النموذج يبدو أقل كأنه مولّد صور وأكثر كأنه أداة تركيب مع محرك توليد خلفي.
كما تثير عشر مراجع سؤالًا حول الغرض من «المرجع». في معظم مسارات العمل الحالية تعني الصورة المرجعية نقل النمط: أعطِ النموذج مظهرًا فيقاربه. أما وضع كل عنصر مرجعي داخل مربع معلن فهو وعد أضيق وأكثر آليّة. إنه يقول: هذا الكائن، هنا. أما هل يفي النموذج بذلك تحت الضغط (عشر عناصر، لوحة 4K، مربعات متداخلة) فهو نوع الشيء الذي يظهر في الاستخدام الإنتاجي لا في منشور إطلاق.
ملاحظة التدريب الجديرة بالانتباه
مدفونًا في التفاصيل التقنية: دُرّب FLUX 3 Image بمعمارية Self-Flow من Black Forest Labs عبر بيانات الصور والفيديو والصوت بشكل مشترك. وقاعدة FLUX 3 هي نموذج تدفق متعدد الوسائط يغطي الوسائط الثلاث كلها، ونموذج الصور هو أحد أوجهه.
هذا مهم لكيفية قراءة خارطة الطريق. إذا كانت الصور والفيديو والصوت تتشارك أساسًا تدريبيًا واحدًا، فإن وعد «الأوزان المفتوحة خلال أسابيع قليلة» يتجاوز هذا الإصدار، ويتحدث عن عائلة من النماذج ستُبنى على القاعدة نفسها، وعن شركة تضع نفسها كبديل مفتوح الأوزان مقابل المنظومات متعددة الوسائط المغلقة من Google وOpenAI.
وهو يفسر أيضًا الترتيب. أطلقت Black Forest Labs مكوني الفيديو والصوت من FLUX 3 أولًا، ونموذج الصور الثابتة أخيرًا. وبالنسبة لشركة بُني سمعتها على توليد الصور، فإن إطلاق نموذج الصور بعد نموذج الفيديو ترتيب غريب، إلا إذا كان نموذج الصور هو الأصعب في الإتقان على القاعدة المشتركة. وقد تكون عناصر التحكم بمربعات الإحاطة أقل من كونها ميزة وأكثر من كونها حلًا التفافيًا لما يفعله التدريب المشترك عبر ثلاث وسائط بالدقة المكانية الدقيقة.
ما يجب مراقبته
في الوقت الحالي، القراءة العملية أضيق. FLUX 3 Image هو منتج API مدفوع يتضمن عناصر تحكم في التخطيط كانت تتطلب سابقًا خطوة تركيب، ودقة أصلية تُلغي المُكبِّر، وتعديلات مناطق تأتي مع رقم منشور للمطابقة. أما مسألة هل أي من ذلك أفضل من البدائل فهي مسألة قياس أداء، وقياسات الأداء هي ما ستُخصص له الأسابيع القليلة المقبلة من الاختبار المستقل.
هناك ثلاثة أمور تستحق المتابعة بمجرد نزول الأوزان. أولًا، هل تنجو واجهة مربعات الإحاطة من الإصدار المفتوح سليمة أم تصبح ميزة مقصورة على API، وهو ما سيشكل انقسامًا ذا دلالة بين الطبقتين المدفوعة والمجانية. ثانيًا، هل تستطيع التعديلات الدقيقة المجتمعية تحقيق الدقة نفسها في التخطيط على أجهزة أصغر، أم أن سلوك الإحداثيات يعتمد على الحجم. ثالثًا، هل يصمد رقم تطابق البكسلات في إعادة إنتاج مستقلة أم يثبت أنه قياس في أفضل الحالات على تعديلات مواتية.
الإشارة الأوسع هي التي تذكرها ملاحظات الإصدار وكأنها عابرة: انتقلت المنافسة في توليد الصور من مدى إثارة مخرَج واحد إلى ما إذا كان المخرَج المئة يطابق الأول. شبكات التخطيط، والحفاظ على المناطق، ومقاييس تطابق البكسلات، كلها إجابات عن ذلك السؤال. لا شيء منها يصنع صورة جميلة. إنها تصنع صورة قابلة للتكرار.
مقالات ذات صلة
ميتا ترخّص تقنية الصور والفيديو من ميدجورني، والسبب ذو دلالة
تتحرك معايير القياس كل ربع سنة. أما حكم مجتمع على ما يبدو جيدًا فلا.
AssemblyAI تخفض زمن استجابة الكلام في الوقت الفعلي إلى 91 مللي ثانية. إليك لماذا يهم هذا الرقم
القيد على الصوت لم يكن أبدًا معدل خطأ الكلمات. بل كان تبادل الأدوار.
نانو بنانا 2.1 من جوجل إصدار ميزات وليس نموذجاً رائداً
إصدار الطبقة المتوسطة يخبرك بما يعتقد مختبر أن معظم مستخدميه يحتاجونه فعلاً، وهو إشارة أكثر فائدة من إصدار رائد.
طبقة إعلانات الفيديو انقسمت إلى متخصصين، وBoreal-H3 يوضح السبب
الجودة السينمائية وسرعة التكرار منتجان مختلفان، ولا يمكن لطبقة توليد واحدة أن تتصدر في كليهما.