← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

أربع خطوات بدلًا من أربعين: كيف يضغط التقطير نماذج الصور المفتوحة إلى بطاقات الرسوميات الاستهلاكية

نُشر في 6 أكتوبر 2026
أربع خطوات بدلًا من أربعين: كيف يضغط التقطير نماذج الصور المفتوحة إلى بطاقات الرسوميات الاستهلاكية

تتقلّص منذ أشهر الفجوة بين نموذج صور مفتوح قوي وبطاقة رسوميات استهلاكية. والآلية هي تقليل خطوات إزالة الضوضاء. فالنموذج الذي كان يحتاج يومًا إلى أربعين تمريرة لتحويل الضوضاء إلى صورة يمكنه الآن الوصول إلى ذلك في أربع خطوات، أو ست، أو ثمانٍ، إذا أضفت المحول المناسب.

ثمة إصداران في مطلع أكتوبر حرّكا هذا الحدّ مجددًا من اتجاهين متعاكسين: ورقة بحثية تعيد التفكير في كيفية تدريب التقطير، ومحول LoRA إنتاجي يطبّق الفكرة على نموذج مفتوح واسع الاستخدام.

DMAD يحوّل مطابقة التوزيع إلى مسألة تصنيف

الورقة البحثية هي DMAD، اختصارًا لـ Distribution Matching as Adversarial Distillation (مطابقة التوزيع كتقطير تخاصمي)، من باحثين في جامعة تكساس إيه آند إم وبايت دانس. صارت متاحة علنًا لأول مرة في 1 أكتوبر، وتعالج تكلفة معروفة في التقطير.

الوصفة القياسية تعمل هكذا. يولّد نموذج المعلّم عينات عالية الجودة عبر خطوات كثيرة. ويتعيّن على نموذج الطالب تقريب التوزيع نفسه في خطوة إلى أربع خطوات. لتوجيه الطالب، تدرّب نموذج انتشار مساعدًا يظل يلائم التوزيع الحالي للطالب، ثم تستخدم الفرق بين درجة المعلّم ودرجة الطالب لتحديث الطالب. المشكلة أن الطالب يظل يتغير، لذا على النموذج المساعد أن يظل يطارده. فتتصاعد الذاكرة والحوسبة.

يعيد DMAD كتابة الهدف كتصنيف. على عمود فقري مشترك للميزات يوجد رأسان للمُميّز. أحدهما يفصل البيانات الحقيقية عن عينات الطالب. والآخر يفصل عينات المعلّم عن عينات الطالب. في الظروف المثلى، تقابل درجة مخرجات المُميّز نسبة كثافة لوغاريتمية، ما يعني أن الطالب يستطيع التحديث وفق هدف خطي مشتق من درجة المُميّز. ولا حاجة إلى نموذج درجة مساعد منفصل.

المكوّن الثاني هو إشراف يعتمد على مستوى الضوضاء. يكون المعلّم قريبًا من التوزيع الحقيقي عند مستويات ضوضاء معينة، ومبتعدًا بوضوح عند مستويات أخرى. يقيس DMAD فرق الدرجة التجريبي بين العينات الحقيقية وعينات المعلّم باستخدام رأس المُميّز الأول، ثم يعيد ترجيح تدريب الطالب وفقًا لذلك، بحيث يرث الطالب قدرًا أقل من تحيّز المعلّم عند مستويات الضوضاء التي يكون فيها المعلّم أضعف. وهذا يحوّل افتراض «المعلّم على حق دائمًا» إلى شيء قابل للقياس.

تمتد النتائج عبر ثلاثة مستويات. في تدريب تصنيف الصور على ImageNet، بلغ التوليد بخطوة واحدة وبدقة 64×64 قيمة FID قدرها 1.04. يقيس FID مدى اختلاف التوزيع المولَّد عن التوزيع الحقيقي، والأقل أفضل.

النسخة الإنتاجية تُشحن بالفعل

تصل الفكرة نفسها إلى المستخدمين عبر محولات LoRA لا عبر الأوراق البحثية. نشرت Alibaba PAI نموذج Qwen-Image-2.1-Fun-Acc-LoRAs على Hugging Face، مطبّقة تقطير فك الترميز المتوازي لخفض الاستدلال من 40 تقييمًا داليًا عصبيًا للمعلّم إلى 4، لكل من تحويل النص إلى صورة والتحرير القائم على التعليمات. المحول برتبة 64 مع ألفا الشبكة 64 بصيغة BF16، وبطاقة النموذج توفّر نصوص بدء سريعة لكل من Diffusers وVideoX-Fun.

تتسم بطاقة النموذج بالصراحة بشأن المقايضات. يتدهور النص الصغير الكثيف مقارنة بالمعلّم، وتخرج تعديلات الصور أكثر ضبابية أو قتامة قليلًا. بالنسبة لملصق يحوي فقرة من الحروف الدقيقة، ليست أربع خطوات الأداة المناسبة. أما الصور بمقاسات وسائل التواصل حيث يكون النص قصيرًا وكبيرًا، فهي مناسبة.

ثمة محول ثانٍ يذهب أبعد في الجودة. Qwen-Image-2.1 Turbo v0.2.1 هو LoRA برتبة 128 وست خطوات بحجم نحو 648 ميغابايت، يضغط معادلة ODE الطويلة لتدفق الاحتمالات في نموذج مطابقة التدفق الأساسي إلى جدول سيغما يمتد من 1.0 إلى 0.25. ست خطوات إعداد وسط: تمريرات كافية للحفاظ على التفاصيل، وقليلة بما يكفي للبقاء سريعًا.

تكمّل تقطيرات المجتمع بقية السلّم. يستهدف محول Viggle turbo أربع خطوات. وتستهدف محولات PrunaAI خمس أو ثماني خطوات. وكلاهما صريح في كونهما قيد التطوير، وتقول ملاحظات Pruna إن نسخة الخطوات المنخفضة لا تضاهي النموذج الأساسي بعد في التركيب متعدد المراجع، وتبديل الوجوه، والتعديلات ذات القيود المتعددة.

سلك Krea 2 Turbo مسارًا مختلفًا في الترخيص. صارت محولات التقطير بخطوتين وأربع خطوات لديه تُشحن مع مسارات عمل ComfyUI بترخيص Apache-2.0 لـ Comfy Cloud، وComfyUI المحلي، وApple MLX، مع تبديل تلقائي للخطوات. وترخيص Apache-2.0 على طبقة مسارات العمل يهم أي شخص يريد بناء منتج فوقها دون مراجعة قانونية.

ما الذي يتغير فعليًا لمن يشغّل هذا

الأثر العملي هو أن العتاد نفسه ينتج صورًا أكثر، وأن الإعدادات المهمة تتغير. توصي نقاشات المجتمع الخاصة بـ Qwen 2.1 بقيمة CFG من 2.0 إلى 3.0 و40 خطوة عند تحميل LoRA، إلى جانب VAE لإصلاح الملمس بحجم نحو 676 ميغابايت. ويذكر آخرون أن سير العمل القياسي عند 2.0 ميغابكسل ودون LoRA صار ينتج جودة عرض قلّما بلغتها نماذج مفتوحة سابقة.

القراءة الصادقة هي أن التقطير منخفض الخطوات مقايضة، وليس غداءً مجانيًا. فدقة النص، ودقة التحرير، واتساق المراجع المتعددة هي أول ما يتضرر، لأنها المهام التي تحتاج إلى أكبر عدد من التمريرات لتُحل. أما الالتزام بالوصف النصي لموضوع واحد واضح فيصمد جيدًا.

ورقة خضراء واحدة تظهر أربع مرات على التوالي مع تزايد حبيبات الفيلم والضوضاء

يشير ذلك إلى سير عمل لا إلى إعداد واحد. ارسم مسودة بأربع خطوات، واختر التركيب الذي تريده، ثم أعد عرض الإطار المختار بعدد الخطوات الكامل. فمحولات التقطير تجعل الاستكشاف رخيصًا وتترك التمريرة النهائية بجودة كاملة.

ما تضيفه الأبحاث بعد المحولات

ملفات LoRA التي ينزّلها المستخدمون هي الطرف المرئي من هذا العمل، لكن ورقة DMAD تشرح لماذا ينبغي أن تكون أجيال المحولات التالية أفضل. احتاجت الوصفة القديمة إلى نموذج مساعد نشط لتتبع توزيع الطالب المتغير، وكانت تلك الكلفة الإضافية تنمو مع كل خطوة تدريب. وإعادة صياغة الهدف كزوج من المُميّزات تلغي النموذج المساعد، ما يعني أن ميزانية GPU نفسها يمكنها تدريب طالب أقوى.

فكرة إعادة الترجيح هي المساهمة الأكثر دوامًا. فمعاملة المعلّم كأنه صحيح بشكل موحّد هي الافتراض الذي يحدّ من مدى جودة طالب مقطّر، لأن الطالب المدرّب مقابل أسوأ لحظات المعلّم يرث تلك الأخطاء. وقياس المواضع التي ينحرف فيها المعلّم عن البيانات الحقيقية وخفض وزن تلك المناطق تقنية عامة، وينبغي أن تنتقل إلى تقطير الفيديو والصوت وأي نمط توليدي آخر يُستخدم فيه التقطير لخفض كلفة الاستدلال.

كيف تقرر ما إذا كان محول مقطّر كافيًا

يتوقف القرار على نوع المهمة. تتعامل المحولات منخفضة الخطوات جيدًا مع تركيبات ذات موضوع واحد، وإضاءة واضحة، وتنسيق كبير. لكنها تعاني مع أي شيء يحتاج إلى تمريرات كثيرة ليُحل: فقرات من النص الصغير، والطباعة الدقيقة، والتعديلات التي يجب أن تحافظ على الهوية عبر مراجع متعددة، والتعليمات التي تكدّس عدة قيود دفعة واحدة. وهذه تحديدًا هي الحالات التي تحذّر منها بطاقات النموذج، والتحذيرات متسقة بين المورّدين.

الترخيص هو المتغير الآخر. تحمل بعض هذه المحولات شروطًا بحثية أو مقيّدة بأوجه أخرى، ومسألة الاستخدام التجاري لا تكون دائمًا محسومة على بطاقة النموذج. يصنّف إصدار Alibaba PAI ترخيصه كـ «other» دون ذكر شروط تجارية، ما يعني أن الفريق الذي ينشره في منتج عليه عمل تحضيري قبل الشحن. ومسارات عمل Krea بترخيص Apache-2.0 هي الاستثناء، ومن المرجح أن يهم هذا التسامح أي شخص يبني خدمة تجارية فوقها.

اتجاه المسار واضح. تُضغط نماذج الصور المفتوحة لتستوعبها الأجهزة التي يملكها الناس بالفعل، ويحدث الضغط علنًا، مع الأوزان وبطاقات النموذج والقيود المعلنة. وهذا الانفتاح مفيد بحد ذاته، لأنه يتيح للمشتري الحكم على المقايضات قبل الالتزام. ويمكن لمورّد مغلق أن يخفض الجودة في تحديث ويسميه تحسينًا في السرعة. أما محول منشور مع بطاقة نموذج تسمّي نقاط ضعفه فلا يستطيع ذلك.

ملاحظة حول ما ينبغي قياسه

يسهل المبالغة في ادعاءات السرعة في هذا المجال، لأن عدد الخطوات ليس سوى مدخل واحد إلى زمن الاستجابة. فالدقة، وحجم الدفعة، والمنقّي (sampler)، وعدد الصور المولّدة لكل وصف نصي، كلها تغيّر الزمن الفعلي أكثر بكثير مما يوحي به عدد الخطوات المعلن. وقد يكون محول بأربع خطوات عند دقة عالية على بطاقة متوسطة المدى أبطأ من تشغيل بأربعين خطوة عند دقة مسودة على العتاد نفسه.

المقارنة التي تهم المشتري هي عدد الصور في الدقيقة بالجودة التي يحتاجها فعلًا، على العتاد الذي يملكه فعلًا. ونادرًا ما تذكر بطاقات النموذج ذلك الرقم، لذا يجب قياسه محليًا. والمحولات تجعل القياس رخيصًا، وهذه هي الفائدة الحقيقية. فأربع خطوات سريعة بما يكفي لتشغيل التجربة التي تخبرك ما إذا كانت أربع خطوات كافية.

ما يجب متابعته لاحقًا

تشير المحولات والورقة البحثية في الاتجاه نفسه. تظل كلفة الاستدلال لنماذج الصور المفتوحة تنخفض، وكل تقطير جديد يضيّق الفجوة بين بطاقة استهلاكية ومسرّع مستأجر. والسؤال الجدير بالمتابعة هو ما إذا كانت الجولة التالية من المحولات تسدّ فجوة عرض النص ودقة المراجع، أم أن تلك الحدود تبيّن أنها مدمجة في توليد الخطوات المنخفضة نفسه. وإلى أن يُحسم ذلك، فالموقف السليم هو التعامل مع عدد الخطوات كمِقبض واحد بين عدة مقابض، وقياس عدد الصور في الدقيقة على العتاد الذي تملكه فعلًا.

مقالات ذات صلة