تدريب نماذج تحويل النص إلى صورة أصبح أسرع بـ3.6 مرة

تدريب نموذج صور هو لعبة انتظار. تنفق أسابيع وكومة من أموال وحدات معالجة الرسوميات (GPU) لتعليم شبكة تحويل النص إلى صور، ومعظم ذلك الوقت يُنفق في حساب أشياء تبدو وكأنه كان ينبغي أن تكون قابلة لإعادة الاستخدام. ورقة بحثية تتناقل هذا الشهر، من Linum AI، تزعم تحقيق تسريع بـ3.6 مرة في تدريب نماذج تحويل النص إلى صورة، والتقنية التي تقف وراءها تستحق الفهم حتى لو لم تدرّب نموذجاً بنفسك.
يُسمى العمل JIT-DDT، وهو يقع ضمن خط بحثي حول جعل تدريب نماذج الانتشار أكثر كفاءة. نماذج الانتشار، العائلة التي تشغّل معظم مولّدات الصور، تعمل عبر تعلّم عكس عملية إضافة الضوضاء. يتضمن تدريبها تشغيل النموذج مراراً وتكراراً على بيانات أُضيفت إليها الضوضاء تدريجياً، في الاتجاهين الأمامي والخلفي عبر خطوات زمنية عديدة. كثير من ذلك الحساب زائد بطرق ليست واضحة إلا إذا نظرت عن كثب إلى الطريقة التي تقضي بها حلقة التدريب وقتها فعلياً، وهذا بالضبط ما تفعله الورقة.
النتيجة الرئيسية، تدريب أسرع بـ3.6 مرة، تعني أن النموذج نفسه الذي كان يستغرق ثلاثة أسابيع قد يستغرق أسبوعاً واحداً، أو أن الميزانية نفسها يمكنها تدريب نموذج أفضل عبر تشغيل مزيد من التكرارات. في مجال تكون فيه الحوسبة التكلفة الرئيسية وتحدد سرعة التكرار من يفوز، هذا رقم ذو مغزى. فهو يخفض الحاجز أمام المختبرات الأصغر وفرق المصادر المفتوحة، ولهذا اشتعل خيط Hacker News بالطريقة التي فعلها. وجرت التعليقات على النحو المعتاد، من أشخاص متشككين في ظروف القياس إلى أشخاص رأوا التضمين الأوسع فوراً: تدريب أرخص يعني نماذج أكثر، وتجارب أكثر، وحلقة تغذية راجعة أسرع للجميع.
السياق الأوسع هو أن كفاءة التدريب أصبحت حدوداً بحثية بحد ذاتها. قبل بضع سنوات كان الجواب عن «كيف نحصل على نماذج أفضل» دائماً تقريباً «مزيد من الحوسبة»، وهو ما يعني «مزيداً من المال»، وهو ما يعني أن المجال يميل نحو من يستطيع الإنفاق أكثر. الآن يسأل المجال أيضاً: «كيف نحصل على النتيجة نفسها بأقل؟» هذا اقتصادي جزئياً، وبيئي جزئياً، واعتراف جزئي بأن منحنى التوسع لا يمكن أن يكون الرافعة الوحيدة إلى الأبد. في مرحلة ما، تتجاوز تكلفة القوة الغاشمة ما ترغب حتى أكبر المختبرات في دفعه، فتصبح الكفاءة هي الميزة التنافسية.
بالنسبة لتوليد الصور تحديداً، لتحسينات الكفاءة تأثير أكبر من المعتاد. نماذج الصور مكلفة التدريب نسبةً إلى حجمها، لأن الصور عالية الأبعاد وعملية الانتشار تتطلب خطوات كثيرة. كما أنها مكلفة في التشغيل، إذ إن كل طلب مستخدم يطلق عملية توليد جديدة، وأحياناً عدة عمليات بالتوازي. التقنيات التي تسرّع التدريب غالباً لها نظيرات تسرّع الاستدلال، لذا يمكن لاختراق في التدريب أن ينتقل إلى منتجات أسرع وأرخص. العلاقة ليست تلقائية، لكن الرؤى الكامنة، حول أي حسابات يمكن تخطيها أو إعادة استخدامها، تميل إلى الانتقال.
زاوية المصادر المفتوحة مهمة هنا. تسريع التدريب بـ3.6 مرة يفيد أساساً من لم يستطيعوا تحمل التكلفة القديمة، أي جمهور المصادر المفتوحة والشركات الناشئة، لا المختبرات ذات أكبر العناقيد. يمكن للعمالقة استيعاب عدم الكفاءة، فهم يرمون عليها مزيداً من الحوسبة. أما اللاعبون الصغار فلا يستطيعون، لذا كل مكسب في الكفاءة يوسّع ما يمكنهم محاولته. عندما يصبح التدريب أرخص، يستطيع مزيد من الناس بناء نماذجهم الخاصة، ما يغذي اتجاه نماذج الصور المفتوحة وهي تقلص الفجوة مع النماذج المغلقة. أبحاث الكفاءة وموجة النماذج المفتوحة يعزز كل منهما الآخر، ويجعل كل منهما الآخر أكثر إتاحة.
يتصل هذا بالقصص الكبرى الأخرى هذا الشهر. Qwen-Image 2.1، وهو نموذج بـ7 مليارات معلمة يعمل على عتاد استهلاكي، برهان على ما تشتريه الكفاءة. حزم التكامل المتداولة على منصات المبدعين الصينية، ودروس «يعمل على بطاقة 6GB»، كل ذلك يعتمد على افتراض أن نماذج الصور يمكن جعلها صغيرة وسريعة دون فقدان جودة كبيرة. كفاءة التدريب هي النسخة المنبعية من ذلك الافتراض. إذا لم تستطع التدريب بكفاءة، فلن تستطيع تحمل تكرار العمل على النماذج الصغيرة التي ستعمل في كل مكان في نهاية المطاف.
هناك تحفظ يستحق التذكر، وهو نفسه ينطبق على كل ورقة تدريب. التسريع المقاس في إعداد محدد، على عتاد محدد، وببيانات محددة لا ينتقل دائماً بشكل نظيف إلى إعدادات أخرى. الادعاء حقيقي، لكن رقم 3.6 هو نتيجة تهيئة واحدة، وقد تختلف تجربتك اعتماداً على التفاصيل: حجم النموذج، وتوزيع البيانات، والعتاد. هذا ليس رفضاً، بل القراءة المعيارية لنتيجة في تعلّم الآلة، والأشخاص في خيط Hacker News الذين اعترضوا على الرقم الدقيق كانوا يطبقون تلك القراءة بشكل صحيح.
مع ذلك، الاتجاه لا لبس فيه. التدريب يصبح أرخص، ونماذج الصور تصبح أكثر إتاحة، وأكثر المستفيدين هم الذين كانوا مستبعدين بسبب التكلفة. كل ورقة كفاءة، حتى تلك التي تبالغ في أرقامها، تدفع المجال نحو عالم يصبح فيه بناء نموذج صور شيئاً تستطيع فريق صغير تحمل تكلفة تجربته. هذا تغيير هيكلي، وليس نتيجة لمرة واحدة.
تسريع بـ3.6 مرة هو خطوة واحدة، وهو علامة على أن حدود الكفاءة تتحرك بالسرعة نفسها التي تتحرك بها حدود القدرات. بالنسبة لأي شخص يراقب المجال، هذا نوع التقدم الذي يظهر لاحقاً كنموذج يمكنك تشغيله فعلاً، على عتاد تملكه فعلاً، دربه فريق موجود فعلاً. تخطف المعايير العناوين، لكن أوراق الكفاءة هي ما يجعل تلك المعايير ممكنة في المقام الأول.
يستحق أن نفهم، على مستوى أعمق قليلاً، لماذا يكون تدريب الانتشار مهدِراً في الأساس، لأن ذلك هو ما يجعل التسريع ممكناً. يتعلم نموذج الانتشار عبر عرض صور عليه بمقادير متفاوتة من الضوضاء وتعلّم إزالتها. تأخذ حلقة التدريب عينة من مستوى ضوضاء، وتشوّه صورة إلى ذلك المستوى، وتطلب من النموذج توقع النسخة النظيفة، مراراً وتكراراً، عبر مستويات ضوضاء كثيرة. يُنفق كثير من الحساب على إعادة معالجة المعلومات نفسها عند مستويات ضوضاء مختلفة قليلاً، ويُهمَل التمرير الأمامي الذي يضيف الضوضاء بعد كل خطوة. إذا استطعت تجنب إعادة حساب الأجزاء التي لا تتغير، أو إعادة استخدام المعلومات عبر الخطوات، يختفي الهدر ويسرّع التدريب.
هذا هو الشكل العام لمعظم أعمال الكفاءة في الانتشار، وJIT-DDT مدخل واحد في كتالوج متنامٍ من هذه التقنيات. الآلية الدقيقة تقل أهميتها للقارئ العام عن النمط الذي توضحه: مجال كان يعامل الحوسبة يوماً ما كأنها لا نهائية صار يعاملها الآن كشيء يجب الحفاظ عليه، لأنه تبيّن أن الهدر لم يكن ضرورياً قط، بل غير مفحوص فقط. كل ورقة كفاءة هي، بمعنى ما، تذكير بأن التطبيقات المبكرة بُنيت لسرعة التطوير، لا لسرعة التنفيذ، وأن هناك مساحة كبيرة متبقية.
تستحق الزاوية البيئية ذكراً أيضاً، حتى إن لم تكن العنوان الرئيسي. تدريب نموذج صور كبير له تكلفة طاقة حقيقية، وتخفيض بـ3.6 مرة هو تخفيض بـ3.6 مرة في تلك التكلفة، مع تساوي كل العوامل الأخرى. في سنة أصبحت فيها البصمة البيئية للذكاء الاصطناعي جزءاً من النقاش العام، الكفاءة ليست مكسباً اقتصادياً فحسب، بل طريقة لجعل التقنية أكثر استدامة. ليس هذا سبب قيام الباحثين بالعمل، لكنه نتيجة تستحق الملاحظة.
بالنسبة لمن يريد فقط استخدام توليد الصور، لا يتطلب أي من هذا اتخاذ إجراء. تظهر مكاسب الكفاءة بشكل غير مباشر، عبر واجهات برمجة تطبيقات أرخص، ونماذج محلية أسرع، وإصدارات مفتوحة أكثر. لكن فهم من أين تأتي تلك المكاسب يغيّر طريقة قراءتك للأخبار. عندما يعلن مختبر عن نموذج جديد أرخص أو أسرع مما كان متوقعاً، فغالباً لا يكون السبب حيلة ذكية واحدة، بل أبحاث الكفاءة المتراكمة تعمل بهدوء في الخلفية، بالطريقة نفسها التي تكون بها سيارة أسرع عادةً نتيجة مئة تحسين صغير لا اختراق واحد.
مقالات ذات صلة
عشر صور مرجعية دفعة واحدة: تحرير الصور بالذكاء الاصطناعي ينتقل من اللقطات المفردة إلى التركيبات
تحرير الصورة الواحدة يصنع تنويعات. وتحرير الصور المتعددة يصنع تركيبات. ما الذي يغيّره وجود عشر مراجع دفعة واحدة في طريقة صياغتنا للأوامر وتركيبنا للمشاهد.
الشفافية الأصلية هي الميزة الجديدة الأكثر فائدة بهدوء في صور الذكاء الاصطناعي
الجميع يطلب الواقعية. أما المصممون فيطلبون خلفية شفافة. لماذا يُعد توليد قناة ألفا الأصلية الميزة الهادئة التي تغيّر سير العمل الحقيقي.
Qwen-Image 2.1 من علي بابا يغيّر للتو الحديث حول تراخيص النماذج المفتوحة
المواصفات التقنية مبهرة، لكن الترخيص هو القصة الحقيقية. يتخلى Qwen-Image 2.1 عن Apache 2.0 لصالح ترخيص بحثي، وأصبحت التفاصيل الدقيقة الآن أكثر أهمية من أي وقت مضى.
Tongyi Wanxiang Qwen-Image 2.1 مفتوح المصدر: كيف يضع نموذج صغير بحجم 7B الصور الشفافة وتحرير 10 صور في بطاقة رسومات استهلاكية واحدة
نموذج مفتوح المصدر لتوليد الصور بحجم 7B، كيف يضع الصور الشفافة وتحرير صور متعددة داخل بطاقة رسومات بسعة 6 جيجابايت؟ تحليل للترقيات الجوهرية في Qwen-Image 2.1 ومنعطف الترخيص.