توليد الصور مفتوح المصدر يُضغط إلى بطاقة رسومات استهلاكية واحدة: Hunyuan DiT يخفض الحد الأدنى إلى ذاكرة 6G

على مدى العام الماضي، كانت تحديثات توليد الصور من النصوص مفتوحة المصدر تدور أساسًا حول جودة الصورة. من تكون نصوصه أوضح، ومن يكون ضوءه وظلاله أقرب إلى التصوير الفوتوغرافي، يبقى أيامًا أطول على قوائم التصنيف. لكن في شهر أكتوبر هذا، تغيّر الاتجاه قليلًا. لم يعد محور نقاش المجتمع هو «أي صورة أجمل»، بل «هل بطاقة الرسومات التي لديّ قادرة أصلًا على تشغيله أم لا».
حد ذاكرة 6G هذا، تم انتزاعه بصعوبة
في الأخبار التي أعلنها نموذج Tencent Hunyuan النصي لتوليد الصور (Hunyuan DiT) مؤخرًا، كان أكثرها فائدة هو إتاحة «إصدار الذاكرة الصغيرة» مفتوح المصدر. وفقًا للشركة، يمكن تشغيله بذاكرة فيديو سعة 6G. من جرّب توليد الصور مفتوح المصدر يعرف ثقل هذا الرقم: سابقًا، تشغيل مجموعة محترمة من توليد الصور محليًا كان يتطلب 16G ذاكرة فيديو كحد أدنى تقريبًا، و8G بالكاد، أما 6G فكان يُرفض مباشرة.

كما جاءت الخطوات المرافقة معها. هذا الإصدار تمّت مواءمته مع مكتبة Diffusers بما في ذلك إضافات مثل LoRA وControlNet، وأُضيف دعم لواجهة Kohya الرسومية. دور Kohya في المجتمع هو انتزاع «تدريب LoRA الخاص بك» من حاجز سطر الأوامر وتحويله إلى بضع نقرات بالفأرة. ودمجه يعني تمهيد الطريق لجملة «أريد أن يتعلّم النموذج أسلوبي الفني الخاص».
في الوقت نفسه، ترقّى Hunyuan DiT نفسه إلى الإصدار 1.2، والتحسينات التي ذكرتها الشركة تتركّز على ملمس الصورة والتكوين. وهذان بالضبط ما طالما وُجّه إليهما النقد في النماذج مفتوحة المصدر: إذا كثرت التفاصيل تصبح ضبابية، وإذا تعقّد التكوين يتفكّك.
وهناك خبر آخر أسهل في التغاضي عنه، لكنه جوهري: قامت Tencent أيضًا بفتح نموذج الوسم «Hunyuan Captioner» التابع لـ Hunyuan. نموذج الوسم هو الخطوة الأولى في تدريب LoRA؛ إذ عليك أولًا أن تجعل الآلة تفكّك كل صورة إلى جمل وصفية قابلة للقراءة، قبل أن يصبح التدريب ممكنًا. في السابق كانت هذه الخطوة إما تتطلب واجهات مغلقة المصدر، أو بدائل متباينة الجودة. وبعد فتح مصدره، قلّ اعتماد سلسلة التدريب المحلية على خدمة خارجية واحدة.
بعد أن أصبحت النماذج مفتوحة المصدر تعمل، انشغل المجتمع بـ«الإصلاح»
ما حققه Hunyuan هنا يشبه توسيع الطريق، بينما يعمل المجتمع على ترقيع خط آخر. بعد فتح مصدر Qwen-Image 2.1، أثار كمًا كبيرًا من الإبداعات الثانوية، وجاءت معه موجة إصلاحات كثيفة.
من المجموعات الأكثر تمثيلًا: Qwen-Image-2.1-viggle-turbo بحجم 7.26GB، واستدلال من 6 خطوات، وتكميم int8، وغالبًا ما يُستخدم لإنتاج صور تصميم الشخصيات بسرعة، مع VAE إصلاح الملمس بحجم 676MB لتعويض النسيج. وأعلن مؤلف آخر أن Fix v2.0 يزيل طبقة الضجيج والتفاصيل الفوضوية المميزة لـ Qwen، ومن دون تحريك التكوين تقريبًا. وهناك أيضًا إصدار Opinionated بصورة أكثر حدة، لكنه يحرّك الصورة قليلًا، وقد أصدره المؤلف مرفقًا مع مجموعة أخذ العينات res_2m_nc المشتقة من RES4LYF.
قد تبدو هذه الترقيعات تافهة، لكنها تكشف أمرًا واحدًا: عندما يدخل نموذج مفتوح المصدر مرحلة الإنتاج الفعلي، فإن ما يحدد فعلًا مدى صلاحيته للاستخدام غالبًا ليس الإصدار الذي صدر في يوم الإطلاق، بل مدى استعداد المجتمع لكتابة إصلاحات له خلال الأسابيع التالية.
كما ترسّبت في المجتمع بعض المعاملات الجاهزة للنسخ المباشر. أحدهم بعد تحميل LoRA على Qwen 2.1 قدّم نصيحة بأن يكون CFG بين 2.0 و3.0، و40 خطوة، واختيار أخذ العينات res_multistep أو beta. وآخر يشغّل مسار عمل قياسيًا بدقة 2.0MP دون LoRA، وقال إن إصدار Qwen الجديد لنموذج الصور أخرج نكهة Midjourney لم تكن تُرى سابقًا إلا في النماذج مغلقة المصدر.
وفي السرعة أيضًا تقدّم واضح. نقطة حفظ LoRA بتقطير من خطوتين لـ Krea 2 Turbo خفّضت زمن إزالة الضوضاء عند 1024x1024 من 76.4 ثانية إلى 19.3 ثانية، أي نحو أربعة أضعاف. الثمن أن جودة التفاصيل بقيت بين 0.97 و1.09 مرة من النموذج المعلّم، وهو أفضل بكثير من 0.40 إلى 0.65 مرة لخطوتي Turbo الأصلية، لكنه يبدع في الصور القريبة/التفصيلية، ولا يزال أقل إقناعًا في المشاهد الواسعة.
تلك الفجوات الصغيرة التي سُدّت أيضًا بالمناسبة
إلى جانب النماذج الرئيسية، هناك أيضًا عدة نماذج مفتوحة المصدر صغيرة الانتشار لكن سمعتها مستقرة تسدّ نقاط ضعفها ببطء. يُستخدم Aesthetic v1.1 وOne Obsession v4 من Anima غالبًا في الإنتاج ذي الطابع الأسلوبي، ويمتدح المستخدمون التزامه بالأسلوب وسهولة كتابة المطالبات فيه؛ فبعد تثبيت البذرة وتغيير المطالبة يمكن الحصول على تنويعات متسقة، كما يمكنه عرض نصوص قصيرة. ونقاط ضعفه صريحة أيضًا: ما زال يعاني مع عدة شخصيات في الإطار الواحد والنصوص الطويلة، والمجتمع ينتظر Anima 2.
أما في Krea 2، فتركّزت الشكاوى على أن «البذور المختلفة تبدو متشابهة»، فاستكشف بعضهم طريقة دون إضافة LoRA ودون تثبيت عُقد خاصة بالنموذج: إعادة استخدام مُشفّر النصوص في ComfyUI (مثل Qwen3VL 4B) كـ LLM لتوسيع المطالبات، ومعاملة بذرة المطالبة كمقبض ضبط خشن وبذرة أخذ العينات كمقبض ضبط دقيق. هذه «الطرق البدائية» تنتشر بسرعة، وغالبًا ما تحل المشكلات العملية أفضل من الوثائق الرسمية.
بعد انخفاض الحاجز، ما الذي يُنافَس عليه؟
عند النظر إلى هذه الخطوات مجتمعة، يصبح الاتجاه واضحًا. لم يعد توليد الصور مفتوح المصدر يجيب فقط عن سؤال «هل يمكنه الرسم بشكل مشابه؟»، بل بدأ يجيب عن سؤالين آخرين: هل يمكن تشغيله على جهاز أستطيع شراءه، وهل يمكن تعديله بدقة وفق مقصدي.
خفض Hunyuan ذاكرة الفيديو إلى 6G وفتحه مصدر نموذج الوسم يجيب عن السؤال الأول. وموجة الإصلاحات وLoRA المتسارعة في مجتمع Qwen تجيب عن «الدقة في التعديل» و«السرعة في التشغيل» ضمن السؤال الثاني. قد يبدو الخطان غير مرتبطين، لكنهما ينتهيان إلى النقطة نفسها: نقل التوليد من مرحلة العرض إلى الحياة اليومية.
بالنسبة للمبدعين العاديين، ربما يكون هذا أصدق تغيير في العام الأخير. لم تعد بحاجة إلى استئجار قوة حوسبة من أجل صورة واحدة، ولا إلى إعادة تثبيت البيئة كاملة لمجرد تغيير الأسلوب. بطاقة رسومات متوسطة من سنوات مضت، مع سلسلة الأدوات التي جمعها المجتمع، تكفي لإنتاج مجموعة أعمال لائقة.
ما تقلّص حقًا هو المسافة بين «أريد أن أجرّب» و«أبدأ فعلًا في التنفيذ».
مقالات ذات صلة
Agility Digit 5 يأتي مع ملف سلامة، لا مجرد ورقة مواصفات
أرضية المستودع ليست مختبرًا. الاعتماد هو البوابة، وليس العرض التوضيحي.
أنهى الوكلاء المتقدمون 30 بالمئة من مسار عمل بحثي. هذا هو الرقم.
يستطيع الوكلاء تشغيل البحث. لكن اختراع الإجراء لا يزال بعيد المنال.
Figure AI تحجز 3.5 مليار دولار من القدرة الحاسوبية قبل أن يكون لديها منتج للبيع
الرهان هو أن التعميم مشكلة حوسبة. والمجال لم يحسم ذلك بعد.
أخيرًا، أضافت OpenAI خلفيات شفافة إلى واجهة برمجة تطبيقات الصور
ميزة صغيرة تحذف خطوة كاملة من خط المعالجة.