PixelUMM وSana يشيران إلى الفكرة نفسها: إزالة السقالات من نماذج الرؤية

صدر إصداران بحثيان من NVIDIA خلال أيام قليلة من بعضهما البعض، ويشتركان في أطروحة واحدة. ظهر PixelUMM دون ضجيج على Hugging Face في 1 أكتوبر الساعة 21:40 UTC، وهو checkpoint بحجم 15.2 مليار معامل، دون منشور مدونة، ولا بيان صحفي، ولا شريحة عرض تقديمي رئيسي. أما Sana، من باحثين في NVIDIA وMIT وTsinghua، فقد كانت علنية لمدة أطول وتتبع نهجاً معاكساً لمشكلة البنية التحتية نفسها.
PixelUMM: نموذج موحّد بلا مُرمِّز
يُظهر اسم المستودع ما هو المشروع: nv-tlabs/PixelUMM، الموصوف في ملخصه المكوّن من سطر واحد بأنه «فهم وتوليد موحّد للصور والفيديو بلا مُرمِّز». وهو مبني على عمود فقري Qwen3-8B مع رخصة مستودع Apache-2.0.
الجزء «بلا مُرمِّز» هو الادعاء المثير للاهتمام. معظم أنظمة الذكاء الاصطناعي البصري اليوم تربط معاً مكوّنات منفصلة: مُرمِّز رؤية يحوّل الصورة إلى رموز يمكن لنموذج لغوي قراءتها، وVAE يضغط بيانات البكسل إلى فضاء كامن يمكن لنموذج انتشار العمل فيه، ومحوّل بصري يتعامل مع التسلسل. بُني PixelUMM ليعمل دون تلك المراحل الوسيطة، ولهذا لا تزال صفحة مشروعه تقرأ «preview» بينما يمكن تنزيل الأوزان.
تلك الفجوة بين أثر موجود وبائع لم يقل شيئاً هي القصة كاملة لهذا الإصدار. هناك مستودع GitHub، وورقة arXiv preprint برقم 2609.38597 بتاريخ 29 سبتمبر لمؤلفين من NVIDIA وجامعة واترلو، وcheckpoint مقسّم على 128 ملفاً مع فهرس مخفي ترفض أدوات التحميل تشغيله بدونه. أما ما إذا كانت NVIDIA تعتبر PixelUMM معلَناً، فهو سؤال لم تجب عنه الشركة.
Sana: اضغط سلسلة الكلفة بدلاً من وحدة واحدة
تهاجم Sana الطبقة نفسها من الحزمة من الاتجاه المعاكس. يصبح تحويل النص إلى صورة عالي الدقة مكلفاً لسبب لا علاقة له كثيراً بعدد البكسلات: عدد الرموز الكامنة الداخلة إلى محوّل الانتشار ينمو سريعاً مع الدقة. ويجب على الانتباه الذاتي القياسي أن يربط كل رمز بكل رمز آخر، لذا ترتفع الكلفة والذاكرة وزمن الاستجابة معاً.
في مقارنة NVIDIA الخاصة عند 1024 بكسل، يحمل FLUX-dev 12 مليار معامل، ويعمل بمعدل 0.04 عيّنة في الثانية، ويستغرق 23 ثانية للصورة. والاتجاه نحو 2K أو 4K، أو تصغير النموذج، أو تقليل خطوات أخذ العينات، لا يحل المشكلة الجوهرية.
تضغط Sana السلسلة كاملة بدلاً من مكوّن واحد. يقلّل مشفّر تلقائي للضغط العميق 32x من عدد الرموز الكامنة. ويقلل الانتباه الخطي من كلفة كل طبقة محوّل. ويقلل حلّال فعّال وتقطير قليل الخطوات من عدد مرات أخذ العينات. وتقلل التقطيع والتفريغ والتكميم منخفض البتات من ذاكرة النشر. تشمل النماذج المنشورة إصدارات 0.6B و1.6B المستهدفة حتى 4K، مع امتداد Sana-1.5 إلى 4.8B. في مقارنة 1024 بكسل الرسمية، يعمل إصدار 0.6B بزمن استجابة 0.9 ثانية.
لنهج ضغط السلسلة خاصية جاذبة لا يمتلكها إصلاح وحدة واحدة. لأن كل مرحلة تساهم، يمكن للفريق تطبيق الأجزاء التي تناسب عتاده وتخطّي الباقي. يمكن لمن يملك محطة عمل وليس لديه خبرة في التكميم أن يأخذ الحلّال الفعّال. ويمكن لمن ينشر على نطاق واسع أن يكدّس التقطيع والتفريغ والتكميم منخفض البتات ليناسب بطاقة أصغر بكثير. ويُوثّق المقايضات لكل مرحلة بدلاً من جمعها في قرار واحد: كل شيء أو لا شيء.
كما يُظهر تطور Sana مدى سرعة تحوّل نتيجة بحثية إلى سطح منتج. استهدف النموذج الأصلي مخرجات تحويل النص إلى فيديو بدقة 4K. ومنذ ذلك الحين توسّع المستودع ليشمل Sana-Sprint، وتوليد الفيديو، وControlNet، وLoRA، والتكميم، وتكامل ComfyUI، وخدمة عبر الإنترنت. وهذا هو المسار نفسه الذي سلكته أدوات الصور: من ورقة بحثية، إلى مستودع، إلى عقدة في الواجهة التي يستخدمها الناس بالفعل.
ما يشترك فيه النهجان
ضع الإصدارين جنباً إلى جنب وسيتضح اتجاه المسار. كلاهما يحاول إزالة الآلات الوسيطة التي ظلت بين البكسلات والنماذج منذ الأيام الأولى للمجال. يسأل PixelUMM ما إذا كان المُرمِّز ضرورياً أصلاً. وتسأل Sana عن مقدار ما يمكن ضغطه من سلسلة الحوسبة قبل أن تنهار الجودة.
المقايضة هي نفسها في كلتا الحالتين، ولا يخفيها أي من المختبرين. إزالة المُرمِّز تعني أن على النموذج تعلّم ما كان المُرمِّز يقدمه، وهذا يكلّف حوسبة تدريب وقد يكلّف جودة في المهام التي كان المُرمِّز يتعامل معها جيداً. أما ضغط السلسلة بقوة يعني أن سقف الجودة يتحرك، ومواد Sana نفسها حريصة بشأن العتاد وظروف القياس وراء أرقام زمن الاستجابة تلك.
السبب في مهاجمة المختبرين لهذه الطبقة هو أن الوسطاء أصبحوا الجزء المكلف. فمُرمِّز الرؤية وVAE يُدرَّبان منفصلين، ويُضبَطان منفصلين، ويُخدَمان منفصلين. وكل واحد منهما مكوّن يمكن أن ينحرف عن التزامن مع بقية خط المعالجة، وكل واحد منهما يضيف زمن استجابة في مقدمة كل طلب. إزالتهما تبسيط معماري وليست حيلة بحثية، وهي تنفع في كل عملية نشر.
لماذا يهم هذا كل من يبني بالصور
بالنسبة للممارسين، النتيجة العملية هي حدود عتاد دنيا أقل. فالعمل على Sana من NVIDIA جزء من نمط أوسع هذا العام: النماذج التي كانت تحتاج إلى بطاقة مركز بيانات تُعاد صياغتها لتناسب عتاد المستهلك، وقد بدأ المجتمع المفتوح يتعامل مع حد 6GB من VRAM كمتطلب وليس كميزة إضافية.
وهناك نتيجة ثانية تظهر في المخططات المعمارية. عندما يتوقف المُرمِّز وVAE عن كونهما خدمتين منفصلتين، يتحول خط معالجة كان يضم ثلاثة نماذج يجب إصدار إصدارات لها ومراقبتها ودفع تكلفتها إلى نموذج واحد. هذا أقل وضوحاً من رقم زمن الاستجابة، لكنه ما يغيّر عبء الصيانة في منتج حقيقي.
بالنسبة للفرق التي تبني فوق هذه النماذج، السؤال العملي هو أي تبسيط يمكنها تبنيه أولاً. يَعِد نهج بلا مُرمِّز بمعمارية أنظف لكنه يتطلب الثقة بأن تعامل النموذج مع التمثيلات يطابق ما كان يقدمه مُرمِّز مصمم لغرض محدد. أما نهج ضغط السلسلة فيَعِد بمكاسب قابلة للقياس في السرعة والذاكرة اليوم مع إبقاء المعمارية الحالية سليمة. أحدهما رهان على الاتجاه الذي يتجه إليه المجال؛ والآخر رهان على العتاد الذي تملكه بالفعل.
كلا الرهانين معقول، والمختبران الساعيان إليهما لا يتنافسان على النشر نفسه. فالإطار الموحّد لPixelUMM يناسب الفرق التي تريد نموذجاً واحداً للفهم والتوليد. وتناسب Sana الفرق التي تحتاج إلى مخرجات عالية الدقة على عتاد محدود. أما التداخل فهو الجزء من الحزمة الذي يحاول كلاهما حذفه.
لم تقل NVIDIA ما إذا كان PixelUMM قد اكتمل. كود Sana منشور، وقد نما المستودع ليشمل متغيرات sprint، وتوليد الفيديو، وControlNet، وLoRA، والتكميم، ودعم ComfyUI، وخدمة عبر الإنترنت. فريقان بحثيان، ومساران، وهدف واحد: الأجزاء من حزمة الرؤية التي لم يرغب أحد في التفكير بها يجري تصميمها لتخرج من المعادلة.
مقالات ذات صلة
صور الأقمار الصناعية أصبحت الآن بيانات تدريب للروبوتات
لم يعد عنق الزجاجة في تدريب الذكاء الاصطناعي الفيزيائي القدرة الحاسوبية ولا قدرة النموذج، بل أصبح جودة العالم الاصطناعي.
Gemini 3.5 Live Translate من Google يلغي التوقف
الترجمة التي تعمل باستمرار، بصوت المتحدث نفسه، على هاتف موجود أصلًا في جيبك، تنقل الميزة من شيء تفتحه إلى شيء يعمل فقط.
الصين تضع أول معيار سلامة إلزامي لوكلاء الذكاء الاصطناعي
تنتقل السلامة من ميزة تروّج لها إلى بوابة تعبر منها. وجرد المخاطر يضم 13 فئة و97 بنداً.
المحتوى المولّد بالذكاء الاصطناعي يبدأ في إعلان هويته
هذه الخطوة لا تحل كل المشكلات، لكنها تحوّل «مولّد بالذكاء الاصطناعي» من خيار يمكن إخفاؤه إلى سؤال يجب الإجابة عنه.