InternLumina-U2 يضع النصوص والصور والفيديو والثلاثي الأبعاد في نموذج واحد بحجم 16B، ثم يطلق مجموعتين من الأوزان

عادةً ما تقدم النماذج متعددة الوسائط الموحدة مقايضة: فهي تغطي العديد من المهام ولكنها لا تتقن أيًا منها. إن InternLumina-U2 محاولة لاختبار هذا الافتراض بميزانية صغيرة من المعاملات، والطريقة التي تم إطلاقه بها تقول الكثير عن الاستراتيجية بقدر ما تقوله عن البنية.
أطلقت InternLM النموذج على Hugging Face بموجب ترخيص Apache 2.0. إنه نموذج خليط الخبراء بحجم 16 مليار معامل مع مليار معامل نشط لكل رمز، مكتوبًا كـ 16B-A1B. وهو يقرن عمودًا فقريًا متناثرًا بتمثيل بصري منفصل تمامًا مكون من 8 كتب ترميز مبنية على شيء يسمى AToken، ويتعامل مع الإجابة على الأسئلة النصية، وتوليد الصور من النص، وفهم الصور، وتحرير الصور، وفهم الفيديو، وفهم الأبعاد الثلاثية في نموذج واحد.
التفصيل المثير للاهتمام يكمن أسفل قائمة المهام: يتضمن الإصدار نقاط تحقق منفصلة لوحدات معالجة Huawei Ascend ولوحدات معالجة NVIDIA الرسومية.
ما يوفره لك النموذج الموحد فعليًا
الحجة وراء التوحيد هي تكلفة الصيانة. عادةً ما يشغّل فريق يبني منتجًا يفهم الصور ويولّدها نموذجًا للفهم وآخر للتوليد، ثم يحافظ على مساري استدلال، ومجموعتي مطالبات، ودورتي ترقية. إن طي الفهم والتوليد في إطار واحد يزيل بعض هذه النفقات، وتمديد الإطار نفسه إلى الفيديو والثلاثي الأبعاد يوسع الفائدة أكثر.
الآلية مهمة لكيفية تحقيق ذلك. التمثيل البصري المنفصل تمامًا يعني أن الصور يتم ترميزها إلى مجموعة من كتب الترميز المتعلمة، في هذه الحالة ثمانية منها، مبنية على AToken. وهذا يدفع فهم الصور والفيديو إلى شكل أقرب إلى تدفق الرموز الذي يعرف نموذج اللغة بالفعل كيفية معالجته، وهو ما يجعل عمودًا فقريًا واحدًا معقولًا عبر العديد من الوسائط.

ما إذا كان النهج الموحد يضاهي المتخصصين بهذا الحجم هو السؤال المفتوح. يزيل Apache 2.0 الاحتكاك القانوني، لكن الترخيص المتساهل لا يجيب عما إذا كان مسار واحد بمليار معامل نشط يولد الصور بنفس جودة نموذج صور مخصص. التقرير الفني مُعلَّم بأنه قادم قريبًا، والمعايير المتاحة الآن أولية ومُبلَّغ عنها من الشركة. وإلى أن يصل التقييم المستقل، يظل الادعاء غير مُثبت.
لماذا تهم نقاط التحقق المزدوجة للأجهزة أكثر مما تبدو
إن شحن نقاط تحقق Ascend وNVIDIA جنبًا إلى جنب هو تصريح حول النشر، وليس مجرد راحة.
كانت مختبرات الذكاء الاصطناعي الصينية تبني في ظل وصول مقيد إلى الرقائق المتطورة، وكان الرد هو التحسين بقوة للأجهزة التي يمكنهم الحصول عليها. إن إطلاق أوزان تعمل على كل من وحدات Ascend NPU من Huawei ووحدات NVIDIA GPU يعني أن فريقًا خارج الصين يمكنه البدء بأجهزة NVIDIA ثم الانتقال لاحقًا إلى Ascend دون تغيير النموذج. كما يعني أن مؤسسة صينية محلية تعمل بالفعل على Ascend يمكنها اعتماد النموذج دون شراء مسرعات جديدة.
هذه تكلفة تبديل أقل مما تبدو. قرارات الأجهزة لزجة، والنموذج الذي يحترم كلا المنصتين يزيل أحد الحواجز التي قد تبقى الفريق مع مورده الحالي. بالنسبة لمؤسسة لديها بنية تحتية قائمة على أي من الجانبين، فإن الإصدار أقل ارتباطًا بالمعايير وأكثر ارتباطًا بما إذا كان يمكن إدخاله في ما هو موجود بالفعل في الرفوف.
السياق يزيد النقطة حدة. تنافست المختبرات الصينية بشكل متزايد من خلال إطلاق أوزان مفتوحة بدلاً من بيع واجهات برمجة تطبيقات مغلقة فقط، والمنطق الاستراتيجي يسير في اتجاهين. الأوزان المفتوحة تنشر التبني والتأثير المعياري بشكل أسرع من نقطة نهاية مغلقة. كما تسمح لبائعي الأجهزة المحليين بالإشارة إلى نماذج حقيقية تعمل جيدًا على شرائحهم، وهو أمر مفيد عندما يكون البديل هو إثبات ذلك في فراغ.
المقارنة بترخيص أكثر صرامة
من المفيد المقارنة بنموذج صور مفتوح آخر حديث. أطلقت Qwen-Image-2.1 نقطة تحقق بحجم 7B توحد توليد الصور من النص والتحرير، وتنتج مخرجات RGBA أصلية بقناة ألفا، وتقبل ما يصل إلى 10 صور مرجعية. احتلت المرتبة الأولى بين النماذج مفتوحة الأوزان في لوحتي صدارة Artificial Analysis. لكن أوزانها صدرت تحت ترخيص صارم غير تجاري، مما يعني أن المشاريع التجارية يجب أن تمر عبر واجهة برمجة التطبيقات الرسمية.
تسير InternLumina-U2 في الاتجاه المعاكس مع Apache 2.0. وهذا يجعلها قابلة للاستخدام مباشرة في المنتجات التجارية، ويضع النموذج في موضع تنافسي مختلف: هذه هي الأوزان التي يمكن لشركة البناء عليها قانونيًا دون التفاوض على ترخيص، حتى لو لم تتصدر لوحة الصدارة.
خيارات البنية التي تستحق الفهم
قراران تصميميان يحملان معظم الثقل.
الأول هو العمود الفقري لخليط الخبراء المتناثر. مع 16B من المعاملات الإجمالية و1B فقط نشط لكل رمز، تتبع تكلفة الاستدلال المجموعة النشطة بدلاً من النموذج الكامل. وهذا ما يجعل نموذجًا واسعًا متعدد المهام ميسور التكلفة للتقديم، لأن حصة كبيرة من الشبكة تظل خاملة لأي إدخال معين.
الثاني هو التمثيل البصري المنفصل. نظام 8 كتب ترميز على AToken هو قرار ضغط بقدر ما هو قرار نمذجة. عدد أقل من كتب الترميز الأفضل تنظيمًا يعني معلومات بصرية أقل للتنبؤ بها في كل خطوة، مما يساعد عند أعداد المعاملات النشطة الصغيرة حيث لا يمكنك شراء الجودة بالحوسبة.
لا يعد أي من الخيارين جديدًا بمفرده. الرهان هو أن الجمع بينهما، بهذا الحجم، ينتج نموذجًا مفيدًا حقًا عبر الوسائط بدلاً من كونه متعدد المواهب يتم تحويله بعيدًا عن العمل الحقيقي.
لماذا تنسيق الإصدار هو الرسالة
قائمة المهام طموحة، لكن تنسيق الإصدار يحمل إشارة أكبر لأي شخص يقرر ما يبني عليه. تبرز ثلاثة خيارات.
الأول هو الحجم. نموذج بحجم 16B مع 1B معامل نشط صغير وفقًا لمعايير سباق الأوزان المفتوحة الحالي، حيث تطلق المختبرات الرائدة نماذج بحجم 744B وحتى 2.8 تريليون معامل. النموذج الصغير الذي يعمل بتكلفة زهيدة على أجهزة يمكن الوصول إليها هو منتج مختلف عن نموذج كبير يحتاج إلى عنقود. إنه يستهدف الفرق التي لا تستطيع شراء طريقها إلى القدرة وتحتاج إلى شيء يمكنها تقديمه اقتصاديًا.
الثاني هو الترخيص. Apache 2.0 هو ترخيص متساهل يسمح بالاستخدام التجاري دون تفاوض، وهو ما يهم أكثر من درجات المعايير لشركة تقرر ما إذا كان يمكنها إطلاق منتج فوق نموذج. النموذج ذو الدرجة القوية والترخيص المقيد هو نموذج توجهه عبر واجهة برمجة تطبيقات. النموذج ذو الترخيص المتساهل هو الذي يمكنك تضمينه.
الثالث هو مزيج الوسائط. معظم النماذج المسماة موحدة تغطي النصوص والصور. إن إضافة فهم الفيديو والثلاثي الأبعاد إلى الإطار نفسه هو ما يجعل الكلمة تستحق مكانها، وهو أيضًا موضع الخطر، لأنه كلما زادت الوسائط التي يجب أن تخدمها مجموعة معاملات نشطة صغيرة، قلّت السعة الموزعة عبرها.
بمجملها، يُقرأ الإصدار كرهان على واقع النشر بدلاً من موقع لوحة الصدارة: صغير بما يكفي للتقديم، ومتساهل بما يكفي للإطلاق، وواسع بما يكفي لاستبدال عدة نماذج في خط أنابيب.
ما يجب مراقبته
ثلاثة أشياء ستحدد كيفية الحكم على هذا الإصدار. التقرير الفني، عندما يصل، يجب أن يحمل جداول المعايير الكاملة، وتحتاج تلك الأرقام إلى تكرار مستقل قبل أن يكون لها وزن. الثاني هو ما إذا كان المسار الموحد يصمد في التوليد تحديدًا، لأن هذا هو المجال الذي يتمتع فيه النماذج المتخصصة بأقوى هيمنة. الثالث هو الأجهزة. إذا أثبتت نقاط تحقق Ascend قدرتها التنافسية عمليًا، يصبح الإصدار ثنائي الأجهزة قالبًا، وستطلق المزيد من المختبرات الصينية أوزانًا تعمل على كلا المنصتين افتراضيًا.
في الوقت الحالي، من الأفضل قراءة الإصدار كبيان نوايا. تتنافس مختبرات الصين على الأوزان المفتوحة، ومرونة الأجهزة، والتراخيص المتساهلة، كل ذلك في وقت واحد، وتضع InternLumina-U2 الثلاثة جميعًا في بطاقة نموذج واحدة.
مقالات ذات صلة
أدوات الفيديو بالذكاء الاصطناعي تحصل على 9 من 10 لسهولة الاستخدام. أما درجة الامتثال فهي قصة مختلفة.
المستخدمون يعشقون مولدات الفيديو بالذكاء الاصطناعي. لكن الإدارات القانونية لم تُسأل بعد.
HappyOyster تبيع عالمًا يمكنك الدخول إليه، لا مقطعًا تشاهده
معظم نماذج الفيديو تمنحك ملفًا. هذا يمنحك غرفة فيها باب.
Luma Ray3 Modify يحافظ على الأداء ويعيد التفاوض على العالم المحيط به
أصعب مشكلة في تحرير فيديو الذكاء الاصطناعي ليست التأثير. بل عدم إفساد اللقطة التي دفعت ثمنها بالفعل.
قسّم Vidu Q3 التوليد من الفيديو المرجعي إلى ثلاثة منتجات. هذا قرار تغليف بقدر ما هو قرار نموذج.
ثلاثة معرّفات نماذج بسعر واحد أقرب إلى قرار مشتريات منه إلى قرار تسويقي.