أصدرت Ai2 حزمة التدريب مفتوحة المصدر، وليس مجموعة أخرى من الأوزان

أصدر معهد ألن للذكاء الاصطناعي Olmo-core 3، بنية تحتية تدريب مفتوحة لنماذج خليط الخبراء على نطاق تريليون معامل. المقياس الرئيسي هو نموذج MoE بـ47 مليار معامل يصل إلى نحو 2.7 ضعف الإنتاجية مقارنة بالإعداد السابق على ثماني وحدات معالجة رسومات B300. هذا الرقم محترم. وهو أيضًا ليس سبب أهمية الإصدار.
من السهل منح الأوزان، ومن الصعب التعلم منها. تنزيل مجموعة أوزان يتيح لك تشغيل نموذج. لكنك لا تستطيع إعادة إنتاجه أو تدقيقه أو إعادة تدريبه على بياناتك دون إعادة بناء خط أنابيب التدريب من الصفر عمليًا. Olmo-core 3 هو إصدار خط الأنابيب.
التمييز الذي يتكرر طرحه
الأوزان المفتوحة والتدريب المفتوح منتجان مختلفان، والفجوة بينهما هي حيث تكمن معظم المعلومات المفيدة.
النموذج المُصدر يخبرك بما حققه فريق ما. أما حزمة التدريب فتخبرك بكيفية ذلك، وهو ما تحتاجه إذا أردت القيام به بنفسك. والثاني أكثر فائدة بكثير لأي شخص خارج المؤسسة المُصدِرة، وأكثر ندرة بكثير، لأن كود التدريب وخط بيانات التدريب وتفاصيل الإعداد هي الأجزاء التي استغرقت أطول وقت لضبطها بشكل صحيح.
خليط الخبراء يجعل هذا أكثر أهمية لا أقل. يوجّه نموذج MoE كل رمز إلى مجموعة فرعية من الخبراء، لذا قد ينشّط نموذج بمعاملات إجمالية بالتريليونات جزءًا صغيرًا فقط لكل رمز. يقلل هذا التصميم تكلفة الاستدلال، لكنه يُدخل قرارات توجيه، وموازنة الحمل بين الخبراء، وأنماط اتصال عبر الأجهزة يصعب ضبطها فعلًا. قد يكون لدى فريقين بنية نموذج متطابقة لكن إنتاجية مختلفة جدًا بسبب خيارات في حلقة التدريب.
إتاحة البنية التحتية للتدريب تعني أن هذه الخيارات مرئية. وهذا ما يجعل رقم الإنتاجية البالغ 2.7 ضعف ذا معنى، لأنه مرتبط بكود يمكن لشخص آخر تشغيله والتحقق منه.

لماذا يُعد تدريب MoE الجزء الصعب
تتوسع النماذج الكثيفة بشكل يمكن التنبؤ به. تضيف معاملات، تضيف حوسبة، فتحصل على منحنى سلس. تقدم نماذج MoE مشكلة جدولة. إذا أرسل الموجّه معظم الرموز إلى خبراء قليلين، يصبح هؤلاء الخبراء عنق الزجاجة وتبقى بقية العتاد عاطلة. وإذا وزّع الرموز بالتساوي أكثر من اللازم، يفقد النموذج التخصص الذي جعل البنية جذابة.
يتطلب إتقان هذا عوامل سعة، وخسائر مساعدة، وتراكبات اتصال تعتبرها معظم المختبرات ملكية خاصة. كما يتطلب حفظ نقاط تفتيش تصمد أمام أعطال العتاد، لأن تشغيل تدريب بهذا الحجم سيواجه أعطالًا، وإعادة البدء من البداية ليست خيارًا.
مكسب الإنتاجية الذي تذكره Ai2 على ثماني وحدات B300 هو نتيجة على نطاق صغير، وينبغي قراءتها على هذا الأساس. إظهار أن حلقة تدريب فعّالة على عقدة واحدة ليس مثل إظهار أنها تصمد عند مئات العقد، حيث يهيمن الاتصال بين العقد. لكنها النتيجة الأولى الصائبة، لأن مشكلات الكفاءة تظهر عادة على النطاق الصغير أولًا وتزداد سوءًا مع التوسع.
لماذا تُعد الإنتاجية على ثماني وحدات GPU الرقم الأول الصحيح
تبدو نتيجة الإنتاجية على نطاق صغير متواضعة مقارنة بإطار التريليون معامل، وهي تستحق دفاعًا. تميل مشكلات كفاءة التدريب إلى الظهور مبكرًا وتزداد سوءًا. إذا كانت حلقة تدريب تهدر ثلث حوسبتها على عقدة واحدة، فستهدر الحلقة نفسها أكثر عند إضافة الاتصال بين العقد، لأن عدم الكفاءة تتراكم مع كل طبقة تنسيق.
نشر رقم على نطاق صغير أولًا طريقة للقول إن الأساسيات سليمة قبل تقديم ادعاءات حول عنقود كبير. وهي أيضًا نقطة البداية الصحيحة. الفريق الذي يذكر رقمًا على نطاق كبير قبل رقم صغير يقدم عادة ذروة لا معدلًا مستدامًا.
هناك سبب ثانٍ لأهمية الرقم. إنتاجية MoE حساسة لحجم الدفعة وطول التسلسل بطرق لا تكون فيها النماذج الكثيفة كذلك، والإعداد الذي يعظّم الكفاءة على ثماني وحدات GPU غالبًا ما يعمّم على عناقيد أكبر مع الضبط. تحسين بمقدار 2.7 ضعف كبير بما يكفي ليعكس تغييرًا بنيويًا لا تفصيلًا في الضبط، مما يجعله يستحق الانتباه.
الجمهور المستهدف من هذا أصغر من جمهور الأوزان
معظم من يتحدثون عن النماذج المفتوحة يريدون الأوزان. يريدون تشغيل الاستدلال، أو الضبط الدقيق على مجال معين، أو بناء منتج. وتخدم هذه الفئة كل إصدارات الأوزان المفتوحة.
الفئة التي تحتاج حزمة تدريب أصغر بكثير: مختبرات البحث، وبرامج الحوسبة الوطنية، والجامعات التي لديها وصول إلى عناقيد حاسوبية، والشركات في الصناعات المنظمة التي يجب أن توثق كيف أُنشئ النموذج. لقد تم خدمة هؤلاء المستخدمين بشكل سيئ، لأن الخيار كان بين بناء خط أنابيب من الصفر واستخدام شيء لا يعمل إلا مع عتاد بائع معين.
تغيّر حزمة التدريب المفتوحة الخيار الثاني. إنها تمنح مختبرًا نقطة بداية يمكنه تعديلها، وتمنح برنامجًا حكوميًا مسارًا إلى نماذج سيادية لا يعتمد على استعداد بائع أجنبي لمشاركة تفاصيل التنفيذ.
هذا شيء استراتيجي للإصدار، وقد التزمت Ai2 به باستمرار. نُشرت نماذج المعهد مع البيانات والكود وسجلات التدريب، وهو معيار أصعب من إصدار الأوزان وورقة بحثية.
الجدل الهادئ حول التدريب المفتوح
هناك نقاش داخل مجتمع النماذج المفتوحة حول ما ينبغي أن يعنيه الانفتاح، وإصدارات كهذه تدفعه إلى الأمام.
يقول موقف إن الأوزان هي ما يهم، لأن الأوزان هي ما يستخدمه الناس. وفقًا لهذا الرأي، نشر نموذج هو هدية وتفاصيل التدريب هي شأن خاص للشركة. ويقول الموقف الآخر إن نموذجًا بدون حزمة تدريبه لا يمكن تدقيقه أو إعادة إنتاجه أو تحسينه من قبل أي شخص خارج الفريق الأصلي، وإن وصف هذا الإصدار بالمفتوح يبالغ فيما يقدمه.
اكتسب الموقف الثاني أرضية لسبب عملي. بدأ المنظمون في عدة ولايات قضائية يطلبون من مطوري النماذج توثيق بيانات التدريب ومصدرها. الفريق الذي درب على خط أنابيب منشور يستطيع الإجابة عن تلك الأسئلة. أما الفريق الذي ضبط أوزانًا مستعارة ضبطًا دقيقًا فلا يستطيع، لأنه لا يعرف ما الذي دخل فيها.
بالنسبة لمعهد بحثي، الحساب بسيط. إصدار حزمة يكلف وقتًا هندسيًا ولا يتنازل عن شيء تجاريًا، لأن المعهد لا يبيع استدعاءات API. وبالنسبة لمختبر تجاري، فإن فعل الشيء نفسه سيمنح المنافسين سبقًا. هذا التفاوت هو السبب في أن حزم التدريب المفتوحة تأتي من المعاهد والجامعات أكثر بكثير من الشركات، وفي أن كل واحدة تظهر تستحق الفحص.
ما يجب مراقبته
ما إذا كانت نتيجة الإنتاجية تصمد عند التوسع. الاختبار المثير ليس ثماني وحدات GPU بل بضع مئات، حيث تعمل أنماط الاتصال التي يضمّنها Olmo-core 3 أو لا تعمل.
ما إذا كانت المختبرات الخارجية تتبناه فعليًا. تنتشر حزمة التدريب عندما يدرب شخص آخر نموذجًا بها وينشر النتيجة. وستكون أول إعادة إنتاج موثوقة أكثر إفادة من أي جدول مقارنة.
ما إذا كان التدريب المفتوح يغيّر المشتريات. كانت الخيارات محدودة أمام المؤسسات التي تحتاج إلى توثيق مصدر نماذجها. وإذا توفر خط أنابيب تدريب كامل بموجب ترخيص متساهل، فستبني عليه بعض تلك المؤسسات بدلًا من الدفع مقابل بديل مغلق.
تحظى إصدارات الأوزان بالانتباه لأن أي شخص يمكنه تنزيلها وتجربتها. أما إصدارات التدريب فهي حيث تنتقل المعرفة الفعلية للمجال، وهي تحدث بوتيرة أقل بكثير. وهذا الإصدار يستحق القراءة المتأنية، لأن الجزء القابل للنقل من النموذج هو العملية التي تقف خلفه.
مقالات ذات صلة
لوحة صدارة نماذج الفيديو التي لا يروّج لها أحد: إلى أين تذهب الطلبات فعلاً
كل أسبوع يحمل تصنيفاً جديداً لتوليد الفيديو، ومعظمها مبني بالطريقة نفسها.
نموذج Qwen3.8-Max من علي بابا يزعم قدرته على البرمجة بنفسه لمدة أسبوعين
توقّف عدد المعاملات عن كونه خبرًا منذ زمن. أما الاثنا عشر يومًا فهي الرقم الجدير بالتدقيق.
PixelUMM يتخلّى عن المكوّنين اللذين تعتمد عليهما كل نماذج الذكاء الاصطناعي البصرية
طُرح الانتشار على مستوى البكسل من قبل واصطدم مرارًا بالحوسبة.
مراكز بيانات الذكاء الاصطناعي تنتظر الآن خطوط الكهرباء، لا شحنات الرقائق
المشاريع التي ستفتتح في الموعد المحدد في 2027 ستكون تلك التي حلّت مسألة الربط وتخصيص الذاكرة أولاً.