منتقي النموذج يتحول إلى منتقي التنسيق

في 30 سبتمبر، نقلت GitHub أداة HydraFusion من سطر الأوامر إلى المحرر. تعمل المعاينة البحثية الآن في VS Code 1.140 وما بعده، وفي تطبيق GitHub Copilot، ما يضع فكرة غير معتادة أمام المطورين العاديين: توقّف عن اختيار نموذج، واختر سير عمل.
HydraFusion ليس نموذجاً. إنه طبقة تقرر، لكل جولة، عدد أدوار النماذج التي تحتاجها المهمة.
ثلاثة أشكال لطلب واحد
Single هي الحالة المألوفة. يتولى نموذج واحد الطلب، بالطريقة التي يعمل بها Copilot Auto بالفعل.
يبدأ Cascade رخيصاً. يكتب نموذج فعّال مسودة أولى، ثم تقبلها بوابة جودة أو تصعّد العمل إلى نموذج أقوى. الهدف هو إبقاء التعديلات الروتينية على نماذج غير مكلفة، وحجز النماذج المكلفة للمشكلات التي تحتاجها فعلاً.
ينفق Critique أكثر ليكون أكثر أماناً. يصوغ نموذج مسودة، ويعمل نموذج ثانٍ من عائلة مختلفة كناقد بصلاحية قراءة فقط، ثم يراجع نموذج الصياغة مرة واحدة بناءً على تلك الملاحظات. لا يلمس الناقد الشيفرة أبداً، ما يمنع الحلقة من أن تتحول إلى نموذجين يتجادلان.
الفرق عن Auto معماري. يقرر Auto أي نموذج واحد يجب أن يتلقى طلبك. يقرر HydraFusion كم عدد الأدوار التي تحتاجها الجولة وكيف تتفاعل. هذا تحوّل ذو معنى في مكان وجود التحكم بالذكاء. تاريخياً، كنت تختار نموذجاً لأنه أفضل في نوع عملك. هنا تختار سياسة تحسين وتدع المنصة تركّب النماذج تحتها.

الاقتصاد حقيقي وأيضاً مُبلَّغ عنه ذاتياً
المشكلة هي الفوترة. تفرض GitHub رسوماً حسب الرموز بسعر كل نموذج مختار القياسي. تشغّل عملية Critique نموذجين على الأقل، لذا قد تكلف أكثر لكل طلب من استدعاء واحد. صُمم Cascade ليكلف أقل عبر دفع العمل السهل إلى الأسفل. التوفير ليس خصماً على أي نموذج. إنه رهان على أن معظم الجولات لا تحتاج إلى الأفضل.
أبلغت تقييمات GitHub المضبوطة عن تخفيضات في تكلفة سير العمل بين 36 و67 بالمئة مقابل خط أساس Claude Opus 5 عبر ثلاث معايير لوكلاء البرمجة، مع جودة أعلى بـ4.9 نقاط مئوية على TerminalBench 2.1، وأقل بـ1.5 نقطة على DeepSWE، وأقل بـ0.1 نقطة على CheckpointBench. هذه أرقام ينتجها المورّد على إعداد الاختبار الخاص بـGitHub. إنها فرضية حول مستودعك، لا ضمان، ولم تُنشر مجموعة النماذج المشاركة في HydraFusion بالكامل. أي شيء يُبنى على المعاينة يجب أن يتعامل مع سلوك التوجيه على أنه شيء يمكن أن يتغير دون إشعار.
هناك أيضاً تكلفة زمن وصول واضحة. مسودة زائد مراجعة تستغرق وقتاً أطول من إجابة واحدة. على الفرق في خطط Business وEnterprise مراقبة لوحات معلومات الاستخدام عن كثب، لأن النظام يقرر متى يصعّد، وذلك القرار ليس مجانياً.
تحسين لا يمكنك فحصه يصعب الوثوق به
الجزء المحرج في التوجيه هو أن الجهة التي تتخذ القرار هي المنصة، لا المطوّر. يمكنك رؤية أي نموذج أجاب بعد الحدث، لكن لا يمكنك بسهولة رؤية لماذا اختار النظام سير عمل ما، أو ما قاسته بوابة الجودة، أو كم اقتربت عملية Cascade من التصعيد. تصف ادعاءات GitHub المعيارية متوسطاً عبر مجموعة اختباراتها الخاصة، والمتوسطات تخفي الحالات المهمة.
تحوّل تلك الفجوة التنسيق إلى مشكلة حوكمة بدلاً من مشكلة تقنية بحتة. فريق هندسي يجب أن يشرح لماذا راجع طلب سحب معين عائلتان من النماذج وحُوسب وفقاً لذلك يحتاج إلى قياس عن بعد للتوجيه، والمعاينة لا تعرضه بعد. العلاج ليس تجنب الميزة. بل اختبارها بالطريقة التي تختبر بها أي تبعية داخلياتها مخفية: على مجموعة مهام مستودع ثابتة ومملة، وقياس تكلفة المهمة المكتملة مقابل نموذج متقدم واحد، ومراقبة إعادات المحاولة وجهد المراجعة بدلاً من السعر المعلن لاختيار واحد.
المقارنة مع Auto تستحق التمسك بها. يجيب Auto عن سؤال أي نموذج هو الأنسب لطلب. يجيب HydraFusion عن سؤال كم من العملية يستحق الدور، والعملية كانت دائماً الجزء المكلف في عمل البرمجيات.
الأثر الجانبي المثير للفضول هو أنه يجعل اختيار النموذج أقل عاطفية. يطوّر المطورون ارتباطات بنماذج معينة، وعادة ما تُبنى تلك الارتباطات على حفنة من النجاحات التي لا تُنسى. النظام الذي يوجّه حسب نوع المهمة ويصعّد عند الفشل يعترف بهدوء أنه لا يوجد نموذج واحد يفوز في كل فئة، وهذا صحيح منذ فترة ونادراً ما يُتصرّف بناءً عليه.
الجيب التالي من المحرر يُبنى لهذا
يعرض إصدار Insiders بالفعل إلى أين يتجه الأمر بعد ذلك. ميزة تسمى Compare Agents، وتحمل وسم Run Multiple Agents، ترسل طلباً واحداً إلى عدة وكلاء بالتوازي، كل واحد في شجرة عمل git خاصة به، ثم يجعل وكيل حكم يختار فائزاً أو يسلّم القائمة المختصرة إلى شخص.
التفصيل المثير هو ما ينظر إليه الحكم. يقارن الملفات المتغيرة وإحصاءات الفروق، ونتائج الاختبارات، وحالة البناء، والتشخيصات، والتوقيت، والفروق المعمارية. يشغّل مجموعة الاختبارات. لا يطلب من نموذج لغوي آخر قراءة الشيفرة والتخمين. هذا قرار صغير بعواقب كبيرة، لأنه يعني أن المقارنة مستندة إلى الحالة الفعلية للمشروع بدلاً من رأي نموذج فيه.
بقية الإصدار نفسه بنية تحتية أهدأ لا تهم إلا عندما تعمل الوكلاء بالتوازي. تتيح جلسات متعددة المجلدات لكل محادثة في جلسة واحدة استخدام مجلدها أو شجرة عملها الخاصة، فتتوقف التغييرات عن التصادم. يسلّم التفويض البعيد مهمة إلى مضيف وكيل بعيد متصل. تعيد مجلدات شجرة العمل المشتركة استخدام المجلدات المتجاهلة لتجنب إعادة تثبيت التبعيات على كل فرع. تتوقف Dev Containers الآن بعد خمس دقائق من الخمول وتعيد التشغيل عند الطلب.
الحوكمة تستمر في الوصول في نفس الالتزامات التي تصل فيها الميزات
النصف الموجه لتقنية المعلومات من الإصدار ليس فكرة لاحقة. عندما تكون ميزات الذكاء الاصطناعي غير متاحة، يذكر المحرر الآن الحد الأدنى من الإصدار المطلوب بدلاً من مطالبة عامة بالتحديث. يمكن للمسؤولين تعيين طبقة افتراضية لنموذج Auto. إعداد OpenTelemetry جديد يربط استخدام Copilot بالمطورين الأفراد.
اقرأ هذه الثلاثة معاً وستتضح الصورة. منصة تنسق عدة نماذج عبر عدة جولات تولّد تكاليف وقياساً عن بعد وأسئلة أذونات لم يولّدها الإكمال التلقائي أحادي النموذج قط. يتوقف نسب التكلفة عن كونه فضولاً مالياً ويصبح شرطاً مسبقاً للسماح للميزة بالاقتراب من الإنتاج.
كانت المراجعة متعددة النماذج ممارسة معيارية بين الفرق الهندسية الحريصة منذ فترة. تطلب من نموذج أن يكتب وآخر أن يبحث عن الأخطاء، أو تجرب نموذجاً سريعاً أولاً وتصعّد عندما يخيب المخرجات. يأخذ HydraFusion تلك العادة ويجعلها تلقائية، وهذا مريح ويزيل أيضاً قراراً أحبت بعض الفرق اتخاذه يدوياً.
كم من الوقت يجب أن تبقى ميزة المعاينة معاينة هو سؤال عادل. تصل الأدوات أسرع من السياسة حولها، وتوقع السعر هو أول ضحية. تشغيل Critique الذي يستدعي بهدوء نموذجين متقدمين على مستودع كبير يمكن أن ينفق مالاً حقيقياً قبل أن يلاحظ أحد. ما إذا كان HydraFusion سيتخرج ليصبح افتراضياً يعتمد أقل على ما إذا كان التوجيه يعمل، وأكثر على ما إذا كانت GitHub قادرة على جعل الفاتورة واضحة بما يكفي ليوقّع عليها أحد.
مقالات ذات صلة
صور المنتجات بالذكاء الاصطناعي تصطدم بجدار امتثال لم يحسبه أحد في التكلفة
كانت التكلفة تُقتبس دائمًا لكل عملية توليد. أما التكلفة الحقيقية فمسعّرة لكل أصل ينجو من المراجعة.
الروبوتات قادرة على أداء 74 بالمئة من العمل الجسدي، ولا يكاد أيّ منه يكون مجديًا اقتصاديًا
القدرة موجودة إلى حد كبير. أما الجدوى الاقتصادية فليست كذلك. أربعون عامًا للوصول إلى عشرة بالمئة ليست توقعًا يبرر الذعر.
نموذج وكيلي مفتوح الأوزان بحجم 744 مليار يظهر تحت ترخيص MIT
الترخيص هو التسويق. نموذج بـ744 مليار يمكن لأي شخص تنزيله يعيد ضبط حسابات الشراء مقابل البناء.
نماذج الفيديو الصينية بالذكاء الاصطناعي تدخل هوليوود: 73 لقطة من المؤثرات البصرية في مسلسل أمازون
ما يعبر الحدود ليست المسلسلات، بل الأدوات التي تُصنع بها.