اقتصاديات غريبة لرقائق الذكاء الاصطناعي: رفوف جديدة تخفض التكاليف بينما تزداد الرقائق القديمة تكلفة

حدث أمران في عالم عتاد الذكاء الاصطناعي في سبتمبر، ويبدوان وكأنهما يشيران إلى اتجاهين متعاكسين. بدأت Nvidia في شحن أحدث أنظمة الرفوف (rack-scale) لديها إلى مزوّدي الخدمات السحابية الكبار، واعدةً باستدلال (inference) أرخص بشكل حاد. وفي الوقت نفسه، ارتفع سعر استئجار رقائق H100 البالغة من العمر ثلاث سنوات. كلا الأمرين صحيح، ومعًا يفسّران شيئًا عن كيفية عمل اقتصاد الذكاء الاصطناعي فعليًا.
الرفوف الجديدة
أكّدت Nvidia أن أنظمة رفوف Vera Rubin NVL144 تُشحن بكميات كبيرة، مع دخول أول عمليات نشر كبرى الخدمة لدى Microsoft وGoogle وAmazon وOracle، وقالت CoreWeave إن أول عناقيد Rubin لديها ستكون متاحة للعملاء قبل نهاية سبتمبر. هذا أكبر انتقال عتادي حاولت الصناعة القيام به، ليحل محل جيل Blackwell الذي شغّل معظم تدريب النماذج الرائدة على مدى العامين الماضيين.
البنية ليست شريحة واحدة. يقرن Vera Rubin وحدة معالجة مركزية Vera مع وحدتي معالجة رسومات Rubin لكل عقدة ويربط بينها بحيث يعمل الرف بأكمله كمعالج واحد كبير. تهيئة NVL144 تربط 144 وحدة GPU من Rubin عبر 72 عقدة في رف واحد، مع ذاكرة HBM4 لأول مرة في نظام إنتاجي ونطاق تمرير ذاكرة يبلغ نحو 13 تيرابايت في الثانية لكل GPU. تدّعي Nvidia نحو 3.6 إكسافلوب من أداء الاستدلال FP4 لكل رف، أي حوالي ثلاثة أضعاف رف Blackwell NVL72 مماثل. هذه أرقام في ظروف مثالية، وتقديرات مستقلة متحفظة تضع المكسب الواقعي أقرب إلى ضعفين إلى ضعفين ونصف.
الرقم المهم لكل من هو خارج مركز البيانات هو التكلفة لكل رمز (token). تشير التسعيرات السحابية المبكرة إلى أن حالات الاستخدام القائمة على Rubin قد تقلّل تكلفة استدلال Blackwell بنسبة 30 إلى 40 في المئة عند الإطلاق، مع انخفاض الأسعار عادةً أكثر مع توسّع السعة. ينعكس ذلك الرقم لاحقًا على سعر استدعاء API، وحجم الاشتراك، وما إذا كانت ميزة توليد الفيديو يمكن أن توجد داخل خطة بعشرين دولارًا.
الرقائق القديمة التي أصبحت أكثر تكلفة
إليك الجزء المناقض للحدس. في سبتمبر، ارتفع سعر الاستئجار بالساعة لرقاقة H100، الشريحة التي شغّلت الموجة الأولى من منتجات الذكاء الاصطناعي، بنسبة 22 في المئة ليصل إلى 3.28 دولار في الساعة. وأشار الرئيس التنفيذي لـ Nvidia إلى هذه الزيادة كدليل على أن القدرة الحاسوبية أصل معمر ومُدرّ للعائد، وليس شيئًا يتهالك وفق جدول زمني.
السبب هو العرض. يجري حجز رقائق Blackwell وRubin الجديدة لأكبر المشترين، ما يترك عناقيد H100 الأقدم تتعامل مع أعباء الاستدلال اليومية. الإمدادات الضيقة من الطاقة والذاكرة في مراكز البيانات تُبقي العتاد الأقدم مشغولًا وتُبقي أسعار الإيجار مرتفعة. لا تزال H100 أرخص بكثير مما كانت عليه عند الإطلاق، عندما استأجرتها شركات السحابة الكبرى مقابل سبعة إلى ثمانية دولارات في الساعة، لكن الارتفاع الأخير يخالف المحاسبة القياسية، التي تُخفّض قيمة الرقاقة على مدى خمس إلى ست سنوات.
لفتت هذه الفجوة الانتباه. جادل البائعون على المكشوف بأن أعمار الرقائق الفعلية أقصر مما تفترضه الجداول الرسمية، ما يعني أن الإهلاك في دفاتر مزوّدي السحابة بطيء أكثر من اللازم. سجّلت Nvidia إيرادات ربع سنوية قياسية بلغت 96.2 مليار دولار في أغسطس، ويمنح ارتفاع سعر الإيجار الشركة حجة جديدة على أن رقائقها تستمر في تحقيق العائد لفترة طويلة بعد أن تصبح قديمة.
سباق توسيع نطاق الرفوف الجديدة
سرعة الطرح تقول الكثير بقدر المواصفات. أصبحت CoreWeave أول مزوّد سحابي يشغّل العتاد الجديد على نطاق متعدد الرفوف، إذ أطلق سبعة رفوف Vera Rubin NVL72، أي 504 وحدات GPU إجمالًا، كعنقود إنتاجي واحد يمتد عبر منطقتين في 16 سبتمبر. الانتقال من رف واحد مُتحقق منه إلى نسيج متعدد الرفوف مهم لأن أعباء الذكاء الاصطناعي الوكيلي (agentic AI) تجري مكالمات صغيرة كثيرة حساسة لزمن الاستجابة، وتتراكم التأخيرات عبر تفاعلات متكررة مع النموذج والأدوات. يقرن كل رف NVL72 بين 72 وحدة GPU و36 وحدة معالجة مركزية Vera، وتدعم بنية النسيج نحو 128,000 وحدة GPU لكل مسار دون إعادة تصميم، ما يعني أن إضافة السعة تغيير في التهيئة لا إعادة بناء.
يبدو نمط الإمداد مختلفًا هذه المرة أيضًا. في جيل Blackwell، تجاوز الطلب العرض لدرجة أن مزوّدي السحابة الأصغر وبرامج الذكاء الاصطناعي الوطنية انتظروا ستة أشهر أو أكثر. رفعت Nvidia إنتاج Rubin في وقت أبكر، ويُقال إن عدة مشاريع ذكاء اصطناعي سيادية في أوروبا والشرق الأوسط ضمن موجة الشحن الأولى بدلًا من الثالثة. أعلنت Nvidia أيضًا شراكة مع مشغّلي السحابة ومراكز البيانات الأستراليين لبناء ما يصل إلى جيجاواطين من سعة مصانع الذكاء الاصطناعي بحلول 2027. إذا استمر ذلك، يصبح استئجار وقت GPU أسهل بشكل ملموس، ما يخفض منحنى التكلفة بأكمله للجميع في السلسلة.
لماذا كلا الأمرين صحيح
يتبدد التناقض الظاهري بمجرد فصل التدريب عن الاستدلال. يحتاج التدريب إلى أحدث وأكبر العناقيد، وهذا الطلب هو ما يبرر بناء رفوف مثل Vera Rubin. الاستدلال هو كل ما يفعله النموذج بعد تدريبه: كل رد من روبوت محادثة، وكل صورة مولّدة، وكل اقتراح برمجي. مع نمو الاستخدام، يمكن أن تصبح التكلفة المتكررة لخدمة تلك الطلبات أكبر من فاتورة التدريب الأصلية.
لهذا تفتح Nvidia جزءًا من منظومتها بدلًا من الدفاع عن كل مقبس. في 10 سبتمبر، أعلنت تعاونًا مع d-Matrix، وهي شركة ناشئة تبني رقائق مخصصة للاستدلال. بموجب الاتفاق، ستتصل رقائق Raptor من الجيل التالي من d-Matrix ببنية رفوف Nvidia عبر NVLink Fusion. صُممت Raptor لاستدلال الذكاء الاصطناعي، خصوصًا الأعمال منخفضة زمن الاستجابة مثل روبوتات المحادثة ومساعدي البرمجة ووكلاء الصوت، بتصميم محوري حول الذاكرة يهدف إلى خفض زمن الاستجابة والتكلفة. لا تتنازل Nvidia عن أي شيء كانت تملكه بالكامل، لأنها لا تزال تزوّد وحدات المعالجة المركزية والشبكات والمحوّلات والبرمجيات حول الرف، بينما تكسب موضعًا في سوق الاستدلال حتى لو لم تفز بكل مسرّع.
هناك قيد أصعب تحت كل هذا. يستهلك رف Vera Rubin NVL144 الواحد نحو 600 كيلوواط، أي ما يعادل تقريبًا طاقة 500 منزل متوسط. أصبحت الكهرباء، لا الرقائق، هي الحد المُقيّد لنمو الذكاء الاصطناعي، ولهذا وقّعت Microsoft وGoogle وAmazon جميعًا اتفاقيات طاقة نووية وجوفية حرارية في العام الماضي لتغذية عناقيد كهذه. إذا أردت معرفة إلى أين تتجه سعة الذكاء الاصطناعي، راقب اتفاقيات شراء الطاقة بدلًا من نتائج المعايير القياسية.
ماذا يعني ذلك لسعر الذكاء الاصطناعي
بالنسبة للمستخدمين، القراءة العملية هي أن تكلفة تشغيل نموذج يجب أن تستمر في الانخفاض، حتى مع بقاء تكلفة أحدث العتاد مرتفعة. الاستدلال الأرخص يجعل من الممكن أن تصبح الميزات التي كانت مكلفة للغاية العام الماضي معيارًا هذا العام. الإجابات الطويلة والمتأنية من روبوتات المحادثة، ومساعدو البرمجة الذين يقرؤون قاعدة شيفرة كاملة، وتوليد الفيديو عند الطلب، كلها تعتمد على انحناء منحنى التكلفة هذا نحو الأسفل.
السؤال الذي يظل المستثمرون يطرحونه هو ما إذا كان الإنفاق الهائل على مراكز البيانات سيدفع ثمن نفسه يومًا ما. Rubin جزء من الإجابة. إذا أصبح تشغيل النموذج نفسه أرخص بنحو الضعف كل ثمانية عشر شهرًا أو نحو ذلك، يبدأ الإنفاق يبدو أقل كفقاعة وأكثر كبنية تحتية. وإذا توقف ذلك المنحنى، يحصل المتشككون على لحظتهم. سيقول الربعان القادمان من تسعير السحابة أي اتجاه تسير الأمور، وسيصل إليك ذلك الرقم قبل أي معيار قياسي بكثير، في شكل تكلفة أدوات الذكاء الاصطناعي لديك.
مقالات ذات صلة
Claude Sonnet 5.5 أرخص بنسبة 30 في المئة. هذه قصة مشتريات، لا قصة نموذج.
عادة ما تُقاس ادعاءات خصم البائع مقابل حمل عمل تمثيلي، وحملك ليس تمثيلياً.
«إتش بي إي» تبيع أجهزة بقيمة 1.2 مليار دولار لأن الشبكة أصبحت جوهر الأمر
طلب بقيمة 1.2 مليار دولار بتوزيع غير معلن على خمس فئات ليس مماثلاً لإيرادات شبكات بقيمة 1.2 مليار دولار وبهامش ربح.
البرمجية الخبيثة التي تُحيل خطوتها التالية إلى تصويت أربعة نماذج
بنية القيادة والتحكم ليست سوى حفنة من واجهات برمجة التطبيقات العامة وخطاف ويب على Discord.
أتاحت شوبيفاي لوكلاء الذكاء الاصطناعي الضغط على زر الشراء. والتاجر لا يزال يتحمّل النزاع.
منصة الوكيل تتوسط في النية. والتاجر يحمل المخاطر.