شريحة الذاكرة أصبحت الآن عنق الزجاجة في حوسبة الذكاء الاصطناعي

لم يكن الحدث الأكثر كشفًا في مجال عتاد الذكاء الاصطناعي هذا الشهر عملية إطلاق، بل اجتماعًا: ليزا سو، الرئيسة التنفيذية لشركة AMD، تجلس وجهًا لوجه مع رئيس قسم أشباه الموصلات في سامسونج. وعندما يلتقي مديران تنفيذيان بهذا المستوى، فنادرًا ما يكون الموضوع المطروح على الطاولة شراكة تسويقية. إنه الإمداد.
وما كانا يناقشانه، وفقًا لتقرير نشرته بلومبرغ، هو الذاكرة عالية النطاق الترددي. وHBM هي الذاكرة المكدّسة التي توضع بجوار مسرّع الذكاء الاصطناعي وتغذّيه بالبيانات بسرعة تكفي لإبقاء الشريحة مشغولة. وتنتجها ثلاث شركات هي SK Hynix وسامسونج وميكرون، وتملك SK Hynix حاليًا الحصة المهيمنة من إمدادات HBM3E التي تستخدمها Nvidia. وإذا أردت أن تفهم لماذا صارت حوسبة الذكاء الاصطناعي نادرة، فالجواب يتعلق بشكل متزايد بشرائح المنطق أقل، وبمن يستطيع تكديس الذاكرة بشكل موثوق وبكميات كبيرة أكثر.
لماذا تحدد HBM عدد الوحدات المشحونة
لا يكون مسرّع الذكاء الاصطناعي مفيدًا إلا بقدر نطاق الذاكرة الترددي المرتبط به. فتوليد الرموز (tokens) كثيف الاستهلاك للذاكرة: إذ يقرأ النظام أوزان النموذج وذاكرة القيم الأساسية مرارًا وتكرارًا، لذا تهم ذاكرة SRAM على الشريحة ومحلية الوصول إلى الذاكرة أكثر مما تهم كثافة الحوسبة الخام. ولهذا فإن رقم الفلوبس (FLOPS) المعلن لشريحة ما يخبرك عن تكلفة الاستدلال بأقل مما تخبرك به تهيئتها للذاكرة، ولهذا اتجهت خارطة طريق Nvidia نفسها نحو التنافس على سعة الذاكرة والحرارة.
وتوضح مشكلة سامسونج حجم الرهان. فقد عانت الشركة من مردودات منخفضة في إنتاج HBM أدت إلى تأخير تأهيلها ضمن سلسلة توريد Nvidia. وبالنسبة إلى AMD، فإن تعميق العلاقة يشكل تحوطًا. فإذا تمكنت من تثبيت تخصيص تفضيلي لذاكرة HBM من سامسونج، فستحصل خارطة طريق سلسلة MI لديها على ميزة تنافسية لا تعتمد على المورّد نفسه الذي ارتبط به منافسها بالفعل.
وتُظهر المواصفات إلى أي حد غدت الذاكرة هي النقطة الجوهرية. يستخدم معالج MI450 من AMD معمارية CDNA 5 على عملية 2 نانومتر من TSMC، ويحمل ما يصل إلى 432 غيغابايت من HBM4 لكل شريحة. ولهذا الرقم وزن حقيقي: فهو الفارق بين تشغيل نموذج كبير من نوع خليط الخبراء على مسرّع واحد وبين الاضطرار إلى تقسيمه على عدة مسرّعات، وهو ما يضاعف فاتورة العتاد وتعقيد الشبكات معًا.
لماذا يقود الاستدلال، لا التدريب، هذا الضغط
يحظى التدريب بالاهتمام، لكن الاستدلال هو من يحدد الطلب على الذاكرة. فعمليات التدريب مشاريع محدودة تنتهي، أما الاستدلال فيستمر إلى الأبد ويتوسع مع المستخدمين. ويتطلب توليد رمز واحد قراءة أوزان النموذج وذاكرة القيم الأساسية من الذاكرة، وتنمو هذه الذاكرة مع طول السياق، لذا تستهلك محادثة طويلة ذاكرة أكبر لكل مستخدم من محادثة قصيرة. والمحللون الذين يقدّرون أن مستخدم الذكاء الاصطناعي يستهلك نحو خمسة أضعاف الرموز التي يستهلكها مستخدم خدمة عادية إنما يصفون آلة عليها أن تحتفظ بحالة أكبر بكثير لكل شخص.
والإجابة المعمارية التي يقدمها القطاع هي التفكيك: أي فصل مرحلة المعالجة الأولية، التي تعالج التوجيه، عن مرحلة فك الترميز، التي تولّد الرموز، بحيث تعمل كل منهما على عتاد يناسب خصائصها. وقد أُفيد أن AMD وCerebras تعملان على اقتران يجمع بين معالجة عالية الإنتاجية وتوليد منخفض الكمون. وهذا يساعد على مستوى الحامل ولا يقدم شيئًا لإمدادات شرائح الذاكرة التي يحتاجها النصفان معًا. وإلى أن تتحسن مردودات التغليف لدى المورّدين الثلاثة، فإن كل حيلة معمارية تشتري الكفاءة دون أن تخفف القيد.
AMD تتجاوز تريليون دولار بفضل طلبات العتاد
وجاء الخبر التجاري في النافذة الزمنية نفسها. فقد أغلقت AMD عند مستوى قياسي بلغ 633.91 دولارًا في الثاني من أكتوبر، لترفع قيمتها السوقية فوق تريليون دولار، مسجلةً مكسبًا يتجاوز 180 بالمئة خلال العام. ولدى هذا الصعود سبب محدد لا مزاج عام. فقد التزمت OpenAI ببناء بقدرة ستة غيغاواط وعلى مدى عدة أجيال يتمركز حول MI450، مع بدء النشر في النصف الثاني من 2026، وأمر شراء (warrant) يسمح بشراء ما يصل إلى 160 مليون سهم من AMD مرتبط بمحطات إنجاز. وانضمت Oracle كشريك إطلاق لعنقود فائق يستخدم 50,000 وحدة معالجة رسومية من MI450 بدءًا من الربع الثالث.
اقرأ البنية وستجدها تبدو أقرب إلى ترتيب تمويلي منها إلى طلب شرائح. فأمر الشراء المرتبط بمحطات النشر يمنح المشتري حصة ملكية في نجاح المورّد، وهو أسلوب لمواءمة الحوافز عندما تكون الأحجام كبيرة بما يقلق الطرفين. وتنفذ Nvidia لعبة موازية، إذ تخطط لما لا يقل عن عشرة غيغاواط من أنظمتها الخاصة لصالح OpenAI مع استثمار محتمل يصل إلى 100 مليار دولار. فديناميكية المورّدين لم تعد استراتيجية شراء. إنها هيكل مشروع مشترك.
نتائج ميكرون الفصلية وحجة الدورة الفائقة
وقد أرسلت أرباح الذاكرة الإشارة نفسها من الجهة الأخرى. فنتائج ميكرون الفصلية جاءت أعلى بكثير من التوقعات بفضل الطلب على HBM وDRAM المدفوع بالذكاء الاصطناعي، ووصفت عدة مؤسسات اللحظة بأنها بداية دورة فائقة في الذاكرة لا مجرد ارتفاع عابر. ومن الحجج الداعمة لذلك الاستهلاك. فالمحللون المتتبعون لأحمال عمل الاستدلال يضعون استهلاك الرموز لكل مستخدم ذكاء اصطناعي عند نحو خمسة أضعاف مستهلك يتصفح خدمة عادية، وهو ما يعيد تصنيف الذاكرة من تكلفة مكوّن إلى تكلفة تشغيل لكل مستخدم.
وذلك مهم لكيفية انحلال النقص. فسعة المنطق يمكن إضافتها ببناء مصانع أشباه الموصلات، وهو ما يستغرق عامين تقريبًا. أما سعة HBM فالأمر أصعب لأنها تعتمد على التغليف المتقدم وعلى مردودات التكديس التي لم يتعلم إتقانها سوى عدد قليل من المورّدين. ومشكلات المردود لدى سامسونج ليست فشلًا إداريًا بقدر ما هي دليل على ضيق القاعدة الماهرة. وإضافة مورّد ثالث مؤهل مشروع يستغرق سنوات، ومنحنى الطلب لا ينتظر.
النسخة المكتبية من القصة نفسها
ويظهر هذا القيد في عوامل شكل أصغر أيضًا. فقد أظهر GB300 Blackwell Ultra من Nvidia أكثر من 2.2 مليار رمز يوميًا في اختبارات مكتبية مع شبكات بسرعة 800 جيجابت في الثانية، وهو رقم لافت لآلة تجلس تحت مكتب. وهي أيضًا آلة يُحدد سعرها جزئيًا بمقدار الذاكرة التي يمكن حشرها فيها. فالفيزياء ذاتها التي تحدّ من حامل مركز البيانات تحدّ من محطة العمل.
والجواب الأطول أجلًا الذي تراهن عليه الشركات هو معمارية. فمنصة Vera Rubin من Nvidia، التي كُشفت في معرض CES، تقرن وحدات معالجة Rubin بوحدات معالجة Vera، مع شبكات التوسع NVLink ومجموعة برمجيات كاملة، وتدفع الشركة نحو مقاييس مثل الرموز في الثانية لكل واط بدلًا من الفلوبس الخام. كما فتحت واجهة الربط الخاصة بها عبر NVLink Fusion، لتتيح للشركاء دمج وحدات المعالجة المركزية والشرائح الخاصة بهم. وهناك أيضًا مسعى مُفاد به لتطوير متحكم ذاكرة مخصص، وهو إشارة إلى أن الشركة تتوقع أن يبقى إمداد الذاكرة متغيرًا استراتيجيًا لا سلعة تُشترى.
ما ينبغي متابعته
ثلاثة أمور ستحدد ما إذا كان قيد الذاكرة سيتراخى أم سيتفاقم حتى 2027. الأول هو الجدول الزمني لتأهيل سامسونج لـ HBM4 مع كل من AMD وNvidia، لأن وجود مورّد ثالث مؤهل فعلًا يغيّر ديناميكية التسعير أكثر من أي إطلاق منتج منفرد. والثاني هو ما إذا كانت ميكرون ستقلّص الفجوة كمورّد بديل، وهو ما سيخفف الضغط عن المورّدين الكوريين. والثالث هو ما إذا كان الاستدلال المفكك، حيث تعمل معالجة التوجيه وتوليد الرموز على أنواع مختلفة من المسرّعات، سيصبح شائعًا بما يكفي لتقليل ضغط الذاكرة على أي شريحة بمفردها.
ولا يُحل أي من ذلك بسرعة. وفي غضون ذلك، فالخلاصة العملية لأي شخص يشتري أو يبني على حوسبة الذكاء الاصطناعي هي أن الذاكرة، لا الحوسبة، هي الرقم الذي سيحرك تكاليفك. فخارطة طريق المنطق علنية ويمكن التنبؤ بها. أما خارطة طريق الذاكرة فتتقيد بمردودات التغليف، وقاعدة مواهب تستغرق سنوات، وخطط رأسمالية لثلاث شركات، وهي التي كانت تحدد فعليًا عدد المسرّعات التي تُشحن.
مقالات ذات صلة
موسيقى الذكاء الاصطناعي حصلت على ترخيص. اقرأ ما الذي تغطيه فعلاً.
المقاطع الرخيصة ما زالت موجودة. ما يختفي هو الافتراض بأن مقطعًا مولَّدًا من أمر نصي خالٍ من المطالبات، وهو ما لم يكن صحيحًا يومًا وأصبح الآن خاطئًا بشكل واضح.
استوديوهات هينغديان فارغة بينما يعمل خط إنتاج الأفلام بالذكاء الاصطناعي في آسيا
مسارح هينغديان الفارغة هي الدليل على أن الصناعة وضعت رهانها بالفعل، سواء وافق الجمهور أم لا.
جوجل تشتري 890 ميجاواط من الطاقة النووية لتغذية مراكز بياناتها
القدرة الحاسوبية متاحة. أما الكهرباء فهي الشيء الذي يجب ترتيبه قبل سنوات، بالطريقة التي تُرتّب بها سلسلة التوريد.
ميتا توصلت إلى تسوية دعوى الكتب. الإذن الآن له ثمن.
تسوية ميتا تُزيل معلمًا واحدًا من الخريطة. لكنها لا ترسم بقيتها، والتسويات القليلة المقبلة ستحدد ما إذا كان الإذن سيصبح سوقًا أم سيبقى سلسلة من الاستثناءات.