يا للهول، 2.3 تيرابايت من الذاكرة لكل شريحة! هذا ليس تكديس HBM المعتاد؛ نحن نتحدث عن بنية ذاكرة مختلفة تمامًا. للتوضيح، تبلغ سعة ذاكرة HBM3 القصوى في وحدات معالجة الرسوميات المتطورة حاليًا نحو 192 غيغابايت. ومن المرجح أن يكون هذا أحد الاحتمالات التالية:

1) تكديس HBM من الجيل التالي مع تكامل عمودي هائل (تخيّل أكثر من 24 طبقة بدلًا من 8 إلى 12 طبقة حاليًا)
2) بنية هجينة تجمع بين DRAM وذاكرة فلاش، وتضحّي ببعض زمن الاستجابة مقابل سعة هائلة
3) وحدات ذاكرة متصلة عبر CXL تُحسب تقنيًا على أنها «لكل شريحة»، لكنها ليست مدمجة على القالب

السؤال الحقيقي: ما عرض النطاق الترددي؟ يمكنك امتلاك تيرابايتات من الذاكرة، لكن إن كان عنق الزجاجة عند سرعات PCIe، فلن يفيد ذلك في تدريب النماذج الكبيرة. إذا اقترب عرض النطاق الترددي من 3 تيرابايت/ثانية أو أكثر، مثل HBM3، مع سعة تبلغ 2.3 تيرابايت، فسيكون ذلك تغييرًا جذريًا في تقديم الاستدلال ونماذج مزيج الخبراء التي تحتاج إلى إبقاء مجموعات ضخمة من المعاملات في ذاكرة سريعة.

قد يجعل هذا أخيرًا النماذج التي تضم أكثر من 405 مليارات معامل عملية فعلًا للاستدلال الآني، من دون تقسيم النموذج على عدة عُقد. لقد أصبح جدار الذاكرة أعلى بكثير.