استخر حافظه CXL به مراکز داده اجازه می‌دهد RAM را به‌عنوان منبعی مشترک ببینند، نه سیلوی هر سرور

اشتراک‌گذاری:
استخر حافظه CXL به مراکز داده اجازه می‌دهد RAM را به‌عنوان منبعی مشترک ببینند، نه سیلوی هر سرور

برای چهل سال، حافظه سرور به یک شکل کار کرده است: DRAM می‌خرید، آن را در یک ماشین نصب می‌کنید و اگر آن ماشین از تمام ظرفیت استفاده نکند، مازاد بلااستفاده می‌ماند. Compute Express Link (CXL) 3.0 این مدل را می‌شکند. سوییچ‌های فابریک با پشتیبانی از استخر حافظه چندهاستی CXL 3.0 اکنون در محیط‌های colocation و سرور اختصاصی پیشرو در حال اجرا هستند و تأثیر آن بر نحوه برنامه‌ریزی ظرفیت مراکز داده بسیار بزرگ‌تر از نام خشک این استاندارد است.

ایده اصلی ساده است: نرخ استفاده از حافظه در یک ناوگان معمولی سرور بین ۴۰ تا ۵۵ درصد است، چون ظرفیت برای اوج بار هر سرور به‌صورت جداگانه تأمین می‌شود، نه برای کل ناوگان. استخر CXL این ظرفیت محبوس‌شده را به استخری مشترک تبدیل می‌کند که هر هاست روی فابریک می‌تواند به‌صورت پویا از آن استفاده کند. بنچمارک‌های خود سامسونگ روی استقرارهای مبتنی بر استخر CXL نشان می‌دهد نرخ استفاده پس از جداسازی حافظه از سرورهای مجزا به ۷۵ تا ۹۰ درصد می‌رسد.

چه چیزی واقعاً در CXL 3.0 تغییر کرد

نسخه‌های قبلی CXL (۱.۱، ۲.۰) به یک هاست امکان می‌دادند یک توسعه‌دهنده حافظه خارجی را از طریق PCIe متصل کند — مفید برای افزودن ظرفیت به یک ماشین، اما نه برای اشتراک‌گذاری آن. CXL 3.0 توپولوژی فابریک و سازگاری چندهاستی را اضافه می‌کند، به این معنا که یک سوییچ می‌تواند بین استخری از ماژول‌های حافظه و یک رک از سرورها قرار بگیرد، ظرفیت را بر اساس تقاضا توزیع کند و پس از پایان یک بار کاری آن را بازپس بگیرد. این استاندارد با سرعت فابریک PCIe 6.0 اجرا می‌شود که تأخیر دسترسی به حافظه استخرشده را به اندازه‌ای پایین نگه می‌دارد که برای بارهای کاری واقعی قابل استفاده باشد، نه فقط برای لایه‌بندی ذخیره‌سازی سرد.

سوییچ Structera S 30260 از Marvell یکی از نخستین قطعات تجاری است که این قابلیت را در مقیاس رک پیاده‌سازی می‌کند. پلتفرم Xeon 6 اینتل از قبل با پشتیبانی بومی از توسعه‌دهنده حافظه CXL عرضه می‌شود و کرنل لینوکس از نسخه ۶.۱ به بعد به‌صورت بومی از دستگاه‌های CXL پشتیبانی می‌کند — یعنی زیرساخت سطح سیستم‌عامل برای استفاده واقعی از حافظه استخرشده در تولید دیگر مانعی نیست که دو سال پیش بود.

زاویه هوش مصنوعی: تخلیه KV cache

بار کاری که استخر CXL را از آزمایشگاه به بودجه‌های تولیدی می‌کشاند، مجازی‌سازی همه‌منظوره نیست — بلکه inference مدل‌های زبانی بزرگ است. سرویس‌دهی LLM برای هر مکالمه فعال، یک KV cache روبه‌رشد در حافظه نگه می‌دارد و این کش با طول context و تعداد نشست‌های همزمان مقیاس می‌گیرد. HBM روی GPU برای نگه‌داری KV cache سرد یا کند-رشد بیش از حد گران و کمیاب است، اما نگه‌داری آن در یک لایه استخرشده CXL تأخیری نزدیک به DRAM با کسری از هزینه هر گیگابایت ارائه می‌دهد. سامسونگ بنچمارک‌هایی مشخصاً درباره تخلیه KV cache به خط محصول CMM-D (CXL Memory Module–DRAM) خود منتشر کرده و هدف‌گذاری کرده تا تولید انبوه ماژول CMM-D 3.0 سازگار با CXL 3.2 را تا پایان ۲۰۲۶ آغاز کند.

این موضوع اهمیت دارد چون هزینه inference، نه هزینه training، چیزی است که بیشتر سازمان‌ها پس از استقرار یک مدل واقعاً برای آن پول می‌پردازند. لایه حافظه‌ای که به یک خوشه inference امکان می‌دهد نشست‌های طولانی‌تر همزمان بیشتری را بدون خرید متناسب HBM بیشتر سرویس دهد، مستقیماً هزینه هر پرس‌وجو در اجرای هوش مصنوعی در مقیاس بزرگ را کاهش می‌دهد.

این برای خریداران چه معنایی دارد

Micron علناً گفته است که DRAM اکنون محدودیتی الزام‌آور برای مشتریانش شده — تقاضای بارهای کاری هوش مصنوعی از رشد عرضه پیشی گرفته و استخر CXL یکی از معدود اهرم‌های کوتاه‌مدتی است که ظرفیت مؤثر حافظه را بدون نیاز به DRAM فیزیکی بیشتر افزایش می‌دهد. برای خریداران زیرساخت، این چند پیامد عملی دارد:

  • برنامه‌ریزی ظرفیت از سطح هر سرور به سطح فابریک منتقل می‌شود. به‌جای اضافه‌تجهیز هر ماشین برای اوج مصرف خودش، تیم‌ها می‌توانند استخر را برای اوج تجمیعی ناوگان تأمین کنند که تقریباً همیشه کمتر از مجموع اوج‌های فردی است.
  • محاسبه TCO تغییر می‌کند. آمار فروشندگان کاهش بیش از ۶۰ درصدی هزینه کل مالکیت حافظه را در صورت استخرسازی صحیح ادعا می‌کند — که عمدتاً ناشی از نخریدن DRAM‌ای است که ۶۰ درصد اوقات بلااستفاده می‌ماند.
  • سوییچ فابریک به یک قلم بودجه واقعی تبدیل می‌شود. Marvell و Astera Labs و دیگران سیلیکون سوییچ CXL را به‌عنوان یک جزء مجزای رک عرضه می‌کنند، نه ویژگی‌ای که با سرور بسته‌بندی شود. بودجه و فضای رک را متناسب با آن در نظر بگیرید.

استخر CXL جایگزین DRAM محلی برای داده‌های حساس به تأخیر نخواهد شد — هیچ‌چیز از حافظه‌ای که فیزیکاً به سوکت CPU متصل است بهتر نیست. اما برای سهم روبه‌رشدی از حافظه که سرد، ناپیوسته یا بین یک کلاس بار کاری مشترک است (KV cache، کش‌های حافظه، buffer pool)، استخرسازی اکنون گزینه‌ای آماده تولید است، نه یک دموی تحقیقاتی. تیم‌هایی که inference را در هر مقیاس معناداری اجرا می‌کنند باید پیش از سفارش خرید بعدی DRAM خود، یک لایه استخرشده CXL 3.0 را ارزیابی کنند، نه پس از آن.

اشتراک‌گذاری:
استخر حافظه CXL به مراکز داده اجازه می‌دهد RAM را به‌عنوان منبعی مشترک ببینند، نه سیلوی هر سرور | AIO APEX