استخر حافظه CXL به مراکز داده اجازه میدهد RAM را بهعنوان منبعی مشترک ببینند، نه سیلوی هر سرور

برای چهل سال، حافظه سرور به یک شکل کار کرده است: DRAM میخرید، آن را در یک ماشین نصب میکنید و اگر آن ماشین از تمام ظرفیت استفاده نکند، مازاد بلااستفاده میماند. Compute Express Link (CXL) 3.0 این مدل را میشکند. سوییچهای فابریک با پشتیبانی از استخر حافظه چندهاستی CXL 3.0 اکنون در محیطهای colocation و سرور اختصاصی پیشرو در حال اجرا هستند و تأثیر آن بر نحوه برنامهریزی ظرفیت مراکز داده بسیار بزرگتر از نام خشک این استاندارد است.
ایده اصلی ساده است: نرخ استفاده از حافظه در یک ناوگان معمولی سرور بین ۴۰ تا ۵۵ درصد است، چون ظرفیت برای اوج بار هر سرور بهصورت جداگانه تأمین میشود، نه برای کل ناوگان. استخر CXL این ظرفیت محبوسشده را به استخری مشترک تبدیل میکند که هر هاست روی فابریک میتواند بهصورت پویا از آن استفاده کند. بنچمارکهای خود سامسونگ روی استقرارهای مبتنی بر استخر CXL نشان میدهد نرخ استفاده پس از جداسازی حافظه از سرورهای مجزا به ۷۵ تا ۹۰ درصد میرسد.
چه چیزی واقعاً در CXL 3.0 تغییر کرد
نسخههای قبلی CXL (۱.۱، ۲.۰) به یک هاست امکان میدادند یک توسعهدهنده حافظه خارجی را از طریق PCIe متصل کند — مفید برای افزودن ظرفیت به یک ماشین، اما نه برای اشتراکگذاری آن. CXL 3.0 توپولوژی فابریک و سازگاری چندهاستی را اضافه میکند، به این معنا که یک سوییچ میتواند بین استخری از ماژولهای حافظه و یک رک از سرورها قرار بگیرد، ظرفیت را بر اساس تقاضا توزیع کند و پس از پایان یک بار کاری آن را بازپس بگیرد. این استاندارد با سرعت فابریک PCIe 6.0 اجرا میشود که تأخیر دسترسی به حافظه استخرشده را به اندازهای پایین نگه میدارد که برای بارهای کاری واقعی قابل استفاده باشد، نه فقط برای لایهبندی ذخیرهسازی سرد.
سوییچ Structera S 30260 از Marvell یکی از نخستین قطعات تجاری است که این قابلیت را در مقیاس رک پیادهسازی میکند. پلتفرم Xeon 6 اینتل از قبل با پشتیبانی بومی از توسعهدهنده حافظه CXL عرضه میشود و کرنل لینوکس از نسخه ۶.۱ به بعد بهصورت بومی از دستگاههای CXL پشتیبانی میکند — یعنی زیرساخت سطح سیستمعامل برای استفاده واقعی از حافظه استخرشده در تولید دیگر مانعی نیست که دو سال پیش بود.
زاویه هوش مصنوعی: تخلیه KV cache
بار کاری که استخر CXL را از آزمایشگاه به بودجههای تولیدی میکشاند، مجازیسازی همهمنظوره نیست — بلکه inference مدلهای زبانی بزرگ است. سرویسدهی LLM برای هر مکالمه فعال، یک KV cache روبهرشد در حافظه نگه میدارد و این کش با طول context و تعداد نشستهای همزمان مقیاس میگیرد. HBM روی GPU برای نگهداری KV cache سرد یا کند-رشد بیش از حد گران و کمیاب است، اما نگهداری آن در یک لایه استخرشده CXL تأخیری نزدیک به DRAM با کسری از هزینه هر گیگابایت ارائه میدهد. سامسونگ بنچمارکهایی مشخصاً درباره تخلیه KV cache به خط محصول CMM-D (CXL Memory Module–DRAM) خود منتشر کرده و هدفگذاری کرده تا تولید انبوه ماژول CMM-D 3.0 سازگار با CXL 3.2 را تا پایان ۲۰۲۶ آغاز کند.
این موضوع اهمیت دارد چون هزینه inference، نه هزینه training، چیزی است که بیشتر سازمانها پس از استقرار یک مدل واقعاً برای آن پول میپردازند. لایه حافظهای که به یک خوشه inference امکان میدهد نشستهای طولانیتر همزمان بیشتری را بدون خرید متناسب HBM بیشتر سرویس دهد، مستقیماً هزینه هر پرسوجو در اجرای هوش مصنوعی در مقیاس بزرگ را کاهش میدهد.
این برای خریداران چه معنایی دارد
Micron علناً گفته است که DRAM اکنون محدودیتی الزامآور برای مشتریانش شده — تقاضای بارهای کاری هوش مصنوعی از رشد عرضه پیشی گرفته و استخر CXL یکی از معدود اهرمهای کوتاهمدتی است که ظرفیت مؤثر حافظه را بدون نیاز به DRAM فیزیکی بیشتر افزایش میدهد. برای خریداران زیرساخت، این چند پیامد عملی دارد:
- برنامهریزی ظرفیت از سطح هر سرور به سطح فابریک منتقل میشود. بهجای اضافهتجهیز هر ماشین برای اوج مصرف خودش، تیمها میتوانند استخر را برای اوج تجمیعی ناوگان تأمین کنند که تقریباً همیشه کمتر از مجموع اوجهای فردی است.
- محاسبه TCO تغییر میکند. آمار فروشندگان کاهش بیش از ۶۰ درصدی هزینه کل مالکیت حافظه را در صورت استخرسازی صحیح ادعا میکند — که عمدتاً ناشی از نخریدن DRAMای است که ۶۰ درصد اوقات بلااستفاده میماند.
- سوییچ فابریک به یک قلم بودجه واقعی تبدیل میشود. Marvell و Astera Labs و دیگران سیلیکون سوییچ CXL را بهعنوان یک جزء مجزای رک عرضه میکنند، نه ویژگیای که با سرور بستهبندی شود. بودجه و فضای رک را متناسب با آن در نظر بگیرید.
استخر CXL جایگزین DRAM محلی برای دادههای حساس به تأخیر نخواهد شد — هیچچیز از حافظهای که فیزیکاً به سوکت CPU متصل است بهتر نیست. اما برای سهم روبهرشدی از حافظه که سرد، ناپیوسته یا بین یک کلاس بار کاری مشترک است (KV cache، کشهای حافظه، buffer pool)، استخرسازی اکنون گزینهای آماده تولید است، نه یک دموی تحقیقاتی. تیمهایی که inference را در هر مقیاس معناداری اجرا میکنند باید پیش از سفارش خرید بعدی DRAM خود، یک لایه استخرشده CXL 3.0 را ارزیابی کنند، نه پس از آن.