حافظه HBM4 در حال تبدیل شدن به گلوگاه واقعی در طراحی تراشه‌های هوش مصنوعی است

اشتراک‌گذاری:
حافظه HBM4 در حال تبدیل شدن به گلوگاه واقعی در طراحی تراشه‌های هوش مصنوعی است

طی دو سال گذشته، گفت‌وگو درباره سخت‌افزار هوش مصنوعی حول محور FLOPS بوده است — یعنی اینکه یک تراشه در هر ثانیه چند تریلیون عملیات ممیز شناور می‌تواند پردازش کند. این چارچوب اکنون منسوخ شده است. در سال ۲۰۲۶، محدودیت اصلی برای آموزش و استنتاج هوش مصنوعی توان محاسباتی نیست، بلکه پهنای باند حافظه است. صنعت این پدیده را «دیوار حافظه» می‌نامد و HBM4 — جدیدترین نسل حافظه با پهنای باند بالا — تلاش فعلی برای شکستن این دیوار است، هرچند اعداد نشان می‌دهند که این یک راه‌حل موقتی است، نه یک راه‌حل اساسی.

چرا پهنای باند مانع اصلی است، نه توان محاسباتی

یک شتاب‌دهنده مدرن هوش مصنوعی می‌تواند در هر ثانیه ضرب‌ماتریس‌های بسیار بیشتری انجام دهد نسبت به اینکه بتواند داده را تغذیه کند. مدل‌های زبانی بزرگ با صدها میلیارد پارامتر برای هر توکن تولیدشده نیاز دارند تا حجم عظیمی از داده‌های وزنی را بین حافظه و هسته‌های محاسباتی جابه‌جا کنند. اگر حافظه نتواند همگام شود، سیلیکون محاسباتی گران‌قیمت بیکار می‌ماند و منتظر داده می‌ماند — مشکلی که مهندسان آن را «محدود به حافظه» می‌نامند. به همین دلیل پلتفرم Vera Rubin انویدیا با هشت انباشته HBM4 عرضه می‌شود که پهنای باند نظری ۲۲ ترابایت بر ثانیه و ظرفیت ۲۸۸ گیگابایت ارائه می‌دهد، و به همین دلیل رقیب آن یعنی MI400-series Instinct MI455X از AMD با ۱۲ انباشته HBM4 برای ظرفیت ۴۳۲ گیگابایت و پهنای باند ۱۹٫۶ ترابایت بر ثانیه مقابله می‌کند — جهشی ۱۴۵ درصدی نسبت به ۸ ترابایت بر ثانیه نسل قبلی MI350.

چه چیزی با HBM4 تغییر کرد

HBM4 عرض رابط حافظه را به ۲,۰۴۸ بیت در هر انباشته دو برابر کرده است (در مقایسه با گذرگاه باریک‌تر HBM3)، که باعث می‌شود هر انباشته به تنهایی حدود ۱٫۵+ ترابایت بر ثانیه پهنای باند و ظرفیت حداکثر ۴۸ گیگابایت داشته باشد. انباشتن چند عدد از این‌ها در کنار هم — همانطور که انویدیا و AMD هر دو انجام می‌دهند — ارقام دو رقمی ترابایت پهنای باند را که در بالا ذکر شد به دست می‌دهد. این یک به‌روزرسانی تدریجی نیست؛ بلکه یک بازطراحی ساختاری از نحوه ارتباط قالب‌های حافظه با لایه منطق پایه زیر آن‌هاست و این کار نیاز داشت که سامسونگ و SK Hynix هر دو در فوریه ۲۰۲۶ تولید انبوه را آغاز کنند، پس از آنکه سامسونگ یک بار به دلیل مشکلات بازده، عرضه خود را به تعویق انداخته بود.

مشکل عرضه که هیچکس درباره آن صحبت نمی‌کند

بخشی که باید هر کسی را که روی زیرساخت هوش مصنوعی سرمایه‌گذاری می‌کند نگران کند این است: هر واحد از ظرفیت تولید HBM4 در سال ۲۰۲۶ از هر سه تأمین‌کننده — SK Hynix، سامسونگ و Micron — تا پایان سه‌ماهه اول ۲۰۲۶ قبلاً فروخته شده و توسط انویدیا، AMD و تیم TPU گوگل رزرو شده بود. SK Hynix حدود ۵۰-۵۵ درصد سهم بازار دارد، سامسونگ ۳۵-۴۰ درصد و Micron با فاصله زیاد ۵-۱۰ درصد، درحالی‌که Micron اکنون در حال افزایش ظرفیت به ۱۵,۰۰۰ ویفر اختصاصی تا پایان سال است. قیمت‌گذاری این کمبود را منعکس می‌کند: HBM3 حدود ۲۰۰ دلار برای هر انباشته، HBM3E حدود ۳۰۰ دلار و HBM4 حدود ۵۰۰ دلار است — حق‌الزحمه‌ای که در صورت‌حساب مواد اولیه هر شتاب‌دهنده هوش مصنوعی و نهایتاً در قیمت ساعات GPU که ارائه‌دهندگان ابری دریافت می‌کنند، لحاظ می‌شود.

این موضوع اهمیت دارد زیرا شکل رقابت در هوش مصنوعی پیشرو را تغییر می‌دهد. یک استارت‌آپ یا ارائه‌دهنده ابری سطح متوسط نمی‌تواند صرفاً برای افزایش مقیاس، HBM4 بیشتری سفارش دهد — ویفرها یک سال قبل رزرو شده‌اند. ظرفیت محاسباتی به‌طور فزاینده‌ای نه با طراحی تراشه، بلکه با قراردادهای عرضه حافظه که ۱۲-۱۸ ماه زودتر امضا شده‌اند، محدود می‌شود.

این برای خریداران و سازندگان چه معنایی دارد

اگر در سال ۲۰۲۶ زیرساخت هوش مصنوعی را ارزیابی می‌کنید، پهنای باند حافظه به ازای هر دلار اکنون معیار مقایسه مفیدتری نسبت به TFLOPS خام است. یک GPU با توان محاسباتی بیشتر اما پهنای باند حافظه محدود، در بارهای کاری واقعی عملکرد ضعیف‌تری نسبت به طراحی متعادل‌تر خواهد داشت، به‌ویژه برای سرویس استنتاج که تولید توکن به شدت محدود به حافظه است. تیم‌هایی که سرویس‌های استنتاج با زمینه بزرگ یا توان عملیاتی بالا می‌سازند باید توکن‌های واقعی در ثانیه تحت بار را معیار قرار دهند، نه اینکه به مشخصات اوج FLOPS اعتماد کنند، زیرا شکاف بین عملکرد نظری و واقعی اکنون عمدتاً داستانی از پهنای باند حافظه است.

برای هر کسی که قراردادهای چندساله GPU یا ابری را نهایی می‌کند، باید در نظر بگیرد که محدودیت‌های عرضه HBM4 ساختاری هستند، نه موقتی — انتظار داشته باشید فشار قیمت و کمبود تخصیص حداقل تا سال ۲۰۲۷ ادامه یابد تا زمانی که کارخانه‌های تولیدی ظرفیت را افزایش دهند. جهش واقعی بعدی تنها از یک مشخصه سریع‌تر HBM5 حاصل نخواهد شد؛ بلکه از تغییرات معماری — مانند نزدیک‌تر کردن حافظه به محاسبات از طریق بسته‌بندی چیپلت یا بررسی حافظه درون‌محاسباتی — که میزان داده‌ای که نیاز به جابه‌جایی دارد را کاهش می‌دهد، به دست خواهد آمد.

اشتراک‌گذاری:
گلوگاه حافظه HBM4: چرا پهنای باند از FLOPS مهم‌تر شد | AIO APEX