معماری Blackwell از NVIDIA اقتصاد مراکز داده را بازنویسی می‌کند

اشتراک‌گذاری:
معماری Blackwell از NVIDIA اقتصاد مراکز داده را بازنویسی می‌کند

هنگامی که NVIDIA معماری Blackwell را در سال ۲۰۲۴ معرفی کرد و از سال‌های ۲۰۲۵ و ۲۰۲۶ عرضه آن را در مقیاس گسترده آغاز کرد، توجه‌ها نخست به اعداد Benchmark معطوف شد. اما این رویکرد، داستان مهم‌تر را نادیده می‌گرفت: Blackwell تنها عملکرد هوش مصنوعی را ارتقاء نداد، بلکه اقتصاد محاسبات هوش مصنوعی را چنان بازآرایی کرد که تمام لایه‌های این حوزه را تحت تأثیر قرار داد — از طراحی مراکز داده گرفته تا نحوه قیمت‌گذاری شرکت‌های هوش مصنوعی برای API های خود.

این صرفاً یک به‌روزرسانی محصول نیست؛ بلکه بازتعریف این است که چه کسی می‌تواند در خط مقدم هوش مصنوعی رقابت کند.

Blackwell واقعاً چه ارائه می‌دهد

GPU مدل B200 توان آموزش BF16 ای در حدود ۲۰ petaFLOPS ارائه می‌دهد که نسبت به نسل پیشین یعنی H100، افزایشی حدود ۲.۵ برابری را در محدوده توان مشابه نشان می‌دهد. اما رقم مهم‌تر، پهنای باند حافظه است: HBM3e در GB200 از طریق اتصال NVLink، ۸ ترابایت بر ثانیه پهنای باند ارائه می‌کند — تقریباً دو برابر سیستم‌های نسل Hopper.

مهم‌ترین تغییر معماری از دیدگاه طراحی مرکز داده این است که NVIDIA واحد بنیادی محاسبات را از سطح تراشه به سطح رک ارتقاء داده است. GB200 NVL72 یک سیستم رک با ۷۲ GPU است که ۱.۴ exaFLOPS محاسبات استنتاج هوش مصنوعی ارائه می‌دهد.

چالش مصرف برق که کمتر به آن پرداخته می‌شود

رک GB200 NVL72 تقریباً ۱۲۰ کیلووات مصرف می‌کند. یک استقرار متوسط شامل ۱۰ رک، معادل ۱.۲ مگاوات مصرف خواهد داشت. در مقیاس بزرگ، یک مرکز داده با ۱۰۰۰ رک به ۱۲۰ مگاوات توان نیاز دارد — تقریباً برابر با مصرف برق یک شهر کوچک. مراکز داده‌ای که در دوران Hopper ساخته شدند برای ۳۰ تا ۴۰ کیلووات در هر رک طراحی شده بودند. اکنون نیاز به سرمایه‌گذاری کلان به مانعی ساختاری برای ورود به این عرصه تبدیل شده است.

تأثیر بر اقتصاد

هزینه آموزش به ازای هر Token با هر نسل GPU به‌طور چشمگیری کاهش یافته است. برآوردها نشان می‌دهند که کاهش هزینه در گذار از H100 به B200، برای کیفیت معادل مدل، حدوداً ۵ تا ۱۰ برابر است. این امر قیمت‌های API را پایین آورده — OpenAI، Anthropic و Google هریک از سال ۲۰۲۳ تاکنون قیمت‌گذاری استنتاج را ۸۰ تا ۹۰ درصد کاهش داده‌اند. با این حال، ارزان‌تر شدن استنتاج در نهایت کل هزینه‌های هوش مصنوعی را افزایش داده است — این همان پارادوکس Jevons در محاسبات هوش مصنوعی است. مایکروسافت و Google هریک هزینه سرمایه‌ای بیش از ۸۰ میلیارد دلار برای سال ۲۰۲۵ پیش‌بینی کرده‌اند.

شکاف فزاینده میان ردیف‌های بازار

شرکتی که در سال ۲۰۲۲ با کلاسترهای H100 زیرساختی رقابتی برای آموزش هوش مصنوعی می‌ساخت، اکنون بدون ارتقاء به Blackwell از رقبا عقب می‌ماند. ابرهای کوچک‌تر نیز به سمت حجم کارهای استنتاج و تخصص‌های نیچ حرکت می‌کنند.

NVLink Fusion و بازی اکوسیستم

NVLink Fusion به تراشه‌های شخص ثالث — از جمله XPU های Marvell — اجازه می‌دهد به‌عنوان همتایان درجه اول به GPU های NVIDIA متصل شوند. این قابلیت NVIDIA را به هاب زیرساخت ترکیبی هوش مصنوعی تبدیل می‌کند.

نتیجه‌گیری‌های کاربردی

  • اجاره برای اکثر مقیاس‌های استنتاج بهتر از خرید است. اقتصاد اجاره GPU از یک ارائه‌دهنده ابری مجهز به Blackwell برای اکثر سازمان‌ها مقرون‌به‌صرفه‌تر از خرید مستقیم است.
  • کلاسترهای آموزشی حساب‌وکتاب متفاوتی دارند. آموزش در مقیاس مرزی با تقاضای پایدار ممکن است مالکیت سخت‌افزار را توجیه کند.
  • رقابت قیمتی میان hyperscaler ها را دنبال کنید. AWS، Azure و Google در حال رقابت برای استقرار Blackwell و کاهش قیمت‌های استنتاج هستند.
  • گلوگاه برق است، نه تراشه‌ها. ظرفیت برق و زیرساخت خنک‌سازی اکنون مهم‌ترین عامل محدودکننده در تصمیم‌گیری‌های مراکز داده است.

داستان سطحی Blackwell سرعت خام است. داستان واقعی این است که محاسبات هوش مصنوعی را سرمایه‌برتر، متمرکزتر و وابسته‌تر به زیرساخت انرژی کرده است.

اشتراک‌گذاری:
معماری Blackwell از NVIDIA اقتصاد مراکز داده را بازنویسی می‌کند | AIO APEX