GPUهای مراکز داده به یک دیوار برق برخورده‌اند، نه دیوار پردازشی

اشتراک‌گذاری:
GPUهای مراکز داده به یک دیوار برق برخورده‌اند، نه دیوار پردازشی

در بیشتر سه سال گذشته، داستان زیرساخت هوش مصنوعی یک داستان تراشه بود: چه کسی می‌تواند تراشه گرافیکی کافی به‌دست آورد و چه زمانی. آن داستان تمام شده است. جدیدترین شتاب‌دهنده‌ها اکنون در حجم‌هایی موجودند که در سال ۲۰۲۳ غیرممکن به نظر می‌رسید، و محدودیت واقعی برای راه‌اندازی یک مرکز داده هوش مصنوعی جدید در سال ۲۰۲۶ دیگر سیلیکون نیست — برق است.

یک خوشه آموزش هوش مصنوعی کاملاً ساخته‌شده امروز می‌تواند به اندازه یک شهر متوسط برق مصرف کند. رساندن این مقدار برق به‌طور پایدار به یک محل، اکنون طولانی‌ترین بخش مسیر بحرانی برای یک تسهیلات جدید است و معمولاً از زمان ساخت و ارسال خود GPUها هم بیشتر طول می‌کشد.

مسئله صف انتظار

اتصال یک بار برقی بزرگ جدید به شبکه نیازمند یک مطالعه اتصال است، و در بیشتر آمریکا و بخش بزرگی از اروپا، صف این مطالعات حالا سه تا پنج سال طول می‌کشد. این بازه زمانی حتی با وجود انفجار تقاضا تغییر چندانی نکرده، چون اپراتورهای شبکه همان فرآیندهای بررسی زیست‌محیطی و مهندسی طراحی‌شده برای دنیایی را اجرا می‌کنند که در آن بارهای بزرگ جدید نادر بودند. یک شرکت بزرگ فناوری که می‌خواهد یک کمپین در مقیاس گیگاوات را در ۱۸ ماه راه‌اندازی کند، نمی‌تواند منتظر یک اتصال معمولی بماند. باید یا وارد یک اتصال شبکه موجود شود، برق خودش را در محل تولید کند، یا مکانی را انتخاب کند که ظرفیت آن به دلایل دیگری از قبل وجود داشته باشد.

چرا شرکت‌ها از شبکه عبور می‌کنند

این دلیل مستقیم موجی از قراردادهای تولید برق محلی و اختصاصی است که سال ۲۰۲۶ را تعریف کرده‌اند. توربین‌های گاز طبیعی که مستقیماً در کنار کمپین‌های مراکز داده جدید نصب می‌شوند، سریع‌ترین راه برای تأمین برق پایدار بدون انتظار در صف اتصال شده‌اند — حتی با وجود اینکه این کار با تعهدات عمومی که چند شرکت درباره انتشار گازهای گلخانه‌ای داده‌اند مغایرت دارد. انرژی هسته‌ای از یک موضوع بحث‌برانگیز به قراردادهای امضا‌شده تبدیل شده است: توافق‌های خرید برق بلندمدت با راکتورهای موجود، به‌علاوه فهرست رو به رشدی از قراردادهای راکتور ماژولار کوچک که برق را سال‌ها بعد تحویل می‌دهند، اما ظرفیت آینده را همین حالا که هنوز در دسترس است قفل می‌کنند. توافق‌های انرژی هسته‌ای آمازون و معاملات مشابه از دیگر شرکت‌های بزرگ فناوری، نه خیرخواهی‌اند و نه روابط‌عمومی. این‌ها پاسخ مستقیم به شبکه‌ای است که نمی‌تواند برق را در بازه زمانی متناسب با استقرار تراشه تحویل دهد.

اثر ثانویه، انتخاب محل است. کمپین‌های مرکز داده بیش از پیش بر اساس نزدیکی به ظرفیت تولید و انتقال برق موجود انتخاب می‌شوند، نه نزدیکی به فیبر، مشتریان یا زمین ارزان — اولویت‌هایی که قبلاً غالب بودند. منطقه‌ای با ظرفیت اضافی هیدروالکتریک، هسته‌ای یا گاز سرگردان، اکنون برای یک شرکت بزرگ فناوری ارزشمندتر از منطقه‌ای با اتصال خوب است، چون اتصال را می‌توان در چند ماه ساخت ولی یک پست برق جدید را نمی‌توان.

خنک‌سازی هم یک مسئله برق است، نه یک مسئله جدا

آخرین نسل شتاب‌دهنده‌های هوش مصنوعی بیش از ۱۰۰۰ وات به ازای هر تراشه مصرف می‌کند و تراکم رک‌ها به نقطه‌ای رسیده که خنک‌سازی هوایی دیگر نمی‌تواند گرما را به‌اندازه کافی سریع دفع کند. خنک‌سازی مایع — صفحات سرد مستقیم روی تراشه یا غوطه‌وری کامل — از یک گزینه خاص به یک الزام برای هر استقرار با چگالی بالا تبدیل شده است. این موضوع برای داستان برق اهمیت دارد چون خود سیستم‌های خنک‌سازی مایع سهم قابل‌توجهی از کل مصرف برق یک تسهیلات را می‌گیرند، و تبدیل یک تسهیلات خنک‌شده با هوا به خنک‌سازی مایع اغلب مخرب‌تر از ساخت جدید است. چند شرکت بزرگ فناوری ظرفیت موجود خنک‌شده با هوا را برای شتاب‌دهنده‌های نسل بعدی کنار گذاشته‌اند و به‌جای آن سالن‌های خنک‌شده با مایع جدید می‌سازند، که به‌جای حل مسئله برق، یک بازه زمانی ساخت چندساله دیگر روی آن اضافه می‌کند.

این برای بقیه صنعت چه معنایی دارد

شرکت‌هایی که ترازنامه کافی برای امضای یک قرارداد خرید برق ده‌ساله یا ساخت یک نیروگاه گاز ندارند، بیش از پیش از آموزش در مقیاس پیشرفته خارج می‌شوند و به سمت اجاره ظرفیت از ابرابرهای جدیدی (neo-cloud) که مسئله برق را حل کرده‌اند حرکت می‌کنند، یا روی بارهای کاری inference تمرکز می‌کنند که می‌توانند روی استقرارهای کوچک‌تر و توزیع‌شده‌تر اجرا شوند، جایی که سقف برق یک محل واحد کمتر اهمیت دارد. شکاف بین شرکت‌هایی که منبع برق خودشان را کنترل می‌کنند و شرکت‌هایی که محاسبات را ساعتی اجاره می‌کنند، به یکی از خط‌های اصلی تفکیک بین کسانی که واقعاً می‌توانند مدل‌های پیشرفته را آموزش دهند و کسانی که فقط می‌توانند آن‌ها را fine-tune و سرویس‌دهی کنند، تبدیل شده است.

نتیجه‌گیری عملی

  • وقتی یک ارائه‌دهنده ابری یا قرارداد colocation برای بارهای کاری هوش مصنوعی را ارزیابی می‌کنید، قبل از پرسیدن درباره موجودی GPU، درباره منبع برق و زمان‌بندی اتصال بپرسید — برق اکنون بیشتر احتمال دارد گلوگاه باشد.
  • انتظار داشته باشید تولید برق محلی (گاز، و به‌طور رو به رشد توافق‌های خرید برق هسته‌ای) به‌عنوان یک راه‌حل جایگزین برای صف‌های اتصال شبکه، نه یک راه‌حل موقت، همچنان گسترش یابد.
  • هزینه‌های تبدیل به خنک‌سازی مایع را در هر برنامه‌ای برای استقرار شتاب‌دهنده‌های نسل بعدی در تسهیلات موجود در نظر بگیرید — یک ساخت جدید اغلب ارزان‌تر از بازسازی است.
  • نزدیکی به تولید برق اضافی را به‌عنوان یک مزیت رقابتی واقعی در انتخاب محل، هم‌رده با اتصال فیبر، در نظر بگیرید.
  • برای بارهای کاری که به آموزش در مقیاس پیشرفته نیاز ندارند، استقرارهای inference توزیع‌شده را در نظر بگیرید که وابستگی به یک سایت بزرگ تک محدود به برق را از بین می‌برند.
اشتراک‌گذاری:
GPUهای مراکز داده به یک دیوار برق برخورده‌اند، نه دیوار پردازشی | AIO APEX