هندسة Blackwell من NVIDIA تعيد كتابة اقتصاديات مراكز البيانات

مشاركة:
هندسة Blackwell من NVIDIA تعيد كتابة اقتصاديات مراكز البيانات

عندما قدمت NVIDIA هندسة Blackwell في عام 2024 وبدأت شحنها على نطاق واسع عبر عامي 2025 و2026، تركز الحديث الأولي على أرقام Benchmark. هذا التأطير أغفل القصة الأهم: لم تقم Blackwell فقط بدفع أداء AI إلى أعلى، بل أعادت هيكلة اقتصاديات الحوسبة في AI بشكل أساسي، مما يفرض تغييرات في كل طبقة من الـ Stack — من تصميم مراكز البيانات إلى كيفية تسعير شركات AI لواجهات API الخاصة بها.

هذا ليس تحديثًا للمنتج. إنه إعادة تفاوض حول من يمكنه المنافسة على جبهة AI.

ما تقدمه Blackwell فعليًا

توفر وحدة B200 حوالي 20 petaFLOPS من إنتاجية التدريب BF16، أي تحسن بنحو 2.5 مرة عن سابقتها H100 ضمن أغلفة طاقة مماثلة. الرقم الأكثر أهمية هو عرض النطاق الترددي للذاكرة: HBM3e على GB200 يوفر 8 تيرابايت في الثانية عبر اتصال NVLink، أي ضعف عرض النطاق الترددي لأنظمة جيل Hopper تقريبًا.

التحول المعماري الأكثر أهمية لتصميم مراكز البيانات هو أن NVIDIA نقلت الوحدة الأساسية للحوسبة من الشريحة إلى الـ Rack. الـ GB200 NVL72 هو نظام على مستوى الـ Rack يضم 72 GPU ويوفر 1.4 exaFLOPS من حوسبة الاستدلال في AI.

مشكلة الطاقة التي لا يعلن عنها أحد

الـ Rack GB200 NVL72 يستهلك حوالي 120 كيلوواط. نشر متواضع لعشرة Racks يسحب 1.2 ميغاواط. على نطاق واسع، مركز بيانات يدير 1000 Rack من هذا القبيل يحتاج إلى 120 ميغاواط من الطاقة — أي ما يقارب استهلاك مدينة صغيرة. مراكز البيانات التي بنيت في عصر Hopper صممت لـ 30 إلى 40 كيلوواط لكل Rack. الفجوة تعني أن المرافق الحالية تتطلب تحديثات كبيرة للتبريد السائل وبنية تحتية للطاقة مطورة قبل أن تتمكن من تشغيل Blackwell بكثافة. أصبحت متطلبات رأس المال الآن حاجزًا هيكليًا للدخول.

التحول الاقتصادي

انخفضت تكلفة التدريب لكل Token بشكل كبير مع كل جيل من وحدات GPU. التقديرات تضع تخفيض التكلفة من H100 إلى B200 بنحو 5 إلى 10 أضعاف لجودة نموذج مكافئة. هذا دفع أسعار API للأسفل — قامت OpenAI وAnthropic وGoogle كل منها بتخفيض تسعير الاستدلال بنسبة 80 إلى 90 بالمائة من 2023 إلى 2026. لكن الاستدلال الأرخص زاد إجمالي الإنفاق على AI — هذه مفارقة Jevons التي تتجلى في حوسبة AI. تكاليف الوحدة المنخفضة تمكن حالات استخدام جديدة، كل منها يدفع طلبًا أكبر على الحوسبة. تتوقع Microsoft وGoogle إنفاقًا رأسماليًا يزيد عن 80 مليار دولار لعام 2025 بينما تتنافسان على نشر قدرات Blackwell.

الفجوة المتسعة بين المستويات

الشركة التي بنت بنية تحتية تنافسية لتدريب AI باستخدام عناقيد H100 في 2022 تتخلف الآن بدون ترقية إلى Blackwell — وتكلفة هذه الترقية أعلى بشكل كبير من الانتقال بين الأجيال السابقة. السحابات الأصغر تتجه نحو أعباء عمل الاستدلال والتخصص بدلاً من المنافسة على نطاق التدريب الخام.

NVLink Fusion ولعبة النظام البيئي

أحد الميزات الأقل تغطية في Blackwell هو NVLink Fusion، الذي يسمح لرقائق طرف ثالث — بما في ذلك XPUs من Marvell — بالاتصال بوحدات GPU من NVIDIA كأنداد من الدرجة الأولى. هذا يضع NVIDIA كمركز للبنية التحتية الهجينة للـ AI بدلاً من كونها بائع GPUs خالصًا.

استنتاجات عملية

  • الاستئجار أفضل من التملك للاستدلال في معظم المقاييس. اقتصاديات استئجار سعة GPU من مزود سحابة مجهز بـ Blackwell أفضل من شراء الأجهزة لمعظم المؤسسات التي تدير أعباء عمل استدلال بدون ضمانات ذروة استخدام.
  • عناقيد التدريب حساب مختلف. التدريب على نطاق Frontier مع طلب مستمر قد يبرر الملكية. معظم المؤسسات لا تدير تدريبًا على نطاق Frontier.
  • راقب حرب الأسعار بين Hyperscalers. AWS وAzure وGoogle تتنافس بنشاط على نشر Blackwell وتسعير الاستدلال. المستفيدون هم المؤسسات ذات البنية المرنة التي يمكنها نقل أعباء العمل إلى أرخص مزود.
  • الطاقة هي عنق الزجاجة، وليس الرقائق. للمؤسسات التي تقيم نشر GPU في الموقع، فإن سعة الطاقة وبنية التبريد أصبحتا الآن القيد الحرج. مركز بيانات لديه احتياطي طاقة وتبريد سائل يساوي أكثر من آخر لديه مساحة فعلية فارغة.

القصة السطحية لـ Blackwell هي السرعة الخام. القصة الحقيقية هي أنها جعلت حوسبة AI أكثر كثافة رأسمالية، وأكثر تركيزًا، وأكثر اعتمادًا على البنية التحتية للطاقة — مما يغير المشهد التنافسي بطرق ستستغرق سنوات لتظهر بالكامل.

مشاركة:
هندسة Blackwell من NVIDIA تعيد كتابة اقتصاديات مراكز البيانات | AIO APEX