تقرير: جوجل تطور شريحة تحمل بنية Gemini محفورة في السيليكون

The Decoder
مشاركة:
تقرير: جوجل تطور شريحة تحمل بنية Gemini محفورة في السيليكون

تطور جوجل شريحة خوادم، تحمل داخلياً اسم "Frozen v2"، تدمج بنية نماذج الذكاء الاصطناعي الخاصة بها Gemini مباشرة في السيليكون بدلاً من الاعتماد على معالجة موترات عامة، وفقاً لتقرير من موقع The Information نقلاً عن شخصين مطلعين على المشروع. التصميم يُنسب إلى فكرة من جيف دين، كبير العلماء في Google DeepMind، وقد يحقق من 6 إلى 10 أضعاف عدد AI tokens لكل واط مقارنة بوحدات TPU من الجيل الحالي في جوجل.

لم تؤكد جوجل علناً وجود Frozen v2، رغم أن الشركة أقرت بشكل عام بإجراء أبحاث مستمرة في مجال الأجهزة. التقرير مهم بغض النظر عن التأكيد الرسمي، لأنه يعكس تحولاً هيكلياً في الطريقة التي تتعامل بها أكبر مختبرات الذكاء الاصطناعي مع تكاليف الاستدلال: بدلاً من صنع أجهزة عامة بشكل متزايد والأمل في أن تواكب البرمجيات ذلك، يبدو أن جوجل مستعدة لتثبيت بنية نموذج محدد في شريحة لا يمكنها تشغيل سوى إصدارات مستقبلية من تلك البنية.

ماذا يعني "بنية محفورة في السيليكون" فعلياً

وحدة TPU أو GPU القياسية هي مسرّع للأغراض العامة: يمكنها تشغيل أي بنية نموذج يقدمها المطور، على حساب إنفاق قدرة حسابية على خطوات يمكن لخط أنابيب ثابت معالجتها بكفاءة أكبر. Frozen v2 تأخذ مساراً وسطاً بين تلك المرونة وشريحة ثابتة الوظائف بالكامل. بدلاً من تجميد الأوزان المدربة للنموذج - وهو مفهوم سابق تخلت عنه جوجل على ما يبدو لأن الأوزان تصبح قديمة بسرعة كبيرة بحيث لا تبرر السيليكون المخصص - تدمج Frozen v2 المخطط البنيوي لـ Gemini: تسلسل العمليات، قرارات التوجيه، والاختيارات الهيكلية التي تحدد كيفية معالجة النموذج للاستعلام، بغض النظر عن قيم المعاملات المحددة.

لا يزال بالإمكان تحميل أوزان جديدة على الشريحة مع إعادة تدريب Gemini وتحديثه. ما هو ثابت في الترانزستورات هو شكل الحساب نفسه، مما يقلل عدد الخطوات التي يجب أن تتخذها الشريحة وكمية البيانات التي تحتاج إلى نقلها لكل استعلام - وهما العاملان المهيمنان على تكلفة طاقة الاستدلال على نطاق واسع.

المقايضة: الكفاءة مقابل المرونة

ثمن مكسب الكفاءة هذا هو التقييد بالبنية. لأن بنية Gemini مطبوعة فعلياً في الشريحة، يمكن لـ Frozen v2 دعم إصدارات Gemini المستقبلية فقط طالما حافظت جوجل على البنية الأساسية للنموذج. إذا أجرت فرق البحث في جوجل تغييراً جوهرياً في كيفية بناء Gemini - النوع من التحولات التي تحدث دورياً عبر أجيال النماذج - فإن الشريحة تتوقف عن كونها مفيدة لأي غرض يتجاوز غرضها الأصلي.

لهذا السبب تصف التقارير Frozen v2 بأنها شريحة للاستخدام الداخلي وليس منتجاً تجارياً مستقبلياً على غرار خط TPU من جوجل، والذي تؤجره الشركة عبر Cloud وترخصه على نطاق أوسع. شريحة مقيدة ببنية نموذج مملوك لشركة واحدة ليس لها سوق خارج تلك الشركة.

الجدول الزمني والسياق الاستراتيجي

تستهدف جوجل بدء النشر في عام 2028 مع أحجام إنتاج أصغر من برنامج TPU الرئيسي - وهو ما يتماشى مع وظيفة Frozen v2 كدليل على مفهوم السيليكون المتخصص والخاص بالبنية بدلاً من رهان بنية تحتية واسع. يتناسب المشروع مع نمط أوسع في 2026: مختبرات الذكاء الاصطناعي ومزودو الخدمات السحابية يعالجون بشكل متزايد تكلفة الاستدلال، وليس تكلفة التدريب، كعائق ملزم يحد من انتشار نماذجهم، والسيليكون المخصص هو أحد الروافع القليلة المتبقية عندما تبدأ تحسينات كفاءة النموذج من البرمجيات وحدها في التسطيح.

إذا تحققت أرقام الكفاءة التي تتراوح بين 6 و10 أضعاف في الإنتاج، فإن Frozen v2 ستقلل بشكل ملموس تكلفة الحساب لكل استعلام لجوجل تحديداً فيما يخص Gemini - وهو رد مباشر على قيود السعة الحاسوبية التي شكلت خريطة طريق الذكاء الاصطناعي وأسعار جوجل طوال عام 2026. كما ورد في The Information وأكدته منافذ تقنية متعددة، يبرز المشروع أن التخصص البنيوي، وليس مجرد حجم الحوسبة الخام، أصبح محوراً تنافسياً بين مختبرات الذكاء الاصطناعي الرائدة.

Originally reported by The Decoder. Read the original article for additional details.

View original source
مشاركة: