بنا به گزارش‌ها، Google در حال ساخت تراشه‌ای است که معماری Gemini را مستقیماً در سیلیکون حک می‌کند

The Decoder
اشتراک‌گذاری:
بنا به گزارش‌ها، Google در حال ساخت تراشه‌ای است که معماری Gemini را مستقیماً در سیلیکون حک می‌کند

بر اساس گزارشی از نشریه The Information که به دو نفر آشنا با جزئیات این پروژه استناد می‌کند، Google در حال توسعه تراشه‌ای برای سرور است که به‌صورت داخلی «Frozen v2» نامیده می‌شود. این تراشه معماری مدل‌های AI Gemini را به‌جای تکیه بر پردازش تانسوری همه‌منظوره، مستقیماً در سیلیکون جاسازی می‌کند. بر اساس این گزارش، ایده اصلی این طراحی به Jeff Dean، دانشمند ارشد Google DeepMind، بازمی‌گردد و انتظار می‌رود این تراشه بتواند ۶ تا ۱۰ برابر بیشتر از TPUهای نسل کنونی Google، توکن‌های AI را به ازای هر وات پردازش کند.

Google وجود Frozen v2 را به‌طور رسمی تأیید نکرده است، هرچند این شرکت به‌طور کلی از ادامه تحقیقات سخت‌افزاری خود سخن گفته است. این گزارش فارغ از تأیید رسمی اهمیت دارد، زیرا نشان‌دهنده تحولی ساختاری در رویکرد بزرگ‌ترین آزمایشگاه‌های AI نسبت به هزینه‌های استنتاج است: به‌جای ساخت سخت‌افزار روزافزون عمومی و انتظار برای پیشرفت نرم‌افزار، Google ظاهراً آماده است معماری یک مدل خاص را به‌صورت سخت‌افزاری در تراشه‌ای جاسازی کند که تنها از نسخه‌های آتی همان معماری پشتیبانی می‌کند.

معنای واقعی «معماری حک‌شده در سیلیکون»

یک TPU یا GPU استاندارد، یک شتاب‌دهنده همه‌منظوره است: می‌تواند هر معماری مدلی را که توسعه‌دهنده در اختیارش قرار دهد اجرا کند، اما به بهای صرف توان محاسباتی برای مراحلی که یک خط پردازش ثابت می‌توانست آن‌ها را به‌مراتب کارآمدتر انجام دهد. بر اساس گزارش‌ها، Frozen v2 مسیری میانه بین این انعطاف‌پذیری و یک تراشه کاملاً تابع ثابت در پیش می‌گیرد. به‌جای ثابت‌کردن وزن‌های آموزش‌دیده مدل — ایده‌ای قدیمی‌تر که Google ظاهراً از آن دست کشیده است، چراکه وزن‌ها آنقدر سریع منسوخ می‌شوند که توجیه‌پذیری سیلیکون سفارشی را از میان می‌برد — Frozen v2 نقشه معماری Gemini را جاسازی می‌کند: توالی عملیات‌ها، تصمیمات مسیریابی و انتخاب‌های ساختاری که نحوه پردازش یک پرس‌وجو توسط مدل را تعریف می‌کنند، مستقل از مقادیر خاص پارامترها.

وزن‌های جدید همچنان می‌توانند با هر بار آموزش مجدد و به‌روزرسانی Gemini روی تراشه بارگذاری شوند. آنچه در ترانزیستورها ثابت شده است، شکل محاسبات خود است که تعداد مراحل لازم برای تراشه و حجم داده‌ای که باید به ازای هر پرس‌وجو جابه‌جا شود را کاهش می‌دهد — دو عاملی که در مقیاس بزرگ، هزینه انرژی استنتاج را تعیین می‌کنند.

مبادله: بهره‌وری در برابر انعطاف‌پذیری

هزینه این افزایش بهره‌وری، قفل‌شدگی به یک معماری است. از آنجا که ساختار Gemini به‌صورت فیزیکی در تراشه تعبیه شده است، Frozen v2 تنها تا زمانی قادر به پشتیبانی از نسخه‌های آتی Gemini خواهد بود که Google معماری بنیادی مدل را حفظ کند. اگر تیم‌های پژوهشی Google تغییری بنیادین در ساختار Gemini ایجاد کنند — همان نوع تحولی که به‌صورت دوره‌ای در میان نسل‌های مختلف مدل رخ می‌دهد — تراشه دیگر فراتر از هدف اولیه خود کارایی نخواهد داشت.

به احتمال زیاد به همین دلیل است که گزارش‌ها Frozen v2 را به‌عنوان تراشه‌ای برای استفاده داخلی توصیف می‌کنند، نه محصولی تجاری آینده به سبک خط TPU Google که از طریق Cloud اجاره داده می‌شود و مجوز آن به‌صورت گسترده‌تری واگذار می‌گردد. تراشه‌ای که به معماری مدل اختصاصی یک شرکت گره خورده باشد، بازاری خارج از آن شرکت نخواهد داشت.

زمان‌بندی و زمینه راهبردی

بر اساس گزارش‌ها، Google استقرار این تراشه را از سال ۲۰۲۸ هدف‌گذاری کرده است، با حجم تولیدی کمتر از برنامه اصلی TPU خود — که با نقش Frozen v2 به‌عنوان اثبات مفهوم برای سیلیکون تخصصی وابسته به معماری، به‌جای یک سرمایه‌گذاری زیرساختی گسترده، همخوانی دارد. این پروژه با الگوی گسترده‌تری در سال ۲۰۲۶ همسو است: آزمایشگاه‌های AI و ارائه‌دهندگان ابر به‌طور فزاینده‌ای هزینه استنتاج، نه هزینه آموزش، را به‌عنوان محدودیت اصلی برای گستردگی استقرار مدل‌های خود در نظر می‌گیرند و سیلیکون سفارشی یکی از معدود اهرم‌های باقیمانده است، آنگاه که بهبود بهره‌وری مدل صرفاً از طریق نرم‌افزار به حد اشباع می‌رسد.

اگر ارقام بهره‌وری ۶ تا ۱۰ برابری در محیط تولید تأیید شوند، Frozen v2 می‌تواند هزینه محاسباتی هر پرس‌وجو برای Gemini را به‌طور معناداری کاهش دهد — پاسخی مستقیم به محدودیت‌های ظرفیت محاسباتی که نقشه راه AI و قیمت‌گذاری Google را در سرتاسر سال ۲۰۲۶ شکل داده است. همان‌طور که The Information گزارش داده و چندین رسانه فناوری آن را تأیید کرده‌اند، این پروژه نشان می‌دهد که تخصص‌گرایی معماری، نه صرفاً مقیاس محاسباتی خام، در حال تبدیل‌شدن به محوری رقابتی در میان آزمایشگاه‌های پیشرفته AI است.

Originally reported by The Decoder. Read the original article for additional details.

View original source
اشتراک‌گذاری: