بنا به گزارشها، Google در حال ساخت تراشهای است که معماری Gemini را مستقیماً در سیلیکون حک میکند

بر اساس گزارشی از نشریه The Information که به دو نفر آشنا با جزئیات این پروژه استناد میکند، Google در حال توسعه تراشهای برای سرور است که بهصورت داخلی «Frozen v2» نامیده میشود. این تراشه معماری مدلهای AI Gemini را بهجای تکیه بر پردازش تانسوری همهمنظوره، مستقیماً در سیلیکون جاسازی میکند. بر اساس این گزارش، ایده اصلی این طراحی به Jeff Dean، دانشمند ارشد Google DeepMind، بازمیگردد و انتظار میرود این تراشه بتواند ۶ تا ۱۰ برابر بیشتر از TPUهای نسل کنونی Google، توکنهای AI را به ازای هر وات پردازش کند.
Google وجود Frozen v2 را بهطور رسمی تأیید نکرده است، هرچند این شرکت بهطور کلی از ادامه تحقیقات سختافزاری خود سخن گفته است. این گزارش فارغ از تأیید رسمی اهمیت دارد، زیرا نشاندهنده تحولی ساختاری در رویکرد بزرگترین آزمایشگاههای AI نسبت به هزینههای استنتاج است: بهجای ساخت سختافزار روزافزون عمومی و انتظار برای پیشرفت نرمافزار، Google ظاهراً آماده است معماری یک مدل خاص را بهصورت سختافزاری در تراشهای جاسازی کند که تنها از نسخههای آتی همان معماری پشتیبانی میکند.
معنای واقعی «معماری حکشده در سیلیکون»
یک TPU یا GPU استاندارد، یک شتابدهنده همهمنظوره است: میتواند هر معماری مدلی را که توسعهدهنده در اختیارش قرار دهد اجرا کند، اما به بهای صرف توان محاسباتی برای مراحلی که یک خط پردازش ثابت میتوانست آنها را بهمراتب کارآمدتر انجام دهد. بر اساس گزارشها، Frozen v2 مسیری میانه بین این انعطافپذیری و یک تراشه کاملاً تابع ثابت در پیش میگیرد. بهجای ثابتکردن وزنهای آموزشدیده مدل — ایدهای قدیمیتر که Google ظاهراً از آن دست کشیده است، چراکه وزنها آنقدر سریع منسوخ میشوند که توجیهپذیری سیلیکون سفارشی را از میان میبرد — Frozen v2 نقشه معماری Gemini را جاسازی میکند: توالی عملیاتها، تصمیمات مسیریابی و انتخابهای ساختاری که نحوه پردازش یک پرسوجو توسط مدل را تعریف میکنند، مستقل از مقادیر خاص پارامترها.
وزنهای جدید همچنان میتوانند با هر بار آموزش مجدد و بهروزرسانی Gemini روی تراشه بارگذاری شوند. آنچه در ترانزیستورها ثابت شده است، شکل محاسبات خود است که تعداد مراحل لازم برای تراشه و حجم دادهای که باید به ازای هر پرسوجو جابهجا شود را کاهش میدهد — دو عاملی که در مقیاس بزرگ، هزینه انرژی استنتاج را تعیین میکنند.
مبادله: بهرهوری در برابر انعطافپذیری
هزینه این افزایش بهرهوری، قفلشدگی به یک معماری است. از آنجا که ساختار Gemini بهصورت فیزیکی در تراشه تعبیه شده است، Frozen v2 تنها تا زمانی قادر به پشتیبانی از نسخههای آتی Gemini خواهد بود که Google معماری بنیادی مدل را حفظ کند. اگر تیمهای پژوهشی Google تغییری بنیادین در ساختار Gemini ایجاد کنند — همان نوع تحولی که بهصورت دورهای در میان نسلهای مختلف مدل رخ میدهد — تراشه دیگر فراتر از هدف اولیه خود کارایی نخواهد داشت.
به احتمال زیاد به همین دلیل است که گزارشها Frozen v2 را بهعنوان تراشهای برای استفاده داخلی توصیف میکنند، نه محصولی تجاری آینده به سبک خط TPU Google که از طریق Cloud اجاره داده میشود و مجوز آن بهصورت گستردهتری واگذار میگردد. تراشهای که به معماری مدل اختصاصی یک شرکت گره خورده باشد، بازاری خارج از آن شرکت نخواهد داشت.
زمانبندی و زمینه راهبردی
بر اساس گزارشها، Google استقرار این تراشه را از سال ۲۰۲۸ هدفگذاری کرده است، با حجم تولیدی کمتر از برنامه اصلی TPU خود — که با نقش Frozen v2 بهعنوان اثبات مفهوم برای سیلیکون تخصصی وابسته به معماری، بهجای یک سرمایهگذاری زیرساختی گسترده، همخوانی دارد. این پروژه با الگوی گستردهتری در سال ۲۰۲۶ همسو است: آزمایشگاههای AI و ارائهدهندگان ابر بهطور فزایندهای هزینه استنتاج، نه هزینه آموزش، را بهعنوان محدودیت اصلی برای گستردگی استقرار مدلهای خود در نظر میگیرند و سیلیکون سفارشی یکی از معدود اهرمهای باقیمانده است، آنگاه که بهبود بهرهوری مدل صرفاً از طریق نرمافزار به حد اشباع میرسد.
اگر ارقام بهرهوری ۶ تا ۱۰ برابری در محیط تولید تأیید شوند، Frozen v2 میتواند هزینه محاسباتی هر پرسوجو برای Gemini را بهطور معناداری کاهش دهد — پاسخی مستقیم به محدودیتهای ظرفیت محاسباتی که نقشه راه AI و قیمتگذاری Google را در سرتاسر سال ۲۰۲۶ شکل داده است. همانطور که The Information گزارش داده و چندین رسانه فناوری آن را تأیید کردهاند، این پروژه نشان میدهد که تخصصگرایی معماری، نه صرفاً مقیاس محاسباتی خام، در حال تبدیلشدن به محوری رقابتی در میان آزمایشگاههای پیشرفته AI است.
Originally reported by The Decoder. Read the original article for additional details.
View original source