AIO APEX

Google construirait une puce avec l'architecture de Gemini gravée dans le silicium

The Decoder
Partager:
Google construirait une puce avec l'architecture de Gemini gravée dans le silicium

Google développe une puce serveur, nommée en interne "Frozen v2", qui intègre l'architecture de ses modèles d'IA Gemini directement dans le silicium plutôt que de s'appuyer sur un traitement tensoriel polyvalent, selon un rapport de The Information citant deux personnes ayant une connaissance directe du projet. La conception remonterait à une idée de Jeff Dean, scientifique en chef de Google DeepMind, et pourrait délivrer 6 à 10 fois plus de tokens d'IA par watt que les TPU actuels de Google.

Google n'a pas confirmé publiquement l'existence de Frozen v2, bien que l'entreprise ait reconnu mener des recherches matérielles de manière générale. Le rapport est significatif indépendamment de la confirmation officielle car il reflète un changement structurel dans la manière dont les plus grands laboratoires d'IA abordent les coûts d'inférence : au lieu de construire du matériel de plus en plus généraliste et d'espérer que le logiciel rattrape son retard, Google serait prêt à câbler l'architecture d'un modèle spécifique dans une puce qui ne peut exécuter que les versions futures de cette architecture.

Ce que signifie vraiment "architecture gravée dans le silicium"

Un TPU ou GPU standard est un accélérateur polyvalent : il peut exécuter n'importe quelle architecture de modèle qu'un développeur lui soumet, au prix de dépenser du calcul sur des étapes qu'un pipeline fixe pourrait gérer plus efficacement. Frozen v2 emprunterait une voie intermédiaire entre cette flexibilité et une puce à fonction entièrement fixe. Plutôt que de figer les poids entraînés du modèle — un concept antérieur que Google aurait abandonné car les poids deviennent trop obsolètes pour justifier un silicium sur mesure — Frozen v2 intègre le plan architectural de Gemini : la séquence des opérations, les décisions de routage et les choix structurels qui définissent la manière dont le modèle traite une requête, indépendamment des valeurs spécifiques des paramètres.

De nouveaux poids peuvent toujours être chargés sur la puce à mesure que Gemini est réentraîné et mis à jour. Ce qui est fixé dans les transistors, c'est la forme du calcul lui-même, ce qui réduit le nombre d'étapes que la puce doit effectuer et la quantité de données qu'elle doit déplacer par requête — les deux facteurs qui dominent le coût énergétique de l'inférence à grande échelle.

Le compromis : l'efficacité contre la flexibilité

Le coût de ce gain d'efficacité est un verrouillage architectural. Parce que la structure de Gemini est physiquement intégrée dans la puce, Frozen v2 ne peut supporter que les futures versions de Gemini tant que Google préserve l'architecture fondamentale du modèle. Si les équipes de recherche de Google apportent un changement fondamental à la façon dont Gemini est structuré — le genre de changement qui se produit périodiquement d'une génération de modèle à l'autre — la puce cesse d'être utile pour autre chose que son objectif initial.

C'est presque certainement pourquoi les rapports décrivent Frozen v2 comme une puce à usage interne plutôt qu'un futur produit commercial dans le moule de la gamme TPU de Google, que Google loue via Cloud et concède sous licence plus largement. Une puce verrouillée sur l'architecture propriétaire d'une seule entreprise n'a pas de marché en dehors de cette entreprise.

Calendrier et contexte stratégique

Google viserait un déploiement à partir de 2028, avec des volumes de production inférieurs à ceux de son programme TPU principal — ce qui correspond à Frozen v2 fonctionnant comme une preuve de concept pour un silicium spécialisé et spécifique à une architecture plutôt qu'à un pari infrastructurel large. Le projet s'inscrit dans une tendance plus large de 2026 : les laboratoires d'IA et les fournisseurs de cloud considèrent de plus en plus le coût d'inférence, et non le coût d'entraînement, comme la contrainte déterminante sur l'ampleur du déploiement de leurs modèles, et le silicium sur mesure est l'un des rares leviers restants une fois que les améliorations d'efficacité des modèles provenant uniquement du logiciel commencent à plafonner.

Si les chiffres d'efficacité de 6 à 10 fois se confirment en production, Frozen v2 réduirait significativement le coût de calcul par requête de Google pour Gemini spécifiquement — une réponse directe aux contraintes de capacité de calcul qui ont façonné la feuille de route et la tarification de Google en matière d'IA tout au long de 2026. Comme rapporté par The Information et corroboré par plusieurs médias technologiques, le projet souligne que la spécialisation architecturale, et non seulement l'échelle de calcul brute, devient un axe concurrentiel parmi les laboratoires d'IA de pointe.

Originally reported by The Decoder. Read the original article for additional details.

View original source
Partager: