AIO APEX

Anthropic crée une équipe interne de conception de puces pour réduire les coûts d'inférence de Claude et la dépendance à Nvidia

Tom's Hardware
Partager:
Anthropic crée une équipe interne de conception de puces pour réduire les coûts d'inférence de Claude et la dépendance à Nvidia

Anthropic a confirmé qu'elle constitue une équipe interne d'ingénieurs en semi-conducteurs pour concevoir des puces IA personnalisées pour ses modèles Claude, rejoignant Google, Microsoft et Amazon dans la construction de silicon propriétaire pour les charges de travail d'inférence IA.

Pourquoi Anthropic se lance dans le silicon personnalisé

Malgré des partenariats avec Google et Broadcom pour la capacité TPU, les processeurs AWS Trainium, les GPU de la série AMD MI450 et le matériel Nvidia via Microsoft Azure, l'économie de l'exécution de Claude à l'échelle de production sur des puces tierces — en particulier le coûteux matériel Nvidia — a poussé l'entreprise vers l'intégration verticale. Anthropic décrit l'effort comme une «approche multi-puce», axée sur la co-conception matériel-modèles pour maximiser l'efficacité d'inférence et réduire les coûts par token à mesure que la demande des clients s'accélère.

Samsung en discussions comme partenaire de fabrication

Anthropic recrute activement des ingénieurs avec «un historique avéré de conception de semi-conducteurs terminés». Samsung Electronics serait en discussions exploratoires comme partenaire de fonderie, utilisant potentiellement son procédé de fabrication avancé à 2 nanomètres. Aucun accord formel n'a été annoncé et Anthropic n'a pas divulgué de calendrier pour la disponibilité de la première puce ni si elle prévoit de fabriquer un composant en interne.

Inférence, pas entraînement — un pari plus ciblé

Il est crucial que les puces personnalisées d'Anthropic ciblent les charges de travail d'inférence — le centre de coût pour servir Claude aux clients en temps réel — plutôt que l'entraînement, qui nécessite de massifs clusters GPU parallèles. C'est une portée plus étroite que ce que les TPU de Google abordaient initialement, et potentiellement un chemin plus rapide vers des économies significatives. Le silicon personnalisé de Google a nécessité environ quatre ans d'itération avant de déplacer significativement le matériel Nvidia pour les charges de travail à grande échelle ; le focus inférence-d'abord d'Anthropic pourrait comprimer ce calendrier.

L'effort de silicon personnalisé complète, plutôt que remplace, les partenariats matériels existants d'Anthropic. La société a contracté environ 3,5 gigawatts de capacité TPU de Google et Broadcom qui entrera en ligne en 2027, plus de 300 mégawatts du centre de données Colossus de SpaceX et jusqu'à 2 gigawatts de puces de la série AMD MI450. Comme le rapporte Tom's Hardware, l'équipe de conception interne d'Anthropic est dans les premières phases de recrutement et de conception, pas encore en phase de production.

La course pour contrôler la pile IA

Le mouvement d'Anthropic reproduit le manuel de chaque grand laboratoire d'IA qui a atteint l'échelle de production. Google a construit les TPU. Amazon a construit Trainium et Inferentia. Microsoft co-développe Maia avec OpenAI. Meta construit sa propre puce Iris. Le fil conducteur : à une échelle suffisante, la marge perdue dans l'économie de location GPU est assez grande pour justifier le coût en capital et en ingénierie du silicon personnalisé. Pour Anthropic, qui facture par token de l'API Claude et concurrence sur la qualité et le prix du modèle, toute réduction significative du coût d'inférence par token élargit directement sa position concurrentielle.

Originally reported by Tom's Hardware. Read the original article for additional details.

View original source
Partager: