Le chip Jalapeño d'OpenAI surpasse Nvidia Blackwell en débit d'inférence par watt

OpenAI a construit son propre chip d'inférence IA, nom de code Jalapeño, et selon une analyse technique détaillée de SemiAnalysis publiée le 25 août, il délivre un meilleur débit par mégawatt que les accélérateurs Blackwell de Nvidia sur les workloads clés de grands modèles de langage.
Qu'est-ce que Jalapeño et que peut-il faire ?
Conçu en interne et fabriqué sur le procédé N3P de TSMC, Jalapeño est un chip en réseau systolique à poids stationnaire avec un TDP de 700W, 15,4 To/s de bande passante mémoire HBM4 et 13,4 PFLOPs de calcul MXFP4. Chaque rack accueille 128 chips ; le système monte jusqu'à 2 048 chips sur 16 racks.
SemiAnalysis a testé des échantillons d'ingénierie A0 sur plusieurs modèles importants. Sur DeepSeek R1, Jalapeño a dépassé 700 tokens/seconde à un seul utilisateur. Sur Kimi K2.5, il a approché 700 tokens/seconde par utilisateur — un avantage de 9x revendiqué. Sur GPT-OSS, 1 400 tokens/seconde par utilisateur.
Le fossé CUDA pourrait se craqueler
SemiAnalysis indique que "les progrès logiciels d'OpenAI ont avancé plus vite que ceux de Nvidia", et affirme que "le fossé CUDA est potentiellement mort". Les performances du noyau ont doublé en moins de deux semaines, et l'équipe est passée des configurations mono-système aux opérations à l'échelle du rack en huit jours.
La conception a débuté mi-2024, avec un tape-out en novembre 2025. Les volumes de production sont prévus principalement pour fin 2027. Malgré des réserves sur les tests limités, l'émergence d'un chip personnalisé compétitif d'OpenAI redéfinit le marché des équipements IA.
Initialement rapporté par SemiAnalysis. Lisez l'article original pour plus de détails.
Voir la source originale