AIO APEX

Le mode Ultrafast d'OpenAI exécute GPT-5.6 Sol à 750 tokens par seconde

TechCrunch
Partager:
Le mode Ultrafast d'OpenAI exécute GPT-5.6 Sol à 750 tokens par seconde

OpenAI a lancé Ultrafast, un nouveau niveau de service API qui exécute GPT-5.6 Sol jusqu'à 750 tokens de sortie par seconde, soit 14 fois la vitesse du mode Standard actuel, qui tourne en moyenne autour de 53 tokens par seconde. Ce mode est disponible en avant-première limitée pour certains clients de l'API à partir du 13 août.

Les gains de vitesse proviennent d'un partenariat avec Cerebras, la startup de puces IA connue pour ses processeurs à l'échelle de la wafer. Ultrafast est le premier produit commercial de cette collaboration, utilisant le matériel de Cerebras pour accélérer considérablement l'inférence sur le modèle phare d'OpenAI sans, selon l'entreprise, aucune réduction de la qualité des sorties.

Ce que signifient réellement 750 tokens par seconde

La différence entre 53 et 750 tokens par seconde est la différence entre un modèle qui tape au fil de votre lecture et un modèle qui fournit une réponse complète presque instantanément. Un article type de 1 000 mots prend environ 18 secondes à vitesse Standard et moins de 2 secondes en mode Ultrafast. Pour les applications en temps réel, cet écart est énorme.

OpenAI affirme qu'Ultrafast est conçu pour les flux de travail qui imposaient historiquement un compromis entre vitesse et intelligence, où les développeurs choisissaient des modèles plus petits et plus rapides parce que les modèles frontières étaient trop lents. L'argument de vente est que vous pouvez désormais exécuter GPT-5.6 Sol, un modèle de pointe, à des vitesses auparavant uniquement réalisables avec des alternatives simplifiées.

Cas d'usage cibles

OpenAI met en avant quatre applications principales où l'inférence en sous-seconde ouvre de nouvelles possibilities : la gestion des incidents (des analystes de sécurité obtenant des réponses en direct au milieu d'une enquête), le service client (des Agent qui s'alignent sur le rythme d'une conversation téléphonique), l'analyse des marchés financiers (commentaires en temps réel sur les mouvements de prix) et le e-commerce (recommandations de produits dynamiques lors de sessions de navigation actives).

Ce sont des catégories où les grandes entreprises acheminent actuellement les requêtes loin des modèles frontières précisément en raison de contraintes de latence. Si Ultrafast maintient ses promesses en matière de Benchmark de qualité à grande échelle, cela supprime cette contrainte.

La connexion Cerebras

Cerebras a passé des années à construire des puces à l'échelle de la wafer comme alternative à l'approche GPU de Nvidia. Son processeur CS-3 est une unique puce (die) de 900 mm² plutôt qu'un cluster de puces plus petites, troquant la complexité de fabrication contre un débit d'inférence brut. Ce partenariat est le déploiement commercial le plus médiatisé du matériel de Cerebras à ce jour.

OpenAI n'a pas annoncé de tarification séparée pour le mode Ultrafast et étend l'accès au fur et à mesure que la capacité augmente. Comme l'a rapporté pour la première fois TechCrunch, l'annonce est venue directement du blog des développeurs d'OpenAI.

Initialement rapporté par TechCrunch. Lisez l'article original pour plus de détails.

Voir la source originale
Partager: