Der Ultrafast-Modus von OpenAI führt GPT-5.6 Sol mit 750 Tokens pro Sekunde aus
TechCrunch

OpenAI hat Ultrafast eingeführt, einen neuen API-Dienstebereich, der GPT-5.6 Sol mit bis zu 750 Ausgabetokens pro Sekunde ausführt – das 14-Fache der Geschwindigkeit des aktuellen Standardmodus, der im Durchschnitt bei etwa 53 Tokens pro Sekunde liegt. Der Modus ist ab dem 13. August in einer limitierten Vorschau für ausgewählte API-Kunden verfügbar.
Die Geschwindigkeitsvorteile resultieren aus einer Partnerschaft mit Cerebras, dem KI-Chip-Startup, das für seine Wafer-Scale-Prozessoren bekannt ist. Ultrafast ist das erste kommerzielle Produkt dieser Zusammenarbeit und nutzt Cerebras-Hardware, um die Inferenz auf dem Flaggschiffmodell von OpenAI drastisch zu beschleunigen, und das laut Angaben des Unternehmens ohne jegliche Einbußen bei der Ausgabequalität.
Was 750 Tokens pro Sekunde tatsächlich bedeuten
Der Unterschied zwischen 53 und 750 Tokens pro Sekunde ist der Unterschied zwischen einem Modell, das beim Lesen tippt, und einem, das eine vollständige Antwort nahezu augenblicklich liefert. Ein typischer Artikel mit 1.000 Wörtern dauert bei Standardgeschwindigkeit etwa 18 Sekunden und bei Ultrafast unter 2 Sekunden. Für Echtzeitanwendungen ist diese Lücke enorm.
OpenAI gibt an, dass Ultrafast für Workflows entwickelt wurde, bei denen historisch gesehen ein Kompromiss zwischen Geschwindigkeit und Intelligenz erzwungen wurde – bei dem Entwickler kleinere, schnellere Modelle wählten, weil Frontier-Modelle zu langsam waren. Das Verkaufsargument ist, dass Sie nun GPT-5.6 Sol, ein Modell auf Frontier-Niveau, mit Geschwindigkeiten ausführen können, die zuvor nur mit abgespeckten Alternativen erreichbar waren.
Ziel-Anwendungsfälle
OpenAI hebt vier Kernanwendungen hervor, bei denen eine Inferenz im Subsekundenbereich neue Möglichkeiten eröffnet: Incident Response (Sicherheitsanalysten, die während einer Untersuchung Live-Antworten erhalten), Kundenservice (Agenten, die mit dem Tempo eines Telefongesprächs Schritt halten), Finanzmarktanalysen (Echtzeit-Kommentare zu Preisbewegungen) und E-Commerce (dynamische Produktempfehlungen während aktiver Browsing-Sitzungen).
Dies sind Kategorien, in denen große Unternehmen Abfragen derzeit speziell wegen Latenzbeschränkungen von Frontier-Modellen weglenken. Wenn Ultrafast seine Benchmark-Versprechen bezüglich der Qualität im großen Maßstab einhält, fällt diese Beschränkung weg.
Die Cerebras-Verbindung
Cerebras hat Jahre damit verbracht, Wafer-Scale-Chips als Alternative zum GPU-Ansatz von Nvidia zu entwickeln. Der CS-3-Prozessor ist ein einzelner 900 mm² großer Die anstelle eines Clusters kleinerer Chips, wobei Fertigungskomplexität gegen rohen Inferenzdurchsatz eingetauscht wird. Diese Partnerschaft ist der bisher prominenteste kommerzielle Einsatz von Cerebras-Hardware.
OpenAI hat keine separaten Preise für den Ultrafast-Modus bekannt gegeben und weitet den Zugriff aus, während die Kapazitäten steigen. Wie zuerst von TechCrunch berichtet, stammt die Ankündigung direkt aus dem Entwickler-Blog von OpenAI.
Ursprünglich berichtet von TechCrunch. Lesen Sie den Originalartikel für weitere Details.
Originalquelle ansehen