AIO APEX

OpenAI ersetzt den Advanced Voice Mode von ChatGPT durch Full-Duplex-GPT-Live-Modelle

TechCrunch
Teilen:
OpenAI ersetzt den Advanced Voice Mode von ChatGPT durch Full-Duplex-GPT-Live-Modelle

OpenAI hat am 8. Juli GPT-Live vorgestellt, ein Paar neuer Sprachmodelle – GPT-Live-1 und GPT-Live-1 mini – die gleichzeitig zuhören und sprechen können und damit den älteren Advanced Voice Mode von ChatGPT für über 150 Millionen Nutzer weltweit ersetzen.

Die bisherige Sprach-Pipeline setzte separate Stufen für speech-to-text, Sprachmodell und text-to-speech zusammen. Jede Übergabe führte zu Latenz und machte das System unfähig, natürlich auf Unterbrechungen mitten im Satz zu reagieren. GPT-Live fasst alle drei zu einem einzigen Modell zusammen, das Rohaudio in Echtzeit verarbeitet – ähnlich wie ein Mensch während eines Gesprächs präsent bleibt, ohne eine Verarbeitungspause einzulegen.

Was GPT-Live tatsächlich tut

Das System unterstützt natürlichen Sprecherwechsel – einschließlich angemessener Hintergrundsignale wie „mhmm" oder Schweigen, während der Nutzer nachdenkt – und kann Gespräche über 30 bis 40 Minuten aufrechterhalten, eine deutliche Verlängerung gegenüber der bisherigen Sprach-Erfahrung. Wenn eine Frage des Nutzers Websuche, tiefergehendes Denken oder komplexe agentische Arbeit erfordert, leitet GPT-Live die Anfrage im Hintergrund an GPT-5.5 weiter und fügt das Ergebnis ohne hörbare Unterbrechung in das Sprachgespräch ein. Auch visuelle Formatierung wird unterstützt: Die Modelle können Informationen als Text oder strukturierte Ausgabe auf dem Bildschirm neben der gesprochenen Antwort anzeigen.

Integrierte Sicherheitsvorkehrungen wenden automatisch altersgerechte Antworten für jugendliche Nutzer an und bieten Ressourcen, wenn Gespräche Themen wie Selbstverletzung berühren.

Einführung und Zugang

GPT-Live-1 mini ist jetzt die standardmäßige Sprach-Erfahrung für alle ChatGPT-Nutzer. Abonnenten kostenpflichtiger Stufen erhalten Zugang zu GPT-Live-1, dem größeren Modell mit stärkerer Leistung bei komplexen Aufgaben. OpenAI hat beide Modelle für die weltweit am häufigsten gesprochenen Sprachen optimiert.

Eine Live-Übersetzungsfunktion wurde während des Starts demonstriert, allerdings zog eine Hindi-Demo Aufmerksamkeit aufgrund ihres starken amerikanischen Akzents und unnatürlichen Vortrags auf sich – eine Erinnerung daran, dass die Qualität der Echtzeitübersetzung noch erhebliches Verbesserungspotenzial hat.

Warum dies wichtig ist

OpenAI beschreibt Sprache als die „primäre Schnittstelle zum Rechnen" für ausgedehnte, komplexe Arbeiten – eine Einordnung, die GPT-Live als Infrastruktur und nicht als Funktion positioniert. Mehr als 150 Millionen Menschen interagieren bereits über Voice and Dictation mit ChatGPT. Indem OpenAI ein Full-Duplex-Modell standardmäßig allen Nutzern zur Verfügung stellt – nicht nur einer Funktionsstufe – geht OpenAI eine strukturelle Wette ein, dass sprachgesteuerte KI-Interaktion für den Mainstream bereit ist.

Die Verschiebung erhöht auch den Wettbewerbsdruck für Google's Gemini Live, Apple Intelligence's Voice-Layer und andere voice AI-Produkte, die noch an ähnlichen Fähigkeiten arbeiten.

Wie zuerst von TechCrunch berichtet, ist OpenAI's GPT-Live-1 mini jetzt für alle Nutzer verfügbar, während GPT-Live-1 für zahlende Abonnenten ausgerollt wird.

Originally reported by TechCrunch. Read the original article for additional details.

View original source
Teilen: