OpenAI remplace l'Advanced Voice Mode de ChatGPT par les modèles full-duplex GPT-Live

OpenAI a lancé le 8 juillet GPT-Live, une paire de nouveaux modèles vocaux — GPT-Live-1 et GPT-Live-1 mini — capables d'écouter et de parler simultanément, remplaçant l'ancien Advanced Voice Mode de ChatGPT pour plus de 150 millions d'utilisateurs dans le monde.
Le pipeline vocal précédent assembliait des étapes séparées de speech-to-text, model de langage, et text-to-speech. Chaque transition ajoutait de la latence et rendait le système incapable de répondre naturellement aux interruptions en milieu de phrase. GPT-Live fusionne les trois en un seul modèle qui traite l'audio brut en temps réel, un peu comme une personne reste engagée dans une conversation sans faire de pause de traitement.
Ce que GPT-Live fait réellement
Le système prend en charge les tours de parole naturels — y compris les signaux de rétroaction appropriés comme « mhmm » ou le silence pendant que l'utilisateur réfléchit — et peut soutenir des conversations de 30 à 40 minutes, une extension notable par rapport à l'expérience vocale précédente. Lorsque la question d'un utilisateur nécessite une recherche web, un raisonnement plus approfondi ou un travail agentique complexe, GPT-Live achemine la demande vers GPT-5.5 en arrière-plan et intègre le résultat dans la conversation vocale sans interruption audible. Le formatage visuel est également pris en charge : les modèles peuvent afficher des informations sous forme de texte ou de sortie structurée à l'écran en complément de la réponse parlée.
Des garde-fous intégrés appliquent automatiquement des réponses adaptées à l'âge pour les utilisateurs adolescents et fournissent des ressources lorsque les conversations abordent des sujets comme l'automutilation.
Déploiement et accès
GPT-Live-1 mini est désormais l'expérience vocale par défaut pour tous les utilisateurs de ChatGPT. Les abonnés payants ont accès à GPT-Live-1, le modèle plus grand avec des performances supérieures sur les tâches complexes. OpenAI a optimisé les deux modèles pour les langues les plus parlées au monde.
Une fonction de traduction en direct a été démontrée lors du lancement, bien qu'une démo en hindi ait attiré l'attention pour son accent américain prononcé et son élocution peu naturelle — un rappel que la qualité de la traduction en temps réel a encore une marge d'amélioration significative.
Pourquoi c'est important
OpenAI décrit la voix comme devenant « l'interface principale de l'informatique » pour un travail prolongé et complexe — un cadrage qui positionne GPT-Live comme une infrastructure plutôt qu'une fonctionnalité. Plus de 150 millions de personnes interagissent déjà avec ChatGPT via Voice et Dictation. En poussant un modèle full-duplex par défaut à tous les utilisateurs — pas seulement à un niveau de fonctionnalité — OpenAI fait un pari structurel selon lequel l'interaction AI vocale est prête pour une utilisation grand public.
Ce changement augmente également les enjeux concurrentiels pour Google Gemini Live, la couche vocale d'Apple Intelligence, et d'autres produits voice AI qui itèrent encore sur des capacités similaires.
Comme l'a rapporté TechCrunch en premier, le GPT-Live-1 mini d'OpenAI est désormais disponible pour tous les utilisateurs, tandis que GPT-Live-1 est déployé pour les abonnés payants.
Originally reported by TechCrunch. Read the original article for additional details.
View original source