OpenAI reemplaza el Modo de Voz Avanzada de ChatGPT con modelos GPT-Live full-duplex

OpenAI lanzó el 8 de julio GPT-Live, un par de nuevos modelos de voz — GPT-Live-1 y GPT-Live-1 mini — que pueden escuchar y hablar simultáneamente, reemplazando el anterior Advanced Voice Mode de ChatGPT para más de 150 millones de usuarios en todo el mundo.
El pipeline de voz anterior unía etapas separadas de speech-to-text, modelo de lenguaje y text-to-speech. Cada transición añadía latencia y hacía que el sistema no pudiera responder de forma natural a interrupciones a mitad de frase. GPT-Live fusiona las tres en un solo modelo que procesa audio bruto en tiempo real, de manera similar a cómo una persona se mantiene involucrada en una conversación sin entrar en una pausa de procesamiento.
Lo que realmente hace GPT-Live
El sistema admite turnos naturales — incluyendo señales de retroalimentación apropiadas como «mhmm» o permanecer en silencio mientras el usuario piensa — y puede mantener conversaciones de 30 a 40 minutos, una extensión notable respecto a la experiencia de voz anterior. Cuando la pregunta de un usuario requiere búsqueda web, razonamiento más profundo o trabajo agentivo complejo, GPT-Live envía la solicitud a GPT-5.5 en segundo plano e integra el resultado de vuelta en la conversación de voz sin una pausa audible. También se admite formato visual: los modelos pueden mostrar información como texto o salida estructurada en pantalla junto a la respuesta hablada.
Las salvaguardas integradas aplican automáticamente respuestas apropiadas para la edad de usuarios adolescentes y proporcionan recursos cuando las conversaciones tocan temas como la autolesión.
Implementación y acceso
GPT-Live-1 mini es ahora la experiencia de voz predeterminada para todos los usuarios de ChatGPT. Los suscriptores de pago obtienen acceso a GPT-Live-1, el modelo más grande con un rendimiento superior en tareas complejas. OpenAI ha optimizado ambos modelos para los idiomas más hablados a nivel mundial.
Una función de traducción en vivo se demostró durante el lanzamiento, aunque una demo en hindi llamó la atención por su fuerte acento estadounidense y su entrega poco natural — un recordatorio de que la calidad de la traducción en tiempo real todavía tiene un margen significativo de mejora.
Por qué esto es importante
OpenAI describe la voz como convirtiéndose en «la interfaz principal para la informática» para trabajos extensos y complejos — un enfoque que posiciona a GPT-Live como infraestructura en lugar de una característica. Más de 150 millones de personas ya interactúan con ChatGPT a través de Voz y Dictado. Al impulsar un modelo full-duplex a todos los usuarios de forma predeterminada — no solo en un nivel de características — OpenAI está haciendo una apuesta estructural de que la interacción de IA con voz primero está lista para el uso general.
El cambio también aumenta las apuestas competitivas para Google Gemini Live, la capa de voz de Apple Intelligence y otros productos de voice AI que todavía están iterando en capacidades similares.
Según informó por primera vez TechCrunch, GPT-Live-1 mini de OpenAI ya está disponible para todos los usuarios, y GPT-Live-1 se está implementando para suscriptores de pago.
Originally reported by TechCrunch. Read the original article for additional details.
View original source