AIO APEX

OpenAI substitui o Advanced Voice Mode do ChatGPT pelos modelos full-duplex GPT-Live

TechCrunch
Compartilhar:
OpenAI substitui o Advanced Voice Mode do ChatGPT pelos modelos full-duplex GPT-Live

A OpenAI lançou em 8 de julho o GPT-Live, um par de novos modelos de voz — GPT-Live-1 e GPT-Live-1 mini — que podem ouvir e falar simultaneamente, substituindo o Advanced Voice Mode mais antigo do ChatGPT para mais de 150 milhões de usuários em todo o mundo.

O pipeline de voz anterior costurava estágios separados de speech-to-text, modelo de linguagem e text-to-speech. Cada transferência adicionava latência e tornava o sistema incapaz de responder naturalmente a interrupções no meio da frase. O GPT-Live condensa todos os três em um único modelo que processa áudio bruto em tempo real, da mesma forma que uma pessoa permanece engajada durante uma conversa sem entrar em uma pausa de processamento.

O que o GPT-Live realmente faz

O sistema suporta alternância natural de turnos — incluindo sinais de back-channel apropriados como "mhmm" ou permanecer em silêncio enquanto o usuário pensa — e pode sustentar conversas de 30 a 40 minutos, uma extensão notável em relação à experiência de voz anterior. Quando a pergunta de um usuário requer busca na web, raciocínio mais profundo ou trabalho agente complexo, o GPT-Live encaminha a solicitação para o GPT-5.5 em segundo plano e insere o resultado de volta na conversa por voz sem uma pausa audível. A formatação visual também é suportada: os modelos podem exibir informações como texto ou saída estruturada na tela junto com a resposta falada.

Salvaguardas integradas aplicam automaticamente respostas apropriadas para a idade de usuários adolescentes e fornecem recursos quando as conversas tocam em tópicos como automutilação.

Implementação e acesso

O GPT-Live-1 mini é agora a experiência de voz padrão para todos os usuários do ChatGPT. Assinantes dos planos pagos têm acesso ao GPT-Live-1, o modelo maior com desempenho mais forte em tarefas complexas. A OpenAI otimizou ambos os modelos para as línguas mais faladas globalmente.

Um recurso de tradução ao vivo foi demonstrado durante o lançamento, embora uma demonstração em hindi tenha chamado a atenção por seu forte sotaque americano e entrega não natural — um lembrete de que a qualidade da tradução em tempo real ainda tem espaço significativo para melhoria.

Por que isso importa

A OpenAI descreve a voz como se tornando "a interface primária para a computação" para trabalhos prolongados e complexos — um enquadramento que posiciona o GPT-Live como infraestrutura, e não como um recurso. Mais de 150 milhões de pessoas já interagem com o ChatGPT por meio de Voz e Ditado. Ao empurrar um modelo full-duplex para todos os usuários por padrão — não apenas para um nível de recurso — a OpenAI está fazendo uma aposta estrutural de que a interação de IA centrada em voz está pronta para uso mainstream.

A mudança também aumenta as apostas competitivas para o Google Gemini Live, a camada de voz do Apple Intelligence e outros produtos de voice AI que ainda estão iterando em capacidades semelhantes.

Conforme noticiado em primeira mão pelo TechCrunch, o GPT-Live-1 mini da OpenAI está disponível agora para todos os usuários, com o GPT-Live-1 sendo lançado para assinantes pagos.

Originally reported by TechCrunch. Read the original article for additional details.

View original source
Compartilhar: