AIO APEX

O modo Ultrafast da OpenAI executa o GPT-5.6 Sol a 750 tokens por segundo

TechCrunch
Compartilhar:
O modo Ultrafast da OpenAI executa o GPT-5.6 Sol a 750 tokens por segundo
A OpenAI lançou o Ultrafast, um novo nível de serviço de API que executa o GPT-5.6 Sol a até 750 output tokens por segundo — 14 vezes a velocidade do modo Standard atual, que tem uma média de cerca de 53 tokens por segundo. O modo está disponível em visualização limitada para clientes de API selecionados a partir de 13 de agosto. Os ganhos de velocidade vêm de uma parceria com a Cerebras, a startup de chips de IA conhecida por seus processadores em escala de wafer. O Ultrafast é o primeiro produto comercial dessa colaboração, utilizando o hardware da Cerebras para acelerar drasticamente a inferência no modelo principal da OpenAI sem, segundo a empresa, nenhuma redução na qualidade da saída. O que 750 tokens por segundo realmente significa A diferença entre 53 e 750 tokens por segundo é a diferença entre um modelo que digita conforme você lê e um que entrega uma resposta completa quase instantaneamente. Um artigo típico de 1.000 palavras leva aproximadamente 18 segundos na velocidade Standard e menos de 2 segundos no Ultrafast. Para aplicações em tempo real, essa lacuna é enorme. A OpenAI diz que o Ultrafast foi projetado para fluxos de trabalho que historicamente forçavam um compromisso entre velocidade e inteligência — onde os desenvolvedores escolhiam modelos menores e mais rápidos porque os modelos de fronteira eram muito lentos. A proposta é que agora você pode executar o GPT-5.6 Sol, um modelo de nível de fronteira, em velocidades anteriormente alcançáveis apenas com alternativas simplificadas. Casos de uso alvo A OpenAI destaca quatro aplicações principais onde a inferência de sub-segundo desbloqueia novas possibilidades: resposta a incidentes (analistas de segurança obtendo respostas ao vivo no meio da investigação), atendimento ao cliente (Agent que acompanham o ritmo de uma conversa telefônica), análise de mercado financeiro (comentários em tempo real sobre movimentos de preços) e comércio eletrônico (recomendações dinâmicas de produtos durante sessões de navegação ativas). Essas são categorias onde grandes empresas atualmente direcionam consultas para longe de modelos de fronteira especificamente devido a restrições de latência. Se o Ultrafast mantiver suas reivindicações de Benchmark de qualidade em escala, ele removerá essa restrição. A conexão com a Cerebras A Cerebras passou anos construindo chips em escala de wafer como uma alternativa à abordagem de GPU da Nvidia. Seu processador CS-3 é um único die de 900mm² em vez de um cluster de chips menores, trocando a complexidade de fabricação por throughput de inferência bruto. Esta parceria é a implantação comercial de maior perfil de hardware da Cerebras até o momento. A OpenAI não anunciou preços separados para o modo Ultrafast e está expandindo o acesso conforme a capacidade cresce. Conforme relatado pela primeira vez pelo TechCrunch, o anúncio veio diretamente do blog de desenvolvedores da OpenAI.

Publicado originalmente por TechCrunch. Leia o artigo original para mais detalhes.

Ver fonte original
Compartilhar: