El modo Ultrafast de OpenAI ejecuta GPT-5.6 Sol a 750 tokens por segundo

OpenAI ha lanzado Ultrafast, un nuevo nivel de servicio de API que ejecuta GPT-5.6 Sol a hasta 750 tokens de salida por segundo, 14 veces la velocidad del modo Estándar actual, que promedia alrededor de 53 tokens por segundo. El modo está disponible en vista previa limitada para clientes de API seleccionados a partir del 13 de agosto.
Las ganancias de velocidad provienen de una asociación con Cerebras, la startup de chips de IA conocida por sus procesadores de oblea completa. Ultrafast es el primer producto comercial de esa colaboración, utilizando hardware de Cerebras para acelerar drásticamente la inferencia en el modelo insignia de OpenAI sin, según la empresa, ninguna reducción en la calidad de salida.
Lo que realmente significan 750 tokens por segundo
La diferencia entre 53 y 750 tokens por segundo es la diferencia entre un modelo que escribe a medida que lees frente a uno que ofrece una respuesta completa casi al instante. Un artículo típico de 1.000 palabras toma aproximadamente 18 segundos a velocidad Estándar y menos de 2 segundos en Ultrafast. Para aplicaciones en tiempo real, esa brecha es enorme.
OpenAI afirma que Ultrafast está diseñado para flujos de trabajo que históricamente han obligado a un compromiso entre velocidad e inteligencia, donde los desarrolladores elegían modelos más pequeños y rápidos porque los modelos de frontera eran demasiado lentos. La propuesta es que ahora puedes ejecutar GPT-5.6 Sol, un modelo de nivel de frontera, a velocidades que antes solo se podían lograr con alternativas simplificadas.
Casos de uso objetivo
OpenAI destaca cuatro aplicaciones principales donde la inferencia en subsegundos desbloquea nuevas posibilidades: respuesta a incidentes (analistas de seguridad que obtienen respuestas en vivo a mitad de la investigación), servicio al cliente (Agent que igualan el ritmo de una conversación telefónica), análisis del mercado financiero (comentarios en tiempo real sobre movimientos de precios) y comercio electrónico (recomendaciones de productos dinámicas durante sesiones de navegación activas).
Estas son categorías en las que las grandes empresas actualmente desvían las consultas lejos de los modelos de frontera específicamente debido a las restricciones de latencia. Si Ultrafast mantiene sus afirmaciones de evaluación de calidad a escala, elimina esa restricción.
La conexión con Cerebras
Cerebras ha pasado años construyendo chips de oblea completa como alternativa al enfoque de GPU de Nvidia. Su procesador CS-3 es un único troquel de 900mm² en lugar de un clúster de chips más pequeños, intercambiando la complejidad de fabricación por un rendimiento bruto de inferencia. Esta asociación es el despliegue comercial de mayor perfil del hardware de Cerebras hasta la fecha.
OpenAI no ha anunciado precios separados para el modo Ultrafast y está expandiendo el acceso a medida que crece la capacidad. Como informó por primera vez TechCrunch, el anuncio provino directamente del blog de desarrolladores de OpenAI.
Publicado originalmente por TechCrunch. Lee el artículo original para más detalles.
Ver fuente original