Anthropic lanza Claude Opus 5 con puntuaciones récord en benchmarks al mismo precio que Opus 4.8

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, un modelo que ofrece un rendimiento drásticamente mejor que su predecesor manteniendo el mismo precio: $5 por millón de tokens de entrada y $25 por millón de tokens de salida, idéntico a Claude Opus 4.8.
Resultados de benchmarks que destacan
En Frontier-Bench v0.1, la evaluación de ingeniería de software realizada por frontierbench.ai, Opus 5 supera a todos los demás modelos — incluido el propio Fable 5 de Anthropic. La brecha con Opus 4.8 es notoria: Opus 5 duplica con creces la puntuación de su predecesor con un costo menor por tarea completada.
El mismo patrón se repite en varias evaluaciones. En ARC-AGI 3, que mide la resolución de problemas nuevos genuinos, Opus 5 obtiene tres veces más puntuación que el siguiente mejor modelo. En Zapier AutomationBench — que prueba si un modelo puede completar tareas empresariales reales de principio a fin — su tasa de éxito es aproximadamente 1,5 veces mejor que cualquier competidor, incluso en su nivel de esfuerzo más bajo. En OSWorld 2.0, un benchmark de uso de computadora, Opus 5 supera el mejor resultado de Fable 5 con poco más de un tercio del costo por tarea de Fable 5. También lidera en GDPval-AA, una evaluación de conocimiento aplicado y razonamiento.
Diseñado para trabajo agente y de largo plazo
Anthropic describe a Opus 5 como "reflexivo y proactivo", lenguaje que refleja su enfoque de diseño en tareas agente extendidas: agentes de software que funcionan durante horas, sortean obstáculos inesperados y se recuperan de errores sin intervención humana. Viene con una ventana de contexto de 1 millón de tokens y un máximo de salida de 128,000 tokens — margen importante para bases de código grandes y sesiones de análisis prolongadas.
Se lanzaron dos funciones beta junto con él: cambios de herramientas en medio de la conversación, que permiten añadir o eliminar herramientas dinámicamente durante una ejecución agente, y un modo de respaldo "predeterminado" para mantener los agentes funcionando cuando una herramienta preferida deja de estar disponible.
Dial de esfuerzo para control de costos
Una configuración de esfuerzo ajustable permite a los desarrolladores intercambiar costo por capacidad. Con ajustes de esfuerzo bajos, Opus 5 sigue superando a la mayoría de los demás modelos disponibles; al máximo esfuerzo, se acerca a la capacidad frontera de Fable 5 con aproximadamente la mitad del costo por tarea. Anthropic también redujo la longitud mínima de prompt cacheable de 1,024 tokens a 512 tokens, lo que genera ahorros reales en prompts más cortos que antes no podían beneficiarse del caching. El procesamiento por lotes puede reducir aún más los costos hasta un 50%.
Avances científicos y seguridad
En las evaluaciones internas de ciencias biológicas de Anthropic, Opus 5 mejora frente a Opus 4.8 en todos los dominios probados. Los mayores avances están en química orgánica — inferir estructuras moleculares a partir de datos espectroscópicos, donde Opus 5 obtiene 10,2 puntos porcentuales más — y predicción de función de proteínas, donde obtiene 7,7 puntos porcentuales más. Anthropic afirma que Opus 5 es "su modelo más alineado hasta la fecha" en auditorías de comportamiento internas, con mayor adherencia a sus pautas constitucionales de IA y menores tasas de mal uso.
Dónde se sitúa en la gama
Opus 5 se convierte en el nuevo modelo predeterminado en Claude Max y el más potente disponible en Claude Pro, reemplazando a Opus 4.8 en ambos roles. Todavía va por detrás de Fable 5 y Mythos 5 en tareas de ciberseguridad, donde esos modelos frontera mantienen la ventaja. Según el anuncio de Anthropic, Claude Opus 5 está disponible de inmediato a través de la API y en Claude.ai.
Originally reported by Anthropic. Read the original article for additional details.
View original source