AIO APEX

Anthropic lance Claude Opus 5 avec des scores record aux benchmarks au même prix que l'Opus 4.8

Anthropic
Partager:
Anthropic lance Claude Opus 5 avec des scores record aux benchmarks au même prix que l'Opus 4.8

Anthropic a publié Claude Opus 5 le 24 juillet 2026, un modèle qui offre des performances nettement meilleures que son prédécesseur tout en conservant le même prix : 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie, identique à Claude Opus 4.8.

Des résultats de benchmarks qui se démarquent

Sur Frontier-Bench v0.1, l'évaluation du génie logiciel menée par frontierbench.ai, Opus 5 surpasse tous les autres modèles — y compris le propre Fable 5 d'Anthropic. L'écart avec Opus 4.8 est flagrant : Opus 5 double plus que le score de son prédécesseur tout en coûtant moins cher par tâche accomplie.

La même tendance se retrouve dans une série d'évaluations. Sur ARC-AGI 3, qui mesure la résolution de problèmes véritablement nouveaux, Opus 5 obtient un score trois fois supérieur au meilleur modèle suivant. Sur Zapier AutomationBench — qui teste si un modèle peut réaliser des tâches professionnelles réelles de bout en bout — son taux de réussite est environ 1,5 fois meilleur que tout concurrent, même au réglage d'effort le plus bas. Sur OSWorld 2.0, un benchmark d'utilisation d'ordinateur, Opus 5 dépasse le meilleur résultat de Fable 5 pour un peu plus du tiers du coût par tâche de Fable 5. Il est également en tête sur GDPval-AA, une évaluation des connaissances appliquées et du raisonnement.

Conçu pour le travail agentique et de longue haleine

Anthropic décrit Opus 5 comme "réfléchi et proactif", un langage qui reflète son orientation de conception vers des tâches agentiques étendues : des agents logiciels qui fonctionnent pendant des heures, naviguent à travers des obstacles inattendus et se remettent des erreurs sans intervention humaine. Il est livré avec une fenêtre de contexte d'un million de tokens et une sortie maximale de 128 000 tokens — une marge importante pour les grosses bases de code et les sessions d'analyse prolongées.

Deux fonctionnalités bêta ont été lancées en parallèle : les changements d'outils en cours de conversation, qui permettent d'ajouter ou de supprimer des outils dynamiquement pendant une exécution agentique, et un mode de repli "par défaut" pour maintenir les agents en fonctionnement lorsqu'un outil préféré devient indisponible.

Cadran d'effort pour le contrôle des coûts

Un réglage d'effort configurable permet aux développeurs d'arbitrer entre coût et capacité. À des niveaux d'effort faibles, Opus 5 surpasse encore la plupart des autres modèles disponibles ; à effort maximal, il s'approche de la capacité de pointe de Fable 5 pour environ la moitié du coût par tâche. Anthropic a également réduit la longueur minimale de prompt mis en cache de 1 024 tokens à 512 tokens, ce qui génère des économies réelles sur les prompts plus courts qui ne pouvaient pas bénéficier du caching auparavant. Le traitement par lots peut réduire encore les coûts jusqu'à 50 %.

Gains scientifiques et sécurité

Sur les évaluations internes en sciences de la vie d'Anthropic, Opus 5 s'améliore par rapport à Opus 4.8 dans tous les domaines testés. Les plus grands gains sont en chimie organique — déduction des structures moléculaires à partir de données spectroscopiques, où Opus 5 obtient 10,2 points de pourcentage de plus — et prédiction de la fonction des protéines, où il obtient 7,7 points de pourcentage de plus. Anthropic affirme qu'Opus 5 est "son modèle le plus aligné à ce jour" lors des audits comportementaux internes, avec une adhésion plus élevée à ses directives d'IA constitutionnelle et des taux d'utilisation abusive plus faibles.

Sa place dans la gamme

Opus 5 devient le nouveau modèle par défaut sur Claude Max et le plus puissant disponible sur Claude Pro, remplaçant Opus 4.8 dans les deux rôles. Il reste en retrait de Fable 5 et Mythos 5 sur les tâches de cybersécurité, où ces modèles de pointe conservent l'avantage. Selon l'annonce d'Anthropic, Claude Opus 5 est disponible immédiatement via l'API et sur Claude.ai.

Originally reported by Anthropic. Read the original article for additional details.

View original source
Partager: