
Claude Opus 5: benchmarks, effort et tarification
Comment utiliser Claude Opus 5 : tableau de benchmarks, l'échelle d'effort qui détermine votre coût, deux changements API de rupture et les étapes de migration.
Anthropic a lancé Claude Opus 5 le 24 juillet 2026, le qualifiant de saut qualitatif par rapport à Claude Opus 4.8[6]. Il est affiché au prix exactement identique au modèle qu'il remplace : 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie[3]. La question de bien utiliser Claude Opus 5 n'a donc presque rien à voir avec le prix catalogue, qui n'a pas changé, et presque tout à voir avec un curseur que la plupart des équipes ne touchent jamais.
Ce curseur s'appelle effort. Au lieu de publier un seul chiffre par indice, Anthropic a publié les courbes score-coût sur l'ensemble des cinq niveaux d'effort[1]. L'écart entre l'échelon le moins cher et le plus cher de ces courbes est plus large que tout ce qu'une réécriture de prompt pourrait récupérer, et la guidance officielle recommande de balayer l'échelle contre vos propres evals plutôt que d'augmenter partout[2].
TL;DR
- Prix catalogue identique, modèle différent. 5 $ / 25 $ par million de jetons, inchangé depuis Opus 4.8[2]. Sur reAPI le même modèle tourne à 2,40 $ / 12,00 $, soit 48 % du tarif publié d'Anthropic.
- La pensée est activée par défaut maintenant. Sur Opus 4.8, l'omission du champ
thinkingsignifiait pas de pensée. Sur Opus 5 la même requête pense[2]. Puisquemax_tokensplafonne la pensée plus le texte de réponse ensemble, les budgets serrés reportés seront tronqués. - Désactiver la pensée est plafonné au niveau d'effort
high. Envoyerthinking: {"type": "disabled"}avecxhighoumaxretourne une 400, vérifiée par requête[2]. - Opus 5 ne gagne pas tout. Le propre tableau d'Anthropic le montre perdant sur le codage agentique face à GPT-5.6 Sol : 68,8 % contre 72,7% sur DeepSWE v1.1[1].
- N'héritez pas les paramètres d'effort. Anthropic dit que
lowetmediumproduisent maintenant une qualité solide à une fraction des jetons et de la latence, et recommande de commencer au défauthighet de vous déplacer dans les deux sens contre vos propres evals[2]. - Priority Tier ne le couvre pas, et il se situe dans son propre compartiment de limite de débit plutôt que dans le pool Opus partagé[5][4].
Ce qu'est Claude Opus 5
Anthropic positionne Claude Opus 5 pour le codage agentique complexe et le travail d'entreprise[2]. L'identifiant API est claude-opus-5, sans suffixe de date à ajouter.
| Propriété | Claude Opus 5 |
|---|---|
| ID modèle API | claude-opus-5 |
| Fenêtre de contexte | 1 M jetons, défaut et maximum |
| Sortie max | 128k jetons |
| Prix catalogue | 5 $ / 25 $ par million de jetons entrée / sortie |
| Mode rapide | 10 $ / 50 $, API Claude uniquement |
| Pensée | Activée par défaut, adaptative |
| Niveaux d'effort | low, medium, high, xhigh, max, défaut high |
| Minimum cache de prompts | 512 jetons, en baisse depuis 1 024 |
Il n'existe pas de variante de contexte plus petit[2]. La fenêtre de 1 M est ce que vous obtenez. Au-delà de l'API Claude, le modèle est disponible sur Amazon Bedrock en tant que anthropic.claude-opus-5, sur Google Cloud en tant que claude-opus-5, et sur Microsoft Foundry[2]. Le mode rapide est l'exception : il ne fonctionne que sur l'API Claude, pas sur l'une des trois plates-formes cloud[2].
Le tableau des benchmarks officiels complet

Ceci est la comparaison publiée par Anthropic, entièrement retranscrite, y compris les lignes sur lesquelles Opus 5 ne gagne pas[1]. Lorsque la colonne Fable 5 porte un nom de modèle différent, c'est l'annotation d'Anthropic elle-même.
| Indice | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Codage agentique terminal (Frontier-Bench v0.1) | 43,3% | 33,7% | 21,1% | 34,4% |
| Travail de connaissance (GDPval-AA v2, Elo) | 1861 | 1747 | 1593 | 1736 |
| Résolution de problèmes novateurs (ARC-AGI-3) | 30,2% | — | 1,5% | 7,8% |
| Recherche agentique (BrowseComp) | 90,8% | 87,4% | 84,3% | 90,4% |
| Raisonnement multidisciplinaire (HLE, sans outils) | 56,3% | 56,5% | 49,8% | — |
| Raisonnement multidisciplinaire (HLE, avec outils) | 64,7% | 63,9% | 57,9% | — |
| Utilisation d'ordinateur (OSWorld 2.0) | 70,6% | 66,1% | 55,7% | 62,6% |
| Codage agentique (DeepSWE v1.1) | 68,8% | 69,7% | 59,0% | 72,7% |
| Codage agentique (FrontierCode v1.1, Main) | 53,4% | 53,5% | 46,5% | 47,5% |
| Flux de travail commerciaux (AutomationBench) | 26,0% | 17,4% | 17,0% | 18,1% |
| Légal (Legal Agent Benchmark, tenu à part) | 11,7% | 13,3% | 10,4% | 2,5% |
| Santé (HealthBench Professional) | 59,8% | 66,0% (Mythos 5) | 57,4% | 60,5% |
| Biologie (BioMysteryBench, difficile) | 49,4% | 46,5% | 42,4% | — |
| Biologie (BioMysteryBench, résolu par humains) | 90,1% | 89,0% (Mythos 5) | 88,5% | — |
Une note méthodologique avant que quiconque cite ces chiffres. Sur le diagramme d'accompagnement qui décompose Frontier-Bench par niveau d'effort, Anthropic énonce que ces résultats proviennent d'une exécution interne sur le harnais mini-SWE-agent avec un backend GKE, en faisant la moyenne de la récompense sur cinq tentatives par tâche, et qu'Opus 4.8 a servi de solution de secours lorsque les classificateurs de sécurité ont refusé une demande d'Opus 5 ou Fable 5[1]. Ce sont des évaluations gérées par le fournisseur. Lisez-les comme un signal directionnel, pas un audit neutre.
Où il gagne et où il perd
Opus 5 prend neuf des quatorze lignes. Les marges sur les victoires ne sont pas subtiles. Frontier-Bench passe de 21,1% sur Opus 4.8 à 43,3%, légèrement plus du double. ARC-AGI-3 passe de 1,5% à 30,2%, et le concurrent le plus proche dans cette ligne est GPT-5.6 Sol à 7,8%. AutomationBench se tient à 26,0% face à un cluster de 17% à 18%[1].
Il perd les cinq autres, et ceux-ci sont plus utiles pour choisir un modèle que les victoires.
- DeepSWE v1.1, codage agentique : 68,8% contre 72,7% de GPT-5.6 Sol. C'est la perte la plus claire du classement, et elle atterrit sur la charge de travail pour laquelle Opus 5 est commercialisé. Anthropic a laissé la ligne.
- HealthBench Professional : 59,8%, derrière Mythos 5 à 66,0% et GPT-5.6 Sol à 60,5%.
- Legal Agent Benchmark : 11,7% contre 13,3% de Fable 5. Les deux chiffres sont assez bas pour que l'indice mesure surtout la distance de l'objectif.
- HLE sans outils (56,3% contre 56,5%) et FrontierCode Main (53,4% contre 53,5%) sont des égalités dans le bruit, mais elles contredisent l'affirmation qu'Opus 5 domine Fable 5 partout.
Le motif : Opus 5 gagne lorsqu'une tâche s'exécute longtemps, utilise des outils et exige de maintenir l'état sur de nombreuses étapes. Elle s'égale ou perd sur les questions dures en un seul coup.
L'échelle d'effort détermine votre facture
Anthropic publie l'échelle complète score-versus-coût plutôt qu'un seul chiffre par indice, et la lire change la façon dont vous configurez le modèle[1].

Trois choses en découlen.
L'échelon supérieur n'est pas le point de départ recommandé. L'instruction d'Anthropic est de commencer par le défaut, high, et d'ajuster dans l'une ou l'autre direction en fonction de vos evals : descendez où la qualité se maintient pour économiser les jetons et la latence, montez pour le travail le plus exigeant[2]. Notez où cette phrase commence. Le point d'entrée recommandé est le milieu de l'échelle, pas le haut, et l'effort porte maintenant plus de poids car Opus 5 convertit l'effort supplémentaire en meilleurs résultats plus fiablement que tout modèle Opus antérieur[2].
Les niveaux bas et moyen sont plus forts qu'avant. Anthropic souligne explicitement l'efficacité à un effort inférieur, en disant que low et medium produisent une qualité solide à une fraction des jetons et de la latence des paramètres supérieurs[2]. L'effort par défaut reporté d'Opus 4.8 n'est pas le bon point de départ.
L'effort est le levier de coût, pas le prompt. La guidance officielle est de commencer au défaut high, puis de vous déplacer dans l'une ou l'autre direction selon vos propres evals : descendez où la qualité se maintient pour économiser les jetons et la latence, montez pour le travail le plus exigeant[2]. À xhigh ou max, définissez un grand max_tokens pour que le modèle ait de la place pour penser et agir sur les sous-agents et les appels d'outils[2].
Deux changements de rupture sous le capot
La surface des requêtes est principalement héritée d'Opus 4.8. Les paramètres d'échantillonnage sont toujours rejetés, les budgets de pensée fixes sont toujours rejetés, et le remplissage du dernier tour assistant échoue toujours. Deux choses ont changé, et les deux cassent le code reporté sans modification.
La pensée fonctionne quand vous omettez le paramètre. Sur Opus 4.8, une requête sans champ thinking s'exécutait sans pensée. Sur Opus 5, la même requête pense, le modèle décidant quand et combien à chaque tour[2]. La valeur du fil n'a pas changé ; thinking: {"type": "adaptive"} est toujours valide et équivalent au défaut. Ce qui a changé, c'est ce qui se passe quand vous ne dites rien. Puisque max_tokens est une limite stricte sur la pensée plus le texte de réponse ensemble, Anthropic vous dit de revoir cela pour toute charge de travail qui s'exécutait sans pensée auparavant[2]. Un budget accordé à la sortie visible seule va maintenant s'interrompre au milieu de la réponse.
Désactiver la pensée nécessite l'effort high ou inférieur. thinking: {"type": "disabled"} associé à xhigh ou max retourne une 400. La vérification s'exécute sur chaque requête, donc une session qui réussit à high commence à échouer au moment où un appel ultérieur augmente l'effort pendant que la pensée est toujours désactivée[2].
Anthropic documente également ce qui peut mal tourner avec la pensée désactivée : le modèle peut écrire un appel d'outil dans sa sortie texte au lieu d'émettre un bloc tool_use, ou divulguer des balises XML internes dans la réponse visible[2]. Le premier mode de défaillance est le dangereux dans une boucle d'agent, car le tour se termine proprement et l'appel n'exécute jamais. La recommandation officielle est de garder la pensée activée et de contrôler le coût avec un niveau d'effort plus bas à la place.
Trois ajouts valent la peine d'être connus :
- Les changements d'outils mid-conversation (en-tête bêta
mid-conversation-tool-changes-2026-07-01) vous permettent d'ajouter ou de supprimer des outils entre les tours tout en préservant le cache de prompts, au lieu de fixer une liste d'outils pour la durée de vie d'une session[2]. - Un mode fallback
"default"(en-tête bêtaserver-side-fallback-2026-07-01) applique les modèles de solution de secours recommandés d'Anthropic par catégorie de refus plutôt qu'une liste que vous maintenez[2]. - Le minimum du cache de prompts s'est réduit à 512 jetons depuis 1 024, donc les prompts précédemment trop courts pour être mis en cache créent maintenant des entrées de cache sans modifications de code[2].
Ce qui fait vraiment bouger la facture
Voici le barème complet officiel[3] :
| Élément | Prix par MTok |
|---|---|
| Entrée | 5 $ |
| Sortie | 25 $ |
| Accès au cache et rafraîchissements | 0,50 $ |
| Écriture de cache (5 minutes) | 6,25 $ |
| Écriture de cache (1 heure) | 10 $ |
| Entrée batch | 2,50 $ |
| Sortie batch | 12,50 $ |
| Entrée mode rapide | 10 $ |
| Sortie mode rapide | 50 $ |
L'API Batch s'exécute à la moitié du tarif standard sur les deux dimensions, et le mode rapide le double[3]. Anthropic décrit Opus 5 comme livrant l'intelligence de la frontière à la moitié du coût de Claude Fable 5[2], ce qui s'ajoute au barème : Fable 5 s'affiche à 10 $ / 50 $[3].
Trois leviers importent plus que le tarif par jeton.
L'effort. L'écart de coût par tentative publié sur l'échelle est assez large pour que déplacer une route de xhigh à medium économise plus que toute réécriture de prompt[1].
Verbosité. Anthropic énonce que les réponses par défaut et les livrables écrits s'allongent sur Opus 5[2]. Les jetons de pensée s'ajoutent à la sortie, tout comme la prose supplémentaire. Baisser l'effort réduit la pensée mais ne raccourcit pas de manière fiable la sortie visible, donc écrivez une instruction de brièveté explicite.
L'échafaudage de vérification que vous pouvez maintenant supprimer. Opus 5 vérifie son propre travail sans y être invité, et Anthropic dit que les instructions reportées de modèles antérieurs, comme « inclure une étape de vérification finale » ou « utiliser un sous-agent pour vérifier », causent une sur-vérification[2]. Les supprimer réduit la dépense de jetons sans compromis de qualité, ce qui est un type rare d'optimisation.
Limites de débit et Priority Tier
Deux faits opérationnels qui rattrapent les équipes lors du déploiement.
Priority Tier ne couvre pas Claude Opus 5. La documentation du niveau de service d'Anthropic énonce que Priority Tier est pris en charge sur tous les modèles Claude disponibles sauf Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 et Claude Sonnet 5[5]. Si votre planification de capacité supposait la couverture Priority Tier, elle ne s'applique pas ici.
Opus 5 a également son propre compartiment de limite de débit. La limite Opus combinée s'applique au trafic sur Opus 4.8, 4.7, 4.6 et 4.5 ; Opus 5 ne fait pas partie de ce pool[4]. C'est une bonne nouvelle lors d'une migration, car le trafic Opus 5 ne consomme pas le budget sur lequel vos routes Opus 4.8 existantes dépendent. Le mode rapide a à nouveau des limites dédiées séparées des limites Opus standard, et retourne une 429 avec un en-tête retry-after en cas de dépassement[4].
Comment utiliser Claude Opus 5 : liste de contrôle de migration
La guidance de migration d'Anthropic se réduit à un changement de chaîne de modèle plus un examen des deux changements de comportement[2]. En pratique la liste est un peu plus longue.
- Changez la chaîne de modèle en
claude-opus-5. - Auditez chaque route qui désactive la pensée. Soit gardez la pensée désactivée et baissez l'effort à
highou inférieur, soit gardez le niveau d'effort et supprimez le champthinking. - Augmentez
max_tokenssur les routes qui ne définissent jamais un champthinking. Elles pensent maintenant, et le budget couvre les deux. - Refaites un balayage d'effort contre vos propres evals. Commencez au défaut
highet déplacez-vous dans les deux sens plutôt que d'hériter des paramètres Opus 4.8. - Supprimez les instructions de vérification des prompts et les étapes de vérification des harnais.
- Ajoutez une instruction de brièveté explicite aux routes face à l'utilisateur.
- Revérifiez les prompts courts que vous aviez rayés comme non stockables contre le nouveau minimum de 512 jetons.
- Traitez les refus comme des réponses, pas des erreurs. Les classificateurs de sécurité peuvent décliner une requête et retourner une raison d'arrêt plutôt qu'une erreur HTTP, donc le code qui lit le premier bloc de contenu sans condition cassera.
Appeler Claude Opus 5 aux côtés de vos autres modèles
Tout ce qui précède pointe vers le même problème opérationnel. Ce modèle a cinq niveaux d'effort, son propre compartiment de limite de débit, pas de Priority Tier, et un tableau de comparaison où il perd le codage agentique face à GPT-5.6 Sol et la santé face à Mythos 5. La configuration correcte n'est pas un seul paramètre. C'est une décision de routage par charge de travail, et elle change chaque fois qu'un fournisseur envoie.
C'est la couche qui vaut la peine d'être construite délibérément. Un balayage d'examen de code et un travail d'extraction en masse ne devraient pas s'exécuter au même effort, et une route sur laquelle Opus 5 perd n'a pas raison de rester sur Opus 5 par habitude. Gérer cela avec un client SDK par fournisseur, une clé par fournisseur, et une surface de facturation par fournisseur est l'endroit où le coût du travail multi-modèle s'accumule vraiment.
reAPI expose Claude Opus 5 via un point de terminaison compatible OpenAI /v1/chat/completions, donc le client que vous utilisez déjà pour les appels GPT et Gemini l'appelle aussi :
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)Les tarifs sur la passerelle sont 2,40 $ par million de jetons d'entrée et 12,00 $ par million de jetons de sortie, ce qui est 48 % des 5 $ / 25 $ publiés d'Anthropic. La surface de requête complète, y compris output_config.effort et les règles de pensée ci-dessus, est documentée sur la page reapi.ai/docs/claude-opus-5, et les tarifs actuels vivent sur reapi.ai/models/claude-opus-5.
Rien de cela ne supprime la décision de routage. Cela supprime la taxe d'intégration sur la prise d'une.
FAQ
Claude Opus 5 est-il meilleur que Claude Fable 5 ?
Sur neuf des quatorze lignes du tableau publié d'Anthropic, oui, et à la moitié du prix catalogue de Fable 5[3]. Mais Fable 5 prend toujours HLE sans outils, FrontierCode Main et le Legal Agent Benchmark, et la ligne HealthBench Professional va à Mythos 5[1].
Claude Opus 5 coûte-t-il plus cher qu'Opus 4.8 ?
Non. Les deux s'affichent à 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie[3]. Anthropic a expédié le saut de capacité sans changement de prix[2].
Quel est le plus grand changement de rupture d'Opus 4.8 ?
La pensée est activée par défaut. Une requête qui a omis le champ thinking s'exécutait sans pensée sur Opus 4.8 et pense sur Opus 5, ce qui change à la fois le coût et le comportement de max_tokens. Deuxièmement, thinking: {"type": "disabled"} retourne maintenant une 400 au niveau d'effort xhigh ou max[2].
Quel niveau d'effort dois-je utiliser ?
Commencez au défaut, high, puis balayez dans les deux directions contre vos propres evals[2]. Anthropic encadre max comme l'échelon supérieur pour le raisonnement le plus profond possible plutôt qu'un meilleur défaut, et note séparément que low et medium se maintiennent à une fraction des jetons et de la latence sur ce modèle[2].
Quel est la fenêtre de contexte de Claude Opus 5 ?
1 M jetons, qui sont à la fois le défaut et le maximum. Il n'existe pas de variante de contexte plus petit. La sortie maximale est 128k jetons[2].
Claude Opus 5 est-il couvert par Priority Tier ?
Non. Priority Tier couvre tous les modèles Claude disponibles sauf Mythos 5, Mythos Preview, Opus 5 et Sonnet 5[5]. Opus 5 s'assied aussi dans son propre compartiment de limite de débit plutôt que le pool Opus 4.x combiné[4].
Puis-je toujours désactiver la pensée ?
Oui, à un effort high ou inférieur. Anthropic déconseille, documentant que le modèle peut écrire les appels d'outils dans le texte visible ou divulguer les balises internes quand la pensée est désactivée, et recommande de baisser l'effort à la place[2].
Comment appeler Claude Opus 5 avec le SDK OpenAI ?
Pointez le client OpenAI sur https://api.reapi.ai/v1, définissez model sur claude-opus-5, et envoyez une requête de chat normal. Le point de terminaison est compatible OpenAI, donc aucune réécriture de SDK n'est nécessaire.
Choisir un niveau d'effort et continuer
La chose intéressante à propos de cette version est que la page de tarification est la partie la moins informative de celle-ci. Le prix catalogue n'a pas bougé, donc tout le delta est dans le comportement : pensée activée par défaut, une 400 qui n'existait pas avant, un plancher de cache réduit de moitié, et une échelle d'effort dont le point d'entrée recommandé est l'échelon du milieu plutôt que le sommet. Anthropic a également publié cinq lignes de comparaison où son nouveau navire amiral perd, ce qui vaut plus que les neuf où il gagne.
Si vous migrez, le travail est petit et spécifique. Changez la chaîne de modèle, auditez les routes qui désactivent la pensée, augmentez max_tokens où la pensée est maintenant implicite, supprimez les instructions de vérification que vous avez écrites pour un modèle plus ancien, et balayez l'effort contre vos propres evals plutôt que d'hériter un paramètre. C'est comment utiliser Claude Opus 5 sans payer pour l'échelon supérieur d'une échelle qui cesse de monter.
Références
- Anthropic. Introducing Claude Opus 5 — benchmark comparison table and effort-level cost curves. Retrieved July 2026 from anthropic.com/news/claude-opus-5
- Anthropic. What's new in Claude Opus 5 — behavior changes, new features, availability, and migration. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Anthropic. Pricing — token, cache, batch, and fast-mode rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
- Anthropic. Rate limits — per-model buckets and fast-mode limits. Retrieved July 2026 from platform.claude.com/docs/en/api/rate-limits
- Anthropic. Service tiers — Priority Tier model coverage. Retrieved July 2026 from platform.claude.com/docs/en/api/service-tiers
- Anthropic. Release notes — Claude Opus 5 launch entry dated July 24, 2026. Retrieved July 2026 from platform.claude.com/docs/en/release-notes/overview
Lectures supplémentaires
- reAPI. What is Claude Opus 4.8? reapi.ai/blog/what-is-claude-opus-4-8
- reAPI. Claude Opus 5 endpoint reference. reapi.ai/docs/claude-opus-5
- reAPI. Model catalog. reapi.ai/models
Auteur

Catégories
Plus d'articles

Quel modèle Claude est meilleur pour coder et écrire
Le meilleur modèle Claude pour coder selon votre benchmark : Fable 5 domine SWE-Bench Pro, Opus 5 gagne sur terminal agentique et coûte 3 fois moins.


Les 10 percées de mathématiques d'OpenAI Astra
Dix avancées en mathématiques et informatique théorique générées par Astra : ce qui a été prouvé, ce que Lean vérifie, et ce qui attend validation des pairs.


Prix Seedream 5.0 Pro : la limite en pixels qui décide tout
Seedream 5.0 Pro se facture à 2,36 millions de pixels, non à son nom. Ce que coûte chaque palier et comment dimensionner l'export 16:9 pour rester bon marché.
