Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Claude Opus 5: benchmarks, effort et tarification
2026/07/27

Claude Opus 5: benchmarks, effort et tarification

Comment utiliser Claude Opus 5 : tableau de benchmarks, l'échelle d'effort qui détermine votre coût, deux changements API de rupture et les étapes de migration.

Anthropic a lancé Claude Opus 5 le 24 juillet 2026, le qualifiant de saut qualitatif par rapport à Claude Opus 4.8[6]. Il est affiché au prix exactement identique au modèle qu'il remplace : 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie[3]. La question de bien utiliser Claude Opus 5 n'a donc presque rien à voir avec le prix catalogue, qui n'a pas changé, et presque tout à voir avec un curseur que la plupart des équipes ne touchent jamais.

Ce curseur s'appelle effort. Au lieu de publier un seul chiffre par indice, Anthropic a publié les courbes score-coût sur l'ensemble des cinq niveaux d'effort[1]. L'écart entre l'échelon le moins cher et le plus cher de ces courbes est plus large que tout ce qu'une réécriture de prompt pourrait récupérer, et la guidance officielle recommande de balayer l'échelle contre vos propres evals plutôt que d'augmenter partout[2].

TL;DR

  • Prix catalogue identique, modèle différent. 5 $ / 25 $ par million de jetons, inchangé depuis Opus 4.8[2]. Sur reAPI le même modèle tourne à 2,40 $ / 12,00 $, soit 48 % du tarif publié d'Anthropic.
  • La pensée est activée par défaut maintenant. Sur Opus 4.8, l'omission du champ thinking signifiait pas de pensée. Sur Opus 5 la même requête pense[2]. Puisque max_tokens plafonne la pensée plus le texte de réponse ensemble, les budgets serrés reportés seront tronqués.
  • Désactiver la pensée est plafonné au niveau d'effort high. Envoyer thinking: {"type": "disabled"} avec xhigh ou max retourne une 400, vérifiée par requête[2].
  • Opus 5 ne gagne pas tout. Le propre tableau d'Anthropic le montre perdant sur le codage agentique face à GPT-5.6 Sol : 68,8 % contre 72,7% sur DeepSWE v1.1[1].
  • N'héritez pas les paramètres d'effort. Anthropic dit que low et medium produisent maintenant une qualité solide à une fraction des jetons et de la latence, et recommande de commencer au défaut high et de vous déplacer dans les deux sens contre vos propres evals[2].
  • Priority Tier ne le couvre pas, et il se situe dans son propre compartiment de limite de débit plutôt que dans le pool Opus partagé[5][4].

Ce qu'est Claude Opus 5

Anthropic positionne Claude Opus 5 pour le codage agentique complexe et le travail d'entreprise[2]. L'identifiant API est claude-opus-5, sans suffixe de date à ajouter.

PropriétéClaude Opus 5
ID modèle APIclaude-opus-5
Fenêtre de contexte1 M jetons, défaut et maximum
Sortie max128k jetons
Prix catalogue5 $ / 25 $ par million de jetons entrée / sortie
Mode rapide10 $ / 50 $, API Claude uniquement
PenséeActivée par défaut, adaptative
Niveaux d'effortlow, medium, high, xhigh, max, défaut high
Minimum cache de prompts512 jetons, en baisse depuis 1 024

Il n'existe pas de variante de contexte plus petit[2]. La fenêtre de 1 M est ce que vous obtenez. Au-delà de l'API Claude, le modèle est disponible sur Amazon Bedrock en tant que anthropic.claude-opus-5, sur Google Cloud en tant que claude-opus-5, et sur Microsoft Foundry[2]. Le mode rapide est l'exception : il ne fonctionne que sur l'API Claude, pas sur l'une des trois plates-formes cloud[2].

Le tableau des benchmarks officiels complet

Le tableau comparatif Claude Opus 5 publié par Anthropic comparant Opus 5, Fable 5, Opus 4.8 et GPT-5.6 Sol sur le codage agentique terminal, le travail de connaissance, la résolution de problèmes novateurs, la recherche agentique, le raisonnement, l'utilisation d'ordinateur, le codage agentique, les flux de travail commerciaux, les évaluations légales, sanitaires et biologiques

Ceci est la comparaison publiée par Anthropic, entièrement retranscrite, y compris les lignes sur lesquelles Opus 5 ne gagne pas[1]. Lorsque la colonne Fable 5 porte un nom de modèle différent, c'est l'annotation d'Anthropic elle-même.

IndiceOpus 5Fable 5Opus 4.8GPT-5.6 Sol
Codage agentique terminal (Frontier-Bench v0.1)43,3%33,7%21,1%34,4%
Travail de connaissance (GDPval-AA v2, Elo)1861174715931736
Résolution de problèmes novateurs (ARC-AGI-3)30,2%1,5%7,8%
Recherche agentique (BrowseComp)90,8%87,4%84,3%90,4%
Raisonnement multidisciplinaire (HLE, sans outils)56,3%56,5%49,8%
Raisonnement multidisciplinaire (HLE, avec outils)64,7%63,9%57,9%
Utilisation d'ordinateur (OSWorld 2.0)70,6%66,1%55,7%62,6%
Codage agentique (DeepSWE v1.1)68,8%69,7%59,0%72,7%
Codage agentique (FrontierCode v1.1, Main)53,4%53,5%46,5%47,5%
Flux de travail commerciaux (AutomationBench)26,0%17,4%17,0%18,1%
Légal (Legal Agent Benchmark, tenu à part)11,7%13,3%10,4%2,5%
Santé (HealthBench Professional)59,8%66,0% (Mythos 5)57,4%60,5%
Biologie (BioMysteryBench, difficile)49,4%46,5%42,4%
Biologie (BioMysteryBench, résolu par humains)90,1%89,0% (Mythos 5)88,5%

Une note méthodologique avant que quiconque cite ces chiffres. Sur le diagramme d'accompagnement qui décompose Frontier-Bench par niveau d'effort, Anthropic énonce que ces résultats proviennent d'une exécution interne sur le harnais mini-SWE-agent avec un backend GKE, en faisant la moyenne de la récompense sur cinq tentatives par tâche, et qu'Opus 4.8 a servi de solution de secours lorsque les classificateurs de sécurité ont refusé une demande d'Opus 5 ou Fable 5[1]. Ce sont des évaluations gérées par le fournisseur. Lisez-les comme un signal directionnel, pas un audit neutre.

Où il gagne et où il perd

Opus 5 prend neuf des quatorze lignes. Les marges sur les victoires ne sont pas subtiles. Frontier-Bench passe de 21,1% sur Opus 4.8 à 43,3%, légèrement plus du double. ARC-AGI-3 passe de 1,5% à 30,2%, et le concurrent le plus proche dans cette ligne est GPT-5.6 Sol à 7,8%. AutomationBench se tient à 26,0% face à un cluster de 17% à 18%[1].

Il perd les cinq autres, et ceux-ci sont plus utiles pour choisir un modèle que les victoires.

  • DeepSWE v1.1, codage agentique : 68,8% contre 72,7% de GPT-5.6 Sol. C'est la perte la plus claire du classement, et elle atterrit sur la charge de travail pour laquelle Opus 5 est commercialisé. Anthropic a laissé la ligne.
  • HealthBench Professional : 59,8%, derrière Mythos 5 à 66,0% et GPT-5.6 Sol à 60,5%.
  • Legal Agent Benchmark : 11,7% contre 13,3% de Fable 5. Les deux chiffres sont assez bas pour que l'indice mesure surtout la distance de l'objectif.
  • HLE sans outils (56,3% contre 56,5%) et FrontierCode Main (53,4% contre 53,5%) sont des égalités dans le bruit, mais elles contredisent l'affirmation qu'Opus 5 domine Fable 5 partout.

Le motif : Opus 5 gagne lorsqu'une tâche s'exécute longtemps, utilise des outils et exige de maintenir l'état sur de nombreuses étapes. Elle s'égale ou perd sur les questions dures en un seul coup.

L'échelle d'effort détermine votre facture

Anthropic publie l'échelle complète score-versus-coût plutôt qu'un seul chiffre par indice, et la lire change la façon dont vous configurez le modèle[1].

Score de codage agentique par rapport au coût par tentative sur Frontier-Bench v0.1, en traçant l'échelle d'effort pour Claude Opus 5, Fable 5, Opus 4.8 et GPT-5.6 Sol sur une échelle de coût logarithmique

Trois choses en découlen.

L'échelon supérieur n'est pas le point de départ recommandé. L'instruction d'Anthropic est de commencer par le défaut, high, et d'ajuster dans l'une ou l'autre direction en fonction de vos evals : descendez où la qualité se maintient pour économiser les jetons et la latence, montez pour le travail le plus exigeant[2]. Notez où cette phrase commence. Le point d'entrée recommandé est le milieu de l'échelle, pas le haut, et l'effort porte maintenant plus de poids car Opus 5 convertit l'effort supplémentaire en meilleurs résultats plus fiablement que tout modèle Opus antérieur[2].

Les niveaux bas et moyen sont plus forts qu'avant. Anthropic souligne explicitement l'efficacité à un effort inférieur, en disant que low et medium produisent une qualité solide à une fraction des jetons et de la latence des paramètres supérieurs[2]. L'effort par défaut reporté d'Opus 4.8 n'est pas le bon point de départ.

L'effort est le levier de coût, pas le prompt. La guidance officielle est de commencer au défaut high, puis de vous déplacer dans l'une ou l'autre direction selon vos propres evals : descendez où la qualité se maintient pour économiser les jetons et la latence, montez pour le travail le plus exigeant[2]. À xhigh ou max, définissez un grand max_tokens pour que le modèle ait de la place pour penser et agir sur les sous-agents et les appels d'outils[2].

Deux changements de rupture sous le capot

La surface des requêtes est principalement héritée d'Opus 4.8. Les paramètres d'échantillonnage sont toujours rejetés, les budgets de pensée fixes sont toujours rejetés, et le remplissage du dernier tour assistant échoue toujours. Deux choses ont changé, et les deux cassent le code reporté sans modification.

La pensée fonctionne quand vous omettez le paramètre. Sur Opus 4.8, une requête sans champ thinking s'exécutait sans pensée. Sur Opus 5, la même requête pense, le modèle décidant quand et combien à chaque tour[2]. La valeur du fil n'a pas changé ; thinking: {"type": "adaptive"} est toujours valide et équivalent au défaut. Ce qui a changé, c'est ce qui se passe quand vous ne dites rien. Puisque max_tokens est une limite stricte sur la pensée plus le texte de réponse ensemble, Anthropic vous dit de revoir cela pour toute charge de travail qui s'exécutait sans pensée auparavant[2]. Un budget accordé à la sortie visible seule va maintenant s'interrompre au milieu de la réponse.

Désactiver la pensée nécessite l'effort high ou inférieur. thinking: {"type": "disabled"} associé à xhigh ou max retourne une 400. La vérification s'exécute sur chaque requête, donc une session qui réussit à high commence à échouer au moment où un appel ultérieur augmente l'effort pendant que la pensée est toujours désactivée[2].

Anthropic documente également ce qui peut mal tourner avec la pensée désactivée : le modèle peut écrire un appel d'outil dans sa sortie texte au lieu d'émettre un bloc tool_use, ou divulguer des balises XML internes dans la réponse visible[2]. Le premier mode de défaillance est le dangereux dans une boucle d'agent, car le tour se termine proprement et l'appel n'exécute jamais. La recommandation officielle est de garder la pensée activée et de contrôler le coût avec un niveau d'effort plus bas à la place.

Trois ajouts valent la peine d'être connus :

  • Les changements d'outils mid-conversation (en-tête bêta mid-conversation-tool-changes-2026-07-01) vous permettent d'ajouter ou de supprimer des outils entre les tours tout en préservant le cache de prompts, au lieu de fixer une liste d'outils pour la durée de vie d'une session[2].
  • Un mode fallback "default" (en-tête bêta server-side-fallback-2026-07-01) applique les modèles de solution de secours recommandés d'Anthropic par catégorie de refus plutôt qu'une liste que vous maintenez[2].
  • Le minimum du cache de prompts s'est réduit à 512 jetons depuis 1 024, donc les prompts précédemment trop courts pour être mis en cache créent maintenant des entrées de cache sans modifications de code[2].

Ce qui fait vraiment bouger la facture

Voici le barème complet officiel[3] :

ÉlémentPrix par MTok
Entrée5 $
Sortie25 $
Accès au cache et rafraîchissements0,50 $
Écriture de cache (5 minutes)6,25 $
Écriture de cache (1 heure)10 $
Entrée batch2,50 $
Sortie batch12,50 $
Entrée mode rapide10 $
Sortie mode rapide50 $

L'API Batch s'exécute à la moitié du tarif standard sur les deux dimensions, et le mode rapide le double[3]. Anthropic décrit Opus 5 comme livrant l'intelligence de la frontière à la moitié du coût de Claude Fable 5[2], ce qui s'ajoute au barème : Fable 5 s'affiche à 10 $ / 50 $[3].

Trois leviers importent plus que le tarif par jeton.

L'effort. L'écart de coût par tentative publié sur l'échelle est assez large pour que déplacer une route de xhigh à medium économise plus que toute réécriture de prompt[1].

Verbosité. Anthropic énonce que les réponses par défaut et les livrables écrits s'allongent sur Opus 5[2]. Les jetons de pensée s'ajoutent à la sortie, tout comme la prose supplémentaire. Baisser l'effort réduit la pensée mais ne raccourcit pas de manière fiable la sortie visible, donc écrivez une instruction de brièveté explicite.

L'échafaudage de vérification que vous pouvez maintenant supprimer. Opus 5 vérifie son propre travail sans y être invité, et Anthropic dit que les instructions reportées de modèles antérieurs, comme « inclure une étape de vérification finale » ou « utiliser un sous-agent pour vérifier », causent une sur-vérification[2]. Les supprimer réduit la dépense de jetons sans compromis de qualité, ce qui est un type rare d'optimisation.

Limites de débit et Priority Tier

Deux faits opérationnels qui rattrapent les équipes lors du déploiement.

Priority Tier ne couvre pas Claude Opus 5. La documentation du niveau de service d'Anthropic énonce que Priority Tier est pris en charge sur tous les modèles Claude disponibles sauf Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 et Claude Sonnet 5[5]. Si votre planification de capacité supposait la couverture Priority Tier, elle ne s'applique pas ici.

Opus 5 a également son propre compartiment de limite de débit. La limite Opus combinée s'applique au trafic sur Opus 4.8, 4.7, 4.6 et 4.5 ; Opus 5 ne fait pas partie de ce pool[4]. C'est une bonne nouvelle lors d'une migration, car le trafic Opus 5 ne consomme pas le budget sur lequel vos routes Opus 4.8 existantes dépendent. Le mode rapide a à nouveau des limites dédiées séparées des limites Opus standard, et retourne une 429 avec un en-tête retry-after en cas de dépassement[4].

Comment utiliser Claude Opus 5 : liste de contrôle de migration

La guidance de migration d'Anthropic se réduit à un changement de chaîne de modèle plus un examen des deux changements de comportement[2]. En pratique la liste est un peu plus longue.

  1. Changez la chaîne de modèle en claude-opus-5.
  2. Auditez chaque route qui désactive la pensée. Soit gardez la pensée désactivée et baissez l'effort à high ou inférieur, soit gardez le niveau d'effort et supprimez le champ thinking.
  3. Augmentez max_tokens sur les routes qui ne définissent jamais un champ thinking. Elles pensent maintenant, et le budget couvre les deux.
  4. Refaites un balayage d'effort contre vos propres evals. Commencez au défaut high et déplacez-vous dans les deux sens plutôt que d'hériter des paramètres Opus 4.8.
  5. Supprimez les instructions de vérification des prompts et les étapes de vérification des harnais.
  6. Ajoutez une instruction de brièveté explicite aux routes face à l'utilisateur.
  7. Revérifiez les prompts courts que vous aviez rayés comme non stockables contre le nouveau minimum de 512 jetons.
  8. Traitez les refus comme des réponses, pas des erreurs. Les classificateurs de sécurité peuvent décliner une requête et retourner une raison d'arrêt plutôt qu'une erreur HTTP, donc le code qui lit le premier bloc de contenu sans condition cassera.

Appeler Claude Opus 5 aux côtés de vos autres modèles

Tout ce qui précède pointe vers le même problème opérationnel. Ce modèle a cinq niveaux d'effort, son propre compartiment de limite de débit, pas de Priority Tier, et un tableau de comparaison où il perd le codage agentique face à GPT-5.6 Sol et la santé face à Mythos 5. La configuration correcte n'est pas un seul paramètre. C'est une décision de routage par charge de travail, et elle change chaque fois qu'un fournisseur envoie.

C'est la couche qui vaut la peine d'être construite délibérément. Un balayage d'examen de code et un travail d'extraction en masse ne devraient pas s'exécuter au même effort, et une route sur laquelle Opus 5 perd n'a pas raison de rester sur Opus 5 par habitude. Gérer cela avec un client SDK par fournisseur, une clé par fournisseur, et une surface de facturation par fournisseur est l'endroit où le coût du travail multi-modèle s'accumule vraiment.

reAPI expose Claude Opus 5 via un point de terminaison compatible OpenAI /v1/chat/completions, donc le client que vous utilisez déjà pour les appels GPT et Gemini l'appelle aussi :

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

Les tarifs sur la passerelle sont 2,40 $ par million de jetons d'entrée et 12,00 $ par million de jetons de sortie, ce qui est 48 % des 5 $ / 25 $ publiés d'Anthropic. La surface de requête complète, y compris output_config.effort et les règles de pensée ci-dessus, est documentée sur la page reapi.ai/docs/claude-opus-5, et les tarifs actuels vivent sur reapi.ai/models/claude-opus-5.

Rien de cela ne supprime la décision de routage. Cela supprime la taxe d'intégration sur la prise d'une.

FAQ

Claude Opus 5 est-il meilleur que Claude Fable 5 ?

Sur neuf des quatorze lignes du tableau publié d'Anthropic, oui, et à la moitié du prix catalogue de Fable 5[3]. Mais Fable 5 prend toujours HLE sans outils, FrontierCode Main et le Legal Agent Benchmark, et la ligne HealthBench Professional va à Mythos 5[1].

Claude Opus 5 coûte-t-il plus cher qu'Opus 4.8 ?

Non. Les deux s'affichent à 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie[3]. Anthropic a expédié le saut de capacité sans changement de prix[2].

Quel est le plus grand changement de rupture d'Opus 4.8 ?

La pensée est activée par défaut. Une requête qui a omis le champ thinking s'exécutait sans pensée sur Opus 4.8 et pense sur Opus 5, ce qui change à la fois le coût et le comportement de max_tokens. Deuxièmement, thinking: {"type": "disabled"} retourne maintenant une 400 au niveau d'effort xhigh ou max[2].

Quel niveau d'effort dois-je utiliser ?

Commencez au défaut, high, puis balayez dans les deux directions contre vos propres evals[2]. Anthropic encadre max comme l'échelon supérieur pour le raisonnement le plus profond possible plutôt qu'un meilleur défaut, et note séparément que low et medium se maintiennent à une fraction des jetons et de la latence sur ce modèle[2].

Quel est la fenêtre de contexte de Claude Opus 5 ?

1 M jetons, qui sont à la fois le défaut et le maximum. Il n'existe pas de variante de contexte plus petit. La sortie maximale est 128k jetons[2].

Claude Opus 5 est-il couvert par Priority Tier ?

Non. Priority Tier couvre tous les modèles Claude disponibles sauf Mythos 5, Mythos Preview, Opus 5 et Sonnet 5[5]. Opus 5 s'assied aussi dans son propre compartiment de limite de débit plutôt que le pool Opus 4.x combiné[4].

Puis-je toujours désactiver la pensée ?

Oui, à un effort high ou inférieur. Anthropic déconseille, documentant que le modèle peut écrire les appels d'outils dans le texte visible ou divulguer les balises internes quand la pensée est désactivée, et recommande de baisser l'effort à la place[2].

Comment appeler Claude Opus 5 avec le SDK OpenAI ?

Pointez le client OpenAI sur https://api.reapi.ai/v1, définissez model sur claude-opus-5, et envoyez une requête de chat normal. Le point de terminaison est compatible OpenAI, donc aucune réécriture de SDK n'est nécessaire.

Choisir un niveau d'effort et continuer

La chose intéressante à propos de cette version est que la page de tarification est la partie la moins informative de celle-ci. Le prix catalogue n'a pas bougé, donc tout le delta est dans le comportement : pensée activée par défaut, une 400 qui n'existait pas avant, un plancher de cache réduit de moitié, et une échelle d'effort dont le point d'entrée recommandé est l'échelon du milieu plutôt que le sommet. Anthropic a également publié cinq lignes de comparaison où son nouveau navire amiral perd, ce qui vaut plus que les neuf où il gagne.

Si vous migrez, le travail est petit et spécifique. Changez la chaîne de modèle, auditez les routes qui désactivent la pensée, augmentez max_tokens où la pensée est maintenant implicite, supprimez les instructions de vérification que vous avez écrites pour un modèle plus ancien, et balayez l'effort contre vos propres evals plutôt que d'hériter un paramètre. C'est comment utiliser Claude Opus 5 sans payer pour l'échelon supérieur d'une échelle qui cesse de monter.

Références

  1. Anthropic. Introducing Claude Opus 5 — benchmark comparison table and effort-level cost curves. Retrieved July 2026 from anthropic.com/news/claude-opus-5
  2. Anthropic. What's new in Claude Opus 5 — behavior changes, new features, availability, and migration. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  3. Anthropic. Pricing — token, cache, batch, and fast-mode rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Rate limits — per-model buckets and fast-mode limits. Retrieved July 2026 from platform.claude.com/docs/en/api/rate-limits
  5. Anthropic. Service tiers — Priority Tier model coverage. Retrieved July 2026 from platform.claude.com/docs/en/api/service-tiers
  6. Anthropic. Release notes — Claude Opus 5 launch entry dated July 24, 2026. Retrieved July 2026 from platform.claude.com/docs/en/release-notes/overview

Lectures supplémentaires