
Comment utiliser Claude Sonnet 5 : effort, coût et limitations
Guide Claude Sonnet 5 : résultats contre Opus 4.8, l'échelle d'effort qui détermine le coût, le tokenizer dense gonfle les factures, et la migration.
Anthropic a lancé Claude Sonnet 5 le 30 juin 2026 avec un discours inhabituellement direct : une intelligence proche d'Opus sur le codage et le travail agent, aux tarifs de Sonnet[1]. Les benchmarks officiels valident l'essentiel.
Bien utiliser Claude Sonnet 5 repose principalement sur deux points que le communiqué de lancement ne met pas en avant. L'échelle d'effort est le levier qui rend la promesse tarifaire réelle, et un tokenizer plus dense signifie que la même requête consomme environ 30 % de tokens supplémentaires par rapport à Sonnet 4.6. Une migration qui se limite à changer le nom du modèle modifiera silencieusement votre facture et peut tronquer la sortie[1].
Ce guide couvre les résultats, où Sonnet 5 égale ou traîne Opus 4.8, les quatre changements API qui cassent le code hérité, la tarification incluant la hausse de septembre, et qui devrait vraiment l'utiliser.
L'essentiel
- Quasi-Opus sur le travail de connaissance. Elo GDPval-AA v2 de 1618 face aux 1615 d'Opus 4.8, un match nul statistique[1].
- Reste à la traîne sur la queue difficile. SWE-bench Pro 63,2 % contre 69,2 %, et USAMO 2026 79,5 % contre 96,7 %[1].
- Les tarifs d'introduction s'étirent jusqu'au 31 août 2026 : $2 en entrée / $10 en sortie par million de tokens, montant à $3 / $15 à partir du 1er septembre[1].
- Premier Sonnet avec l'échelle d'effort complète :
low,medium,high(par défaut),xhigh,max[1]. - Le tokenizer est environ 30 % plus dense. Les prix au token sont inchangés, donc une requête identique coûte plus cher que sur Sonnet 4.6. Re-profiler avant de migrer[1].
budget_tokenset les paramètres d'échantillonnage retournent maintenant 400[1].
Ce qu'est Claude Sonnet 5
Claude Sonnet 5 (claude-sonnet-5) succède à Sonnet 4.6 en tant que remplacement drop-in. Anthropic le décrit comme le modèle Sonnet le plus agent, conçu pour faire des plans, piloter les navigateurs et les terminaux, et fonctionner de manière autonome pendant de longues périodes à un niveau qui exigeait récemment des modèles plus grands et plus coûteux[1].
Il a été déployé comme modèle par défaut pour les utilisateurs gratuits et pro sur claude.ai, et simultanément sur l'API Claude, Amazon Bedrock, Google Cloud Vertex AI et Microsoft Foundry en préversion. Il offre une fenêtre de contexte de 1M tokens par défaut et une sortie maximale de 128K[1].
Résultats

| Benchmark | Sonnet 5 | Sonnet 4.6 | Opus 4.8 (référence) |
|---|---|---|---|
| Codage agent (SWE-bench Pro) | 63,2 % | 58,1 % | 69,2 % |
| Codage agent (Terminal-Bench 2.1) | 80,4 % | 67,0 % | 82,7 % |
| Raisonnement (HLE, sans outils) | 43,2 % | 34,6 % | 49,8 % |
| Raisonnement (HLE, avec outils) | 57,4 % | 46,8 % | 57,9 % |
| Utilisation d'ordinateur (OSWorld-Verified) | 81,2 % | 78,5 % | 83,4 % |
| Travail de connaissance (GDPval-AA v2, Elo) | 1618 | 1395 | 1615 |
Deux points se démarquent. Par rapport à Sonnet 4.6, c'est un balayage net avec des sauts réels : Terminal-Bench monte de 13,4 points et l'Elo du travail de connaissance augmente de 223. Et sur le travail de connaissance, Sonnet 5 devance nominalement Opus 4.8, 1618 contre 1615, ce qui est un match nul, tout en se situant à environ deux à six points du vaisseau amiral sur le codage agent et l'utilisation d'ordinateur[1].
L'écart "à quelques points, à un tiers du coût" est l'ensemble de la proposition de valeur.
Les chiffres plus profonds de la fiche technique : 85,2 % sur le sous-ensemble SWE-bench Verified classique de 500 problèmes, 78,3 % sur SWE-bench Multilingue sur neuf langues, et 38,8 sur FrontierCode v1 de Cognition, plus du double des 15,1 de Sonnet 4.6. La mesure indépendante de Cursor le place à 61,2 % sur CursorBench contre 49 % pour Sonnet 4.6 et 63,8 % pour Opus 4.8. BrowseComp atteint 84,7 % mono-agent et 86,6 % multi-agent[1].
Un point faible honnête : sur USAMO 2026, Sonnet 5 obtient 79,5 %, un bond important par rapport aux 55,0 % de Sonnet 4.6, mais bien loin des 96,7 % d'Opus 4.8[1]. Les mathématiques formelles lourdes ne sont pas la mission de ce modèle.
L'échelle d'effort est le levier tarifaire
Sonnet 5 est le premier modèle de niveau Sonnet à exposer l'échelle complète : low, medium, high (par défaut), xhigh et max[1]. Ce n'est pas un bouton cosmétique. C'est ce qui rend réelle la promesse de qualité Opus au tarif Sonnet.

La courbe BrowseComp est l'illustration la plus claire. La précision de Sonnet 5 monte de environ 60 % à low à environ 85 % à max, et atteint une précision de classe Opus-4.8 à un coût par tâche nettement inférieur. Opus 4.8 plafonne toujours légèrement plus haut, mais Sonnet 5 y arrive pour beaucoup moins cher, ce qui est exactement ce dont une boucle d'agent à haut débit a besoin[1].
L'utilisation d'ordinateur raconte une histoire plus sobre.

Sur OSWorld-Verified, Opus 4.8 reste en tête à chaque niveau d'effort. Sonnet 5 bat toujours facilement Sonnet 4.6 et reste beaucoup moins cher, mais si le contrôle GUI au pixel près est votre charge de travail principale, le vaisseau amiral conserve un avantage réel[1].
La règle pratique : xhigh pour le codage à long terme et les tâches agent les plus difficiles, high pour la plupart du travail, medium ou low pour les emplois sensibles à la latence ou simples. Affinez par route plutôt que de défendre max partout.
Face au niveau comparable en coût
La fiche technique publie des chiffres de concurrents par rapport à GPT-5.5 et Gemini 3.5 Flash, qui est le niveau comparable en coût plutôt que la frontière absolue. Lisez cela comme "battez les modèles à votre point de prix", pas "battez tout"[1].
| Évaluation | Sonnet 5 | GPT-5.5 | Gemini 3.5 Flash |
|---|---|---|---|
| SWE-bench Pro | 63,2 | 58,6 | 55,1 |
| Terminal-Bench 2.1 | 80,4 | 83,4 | 76,2 |
| HLE (sans outils) | 43,2 | 41,4 | 40,2 |
| HLE (avec outils) | 57,4 | 52,2 | n/a |
| OSWorld-Verified | 81,2 | 78,7 | 78,4 |
| FrontierCode v1 | 38,8 | 25,5 | n/a |
| GDPval-AA v2 (Elo) | 1618 | 1509 | 1357 |
| AutomationBench | 13,5 | 12,9 | 14,5 |
| HealthBench Professionnel | 57,8 | 51,8 | n/a |
Sonnet 5 remporte la plupart des affrontements directs contre GPT-5.5 et perd celui qui est le plus cité : Terminal-Bench 2.1, où GPT-5.5 pilotant la CLI Codex obtient 83,4 contre 80,4. Face à Gemini 3.5 Flash, le balayage est plus large, avec AutomationBench la seule exception. Remarquez que les scores AutomationBench sont bas partout ; ce sont des benchmarks non saturés, pas résolus[1].
Où il égale Opus 4.8 et où il traîne
Égale ou devance : travail de connaissance GDPval-AA v2 (1618 contre 1615), recherche agent sur BrowseComp à une précision comparable pour un coût de tâche donné, Real-World Finance v2 (1219 contre 1222) et l'Elo de travail professionnel AA-Briefcase (1393 contre 1352)[1].
Traîne : SWE-bench Pro (63,2 contre 69,2), Terminal-Bench 2.1 (80,4 contre 82,7), OSWorld (81,2 contre 83,4), HLE sans outils (43,2 contre 49,8), CursorBench (61,2 contre 63,8), Toolathlon (54,3 contre 59,9) et USAMO 2026 (79,5 contre 96,7)[1].
Le motif est cohérent. Sur le travail de connaissance ouvert et la recherche agent, Sonnet 5 est effectivement de classe Opus. Sur le codage le plus difficile, l'utilisation d'ordinateur et les mathématiques formelles, Opus 4.8 conserve un avantage réel mais modeste. Pour les charges de travail exécutant plusieurs tours d'agent où le coût domine, Sonnet 5 est le défaut rationnel et Opus est le chemin d'escalade pour la queue difficile.
Comment utiliser Claude Sonnet 5 : quatre changements qui cassent le code ancien
Sonnet 5 adopte la surface de requête d'Opus 4.7/4.8, la migration est donc plus qu'un échange de chaîne[1].
La réflexion adaptative est activée par défaut. Sonnet 4.6 fonctionnait sans réfléchir sauf s'il était demandé. Sonnet 5 réfléchit de manière adaptative dès le départ, décidant par requête combien de raisonnement une tâche justifie. Vous pouvez toujours le désactiver explicitement si vous avez besoin de vitesse brute.
budget_tokens est supprimé. Les budgets de réflexion manuels retournent maintenant un 400. Contrôlez la profondeur via les niveaux d'effort.
Les paramètres d'échantillonnage sont rejetés. temperature, top_p et top_k non par défaut retournent un 400. Guidez avec la mise en forme.
Le tokenizer est environ 30 % plus dense. Sonnet 5 partage le tokenizer introduit avec Opus 4.7, qui transforme le même texte en environ 30 % de tokens supplémentaires. La tarification au token est inchangée, donc une requête équivalente peut coûter plus cher que sur Sonnet 4.6, et une limite max_tokens réglée pour l'ancien tokenizer peut maintenant tronquer la sortie en pleine réflexion.
C'est celui-là qui est la surprise coûteuse. Re-mesurer les dépenses réelles sur vos propres requêtes plutôt que de supposer que la tarification affichée se mappe proprement depuis Sonnet 4.6.
Une capacité digne de note : Sonnet 5 est le premier modèle de niveau Sonnet avec un palier image haute résolution, jusqu'à 2576 pixels sur le bord long et 4784 tokens visuels, face à l'ancien plafond de 1568 pixels. Il s'active automatiquement, ce qui importe pour la compréhension des documents denses, des graphiques et des captures d'écran[1].
Tarification
| Article | Introduction (jusqu'au 31 août 2026) | Standard (à partir du 1er septembre 2026) |
|---|---|---|
| Entrée | $2 / MTok | $3 / MTok |
| Sortie | $10 / MTok | $15 / MTok |
| Lecture cache | ~$0.20 / MTok | ~$0.30 / MTok |
| Batch | $1 / $5 | 50 % du standard |
Face à Opus 4.8 à $5 / $25, Sonnet 5 est environ un tiers du coût aux tarifs d'introduction et environ 60 % aux tarifs standard[1]. Couchez dans le cadran d'effort et la mise en cache des requêtes et l'écart s'élargit pour une charge de travail agent bien affûtée.
Deux mises en garde. Le tokenizer plus dense signifie que vous devriez recalculer les dépenses réelles plutôt que de faire confiance à la comparaison affichée. Et Priority Tier n'est pas disponible sur Sonnet 5[1].
Comportement de sécurité que votre code doit gérer
Sonnet 5 est le premier modèle de niveau Sonnet livré avec des protections cybersécurité en temps réel. Les requêtes touchant aux sujets cyber et biologiques interdits ou à haut risque peuvent être refusées, retournées en tant que HTTP 200 réussi avec une raison d'arrêt de refus plutôt qu'une erreur[1].
Si vous construisez un outil de sécurité ou des workflows de sciences de la vie où des requêtes bénignes mais adjacentes pourraient déclencher un classificateur, gérez explicitement cette raison d'arrêt au lieu de supposer que chaque 200 porte du contenu utilisable. Anthropic signale également des taux d'hallucination et de sycophantie inférieurs à Sonnet 4.6, ce qui importe partout où la sortie est approuvée en aval sans vérification humaine[1].
Qui devrait utiliser Claude Sonnet 5
C'est le défaut rationnel pour les charges de travail agent à haut volume où le coût par tour se compose : agents de codage, automatisation de navigateur et terminal, boucles de récupération et de recherche. Il s'adapte aux constructeurs de produits intégrant un LLM dans une fonctionnalité d'expédition, et au travail documentaire à long contexte où la fenêtre 1M et le prix bas au token rendent le traitement en masse viable.
Ayez recours à Opus 4.8 ou Opus 5 à la place lorsque la tâche se trouve dans la queue difficile : le codage le plus exigeant, l'utilisation d'ordinateur au pixel près ou les mathématiques formelles, où l'avantage de quelques points du vaisseau amiral vaut la prime.
Exécuter un modèle de niveau Sonnet sur reAPI
Pour être direct sur la couverture : Claude Sonnet 5 n'est pas sur la passerelle reAPI aujourd'hui. Le modèle de niveau Sonnet disponible est Claude Sonnet 4.6, et les modèles Claude sur la passerelle sont Opus 5, Opus 4.8, Opus 4.7, Sonnet 4.6 et Fable 5.
Cela importe moins qu'il y paraît, en raison de l'endroit où les prix se trouvent réellement. Sonnet 5 s'affiche à $3 / $15 à partir de septembre. Sur reAPI, Claude Opus 5 coûte $2.40 / $12.00 et Sonnet 4.6 pareil. Le modèle de niveau supérieur coûte donc moins sur la passerelle que la tarification standard affichée de Sonnet 5, et Opus 5 est le modèle qu'Anthropic décrit comme délivrant l'intelligence frontière à la moitié du coût de Fable 5.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Plan and run this multi-step refactor."}],
max_tokens=16000,
stream=True,
)Le endpoint est compatible OpenAI et la surface native Anthropic /v1/messages est aussi disponible. Les tarifs et les formes de requête sont sur reapi.ai/models, et la référence Opus 5 est sur reapi.ai/docs/claude-opus-5.
Si votre évaluation nécessite spécifiquement le comportement de Sonnet 5 plutôt que son point de prix, appelez-le directement via Anthropic.
FAQ
Claude Sonnet 5 est-il meilleur qu'Opus 4.8 ?
Sur le travail de connaissance ouvert et la recherche agent, ils sont effectivement à égalité, et Sonnet 5 avance légèrement sur GDPval-AA v2 (1618 contre 1615). Sur le codage le plus difficile, l'utilisation d'ordinateur et les mathématiques formelles, Opus 4.8 conserve un avantage modeste[1].
Combien coûte Claude Sonnet 5 ?
$2 par million de tokens d'entrée et $10 par million de sortie jusqu'au 31 août 2026, montant à $3 / $15 à partir du 1er septembre. La mise en cache des requêtes réduit les lectures de contexte en cache d'environ 90 %, et l'API Batch réduit de moitié le tarif[1].
Qu'est-ce que le niveau d'effort xhigh ?
Un paramètre d'effort entre high et max, réglé pour les tâches agent et de codage à long terme. Sonnet 5 est le premier modèle de niveau Sonnet à supporter l'échelle complète[1].
Pourquoi mes coûts ont-ils augmenté après migration depuis Sonnet 4.6 ?
Le tokenizer est environ 30 % plus dense, donc le même texte devient environ 30 % plus de tokens aux prix par token inchangés. Recomptez vos requêtes et relevez max_tokens afin que la sortie longue ne soit pas tronquée[1].
Claude Sonnet 5 supporte-t-il une fenêtre de contexte 1M token ?
Oui, 1M par défaut au tarif par token standard sans surcharge de long contexte, et jusqu'à 128K tokens de sortie[1].
Qu'est-ce qui casse lors de la migration depuis Sonnet 4.6 ?
budget_tokens retourne un 400, les paramètres d'échantillonnage non par défaut retournent un 400, la réflexion adaptative est maintenant par défaut, et le tokenizer plus dense change le coût et le comportement de troncature[1].
Claude Sonnet 5 peut-il contrôler un ordinateur ?
Oui. Il supporte l'utilisation d'outils, la recherche web, la récupération web, l'exécution de code et l'utilisation d'ordinateur, obtenant 81,2 % sur OSWorld-Verified contre 83,4 % pour Opus 4.8[1].
Claude Sonnet 5 est-il disponible sur reAPI ?
Actuellement non. La passerelle comporte Claude Opus 5, Opus 4.8, Opus 4.7, Sonnet 4.6 et Fable 5. Opus 5 sur reAPI coûte moins par token que le tarif standard affiché de Sonnet 5.
Choisir entre un palier et un point de prix
Claude Sonnet 5 livre sur sa promesse centrale. Pour le codage et le travail agent, il se rapproche suffisamment d'Opus 4.8 pour que, à un tiers du coût pendant la fenêtre d'introduction, il devienne le défaut sensé et réserve le vaisseau amiral à la queue difficile. Il remporte la plupart des affrontements directs contre GPT-5.5 et Gemini 3.5 Flash, avec des exceptions honnêtes sur Terminal-Bench, AutomationBench et les mathématiques formelles.
Deux choses décident si cet arithmétique résiste au contact avec votre charge de travail. L'augmentation tarifaire de septembre le fait passer d'un tiers d'Opus à environ 60 %, et le tokenizer plus dense signifie que la comparaison affichée sous-estime les dépenses réelles. Mesurez les deux sur vos propres requêtes avant de vous engager. C'est comment utiliser Claude Sonnet 5 sans découvrir le tokenizer sur votre facture, et c'est aussi pourquoi l'étiquette de palier importe moins que le nombre que vous payez réellement par tâche complétée.
Références
- Anthropic. Introducing Claude Sonnet 5. Retrieved July 2026 from anthropic.com/news/claude-sonnet-5
- Anthropic. Models overview — specs and pricing for all current Claude models. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
- Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
Lecture supplémentaire
- reAPI. How to use Claude Opus 5. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. How to use Claude Opus 4.8. reapi.ai/blog/how-to-use-claude-opus-4-8
- reAPI. Model catalog. reapi.ai/models
Auteur

Catégories
xhigh ?Pourquoi mes coûts ont-ils augmenté après migration depuis Sonnet 4.6 ?Claude Sonnet 5 supporte-t-il une fenêtre de contexte 1M token ?Qu'est-ce qui casse lors de la migration depuis Sonnet 4.6 ?Claude Sonnet 5 peut-il contrôler un ordinateur ?Claude Sonnet 5 est-il disponible sur reAPI ?Choisir entre un palier et un point de prixRéférencesLecture supplémentairePlus d'articles

Générer une vidéo d'un document PDF, PPT, Excel ou web
Créer une vidéo de 2 à 30 secondes à partir d'un PDF, présentation, tableur ou page web avec Wan 3.0. Limites d'entrée, calculs de coûts et exemples de requête.


DeepSeek V4 1M : max_tokens, facturation et concurrence
DeepSeek V4 partage 1M tokens entre entrée et sortie (384K max). Découvrez max_tokens, la facturation du cache et les limites de concurrence.


H3 Max est-il open source ? Poids et utilisation locale
MiniMax H3 a des poids publics, mais H3 Max est une variante post-entraînée distincte par fal. Découvrez ce qui est téléchargeable, hébergé et vérifié.
