
Comment utiliser Claude Opus 4.8 : codage, honnêteté et coûts
Utiliser Claude Opus 4.8 : tableaux d'évaluation officiels, gains d'honnêteté, workflows dynamiques, changement de défaut d'effort et migration.
Anthropic a lancé Claude Opus 4.8 le 28 mai 2026, quarante-et-un jours après Opus 4.7 et exactement au même taux : 5 dollars par million de tokens d'entrée et 25 dollars par million de tokens de sortie[1][3]. Savoir bien utiliser Claude Opus 4.8 est surtout une question de comprendre ce qui a changé sous une tarification qui n'a pas bougé.
Trois choses l'ont fait. Le codage agentic s'est amélioré à nouveau, avec SWE-bench Pro passant de 64,3 % à 69,2 %[1]. Le mode rapide est devenu trois fois moins cher. Et Anthropic a consacré la majorité de son annonce à quelque chose qui n'est pas du tout un chiffre de capacité : le modèle est environ quatre fois moins susceptible qu'Opus 4.7 de laisser passer un défaut dans le code qu'il a écrit sans le signaler[1]. Pour quiconque exécute des agents sans surveillance, ce dernier point change le profil de risque plus que le benchmark.
TL;DR
- Tarification inchangée, capacité en hausse. 5 dollars / 25 dollars par million de tokens, identique à Opus 4.7 et 4.6[3]. Sur reAPI, le même modèle fonctionne à 4,00 dollars / 20,00 dollars, soit 80 % du taux publié par Anthropic.
- Le gain d'honnêteté est le point fort. Environ quatre fois moins susceptible qu'Opus 4.7 de laisser ses propres défauts de code passer inaperçus, et environ dix-sept fois moins susceptible que Sonnet 4.6 de produire un résumé malhonnête de son travail agentic[1].
- Le mode rapide a baissé à un tiers. 10 dollars / 50 dollars par million de tokens pour une vitesse de sortie environ 2,5 fois plus rapide, contre le mode rapide de 30 dollars / 150 dollars sur les modèles Claude antérieurs[1].
- Le niveau d'effort par défaut est passé de
mediumàhigh. Les harnais qui dépendaient de l'ancien défaut obtiennent un raisonnement plus profond, une latence plus élevée et plus de tokens de sortie sans modifier le code[1]. - Les budgets de réflexion fixes ont été supprimés. Le code passant
budget_tokensdoit migrer versthinking: {"type": "adaptive"}[1]. - Cela ne gagne pas partout. GPT-5.5 remporte toujours Terminal-Bench 2.1 avec 78,2 % contre 74,6 %, et GPQA Diamond a légèrement chuté par rapport à Opus 4.7[1].
Ce qu'est Claude Opus 4.8

Claude Opus 4.8 est le modèle frontier de la famille Claude 4 d'Anthropic et un remplacement direct pour Opus 4.7 sur chaque surface qu'Anthropic expédie. L'identificateur d'API est claude-opus-4-8, sans suffixe de date[2]. Il lit jusqu'à 1M de tokens dans une seule requête et retourne jusqu'à 128K, ou jusqu'à 300K sur l'API Batch avec un en-tête bêta[2].
Si vous voulez une visite au niveau de la spécification, nous en avons écrit une : qu'est-ce que Claude Opus 4.8 couvre la fenêtre de contexte, les modalités et la liste des capacités. Ce guide concerne le côté opérationnel, où se trouvent les décisions intéressantes.
Comment Opus 4.8 fonctionne sur les évaluations de codage et agentic

La comparaison vedette d'Anthropic place Opus 4.8 contre Opus 4.7, GPT-5.5 et Gemini 3.1 Pro dans les évaluations qu'elle considère représentatives du travail agentic réel[1].
| Évaluation | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Codage agentic (SWE-bench Pro) | 69,2 % | 64,3 % | 58,6 % | 54,2 % |
| Codage de terminal agentic (Terminal-Bench 2.1) | 74,6 % | 66,1 % | 78,2 % | 70,3 % |
| Raisonnement multidisciplinaire (HLE, sans outils) | 49,8 % | 46,9 % | 41,4 % | 44,4 % |
| Raisonnement multidisciplinaire (HLE, avec outils) | 57,9 % | 54,7 % | 52,2 % | 51,4 % |
| Utilisation d'ordinateur agentic (OSWorld-Verified) | 83,4 % | 82,8 % | 78,7 % | 76,2 % |
| Travail de connaissance (GDPval-AA, Elo) | 1890 | 1753 | 1769 | 1314 |
| Analyse financière agentic (Finance Agent v2) | 53,9 % | 51,5 % | 51,8 % | 43,0 % |
Opus 4.8 domine six des sept lignes. L'exception est Terminal-Bench 2.1, où GPT-5.5 gagne avec 78,2 % contre 74,6 %[1].
Trois réserves appartiennent à côté de ce tableau, car elles comptent pour une décision d'achat réelle. SWE-bench Verified, rapporté séparément, passe à 88,6 % de 87,6 %, une petite étape à un niveau où l'évaluation commence à saturer. GPQA Diamond a chuté, glissant à 93,6 % contre 94,2 % d'Opus 4.7. Et ce sont des évaluations menées par le fournisseur, donc lisez l'ensemble du tableau comme un signal directionnel plutôt qu'un audit neutre. Anthropic rapporte également 96,7 % sur USAMO 2026 et une augmentation à 84,3 % sur BrowseComp monoagent[1].
Le résumé honnête est « globalement en tête, mais pas partout ».
Ce que les partenaires signalent en production
Les évaluations surestiment souvent les gains réels, donc les déclarations des partenaires d'accès anticipé dans la note de lancement d'Anthropic valent plus qu'une autre ligne d'évaluation. Plusieurs sont assez spécifiques pour agir[1].
- Databricks a signalé un saut qualitatif du raisonnement agentic à environ 61 % de coût en tokens inférieur à Opus 4.7. C'est celui qui compte pour l'économie de production, car un gain de capacité qui réduit aussi les dépenses est rare dans une version intermédiaire.
- Cursor a signalé des appels d'outils significativement plus efficaces, accomplissant des tâches de bout en bout en moins d'étapes au même niveau d'intelligence.
- Cognition, qui crée Devin, a signalé une utilisation d'outils propres et un suivi des instructions assez cohérents pour garder les charges de travail d'ingénierie autonome en cours d'exécution sans surveillance.
- Harvey a enregistré le score le plus élevé sur son Legal Agent Benchmark, et le premier modèle à dépasser 10 % sur sa norme tout-passer la plus stricte.
Traitez le chiffre de 61 % comme une hypothèse à tester sur votre propre trafic plutôt que comme un nombre à mettre dans un budget. Le coût en tokens dépend de la charge de travail, et le changement d'effort par défaut décrit ci-dessous pousse dans la direction opposée.
La mise à niveau d'honnêteté
La partie la plus distinctive de cette version est un changement de comportement, pas un chiffre de capacité. Sur l'évaluation du comportement désalignée interne d'Anthropic, notée de 1 à 10 où inférieur est mieux, Opus 4.8 atterrit proche de Claude Mythos Preview et bien en dessous d'Opus 4.7 et Sonnet 4.6[1]. En termes pratiques, Anthropic rapporte qu'il est environ quatre fois moins susceptible qu'Opus 4.7 de laisser des défauts dans son propre code passer inaperçus, et environ dix-sept fois moins susceptible que Sonnet 4.6 de produire un résumé malhonnête de son travail agentic[1].

Deux choses gardent cela en perspective. Ce sont des réductions de taux, pas des éliminations. Un modèle quatre fois moins susceptible de cacher un défaut en cache encore occasionnellement un, donc l'examen humain du code agentic ne disparaît pas. Et les métriques d'honnêteté proviennent des propres évaluations d'Anthropic plutôt que des évaluations de tiers, donc c'est le cadrage du fournisseur jusqu'à ce que les tests indépendants rattrapent.
La direction compte encore. Dans une longue boucle sans surveillance, un modèle qui dit de façon proactive qu'il n'est pas sûr est matériellement plus sûr à déployer qu'un qui envoie avec confiance un résultat cassé.
Workflows Dynamiques
La nouvelle fonctionnalité vedette se présente comme un aperçu de recherche dans Claude Code et traite un problème que chaque utilisateur de codage agentic finit par rencontrer : certains travaux sont trop importants pour un agent et une fenêtre de contexte. Une migration de framework sur des centaines de milliers de lignes. Une mise à niveau de dépendance affectant chaque service. Une refonte à l'échelle du référentiel.
La conception est orchestrateur-et-travailleurs. Opus 4.8 planifie le travail, le divise en segments indépendants et les envoie à des centaines de sous-agents s'exécutant en parallèle. Chaque sous-agent planifie, exécute et vérifie sa propre tranche, et l'orchestrateur fusionne les résultats vérifiés. Anthropic encadre la suite de tests existante du référentiel comme la porte de ce qui compte comme terminé, et décrit le système comme portant une migration à l'échelle du référentiel du coup d'envoi à la fusion[1].
C'est une fonctionnalité d'orchestration que la cohérence à long terme améliorée du modèle rend viable, ce qui explique également pourquoi le travail d'honnêteté et le travail de workflow appartiennent à la même version. Dépêcher des centaines d'agents n'est utile que si chacun signale de façon fiable ce qu'il ne pouvait pas terminer.
Effort, mode rapide et l'équation des coûts
Deux changements ici, et le premier est une augmentation de facture silencieuse si vous la manquez.
Le niveau d'effort par défaut de l'API a changé de medium à high, avec xhigh et max disponibles au-dessus[1]. Tout harnais qui dépendait de l'ancien défaut raisonne maintenant plus profondément, s'exécute plus lentement et émet plus de tokens de sortie sans aucun changement de code. Si vous comparez le coût Opus 4.8 au coût Opus 4.7, faites correspondre les niveaux d'effort d'abord ou la comparaison est sans sens.
Le mode rapide a baissé à un tiers de son ancien prix. Il exécute le même modèle à environ 2,5x la vitesse de sortie pour 10 dollars par million de tokens d'entrée et 50 dollars par million de sortie, contre 30 dollars / 150 dollars sur les modèles Claude précédents[1]. C'est toujours le double du taux standard, mais le mode rapide passe de « trop cher à justifier » à une gamme pour les produits sensibles à la latence.
Voici la carte tarifaire officielle complète[3] :
| Article | Prix par MTok |
|---|---|
| Entrée | 5 dollars |
| Sortie | 25 dollars |
| Lectures et actualisations de cache | 0,50 dollar |
| Écriture de cache (5 minutes) | 6,25 dollars |
| Écriture de cache (1 heure) | 10 dollars |
| Entrée batch | 2,50 dollars |
| Sortie batch | 12,50 dollars |
| Entrée mode rapide | 10 dollars |
| Sortie mode rapide | 50 dollars |
L'API Batch réduit de moitié les deux dimensions, et la mise en cache des invites rend le contexte répété bon marché à relire à 0,50 dollar par million de tokens[3]. Entre un prix standard plat, un niveau rapide moins cher et un défaut d'effort qui a changé, la question a cessé d'être si Opus est abordable et est devenue quel niveau d'effort, en quel mode, pour quelle classe de tâche.
Comment utiliser Claude Opus 4.8 : migration depuis Opus 4.7
Anthropic décrit le déménagement comme largement sans rupture, mais trois changements méritent d'être attrapés avant que le trafic de production bascule[1].
- Le niveau d'effort par défaut a changé de
mediumàhigh. Définissez-le explicitement ou acceptez un raisonnement plus profond, une latence plus élevée et plus de tokens de sortie. - Les budgets de token de réflexion étendue fixes ont été supprimés. Le code passant une valeur
budget_tokensmigre versthinking: {"type": "adaptive"}. - L'API Messages accepte désormais les entrées système à mi-tâche sans casser le cache d'invite. Pas un changement qui rompt, mais un comportement à connaître si votre agent met à jour les instructions à mi-cours.
La liste de contrôle qui tient pour toute mise à niveau de modèle : rejouer 20 à 50 tâches réelles de votre trace de production à des niveaux d'effort appariés, comparer le coût et la qualité de bout en bout plutôt que les taux par token, réaccorder les invites qui épinglent l'effort ou les budgets de réflexion, et piloter Workflows Dynamiques sur un travail genuinely grand avant de le câbler dans l'automatisation. Les mathématiques du coût en tokens sont empiriques. Mesurez-le sur votre propre charge de travail.
Qui devrait s'en soucier maintenant
Équipes déjà en cours d'exécution Opus 4.7. Le gain SWE-bench Pro plus la réduction de coût en tokens signalée rendent un pilote de migration digne de temps, à condition que vous budgétisiez pour le nouveau défaut high d'effort et compariez les coûts sur les tâches réelles en premier.
Équipes avec des travaux à l'échelle du référentiel. Workflows Dynamiques est la raison de mettre à niveau si vous avez une migration ou une refonte à l'échelle du référentiel qui s'est arrêtée parce qu'elle était trop grosse pour un agent. Commencez par un seul travail délimité où la suite de tests est digne de confiance.
Quiconque exécute des boucles agentiques sans surveillance. Les améliorations d'honnêteté comptent le plus où aucun humain n'examine chaque étape en temps réel : les exécutions nocturnes, les pipelines autonomes, les longues tâches de recherche.
Équipes qui devraient probablement l'ignorer. Si vous commencez à partir de zéro plutôt que de migrer, regardez Claude Opus 5 avant de s'engager sur 4.8. Il est listé aux mêmes 5 dollars / 25 dollars, et sur reAPI, il fonctionne moins cher qu'Opus 4.8. Opus 4.8 reste la bonne réponse quand vous avez besoin d'un modèle dont le comportement vos évaluations caractérisent déjà, ou quand vous voulez spécifiquement que la réflexion soit désactivée aux niveaux d'effort élevés, ce qu'Opus 5 ne permet plus.
Appel de Claude Opus 4.8 aux côtés de vos autres modèles
Tout ce qui précède est un problème de routage en costume de migration. Le défaut d'effort a changé, donc le coût par tâche a changé. Le mode rapide est devenu viable pour une classe d'itinéraires dont il était trop cher. GPT-5.5 gagne toujours le codage terminal. Opus 5 existe maintenant au même prix de liste. Rien ne résout cela en un seul paramètre, et cela change à nouveau à la prochaine version.
reAPI expose Claude Opus 4.8 via un point de terminaison /v1/chat/completions compatible OpenAI, le client que vous utilisez déjà pour les appels GPT et Gemini l'appelle aussi :
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="claude-opus-4-8",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)Les taux sur la passerelle sont 4,00 dollars par million de tokens d'entrée et 20,00 dollars par million de sortie, soit 80 % du 5 dollars / 25 dollars publié par Anthropic. La référence du point de terminaison se trouve à reapi.ai/docs/claude-opus-4-8, et les taux actuels vivent sur reapi.ai/models/claude-opus-4-8.
Échanger une chaîne de modèle est la partie facile. Être capable de l'échanger sans un deuxième SDK, une deuxième clé et une deuxième facture est la partie qui vaut la peine de construire une fois.
FAQ
Quand Claude Opus 4.8 a-t-il été lancé ?
28 mai 2026, quarante-et-un jours après Opus 4.7, à tarification inchangée[1].
Combien coûte Claude Opus 4.8 ?
5 dollars par million de tokens d'entrée et 25 dollars par million de sortie, avec lectures de cache à 0,50 dollar et l'API Batch à moitié prix[3]. Le mode rapide est 10 dollars / 50 dollars[1].
Quelle est la plus grande chose à attraper lors de la migration depuis Opus 4.7 ?
Le niveau d'effort par défaut de l'API a changé de medium à high. Si votre harnais dépendait de l'ancien défaut, vous obtenez un raisonnement plus profond, une latence plus élevée et plus de tokens de sortie sans modifier le code[1].
Claude Opus 4.8 bat-il GPT-5.5 ?
Sur cinq des six lignes où Anthropic les compare directement, oui. GPT-5.5 gagne le codage terminal agentic sur Terminal-Bench 2.1 avec 78,2 % contre 74,6 %[1].
Que sont les Workflows Dynamiques ?
Un aperçu de recherche Claude Code dans lequel Opus 4.8 agit comme un orchestrateur, divise un travail important en segments indépendants, envoie à des centaines de sous-agents parallèles et fusionne les résultats vérifiés à l'aide de la suite de tests du référentiel comme porte[1].
L'amélioration d'honnêteté est-elle vérifiée indépendamment ?
Pas encore. Les chiffres de quatre fois et dix-sept fois proviennent des évaluations internes d'Anthropic plutôt que des évaluations de tiers[1]. Ce sont des réductions de taux, pas des éliminations, donc l'examen humain de la sortie agentic s'applique toujours.
Dois-je utiliser Opus 4.8 ou Opus 5 ?
Opus 5 est listé aux mêmes 5 dollars / 25 dollars et est un changement de saut plutôt qu'une mise à niveau supplémentaire. Opus 4.8 reste pertinent quand vos évaluations caractérisent déjà son comportement, ou quand vous avez besoin que la réflexion soit désactivée aux niveaux d'effort élevés, qu'Opus 5 rejette.
Comment puis-je appeler Claude Opus 4.8 avec le SDK OpenAI ?
Pointez le client OpenAI sur https://api.reapi.ai/v1, définissez model sur claude-opus-4-8 et envoyez une requête de chat normale. Le point de terminaison est compatible OpenAI, donc aucune réécriture SDK n'est nécessaire.
Adapter le niveau d'effort à la tâche
La façon utile de lire cette version est qu'Anthropic a maintenu le prix plat et a dépensé la version sur des choses qui ne s'affichent que en production : un modèle qui signale ses propres erreurs, une primitive d'orchestration pour des travaux trop gros pour une fenêtre de contexte, et un mode rapide qui coûte enfin ce que les produits sensibles à la latence peuvent payer. Le tableau d'évaluation est réel mais modeste. Le changement de comportement est la partie qui altère le niveau de surveillance qu'un agent a besoin.
Si vous migrez, le travail est petit et spécifique. Épinglez le niveau d'effort explicitement plutôt que d'hériter du nouveau défaut high, déplacez tout code budget_tokens vers une réflexion adaptative, relisez les tâches de production réelles à l'effort appariés avant de faire confiance à toute comparaison de coûts, et pilotez Workflows Dynamiques sur un travail délimité avec une suite de tests que vous faites confiance. C'est ainsi qu'on utilise Claude Opus 4.8 sans découvrir le défaut d'effort sur la facture.
Références
- Anthropic. Introducing Claude Opus 4.8 — benchmarks, honesty evaluations, Dynamic Workflows, effort defaults, and fast-mode pricing. Retrieved July 2026 from anthropic.com/news/claude-opus-4-8
- Anthropic. Models overview — context, output, modality, and capabilities. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
- Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
Lectures complémentaires
- reAPI. How to use Claude Opus 5. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. What is Claude Opus 4.8? reapi.ai/blog/what-is-claude-opus-4-8
- reAPI. Claude Opus 4.8 endpoint reference. reapi.ai/docs/claude-opus-4-8
Auteur

Catégories
Plus d'articles

Forfaits vidéo IA illimité: vérifiez d'abord les calculs
Test en quatre étapes pour tout forfait vidéo IA illimité, utilisant les chiffres publics du vendeur, plus les huit endroits où se cache le vrai plafond.


Hailuo H3 : API, spécifications, tarification et limites 2026
Découvrez les spécifications Hailuo H3, l'audio natif stéréo, la tarification API, les limites et le code d'intégration pour MiniMax H3 en 2026.


API GPT 20% moins cher sur reAPI : cinq modèles à comparer
Cinq modèles GPT coûtent maintenant 20% moins cher sur reAPI qu'aux tarifs standard OpenAI. Comparez les tarifs de GPT-5.4, GPT-5.5 et tous les niveaux GPT-5.6.
