
La fenêtre de contexte Claude : qu'est-ce qui la consomme
Fenêtre 1 million de tokens sur les modèles actuels, mais les définitions d'outils, la réflexion conservée et le cache la consomment. Plus n'est pas mieux.
La fenêtre de contexte est tout ce que Claude peut référencer en générant une réponse, y compris la réponse elle-même. Anthropic l'appelle mémoire de travail, par opposition au corpus d'entraînement[1].
La partie qu'il faut retenir est la phrase qu'Anthropic place juste après cette définition : plus de contexte n'est pas automatiquement mieux. À mesure que le nombre de tokens augmente, la précision et le rappel se dégradent, phénomène que la documentation appelle dégradation du contexte[1]. Sélectionner le contenu avec soin importe autant que l'espace disponible.
TL;DR
- 1 million de tokens sur les modèles actuels : Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5, Mythos 5. Les autres, dont Sonnet 4.5, ont 200 000[1].
- 1 million est le défaut. Pas de header bêta, et les demandes longues contexte facturent au tarif standard[1].
- La sortie compte aussi, y compris la réflexion prolongée, et
max_tokensest plafonné à 128 000 sur les modèles à fenêtre 1M[1]. - Tout dans la requête compte : invite système, chaque message, résultats d'outils, images, documents et définitions d'outils[1].
- Les modèles plus récents conservent les blocs de réflexion précédents par défaut, donc ils se facturent comme entrée aux tours suivants[1].
- Les modèles Sonnet reçoivent un budget de tokens injecté en direct ; Opus et Fable ne le font pas[1].
Ce qui compte vraiment

L'erreur courante est de budgéter uniquement la conversation. La liste complète[1] :
- L'invite système
- Chaque message dans
messages, incluant les résultats d'outils, images et documents - Les définitions de vos outils
- La sortie que Claude génère ce tour, y compris sa réflexion prolongée
Chaque réponse rapporte ce que la requête a consommé dans son champ usage. Avec mise en cache d'invite, le nombre de tokens d'entrée se divise entre input_tokens, cache_read_input_tokens et cache_creation_input_tokens, et tous les trois comptent pour la fenêtre[1]. Caché ne signifie pas gratuit pour la fenêtre ; cela signifie moins cher par token.
Pour dimensionner une requête avant de l'envoyer, utilisez l'API de comptage de tokens plutôt que d'estimer à partir du nombre de caractères.
Tailles et ce que 1 million coûte réellement
| Modèles | Fenêtre de contexte |
|---|---|
| Opus 5, Opus 4.8, Opus 4.7, Opus 4.6 | 1M |
| Sonnet 5, Sonnet 4.6 | 1M |
| Fable 5, Mythos 5 | 1M |
| Sonnet 4.5 et autres modèles antérieurs | 200k |
Deux détails qui économisent de l'argent et de la confusion[1] :
1 million est le défaut sur ces modèles. Il n'y a pas de header bêta à envoyer, et une requête de 900 000 tokens se facture au même tarif par token qu'une requête de 9 000 tokens. Il n'y a pas de surcharge longue contexte.
La sortie maximale est 128 000 sur tout modèle avec fenêtre 1M, peu importe la place restante en entrée.
Une seule requête peut transporter jusqu'à 600 images ou pages PDF (100 sur modèles à fenêtre 200k), et les gros payloads peuvent atteindre les limites de taille de requête avant les limites de tokens[1].
La réflexion change l'arithmétique
Les tokens de réflexion sont un sous-ensemble de max_tokens, se facturent comme sortie et comptent pour les limites de débit. Avec réflexion adaptative, l'allocation varie par requête, donc l'utilisation n'est pas prévisible à partir de la longueur d'invite seule[1].
Le comportement qui surprend les gens est ce qui arrive aux blocs de réflexion des tours précédents.
Sur Opus 4.5 et plus récent, Sonnet 4.6 et plus récent, Fable 5 et Mythos 5, l'API conserve les blocs de réflexion précédents par défaut, et ils comptent pour la fenêtre comme n'importe quels autres tokens d'entrée. Ils ont été facturés une fois comme sortie lors de la génération, et les blocs conservés sont ensuite facturés comme entrée à chaque requête ultérieure qui les porte[1].
Sur les modèles Opus et Sonnet antérieurs et tous les modèles Haiku, l'API les supprime automatiquement quand vous les retournez.
Si une longue conversation agentique consomme du contexte plus vite que la transcription visible ne l'explique, la réflexion conservée en est généralement la raison. Le nettoyage des blocs de réflexion remplace le défaut dans l'une ou l'autre direction.
Sensibilité au contexte : certains modèles savent, d'autres non
C'est la division que la plupart des gens ne connaissent pas[1].
Sonnet 5, Sonnet 4.6, Sonnet 4.5 et Haiku 4.5 suivent leur budget restant. L'API injecte le total dans l'invite système de chaque requête :
<budget:token_budget>200000</budget:token_budget>et le met à jour après chaque appel d'outil :
<system_warning>Token usage: 35000/200000; 165000 remaining</system_warning>C'est automatique. Vous n'envoyez jamais ces tags vous-même, et les tokens d'image sont inclus dans les comptages.
Opus 4.7 et plus récent, Fable 5 et Mythos 5 ne reçoivent pas ces tags. Pour ceux-ci, fournissez un budget explicite avec budgets de tâche, actuellement en bêta.
La conséquence pratique : un modèle Sonnet peut adapter une longue tâche à l'espace restant, tandis qu'un modèle Opus ne peut pas le faire sauf si vous le lui dites. C'est une véritable différence comportementale entre les niveaux qui n'a rien à voir avec les scores de capacité.
Quand les conversations dépassent la fenêtre
Deux mécanismes serveur, tous les deux à connaître avant de construire votre propre troncature[1].
Compaction résume automatiquement les parties antérieures de la conversation sur le serveur pour qu'elle puisse continuer au-delà de la limite. Bêta, sur Claude 4.6 et plus récent.
Édition de contexte offre des stratégies plus ciblées, incluant l'effacement des anciens résultats d'outils dans les flux agentiques, ce qui est habituellement l'endroit où vivent la plupart des tokens d'une longue conversation.
Recourir à l'une ou l'autre est mieux qu'une boucle maison "supprimer les messages les plus anciens", qui tend à jeter le contexte au niveau système qui rendait la conversation cohérente.
Travailler avec
Triez, ne remplissez pas. La dégradation du contexte est un comportement documenté, pas une rumeur. Une invite de 900 000 tokens n'est pas automatiquement mieux qu'une invite bien choisie de 90 000 tokens.
Comptez les définitions d'outils. Elles se trouvent à chaque requête, et un grand schéma d'outils est un impôt fixe sur chaque tour.
Observez la réflexion conservée sur les modèles plus récents pendant les longues exécutions agentiques.
Choisissez le niveau avec le comportement dont vous avez besoin. Si un modèle doit s'adapter à une tâche longue, le budget injecté de Sonnet le fait nativement.
from openai import OpenAI
client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Read this repository and summarize the architecture."}],
max_tokens=16000,
)
print(resp.usage) # the number to reconcile againstLes tarifs pour les modèles à fenêtre 1M sont sur reapi.ai/models.
FAQ
Qu'est-ce que la fenêtre de contexte dans Claude ?
Tout le texte que le modèle peut référencer en générant une réponse, y compris la réponse elle-même. C'est de la mémoire de travail, pas des données d'entraînement[1].
Quelle est la taille de la fenêtre de contexte de Claude ?
1 million de tokens sur Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5 et Mythos 5. Les modèles antérieurs incluant Sonnet 4.5 en ont 200 000[1].
Utiliser la fenêtre complète de 1M coûte-t-il extra ?
Non. Sur les modèles avec fenêtre 1M, 1M est le défaut et les requêtes se facturent au tarif standard sans surcharge longue contexte[1].
Qu'est-ce qui compte pour la fenêtre de contexte ?
Invite système, tous les messages y compris résultats d'outils, images et documents, définitions d'outils et la sortie y compris réflexion prolongée. L'entrée mise en cache compte aussi[1].
Pourquoi ma fenêtre se remplit-elle plus vite que la conversation ne le suggère ?
Sur les modèles plus récents, l'API conserve les blocs de réflexion précédents par défaut et ils comptent comme entrée aux tours suivants[1].
Plus de contexte est-il toujours mieux ?
Non. Anthropic documente que la précision et le rappel se dégradent à mesure que le nombre de tokens augmente, phénomène appelé dégradation du contexte[1].
Combien d'images une requête peut-elle porter ?
Jusqu'à 600 images ou pages PDF sur modèles à fenêtre 1M, 100 sur modèles à fenêtre 200k, sous réserve des limites de taille de requête[1].
Que se passe-t-il quand une conversation dépasse la fenêtre ?
Utilisez la compaction serveur, qui résume les tours antérieurs pour que la conversation continue, ou l'édition de contexte pour effacer les anciens résultats d'outils[1].
Budgétiser la fenêtre plutôt que la remplir
Le chiffre que tout le monde cite sur la fenêtre de contexte dans Claude est 1 million, et c'est le fait le moins intéressant à ce sujet. Ce qui détermine si une intégration longue contexte fonctionne, c'est la comptabilité : définitions d'outils voyageant à chaque tour, blocs de réflexion se refacturant comme entrée, tokens mis en cache consommant toujours l'espace et la sortie rivalisant pour le même budget.
Le cadre propre à Anthropic est le bon à adopter. La fenêtre est mémoire de travail, plus ne s'améliore pas automatiquement, et ce que vous choisissez d'y mettre importe plus que combien de place reste.
Références
- Anthropic. Context windows — sizes by model, what counts, thinking behavior, context awareness, compaction, and overflow. Récupéré juillet 2026 de docs.claude.com/en/docs/build-with-claude/context-windows
Lectures complémentaires
- reAPI. Comment utiliser Claude Opus 5. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. Quel modèle Claude est le meilleur pour le codage. reapi.ai/blog/best-claude-model-for-coding
- reAPI. Catalogue de modèles. reapi.ai/models
Auteur

Catégories
Plus d'articles

Comment utiliser Claude Sonnet 5 : effort, coût et limitations
Guide Claude Sonnet 5 : résultats contre Opus 4.8, l'échelle d'effort qui détermine le coût, le tokenizer dense gonfle les factures, et la migration.


Meilleures alternatives à WaveSpeed en 2026 : 5 options comparées
Vous cherchez une alternative à WaveSpeed en 2026 ? Comparez fal.ai, Replicate, Together AI, RunPod et reAPI selon les modèles, les prix, la vitesse et l’API.


API Veo 3.1 la moins chère en 2026 : les vrais tarifs
Les tarifs de l’API Veo 3.1 vont de $0.40/s chez Google à $0.046 par clip de 8 secondes sur reAPI. Comparatif de cinq fournisseurs, mai 2026.
