
GPT-6 Luna API prix : tarifs par token et calculateur de coûts
Prix de la GPT-6 Luna API selon OpenAI : input, output, lectures et écritures de cache, palier 272K, Batch et Fast, plus des exemples de coûts chiffrés.
Les prix de la GPT-6 Luna API commencent à $0.10 par million de tokens d'input et $0.50 par million de tokens d'output sur le tier Standard d'OpenAI, les tarifs les plus bas de la gamme GPT-6[1]. Ces deux chiffres ne représentent toutefois qu'une partie de la facture. L'input en cache, les écritures de cache, un tarif distinct pour les prompts de plus de 272K tokens et les tokens de reasoning facturés comme output peuvent tous faire varier le coût réel.
Ce guide reprend chaque tarif de GPT-6 Luna figurant sur la page de prix d'OpenAI, consultée le 7 octobre 2026, explique comment une requête est tarifée et détaille cinq scénarios de coût avec leurs hypothèses écrites, pour que vous puissiez refaire le calcul avec vos propres volumes de tokens.
TL;DR
- Tarifs Standard par 1M de tokens : $0.10 d'input, $0.01 d'input en cache, $0.125 d'écritures de cache, $0.50 d'output[1].
- Au-delà de 272K tokens d'input, toute la requête passe à $0.20 d'input, $0.02 d'input en cache, $0.25 d'écritures de cache et $0.75 d'output[1][2].
- Batch et Flex coûtent moitié moins que Standard ; Fast mode coûte deux fois plus ; le traitement régional ajoute 10%[2].
- Les tokens de reasoning sont facturés comme output, donc le reasoning effort est le principal levier après le volume[3].
- Une requête courte coûte peu : 500 tokens d'input et 10 tokens d'output coûtent $0.000055 aux tarifs Standard, soit $55 par million de requêtes de ce type (notre calcul, détaillé plus bas).
- Face au reste de GPT-6 : les tarifs Standard d'Astra valent exactement 100 fois ceux de Luna, et l'input et l'output de GPT-6 Sol 20 fois[1].
Prix de la GPT-6 Luna API pour chaque type de token
OpenAI tarifie GPT-6 Luna par type de token et par longueur de prompt. Le "short context" va jusqu'à 272K tokens d'input ; au-delà, les tarifs de contexte long s'appliquent à toute la requête[1].
| Par 1M de tokens (Standard) | Jusqu'à 272K d'input | Plus de 272K d'input |
|---|---|---|
| Input | $0.10 | $0.20 |
| Input en cache | $0.01 | $0.02 |
| Écritures de cache | $0.125 | $0.25 |
| Output | $0.50 | $0.75 |
Source : OpenAI API pricing, tier Standard[1].
La page du modèle indique les multiplicateurs derrière ces chiffres. L'input en cache coûte 10% du tarif d'input hors cache, les écritures de cache 1.25 fois ce tarif, et les prompts de plus de 272K tokens d'input sont « facturés à 2x les tarifs d'input et de cache et à 1.5x l'output pour l'ensemble de la requête »[2].
Batch, Flex, Fast et traitement régional
Le tier de traitement modifie chaque tarif d'un facteur fixe. La page du modèle d'OpenAI indique : « Batch et Flex sont facturés à 50% des tarifs Standard. Fast mode est facturé à 2x les tarifs applicables », et le traitement régional « ajoute une majoration de 10% là où il est disponible »[2].
| Par 1M de tokens, jusqu'à 272K d'input | Input | Input en cache | Écritures de cache | Output |
|---|---|---|---|---|
| Standard | $0.10 | $0.01 | $0.125 | $0.50 |
| Batch | $0.05 | $0.005 | $0.0625 | $0.25 |
| Flex | $0.05 | $0.005 | $0.0625 | $0.25 |
| Fast | $0.20 | $0.02 | $0.25 | $1.00 |
Source : OpenAI API pricing, tableaux Standard, Batch, Flex et Fast[1].
Batch convient aux tâches hors ligne comme la classification nocturne ou les backfills. Fast mode est l'option d'OpenAI pour le trafic sensible à la latence, et OpenAI précise qu'il n'est pas disponible avec la résidence des données dans l'UE pour GPT-6 Luna[4].
Comment une requête GPT-6 Luna est tarifée
Pour un prompt de 272K tokens d'input ou moins, aux tarifs Standard :
cost = ( uncached_input × 0.10
+ cached_input × 0.01
+ cache_write × 0.125
+ output × 0.50 ) / 1,000,000Au-delà de 272K tokens d'input, remplacez par 0.20, 0.02, 0.25 et 0.75 pour toute la requête. Quatre règles déterminent dans quelle catégorie tombe chaque token.
Les tokens de reasoning sont de l'output. OpenAI indique que les tokens de reasoning « occupent de l'espace dans la fenêtre de contexte du modèle et sont facturés comme tokens d'output »[3]. GPT-6 Luna prend en charge six niveaux d'effort, de none à max, avec medium par défaut[2]. Un label de classification de deux mots peut cacher des centaines de tokens de reasoning facturés.
Les frais de cache remplacent le tarif d'input au lieu de s'y ajouter. Le guide de caching d'OpenAI précise que la tarification des écritures de cache « n'est pas un frais additionnel : les tokens d'input utilisent le tarif d'input hors cache, d'input en cache ou d'écriture de cache »[5].
Les préfixes courts ne sont jamais mis en cache. La longueur minimale de prompt pouvant être mise en cache est de 1,024 tokens pour GPT-5.6 et les modèles ultérieurs, et un préfixe en cache reste utilisable pendant au moins 30 minutes après sa dernière écriture ou réutilisation[5].
Le seuil de 272K s'applique par requête. Un prompt unique de 300K tokens d'input est facturé entièrement aux tarifs de contexte long, output compris[2].
Calculateur de coûts de la GPT-6 Luna API : cinq exemples chiffrés
Chaque ligne ci-dessous utilise les tarifs publics d'OpenAI indiqués plus haut. Les volumes de tokens sont des hypothèses choisies à titre d'illustration, pas des mesures. Remplacez-les par les chiffres de l'objet usage de vos propres réponses.
| Scénario | Hypothèses | Calcul | Total |
|---|---|---|---|
A. Étiquetage de tickets, effort none | 1,000,000 requêtes × 500 d'input, 10 d'output | 500M × $0.10 + 10M × $0.50 = $50 + $5 | $55.00 |
B. Même tâche, effort medium | Comme A, plus 300 tokens de reasoning supposés par requête | 500M × $0.10 + 310M × $0.50 = $50 + $155 | $205.00 |
| C. Scénario A via Batch | Comme A, aux tarifs Batch | 500M × $0.05 + 10M × $0.25 = $25 + $2.50 | $27.50 |
| D. Assistant de support avec préfixe en cache | 100,000 requêtes ; préfixe stable de 4,000 tokens écrit 1,000 fois et lu 99,000 fois ; 1,000 nouveaux tokens d'input et 400 d'output par requête | 396M × $0.01 + 4M × $0.125 + 100M × $0.10 + 40M × $0.50 = $3.96 + $0.50 + $10 + $20 | $34.46 |
| E. Documents longs | 1,000 requêtes × 400,000 d'input, 2,000 d'output (tier contexte long) | 400M × $0.20 + 2M × $0.75 = $80 + $1.50 | $81.50 |
Trois enseignements ressortent.
Ici, l'effort coûte plus que le volume. Dans B, la passe de reasoning supposée fait de l'output le poste le plus lourd, et la tâche coûte 3.7 fois le scénario A. Vérifiez si none ou low atteint votre objectif de précision avant de payer pour medium.
Le caching divise par deux le scénario D. Sans cache, le même trafic coûte 500M × $0.10 + 40M × $0.50 = $70.00. Les lectures de cache font passer le préfixe de $40 à $4.46, écritures comprises.
Le seuil de 272K double l'input. Si chaque document de E pouvait être découpé en deux requêtes de 200,000 tokens avec 2,000 tokens d'output chacune, la facture serait de 400M × $0.10 + 4M × $0.50 = $42.00. Le découpage change ce que le modèle voit en une seule fois, alors vérifiez la qualité avant de viser l'économie.
Comparaison des prix de GPT-6 Luna avec les autres modèles GPT
Tous les tarifs Standard par 1M de tokens pour des prompts jusqu'à 272K tokens d'input[1] :
| Modèle | Input | Input en cache | Écritures de cache | Output |
|---|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.01 | $0.125 | $0.50 |
| GPT-5.6 Luna | $0.20 | $0.02 | $0.25 | $1.20 |
| GPT-6 Sol | $2.00 | $0.20 | $2.50 | $10.00 |
| GPT-6.1 Sol | $2.00 | $0.10 | $2.50 | $10.00 |
| GPT-6 Astra | $10.00 | $1.00 | $12.50 | $50.00 |
OpenAI attribue le prix bas de Luna à des « améliorations du caching et de l'inférence », répercutées sous forme de baisse par rapport aux prix de GPT-5.6[6]. Les compromis modèle par modèle sont traités dans GPT-6 Luna vs 5.6 Luna et GPT-6 Sol vs Luna ; les tarifs de Sol figurent dans GPT-6 Sol pricing.
Payer GPT-6 Luna via reAPI
reAPI propose GPT-6 Luna sur son endpoint Chat Completions avec l'id de modèle gpt-6-luna, facturé au token depuis votre solde de crédits reAPI. Input, output, lecture de cache et écriture de cache ont chacun leur propre tarif, les tokens de reasoning sont facturés comme output, et les prompts de plus de 272K tokens d'input entraînent une nouvelle tarification de toute la requête[7]. L'objet usage de chaque réponse indique prompt_tokens, completion_tokens (reasoning inclus) et cached_tokens, ce qui vous permet de rapprocher la facture de la formule ci-dessus[7].
Les tarifs par token actuels de reAPI et un estimateur de coûts pour les tokens d'input et d'output se trouvent sur la page du modèle GPT-6 Luna. Une remarque sur la forme des requêtes : envoyer temperature à GPT-6 Luna renvoie 400, point traité dans GPT-6 Luna temperature.
FAQ
Combien coûte chat gpt 6 ?
Dans l'API, GPT-6 est facturé au token selon le modèle : GPT-6 Luna à $0.10 d'input et $0.50 d'output par 1M de tokens, GPT-6 Sol et GPT-6.1 Sol à $2 et $10, et GPT-6 Astra à $10 et $50[1]. Dans ChatGPT, OpenAI a rendu GPT-6 Sol et Luna disponibles pour les utilisateurs Plus, Pro, Business, Enterprise et Edu, et les utilisateurs Free et Go peuvent utiliser GPT-6 Luna dans l'application de bureau[6].
Prix de gpt 6 luna pour 10000 tokens
Aux tarifs Standard, 10,000 tokens d'input coûtent $0.001 et 10,000 tokens d'output coûtent $0.005[1]. Si ces 10,000 tokens d'input étaient des lectures de cache, ils coûteraient $0.0001.
Coût des tokens d'output de gpt 6 luna
L'output coûte $0.50 par 1M de tokens pour les prompts jusqu'à 272K tokens d'input et $0.75 au-delà, aux tarifs Standard[1]. Les tokens de reasoning sont inclus dans l'output facturé[3].
Réductions de prix de gpt 6 luna
OpenAI en indique deux : Batch et Flex à 50% des tarifs Standard, et l'input en cache à 10% du tarif d'input hors cache[2]. Fast mode et le traitement régional vont dans l'autre sens, à 2x et +10%.
gpt 6 luna gratuit
Dans l'API, GPT-6 Luna est facturé au token aux tarifs ci-dessus[1]. Dans ChatGPT, OpenAI indique que les utilisateurs Free et Go peuvent accéder à GPT-6 Luna dans l'application de bureau[6].
Coût de l'API gpt 6 luna vs gpt 6 astra
Les tarifs Standard de GPT-6 Astra sont de $10 d'input, $1 d'input en cache, $12.50 d'écritures de cache et $50 d'output par 1M de tokens, soit exactement 100 fois chaque tarif de GPT-6 Luna[1]. Astra propose aussi un tier Ultrafast à des prix plus élevés ; Luna n'apparaît pas dans ce tableau[1].
Combien coûte une API GPT ?
Cela dépend du modèle. Dans le tableau Standard actuel d'OpenAI, les tarifs vont de $0.10 d'input et $0.50 d'output par 1M de tokens pour GPT-6 Luna jusqu'à $30 d'input et $180 d'output pour GPT-5.5 Pro et GPT-5.4 Pro[1].
Garder des coûts GPT-6 Luna prévisibles
L'essentiel d'une facture GPT-6 Luna dépend de trois choix : le reasoning effort que vous envoyez, la longueur suffisante ou non de votre préfixe de prompt stable pour être mis en cache, et le fait qu'un prompt dépasse ou non 272K tokens d'input. Mesurez chacun à partir de données usage réelles sur un échantillon de trafic, puis reportez ces volumes dans la formule. Ainsi, les prix de la GPT-6 Luna API deviennent faciles à prévoir : $0.10 en entrée, $0.50 en sortie, et chaque exception est documentée.
References
- OpenAI. API pricing. Consulté en octobre 2026 sur developers.openai.com/api/docs/pricing
- OpenAI. GPT-6 Luna model page. Consulté en octobre 2026 sur developers.openai.com/api/docs/models/gpt-6-luna
- OpenAI. Reasoning models. Consulté en octobre 2026 sur developers.openai.com/api/docs/guides/reasoning
- OpenAI. Fast mode. Consulté en octobre 2026 sur developers.openai.com/api/docs/guides/fast-mode
- OpenAI. Prompt caching. Consulté en octobre 2026 sur developers.openai.com/api/docs/guides/prompt-caching
- OpenAI. Introducing GPT-6 Sol and Luna. Consulté en octobre 2026 sur openai.com/index/introducing-gpt-6-sol-and-luna
- reAPI. GPT-6 Luna API docs. Consulté en octobre 2026 sur reapi.ai/docs/gpt-6-luna
Auteur

Catégories
Plus d'articles

Tokens de sortie des LLM : limites API et contexte
Comparez les limites de sortie des LLM, budgets de raisonnement et paramètres API. Distinguez contexte, plafonds, valeurs par défaut et traitement par lots.


Kimi K3 sur 4GB : démêler 2,8 trillions de paramètres
Kimi K3 tient-il réellement sur 4GB ? Comprenez les calculs de 1,4TB, le déchargement par couche, le support logiciel et la route API pratique.


Filtres de contenu Seedream 5 Pro : ce qu'ils bloquent
Découvrez les quatre couches de filtrage de Seedream 5 Pro : comment chacune fonctionne, ce qu'elle bloque et pourquoi un refus est difficile à diagnostiquer.
