Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Kimi K3 : guide complet du modèle phare 2.8T de Moonshot
2026/07/27 ·

Kimi K3 : guide complet du modèle phare 2.8T de Moonshot

Architecture, tarifs et API de Kimi K3 : contexte 1M, raisonnement permanent, échantillonnage fixe et appel via une API compatible OpenAI.

Moonshot AI a lancé Kimi K3 à la mi-juillet 2026, mais dans l'ordre inverse des habitudes : la documentation API, la page des tarifs et un identifiant de modèle kimi-k3 fonctionnel sont apparus avant le moindre tableau de benchmarks, article technique ou publication des poids[1]. Une semaine de discussions fondées sur des fuites a comblé le vide, avec presque toujours au moins une donnée erronée. Ce guide rassemble la version issue de la propre documentation de Moonshot : ce qui est confirmé, ce qui est volontairement fixe et ce qui reste inédit.

Notre point de vue est aussi précis : Kimi K3 est disponible sur la passerelle reAPI. Les sections suivantes expliquent donc autant le modèle que son utilisation réelle — les paramètres qui font rejeter une requête, le comportement du cache qui détermine la facture et les pièges qui attendent le code K2.x lors d'une migration.

En bref

  • Kimi K3 est un modèle phare de 2.8 billions de paramètres, fondé sur Kimi Delta Attention, un mécanisme hybride d'attention linéaire, et Attention Residuals. Son Stable LatentMoE active 16 experts parmi 896 pour chaque token[1][3].
  • La fenêtre de contexte atteint 1 048 576 tokens avec un tarif uniforme, sans palier pour le contexte long. L'API native de Moonshot fixe le plafond de sortie par défaut à 131 072 et accepte jusqu'à 1 048 576, à condition que l'entrée plus ce plafond tiennent dans la fenêtre[1][2][9].
  • Le raisonnement est toujours actif. Le seul réglage est reasoning_effort, à trois niveaux (low / high / max, sans medium), avec max par défaut[4].
  • L'échantillonnage est verrouillé : temperature 1.0, top_p 0.95, n 1 et les deux pénalités à 0. Toute autre valeur provoque une erreur[1].
  • Le tarif publié par Moonshot est de $3.00 en entrée / $15.00 en sortie par 1M tokens ($0.30 en entrée si le cache répond). Sur reAPI, le même modèle coûte $2.50 / $12.00, moins cher dans les deux cas[2][8].
  • La vision est native pour les images et les vidéos, mais les URL d'images publiques sont refusées : utilisez du base64 ou une référence de fichier importé[5].

Kimi K3 en un coup d'œil

Toutes les données de ce tableau viennent de la documentation API de Moonshot, consultée le 26 juillet 2026 :

CaractéristiqueKimi K3 (officiel)
ID du modèlekimi-k3
Nombre total de paramètres2.8 billions
ArchitectureKimi Delta Attention (attention linéaire hybride) + Attention Residuals ; Stable LatentMoE, 16 experts actifs sur 896
Fenêtre de contexte1,048,576 tokens (1M)
Sortie maximaleValeur native par défaut : 131 072 tokens ; plafond du paramètre : 1 048 576, sous réserve de la place occupée par l’entrée [9]
Modalitéstexte, image et vidéo en entrée ; texte en sortie
Raisonnementtoujours actif ; reasoning_effort avec low / high / max, max par défaut
Prix d'entrée (cache manqué)$3.00 par 1M tokens
Prix d'entrée (cache touché)$0.30 par 1M tokens
Prix de sortie$15.00 par 1M tokens
Paliers de contexteaucun — même tarif par token quelle que soit la longueur

Deux chiffres méritent un second regard. Avec 2.8T paramètres, K3 entre dans une catégorie encore jamais occupée par un modèle à poids ouverts. Moonshot s'est engagé à publier ses poids, ce qui en ferait le premier modèle open source de la classe des 3 billions[3]. Puis il y a le tarif : à $3.00 / $15.00, K3 coûte trois à quatre fois plus que la gamme K2. Moonshot le positionne en modèle phare de pointe et non en option économique, contrairement à ce qu'évoquait auparavant le nom Kimi, tout en restant moins cher que les modèles fermés de pointe en entrée comme en sortie.

Le lancement : l'API d'abord, les preuves ensuite

L'ordre du déploiement explique les informations contradictoires encore en circulation. Avant le lancement, des observateurs ont vu une page promotionnelle apparaître brièvement sur la plateforme Moonshot et des sélecteurs bêta dans l'application Kimi. Les fuites ont convergé vers « environ 2.5T paramètres et 1M de contexte ». C'était proche, mais le chiffre officiel est 2.8T. Une vidéo muette publiée par le compte officiel de Moonshot a suivi, puis le produit a devancé le cycle médiatique : documentation API, guide de démarrage et page de prix ont été mis en ligne le jour des premiers articles financiers sur le lancement[1][2].

Cette séquence — API et documentation avant benchmarks et poids — inverse celle des modèles phares K2, tous lancés avec un article technique complet et des poids ouverts dès le premier jour. Conséquence pratique : pendant la première semaine de K3, la documentation constituait l'unique source fiable ; tout le reste relevait de l'inférence.

Architecture : Kimi Delta Attention, LatentMoE et Attention Residuals

La phrase la plus intéressante techniquement dans la documentation indique que K3 est « construit sur Kimi Delta Attention, un mécanisme hybride d'attention linéaire, et Attention Residuals »[3]. Ce n'est pas du vocabulaire marketing : il s'agit du déploiement en production de la recherche Kimi Linear publiée par Moonshot fin 2025. La comprendre explique à la fois la fenêtre de 1M tokens et le tarif uniforme qui la rend exploitable[6].

Kimi Delta Attention (KDA) est un mécanisme d'attention linéaire, dérivé de Gated DeltaNet avec un contrôle plus fin. Le cache clé-valeur de l'attention softmax standard grandit linéairement avec la séquence, rendant les contextes d'un million de tokens extrêmement chers. L'attention linéaire conserve à la place un état récurrent de taille fixe. Historiquement, la qualité en souffrait : l'attention purement linéaire perd en rappel précis dans les longs documents.

La disposition hybride résout ce compromis dans l'article Kimi Linear : elle alterne couches KDA et couches d'attention complète selon un ratio 3:1. Trois couches sur quatre utilisent le mécanisme linéaire économique, tandis que la quatrième conserve une attention globale exacte. Dans les résultats publiés, cette configuration dépasse l'attention complète sur les benchmarks de qualité, réduit la mémoire du KV-cache jusqu'à 75% et accélère le décodage jusqu'à 6x avec un contexte de 1M tokens[6].

Stable LatentMoE est la configuration sparse mixture-of-experts : 896 experts, dont 16 actifs par token[3]. Cette parcimonie rend un modèle de 2.8T exploitable : le calcul actif pour chaque token ne représente qu'une petite partie des paramètres totaux.

Attention Residuals reste le seul composant sans article publié ; le terme apparaît pour la première fois dans la documentation de K3. Avant un rapport technique, la position honnête consiste à dire que nous connaissons son nom, pas son mécanisme.

Pourquoi cela compte en pratique : une fenêtre de 1M tokens ne vaut que si son coût reste viable. La plupart des fournisseurs augmentent leurs tarifs pour les contextes très longs ou dégradent discrètement le service. La documentation de K3 affirme qu'il n'existe aucun palier : le tarif par token reste identique avec 5,000 ou 900,000 tokens[2]. Cette décision n'est rationnelle que si le coût marginal du contexte long s'est réellement effondré, précisément le rôle de KDA. L'architecture raconte l'histoire du prix.

Ce que l'API fournit réellement

L'API K3 impose des choix qui surprendront les équipes venant de K2.x ou de modèles au format OpenAI. Il s'agit de contraintes documentées, pas de simples observations[1] :

  • Le raisonnement est toujours actif. Aucun mode sans réflexion : à la question « comment désactiver la chaîne de pensée », la FAQ de Moonshot répond simplement que c'est impossible. Le champ racine reasoning_effort propose low, high et max. Il n'existe pas de medium, et le niveau le plus coûteux, max, est utilisé par défaut[4].
  • L'échantillonnage est fixe. temperature vaut toujours 1.0, top_p 0.95, n 1 et les deux paramètres de pénalité 0. Toute autre valeur déclenche une erreur ; mieux vaut donc les omettre. Si votre pipeline ajuste la température par tâche, ce levier disparaît.
  • Le budget de sortie doit tenir dans la fenêtre avec l'entrée. L'API native de Moonshot fixe max_completion_tokens à 131 072 par défaut et accepte jusqu'à 1 048 576. Si l'entrée plus ce plafond dépassent la fenêtre, elle renvoie invalid_request_error. Le plus grand paramètre ne garantit pas une réponse finale d'un million de tokens. Fixez explicitement le plafond et gardez de la place pour l'entrée, le raisonnement et la réponse[9].
  • Le streaming sépare raisonnement et réponse. Les réponses en flux transmettent des deltas reasoning_content distincts des deltas content, ce qui permet à une interface d'afficher séparément la réflexion et la réponse finale.
  • La conservation du raisonnement est obligatoire. Dans les boucles multi-tours et d'appels d'outils, le message assistant complet — reasoning_content et tool_calls inclus — doit être renvoyé sans modification dans messages. Ne conserver que content, habitude fréquente du code inspiré d'OpenAI, dégrade silencieusement le modèle.
  • La vision comporte des limites nettes. Images et vidéos sont acceptées nativement, mais pas les URL d'images publiques. Envoyez des URI de données base64 ou importez un fichier et utilisez son ID[5].
  • La sortie structurée est native. Un JSON Schema avec strict: true contraint le champ de réponse finale, mais pas le raisonnement en prose.

La nouvelle pile d'appel d'outils

Deux fonctions apparaissent avec K3. Elles répondent au même problème : les agents qui disposent de nombreux outils gaspillent du contexte dans leurs définitions[1].

tool_choice: "required" impose au moins un appel d'outil pendant le tour. Cela empêche l'agent de répondre de mémoire quand il devait effectuer une recherche. Les modèles K2 refusent cette valeur ; K3 l'accepte.

Le chargement dynamique d'outils est plus original : placez une définition complète d'outil dans un message system au milieu de la conversation, avec un champ tools et sans content. L'outil devient alors disponible. Au lieu d'ajouter d'emblée 80 schémas à chaque requête, l'orchestrateur les injecte lorsque la phase du workflow les exige. Attention : le serveur ne conserve pas l'outil chargé ; gardez ce message system dans l'historique, sinon l'outil disparaît au tour suivant.

Un avertissement de la documentation mérite d'être repris : l'outil web_search intégré de Moonshot est signalé comme en cours de mise à jour et n'est pas recommandé en production. Apportez votre propre recherche si votre agent en a besoin.

Cache de contexte automatique

Le cache de K3 ne demande ni identifiant, ni gestion du TTL, ni paramètre supplémentaire. Conservez un long préfixe stable entre les requêtes et la plateforme tente automatiquement de le réutiliser, à $0.30 par 1M tokens au lieu de $3.00[1]. La réduction atteint 90% sur le contexte répété et transforme la fenêtre de 1M en pratique exploitable : chargez une fois un corpus comme préfixe stable, puis interrogez-le à un dixième du prix.

Deux conditions déterminent la réussite. Le prompt de la requête précédente doit dépasser 256 tokens ; en dessous, rien n'est mis en cache. Le niveau reasoning_effort doit également rester identique : le changer pendant la conversation invalide le préfixe[4]. Choisissez-le avant de commencer.

Les premières mesures tierces indiquent que le mécanisme fonctionne : les statistiques en direct d'OpenRouter pour K3 ont affiché plus de 75% de cache touché, ramenant le prix moyen pondéré de l'entrée nettement sous le tiers du tarif catalogue[7].

Tarifs : une rupture assumée avec la stratégie économique

Jusqu'ici, chaque version de Kimi misait surtout sur le coût. K3 change de stratégie. Voici sa place face à sa famille et aux modèles de pointe, par 1M tokens et avec un cache manqué en entrée :

ModèleEntréeSortieEntrée avec cacheContexte
Kimi K2.6$0.95$4.00$0.16256K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K3 (Moonshot direct)$3.00$15.00$0.301M
Kimi K3 sur reAPI$2.50$12.001M
Claude Opus 4.8$5.00$25.001M
GPT-5.5$5.00$30.00400K

Le positionnement se lit immédiatement : K3 coûte trois à quatre fois plus que ses propres modèles voisins et 40–50% de moins que les modèles fermés de pointe. Moonshot estime qu'une fenêtre de 1M tokens, la vidéo native et des capacités de pointe justifient un niveau premium dans le monde des poids ouverts.

La vitesse est l'astérisque honnête. Les premières mesures tierces donnent K3 à environ 28 tokens par seconde et quatre secondes avant le premier token[7]. Rien d'étonnant pour un modèle de cette taille avec raisonnement permanent, mais c'est lent. K3 privilégie la profondeur par appel, pas les appels par minute ; les boucles interactives sensibles à la latence nécessitent un autre modèle.

Dernier point : Moonshot réduit fortement sa gamme. La série historique moonshot-v1 et d'anciennes variantes K2.x sont fermées aux nouveaux utilisateurs, avec un arrêt complet de la plateforme annoncé pour fin août 2026. Moonshot veut faire migrer tout le monde vers K3.

Migrer depuis K2.x : liste pratique

Si vous utilisez K2.6 ou K2.7-Code, la migration reste limitée mais réelle :

  1. Remplacez l'ID du modèle par kimi-k3 ; l'API reste compatible OpenAI.
  2. Remplacez le paramètre thinking par reasoning_effort à la racine. L'objet thinking de K2 n'existe pas dans K3 et déclenche une erreur.
  3. Supprimez les paramètres d'échantillonnage. Retirez temperature, top_p et les pénalités des requêtes K3 : le serveur les fixe et toute autre valeur est rejetée.
  4. Choisissez l'effort consciemment. max est le niveau par défaut et le plus coûteux ; les tokens de raisonnement sont facturés en sortie. Passez à high ou low si la tâche ne mérite pas ce coût, sans changer pendant la conversation pour ne pas invalider le cache.
  5. Recalculez vos coûts. Au tarif catalogue, les tokens de sortie coûtent 3.75x le prix de K2.6 et le raisonnement permanent en augmente le volume. Compensez avec le cache automatique : préfixe stable au début, suffixe variable à la fin.
  6. Adaptez l'ingestion visuelle si vous utilisiez des URL d'images publiques. K3 n'accepte que le base64 ou des références de fichiers importés[5].
  7. Renvoyez chaque message assistant au complet, avec reasoning_content et tool_calls, à chaque tour.

À qui K3 convient-il aujourd'hui ?

D'après les seuls faits confirmés, K3 convient aujourd'hui aux travaux longs où la qualité par tâche prime sur le prix par token : agents de programmation actifs plusieurs heures dans de grands dépôts, corpus d'un million de tokens interrogés à répétition avec un préfixe en cache et tâches multimodales réunissant images, vidéo et code dans un même contexte.

Ce n'est pas le bon choix pour les produits interactifs sensibles à la latence — 28 tokens/sec correspondent à un autre type d'outil —, les pipelines qui exigent un échantillonnage réglable, puisque tout est verrouillé, ou l'optimisation pure des coûts, réservée aux niveaux moins chers.

Exécuter Kimi K3 avec reAPI

K3 est disponible sur la passerelle reAPI comme endpoint compatible OpenAI : remplacez l'URL de base par https://api.reapi.ai/v1, envoyez votre clé de passerelle comme bearer token et utilisez kimi-k3 comme modèle. Le SDK openai existant fonctionne sans modification.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "Refactor this module and add tests." }
    ],
    "reasoning_effort": "high",
    "stream": true
  }'

Deux raisons de passer par reAPI plutôt que directement par K3 :

  • Le prix. reAPI facture K3 $2.50 en entrée / $12.00 en sortie par 1M tokens, sous les tarifs publiés par Moonshot, avec une sortie moins chère d'un cinquième[8]. Pour un modèle dont le raisonnement permanent gonfle la sortie, ce tarif est le chiffre décisif.
  • Une clé pour plusieurs modèles. La même clé donne accès à Claude, GPT, Gemini, DeepSeek, GLM et à la gamme Kimi. K3 devient une décision de routage plutôt qu'un engagement fournisseur ; utilisez la même logique de bascule et d'équilibrage que pour les autres modèles.

La totalité de l'interface — paramètres fixes, conditions du cache, format des parties vision et catalogue d'erreurs — figure dans notre documentation de l'API Kimi K3, et les tarifs actuels sont sur la page du modèle.

FAQ

Kimi K3 est-il open source ?

Moonshot présente K3 comme une version open source et s'est engagé à publier les poids, ce qui en ferait le premier modèle ouvert de la classe des 3 billions de paramètres[3]. À l'heure où ces lignes sont écrites, leur publication est imminente, mais l'API reste la voie d'accès principale.

Peut-on désactiver ou réduire le raisonnement de K3 ?

Impossible de le désactiver : il reste toujours actif. Vous pouvez le réduire avec reasoning_effort, qui accepte low, high et max, avec max par défaut[4]. low sert précisément lorsque le raisonnement coûte plus que la réponse ne vaut.

Le contexte de 1M coûte-t-il plus cher ?

Non. Le tarif par token reste fixe quelle que soit la longueur : un prompt de 900K tokens est facturé au même taux qu'un prompt de 9K[2]. En direct chez Moonshot, l'entrée avec cache tombe à $0.30 par 1M tokens.

Pourquoi K3 renvoie-t-il une erreur sur la température ?

temperature, top_p, n et les deux pénalités sont fixés côté serveur. Toute autre valeur provoque une erreur plutôt que de remplacer le réglage[1]. Supprimez-les de la requête. Même règle pour l'objet thinking de K2 : utilisez reasoning_effort à la racine.

Puis-je utiliser K3 dans Claude Code, Codex ou Cline ?

Oui. L'API est compatible OpenAI ; tout outil acceptant une URL de base et une clé personnalisées peut l'utiliser, notamment Claude Code, Codex, Cline, RooCode et OpenCode. Pointez-le vers https://api.reapi.ai/v1 avec une clé de passerelle et l'ID kimi-k3.

Comment K3 se compare-t-il à Claude Opus 4.8 ou GPT-5.5 sur les benchmarks ?

Moonshot n'a encore publié aucun tableau d'évaluation officiel pour K3 : ni SWE-Bench, ni Terminal-Bench, ni résultat vérifiable indépendamment. Considérez les chiffres précis des réseaux sociaux comme non vérifiés jusqu'à la publication des benchmarks et du rapport technique.

Références

  1. Moonshot AI. Démarrage rapide Kimi K3 — documentation API officielle : ID, échantillonnage fixe, limites de sortie, outils et cache. Consulté en juillet 2026 sur platform.kimi.ai/docs/guide/kimi-k3-quickstart
  2. Moonshot AI. Tarifs Kimi K3 — $3.00 / $15.00 par 1M tokens, entrée avec cache à $0.30, aucun palier de contexte. Consulté en juillet 2026 sur platform.kimi.ai/docs/pricing/chat-k3
  3. Moonshot AI. Vue d'ensemble — 2.8T paramètres, Kimi Delta Attention + Attention Residuals, Stable LatentMoE (16 experts sur 896), engagement open source. Consulté en juillet 2026 sur platform.kimi.ai/docs/api/models-overview
  4. Moonshot AI. Utiliser reasoning_effort — trois niveaux (low / high / max), max par défaut et invalidation du cache lors d'un changement. Consulté en juillet 2026 sur platform.kimi.ai/docs/guide/use-reasoning-effort
  5. Moonshot AI. Utiliser les modèles de vision Kimi — images et vidéos, base64 et fichiers, sans URL publique. Consulté en juillet 2026 sur platform.kimi.ai/docs/guide/use-kimi-vision-model
  6. Moonshot AI. Kimi Linear: An Expressive, Efficient Attention Architecture (arXiv:2510.26692) — KDA, disposition hybride 3:1, résultats du KV-cache et du décodage. Consulté en juillet 2026 sur arxiv.org/abs/2510.26692
  7. OpenRouter. MoonshotAI: Kimi K3 — télémétrie en direct : cache, prix pondéré, débit et TTFT. Consulté en juillet 2026 sur openrouter.ai/moonshotai/kimi-k3
  8. reAPI. Kimi K3 — page du modèle, documentation API et tarifs actuels. Consulté en juillet 2026 sur reapi.ai/docs/kimi-k3
  9. Moonshot AI. Chat Completions API — output cap and input-plus-cap validation. Retrieved September 8, 2026 from platform.kimi.ai/docs/api/chat

Pour aller plus loin