Seedance 2.5 is live — 30-second cinematic video with native audio & real-person referencesfrom $0.071 par seconde

Kimi K3 — contexte 1M, fleuron à poids ouverts

Kimi K3 est le modèle fleuron de Moonshot pour le codage à long horizon et le travail de connaissance de bout en bout. Kimi K3 lit une fenêtre de contexte de 1 048 576 tokens, raisonne toujours, et propose un curseur d'effort de raisonnement à trois crans, de low à max. La vision native couvre les images et la vidéo, les poids sont ouverts, et sur reAPI Kimi K3 est facturé sous le tarif par token publié par Moonshot, en entrée comme en sortie.

Points clés
Flagship Moonshot · appel d'outils · sortie JSON
Idéal pour
Travail zh / en long contexte, agents
Entrée
Messages de chat (OpenAI-compatible)
Sortie
Texte, streaming optionnel
Kimi K3modelkimi-k3

Playground de Kimi K3

Les modèles de chat tournent sur la passerelle api.reapi.ai, qui possède sa propre console et sa propre clé. Ouvre la console pour exécuter Kimi K3 via l'interface Chat Completions compatible OpenAI.

Qu'est-ce que l'API Kimi K3 ?

Kimi K3 est le modèle phare à poids ouverts de Moonshot AI, conçu pour le codage au long cours et le travail de connaissance de bout en bout, exposé sur reAPI via un endpoint chat completions compatible OpenAI. Il dispose d'une fenêtre de contexte de 1 048 576 tokens et peut renvoyer cette fenêtre entière en une seule réponse (la limite de sortie par défaut est de 131 072 tokens), raisonne systématiquement avec un effort réglable sur low, high ou max, et accepte nativement images et vidéos, en plus de l'appel d'outils et d'une sortie JSON Schema stricte. Les tokens d'entrée et de sortie sont facturés séparément au million de tokens, et le cache de contexte s'active automatiquement sur les préfixes répétés.

Ce que tu peux construire avec ce modèle

Des workflows réels et des cas d'usage en production que tu peux construire et déployer avec ce modèle.

Kimi K3 corrigeant un défaut de mise en page à partir d'une capture de la page cassée

Du codage à long horizon, captures d'écran dans la boucle

Moonshot positionne Kimi K3 sur le codage à long horizon et le décrit menant des tâches d'ingénierie avec un minimum de supervision humaine — lisant et modifiant de grandes bases de code, coordonnant des outils en terminal. Ce qui distingue Kimi K3 d'un modèle de code purement textuel, c'est que la vision est native et non greffée : captures d'écran et retours visuels sont des entrées, et Moonshot cite explicitement le développement de jeux, l'ingénierie frontend et la CAO. Cela ferme une boucle qu'un modèle textuel ne peut pas fermer, puisque le modèle peut regarder ce qu'il vient de construire et juger si la mise en page est réellement fautive avant d'éditer à nouveau.

Lire la doc API
Kimi K3 lisant un vaste corpus de documents et produisant un livrable structuré

Un million de tokens de travail de connaissance, sans couche de découpage

La fenêtre de contexte de Kimi K3 fait 1 048 576 tokens, et la FAQ de Moonshot précise que le tarif est plat, sans palier selon la longueur de contexte — remplir la fenêtre coûte donc, au token, ce que coûte n'importe quel autre token. Un ensemble de contrats, un dossier de recherche ou une année de dépôts part entier vers Kimi K3, ce qui supprime la couche de récupération dont le seul rôle était de contourner un contexte étroit. Le travail répété revient ensuite au cache de contexte : sur Kimi K3 il est automatique, sans identifiant de cache, sans TTL et sans paramètre supplémentaire — un préfixe stable devant une question qui change est donc le motif à adopter.

Kimi K3 exécutant une boucle agentique avec des outils chargés en cours de route

Des agents obligés d'appeler des outils, pas persuadés de le faire

Deux contrôles d'appel d'outils sont arrivés avec cette génération. Un choix d'outil requis force au moins un appel sur le tour, ce qui est la façon d'empêcher un agent de répondre de mémoire quand il devait aller vérifier — les modèles K2 refusent cette valeur, Kimi K3 l'accepte. Et un outil peut être introduit en cours de conversation en plaçant sa définition complète dans un message système, si bien qu'un large inventaire d'outils n'a pas à être déclaré d'avance à chaque requête. Les sorties structurées et un JSON Schema gardent parsable ce que Kimi K3 renvoie en fin de boucle.

Tarifs

Basé sur les crédits — 1 crédit = 0,001 USD. Tu ne paies que les générations réussies.

Coût du premier test
$2.52,500 credits

Une génération au palier le moins cher (1M tokens).

Guide de budget de test
Ajouter des crédits
$10
≈ 4 tests
$50
≈ 20 tests
$100
≈ 40 tests
ModèleCatégoriePrix
Facturation au tokenEntrée
$2.5
1M tokens
Sortie
$12
1M tokens

Pourquoi reAPI

Sous le tarif publié, dans les deux sens

Moonshot publie un tarif par million de tokens pour l'entrée et la sortie de Kimi K3. Sur reAPI, Kimi K3 passe sous ce tarif des deux côtés, et d'un cinquième entier en sortie — aucun abonnement en dessous, aucun engagement minimum, paiement à l'usage en USD sur le solde de votre passerelle. Les chiffres exacts figurent dans le tableau tarifaire de cette page.

Compatible OpenAI, remplacement direct

Kimi K3 est servi depuis un endpoint `/v1/chat/completions` standard, et le quickstart de Moonshot pilote lui-même le modèle via le SDK OpenAI — cette compatibilité est donc le choix du fournisseur, pas une couche que nous ajoutons. Adopter Kimi K3 tient à une base URL, une clé et une chaîne de modèle. Pas de changement de SDK, et rien dans Kimi K3 ne réclame un client dédié.

Une clé pour Kimi, Claude, GPT et Gemini

La clé api.reapi.ai qui appelle Kimi K3 appelle aussi les familles Claude, GPT et Gemini. Opposer Kimi K3 à un modèle de pointe fermé, ou basculer quand un fournisseur passe une mauvaise heure, tient à une chaîne de modèle plutôt qu'à une deuxième intégration, une deuxième facture et un deuxième jeu d'identifiants.

Kimi K3 vs Claude Opus 5

Sur reAPI, ces deux modèles tombent pratiquement au même tarif par token, ce qui fait du prix la partie la moins intéressante de la comparaison. Ce qui diffère, c'est la forme : Kimi K3 est le modèle à poids ouverts qui raisonne toujours, rend son texte de raisonnement et accepte la vidéo, tandis que Claude Opus 5 est le modèle fermé à l'échelle d'effort plus fine qui garde son raisonnement pour lui. Deux de ces lignes sont celles qui cassent du code repris chez un autre fournisseur — sur Kimi K3 la réflexion ne se coupe pas, et son texte de raisonnement doit être renvoyé dans les historiques multi-tours.

Capacité
Kimi K3 sur reAPI
Claude Opus 5
Poids
Ouverts — Moonshot le présente comme le premier modèle open source de la classe des trois mille milliards de paramètres
Fermés — accès API uniquement
Limites de contexte et de sortie
Contexte de 1 048 576 tokens ; sortie à 131 072 par défaut, relevable à la fenêtre entière
Contexte de 1M de tokens ; sortie maximale de 128k, fixe
Réflexion
Toujours active et non désactivable — baissez l'effort à la place
Active par défaut, désactivable à un effort high ou inférieur
Échelle d'effort
Trois crans — low, high, max — avec max par défaut
Cinq crans de low à max, high par défaut
Texte de raisonnement
Renvoyé à côté de la réponse, et exigé en retour dans la requête suivante
Raisonnement brut jamais renvoyé ; un résumé lisible sur demande
Entrée visuelle
Images et vidéo, en base64 ou fichier téléversé — URL publiques refusées
Images et PDF ; pas d'entrée vidéo

La comparaison reflète le comportement documenté par chaque fournisseur au moment de la rédaction. Les tarifs sont décrits en termes de rapports et non de montants ; les chiffres réels pour Kimi K3 figurent dans le tableau tarifaire ci-dessus.

Mettre Kimi K3 en production en trois étapes

  1. step 01

    Créer un compte et une clé sur api.reapi.ai

    Inscrivez-vous sur api.reapi.ai, ouvrez la console et générez une clé API. Cette unique clé atteint Kimi K3 et tous les autres modèles de la passerelle, facturés depuis un seul solde.

    Ouvrir
  2. step 02

    Pointer votre client vers la passerelle

    Mettez votre base URL sur api.reapi.ai et votre clé sur celle que vous venez de créer. Tout client qui parle déjà OpenAI Chat Completions fonctionne sans modification — aucun changement de SDK n'est nécessaire pour atteindre Kimi K3.

    Ouvrir
  3. step 03

    Envoyer `kimi-k3` comme modèle

    Mettez le champ model sur `kimi-k3` et postez vos messages. Activez le streaming pour les longues sorties, retirez tout temperature ou top_p que vous envoyiez, et choisissez un effort de raisonnement — Kimi K3 réfléchit toujours, et le cran par défaut est le plus coûteux.

    Ouvrir
docs/api/kimi-k3

Référence API

Code prêt à l'emploi et tableau complet des paramètres.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "group": "default",
    "messages": [
      { "role": "user", "content": "Hello" }
    ],
    "reasoning_effort": "high",
    "stream": true
  }'

Échec de validation des paramètres

Rejet synchrone avec le champ fautif nommé. Vérifiez enums, plages et champs URL — rien n'est facturé.

Problème d'authentification ou de solde

401 : clé Bearer absente ou invalide ; 402 : la réserve dépasse votre solde. Gérez clés et crédits dans la console.

Contenu ou matériel rejeté

Le matériel de référence et les sorties passent une modération automatique. Les tâches rejetées échouent avec une erreur claire et un remboursement intégral.

Tâche échouée ou expirée

Une tâche en état d'échec n'est jamais facturée — la réserve est remboursée automatiquement. Conservez l'ID et réessayez.

Questions fréquentes

Questions courantes sur ce modèle.

Kimi K3 est facturé à l'usage en USD par token sur votre solde api.reapi.ai, avec des tarifs distincts en entrée et en sortie et sans abonnement. Les deux passent sous le tarif par token publié par Moonshot, la sortie d'un cinquième entier. Les chiffres actuels figurent dans le tableau tarifaire de cette page.

start building

Prêt à déployer ?

Essaie-le dans le playground ou récupère une clé API pour intégrer dès maintenant.