Seedance 2.5 is live — 30-second cinematic video with native audio & real-person referencesfrom $0.071 pro Sekunde

Kimi K3 — 1M Kontext, Open-Weight-Flaggschiff

Kimi K3 ist Moonshots Flaggschiff für Long-Horizon-Coding und Wissensarbeit von Anfang bis Ende. Kimi K3 liest ein Kontextfenster von 1.048.576 Tokens, reasoniert immer und bietet einen dreistufigen Reasoning-Effort-Regler von low bis max. Die native Vision umfasst Bilder und Video, die Gewichte sind offen, und auf reAPI liegt Kimi K3 bei Input und Output jeweils unter Moonshots veröffentlichter Token-Rate.

Kernmerkmale
Moonshot-Flaggschiff · Werkzeugaufrufe · JSON-Ausgabe
Geeignet für
Langkontext zh / en Arbeit, Agenten
Eingabe
Chatnachrichten (OpenAI-kompatibel)
Ausgabe
Text, optionales Streaming
Kimi K3modelkimi-k3

Kimi K3 Playground

Chat-Modelle laufen im api.reapi.ai-Gateway, das eine eigene Konsole und einen eigenen Key hat. Öffne die Konsole, um Kimi K3 über die OpenAI-kompatible Chat-Completions-Schnittstelle auszuführen.

Was ist die Kimi K3 API?

Kimi K3 ist das Open-Weight-Flaggschiff von Moonshot AI für langlaufende Coding-Aufgaben und durchgängige Wissensarbeit, auf reAPI über einen OpenAI-kompatiblen Chat-Completions-Endpunkt verfügbar. Das Modell hat ein Kontextfenster von 1.048.576 Tokens und kann in einer einzigen Antwort bis zu dieses gesamte Fenster ausgeben — die Standardgrenze liegt bei 131.072 Tokens —, denkt immer mit und lässt sich dabei auf low, high oder max stellen, und nimmt Bilder und Videos nativ entgegen, ergänzt um Tool-Calling und striktes JSON-Schema-Output. Eingabe- und Ausgabetokens werden getrennt pro Million Tokens abgerechnet, und bei wiederholten Präfixen greift das Context Caching automatisch.

Was du mit diesem Modell bauen kannst

Echte Workflows und produktionsreife Use Cases, die du mit diesem Modell bauen und ausliefern kannst.

Kimi K3 behebt einen Layout-Fehler anhand eines Screenshots der kaputten Seite

Long-Horizon-Coding, mit Screenshots im Kreislauf

Moonshot positioniert Kimi K3 für Long-Horizon-Coding und beschreibt es dabei, Engineering-Aufgaben mit minimaler menschlicher Aufsicht durchzuziehen — große Codebasen zu lesen und zu bearbeiten und Terminal-Tools zu koordinieren. Was Kimi K3 von einem reinen Text-Coding-Modell unterscheidet: Vision ist nativ und nicht angeflanscht. Screenshots und visuelles Feedback sind Eingaben, und Moonshot nennt dafür ausdrücklich Spieleentwicklung, Frontend-Engineering und CAD. Das schließt einen Kreis, den ein reines Textmodell nicht schließen kann, weil das Modell ansehen kann, was es gerade gebaut hat, und beurteilen, ob das Layout wirklich falsch ist, bevor es erneut editiert.

API-Dokumentation lesen
Kimi K3 liest einen großen Dokumentenbestand und erzeugt ein strukturiertes Ergebnis

Eine Million Tokens Wissensarbeit ohne Chunking-Schicht

Das Kontextfenster von Kimi K3 umfasst 1.048.576 Tokens, und Moonshots eigene FAQ sagt, die Rate sei flach und ohne Staffelung nach Kontextlänge — das Fenster zu füllen kostet pro Token also so viel wie jeder andere Token. Ein Vertragskonvolut, ein Recherchepaket oder ein Jahr an Einreichungen geht komplett an Kimi K3, womit die Retrieval-Schicht wegfällt, deren einzige Aufgabe das Umgehen eines kleinen Kontexts war. Die Wiederholungen übernimmt dann das Context Caching: bei Kimi K3 automatisch, ohne Cache-ID, ohne TTL, ohne Zusatzparameter — ein stabiler Prefix vor einer wechselnden Frage ist also das Muster, um das man baut.

Kimi K3 führt eine agentische Schleife aus, in die mitten im Lauf Tools geladen werden

Agenten, die Tools aufrufen müssen, nicht dazu überredet werden

Mit dieser Generation kamen zwei Steuerungen fürs Tool Calling. Eine erforderliche Tool-Wahl erzwingt mindestens einen Aufruf in der Runde — so verhindert man, dass ein Agent aus dem Gedächtnis antwortet, wo er hätte nachsehen sollen. Die K2-Modelle weisen diesen Wert ab, Kimi K3 nimmt ihn an. Und ein Tool lässt sich mitten im Gespräch einführen, indem seine vollständige Definition in eine System-Nachricht wandert, sodass ein großer Tool-Bestand nicht bei jedem Request vorab deklariert werden muss. Structured Outputs und ein JSON Schema halten am Ende der Schleife parsebar, was Kimi K3 zurückgibt.

Preise

Credit-basiert — 1 Credit = 0,001 USD. Du zahlst nur für erfolgreich abgeschlossene Generierungen.

Kosten des ersten Tests
$2.52,500 credits

Eine Generierung in der günstigsten Stufe (1M tokens).

Testbudget-Leitfaden
Credits aufladen
$10
≈ 4 Tests
$50
≈ 20 Tests
$100
≈ 40 Tests
ModellKategoriePreis
Token-AbrechnungInput
$2.5
1M tokens
Output
$12
1M tokens

Warum reAPI

Unter der veröffentlichten Rate, in beide Richtungen

Moonshot veröffentlicht für Input und Output von Kimi K3 eine Rate pro Million Tokens. Auf reAPI liegt Kimi K3 bei beidem darunter, beim Output um ein ganzes Fünftel — kein Abo darunter, keine Mindestabnahme, nutzungsbasiert in USD gegen dein Gateway-Guthaben. Die genauen Zahlen stehen in der Preistabelle auf dieser Seite.

OpenAI-kompatibel, direkt einsetzbar

Kimi K3 wird über einen standardmäßigen `/v1/chat/completions`-Endpunkt bereitgestellt, und Moonshots eigener Quickstart fährt das Modell über das OpenAI-SDK — die Kompatibilität ist also das Design des Anbieters und keine übergelegte Schicht. Die Umstellung auf Kimi K3 ist eine Base URL, ein Key und ein Model-String. Kein SDK-Tausch, und nichts an Kimi K3 braucht einen eigenen Client.

Ein Key für Kimi, Claude, GPT und Gemini

Derselbe api.reapi.ai-Key, der Kimi K3 aufruft, ruft auch die Claude-, GPT- und Gemini-Familien auf. Kimi K3 direkt gegen ein geschlossenes Frontier-Modell zu stellen oder umzuschalten, wenn ein Anbieter eine schlechte Stunde hat, ist ein Model-String und nicht eine zweite Integration, eine zweite Rechnung und ein zweiter Satz Zugangsdaten.

Kimi K3 vs. Claude Opus 5

Auf reAPI landen diese zwei praktisch auf derselben Token-Rate, was den Preis zum uninteressantesten Teil des Vergleichs macht. Unterschiedlich ist die Form: Kimi K3 ist das Modell mit offenen Gewichten, das immer reasoniert, seinen Reasoning-Text herausgibt und Video-Input nimmt, während Claude Opus 5 das geschlossene Modell mit der feineren Effort-Leiter ist, das sein Reasoning für sich behält. Zwei dieser Zeilen brechen Code, der von einem anderen Anbieter übernommen wurde — bei Kimi K3 lässt sich Denken nicht abschalten, und der Reasoning-Text muss in Multi-Turn-Verläufen zurückgespielt werden.

Fähigkeit
Kimi K3 auf reAPI
Claude Opus 5
Gewichte
Offen — Moonshot nennt es das erste Open-Source-Modell der Drei-Billionen-Parameter-Klasse
Geschlossen — nur API-Zugriff
Kontext- und Output-Grenzen
1.048.576-Token-Kontext; Output standardmäßig 131.072, anhebbar auf das ganze Fenster
1M-Token-Kontext; 128k maximaler Output, fest
Denken
Immer an und nicht abschaltbar — stattdessen den Effort senken
Standardmäßig an, abschaltbar bei Effort high oder niedriger
Effort-Leiter
Drei Stufen — low, high, max — mit Standard max
Fünf Stufen von low bis max, Standard high
Reasoning-Text
Kommt neben der Antwort zurück und ist im nächsten Request erforderlich
Rohes Reasoning wird nie herausgegeben; auf Anfrage eine lesbare Zusammenfassung
Visuelle Eingabe
Bilder und Video, als base64 oder hochgeladene Datei — öffentliche URLs werden abgewiesen
Bilder und PDF; kein Video-Input

Der Vergleich spiegelt das Verhalten, das jeder Anbieter zum Zeitpunkt der Erstellung selbst dokumentiert. Raten werden als Verhältnisse und nicht als Beträge beschrieben; die aktuellen Zahlen für Kimi K3 stehen in der Preistabelle oben.

Kimi K3 in drei Schritten ausliefern

  1. step 01

    Konto und Key auf api.reapi.ai anlegen

    Registriere dich auf api.reapi.ai, öffne die Konsole und erzeuge einen API-Key. Dieser eine Key erreicht Kimi K3 und jedes andere Modell im Gateway, abgerechnet über ein einziges Guthaben.

    Öffnen
  2. step 02

    Client auf das Gateway richten

    Setze deine Base URL auf api.reapi.ai und deinen Key auf den gerade erzeugten. Jeder Client, der schon OpenAI Chat Completions spricht, läuft unverändert — für Kimi K3 ist kein SDK-Tausch nötig.

    Öffnen
  3. step 03

    `kimi-k3` als Model senden

    Setze das Model-Feld auf `kimi-k3` und poste deine Messages. Aktiviere Streaming für lange Antworten, entferne jedes `temperature` und `top_p`, das du bisher gesendet hast, und wähle einen Reasoning-Effort — Kimi K3 denkt immer, und die Standardstufe ist die teuerste.

    Öffnen
docs/api/kimi-k3

API-Referenz

Sofort einsetzbarer Code und die vollständige Parametertabelle.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "group": "default",
    "messages": [
      { "role": "user", "content": "Hello" }
    ],
    "reasoning_effort": "high",
    "stream": true
  }'

Parametervalidierung fehlgeschlagen

Synchron abgelehnt, das fehlerhafte Feld wird benannt. Enum-Werte, Bereiche und URL-Felder prüfen — es wird nichts berechnet.

Authentifizierung oder Guthaben

401 bedeutet fehlender/ungültiger Bearer-Key; 402 bedeutet, die Reservierung übersteigt das Guthaben. Keys und Credits in der Konsole verwalten.

Inhalt oder Material abgelehnt

Referenzmaterial und Ausgaben durchlaufen eine automatische Prüfung. Abgelehnte Tasks schlagen mit klarer Fehlermeldung fehl und werden voll erstattet.

Task fehlgeschlagen oder Timeout

Ein fehlgeschlagener Task wird nie berechnet — die Reservierung wird automatisch erstattet. Task-ID behalten und erneut versuchen.

Häufig gestellte Fragen

Häufige Fragen zu diesem Modell.

Kimi K3 wird nutzungsbasiert in USD pro Token gegen dein api.reapi.ai-Guthaben abgerechnet, mit getrennten Raten für Input und Output und ohne Abo. Beide liegen unter Moonshots veröffentlichter Token-Rate, der Output um ein ganzes Fünftel. Die aktuellen Zahlen stehen in der Preistabelle auf dieser Seite.

start building

Bereit zum Start?

Probiere es im Playground aus oder hol dir einen API-Key, um direkt loszulegen.