
Anthropic
Claude Opus 5
Ab $2.40 pro 1M Tokens
Kimi K3 ist Moonshots Flaggschiff für Long-Horizon-Coding und Wissensarbeit von Anfang bis Ende. Kimi K3 liest ein Kontextfenster von 1.048.576 Tokens, reasoniert immer und bietet einen dreistufigen Reasoning-Effort-Regler von low bis max. Die native Vision umfasst Bilder und Video, die Gewichte sind offen, und auf reAPI liegt Kimi K3 bei Input und Output jeweils unter Moonshots veröffentlichter Token-Rate.
kimi-k3Chat-Modelle laufen im api.reapi.ai-Gateway, das eine eigene Konsole und einen eigenen Key hat. Öffne die Konsole, um Kimi K3 über die OpenAI-kompatible Chat-Completions-Schnittstelle auszuführen.
Echte Workflows und produktionsreife Use Cases, die du mit diesem Modell bauen und ausliefern kannst.

Moonshot positioniert Kimi K3 für Long-Horizon-Coding und beschreibt es dabei, Engineering-Aufgaben mit minimaler menschlicher Aufsicht durchzuziehen — große Codebasen zu lesen und zu bearbeiten und Terminal-Tools zu koordinieren. Was Kimi K3 von einem reinen Text-Coding-Modell unterscheidet: Vision ist nativ und nicht angeflanscht. Screenshots und visuelles Feedback sind Eingaben, und Moonshot nennt dafür ausdrücklich Spieleentwicklung, Frontend-Engineering und CAD. Das schließt einen Kreis, den ein reines Textmodell nicht schließen kann, weil das Modell ansehen kann, was es gerade gebaut hat, und beurteilen, ob das Layout wirklich falsch ist, bevor es erneut editiert.
API-Dokumentation lesen
Das Kontextfenster von Kimi K3 umfasst 1.048.576 Tokens, und Moonshots eigene FAQ sagt, die Rate sei flach und ohne Staffelung nach Kontextlänge — das Fenster zu füllen kostet pro Token also so viel wie jeder andere Token. Ein Vertragskonvolut, ein Recherchepaket oder ein Jahr an Einreichungen geht komplett an Kimi K3, womit die Retrieval-Schicht wegfällt, deren einzige Aufgabe das Umgehen eines kleinen Kontexts war. Die Wiederholungen übernimmt dann das Context Caching: bei Kimi K3 automatisch, ohne Cache-ID, ohne TTL, ohne Zusatzparameter — ein stabiler Prefix vor einer wechselnden Frage ist also das Muster, um das man baut.

Mit dieser Generation kamen zwei Steuerungen fürs Tool Calling. Eine erforderliche Tool-Wahl erzwingt mindestens einen Aufruf in der Runde — so verhindert man, dass ein Agent aus dem Gedächtnis antwortet, wo er hätte nachsehen sollen. Die K2-Modelle weisen diesen Wert ab, Kimi K3 nimmt ihn an. Und ein Tool lässt sich mitten im Gespräch einführen, indem seine vollständige Definition in eine System-Nachricht wandert, sodass ein großer Tool-Bestand nicht bei jedem Request vorab deklariert werden muss. Structured Outputs und ein JSON Schema halten am Ende der Schleife parsebar, was Kimi K3 zurückgibt.
Credit-basiert — 1 Credit = 0,001 USD. Du zahlst nur für erfolgreich abgeschlossene Generierungen.
| Kategorie | Einheit | Preis |
|---|---|---|
| Token-Abrechnung | ||
| Input | 1M tokens | $2.5 |
| Output | 1M tokens | $12 |
Moonshot veröffentlicht für Input und Output von Kimi K3 eine Rate pro Million Tokens. Auf reAPI liegt Kimi K3 bei beidem darunter, beim Output um ein ganzes Fünftel — kein Abo darunter, keine Mindestabnahme, nutzungsbasiert in USD gegen dein Gateway-Guthaben. Die genauen Zahlen stehen in der Preistabelle auf dieser Seite.
Kimi K3 wird über einen standardmäßigen `/v1/chat/completions`-Endpunkt bereitgestellt, und Moonshots eigener Quickstart fährt das Modell über das OpenAI-SDK — die Kompatibilität ist also das Design des Anbieters und keine übergelegte Schicht. Die Umstellung auf Kimi K3 ist eine Base URL, ein Key und ein Model-String. Kein SDK-Tausch, und nichts an Kimi K3 braucht einen eigenen Client.
Derselbe api.reapi.ai-Key, der Kimi K3 aufruft, ruft auch die Claude-, GPT- und Gemini-Familien auf. Kimi K3 direkt gegen ein geschlossenes Frontier-Modell zu stellen oder umzuschalten, wenn ein Anbieter eine schlechte Stunde hat, ist ein Model-String und nicht eine zweite Integration, eine zweite Rechnung und ein zweiter Satz Zugangsdaten.
Auf reAPI landen diese zwei praktisch auf derselben Token-Rate, was den Preis zum uninteressantesten Teil des Vergleichs macht. Unterschiedlich ist die Form: Kimi K3 ist das Modell mit offenen Gewichten, das immer reasoniert, seinen Reasoning-Text herausgibt und Video-Input nimmt, während Claude Opus 5 das geschlossene Modell mit der feineren Effort-Leiter ist, das sein Reasoning für sich behält. Zwei dieser Zeilen brechen Code, der von einem anderen Anbieter übernommen wurde — bei Kimi K3 lässt sich Denken nicht abschalten, und der Reasoning-Text muss in Multi-Turn-Verläufen zurückgespielt werden.
Der Vergleich spiegelt das Verhalten, das jeder Anbieter zum Zeitpunkt der Erstellung selbst dokumentiert. Raten werden als Verhältnisse und nicht als Beträge beschrieben; die aktuellen Zahlen für Kimi K3 stehen in der Preistabelle oben.
Registriere dich auf api.reapi.ai, öffne die Konsole und erzeuge einen API-Key. Dieser eine Key erreicht Kimi K3 und jedes andere Modell im Gateway, abgerechnet über ein einziges Guthaben.
ÖffnenSetze deine Base URL auf api.reapi.ai und deinen Key auf den gerade erzeugten. Jeder Client, der schon OpenAI Chat Completions spricht, läuft unverändert — für Kimi K3 ist kein SDK-Tausch nötig.
ÖffnenSetze das Model-Feld auf `kimi-k3` und poste deine Messages. Aktiviere Streaming für lange Antworten, entferne jedes `temperature` und `top_p`, das du bisher gesendet hast, und wähle einen Reasoning-Effort — Kimi K3 denkt immer, und die Standardstufe ist die teuerste.
ÖffnenHäufige Fragen zu diesem Modell.
Entdecke weitere Modelle derselben Kategorie.

Anthropic
Ab $2.40 pro 1M Tokens

OpenAI
Ab $2.00 pro 1M Token

Anthropic
Ab $2.00 pro 1M Tokens

Anthropic
Ab $2.00 pro 1M Tokens
Probiere es im Playground aus oder hol dir einen API-Key, um direkt loszulegen.