
DeepSeek V4: Kontext, max_tokens und Concurrency erklärt
DeepSeek V4 teilt sein 1M-Kontextfenster zwischen Input und Output mit 384K Maximum. Lerne max_tokens, Cache-Abrechnung und Concurrency kennen.
DeepSeek V4s Kontextfenster von 1M ist ein gemeinsames Budget für Ein- und Ausgabe. Du kannst nicht 1M Input-Token senden und dann zusätzlich 384K generieren. Die 384K sind das Maximum für Ausgabe, während max_tokens dein selbst gewähltes Ausgabelimit für eine Anfrage ist. Die tatsächliche Ausgabe wird auch durch den verbleibenden Platz im 1M-Fenster begrenzt[1][2].
Dieser Leitfaden beantwortet die praktischen Fragen dahinter: Wie Budget ich Input und Output, wie setze ich max_tokens, was bewirken Thinking-Token bei der Nutzung, wie funktioniert Cache-Abrechnung, und warum haben Flash und Pro unterschiedliche Concurrency-Limits.
DeepSeek V4 Limits auf einen Blick
| Element | Offizielle Spezifikation |
|---|---|
| Modell-IDs | deepseek-v4-flash, deepseek-v4-pro |
| Kontextfenster | 1M Token, geteilt durch Input und generierte Ausgabe |
| Maximale Ausgabe | 384K Token |
max_tokens | Pro-Anfrage-Deckel für Ausgabe; darf verbleibenden Kontext oder Modell-Ausgabelimit nicht überschreiten |
| Standardmodus | Thinking aktiviert; normale Anfragen verwenden standardmäßig reasoning_effort: high |
| Cache | Kontext-Disk-Cache ist automatisch aktiviert |
| Direct-API-Concurrency | Flash 2.500; Pro 500, pro Account |
| Schnittstellen | OpenAI Chat Completions und Anthropic-kompatibel |
DeepSeek veröffentlichte die V4-Vorschau am 24. April 2026 mit Flash- und Pro-Varianten und Kontextfenster von 1M[3]. Die offizielle Preisseite listet dasselbe 384K-Ausgabelimit für beide Modelle auf, zusammen mit JSON Output, Tool Calls, Präfix-Completion und FIM-Completion[1].
Heisst 1M nur Input?
Nein. DeepSeeks Chat-Completions-Referenz sagt, dass die Gesamtlänge von Input-Token und generierten Token durch die Modell-Kontextlänge begrenzt ist[2].
Nutze dieses Gedankenmodell:
Input-Token + generierte Token <= 1M Kontext
generierte Token <= max_tokens
generierte Token <= 384K Modell-AusgabelimitWenn das Prompt fast das ganze Kontextfenster füllt, kann das Modell nicht auch noch eine 384K-Antwort zurückgeben. Reserviere Platz für System-Instruktionen, Tool-Schemas, Gesprächsverlauf und die Antwort.
Ein grosses Fenster hebt auch nicht auf, dass Retrieval und Chunking wertvoll sind. Weniger, besser organisierte Kontexte zu senden verbessert oft Latenz, Kosten und Antwort-Fokus.
Wie du max_tokens setzt
max_tokens ist das maximale Ausgabelimit für eine Anfrage. Ein finish_reason von length kann bedeuten, dass die Anfrage diesen Deckel erreicht hat oder Kontext verbraucht hat[2].
Vernünftige Startpunkte:
| Workload | Start-Deckel |
|---|---|
| Klassifikation, Extraktion, kurze Antworten | 1K–4K |
| Code-Review und Dokument-Zusammenfassungen | 4K–16K |
| Lange Reports und Migrations-Pläne | 16K–64K |
| Extreme Long-Form-Generierung | Nur nach Messung von Kosten und Truncation erhöhen |
Das sind technische Startpunkte, keine offiziellen Anforderungen. Miss finish_reason, tatsächliche Completion-Token, Latenz und Useful-Output-Rate, bevor du den Deckel erhöhst.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Review this repository inventory and produce a risk-ranked migration plan.",
}
],
max_tokens=16_384,
reasoning_effort="high",
extra_body={
"thinking": {"type": "enabled"},
"group": "default",
},
)Siehe die DeepSeek-V4-API-Referenz für reAPI-Request-Felder, und die DeepSeek-V4-Modellseite für Playground und Live-Gateway-Preise.
Thinking-Token und Completion-Nutzung
Thinking-Modus ist standardmäßig aktiviert. DeepSeek gibt Reasoning in reasoning_content zurück, und das Usage-Objekt kann es separat als completion_tokens_details.reasoning_tokens berichten[4][2].
Plane die Completion-Kapazität um Reasoning zusätzlich zur sichtbaren finalen Antwort. Im Thinking-Modus werden temperature, top_p, presence_penalty und frequency_penalty akzeptiert aus Kompatibilitätsgründen, haben aber keine Wirkung[4].
Für deterministische Extraktion oder Low-Latency-Arbeit teste Flash mit deaktiviertem Thinking. Halte Thinking aktiviert für Planning, Coding und Multi-Step-Tool-Use, wo das zusätzliche Reasoning nützlich ist.
Wie Abrechnung funktioniert
DeepSeek Direct rechnet drei Token-Buckets ab:
- gecachte Eingabe;
- ungecachte Eingabe;
- Ausgabe.
Die offiziellen USD-Sätze vom 30. Juli 2026 waren[1]:
| Modell | Gecachte Eingabe / 1M | Ungecachte Eingabe / 1M | Ausgabe / 1M |
|---|---|---|---|
| DeepSeek V4 Flash | $0,0028 | $0,14 | $0,28 |
| DeepSeek V4 Pro | $0,003625 | $0,435 | $0,87 |
Die allgemeine Formel ist:
Kosten =
gecachte_Eingabe / 1M × gecachter_Satz
+ ungecachte_Eingabe / 1M × ungecachter_Satz
+ Ausgabe / 1M × AusgabensatzDas sind DeepSeeks direkte Preise. reAPI ist ein separates Gateway mit eigenen Live-USD-Sätzen, nutze also die Preiskarte auf der reAPI-DeepSeek-V4-Seite für Gateway-Abrechnung.
Kontext-Cache nutzen
DeepSeeks Disk-Cache ist automatisch aktiviert. Eine spätere Anfrage erhält einen Cache-Hit nur, wenn sie vollständig eine gespeicherte Präfix-Unit passt; ähnliches Wording reicht nicht[5].
Stelle stabilen Inhalt vorn:
stabiler System-Prompt
+ stabile Tool-Schemas
+ unverändertes Repository oder Dokument-Corpus
+ die Frage, die sich pro Anfrage ändertNutze die Response-Felder prompt_cache_hit_tokens und prompt_cache_miss_tokens, um die echte Hit-Rate zu berechnen. Schätze Einsparungen nicht allein auf Prompt-Ähnlichkeit.
Flash und Pro Concurrency
DeepSeek Direct veröffentlicht Account-Limits für Concurrency von 2.500 für Flash und 500 für Pro. Eine Anfrage belegt einen Concurrency-Slot bis ihre Response fertig ist. Das Limit ist pro Account, nicht pro API-Schlüssel, und Überschuss-Anfragen erhalten HTTP 429[6].
Das optionale user_id kann Safety-, Cache- und Scheduling-Verhalten isolieren, aber normale Accounts teilen immer noch die totale Account-Concurrency über alle User-IDs hinweg. Mehr Keys oder User-IDs zu schaffen erhöht nicht die Kapazität.
Diese Zahlen gelten für DeepSeek Direct. Gateway-Concurrency und Queueing können unterscheiden; wenn du reAPI nutzt, folge den Limits und Responses, die von reAPI veröffentlicht werden.
Production-Checkliste für 1M-Kontext-Anfragen
- Zähle Token statt Zeichen als Token anzunehmen.
- Reserviere Kontext für Ausgabe, Tool-Schemas und Follow-Up-Turns.
- Setze
max_tokensauf die Aufgabe, nicht automatisch auf 384K. - Erfasse
finish_reasonund unterscheide Truncation von natürlichen Stopps. - Halte wiederverwendbare Präfixe stabil und verfolgë Cache-Hit-Token.
- Miss Reasoning-Nutzung separat von sichtbarer Antwortlänge.
- Wiederhole 429-Responses mit exponentieller Backoff und Jitter.
- Route High-Volume-Routine-Arbeit zu Flash und reserviere Pro für schwierigere Aufgaben.
- Nutze die aktuellen V4-Modell-IDs; DeepSeeks angekundigte Deprecation für
deepseek-chatunddeepseek-reasonerwar 24. Juli 2026[3].
FAQ
Unterstützt DeepSeek V4 Flash 1M Kontext?
Ja. Beide Flash und Pro haben ein Kontextfenster von 1M und ein maximales Ausgabelimit von 384K[1].
Ist das 1M Kontext nur Input?
Nein. Input und generierte Ausgabe teilen das Modell-Kontextlimit[2].
Kann ich max_tokens auf 384K setzen?
384K ist die Modell-Ausgabedecke, aber die Anfrage muss auch genug Platz im 1M-Kontextfenster übrig haben. Die Einstellung garantiert keine 384K-Antwort.
Zählen Reasoning-Token zur Completion-Nutzung?
Kapazität und Abrechnung sollten sie einplanen. DeepSeek berichtet Reasoning-Token innerhalb von Completion-Nutzungsdetails[2].
Sind Concurrency-Limits pro API-Schlüssel?
Nein. DeepSeek Direct limitiert Concurrency pro Account: 2.500 für Flash und 500 für Pro[6].
Muss ich Prompt-Caching aktivieren?
Nein. Der Kontext-Disk-Cache ist automatisch. Halte gemeinsame Präfixe stabil und prüfe die Cache-Hit-Felder in usage[5].
Weitere Lektüre
References
- DeepSeek. Models & Pricing — V4 context, output, features, prices, and concurrency. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/pricing
- DeepSeek. Create Chat Completion — max_tokens, context limits, finish reasons, and usage. Retrieved July 30, 2026 from api-docs.deepseek.com/api/create-chat-completion
- DeepSeek. DeepSeek-V4 preview release. April 24, 2026. api-docs.deepseek.com/news/news260424
- DeepSeek. Thinking Mode — controls, reasoning effort, and reasoning content. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/thinking_mode
- DeepSeek. Context Caching — prefix matching and usage fields. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/kv_cache
- DeepSeek. Rate Limit & Isolation — account-level concurrency and user_id. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/rate_limit
Autor

Kategorien
max_tokens setztThinking-Token und Completion-NutzungWie Abrechnung funktioniertKontext-Cache nutzenFlash und Pro ConcurrencyProduction-Checkliste für 1M-Kontext-AnfragenFAQUnterstützt DeepSeek V4 Flash 1M Kontext?Ist das 1M Kontext nur Input?Kann ich max_tokens auf 384K setzen?Zählen Reasoning-Token zur Completion-Nutzung?Sind Concurrency-Limits pro API-Schlüssel?Muss ich Prompt-Caching aktivieren?Weitere LektüreReferencesWeitere Beiträge

Claude Code: Anthropics agentengestütztes Terminal-Coding-Tool
Claude Code: 1-Million-Token-Kontext, 80,8% SWE-bench-Score, Plan-Mode-Gatekeeper, Installation, Vergleich mit Cursor und Copilot, Plattformen und Nutzung.


Dreamina Seedance 2.5 Prompt-Guide: Referenzen & Timing
Bessere Seedance-2.5-Prompts mit offiziellen Referenzlimits, 30-Sekunden-Phasen, Zeitsteuerung, Bearbeitung, Verlängerung und Keyframe-Vorlagen.


Claude Opus 5: Benchmarks, Effort-Stufen und Kosten
Claude Opus 5 nutzen: offizielle Benchmark-Tabelle, die Effort-Leiter die deine Rechnung bestimmt, zwei Breaking-API-Changes und Migrationschritte.
