Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
DeepSeek V4: Kontext, max_tokens und Concurrency erklärt
2026/07/30

DeepSeek V4: Kontext, max_tokens und Concurrency erklärt

DeepSeek V4 teilt sein 1M-Kontextfenster zwischen Input und Output mit 384K Maximum. Lerne max_tokens, Cache-Abrechnung und Concurrency kennen.

DeepSeek V4s Kontextfenster von 1M ist ein gemeinsames Budget für Ein- und Ausgabe. Du kannst nicht 1M Input-Token senden und dann zusätzlich 384K generieren. Die 384K sind das Maximum für Ausgabe, während max_tokens dein selbst gewähltes Ausgabelimit für eine Anfrage ist. Die tatsächliche Ausgabe wird auch durch den verbleibenden Platz im 1M-Fenster begrenzt[1][2].

Dieser Leitfaden beantwortet die praktischen Fragen dahinter: Wie Budget ich Input und Output, wie setze ich max_tokens, was bewirken Thinking-Token bei der Nutzung, wie funktioniert Cache-Abrechnung, und warum haben Flash und Pro unterschiedliche Concurrency-Limits.

DeepSeek V4 Limits auf einen Blick

ElementOffizielle Spezifikation
Modell-IDsdeepseek-v4-flash, deepseek-v4-pro
Kontextfenster1M Token, geteilt durch Input und generierte Ausgabe
Maximale Ausgabe384K Token
max_tokensPro-Anfrage-Deckel für Ausgabe; darf verbleibenden Kontext oder Modell-Ausgabelimit nicht überschreiten
StandardmodusThinking aktiviert; normale Anfragen verwenden standardmäßig reasoning_effort: high
CacheKontext-Disk-Cache ist automatisch aktiviert
Direct-API-ConcurrencyFlash 2.500; Pro 500, pro Account
SchnittstellenOpenAI Chat Completions und Anthropic-kompatibel

DeepSeek veröffentlichte die V4-Vorschau am 24. April 2026 mit Flash- und Pro-Varianten und Kontextfenster von 1M[3]. Die offizielle Preisseite listet dasselbe 384K-Ausgabelimit für beide Modelle auf, zusammen mit JSON Output, Tool Calls, Präfix-Completion und FIM-Completion[1].

Heisst 1M nur Input?

Nein. DeepSeeks Chat-Completions-Referenz sagt, dass die Gesamtlänge von Input-Token und generierten Token durch die Modell-Kontextlänge begrenzt ist[2].

Nutze dieses Gedankenmodell:

Input-Token + generierte Token <= 1M Kontext
generierte Token <= max_tokens
generierte Token <= 384K Modell-Ausgabelimit

Wenn das Prompt fast das ganze Kontextfenster füllt, kann das Modell nicht auch noch eine 384K-Antwort zurückgeben. Reserviere Platz für System-Instruktionen, Tool-Schemas, Gesprächsverlauf und die Antwort.

Ein grosses Fenster hebt auch nicht auf, dass Retrieval und Chunking wertvoll sind. Weniger, besser organisierte Kontexte zu senden verbessert oft Latenz, Kosten und Antwort-Fokus.

Wie du max_tokens setzt

max_tokens ist das maximale Ausgabelimit für eine Anfrage. Ein finish_reason von length kann bedeuten, dass die Anfrage diesen Deckel erreicht hat oder Kontext verbraucht hat[2].

Vernünftige Startpunkte:

WorkloadStart-Deckel
Klassifikation, Extraktion, kurze Antworten1K–4K
Code-Review und Dokument-Zusammenfassungen4K–16K
Lange Reports und Migrations-Pläne16K–64K
Extreme Long-Form-GenerierungNur nach Messung von Kosten und Truncation erhöhen

Das sind technische Startpunkte, keine offiziellen Anforderungen. Miss finish_reason, tatsächliche Completion-Token, Latenz und Useful-Output-Rate, bevor du den Deckel erhöhst.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "user",
            "content": "Review this repository inventory and produce a risk-ranked migration plan.",
        }
    ],
    max_tokens=16_384,
    reasoning_effort="high",
    extra_body={
        "thinking": {"type": "enabled"},
        "group": "default",
    },
)

Siehe die DeepSeek-V4-API-Referenz für reAPI-Request-Felder, und die DeepSeek-V4-Modellseite für Playground und Live-Gateway-Preise.

Thinking-Token und Completion-Nutzung

Thinking-Modus ist standardmäßig aktiviert. DeepSeek gibt Reasoning in reasoning_content zurück, und das Usage-Objekt kann es separat als completion_tokens_details.reasoning_tokens berichten[4][2].

Plane die Completion-Kapazität um Reasoning zusätzlich zur sichtbaren finalen Antwort. Im Thinking-Modus werden temperature, top_p, presence_penalty und frequency_penalty akzeptiert aus Kompatibilitätsgründen, haben aber keine Wirkung[4].

Für deterministische Extraktion oder Low-Latency-Arbeit teste Flash mit deaktiviertem Thinking. Halte Thinking aktiviert für Planning, Coding und Multi-Step-Tool-Use, wo das zusätzliche Reasoning nützlich ist.

Wie Abrechnung funktioniert

DeepSeek Direct rechnet drei Token-Buckets ab:

  1. gecachte Eingabe;
  2. ungecachte Eingabe;
  3. Ausgabe.

Die offiziellen USD-Sätze vom 30. Juli 2026 waren[1]:

ModellGecachte Eingabe / 1MUngecachte Eingabe / 1MAusgabe / 1M
DeepSeek V4 Flash$0,0028$0,14$0,28
DeepSeek V4 Pro$0,003625$0,435$0,87

Die allgemeine Formel ist:

Kosten =
  gecachte_Eingabe / 1M × gecachter_Satz
  + ungecachte_Eingabe / 1M × ungecachter_Satz
  + Ausgabe / 1M × Ausgabensatz

Das sind DeepSeeks direkte Preise. reAPI ist ein separates Gateway mit eigenen Live-USD-Sätzen, nutze also die Preiskarte auf der reAPI-DeepSeek-V4-Seite für Gateway-Abrechnung.

Kontext-Cache nutzen

DeepSeeks Disk-Cache ist automatisch aktiviert. Eine spätere Anfrage erhält einen Cache-Hit nur, wenn sie vollständig eine gespeicherte Präfix-Unit passt; ähnliches Wording reicht nicht[5].

Stelle stabilen Inhalt vorn:

stabiler System-Prompt
+ stabile Tool-Schemas
+ unverändertes Repository oder Dokument-Corpus
+ die Frage, die sich pro Anfrage ändert

Nutze die Response-Felder prompt_cache_hit_tokens und prompt_cache_miss_tokens, um die echte Hit-Rate zu berechnen. Schätze Einsparungen nicht allein auf Prompt-Ähnlichkeit.

Flash und Pro Concurrency

DeepSeek Direct veröffentlicht Account-Limits für Concurrency von 2.500 für Flash und 500 für Pro. Eine Anfrage belegt einen Concurrency-Slot bis ihre Response fertig ist. Das Limit ist pro Account, nicht pro API-Schlüssel, und Überschuss-Anfragen erhalten HTTP 429[6].

Das optionale user_id kann Safety-, Cache- und Scheduling-Verhalten isolieren, aber normale Accounts teilen immer noch die totale Account-Concurrency über alle User-IDs hinweg. Mehr Keys oder User-IDs zu schaffen erhöht nicht die Kapazität.

Diese Zahlen gelten für DeepSeek Direct. Gateway-Concurrency und Queueing können unterscheiden; wenn du reAPI nutzt, folge den Limits und Responses, die von reAPI veröffentlicht werden.

Production-Checkliste für 1M-Kontext-Anfragen

  • Zähle Token statt Zeichen als Token anzunehmen.
  • Reserviere Kontext für Ausgabe, Tool-Schemas und Follow-Up-Turns.
  • Setze max_tokens auf die Aufgabe, nicht automatisch auf 384K.
  • Erfasse finish_reason und unterscheide Truncation von natürlichen Stopps.
  • Halte wiederverwendbare Präfixe stabil und verfolgë Cache-Hit-Token.
  • Miss Reasoning-Nutzung separat von sichtbarer Antwortlänge.
  • Wiederhole 429-Responses mit exponentieller Backoff und Jitter.
  • Route High-Volume-Routine-Arbeit zu Flash und reserviere Pro für schwierigere Aufgaben.
  • Nutze die aktuellen V4-Modell-IDs; DeepSeeks angekundigte Deprecation für deepseek-chat und deepseek-reasoner war 24. Juli 2026[3].

FAQ

Unterstützt DeepSeek V4 Flash 1M Kontext?

Ja. Beide Flash und Pro haben ein Kontextfenster von 1M und ein maximales Ausgabelimit von 384K[1].

Ist das 1M Kontext nur Input?

Nein. Input und generierte Ausgabe teilen das Modell-Kontextlimit[2].

Kann ich max_tokens auf 384K setzen?

384K ist die Modell-Ausgabedecke, aber die Anfrage muss auch genug Platz im 1M-Kontextfenster übrig haben. Die Einstellung garantiert keine 384K-Antwort.

Zählen Reasoning-Token zur Completion-Nutzung?

Kapazität und Abrechnung sollten sie einplanen. DeepSeek berichtet Reasoning-Token innerhalb von Completion-Nutzungsdetails[2].

Sind Concurrency-Limits pro API-Schlüssel?

Nein. DeepSeek Direct limitiert Concurrency pro Account: 2.500 für Flash und 500 für Pro[6].

Muss ich Prompt-Caching aktivieren?

Nein. Der Kontext-Disk-Cache ist automatisch. Halte gemeinsame Präfixe stabil und prüfe die Cache-Hit-Felder in usage[5].

Weitere Lektüre

References

  1. DeepSeek. Models & Pricing — V4 context, output, features, prices, and concurrency. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/pricing
  2. DeepSeek. Create Chat Completion — max_tokens, context limits, finish reasons, and usage. Retrieved July 30, 2026 from api-docs.deepseek.com/api/create-chat-completion
  3. DeepSeek. DeepSeek-V4 preview release. April 24, 2026. api-docs.deepseek.com/news/news260424
  4. DeepSeek. Thinking Mode — controls, reasoning effort, and reasoning content. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/thinking_mode
  5. DeepSeek. Context Caching — prefix matching and usage fields. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/kv_cache
  6. DeepSeek. Rate Limit & Isolation — account-level concurrency and user_id. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/rate_limit