
DeepSeek V4 Flash 0731 mit Agent- und Codex-Support
DeepSeek V4 Flash 0731 ist live mit besseren Agent-Benchmarks, nativem Responses API Support und Codex-Integration unter der gleichen Model-ID.
DeepSeek V4 Flash 0731 ist nun das offizielle Flash-Modell, das von DeepSeeks API bereitgestellt wird. Das Update vom 31. Juli 2026 ersetzt die April-Preview hinter der bestehenden deepseek-v4-flash Model-ID, fügt nativen Responses API Support hinzu und stimmt das Modell erheblich neu für Code-Agenten und Tool-getriebene Arbeit ab. DeepSeek nennt die Version offiziell, aber der API-Service ist weiterhin als Public Beta gekennzeichnet.[1]
Das ist ein reiner API-Rollout. DeepSeek V4 Pro, die DeepSeek App und Web Chat wurden nicht als Teil des 0731 Releases aktualisiert. Die Architektur hat sich ebenfalls nicht geändert: Flash bleibt ein 284B-Parameter Mixture-of-Experts Modell mit 13B aktiven Parametern und einem Kontextfenster von einer Million Token.[1][2]
TL;DR
- Das offizielle Modell ist
DeepSeek-V4-Flash-0731. Bestehende API-Aufrufe verwenden weiterhindeepseek-v4-flash; eine Model-Namen-Migration ist nicht erforderlich.[1] - Das ist ein Post-Training Upgrade, keine neue Architektur. Gesamtparameter, aktive Parameter und das 1M Kontextfenster bleiben unverändert.[1][2]
- Agent-Performance ist das Schlagwort. DeepSeek meldet 82,7 auf Terminal Bench 2.1, 54,4 auf DeepSWE und 70,3 auf Toolathlon Verified mit seinem unreleased Minimal Harness und maximaler Reasoning Effort.[1]
- Responses API Support ist nativ. Flash kann jetzt Codex ohne den Protokoll-Konversions-Proxy unterstützen, den die Preview benötigte.[3][4]
- Die Kompatibilitätsschicht ist keine vollständige OpenAI-Parität. Die API ist zustandslos, akzeptiert Text statt Bild/Datei-Eingaben und ignoriert oder lehnt mehrere Responses API Felder ab.[3]
- Pro und Consumer Chat wurden nicht verändert. DeepSeek sagt, dass die offizielle V4 Pro Version separat folgt.[1]
Spezifikationen von DeepSeek V4 Flash 0731
| Kategorie | Offizieller Release-Status |
|---|---|
| Release-Datum | 31. Juli 2026 |
| Service-Status | Offizielle API-Version in Public Beta |
| API Model-ID | deepseek-v4-flash |
| Checkpoint-Name | DeepSeek-V4-Flash-0731 |
| Architektur | Mixture of Experts, unverändert von der Preview |
| Parameter | 284B gesamt, 13B aktiviert |
| Kontextfenster | 1M Token |
| Maximale Ausgabe | 384K Token |
| Reasoning-Modi | Non-thinking, Think High, Think Max |
| API-Formate | Chat Completions, Anthropic-kompatibel, Responses API |
| Eingabe im Responses API | Text; Bild- und Dateieingaben werden nicht unterstützt |
| Open Weights | MIT-lizenzierte Model-Gewichte verfügbar |
Die Unterscheidung zwischen Model-ID und Checkpoint-Name ist absichtlich. DeepSeek-V4-Flash-0731 identifiziert die aktualisierten Gewichte, während deepseek-v4-flash der stabile Service-Name ist, den Anwendungen an die API senden.[5] Dies ermöglicht es DeepSeek, das Backend zu aktualisieren, ohne dass jeder Entwickler die Produktionskonfiguration ändern muss.
Was sich von DeepSeek V4 Flash Preview geändert hat

Das 0731 Release ändert mehr das Verhalten und die Integration als die rohe Model-Skalierung.
| Bereich | April Preview | 0731 offizieller Flash |
|---|---|---|
| Architektur | 284B gesamt / 13B aktiv MoE | Unverändert |
| Kontext | 1M Token | Unverändert |
| Model-ID | deepseek-v4-flash | Unverändert |
| Training-Phase | Preview Post-Training | Neu-Post-Training für offizielle Version |
| Agent-Fähigkeit | Starke allgemeine Agent-Basis | Großes Coding-Agent- und Tool-Use Retuning |
| Responses API | Kein nativer Endpoint | Nativer Support |
| Codex-Integration | Benötigte einen Adapter oder andere kompatible Route | Offiziell dokumentierte direkte Konfiguration |
| Rollout-Umfang | Flash und Pro Preview APIs | Nur Flash API |
DeepSeek sagt, dass 0731 "nur neu-post-trainiert wurde."[1] Diese Formulierung ist leicht zu unterschätzen. Für Agent-Modelle steuert Post-Training, ob das Modell effektiv plant, das richtige Tool ruft, das Ergebnis liest, sich von Fehlern erholt und bis zum Taskende fortfährt. Die Architektur setzt die Kapazität; Post-Training bestimmt, wie zuverlässig diese Kapazität in einem funktionierenden Agenten erscheint.
Das Release macht das Modell daher nicht größer. Es macht das bestehende Flash-Modell nützlicher für Repository-Arbeit, Terminal-Tasks, Patch-Generierung, Suche und Multi-Step-Automation.
DeepSeeks neue Agent-Benchmarks – und wie man sie liest
DeepSeek veröffentlichte neun Scores für das offizielle Release:[1]
| Benchmark | DeepSeek V4 Flash 0731 |
|---|---|
| Terminal Bench 2.1 | 82,7 |
| NL2Repo | 54,2 |
| CyberGym | 76,7 |
| DeepSWE | 54,4 |
| Toolathlon Verified | 70,3 |
| Agent Last Exam | 25,2 |
| Automation Bench Public | 25,1 |
| DSBench FullStack | 68,7 |
| DSBench Hard | 59,6 |
Diese Zahlen unterstützen die Behauptung, dass Agent-Arbeit der Fokus des Updates war. Sie etablieren keine universelle Rangliste.
DeepSeek verwendete seinen eigenen "Harness Minimal Mode", den das Unternehmen später veröffentlichen wird, mit maximaler Reasoning Effort, top_p: 0.95 und temperature: 1.0. Zwei der gemeldeten Datensätze – DSBench FullStack und DSBench Hard – sind intern.[1] Bis der Harness und interne Tasks verfügbar sind, können diese Ergebnisse end-to-end nicht unabhängig reproduziert werden.
Für eine Produktionsevaluation, halte denselben Repository-Set, Tool-Permissions, Timeout, Retry Policy, Reasoning Effort und Token Budget über Modelle. Messe abgeschlossene Tasks und akzeptierte Patches, nicht nur ob ein Agent einen plausiblen aussehenden Diff produzierte.
Native Responses API ist die wichtigste Developer-Änderung
DeepSeek V4 Flash akzeptiert jetzt das Responses API Format am Standard DeepSeek Base URL. Das behebt eine signifikante Integrationslücke für Codex und andere Clients, die um /v1/responses statt Chat Completions gebaut sind.[3]
Ein minimaler direkter Aufruf nutzt das OpenAI SDK:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="Review code conservatively and explain every proposed edit.",
input="Find the race condition in this queue worker.",
reasoning={"effort": "high"},
max_output_tokens=8_192,
)
print(response.output_text)Streaming gibt semantische Events wie response.output_text.delta, response.function_call_arguments.delta und response.completed zurück. Im Gegensatz zum vertrauten Chat Completions Stream endet es nicht mit data: [DONE].[3]
Nativer Support wichtig, weil ein Adapter nicht mehr Tool Calls, Reasoning Events und Output Items zwischen zwei Wire Formaten übersetzen muss. Weniger Translation Layers bedeuten weniger Orte, wo Tool-Call-IDs, Streaming State oder Reasoning History kaputtgehen können.
Responses API Kompatibilität hat wichtige Grenzen
"Native Responses API" bedeutet nicht, dass jedes OpenAI Responses Feature funktioniert. DeepSeek dokumentiert die Kompatibilitätsgrenze im Detail.[3]
Unterstützte Features include:
- Text-Eingabe und Developer/System Instructions;
- Streaming;
- Function Tools und serverseitige Web-Suche;
- erforderliche oder spezifische Tool Choice;
- Reasoning Effort;
- strukturierte Text-Formate;
- das
apply_patchCustom Tool für Codex-Kompatibilität.
Wichtige Einschränkungen include:
previous_response_idundconversationwerden nicht unterstützt, so die API ist zustandslos;store, Background Mode, Metadata, Prompt Templates und Service Tiers werden nicht unterstützt;- Bild- und Datei-Input Items werden durch Placeholder Text ersetzt statt verarbeitet;
- MCP, Computer Use, Code Interpreter und File Search Tools werden ignoriert;
parallel_tool_callswird ignoriert, weil paralleles Tool Use immer aktiviert ist;- Anfragen, die das Kontextfenster überschreiten, geben HTTP 400 zurück statt automatisch gekürzt zu werden.
Einige nicht unterstützte Parameter werden stillschweigend ignoriert. Das macht initiale Verbindung einfacher, aber es bedeutet auch, dass eine Anfrage erfolgreich sein kann, ohne alle Controls zu ehren, die deine Anwendung gesendet hat. Integrationstests sollten Verhalten, nicht nur HTTP Status, verifizieren.
Wie man DeepSeek V4 Flash 0731 mit Codex nutzt
DeepSeek veröffentlicht nun einen dedizierten Codex-Konfigurationsleitfaden. Zum 2. August werden nur Flash unterstützt; V4 Pro Support wird separat erwartet.[4]
Die offizielle Einrichtung erstellt einen DeepSeek Provider in ~/.codex/config.toml und einen Model Katalog in ~/.codex/models.json. Die wichtigen Runtime Values sind:
model = "deepseek-v4-flash"
model_provider = "deepseek"
[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"DeepSeeks Katalog gibt Flash ein 1.048.576-Token maximales Kontextfenster, aktiviert parallele Tool Calls und exponiert niedrige, hohe und maximale Reasoning Level.[4] Halte den API Key in einer Umgebungsvariable statt ihn in einer gemeinsamen Konfigurationsdatei zu schreiben.
Für Repository-Arbeit, starte mit high Reasoning. Bewege dich zu max nur für Tasks, die extra Latenz und Output Tokens rechtfertigen, wie eine Cross-Service Migration oder ein kniffliger intermittierender Bug.
Preis und Kontextlimits erhielten kein neues Release Tier
Das aktuelle DeepSeek Direct Preisblatt listet Flash auf:[6]
| Token Kategorie | Preis pro 1M Token |
|---|---|
| Gecachte Eingabe | $0,0028 |
| Ungecachte Eingabe | $0,14 |
| Ausgabe | $0,28 |
Flash behält ein 1M gemeinsames Kontextfenster, ein 384K maximales Output und ein Account-Level Concurrency Limit von 2.500.[6][7] Der niedrige Headline Token Preis macht Maximum-Context Agent Runs nicht frei: Tool Schemas, Repository Dateien, Reasoning Tokens, Retries und lange Outputs tragen alle zur Usage bei.
Für eine detaillierte Erklärung der Context Budgetierung und Cache Verhalten, siehe DeepSeek V4 1M Context: max_tokens, Billing, and Concurrency.
Das sind DeepSeek Direct Rates. reAPI hat seinen eigenen Product Contract und Live Rate Card auf der DeepSeek V4 Model Seite. Kopiere keinen Vendor Preis in einen Gateway Cost Calculator ohne die Route zu prüfen, die du actually nutzt.
DeepSeek V4 Flash durch reAPI aufrufen
Die bestehende reAPI Integration nutzt den gleichen stabilen Model Namen durch einen OpenAI-kompatiblen Chat Completions Endpoint:
curl https://api.reapi.ai/v1/chat/completions \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "Work through the repository methodically. Return a minimal patch."
},
{
"role": "user",
"content": "Trace this authentication failure and identify the smallest safe fix."
}
],
"max_tokens": 8192,
"reasoning_effort": "high"
}'Siehe die DeepSeek V4 API Dokumentation für den aktuellen reAPI Request Contract. Gateway Rollout und Vendor-Direct Rollout sind separate Operational Events, also bestätige die aktive Route und Model Discovery Response wenn eine Anwendung von der exakten 0731 Revision abhängt.
Wer sollte zum offiziellen Flash Release wechseln?
Bestehende DeepSeek Direct API Nutzer müssen Model IDs nicht wechseln; der stabile Flash Name wählt bereits die neueste Version. Sie sollten Evaluationen re-laufen, weil sich Verhalten auch wenn Konfiguration nicht geändert hat, geändert hat.
Das Release ist besonders relevant für:
- Coding-Agent Teams, die Terminal, Search und Patch Tools nutzen;
- Entwickler, die vorher einen Chat Completions-zu-Responses Proxy betrieben;
- High-Volume Workloads, die einen kleineren aktiven Parameter Footprint als V4 Pro brauchen;
- Long-Context Agenten, die von automatischem Prefix Caching profitieren können;
- Codex Nutzer, willens, innerhalb DeepSeeks dokumentierter Kompatibilitätsgrenzen zu arbeiten.
Warte bevor du es als Drop-In Replacement behandelst, wenn dein Workflow Bildverständnis, dauerhafte Responses Conversations, Background Jobs, Code Interpreter, MCP durch die API oder exakte OpenAI Feature Parität benötigt. Diese Features sind abwesend oder gehandhabt außerhalb des Model Endpoints heute.[3]
Production Migration Checklist
- Halte
deepseek-v4-flash; erfinde keinedeepseek-v4-flash-0731API ID, es sei denn ein Provider exponiert es explizit. - Re-laufe Agent Evaluationen weil sich Backend Verhalten unter dem stabilen Namen geändert hat.
- Pinne den Harness, Tool Definitionen, Reasoning Effort, Token Budget und Timeout wenn du Ergebnisse vergleichst.
- Teste jedes Responses API Field, das deine Anwendung benötigt; mehrere nicht unterstützte Fields werden stillschweigend ignoriert.
- Bewahre Conversation History Client-Side weil
previous_response_idnicht unterstützt wird. - Lehne oder Pre-Prozessiere Bild- und Datei-Eingaben statt anzunehmen das Modell kann sie inspizieren.
- Verfolge gecachte und ungecachte Eingabe separat in Cost Telemetrie.
- Rollout hinter einen Feature Flag und halte die bisherige Production Route verfügbar bis Acceptance Tests passen.
Häufig gestellte Fragen
Ist DeepSeek V4 Flash 0731 die offizielle Version?
Ja. DeepSeek nennt es das offizielle V4 Flash Release, bedient durch eine API Public Beta ab 31. Juli 2026.[1] "Official Release" beschreibt die Model Revision; "Public Beta" beschreibt die aktuelle Service Stage.
Muss ich den API Model Namen ändern?
Nein. DeepSeek Direct nutzt weiterhin deepseek-v4-flash, das jetzt zu DeepSeek-V4-Flash-0731 routet.[5]
Ist DeepSeek V4 Flash 0731 ein größeres Modell?
Nein. Es behält die Preview Architektur und Größe: 284B totale Parameter und 13B aktiviert. Das Update kommt von zusätzlichem Post-Training.[1]
Unterstützt das offizielle Flash Release die Responses API?
Ja. DeepSeek bietet eine native Responses API Oberfläche für Flash und dokumentiert direkte Codex Integration.[3][4]
Kann DeepSeek V4 Flash Bilder durch Responses API verarbeiten?
Nein. Die offizielle Kompatibilitätstabelle sagt Bild- und Datei-Input Teile werden durch Placeholder Text ersetzt. Behandle den Endpoint als Text Eingabe.[3]
Wurde DeepSeek V4 Pro auch aktualisiert?
Nein. DeepSeek sagt das 0731 Update gilt nur der Flash API. Die Pro API und App/Web Models waren unverändert, mit dem offiziellen Pro Release geplant separat.[1]
Was dieser Release wirklich bedeutet
Das DeepSeek V4 Flash offizielle Release ist ein fokussiertes Agent Upgrade. Es behält die effiziente Flash Architektur und stabilen API Namen, ändert dann den Teil, den Entwickler am meisten fühlen: Tool Use, Terminal Arbeit, Coding Verhalten und Integration mit Responses-basierten Clients.
Die praktische Headline ist nicht bloß dass Benchmark Zahlen stiegen. deepseek-v4-flash kann sich jetzt direkt durch ein dokumentiertes natives Protokoll in Codex stecken. Teams sollten immer noch die Kompatibilitätslücken testen, Performance auf ihren eigenen Repositories reproduzieren und denken dass der Service in Public Beta ist. Das ist ein substanzielles Release, aber es ist noch nicht der vollständige DeepSeek V4 Product-Line Rollout.
References
- DeepSeek. Change Log — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/updates
- DeepSeek. DeepSeek-V4-Flash model card — architecture, parameters, context, reasoning modes, and license. Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
- DeepSeek. Using the Responses API — supported fields, tools, streaming, and compatibility limits. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/responses_api
- DeepSeek. Integrate with Codex — official provider and model configuration. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/agent_integrations/codex
- DeepSeek. Your First API Call —
deepseek-v4-flashnow routes to the 0731 model. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/function_calling - DeepSeek. Models & Pricing — Flash token rates, context, maximum output, and features. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/pricing
- DeepSeek. Rate Limit & Isolation — account-level Flash concurrency. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/rate_limit
Further reading
- reAPI. DeepSeek V4 model page and live gateway pricing. reapi.ai/models/deepseek-v4
- reAPI. DeepSeek V4 API reference. reapi.ai/docs/deepseek-v4
- reAPI. MiniMax M3 API: 1M Context, Pricing, and Coding Guide. reapi.ai/blog/minimax-m3-api-guide
Autor

Kategorien
Weitere Beiträge

Kimi K3: Komplettguide zu Moonshots 2.8T-Flaggschiff
Kimi K3 erklärt: Architektur, Preise und API-Verhalten mit 1M Kontext, ständigem Reasoning, festem Sampling und OpenAI-kompatibler API.


DeepSeek V4: Kontext, max_tokens und Concurrency erklärt
DeepSeek V4 teilt sein 1M-Kontextfenster zwischen Input und Output mit 384K Maximum. Lerne max_tokens, Cache-Abrechnung und Concurrency kennen.


KI-Bildgenerierung für Spiele: Kosten durch Caching senken
Cache-First-Pipeline für Spielbilder mit semantischen Keys, Single-Flight-Anfragen, asynchronem Polling, Budget-Caps und praktischer Kostenrechnung.
