Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
DeepSeek V4 Flash 0731 mit Agent- und Codex-Support
2026/08/02

DeepSeek V4 Flash 0731 mit Agent- und Codex-Support

DeepSeek V4 Flash 0731 ist live mit besseren Agent-Benchmarks, nativem Responses API Support und Codex-Integration unter der gleichen Model-ID.

DeepSeek V4 Flash 0731 ist nun das offizielle Flash-Modell, das von DeepSeeks API bereitgestellt wird. Das Update vom 31. Juli 2026 ersetzt die April-Preview hinter der bestehenden deepseek-v4-flash Model-ID, fügt nativen Responses API Support hinzu und stimmt das Modell erheblich neu für Code-Agenten und Tool-getriebene Arbeit ab. DeepSeek nennt die Version offiziell, aber der API-Service ist weiterhin als Public Beta gekennzeichnet.[1]

Das ist ein reiner API-Rollout. DeepSeek V4 Pro, die DeepSeek App und Web Chat wurden nicht als Teil des 0731 Releases aktualisiert. Die Architektur hat sich ebenfalls nicht geändert: Flash bleibt ein 284B-Parameter Mixture-of-Experts Modell mit 13B aktiven Parametern und einem Kontextfenster von einer Million Token.[1][2]

TL;DR

  • Das offizielle Modell ist DeepSeek-V4-Flash-0731. Bestehende API-Aufrufe verwenden weiterhin deepseek-v4-flash; eine Model-Namen-Migration ist nicht erforderlich.[1]
  • Das ist ein Post-Training Upgrade, keine neue Architektur. Gesamtparameter, aktive Parameter und das 1M Kontextfenster bleiben unverändert.[1][2]
  • Agent-Performance ist das Schlagwort. DeepSeek meldet 82,7 auf Terminal Bench 2.1, 54,4 auf DeepSWE und 70,3 auf Toolathlon Verified mit seinem unreleased Minimal Harness und maximaler Reasoning Effort.[1]
  • Responses API Support ist nativ. Flash kann jetzt Codex ohne den Protokoll-Konversions-Proxy unterstützen, den die Preview benötigte.[3][4]
  • Die Kompatibilitätsschicht ist keine vollständige OpenAI-Parität. Die API ist zustandslos, akzeptiert Text statt Bild/Datei-Eingaben und ignoriert oder lehnt mehrere Responses API Felder ab.[3]
  • Pro und Consumer Chat wurden nicht verändert. DeepSeek sagt, dass die offizielle V4 Pro Version separat folgt.[1]

Spezifikationen von DeepSeek V4 Flash 0731

KategorieOffizieller Release-Status
Release-Datum31. Juli 2026
Service-StatusOffizielle API-Version in Public Beta
API Model-IDdeepseek-v4-flash
Checkpoint-NameDeepSeek-V4-Flash-0731
ArchitekturMixture of Experts, unverändert von der Preview
Parameter284B gesamt, 13B aktiviert
Kontextfenster1M Token
Maximale Ausgabe384K Token
Reasoning-ModiNon-thinking, Think High, Think Max
API-FormateChat Completions, Anthropic-kompatibel, Responses API
Eingabe im Responses APIText; Bild- und Dateieingaben werden nicht unterstützt
Open WeightsMIT-lizenzierte Model-Gewichte verfügbar

Die Unterscheidung zwischen Model-ID und Checkpoint-Name ist absichtlich. DeepSeek-V4-Flash-0731 identifiziert die aktualisierten Gewichte, während deepseek-v4-flash der stabile Service-Name ist, den Anwendungen an die API senden.[5] Dies ermöglicht es DeepSeek, das Backend zu aktualisieren, ohne dass jeder Entwickler die Produktionskonfiguration ändern muss.

Was sich von DeepSeek V4 Flash Preview geändert hat

DeepSeek V4 Flash 0731 Upgrade-Karte mit unveränderter Architektur, neuem Post-Training, verstärktem Agent-Verhalten und nativem Responses API Support

Das 0731 Release ändert mehr das Verhalten und die Integration als die rohe Model-Skalierung.

BereichApril Preview0731 offizieller Flash
Architektur284B gesamt / 13B aktiv MoEUnverändert
Kontext1M TokenUnverändert
Model-IDdeepseek-v4-flashUnverändert
Training-PhasePreview Post-TrainingNeu-Post-Training für offizielle Version
Agent-FähigkeitStarke allgemeine Agent-BasisGroßes Coding-Agent- und Tool-Use Retuning
Responses APIKein nativer EndpointNativer Support
Codex-IntegrationBenötigte einen Adapter oder andere kompatible RouteOffiziell dokumentierte direkte Konfiguration
Rollout-UmfangFlash und Pro Preview APIsNur Flash API

DeepSeek sagt, dass 0731 "nur neu-post-trainiert wurde."[1] Diese Formulierung ist leicht zu unterschätzen. Für Agent-Modelle steuert Post-Training, ob das Modell effektiv plant, das richtige Tool ruft, das Ergebnis liest, sich von Fehlern erholt und bis zum Taskende fortfährt. Die Architektur setzt die Kapazität; Post-Training bestimmt, wie zuverlässig diese Kapazität in einem funktionierenden Agenten erscheint.

Das Release macht das Modell daher nicht größer. Es macht das bestehende Flash-Modell nützlicher für Repository-Arbeit, Terminal-Tasks, Patch-Generierung, Suche und Multi-Step-Automation.

DeepSeeks neue Agent-Benchmarks – und wie man sie liest

DeepSeek veröffentlichte neun Scores für das offizielle Release:[1]

BenchmarkDeepSeek V4 Flash 0731
Terminal Bench 2.182,7
NL2Repo54,2
CyberGym76,7
DeepSWE54,4
Toolathlon Verified70,3
Agent Last Exam25,2
Automation Bench Public25,1
DSBench FullStack68,7
DSBench Hard59,6

Diese Zahlen unterstützen die Behauptung, dass Agent-Arbeit der Fokus des Updates war. Sie etablieren keine universelle Rangliste.

DeepSeek verwendete seinen eigenen "Harness Minimal Mode", den das Unternehmen später veröffentlichen wird, mit maximaler Reasoning Effort, top_p: 0.95 und temperature: 1.0. Zwei der gemeldeten Datensätze – DSBench FullStack und DSBench Hard – sind intern.[1] Bis der Harness und interne Tasks verfügbar sind, können diese Ergebnisse end-to-end nicht unabhängig reproduziert werden.

Für eine Produktionsevaluation, halte denselben Repository-Set, Tool-Permissions, Timeout, Retry Policy, Reasoning Effort und Token Budget über Modelle. Messe abgeschlossene Tasks und akzeptierte Patches, nicht nur ob ein Agent einen plausiblen aussehenden Diff produzierte.

Native Responses API ist die wichtigste Developer-Änderung

DeepSeek V4 Flash akzeptiert jetzt das Responses API Format am Standard DeepSeek Base URL. Das behebt eine signifikante Integrationslücke für Codex und andere Clients, die um /v1/responses statt Chat Completions gebaut sind.[3]

Ein minimaler direkter Aufruf nutzt das OpenAI SDK:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="Review code conservatively and explain every proposed edit.",
    input="Find the race condition in this queue worker.",
    reasoning={"effort": "high"},
    max_output_tokens=8_192,
)

print(response.output_text)

Streaming gibt semantische Events wie response.output_text.delta, response.function_call_arguments.delta und response.completed zurück. Im Gegensatz zum vertrauten Chat Completions Stream endet es nicht mit data: [DONE].[3]

Nativer Support wichtig, weil ein Adapter nicht mehr Tool Calls, Reasoning Events und Output Items zwischen zwei Wire Formaten übersetzen muss. Weniger Translation Layers bedeuten weniger Orte, wo Tool-Call-IDs, Streaming State oder Reasoning History kaputtgehen können.

Responses API Kompatibilität hat wichtige Grenzen

"Native Responses API" bedeutet nicht, dass jedes OpenAI Responses Feature funktioniert. DeepSeek dokumentiert die Kompatibilitätsgrenze im Detail.[3]

Unterstützte Features include:

  • Text-Eingabe und Developer/System Instructions;
  • Streaming;
  • Function Tools und serverseitige Web-Suche;
  • erforderliche oder spezifische Tool Choice;
  • Reasoning Effort;
  • strukturierte Text-Formate;
  • das apply_patch Custom Tool für Codex-Kompatibilität.

Wichtige Einschränkungen include:

  • previous_response_id und conversation werden nicht unterstützt, so die API ist zustandslos;
  • store, Background Mode, Metadata, Prompt Templates und Service Tiers werden nicht unterstützt;
  • Bild- und Datei-Input Items werden durch Placeholder Text ersetzt statt verarbeitet;
  • MCP, Computer Use, Code Interpreter und File Search Tools werden ignoriert;
  • parallel_tool_calls wird ignoriert, weil paralleles Tool Use immer aktiviert ist;
  • Anfragen, die das Kontextfenster überschreiten, geben HTTP 400 zurück statt automatisch gekürzt zu werden.

Einige nicht unterstützte Parameter werden stillschweigend ignoriert. Das macht initiale Verbindung einfacher, aber es bedeutet auch, dass eine Anfrage erfolgreich sein kann, ohne alle Controls zu ehren, die deine Anwendung gesendet hat. Integrationstests sollten Verhalten, nicht nur HTTP Status, verifizieren.

Wie man DeepSeek V4 Flash 0731 mit Codex nutzt

DeepSeek veröffentlicht nun einen dedizierten Codex-Konfigurationsleitfaden. Zum 2. August werden nur Flash unterstützt; V4 Pro Support wird separat erwartet.[4]

Die offizielle Einrichtung erstellt einen DeepSeek Provider in ~/.codex/config.toml und einen Model Katalog in ~/.codex/models.json. Die wichtigen Runtime Values sind:

model = "deepseek-v4-flash"
model_provider = "deepseek"

[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"

DeepSeeks Katalog gibt Flash ein 1.048.576-Token maximales Kontextfenster, aktiviert parallele Tool Calls und exponiert niedrige, hohe und maximale Reasoning Level.[4] Halte den API Key in einer Umgebungsvariable statt ihn in einer gemeinsamen Konfigurationsdatei zu schreiben.

Für Repository-Arbeit, starte mit high Reasoning. Bewege dich zu max nur für Tasks, die extra Latenz und Output Tokens rechtfertigen, wie eine Cross-Service Migration oder ein kniffliger intermittierender Bug.

Preis und Kontextlimits erhielten kein neues Release Tier

Das aktuelle DeepSeek Direct Preisblatt listet Flash auf:[6]

Token KategoriePreis pro 1M Token
Gecachte Eingabe$0,0028
Ungecachte Eingabe$0,14
Ausgabe$0,28

Flash behält ein 1M gemeinsames Kontextfenster, ein 384K maximales Output und ein Account-Level Concurrency Limit von 2.500.[6][7] Der niedrige Headline Token Preis macht Maximum-Context Agent Runs nicht frei: Tool Schemas, Repository Dateien, Reasoning Tokens, Retries und lange Outputs tragen alle zur Usage bei.

Für eine detaillierte Erklärung der Context Budgetierung und Cache Verhalten, siehe DeepSeek V4 1M Context: max_tokens, Billing, and Concurrency.

Das sind DeepSeek Direct Rates. reAPI hat seinen eigenen Product Contract und Live Rate Card auf der DeepSeek V4 Model Seite. Kopiere keinen Vendor Preis in einen Gateway Cost Calculator ohne die Route zu prüfen, die du actually nutzt.

DeepSeek V4 Flash durch reAPI aufrufen

Die bestehende reAPI Integration nutzt den gleichen stabilen Model Namen durch einen OpenAI-kompatiblen Chat Completions Endpoint:

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "Work through the repository methodically. Return a minimal patch."
      },
      {
        "role": "user",
        "content": "Trace this authentication failure and identify the smallest safe fix."
      }
    ],
    "max_tokens": 8192,
    "reasoning_effort": "high"
  }'

Siehe die DeepSeek V4 API Dokumentation für den aktuellen reAPI Request Contract. Gateway Rollout und Vendor-Direct Rollout sind separate Operational Events, also bestätige die aktive Route und Model Discovery Response wenn eine Anwendung von der exakten 0731 Revision abhängt.

Wer sollte zum offiziellen Flash Release wechseln?

Bestehende DeepSeek Direct API Nutzer müssen Model IDs nicht wechseln; der stabile Flash Name wählt bereits die neueste Version. Sie sollten Evaluationen re-laufen, weil sich Verhalten auch wenn Konfiguration nicht geändert hat, geändert hat.

Das Release ist besonders relevant für:

  • Coding-Agent Teams, die Terminal, Search und Patch Tools nutzen;
  • Entwickler, die vorher einen Chat Completions-zu-Responses Proxy betrieben;
  • High-Volume Workloads, die einen kleineren aktiven Parameter Footprint als V4 Pro brauchen;
  • Long-Context Agenten, die von automatischem Prefix Caching profitieren können;
  • Codex Nutzer, willens, innerhalb DeepSeeks dokumentierter Kompatibilitätsgrenzen zu arbeiten.

Warte bevor du es als Drop-In Replacement behandelst, wenn dein Workflow Bildverständnis, dauerhafte Responses Conversations, Background Jobs, Code Interpreter, MCP durch die API oder exakte OpenAI Feature Parität benötigt. Diese Features sind abwesend oder gehandhabt außerhalb des Model Endpoints heute.[3]

Production Migration Checklist

  1. Halte deepseek-v4-flash; erfinde keine deepseek-v4-flash-0731 API ID, es sei denn ein Provider exponiert es explizit.
  2. Re-laufe Agent Evaluationen weil sich Backend Verhalten unter dem stabilen Namen geändert hat.
  3. Pinne den Harness, Tool Definitionen, Reasoning Effort, Token Budget und Timeout wenn du Ergebnisse vergleichst.
  4. Teste jedes Responses API Field, das deine Anwendung benötigt; mehrere nicht unterstützte Fields werden stillschweigend ignoriert.
  5. Bewahre Conversation History Client-Side weil previous_response_id nicht unterstützt wird.
  6. Lehne oder Pre-Prozessiere Bild- und Datei-Eingaben statt anzunehmen das Modell kann sie inspizieren.
  7. Verfolge gecachte und ungecachte Eingabe separat in Cost Telemetrie.
  8. Rollout hinter einen Feature Flag und halte die bisherige Production Route verfügbar bis Acceptance Tests passen.

Häufig gestellte Fragen

Ist DeepSeek V4 Flash 0731 die offizielle Version?

Ja. DeepSeek nennt es das offizielle V4 Flash Release, bedient durch eine API Public Beta ab 31. Juli 2026.[1] "Official Release" beschreibt die Model Revision; "Public Beta" beschreibt die aktuelle Service Stage.

Muss ich den API Model Namen ändern?

Nein. DeepSeek Direct nutzt weiterhin deepseek-v4-flash, das jetzt zu DeepSeek-V4-Flash-0731 routet.[5]

Ist DeepSeek V4 Flash 0731 ein größeres Modell?

Nein. Es behält die Preview Architektur und Größe: 284B totale Parameter und 13B aktiviert. Das Update kommt von zusätzlichem Post-Training.[1]

Unterstützt das offizielle Flash Release die Responses API?

Ja. DeepSeek bietet eine native Responses API Oberfläche für Flash und dokumentiert direkte Codex Integration.[3][4]

Kann DeepSeek V4 Flash Bilder durch Responses API verarbeiten?

Nein. Die offizielle Kompatibilitätstabelle sagt Bild- und Datei-Input Teile werden durch Placeholder Text ersetzt. Behandle den Endpoint als Text Eingabe.[3]

Wurde DeepSeek V4 Pro auch aktualisiert?

Nein. DeepSeek sagt das 0731 Update gilt nur der Flash API. Die Pro API und App/Web Models waren unverändert, mit dem offiziellen Pro Release geplant separat.[1]

Was dieser Release wirklich bedeutet

Das DeepSeek V4 Flash offizielle Release ist ein fokussiertes Agent Upgrade. Es behält die effiziente Flash Architektur und stabilen API Namen, ändert dann den Teil, den Entwickler am meisten fühlen: Tool Use, Terminal Arbeit, Coding Verhalten und Integration mit Responses-basierten Clients.

Die praktische Headline ist nicht bloß dass Benchmark Zahlen stiegen. deepseek-v4-flash kann sich jetzt direkt durch ein dokumentiertes natives Protokoll in Codex stecken. Teams sollten immer noch die Kompatibilitätslücken testen, Performance auf ihren eigenen Repositories reproduzieren und denken dass der Service in Public Beta ist. Das ist ein substanzielles Release, aber es ist noch nicht der vollständige DeepSeek V4 Product-Line Rollout.

References

  1. DeepSeek. Change Log — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/updates
  2. DeepSeek. DeepSeek-V4-Flash model card — architecture, parameters, context, reasoning modes, and license. Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
  3. DeepSeek. Using the Responses API — supported fields, tools, streaming, and compatibility limits. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/responses_api
  4. DeepSeek. Integrate with Codex — official provider and model configuration. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/agent_integrations/codex
  5. DeepSeek. Your First API Call — deepseek-v4-flash now routes to the 0731 model. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/function_calling
  6. DeepSeek. Models & Pricing — Flash token rates, context, maximum output, and features. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/pricing
  7. DeepSeek. Rate Limit & Isolation — account-level Flash concurrency. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/rate_limit

Further reading