Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
DeepSeek V4 Flash 0731 : version officielle avec Responses API
2026/08/02

DeepSeek V4 Flash 0731 : version officielle avec Responses API

DeepSeek V4 Flash 0731 en bêta publique avec benchmarks d'agent renforcés, support natif Responses API, intégration Codex et le même identifiant de modèle.

DeepSeek V4 Flash 0731 est désormais le modèle Flash officiel servi par l'API DeepSeek. La mise à jour du 31 juillet 2026 remplace l'aperçu d'avril derrière l'identifiant de modèle existant deepseek-v4-flash, ajoute le support natif de Responses API et retune substantiellement le modèle pour les agents de codage et le travail piloté par outils. DeepSeek qualifie la version de officielle, mais le service API reste étiqueté bêta publique.[1]

Il s'agit d'un déploiement réservé à l'API. DeepSeek V4 Pro, l'application DeepSeek et le chat web n'ont pas été mis à jour dans le cadre de la version 0731. L'architecture n'a pas changé non plus : Flash reste un modèle de mélange d'experts à 284 milliards de paramètres avec 13 milliards de paramètres actifs et une fenêtre de contexte d'un million de tokens.[1][2]

TL;DR

  • Le modèle officiel est DeepSeek-V4-Flash-0731. Les appels API existants continuent d'utiliser deepseek-v4-flash ; aucune migration de nom de modèle n'est requise.[1]
  • C'est une mise à jour post-entraînement, pas une nouvelle architecture. Le nombre total de paramètres, les paramètres actifs et la fenêtre de contexte de 1 M restent inchangés.[1][2]
  • Les performances des agents sont le gros titre. DeepSeek rapporte 82,7 sur Terminal Bench 2.1, 54,4 sur DeepSWE et 70,3 sur Toolathlon Verified, en utilisant son harness minimal non publié et le maximum d'effort de raisonnement.[1]
  • Le support de Responses API est natif. Flash peut désormais alimenter Codex sans le proxy de conversion de protocole que l'aperçu exigeait.[3][4]
  • La couche de compatibilité n'offre pas la parité complète d'OpenAI. L'API est sans état, accepte le texte plutôt que les entrées image/fichier et ignore ou rejette plusieurs champs Responses API.[3]
  • Le chat Pro et consommateur n'a pas changé. DeepSeek indique que la version officielle V4 Pro suivra séparément.[1]

Spécifications de DeepSeek V4 Flash 0731

ÉlémentÉtat de la version officielle
Date de sortie31 juillet 2026
État du serviceVersion officielle de l'API en bêta publique
ID du modèle APIdeepseek-v4-flash
Nom du checkpointDeepSeek-V4-Flash-0731
ArchitectureMélange d'experts, inchangée par rapport à l'aperçu
Paramètres284 milliards au total, 13 milliards activés
Fenêtre de contexte1 million de tokens
Sortie maximale384 K tokens
Modes de raisonnementNon-pensant, Think High, Think Max
Formats APIChat Completions, compatible Anthropic, Responses API
Entrée sur Responses APITexte ; les entrées d'image et de fichier ne sont pas prises en charge
Poids ouvertsPoids de modèle disponibles sous licence MIT

La distinction entre l'ID du modèle et le nom du checkpoint est intentionnelle. DeepSeek-V4-Flash-0731 identifie les poids mis à jour, tandis que deepseek-v4-flash est le nom de service stable que les applications envoient à l'API.[5] Cela permet à DeepSeek de mettre à jour le backend sans forcer chaque développeur à modifier la configuration de production.

Ce qui a changé par rapport à DeepSeek V4 Flash Preview

Carte de mise à niveau DeepSeek V4 Flash 0731 montrant l'architecture inchangée, la post-formation nouvelle, le comportement d'agent plus fort et le support Responses API natif

La version 0731 change le comportement et l'intégration plus que l'échelle brute du modèle.

ZoneAperçu d'avrilFlash officiel 0731
Architecture284 milliards au total / 13 milliards de MoE actifInchangée
Contexte1 million de tokensInchangée
ID du modèledeepseek-v4-flashInchangée
Étape d'entraînementPost-entraînement d'aperçuRe-post-entraîné pour la version officielle
Capacité d'agentRéférence d'agent général fortRetune majeure de l'agent de codage et de l'utilisation d'outils
Responses APIPas de point de terminaison natifSupport natif
Intégration CodexNécessitait un adaptateur ou un autre itinéraire compatibleConfiguration directe officially documented
Portée du déploiementAPI Flash et Pro previewAPI Flash uniquement

DeepSeek dit que 0731 "était seulement re-post-entraîné."[1] Cette phrase est facile à minimiser. Pour les modèles d'agent, le post-entraînement contrôle si le modèle planifie efficacement, appelle le bon outil, lit le résultat, se remet d'un échec et continue jusqu'à ce que la tâche soit terminée. L'architecture établit la capacité ; le post-entraînement détermine la fiabilité avec laquelle cette capacité apparaît dans un agent de travail.

La version ne rend donc pas le modèle plus grand. Elle rend le modèle Flash existant plus utile pour le travail de repository, les tâches terminales, la génération de patchs, la recherche et l'automatisation multi-étapes.

Les nouveaux benchmarks d'agent de DeepSeek — et comment les interpréter

DeepSeek a publié neuf scores pour la version officielle :[1]

BenchmarkDeepSeek V4 Flash 0731
Terminal Bench 2.182,7
NL2Repo54,2
CyberGym76,7
DeepSWE54,4
Toolathlon Verified70,3
Agent Last Exam25,2
Automation Bench Public25,1
DSBench FullStack68,7
DSBench Hard59,6

Ces chiffres soutiennent l'affirmation que le travail d'agent était le foyer de la mise à jour. Ils n'établissent pas un classement universel.

DeepSeek a utilisé son propre « mode harness minimal », que l'entreprise dit être publié ultérieurement, avec un effort de raisonnement maximal, top_p: 0.95 et temperature: 1.0. Deux des ensembles de données rapportés — DSBench FullStack et DSBench Hard — sont internes.[1] Jusqu'à ce que le harness et les tâches internes soient disponibles, ces résultats ne peuvent pas être indépendamment reproduits de bout en bout.

Pour une évaluation de production, gardez le même ensemble de repository, permissions d'outils, délai d'expiration, politique de nouvelle tentative, effort de raisonnement et budget de tokens dans tous les modèles. Mesurez les tâches terminées et les patches acceptés, pas seulement si un agent a produit un diff plausible.

Responses API natif est le changement de développeur le plus important

DeepSeek V4 Flash accepte désormais le format Responses API à l'URL de base DeepSeek standard. Cela supprime un écart d'intégration significatif pour Codex et d'autres clients construits autour de /v1/responses plutôt que Chat Completions.[3]

Un appel direct minimal utilise le SDK OpenAI :

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="Review code conservatively and explain every proposed edit.",
    input="Find the race condition in this queue worker.",
    reasoning={"effort": "high"},
    max_output_tokens=8_192,
)

print(response.output_text)

Le streaming retourne des événements sémantiques tels que response.output_text.delta, response.function_call_arguments.delta et response.completed. Contrairement au flux Chat Completions familier, il ne se termine pas par data: [DONE].[3]

Le support natif est important car un adaptateur ne doit plus traduire les appels d'outils, les événements de raisonnement et les éléments de sortie entre deux formats de fil. Moins de couches de traduction signifie moins d'endroits où les ID d'appels d'outils, l'état de streaming ou l'historique de raisonnement peuvent se casser.

La compatibilité de Responses API a des limites importantes

« Responses API native » ne signifie pas que toutes les fonctionnalités Responses d'OpenAI fonctionnent. DeepSeek documente la limite de compatibilité en détail.[3]

Les fonctionnalités prises en charge incluent :

  • entrée de texte et instructions développeur/système ;
  • streaming ;
  • outils de fonction et recherche web côté serveur ;
  • choix d'outil obligatoire ou spécifique ;
  • effort de raisonnement ;
  • formats de texte structurés ;
  • l'outil personnalisé apply_patch utilisé pour la compatibilité Codex.

Les limitations importantes incluent :

  • previous_response_id et conversation ne sont pas prises en charge, donc l'API est sans état ;
  • store, le mode arrière-plan, les métadonnées, les modèles d'invite et les niveaux de service ne sont pas pris en charge ;
  • les éléments d'entrée d'image et de fichier sont remplacés par du texte d'espace réservé plutôt que traités ;
  • MCP, l'utilisation d'ordinateur, l'interpréteur de code et les outils de recherche de fichiers sont ignorés ;
  • parallel_tool_calls est ignoré car l'utilisation parallèle d'outils est toujours activée ;
  • les demandes qui dépassent la fenêtre de contexte retournent HTTP 400 au lieu d'être tronquées automatiquement.

Certains paramètres non pris en charge sont silencieusement ignorés. Cela facilite la connexion initiale, mais cela signifie également qu'une demande peut revenir avec succès sans honorer chaque contrôle que votre application a envoyé. Les tests d'intégration doivent vérifier le comportement, pas seulement le statut HTTP.

Comment utiliser DeepSeek V4 Flash 0731 avec Codex

DeepSeek publie désormais un guide de configuration Codex dédié. Au 2 août, seul Flash est pris en charge ; le support V4 Pro est attendu séparément.[4]

La configuration officielle crée un fournisseur DeepSeek dans ~/.codex/config.toml et un catalogue de modèles dans ~/.codex/models.json. Les valeurs d'exécution importantes sont :

model = "deepseek-v4-flash"
model_provider = "deepseek"

[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"

Le catalogue de DeepSeek donne à Flash un contexte maximum de 1 048 576 tokens, active les appels d'outils parallèles et expose les niveaux de raisonnement faible, élevé et maximal.[4] Conservez la clé API dans une variable d'environnement plutôt que de l'écrire dans un fichier de configuration partagé.

Pour le travail de repository, commencez avec un raisonnement high. Passez à max uniquement pour les tâches qui justifient une latence et des tokens de sortie supplémentaires, tels qu'une migration multi-service ou un bug intermittent difficile.

Les tarifs et les limites de contexte n'ont pas reçu un nouveau niveau de version

La feuille de prix DeepSeek Direct actuelle répertorie Flash à :[6]

Catégorie de tokenPrix pour 1 million de tokens
Entrée mise en cache0,0028 $
Entrée non mise en cache0,14 $
Sortie0,28 $

Flash conserve une fenêtre de contexte partagée de 1 M, une sortie maximale de 384 K et une limite de concurrence au niveau du compte de 2 500.[6][7] Le prix bas du token du titre n'entraîne pas l'exécution d'agents à contexte maximum gratuit : les schémas d'outils, les fichiers de repository, les tokens de raisonnement, les tentatives et les longs résultats contribuent tous à l'utilisation.

Pour une explication détaillée du budget de contexte et du comportement du cache, voir DeepSeek V4 1M Context: max_tokens, Billing, and Concurrency.

Ce sont les tarifs DeepSeek Direct. reAPI a son propre contrat de produit et sa carte de tarifs actuelle sur la page du modèle DeepSeek V4. Ne copiez pas un prix de fournisseur dans une calculatrice de coûts de gateway sans vérifier l'itinéraire que vous utilisez réellement.

Appel de DeepSeek V4 Flash via reAPI

L'intégration reAPI existante utilise le même nom de modèle stable via un point de terminaison Chat Completions compatible OpenAI :

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "Work through the repository methodically. Return a minimal patch."
      },
      {
        "role": "user",
        "content": "Trace this authentication failure and identify the smallest safe fix."
      }
    ],
    "max_tokens": 8192,
    "reasoning_effort": "high"
  }'

Voir la documentation de l'API DeepSeek V4 pour le contrat de demande reAPI actuel. Le déploiement de gateway et le déploiement direct du fournisseur sont des événements opérationnels séparés, donc confirmez l'itinéraire actif et la réponse de découverte de modèle quand une application dépend de la révision exacte 0731.

Qui devrait passer à la version officielle Flash ?

Les utilisateurs directs de l'API DeepSeek existants n'ont pas besoin de changer les ID de modèle ; le nom Flash stable sélectionne déjà la dernière version. Ils doivent réexécuter les évaluations car le comportement a changé même si la configuration n'a pas.

La version est particulièrement pertinente pour :

  • les équipes d'agent de codage utilisant les outils de terminal, de recherche et de patch ;
  • les développeurs qui maintenaient auparavant un proxy Chat Completions-to-Responses ;
  • les charges de travail à haut volume qui ont besoin d'une empreinte de paramètres actifs plus petite que V4 Pro ;
  • les agents de contexte long qui peuvent bénéficier de la mise en cache automatique du préfixe ;
  • les utilisateurs de Codex disposés à opérer dans les limites de compatibilité documentées de DeepSeek.

Attendez avant de le traiter comme un remplacement direct quand votre flux de travail nécessite la compréhension d'images, des conversations Responses durables, des travaux d'arrière-plan, l'interpréteur de code, MCP via l'API ou la parité exacte des fonctionnalités OpenAI. Ces fonctionnalités sont absentes ou traitées en dehors du point de terminaison du modèle aujourd'hui.[3]

Liste de vérification de migration de production

  1. Conservez deepseek-v4-flash ; n'inventez pas d'ID API deepseek-v4-flash-0731 sauf si un fournisseur l'expose explicitement.
  2. Réexécutez les évaluations d'agent car le comportement du backend a changé sous le nom stable.
  3. Épinglez le harness, les définitions d'outils, l'effort de raisonnement, le budget de tokens et le délai d'expiration lors de la comparaison des résultats.
  4. Testez tous les champs Responses API dont dépend votre application ; plusieurs champs non pris en charge sont silencieusement ignorés.
  5. Conservez l'historique des conversations côté client car previous_response_id n'est pas pris en charge.
  6. Rejetez ou pré-traitez les entrées d'image et de fichier plutôt que de supposer que le modèle peut les inspecter.
  7. Suivez séparément l'entrée mise en cache et non mise en cache dans la télémétrie des coûts.
  8. Déployer derrière un indicateur de fonctionnalité et conserver l'itinéraire de production précédent disponible jusqu'à ce que les tests d'acceptation réussissent.

Questions fréquemment posées

DeepSeek V4 Flash 0731 est-il la version officielle ?

Oui. DeepSeek l'appelle la version officielle V4 Flash, servie via une API bêta publique à partir du 31 juillet 2026.[1] « Version officielle » décrit la révision du modèle ; « bêta publique » décrit l'étape actuelle du service.

Dois-je changer le nom du modèle API ?

Non. DeepSeek Direct continue à utiliser deepseek-v4-flash, qui achemine maintenant vers DeepSeek-V4-Flash-0731.[5]

DeepSeek V4 Flash 0731 est-il un modèle plus grand ?

Non. Il conserve l'architecture et la taille de l'aperçu : 284 milliards de paramètres au total et 13 milliards activés. La mise à jour provient d'un post-entraînement supplémentaire.[1]

La version officielle Flash prend-elle en charge Responses API ?

Oui. DeepSeek fournit une surface Responses API native pour Flash et documente l'intégration directe de Codex.[3][4]

DeepSeek V4 Flash peut-il traiter des images via Responses API ?

Non. Le tableau de compatibilité officiel indique que les parties d'entrée d'image et de fichier sont remplacées par du texte d'espace réservé. Traitez le point de terminaison comme entrée de texte.[3]

V4 Pro DeepSeek a-t-il également été mis à niveau ?

Non. DeepSeek indique que la mise à jour 0731 s'applique uniquement à l'API Flash. L'API Pro et les modèles App/Web sont restés inchangés, avec la version Pro officielle planifiée séparément.[1]

Ce que cette version signifie réellement

La version officielle de DeepSeek V4 Flash est une mise à niveau focalisée d'agent. Elle conserve l'architecture Flash efficace et le nom d'API stable, puis change la partie que les développeurs ressentent le plus : l'utilisation des outils, le travail terminal, le comportement de codage et l'intégration avec les clients basés sur Responses.

Le titre pratique n'est pas simplement que les chiffres des benchmarks ont augmenté. deepseek-v4-flash peut désormais se brancher directement dans Codex via un protocole natif documenté. Les équipes doivent toujours tester les lacunes de compatibilité, reproduire les performances sur leurs propres repository et se rappeler que le service est en bêta publique. C'est une version substantielle, mais ce n'est pas encore le déploiement complet de la gamme de produits DeepSeek V4.

Références

  1. DeepSeek. Change Log — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/updates
  2. DeepSeek. DeepSeek-V4-Flash model card — architecture, parameters, context, reasoning modes, and license. Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
  3. DeepSeek. Using the Responses API — supported fields, tools, streaming, and compatibility limits. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/responses_api
  4. DeepSeek. Integrate with Codex — official provider and model configuration. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/agent_integrations/codex
  5. DeepSeek. Your First API Call — deepseek-v4-flash now routes to the 0731 model. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/function_calling
  6. DeepSeek. Models & Pricing — Flash token rates, context, maximum output, and features. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/pricing
  7. DeepSeek. Rate Limit & Isolation — account-level Flash concurrency. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/rate_limit

Lectures complémentaires