
DeepSeek V4 Flash 0731 : version officielle avec Responses API
DeepSeek V4 Flash 0731 en bêta publique avec benchmarks d'agent renforcés, support natif Responses API, intégration Codex et le même identifiant de modèle.
DeepSeek V4 Flash 0731 est désormais le modèle Flash officiel servi par l'API DeepSeek. La mise à jour du 31 juillet 2026 remplace l'aperçu d'avril derrière l'identifiant de modèle existant deepseek-v4-flash, ajoute le support natif de Responses API et retune substantiellement le modèle pour les agents de codage et le travail piloté par outils. DeepSeek qualifie la version de officielle, mais le service API reste étiqueté bêta publique.[1]
Il s'agit d'un déploiement réservé à l'API. DeepSeek V4 Pro, l'application DeepSeek et le chat web n'ont pas été mis à jour dans le cadre de la version 0731. L'architecture n'a pas changé non plus : Flash reste un modèle de mélange d'experts à 284 milliards de paramètres avec 13 milliards de paramètres actifs et une fenêtre de contexte d'un million de tokens.[1][2]
TL;DR
- Le modèle officiel est
DeepSeek-V4-Flash-0731. Les appels API existants continuent d'utiliserdeepseek-v4-flash; aucune migration de nom de modèle n'est requise.[1] - C'est une mise à jour post-entraînement, pas une nouvelle architecture. Le nombre total de paramètres, les paramètres actifs et la fenêtre de contexte de 1 M restent inchangés.[1][2]
- Les performances des agents sont le gros titre. DeepSeek rapporte 82,7 sur Terminal Bench 2.1, 54,4 sur DeepSWE et 70,3 sur Toolathlon Verified, en utilisant son harness minimal non publié et le maximum d'effort de raisonnement.[1]
- Le support de Responses API est natif. Flash peut désormais alimenter Codex sans le proxy de conversion de protocole que l'aperçu exigeait.[3][4]
- La couche de compatibilité n'offre pas la parité complète d'OpenAI. L'API est sans état, accepte le texte plutôt que les entrées image/fichier et ignore ou rejette plusieurs champs Responses API.[3]
- Le chat Pro et consommateur n'a pas changé. DeepSeek indique que la version officielle V4 Pro suivra séparément.[1]
Spécifications de DeepSeek V4 Flash 0731
| Élément | État de la version officielle |
|---|---|
| Date de sortie | 31 juillet 2026 |
| État du service | Version officielle de l'API en bêta publique |
| ID du modèle API | deepseek-v4-flash |
| Nom du checkpoint | DeepSeek-V4-Flash-0731 |
| Architecture | Mélange d'experts, inchangée par rapport à l'aperçu |
| Paramètres | 284 milliards au total, 13 milliards activés |
| Fenêtre de contexte | 1 million de tokens |
| Sortie maximale | 384 K tokens |
| Modes de raisonnement | Non-pensant, Think High, Think Max |
| Formats API | Chat Completions, compatible Anthropic, Responses API |
| Entrée sur Responses API | Texte ; les entrées d'image et de fichier ne sont pas prises en charge |
| Poids ouverts | Poids de modèle disponibles sous licence MIT |
La distinction entre l'ID du modèle et le nom du checkpoint est intentionnelle. DeepSeek-V4-Flash-0731 identifie les poids mis à jour, tandis que deepseek-v4-flash est le nom de service stable que les applications envoient à l'API.[5] Cela permet à DeepSeek de mettre à jour le backend sans forcer chaque développeur à modifier la configuration de production.
Ce qui a changé par rapport à DeepSeek V4 Flash Preview

La version 0731 change le comportement et l'intégration plus que l'échelle brute du modèle.
| Zone | Aperçu d'avril | Flash officiel 0731 |
|---|---|---|
| Architecture | 284 milliards au total / 13 milliards de MoE actif | Inchangée |
| Contexte | 1 million de tokens | Inchangée |
| ID du modèle | deepseek-v4-flash | Inchangée |
| Étape d'entraînement | Post-entraînement d'aperçu | Re-post-entraîné pour la version officielle |
| Capacité d'agent | Référence d'agent général fort | Retune majeure de l'agent de codage et de l'utilisation d'outils |
| Responses API | Pas de point de terminaison natif | Support natif |
| Intégration Codex | Nécessitait un adaptateur ou un autre itinéraire compatible | Configuration directe officially documented |
| Portée du déploiement | API Flash et Pro preview | API Flash uniquement |
DeepSeek dit que 0731 "était seulement re-post-entraîné."[1] Cette phrase est facile à minimiser. Pour les modèles d'agent, le post-entraînement contrôle si le modèle planifie efficacement, appelle le bon outil, lit le résultat, se remet d'un échec et continue jusqu'à ce que la tâche soit terminée. L'architecture établit la capacité ; le post-entraînement détermine la fiabilité avec laquelle cette capacité apparaît dans un agent de travail.
La version ne rend donc pas le modèle plus grand. Elle rend le modèle Flash existant plus utile pour le travail de repository, les tâches terminales, la génération de patchs, la recherche et l'automatisation multi-étapes.
Les nouveaux benchmarks d'agent de DeepSeek — et comment les interpréter
DeepSeek a publié neuf scores pour la version officielle :[1]
| Benchmark | DeepSeek V4 Flash 0731 |
|---|---|
| Terminal Bench 2.1 | 82,7 |
| NL2Repo | 54,2 |
| CyberGym | 76,7 |
| DeepSWE | 54,4 |
| Toolathlon Verified | 70,3 |
| Agent Last Exam | 25,2 |
| Automation Bench Public | 25,1 |
| DSBench FullStack | 68,7 |
| DSBench Hard | 59,6 |
Ces chiffres soutiennent l'affirmation que le travail d'agent était le foyer de la mise à jour. Ils n'établissent pas un classement universel.
DeepSeek a utilisé son propre « mode harness minimal », que l'entreprise dit être publié ultérieurement, avec un effort de raisonnement maximal, top_p: 0.95 et temperature: 1.0. Deux des ensembles de données rapportés — DSBench FullStack et DSBench Hard — sont internes.[1] Jusqu'à ce que le harness et les tâches internes soient disponibles, ces résultats ne peuvent pas être indépendamment reproduits de bout en bout.
Pour une évaluation de production, gardez le même ensemble de repository, permissions d'outils, délai d'expiration, politique de nouvelle tentative, effort de raisonnement et budget de tokens dans tous les modèles. Mesurez les tâches terminées et les patches acceptés, pas seulement si un agent a produit un diff plausible.
Responses API natif est le changement de développeur le plus important
DeepSeek V4 Flash accepte désormais le format Responses API à l'URL de base DeepSeek standard. Cela supprime un écart d'intégration significatif pour Codex et d'autres clients construits autour de /v1/responses plutôt que Chat Completions.[3]
Un appel direct minimal utilise le SDK OpenAI :
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="Review code conservatively and explain every proposed edit.",
input="Find the race condition in this queue worker.",
reasoning={"effort": "high"},
max_output_tokens=8_192,
)
print(response.output_text)Le streaming retourne des événements sémantiques tels que response.output_text.delta, response.function_call_arguments.delta et response.completed. Contrairement au flux Chat Completions familier, il ne se termine pas par data: [DONE].[3]
Le support natif est important car un adaptateur ne doit plus traduire les appels d'outils, les événements de raisonnement et les éléments de sortie entre deux formats de fil. Moins de couches de traduction signifie moins d'endroits où les ID d'appels d'outils, l'état de streaming ou l'historique de raisonnement peuvent se casser.
La compatibilité de Responses API a des limites importantes
« Responses API native » ne signifie pas que toutes les fonctionnalités Responses d'OpenAI fonctionnent. DeepSeek documente la limite de compatibilité en détail.[3]
Les fonctionnalités prises en charge incluent :
- entrée de texte et instructions développeur/système ;
- streaming ;
- outils de fonction et recherche web côté serveur ;
- choix d'outil obligatoire ou spécifique ;
- effort de raisonnement ;
- formats de texte structurés ;
- l'outil personnalisé
apply_patchutilisé pour la compatibilité Codex.
Les limitations importantes incluent :
previous_response_idetconversationne sont pas prises en charge, donc l'API est sans état ;store, le mode arrière-plan, les métadonnées, les modèles d'invite et les niveaux de service ne sont pas pris en charge ;- les éléments d'entrée d'image et de fichier sont remplacés par du texte d'espace réservé plutôt que traités ;
- MCP, l'utilisation d'ordinateur, l'interpréteur de code et les outils de recherche de fichiers sont ignorés ;
parallel_tool_callsest ignoré car l'utilisation parallèle d'outils est toujours activée ;- les demandes qui dépassent la fenêtre de contexte retournent HTTP 400 au lieu d'être tronquées automatiquement.
Certains paramètres non pris en charge sont silencieusement ignorés. Cela facilite la connexion initiale, mais cela signifie également qu'une demande peut revenir avec succès sans honorer chaque contrôle que votre application a envoyé. Les tests d'intégration doivent vérifier le comportement, pas seulement le statut HTTP.
Comment utiliser DeepSeek V4 Flash 0731 avec Codex
DeepSeek publie désormais un guide de configuration Codex dédié. Au 2 août, seul Flash est pris en charge ; le support V4 Pro est attendu séparément.[4]
La configuration officielle crée un fournisseur DeepSeek dans ~/.codex/config.toml et un catalogue de modèles dans ~/.codex/models.json. Les valeurs d'exécution importantes sont :
model = "deepseek-v4-flash"
model_provider = "deepseek"
[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"Le catalogue de DeepSeek donne à Flash un contexte maximum de 1 048 576 tokens, active les appels d'outils parallèles et expose les niveaux de raisonnement faible, élevé et maximal.[4] Conservez la clé API dans une variable d'environnement plutôt que de l'écrire dans un fichier de configuration partagé.
Pour le travail de repository, commencez avec un raisonnement high. Passez à max uniquement pour les tâches qui justifient une latence et des tokens de sortie supplémentaires, tels qu'une migration multi-service ou un bug intermittent difficile.
Les tarifs et les limites de contexte n'ont pas reçu un nouveau niveau de version
La feuille de prix DeepSeek Direct actuelle répertorie Flash à :[6]
| Catégorie de token | Prix pour 1 million de tokens |
|---|---|
| Entrée mise en cache | 0,0028 $ |
| Entrée non mise en cache | 0,14 $ |
| Sortie | 0,28 $ |
Flash conserve une fenêtre de contexte partagée de 1 M, une sortie maximale de 384 K et une limite de concurrence au niveau du compte de 2 500.[6][7] Le prix bas du token du titre n'entraîne pas l'exécution d'agents à contexte maximum gratuit : les schémas d'outils, les fichiers de repository, les tokens de raisonnement, les tentatives et les longs résultats contribuent tous à l'utilisation.
Pour une explication détaillée du budget de contexte et du comportement du cache, voir DeepSeek V4 1M Context: max_tokens, Billing, and Concurrency.
Ce sont les tarifs DeepSeek Direct. reAPI a son propre contrat de produit et sa carte de tarifs actuelle sur la page du modèle DeepSeek V4. Ne copiez pas un prix de fournisseur dans une calculatrice de coûts de gateway sans vérifier l'itinéraire que vous utilisez réellement.
Appel de DeepSeek V4 Flash via reAPI
L'intégration reAPI existante utilise le même nom de modèle stable via un point de terminaison Chat Completions compatible OpenAI :
curl https://api.reapi.ai/v1/chat/completions \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "Work through the repository methodically. Return a minimal patch."
},
{
"role": "user",
"content": "Trace this authentication failure and identify the smallest safe fix."
}
],
"max_tokens": 8192,
"reasoning_effort": "high"
}'Voir la documentation de l'API DeepSeek V4 pour le contrat de demande reAPI actuel. Le déploiement de gateway et le déploiement direct du fournisseur sont des événements opérationnels séparés, donc confirmez l'itinéraire actif et la réponse de découverte de modèle quand une application dépend de la révision exacte 0731.
Qui devrait passer à la version officielle Flash ?
Les utilisateurs directs de l'API DeepSeek existants n'ont pas besoin de changer les ID de modèle ; le nom Flash stable sélectionne déjà la dernière version. Ils doivent réexécuter les évaluations car le comportement a changé même si la configuration n'a pas.
La version est particulièrement pertinente pour :
- les équipes d'agent de codage utilisant les outils de terminal, de recherche et de patch ;
- les développeurs qui maintenaient auparavant un proxy Chat Completions-to-Responses ;
- les charges de travail à haut volume qui ont besoin d'une empreinte de paramètres actifs plus petite que V4 Pro ;
- les agents de contexte long qui peuvent bénéficier de la mise en cache automatique du préfixe ;
- les utilisateurs de Codex disposés à opérer dans les limites de compatibilité documentées de DeepSeek.
Attendez avant de le traiter comme un remplacement direct quand votre flux de travail nécessite la compréhension d'images, des conversations Responses durables, des travaux d'arrière-plan, l'interpréteur de code, MCP via l'API ou la parité exacte des fonctionnalités OpenAI. Ces fonctionnalités sont absentes ou traitées en dehors du point de terminaison du modèle aujourd'hui.[3]
Liste de vérification de migration de production
- Conservez
deepseek-v4-flash; n'inventez pas d'ID APIdeepseek-v4-flash-0731sauf si un fournisseur l'expose explicitement. - Réexécutez les évaluations d'agent car le comportement du backend a changé sous le nom stable.
- Épinglez le harness, les définitions d'outils, l'effort de raisonnement, le budget de tokens et le délai d'expiration lors de la comparaison des résultats.
- Testez tous les champs Responses API dont dépend votre application ; plusieurs champs non pris en charge sont silencieusement ignorés.
- Conservez l'historique des conversations côté client car
previous_response_idn'est pas pris en charge. - Rejetez ou pré-traitez les entrées d'image et de fichier plutôt que de supposer que le modèle peut les inspecter.
- Suivez séparément l'entrée mise en cache et non mise en cache dans la télémétrie des coûts.
- Déployer derrière un indicateur de fonctionnalité et conserver l'itinéraire de production précédent disponible jusqu'à ce que les tests d'acceptation réussissent.
Questions fréquemment posées
DeepSeek V4 Flash 0731 est-il la version officielle ?
Oui. DeepSeek l'appelle la version officielle V4 Flash, servie via une API bêta publique à partir du 31 juillet 2026.[1] « Version officielle » décrit la révision du modèle ; « bêta publique » décrit l'étape actuelle du service.
Dois-je changer le nom du modèle API ?
Non. DeepSeek Direct continue à utiliser deepseek-v4-flash, qui achemine maintenant vers DeepSeek-V4-Flash-0731.[5]
DeepSeek V4 Flash 0731 est-il un modèle plus grand ?
Non. Il conserve l'architecture et la taille de l'aperçu : 284 milliards de paramètres au total et 13 milliards activés. La mise à jour provient d'un post-entraînement supplémentaire.[1]
La version officielle Flash prend-elle en charge Responses API ?
Oui. DeepSeek fournit une surface Responses API native pour Flash et documente l'intégration directe de Codex.[3][4]
DeepSeek V4 Flash peut-il traiter des images via Responses API ?
Non. Le tableau de compatibilité officiel indique que les parties d'entrée d'image et de fichier sont remplacées par du texte d'espace réservé. Traitez le point de terminaison comme entrée de texte.[3]
V4 Pro DeepSeek a-t-il également été mis à niveau ?
Non. DeepSeek indique que la mise à jour 0731 s'applique uniquement à l'API Flash. L'API Pro et les modèles App/Web sont restés inchangés, avec la version Pro officielle planifiée séparément.[1]
Ce que cette version signifie réellement
La version officielle de DeepSeek V4 Flash est une mise à niveau focalisée d'agent. Elle conserve l'architecture Flash efficace et le nom d'API stable, puis change la partie que les développeurs ressentent le plus : l'utilisation des outils, le travail terminal, le comportement de codage et l'intégration avec les clients basés sur Responses.
Le titre pratique n'est pas simplement que les chiffres des benchmarks ont augmenté. deepseek-v4-flash peut désormais se brancher directement dans Codex via un protocole natif documenté. Les équipes doivent toujours tester les lacunes de compatibilité, reproduire les performances sur leurs propres repository et se rappeler que le service est en bêta publique. C'est une version substantielle, mais ce n'est pas encore le déploiement complet de la gamme de produits DeepSeek V4.
Références
- DeepSeek. Change Log — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/updates
- DeepSeek. DeepSeek-V4-Flash model card — architecture, parameters, context, reasoning modes, and license. Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
- DeepSeek. Using the Responses API — supported fields, tools, streaming, and compatibility limits. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/responses_api
- DeepSeek. Integrate with Codex — official provider and model configuration. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/agent_integrations/codex
- DeepSeek. Your First API Call —
deepseek-v4-flashnow routes to the 0731 model. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/function_calling - DeepSeek. Models & Pricing — Flash token rates, context, maximum output, and features. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/pricing
- DeepSeek. Rate Limit & Isolation — account-level Flash concurrency. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/rate_limit
Lectures complémentaires
- reAPI. Page du modèle DeepSeek V4 et tarification actuelle de la gateway. reapi.ai/models/deepseek-v4
- reAPI. Référence API DeepSeek V4. reapi.ai/docs/deepseek-v4
- reAPI. MiniMax M3 API : 1 million de contexte, tarification et guide de codage. reapi.ai/blog/minimax-m3-api-guide
Auteur

Catégories
Plus d'articles

API Wan 3.0 Video Prime : tarifs, modes, configuration Python
Générez des vidéos 2–30 secondes avec l'API Wan 3.0 Video Prime. Tarifs en direct, cinq modes de requête, code Python, limites et pièges de facturation.


L'IA restaure vieilles vidéos : preset old_film et tarifs
Restauration vidéo IA : preset old_film, requête champ par champ, coûts archivés réels à partir de 2,46 $ par bobine, et limites de la restauration automatisée.


Seedance 2.1 et Seedance 2.0 Mini : ce qui se prépare vraiment
Seedance 2.1 gagnerait 20 % en qualité ; Seedance 2.0 Mini est désormais disponible à un tarif inférieur. Sources, démenti et prix actuels.
