Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
DeepSeek V4 Flash Oficial: Mejoras en Agentes y Codex 0731
2026/08/02

DeepSeek V4 Flash Oficial: Mejoras en Agentes y Codex 0731

DeepSeek V4 Flash 0731 en beta pública con benchmarks de agentes mejorados, soporte nativo de API de Respuestas, Codex y el mismo ID de modelo.

DeepSeek V4 Flash 0731 es ahora el modelo Flash oficial ofrecido por la API de DeepSeek. La actualización del 31 de julio de 2026 reemplaza la vista previa de abril detrás del ID de modelo existente deepseek-v4-flash, agrega soporte nativo de API de Respuestas y retune sustancialmente el modelo para agentes de codificación y trabajo impulsado por herramientas. DeepSeek llama a la versión oficial, pero el servicio API aún se etiqueta como beta pública.[1]

Este es un lanzamiento exclusivamente de API. DeepSeek V4 Pro, la aplicación DeepSeek y el chat web no se actualizaron como parte del lanzamiento 0731. La arquitectura tampoco cambió: Flash sigue siendo un modelo de mezcla de expertos con 284B parámetros totales, 13B parámetros activos y una ventana de contexto de un millón de tokens.[1][2]

TL;DR

  • El modelo oficial es DeepSeek-V4-Flash-0731. Las llamadas API existentes continúan usando deepseek-v4-flash; no se requiere migración de nombre de modelo.[1]
  • Este es un upgrade de post-entrenamiento, no una nueva arquitectura. Los parámetros totales, parámetros activos y la ventana de contexto de 1M permanecen sin cambios.[1][2]
  • El rendimiento del agente es el titular. DeepSeek reporta 82.7 en Terminal Bench 2.1, 54.4 en DeepSWE y 70.3 en Toolathlon Verified, usando su arnés mínimo no lanzado y esfuerzo de razonamiento máximo.[1]
  • El soporte de API de Respuestas es nativo. Flash ahora puede respaldar Codex sin el proxy de conversión de protocolo que requería la vista previa.[3][4]
  • La capa de compatibilidad no es paridad completa de OpenAI. La API es sin estado, acepta texto en lugar de entradas de imagen/archivo e ignora o rechaza varios campos de API de Respuestas.[3]
  • El chat Pro y de consumidor no cambió. DeepSeek dice que el lanzamiento oficial de V4 Pro seguirá por separado.[1]

Especificaciones de DeepSeek V4 Flash 0731

ElementoEstado de versión oficial
Fecha de lanzamiento31 de julio de 2026
Estado del servicioLanzamiento oficial de API en beta pública
ID de modelo de APIdeepseek-v4-flash
Nombre de punto de controlDeepSeek-V4-Flash-0731
ArquitecturaMezcla de expertos, sin cambios desde la vista previa
Parámetros284B total, 13B activados
Ventana de contexto1M tokens
Salida máxima384K tokens
Modos de razonamientoNo pensar, Pensar Alto, Pensar Máximo
Formatos de APIChat Completions, Compatible con Anthropic, API de Respuestas
Entrada en API de RespuestasTexto; las entradas de imagen y archivo no son compatibles
Pesos abiertosPesos de modelo con licencia MIT disponibles

La distinción entre el ID de modelo y el nombre del punto de control es deliberada. DeepSeek-V4-Flash-0731 identifica los pesos actualizados, mientras que deepseek-v4-flash es el nombre de servicio estable que las aplicaciones envían a la API.[5] Esto permite que DeepSeek actualice el backend sin obligar a cada desarrollador a cambiar la configuración de producción.

Qué cambió desde DeepSeek V4 Flash Preview

Mapa de actualización de DeepSeek V4 Flash 0731 mostrando arquitectura sin cambios, nuevo post-entrenamiento, comportamiento de agente más fuerte y soporte nativo de API de Respuestas

El lanzamiento 0731 cambia el comportamiento e integración más que la escala del modelo puro.

ÁreaVista previa de abrilFlash oficial 0731
ArquitecturaMoE 284B total / 13B activoSin cambios
Contexto1M tokensSin cambios
ID de modelodeepseek-v4-flashSin cambios
Etapa de entrenamientoPost-entrenamiento de vista previaRe-post-entrenado para la versión oficial
Capacidad de agenteLínea base fuerte de agente generalReajuste importante de agente de codificación y uso de herramientas
API de RespuestasSin endpoint nativoSoporte nativo
Integración de CodexRequería un adaptador u otra ruta compatibleConfiguración directa documentada oficialmente
Alcance del lanzamientoAPI de Flash y Pro previewSolo Flash API

DeepSeek dice que 0731 "solo fue re-post-entrenado."[1] Esa frase es fácil de infravalorar. Para modelos de agentes, el post-entrenamiento controla si el modelo planifica efectivamente, llama a la herramienta correcta, lee el resultado, se recupera del fallo y continúa hasta completar la tarea. La arquitectura establece la capacidad; el post-entrenamiento determina cuán confiablemente esa capacidad aparece dentro de un agente funcional.

Por lo tanto, el lanzamiento no hace que el modelo sea más grande. Hace que el modelo Flash existente sea más útil para trabajo de repositorio, tareas de terminal, generación de parches, búsqueda y automatización de múltiples pasos.

Nuevos benchmarks de agentes de DeepSeek, y cómo leerlos

DeepSeek publicó nueve puntuaciones para el lanzamiento oficial:[1]

BenchmarkDeepSeek V4 Flash 0731
Terminal Bench 2.182.7
NL2Repo54.2
CyberGym76.7
DeepSWE54.4
Toolathlon Verified70.3
Agent Last Exam25.2
Automation Bench Public25.1
DSBench FullStack68.7
DSBench Hard59.6

Estas cifras apoyan la afirmación de que el trabajo de agentes fue el enfoque de la actualización. No establecen un ranking universal.

DeepSeek utilizó su propio "modo arnés mínimo", que la empresa dice que se lanzará posteriormente, con esfuerzo de razonamiento máximo, top_p: 0.95 y temperature: 1.0. Dos de los conjuntos de datos reportados —DSBench FullStack y DSBench Hard— son internos.[1] Hasta que el arnés y las tareas internas estén disponibles, esos resultados no pueden reproducirse independientemente de principio a fin.

Para una evaluación de producción, mantenga el mismo conjunto de repositorio, permisos de herramientas, tiempo de espera, política de reintento, esfuerzo de razonamiento y presupuesto de tokens en todos los modelos. Mida tareas completadas y parches aceptados, no solo si un agente produjo un diff de apariencia plausible.

La API de Respuestas nativa es el cambio más importante para desarrolladores

DeepSeek V4 Flash ahora acepta el formato de API de Respuestas en la URL base estándar de DeepSeek. Eso elimina una brecha de integración significativa para Codex y otros clientes construidos alrededor de /v1/responses en lugar de Chat Completions.[3]

Una llamada directa mínima usa el SDK de OpenAI:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="Review code conservatively and explain every proposed edit.",
    input="Find the race condition in this queue worker.",
    reasoning={"effort": "high"},
    max_output_tokens=8_192,
)

print(response.output_text)

El streaming devuelve eventos semánticos como response.output_text.delta, response.function_call_arguments.delta y response.completed. A diferencia del stream de Chat Completions familiar, no termina con data: [DONE].[3]

La compatibilidad nativa es importante porque un adaptador ya no tiene que traducir llamadas de herramientas, eventos de razonamiento y elementos de salida entre dos formatos de cable. Menos capas de traducción significan menos lugares donde los IDs de llamadas de herramientas, el estado de streaming o el historial de razonamiento se pueden romper.

La compatibilidad de API de Respuestas tiene límites importantes

"API de Respuestas nativa" no significa que cada característica de Respuestas de OpenAI funcione. DeepSeek documenta el límite de compatibilidad en detalle.[3]

Las características compatibles incluyen:

  • entrada de texto e instrucciones de desarrollador/sistema;
  • streaming;
  • herramientas de función y búsqueda web del lado del servidor;
  • opción de herramienta requerida o específica;
  • esfuerzo de razonamiento;
  • formatos de texto estructurado;
  • la herramienta personalizada apply_patch utilizada para compatibilidad con Codex.

Las limitaciones importantes incluyen:

  • previous_response_id y conversation no son compatibles, por lo que la API es sin estado;
  • store, modo de fondo, metadatos, plantillas de mensaje y niveles de servicio no son compatibles;
  • los elementos de entrada de imagen y archivo se reemplazan con texto de marcador de posición en lugar de procesarse;
  • MCP, uso de computadora, intérprete de código y herramientas de búsqueda de archivos se ignoran;
  • parallel_tool_calls se ignora porque el uso de herramientas paralelas siempre está habilitado;
  • las solicitudes que exceden la ventana de contexto devuelven HTTP 400 en lugar de truncarse automáticamente.

Algunos parámetros no compatibles se ignoran silenciosamente. Eso hace que la conexión inicial sea más fácil, pero también significa que una solicitud puede devolverse exitosamente sin honrar cada control que envió su aplicación. Las pruebas de integración deben verificar el comportamiento, no solo el estado HTTP.

Cómo usar DeepSeek V4 Flash 0731 con Codex

DeepSeek ahora publica una guía de configuración dedicada de Codex. A partir del 2 de agosto, solo se admite Flash; se espera que el soporte de V4 Pro sea por separado.[4]

La configuración oficial crea un proveedor de DeepSeek en ~/.codex/config.toml y un catálogo de modelos en ~/.codex/models.json. Los valores de tiempo de ejecución importantes son:

model = "deepseek-v4-flash"
model_provider = "deepseek"

[model_providers.deepseek]
name = "DeepSeek"
base_url = "https://api.deepseek.com"
wire_api = "responses"
env_key = "DEEPSEEK_API_KEY"

El catálogo de DeepSeek proporciona a Flash un contexto máximo de 1,048,576 tokens, habilita llamadas de herramientas paralelas y expone niveles de razonamiento bajo, alto y máximo.[4] Mantenga la clave de API en una variable de entorno en lugar de escribirla en un archivo de configuración compartido.

Para trabajo de repositorio, comience con razonamiento high. Pasar a max solo para tareas que justifiquen latencia adicional y tokens de salida, como una migración entre servicios o un error intermitente difícil.

La fijación de precios y los límites de contexto no recibieron un nuevo nivel de lanzamiento

La hoja de precios actual de DeepSeek Direct lista Flash en:[6]

Categoría de tokenPrecio por 1M tokens
Entrada en caché$0.0028
Entrada sin caché$0.14
Salida$0.28

Flash retiene una ventana de contexto compartida de 1M, una salida máxima de 384K y un límite de concurrencia a nivel de cuenta de 2.500.[6][7] El bajo precio de token del titular no hace que las ejecuciones de agentes de contexto máximo sean gratuitas: esquemas de herramientas, archivos de repositorio, tokens de razonamiento, reintentos y salidas largas contribuyen al uso.

Para una explicación detallada del presupuesto de contexto y el comportamiento del caché, consulte DeepSeek V4 1M Context: max_tokens, Billing, and Concurrency.

Estos son los tipos de DeepSeek Direct. reAPI tiene su propio contrato de producto y tarjeta de tarifa activa en la página del modelo DeepSeek V4. No copie un precio de proveedor en una calculadora de costo de puerta de enlace sin verificar la ruta que está usando realmente.

Llamando a DeepSeek V4 Flash a través de reAPI

La integración existente de reAPI utiliza el mismo nombre de modelo estable a través de un endpoint de Chat Completions compatible con OpenAI:

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "Work through the repository methodically. Return a minimal patch."
      },
      {
        "role": "user",
        "content": "Trace this authentication failure and identify the smallest safe fix."
      }
    ],
    "max_tokens": 8192,
    "reasoning_effort": "high"
  }'

Consulte la documentación de la API de DeepSeek V4 para el contrato de solicitud actual de reAPI. El lanzamiento de la puerta de enlace y el lanzamiento directo del proveedor son eventos operacionales separados, así que confirme la ruta activa y la respuesta de descubrimiento de modelo cuando una aplicación depende de la revisión exacta 0731.

¿Quién debería cambiar a la versión Flash oficial?

Los usuarios actuales de la API Direct de DeepSeek no necesitan cambiar IDs de modelo; el nombre Flash estable ya selecciona la versión más reciente. Deberían reiniciar evaluaciones porque el comportamiento cambió aunque la configuración no.

El lanzamiento es particularmente relevante para:

  • equipos de agentes de codificación que usan herramientas de terminal, búsqueda y parches;
  • desarrolladores que previamente mantenían un proxy de Chat Completions a Responses;
  • cargas de trabajo de alto volumen que necesitan una huella de parámetro activo más pequeña que V4 Pro;
  • agentes de contexto largo que pueden beneficiarse del almacenamiento en caché de prefijo automático;
  • usuarios de Codex dispuestos a operar dentro de los límites de compatibilidad documentados de DeepSeek.

Espere antes de tratarlo como un reemplazo plug-and-play cuando su flujo de trabajo requiere comprensión de imagen, conversaciones de Respuestas duraderas, trabajos en segundo plano, intérprete de código, MCP a través de la API o paridad exacta de características de OpenAI. Esas características están ausentes o se manejan fuera del endpoint del modelo hoy.[3]

Lista de verificación de migración de producción

  1. Mantenga deepseek-v4-flash; no invente un ID de API deepseek-v4-flash-0731 a menos que un proveedor lo exponga explícitamente.
  2. Rerun evaluaciones de agentes porque el comportamiento del backend cambió bajo el nombre estable.
  3. Fije el arnés, definiciones de herramientas, esfuerzo de razonamiento, presupuesto de tokens y tiempo de espera al comparar resultados.
  4. Pruebe cada campo de API de Respuestas en el que su aplicación dependa; varios campos no compatibles se ignoran silenciosamente.
  5. Preservar el historial de conversaciones del lado del cliente porque previous_response_id no es compatible.
  6. Rechazar o preprocesar entradas de imagen y archivo en lugar de asumir que el modelo puede inspeccionarlas.
  7. Rastrear entrada en caché y sin caché por separado en la telemetría de costos.
  8. Desplegar detrás de una bandera de característica y mantener la ruta de producción anterior disponible hasta que pasen las pruebas de aceptación.

Preguntas frecuentes

¿Es DeepSeek V4 Flash 0731 la versión oficial?

Sí. DeepSeek lo llama la versión oficial de V4 Flash, servida a través de una beta pública de API desde el 31 de julio de 2026.[1] "Lanzamiento oficial" describe la revisión del modelo; "beta pública" describe la etapa de servicio actual.

¿Necesito cambiar el nombre del modelo de API?

No. DeepSeek Direct continúa usando deepseek-v4-flash, que ahora se enruta a DeepSeek-V4-Flash-0731.[5]

¿Es DeepSeek V4 Flash 0731 un modelo más grande?

No. Conserva la arquitectura y el tamaño de vista previa: 284B parámetros totales y 13B activados. La actualización proviene de post-entrenamiento adicional.[1]

¿Admite la versión Flash oficial la API de Respuestas?

Sí. DeepSeek proporciona una superficie de API de Respuestas nativa para Flash y documenta la integración directa de Codex.[3][4]

¿Puede DeepSeek V4 Flash procesar imágenes a través de API de Respuestas?

No. La tabla de compatibilidad oficial dice que las partes de entrada de imagen y archivo se reemplazan con texto de marcador de posición. Trate el endpoint como entrada de texto.[3]

¿Se actualizó DeepSeek V4 Pro también?

No. DeepSeek dice que la actualización 0731 se aplica solo a la API de Flash. La API de Pro y los modelos de App/Web no se modificaron, con el lanzamiento oficial de Pro planeado por separado.[1]

Lo que este lanzamiento realmente significa

El lanzamiento oficial de DeepSeek V4 Flash es una actualización de agente enfocada. Mantiene la arquitectura Flash eficiente y el nombre de API estable, luego cambia la parte que los desarrolladores sienten más: uso de herramientas, trabajo de terminal, comportamiento de codificación e integración con clientes basados en Respuestas.

El titular práctico no es simplemente que los números de benchmark hayan subido. deepseek-v4-flash ahora puede conectarse directamente a Codex a través de un protocolo nativo documentado. Los equipos aún deben probar los espacios de compatibilidad, reproducir el rendimiento en sus propios repositorios y recordar que el servicio está en beta pública. Ese es un lanzamiento sustancial, pero aún no es el lanzamiento completo de la línea de productos DeepSeek V4.

Referencias

  1. DeepSeek. Change Log — DeepSeek-V4-Flash Update. July 31, 2026. api-docs.deepseek.com/updates
  2. DeepSeek. DeepSeek-V4-Flash model card — architecture, parameters, context, reasoning modes, and license. Retrieved August 2, 2026 from huggingface.co/deepseek-ai/DeepSeek-V4-Flash
  3. DeepSeek. Using the Responses API — supported fields, tools, streaming, and compatibility limits. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/responses_api
  4. DeepSeek. Integrate with Codex — official provider and model configuration. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/agent_integrations/codex
  5. DeepSeek. Your First API Call — deepseek-v4-flash now routes to the 0731 model. Retrieved August 2, 2026 from api-docs.deepseek.com/guides/function_calling
  6. DeepSeek. Models & Pricing — Flash token rates, context, maximum output, and features. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/pricing
  7. DeepSeek. Rate Limit & Isolation — account-level Flash concurrency. Retrieved August 2, 2026 from api-docs.deepseek.com/quick_start/rate_limit

Lectura adicional