Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
DeepSeek V4 1M: max_tokens, facturación y concurrencia
2026/07/30

DeepSeek V4 1M: max_tokens, facturación y concurrencia

El contexto de 1M se comparte entre entrada y salida, con máximo de 384K. Aprenda sobre max_tokens, facturación en caché y límites de concurrencia.

La ventana de contexto de 1M de DeepSeek V4 es un presupuesto compartido entre entrada y salida. No significa que puedas enviar 1M de tokens de entrada y generar otros 384K. La cifra 384K es la salida máxima, mientras que max_tokens es el límite de salida que eliges para una solicitud. La salida real también se limita por el espacio restante en la ventana de 1M[1][2].

Esta guía responde las preguntas prácticas detrás de esa especificación: cómo presupuestar entrada y salida, cómo establecer max_tokens, qué hacen los tokens de razonamiento con el uso, cómo funciona la facturación de caché y por qué Flash y Pro tienen límites de concurrencia diferentes.

Límites de DeepSeek V4 de un vistazo

ElementoEspecificación oficial
IDs de modelodeepseek-v4-flash, deepseek-v4-pro
Ventana de contexto1M de tokens, compartida por entrada y salida generada
Salida máxima384K tokens
max_tokensLímite de finalización por solicitud; no puede exceder el contexto restante o el límite de salida del modelo
Modo predeterminadoRazonamiento habilitado; las solicitudes ordinarias usan por defecto reasoning_effort: high
CachéLa caché de disco de contexto está habilitada automáticamente
Concurrencia de API directaFlash 2,500; Pro 500, por cuenta
InterfacesChat Completions de OpenAI y compatible con Anthropic

DeepSeek lanzó la vista previa de V4 el 24 de abril de 2026 con variantes Flash y Pro y una ventana de contexto de 1M[3]. La página de precios oficial enumera el mismo límite de salida de 384K para ambos modelos, junto con JSON Output, llamadas de herramientas, finalización de prefijo y finalización FIM[1].

¿1M significa solo entrada?

No. La referencia de Chat Completions de DeepSeek establece que la longitud total de tokens de entrada y tokens generados se limita por la longitud de contexto del modelo[2].

Usa este modelo mental:

tokens_entrada + tokens_generados <= contexto_1M
tokens_generados <= max_tokens
tokens_generados <= límite_salida_modelo_384K

Si el prompt casi llena la ventana de contexto, el modelo no puede también devolver una respuesta de 384K. Reserva espacio para instrucciones del sistema, esquemas de herramientas, historial de conversación y la finalización.

Una ventana grande tampoco elimina el valor de la recuperación y fragmentación. Enviar menos contexto, mejor organizado, a menudo mejora la latencia, el costo y el enfoque de la respuesta.

Cómo establecer max_tokens

max_tokens es la longitud máxima de finalización para una solicitud. Un finish_reason de length puede significar que la solicitud alcanzó este límite o agotó el contexto disponible[2].

Puntos de partida razonables:

Carga de trabajoLímite inicial
Clasificación, extracción, respuestas breves1K–4K
Revisión de código y resúmenes de documentos4K–16K
Reportes largos y planes de migración16K–64K
Generación extrema de formato largoAumentar solo después de medir costo y truncado

Estos son puntos de partida de ingeniería, no requisitos oficiales. Mide finish_reason, tokens de finalización reales, latencia y tasa de salida útil antes de aumentar el límite.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "user",
            "content": "Review this repository inventory and produce a risk-ranked migration plan.",
        }
    ],
    max_tokens=16_384,
    reasoning_effort="high",
    extra_body={
        "thinking": {"type": "enabled"},
        "group": "default",
    },
)

Consulta la referencia de API de DeepSeek V4 para los campos de solicitud de reAPI, y la página del modelo DeepSeek V4 para el playground y los precios en vivo de la puerta de enlace.

Tokens de razonamiento y uso de finalización

El modo de razonamiento está habilitado por defecto. DeepSeek devuelve el razonamiento en reasoning_content, y el objeto de uso puede informarlo por separado como completion_tokens_details.reasoning_tokens[4][2].

Planifica la capacidad de finalización alrededor del razonamiento y también de la respuesta final visible. En modo de razonamiento, temperature, top_p, presence_penalty y frequency_penalty se aceptan por compatibilidad pero no tienen efecto[4].

Para extracción determinista o trabajo de baja latencia, prueba Flash con razonamiento deshabilitado. Mantén el razonamiento habilitado para planificación, codificación y uso de herramientas de varios pasos donde el razonamiento adicional es útil.

Cómo funciona la facturación

DeepSeek Direct factura tres buckets de tokens:

  1. entrada en caché;
  2. entrada sin caché;
  3. salida.

Las tarifas USD oficiales al 30 de julio de 2026 fueron[1]:

ModeloEntrada en caché / 1MEntrada sin caché / 1MSalida / 1M
DeepSeek V4 Flash$0.0028$0.14$0.28
DeepSeek V4 Pro$0.003625$0.435$0.87

La fórmula general es:

costo =
  entrada_en_caché / 1M × tarifa_en_caché
  + entrada_sin_caché / 1M × tarifa_sin_caché
  + salida / 1M × tarifa_salida

Estos son los precios directos de DeepSeek. reAPI es una puerta de enlace separada con sus propias tarifas USD en vivo, así que usa la tarjeta de precios en la página reAPI DeepSeek V4 para la facturación de la puerta de enlace.

Obtener valor del almacenamiento en caché de contexto

La caché de disco de DeepSeek está habilitada automáticamente. Una solicitud posterior recibe un acierto de caché solo cuando coincide completamente con una unidad de prefijo almacenada; la redacción similar no es suficiente[5].

Pon contenido estable primero:

prompt de sistema estable
+ esquemas de herramientas estables
+ repositorio sin cambios o corpus de documentos
+ la pregunta que cambia por solicitud

Usa los campos de respuesta prompt_cache_hit_tokens y prompt_cache_miss_tokens para calcular la tasa de acierto real. No estimes ahorros solo a partir de similitud de prompts.

Concurrencia de Flash y Pro

DeepSeek Direct publica límites de concurrencia a nivel de cuenta de 2,500 para Flash y 500 para Pro. Una solicitud ocupa un slot de concurrencia hasta que finaliza su respuesta. El límite es por cuenta, no por clave de API, y las solicitudes excesivas reciben HTTP 429[6].

El user_id opcional puede aislar comportamiento de seguridad, caché y programación, pero las cuentas ordinarias aún comparten la concurrencia total de cuenta en todos los IDs de usuario. Crear más claves o IDs de usuario no aumenta la capacidad.

Esas cifras se aplican a DeepSeek Direct. La concurrencia de la puerta de enlace y la puesta en cola pueden diferir; cuando uses reAPI, sigue los límites y respuestas publicados por reAPI.

Lista de verificación de producción para solicitudes de contexto de 1M

  • Cuenta tokens en lugar de tratar caracteres como tokens.
  • Reserva contexto para salida, esquemas de herramientas y turnos posteriores.
  • Establece max_tokens a la tarea, no automáticamente a 384K.
  • Registra finish_reason y distingue truncado de detenciones naturales.
  • Mantén prefijos reutilizables estables y rastrea tokens de acierto de caché.
  • Mide el uso de razonamiento por separado de la longitud de respuesta visible.
  • Reintenta respuestas 429 con backoff exponencial y jitter.
  • Enruta trabajo de rutina de alto volumen a Flash y reserva Pro para tareas más difíciles.
  • Usa los IDs de modelo V4 actuales; la fecha de deprecación anunciada por DeepSeek para deepseek-chat y deepseek-reasoner fue el 24 de julio de 2026[3].

FAQ

¿DeepSeek V4 Flash admite contexto de 1M?

Sí. Tanto Flash como Pro tienen una ventana de contexto de 1M y una salida máxima de 384K[1].

¿Los 1M de contexto son solo entrada?

No. La entrada y la salida generada comparten el límite de contexto del modelo[2].

¿Puedo establecer max_tokens a 384K?

384K es el límite de salida del modelo, pero la solicitud también debe tener suficiente espacio en la ventana de contexto de 1M. La configuración no garantiza una finalización de 384K.

¿Cuentan los tokens de razonamiento hacia el uso de finalización?

Los planes de capacidad y facturación deberían incluirlos. DeepSeek reporta tokens de razonamiento dentro de los detalles de uso de finalización[2].

¿Los límites de concurrencia son por clave de API?

No. DeepSeek Direct limita la concurrencia por cuenta: 2,500 para Flash y 500 para Pro[6].

¿Necesito habilitar el almacenamiento en caché de prompts?

No. La caché de disco de contexto es automática. Mantén prefijos compartidos estables e inspecciona los campos de acierto de caché en usage[5].

Lecturas adicionales

Referencias

  1. DeepSeek. Models & Pricing — V4 context, output, features, prices, and concurrency. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/pricing
  2. DeepSeek. Create Chat Completion — max_tokens, context limits, finish reasons, and usage. Retrieved July 30, 2026 from api-docs.deepseek.com/api/create-chat-completion
  3. DeepSeek. DeepSeek-V4 preview release. April 24, 2026. api-docs.deepseek.com/news/news260424
  4. DeepSeek. Thinking Mode — controls, reasoning effort, and reasoning content. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/thinking_mode
  5. DeepSeek. Context Caching — prefix matching and usage fields. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/kv_cache
  6. DeepSeek. Rate Limit & Isolation — account-level concurrency and user_id. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/rate_limit