
DeepSeek V4 1M: max_tokens, facturación y concurrencia
El contexto de 1M se comparte entre entrada y salida, con máximo de 384K. Aprenda sobre max_tokens, facturación en caché y límites de concurrencia.
La ventana de contexto de 1M de DeepSeek V4 es un presupuesto compartido entre entrada y salida. No significa que puedas enviar 1M de tokens de entrada y generar otros 384K. La cifra 384K es la salida máxima, mientras que max_tokens es el límite de salida que eliges para una solicitud. La salida real también se limita por el espacio restante en la ventana de 1M[1][2].
Esta guía responde las preguntas prácticas detrás de esa especificación: cómo presupuestar entrada y salida, cómo establecer max_tokens, qué hacen los tokens de razonamiento con el uso, cómo funciona la facturación de caché y por qué Flash y Pro tienen límites de concurrencia diferentes.
Límites de DeepSeek V4 de un vistazo
| Elemento | Especificación oficial |
|---|---|
| IDs de modelo | deepseek-v4-flash, deepseek-v4-pro |
| Ventana de contexto | 1M de tokens, compartida por entrada y salida generada |
| Salida máxima | 384K tokens |
max_tokens | Límite de finalización por solicitud; no puede exceder el contexto restante o el límite de salida del modelo |
| Modo predeterminado | Razonamiento habilitado; las solicitudes ordinarias usan por defecto reasoning_effort: high |
| Caché | La caché de disco de contexto está habilitada automáticamente |
| Concurrencia de API directa | Flash 2,500; Pro 500, por cuenta |
| Interfaces | Chat Completions de OpenAI y compatible con Anthropic |
DeepSeek lanzó la vista previa de V4 el 24 de abril de 2026 con variantes Flash y Pro y una ventana de contexto de 1M[3]. La página de precios oficial enumera el mismo límite de salida de 384K para ambos modelos, junto con JSON Output, llamadas de herramientas, finalización de prefijo y finalización FIM[1].
¿1M significa solo entrada?
No. La referencia de Chat Completions de DeepSeek establece que la longitud total de tokens de entrada y tokens generados se limita por la longitud de contexto del modelo[2].
Usa este modelo mental:
tokens_entrada + tokens_generados <= contexto_1M
tokens_generados <= max_tokens
tokens_generados <= límite_salida_modelo_384KSi el prompt casi llena la ventana de contexto, el modelo no puede también devolver una respuesta de 384K. Reserva espacio para instrucciones del sistema, esquemas de herramientas, historial de conversación y la finalización.
Una ventana grande tampoco elimina el valor de la recuperación y fragmentación. Enviar menos contexto, mejor organizado, a menudo mejora la latencia, el costo y el enfoque de la respuesta.
Cómo establecer max_tokens
max_tokens es la longitud máxima de finalización para una solicitud. Un finish_reason de length puede significar que la solicitud alcanzó este límite o agotó el contexto disponible[2].
Puntos de partida razonables:
| Carga de trabajo | Límite inicial |
|---|---|
| Clasificación, extracción, respuestas breves | 1K–4K |
| Revisión de código y resúmenes de documentos | 4K–16K |
| Reportes largos y planes de migración | 16K–64K |
| Generación extrema de formato largo | Aumentar solo después de medir costo y truncado |
Estos son puntos de partida de ingeniería, no requisitos oficiales. Mide finish_reason, tokens de finalización reales, latencia y tasa de salida útil antes de aumentar el límite.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Review this repository inventory and produce a risk-ranked migration plan.",
}
],
max_tokens=16_384,
reasoning_effort="high",
extra_body={
"thinking": {"type": "enabled"},
"group": "default",
},
)Consulta la referencia de API de DeepSeek V4 para los campos de solicitud de reAPI, y la página del modelo DeepSeek V4 para el playground y los precios en vivo de la puerta de enlace.
Tokens de razonamiento y uso de finalización
El modo de razonamiento está habilitado por defecto. DeepSeek devuelve el razonamiento en reasoning_content, y el objeto de uso puede informarlo por separado como completion_tokens_details.reasoning_tokens[4][2].
Planifica la capacidad de finalización alrededor del razonamiento y también de la respuesta final visible. En modo de razonamiento, temperature, top_p, presence_penalty y frequency_penalty se aceptan por compatibilidad pero no tienen efecto[4].
Para extracción determinista o trabajo de baja latencia, prueba Flash con razonamiento deshabilitado. Mantén el razonamiento habilitado para planificación, codificación y uso de herramientas de varios pasos donde el razonamiento adicional es útil.
Cómo funciona la facturación
DeepSeek Direct factura tres buckets de tokens:
- entrada en caché;
- entrada sin caché;
- salida.
Las tarifas USD oficiales al 30 de julio de 2026 fueron[1]:
| Modelo | Entrada en caché / 1M | Entrada sin caché / 1M | Salida / 1M |
|---|---|---|---|
| DeepSeek V4 Flash | $0.0028 | $0.14 | $0.28 |
| DeepSeek V4 Pro | $0.003625 | $0.435 | $0.87 |
La fórmula general es:
costo =
entrada_en_caché / 1M × tarifa_en_caché
+ entrada_sin_caché / 1M × tarifa_sin_caché
+ salida / 1M × tarifa_salidaEstos son los precios directos de DeepSeek. reAPI es una puerta de enlace separada con sus propias tarifas USD en vivo, así que usa la tarjeta de precios en la página reAPI DeepSeek V4 para la facturación de la puerta de enlace.
Obtener valor del almacenamiento en caché de contexto
La caché de disco de DeepSeek está habilitada automáticamente. Una solicitud posterior recibe un acierto de caché solo cuando coincide completamente con una unidad de prefijo almacenada; la redacción similar no es suficiente[5].
Pon contenido estable primero:
prompt de sistema estable
+ esquemas de herramientas estables
+ repositorio sin cambios o corpus de documentos
+ la pregunta que cambia por solicitudUsa los campos de respuesta prompt_cache_hit_tokens y prompt_cache_miss_tokens para calcular la tasa de acierto real. No estimes ahorros solo a partir de similitud de prompts.
Concurrencia de Flash y Pro
DeepSeek Direct publica límites de concurrencia a nivel de cuenta de 2,500 para Flash y 500 para Pro. Una solicitud ocupa un slot de concurrencia hasta que finaliza su respuesta. El límite es por cuenta, no por clave de API, y las solicitudes excesivas reciben HTTP 429[6].
El user_id opcional puede aislar comportamiento de seguridad, caché y programación, pero las cuentas ordinarias aún comparten la concurrencia total de cuenta en todos los IDs de usuario. Crear más claves o IDs de usuario no aumenta la capacidad.
Esas cifras se aplican a DeepSeek Direct. La concurrencia de la puerta de enlace y la puesta en cola pueden diferir; cuando uses reAPI, sigue los límites y respuestas publicados por reAPI.
Lista de verificación de producción para solicitudes de contexto de 1M
- Cuenta tokens en lugar de tratar caracteres como tokens.
- Reserva contexto para salida, esquemas de herramientas y turnos posteriores.
- Establece
max_tokensa la tarea, no automáticamente a 384K. - Registra
finish_reasony distingue truncado de detenciones naturales. - Mantén prefijos reutilizables estables y rastrea tokens de acierto de caché.
- Mide el uso de razonamiento por separado de la longitud de respuesta visible.
- Reintenta respuestas 429 con backoff exponencial y jitter.
- Enruta trabajo de rutina de alto volumen a Flash y reserva Pro para tareas más difíciles.
- Usa los IDs de modelo V4 actuales; la fecha de deprecación anunciada por DeepSeek para
deepseek-chatydeepseek-reasonerfue el 24 de julio de 2026[3].
FAQ
¿DeepSeek V4 Flash admite contexto de 1M?
Sí. Tanto Flash como Pro tienen una ventana de contexto de 1M y una salida máxima de 384K[1].
¿Los 1M de contexto son solo entrada?
No. La entrada y la salida generada comparten el límite de contexto del modelo[2].
¿Puedo establecer max_tokens a 384K?
384K es el límite de salida del modelo, pero la solicitud también debe tener suficiente espacio en la ventana de contexto de 1M. La configuración no garantiza una finalización de 384K.
¿Cuentan los tokens de razonamiento hacia el uso de finalización?
Los planes de capacidad y facturación deberían incluirlos. DeepSeek reporta tokens de razonamiento dentro de los detalles de uso de finalización[2].
¿Los límites de concurrencia son por clave de API?
No. DeepSeek Direct limita la concurrencia por cuenta: 2,500 para Flash y 500 para Pro[6].
¿Necesito habilitar el almacenamiento en caché de prompts?
No. La caché de disco de contexto es automática. Mantén prefijos compartidos estables e inspecciona los campos de acierto de caché en usage[5].
Lecturas adicionales
- Modelo y precios en vivo de DeepSeek V4
- Referencia de API de DeepSeek V4
- Examinar modelos de chat de reAPI
Referencias
- DeepSeek. Models & Pricing — V4 context, output, features, prices, and concurrency. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/pricing
- DeepSeek. Create Chat Completion — max_tokens, context limits, finish reasons, and usage. Retrieved July 30, 2026 from api-docs.deepseek.com/api/create-chat-completion
- DeepSeek. DeepSeek-V4 preview release. April 24, 2026. api-docs.deepseek.com/news/news260424
- DeepSeek. Thinking Mode — controls, reasoning effort, and reasoning content. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/thinking_mode
- DeepSeek. Context Caching — prefix matching and usage fields. Retrieved July 30, 2026 from api-docs.deepseek.com/guides/kv_cache
- DeepSeek. Rate Limit & Isolation — account-level concurrency and user_id. Retrieved July 30, 2026 from api-docs.deepseek.com/quick_start/rate_limit
Autor

Categorías
max_tokensTokens de razonamiento y uso de finalizaciónCómo funciona la facturaciónObtener valor del almacenamiento en caché de contextoConcurrencia de Flash y ProLista de verificación de producción para solicitudes de contexto de 1MFAQ¿DeepSeek V4 Flash admite contexto de 1M?¿Los 1M de contexto son solo entrada?¿Puedo establecer max_tokens a 384K?¿Cuentan los tokens de razonamiento hacia el uso de finalización?¿Los límites de concurrencia son por clave de API?¿Necesito habilitar el almacenamiento en caché de prompts?Lecturas adicionalesReferenciasMás publicaciones

Kling Motion Control: v2.6 vs v3, precios y preparación
Usa Kling Motion Control v2.6 o v3 con el modo de orientación, duración de origen y nivel de precio para reducir la desviación de rostro y cuerpo.


Continuidad en vídeos IA: cómo mantenerla en múltiples clips
Aprende a extender vídeos IA en múltiples clips con registro de estado, fotogramas de referencia, indicaciones de continuación y reglas de reparación.


GPT Image 2 y Seedance 2.0: coherencia de personajes
Usa ambos para reducir desviación de caracteres. Construye referencias, anima fotogramas y encadena clips sin perder identidad en secuencias.
