Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Tokens de salida de los LLM: límites y presupuesto
2026/09/08

Tokens de salida de los LLM: límites y presupuesto

Compara límites de salida de los LLM, presupuestos de razonamiento y parámetros API. Distingue contexto, topes, valores por defecto y extensión por lotes.

Una ventana de contexto de un millón de tokens dice poco sobre la longitud de la respuesta que puede producir un LLM. GPT-5.6 Luna anuncia una ventana de 1 050 000 tokens, pero una salida máxima de 128 000 tokens. La API nativa de MiniMax M3 publica un límite de generación de 524 288 tokens. Son restricciones distintas, incluso antes de que el razonamiento consuma parte del presupuesto de respuesta.[1][2]

La comparación útil consiste en saber qué tarea cabe: la entrada, el trabajo generado y la interfaz que lo entrega. Esta guía compara el máximo de tokens de salida de los LLM para informes largos, extracción estructurada y generación de código. Separa las especificaciones nativas de los proveedores de la interfaz publicada por reAPI, y las solicitudes síncronas del procesamiento por lotes. Las especificaciones se comprobaron el 8 de septiembre de 2026; un límite documentado no promete que el modelo produzca esa cantidad de tokens útiles.

Lo esencial

  • El límite de salida es independiente de la ventana de contexto. Luna permite 128 000 tokens de salida dentro de una ventana de 1 050 000. Una mayor capacidad de entrada no aumenta la salida máxima.[1]
  • Una recomendación no establece un valor por defecto. MiniMax recomienda 131 072 tokens para M3 y permite hasta 524 288. Su página API actual no identifica 131 072 como el valor utilizado cuando se omite el campo.[2]
  • El mayor valor aceptado puede no caber junto con tu entrada. Kimi K3 permite max_completion_tokens hasta 1 048 576, pero rechaza una solicitud si la entrada más ese límite superan su ventana de contexto.[3]
  • La ventana de DeepSeek se comparte. V4 Flash y Pro anuncian 1M de contexto y una salida máxima de 384K. La API limita la suma de los tokens de entrada y los generados.[4][5]

Máximo de tokens de salida por modelo y API

La tabla describe las API de los propios proveedores. «No indicado» significa que la especificación consultada no ofrece un valor numérico por defecto. No significa que la salida sea ilimitada.

Modelo y APIVentana de contextoPresupuesto máximo de generaciónValor por defecto o recomendaciónControl de salida
Kimi K3, Chat Completions nativo1M, según la notación del proveedorEl parámetro llega a 1 048 576; la entrada más el límite deben caberValor por defecto: 131 072max_completion_tokens
DeepSeek V4 Flash / Pro, Chat Completions nativo1M384K; también limitado por el contexto disponibleValor numérico por defecto no indicado en las páginas actualesmax_tokens
MiniMax M3, API nativa compatible con OpenAI1M524 288Recomendado: 131 072; valor numérico por defecto no indicadomax_completion_tokens
GPT-5.6 Luna / GPT-6 Astra, API nativa1 050 000128 000Valor numérico de salida por defecto no indicado en las páginas de los modelosChat Completions: max_completion_tokens; Responses: max_output_tokens
Claude Opus 5 / Opus 4.8, Messages síncrono1M128KEspecifica un presupuesto por solicitud; los valores de ejemplo no son valores por defectomax_tokens
Claude Opus 5 / Opus 4.8, Message Batches con extensión beta de salida1M300 000Requiere la función por lotes correspondiente y su cabecera betamax_tokens

Fuentes: páginas de parámetros y modelos de Kimi; precios y referencia API de DeepSeek; referencia API de MiniMax; páginas de los modelos Luna y Astra de OpenAI; documentación de contexto y procesamiento por lotes de Anthropic.[3][6][4][5][2][1][7][8][9]

Conserva las unidades de la fuente. DeepSeek publica 384K sin un número entero exacto en estas páginas. MiniMax relaciona expresamente 512K con 524 288. Convertir la «K» de todos los proveedores con el mismo multiplicador añadiría una precisión que las fuentes no respaldan.

La fila de lotes de Claude describe una capacidad distinta. Requiere output-300k-2026-03-24 en la API Message Batches, no en la API Messages síncrona. Anthropic indica actualmente que está disponible en Claude API y Claude Platform on AWS, con las demás plataformas de alojamiento excluidas. Que un modelo nativo admita esa función por lotes no demuestra que otra pasarela la ofrezca.[9]

Reserva espacio para el trabajo que el lector no verá

La referencia Chat Completions de OpenAI define max_completion_tokens como un límite que incluye la salida visible y los tokens de razonamiento. La guía de Responses también incluye los tokens de formato no visibles en su presupuesto de tokens generados. Claude cuenta igualmente el pensamiento dentro de max_tokens.[10][11][8]

Por tanto, un cálculo de planificación puede tener este aspecto:

Presupuesto de la solicitud:    30 000 tokens generados
Previsión para razonamiento:    10 000 tokens
Espacio para la salida visible: 20 000 tokens

Son asignaciones ilustrativas, no mediciones ni una promesa sobre la longitud del razonamiento de un modelo. Si una respuesta emplea más razonamiento del previsto, queda menos del mismo presupuesto para la respuesta visible. Aumentar el esfuerzo puede cambiar el trabajo realizado sin incrementar el límite que enviaste.

Para una tarea de salida larga, anota dos requisitos: la entrada que debe seguir disponible y el presupuesto de generación necesario. Cuenta las instrucciones del sistema, los mensajes conservados, las definiciones de herramientas y sus resultados cuando el punto de acceso los incluya. Después comprueba tanto el límite de salida como la restricción de contexto. Una solicitud puede cumplir uno e incumplir la otra.[8]

Esto importa al elegir un modelo. Un presupuesto necesario de generación de 150 000 tokens supera el máximo de 128 000 de Luna y Astra, con independencia del contexto sin usar. La extensión por lotes de Claude permite un presupuesto de ese tamaño bajo sus condiciones documentadas. Eso todavía no dice si el documento resultante será completo, correcto o si compensará su coste.[1][7][9]

El razonamiento siempre activo de Kimi es otro motivo para no anunciar su mayor valor de parámetro como una respuesta final de un millón de tokens. Su API comprueba la entrada más el límite antes de generar. La página de MiniMax describe un límite de longitud de generación, sin prometer que todo el presupuesto se convierta en texto útil. Fija un límite explícito e inspecciona lo que contiene realmente la respuesta.[3][12][2]

Usa el parámetro que corresponde al endpoint

La compatibilidad con OpenAI no hace intercambiables todos los parámetros. OpenAI utiliza max_completion_tokens en Chat Completions y max_output_tokens en Responses. La API Chat Completions nativa de DeepSeek utiliza max_tokens. La referencia nativa actual de MiniMax, compatible con OpenAI, marca max_tokens como obsoleto en favor de max_completion_tokens.[10][11][5][2]

Los controles de razonamiento también difieren. Kimi K3 acepta low, high y max, con max por defecto. DeepSeek acepta esos tres valores y utiliza high por defecto; sus alias de compatibilidad medium y xhigh equivalen a high. Luna admite none y varios niveles de razonamiento, con medium por defecto. Astra no admite none; su página actual no indica un esfuerzo por defecto.[12][13][1][7]

Claude controla el esfuerzo mediante output_config.effort. En Opus 5 y 4.8, el nivel superior se escribe xhigh, no extra. El valor por defecto documentado es high. Opus 5 activa el pensamiento adaptativo por defecto y solo permite desactivarlo con un esfuerzo high o inferior. Opus 4.8 empieza con el pensamiento desactivado hasta que se habilita.[14][15]

En reAPI, empieza por el catálogo actual de modelos y la documentación enlazada desde el modelo elegido. La página del modelo Luna indica sus límites de contexto y salida, mientras que la referencia API de Kimi identifica el campo de la solicitud. Trata el valor por defecto del proveedor nativo, el valor explícito de un ejemplo y el comportamiento real de una pasarela como hechos distintos. Especificar el límite que necesitas elimina una ambigüedad evitable.

Lee el error antes de cambiar de modelo

Las API gestionan de forma diferente una ventana llena:

InterfazSeñal documentadaQué comprobar
Kimi, Chat Completions nativoinvalid_request_error si la entrada más el límite solicitado superan el contextoReduce la entrada o el límite solicitado antes de reintentar
DeepSeek, Chat Completions nativofinish_reason: length puede indicar el límite de salida o el de contextoCompara el límite solicitado, el consumo y la entrada conservada
OpenAI Responsesstatus: incomplete, con incomplete_details.reason: max_output_tokensComprueba el consumo de razonamiento además de la salida visible
Claude Messages, Claude 4.5 y posterioresSe rechaza una entrada que por sí sola supera el contexto; una generación que alcanza el límite puede detenerse con model_context_window_exceededDistingue un prompt demasiado grande del agotamiento de la ventana durante la generación

Son reglas específicas de cada punto de acceso, no nombres de campos intercambiables.[3][5][11][8]

Una aplicación de agentes también puede detenerse antes de que el modelo alcance su límite. Conserva la respuesta original del proveedor junto con el error de la aplicación y los presupuestos configurados. Un mensaje como «límite de tokens de salida alcanzado» no identifica por sí solo si la restricción viene del proveedor, del SDK o del agente. Para presupuestar con DeepSeek, la guía existente de contexto 1M explica el cálculo de la ventana compartida.

Preguntas frecuentes

¿Puedo enviar 1M de tokens de entrada y recibir aun así la salida máxima?

No lo des por hecho. DeepSeek limita conjuntamente la entrada y la salida generada. Kimi comprueba la entrada más el límite solicitado. La ventana de Claude también incluye la salida generada y el pensamiento. Lee la regla del punto de acceso elegido antes de llenar el prompt hasta su capacidad anunciada.[5][3][8]

¿El modelo con el mayor límite de salida es el mejor para un informe largo?

El límite determina si el presupuesto solicitado es posible en esa interfaz. No mide la exactitud de los datos, el seguimiento de instrucciones ni cuánto texto útil necesita la tarea. Después de comprobar el límite, evalúa un informe representativo según sus criterios de finalización.

¿Recibir la respuesta en flujo aumenta el máximo de tokens?

Los límites de esta comparación son de generación. Recibir la respuesta en flujo cambia cómo llega la respuesta; no es la extensión exclusiva de lotes que eleva el límite de Claude a 300 000. Selecciona expresamente esa función cuando sea adecuada.[9]

¿Debo copiar 4096 u 8192 de un ejemplo como valor por defecto del modelo?

Un ejemplo muestra una solicitud que el autor decidió enviar. Usa un valor por defecto solo cuando la especificación del punto de acceso lo identifique expresamente así. Los 131 072 de MiniMax son una recomendación; Moonshot documenta explícitamente los 131 072 de Kimi como un valor nativo por defecto.[2][3]

¿Puede una respuesta agotar los tokens de salida sin producir una respuesta visible?

Sí, en el comportamiento de OpenAI Responses documentado aquí: el razonamiento puede consumir el presupuesto antes de que aparezca una salida visible. Inspecciona el estado incompleto y el consumo de tokens en vez de interpretar una respuesta vacía como prueba de que no hubo trabajo.[11]

¿Qué datos debo guardar para una comprobación en producción?

Guarda el identificador del modelo, el punto de acceso, el límite de salida solicitado, el nivel de esfuerzo, el consumo declarado de entrada y salida, el motivo de finalización o parada y si el resultado superó los criterios de finalización de la tarea. Registra estos datos juntos. Te permiten comparar el máximo de tokens de salida de los LLM con el presupuesto que utilizó realmente tu aplicación.

Elige el presupuesto antes que el modelo

Compara el máximo de tokens de salida de los LLM con una tarea representativa: la entrada que debes conservar, el presupuesto de generación necesario y si puedes utilizar una interfaz por lotes. Fija el límite explícitamente, ejecuta una pequeña evaluación y comprueba la calidad de finalización junto con el consumo de tokens. Si la tarea necesita más de una llamada, divídela en un límite significativo del documento o del código y conserva el estado necesario para la siguiente solicitud. Una ventana anunciada más grande no resuelve por sí sola un límite de salida.

Referencias

  1. OpenAI. Modelo GPT-5.6 Luna. Consultado el 8 de septiembre de 2026 en developers.openai.com/api/docs/models/gpt-5.6-luna.
  2. MiniMax. API Chat Completions. Consultado el 8 de septiembre de 2026 en platform.minimax.io/docs/api-reference/text-chat-openai.
  3. Moonshot AI. API Chat Completions. Consultado el 8 de septiembre de 2026 en platform.kimi.ai/docs/api/chat.
  4. DeepSeek. Modelos y precios. Consultado el 8 de septiembre de 2026 en api-docs.deepseek.com/zh-cn/quick_start/pricing.
  5. DeepSeek. API Chat Completions. Consultado el 8 de septiembre de 2026 en api-docs.deepseek.com/zh-cn/api/create-chat-completion.
  6. Moonshot AI. Lista de modelos. Consultado el 8 de septiembre de 2026 en platform.kimi.ai/docs/models.
  7. OpenAI. Modelo GPT-6 Astra. Consultado el 8 de septiembre de 2026 en developers.openai.com/api/docs/models/gpt-6-astra.
  8. Anthropic. Ventanas de contexto. Consultado el 8 de septiembre de 2026 en platform.claude.com/docs/en/build-with-claude/context-windows.
  9. Anthropic. Procesamiento por lotes: extensión beta de salida. Consultado el 8 de septiembre de 2026 en platform.claude.com/docs/en/build-with-claude/batch-processing.
  10. OpenAI. Crear una respuesta Chat Completions. Consultado el 8 de septiembre de 2026 en developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create.
  11. OpenAI. Modelos de razonamiento. Consultado el 8 de septiembre de 2026 en developers.openai.com/api/docs/guides/reasoning.
  12. Moonshot AI. Esfuerzo de razonamiento. Consultado el 8 de septiembre de 2026 en platform.kimi.ai/docs/guide/use-reasoning-effort.
  13. DeepSeek. Modo de razonamiento. Consultado el 8 de septiembre de 2026 en api-docs.deepseek.com/zh-cn/guides/thinking_mode.
  14. Anthropic. Esfuerzo. Consultado el 8 de septiembre de 2026 en platform.claude.com/docs/en/build-with-claude/effort.
  15. Anthropic. Pensamiento. Consultado el 8 de septiembre de 2026 en platform.claude.com/docs/en/build-with-claude/thinking.