Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Ventana de contexto en Claude: qué es y qué consume
2026/07/27

Ventana de contexto en Claude: qué es y qué consume

Ventana de 1M tokens en Claude, pero definiciones de herramientas, pensamiento retenido y datos cacheados la consumen. Más contexto no siempre es mejor.

La ventana de contexto es todo lo que Claude puede consultar mientras genera una respuesta, incluida la respuesta misma. Anthropic lo llama memoria de trabajo, a diferencia del corpus de entrenamiento[1].

La parte que vale la pena interiorizar es la frase que Anthropic coloca justo después de esa definición: más contexto no es automáticamente mejor. A medida que crece el número de tokens, la precisión y exhaustividad se degradan, un fenómeno que la documentación denomina context rot[1]. Curar lo que entra es tan importante como cuánto espacio hay.

TL;DR

  • 1M de tokens en modelos actuales: Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5, Mythos 5. Los demás, incluidos Sonnet 4.5, son 200k[1].
  • 1M es el estándar. Sin encabezado beta, y las solicitudes de contexto largo se facturan a precios estándar[1].
  • La salida también cuenta, incluido el pensamiento extendido, y max_tokens limita a 128k en modelos de ventana 1M[1].
  • Todo en la solicitud cuenta: prompt del sistema, todos los mensajes, resultados de herramientas, imágenes, documentos y definiciones de herramientas[1].
  • Los modelos más nuevos mantienen bloques de pensamiento anteriores por defecto, por lo que se facturan como entrada en turnos posteriores[1].
  • Los modelos Sonnet reciben un presupuesto de tokens inyectado en vivo; Opus y Fable no[1].

Qué realmente cuenta

Lo que ocupa una ventana de contexto de Claude: prompt del sistema, definiciones de herramientas, mensajes con resultados de herramientas e imágenes, bloques de pensamiento retenidos que se facturan como entrada de nuevo, y salida de este turno limitada a 128k

El error común es presupuestar solo para la conversación. La lista completa[1]:

  • El prompt del sistema
  • Cada mensaje en messages, incluidos resultados de herramientas, imágenes y documentos
  • Tus definiciones de herramientas
  • La salida que Claude genera este turno, incluido su pensamiento extendido

Cada respuesta informa qué consumió la solicitud en su campo usage. Con caché de prompt, el recuento de entrada se divide entre input_tokens, cache_read_input_tokens y cache_creation_input_tokens, y los tres cuentan hacia la ventana[1]. En caché no significa libre de la ventana; significa más barato por token.

Para dimensionar una solicitud antes de enviarla, usa la API de conteo de tokens en lugar de estimar desde la cantidad de caracteres.

Tamaños, y lo que realmente cuesta 1M

ModelosVentana de contexto
Opus 5, Opus 4.8, Opus 4.7, Opus 4.61M
Sonnet 5, Sonnet 4.61M
Fable 5, Mythos 51M
Sonnet 4.5 y otros modelos anteriores200k

Dos detalles que ahorran dinero y confusión[1]:

1M es el estándar en esos modelos. No hay encabezado beta para enviar, y una solicitud de 900k tokens se factura a la misma tarifa por token que una de 9k. No hay recargo por contexto largo.

La salida máxima es 128k en cualquier modelo de ventana 1M, sin importar cuánto espacio de entrada queda.

Una sola solicitud puede llevar hasta 600 imágenes o páginas PDF (100 en modelos de ventana 200k), y cargas útiles grandes pueden alcanzar límites de tamaño de solicitud antes de alcanzar el límite de tokens[1].

El pensamiento cambia la aritmética

Los tokens de pensamiento son un subconjunto de max_tokens, se facturan como salida y cuentan hacia los límites de velocidad. Con pensamiento adaptativo, la asignación varía por solicitud, por lo que el uso no es predecible solo a partir de la longitud del prompt[1].

El comportamiento que sorprende a la gente es lo que sucede con los turnos anteriores pensando.

En Opus 4.5 y posterior, Sonnet 4.6 y posterior, Fable 5 y Mythos 5, la API mantiene bloques de pensamiento anteriores por defecto, y cuentan hacia la ventana como cualquier otro token de entrada. Se facturaron una vez como salida cuando se generaron, y los bloques mantenidos se facturan nuevamente como entrada en cada solicitud posterior que los lleve[1].

En modelos Opus y Sonnet anteriores y todos los modelos Haiku, la API los elimina automáticamente cuando los pasas.

Si una conversación agentic larga consume contexto más rápido de lo que sugiere la transcripción visible, el pensamiento retenido es generalmente por qué. El borrado de bloque de pensamiento anula el estándar en cualquier dirección.

Conciencia de contexto: algunos modelos saben, algunos no

Esta es la división que la mayoría de la gente no conoce[1].

Sonnet 5, Sonnet 4.6, Sonnet 4.5 y Haiku 4.5 rastrean su presupuesto restante. La API inyecta el total en el prompt del sistema de cada solicitud:

<budget:token_budget>200000</budget:token_budget>

y lo actualiza después de cada llamada de herramienta:

<system_warning>Token usage: 35000/200000; 165000 remaining</system_warning>

Esto es automático. Nunca envías estas etiquetas tú mismo, e incluye tokens de imagen en los recuentos.

Opus 4.7 y posterior, Fable 5 y Mythos 5 no reciben estas etiquetas. Para esos, proporciona un presupuesto explícito con presupuestos de tarea, actualmente en beta.

La consecuencia práctica: un modelo Sonnet puede regular una tarea larga contra el espacio que queda, mientras que un modelo Opus no puede a menos que le digas. Esa es una diferencia de comportamiento real entre niveles que no tiene nada que ver con puntuaciones de capacidad.

Cuando las conversaciones superan la ventana

Dos mecanismos del lado del servidor, ambos valen la pena conocer antes de construir tu propio truncamiento[1].

La compactación resume automáticamente partes anteriores de la conversación en el servidor para que pueda continuar más allá del límite. Beta, en Claude 4.6 y posterior.

La edición de contexto ofrece estrategias más dirigidas, incluida la limpieza de resultados de herramientas antiguos en flujos de trabajo agentic, que es generalmente donde vive la mayor parte de los tokens de una conversación larga.

Recurrir a cualquiera de ellas es mejor que un bucle casero "dejar caer los mensajes más antiguos", que tiende a descartar el contexto de nivel de sistema que hacía coherente la conversación.

Trabajar con esto

Depura, no llenes. La degradación de contexto es un comportamiento documentado, no un rumor. Un prompt de 900k tokens no es automáticamente mejor que uno bien elegido de 90k.

Cuenta las definiciones de herramientas. Están en cada solicitud, y un esquema de herramienta grande es un impuesto fijo en cada turno.

Monitorea el pensamiento retenido en modelos más nuevos durante ejecuciones agentic largas.

Elige el nivel con el comportamiento que necesitas. Si un modelo necesita regularse a sí mismo en una tarea larga, el presupuesto inyectado de Sonnet lo hace de forma nativa.

from openai import OpenAI

client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Read this repository and summarize the architecture."}],
    max_tokens=16000,
)
print(resp.usage)   # the number to reconcile against

Las tarifas para los modelos de ventana 1M están en reapi.ai/models.

FAQ

¿Qué es la ventana de contexto en Claude?

Todo el texto que el modelo puede consultar mientras genera una respuesta, incluida la respuesta misma. Es memoria de trabajo, no datos de entrenamiento[1].

¿Cuán grande es la ventana de contexto de Claude?

1M de tokens en Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5 y Mythos 5. Los modelos anteriores, incluidos Sonnet 4.5, son 200k[1].

¿Usar la ventana completa de 1M cuesta extra?

No. En modelos con ventana 1M, 1M es el estándar y las solicitudes se facturan a tarifa estándar sin recargo por contexto largo[1].

¿Qué cuenta hacia la ventana de contexto?

Prompt del sistema, todos los mensajes incluidos resultados de herramientas, imágenes y documentos, definiciones de herramientas, y la salida incluido el pensamiento extendido. La entrada en caché también cuenta[1].

¿Por qué mi contexto se llena más rápido de lo que sugiere la conversación?

En modelos más nuevos la API mantiene bloques de pensamiento anteriores por defecto, y cuentan como entrada en turnos posteriores[1].

¿Es más contexto siempre mejor?

No. Anthropic documenta que la precisión y exhaustividad se degradan a medida que crece el número de tokens, un fenómeno llamado context rot[1].

¿Cuántas imágenes puede llevar una sola solicitud?

Hasta 600 imágenes o páginas PDF en modelos de ventana 1M, 100 en modelos de ventana 200k, sujeto a límites de tamaño de solicitud[1].

¿Qué sucede cuando una conversación supera la ventana?

Usa compactación del lado del servidor, que resume los turnos anteriores para que la conversación continúe, o edición de contexto para limpiar resultados de herramientas antiguos[1].

Presupuesta la ventana en lugar de llenarla

El número que todos citan sobre la ventana de contexto en Claude es 1M, y es el dato menos interesante al respecto. Lo que decide si una integración de contexto largo funciona es la contabilidad: definiciones de herramientas viajando en cada turno, bloques de pensamiento retenidos facturados como entrada, tokens en caché aún consumiendo espacio, y salida compitiendo por el mismo presupuesto.

El propio marco de referencia de Anthropic es el correcto para adoptar. La ventana es memoria de trabajo, más de ella no es automáticamente mejor, y lo que eliges poner en ella importa más que cuánto espacio queda.

Referencias

  1. Anthropic. Context windows — sizes by model, what counts, thinking behavior, context awareness, compaction, and overflow. Retrieved July 2026 from docs.claude.com/en/docs/build-with-claude/context-windows

Lecturas adicionales