Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Ventana de contexto GPT-6 Astra: el número 258K en Codex
2026/09/07

Ventana de contexto GPT-6 Astra: el número 258K en Codex

Entiende la ventana de contexto de 1,05M tokens de GPT-6 Astra, por qué Codex muestra 258K en sesión y cómo medir compresión sin estimaciones.

La ventana de contexto de 1.050.000 tokens de GPT-6 Astra es un límite del modelo de API, no una promesa de que cada sesión de Codex muestre 1,05M de tokens utilizables. Si Codex muestra alrededor de 258K en tu sesión y más tarde se comprime, trata esos números como un comportamiento de producto a nivel de sesión. OpenAI no publica 258K como especificación oficial de Astra ni revela una fórmula de asignación exacta en las fuentes citadas aquí.[1]

La respuesta útil es separar el contrato del modelo, el presupuesto de trabajo del producto, la cantidad ya ocupada y el umbral de compresión. Son números diferentes. Mide la sesión y la versión de cliente que realmente tienes; no deduzcas una fórmula de asignación oculta a partir de un contador redondeado.

Respuesta rápida

  • La API de Astra documenta una ventana de contexto de 1,05M tokens y 128K de salida máxima.[1]
  • Un contador de Codex es un presupuesto de trabajo del producto, no el límite del modelo de API. Si muestra alrededor de 258K, trátalo como una observación de sesión, no como una especificación oficial.
  • Las instrucciones, herramientas, espacio para salida, estado de conversación y compresión pueden reducir el conjunto de trabajo visible; OpenAI no publica una división exacta.
  • Mide la capacidad de API a través de la API, y haz que las tareas largas de Codex sobrevivan la compresión guardando requisitos, decisiones y resultados de prueba fuera del chat.

Los tres números que la gente está confundiendo

La frase "ventana de contexto" se usa con soltura en discusiones de productos. Antes de depurar, nombra el número que estás mirando.

NúmeroQué significaQué no demuestra
1.050.000El valor de ventana de contexto en el contrato del modelo de API de OpenAI para gpt-6-astraQue un cliente de Codex le da a un turno o sesión la cantidad completa
128.000El valor de salida máxima en la página del modeloQue cada solicitud reserva o produce 128.000 tokens
Alrededor de 258KUn valor que tu sesión actual de Codex puede mostrarUn límite permanente y documentado de Astra o una fórmula interna exacta

Dos números más importan: el presupuesto restante y el disparador de compresión, donde el producto resume o externaliza trabajos anteriores antes de una falla completa.

El máximo de página del modelo y el contador restante del producto pueden estar ambos correctos. Responden preguntas diferentes:

  • Contrato del modelo: cuánto contexto total puede soportar el modelo de API bajo su contrato documentado.
  • Presupuesto de trabajo en tiempo de ejecución: cuánto el producto actual elige o puede mantener activo para esta sesión.
  • Presupuesto restante: cuánto del presupuesto de trabajo restante después de instrucciones actuales, historial, material de herramientas y espacio para salida.
  • Umbral de compresión: cuándo el producto comienza a preservar la tarea en una forma más compacta.

No restes 128K de 1,05M y declares el resto como presupuesto de Codex. Si una sesión muestra 258K, no dividas por un porcentaje de seguridad asumido y declares el resultado como un límite oculto. Esos cálculos pueden producir números ordenados, pero el material citado de OpenAI no documenta esa asignación.

Un modelo de presupuesto práctico, no una especificación interna

Para planificación, ayuda usar una desigualdad conceptual:

instrucciones activas
+ conversación retenida
+ esquemas de herramientas
+ entradas y salidas de herramientas
+ archivos o fragmentos suministrados al modelo
+ espacio para salida
<= presupuesto de trabajo en tiempo de ejecución actual

Este es un modelo de contabilidad, no una descripción de ingeniería inversa de Codex. OpenAI no ha publicado, en las fuentes citadas aquí, el tamaño exacto de cada componente o la regla detrás de una pantalla de 258K. El valor de la ecuación es que cada elemento de la izquierda se puede observar o controlar durante una prueba.

La distinción también previene un error común de API. Una salida máxima de 128.000 no significa que la API siempre deje esa cantidad vacía, ni establecer un límite de salida más pequeño aumenta la ventana de contexto publicada del modelo. Simplemente establece un límite para esa respuesta. Inspecciona el uso devuelto por el punto final en lugar de estimarlo a partir de caracteres de documento o una barra de progreso de UI.

Para el ID de modelo actual, modalidades soportadas y comportamiento específico de ruta, usa la referencia de API de GPT-6 Astra. La página del modelo lleva la tarjeta de tarifa actual de reAPI. Esas páginas describen esa ruta; no definen el presupuesto de sesión de la aplicación Codex.

Qué cambia la compresión en Astra para Codex

La compresión existe porque los trabajos largos impulsados por herramientas finalmente llenan su contexto de trabajo activo. Históricamente, dice OpenAI, Codex resumió el trabajo acumulado, que podría omitir detalles como por qué falló una corrección o cómo se comportó un componente. Con Astra, OpenAI introdujo un mecanismo experimental de Codex que puede guardar notas en ventanas de contexto. Las ventanas anteriores permanecen buscables, por lo que el modelo puede recuperar un requisito o resultado de prueba anterior incluso cuando no se capturó en esas notas.[2]

Eso le da a una sesión larga tres formas distintas de memoria:

  1. Contexto activo: material inmediatamente presente para el turno actual.
  2. Notas entre ventanas: hechos seleccionados preservados cuando el contexto activo se agota.
  3. Ventanas anteriores buscables: mensajes y resultados de herramientas antiguos que se pueden recuperar cuando son relevantes.

El contexto activo es la parte que esperaríamos que un indicador de "tokens restantes" en vivo describiera. El artículo de OpenAI no explica cómo el contador de Codex trata notas o ventanas buscables. Esas dos formas pueden ayudar al agente recuperar información sin mantener cada byte activo. El historial buscable no es lo mismo que cada resultado anterior de herramientas que ocupa el contexto actual del modelo de una vez.

OpenAI dice que el nuevo mecanismo se puede habilitar en la configuración de Codex y se espera que se convierta en el predeterminado de Astra en las semanas posteriores al lanzamiento.[2] Porque ese estado es sensible al tiempo, verifica la documentación actual de Codex y tu versión instalada en lugar de copiar un fragmento de configuración no verificado. Este artículo intencionalmente no prescribe un override de ventana de contexto documentado.

Investiga una pantalla de 258K sin tratarla como universal

Una prueba útil compara sesiones, no memorias. Comienza con una tarea vacía y escribe las condiciones antes de agregar material.

Campo a registrarPor qué importa
Fecha y horaLos despliegues y predeterminados pueden cambiar
Versión de la aplicación o CLI de CodexLos clientes antiguos y nuevos pueden llevar catálogos o comportamientos diferentes
Tipo de cuenta y espacio de trabajoEl acceso del producto y los controles del espacio de trabajo pueden diferir
Etiqueta de modelo seleccionadaUna sesión puede no estar usando el modelo que pretendías
Sesión nueva o reanudadaUn hilo reanudado ya contiene trabajo retenido
Presupuesto total y restante mostradoEstos son los valores bajo investigación
Herramientas o integraciones habilitadasLos esquemas y resultados agregan material a la sesión
Evento de compresión y horaMuestra dónde actúo el producto, no meramente dónde comenzó el medidor
Resultado después de la compresiónRevela qué requisitos y hechos de prueba sobrevivieron

Luego ejecuta una secuencia controlada:

  1. Abre una nueva sesión, selecciona Astra y captura la etiqueta del modelo y presupuesto mostrado antes de adjuntar archivos o ejecutar herramientas.
  2. Dale una tarea de repositorio acotada y de solo lectura. Registra qué archivos se leen y si los comandos producen salida corta o larga.
  3. Pide el mismo entregable en una segunda sesión nueva, pero filtra búsquedas y limita registros en la fuente. Compara el cambio en el presupuesto mostrado.
  4. Si ocurre compresión, pide los criterios de aceptación originales, archivos modificados, enfoques fallidos y resultado de prueba más reciente. Verifica cada elemento contra el repositorio en lugar de aceptar un recuento fluido.
  5. Repite después de una actualización de cliente. No compares una sesión vieja reanudada con una nueva fresca y atribuyas cada diferencia al modelo.

Esta prueba no revelará detalles de implementación privada. Responderá la pregunta operacional: qué entradas consumen el presupuesto que ves, cuándo comprime este cliente y qué información debe escribirse en algún lugar duradero.

Si tu interfaz muestra 258K, preserva las condiciones completas de la prueba: versión de cliente, catálogo en tiempo de ejecución, cuenta, edad de sesión, herramientas habilitadas e entradas recientes. Sin esas variables y una especificación oficial de OpenAI, el número no puede promocionarse a un límite general de Codex.

La salida de herramientas puede consumir más espacio que la solicitud misma

Una tarea de codificación puede comenzar con un aviso de dos oraciones y aún así hacerse grande. Listados de archivos recursivos, archivos de bloqueo generados, paquetes minificados, informes de pruebas detallados, volcados de bases de datos y diffs repetidos pueden empequeñecer la solicitud original. El modelo puede necesitar solo cinco líneas de error relevantes, mientras que la herramienta devuelve cinco mil.

Reduce ese material antes de que entre en la conversación:

  • busca un símbolo o cadena de error antes de abrir un directorio completo;
  • solicita el rango de líneas relevante en lugar de un archivo generado completo;
  • muestra un diff enfocado, luego abre contexto sin cambios solo cuando sea necesario;
  • ejecuta la prueba única fallida antes de la suite completa;
  • limita pilas de seguimiento repetidas y preserva el registro completo como un archivo;
  • resume un resultado de datos grande con recuentos, luego inspecciona filas anómalas;
  • evita pegar la misma salida de construcción en varios turnos.

Esto no es meramente una forma de posponer la compresión. Los resultados de herramientas más pequeños y enfocados hacen que sea más fácil distinguir el error actual de fallos obsoletos. También dejan más espacio para requisitos, decisiones y verificación.

Mantén los artefactos completos fuera del chat y registra sus rutas. El agente puede reabrir el relevante cuando sea necesario. Una ruta más un hallazgo conciso es generalmente más útil que una transcripción copiada tres veces.

Diseña una tarea larga para que la compresión sea manejable

Un modelo de millones de tokens no es un sustituto para el estado del proyecto. Para un cambio de repositorio que puede abarcar varias ventanas de contexto, mantén un libro mayor compacto en el espacio de trabajo o sistema de tareas:

Objetivo:
Restricciones no negociables:
Archivos intencionalmente cambiados:
Decisiones y evidencia:
Enfoque fallido y por qué:
Verificaciones ejecutadas y resultado exacto:
Trabajo restante:
Punto de reversión:

Actualízalo cuando una decisión cambie, no después de cada comando. El libro mayor tiene dos funciones: permite que una sesión comprimida recupere los hechos que importan, y permite que un humano audite si el resumen del agente coincide con el árbol de trabajo real.

Usa criterios de aceptación explícitos. "Termina la refactorización" es frágil porque una sesión posterior a la compresión puede reinterpretar "terminar". "El analizador acepta estos tres accesorios, el punto final antiguo permanece detrás de un switch y sin cambios de archivos no relacionados" sobrevive la compresión mucho mejor.

Para una migración de API, la guía de migración de GPT-6 Astra proporciona una secuencia de descubrimiento, canario y reversión. Para preguntas de acceso de producto, separa Codex de Chat, Work y API usando la matriz de acceso de GPT-6 Astra.

Cuándo el contrato de API de 1,05M es el número que importa

Usa una prueba de API cuando el requisito sea enviar deliberadamente un contexto grande ensamblado a gpt-6-astra. Confirma el modelo con /v1/models, construye un accesorio representativo, establece un límite de salida acotado y almacena los campos de uso de la respuesta. Comienza muy por debajo del techo y aumenta solo si la tarea realmente se beneficia.

La guía del modelo Astra de OpenAI lista la compresión entre las capacidades disponibles a través de la API.[3] Ese es un mecanismo de API separado; no documenta el umbral o contabilidad usado por Codex.

La página del modelo de OpenAI también declara que las solicitudes con más de 272.000 tokens de entrada usan tasas de contexto más largo, aplicadas a la solicitud completa bajo la regla de precios publicada.[1] Ese umbral de precios de 272K no es evidencia de que Codex deba exponer 272K o 258K. Los niveles de precios, capacidad del modelo y presupuesto de trabajo de una aplicación son políticas independientes.

Un experimento de API debe responder una pregunta del producto, no probar que una carga útil grande puede ser aceptada. Una evaluación compacta podría comparar:

puntuación de retención = hechos necesarios recuperados correctamente / hechos necesarios consultados

costo aceptado = costo total liquidado / respuestas que pasan cada verificación requerida

Coloca hechos conocidos al principio, medio y final del accesorio. Pide respuestas que se puedan verificar exactamente. Registra latencia, uso de tokens y fallos. No declares que el modelo "usó la ventana completa" simplemente porque una solicitud se devolvió correctamente.

Solucionador de problemas para un presupuesto de Codex más pequeño de lo esperado

La página del modelo dice 1,05M, pero una sesión nueva de Codex dice 258K

Registra la versión del cliente, la etiqueta del modelo y el valor mostrado. Actualiza a través del canal oficial, abre una nueva sesión y verifica de nuevo. Si el valor persiste, reporta esos hechos a OpenAI. No describas la lectura como una especificación de API ni fuerces un valor de configuración de terceros en producción.

La compresión comienza más temprano que el total mostrado

Verifica si la interfaz muestra capacidad total o capacidad restante. Ten en cuenta el tamaño de la salida de herramientas reciente y si la sesión fue reanudada. El disparador de compresión puede incluir espacio que un simple recuento de texto visible no captura; las fuentes citadas no proporcionan su fórmula exacta.

La tarea olvida un requisito después de la compresión

Mueve restricciones duraderas y verificaciones de aceptación al libro mayor de tareas. Pide al agente que las restate, luego verifica la declaración contra el archivo. Las notas entre ventanas y búsqueda de OpenAI pueden ayudar la recuperación, pero no eliminan la necesidad de una fuente de verdad verificable.[2]

El medidor de contexto cae rápidamente después de un comando

Inspecciona qué devolvió el comando. Reemplaza listados amplios, registros completos o archivos generados grandes con salida filtrada. Guarda el artefacto completo fuera de la conversación para que permanezca disponible sin mantenerse activo.

Una solicitud de API directo falla por debajo de 1,05M

Verifica el ID de modelo exacto, punto final, configuración de entrada y salida y error devuelto. Cuenta tokens con el tokenizador apropiado para la solicitud en lugar de caracteres. La cifra de contexto es un máximo del modelo, no una garantía de que cada combinación de carga útil, solicitud de salida, cuenta y ruta sea aceptada.

FAQ

¿GPT-6 Astra realmente tiene una ventana de contexto de un millón de tokens?

Sí para el contrato del modelo de API oficial: OpenAI lista 1.050.000 tokens para gpt-6-astra, con una salida máxima separada de 128.000 tokens.[1]

¿Es 258K el límite oficial de Codex para Astra?

No. Las fuentes oficiales de OpenAI citadas aquí no definen un límite de Codex de 258K. Si tu interfaz muestra ese valor, registralo como comportamiento de esa sesión hasta que OpenAI documente el presupuesto relevante de Codex.

¿Puedo cambiar una configuración de Codex para forzar 1,05M?

No dependas de configuración copiada de comentarios sin coincidencias con documentación oficial para tu versión de cliente. Un número declarado más grande no demuestra que el tiempo de ejecución lo aceptó, y puede cambiar uso y comportamiento de compresión.

¿La compresión significa que Codex borra todo antes?

OpenAI dice que Astra puede guardar notas entre ventanas y buscar ventanas de contexto anteriores en Codex. Eso es diferente de mantener todo contenido anterior activo a la vez. Verifica requisitos críticos y resultados de pruebas después de un evento de compresión.[2]

¿Las llamadas de herramientas cuentan contra el contexto de trabajo?

Las definiciones de herramientas, argumentos y material devuelto son parte de la información que el agente debe procesar. La contabilidad exacta de Codex no se publica en las fuentes citadas, así que mide el cambio mostrado en una sesión controlada en lugar de asignar una sobrecarga fija a cada herramienta.

¿Es la API mejor que Codex para trabajo de contexto largo?

Resuelven problemas diferentes. La API es la superficie apropiada cuando tu aplicación ensambla y mide una solicitud bajo el contrato del modelo documentado. Codex suministra un arnés de codificación, herramientas, gestión de sesión y compresión. Elige basado en el flujo de trabajo, no en el número más grande en ninguna interfaz.

Mide la sesión que tienes, luego diseña para compresión

La cifra de 1,05M y una posible pantalla de sesión de 258K no son especificaciones en competencia. La primera es la capacidad del modelo de API documentada por OpenAI. La segunda es una condición a investigar en el tiempo de ejecución actual de Codex, no un límite publicado de Astra. Captura las condiciones en tiempo de ejecución y haz que la salida de herramientas y estado del proyecto sean auditables.

Luego un evento de compresión se convierte en una entrega planeada en lugar de un misterio. La sesión puede recuperar su objetivo, restricciones, decisiones y verificación más reciente de evidencia durable incluso cuando el conjunto de trabajo activo cambia.

References

  1. OpenAI API, "GPT-6 Astra Model", consultado el 7 de septiembre de 2026.
  2. OpenAI, "GPT-6 Astra: A new generation of intelligence", publicado el 3 de septiembre de 2026; consultado el 7 de septiembre de 2026.
  3. OpenAI API, "Model guidance: Using GPT-6 Astra", consultado el 7 de septiembre de 2026.