
Контекстное окно GPT-6 Astra: почему Codex может показать 258K
Разбираемся с контекстным окном GPT-6 Astra из 1,05M токенов, с тем почему сессия Codex показывает меньше, и как измерить сжатие без предположений.
Контекстное окно из 1.050.000 токенов GPT-6 Astra — это лимит модели API, а не обещание, что каждая сессия Codex будет показывать 1,05M используемых токенов. Если в вашей сессии Codex отображается около 258K и позже происходит сжатие, рассматривайте эти числа как поведение на уровне сессии продукта. OpenAI не публикует 258K как официальную спецификацию Astra и не раскрывает точную формулу распределения в цитируемых здесь источниках.[1]
Полезный ответ — отделить контракт модели, рабочий бюджет продукта, уже занятое место и пороговое значение сжатия. Это разные числа. Измеряйте сессию и версию клиента, которые у вас фактически есть; не выводите скрытую формулу распределения из округлённого счётчика.
Быстрый ответ
- API Astra документирует контекстное окно 1,05M токенов и максимум 128K на выход.[1]
- Счётчик Codex — это рабочий бюджет продукта, а не лимит модели API. Если он показывает около 258K, рассматривайте это как наблюдение в сессии, не как официальную спецификацию.
- Инструкции, инструменты, зарезервированное место для выхода, состояние беседы и сжатие могут сокращать видимое рабочее множество; OpenAI не публикует точное распределение.
- Измеряйте ёмкость API через API, и спасайте длинные задачи Codex от сжатия, сохраняя требования, решения и результаты тестов вне чата.
Три числа, которые люди путают
Фраза «контекстное окно» применяется свободно в обсуждениях продукта. Перед отладкой назовите число, на которое вы смотрите.
| Число | Что оно означает | Что оно не доказывает |
|---|---|---|
| 1.050.000 | Значение контекстного окна в контракте модели API OpenAI для gpt-6-astra | Что клиент Codex отдаёт одному ходу или сессии всю сумму целиком |
| 128.000 | Значение максимума выхода на странице модели | Что каждый запрос резервирует или производит 128.000 токенов |
| Около 258K | Значение, которое может отображать ваша текущая сессия Codex | Задокументированный постоянный лимит Astra или точную внутреннюю формулу |
Два других числа имеют значение: оставшийся бюджет и порог сжатия, где продукт сжимает или экспортирует раньше выполненную работу перед полным отказом.
Максимум страницы модели и оставшийся счётчик продукта могут быть оба правильны. Они отвечают на разные вопросы:
- Контракт модели: сколько всего контекста может поддерживать модель API в соответствии с её задокументированным контрактом.
- Рабочий бюджет в среде выполнения: сколько текущий продукт выбирает или может держать активным для этой сессии.
- Оставшийся бюджет: сколько из рабочего бюджета остаётся после текущих инструкций, истории, материалов инструментов и зарезервированного места для выхода.
- Порог сжатия: когда продукт начинает сохранять задачу в более компактном виде.
Не вычитайте 128K из 1,05M и объявляйте остаток бюджетом Codex. Если сессия показывает 258K, не делите на предполагаемый процент безопасности и объявляйте результат скрытой крышкой. Такие вычисления могут дать аккуратные числа, но цитируемый материал OpenAI не документирует это распределение.
Практическая модель бюджета, не внутренняя спецификация
Для планирования полезно использовать концептуальное неравенство:
активные инструкции
+ сохранённая беседа
+ схемы инструментов
+ входы и выходы инструментов
+ файлы или выдержки, поставляемые модели
+ место для выхода
<= текущий рабочий бюджет в среде выполненияЭто модель учёта, а не обратный инжиниринг Codex. OpenAI не опубликовал, в цитируемых здесь источниках, точный размер каждого компонента или правило за отображением 258K. Ценность уравнения в том, что каждый элемент слева можно наблюдать или контролировать во время теста.
Это различие также предотвращает распространённую ошибку API. Максимум выхода в 128.000 не означает, что API всегда оставляет столько пусто, и установка меньшего лимита выхода не увеличивает опубликованное контекстное окно модели. Это просто устанавливает границу для того ответа. Проверяйте использование, возвращаемое конечной точкой, вместо оценки по символам документа или полоске прогресса UI.
Для текущего ID модели, поддерживаемых модальностей и поведения, связанного с маршрутом, используйте справку API GPT-6 Astra. Страница модели содержит текущий прайс-лист reAPI. Эти страницы описывают этот маршрут; они не определяют бюджет сессии приложения Codex.
Что меняется в Astra при сжатии для Codex
Сжатие существует потому, что длинные задачи с инструментами в конце концов заполняют активный контекст. Исторически, говорит OpenAI, Codex суммировал накопленную работу, что могло опустить детали вроде того, почему исправление провалилось или как работал компонент. С Astra OpenAI вводит экспериментальный механизм Codex, который может вести заметки через контекстные окна. Более ранние окна остаются доступны для поиска, так что модель может найти прошлое требование или результат теста даже когда он не был захвачен в этих заметках.[2]
Это даёт длинной сессии три отличные формы памяти:
- Активный контекст: материал, непосредственно присутствующий для текущего хода.
- Заметки между окнами: выбранные факты, сохранённые когда активный контекст переполняется.
- Доступные для поиска более ранние окна: старые сообщения и результаты инструментов, которые можно найти когда они релевантны.
Активный контекст — это часть, которую мы ожидали бы видеть в живом индикаторе «токенов осталось». Статья OpenAI не объясняет, как счётчик Codex относится к заметкам или окнам для поиска. Эти две формы могут помочь агенту восстановить информацию без сохранения каждого байта активным. Доступная для поиска история — это не то же самое, что каждый предыдущий результат инструмента, занимающий текущий контекст модели сразу.
OpenAI говорит, что новый механизм можно включить в конфигурации Codex и ожидается, что он станет предлагаемым по умолчанию в Astra в недели после запуска.[2] Поскольку этот статус чувствителен ко времени, проверяйте текущую документацию Codex и установленную версию вместо копирования непроверенного фрагмента конфигурации. Эта статья намеренно не предписывает недокументированный override контекстного окна.
Исследуйте отображение 258K без обобщения
Полезный тест сравнивает сессии, не воспоминания. Начните с пустой задачи и запишите условия перед добавлением материала.
| Поле для записи | Почему это важно |
|---|---|
| Дата и время | Развёртывания и значения по умолчанию могут меняться |
| Версия приложения или CLI Codex | Старые и новые клиенты могут нести разные каталоги или поведение |
| Тип аккаунта и рабочей области | Доступ продукта и управление рабочей областью могут различаться |
| Выбранная метка модели | Сессия может использовать не ту модель, которую вы намеревались |
| Новая или возобновлённая сессия | Возобновлённый поток уже содержит сохранённую работу |
| Показанный общий и оставшийся бюджет | Это значения под исследованием |
| Включённые инструменты или интеграции | Схемы и результаты добавляют материал в сессию |
| Событие и время сжатия | Показывает, где действовал продукт, не просто где начался счётчик |
| Результат после сжатия | Раскрывает какие требования и факты тестов пережили |
Затем запустите контролируемую последовательность:
- Откройте новую сессию, выберите Astra и захватите метку модели и показанный бюджет перед прикреплением файлов или запуском инструментов.
- Дайте ей ограниченную задачу репозитория только для чтения. Запишите какие файлы читаются и производит ли команды короткий или длинный вывод.
- Попросите того же результата во второй новой сессии, но отфильтруйте поиски и ограничьте логи у источника. Сравните изменение показанного бюджета.
- Если происходит сжатие, попросите исходные критерии приёмки, изменённые файлы, неудачные подходы и последний результат теста. Проверьте каждый элемент против репозитория вместо принятия беглого пересказа.
- Повторите после обновления клиента. Не сравнивайте возобновлённую старую сессию с новой свежей и не приписывайте каждое различие модели.
Этот тест не раскроет приватные детали реализации. Он ответит на операционный вопрос: какие входы используют видимый вам бюджет, когда этот клиент сжимает и какую информацию нужно писать в прочное место.
Если ваш интерфейс показывает 258K, сохраняйте полные условия теста: версия клиента, каталог среды выполнения, аккаунт, возраст сессии, включённые инструменты и последние входы. Без этих переменных и официальной спецификации OpenAI число не может быть повышено в ранг общего лимита Codex.
Вывод инструмента может потребить больше места чем сам запрос
Задача кодирования может начаться с подсказки из двух предложений и всё равно стать большой. Рекурсивные листинги файлов, сгенерированные файлы блокировки, минифицированные пакеты, многословные отчёты тестов, дампы баз данных и повторяющиеся диффы могут затмить исходный запрос. Модели может понадобиться только пять релевантных строк ошибки, в то время как инструмент возвращает пять тысяч.
Уменьшайте этот материал перед тем как он войдёт в беседу:
- ищите символ или строку ошибки перед открытием целого каталога;
- запрашивайте релевантный диапазон строк вместо целого сгенерированного файла;
- показывайте сфокусированный diff, затем открывайте неизменённый контекст только когда нужно;
- запускайте единственный провальный тест перед полной suite;
- ограничивайте повторяющиеся трассировки стека и сохраняйте полный лог как файл;
- суммируйте большой результат данных с подсчётами, затем проверяйте аномальные строки;
- избегайте вставки одного и того же вывода сборки в несколько ходов.
Это не просто способ отложить сжатие. Меньшие, более целенаправленные результаты инструментов облегчают различие текущей ошибки от застарелых отказов. Они также оставляют больше места для требований, решений и проверки.
Сохраняйте полные артефакты вне чата и записывайте их пути. Агент может переоткрыть релевантный когда понадобится. Путь плюс краткий вывод обычно полезнее чем стенограмма скопирована трижды.
Спроектируйте длинную задачу так чтобы сжатие было управляемо
Миллионотокенная модель — это не замена для состояния проекта. Для изменения репозитория, которое может охватить несколько контекстных окон, ведите компактный журнал в рабочей области или системе задач:
Цель:
Неоспоримые ограничения:
Файлы намеренно изменённые:
Решения и доказательство:
Неудачный подход и почему:
Проведённые проверки и точный результат:
Остающаяся работа:
Точка отката:Обновляйте его когда решение меняется, не после каждой команды. Журнал имеет две функции: позволяет сжатой сессии восстановить значимые факты, и позволяет человеку проверить совпадает ли пересказ агента с фактическим рабочим деревом.
Используйте явные критерии приёмки. «Закончи рефакторинг» хрупкий потому что постсжатая сессия может переинтерпретировать «закончить». «Парсер принимает эти три фиксктуры, старая конечная точка остаётся за switch и никакие посторонние файлы не меняются» лучше переживает сжатие.
Для миграции API руководство по миграции GPT-6 Astra предоставляет последовательность обнаружения, канарейки и отката. Для вопросов доступа продукта разделяйте Codex от Chat, Work и API используя матрицу доступа GPT-6 Astra.
Когда контракт API 1,05M — это число которое имеет значение
Используйте API тест когда требование отправить намеренно собранный большой контекст к gpt-6-astra. Подтвердите модель с /v1/models, постройте репрезентативный фиксчтур, установите ограниченный лимит выхода и сохраните поля использования ответа. Начните значительно ниже потолка и увеличивайте только если задача действительно выигрывает.
Руководство модели Astra OpenAI перечисляет сжатие среди возможностей доступных через API.[3] Это отдельный механизм API; он не документирует порог или учёт используемый Codex.
Страница модели OpenAI также говорит что запросы с более чем 272.000 токенов входа используют более высокие долгоконтекстные ставки, применяемые ко всему запросу под опубликованным правилом цен.[1] Этот порог цен 272K — это не доказательство что Codex должен показывать 272K или 258K. Уровни цен, ёмкость модели и рабочий бюджет приложения — это независимые политики.
Эксперимент API должен ответить на вопрос продукта, не доказать что большая полезная нагрузка может быть принята. Компактная оценка могла бы сравнить:
оценка сохранения = точно восстановленные необходимые факты / запрошенные необходимые факты
принятая стоимость = общая окончательная стоимость / ответы проходящие каждую необходимую проверкуПоместите известные факты в начало, середину и конец фиксчтура. Просите ответы которые можно проверить точно. Записывайте задержку, использование токенов и отказы. Не заявляйте что модель «использовала полное окно» просто потому что запрос вернулся успешно.
Диагностика неожиданно малого бюджета Codex
Страница модели говорит 1,05M, но новая сессия Codex говорит 258K
Запишите версию клиента, метку модели и показанное значение. Обновитесь через официальный канал, откройте новую сессию и проверьте ещё раз. Если значение остаётся, отправьте эти факты в OpenAI. Не описывайте чтение как спецификацию API и не форсируйте значение конфигурации от третьей стороны в продакшн.
Сжатие начинается раньше показанного общего значения
Проверьте показывает ли интерфейс общую ёмкость или оставшуюся ёмкость. Обратите внимание на размер недавнего вывода инструмента и была ли сессия возобновлена. Порог сжатия может включать место которое простой подсчёт видимого текста не захватывает; цитируемые источники не предоставляют его точную формулу.
Задача забывает требование после сжатия
Перемещайте прочные ограничения и проверки приёмки в журнал задачи. Попросите агента пересказать их, затем проверьте высказывание против файла. Заметки между окнами и поиск OpenAI могут помочь восстановлению, но они не убирают нужду в проверяемом источнике истины.[2]
Счётчик контекста быстро падает после команды
Проверьте что вернула команда. Заменяйте широкие листинги, полные логи или большие сгенерированные файлы на отфильтрованный вывод. Сохраняйте полный артефакт вне беседы чтобы он остался доступен без активности.
Прямой запрос API проваливается ниже 1,05M
Проверьте точный ID модели, конечную точку, настройки входа и выхода и возвращённую ошибку. Считайте токены с токенизатором подходящим запросу вместо символов. Цифра контекста — это максимум модели, не гарантия что каждое сочетание полезной нагрузки, запроса выхода, аккаунта и маршрута будет принято.
FAQ
Правда ли что GPT-6 Astra имеет контекстное окно в миллион токенов?
Да для официального контракта модели API: OpenAI перечисляет 1.050.000 токенов для gpt-6-astra с отдельным максимумом выхода 128.000 токенов.[1]
Является ли 258K официальным лимитом Codex для Astra?
Нет. Официальные источники OpenAI цитируемые здесь не определяют лимит Codex 258K. Если ваш интерфейс показывает это значение, записывайте его как поведение той сессии пока OpenAI не задокументирует релевантный бюджет Codex.
Могу ли я изменить настройку Codex чтобы форсировать 1,05M?
Не полагайтесь на конфигурацию скопированную из комментариев без совпадения официальной документации для вашей версии клиента. Большее объявленное число не доказывает что среда выполнения его принялась, и это может менять использование и поведение сжатия.
Означает ли сжатие что Codex удаляет всё перед тем?
OpenAI говорит что Astra может хранить заметки между окнами и искать более ранние контекстные окна в Codex. Это отлично от сохранения всего прошлого контента активным сразу. Проверяйте критические требования и результаты тестов после события сжатия.[2]
Считаются ли вызовы инструментов в рабочий контекст?
Определения инструментов, аргументы и возвращённый материал — это часть информации которую должен обработать агент. Точный учёт Codex не опубликован в цитируемых источниках, поэтому измеряйте показанное изменение в контролируемой сессии вместо назначения фиксированной нагрузки каждому инструменту.
Лучше ли API чем Codex для длинноконтекстной работы?
Они решают разные проблемы. API — это подходящая поверхность когда ваше приложение собирает и измеряет запрос в соответствии с задокументированным контрактом модели. Codex поставляет harness кодирования, инструменты, управление сессией и сжатие. Выбирайте на основе workflow, не на самом большом числе в любом интерфейсе.
Измеряйте сессию которая у вас есть, затем проектируйте для сжатия
Цифра 1,05M и возможное отображение сессии 258K — это не конкурирующие спецификации. Первая — это задокументированная ёмкость модели API OpenAI. Вторая — это состояние для исследования в текущей среде выполнения Codex, не опубликованный лимит Astra. Захватывайте условия среды выполнения и делайте вывод инструмента и состояние проекта проверяемым.
Затем событие сжатия становится планируемой передачей вместо загадки. Сессия может восстановить свою цель, ограничения, решения и последнюю проверку из прочного доказательства даже когда активное рабочее множество меняется.
References
- OpenAI API, "GPT-6 Astra Model", доступно 7 сентября 2026.
- OpenAI, "GPT-6 Astra: A new generation of intelligence", выпущено 3 сентября 2026; доступно 7 сентября 2026.
- OpenAI API, "Model guidance: Using GPT-6 Astra", доступно 7 сентября 2026.
Автор

Категории
Ещё статьи

Как управлять движением видео AI через раскадровку
Практическое руководство по преобразованию сложного движения в упорядоченные ключевые кадры с определением ролей, промптами, тестами и проверкой результатов.


Критик для агента генерации видео: цикл проверки качества
Постройте цикл критика для видеоагента с правилами принятия, областями восстановления, бюджетами повторов и человеческим контролем перед финализацией.


Цена API удаления фона: расчет за полезное изображение
Рассчитайте стоимость API удаления фона от текущей ставки 88 кредитов, добавьте отклоненные результаты, повторные попытки, хранение и проверку качества.
