
Контекстное окно Claude: размер и из чего оно состоит
На текущих моделях Claude контекстное окно составляет 1M токенов, но определения инструментов, логика мышления и кеш его потребляют. Больше не означает лучше.
Контекстное окно — это всё, на что Claude может ссылаться при генерации ответа, включая сам ответ. Anthropic называет это рабочей памятью, в отличие от обучающего корпуса[1].
Главное, что стоит запомнить — это фраза, которая идёт сразу после этого определения: больше контекста — это не автоматически лучше. С ростом количества токенов точность и полнота ухудшаются; это явление в документации Anthropic называют контекстным затуханием[1]. Выбор того, что туда поместить, важен не менее чем сам размер.
TL;DR
- 1M токенов на текущих моделях: Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5, Mythos 5. Остальные, включая Sonnet 4.5, имеют 200k[1].
- 1M — по умолчанию. Нет никаких специальных заголовков, и долгие запросы тарифицируются по стандартной ставке[1].
- Вывод тоже считается, включая расширенное мышление, и
max_tokensограничен 128k на моделях с окном 1M[1]. - Всё в запросе считается: системный промпт, каждое сообщение, результаты инструментов, изображения, документы и определения инструментов[1].
- Более новые модели по умолчанию сохраняют блоки предыдущего мышления, поэтому они считаются входом для последующих ходов[1].
- Модели Sonnet получают динамический бюджет токенов; Opus и Fable — нет[1].
Что на самом деле считается

Распространённая ошибка — считать в расчёт только саму беседу. Полный список[1]:
- Системный промпт
- Каждое сообщение в
messages, включая результаты инструментов, изображения и документы - Ваши определения инструментов
- Вывод, который Claude генерирует в этом ходе, включая его расширенное мышление
Каждый ответ сообщает в поле usage, сколько токенов потребовался запрос. При кешировании входа счётчик токенов распределяется между input_tokens, cache_read_input_tokens и cache_creation_input_tokens, и все три считаются в окне[1]. Кешированное не означает свободное от окна; это означает дешевле за токен.
Чтобы рассчитать размер запроса перед отправкой, используйте API для подсчёта токенов вместо оценки по количеству символов.
Размеры и реальная стоимость 1M
| Модели | Контекстное окно |
|---|---|
| Opus 5, Opus 4.8, Opus 4.7, Opus 4.6 | 1M |
| Sonnet 5, Sonnet 4.6 | 1M |
| Fable 5, Mythos 5 | 1M |
| Sonnet 4.5 и другие более старые модели | 200k |
Два нюанса, которые экономят деньги и путаницу[1]:
1M по умолчанию на этих моделях. Нет никакого бета-заголовка для отправки, и запрос на 900k токенов тарифицируется по той же ставке за токен, что и запрос на 9k. Нет надбавки за долгий контекст.
Максимальный выход — 128k на любой модели с окном 1M, независимо от того, сколько входного пространства остаётся.
Один запрос может содержать до 600 изображений или страниц PDF (100 на моделях с окном 200k), и большие грузы могут достичь лимитов размера запроса раньше, чем лимита токенов[1].
Мышление меняет расчёты
Токены мышления — это подмножество max_tokens, они считаются выходом и влияют на лимиты частоты. При адаптивном мышлении распределение варьируется для каждого запроса, поэтому использование нельзя предсказать только по длине промпта[1].
Поведение, которое удивляет людей — что происходит с мышлением предыдущих ходов.
На Opus 4.5 и позже, Sonnet 4.6 и позже, Fable 5 и Mythos 5 API сохраняет блоки предыдущего мышления по умолчанию, и они считаются входом, как любые другие токены входа. Они были тарифицированы один раз как выход при генерации, а сохранённые блоки затем тарифицируются как вход для каждого последующего запроса, который их содержит[1].
На более старых моделях Opus и Sonnet и всех моделях Haiku API автоматически удаляет их при передаче обратно.
Если долгий агентский разговор потребляет контекст быстрее, чем это объясняет видимый текст, обычно виновата сохранённая логика мышления. Очистка блока логики мышления переопределяет умолчание в обе стороны.
Осведомлённость о контексте: некоторые модели знают, некоторые — нет
Это разделение, о котором большинство людей не знают[1].
Sonnet 5, Sonnet 4.6, Sonnet 4.5 и Haiku 4.5 отслеживают оставшийся бюджет. API внедряет итоговый размер в системный промпт каждого запроса:
<budget:token_budget>200000</budget:token_budget>и обновляет его после каждого вызова инструмента:
<system_warning>Token usage: 35000/200000; 165000 remaining</system_warning>Это автоматическое. Вы никогда не отправляете эти теги сами, и токены изображений включены в подсчёты.
Opus 4.7 и позже, Fable 5 и Mythos 5 не получают эти теги. Для них установите явный бюджет с помощью бюджетов задач, в настоящий момент в бета-версии.
Практическое следствие: модель Sonnet может темпировать долгую задачу против оставшегося пространства, в то время как модель Opus не может, если вы ей не сказали. Это реальное различие в поведении между уровнями, которое не имеет ничего общего с оценками возможностей.
Когда разговоры перерастают окно
Два серверные механизма, оба стоит знать, перед тем как строить собственное усечение[1].
Уплотнение автоматически резюмирует более ранние части разговора на сервере, чтобы он мог продолжаться после лимита. Бета, на Claude 4.6 и позже.
Редактирование контекста предлагает более целенаправленные стратегии, включая очистку старых результатов инструментов в агентских рабочих процессах, что обычно там, где живут основные токены долгого разговора.
Обращение к любому из них лучше, чем самодельный цикл «выбросить самые старые сообщения», который имеет тенденцию отбрасывать контекст уровня системы, который делал разговор связным.
Работа с ним
Курируйте, не наполняйте. Контекстное затухание — задокументированное поведение, не слух. Промпт на 900k токенов не автоматически лучше, чем хорошо выбранный на 90k.
Считайте определения инструментов. Они есть в каждом запросе, и большая схема инструмента — это фиксированный налог на каждый ход.
Смотрите на сохранённую логику мышления на более новых моделях во время долгих агентских запусков.
Выберите уровень с поведением, которое вам нужно. Если модели нужно темпировать себя в долгой задаче, внедрённый бюджет Sonnet делает это изначально.
from openai import OpenAI
client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Read this repository and summarize the architecture."}],
max_tokens=16000,
)
print(resp.usage) # the number to reconcile againstСтавки для моделей с окном 1M находятся на reapi.ai/models.
FAQ
Что такое контекстное окно в Claude?
Весь текст, который модель может использовать при генерации ответа, включая сам ответ. Это рабочая память, а не обучающие данные[1].
Какой размер контекстного окна у Claude?
1M токенов на Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5 и Mythos 5. Более старые модели, включая Sonnet 4.5, имеют 200k[1].
Стоит ли использование полного окна 1M дополнительно?
Нет. На моделях с окном 1M, 1M — это умолчание, и запросы тарифицируются по стандартной ставке без надбавки за долгий контекст[1].
Что считается в контекстном окне?
Системный промпт, все сообщения, включая результаты инструментов и изображения и документы, определения инструментов и выход, включая расширенное мышление. Кешированный вход тоже считается[1].
Почему мой контекст заполняется быстрее, чем это предполагает разговор?
На более новых моделях API сохраняет блоки предыдущего мышления по умолчанию, и они считаются входом для последующих ходов[1].
Всегда ли больше контекста лучше?
Нет. Anthropic задокументировала, что точность и полнота ухудшаются с ростом количества токенов, явление, называемое контекстным затуханием[1].
Сколько изображений может содержать один запрос?
До 600 изображений или страниц PDF на моделях с окном 1M, 100 на моделях с окном 200k, с учётом лимитов размера запроса[1].
Что происходит, когда разговор превышает окно?
Используйте сервер-сторонний компактинг, который резюмирует более ранние ходы, чтобы разговор продолжался, или редактирование контекста для очистки старых результатов инструментов[1].
Бюджетирование окна вместо его наполнения
Число, которое все цитируют о контекстном окне в Claude — 1M, и это наименее интересный факт о нём. То, что определяет, будет ли долгий контекстный интеграция работать — это учёт: определения инструментов, путешествующие на каждом ходу, сохранённые блоки логики мышления, считаемые входом, кешированные токены, все ещё потребляющие пространство, и выход, конкурирующий за один и тот же бюджет.
Собственный фрейм Anthropic — это правильный подход. Окно — это рабочая память, больше её не автоматически лучше, и то, что вы выбираете туда поместить, важнее, чем сколько места осталось.
References
- Anthropic. Context windows — sizes by model, what counts, thinking behavior, context awareness, compaction, and overflow. Retrieved July 2026 from docs.claude.com/en/docs/build-with-claude/context-windows
Further reading
- reAPI. How to use Claude Opus 5. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. Which Claude model is best for coding. reapi.ai/blog/best-claude-model-for-coding
- reAPI. Model catalog. reapi.ai/models
Автор

Категории
Ещё статьи

Claude Sonnet 5: применение, цена и производительность
Как использовать Claude Sonnet 5: официальные тесты против Opus 4.8, система усилий, плотный токенизатор, миграция кода и новые цены с сентября.


API музыкального видео: полные песни, фото и субтитры
Преобразуйте MP3 длительностью 10–300 секунд и 1–7 референс-фотографий в полноценный клип с примерами API, опциями субтитров и таблицами точных расходов.


Claude Fable 5.1: миграция и исправление ошибок инструментов
Мигрируйте с Claude Fable 5 без сбоев вызовов инструментов и истории диалога. Решение для принудительного выбора инструментов, блоков размышлений и fallback.
