
Claude 컨텍스트 윈도우: 1M 토큰과 그것이 소비하는 것들
Claude의 컨텍스트 윈도우는 현재 모델에서 1M 토큰이지만, 도구 정의, 보존된 생각, 캐시된 입력이 모두 소비합니다. 더 크다는 것이 더 낫다는 뜻은 아닙니다.
컨텍스트 윈도우는 Claude가 응답을 생성할 때 참조할 수 있는 모든 내용으로, 응답 자체도 포함합니다. Anthropic은 이를 훈련 코퍼스와 구별되는 작업 메모리라고 부릅니다[1].
내면화할 가치가 있는 부분은 Anthropic이 그 정의 직후에 제시하는 문장입니다. 더 큰 컨텍스트가 반드시 더 좋다는 뜻은 아닙니다. 토큰 수가 증가함에 따라 정확도와 재현율이 저하되는데, 이를 문서에서는 컨텍스트 부패라고 부릅니다[1]. 무엇을 포함할지 큐레이션하는 것이 얼마나 많은 공간이 있는지만큼 중요합니다.
TL;DR
- 현재 모델의 1M 토큰: Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5, Mythos 5. Sonnet 4.5를 포함한 다른 모델은 200k입니다[1].
- 1M이 기본값입니다. 베타 헤더가 필요 없으며, 긴 컨텍스트 요청도 표준 가격으로 청구됩니다[1].
- 출력도 계산됩니다. 확장된 생각 포함하며, 1M 윈도우 모델에서
max_tokens는 128k로 제한됩니다[1]. - 요청의 모든 것이 계산됩니다: 시스템 프롬프트, 모든 메시지, 도구 결과, 이미지, 문서, 도구 정의[1].
- 더 최신 모델은 이전 생각 블록을 기본으로 유지합니다. 이후 회차에서 입력으로 청구됩니다[1].
- Sonnet 모델은 실시간 토큰 예산이 주입됩니다. Opus와 Fable은 그렇지 않습니다[1].
실제로 계산되는 것

흔한 실수는 대화만 계산하는 것입니다. 전체 목록은 이렇습니다[1]:
- 시스템 프롬프트
messages의 모든 메시지로, 도구 결과, 이미지, 문서 포함- 당신의 도구 정의
- 이번 회차에서 Claude가 생성하는 출력, 확장된 생각 포함
모든 응답은 요청이 소비한 것을 usage 필드에서 보고합니다. 프롬프트 캐싱을 사용하면 입력 수가 input_tokens, cache_read_input_tokens, cache_creation_input_tokens로 나뉘는데, 세 개 모두 윈도우에 계산됩니다[1]. 캐시되었다는 것은 윈도우에서 자유롭다는 뜻이 아니라, 토큰당 더 저렴하다는 뜻입니다.
요청을 보내기 전에 크기를 계산하려면 문자 수로 추정하는 대신 토큰 계산 API를 사용하세요.
크기, 그리고 1M 윈도우의 실제 비용
| 모델 | 컨텍스트 윈도우 |
|---|---|
| Opus 5, Opus 4.8, Opus 4.7, Opus 4.6 | 1M |
| Sonnet 5, Sonnet 4.6 | 1M |
| Fable 5, Mythos 5 | 1M |
| Sonnet 4.5 및 기타 이전 모델 | 200k |
돈과 혼란을 줄이는 두 가지 세부 사항입니다[1]:
1M은 이 모델들의 기본값입니다. 보낼 베타 헤더가 없으며, 900k 토큰 요청은 9k 요청과 같은 토큰당 요율로 청구됩니다. 긴 컨텍스트 할증료는 없습니다.
최대 출력은 128k입니다. 남은 입력 공간이 얼마나 되든 관계없이 모든 1M 윈도우 모델에서입니다.
단일 요청은 최대 600개 이미지 또는 PDF 페이지(200k 윈도우 모델에서는 100개)를 처리할 수 있으며, 큰 페이로드는 토큰 제한에 먼저 도달하기 전에 요청 크기 제한에 도달할 수 있습니다[1].
생각이 산술을 변경합니다
생각 토큰은 max_tokens의 부분 집합이며, 출력으로 청구되고, 속도 제한을 향해 계산됩니다. 적응형 생각을 사용하면 할당이 요청마다 다르므로 사용은 프롬프트 길이만으로는 예측할 수 없습니다[1].
사람들을 놀라게 하는 행동은 이전 회차의 생각입니다.
Opus 4.5 이상, Sonnet 4.6 이상, Fable 5, Mythos 5에서는 API가 기본으로 이전 생각 블록을 유지합니다. 생성될 때 출력으로 한 번 청구되었고, 보존된 블록은 이후의 그것들을 전달하는 모든 요청에서 입력 토큰으로 다시 청구됩니다[1].
이전 Opus 및 Sonnet 모델과 모든 Haiku 모델에서는 API가 다시 전달될 때 자동으로 제거합니다.
긴 에이전틱 대화가 보이는 기록으로 설명되는 것보다 빠르게 컨텍스트를 소비하고 있다면, 보존된 생각이 대개 원인입니다. 생각 블록 정리는 어느 방향에서든 기본값을 무시합니다.
컨텍스트 인식: 일부 모델은 알고 일부는 모릅니다
이것이 대부분의 사람들이 인식하지 못하는 분할입니다[1].
Sonnet 5, Sonnet 4.6, Sonnet 4.5, Haiku 4.5는 남은 예산을 추적합니다. API는 모든 요청의 시스템 프롬프트에 합계를 주입합니다:
<budget:token_budget>200000</budget:token_budget>그리고 각 도구 호출 후에 업데이트합니다:
<system_warning>Token usage: 35000/200000; 165000 remaining</system_warning>이는 자동입니다. 이 태그를 직접 보내지 않으며, 이미지 토큰도 계산에 포함됩니다.
Opus 4.7 이상, Fable 5, Mythos 5는 이 태그를 받지 않습니다. 이들의 경우, 현재 베타 상태인 작업 예산으로 명시적 예산을 제공하세요.
실질적 결과: Sonnet 모델은 남은 공간에 대해 긴 작업의 속도를 조절할 수 있지만, Opus 모델은 당신이 말하지 않는 한 할 수 없습니다. 이는 기능 점수와 무관한 계층 간의 실제 행동 차이입니다.
대화가 윈도우를 초과할 때
두 가지 서버 측 메커니즘이 있으며, 둘 다 자신의 절단을 구축하기 전에 알 가치가 있습니다[1].
압축은 자동으로 서버에서 대화의 이전 부분을 요약하여 계속할 수 있도록 합니다. 베타이며, Claude 4.6 이상에서 사용 가능합니다.
컨텍스트 편집은 에이전틱 워크플로에서 오래된 도구 결과를 정리하는 것 등 더 목표화된 전략을 제공하는데, 이것이 보통 긴 대화의 토큰의 대부분이 실제로 사는 곳입니다.
둘 다 도달하는 것이 "가장 오래된 메시지 제거" 루프를 직접 만드는 것보다 낫습니다. 그 루프는 대화를 일관성 있게 만든 시스템 수준 컨텍스트를 버리는 경향이 있습니다.
이를 활용하기
큐레이션하세요, 채우지 마세요. 컨텍스트 부패는 문서화된 행동이지 소문이 아닙니다. 900k 토큰 프롬프트가 잘 선택된 90k 프롬프트보다 반드시 낫지는 않습니다.
도구 정의를 계산하세요. 이는 모든 요청에 포함되며, 큰 도구 스키마는 매 회차마다 고정 비용입니다.
긴 에이전틱 실행 중 보존된 생각을 모니터하세요.
필요한 행동을 하는 계층을 선택하세요. 모델이 긴 작업에 걸쳐 자신의 속도를 조절해야 한다면, Sonnet의 주입된 예산은 이를 자체적으로 수행합니다.
from openai import OpenAI
client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Read this repository and summarize the architecture."}],
max_tokens=16000,
)
print(resp.usage) # the number to reconcile against1M 윈도우 모델의 요금은 reapi.ai/models에 있습니다.
FAQ
Claude의 컨텍스트 윈도우란 무엇입니까?
모델이 응답을 생성할 때 참조할 수 있는 모든 텍스트로, 응답 자체를 포함합니다. 이는 훈련 데이터가 아닌 작업 메모리입니다[1].
Claude의 컨텍스트 윈도우는 얼마나 큽니까?
Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5, Mythos 5에서는 1M 토큰입니다. Sonnet 4.5를 포함한 이전 모델은 200k입니다[1].
전체 1M 윈도우를 사용하는 것이 추가 비용이 드나요?
아니요. 1M 윈도우를 가진 모델에서는 1M이 기본값이며 요청은 긴 컨텍스트 할증료 없이 표준 가격으로 청구됩니다[1].
컨텍스트 윈도우에 무엇이 계산됩니까?
시스템 프롬프트, 도구 결과와 이미지 및 문서를 포함한 모든 메시지, 도구 정의, 확장된 생각을 포함한 출력. 캐시된 입력도 계산됩니다[1].
제 컨텍스트가 대화로 설명되는 것보다 빠르게 채워지는 이유는 무엇입니까?
더 최신 모델에서 API는 기본으로 이전 생각 블록을 유지하며, 이후 회차에서 입력으로 계산됩니다[1].
더 큰 컨텍스트가 항상 더 나은가요?
아니요. Anthropic은 토큰 수가 증가함에 따라 정확도와 재현율이 저하된다고 문서화했으며, 이를 컨텍스트 부패라고 부릅니다[1].
한 요청이 얼마나 많은 이미지를 처리할 수 있나요?
1M 윈도우 모델에서는 최대 600개 이미지 또는 PDF 페이지, 200k 윈도우 모델에서는 100개이며, 요청 크기 제한에 따릅니다[1].
대화가 윈도우를 초과하면 어떻게 됩니까?
서버 측 압축을 사용하세요. 이는 이전 회차를 요약하여 대화가 계속될 수 있도록 하거나, 오래된 도구 결과를 정리하기 위해 컨텍스트 편집을 사용하세요[1].
윈도우를 채우지 말고 예산을 책정하세요
Claude의 컨텍스트 윈도우에 대해 모든 사람이 인용하는 수치는 1M이며, 이는 가장 흥미로운 사실입니다. 긴 컨텍스트 통합이 작동하는지 결정하는 것은 회계입니다: 매 회차마다 따라다니는 도구 정의, 입력으로 청구되는 보존된 생각 블록, 여전히 공간을 소비하는 캐시된 토큰, 같은 예산을 놓고 경쟁하는 출력입니다.
Anthropic의 자체 프레이밍이 채택할 올바른 것입니다. 윈도우는 작업 메모리이고, 더 큰 것이 반드시 더 나은 것은 아니며, 무엇을 포함하도록 선택할지가 남은 공간이 얼마나 되는지보다 더 중요합니다.
참고문헌
- Anthropic. Context windows — sizes by model, what counts, thinking behavior, context awareness, compaction, and overflow. Retrieved July 2026 from docs.claude.com/en/docs/build-with-claude/context-windows
추가 읽을거리
- reAPI. How to use Claude Opus 5. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. Which Claude model is best for coding. reapi.ai/blog/best-claude-model-for-coding
- reAPI. Model catalog. reapi.ai/models
작성자

카테고리
더 많은 게시물

FLUX 3 vs Seedance 2.5: 키프레임, 최대 길이, 가격 비교
FLUX 3과 Seedance 2.5를 최대 길이, 키프레임 수, 레퍼런스 용량, 편집 기능, 오디오 생성, 출력 해상도, 그리고 API 가격으로 비교하여 선택하세요.


AI 뮤직비디오 생성 API: 음악·사진·가사로 전곡 영상 만들기
10초~5분 음악 파일과 1~7개 참고 이미지로 완성된 뮤직비디오를 한 번의 비동기 API 요청으로 생성하는 방법, 자막 옵션, 정확한 가격표를 정리했습니다.


게임 AI 이미지 캐싱 가이드: 비용 절감 방법
게임 이미지 생성 비용을 절감하기 위해 의미론적 키, 단일 제출, 비동기 폴링, 예산 제한, 영구 저장소를 활용한 캐시 우선 파이프라인을 구축합니다.
