Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Claude 컨텍스트 윈도우: 1M 토큰과 그것이 소비하는 것들
2026/07/27

Claude 컨텍스트 윈도우: 1M 토큰과 그것이 소비하는 것들

Claude의 컨텍스트 윈도우는 현재 모델에서 1M 토큰이지만, 도구 정의, 보존된 생각, 캐시된 입력이 모두 소비합니다. 더 크다는 것이 더 낫다는 뜻은 아닙니다.

컨텍스트 윈도우는 Claude가 응답을 생성할 때 참조할 수 있는 모든 내용으로, 응답 자체도 포함합니다. Anthropic은 이를 훈련 코퍼스와 구별되는 작업 메모리라고 부릅니다[1].

내면화할 가치가 있는 부분은 Anthropic이 그 정의 직후에 제시하는 문장입니다. 더 큰 컨텍스트가 반드시 더 좋다는 뜻은 아닙니다. 토큰 수가 증가함에 따라 정확도와 재현율이 저하되는데, 이를 문서에서는 컨텍스트 부패라고 부릅니다[1]. 무엇을 포함할지 큐레이션하는 것이 얼마나 많은 공간이 있는지만큼 중요합니다.

TL;DR

  • 현재 모델의 1M 토큰: Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5, Mythos 5. Sonnet 4.5를 포함한 다른 모델은 200k입니다[1].
  • 1M이 기본값입니다. 베타 헤더가 필요 없으며, 긴 컨텍스트 요청도 표준 가격으로 청구됩니다[1].
  • 출력도 계산됩니다. 확장된 생각 포함하며, 1M 윈도우 모델에서 max_tokens는 128k로 제한됩니다[1].
  • 요청의 모든 것이 계산됩니다: 시스템 프롬프트, 모든 메시지, 도구 결과, 이미지, 문서, 도구 정의[1].
  • 더 최신 모델은 이전 생각 블록을 기본으로 유지합니다. 이후 회차에서 입력으로 청구됩니다[1].
  • Sonnet 모델은 실시간 토큰 예산이 주입됩니다. Opus와 Fable은 그렇지 않습니다[1].

실제로 계산되는 것

Claude 컨텍스트 윈도우를 차지하는 것들: 시스템 프롬프트, 도구 정의, 도구 결과와 이미지가 있는 메시지, 다시 입력으로 청구되는 보존된 생각 블록, 이번 회차 출력(128k로 제한)

흔한 실수는 대화만 계산하는 것입니다. 전체 목록은 이렇습니다[1]:

  • 시스템 프롬프트
  • messages의 모든 메시지로, 도구 결과, 이미지, 문서 포함
  • 당신의 도구 정의
  • 이번 회차에서 Claude가 생성하는 출력, 확장된 생각 포함

모든 응답은 요청이 소비한 것을 usage 필드에서 보고합니다. 프롬프트 캐싱을 사용하면 입력 수가 input_tokens, cache_read_input_tokens, cache_creation_input_tokens로 나뉘는데, 세 개 모두 윈도우에 계산됩니다[1]. 캐시되었다는 것은 윈도우에서 자유롭다는 뜻이 아니라, 토큰당 더 저렴하다는 뜻입니다.

요청을 보내기 전에 크기를 계산하려면 문자 수로 추정하는 대신 토큰 계산 API를 사용하세요.

크기, 그리고 1M 윈도우의 실제 비용

모델컨텍스트 윈도우
Opus 5, Opus 4.8, Opus 4.7, Opus 4.61M
Sonnet 5, Sonnet 4.61M
Fable 5, Mythos 51M
Sonnet 4.5 및 기타 이전 모델200k

돈과 혼란을 줄이는 두 가지 세부 사항입니다[1]:

1M은 이 모델들의 기본값입니다. 보낼 베타 헤더가 없으며, 900k 토큰 요청은 9k 요청과 같은 토큰당 요율로 청구됩니다. 긴 컨텍스트 할증료는 없습니다.

최대 출력은 128k입니다. 남은 입력 공간이 얼마나 되든 관계없이 모든 1M 윈도우 모델에서입니다.

단일 요청은 최대 600개 이미지 또는 PDF 페이지(200k 윈도우 모델에서는 100개)를 처리할 수 있으며, 큰 페이로드는 토큰 제한에 먼저 도달하기 전에 요청 크기 제한에 도달할 수 있습니다[1].

생각이 산술을 변경합니다

생각 토큰은 max_tokens의 부분 집합이며, 출력으로 청구되고, 속도 제한을 향해 계산됩니다. 적응형 생각을 사용하면 할당이 요청마다 다르므로 사용은 프롬프트 길이만으로는 예측할 수 없습니다[1].

사람들을 놀라게 하는 행동은 이전 회차의 생각입니다.

Opus 4.5 이상, Sonnet 4.6 이상, Fable 5, Mythos 5에서는 API가 기본으로 이전 생각 블록을 유지합니다. 생성될 때 출력으로 한 번 청구되었고, 보존된 블록은 이후의 그것들을 전달하는 모든 요청에서 입력 토큰으로 다시 청구됩니다[1].

이전 Opus 및 Sonnet 모델과 모든 Haiku 모델에서는 API가 다시 전달될 때 자동으로 제거합니다.

긴 에이전틱 대화가 보이는 기록으로 설명되는 것보다 빠르게 컨텍스트를 소비하고 있다면, 보존된 생각이 대개 원인입니다. 생각 블록 정리는 어느 방향에서든 기본값을 무시합니다.

컨텍스트 인식: 일부 모델은 알고 일부는 모릅니다

이것이 대부분의 사람들이 인식하지 못하는 분할입니다[1].

Sonnet 5, Sonnet 4.6, Sonnet 4.5, Haiku 4.5는 남은 예산을 추적합니다. API는 모든 요청의 시스템 프롬프트에 합계를 주입합니다:

<budget:token_budget>200000</budget:token_budget>

그리고 각 도구 호출 후에 업데이트합니다:

<system_warning>Token usage: 35000/200000; 165000 remaining</system_warning>

이는 자동입니다. 이 태그를 직접 보내지 않으며, 이미지 토큰도 계산에 포함됩니다.

Opus 4.7 이상, Fable 5, Mythos 5는 이 태그를 받지 않습니다. 이들의 경우, 현재 베타 상태인 작업 예산으로 명시적 예산을 제공하세요.

실질적 결과: Sonnet 모델은 남은 공간에 대해 긴 작업의 속도를 조절할 수 있지만, Opus 모델은 당신이 말하지 않는 한 할 수 없습니다. 이는 기능 점수와 무관한 계층 간의 실제 행동 차이입니다.

대화가 윈도우를 초과할 때

두 가지 서버 측 메커니즘이 있으며, 둘 다 자신의 절단을 구축하기 전에 알 가치가 있습니다[1].

압축은 자동으로 서버에서 대화의 이전 부분을 요약하여 계속할 수 있도록 합니다. 베타이며, Claude 4.6 이상에서 사용 가능합니다.

컨텍스트 편집은 에이전틱 워크플로에서 오래된 도구 결과를 정리하는 것 등 더 목표화된 전략을 제공하는데, 이것이 보통 긴 대화의 토큰의 대부분이 실제로 사는 곳입니다.

둘 다 도달하는 것이 "가장 오래된 메시지 제거" 루프를 직접 만드는 것보다 낫습니다. 그 루프는 대화를 일관성 있게 만든 시스템 수준 컨텍스트를 버리는 경향이 있습니다.

이를 활용하기

큐레이션하세요, 채우지 마세요. 컨텍스트 부패는 문서화된 행동이지 소문이 아닙니다. 900k 토큰 프롬프트가 잘 선택된 90k 프롬프트보다 반드시 낫지는 않습니다.

도구 정의를 계산하세요. 이는 모든 요청에 포함되며, 큰 도구 스키마는 매 회차마다 고정 비용입니다.

긴 에이전틱 실행 중 보존된 생각을 모니터하세요.

필요한 행동을 하는 계층을 선택하세요. 모델이 긴 작업에 걸쳐 자신의 속도를 조절해야 한다면, Sonnet의 주입된 예산은 이를 자체적으로 수행합니다.

from openai import OpenAI

client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Read this repository and summarize the architecture."}],
    max_tokens=16000,
)
print(resp.usage)   # the number to reconcile against

1M 윈도우 모델의 요금은 reapi.ai/models에 있습니다.

FAQ

Claude의 컨텍스트 윈도우란 무엇입니까?

모델이 응답을 생성할 때 참조할 수 있는 모든 텍스트로, 응답 자체를 포함합니다. 이는 훈련 데이터가 아닌 작업 메모리입니다[1].

Claude의 컨텍스트 윈도우는 얼마나 큽니까?

Opus 5, Opus 4.8/4.7/4.6, Sonnet 5, Sonnet 4.6, Fable 5, Mythos 5에서는 1M 토큰입니다. Sonnet 4.5를 포함한 이전 모델은 200k입니다[1].

전체 1M 윈도우를 사용하는 것이 추가 비용이 드나요?

아니요. 1M 윈도우를 가진 모델에서는 1M이 기본값이며 요청은 긴 컨텍스트 할증료 없이 표준 가격으로 청구됩니다[1].

컨텍스트 윈도우에 무엇이 계산됩니까?

시스템 프롬프트, 도구 결과와 이미지 및 문서를 포함한 모든 메시지, 도구 정의, 확장된 생각을 포함한 출력. 캐시된 입력도 계산됩니다[1].

제 컨텍스트가 대화로 설명되는 것보다 빠르게 채워지는 이유는 무엇입니까?

더 최신 모델에서 API는 기본으로 이전 생각 블록을 유지하며, 이후 회차에서 입력으로 계산됩니다[1].

더 큰 컨텍스트가 항상 더 나은가요?

아니요. Anthropic은 토큰 수가 증가함에 따라 정확도와 재현율이 저하된다고 문서화했으며, 이를 컨텍스트 부패라고 부릅니다[1].

한 요청이 얼마나 많은 이미지를 처리할 수 있나요?

1M 윈도우 모델에서는 최대 600개 이미지 또는 PDF 페이지, 200k 윈도우 모델에서는 100개이며, 요청 크기 제한에 따릅니다[1].

대화가 윈도우를 초과하면 어떻게 됩니까?

서버 측 압축을 사용하세요. 이는 이전 회차를 요약하여 대화가 계속될 수 있도록 하거나, 오래된 도구 결과를 정리하기 위해 컨텍스트 편집을 사용하세요[1].

윈도우를 채우지 말고 예산을 책정하세요

Claude의 컨텍스트 윈도우에 대해 모든 사람이 인용하는 수치는 1M이며, 이는 가장 흥미로운 사실입니다. 긴 컨텍스트 통합이 작동하는지 결정하는 것은 회계입니다: 매 회차마다 따라다니는 도구 정의, 입력으로 청구되는 보존된 생각 블록, 여전히 공간을 소비하는 캐시된 토큰, 같은 예산을 놓고 경쟁하는 출력입니다.

Anthropic의 자체 프레이밍이 채택할 올바른 것입니다. 윈도우는 작업 메모리이고, 더 큰 것이 반드시 더 나은 것은 아니며, 무엇을 포함하도록 선택할지가 남은 공간이 얼마나 되는지보다 더 중요합니다.

참고문헌

  1. Anthropic. Context windows — sizes by model, what counts, thinking behavior, context awareness, compaction, and overflow. Retrieved July 2026 from docs.claude.com/en/docs/build-with-claude/context-windows

추가 읽을거리