Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
LLM 최대 출력 토큰 비교: 모델별 API 출력 한도와 컨텍스트, 추론 예산을 구분하는 방법
2026/09/08

LLM 최대 출력 토큰 비교: 모델별 API 출력 한도와 컨텍스트, 추론 예산을 구분하는 방법

LLM 최대 출력 토큰을 컨텍스트 윈도우, 추론 예산, API 매개변수와 구분해 비교합니다. 요청 한도와 기본값·권장값의 차이, Claude의 배치 전용 출력 확장 조건을 확인하고, 제공사 자체 API 사양을 reAPI 인터페이스와 혼동하지 않도록 명확하게 정리했습니다.

100만 토큰의 컨텍스트 윈도우만으로는 LLM이 얼마나 긴 답변을 만들 수 있는지 거의 알 수 없습니다. GPT-5.6 Luna의 컨텍스트 윈도우는 1,050,000토큰이지만 최대 출력은 128,000토큰입니다. MiniMax M3의 자체 API는 생성 한도를 524,288토큰으로 명시합니다. 추론이 응답 예산의 일부를 사용한다는 점을 고려하기 전부터, 서로 다른 제약입니다.[1][2]

실제로 비교해야 할 것은 입력, 생성에 필요한 작업, 결과를 전달하는 인터페이스까지 포함했을 때 수행하려는 작업이 한도 안에 들어가는지입니다. 이 글은 긴 보고서, 구조화된 데이터 추출, 코드 생성을 위한 LLM 최대 출력 토큰을 비교합니다. 제공사 자체 API의 사양과 reAPI의 공개 인터페이스를 구분하고, 동기 요청과 배치 처리도 나누어 살펴봅니다. 사양 확인일은 2026년 9월 8일입니다. 문서에 적힌 상한이 그만큼의 유용한 토큰을 생성한다는 보장은 아닙니다.

핵심 요약

  • 출력 한도와 컨텍스트 윈도우는 별개입니다. Luna는 1,050,000토큰의 윈도우 안에서 최대 128,000토큰을 출력할 수 있습니다. 입력 용량이 더 크다고 최대 출력까지 늘어나지는 않습니다.[1]
  • 권장값이 기본값인 것은 아닙니다. MiniMax는 M3에 131,072토큰을 권장하고 최대 524,288토큰을 허용합니다. 그러나 현재 API 페이지에는 필드를 생략했을 때 131,072를 사용한다고 명시되어 있지 않습니다.[2]
  • 매개변수의 최댓값이 입력과 함께 들어간다는 보장은 없습니다. Kimi K3는 max_completion_tokens에 최대 1,048,576을 허용하지만, 입력과 요청한 한도의 합이 컨텍스트 윈도우를 넘으면 요청을 거부합니다.[3]
  • DeepSeek는 하나의 윈도우를 공유합니다. V4 Flash와 Pro의 사양은 컨텍스트 1M, 최대 출력 384K입니다. API는 입력 토큰과 생성 토큰의 합을 제한합니다.[4][5]

모델과 API별 LLM 최대 출력 토큰

다음 표는 각 제공사가 직접 운영하는 API의 사양입니다. ‘명시되지 않음’은 확인한 사양에 숫자로 된 기본값이 없다는 뜻입니다. 출력이 무제한이라는 의미는 아닙니다.

모델 및 API컨텍스트 윈도우최대 생성 예산기본값 또는 권장값출력 제어 매개변수
Kimi K3, 자체 Chat Completions제공사 표기 기준 1M매개변수 범위는 최대 1,048,576. 입력과 한도의 합이 윈도우 안에 들어가야 함기본값 131,072max_completion_tokens
DeepSeek V4 Flash / Pro, 자체 Chat Completions1M384K. 사용 가능한 컨텍스트의 제한도 받음현재 페이지에 숫자 기본값이 명시되지 않음max_tokens
MiniMax M3, 자체 OpenAI 호환 API1M524,288권장값 131,072. 숫자 기본값은 명시되지 않음max_completion_tokens
GPT-5.6 Luna / GPT-6 Astra, 자체 API1,050,000128,000모델 페이지에 숫자로 된 출력 기본값이 명시되지 않음Chat Completions: max_completion_tokens, Responses: max_output_tokens
Claude Opus 5 / Opus 4.8, 동기 Messages1M128K요청 예산을 지정해야 함. 예제의 값은 기본값이 아님max_tokens
Claude Opus 5 / Opus 4.8, 출력 확장 베타를 적용한 Message Batches1M300,000해당 배치 기능과 베타 헤더가 필요함max_tokens

출처는 Kimi의 매개변수·모델 페이지, DeepSeek의 가격 페이지와 API 참조 문서, MiniMax의 API 참조 문서, OpenAI의 Luna·Astra 모델 페이지, Anthropic의 컨텍스트·배치 처리 문서입니다.[3][6][4][5][2][1][7][8][9]

단위는 출처의 표기를 유지합니다. DeepSeek는 해당 페이지에 정확한 정수 대신 384K라고 표기합니다. MiniMax는 512K가 524,288에 해당한다고 명시합니다. 모든 제공사의 ‘K’에 같은 배수를 적용하면 출처가 뒷받침하지 않는 정밀도를 덧붙이게 됩니다.

Claude의 배치 행은 별도의 기능입니다. 동기 Messages API가 아닌 Message Batches API에서 output-300k-2026-03-24를 지정해야 합니다. Anthropic이 현재 명시한 지원 환경은 Claude API와 Claude Platform on AWS이며, 다른 호스팅 플랫폼은 제외됩니다. 제공사 자체 API에서 배치를 지원하는 모델이라고 해서 다른 게이트웨이에서도 이 기능을 제공한다고 볼 수는 없습니다.[9]

독자에게 보이지 않는 작업에도 예산을 남겨야 합니다

OpenAI의 Chat Completions 참조 문서는 max_completion_tokens를 가시적 출력과 추론 토큰을 모두 포함하는 한도로 정의합니다. Responses 가이드는 보이지 않는 형식 처리 토큰도 생성 토큰 예산에 포함합니다. Claude 역시 사고 토큰을 max_tokens에 포함해 계산합니다.[10][11][8]

계획 단계에서는 다음과 같이 예산을 나눌 수 있습니다.

요청 예산:                   생성 토큰 30,000
추론에 배정할 예상 예산:      10,000토큰
가시적 출력에 남는 예산:      20,000토큰

이는 배분을 설명하기 위한 예시입니다. 측정 결과도, 모델의 추론 길이에 대한 약속도 아닙니다. 응답이 예상보다 많은 토큰을 추론에 사용하면 같은 총예산에서 답변에 쓸 수 있는 양은 줄어듭니다. 추론 강도를 높이면 수행하는 작업은 달라질 수 있지만, 요청에 보낸 상한이 함께 늘어나는 것은 아닙니다.

긴 글을 생성할 때는 두 가지 요구사항을 적어 봅니다. 계속 유지해야 하는 입력과 작업에 필요한 생성 예산입니다. 해당 엔드포인트의 계산 대상이라면 시스템 지시, 보존한 메시지, 도구 정의, 도구 실행 결과까지 포함합니다. 그런 다음 출력 상한과 컨텍스트 제약을 모두 확인합니다. 한쪽 조건은 통과해도 다른 쪽에서 실패할 수 있습니다.[8]

모델을 고를 때도 이 구분이 중요합니다. 생성 예산이 150,000토큰 필요하다면 사용하지 않은 컨텍스트가 아무리 많아도 Luna와 Astra의 최대 128,000토큰을 넘습니다. Claude의 배치 출력 확장은 문서에 명시된 조건에서 이 정도 예산을 수용할 수 있습니다. 그렇다고 결과 문서가 완전하고 정확하며 비용에 합당하다는 뜻은 아닙니다.[1][7][9]

Kimi는 추론이 항상 켜져 있습니다. 가장 큰 매개변수 값을 ‘100만 토큰짜리 최종 답변’으로 소개하면 안 되는 또 하나의 이유입니다. API는 생성 전에 입력과 요청한 한도의 합을 검사합니다. MiniMax 문서도 생성 길이의 한도를 설명할 뿐, 배정한 토큰이 전부 유용한 답변 본문이 된다고 약속하지 않습니다. 한도를 명시하고 실제 응답 내용을 확인해야 합니다.[3][12][2]

엔드포인트에 맞는 매개변수를 사용합니다

OpenAI 호환이라는 말이 모든 매개변수를 서로 바꿔 쓸 수 있다는 뜻은 아닙니다. OpenAI는 Chat Completions에서 max_completion_tokens, Responses에서 max_output_tokens를 사용합니다. DeepSeek의 자체 Chat Completions API는 max_tokens를 사용합니다. MiniMax의 현재 자체 OpenAI 호환 참조 문서는 max_tokens를 비권장으로 표시하고 max_completion_tokens를 사용하도록 안내합니다.[10][11][5][2]

추론 제어 방식도 다릅니다. Kimi K3는 low, high, max를 받고 기본값은 max입니다. DeepSeek도 이 세 값을 받지만 기본값은 high이며, 호환용 별칭인 mediumxhighhigh로 처리합니다. Luna는 none을 포함한 여러 추론 수준을 지원하고 기본값은 medium입니다. Astra는 none을 지원하지 않으며 현재 모델 페이지에는 기본 추론 강도가 명시되어 있지 않습니다.[12][13][1][7]

Claude는 output_config.effort로 추론 강도를 제어합니다. Opus 5와 4.8의 상위 수준은 extra가 아닌 xhigh로 표기합니다. 문서상 기본값은 high입니다. Opus 5는 적응형 사고가 기본적으로 활성화되어 있고, 추론 강도가 high 이하일 때만 사고를 끌 수 있습니다. Opus 4.8은 사고를 활성화하기 전까지 비활성 상태로 시작합니다.[14][15]

reAPI에서는 현재 모델 목록과 선택한 모델에 연결된 문서부터 확인합니다. Luna 모델 페이지에는 컨텍스트와 출력 한도가 적혀 있고, Kimi API 참조 문서에서는 요청 필드를 확인할 수 있습니다. 제공사 자체 API의 기본값, 예제에서 명시한 값, 게이트웨이의 실제 동작을 별개의 사실로 다뤄야 합니다. 원하는 한도를 직접 지정하면 피할 수 있는 모호함 하나를 없앨 수 있습니다.

모델을 바꾸기 전에 실패 원인을 확인합니다

윈도우가 가득 찼을 때의 처리는 API마다 다릅니다.

인터페이스문서에 명시된 신호확인할 사항
Kimi 자체 Chat Completions입력과 요청한 한도의 합이 컨텍스트를 초과하면 invalid_request_error재시도 전에 입력 또는 요청 한도를 줄임
DeepSeek 자체 Chat Completionsfinish_reason: length는 출력 한도나 컨텍스트 한도 도달을 의미할 수 있음요청한 한도, 사용량, 보존한 입력을 대조
OpenAI Responsesstatus: incomplete, incomplete_details.reason: max_output_tokens가시적 출력뿐 아니라 추론 사용량도 확인
Claude Messages, Claude 4.5 이상입력만으로 컨텍스트를 초과하면 거부. 생성 도중 경계에 도달하면 model_context_window_exceeded로 멈출 수 있음프롬프트 자체가 너무 큰 경우와 생성 중 용량이 소진된 경우를 구분

이들은 엔드포인트별로 정해진 규약입니다. 서로 바꿔 쓸 수 있는 필드명이 아닙니다.[3][5][11][8]

에이전트 애플리케이션이 모델 한도에 도달하기 전에 멈출 수도 있습니다. 제공사의 원본 응답을 애플리케이션 오류, 설정한 예산과 함께 보관해야 합니다. ‘출력 토큰 한도에 도달했습니다’라는 메시지만으로는 제공사, SDK, 에이전트 중 누가 제한을 적용했는지 알 수 없습니다. DeepSeek의 구체적인 예산 계산은 기존 1M 컨텍스트 가이드에서 공유 윈도우를 기준으로 설명합니다.

자주 묻는 질문

입력을 1M토큰 보내도 최대 출력까지 받을 수 있나요?

그렇게 가정하면 안 됩니다. DeepSeek는 입력과 생성 출력을 합쳐 제한합니다. Kimi는 입력과 요청한 한도의 합을 확인합니다. Claude의 윈도우에도 생성 출력과 사고가 포함됩니다. 공시된 용량만큼 프롬프트를 채우기 전에 선택한 엔드포인트의 규칙을 읽어야 합니다.[5][3][8]

출력 한도가 가장 큰 모델이 긴 보고서에도 가장 좋은가요?

한도로 알 수 있는 것은 해당 인터페이스에서 요청한 예산을 허용하는지입니다. 사실의 정확성, 지시를 따르는 능력, 작업에 필요한 유용한 텍스트의 양까지 측정하지는 않습니다. 한도를 확인한 뒤 대표적인 보고서로 평가하고 완료 기준을 충족하는지 살펴봐야 합니다.

스트리밍을 사용하면 토큰 상한이 높아지나요?

이 비교에 나온 한도는 생성 한도입니다. 스트리밍은 응답을 받는 방식을 바꾸는 것이며, Claude 상한을 300,000으로 높이는 배치 전용 확장과는 다릅니다. 그 기능이 필요한 경우 명시적으로 선택해야 합니다.[9]

예제의 4096이나 8192를 모델 기본값으로 사용해도 되나요?

예제는 작성자가 선택해 보낸 요청을 보여 줍니다. 엔드포인트 사양에 기본값이라고 명시된 값만 기본값으로 취급해야 합니다. MiniMax의 131,072는 권장값이며, Moonshot은 Kimi의 131,072를 자체 API의 기본값으로 명시합니다.[2][3]

답변이 나오기 전에 출력 토큰을 모두 쓸 수도 있나요?

여기서 다룬 OpenAI Responses의 문서화된 동작에서는 가능합니다. 가시적 출력이 나오기 전에 추론이 예산을 소모할 수 있습니다. 빈 답변을 아무 작업도 하지 않았다는 증거로 보지 말고, 미완료 상태와 토큰 사용량을 확인해야 합니다.[11]

프로덕션 검증을 위해 무엇을 기록해야 하나요?

모델 ID, 엔드포인트, 요청한 출력 한도, 추론 강도 설정, 보고된 입력·출력 사용량, 종료 또는 중지 사유, 결과가 작업 완료 검사에 통과했는지를 함께 기록합니다. 이 기록이 있어야 LLM 최대 출력 토큰과 애플리케이션이 실제로 사용한 예산을 비교할 수 있습니다.

모델보다 필요한 예산을 먼저 정합니다

대표적인 작업 하나를 기준으로 유지해야 할 입력, 필요한 생성 예산, 배치 인터페이스를 사용할 수 있는지를 정리하고 LLM 최대 출력 토큰과 비교합니다. 상한을 명시해 소규모 평가를 실행한 뒤 토큰 사용량과 완료 품질을 함께 확인합니다. 여러 번 호출해야 한다면 문서나 코드에서 의미 있는 경계로 작업을 나누고 다음 요청에 필요한 상태를 보존합니다. 공시된 윈도우가 더 크다는 이유만으로 출력 한도가 해결되지는 않습니다.

참고 문헌

  1. OpenAI. GPT-5.6 Luna 모델. 2026년 9월 8일 확인: developers.openai.com/api/docs/models/gpt-5.6-luna.
  2. MiniMax. Chat Completions API. 2026년 9월 8일 확인: platform.minimax.io/docs/api-reference/text-chat-openai.
  3. Moonshot AI. Chat Completions API. 2026년 9월 8일 확인: platform.kimi.ai/docs/api/chat.
  4. DeepSeek. 모델 및 가격. 2026년 9월 8일 확인: api-docs.deepseek.com/zh-cn/quick_start/pricing.
  5. DeepSeek. Chat Completions API. 2026년 9월 8일 확인: api-docs.deepseek.com/zh-cn/api/create-chat-completion.
  6. Moonshot AI. 모델 목록. 2026년 9월 8일 확인: platform.kimi.ai/docs/models.
  7. OpenAI. GPT-6 Astra 모델. 2026년 9월 8일 확인: developers.openai.com/api/docs/models/gpt-6-astra.
  8. Anthropic. 컨텍스트 윈도우. 2026년 9월 8일 확인: platform.claude.com/docs/en/build-with-claude/context-windows.
  9. Anthropic. 배치 처리: 출력 확장 베타. 2026년 9월 8일 확인: platform.claude.com/docs/en/build-with-claude/batch-processing.
  10. OpenAI. Chat Completion 생성. 2026년 9월 8일 확인: developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create.
  11. OpenAI. 추론 모델. 2026년 9월 8일 확인: developers.openai.com/api/docs/guides/reasoning.
  12. Moonshot AI. 추론 강도. 2026년 9월 8일 확인: platform.kimi.ai/docs/guide/use-reasoning-effort.
  13. DeepSeek. 사고 모드. 2026년 9월 8일 확인: api-docs.deepseek.com/zh-cn/guides/thinking_mode.
  14. Anthropic. 추론 강도. 2026년 9월 8일 확인: platform.claude.com/docs/en/build-with-claude/effort.
  15. Anthropic. 사고. 2026년 9월 8일 확인: platform.claude.com/docs/en/build-with-claude/thinking.