Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
GLM-5.2 API 가이드: 1M 컨텍스트, 요금, 코딩(2026)
2026/08/01

GLM-5.2 API 가이드: 1M 컨텍스트, 요금, 코딩(2026)

GLM-5.2 API를 OpenAI 호환 코드로 사용하세요. 1M 컨텍스트, $1.40/$4.40 공식 요금, reAPI 요금, 추론 제어, 제한을 알아봅시다.

GLM-5.2는 긴 지평선 코딩과 에이전트 작업용 Z.AI의 공개 가중치 플래그십입니다. GLM-5.2 API는 백만 토큰 컨텍스트 윈도우, 128K 최대 출력, 비활성화 가능한 추론, 함수 호출, JSON 모드, OpenAI 호환 요청 형태를 결합합니다.[1]

헤드라인 가격은 경쟁력 있습니다: Z.AI는 입력 토큰당 $1.40, 캐시된 입력 $0.26, 출력 토큰당 $4.40을 공시합니다. reAPI는 현재 호환 게이트웨이를 통해 입력 $0.90, 출력 $3을 공시하고 있습니다.[2]

요약

  • 모델 id: glm-5.2, 점이 포함됩니다.
  • 컨텍스트: 1M 토큰; 최대 출력은 131,072 토큰입니다.
  • 공식 가격: MTok당 입력 $1.40, 캐시된 입력 $0.26, 출력 $4.40입니다.
  • reAPI 가격: MTok당 입력 $0.90, 출력 $3입니다.
  • 추론: 기본 활성화이지만 전환 가능합니다.
  • 추론 노력: 7개 레이블을 허용하지만 3가지 효과적 행동으로 축약됩니다; 기본값은 max입니다.
  • 도구: 최대 128개 함수, tool_choice: "auto", 스트리밍 도구 호출 인수입니다.
  • 주요 함정: 페이지 슬러그는 glm-5-2이지만 API 요청은 glm-5.2를 전송해야 합니다.

GLM-5.2 사양

속성GLM-5.2
공급업체Z.AI
배포공개 가중치
API 모델 idglm-5.2
컨텍스트 윈도우1,000,000 토큰
최대 출력131,072 토큰
입력/출력텍스트 / 텍스트
추론 기본값활성화
추론 기본값max
온도0.0–1.0, 기본값 1.0
Top-p0.01–1.0, 기본값 0.95
도구최대 128개 함수
구조화된 출력JSON 객체 모드, JSON Schema 아님

Z.AI는 모델을 긴 지평선 작업에 위치시킵니다. 긴 컨텍스트는 대규모 코드베이스와 문서 컬렉션을 지원하지만, 매 턴마다 모든 파일을 보내는 이유로 취급되어서는 안 됩니다. 검색과 컨텍스트 선택이 여전히 지연시간과 비용을 줄입니다.

GLM-5.2 API 요금

경로입력 / MTok캐시된 입력출력 / MTok
Z.AI 공식$1.40$0.26$4.40
reAPI$0.90별도 공시 안 함$3.00

캐시되지 않은 입력 토큰 100M과 출력 토큰 20M의 월간 워크로드는 단순 표준 요금 계산이 다음과 같습니다:

Z.AI: 100 × $1.40 + 20 × $4.40 = $228
reAPI: 100 × $0.90 + 20 × $3.00 = $150

그 예는 동일한 토큰 사용량과 캐시 히트 없음을 가정합니다. Z.AI의 $0.26 캐시 요금은 반복된 시스템 프롬프트, 도구 정의 또는 안정적인 리포지토리 컨텍스트가 있는 워크로드를 실질적으로 변경할 수 있습니다.

추론 노력 레이블은 3가지 행동으로 축약됩니다

GLM-5.2는 의미 있게 실행하는 것보다 더 많은 노력 문자열을 허용합니다. Z.AI의 요청 행동에 따르면 값은 다음과 같이 매핑됩니다:

GLM-5.2 추론 노력 맵은 7개의 허용된 레이블을 추론 없음, 높음, 최대 행동으로 축약합니다

전송된 값효과적 행동
none, minimal추론 건너뛰기
low, medium, high높은 추론
xhigh, max최대 추론

기본값은 max이며, 이는 일상적인 분류, 추출 및 단순 코드 편집에 비용이 많이 듭니다. 작업에 추론이 필요하지만 최대가 아닌 경우 high를 전송합니다. 결정론적이고 간단한 경우 none과 추론 비활성화를 비교합니다.

reasoning_effort는 추론이 활성화된 동안에만 중요합니다. maxthinking: {"type": "disabled"}를 재정의할 것으로 예상하지 마세요.

대화 추론 처리 방식

GLM-5.2는 보이는 contentreasoning_content와 분리합니다. 기본 clear_thinking: true로, 이전 추론은 턴 간에 유지되지 않고 제거됩니다. 완전한 추론 기록이 계속 관련 있고 애플리케이션이 전체 정렬된 메시지를 올바르게 재생할 수 있을 때만 false로 설정합니다.[3]

이는 유지된 추론이 필수인 Kimi K3와 다릅니다. GLM-5.2는 더 깔끔한 컨텍스트와 숨겨진 작업의 연속성 중에서 선택할 수 있습니다.

OpenAI Python SDK로 GLM-5.2 호출

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

stream = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "user", "content": "Refactor this module and add tests."}
    ],
    max_tokens=8192,
    stream=True,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="")
    if delta.content:
        print(delta.content, end="")

모델 id는 점을 포함합니다. glm-5-2는 웹사이트 슬러그이며 요청 본문에 전송되면 알 수 없는 모델 오류를 발생시킵니다.

함수 호출과 구조화된 출력

GLM-5.2는 최대 128개 함수 정의를 지원하고 tool_stream이 활성화된 경우 도구 호출 인수를 스트리밍합니다. 그 tool_choice 행동은 많은 OpenAI 모델보다 더 좁습니다: auto가 지원되는 선택입니다. 모델이 언제 호출할지 결정할 수 있도록 프롬프트와 도구 설명을 설계합니다.

모델은 다음을 통해 JSON 객체 모드를 지원합니다:

{
  "response_format": {"type": "json_object"}
}

이는 JSON Schema 강제가 아닙니다. 애플리케이션에서 반환된 객체를 검증하고 필수 필드가 누락된 경우 재시도하거나 복구합니다.

온도, top-p, 정지 시퀀스

여러 추론 모델과 달리 GLM-5.2는 온도와 top-p 튜닝을 허용합니다. Z.AI는 하나를 변경하는 것을 권장합니다. 두 가지 동시 샘플링 변경은 출력 행동을 속성하기 어렵게 만들기 때문입니다.[1]

  • 일반 에이전트 작업에는 기본값을 사용합니다.
  • 반복 가능한 추출 또는 변환을 위해 낮은 온도를 사용합니다.
  • 단 하나의 정지 문자열만 사용합니다; API는 긴 정지 목록을 허용하지 않습니다.
  • max_tokens를 현실적으로 유지합니다. 128K 상한선은 모든 호출의 목표가 아닙니다.

코딩 에이전트의 경우 추론 노력과 컨텍스트 선택이 일반적으로 작은 샘플링 변경보다 비용에 더 많이 영향을 미칩니다.

GLM-5.2를 언제 사용하나요

대규모 코드베이스 작업에 사용하세요. 컨텍스트 윈도우와 도구 지원은 리포지토리 탐색, 마이그레이션, 테스트 생성 및 장기 실행 수리에 맞습니다.

비용에 민감한 에이전트에 사용하세요. 공식 및 reAPI 요금은 Claude 및 GPT 플래그십 계층 아래에 잘 앉아 있습니다.

공개 가중치가 중요한 경우 사용하세요. 팀은 배타적으로 폐쇄형 API에 의존하지 않고 자체 호스팅 또는 비공개 배포를 평가할 수 있습니다.

기본 이미지 이해가 필요한 경우 피하세요. 문서화된 GLM-5.2 API는 텍스트 입력 및 텍스트 출력입니다. 이미지 또는 비디오 분석을 위해 비전 모델을 선택합니다.

일반적인 통합 실수

  1. glm-5.2 대신 glm-5-2를 전송합니다.
  2. 모든 저가 요청에서 기본 max 노력을 남겨둡니다.
  3. response_format이 JSON Schema를 강제할 것으로 예상합니다.
  4. tool_choice를 지원하지 않는 강제 도구 값으로 설정합니다.
  5. 온도와 top-p를 동시에 튜닝합니다.
  6. 스트리밍 중 content만 읽고 필요한지 결정하지 않고 reasoning_content를 버립니다.
  7. 관련 파일을 검색하지 않고 1M 컨텍스트 윈도우를 채웁니다.

FAQ

GLM-5.2는 오픈 소스인가요?

GLM-5.2를 오픈 가중치로 설명하는 것이 더 안전합니다. 특정 라이선스와 릴리스 아티팩트가 오픈 소스의 정의를 충족하지 않는 한입니다. 재배포 또는 상업 배포 전에 현재 모델 라이선스를 검토하세요.

GLM-5.2 API 비용은 얼마인가요?

Z.AI는 입력 $1.40, 캐시된 입력 $0.26, 출력 $4.40을 백만 토큰당 공시합니다. reAPI는 현재 입력 $0.90, 출력 $3을 공시하고 있습니다.

GLM-5.2는 백만 토큰을 지원하나요?

네. Z.AI는 1M 토큰 컨텍스트 윈도우와 128K 최대 출력을 문서화합니다.

추론을 비활성화할 수 있나요?

네. thinking.typedisabled로 설정하거나 지원되는 경우 추론 없음 노력 값을 사용합니다. 기본값은 최대 추론으로 활성화됩니다.

GLM-5.2는 이미지를 지원하나요?

문서화된 채팅 모델 표면에서는 아니요. 텍스트를 허용하고 텍스트를 반환합니다.

GLM-5.2 API는 OpenAI 호환인가요?

reAPI 경로는 OpenAI Chat Completions과 호환됩니다. thinkingreasoning_effort 같은 공급업체 특정 필드는 SDK의 추가 본문 메커니즘을 통해 전달되어야 합니다.

결론

GLM-5.2 API는 백만 토큰 컨텍스트, 공개 가중치, 낮은 토큰 가격이 기본 멀티모달성보다 중요한 경우 매력적입니다. 통합은 3가지 세부 사항을 올바르게 처리하면 간단합니다: 점이 있는 glm-5.2를 전송하고, 일상적인 트래픽에 대해 기본 max 노력을 낮추고, JSON 모드를 구문으로 취급합니다. 스키마 검증이 아닙니다.

참고

  1. Z.AI. GLM-5.2 모델 가이드 및 API 행동. docs.z.ai/guides/llm/glm-5.2
  2. Z.AI. 모델 요금. docs.z.ai/guides/overview/pricing
  3. Z.AI. Chat Completions API 참고. docs.z.ai/api-reference/llm/chat-completion

추가 자료