
GLM-5.2 API 가이드: 1M 컨텍스트, 요금, 코딩(2026)
GLM-5.2 API를 OpenAI 호환 코드로 사용하세요. 1M 컨텍스트, $1.40/$4.40 공식 요금, reAPI 요금, 추론 제어, 제한을 알아봅시다.
GLM-5.2는 긴 지평선 코딩과 에이전트 작업용 Z.AI의 공개 가중치 플래그십입니다. GLM-5.2 API는 백만 토큰 컨텍스트 윈도우, 128K 최대 출력, 비활성화 가능한 추론, 함수 호출, JSON 모드, OpenAI 호환 요청 형태를 결합합니다.[1]
헤드라인 가격은 경쟁력 있습니다: Z.AI는 입력 토큰당 $1.40, 캐시된 입력 $0.26, 출력 토큰당 $4.40을 공시합니다. reAPI는 현재 호환 게이트웨이를 통해 입력 $0.90, 출력 $3을 공시하고 있습니다.[2]
요약
- 모델 id:
glm-5.2, 점이 포함됩니다. - 컨텍스트: 1M 토큰; 최대 출력은 131,072 토큰입니다.
- 공식 가격: MTok당 입력 $1.40, 캐시된 입력 $0.26, 출력 $4.40입니다.
- reAPI 가격: MTok당 입력 $0.90, 출력 $3입니다.
- 추론: 기본 활성화이지만 전환 가능합니다.
- 추론 노력: 7개 레이블을 허용하지만 3가지 효과적 행동으로 축약됩니다;
기본값은
max입니다. - 도구: 최대 128개 함수,
tool_choice: "auto", 스트리밍 도구 호출 인수입니다. - 주요 함정: 페이지 슬러그는
glm-5-2이지만 API 요청은glm-5.2를 전송해야 합니다.
GLM-5.2 사양
| 속성 | GLM-5.2 |
|---|---|
| 공급업체 | Z.AI |
| 배포 | 공개 가중치 |
| API 모델 id | glm-5.2 |
| 컨텍스트 윈도우 | 1,000,000 토큰 |
| 최대 출력 | 131,072 토큰 |
| 입력/출력 | 텍스트 / 텍스트 |
| 추론 기본값 | 활성화 |
| 추론 기본값 | max |
| 온도 | 0.0–1.0, 기본값 1.0 |
| Top-p | 0.01–1.0, 기본값 0.95 |
| 도구 | 최대 128개 함수 |
| 구조화된 출력 | JSON 객체 모드, JSON Schema 아님 |
Z.AI는 모델을 긴 지평선 작업에 위치시킵니다. 긴 컨텍스트는 대규모 코드베이스와 문서 컬렉션을 지원하지만, 매 턴마다 모든 파일을 보내는 이유로 취급되어서는 안 됩니다. 검색과 컨텍스트 선택이 여전히 지연시간과 비용을 줄입니다.
GLM-5.2 API 요금
| 경로 | 입력 / MTok | 캐시된 입력 | 출력 / MTok |
|---|---|---|---|
| Z.AI 공식 | $1.40 | $0.26 | $4.40 |
| reAPI | $0.90 | 별도 공시 안 함 | $3.00 |
캐시되지 않은 입력 토큰 100M과 출력 토큰 20M의 월간 워크로드는 단순 표준 요금 계산이 다음과 같습니다:
Z.AI: 100 × $1.40 + 20 × $4.40 = $228
reAPI: 100 × $0.90 + 20 × $3.00 = $150그 예는 동일한 토큰 사용량과 캐시 히트 없음을 가정합니다. Z.AI의 $0.26 캐시 요금은 반복된 시스템 프롬프트, 도구 정의 또는 안정적인 리포지토리 컨텍스트가 있는 워크로드를 실질적으로 변경할 수 있습니다.
추론 노력 레이블은 3가지 행동으로 축약됩니다
GLM-5.2는 의미 있게 실행하는 것보다 더 많은 노력 문자열을 허용합니다. Z.AI의 요청 행동에 따르면 값은 다음과 같이 매핑됩니다:

| 전송된 값 | 효과적 행동 |
|---|---|
none, minimal | 추론 건너뛰기 |
low, medium, high | 높은 추론 |
xhigh, max | 최대 추론 |
기본값은 max이며, 이는 일상적인 분류, 추출
및 단순 코드 편집에 비용이 많이 듭니다. 작업에 추론이 필요하지만 최대가 아닌 경우
high를 전송합니다. 결정론적이고 간단한 경우 none과 추론 비활성화를
비교합니다.
reasoning_effort는 추론이 활성화된 동안에만 중요합니다. max이
thinking: {"type": "disabled"}를 재정의할 것으로 예상하지 마세요.
대화 추론 처리 방식
GLM-5.2는 보이는 content를 reasoning_content와 분리합니다. 기본
clear_thinking: true로, 이전 추론은 턴 간에 유지되지 않고 제거됩니다. 완전한
추론 기록이 계속 관련 있고 애플리케이션이 전체 정렬된 메시지를 올바르게
재생할 수 있을 때만 false로 설정합니다.[3]
이는 유지된 추론이 필수인 Kimi K3와 다릅니다. GLM-5.2는 더 깔끔한 컨텍스트와 숨겨진 작업의 연속성 중에서 선택할 수 있습니다.
OpenAI Python SDK로 GLM-5.2 호출
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
stream = client.chat.completions.create(
model="glm-5.2",
messages=[
{"role": "user", "content": "Refactor this module and add tests."}
],
max_tokens=8192,
stream=True,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
},
)
for chunk in stream:
delta = chunk.choices[0].delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
print(reasoning, end="")
if delta.content:
print(delta.content, end="")모델 id는 점을 포함합니다. glm-5-2는 웹사이트 슬러그이며
요청 본문에 전송되면 알 수 없는 모델 오류를 발생시킵니다.
함수 호출과 구조화된 출력
GLM-5.2는 최대 128개 함수 정의를 지원하고 tool_stream이
활성화된 경우 도구 호출 인수를 스트리밍합니다. 그 tool_choice 행동은
많은 OpenAI 모델보다 더 좁습니다: auto가 지원되는 선택입니다. 모델이
언제 호출할지 결정할 수 있도록 프롬프트와 도구 설명을 설계합니다.
모델은 다음을 통해 JSON 객체 모드를 지원합니다:
{
"response_format": {"type": "json_object"}
}이는 JSON Schema 강제가 아닙니다. 애플리케이션에서 반환된 객체를 검증하고 필수 필드가 누락된 경우 재시도하거나 복구합니다.
온도, top-p, 정지 시퀀스
여러 추론 모델과 달리 GLM-5.2는 온도와 top-p 튜닝을 허용합니다. Z.AI는 하나를 변경하는 것을 권장합니다. 두 가지 동시 샘플링 변경은 출력 행동을 속성하기 어렵게 만들기 때문입니다.[1]
- 일반 에이전트 작업에는 기본값을 사용합니다.
- 반복 가능한 추출 또는 변환을 위해 낮은 온도를 사용합니다.
- 단 하나의 정지 문자열만 사용합니다; API는 긴 정지 목록을 허용하지 않습니다.
max_tokens를 현실적으로 유지합니다. 128K 상한선은 모든 호출의 목표가 아닙니다.
코딩 에이전트의 경우 추론 노력과 컨텍스트 선택이 일반적으로 작은 샘플링 변경보다 비용에 더 많이 영향을 미칩니다.
GLM-5.2를 언제 사용하나요
대규모 코드베이스 작업에 사용하세요. 컨텍스트 윈도우와 도구 지원은 리포지토리 탐색, 마이그레이션, 테스트 생성 및 장기 실행 수리에 맞습니다.
비용에 민감한 에이전트에 사용하세요. 공식 및 reAPI 요금은 Claude 및 GPT 플래그십 계층 아래에 잘 앉아 있습니다.
공개 가중치가 중요한 경우 사용하세요. 팀은 배타적으로 폐쇄형 API에 의존하지 않고 자체 호스팅 또는 비공개 배포를 평가할 수 있습니다.
기본 이미지 이해가 필요한 경우 피하세요. 문서화된 GLM-5.2 API는 텍스트 입력 및 텍스트 출력입니다. 이미지 또는 비디오 분석을 위해 비전 모델을 선택합니다.
일반적인 통합 실수
glm-5.2대신glm-5-2를 전송합니다.- 모든 저가 요청에서 기본
max노력을 남겨둡니다. response_format이 JSON Schema를 강제할 것으로 예상합니다.tool_choice를 지원하지 않는 강제 도구 값으로 설정합니다.- 온도와 top-p를 동시에 튜닝합니다.
- 스트리밍 중
content만 읽고 필요한지 결정하지 않고reasoning_content를 버립니다. - 관련 파일을 검색하지 않고 1M 컨텍스트 윈도우를 채웁니다.
FAQ
GLM-5.2는 오픈 소스인가요?
GLM-5.2를 오픈 가중치로 설명하는 것이 더 안전합니다. 특정 라이선스와 릴리스 아티팩트가 오픈 소스의 정의를 충족하지 않는 한입니다. 재배포 또는 상업 배포 전에 현재 모델 라이선스를 검토하세요.
GLM-5.2 API 비용은 얼마인가요?
Z.AI는 입력 $1.40, 캐시된 입력 $0.26, 출력 $4.40을 백만 토큰당 공시합니다. reAPI는 현재 입력 $0.90, 출력 $3을 공시하고 있습니다.
GLM-5.2는 백만 토큰을 지원하나요?
네. Z.AI는 1M 토큰 컨텍스트 윈도우와 128K 최대 출력을 문서화합니다.
추론을 비활성화할 수 있나요?
네. thinking.type을 disabled로 설정하거나 지원되는 경우 추론 없음
노력 값을 사용합니다. 기본값은 최대 추론으로 활성화됩니다.
GLM-5.2는 이미지를 지원하나요?
문서화된 채팅 모델 표면에서는 아니요. 텍스트를 허용하고 텍스트를 반환합니다.
GLM-5.2 API는 OpenAI 호환인가요?
reAPI 경로는 OpenAI Chat Completions과 호환됩니다. thinking 및
reasoning_effort 같은 공급업체 특정 필드는 SDK의 추가 본문 메커니즘을 통해
전달되어야 합니다.
결론
GLM-5.2 API는 백만 토큰 컨텍스트, 공개 가중치,
낮은 토큰 가격이 기본 멀티모달성보다 중요한 경우 매력적입니다. 통합은 3가지
세부 사항을 올바르게 처리하면 간단합니다: 점이 있는 glm-5.2를 전송하고,
일상적인 트래픽에 대해 기본 max 노력을 낮추고, JSON 모드를
구문으로 취급합니다. 스키마 검증이 아닙니다.
참고
- Z.AI. GLM-5.2 모델 가이드 및 API 행동. docs.z.ai/guides/llm/glm-5.2
- Z.AI. 모델 요금. docs.z.ai/guides/overview/pricing
- Z.AI. Chat Completions API 참고. docs.z.ai/api-reference/llm/chat-completion
추가 자료
- reAPI. GLM-5.2 API 문서. reapi.ai/docs/glm-5-2
- reAPI. GLM-5.2 모델 페이지. reapi.ai/models/glm-5-2
- reAPI. Kimi K3 완전 가이드. reapi.ai/blog/kimi-k3-complete-guide
작성자

카테고리
더 많은 게시물

Mammouth AI 요금제·제한·API 접근 2026
Mammouth AI 요금제 설명: Starter, Standard, Expert 플랜 비교, 3시간 할당량 초기화, 포함 API 크레딧, 사용량 기반 결제, 파일 제한 안내합니다.


Kimi K3 vs Claude Opus 5: 오픈 웨이트 vs 관리형 신뢰성
Kimi K3와 Claude Opus 5를 비교합니다. 오픈 웨이트, 1M 컨텍스트, 추론, 멀티모달 입력, API 가격, 배포 요구 사항을 분석합니다.


Sora 2 API 종료: 영상 내보내기와 마이그레이션 요금
Sora 2 API는 2026년 9월 24일 종료되며 공식 대체 모델이 없습니다. 보유 영상을 내보내고 엔드포인트를 다시 매핑한 후 각 티어의 실제 비용을 확인하세요.
