Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
GLM-5.2 API 完整指南:1M token、定价、编码
2026/08/01

GLM-5.2 API 完整指南:1M token、定价、编码

GLM-5.2 OpenAI 兼容 API:百万 token、官方价 $1.40/$4.40、reAPI 费率、推理控制与限制。

GLM-5.2 是 Z.AI 的开源权重旗舰模型,专为长期编码和智能体工作设计。GLM-5.2 API 结合了百万 token 上下文窗口、128K 最大输出、可禁用的思维过程、函数调用、JSON 模式和 OpenAI 兼容的请求格式。[1]

其官方价格很有竞争力:Z.AI 列出每百万输入 token 1.40 美元、缓存输入 0.26 美元,以及每百万输出 token 4.40 美元。reAPI 目前通过其兼容网关列出 0.90 美元输入和 3 美元输出。[2]

TL;DR

  • 模型 id: glm-5.2,包含小数点。
  • 上下文: 1M token;最大输出为 131,072 token。
  • 官方价格: 每百万 token 输入 1.40 美元、缓存输入 0.26 美元、输出 4.40 美元。
  • reAPI 价格: 每百万 token 输入 0.90 美元和输出 3 美元。
  • 思维过程: 默认启用但可关闭。
  • 推理等级: 接受七个标签但只有三种实际行为;默认为 max
  • 工具: 最多 128 个函数、tool_choice: "auto"、流式工具调用参数。
  • 主要陷阱: 页面 slug 是 glm-5-2,但 API 请求必须发送 glm-5.2

GLM-5.2 规格

属性GLM-5.2
供应商Z.AI
分布方式开源权重
API 模型 idglm-5.2
上下文窗口1,000,000 token
最大输出131,072 token
输入/输出文本 / 文本
思维默认启用
推理默认max
温度0.0–1.0,默认 1.0
Top-p0.01–1.0,默认 0.95
工具最多 128 个函数
结构化输出JSON 对象模式,不是 JSON Schema

Z.AI 为长期任务定位该模型。长上下文支持大型代码库和文档集合,但不应被视为在每个回合发送每个文件的理由。搜索和上下文选择仍能降低延迟和成本。

GLM-5.2 API 定价

路线输入 / 百万 token缓存输入输出 / 百万 token
Z.AI 官方$1.40$0.26$4.40
reAPI$0.90未单独公布$3.00

对于每月包含 100M 未缓存输入 token 和 20M 输出 token 的工作负载,简单的标准费率计算为:

Z.AI: 100 × $1.40 + 20 × $4.40 = $228
reAPI: 100 × $0.90 + 20 × $3.00 = $150

该示例假设相同的 token 使用量且没有缓存命中。Z.AI 的 $0.26 缓存费率可以显著改变具有重复系统提示、工具定义或稳定代码库上下文的工作负载。

推理等级标签折叠为三种行为

GLM-5.2 接受比其有意义执行的更多的等级字符串。根据 Z.AI 的请求行为,值映射如下:

GLM-5.2 推理等级图表显示七个接受的标签折叠为无思维、高和最大行为

发送的值有效行为
noneminimal跳过思维
lowmediumhigh高推理
xhighmax最大推理

默认为 max,对于常规分类、提取和简单代码编辑来说成本很高。如果任务需要推理但不需要最大,发送 high。如果它是确定性和简单的,比较 none 和禁用思维。

reasoning_effort 只有在启用思维时才起作用。不要指望 max 会覆盖 thinking: {"type": "disabled"}

对话思维如何处理

GLM-5.2 分离可见的 contentreasoning_content。使用默认的 clear_thinking: true,之前的推理在回合之间会被移除而不是保留。仅在完整的推理历史保持相关且您的应用能正确回放完整有序消息时,才将其设为 false[3]

这与 Kimi K3 不同,后者的保留思维是强制的。GLM-5.2 让您在更干净的上下文和隐藏工作的连续性之间选择。

使用 OpenAI Python SDK 调用 GLM-5.2

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

stream = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "user", "content": "Refactor this module and add tests."}
    ],
    max_tokens=8192,
    stream=True,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="")
    if delta.content:
        print(delta.content, end="")

模型 id 包含一个小数点。glm-5-2 是网站 slug,在请求体中发送会产生未知模型错误。

函数调用和结构化输出

GLM-5.2 支持最多 128 个函数定义,当启用 tool_stream 时流式传输工具调用参数。它的 tool_choice 行为比许多 OpenAI 模型更窄:auto 是支持的选择。设计提示和工具描述,使模型能决定何时调用它们。

该模型通过以下方式支持 JSON 对象模式:

{
  "response_format": {"type": "json_object"}
}

这不是 JSON Schema 强制执行。在您的应用中验证返回的对象,并在缺少必需字段时重试或修复。

温度、top-p 和停止序列

与几个推理模型不同,GLM-5.2 允许温度和 top-p 调整。Z.AI 建议改变其中一个而不是两个,因为两个同时采样更改使输出行为更难归因。[1]

  • 对一般智能体工作使用默认值。
  • 对可重复的提取或转换使用较低的温度。
  • 仅使用一个停止字符串;API 不接受很长的停止列表。
  • 保持 max_tokens 现实。128K 上限不是每个调用的目标。

对于编码智能体,推理等级和上下文选择通常比小的采样更改影响成本更多。

何时使用 GLM-5.2

对大型代码库工作使用它。 上下文窗口和工具支持适合代码库导航、迁移、测试生成和长期运行修复。

对成本敏感的智能体使用它。 其官方和 reAPI 费率远低于旗舰 Claude 和 GPT 层级。

当开源权重重要时使用它。 团队可评估自托管或私有部署,而不是仅依赖封闭 API。

当需要原生图像理解时避免使用。 已记录的 GLM-5.2 API 是文本输入和输出。为图像或视频分析选择视觉模型。

常见集成错误

  1. 发送 glm-5-2 而不是 glm-5.2
  2. 在每个低价值请求上保留默认 max 等级。
  3. 期望 response_format 强制 JSON Schema。
  4. tool_choice 设置为不支持的强制工具值。
  5. 同时调整温度和 top-p。
  6. 在流式传输时仅读取 content 并在不决定是否需要时丢弃 reasoning_content
  7. 填充 1M 上下文窗口而不是检索相关文件。

FAQ

GLM-5.2 是开源的吗?

将 GLM-5.2 描述为开源权重更安全,除非特定许可证和发布工件满足您的开源定义。在重新分配或商业部署前审查当前模型许可证。

GLM-5.2 API 成本多少?

Z.AI 列出每百万 token 输入 1.40 美元、缓存输入 0.26 美元和输出 4.40 美元。reAPI 目前列出每百万 token 输入 0.90 美元和输出 3 美元。

GLM-5.2 支持一百万 token 吗?

是的。Z.AI 记录了 1M token 上下文窗口和 128K 最大输出。

思维过程能被禁用吗?

是的。将 thinking.type 设置为 disabled,或在支持的地方使用无思维等级值。默认启用最大推理。

GLM-5.2 支持图像吗?

在已记录的聊天模型表面上不支持。它接受文本并返回文本。

GLM-5.2 API 是 OpenAI 兼容的吗?

reAPI 路线与 OpenAI Chat Completions 兼容。供应商特定字段如 thinkingreasoning_effort 应通过 SDK 的 extra-body 机制传递。

结论

当百万 token 上下文、开源权重和低 token 价格比原生多模态重要时,GLM-5.2 API 很引人注目。一旦正确处理三个细节,集成就很直接:使用小数点发送 glm-5.2,为常规流量降低默认 max 等级,并将 JSON 模式视为语法而不是 schema 验证。

References

  1. Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
  2. Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
  3. Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion

Further reading