Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
GLM-5.2 API: 1M トークン、価格、コーディング(2026)
2026/08/01

GLM-5.2 API: 1M トークン、価格、コーディング(2026)

GLM-5.2 API を OpenAI互換コードで使用します。1M コンテキスト、公式価格、reAPI レート、推論制御、および制限について学びます。

GLM-5.2 は Z.AI のオープンウェイト型フラグシップで、長期間のコーディングとエージェント作業向けに設計されています。GLM-5.2 API は、100万トークンのコンテキストウィンドウ、最大128K出力、無効化可能な思考、関数呼び出し、JSONモード、OpenAI互換のリクエスト形式を備えています。[1]

ヘッドライン価格は競争力があります。Z.AI は入力トークンあたり $1.40、キャッシュ入力あたり $0.26、出力トークンあたり $4.40 としています。reAPI は現在、互換ゲートウェイを通じて入力 $0.90、出力 $3.00 と表示しています。[2]

TL;DR

  • モデル ID: glm-5.2(ドット付き)。
  • コンテキスト: 1M トークン。最大出力は 131,072 トークン。
  • 公式価格: 入力 $1.40、キャッシュ入力 $0.26、出力 $4.40(MTok あたり)。
  • reAPI 価格: 入力 $0.90、出力 $3.00(MTok あたり)。
  • 思考: デフォルトで有効。オフにできます。
  • 推論努力: 7 つのラベルを受け入れますが、3 つの効果的な動作に縮小されます。デフォルトは max
  • ツール: 最大 128 個の関数。tool_choice: "auto"。ストリーム化されたツール呼び出し引数。
  • メインの落とし穴: ページスラグは glm-5-2 ですが、API リクエストは glm-5.2 で送信する必要があります。

GLM-5.2 仕様

プロパティGLM-5.2
ベンダーZ.AI
配布オープンウェイト
API モデル IDglm-5.2
コンテキストウィンドウ1,000,000 トークン
最大出力131,072 トークン
入力/出力テキスト / テキスト
思考デフォルト有効
推論デフォルトmax
温度0.0–1.0。デフォルト 1.0
Top-p0.01–1.0。デフォルト 0.95
ツール最大 128 関数
構造化出力JSON オブジェクトモード。JSON Schema ではない

Z.AI は、大規模なコンテキストウィンドウと長期間のタスク向けにこのモデルを位置付けています。大きなコードベースとドキュメントコレクションをサポートしていますが、すべてのファイルをすべてのターンで送信する理由として使用しないでください。検索とコンテキスト選択により、レイテンシとコストが削減されます。

GLM-5.2 API 価格設定

ルート入力 / MTokキャッシュ入力出力 / MTok
Z.AI 公式$1.40$0.26$4.40
reAPI$0.90別途公開なし$3.00

入力トークン 100M(キャッシュなし)と出力トークン 20M の月間ワークロードでは、標準レート計算は次のようになります。

Z.AI: 100 × $1.40 + 20 × $4.40 = $228
reAPI: 100 × $0.90 + 20 × $3.00 = $150

この例では、同じトークン使用量でキャッシュヒットなしを想定しています。Z.AI の $0.26 キャッシュレートは、繰り返されるシステムプロンプト、ツール定義、または安定したリポジトリコンテキストを持つワークロードに大きな影響を与える可能性があります。

推論努力ラベルが 3 つの動作に縮小される

GLM-5.2 は、より多くの努力文字列を受け入れていますが、それより意味のある実行が行われます。Z.AI のリクエスト動作によると、値は次のようにマップされます。

7 つの受け入れられたラベルがなし思考、高、最大動作に縮小されるを示す GLM-5.2 推論努力マップ

送信された値効果的な動作
noneminimal思考をスキップ
lowmediumhigh高推論
xhighmax最大推論

デフォルトは max で、ルーティン分類、抽出、簡単なコード編集には高コストです。タスクが推論を必要とするが最大ではない場合、high を送信してください。決定的でシンプルな場合は、none と無効化された思考を比較します。

reasoning_effort は、思考が有効な場合にのみ関連があります。maxthinking: {"type": "disabled"} の動作をオーバーライドすることを期待しないでください。

会話の思考がどのように処理されるか

GLM-5.2 は、表示可能な content から reasoning_content を分離します。デフォルトの clear_thinking: true では、以前の推論はターン間で保持されず、削除されます。完全な推論履歴が関連性を保つ場合、およびアプリケーションすべての注文されたメッセージを正しく再生できる場合にのみ、false に設定してください。[3]

これは、保持された思考が必須の Kimi K3 とは異なります。GLM-5.2 では、クリーンなコンテキストと隠れた作業の継続性の間で選択できます。

OpenAI Python SDK で GLM-5.2 を呼び出す

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

stream = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "user", "content": "Refactor this module and add tests."}
    ],
    max_tokens=8192,
    stream=True,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="")
    if delta.content:
        print(delta.content, end="")

モデル ID には小数点が含まれます。glm-5-2 はウェブサイトスラグで、リクエストボディで送信するとモデル不明エラーが生成されます。

関数呼び出しと構造化出力

GLM-5.2 は最大 128 個の関数定義をサポートし、tool_stream が有効な場合、ツール呼び出し引数をストリーム化します。その tool_choice 動作は、多くの OpenAI モデルより狭くなります。auto がサポートされている選択肢です。プロンプトとツール説明を設計して、モデルが呼び出しのタイミングを決定できるようにします。

このモデルは、JSON オブジェクトモードをサポートしています。

{
  "response_format": {"type": "json_object"}
}

これは JSON Schema の強制ではありません。返されたオブジェクトをアプリケーションで検証し、必須フィールドが欠落している場合は再試行するか修復してください。

温度、Top-p、停止シーケンス

複数の推論モデルとは異なり、GLM-5.2 は温度と Top-p のチューニングを許可します。Z.AI は、2 つの同時サンプリング変更出力動作属性を難しくするため、両方ではなく 1 つを変更することをお勧めします。[1]

  • 一般的なエージェント作業にはデフォルトを使用してください。
  • 反復可能な抽出や変換の場合は温度を低くします。
  • 停止文字列は 1 つだけ使用してください。API は長い停止リストを受け入れません。
  • max_tokens を現実的に保ってください。128K の上限は、すべての呼び出しの目標ではありません。

コーディングエージェントの場合、推論努力とコンテキスト選択は通常、小さなサンプリング変更よりもコストに大きな影響を与えます。

GLM-5.2 を使用する時期

大規模なコードベース作業に使用してください。 コンテキストウィンドウとツールサポートは、リポジトリナビゲーション、マイグレーション、テスト生成、および長期実行の修復に適しています。

コスト対応エージェントに使用してください。 公式およびreAPI レートは、フラグシップ Claude と GPT 層をはるかに下回ります。

オープンウェイトが重要な場合に使用してください。 チームは、独占的なクローズド API に完全に依存するのではなく、自己ホスティングまたはプライベート展開を評価できます。

ネイティブ画像理解が必要な場合は回避してください。 ドキュメント化された GLM-5.2 API はテキスト入出力です。画像またはビデオ分析にはビジョンモデルを選択してください。

一般的な統合の落とし穴

  1. glm-5.2 の代わりに glm-5-2 を送信する。
  2. すべての低価値リクエストでデフォルト max 努力を残す。
  3. response_format が JSON Schema を適用することを期待する。
  4. tool_choice を無効化された強制ツール値に設定する。
  5. 温度と Top-p を同時にチューニングする。
  6. ストリーミング中に content だけを読み、reasoning_content を破棄してから削除するかを決定する。
  7. 関連ファイルを取得する代わりに 1M コンテキストウィンドウを埋める。

FAQ

GLM-5.2 はオープンソースですか?

具体的なライセンスとリリースアーティファクトが定義に合致しない限り、GLM-5.2 をオープンウェイトとして説明する方が安全です。再配布または商用展開の前に、現在のモデルライセンスを確認してください。

GLM-5.2 API はいくらですか?

Z.AI は入力トークンあたり $1.40、キャッシュ入力あたり $0.26、出力トークンあたり $4.40 を表示しています。reAPI は現在、入力 $0.90 と出力 $3.00 を表示しています。

GLM-5.2 は 100 万トークンをサポートしていますか?

はい。Z.AI は 1M トークンのコンテキストウィンドウと最大出力 128K を文書化しています。

思考を無効にできますか?

はい。thinking.typedisabled に設定するか、サポートされている No-Thinking 努力値を使用してください。デフォルトは最大推論で有効になっています。

GLM-5.2 は画像をサポートしていますか?

ドキュメント化されたチャットモデルのサーフェスでは「いいえ」。テキストを受け入れてテキストを返します。

GLM-5.2 API は OpenAI 互換ですか?

reAPI ルートは OpenAI Chat Completions と互換性があります。thinking および reasoning_effort などのベンダー固有のフィールドは、SDK の extra-body メカニズムを通じて渡す必要があります。

結論

GLM-5.2 API は、100万トークンのコンテキスト、オープンウェイト、低いトークン価格がネイティブマルチモーダリティより重要な場合、説得力があります。統合は、3 つの詳細を正しく処理すれば単純です。ドット付きで glm-5.2 を送信し、ルーティントラフィックのデフォルト max 努力を低くし、JSON モードをスキーマ検証ではなく構文として扱ってください。

参考資料

  1. Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
  2. Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
  3. Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion

さらに読むべき内容