Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
GLM-5.2 API: 1M Kontext, Preise und Programmierung (2026)
2026/08/01

GLM-5.2 API: 1M Kontext, Preise und Programmierung (2026)

Nutzen Sie die GLM-5.2 API mit OpenAI-kompatiblem Code. Erfahren Sie mehr über 1M Kontext, Preisen ($1,40/$4,40), reAPI-Raten, Reasoning-Steuerung und Limits.

GLM-5.2 ist Z.AIs Flaggschiff mit offenem Gewicht für langfristige Codierungen und Agenten-Arbeiten. Die GLM-5.2 API kombiniert ein Kontextfenster von einer Million Token, maximale Ausgabe von 128K, deaktiviertes Thinking, Funktionsaufrufe, JSON-Modus und eine OpenAI-kompatible Anforderungsform.[1]

Der Headline-Preis ist wettbewerbsfähig: Z.AI listet $1,40 pro Million Eingabe-Token, $0,26 für gecachte Eingabe und $4,40 pro Million Ausgabe-Token. reAPI listet derzeit $0,90 Eingabe und $3 Ausgabe über sein kompatibles Gateway.[2]

TL;DR

  • Modell-ID: glm-5.2, mit dem Punkt.
  • Kontext: 1M Token; maximale Ausgabe sind 131.072 Token.
  • Offizielle Preise: $1,40 Eingabe, $0,26 gecachte Eingabe, $4,40 Ausgabe pro MTok.
  • reAPI-Preis: $0,90 Eingabe und $3 Ausgabe pro MTok.
  • Thinking: standardmäßig aktiviert, aber abschaltbar.
  • Reasoning Effort: akzeptiert sieben Bezeichnungen, aber reduziert sich auf drei effektive Verhaltensweisen; Standard ist max.
  • Tools: bis zu 128 Funktionen, tool_choice: "auto", gestreamte Tool-Call-Argumente.
  • Hauptfalle: Der Seiten-Slug ist glm-5-2, aber API-Anfragen müssen glm-5.2 senden.

GLM-5.2 Spezifikationen

EigenschaftGLM-5.2
AnbieterZ.AI
VerteilungOpen Weight
API-Modell-IDglm-5.2
Kontextfenster1.000.000 Token
Maximale Ausgabe131.072 Token
Eingabe/AusgabeText / Text
Thinking StandardAktiviert
Reasoning Standardmax
Temperatur0,0–1,0, Standard 1,0
Top-p0,01–1,0, Standard 0,95
ToolsBis zu 128 Funktionen
Strukturierte AusgabeJSON-Objektmodus, nicht JSON Schema

Z.AI positioniert das Modell für Aufgaben mit großem Horizont. Das lange Kontextfenster unterstützt große Codebases und Dokumentsammlungen, sollte aber nicht als Grund verwendet werden, jede Datei bei jedem Durchgang zu senden. Suche und Kontextauswahl reduzieren weiterhin Latenz und Kosten.

GLM-5.2 API Preisgestaltung

RouteEingabe / MTokGecachte EingabeAusgabe / MTok
Z.AI offiziell$1,40$0,26$4,40
reAPI$0,90Nicht separat veröffentlicht$3,00

Für eine monatliche Arbeitslast mit 100M ungecachter Eingabe-Token und 20M Ausgabe-Token ist die einfache Standard-Tarif-Berechnung:

Z.AI: 100 × $1,40 + 20 × $4,40 = $228
reAPI: 100 × $0,90 + 20 × $3,00 = $150

Dieses Beispiel geht von gleicher Token-Nutzung und keinen Cache-Treffern aus. Der $0,26 gecachte Tarif von Z.AI kann eine Arbeitslast mit wiederholten System-Prompts, Tool-Definitionen oder stabiler Repository-Kontextbedeutung verändern.

Die Reasoning-Effort-Bezeichnungen reduzieren sich auf drei Verhaltensweisen

GLM-5.2 akzeptiert mehr Effort-Strings als es sinnvoll ausführt. Gemäß Z.AIs Anfrageverhalten erfolgt die Zuordnung wie folgt:

GLM-5.2 Reasoning-Effort-Karte, die sieben akzeptierte Bezeichnungen in No-Thinking-, High- und Max-Verhalten reduziert

Gesendete WerteEffektives Verhalten
none, minimalThinking überspringen
low, medium, highHohes Reasoning
xhigh, maxMaximales Reasoning

Der Standard ist max, was für routine Klassifizierung, Extraktion und einfache Code-Änderungen teuer ist. Wenn die Aufgabe Reasoning benötigt, aber nicht das Maximum, senden Sie high. Wenn es deterministisch und einfach ist, vergleichen Sie none mit deaktiviertem Thinking.

reasoning_effort ist nur relevant, wenn Thinking aktiviert ist. Erwarten Sie nicht, dass max das Verhalten thinking: {"type": "disabled"} überschreibt.

Wie Gespräche mit Thinking gehandhabt werden

GLM-5.2 trennt sichtbaren content von reasoning_content. Mit dem Standard clear_thinking: true wird vorheriges Reasoning entfernt, anstatt zwischen den Durchgängen beibehalten zu werden. Setzen Sie es auf false nur, wenn die vollständige Reasoning-Verlaufssicherung relevant bleibt und Ihre Anwendung alle bestellten Nachrichten korrekt abspielen kann.[3]

Dies unterscheidet sich von Kimi K3, wo beibehaltenes Thinking obligatorisch ist. GLM-5.2 lässt Sie zwischen sauberem Kontext und Kontinuität verborgener Arbeit wählen.

GLM-5.2 mit dem OpenAI Python SDK aufrufen

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

stream = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "user", "content": "Refactor this module and add tests."}
    ],
    max_tokens=8192,
    stream=True,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="")
    if delta.content:
        print(delta.content, end="")

Die Modell-ID enthält einen Punkt. glm-5-2 ist der Website-Slug und führt zu einem Fehler mit unbekanntem Modell, wenn es im Request-Body gesendet wird.

Funktionsaufrufe und strukturierte Ausgabe

GLM-5.2 unterstützt bis zu 128 Funktionsdefinitionen und streamt Tool-Call-Argumente, wenn tool_stream aktiviert ist. Sein tool_choice-Verhalten ist enger als bei vielen OpenAI-Modellen: auto ist die unterstützte Wahl. Gestalten Sie den Prompt und die Tool-Beschreibungen so, dass das Modell entscheiden kann, wann sie aufgerufen werden.

Das Modell unterstützt den JSON-Objektmodus über:

{
  "response_format": {"type": "json_object"}
}

Dies ist keine JSON-Schema-Erzwingung. Validieren Sie das zurückgegebene Objekt in Ihrer Anwendung und wiederholen oder reparieren Sie bei Bedarf, wenn erforderliche Felder fehlen.

Temperatur, Top-p und Stop-Sequenzen

Im Gegensatz zu mehreren Reasoning-Modellen erlaubt GLM-5.2 die Tuning von Temperatur und Top-p. Z.AI empfiehlt, eines zu ändern, anstatt beides, da zwei gleichzeitige Sampling-Änderungen das Ausgabeverhalten schwerer zuweisen lassen.[1]

  • Verwenden Sie die Standards für allgemeine Agenten-Arbeiten.
  • Niedrigere Temperatur für wiederholbare Extraktion oder Umwandlung.
  • Verwenden Sie nur einen Stop-String; die API akzeptiert keine lange Stop-Liste.
  • Halten Sie max_tokens realistisch. Eine 128K-Obergrenze ist nicht das Ziel für jeden Aufruf.

Für Coding-Agenten wirken sich Reasoning Effort und Kontextauswahl normalerweise stärker auf die Kosten aus als kleine Sampling-Änderungen.

Wann man GLM-5.2 verwendet

Nutzen Sie es für Arbeiten mit großen Codebasen. Das Kontextfenster und die Tool-Unterstützung passen zu Repository-Navigation, Migrationen, Test-Generierung und langfristiger Reparatur.

Nutzen Sie es für kostenempfindliche Agenten. Seine offiziellen und reAPI-Raten sitzen gut unterhalb der Flaggschiff-Claude und GPT-Tiers.

Nutzen Sie es, wenn offene Gewichte wichtig sind. Teams können Self-Hosting oder private Deployment evaluieren, anstatt sich ausschließlich auf eine geschlossene API zu verlassen.

Vermeiden Sie es, wenn natives Bildverständnis erforderlich ist. Die dokumentierte GLM-5.2 API ist Text in und Text aus. Wählen Sie ein Vision-Modell für Bild- oder Videoanalyse.

Häufige Integrationsfehler

  1. Senden von glm-5-2 anstelle von glm-5.2.
  2. Belassen der Standard-max-Anstrengung bei jeder geringwertigen Anfrage.
  3. Erwarten, dass response_format ein JSON Schema erzwingt.
  4. Einstellen von tool_choice auf einen nicht unterstützten erzwungenen Tool-Wert.
  5. Tuning von Temperatur und Top-p gleichzeitig.
  6. Lesen nur von content während des Streamings und Verwerfen von reasoning_content, ohne zu entscheiden, ob es benötigt wird.
  7. Füllen des 1M Kontextfensters anstelle des Abrufens relevanter Dateien.

FAQ

Ist GLM-5.2 Open Source?

Es ist sicherer, GLM-5.2 als offenes Gewicht zu beschreiben, wenn die spezifische Lizenz und die Release-Artefakte Ihre Definition von Open Source nicht erfüllen. Überprüfen Sie die aktuelle Modellizenz vor Umverteilung oder kommerziellem Einsatz.

Wie viel kostet die GLM-5.2 API?

Z.AI listet $1,40 Eingabe, $0,26 gecachte Eingabe und $4,40 Ausgabe pro Million Token. reAPI listet derzeit $0,90 Eingabe und $3 Ausgabe.

Unterstützt GLM-5.2 eine Million Token?

Ja. Z.AI dokumentiert ein 1M-Token-Kontextfenster und maximale Ausgabe von 128K.

Kann Thinking deaktiviert werden?

Ja. Setzen Sie thinking.type auf disabled, oder verwenden Sie einen No-Thinking-Effort-Wert, wo unterstützt. Der Standard ist aktiviert mit maximalem Reasoning.

Unterstützt GLM-5.2 Bilder?

Nein auf der dokumentierten Chat-Modelloberfläche. Es akzeptiert Text und gibt Text zurück.

Ist die GLM-5.2 API OpenAI-kompatibel?

Die reAPI-Route ist kompatibel mit OpenAI Chat Completions. Vendor-spezifische Felder wie thinking und reasoning_effort sollten über den Extra-Body-Mechanismus des SDK weitergeleitet werden.

Schlussfolgerung

Die GLM-5.2 API ist überzeugend, wenn ein Kontextfenster mit einer Million Token, offene Gewichte und niedrige Token-Preise wichtiger sind als native Multimodalität. Die Integration ist unkompliziert, sobald drei Details korrekt behandelt werden: Senden Sie glm-5.2 mit dem Punkt, senken Sie die Standard-max-Anstrengung für Routine-Verkehr, und behandeln Sie den JSON-Modus als Syntax, nicht als Schema-Validierung.

Referenzen

  1. Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
  2. Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
  3. Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion

Weitere Lektüre