
GLM-5.2 API: 1M Kontext, Preise und Programmierung (2026)
Nutzen Sie die GLM-5.2 API mit OpenAI-kompatiblem Code. Erfahren Sie mehr über 1M Kontext, Preisen ($1,40/$4,40), reAPI-Raten, Reasoning-Steuerung und Limits.
GLM-5.2 ist Z.AIs Flaggschiff mit offenem Gewicht für langfristige Codierungen und Agenten-Arbeiten. Die GLM-5.2 API kombiniert ein Kontextfenster von einer Million Token, maximale Ausgabe von 128K, deaktiviertes Thinking, Funktionsaufrufe, JSON-Modus und eine OpenAI-kompatible Anforderungsform.[1]
Der Headline-Preis ist wettbewerbsfähig: Z.AI listet $1,40 pro Million Eingabe-Token, $0,26 für gecachte Eingabe und $4,40 pro Million Ausgabe-Token. reAPI listet derzeit $0,90 Eingabe und $3 Ausgabe über sein kompatibles Gateway.[2]
TL;DR
- Modell-ID:
glm-5.2, mit dem Punkt. - Kontext: 1M Token; maximale Ausgabe sind 131.072 Token.
- Offizielle Preise: $1,40 Eingabe, $0,26 gecachte Eingabe, $4,40 Ausgabe pro MTok.
- reAPI-Preis: $0,90 Eingabe und $3 Ausgabe pro MTok.
- Thinking: standardmäßig aktiviert, aber abschaltbar.
- Reasoning Effort: akzeptiert sieben Bezeichnungen, aber reduziert sich auf drei effektive Verhaltensweisen; Standard ist
max. - Tools: bis zu 128 Funktionen,
tool_choice: "auto", gestreamte Tool-Call-Argumente. - Hauptfalle: Der Seiten-Slug ist
glm-5-2, aber API-Anfragen müssenglm-5.2senden.
GLM-5.2 Spezifikationen
| Eigenschaft | GLM-5.2 |
|---|---|
| Anbieter | Z.AI |
| Verteilung | Open Weight |
| API-Modell-ID | glm-5.2 |
| Kontextfenster | 1.000.000 Token |
| Maximale Ausgabe | 131.072 Token |
| Eingabe/Ausgabe | Text / Text |
| Thinking Standard | Aktiviert |
| Reasoning Standard | max |
| Temperatur | 0,0–1,0, Standard 1,0 |
| Top-p | 0,01–1,0, Standard 0,95 |
| Tools | Bis zu 128 Funktionen |
| Strukturierte Ausgabe | JSON-Objektmodus, nicht JSON Schema |
Z.AI positioniert das Modell für Aufgaben mit großem Horizont. Das lange Kontextfenster unterstützt große Codebases und Dokumentsammlungen, sollte aber nicht als Grund verwendet werden, jede Datei bei jedem Durchgang zu senden. Suche und Kontextauswahl reduzieren weiterhin Latenz und Kosten.
GLM-5.2 API Preisgestaltung
| Route | Eingabe / MTok | Gecachte Eingabe | Ausgabe / MTok |
|---|---|---|---|
| Z.AI offiziell | $1,40 | $0,26 | $4,40 |
| reAPI | $0,90 | Nicht separat veröffentlicht | $3,00 |
Für eine monatliche Arbeitslast mit 100M ungecachter Eingabe-Token und 20M Ausgabe-Token ist die einfache Standard-Tarif-Berechnung:
Z.AI: 100 × $1,40 + 20 × $4,40 = $228
reAPI: 100 × $0,90 + 20 × $3,00 = $150Dieses Beispiel geht von gleicher Token-Nutzung und keinen Cache-Treffern aus. Der $0,26 gecachte Tarif von Z.AI kann eine Arbeitslast mit wiederholten System-Prompts, Tool-Definitionen oder stabiler Repository-Kontextbedeutung verändern.
Die Reasoning-Effort-Bezeichnungen reduzieren sich auf drei Verhaltensweisen
GLM-5.2 akzeptiert mehr Effort-Strings als es sinnvoll ausführt. Gemäß Z.AIs Anfrageverhalten erfolgt die Zuordnung wie folgt:

| Gesendete Werte | Effektives Verhalten |
|---|---|
none, minimal | Thinking überspringen |
low, medium, high | Hohes Reasoning |
xhigh, max | Maximales Reasoning |
Der Standard ist max, was für routine Klassifizierung, Extraktion und einfache Code-Änderungen teuer ist. Wenn die Aufgabe Reasoning benötigt, aber nicht das Maximum, senden Sie high. Wenn es deterministisch und einfach ist, vergleichen Sie none mit deaktiviertem Thinking.
reasoning_effort ist nur relevant, wenn Thinking aktiviert ist. Erwarten Sie nicht, dass max das Verhalten thinking: {"type": "disabled"} überschreibt.
Wie Gespräche mit Thinking gehandhabt werden
GLM-5.2 trennt sichtbaren content von reasoning_content. Mit dem Standard clear_thinking: true wird vorheriges Reasoning entfernt, anstatt zwischen den Durchgängen beibehalten zu werden. Setzen Sie es auf false nur, wenn die vollständige Reasoning-Verlaufssicherung relevant bleibt und Ihre Anwendung alle bestellten Nachrichten korrekt abspielen kann.[3]
Dies unterscheidet sich von Kimi K3, wo beibehaltenes Thinking obligatorisch ist. GLM-5.2 lässt Sie zwischen sauberem Kontext und Kontinuität verborgener Arbeit wählen.
GLM-5.2 mit dem OpenAI Python SDK aufrufen
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
stream = client.chat.completions.create(
model="glm-5.2",
messages=[
{"role": "user", "content": "Refactor this module and add tests."}
],
max_tokens=8192,
stream=True,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
},
)
for chunk in stream:
delta = chunk.choices[0].delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
print(reasoning, end="")
if delta.content:
print(delta.content, end="")Die Modell-ID enthält einen Punkt. glm-5-2 ist der Website-Slug und führt zu einem Fehler mit unbekanntem Modell, wenn es im Request-Body gesendet wird.
Funktionsaufrufe und strukturierte Ausgabe
GLM-5.2 unterstützt bis zu 128 Funktionsdefinitionen und streamt Tool-Call-Argumente, wenn tool_stream aktiviert ist. Sein tool_choice-Verhalten ist enger als bei vielen OpenAI-Modellen: auto ist die unterstützte Wahl. Gestalten Sie den Prompt und die Tool-Beschreibungen so, dass das Modell entscheiden kann, wann sie aufgerufen werden.
Das Modell unterstützt den JSON-Objektmodus über:
{
"response_format": {"type": "json_object"}
}Dies ist keine JSON-Schema-Erzwingung. Validieren Sie das zurückgegebene Objekt in Ihrer Anwendung und wiederholen oder reparieren Sie bei Bedarf, wenn erforderliche Felder fehlen.
Temperatur, Top-p und Stop-Sequenzen
Im Gegensatz zu mehreren Reasoning-Modellen erlaubt GLM-5.2 die Tuning von Temperatur und Top-p. Z.AI empfiehlt, eines zu ändern, anstatt beides, da zwei gleichzeitige Sampling-Änderungen das Ausgabeverhalten schwerer zuweisen lassen.[1]
- Verwenden Sie die Standards für allgemeine Agenten-Arbeiten.
- Niedrigere Temperatur für wiederholbare Extraktion oder Umwandlung.
- Verwenden Sie nur einen Stop-String; die API akzeptiert keine lange Stop-Liste.
- Halten Sie
max_tokensrealistisch. Eine 128K-Obergrenze ist nicht das Ziel für jeden Aufruf.
Für Coding-Agenten wirken sich Reasoning Effort und Kontextauswahl normalerweise stärker auf die Kosten aus als kleine Sampling-Änderungen.
Wann man GLM-5.2 verwendet
Nutzen Sie es für Arbeiten mit großen Codebasen. Das Kontextfenster und die Tool-Unterstützung passen zu Repository-Navigation, Migrationen, Test-Generierung und langfristiger Reparatur.
Nutzen Sie es für kostenempfindliche Agenten. Seine offiziellen und reAPI-Raten sitzen gut unterhalb der Flaggschiff-Claude und GPT-Tiers.
Nutzen Sie es, wenn offene Gewichte wichtig sind. Teams können Self-Hosting oder private Deployment evaluieren, anstatt sich ausschließlich auf eine geschlossene API zu verlassen.
Vermeiden Sie es, wenn natives Bildverständnis erforderlich ist. Die dokumentierte GLM-5.2 API ist Text in und Text aus. Wählen Sie ein Vision-Modell für Bild- oder Videoanalyse.
Häufige Integrationsfehler
- Senden von
glm-5-2anstelle vonglm-5.2. - Belassen der Standard-
max-Anstrengung bei jeder geringwertigen Anfrage. - Erwarten, dass
response_formatein JSON Schema erzwingt. - Einstellen von
tool_choiceauf einen nicht unterstützten erzwungenen Tool-Wert. - Tuning von Temperatur und Top-p gleichzeitig.
- Lesen nur von
contentwährend des Streamings und Verwerfen vonreasoning_content, ohne zu entscheiden, ob es benötigt wird. - Füllen des 1M Kontextfensters anstelle des Abrufens relevanter Dateien.
FAQ
Ist GLM-5.2 Open Source?
Es ist sicherer, GLM-5.2 als offenes Gewicht zu beschreiben, wenn die spezifische Lizenz und die Release-Artefakte Ihre Definition von Open Source nicht erfüllen. Überprüfen Sie die aktuelle Modellizenz vor Umverteilung oder kommerziellem Einsatz.
Wie viel kostet die GLM-5.2 API?
Z.AI listet $1,40 Eingabe, $0,26 gecachte Eingabe und $4,40 Ausgabe pro Million Token. reAPI listet derzeit $0,90 Eingabe und $3 Ausgabe.
Unterstützt GLM-5.2 eine Million Token?
Ja. Z.AI dokumentiert ein 1M-Token-Kontextfenster und maximale Ausgabe von 128K.
Kann Thinking deaktiviert werden?
Ja. Setzen Sie thinking.type auf disabled, oder verwenden Sie einen No-Thinking-Effort-Wert, wo unterstützt. Der Standard ist aktiviert mit maximalem Reasoning.
Unterstützt GLM-5.2 Bilder?
Nein auf der dokumentierten Chat-Modelloberfläche. Es akzeptiert Text und gibt Text zurück.
Ist die GLM-5.2 API OpenAI-kompatibel?
Die reAPI-Route ist kompatibel mit OpenAI Chat Completions. Vendor-spezifische Felder wie thinking und reasoning_effort sollten über den Extra-Body-Mechanismus des SDK weitergeleitet werden.
Schlussfolgerung
Die GLM-5.2 API ist überzeugend, wenn ein Kontextfenster mit einer Million Token, offene Gewichte und niedrige Token-Preise wichtiger sind als native Multimodalität. Die Integration ist unkompliziert, sobald drei Details korrekt behandelt werden: Senden Sie glm-5.2 mit dem Punkt, senken Sie die Standard-max-Anstrengung für Routine-Verkehr, und behandeln Sie den JSON-Modus als Syntax, nicht als Schema-Validierung.
Referenzen
- Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
- Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
- Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion
Weitere Lektüre
- reAPI. GLM-5.2 API documentation. reapi.ai/docs/glm-5-2
- reAPI. GLM-5.2 model page. reapi.ai/models/glm-5-2
- reAPI. Kimi K3 complete guide. reapi.ai/blog/kimi-k3-complete-guide
Autor

Kategorien
Weitere Beiträge

WaveSpeed AI: Preise, Testguthaben und Pay-as-you-go
WaveSpeed nutzt Prepaid-Credits statt Abonnement. Wie kostenlose Testversion, Kontostufen, API-Aktivierung und Gebührenlimits funktionieren.


DeepSeek V4 Flash 0731 mit Agent- und Codex-Support
DeepSeek V4 Flash 0731 ist live mit besseren Agent-Benchmarks, nativem Responses API Support und Codex-Integration unter der gleichen Model-ID.


Document-to-Video API: PDF, PPT, XLS, DOCX oder Webseite
Nutze Wan 3.0 um Videos aus PDFs, Präsentationen, Tabellen oder Webseiten zu generieren—mit Eingabelimits, Kostenrechnung und Anfrage-Beispielen.
