Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
API GLM-5.2 : contexte d'un million, tarifs et codage
2026/08/01

API GLM-5.2 : contexte d'un million, tarifs et codage

Utilisez l'API GLM-5.2 avec du code compatible OpenAI. Apprenez son contexte d'un million, ses tarifs officiels 1,40 $/4,40 $ et ses limites.

GLM-5.2 est le modèle phare open-weight de Z.AI pour les tâches de codage à long horizon et le travail d'agent. L'API GLM-5.2 combine une fenêtre de contexte d'un million de jetons, 128 K de sortie maximale, une réflexion pouvant être désactivée, l'appel de fonctions, le mode JSON et une forme de requête compatible OpenAI.[1]

Son prix annoncé est compétitif : Z.AI liste 1,40 $ par million de jetons d'entrée, 0,26 $ pour l'entrée mise en cache et 4,40 $ par million de jetons de sortie. reAPI affiche actuellement 0,90 $ d'entrée et 3 $ de sortie via sa passerelle compatible.[2]

TL;DR

  • Id du modèle : glm-5.2, avec le point.
  • Contexte : jetons 1M ; la sortie maximale est de 131 072 jetons.
  • Prix officiel : 1,40 $ entrée, 0,26 $ entrée mise en cache, 4,40 $ sortie par million de jetons.
  • Prix reAPI : 0,90 $ entrée et 3 $ sortie par million de jetons.
  • Réflexion : activée par défaut mais commutable.
  • Effort de raisonnement : accepte sept étiquettes mais se réduit à trois comportements effectifs ; la valeur par défaut est max.
  • Outils : jusqu'à 128 fonctions, tool_choice: "auto", arguments d'appel d'outil en continu.
  • Principal piège : le slug de la page est glm-5-2, mais les requêtes API doivent envoyer glm-5.2.

Spécifications GLM-5.2

PropriétéGLM-5.2
FournisseurZ.AI
DistributionPoids ouvert
Id du modèle APIglm-5.2
Fenêtre de contexte1 000 000 jetons
Sortie maximale131 072 jetons
Entrée/sortieTexte / texte
Réflexion par défautActivée
Raisonnement par défautmax
Température0,0–1,0, par défaut 1,0
Top-p0,01–1,0, par défaut 0,95
OutilsJusqu'à 128 fonctions
Sortie structuréeMode objet JSON, non schéma JSON

Z.AI positionne le modèle pour les tâches à long horizon. Le long contexte soutient les grands dépôts de code et les collections de documents, mais il ne devrait pas être traité comme une raison d'envoyer chaque fichier à chaque tour. La recherche et la sélection du contexte réduisent toujours la latence et le coût.

Tarification API GLM-5.2

RouteEntrée / millionEntrée mise en cacheSortie / million
Z.AI officiel1,40 $0,26 $4,40 $
reAPI0,90 $Non publié séparément3,00 $

Pour une charge de travail mensuelle avec 100 millions de jetons d'entrée non mis en cache et 20 millions de jetons de sortie, le calcul simple du tarif standard est :

Z.AI: 100 × 1,40 $ + 20 × 4,40 $ = 228 $
reAPI: 100 × 0,90 $ + 20 × 3,00 $ = 150 $

Cet exemple suppose la même utilisation de jetons et aucun succès du cache. Le tarif mis en cache de Z.AI de 0,26 $ peut modifier matériellement une charge de travail avec des invites système répétées, des définitions d'outils ou un contexte de dépôt stable.

Les étiquettes d'effort de raisonnement se réduisent à trois comportements

GLM-5.2 accepte plus de chaînes d'effort qu'il ne l'exécute de manière significative. Selon le comportement des requêtes de Z.AI, les valeurs se mappent comme suit :

La carte de l'effort de raisonnement GLM-5.2 montrant sept étiquettes acceptées se réduisant à aucune réflexion, comportement élevé et maximal

Valeurs envoyéesComportement effectif
none, minimalIgnorer la réflexion
low, medium, highRaisonnement élevé
xhigh, maxRaisonnement maximal

La valeur par défaut est max, qui est chère pour la classification courante, l'extraction et les modifications de code simples. Si la tâche a besoin de raisonnement mais pas du maximum, envoyez high. S'il est déterministe et simple, comparez none avec la réflexion désactivée.

reasoning_effort ne compte que pendant que la réflexion est activée. N'attendez pas que max remplace thinking: {"type": "disabled"}.

Comment la réflexion de conversation est gérée

GLM-5.2 sépare le content visible du reasoning_content. Avec le clear_thinking: true par défaut, le raisonnement antérieur est supprimé plutôt que conservé entre les tours. Définissez-le à false uniquement lorsque l'historique complet du raisonnement reste pertinent et que votre application peut rejouer correctement les messages complets ordonnés.[3]

Cela diffère de Kimi K3, où la réflexion conservée est obligatoire. GLM-5.2 vous permet de choisir entre un contexte plus propre et la continuité du travail caché.

Appel de GLM-5.2 avec le SDK Python OpenAI

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

stream = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "user", "content": "Refactor this module and add tests."}
    ],
    max_tokens=8192,
    stream=True,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="")
    if delta.content:
        print(delta.content, end="")

L'id du modèle contient un point. glm-5-2 est le slug du site web et produira une erreur de modèle inconnu s'il est envoyé dans le corps de la requête.

Appel de fonction et sortie structurée

GLM-5.2 supporte jusqu'à 128 définitions de fonction et diffuse les arguments d'appel d'outil quand tool_stream est activé. Son comportement tool_choice est plus étroit que celui de nombreux modèles OpenAI : auto est le choix pris en charge. Concevez l'invite et les descriptions d'outils afin que le modèle puisse décider quand les appeler.

Le modèle prend en charge le mode objet JSON via :

{
  "response_format": {"type": "json_object"}
}

Ceci n'est pas l'application du schéma JSON. Validez l'objet retourné dans votre application et réessayez ou réparez lorsque des champs obligatoires manquent.

Température, top-p et séquences d'arrêt

Contrairement à plusieurs modèles de raisonnement, GLM-5.2 permet l'ajustement de la température et du top-p. Z.AI recommande de changer l'un plutôt que les deux, car deux modifications d'échantillonnage simultanées rendent le comportement de sortie plus difficile à attribuer.[1]

  • Utilisez les valeurs par défaut pour le travail d'agent général.
  • Température inférieure pour l'extraction ou la transformation répétables.
  • Utilisez une seule chaîne d'arrêt ; l'API n'accepte pas une longue liste d'arrêt.
  • Gardez max_tokens réaliste. Un plafond de 128 K n'est pas un objectif pour chaque appel.

Pour les agents de codage, l'effort de raisonnement et la sélection du contexte affectent généralement le coût plus que les petits changements d'échantillonnage.

Quand utiliser GLM-5.2

Utilisez-le pour le travail de grands dépôts de code. La fenêtre de contexte et le support des outils conviennent à la navigation des dépôts, aux migrations, à la génération de tests et à la réparation à long terme.

Utilisez-le pour les agents sensibles aux coûts. Ses tarifs officiels et reAPI se situent bien en dessous des niveaux de Claude et GPT phares.

Utilisez-le quand les poids ouverts sont importants. Les équipes peuvent évaluer l'auto-hébergement ou le déploiement privé plutôt que de dépendre exclusivement d'une API fermée.

Évitez-le quand la compréhension d'images natives est requise. L'API GLM-5.2 documentée est texte d'entrée et sortie de texte. Choisissez un modèle de vision pour l'analyse d'images ou de vidéos.

Erreurs d'intégration courantes

  1. Envoi de glm-5-2 au lieu de glm-5.2.
  2. Maintenir l'effort max par défaut sur chaque requête de faible valeur.
  3. Attendre que response_format applique un schéma JSON.
  4. Définir tool_choice sur une valeur d'outil forcé non prise en charge.
  5. Régler la température et le top-p simultanément.
  6. Lire uniquement content lors du flux et rejeter reasoning_content sans décider si c'est nécessaire.
  7. Remplir la fenêtre de contexte de 1M au lieu de récupérer les fichiers pertinents.

FAQ

GLM-5.2 est-il open source ?

Il est plus prudent de décrire GLM-5.2 comme open-weight sauf si la licence spécifique et les artefacts de distribution satisfont votre définition de l'open source. Examinez la licence actuelle du modèle avant la redistribution ou le déploiement commercial.

Combien coûte l'API GLM-5.2 ?

Z.AI liste 1,40 $ entrée, 0,26 $ entrée mise en cache et 4,40 $ sortie par million de jetons. reAPI affiche actuellement 0,90 $ d'entrée et 3 $ de sortie.

GLM-5.2 supporte-t-il un million de jetons ?

Oui. Z.AI documente une fenêtre de contexte de 1 million de jetons et une sortie maximale de 128 K.

La réflexion peut-elle être désactivée ?

Oui. Définissez thinking.type sur disabled, ou utilisez une valeur d'effort sans réflexion où prise en charge. La valeur par défaut est activée avec un raisonnement maximal.

GLM-5.2 supporte-t-il les images ?

Non sur la surface du modèle de chat documentée. Il accepte du texte et retourne du texte.

L'API GLM-5.2 est-elle compatible OpenAI ?

L'itinéraire reAPI est compatible avec OpenAI Chat Completions. Les champs spécifiques au fournisseur tels que thinking et reasoning_effort doivent être transmis via le mécanisme extra-body du SDK.

Conclusion

L'API GLM-5.2 est attrayante quand un contexte d'un million de jetons, les poids ouverts et les bas tarifs de jetons importent plus que la multimodalité native. L'intégration est simple une fois que trois détails sont gérés correctement : envoyer glm-5.2 avec le point, réduire l'effort max par défaut pour le trafic de routine et traiter le mode JSON comme une syntaxe—pas une validation de schéma.

References

  1. Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
  2. Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
  3. Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion

Further reading