Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Guía de API de GLM-5.2: contexto de 1M, precios y codificación
2026/08/01

Guía de API de GLM-5.2: contexto de 1M, precios y codificación

Usa la API de GLM-5.2 con código compatible con OpenAI. Aprende su contexto de 1M, precios oficiales $1.40/$4.40, tarifas de reAPI y razonamiento

GLM-5.2 es el modelo insignia de peso abierto de Z.AI para trabajo de codificación de largo horizonte y agentes. La API de GLM-5.2 combina una ventana de contexto de un millón de tokens, salida máxima de 128K, pensamiento que puede desactivarse, invocación de funciones, modo JSON y una forma de solicitud compatible con OpenAI.[1]

Su precio titular es competitivo: Z.AI lista $1.40 por millón de tokens de entrada, $0.26 para entrada en caché y $4.40 por millón de tokens de salida. reAPI actualmente lista $0.90 entrada y $3 salida a través de su puerta de enlace compatible.[2]

TL;DR

  • ID de modelo: glm-5.2, con el punto.
  • Contexto: 1M tokens; la salida máxima es 131,072 tokens.
  • Precio oficial: $1.40 entrada, $0.26 entrada en caché, $4.40 salida por MTok.
  • Precio de reAPI: $0.90 entrada y $3 salida por MTok.
  • Pensamiento: habilitado por defecto pero intercambiable.
  • Esfuerzo de razonamiento: acepta siete etiquetas pero se reduce a tres comportamientos efectivos; el predeterminado es max.
  • Herramientas: hasta 128 funciones, tool_choice: "auto", argumentos de invocación de herramientas transmitidos.
  • Trampa principal: el slug de página es glm-5-2, pero las solicitudes de API deben enviar glm-5.2.

Especificaciones de GLM-5.2

PropiedadGLM-5.2
ProveedorZ.AI
DistribuciónPeso abierto
ID de modelo de APIglm-5.2
Ventana de contexto1,000,000 tokens
Salida máxima131,072 tokens
Entrada/salidaTexto / texto
Pensamiento predeterminadoHabilitado
Predeterminado de razonamientomax
Temperatura0.0–1.0, por defecto 1.0
Top-p0.01–1.0, por defecto 0.95
HerramientasHasta 128 funciones
Salida estructuradaModo de objeto JSON, no esquema JSON

Z.AI posiciona el modelo para tareas de largo horizonte. El contexto largo admite grandes bases de código y colecciones de documentos, pero no debe tratarse como una razón para enviar cada archivo en cada turno. La búsqueda y la selección de contexto aún reducen la latencia y el costo.

Precios de la API de GLM-5.2

RutaEntrada / MTokEntrada en cachéSalida / MTok
Oficial de Z.AI$1.40$0.26$4.40
reAPI$0.90No publicado por separado$3.00

Para una carga de trabajo mensual con 100M tokens de entrada sin caché y 20M tokens de salida, el cálculo simple de tarifa estándar es:

Z.AI: 100 × $1.40 + 20 × $4.40 = $228
reAPI: 100 × $0.90 + 20 × $3.00 = $150

Ese ejemplo asume el mismo uso de tokens y sin aciertos de caché. La tarifa en caché de $0.26 de Z.AI puede cambiar materialmente una carga de trabajo con indicadores de sistema repetidos, definiciones de herramientas o contexto de repositorio estable.

Las etiquetas de esfuerzo de razonamiento se contraen a tres comportamientos

GLM-5.2 acepta más cadenas de esfuerzo de las que ejecuta significativamente. Según el comportamiento de la solicitud de Z.AI, los valores se asignan de la siguiente manera:

Mapa de esfuerzo de razonamiento de GLM-5.2 que muestra siete etiquetas aceptadas colapsadas en comportamiento sin pensamiento, alto y máximo

Valores enviadosComportamiento efectivo
none, minimalOmitir pensamiento
low, medium, highRazonamiento alto
xhigh, maxRazonamiento máximo

El predeterminado es max, que es caro para clasificación rutinaria, extracción y ediciones simples de código. Si la tarea necesita razonamiento pero no el máximo, envía high. Si es determinista y simple, compara none con pensamiento deshabilitado.

reasoning_effort solo importa mientras el pensamiento esté habilitado. No esperes que max anule thinking: {"type": "disabled"}.

Cómo se maneja el pensamiento en la conversación

GLM-5.2 separa el content visible del reasoning_content. Con el predeterminado clear_thinking: true, el razonamiento anterior se elimina en lugar de preservarse en los turnos. Establécelo a false solo cuando el historial de razonamiento completo permanece relevante y tu aplicación puede reproducir correctamente todos los mensajes ordenados.[3]

Esto difiere de Kimi K3, donde el pensamiento preservado es obligatorio. GLM-5.2 te permite elegir entre un contexto más limpio y la continuidad del trabajo oculto.

Llamar a GLM-5.2 con el SDK de Python de OpenAI

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

stream = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "user", "content": "Refactor this module and add tests."}
    ],
    max_tokens=8192,
    stream=True,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="")
    if delta.content:
        print(delta.content, end="")

El ID de modelo contiene un punto. glm-5-2 es el slug del sitio web y producirá un error de modelo desconocido si se envía en el cuerpo de la solicitud.

Invocación de funciones y salida estructurada

GLM-5.2 admite hasta 128 definiciones de función y transmite argumentos de invocación de herramientas cuando tool_stream está habilitado. Su comportamiento tool_choice es más estrecho que muchos modelos OpenAI: auto es la opción admitida. Diseña el indicador y las descripciones de herramientas para que el modelo pueda decidir cuándo llamarlas.

El modelo admite modo de objeto JSON a través de:

{
  "response_format": {"type": "json_object"}
}

Esto no es aplicación de esquema JSON. Valida el objeto devuelto en tu aplicación e intenta de nuevo o repara cuando falten campos obligatorios.

Temperatura, top-p y secuencias de parada

A diferencia de varios modelos de razonamiento, GLM-5.2 permite ajuste de temperatura y top-p. Z.AI recomienda cambiar uno en lugar de ambos, porque dos cambios de muestreo simultáneos dificultan la atribución del comportamiento de salida.[1]

  • Usa los valores predeterminados para el trabajo general del agente.
  • Baja temperatura para extracción o transformación repetible.
  • Usa solo una cadena de parada; la API no acepta una lista larga de paradas.
  • Mantén max_tokens realista. Un techo de 128K no es un objetivo para cada llamada.

Para agentes de codificación, el esfuerzo de razonamiento y la selección de contexto generalmente afectan más el costo que pequeños cambios de muestreo.

Cuándo usar GLM-5.2

Úsalo para trabajo de base de código grande. La ventana de contexto y el soporte de herramientas se ajustan a la navegación del repositorio, migraciones, generación de pruebas y reparación de largo plazo.

Úsalo para agentes sensibles al costo. Sus tarifas oficiales y de reAPI se sitúan bien por debajo de los niveles insignia de Claude y GPT.

Úsalo cuando los pesos abiertos importan. Los equipos pueden evaluar el auto-alojamiento o la implementación privada en lugar de depender exclusivamente de una API cerrada.

Evítalo cuando se requiere comprensión nativa de imágenes. La API de GLM-5.2 documentada es entrada y salida de texto. Elige un modelo de visión para análisis de imagen o vídeo.

Errores comunes de integración

  1. Enviar glm-5-2 en lugar de glm-5.2.
  2. Dejar el esfuerzo predeterminado max en cada solicitud de bajo valor.
  3. Esperar que response_format aplique un esquema JSON.
  4. Establecer tool_choice a un valor de herramienta forzada no admitido.
  5. Ajustar temperatura y top-p simultáneamente.
  6. Leer solo content durante la transmisión y descartar reasoning_content sin decidir si es necesario.
  7. Llenar la ventana de contexto de 1M en lugar de recuperar archivos relevantes.

FAQ

¿Es GLM-5.2 de código abierto?

Es más seguro describir GLM-5.2 como peso abierto a menos que la licencia específica y los artefactos de lanzamiento satisfagan tu definición de código abierto. Revisa la licencia del modelo actual antes de la redistribución o implementación comercial.

¿Cuánto cuesta la API de GLM-5.2?

Z.AI lista $1.40 entrada, $0.26 entrada en caché, y $4.40 salida por millón de tokens. reAPI actualmente lista $0.90 entrada y $3 salida.

¿Admite GLM-5.2 un millón de tokens?

Sí. Z.AI documenta una ventana de contexto de 1M tokens y salida máxima de 128K.

¿Se puede desactivar el pensamiento?

Sí. Establece thinking.type a disabled, o usa un valor de esfuerzo sin pensamiento donde sea compatible. El predeterminado es habilitado con razonamiento máximo.

¿Admite GLM-5.2 imágenes?

No en la superficie del modelo de chat documentada. Acepta texto y devuelve texto.

¿Es la API de GLM-5.2 compatible con OpenAI?

La ruta de reAPI es compatible con OpenAI Chat Completions. Los campos específicos del proveedor como thinking y reasoning_effort deben pasarse a través del mecanismo extra-body del SDK.

Conclusión

La API de GLM-5.2 es convincente cuando una ventana de contexto de un millón de tokens, pesos abiertos y precios de tokens bajos importan más que la multimodalidad nativa. La integración es directa una vez que se manejan correctamente tres detalles: envía glm-5.2 con el punto, baja el esfuerzo predeterminado max para el tráfico rutinario y trata el modo JSON como sintaxis, no validación de esquema.

References

  1. Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
  2. Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
  3. Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion

Further reading