
Guía de API de GLM-5.2: contexto de 1M, precios y codificación
Usa la API de GLM-5.2 con código compatible con OpenAI. Aprende su contexto de 1M, precios oficiales $1.40/$4.40, tarifas de reAPI y razonamiento
GLM-5.2 es el modelo insignia de peso abierto de Z.AI para trabajo de codificación de largo horizonte y agentes. La API de GLM-5.2 combina una ventana de contexto de un millón de tokens, salida máxima de 128K, pensamiento que puede desactivarse, invocación de funciones, modo JSON y una forma de solicitud compatible con OpenAI.[1]
Su precio titular es competitivo: Z.AI lista $1.40 por millón de tokens de entrada, $0.26 para entrada en caché y $4.40 por millón de tokens de salida. reAPI actualmente lista $0.90 entrada y $3 salida a través de su puerta de enlace compatible.[2]
TL;DR
- ID de modelo:
glm-5.2, con el punto. - Contexto: 1M tokens; la salida máxima es 131,072 tokens.
- Precio oficial: $1.40 entrada, $0.26 entrada en caché, $4.40 salida por MTok.
- Precio de reAPI: $0.90 entrada y $3 salida por MTok.
- Pensamiento: habilitado por defecto pero intercambiable.
- Esfuerzo de razonamiento: acepta siete etiquetas pero se reduce a tres comportamientos efectivos; el predeterminado es
max. - Herramientas: hasta 128 funciones,
tool_choice: "auto", argumentos de invocación de herramientas transmitidos. - Trampa principal: el slug de página es
glm-5-2, pero las solicitudes de API deben enviarglm-5.2.
Especificaciones de GLM-5.2
| Propiedad | GLM-5.2 |
|---|---|
| Proveedor | Z.AI |
| Distribución | Peso abierto |
| ID de modelo de API | glm-5.2 |
| Ventana de contexto | 1,000,000 tokens |
| Salida máxima | 131,072 tokens |
| Entrada/salida | Texto / texto |
| Pensamiento predeterminado | Habilitado |
| Predeterminado de razonamiento | max |
| Temperatura | 0.0–1.0, por defecto 1.0 |
| Top-p | 0.01–1.0, por defecto 0.95 |
| Herramientas | Hasta 128 funciones |
| Salida estructurada | Modo de objeto JSON, no esquema JSON |
Z.AI posiciona el modelo para tareas de largo horizonte. El contexto largo admite grandes bases de código y colecciones de documentos, pero no debe tratarse como una razón para enviar cada archivo en cada turno. La búsqueda y la selección de contexto aún reducen la latencia y el costo.
Precios de la API de GLM-5.2
| Ruta | Entrada / MTok | Entrada en caché | Salida / MTok |
|---|---|---|---|
| Oficial de Z.AI | $1.40 | $0.26 | $4.40 |
| reAPI | $0.90 | No publicado por separado | $3.00 |
Para una carga de trabajo mensual con 100M tokens de entrada sin caché y 20M tokens de salida, el cálculo simple de tarifa estándar es:
Z.AI: 100 × $1.40 + 20 × $4.40 = $228
reAPI: 100 × $0.90 + 20 × $3.00 = $150Ese ejemplo asume el mismo uso de tokens y sin aciertos de caché. La tarifa en caché de $0.26 de Z.AI puede cambiar materialmente una carga de trabajo con indicadores de sistema repetidos, definiciones de herramientas o contexto de repositorio estable.
Las etiquetas de esfuerzo de razonamiento se contraen a tres comportamientos
GLM-5.2 acepta más cadenas de esfuerzo de las que ejecuta significativamente. Según el comportamiento de la solicitud de Z.AI, los valores se asignan de la siguiente manera:

| Valores enviados | Comportamiento efectivo |
|---|---|
none, minimal | Omitir pensamiento |
low, medium, high | Razonamiento alto |
xhigh, max | Razonamiento máximo |
El predeterminado es max, que es caro para clasificación rutinaria, extracción y ediciones simples de código. Si la tarea necesita razonamiento pero no el máximo, envía high. Si es determinista y simple, compara none con pensamiento deshabilitado.
reasoning_effort solo importa mientras el pensamiento esté habilitado. No esperes que max anule thinking: {"type": "disabled"}.
Cómo se maneja el pensamiento en la conversación
GLM-5.2 separa el content visible del reasoning_content. Con el predeterminado clear_thinking: true, el razonamiento anterior se elimina en lugar de preservarse en los turnos. Establécelo a false solo cuando el historial de razonamiento completo permanece relevante y tu aplicación puede reproducir correctamente todos los mensajes ordenados.[3]
Esto difiere de Kimi K3, donde el pensamiento preservado es obligatorio. GLM-5.2 te permite elegir entre un contexto más limpio y la continuidad del trabajo oculto.
Llamar a GLM-5.2 con el SDK de Python de OpenAI
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
stream = client.chat.completions.create(
model="glm-5.2",
messages=[
{"role": "user", "content": "Refactor this module and add tests."}
],
max_tokens=8192,
stream=True,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
},
)
for chunk in stream:
delta = chunk.choices[0].delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
print(reasoning, end="")
if delta.content:
print(delta.content, end="")El ID de modelo contiene un punto. glm-5-2 es el slug del sitio web y producirá un error de modelo desconocido si se envía en el cuerpo de la solicitud.
Invocación de funciones y salida estructurada
GLM-5.2 admite hasta 128 definiciones de función y transmite argumentos de invocación de herramientas cuando tool_stream está habilitado. Su comportamiento tool_choice es más estrecho que muchos modelos OpenAI: auto es la opción admitida. Diseña el indicador y las descripciones de herramientas para que el modelo pueda decidir cuándo llamarlas.
El modelo admite modo de objeto JSON a través de:
{
"response_format": {"type": "json_object"}
}Esto no es aplicación de esquema JSON. Valida el objeto devuelto en tu aplicación e intenta de nuevo o repara cuando falten campos obligatorios.
Temperatura, top-p y secuencias de parada
A diferencia de varios modelos de razonamiento, GLM-5.2 permite ajuste de temperatura y top-p. Z.AI recomienda cambiar uno en lugar de ambos, porque dos cambios de muestreo simultáneos dificultan la atribución del comportamiento de salida.[1]
- Usa los valores predeterminados para el trabajo general del agente.
- Baja temperatura para extracción o transformación repetible.
- Usa solo una cadena de parada; la API no acepta una lista larga de paradas.
- Mantén
max_tokensrealista. Un techo de 128K no es un objetivo para cada llamada.
Para agentes de codificación, el esfuerzo de razonamiento y la selección de contexto generalmente afectan más el costo que pequeños cambios de muestreo.
Cuándo usar GLM-5.2
Úsalo para trabajo de base de código grande. La ventana de contexto y el soporte de herramientas se ajustan a la navegación del repositorio, migraciones, generación de pruebas y reparación de largo plazo.
Úsalo para agentes sensibles al costo. Sus tarifas oficiales y de reAPI se sitúan bien por debajo de los niveles insignia de Claude y GPT.
Úsalo cuando los pesos abiertos importan. Los equipos pueden evaluar el auto-alojamiento o la implementación privada en lugar de depender exclusivamente de una API cerrada.
Evítalo cuando se requiere comprensión nativa de imágenes. La API de GLM-5.2 documentada es entrada y salida de texto. Elige un modelo de visión para análisis de imagen o vídeo.
Errores comunes de integración
- Enviar
glm-5-2en lugar deglm-5.2. - Dejar el esfuerzo predeterminado
maxen cada solicitud de bajo valor. - Esperar que
response_formataplique un esquema JSON. - Establecer
tool_choicea un valor de herramienta forzada no admitido. - Ajustar temperatura y top-p simultáneamente.
- Leer solo
contentdurante la transmisión y descartarreasoning_contentsin decidir si es necesario. - Llenar la ventana de contexto de 1M en lugar de recuperar archivos relevantes.
FAQ
¿Es GLM-5.2 de código abierto?
Es más seguro describir GLM-5.2 como peso abierto a menos que la licencia específica y los artefactos de lanzamiento satisfagan tu definición de código abierto. Revisa la licencia del modelo actual antes de la redistribución o implementación comercial.
¿Cuánto cuesta la API de GLM-5.2?
Z.AI lista $1.40 entrada, $0.26 entrada en caché, y $4.40 salida por millón de tokens. reAPI actualmente lista $0.90 entrada y $3 salida.
¿Admite GLM-5.2 un millón de tokens?
Sí. Z.AI documenta una ventana de contexto de 1M tokens y salida máxima de 128K.
¿Se puede desactivar el pensamiento?
Sí. Establece thinking.type a disabled, o usa un valor de esfuerzo sin pensamiento donde sea compatible. El predeterminado es habilitado con razonamiento máximo.
¿Admite GLM-5.2 imágenes?
No en la superficie del modelo de chat documentada. Acepta texto y devuelve texto.
¿Es la API de GLM-5.2 compatible con OpenAI?
La ruta de reAPI es compatible con OpenAI Chat Completions. Los campos específicos del proveedor como thinking y reasoning_effort deben pasarse a través del mecanismo extra-body del SDK.
Conclusión
La API de GLM-5.2 es convincente cuando una ventana de contexto de un millón de tokens, pesos abiertos y precios de tokens bajos importan más que la multimodalidad nativa. La integración es directa una vez que se manejan correctamente tres detalles: envía glm-5.2 con el punto, baja el esfuerzo predeterminado max para el tráfico rutinario y trata el modo JSON como sintaxis, no validación de esquema.
References
- Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
- Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
- Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion
Further reading
- reAPI. GLM-5.2 API documentation. reapi.ai/docs/glm-5-2
- reAPI. GLM-5.2 model page. reapi.ai/models/glm-5-2
- reAPI. Kimi K3 complete guide. reapi.ai/blog/kimi-k3-complete-guide
Autor

Categorías
Más publicaciones

Transferencia de fotograma clave: Seedream a Seedance
Seedream fija composición con imagen barata, Seedance genera movimiento desde ese fotograma aprobado. Qué responsabilidades tiene cada fase y dónde falla.


Videos largos IA: Encadenamiento más allá del límite
Máximo 30 segundos por generación IA. Encadenar segmentos sin costura, reglas de parámetros, dónde se ven roturas, y costo de tres minutos de vídeo.


¿GPT-5.6 está fuera? Sí — y aquí está lo que se lanzó
GPT-5.6 lanzado en tres niveles: Sol, Terra y Luna. Despliegue limitado semanas causó respuestas conflictivas; Terra es la que vale la pena.
