
GLM-5.2: контекст 1M, цена и кодирование (2026)
API GLM-5.2 с контекстом 1M токенов для кодирования. Официальная цена $1.40/$4.40, тарифы reAPI, контроль рассуждений и ограничения открытого стандарта.
GLM-5.2 — флагманская модель с открытыми весами от Z.AI для долгосрочного кодирования и работы с агентами. API GLM-5.2 сочетает контекстное окно в один миллион токенов, максимальный выход 128K, отключаемое мышление, вызовы функций, JSON-режим и форму запроса, совместимую с OpenAI.[1]
Его ориентировочная цена конкурентоспособна: Z.AI указывает $1.40 за миллион входящих токенов, $0.26 за кэшированный вход и $4.40 за миллион выходящих токенов. reAPI в настоящий момент указывает $0.90 входящих и $3 выходящих через совместимый шлюз.[2]
TL;DR
- ID модели:
glm-5.2с точкой. - Контекст: 1M токенов; максимальный выход — 131 072 токена.
- Официальная цена: $1.40 входящих, $0.26 кэшированных входящих, $4.40 выходящих за MTok.
- Цена reAPI: $0.90 входящих и $3 выходящих за MTok.
- Мышление: включено по умолчанию, но переключаемо.
- Усилие рассуждений: принимает семь ярлыков, но сводится к трём эффективным поведениям; по умолчанию
max. - Инструменты: до 128 функций,
tool_choice: "auto", потоковые аргументы вызова инструмента. - Главная ловушка: слаг страницы —
glm-5-2, но запросы API должны отправлятьglm-5.2.
Спецификации GLM-5.2
| Свойство | GLM-5.2 |
|---|---|
| Поставщик | Z.AI |
| Распределение | Открытый вес |
| API ID модели | glm-5.2 |
| Контекстное окно | 1 000 000 токенов |
| Максимальный выход | 131 072 токена |
| Вход/выход | Текст / текст |
| Стандарт мышления | Включено |
| Стандарт рассуждений | max |
| Температура | 0.0–1.0, по умолчанию 1.0 |
| Top-p | 0.01–1.0, по умолчанию 0.95 |
| Инструменты | До 128 функций |
| Структурированный выход | JSON-режим объекта, не JSON Schema |
Z.AI позиционирует модель для долгосрочных задач. Большой контекст поддерживает крупные кодовые базы и коллекции документов, но его не следует рассматривать как причину отправлять каждый файл при каждом обращении. Поиск и выбор контекста всё ещё снижают задержку и стоимость.
Цена API GLM-5.2
| Маршрут | Входящие / MTok | Кэшированные входящие | Выходящие / MTok |
|---|---|---|---|
| Z.AI официально | $1.40 | $0.26 | $4.40 |
| reAPI | $0.90 | Не опубликовано отдельно | $3.00 |
Для месячной нагрузки со 100M некэшированных входящих токенов и 20M выходящих токенов простой расчёт по стандартной ставке:
Z.AI: 100 × $1.40 + 20 × $4.40 = $228
reAPI: 100 × $0.90 + 20 × $3.00 = $150Этот пример предполагает одинаковое использование токенов и отсутствие попаданий в кэш. Кэшированная ставка Z.AI в $0.26 может существенно изменить нагрузку с повторяющимися системными подсказками, определениями инструментов или стабильным контекстом хранилища.
Ярлыки усилия рассуждений сводятся к трём поведениям
GLM-5.2 принимает больше строк усилий, чем он осмысленно выполняет. Согласно поведению запроса Z.AI, значения сопоставляются следующим образом:

| Отправленные значения | Эффективное поведение |
|---|---|
none, minimal | Пропустить мышление |
low, medium, high | Высокие рассуждения |
xhigh, max | Максимальные рассуждения |
По умолчанию используется max, что дорого для рутинной классификации, извлечения и простого редактирования кода. Если задача нуждается в рассуждениях, но не в максимальных, отправь high. Если это детерминированное и простое, сравни none с отключённым мышлением.
reasoning_effort имеет значение только во время включённого мышления. Не ожидай, что max переопределит thinking: {"type": "disabled"}.
Как обрабатывается мышление в диалоге
GLM-5.2 разделяет видимый content от reasoning_content. При стандартном clear_thinking: true предыдущие рассуждения удаляются, а не сохраняются между ходами. Установи его на false только когда полная история рассуждений остаётся актуальной и твоё приложение может правильно воспроизвести полный упорядоченный список сообщений.[3]
Это отличается от Kimi K3, где сохранённое мышление обязательно. GLM-5.2 позволяет тебе выбирать между более чистым контекстом и преемственностью скрытой работы.
Вызов GLM-5.2 с Python SDK OpenAI
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
stream = client.chat.completions.create(
model="glm-5.2",
messages=[
{"role": "user", "content": "Refactor this module and add tests."}
],
max_tokens=8192,
stream=True,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
},
)
for chunk in stream:
delta = chunk.choices[0].delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
print(reasoning, end="")
if delta.content:
print(delta.content, end="")ID модели содержит точку. glm-5-2 — слаг веб-сайта и вызовет ошибку неизвестной модели, если его отправить в теле запроса.
Вызовы функций и структурированный выход
GLM-5.2 поддерживает до 128 определений функций и потоки аргументов вызова инструмента при включённом tool_stream. Его поведение tool_choice уже, чем во многих моделях OpenAI: поддерживаемый выбор — auto. Разработай подсказку и описания инструментов так, чтобы модель могла решить, когда их вызывать.
Модель поддерживает JSON-режим объекта через:
{
"response_format": {"type": "json_object"}
}Это не принуждение JSON Schema. Проверьте возвращаемый объект в своём приложении и повторите попытку или восстановите при отсутствии требуемых полей.
Температура, top-p и стоп-последовательности
В отличие от некоторых моделей рассуждений, GLM-5.2 позволяет настройку температуры и top-p. Z.AI рекомендует изменить один, а не оба, потому что два одновременных изменения выборки затрудняют определение поведения выхода.[1]
- Используй стандартные значения для общей работы агента.
- Более низкая температура для повторяемого извлечения или трансформации.
- Используй только одну стоп-строку; API не принимает длинный список стопов.
- Держи
max_tokensреалистично. Потолок 128K — это не цель для каждого вызова.
Для кодирующих агентов усилие рассуждений и выбор контекста обычно влияют на стоимость больше, чем небольшие изменения выборки.
Когда использовать GLM-5.2
Используй для работы с большими кодовыми базами. Контекстное окно и поддержка инструментов подходят для навигации по хранилищу, миграций, генерации тестов и долгосрочного восстановления.
Используй для чувствительных к стоимости агентов. Его официальные и reAPI ставки находятся хорошо ниже флагманских уровней Claude и GPT.
Используй когда открытые веса имеют значение. Команды могут оценить самостоятельный хостинг или приватное развёртывание вместо исключительной зависимости от закрытого API.
Избегай когда требуется встроенное понимание изображений. Задокументированный API GLM-5.2 — текст на входе и текст на выходе. Выбери модель зрения для анализа изображений или видео.
Типичные ошибки интеграции
- Отправка
glm-5-2вместоglm-5.2. - Оставление стандартного усилия
maxпри каждом низкоценном запросе. - Ожидание того, что
response_formatбудет принуждать JSON Schema. - Установка
tool_choiceна неподдерживаемое значение принудительного инструмента. - Одновременная настройка температуры и top-p.
- Чтение только
contentпри потоковой передаче и отбрасываниеreasoning_contentбез решения, нужно ли оно. - Заполнение контекстного окна 1M вместо извлечения релевантных файлов.
FAQ
Является ли GLM-5.2 открытым источником?
Безопаснее описать GLM-5.2 как открытый вес, если конкретная лицензия и артефакты выпуска не удовлетворяют твоему определению открытого источника. Проверьте текущую лицензию модели перед перераспределением или коммерческим развёртыванием.
Сколько стоит API GLM-5.2?
Z.AI указывает $1.40 входящих, $0.26 кэшированных входящих и $4.40 выходящих за миллион токенов. reAPI в настоящий момент указывает $0.90 входящих и $3 выходящих.
Поддерживает ли GLM-5.2 один миллион токенов?
Да. Z.AI документирует контекстное окно 1M-токена и максимальный выход 128K.
Можно ли отключить мышление?
Да. Установи thinking.type на disabled, или используй значение усилия без мышления, где это поддерживается. По умолчанию включено с максимальным рассуждением.
Поддерживает ли GLM-5.2 изображения?
Нет на задокументированной поверхности модели чата. Он принимает текст и возвращает текст.
Совместим ли API GLM-5.2 с OpenAI?
Маршрут reAPI совместим с OpenAI Chat Completions. Зависящие от поставщика поля, такие как thinking и reasoning_effort, должны передаваться через механизм extra-body SDK.
Заключение
API GLM-5.2 привлекателен, когда контекст из одного миллиона токенов, открытые веса и низкие цены на токены важнее встроенной мультимодальности. Интеграция проста после правильной обработки трёх деталей: отправка glm-5.2 с точкой, снижение стандартного усилия max для рутинного трафика и обработка JSON-режима как синтаксиса, а не проверки схемы.
References
- Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
- Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
- Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion
Further reading
- reAPI. GLM-5.2 API documentation. reapi.ai/docs/glm-5-2
- reAPI. GLM-5.2 model page. reapi.ai/models/glm-5-2
- reAPI. Kimi K3 complete guide. reapi.ai/blog/kimi-k3-complete-guide
Автор

Категории
Ещё статьи

Как режиссировать AI-видео: план сцены для натуральной игры
Научись спланировать убедительный диалог в AI-видео: план сцены, состояния персонажей, движение камеры, шаблоны промптов, проверки качества и пример API.


Альтернативы Sora 2 API: длительность, аудио, стоимость
Сравниваем альтернативы Sora 2 API по самому важному: максимальная длительность, аудиотариф и цены за секунду, все проверено в августе 2026 года.


Сравнение цен Wan 3.0 API: 480P, 720P и 1080P
Сравниваем официальный API Wan 3.0 с reAPI и рассчитываем стоимость видео длительностью 5, 10 и 30 секунд при разрешениях 480P, 720P и 1080P.
