Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
GLM-5.2: контекст 1M, цена и кодирование (2026)
2026/08/01

GLM-5.2: контекст 1M, цена и кодирование (2026)

API GLM-5.2 с контекстом 1M токенов для кодирования. Официальная цена $1.40/$4.40, тарифы reAPI, контроль рассуждений и ограничения открытого стандарта.

GLM-5.2 — флагманская модель с открытыми весами от Z.AI для долгосрочного кодирования и работы с агентами. API GLM-5.2 сочетает контекстное окно в один миллион токенов, максимальный выход 128K, отключаемое мышление, вызовы функций, JSON-режим и форму запроса, совместимую с OpenAI.[1]

Его ориентировочная цена конкурентоспособна: Z.AI указывает $1.40 за миллион входящих токенов, $0.26 за кэшированный вход и $4.40 за миллион выходящих токенов. reAPI в настоящий момент указывает $0.90 входящих и $3 выходящих через совместимый шлюз.[2]

TL;DR

  • ID модели: glm-5.2 с точкой.
  • Контекст: 1M токенов; максимальный выход — 131 072 токена.
  • Официальная цена: $1.40 входящих, $0.26 кэшированных входящих, $4.40 выходящих за MTok.
  • Цена reAPI: $0.90 входящих и $3 выходящих за MTok.
  • Мышление: включено по умолчанию, но переключаемо.
  • Усилие рассуждений: принимает семь ярлыков, но сводится к трём эффективным поведениям; по умолчанию max.
  • Инструменты: до 128 функций, tool_choice: "auto", потоковые аргументы вызова инструмента.
  • Главная ловушка: слаг страницы — glm-5-2, но запросы API должны отправлять glm-5.2.

Спецификации GLM-5.2

СвойствоGLM-5.2
ПоставщикZ.AI
РаспределениеОткрытый вес
API ID моделиglm-5.2
Контекстное окно1 000 000 токенов
Максимальный выход131 072 токена
Вход/выходТекст / текст
Стандарт мышленияВключено
Стандарт рассужденийmax
Температура0.0–1.0, по умолчанию 1.0
Top-p0.01–1.0, по умолчанию 0.95
ИнструментыДо 128 функций
Структурированный выходJSON-режим объекта, не JSON Schema

Z.AI позиционирует модель для долгосрочных задач. Большой контекст поддерживает крупные кодовые базы и коллекции документов, но его не следует рассматривать как причину отправлять каждый файл при каждом обращении. Поиск и выбор контекста всё ещё снижают задержку и стоимость.

Цена API GLM-5.2

МаршрутВходящие / MTokКэшированные входящиеВыходящие / MTok
Z.AI официально$1.40$0.26$4.40
reAPI$0.90Не опубликовано отдельно$3.00

Для месячной нагрузки со 100M некэшированных входящих токенов и 20M выходящих токенов простой расчёт по стандартной ставке:

Z.AI: 100 × $1.40 + 20 × $4.40 = $228
reAPI: 100 × $0.90 + 20 × $3.00 = $150

Этот пример предполагает одинаковое использование токенов и отсутствие попаданий в кэш. Кэшированная ставка Z.AI в $0.26 может существенно изменить нагрузку с повторяющимися системными подсказками, определениями инструментов или стабильным контекстом хранилища.

Ярлыки усилия рассуждений сводятся к трём поведениям

GLM-5.2 принимает больше строк усилий, чем он осмысленно выполняет. Согласно поведению запроса Z.AI, значения сопоставляются следующим образом:

Карта усилий рассуждений GLM-5.2, показывающая семь принятых ярлыков, сводящихся к поведению без мышления, высокому и максимальному

Отправленные значенияЭффективное поведение
none, minimalПропустить мышление
low, medium, highВысокие рассуждения
xhigh, maxМаксимальные рассуждения

По умолчанию используется max, что дорого для рутинной классификации, извлечения и простого редактирования кода. Если задача нуждается в рассуждениях, но не в максимальных, отправь high. Если это детерминированное и простое, сравни none с отключённым мышлением.

reasoning_effort имеет значение только во время включённого мышления. Не ожидай, что max переопределит thinking: {"type": "disabled"}.

Как обрабатывается мышление в диалоге

GLM-5.2 разделяет видимый content от reasoning_content. При стандартном clear_thinking: true предыдущие рассуждения удаляются, а не сохраняются между ходами. Установи его на false только когда полная история рассуждений остаётся актуальной и твоё приложение может правильно воспроизвести полный упорядоченный список сообщений.[3]

Это отличается от Kimi K3, где сохранённое мышление обязательно. GLM-5.2 позволяет тебе выбирать между более чистым контекстом и преемственностью скрытой работы.

Вызов GLM-5.2 с Python SDK OpenAI

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

stream = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "user", "content": "Refactor this module and add tests."}
    ],
    max_tokens=8192,
    stream=True,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)
    if reasoning:
        print(reasoning, end="")
    if delta.content:
        print(delta.content, end="")

ID модели содержит точку. glm-5-2 — слаг веб-сайта и вызовет ошибку неизвестной модели, если его отправить в теле запроса.

Вызовы функций и структурированный выход

GLM-5.2 поддерживает до 128 определений функций и потоки аргументов вызова инструмента при включённом tool_stream. Его поведение tool_choice уже, чем во многих моделях OpenAI: поддерживаемый выбор — auto. Разработай подсказку и описания инструментов так, чтобы модель могла решить, когда их вызывать.

Модель поддерживает JSON-режим объекта через:

{
  "response_format": {"type": "json_object"}
}

Это не принуждение JSON Schema. Проверьте возвращаемый объект в своём приложении и повторите попытку или восстановите при отсутствии требуемых полей.

Температура, top-p и стоп-последовательности

В отличие от некоторых моделей рассуждений, GLM-5.2 позволяет настройку температуры и top-p. Z.AI рекомендует изменить один, а не оба, потому что два одновременных изменения выборки затрудняют определение поведения выхода.[1]

  • Используй стандартные значения для общей работы агента.
  • Более низкая температура для повторяемого извлечения или трансформации.
  • Используй только одну стоп-строку; API не принимает длинный список стопов.
  • Держи max_tokens реалистично. Потолок 128K — это не цель для каждого вызова.

Для кодирующих агентов усилие рассуждений и выбор контекста обычно влияют на стоимость больше, чем небольшие изменения выборки.

Когда использовать GLM-5.2

Используй для работы с большими кодовыми базами. Контекстное окно и поддержка инструментов подходят для навигации по хранилищу, миграций, генерации тестов и долгосрочного восстановления.

Используй для чувствительных к стоимости агентов. Его официальные и reAPI ставки находятся хорошо ниже флагманских уровней Claude и GPT.

Используй когда открытые веса имеют значение. Команды могут оценить самостоятельный хостинг или приватное развёртывание вместо исключительной зависимости от закрытого API.

Избегай когда требуется встроенное понимание изображений. Задокументированный API GLM-5.2 — текст на входе и текст на выходе. Выбери модель зрения для анализа изображений или видео.

Типичные ошибки интеграции

  1. Отправка glm-5-2 вместо glm-5.2.
  2. Оставление стандартного усилия max при каждом низкоценном запросе.
  3. Ожидание того, что response_format будет принуждать JSON Schema.
  4. Установка tool_choice на неподдерживаемое значение принудительного инструмента.
  5. Одновременная настройка температуры и top-p.
  6. Чтение только content при потоковой передаче и отбрасывание reasoning_content без решения, нужно ли оно.
  7. Заполнение контекстного окна 1M вместо извлечения релевантных файлов.

FAQ

Является ли GLM-5.2 открытым источником?

Безопаснее описать GLM-5.2 как открытый вес, если конкретная лицензия и артефакты выпуска не удовлетворяют твоему определению открытого источника. Проверьте текущую лицензию модели перед перераспределением или коммерческим развёртыванием.

Сколько стоит API GLM-5.2?

Z.AI указывает $1.40 входящих, $0.26 кэшированных входящих и $4.40 выходящих за миллион токенов. reAPI в настоящий момент указывает $0.90 входящих и $3 выходящих.

Поддерживает ли GLM-5.2 один миллион токенов?

Да. Z.AI документирует контекстное окно 1M-токена и максимальный выход 128K.

Можно ли отключить мышление?

Да. Установи thinking.type на disabled, или используй значение усилия без мышления, где это поддерживается. По умолчанию включено с максимальным рассуждением.

Поддерживает ли GLM-5.2 изображения?

Нет на задокументированной поверхности модели чата. Он принимает текст и возвращает текст.

Совместим ли API GLM-5.2 с OpenAI?

Маршрут reAPI совместим с OpenAI Chat Completions. Зависящие от поставщика поля, такие как thinking и reasoning_effort, должны передаваться через механизм extra-body SDK.

Заключение

API GLM-5.2 привлекателен, когда контекст из одного миллиона токенов, открытые веса и низкие цены на токены важнее встроенной мультимодальности. Интеграция проста после правильной обработки трёх деталей: отправка glm-5.2 с точкой, снижение стандартного усилия max для рутинного трафика и обработка JSON-режима как синтаксиса, а не проверки схемы.

References

  1. Z.AI. GLM-5.2 model guide and API behavior. docs.z.ai/guides/llm/glm-5.2
  2. Z.AI. Model pricing. docs.z.ai/guides/overview/pricing
  3. Z.AI. Chat Completions API reference. docs.z.ai/api-reference/llm/chat-completion

Further reading