GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
Что такое Ox Alpha? Скрытая модель с контекстом 1M и видеовходом
2026/09/29

Что такое Ox Alpha? Скрытая модель с контекстом 1M и видеовходом

Ox Alpha — анонимная модель с контекстом 1M на OpenRouter в августе 2026 года. Позже Z.ai раскрыла в ней GLM-5.3-Flash. Характеристики, цены, бенчмарки и API.

Ox Alpha — анонимная «стелс»-модель ИИ, которая появилась на OpenRouter 20 августа 2026 года с контекстным окном в 1 048 576 токенов и поддержкой текста, изображений и видео на входе.[1] Шесть дней никто не признавался, кто её создал. 26 августа Z.ai положила конец догадкам: Ox Alpha оказалась невыпущенной сборкой GLM-5.3-Flash, которую публично тестировали до запуска.[3]

Поэтому честный ответ на вопрос «что такое Ox Alpha» изменился с тех пор, как были написаны большинство обзоров. Это больше не бесплатная загадочная модель. Это выпущенная модель с открытыми весами, прайс-листом, карточкой модели и результатами бенчмарков. В этом руководстве разберём, чем Ox Alpha была во время превью, чем она оказалась и что именно нужно вызывать сегодня, если вам нужна та же модель.

TL;DR

  • Запуск: Ox Alpha появилась на OpenRouter 20 августа 2026 года как stealth/ox-alpha и была заявлена как модель с рассуждениями для кодинга, агентной работы и продакшен-нагрузок.[1]
  • Происхождение: 26 августа Z.ai подтвердила, что анонимно тестировала GLM-5.3-Flash под именем ox-alpha на OpenCode и OpenRouter.[3]
  • Размер: 320B параметров всего, 18B активных, гибрид разреженного и линейного внимания.[3]
  • Модальности: на входе видео, изображения, текст и файлы; на выходе текст; контекст 1M и максимальный выход 128K в API Z.ai.[4]
  • Цена сейчас: Z.ai указывает для GLM-5.3-Flash $0.15 за вход, $0.03 за кэшированный вход и $0.50 за выход за миллион токенов.[5]
  • Веса: опубликованы на Hugging Face под лицензией MIT.[6]

Чем была Ox Alpha во время скрытого превью

OpenRouter описывал Ox Alpha как «модель с рассуждениями, созданную для кодинга, длительной агентной работы и продакшен-нагрузок», подходящую для долгосрочной разработки ПО и для сценариев, где текст сочетается с визуальным контекстом.[1] В поле провайдера значилось «stealth». В карточке говорилось, что моделью управляет третья сторона, решившая остаться анонимной, а OpenRouter лишь маршрутизирует запросы.

Для бесплатного листинга характеристики были необычными. Собственный FAQ OpenRouter на этой странице указывает контекстное окно в 1 048 576 токенов и сообщает, что Ox Alpha «принимает на вход текст, изображения и видео и возвращает текст».[1] Видеовход до сих пор редкость среди моделей для кодинга, а окно 1M на бесплатном эндпоинте быстро привлекло внимание.

TechCrunch написал об этом ажиотаже 23 августа. В заметке сказано, что модель была бесплатной на OpenRouter, что CEO Stripe Патрик Коллисон назвал её «очень впечатляющей» и что догадки расходились кардинально.[2] Ранние предположения указывали на семейство GLM от Z.ai. В обновлении Wccftech вместо этого фигурировала невыпущенная модель Microsoft MAI, а в тредах Reddit спорили в обе стороны. Иначе говоря, сообщество по «отпечаткам» модели шло в правильном направлении, но доказать это никто не мог.

Одна деталь из превью по-прежнему важна. В уведомлении OpenRouter сказано, что промпты и ответы, отправленные в Ox Alpha, «сохранялись провайдером и не используются для обучения».[1] Если в августе вы вставляли в Ox Alpha приватный код, эти данные ушли в Z.ai.

Ox Alpha оказалась GLM-5.3-Flash

Разгадка появилась в посте Z.ai о запуске GLM-5.3-Flash от 26 августа 2026 года: «До релиза мы анонимно тестировали GLM-5.3-Flash под именем ox-alpha на OpenCode и OpenRouter, чтобы собрать отзывы пользователей. Она быстро стала самой популярной моделью недели — и весь этот трафик обслуживался на китайских ИИ-чипах».[3]

OpenRouter обновил скрытую страницу в том же ключе. Теперь там написано: «Эта стелс-модель была разработана и эксплуатировалась ZAI; раскрыто, что это ZAI GLM-5.3-Flash», а пользователей направляют на листинг z-ai/glm-5.3-flash.[1] В этом листинге указана дата релиза 26 августа 2026 года.[7]

GLM-5.3-Flash — первая нативно мультимодальная модель в серии GLM-5. По словам Z.ai, она построена на новой, заново обученной базовой модели, а не является дообучением одной из прежних GLM, и была предобучена на мультимодальном корпусе из 30T токенов.[3]

Характеристики Ox Alpha вкратце

ПараметрOx Alpha / GLM-5.3-Flash
РазработчикZ.ai (подтверждено 26 августа 2026 года)
Стелс-IDstealth/ox-alpha (выведен из эксплуатации)
Код модели в APIglm-5.3-flash, а также более быстрая glm-5.3-flashx
Параметры320B всего, 18B активных
Слои45
ВходВидео, изображения, текст, файлы
ВыходТекст
Контекстное окно1M токенов в API Z.ai
Максимальный выход128K токенов
МышлениеВсегда включено; reasoning_effort: low, high или max
ЛицензияMIT, веса на Hugging Face

Источники: пост Z.ai о запуске и руководство по модели, а также карточка модели на Hugging Face.[3][4][6] Страница GLM-5.3-Flash на OpenRouter и руководство Z.ai сходятся в размере контекста: OpenRouter указывает 1 048 576 токенов, то есть те же 1M, что и Z.ai.[7][4] Если планируете заполнять окно целиком, закладывайтесь на 1M.

Как Ox Alpha получила столько контекста при таких малых вычислениях

Архитектура объясняет и окно 1M, и низкую цену. По сравнению с GLM-4.5 у GLM-5.3-Flash похожий общий размер (320B против 355B), но почти вдвое меньше активных параметров (18B против 32B) и меньше половины слоёв (45 против 92).[3]

Главное изменение касается внимания. Z.ai сочетает линейное внимание, которое отслеживает локальные зависимости через скользящее состояние, с разреженным вниманием, которое с помощью лёгкого индексатора подтягивает релевантные токены из далёких участков контекста. Техника, которую Z.ai называет IndexPool, сжимает четыре ключевых вектора индексатора в один, чтобы индексатор оставался дешёвым на 1M токенов. По сравнению с GLM-5.3 Z.ai сообщает о снижении вычислений на внимание в 3.0× и уменьшении KV-кэша в 4.4×.[3]

Этим же объясняется, почему превью могло работать на китайских ИИ-чипах. По словам Z.ai, эти чипы ограничены в первую очередь объёмом и пропускной способностью памяти, и компании удалось в 3× улучшить сквозную производительность инференса относительно первого базового варианта на том же железе.[3] Меньший KV-кэш — ровно то, что нужно чипу, упирающемуся в память.

Бенчмарки Ox Alpha: теперь цифры официальные

Во время превью любой бенчмарк Ox Alpha был скриншотом от незнакомца. Теперь есть официальная таблица. Это собственные цифры Z.ai, а не независимые проверки, поэтому воспринимайте их как заявление вендора.[3]

БенчмаркGLM-5.3-FlashGLM-5.2Opus 4.8
Terminal Bench 2.184.381.085.0
DeepSWE v1.163.446.258.0
NL2Repo56.348.969.7
Toolathlon Verified78.459.976.2
AutomationBench v1.0.648.826.241.0
HLE w/ Tools55.354.757.9
OSWorld 2.059.1н/д54.8

Выделяются две вещи. Во-первых, скачок относительно GLM-5.2 в агентных задачах большой: результат в AutomationBench почти удваивается. Во-вторых, модель не опережает Claude Opus 4.8 повсюду. Она заметно отстаёт на NL2Repo, где нужно построить целый репозиторий по спецификации на естественном языке. Формулировка Z.ai «приближается к Claude Opus 4.8» справедлива. «Обходит Opus» — уже нет.

Z.ai также сообщает о результате 57 в Artificial Analysis Intelligence Index v4.1.1 при $0.045 за задачу (со скидкой).[3]

Цены Ox Alpha после бесплатного превью

Бесплатный период закончился. Вот сколько та же модель стоит в API Z.ai за миллион токенов:[5]

МодельВходКэшированный входВыход
GLM-5.3-Flash$0.15$0.03$0.50
GLM-5.3-FlashX$0.37$0.075$1.25
GLM-5.3$1.40$0.26$4.40
GLM-5.2$1.40$0.26$4.40

Отсюда и фраза «в десять раз дешевле» в посте Z.ai о запуске: $0.50 за выход против $4.40 у GLM-5.2 — это примерно одна девятая.[3] FlashX — та же модель, обслуживаемая с упором на скорость. Z.ai называет для неё до 200 токенов в секунду.[4]

Поскольку веса открыты, модель раздают и другие хостеры. OpenRouter перечисляет более двадцати провайдеров для z-ai/glm-5.3-flash, и собственный эндпоинт Z.ai там совпадает с прайсовыми $0.15 / $0.50.[7]

Как вызывать модель, которой стала Ox Alpha

stealth/ox-alpha выведен из эксплуатации, поэтому не прописывайте его в коде. Вызывайте glm-5.3-flash через Chat Completions API Z.ai или z-ai/glm-5.3-flash на OpenRouter.[4][7] При переходе с чисто текстовой модели несколько особенностей часто сбивают с толку:

  • Мышление нельзя отключить. thinking.type принимает только enabled. Управляйте стоимостью через reasoning_effort, который принимает low, high или max и по умолчанию равен max, если параметр не передан.[4][6]
  • Рекомендуемые параметры сэмплирования: temperature: 1 и top_p: 0.95. Для потоковой передачи Z.ai советует включать и stream, и tool_stream.[4]
  • Изображения передаются в блоках контента image_url. Для нескольких изображений добавьте несколько блоков. Z.ai рекомендует передавать URL.[4]
  • В самостоятельно развёрнутых чат-приложениях задайте clear_thinking. В чат-шаблоне открытых весов он по умолчанию равен false, а карточка модели советует передавать true для чата.[6]

Минимальный запрос выглядит так:

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "reasoning_effort": "high",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}},
        {"type": "text", "text": "Find the layout bugs in this screenshot."}
      ]
    }]
  }'

Для самостоятельного развёртывания карточка модели называет среди поддерживаемых вариантов SGLang, vLLM, Transformers, KTransformers и Unsloth.[6]

FAQ

Что такое Ox Alpha?

Ox Alpha — анонимное имя GLM-5.3-Flash от Z.ai во время публичного превью на OpenRouter и OpenCode, начавшегося 20 августа 2026 года. Это мультимодальная модель с рассуждениями для кодинга и агентной работы с контекстным окном в 1M токенов.

Кто создал Ox Alpha?

Z.ai. Компания подтвердила это в посте о запуске GLM-5.3-Flash 26 августа 2026 года, а скрытая страница OpenRouter теперь сообщает, что модель была «разработана и эксплуатировалась ZAI».

Ox Alpha всё ещё бесплатна?

Нет. Скрытое превью завершилось. Теперь модель поставляется как GLM-5.3-Flash по цене $0.15 за вход и $0.50 за выход за миллион токенов в API Z.ai.

Ox Alpha — это open source?

Да, в виде GLM-5.3-Flash. Веса лежат на Hugging Face под лицензией MIT. Во время самого превью веса были недоступны.

Какое контекстное окно у Ox Alpha?

OpenRouter указывал для Ox Alpha 1 048 576 токенов. Руководство Z.ai по GLM-5.3-Flash называет контекст 1M и максимальный выход 128K.

Умеет ли Ox Alpha читать видео?

Да. Z.ai указывает видео, изображения, текст и файлы как входные модальности GLM-5.3-Flash. На выходе только текст.

Была ли Ox Alpha моделью Gemini или Microsoft?

Нет. Это были догадки сообщества, о которых писали во время превью. И Z.ai, и OpenRouter идентифицируют модель как GLM-5.3-Flash.

Ox Alpha лучше, чем GLM-5.2?

По опубликованным бенчмаркам Z.ai — да, причём в агентных задачах с большим отрывом. К тому же выход у неё стоит примерно в девять раз дешевле. Единственная причина остаться на GLM-5.2 — если вы уже настроили промпты под её поведение и вам не нужно зрение.

Место Ox Alpha в стеке GLM

Ox Alpha оказалась удачным маркетинговым экспериментом: анонимная модель стала самым популярным листингом недели, а к моменту раскрытия уже был готов прайс-лист. Для разработчиков практический вывод проще. За Ox Alpha стоит дешёвая модель для кодинга с открытыми весами и контекстом 1M, которая умеет смотреть скриншоты и видео, а бесплатного стелс-эндпоинта больше нет.

Если вы уже используете GLM-5.2 через reAPI, наше руководство по API GLM-5.2 описывает формат запроса, управление рассуждениями и ограничения, а на странице модели GLM-5.2 указаны актуальные тарифы. Другие варианты с длинным контекстом — в нашем руководстве по Kimi K3 и руководстве по контексту 1M в DeepSeek V4. Просто помните: искать Ox Alpha сегодня — значит искать GLM-5.3-Flash.

Источники

  1. OpenRouter. Ox Alpha (stealth/ox-alpha): listing, reveal notice and FAQ. Retrieved September 2026 from openrouter.ai/stealth/ox-alpha
  2. TechCrunch. Who's behind the new 'stealth model' Ox Alpha? August 23, 2026. Retrieved September 2026 from techcrunch.com/2026/08/23/whos-behind-the-new-stealth-model-ox-alpha
  3. Z.ai. GLM-5.3-Flash: Frontier Intelligence, Flash Cost. August 26, 2026. Retrieved September 2026 from z.ai/blog/glm-5.3-flash
  4. Z.ai. GLM-5.3-Flash/FlashX model guide. Retrieved September 2026 from docs.z.ai/guides/llm/glm-5.3-flash
  5. Z.ai. Pricing. Retrieved September 2026 from docs.z.ai/guides/overview/pricing
  6. Z.ai. zai-org/GLM-5.3-Flash model card. Hugging Face. Retrieved September 2026 from huggingface.co/zai-org/GLM-5.3-Flash
  7. OpenRouter. Z.ai: GLM 5.3 Flash (z-ai/glm-5.3-flash). Retrieved September 2026 from openrouter.ai/z-ai/glm-5.3-flash

Дополнительное чтение