
Что такое Ox Alpha? Скрытая модель с контекстом 1M и видеовходом
Ox Alpha — анонимная модель с контекстом 1M на OpenRouter в августе 2026 года. Позже Z.ai раскрыла в ней GLM-5.3-Flash. Характеристики, цены, бенчмарки и API.
Ox Alpha — анонимная «стелс»-модель ИИ, которая появилась на OpenRouter 20 августа 2026 года с контекстным окном в 1 048 576 токенов и поддержкой текста, изображений и видео на входе.[1] Шесть дней никто не признавался, кто её создал. 26 августа Z.ai положила конец догадкам: Ox Alpha оказалась невыпущенной сборкой GLM-5.3-Flash, которую публично тестировали до запуска.[3]
Поэтому честный ответ на вопрос «что такое Ox Alpha» изменился с тех пор, как были написаны большинство обзоров. Это больше не бесплатная загадочная модель. Это выпущенная модель с открытыми весами, прайс-листом, карточкой модели и результатами бенчмарков. В этом руководстве разберём, чем Ox Alpha была во время превью, чем она оказалась и что именно нужно вызывать сегодня, если вам нужна та же модель.
TL;DR
- Запуск: Ox Alpha появилась на OpenRouter 20 августа 2026 года как
stealth/ox-alphaи была заявлена как модель с рассуждениями для кодинга, агентной работы и продакшен-нагрузок.[1] - Происхождение: 26 августа Z.ai подтвердила, что анонимно тестировала GLM-5.3-Flash под именем ox-alpha на OpenCode и OpenRouter.[3]
- Размер: 320B параметров всего, 18B активных, гибрид разреженного и линейного внимания.[3]
- Модальности: на входе видео, изображения, текст и файлы; на выходе текст; контекст 1M и максимальный выход 128K в API Z.ai.[4]
- Цена сейчас: Z.ai указывает для GLM-5.3-Flash $0.15 за вход, $0.03 за кэшированный вход и $0.50 за выход за миллион токенов.[5]
- Веса: опубликованы на Hugging Face под лицензией MIT.[6]
Чем была Ox Alpha во время скрытого превью
OpenRouter описывал Ox Alpha как «модель с рассуждениями, созданную для кодинга, длительной агентной работы и продакшен-нагрузок», подходящую для долгосрочной разработки ПО и для сценариев, где текст сочетается с визуальным контекстом.[1] В поле провайдера значилось «stealth». В карточке говорилось, что моделью управляет третья сторона, решившая остаться анонимной, а OpenRouter лишь маршрутизирует запросы.
Для бесплатного листинга характеристики были необычными. Собственный FAQ OpenRouter на этой странице указывает контекстное окно в 1 048 576 токенов и сообщает, что Ox Alpha «принимает на вход текст, изображения и видео и возвращает текст».[1] Видеовход до сих пор редкость среди моделей для кодинга, а окно 1M на бесплатном эндпоинте быстро привлекло внимание.
TechCrunch написал об этом ажиотаже 23 августа. В заметке сказано, что модель была бесплатной на OpenRouter, что CEO Stripe Патрик Коллисон назвал её «очень впечатляющей» и что догадки расходились кардинально.[2] Ранние предположения указывали на семейство GLM от Z.ai. В обновлении Wccftech вместо этого фигурировала невыпущенная модель Microsoft MAI, а в тредах Reddit спорили в обе стороны. Иначе говоря, сообщество по «отпечаткам» модели шло в правильном направлении, но доказать это никто не мог.
Одна деталь из превью по-прежнему важна. В уведомлении OpenRouter сказано, что промпты и ответы, отправленные в Ox Alpha, «сохранялись провайдером и не используются для обучения».[1] Если в августе вы вставляли в Ox Alpha приватный код, эти данные ушли в Z.ai.
Ox Alpha оказалась GLM-5.3-Flash
Разгадка появилась в посте Z.ai о запуске GLM-5.3-Flash от 26 августа 2026 года: «До релиза мы анонимно тестировали GLM-5.3-Flash под именем ox-alpha на OpenCode и OpenRouter, чтобы собрать отзывы пользователей. Она быстро стала самой популярной моделью недели — и весь этот трафик обслуживался на китайских ИИ-чипах».[3]
OpenRouter обновил скрытую страницу в том же ключе. Теперь там написано: «Эта
стелс-модель была разработана и эксплуатировалась ZAI; раскрыто, что это ZAI
GLM-5.3-Flash», а пользователей направляют на листинг z-ai/glm-5.3-flash.[1]
В этом листинге указана дата релиза 26 августа 2026 года.[7]
GLM-5.3-Flash — первая нативно мультимодальная модель в серии GLM-5. По словам Z.ai, она построена на новой, заново обученной базовой модели, а не является дообучением одной из прежних GLM, и была предобучена на мультимодальном корпусе из 30T токенов.[3]
Характеристики Ox Alpha вкратце
| Параметр | Ox Alpha / GLM-5.3-Flash |
|---|---|
| Разработчик | Z.ai (подтверждено 26 августа 2026 года) |
| Стелс-ID | stealth/ox-alpha (выведен из эксплуатации) |
| Код модели в API | glm-5.3-flash, а также более быстрая glm-5.3-flashx |
| Параметры | 320B всего, 18B активных |
| Слои | 45 |
| Вход | Видео, изображения, текст, файлы |
| Выход | Текст |
| Контекстное окно | 1M токенов в API Z.ai |
| Максимальный выход | 128K токенов |
| Мышление | Всегда включено; reasoning_effort: low, high или max |
| Лицензия | MIT, веса на Hugging Face |
Источники: пост Z.ai о запуске и руководство по модели, а также карточка модели на Hugging Face.[3][4][6] Страница GLM-5.3-Flash на OpenRouter и руководство Z.ai сходятся в размере контекста: OpenRouter указывает 1 048 576 токенов, то есть те же 1M, что и Z.ai.[7][4] Если планируете заполнять окно целиком, закладывайтесь на 1M.
Как Ox Alpha получила столько контекста при таких малых вычислениях
Архитектура объясняет и окно 1M, и низкую цену. По сравнению с GLM-4.5 у GLM-5.3-Flash похожий общий размер (320B против 355B), но почти вдвое меньше активных параметров (18B против 32B) и меньше половины слоёв (45 против 92).[3]
Главное изменение касается внимания. Z.ai сочетает линейное внимание, которое отслеживает локальные зависимости через скользящее состояние, с разреженным вниманием, которое с помощью лёгкого индексатора подтягивает релевантные токены из далёких участков контекста. Техника, которую Z.ai называет IndexPool, сжимает четыре ключевых вектора индексатора в один, чтобы индексатор оставался дешёвым на 1M токенов. По сравнению с GLM-5.3 Z.ai сообщает о снижении вычислений на внимание в 3.0× и уменьшении KV-кэша в 4.4×.[3]
Этим же объясняется, почему превью могло работать на китайских ИИ-чипах. По словам Z.ai, эти чипы ограничены в первую очередь объёмом и пропускной способностью памяти, и компании удалось в 3× улучшить сквозную производительность инференса относительно первого базового варианта на том же железе.[3] Меньший KV-кэш — ровно то, что нужно чипу, упирающемуся в память.
Бенчмарки Ox Alpha: теперь цифры официальные
Во время превью любой бенчмарк Ox Alpha был скриншотом от незнакомца. Теперь есть официальная таблица. Это собственные цифры Z.ai, а не независимые проверки, поэтому воспринимайте их как заявление вендора.[3]
| Бенчмарк | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 85.0 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 |
| NL2Repo | 56.3 | 48.9 | 69.7 |
| Toolathlon Verified | 78.4 | 59.9 | 76.2 |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 41.0 |
| HLE w/ Tools | 55.3 | 54.7 | 57.9 |
| OSWorld 2.0 | 59.1 | н/д | 54.8 |
Выделяются две вещи. Во-первых, скачок относительно GLM-5.2 в агентных задачах большой: результат в AutomationBench почти удваивается. Во-вторых, модель не опережает Claude Opus 4.8 повсюду. Она заметно отстаёт на NL2Repo, где нужно построить целый репозиторий по спецификации на естественном языке. Формулировка Z.ai «приближается к Claude Opus 4.8» справедлива. «Обходит Opus» — уже нет.
Z.ai также сообщает о результате 57 в Artificial Analysis Intelligence Index v4.1.1 при $0.045 за задачу (со скидкой).[3]
Цены Ox Alpha после бесплатного превью
Бесплатный период закончился. Вот сколько та же модель стоит в API Z.ai за миллион токенов:[5]
| Модель | Вход | Кэшированный вход | Выход |
|---|---|---|---|
| GLM-5.3-Flash | $0.15 | $0.03 | $0.50 |
| GLM-5.3-FlashX | $0.37 | $0.075 | $1.25 |
| GLM-5.3 | $1.40 | $0.26 | $4.40 |
| GLM-5.2 | $1.40 | $0.26 | $4.40 |
Отсюда и фраза «в десять раз дешевле» в посте Z.ai о запуске: $0.50 за выход против $4.40 у GLM-5.2 — это примерно одна девятая.[3] FlashX — та же модель, обслуживаемая с упором на скорость. Z.ai называет для неё до 200 токенов в секунду.[4]
Поскольку веса открыты, модель раздают и другие хостеры. OpenRouter перечисляет
более двадцати провайдеров для z-ai/glm-5.3-flash, и собственный эндпоинт Z.ai
там совпадает с прайсовыми $0.15 / $0.50.[7]
Как вызывать модель, которой стала Ox Alpha
stealth/ox-alpha выведен из эксплуатации, поэтому не прописывайте его в коде.
Вызывайте glm-5.3-flash через Chat Completions API Z.ai или z-ai/glm-5.3-flash
на OpenRouter.[4][7]
При переходе с чисто текстовой модели несколько особенностей часто сбивают с толку:
- Мышление нельзя отключить.
thinking.typeпринимает толькоenabled. Управляйте стоимостью черезreasoning_effort, который принимаетlow,highилиmaxи по умолчанию равенmax, если параметр не передан.[4][6] - Рекомендуемые параметры сэмплирования:
temperature: 1иtop_p: 0.95. Для потоковой передачи Z.ai советует включать иstream, иtool_stream.[4] - Изображения передаются в блоках контента
image_url. Для нескольких изображений добавьте несколько блоков. Z.ai рекомендует передавать URL.[4] - В самостоятельно развёрнутых чат-приложениях задайте
clear_thinking. В чат-шаблоне открытых весов он по умолчанию равенfalse, а карточка модели советует передаватьtrueдля чата.[6]
Минимальный запрос выглядит так:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"reasoning_effort": "high",
"messages": [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}},
{"type": "text", "text": "Find the layout bugs in this screenshot."}
]
}]
}'Для самостоятельного развёртывания карточка модели называет среди поддерживаемых вариантов SGLang, vLLM, Transformers, KTransformers и Unsloth.[6]
FAQ
Что такое Ox Alpha?
Ox Alpha — анонимное имя GLM-5.3-Flash от Z.ai во время публичного превью на OpenRouter и OpenCode, начавшегося 20 августа 2026 года. Это мультимодальная модель с рассуждениями для кодинга и агентной работы с контекстным окном в 1M токенов.
Кто создал Ox Alpha?
Z.ai. Компания подтвердила это в посте о запуске GLM-5.3-Flash 26 августа 2026 года, а скрытая страница OpenRouter теперь сообщает, что модель была «разработана и эксплуатировалась ZAI».
Ox Alpha всё ещё бесплатна?
Нет. Скрытое превью завершилось. Теперь модель поставляется как GLM-5.3-Flash по цене $0.15 за вход и $0.50 за выход за миллион токенов в API Z.ai.
Ox Alpha — это open source?
Да, в виде GLM-5.3-Flash. Веса лежат на Hugging Face под лицензией MIT. Во время самого превью веса были недоступны.
Какое контекстное окно у Ox Alpha?
OpenRouter указывал для Ox Alpha 1 048 576 токенов. Руководство Z.ai по GLM-5.3-Flash называет контекст 1M и максимальный выход 128K.
Умеет ли Ox Alpha читать видео?
Да. Z.ai указывает видео, изображения, текст и файлы как входные модальности GLM-5.3-Flash. На выходе только текст.
Была ли Ox Alpha моделью Gemini или Microsoft?
Нет. Это были догадки сообщества, о которых писали во время превью. И Z.ai, и OpenRouter идентифицируют модель как GLM-5.3-Flash.
Ox Alpha лучше, чем GLM-5.2?
По опубликованным бенчмаркам Z.ai — да, причём в агентных задачах с большим отрывом. К тому же выход у неё стоит примерно в девять раз дешевле. Единственная причина остаться на GLM-5.2 — если вы уже настроили промпты под её поведение и вам не нужно зрение.
Место Ox Alpha в стеке GLM
Ox Alpha оказалась удачным маркетинговым экспериментом: анонимная модель стала самым популярным листингом недели, а к моменту раскрытия уже был готов прайс-лист. Для разработчиков практический вывод проще. За Ox Alpha стоит дешёвая модель для кодинга с открытыми весами и контекстом 1M, которая умеет смотреть скриншоты и видео, а бесплатного стелс-эндпоинта больше нет.
Если вы уже используете GLM-5.2 через reAPI, наше руководство по API GLM-5.2 описывает формат запроса, управление рассуждениями и ограничения, а на странице модели GLM-5.2 указаны актуальные тарифы. Другие варианты с длинным контекстом — в нашем руководстве по Kimi K3 и руководстве по контексту 1M в DeepSeek V4. Просто помните: искать Ox Alpha сегодня — значит искать GLM-5.3-Flash.
Источники
- OpenRouter. Ox Alpha (stealth/ox-alpha): listing, reveal notice and FAQ. Retrieved September 2026 from openrouter.ai/stealth/ox-alpha
- TechCrunch. Who's behind the new 'stealth model' Ox Alpha? August 23, 2026. Retrieved September 2026 from techcrunch.com/2026/08/23/whos-behind-the-new-stealth-model-ox-alpha
- Z.ai. GLM-5.3-Flash: Frontier Intelligence, Flash Cost. August 26, 2026. Retrieved September 2026 from z.ai/blog/glm-5.3-flash
- Z.ai. GLM-5.3-Flash/FlashX model guide. Retrieved September 2026 from docs.z.ai/guides/llm/glm-5.3-flash
- Z.ai. Pricing. Retrieved September 2026 from docs.z.ai/guides/overview/pricing
- Z.ai. zai-org/GLM-5.3-Flash model card. Hugging Face. Retrieved September 2026 from huggingface.co/zai-org/GLM-5.3-Flash
- OpenRouter. Z.ai: GLM 5.3 Flash (z-ai/glm-5.3-flash). Retrieved September 2026 from openrouter.ai/z-ai/glm-5.3-flash
Дополнительное чтение
- reAPI. GLM-5.2 API guide. reapi.ai/blog/glm-5-2-api-guide
- reAPI. GLM-5.2 model page. reapi.ai/models/glm-5-2
Автор

Категории
Ещё статьи

Claude Fable 5.1 vs GPT-6 Astra: выбор по типу задачи
Сравниваем Claude Fable 5.1 и GPT-6 Astra по контексту, инструментам, кешированию, хранению данных и цене — затем проверьте оба на своей нагрузке.


GLM-5.2: контекст 1M, цена и кодирование (2026)
API GLM-5.2 с контекстом 1M токенов для кодирования. Официальная цена $1.40/$4.40, тарифы reAPI, контроль рассуждений и ограничения открытого стандарта.


Выбор модели Grok Imagine: 1.0 vs 1.5 vs Image 2.0
Три модели Grok Imagine за четыре месяца, разделённые на видео и изображения. Какая имеет API, какая дешевле и ловушка с названиями, стоящая полдня.
