GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
什么是 Ox Alpha?支持视频输入的 1M 上下文隐身模型
2026/09/29

什么是 Ox Alpha?支持视频输入的 1M 上下文隐身模型

Ox Alpha 是 2026 年 8 月出现在 OpenRouter 上的匿名 1M 上下文模型,Z.ai 随后揭晓其真身为 GLM-5.3-Flash。详解规格、定价、基准与 API 接入。

Ox Alpha 是一个匿名的"隐身"(stealth)AI 模型,于 2026 年 8 月 20 日上架 OpenRouter,拥有 1,048,576 token 的上下文窗口,支持文本、图片和视频输入。[1]整整六天,没有人出来认领它。8 月 26 日,Z.ai 揭开了谜底:Ox Alpha 是 GLM-5.3-Flash 发布前的一个未公开版本,在正式上线前拿到公开环境里测试。[3]

所以,"Ox Alpha 是什么"这个问题的答案,已经和大多数科普文章写成时不一样了。它不再是一个免费的神秘模型,而是一个已经发布的开源权重模型,有价目表、有模型卡,也有基准测试数据。本文会讲清楚三件事:预览期间的 Ox Alpha 是什么样子,它最后被证实是谁,以及今天想用同一个模型时实际该调用什么。

TL;DR

  • 上线: Ox Alpha 于 2026 年 8 月 20 日以 stealth/ox-alpha 的名字在 OpenRouter 上线,定位是面向编码、智能体任务和生产负载的推理模型。[1]
  • 身份: Z.ai 在 8 月 26 日确认,它曾以 ox-alpha 的名义在 OpenCode 和 OpenRouter 上匿名测试 GLM-5.3-Flash。[3]
  • 规模: 总参数 320B,激活参数 18B,采用稀疏注意力与线性注意力的混合结构。[3]
  • 输入输出: 输入支持视频、图片、文本和文件,输出为文本;在 Z.ai 的 API 上提供 1M 上下文和 128K 最大输出。[4]
  • 当前价格: Z.ai 列出的 GLM-5.3-Flash 价格为每百万 token 输入 $0.15、缓存输入 $0.03、输出 $0.50。[5]
  • 权重: 已在 Hugging Face 以 MIT 许可证发布。[6]

隐身预览期间的 Ox Alpha

OpenRouter 对 Ox Alpha 的描述是"一个为编码、持续性智能体工作和生产负载设计的推理模型",适合长周期的软件工程任务,以及文本与视觉上下文混合的工作流。[1]提供方一栏写的是"stealth"。页面说明该模型由一家选择匿名的第三方运行,OpenRouter 只负责转发请求。

对一个免费上架的模型来说,这份规格相当少见。OpenRouter 在该页面的 FAQ 里给出了 1,048,576 token 的上下文窗口,并表示 Ox Alpha "接受文本、图片和视频输入,返回文本"。[1]在主打编码的模型里,支持视频输入的至今仍不多见;一个免费端点配上 1M 窗口,很快就引来了关注。

TechCrunch 在 8 月 23 日报道了这波热潮。报道提到,该模型在 OpenRouter 上免费开放,Stripe CEO Patrick Collison 称它"非常惊艳",而外界的猜测五花八门。[2]早期猜测多指向 Z.ai 的 GLM 系列。Wccftech 的一篇更新则提出它可能是微软尚未发布的 MAI 模型,Reddit 上两派也争执不下。换句话说,社区通过行为特征做的"指纹识别"方向是对的,只是没人能拿出证据。

预览期有一个细节至今仍然重要。OpenRouter 的说明写道,发给 Ox Alpha 的提示词和生成结果"由提供方留存,不用于训练"。[1]如果你在 8 月把私有代码贴进了 Ox Alpha,这些数据去了 Z.ai 那里。

Ox Alpha 就是 GLM-5.3-Flash

谜底出现在 Z.ai 于 2026 年 8 月 26 日发布的 GLM-5.3-Flash 上线文章里:"发布之前,我们以 ox-alpha 的名义在 OpenCode 和 OpenRouter 上匿名测试了 GLM-5.3-Flash,以收集用户反馈。它很快成为当周最受欢迎的模型——而全部流量都跑在中国 AI 芯片上。"[3]

OpenRouter 也同步更新了那个隐身页面,现在写着:"这个隐身模型由 ZAI 开发和运营,已揭晓为 ZAI GLM-5.3-Flash",并引导用户前往 z-ai/glm-5.3-flash 页面。[1]该页面显示的发布日期为 2026 年 8 月 26 日。[7]

GLM-5.3-Flash 是 GLM-5 系列中第一个原生多模态模型。Z.ai 表示,它基于一个全新训练的基座模型,而不是在早先某个 GLM 上做微调,预训练使用了 30T token 的多模态语料。[3]

Ox Alpha 规格一览

属性Ox Alpha / GLM-5.3-Flash
开发方Z.ai(2026 年 8 月 26 日确认)
隐身 IDstealth/ox-alpha(已下线)
API 模型代码glm-5.3-flash,另有速度更快的 glm-5.3-flashx
参数量总计 320B,激活 18B
层数45
输入视频、图片、文本、文件
输出文本
上下文窗口Z.ai API 上为 1M token
最大输出128K token
思考模式始终开启;reasoning_effort 可选 low、high 或 max
许可证MIT,权重在 Hugging Face

来源:Z.ai 上线文章与模型指南,以及 Hugging Face 模型卡。[3][4][6] OpenRouter 的 GLM-5.3-Flash 页面与 Z.ai 自己的指南在上下文长度上一致:OpenRouter 标注 1,048,576 tokens,也就是 Z.ai 公布的 1M。[7][4] 如果你打算把窗口塞满,请按 1M 来规划。

Ox Alpha 如何用这么少的算力撑起这么长的上下文

1M 窗口和低价都能从架构上找到原因。与 GLM-4.5 相比,GLM-5.3-Flash 的总规模相近(320B 对 355B),但激活参数几乎减半(18B 对 32B),层数也不到一半(45 对 92)。[3]

更大的变化在注意力机制。Z.ai 把两种注意力结合在一起:线性注意力通过一个滚动状态追踪局部依赖;稀疏注意力则用一个轻量索引器,从上下文很远处把相关 token 拉回来。Z.ai 还用一种名为 IndexPool 的技术,把四个索引器 key 向量压缩成一个,让这个索引器在 1M token 下依然便宜。与 GLM-5.3 相比,Z.ai 报告注意力计算量减少 3.0×,KV cache 缩小 4.4×。[3]

这也解释了为什么预览版能跑在中国 AI 芯片上。Z.ai 表示,这些芯片的主要瓶颈是显存容量和带宽,而它在同一硬件上把端到端推理服务性能做到了最初基线的 3 倍。[3]更小的 KV cache,正是受内存制约的芯片最需要的。

Ox Alpha 基准成绩:现在有官方数字了

预览期间,所有 Ox Alpha 的基准成绩都是陌生人发的截图。现在有了官方表格。不过这些是 Z.ai 自己公布的数字,不是独立审计,应当视为厂商的说法。[3]

基准测试GLM-5.3-FlashGLM-5.2Opus 4.8
Terminal Bench 2.184.381.085.0
DeepSWE v1.163.446.258.0
NL2Repo56.348.969.7
Toolathlon Verified78.459.976.2
AutomationBench v1.0.648.826.241.0
HLE w/ Tools55.354.757.9
OSWorld 2.059.1n/a54.8

有两点很突出。第一,在智能体任务上它相对 GLM-5.2 的提升很大:AutomationBench 几乎翻倍。第二,它并没有全面领先 Claude Opus 4.8。在 NL2Repo 上它明显落后,这项测试要求根据自然语言需求生成整个代码仓库。Z.ai 的总结是"逼近 Claude Opus 4.8",这个说法公允;要说"超越 Opus"就不成立了。

Z.ai 还报告,该模型在 Artificial Analysis Intelligence Index v4.1.1 上得分 57,每个任务成本 $0.045(折扣价)。[3]

免费预览结束后的 Ox Alpha 定价

免费窗口已经关闭。以下是同一模型在 Z.ai API 上的价格,按每百万 token 计:[5]

模型输入缓存输入输出
GLM-5.3-Flash$0.15$0.03$0.50
GLM-5.3-FlashX$0.37$0.075$1.25
GLM-5.3$1.40$0.26$4.40
GLM-5.2$1.40$0.26$4.40

Z.ai 上线文章里"十分之一价格"的说法就是这么来的:输出 $0.50 对比 GLM-5.2 的 $4.40,大约是九分之一。[3] FlashX 是同一个模型的高速服务版本,Z.ai 给出的速度最高可达每秒 200 token。[4]

由于权重开放,其他托管方也在提供这个模型。OpenRouter 上 z-ai/glm-5.3-flash 列出了二十多家提供方,其中 Z.ai 自家端点的价格与 $0.15 / $0.50 的官方价一致。[7]

调用 Ox Alpha 的"转正版"模型

stealth/ox-alpha 已经下线,不要把它写死在代码里。在 Z.ai 的 Chat Completions API 上调用 glm-5.3-flash,或在 OpenRouter 上调用 z-ai/glm-5.3-flash。[4][7] 从纯文本模型迁移过来时,有几处行为容易踩坑:

  • 思考模式无法关闭。 thinking.type 只接受 enabled。成本要靠 reasoning_effort 控制,可选 low、high 或 max,省略时默认为 max。[4][6]
  • 推荐采样参数: temperature: 1 和 top_p: 0.95。流式输出时,Z.ai 建议同时开启 stream 和 tool_stream。[4]
  • 图片放在 image_url 内容块里。 多张图片就加多个内容块。Z.ai 建议传 URL。[4]
  • 自部署的聊天应用应设置 clear_thinking。 在开源权重的对话模板中它默认为 false,模型卡建议在聊天场景下传 true。[6]

一个最简请求如下:

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "reasoning_effort": "high",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}},
        {"type": "text", "text": "Find the layout bugs in this screenshot."}
      ]
    }]
  }'

如果要自部署,模型卡列出的支持方式包括 SGLang、vLLM、Transformers、KTransformers 和 Unsloth。[6]

常见问题

Ox Alpha 是什么?

Ox Alpha 是 Z.ai 的 GLM-5.3-Flash 在公开预览期间使用的匿名名称,预览从 2026 年 8 月 20 日开始,在 OpenRouter 和 OpenCode 上进行。它是一个面向编码和智能体任务的多模态推理模型,上下文窗口为 1M token。

Ox Alpha 是谁开发的?

Z.ai。该公司在 2026 年 8 月 26 日的 GLM-5.3-Flash 上线文章中予以确认,OpenRouter 的隐身页面现在也写明该模型"由 ZAI 开发和运营"。

Ox Alpha 现在还免费吗?

不免费。隐身预览已经结束。该模型现在以 GLM-5.3-Flash 的名字提供,Z.ai API 上的价格为每百万 token 输入 $0.15、输出 $0.50。

Ox Alpha 开源吗?

开源,以 GLM-5.3-Flash 的形式。权重以 MIT 许可证发布在 Hugging Face 上。预览期间本身并没有提供权重。

Ox Alpha 的上下文窗口有多大?

OpenRouter 为 Ox Alpha 标注的是 1,048,576 token。Z.ai 的 GLM-5.3-Flash 指南给出的是 1M 上下文和 128K 最大输出。

Ox Alpha 能读视频吗?

能。Z.ai 列出的 GLM-5.3-Flash 输入模态包括视频、图片、文本和文件,输出只有文本。

Ox Alpha 是 Gemini 或微软的模型吗?

不是。那些只是预览期间被报道的社区猜测。Z.ai 和 OpenRouter 都确认该模型是 GLM-5.3-Flash。

Ox Alpha 比 GLM-5.2 强吗?

按 Z.ai 公布的基准测试,是的,在智能体任务上领先幅度很大。它的输出价格也只有 GLM-5.2 的九分之一左右。唯一留在 GLM-5.2 的理由是:你已经围绕它的行为调好了提示词,并且不需要视觉能力。

Ox Alpha 在 GLM 技术栈中的位置

Ox Alpha 是一次成功的营销实验:一个匿名模型成了当周最受欢迎的上架模型,揭晓时价目表已经准备就绪。对开发者来说,实际结论更简单:Ox Alpha 背后的模型是一个便宜、开源权重、1M 上下文、能看截图和视频的编码模型,而那个免费的隐身端点已经没了。

如果你已经在通过 reAPI 使用 GLM-5.2,我们的 GLM-5.2 API 指南 介绍了请求格式、推理控制和各项限制, GLM-5.2 模型页 则有最新费率。想了解其他长上下文选项,可以看我们的 Kimi K3 指南 和 DeepSeek V4 1M 上下文指南。记住一点:今天搜索 Ox Alpha,实际要找的就是 GLM-5.3-Flash。

参考资料

  1. OpenRouter. Ox Alpha (stealth/ox-alpha): listing, reveal notice and FAQ. Retrieved September 2026 from openrouter.ai/stealth/ox-alpha
  2. TechCrunch. Who's behind the new 'stealth model' Ox Alpha? August 23, 2026. Retrieved September 2026 from techcrunch.com/2026/08/23/whos-behind-the-new-stealth-model-ox-alpha
  3. Z.ai. GLM-5.3-Flash: Frontier Intelligence, Flash Cost. August 26, 2026. Retrieved September 2026 from z.ai/blog/glm-5.3-flash
  4. Z.ai. GLM-5.3-Flash/FlashX model guide. Retrieved September 2026 from docs.z.ai/guides/llm/glm-5.3-flash
  5. Z.ai. Pricing. Retrieved September 2026 from docs.z.ai/guides/overview/pricing
  6. Z.ai. zai-org/GLM-5.3-Flash model card. Hugging Face. Retrieved September 2026 from huggingface.co/zai-org/GLM-5.3-Flash
  7. OpenRouter. Z.ai: GLM 5.3 Flash (z-ai/glm-5.3-flash). Retrieved September 2026 from openrouter.ai/z-ai/glm-5.3-flash

延伸阅读