
什么是 Ox Alpha?支持视频输入的 1M 上下文隐身模型
Ox Alpha 是 2026 年 8 月出现在 OpenRouter 上的匿名 1M 上下文模型,Z.ai 随后揭晓其真身为 GLM-5.3-Flash。详解规格、定价、基准与 API 接入。
Ox Alpha 是一个匿名的"隐身"(stealth)AI 模型,于 2026 年 8 月 20 日上架 OpenRouter,拥有 1,048,576 token 的上下文窗口,支持文本、图片和视频输入。[1]整整六天,没有人出来认领它。8 月 26 日,Z.ai 揭开了谜底:Ox Alpha 是 GLM-5.3-Flash 发布前的一个未公开版本,在正式上线前拿到公开环境里测试。[3]
所以,"Ox Alpha 是什么"这个问题的答案,已经和大多数科普文章写成时不一样了。它不再是一个免费的神秘模型,而是一个已经发布的开源权重模型,有价目表、有模型卡,也有基准测试数据。本文会讲清楚三件事:预览期间的 Ox Alpha 是什么样子,它最后被证实是谁,以及今天想用同一个模型时实际该调用什么。
TL;DR
- 上线: Ox Alpha 于 2026 年 8 月 20 日以
stealth/ox-alpha的名字在 OpenRouter 上线,定位是面向编码、智能体任务和生产负载的推理模型。[1] - 身份: Z.ai 在 8 月 26 日确认,它曾以 ox-alpha 的名义在 OpenCode 和 OpenRouter 上匿名测试 GLM-5.3-Flash。[3]
- 规模: 总参数 320B,激活参数 18B,采用稀疏注意力与线性注意力的混合结构。[3]
- 输入输出: 输入支持视频、图片、文本和文件,输出为文本;在 Z.ai 的 API 上提供 1M 上下文和 128K 最大输出。[4]
- 当前价格: Z.ai 列出的 GLM-5.3-Flash 价格为每百万 token 输入 $0.15、缓存输入 $0.03、输出 $0.50。[5]
- 权重: 已在 Hugging Face 以 MIT 许可证发布。[6]
隐身预览期间的 Ox Alpha
OpenRouter 对 Ox Alpha 的描述是"一个为编码、持续性智能体工作和生产负载设计的推理模型",适合长周期的软件工程任务,以及文本与视觉上下文混合的工作流。[1]提供方一栏写的是"stealth"。页面说明该模型由一家选择匿名的第三方运行,OpenRouter 只负责转发请求。
对一个免费上架的模型来说,这份规格相当少见。OpenRouter 在该页面的 FAQ 里给出了 1,048,576 token 的上下文窗口,并表示 Ox Alpha "接受文本、图片和视频输入,返回文本"。[1]在主打编码的模型里,支持视频输入的至今仍不多见;一个免费端点配上 1M 窗口,很快就引来了关注。
TechCrunch 在 8 月 23 日报道了这波热潮。报道提到,该模型在 OpenRouter 上免费开放,Stripe CEO Patrick Collison 称它"非常惊艳",而外界的猜测五花八门。[2]早期猜测多指向 Z.ai 的 GLM 系列。Wccftech 的一篇更新则提出它可能是微软尚未发布的 MAI 模型,Reddit 上两派也争执不下。换句话说,社区通过行为特征做的"指纹识别"方向是对的,只是没人能拿出证据。
预览期有一个细节至今仍然重要。OpenRouter 的说明写道,发给 Ox Alpha 的提示词和生成结果"由提供方留存,不用于训练"。[1]如果你在 8 月把私有代码贴进了 Ox Alpha,这些数据去了 Z.ai 那里。
Ox Alpha 就是 GLM-5.3-Flash
谜底出现在 Z.ai 于 2026 年 8 月 26 日发布的 GLM-5.3-Flash 上线文章里:"发布之前,我们以 ox-alpha 的名义在 OpenCode 和 OpenRouter 上匿名测试了 GLM-5.3-Flash,以收集用户反馈。它很快成为当周最受欢迎的模型——而全部流量都跑在中国 AI 芯片上。"[3]
OpenRouter 也同步更新了那个隐身页面,现在写着:"这个隐身模型由 ZAI 开发和运营,已揭晓为 ZAI GLM-5.3-Flash",并引导用户前往 z-ai/glm-5.3-flash 页面。[1]该页面显示的发布日期为 2026 年 8 月 26 日。[7]
GLM-5.3-Flash 是 GLM-5 系列中第一个原生多模态模型。Z.ai 表示,它基于一个全新训练的基座模型,而不是在早先某个 GLM 上做微调,预训练使用了 30T token 的多模态语料。[3]
Ox Alpha 规格一览
| 属性 | Ox Alpha / GLM-5.3-Flash |
|---|---|
| 开发方 | Z.ai(2026 年 8 月 26 日确认) |
| 隐身 ID | stealth/ox-alpha(已下线) |
| API 模型代码 | glm-5.3-flash,另有速度更快的 glm-5.3-flashx |
| 参数量 | 总计 320B,激活 18B |
| 层数 | 45 |
| 输入 | 视频、图片、文本、文件 |
| 输出 | 文本 |
| 上下文窗口 | Z.ai API 上为 1M token |
| 最大输出 | 128K token |
| 思考模式 | 始终开启;reasoning_effort 可选 low、high 或 max |
| 许可证 | MIT,权重在 Hugging Face |
来源:Z.ai 上线文章与模型指南,以及 Hugging Face 模型卡。[3][4][6] OpenRouter 的 GLM-5.3-Flash 页面与 Z.ai 自己的指南在上下文长度上一致:OpenRouter 标注 1,048,576 tokens,也就是 Z.ai 公布的 1M。[7][4] 如果你打算把窗口塞满,请按 1M 来规划。
Ox Alpha 如何用这么少的算力撑起这么长的上下文
1M 窗口和低价都能从架构上找到原因。与 GLM-4.5 相比,GLM-5.3-Flash 的总规模相近(320B 对 355B),但激活参数几乎减半(18B 对 32B),层数也不到一半(45 对 92)。[3]
更大的变化在注意力机制。Z.ai 把两种注意力结合在一起:线性注意力通过一个滚动状态追踪局部依赖;稀疏注意力则用一个轻量索引器,从上下文很远处把相关 token 拉回来。Z.ai 还用一种名为 IndexPool 的技术,把四个索引器 key 向量压缩成一个,让这个索引器在 1M token 下依然便宜。与 GLM-5.3 相比,Z.ai 报告注意力计算量减少 3.0×,KV cache 缩小 4.4×。[3]
这也解释了为什么预览版能跑在中国 AI 芯片上。Z.ai 表示,这些芯片的主要瓶颈是显存容量和带宽,而它在同一硬件上把端到端推理服务性能做到了最初基线的 3 倍。[3]更小的 KV cache,正是受内存制约的芯片最需要的。
Ox Alpha 基准成绩:现在有官方数字了
预览期间,所有 Ox Alpha 的基准成绩都是陌生人发的截图。现在有了官方表格。不过这些是 Z.ai 自己公布的数字,不是独立审计,应当视为厂商的说法。[3]
| 基准测试 | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 85.0 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 |
| NL2Repo | 56.3 | 48.9 | 69.7 |
| Toolathlon Verified | 78.4 | 59.9 | 76.2 |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 41.0 |
| HLE w/ Tools | 55.3 | 54.7 | 57.9 |
| OSWorld 2.0 | 59.1 | n/a | 54.8 |
有两点很突出。第一,在智能体任务上它相对 GLM-5.2 的提升很大:AutomationBench 几乎翻倍。第二,它并没有全面领先 Claude Opus 4.8。在 NL2Repo 上它明显落后,这项测试要求根据自然语言需求生成整个代码仓库。Z.ai 的总结是"逼近 Claude Opus 4.8",这个说法公允;要说"超越 Opus"就不成立了。
Z.ai 还报告,该模型在 Artificial Analysis Intelligence Index v4.1.1 上得分 57,每个任务成本 $0.045(折扣价)。[3]
免费预览结束后的 Ox Alpha 定价
免费窗口已经关闭。以下是同一模型在 Z.ai API 上的价格,按每百万 token 计:[5]
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| GLM-5.3-Flash | $0.15 | $0.03 | $0.50 |
| GLM-5.3-FlashX | $0.37 | $0.075 | $1.25 |
| GLM-5.3 | $1.40 | $0.26 | $4.40 |
| GLM-5.2 | $1.40 | $0.26 | $4.40 |
Z.ai 上线文章里"十分之一价格"的说法就是这么来的:输出 $0.50 对比 GLM-5.2 的 $4.40,大约是九分之一。[3] FlashX 是同一个模型的高速服务版本,Z.ai 给出的速度最高可达每秒 200 token。[4]
由于权重开放,其他托管方也在提供这个模型。OpenRouter 上 z-ai/glm-5.3-flash 列出了二十多家提供方,其中 Z.ai 自家端点的价格与 $0.15 / $0.50 的官方价一致。[7]
调用 Ox Alpha 的"转正版"模型
stealth/ox-alpha 已经下线,不要把它写死在代码里。在 Z.ai 的 Chat Completions API 上调用 glm-5.3-flash,或在 OpenRouter 上调用 z-ai/glm-5.3-flash。[4][7]
从纯文本模型迁移过来时,有几处行为容易踩坑:
- 思考模式无法关闭。
thinking.type只接受enabled。成本要靠reasoning_effort控制,可选low、high或max,省略时默认为max。[4][6] - 推荐采样参数:
temperature: 1和top_p: 0.95。流式输出时,Z.ai 建议同时开启stream和tool_stream。[4] - 图片放在
image_url内容块里。 多张图片就加多个内容块。Z.ai 建议传 URL。[4] - 自部署的聊天应用应设置
clear_thinking。 在开源权重的对话模板中它默认为false,模型卡建议在聊天场景下传true。[6]
一个最简请求如下:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"reasoning_effort": "high",
"messages": [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}},
{"type": "text", "text": "Find the layout bugs in this screenshot."}
]
}]
}'如果要自部署,模型卡列出的支持方式包括 SGLang、vLLM、Transformers、KTransformers 和 Unsloth。[6]
常见问题
Ox Alpha 是什么?
Ox Alpha 是 Z.ai 的 GLM-5.3-Flash 在公开预览期间使用的匿名名称,预览从 2026 年 8 月 20 日开始,在 OpenRouter 和 OpenCode 上进行。它是一个面向编码和智能体任务的多模态推理模型,上下文窗口为 1M token。
Ox Alpha 是谁开发的?
Z.ai。该公司在 2026 年 8 月 26 日的 GLM-5.3-Flash 上线文章中予以确认,OpenRouter 的隐身页面现在也写明该模型"由 ZAI 开发和运营"。
Ox Alpha 现在还免费吗?
不免费。隐身预览已经结束。该模型现在以 GLM-5.3-Flash 的名字提供,Z.ai API 上的价格为每百万 token 输入 $0.15、输出 $0.50。
Ox Alpha 开源吗?
开源,以 GLM-5.3-Flash 的形式。权重以 MIT 许可证发布在 Hugging Face 上。预览期间本身并没有提供权重。
Ox Alpha 的上下文窗口有多大?
OpenRouter 为 Ox Alpha 标注的是 1,048,576 token。Z.ai 的 GLM-5.3-Flash 指南给出的是 1M 上下文和 128K 最大输出。
Ox Alpha 能读视频吗?
能。Z.ai 列出的 GLM-5.3-Flash 输入模态包括视频、图片、文本和文件,输出只有文本。
Ox Alpha 是 Gemini 或微软的模型吗?
不是。那些只是预览期间被报道的社区猜测。Z.ai 和 OpenRouter 都确认该模型是 GLM-5.3-Flash。
Ox Alpha 比 GLM-5.2 强吗?
按 Z.ai 公布的基准测试,是的,在智能体任务上领先幅度很大。它的输出价格也只有 GLM-5.2 的九分之一左右。唯一留在 GLM-5.2 的理由是:你已经围绕它的行为调好了提示词,并且不需要视觉能力。
Ox Alpha 在 GLM 技术栈中的位置
Ox Alpha 是一次成功的营销实验:一个匿名模型成了当周最受欢迎的上架模型,揭晓时价目表已经准备就绪。对开发者来说,实际结论更简单:Ox Alpha 背后的模型是一个便宜、开源权重、1M 上下文、能看截图和视频的编码模型,而那个免费的隐身端点已经没了。
如果你已经在通过 reAPI 使用 GLM-5.2,我们的 GLM-5.2 API 指南 介绍了请求格式、推理控制和各项限制, GLM-5.2 模型页 则有最新费率。想了解其他长上下文选项,可以看我们的 Kimi K3 指南 和 DeepSeek V4 1M 上下文指南。记住一点:今天搜索 Ox Alpha,实际要找的就是 GLM-5.3-Flash。
参考资料
- OpenRouter. Ox Alpha (stealth/ox-alpha): listing, reveal notice and FAQ. Retrieved September 2026 from openrouter.ai/stealth/ox-alpha
- TechCrunch. Who's behind the new 'stealth model' Ox Alpha? August 23, 2026. Retrieved September 2026 from techcrunch.com/2026/08/23/whos-behind-the-new-stealth-model-ox-alpha
- Z.ai. GLM-5.3-Flash: Frontier Intelligence, Flash Cost. August 26, 2026. Retrieved September 2026 from z.ai/blog/glm-5.3-flash
- Z.ai. GLM-5.3-Flash/FlashX model guide. Retrieved September 2026 from docs.z.ai/guides/llm/glm-5.3-flash
- Z.ai. Pricing. Retrieved September 2026 from docs.z.ai/guides/overview/pricing
- Z.ai. zai-org/GLM-5.3-Flash model card. Hugging Face. Retrieved September 2026 from huggingface.co/zai-org/GLM-5.3-Flash
- OpenRouter. Z.ai: GLM 5.3 Flash (z-ai/glm-5.3-flash). Retrieved September 2026 from openrouter.ai/z-ai/glm-5.3-flash
延伸阅读
- reAPI. GLM-5.2 API guide. reapi.ai/blog/glm-5-2-api-guide
- reAPI. GLM-5.2 model page. reapi.ai/models/glm-5-2
作者

分类
更多文章

GPT Image 2 加 Seedance 2.0:打造角色一致性工作流
用 GPT Image 2 设计和冻结角色形象,用 Seedance 2.0 驱动动画,通过标准化检查点减少跨镜头角色漂移。


Suno API 价格:18 个操作的费用与月度预算
查看 Suno API 全部 18 个异步操作的实际价格、整数 credits 扣费、双歌曲计费方式与 V6 版本费用,并按采用歌曲数量计算月度预算。


真人 AI 视频生成器:哪些做法真的可行
用真人素材制作 AI 视频:如何准备合规参考图、挑选支持原生对白的模型,并逐项核对输入限制、审核结果与实际生成成本。
