
Ox Alphaとは?動画入力対応の1Mコンテキスト・ステルスモデル
Ox Alphaは2026年8月にOpenRouterへ匿名で登場した1Mコンテキストのモデルで、後にZ.aiがGLM-5.3-Flashだと公表しました。仕様、価格、ベンチマーク、APIでの使い方を解説します。
Ox Alpha は、2026年8月20日に OpenRouter に登場した匿名の「ステルス」AI モデルです。1,048,576 トークンのコンテキストウィンドウを持ち、テキスト・画像・動画を入力として受け付けました。[1] その後6日間、開発元は明かされませんでした。8月26日、Z.ai が推測に終止符を打ちます。Ox Alpha の正体は、リリース前に公開テストされていた GLM-5.3-Flash の未発表ビルドだったのです。[3]
つまり「Ox Alpha とは何か」への正確な答えは、多くの解説記事が書かれた時点から変わっています。もはや無料の謎のモデルではありません。価格表、モデルカード、ベンチマーク数値がそろった、リリース済みのオープンウェイトモデルです。本ガイドでは、プレビュー期間中の Ox Alpha の姿、判明した正体、そして同じモデルを今使いたい場合に実際に何を呼び出せばよいかを説明します。
TL;DR
- 公開: Ox Alpha は2026年8月20日に
stealth/ox-alphaとして OpenRouter で公開され、コーディング、エージェント作業、本番ワークロード向けの推論モデルとして掲載されました。[1] - 正体: Z.ai は8月26日、GLM-5.3-Flash を ox-alpha として OpenCode と OpenRouter で匿名テストしていたと認めました。[3]
- 規模: 総パラメータ 320B、アクティブ 18B。スパースアテンションと線形アテンションのハイブリッド構成です。[3]
- 入出力: 入力は動画・画像・テキスト・ファイル、出力はテキスト。Z.ai の API ではコンテキスト 1M、最大出力 128K です。[4]
- 現在の価格: Z.ai は GLM-5.3-Flash を100万トークンあたり入力 $0.15、キャッシュ入力 $0.03、出力 $0.50 としています。[5]
- ウェイト: MIT ライセンスで Hugging Face に公開されています。[6]
ステルスプレビュー期間中の Ox Alpha
OpenRouter は Ox Alpha を「コーディング、持続的なエージェント作業、本番ワークロード向けに設計された推論モデル」と説明し、長期にわたるソフトウェアエンジニアリングや、テキストと視覚的コンテキストを組み合わせるワークフローに適しているとしていました。[1] プロバイダー欄の表記は「stealth」。掲載ページには、モデルは匿名を選んだ第三者が運用しており、OpenRouter はリクエストをルーティングしているだけだと書かれていました。
無料の掲載モデルとしては異例のスペックでした。同ページの OpenRouter 自身の FAQ は、コンテキストウィンドウを 1,048,576 トークンとし、Ox Alpha は「テキスト、画像、動画を入力として受け付け、テキストを返す」と記しています。[1] コーディング特化モデルで動画入力に対応するものはまだ珍しく、無料エンドポイントで 1M ウィンドウという点もあって、すぐに注目を集めました。
TechCrunch は8月23日にこの過熱ぶりを報じています。記事は、モデルが OpenRouter で無料だったこと、Stripe CEO の Patrick Collison 氏が「非常に印象的」と評したこと、そして推測が四方八方に飛び交っていたことに触れています。[2] 初期の推測は Z.ai の GLM ファミリーを指していました。一方、Wccftech の続報は未発表の Microsoft MAI モデルという説を持ち出し、Reddit のスレッドでも両論が戦わされていました。要するに、コミュニティによる特定作業は正しい方向を向いていたものの、誰も証明できなかったわけです。
プレビュー期間の話で、今も重要な点がひとつあります。OpenRouter の告知によれば、Ox Alpha に送られたプロンプトと生成結果は「プロバイダーによって保持され、学習には使用されない」とされていました。[1] 8月に Ox Alpha へ非公開のコードを貼り付けたなら、そのデータは Z.ai に渡っています。
Ox Alpha の正体は GLM-5.3-Flash
正体が明かされたのは、2026年8月26日付の Z.ai による GLM-5.3-Flash のリリース記事でした。「リリース前に、ユーザーフィードバックを集めるため、GLM-5.3-Flash を ox-alpha として OpenCode と OpenRouter で匿名テストしました。このモデルはたちまちその週で最も人気のモデルとなり、そのトラフィックはすべて中国製 AI チップで処理されていました。」[3]
OpenRouter もステルスページを同様に更新しました。現在は「このステルスモデルは ZAI が開発・運用しており、ZAI GLM-5.3-Flash であることが明らかになりました」と記され、z-ai/glm-5.3-flash の掲載ページへ誘導しています。[1]
その掲載ページのリリース日は2026年8月26日です。[7]
GLM-5.3-Flash は GLM-5 シリーズ初のネイティブマルチモーダルモデルです。Z.ai によれば、以前の GLM のファインチューンではなく新たに学習したベースモデルから出発しており、30T トークンのマルチモーダルコーパスで事前学習されています。[3]
Ox Alpha の仕様一覧
| 項目 | Ox Alpha / GLM-5.3-Flash |
|---|---|
| 開発元 | Z.ai(2026年8月26日に公表) |
| ステルス ID | stealth/ox-alpha(提供終了) |
| API モデルコード | glm-5.3-flash、高速版の glm-5.3-flashx |
| パラメータ | 総数 320B、アクティブ 18B |
| レイヤー数 | 45 |
| 入力 | 動画、画像、テキスト、ファイル |
| 出力 | テキスト |
| コンテキストウィンドウ | Z.ai の API で 1M トークン |
| 最大出力 | 128K トークン |
| 思考 | 常時オン。reasoning_effort は low、high、max |
| ライセンス | MIT、ウェイトは Hugging Face で公開 |
出典:Z.ai のリリース記事とモデルガイド、および Hugging Face のモデルカード。[3][4][6] OpenRouter の GLM-5.3-Flash ページと Z.ai 自身のガイドは、コンテキスト長で一致しています。OpenRouter の表示は 1,048,576 トークンで、Z.ai が公表している 1M と同じです。[7][4] ウィンドウを目一杯使う予定なら、1M を前提に見積もってください。
Ox Alpha が少ない計算量で長いコンテキストを実現した仕組み
アーキテクチャを見れば、1M ウィンドウと低価格の両方に説明がつきます。GLM-4.5 と比べると、GLM-5.3-Flash は総パラメータ数はほぼ同等(320B 対 355B)ながら、アクティブパラメータは約半分(18B 対 32B)、レイヤー数は半分未満(45 対 92)です。[3]
より大きな変化はアテンションにあります。Z.ai は、逐次更新される状態で局所的な依存関係を追う線形アテンションと、軽量なインデクサーでコンテキストのはるか前方から関連トークンを引き出すスパースアテンションを組み合わせています。Z.ai が IndexPool と呼ぶ手法は、インデクサーのキーベクトル4本を1本に圧縮し、1M トークンでもインデクサーを低コストに保ちます。Z.ai は GLM-5.3 比でアテンション計算量が 3.0 分の1、KV キャッシュが 4.4 分の1になったと報告しています。[3]
プレビューを中国製 AI チップで運用できた理由もここにあります。Z.ai によれば、これらのチップは主にメモリ容量と帯域幅に制約されており、同じハードウェア上で当初のベースラインに比べエンドツーエンドのサービング性能を3倍に高めたといいます。[3] KV キャッシュの縮小は、メモリ律速のチップにまさに必要なものです。
公式数値が出た Ox Alpha のベンチマーク
プレビュー期間中、Ox Alpha のベンチマークはどれも見知らぬ誰かのスクリーンショットでした。今は公式の表があります。ただしこれは Z.ai 自身の数値で、独立した検証ではないため、ベンダーの主張として読んでください。[3]
| ベンチマーク | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 85.0 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 |
| NL2Repo | 56.3 | 48.9 | 69.7 |
| Toolathlon Verified | 78.4 | 59.9 | 76.2 |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 41.0 |
| HLE w/ Tools | 55.3 | 54.7 | 57.9 |
| OSWorld 2.0 | 59.1 | n/a | 54.8 |
目を引く点が2つあります。第一に、エージェント作業での GLM-5.2 からの伸びが大きく、AutomationBench はほぼ倍増しています。第二に、Claude Opus 4.8 をすべての項目で上回っているわけではありません。自然言語の仕様からリポジトリ全体を作らせる NL2Repo では明確に後れを取っています。「Claude Opus 4.8 に迫る」という Z.ai のまとめは妥当です。「Opus を超える」とは言えません。
Z.ai はまた、Artificial Analysis Intelligence Index v4.1.1 でスコア 57、1タスクあたり $0.045(割引適用時)という結果も報告しています。[3]
無料プレビュー終了後の Ox Alpha の価格
無料期間は終わりました。同じモデルの Z.ai API での価格は、100万トークンあたり次のとおりです。[5]
| モデル | 入力 | キャッシュ入力 | 出力 |
|---|---|---|---|
| GLM-5.3-Flash | $0.15 | $0.03 | $0.50 |
| GLM-5.3-FlashX | $0.37 | $0.075 | $1.25 |
| GLM-5.3 | $1.40 | $0.26 | $4.40 |
| GLM-5.2 | $1.40 | $0.26 | $4.40 |
Z.ai のリリース記事にある「10分の1の価格」という表現はここから来ています。出力 $0.50 は GLM-5.2 の $4.40 のおよそ9分の1です。[3] FlashX は同じモデルを速度重視で提供するもので、Z.ai は最大で毎秒200トークンとしています。[4]
ウェイトが公開されているため、他のホストでも提供されています。OpenRouter には z-ai/glm-5.3-flash のプロバイダーが20社以上掲載されており、そこでの Z.ai 自身のエンドポイントは定価の $0.15 / $0.50 と一致しています。[7]
Ox Alpha の後継モデルを呼び出す
stealth/ox-alpha は提供終了しているので、ハードコードしないでください。Z.ai の Chat Completions API では glm-5.3-flash、OpenRouter では z-ai/glm-5.3-flash を呼び出します。[4][7]
テキスト専用モデルから移行する際に、つまずきやすい挙動がいくつかあります。
- 思考はオフにできません。
thinking.typeが受け付けるのはenabledのみです。コストはreasoning_effortで制御します。値はlow、high、maxで、省略時のデフォルトはmaxです。[4][6] - 推奨サンプリング設定:
temperature: 1とtop_p: 0.95。ストリーミングでは、Z.ai はstreamとtool_streamの両方を有効にすることを推奨しています。[4] - 画像は
image_urlコンテンツブロックで渡します。 複数枚の場合はブロックを複数追加します。Z.ai は URL で渡すことを推奨しています。[4] - セルフホストのチャットアプリでは
clear_thinkingを設定してください。 オープンウェイト版のチャットテンプレートではデフォルトがfalseで、モデルカードはチャット用途ではtrueを渡すよう指示しています。[6]
最小限のリクエストは次のようになります。
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"reasoning_effort": "high",
"messages": [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}},
{"type": "text", "text": "Find the layout bugs in this screenshot."}
]
}]
}'セルフホストする場合、モデルカードは対応手段として SGLang、vLLM、Transformers、KTransformers、Unsloth などを挙げています。[6]
FAQ
Ox Alpha とは何ですか?
Ox Alpha は、2026年8月20日に始まった OpenRouter と OpenCode での公開プレビュー中に、Z.ai の GLM-5.3-Flash が使っていた匿名の名前です。コーディングとエージェント作業向けのマルチモーダル推論モデルで、1M トークンのコンテキストウィンドウを備えています。
Ox Alpha を開発したのは誰ですか?
Z.ai です。同社は2026年8月26日の GLM-5.3-Flash リリース記事でこれを認めており、OpenRouter のステルスページにも現在、このモデルは「ZAI が開発・運用」していると記されています。
Ox Alpha は今も無料ですか?
いいえ。ステルスプレビューは終了しました。現在は GLM-5.3-Flash として提供され、Z.ai の API では100万トークンあたり入力 $0.15、出力 $0.50 です。
Ox Alpha はオープンソースですか?
はい、GLM-5.3-Flash としてオープンです。ウェイトは MIT ライセンスで Hugging Face に公開されています。ただしプレビュー期間中はウェイトは公開されていませんでした。
Ox Alpha のコンテキストウィンドウはどれくらいですか?
OpenRouter は Ox Alpha のコンテキストを 1,048,576 トークンとしていました。Z.ai の GLM-5.3-Flash ガイドでは、コンテキスト 1M、最大出力 128K です。
Ox Alpha は動画を読み取れますか?
はい。Z.ai は GLM-5.3-Flash の入力モダリティとして動画、画像、テキスト、ファイルを挙げています。出力はテキストのみです。
Ox Alpha は Gemini や Microsoft のモデルだったのですか?
いいえ。それらはプレビュー中に報じられたコミュニティの推測にすぎません。Z.ai と OpenRouter はいずれも、このモデルを GLM-5.3-Flash としています。
Ox Alpha は GLM-5.2 より優れていますか?
Z.ai が公表したベンチマーク上ではそうで、特にエージェントタスクで大きく上回っています。出力コストも約9分の1です。GLM-5.2 を使い続ける理由があるとすれば、その挙動に合わせてプロンプトを調整済みで、ビジョン機能が不要な場合くらいです。
GLM スタックにおける Ox Alpha の位置付け
Ox Alpha は成功したマーケティング実験でした。匿名のモデルがその週で最も人気の掲載モデルとなり、正体が明かされた時点ですでに価格表まで用意されていたのです。開発者にとっての実務的な結論はもっとシンプルです。Ox Alpha の中身は、スクリーンショットや動画も読める、安価でオープンウェイトの 1M コンテキスト対応コーディングモデルであり、無料のステルスエンドポイントはもう存在しません。
すでに reAPI 経由で GLM-5.2 を使っているなら、GLM-5.2 API ガイドでリクエスト形式、推論制御、制限を解説しており、GLM-5.2 モデルページで最新の料金を確認できます。他の長コンテキストの選択肢については、Kimi K3 ガイドと DeepSeek V4 1M コンテキストガイドをご覧ください。ただ、今 Ox Alpha を探すということは、GLM-5.3-Flash を探すということだと覚えておいてください。
参考資料
- OpenRouter. Ox Alpha (stealth/ox-alpha): listing, reveal notice and FAQ. Retrieved September 2026 from openrouter.ai/stealth/ox-alpha
- TechCrunch. Who's behind the new 'stealth model' Ox Alpha? August 23, 2026. Retrieved September 2026 from techcrunch.com/2026/08/23/whos-behind-the-new-stealth-model-ox-alpha
- Z.ai. GLM-5.3-Flash: Frontier Intelligence, Flash Cost. August 26, 2026. Retrieved September 2026 from z.ai/blog/glm-5.3-flash
- Z.ai. GLM-5.3-Flash/FlashX model guide. Retrieved September 2026 from docs.z.ai/guides/llm/glm-5.3-flash
- Z.ai. Pricing. Retrieved September 2026 from docs.z.ai/guides/overview/pricing
- Z.ai. zai-org/GLM-5.3-Flash model card. Hugging Face. Retrieved September 2026 from huggingface.co/zai-org/GLM-5.3-Flash
- OpenRouter. Z.ai: GLM 5.3 Flash (z-ai/glm-5.3-flash). Retrieved September 2026 from openrouter.ai/z-ai/glm-5.3-flash
さらに読むべき内容
- reAPI. GLM-5.2 API guide. reapi.ai/blog/glm-5-2-api-guide
- reAPI. GLM-5.2 model page. reapi.ai/models/glm-5-2
著者

カテゴリ
他の記事

GLM-5.2 API: 1M トークン、価格、コーディング(2026)
GLM-5.2 API を OpenAI互換コードで使用します。1M コンテキスト、公式価格、reAPI レート、推論制御、および制限について学びます。


Mammouth.aiの代替おすすめ5選|2026年比較
2026年のMammouth.ai代替を検討中ですか。Poe、Perplexity、OpenRouter、HuggingChat、reAPIの5つを、対応モデル・チャット以外の機能・アプリかAPIかという使い方の違いで比較します。


MiniMax H3 Maxはオープンソース?ウェイト取得とローカル利用
MiniMax H3は公開ウェイトを持ちますが、H3 MaxはfalによるPost-Training版。ダウンロード可能、ホスト、検証状況をまとめました。
