GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
Ox Alpha란 무엇인가? 비디오 입력 1M 스텔스 모델
2026/09/29

Ox Alpha란 무엇인가? 비디오 입력 1M 스텔스 모델

Ox Alpha는 2026년 8월 OpenRouter에 등장한 익명 1M 컨텍스트 모델로, 이후 Z.ai가 GLM-5.3-Flash로 공개했습니다. 사양, 요금, 벤치마크, API 사용법을 정리합니다.

Ox Alpha는 2026년 8월 20일 OpenRouter에 등장한 익명 "스텔스" AI 모델로, 1,048,576 토큰 컨텍스트 윈도우와 텍스트·이미지·비디오 입력을 지원했습니다.[1] 6일 동안 누구도 개발사를 밝히지 않았습니다. 8월 26일 Z.ai가 추측을 끝냈습니다. Ox Alpha는 출시 전 공개 테스트 중이던 GLM-5.3-Flash의 미출시 빌드였습니다.[3]

그래서 "Ox Alpha란 무엇인가"에 대한 정직한 답은 대부분의 해설 글이 쓰인 이후로 바뀌었습니다. 이제는 무료로 풀린 정체불명의 모델이 아닙니다. 요금표, 모델 카드, 벤치마크 수치를 갖춘 정식 출시된 공개 가중치 모델입니다. 이 가이드는 프리뷰 기간의 Ox Alpha가 어떤 모델이었는지, 결국 무엇으로 밝혀졌는지, 그리고 같은 모델을 쓰려면 오늘 실제로 무엇을 호출해야 하는지 다룹니다.

요약

  • 출시: Ox Alpha는 2026년 8월 20일 OpenRouter에 stealth/ox-alpha로 공개되었으며, 코딩·에이전트 작업·프로덕션 워크로드용 추론 모델로 소개되었습니다.[1]
  • 정체: Z.ai는 8월 26일 OpenCode와 OpenRouter에서 GLM-5.3-Flash를 ox-alpha라는 이름으로 익명 테스트했다고 확인했습니다.[3]
  • 규모: 총 320B 파라미터, 활성 18B이며 희소 어텐션과 선형 어텐션을 결합한 하이브리드 구조입니다.[3]
  • 입력: 비디오·이미지·텍스트·파일 입력, 텍스트 출력이며 Z.ai API 기준 1M 컨텍스트와 최대 128K 출력을 지원합니다.[4]
  • 현재 가격: Z.ai는 GLM-5.3-Flash를 100만 토큰당 입력 $0.15, 캐시된 입력 $0.03, 출력 $0.50으로 공시합니다.[5]
  • 가중치: MIT 라이선스로 Hugging Face에 공개되었습니다.[6]

스텔스 프리뷰 기간의 Ox Alpha

OpenRouter는 Ox Alpha를 "코딩, 지속적인 에이전트 작업, 프로덕션 워크로드를 위해 설계된 추론 모델"로 소개하며, 장기 소프트웨어 엔지니어링과 텍스트에 시각적 맥락이 섞인 워크플로에 적합하다고 설명했습니다.[1] 제공자 항목에는 "stealth"라고만 적혀 있었습니다. 목록 페이지에는 익명을 택한 제3자가 모델을 운영하며 OpenRouter는 요청을 중계할 뿐이라고 적혀 있었습니다.

무료 모델치고는 사양이 이례적이었습니다. 해당 페이지의 OpenRouter FAQ는 1,048,576 토큰 컨텍스트 윈도우를 명시하고, Ox Alpha가 "텍스트, 이미지, 비디오를 입력으로 받아 텍스트를 반환한다"고 설명합니다.[1] 코딩 특화 모델 가운데 비디오 입력은 여전히 드물고, 무료 엔드포인트에서 1M 윈도우를 제공하니 금세 주목을 받았습니다.

TechCrunch는 8월 23일 이 열기를 보도했습니다. 기사는 모델이 OpenRouter에서 무료였다는 점, Stripe CEO Patrick Collison이 "매우 인상적"이라고 평가했다는 점, 그리고 추측이 제각각이었다는 점을 짚었습니다.[2] 초기 추측은 Z.ai의 GLM 계열을 가리켰습니다. 반면 Wccftech의 업데이트는 미출시 Microsoft MAI 모델일 가능성을 제기했고, Reddit 스레드에서는 양쪽 주장이 맞섰습니다. 즉 커뮤니티의 핑거프린팅은 올바른 방향을 가리키고 있었지만, 아무도 증명하지는 못했습니다.

프리뷰 기간의 한 가지 세부 사항은 지금도 중요합니다. OpenRouter 공지에 따르면 Ox Alpha로 보낸 프롬프트와 응답은 "제공자가 보관했으며 학습에는 사용되지 않습니다."[1] 8월에 Ox Alpha에 비공개 코드를 붙여 넣었다면, 그 데이터는 Z.ai로 전달되었습니다.

Ox Alpha의 정체는 GLM-5.3-Flash

정체는 2026년 8월 26일자 Z.ai의 GLM-5.3-Flash 출시 글에서 공개되었습니다. "출시 전, 사용자 피드백을 수집하기 위해 OpenCode와 OpenRouter에서 GLM-5.3-Flash를 ox-alpha라는 이름으로 익명 테스트했습니다. 이 모델은 금세 그 주 가장 인기 있는 모델이 되었고, 이 모든 트래픽은 중국산 AI 칩으로 처리되었습니다."[3]

OpenRouter도 같은 내용으로 스텔스 페이지를 업데이트했습니다. 현재 페이지에는 "이 스텔스 모델은 ZAI가 개발·운영했으며, ZAI GLM-5.3-Flash로 밝혀졌습니다"라고 적혀 있고, z-ai/glm-5.3-flash 목록 페이지로 안내합니다.[1] 해당 목록 페이지의 출시일은 2026년 8월 26일입니다.[7]

GLM-5.3-Flash는 GLM-5 시리즈 최초의 네이티브 멀티모달 모델입니다. Z.ai에 따르면 이전 GLM을 파인튜닝한 것이 아니라 새로 학습한 베이스 모델에서 출발했으며, 30T 토큰 규모의 멀티모달 코퍼스로 사전 학습되었습니다.[3]

Ox Alpha 사양 한눈에 보기

항목Ox Alpha / GLM-5.3-Flash
개발사Z.ai (2026년 8월 26일 확인)
스텔스 IDstealth/ox-alpha (종료됨)
API 모델 코드glm-5.3-flash, 더 빠른 glm-5.3-flashx
파라미터총 320B, 활성 18B
레이어45
입력비디오, 이미지, 텍스트, 파일
출력텍스트
컨텍스트 윈도우Z.ai API 기준 1M 토큰
최대 출력128K 토큰
사고(Thinking)항상 켜짐; reasoning_effort는 low, high, max
라이선스MIT, Hugging Face에 가중치 공개

출처: Z.ai 출시 글과 모델 가이드, Hugging Face 모델 카드.[3][4][6] OpenRouter의 GLM-5.3-Flash 페이지와 Z.ai 자체 가이드는 컨텍스트 길이가 일치합니다. OpenRouter 표기는 1,048,576 토큰으로, Z.ai가 공시한 1M과 같습니다.[7][4] 윈도우를 꽉 채워 쓸 계획이라면 1M을 기준으로 잡으세요.

Ox Alpha가 적은 연산으로 긴 컨텍스트를 확보한 방법

아키텍처를 보면 1M 윈도우와 낮은 가격이 모두 설명됩니다. GLM-4.5와 비교하면 GLM-5.3-Flash는 총 규모는 비슷하지만(320B 대 355B) 활성 파라미터는 거의 절반(18B 대 32B)이고, 레이어 수는 절반 미만(45 대 92)입니다.[3]

더 큰 변화는 어텐션입니다. Z.ai는 누적 상태를 통해 국소 의존성을 추적하는 선형 어텐션과, 경량 인덱서로 컨텍스트 먼 곳의 관련 토큰을 끌어오는 희소 어텐션을 결합합니다. Z.ai가 IndexPool이라 부르는 기법은 인덱서 키 벡터 4개를 하나로 압축해 1M 토큰에서도 인덱서 비용을 낮게 유지합니다. Z.ai는 GLM-5.3 대비 어텐션 연산이 3.0배 적고 KV 캐시가 4.4배 작다고 밝혔습니다.[3]

프리뷰가 중국산 AI 칩에서 돌아갈 수 있었던 이유도 여기에 있습니다. Z.ai에 따르면 이 칩들은 주로 메모리 용량과 대역폭에 제약을 받으며, 같은 하드웨어에서 초기 기준선 대비 엔드투엔드 서빙 성능을 3배 끌어올렸습니다.[3] KV 캐시가 작다는 것은 바로 메모리에 묶인 칩이 필요로 하는 것입니다.

Ox Alpha 벤치마크: 이제는 공식 수치

프리뷰 기간에는 Ox Alpha 벤치마크가 전부 누군지 모를 사람의 스크린샷이었습니다. 이제는 공식 표가 있습니다. 독립 감사가 아닌 Z.ai 자체 수치이므로 제조사의 주장으로 읽어야 합니다.[3]

벤치마크GLM-5.3-FlashGLM-5.2Opus 4.8
Terminal Bench 2.184.381.085.0
DeepSWE v1.163.446.258.0
NL2Repo56.348.969.7
Toolathlon Verified78.459.976.2
AutomationBench v1.0.648.826.241.0
HLE w/ Tools55.354.757.9
OSWorld 2.059.1n/a54.8

두 가지가 눈에 띕니다. 첫째, 에이전트 작업에서 GLM-5.2 대비 향상 폭이 큽니다. AutomationBench는 거의 두 배입니다. 둘째, 모델이 Claude Opus 4.8을 모든 항목에서 앞서지는 않습니다. 자연어 명세로 저장소 전체를 만들어야 하는 NL2Repo에서는 확실히 뒤처집니다. "Claude Opus 4.8에 근접했다"는 Z.ai의 요약은 공정합니다. "Opus를 이겼다"는 표현은 그렇지 않습니다.

Z.ai는 또한 Artificial Analysis Intelligence Index v4.1.1에서 작업당 $0.045(할인가)로 57점을 기록했다고 밝혔습니다.[3]

무료 프리뷰 이후의 Ox Alpha 요금

무료 기간은 끝났습니다. 같은 모델의 Z.ai API 요금은 100만 토큰당 다음과 같습니다.[5]

모델입력캐시된 입력출력
GLM-5.3-Flash$0.15$0.03$0.50
GLM-5.3-FlashX$0.37$0.075$1.25
GLM-5.3$1.40$0.26$4.40
GLM-5.2$1.40$0.26$4.40

Z.ai 출시 글의 "10분의 1 가격"이라는 문구는 여기서 나왔습니다. 출력 $0.50은 GLM-5.2의 $4.40과 비교하면 대략 9분의 1입니다.[3] FlashX는 같은 모델을 속도 중심으로 서빙한 버전입니다. Z.ai는 FlashX가 초당 최대 200 토큰을 낸다고 밝힙니다.[4]

가중치가 공개되어 있으므로 다른 호스트들도 이 모델을 제공합니다. OpenRouter는 z-ai/glm-5.3-flash에 대해 20곳이 넘는 제공자를 나열하며, 그중 Z.ai 자체 엔드포인트는 $0.15 / $0.50 공시 가격과 일치합니다.[7]

Ox Alpha가 된 모델 호출하기

stealth/ox-alpha는 종료되었으니 하드코딩하지 마세요. Z.ai의 Chat Completions API에서는 glm-5.3-flash를, OpenRouter에서는 z-ai/glm-5.3-flash를 호출하세요.[4][7] 텍스트 전용 모델에서 넘어올 때 흔히 걸려 넘어지는 동작이 몇 가지 있습니다.

  • 사고(thinking)는 끌 수 없습니다. thinking.type은 enabled만 허용합니다. 비용은 reasoning_effort로 제어하며, low, high, max를 받고 생략하면 기본값은 max입니다.[4][6]
  • 권장 샘플링: temperature: 1과 top_p: 0.95. 스트리밍 시 Z.ai는 stream과 tool_stream을 모두 켤 것을 권장합니다.[4]
  • 이미지는 image_url 콘텐츠 블록에 넣습니다. 이미지가 여러 장이면 블록을 여러 개 추가하세요. Z.ai는 URL 전달을 권장합니다.[4]
  • 직접 호스팅하는 채팅 앱은 clear_thinking을 설정해야 합니다. 공개 가중치의 채팅 템플릿에서는 기본값이 false이며, 모델 카드는 채팅 용도라면 true를 전달하라고 안내합니다.[6]

최소 요청은 다음과 같습니다.

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "reasoning_effort": "high",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}},
        {"type": "text", "text": "Find the layout bugs in this screenshot."}
      ]
    }]
  }'

직접 호스팅한다면, 모델 카드는 지원 경로로 SGLang, vLLM, Transformers, KTransformers, Unsloth 등을 나열합니다.[6]

FAQ

Ox Alpha란 무엇인가요?

Ox Alpha는 2026년 8월 20일 시작된 OpenRouter와 OpenCode 공개 프리뷰 기간 동안 Z.ai의 GLM-5.3-Flash에 붙었던 익명 이름입니다. 1M 토큰 컨텍스트 윈도우를 갖춘 코딩·에이전트 작업용 멀티모달 추론 모델입니다.

Ox Alpha는 누가 만들었나요?

Z.ai입니다. 회사는 2026년 8월 26일 GLM-5.3-Flash 출시 글에서 이를 확인했고, OpenRouter의 스텔스 페이지에도 현재 이 모델이 "ZAI가 개발·운영했다"고 적혀 있습니다.

Ox Alpha는 아직 무료인가요?

아닙니다. 스텔스 프리뷰는 종료되었습니다. 현재 모델은 GLM-5.3-Flash로 제공되며, Z.ai API 기준 100만 토큰당 입력 $0.15, 출력 $0.50입니다.

Ox Alpha는 오픈 소스인가요?

네, GLM-5.3-Flash로서는 그렇습니다. 가중치는 MIT 라이선스로 Hugging Face에 공개되어 있습니다. 프리뷰 기간 자체에는 가중치가 공개되지 않았습니다.

Ox Alpha의 컨텍스트 윈도우는 얼마인가요?

OpenRouter는 Ox Alpha의 컨텍스트를 1,048,576 토큰으로 표기했습니다. Z.ai의 GLM-5.3-Flash 가이드는 1M 컨텍스트와 최대 128K 출력을 명시합니다.

Ox Alpha는 비디오를 읽을 수 있나요?

네. Z.ai는 GLM-5.3-Flash의 입력 모달리티로 비디오, 이미지, 텍스트, 파일을 명시합니다. 출력은 텍스트만 지원합니다.

Ox Alpha는 Gemini나 Microsoft 모델이었나요?

아닙니다. 그것은 프리뷰 기간에 보도된 커뮤니티의 추측이었습니다. Z.ai와 OpenRouter 모두 이 모델을 GLM-5.3-Flash로 확인했습니다.

Ox Alpha는 GLM-5.2보다 나은가요?

Z.ai가 공개한 벤치마크 기준으로는 그렇고, 에이전트 작업에서는 격차가 큽니다. 출력 비용도 약 9분의 1입니다. GLM-5.2에 머무를 유일한 이유는 이미 그 동작에 맞춰 프롬프트를 튜닝해 두었고 비전 기능이 필요 없는 경우입니다.

GLM 스택에서 Ox Alpha의 위치

Ox Alpha는 성공한 마케팅 실험이었습니다. 익명 모델이 그 주 가장 인기 있는 목록에 올랐고, 정체가 공개될 때는 이미 요금표까지 준비되어 있었습니다. 개발자 입장에서 실질적인 결론은 더 단순합니다. Ox Alpha의 실체는 스크린샷과 비디오를 볼 수 있는 저렴한 공개 가중치 1M 컨텍스트 코딩 모델이며, 무료 스텔스 엔드포인트는 사라졌습니다.

이미 reAPI를 통해 GLM-5.2를 사용하고 있다면, GLM-5.2 API 가이드에서 요청 형태, 추론 제어, 제한 사항을 확인할 수 있고, GLM-5.2 모델 페이지에서 현재 요금을 볼 수 있습니다. 다른 긴 컨텍스트 선택지는 Kimi K3 가이드와 DeepSeek V4 1M 컨텍스트 가이드를 참고하세요. 다만 오늘 Ox Alpha를 찾는다는 것은 곧 GLM-5.3-Flash를 찾는다는 뜻임을 기억하세요.

참고

  1. OpenRouter. Ox Alpha (stealth/ox-alpha): listing, reveal notice and FAQ. Retrieved September 2026 from openrouter.ai/stealth/ox-alpha
  2. TechCrunch. Who's behind the new 'stealth model' Ox Alpha? August 23, 2026. Retrieved September 2026 from techcrunch.com/2026/08/23/whos-behind-the-new-stealth-model-ox-alpha
  3. Z.ai. GLM-5.3-Flash: Frontier Intelligence, Flash Cost. August 26, 2026. Retrieved September 2026 from z.ai/blog/glm-5.3-flash
  4. Z.ai. GLM-5.3-Flash/FlashX model guide. Retrieved September 2026 from docs.z.ai/guides/llm/glm-5.3-flash
  5. Z.ai. Pricing. Retrieved September 2026 from docs.z.ai/guides/overview/pricing
  6. Z.ai. zai-org/GLM-5.3-Flash model card. Hugging Face. Retrieved September 2026 from huggingface.co/zai-org/GLM-5.3-Flash
  7. OpenRouter. Z.ai: GLM 5.3 Flash (z-ai/glm-5.3-flash). Retrieved September 2026 from openrouter.ai/z-ai/glm-5.3-flash

추가 자료