GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
¿Qué es Ox Alpha? El modelo stealth de 1M de contexto con vídeo
2026/09/29

¿Qué es Ox Alpha? El modelo stealth de 1M de contexto con vídeo

Ox Alpha fue el modelo anónimo de 1M de contexto en OpenRouter en agosto de 2026. Z.ai reveló que era GLM-5.3-Flash. Specs, precios, benchmarks y API.

Ox Alpha fue un modelo de IA anónimo, un modelo "stealth", que apareció en OpenRouter el 20 de agosto de 2026 con una ventana de contexto de 1,048,576 tokens y entrada de texto, imagen y vídeo.[1] Durante seis días nadie quiso decir quién lo había creado. El 26 de agosto, Z.ai puso fin a las especulaciones: Ox Alpha era una versión no publicada de GLM-5.3-Flash, probada en público antes de su lanzamiento.[3]

Así que la respuesta honesta a "qué es Ox Alpha" ha cambiado desde que se escribieron la mayoría de los artículos explicativos. Ya no es un modelo misterioso y gratuito. Es un modelo publicado, de pesos abiertos, con lista de precios, model card y resultados de benchmarks. Esta guía explica qué fue Ox Alpha durante la vista previa, qué resultó ser y a qué modelo tienes que llamar hoy si quieres usar el mismo.

TL;DR

  • Lanzamiento: Ox Alpha se publicó en OpenRouter el 20 de agosto de 2026 como stealth/ox-alpha, listado como modelo de razonamiento para programación, trabajo agéntico y cargas de producción.[1]
  • Identidad: Z.ai confirmó el 26 de agosto que había probado GLM-5.3-Flash de forma anónima como ox-alpha en OpenCode y OpenRouter.[3]
  • Tamaño: 320B de parámetros totales, 18B activos, con una combinación de atención dispersa y atención lineal.[3]
  • Entradas: vídeo, imagen, texto y archivos como entrada; texto como salida; 1M de contexto y 128K de salida máxima en la API de Z.ai.[4]
  • Precio actual: Z.ai lista GLM-5.3-Flash a $0.15 de entrada, $0.03 de entrada en caché y $0.50 de salida por millón de tokens.[5]
  • Pesos: publicados en Hugging Face bajo licencia MIT.[6]

Qué fue Ox Alpha durante la vista previa stealth

OpenRouter describió Ox Alpha como "un modelo de razonamiento diseñado para programación, trabajo agéntico sostenido y cargas de producción", adecuado para ingeniería de software de largo horizonte y para flujos de trabajo que mezclan texto con contexto visual.[1] En el campo del proveedor ponía "stealth". La ficha indicaba que el modelo lo operaba un tercero que había decidido permanecer en el anonimato y que OpenRouter solo enrutaba las solicitudes.

La ficha técnica era inusual para un modelo gratuito. Las propias FAQ de OpenRouter en esa página indican una ventana de contexto de 1,048,576 tokens y dicen que Ox Alpha "acepta texto, imágenes y vídeo como entrada y devuelve texto".[1] La entrada de vídeo sigue siendo poco común entre los modelos orientados a programación, y una ventana de 1M en un endpoint gratuito llamó la atención enseguida.

TechCrunch cubrió el revuelo el 23 de agosto. Su nota señala que el modelo era gratuito en OpenRouter, que el CEO de Stripe, Patrick Collison, lo calificó de "muy impresionante" y que las hipótesis iban en todas direcciones.[2] Las primeras especulaciones apuntaban a la familia GLM de Z.ai. Una actualización de Wccftech sugirió en cambio un modelo MAI de Microsoft aún no publicado, y en los hilos de Reddit se defendían ambas posturas. Es decir, el análisis de huellas de la comunidad apuntaba en la dirección correcta, pero nadie podía demostrarlo.

Hay un detalle de la vista previa que sigue siendo relevante. El aviso de OpenRouter dice que los prompts y las respuestas enviados a Ox Alpha "fueron conservados por el proveedor y no se usan para entrenamiento".[1] Si pegaste código privado en Ox Alpha en agosto, esos datos llegaron a Z.ai.

Ox Alpha era GLM-5.3-Flash

La revelación llegó en el anuncio de lanzamiento de GLM-5.3-Flash de Z.ai, fechado el 26 de agosto de 2026: "Antes del lanzamiento, probamos GLM-5.3-Flash de forma anónima como ox-alpha en OpenCode y OpenRouter para recoger opiniones de los usuarios. Rápidamente se convirtió en el modelo más popular de la semana, y todo ese tráfico se sirvió con chips de IA chinos".[3]

OpenRouter actualizó la página stealth en el mismo sentido. Ahora dice: "Este modelo stealth fue desarrollado y operado por ZAI, y se ha revelado que es ZAI GLM-5.3-Flash", y remite a los usuarios a la ficha z-ai/glm-5.3-flash.[1] Esa ficha muestra como fecha de lanzamiento el 26 de agosto de 2026.[7]

GLM-5.3-Flash es el primer modelo nativamente multimodal de la serie GLM-5. Z.ai afirma que parte de un modelo base entrenado desde cero, no de un fine-tune de un GLM anterior, y que se preentrenó con un corpus multimodal de 30T tokens.[3]

Especificaciones de Ox Alpha de un vistazo

AtributoOx Alpha / GLM-5.3-Flash
DesarrolladorZ.ai (confirmado el 26 de agosto de 2026)
ID stealthstealth/ox-alpha (retirado)
Código de modelo en la APIglm-5.3-flash, más el más rápido glm-5.3-flashx
Parámetros320B totales, 18B activos
Capas45
EntradaVídeo, imagen, texto, archivo
SalidaTexto
Ventana de contexto1M tokens en la API de Z.ai
Salida máxima128K tokens
PensamientoSiempre activo; reasoning_effort de low, high o max
LicenciaMIT, pesos en Hugging Face

Fuentes: anuncio de lanzamiento y guía del modelo de Z.ai, además de la model card de Hugging Face.[3][4][6] La página de GLM-5.3-Flash en OpenRouter y la guía de Z.ai coinciden en el contexto: OpenRouter indica 1.048.576 tokens, es decir, el 1M que publica Z.ai.[7][4] Si piensas llenar la ventana, planifica con 1M.

Cómo consiguió Ox Alpha tanto contexto con tan poco cómputo

La arquitectura explica tanto la ventana de 1M como el precio bajo. Frente a GLM-4.5, GLM-5.3-Flash tiene un tamaño total similar (320B frente a 355B), pero casi la mitad de parámetros activos (18B frente a 32B) y menos de la mitad de capas (45 frente a 92).[3]

El cambio más importante está en la atención. Z.ai combina atención lineal, que sigue las dependencias locales mediante un estado acumulado, con atención dispersa, que usa un indexador ligero para recuperar tokens relevantes de partes lejanas del contexto. Una técnica que Z.ai llama IndexPool comprime cuatro vectores clave del indexador en uno para que ese indexador siga siendo barato con 1M de tokens. Frente a GLM-5.3, Z.ai reporta 3.0× menos cómputo de atención y una caché KV 4.4× más pequeña.[3]

Por eso también la vista previa pudo ejecutarse en chips de IA chinos. Z.ai dice que esos chips están limitados sobre todo por la capacidad y el ancho de banda de memoria, y que logró una mejora de 3× en el rendimiento de servicio de extremo a extremo respecto a su primera línea base en el mismo hardware.[3] Una caché KV más pequeña es justo lo que necesita un chip limitado por memoria.

Benchmarks de Ox Alpha, ahora que las cifras son oficiales

Durante la vista previa, cada benchmark de Ox Alpha era una captura de pantalla de algún desconocido. Ahora hay una tabla oficial. Son cifras de la propia Z.ai, no auditorías independientes, así que tómalas como lo que afirma el fabricante.[3]

BenchmarkGLM-5.3-FlashGLM-5.2Opus 4.8
Terminal Bench 2.184.381.085.0
DeepSWE v1.163.446.258.0
NL2Repo56.348.969.7
Toolathlon Verified78.459.976.2
AutomationBench v1.0.648.826.241.0
HLE w/ Tools55.354.757.9
OSWorld 2.059.1n/d54.8

Destacan dos cosas. Primero, el salto respecto a GLM-5.2 en tareas agénticas es grande: AutomationBench casi se duplica. Segundo, el modelo no supera a Claude Opus 4.8 en todo. Queda claramente por detrás en NL2Repo, que pide generar un repositorio completo a partir de una especificación en lenguaje natural. El resumen de Z.ai, "acercándose a Claude Opus 4.8", es justo. "Supera a Opus" no lo sería.

Z.ai también reporta una puntuación de 57 en el Artificial Analysis Intelligence Index v4.1.1 a $0.045 por tarea (con descuento).[3]

Precios de Ox Alpha tras la vista previa gratuita

La etapa gratuita ha terminado. Esto es lo que cuesta el mismo modelo en la API de Z.ai, por millón de tokens:[5]

ModeloEntradaEntrada en cachéSalida
GLM-5.3-Flash$0.15$0.03$0.50
GLM-5.3-FlashX$0.37$0.075$1.25
GLM-5.3$1.40$0.26$4.40
GLM-5.2$1.40$0.26$4.40

De ahí sale la frase "una décima parte del precio" del anuncio de Z.ai: $0.50 de salida frente a $4.40 de GLM-5.2 es aproximadamente una novena parte.[3] FlashX es el mismo modelo servido para priorizar velocidad. Z.ai indica hasta 200 tokens por segundo.[4]

Como los pesos son abiertos, otros proveedores también lo sirven. OpenRouter lista más de veinte proveedores para z-ai/glm-5.3-flash, y el endpoint de la propia Z.ai allí coincide con el precio de lista de $0.15 / $0.50.[7]

Cómo llamar al modelo en el que se convirtió Ox Alpha

stealth/ox-alpha está retirado, así que no lo dejes fijo en el código. Llama a glm-5.3-flash en la API de Chat Completions de Z.ai, o a z-ai/glm-5.3-flash en OpenRouter.[4][7] Algunos comportamientos confunden a quienes llegan desde un modelo solo de texto:

  • El pensamiento no se puede desactivar. thinking.type solo acepta enabled. Controla el coste con reasoning_effort, que admite low, high o max y toma max por defecto si se omite.[4][6]
  • Muestreo recomendado: temperature: 1 y top_p: 0.95. Para streaming, Z.ai sugiere activar tanto stream como tool_stream.[4]
  • Las imágenes van en bloques de contenido image_url. Añade varios bloques para varias imágenes. Z.ai recomienda pasar una URL.[4]
  • Las apps de chat autoalojadas deben configurar clear_thinking. En la plantilla de chat de los pesos abiertos su valor por defecto es false, y la model card indica pasar true para uso en chat.[6]

Una solicitud mínima tiene este aspecto:

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "reasoning_effort": "high",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}},
        {"type": "text", "text": "Find the layout bugs in this screenshot."}
      ]
    }]
  }'

Si lo autoalojas, la model card incluye SGLang, vLLM, Transformers, KTransformers y Unsloth entre las opciones compatibles.[6]

FAQ

¿Qué es Ox Alpha?

Ox Alpha fue el nombre anónimo de GLM-5.3-Flash de Z.ai durante una vista previa pública en OpenRouter y OpenCode que comenzó el 20 de agosto de 2026. Es un modelo de razonamiento multimodal para programación y trabajo con agentes, con una ventana de contexto de 1M de tokens.

¿Quién creó Ox Alpha?

Z.ai. La empresa lo confirmó en el anuncio de lanzamiento de GLM-5.3-Flash el 26 de agosto de 2026, y la página stealth de OpenRouter ahora dice que el modelo fue "desarrollado y operado por ZAI".

¿Sigue siendo gratis Ox Alpha?

No. La vista previa stealth ha terminado. El modelo se distribuye ahora como GLM-5.3-Flash a $0.15 de entrada y $0.50 de salida por millón de tokens en la API de Z.ai.

¿Es Ox Alpha de código abierto?

Sí, como GLM-5.3-Flash. Los pesos están en Hugging Face bajo licencia MIT. Durante la propia vista previa no había pesos disponibles.

¿Cuál es la ventana de contexto de Ox Alpha?

OpenRouter indicaba 1,048,576 tokens para Ox Alpha. La guía de Z.ai para GLM-5.3-Flash da 1M de contexto y 128K de salida máxima.

¿Puede Ox Alpha leer vídeo?

Sí. Z.ai lista vídeo, imagen, texto y archivo como modalidades de entrada de GLM-5.3-Flash. La salida es solo texto.

¿Era Ox Alpha un modelo de Gemini o de Microsoft?

No. Esas eran hipótesis de la comunidad recogidas durante la vista previa. Tanto Z.ai como OpenRouter identifican el modelo como GLM-5.3-Flash.

¿Es Ox Alpha mejor que GLM-5.2?

Según los benchmarks publicados por Z.ai, sí, y por un amplio margen en tareas agénticas. Además, la salida cuesta aproximadamente una novena parte. El único motivo para quedarse en GLM-5.2 es que ya tengas prompts ajustados a su comportamiento y no necesites visión.

Dónde encaja Ox Alpha en un stack de GLM

Ox Alpha fue un experimento de marketing que funcionó: un modelo anónimo se convirtió en el más popular de su semana, y la revelación llegó con la lista de precios ya preparada. Para quienes desarrollan, la conclusión práctica es más sencilla. El modelo detrás de Ox Alpha es un modelo de programación barato, de pesos abiertos y con 1M de contexto que puede analizar capturas de pantalla y vídeo, y el endpoint stealth gratuito ya no existe.

Si ya usas GLM-5.2 a través de reAPI, nuestra guía de la API de GLM-5.2 cubre la forma de las solicitudes, los controles de razonamiento y los límites, y la página del modelo GLM-5.2 tiene las tarifas actuales. Para otras opciones de contexto largo, consulta nuestra guía de Kimi K3 y la guía de DeepSeek V4 con 1M de contexto. Solo recuerda que hoy buscar Ox Alpha significa buscar GLM-5.3-Flash.

Referencias

  1. OpenRouter. Ox Alpha (stealth/ox-alpha): listing, reveal notice and FAQ. Retrieved September 2026 from openrouter.ai/stealth/ox-alpha
  2. TechCrunch. Who's behind the new 'stealth model' Ox Alpha? August 23, 2026. Retrieved September 2026 from techcrunch.com/2026/08/23/whos-behind-the-new-stealth-model-ox-alpha
  3. Z.ai. GLM-5.3-Flash: Frontier Intelligence, Flash Cost. August 26, 2026. Retrieved September 2026 from z.ai/blog/glm-5.3-flash
  4. Z.ai. GLM-5.3-Flash/FlashX model guide. Retrieved September 2026 from docs.z.ai/guides/llm/glm-5.3-flash
  5. Z.ai. Pricing. Retrieved September 2026 from docs.z.ai/guides/overview/pricing
  6. Z.ai. zai-org/GLM-5.3-Flash model card. Hugging Face. Retrieved September 2026 from huggingface.co/zai-org/GLM-5.3-Flash
  7. OpenRouter. Z.ai: GLM 5.3 Flash (z-ai/glm-5.3-flash). Retrieved September 2026 from openrouter.ai/z-ai/glm-5.3-flash

Lecturas adicionales