
Grok Imagine: 1.0 vs 1.5 vs Image 2.0, cuál elegir
Tres modelos Grok Imagine repartidos entre vídeo e imagen. Cuál tiene API pública, cuál es más barato y la confusa trampa de nomenclatura que cuesta horas.
Tres modelos Grok Imagine se han lanzado en cuatro meses, y elegir entre ellos no es una cuestión de cuál es el más nuevo. Cada modelo Grok Imagine hace un trabajo diferente, uno de ellos no se puede llamar desde una API en absoluto, y la nomenclatura hace que todo sea más complicado de lo necesario.
Aquí va la versión corta. Grok Imagine 1.0 Video y Video 1.5 generan vídeo. Imagine Image 2.0 genera imágenes. Los números de versión se distribuyen por dos modalidades diferentes, así que "2.0 es la mejora de 1.5" es incorrecto de la forma que importa.
Qué es cada modelo Grok Imagine realmente
| Lanzamiento | Fecha | Modalidad | En reAPI |
|---|---|---|---|
| Grok Imagine 1.0 Video | 7 mayo 2026 | Vídeo | Disponible |
| Grok Imagine Video 1.5 | 4 junio 2026 | Vídeo | Disponible |
| Imagine Image 2.0 | 7 agosto 2026 | Imagen | Próximamente |
La trampa está en la columna intermedia. Quien busca un modelo Grok Imagine ve 2.0 como el buque insignia y asume que reemplaza a 1.5. No es así. Si necesitas vídeo, 1.5 es la generación actual y 2.0 no te tiene nada que ofrecer. Si necesitas imágenes, 2.0 es el que quieres pero aún no es llamable.
Video 1.5 es el modelo de vídeo que funciona ahora
Video 1.5 cubre texto-a-vídeo, imagen-a-vídeo y referencia-a-vídeo con hasta siete imágenes de referencia. Genera 1080p nativa, clips de hasta 15 segundos, y audio en el mismo pase que la imagen, lo que significa que la ambientación, los efectos y el diálogo llegan ya sincronizados en lugar de aplicarse después.
La velocidad también mejoró. Una generación Fast de 720p de 6 segundos fue de más de 40 segundos a aproximadamente 25[1]. En el tablero Image-to-Video Arena se ubicó tercero a partir del 2 de agosto de 2026, dentro de un grupo líder cuyos intervalos de confianza se superponen, así que trata el orden dentro de ese grupo como ruido.
En la práctica, este es el modelo Grok Imagine que eliges cuando una imagen fija necesita convertirse en algunos segundos de movimiento. No una actuación, solo una mirada que se mueve, cabello que se agita, un zoom lento.
Para qué sirve aún 1.0 Video
Grok Imagine 1.0 Video es anterior a 1.5 por un mes y sigue disponible en reAPI. Es el nivel más económico en lugar de uno deprecado. Si tu carga de trabajo es alto volumen y corta, y no necesitas 1080p, siete referencias o el tiempo de procesamiento más rápido, el modelo Grok Imagine más antiguo sigue siendo válido.
El enmarcado honesto: 1.5 es mejor en casi todo, y la razón para ejecutar 1.0 es el coste por clip, no la capacidad.
Eso todavía lo convierte en una opción real en dos situaciones. La primera es la generación en lote donde los clips son cortos, se recortan aún más, y nunca salen de un feed vertical, así que 1080p no aporta nada. La segunda es el trabajo A/B donde estás probando prompts o conceptos en lugar de producir finales, y pasar el modelo Grok Imagine más barato por cincuenta variantes vence pasar el caro por quince. Una vez que un concepto está bloqueado, re-renderiza el ganador en 1.5.
Image 2.0 es un producto diferente con un número de versión
Imagine Image 2.0 se lanzó el 7 de agosto de 2026 como el nuevo Quality Mode dentro de Grok[2]. En los tableros Arena, xAI citó que se ubicó segundo en el mundo tanto en texto-a-imagen como en edición de imágenes, detrás de GPT Image 2 de OpenAI en ambos. Esas puntuaciones aún llevan una etiqueta Preliminary porque el recuento de votos es bajo.
Lo que lo diferencia de un modelo texto-a-imagen simple es que la edición está integrada en lugar de ser un añadido. Una varita mágica cambia solo la región a la que apuntas. La segmentación selecciona áreas precisas. La eliminación de fondo exporta sujetos sobre transparencia. La edición multireferencia acepta hasta cinco entradas en una sola generación, así que un personaje, una ubicación y una utilería pueden suministrarse por separado en lugar de apretujados en una imagen de referencia.
Hay una trampa, y es lo que la mayoría de la gente entiende mal. Image 2.0 no tiene API pública. El anuncio de xAI termina con "el acceso a la API próximamente" y no da ni punto final ni fecha.
La colisión de nomenclatura que le cuesta una tarde a la gente
Ya hay un modelo de imagen Grok en la API, y no es el 2.0.
grok-imagine-image-quality ha sido llamable desde mayo
2026[3]. Es la generación anterior, puntuando
1228 y 1390 en los mismos tableros donde Image 2.0 publicó 1320 y 1439.
Así que si integras un modelo Grok Imagine para imágenes esta semana, obtienes Quality, no 2.0. La edición con alcance regional y la composición de cinco referencias que hacen que 2.0 sea interesante no están en ese punto final. Presupuesta el comportamiento más antiguo o espera.
Selecciona un modelo Grok Imagine por tarea
Trabaja hacia atrás desde la salida, no desde el número de versión.
Vídeo, disponible hoy. Video 1.5. 1080p nativa, hasta 15 segundos, audio en el mismo pase, siete imágenes de referencia.
Vídeo, sensible al coste en volumen. 1.0 Video. Antiguo, más barato, aún disponible.
Imágenes, disponible hoy. No un modelo Grok Imagine. Usa algo con un punto final, luego cambia más tarde.
Imágenes, planeando con anticipación. Image 2.0, cuando se abra la API.
Esa última fila merece diseñarse ahora. Cada modelo de imagen en reAPI habla la misma forma de solicitud async, así que construir contra un modelo que se envía hoy y cambiar el id del modelo cuando Image 2.0 llegue es una edición de una línea en lugar de una migración. La misma clave de API ya funciona en toda la plataforma.
El coste es la parte que los números de versión ocultan
El orden de versión implica que más nuevo significa más caro, y en esta alineación eso no es confiable. En el lado del vídeo, 1.0 Video y Video 1.5 se facturan por segundo y se escalan por resolución, así que la brecha entre ellos se amplía con la duración del clip en lugar de mantenerse un porcentaje fijo. Un render 1080p de 15 segundos y un render 480p de 4 segundos son productos diferentes comercialmente aunque el mismo modelo Grok Imagine los produjese.
Eso importa cuando estás dimensionando una carga de trabajo. Los equipos típicamente hacen benchmark en clips de prueba cortos de 480p, eligen el modelo Grok Imagine más nuevo en calidad, luego descubren que la factura real vive en la resolución y duración que realmente envían. Ejecuta la estimación con configuración de producción antes de comprometerte.
Para Image 2.0 no hay una conversación sobre costes que hacer aún, porque ninguna tasa se ha publicado. Cuando llegue, la tabla de precios en su página de modelo se completa automáticamente, y el sistema de créditos no cambia: pagas por generación completada, las generaciones fallidas se reembolsan, y los créditos no expiran.
Una nota práctica más. Porque cada modelo en la plataforma comparte una clave y una forma de solicitud async, comparar dos opciones de modelo Grok Imagine en producción es barato. Apunta la misma integración a cada id, ejecuta los mismos prompts, y compara salidas reales y cargos reales en lugar de posiciones en clasificaciones. Eso suele ser una señal mejor que un delta Elo medido en los prompts de otro.
Qué no se publica
Vale ser explícito, porque las conjeturas circulan como hechos.
La arquitectura de Image 2.0, el recuento de parámetros y el método de entrenamiento no se divulgan. xAI describió el modelo anterior Aurora como autorregresivo, pero los reclamos de que 2.0 comparte ese diseño son inferencia, no documentación. El precio de Image 2.0 tampoco se ha publicado, ni para el modelo ni para la API próxima. Cualquier tasa por imagen citada para él hoy está inventada.
Dónde deja esto la alineación
Los números de versión sugieren una escalera. La realidad son dos líneas de
productos que comparten un nombre: vídeo en 1.0 y 1.5, imágenes en 2.0, más un
cuarto modelo, grok-imagine-image-quality, sirviendo silenciosamente tráfico de
imagen en la API mientras 2.0 recibe la atención.
Así que la regla de selección no es "tomar el número más alto". Empieza desde la salida que necesitas, verifica si ese modelo Grok Imagine tiene un punto final que puedas llamar hoy, y solo entonces compara calidad. Dos de los cuatro fallan la prueba de punto final para imágenes ahora, y uno de ellos falla silenciosamente respondiendo con una generación más antigua de la esperada.
Para trabajo de vídeo, el modelo Grok Imagine actual es Video 1.5, y está disponible. Para trabajo de imagen, el modelo Grok Imagine vale la pena planificar es Image 2.0, y no es aún llamable. Construye en algo que se envía, mantén el id del modelo en config en lugar de hardcodeado, y el día que Image 2.0 se abre cambias una línea en lugar de reescribir una integración.
Referencias
- xAI. Grok Imagine Video 1.5. Retrieved August 2026 from x.ai/news/grok-imagine-video-1-5
- xAI. Imagine Image 2.0. Retrieved August 2026 from x.ai/news/grok-imagine-image-2
- xAI. Grok Imagine Quality Mode API. Retrieved August 2026 from x.ai/news/grok-imagine-quality-mode
Further reading
- reapi.ai/models/grok-imagine-video-1-5 · pricing and limits for the current video Grok Imagine model
- reapi.ai/models/grok-imagine-image-2-0 · what the Image 2.0 Grok Imagine model brings when its API opens
- reapi.ai/blog/grok-imagine-2-0-vs-gpt-image-2 · how Image 2.0 stacks up against the model that outranked it
Autor

Categorías
Más publicaciones

Diez avances de OpenAI Astra en matemáticas: qué significan
OpenAI Astra produce diez avances en matemáticas e informática teórica. Analiza qué se probó, qué verifica Lean, y por qué requiere revisión de expertos.


Rechazos en Seedance 2.5: cómo leer el filtro
Diagnostica rechazos de Seedance 2.5 desde el error de tarea, enrutamiento y créditos liquidados sin adivinar la verificación de seguridad que se activó.


Kimi K3 vs Claude Opus 5: pesos abiertos o confiable
Kimi K3 vs Claude Opus 5: compara pesos abiertos, contexto 1M, razonamiento, entrada multimodal, precios de API, requisitos de implementación para tu equipo.
