Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Grok Imagine 2.0 vs GPT Image 2: puntuaciones, edición e API
2026/08/10

Grok Imagine 2.0 vs GPT Image 2: puntuaciones, edición e API

Grok Imagine 2.0 ocupa el segundo lugar en dos tableros Arena, pero todavía sin API. Diferencias Elo, edición regional y qué modelo puedes usar en producción.

xAI lanzó Imagine Image 2.0 el 7 de agosto de 2026, y los tableros Arena que citó colocan el modelo en segundo lugar mundial en generación de texto a imagen y edición de imágenes. El primer lugar en ambos correspondió a GPT Image 2 de OpenAI[1]. Ese es el titular, y es más interesante de lo que parece, porque en una comparación Grok Imagine 2.0 vs GPT Image 2, la brecha no está donde la mayoría de la gente supone.

Si estás evaluando Grok Imagine 2.0 vs GPT Image 2 para decidir sobre qué construir, la clasificación es el número menos útil de la página. Lo que importa es que uno de ellos se puede llamar desde una API hoy y el otro no, y que ambos modelos están optimizados para mitades diferentes del mismo trabajo.

Lo que dicen realmente las puntuaciones Grok Imagine 2.0 en Arena

En los tableros que xAI citó el día del anuncio, Grok Imagine 2.0 registró 1320 (±12) en texto a imagen y 1439 (±8) en edición de imágenes[1]. La generación anterior, Grok Imagine Quality, se sitúa en 1228 y 1390 en esos mismos tableros actuales.

Eso equivale aproximadamente a +92 Elo en generación y +49 en edición. No es un error de redondeo ni tampoco "la piel se ve un poco mejor". Un salto de este tamaño generalmente significa que el modelo cambió cómo maneja las instrucciones, no solo cómo renderiza píxeles.

Aquí viene la salvedad. Las puntuaciones de Grok Imagine 2.0 aún llevan una etiqueta Preliminary porque el recuento de votos es bajo. "Colocación inicial fuerte" es la lectura honesta. "Segundo mejor modelo de imagen del mundo, confirmado" no lo es, al menos no todavía. Cualquier veredicto Grok Imagine 2.0 vs GPT Image 2 escrito este mes es provisional por definición.

La parte que sorprende a la mayoría

Grok Imagine 2.0 no tiene API pública hoy. El anuncio de xAI termina con las palabras "el acceso a la API llegará pronto" y se detiene ahí[1]. Sin punto de acceso, sin referencia de parámetros, sin fecha.

Mientras tanto, hay un modelo Grok de imagen disponible en la API hoy, pero no es este. grok-imagine-image-quality se puede llamar desde mayo de 2026[2]. Es la generación anterior, la fila 1228/1390 en la tabla anterior. Si integras esperando el comportamiento de Grok Imagine 2.0 esta semana, obtendrás el comportamiento de Quality y pasarás una tarde preguntándote por qué la edición se siente más débil que en los demos.

GPT Image 2, en cambio, se puede llamar ahora. Así que la pregunta práctica para las próximas semanas no es qué modelo es mejor. Es qué modelo realmente puedes llamar.

Dónde Grok Imagine 2.0 es genuinamente más fuerte

Los dos modelos no compiten por el mismo lugar en una tubería.

GPT Image 2 gana en corrección de un solo intento. Seguimiento complejo de instrucciones, renderizado de texto, preservación de sujeto y menos reintentos desperdiciados. A través de la API de Responses, puedes mantener una conversación en marcha y hacer ediciones de alta fidelidad contra ella[3]. Si tu flujo de trabajo es "obtener una imagen exacta, luego revisarla precisamente", esa es la herramienta más fuerte, y su posición en Arena lo respalda.

Grok Imagine 2.0 gana en el bucle. El modelo de edición Grok Imagine 2.0 es la mitad interesante: una varita mágica que cambia solo la región que señalas, segmentación para áreas precisas, eliminación de fondo que exporta sujetos en transparencia, y edición multireferencia que acepta hasta cinco entradas en una sola generación.

La última capacidad es la subestimada. En lugar de cargar una sola imagen de referencia con cada trabajo a la vez, personaje, vestuario, ubicación, iluminación y look general, los dividimos entre cinco entradas y controlamos exactamente qué se hereda de dónde.

El modo de fallo anterior es lo que esto arregla. Generas un buen fotograma, una mano sale mal, regeneras para arreglarlo y ahora la cara, el cuerpo, la iluminación y la composición han derivado todos. La edición de alcance regional significa que las partes que ya aprobaste sobreviven a la corrección. En la práctica, eso convierte la generación de imágenes en algo más cercano a una sesión de fotos con un pase de retoque, en lugar de tirar de una palanca tragaperras hasta que todo un fotograma aterrice.

Smart Resize pertenece a la misma categoría. Nueve relaciones de aspecto publicadas van de 1:2 a 2:1, y en lugar de recortar una composición existente, el modelo rellena el fotograma para la relación que eliges. Un retrato 2:3 se convierte en un vertical 9:16 sin perder lo que estaba fuera del nuevo recorte.

La adyacencia de video que nadie cuenta

GPT Image 2 no genera video. Grok Imagine sí, y las dos mitades están construidas para transferirse mutuamente. Esa adyacencia rara vez aparece en una tabla de características Grok Imagine 2.0 vs GPT Image 2, pero para algunos equipos decide toda la pregunta.

Video 1.5 cubre texto a video, imagen a video, referencia a video con hasta siete imágenes, 1080p nativa, clips de hasta 15 segundos y audio generado en el mismo paso. Una generación Fast de 6 segundos a 720p cayó de más de 40 segundos a aproximadamente 25[4]. En el tablero de arena imagen-a-video, se ubicó tercero al 2 de agosto de 2026, dentro de un grupo superior cuyas barras de error se superponen.

Para una imagen fija, unos pocos segundos de movimiento suelen ser suficientes. Una mirada que se desplaza. Los hombros que suben con una respiración. Cabello moviéndose al viento. Un empujón lento. Si tu salida aterriza en redes sociales, esa transición de imagen a clip corto vale más que 90 Elo en un tablero de clasificación.

Cómo se ajusta esto junto a Gemini y Krea

Cuatro modelos, cuatro trabajos diferentes:

ModeloEn qué es mejor
GPT Image 2Generar una imagen exacta según se indica y luego editarla con precisión
Gemini / Nano Banana 2Conocimiento mundial, contexto largo, edición multimodal conversacional
Krea 2Explorar una dirección estética en lugar de acertar una única respuesta correcta
Grok Imagine 2.0Generar, corregir regiones y animar rápidamente en un ciclo

Gemini 3.1 Flash Image acepta audio y video como entrada, puede verificar hechos mediante búsqueda y genera hasta 4K. Si necesitas un modelo para razonar sobre una escena compleja o mantener continuidad en una conversación larga, es donde se adelanta.

Krea 2 se construye alrededor de la exploración en lugar de la ejecución. Referencias de estilo, paneles de estado, deslizadores de intensidad y complejidad, LoRA. Se adapta mejor a encontrar un look en una serie que a ejecutar un brief fijo.

Nada de esto es una clasificación. Son cuatro formas diferentes de trabajo, y elegir solo por posición en el tablero de clasificación es cómo los equipos terminan con la herramienta incorrecta.

Lo que aún no sabemos

Vale la pena declarar claramente, porque mucha cobertura es especulación.

xAI describió el antiguo modelo Aurora como un modelo de generación de imágenes autorregresivo[5]. Para Grok Imagine 2.0, la arquitectura, el recuento de parámetros, el método de entrenamiento y cualquier estructura MoE simplemente no se publican. Las afirmaciones de que es "el mismo MoE autorregresivo que Aurora" o que usa un DiT o VAE particular son inferencia disfrazada de hecho.

El precio es la misma historia. Nada publicado, ni para el modelo ni para la API próxima. Cualquiera que cite una tarifa por imagen para Grok Imagine 2.0 hoy se la inventó. Los techos de resolución de salida y los límites de velocidad tampoco se divulgan.

Elegir un modelo para este mes

Si necesitas un modelo de imagen en producción ahora, GPT Image 2 es el que tiene un punto de acceso y es primero en ambos tableros contra los que fue medido. Esa es una llamada fácil, y no hay cambios provisionales en Elo que la cambien.

Si tu trabajo parece un bucle, generar, corregir una región, mantener el sujeto consistente en un conjunto, luego empujar el mejor fotograma en un clip corto, la decisión Grok Imagine 2.0 vs GPT Image 2 deja de ser una pregunta de calidad y se convierte en una de flujo de trabajo. La jugada práctica es construir contra un punto de acceso de imagen compartido hoy con un modelo que se envía, y luego cambiar el id del modelo cuando Grok Imagine 2.0 se abre. En reAPI eso es un cambio de una línea en lugar de una migración, y la misma clave de API ya funciona en todos los modelos en la plataforma.

Lo que el modelo de edición cambia en la práctica

La mayoría de las API de imagen tratan la edición como un segundo punto de acceso que resulta aceptar una imagen. Grok Imagine 2.0 la trata como el mismo sistema que generó el fotograma, y esa distinción aparece en los modos de fallo en lugar de en los demos.

Toma una foto de producto donde la etiqueta está mal. En un modelo solo de generación, reescribes el prompt y lo corres de nuevo, y la iluminación se desplaza, la sombra se mueve, el reflejo cambia, y ahora estás comparando dos imágenes que difieren en cinco formas en lugar de una. Con edición de alcance regional, señalas la etiqueta. Todo lo demás es byte a byte lo que ya aprobaste.

La misma lógica cubre una serie. Dale a Grok Imagine 2.0 una referencia de personaje, una referencia de ubicación y una referencia de vestuario como entradas separadas, y puedes ejecutar el mismo sujeto a través de configuraciones matutinas, vespertinas e interiores sin que la cara derive entre disparos. Una imagen de referencia que lleve todo eso a la vez es donde la consistencia normalmente se rompe.

La eliminación de fondo se ajusta al mismo flujo de trabajo. Exportar un sujeto en transparencia no es una capacidad de titular, pero es el paso que decide si una salida va directo a un diseño o necesita un viaje de ida y vuelta a través de una herramienta de máscara primero.

Nada de esto hace que Grok Imagine 2.0 sea un mejor modelo que GPT Image 2 en seguimiento de instrucciones sin procesar. Los números de Arena dicen lo contrario, y preliminares o no, apuntan en la misma dirección. Lo que cambia es cuántas generaciones quemas para llegar de un fotograma decente a un activo terminado, y ese costo nunca aparece en un tablero.

Referencias

  1. xAI. Imagine Image 2.0. Retrieved August 2026 from x.ai/news/grok-imagine-image-2
  2. xAI. Grok Imagine Quality Mode API. Retrieved August 2026 from x.ai/news/grok-imagine-quality-mode
  3. OpenAI. Image generation guide. Retrieved August 2026 from platform.openai.com/docs/guides/image-generation
  4. xAI. Grok Imagine Video 1.5. Retrieved August 2026 from x.ai/news/grok-imagine-video-1-5
  5. xAI. Grok Imagine API. Retrieved August 2026 from x.ai/news/grok-imagine-api

Further reading