Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Grok Imagine 2.0 vs GPT Image 2 : scores, édition et API
2026/08/10

Grok Imagine 2.0 vs GPT Image 2 : scores, édition et API

Grok Imagine 2.0 se classe deuxième à GPT Image 2 en génération et édition, mais sans API. Écarts Elo, édition régionale et modèles disponibles maintenant.

xAI a lancé Imagine Image 2.0 le 7 août 2026, et les tableaux Arena qu'il a cités placent le modèle en deuxième place au monde en texte-vers-image et édition d'image. La première place dans les deux catégories est allée au modèle GPT Image 2 d'OpenAI[1]. C'est le titre de l'article, et c'est plus intéressant que cela ne le paraît, car dans une comparaison Grok Imagine 2.0 vs GPT Image 2, l'écart ne se situe pas où la plupart des gens le supposent.

Si vous pesez Grok Imagine 2.0 vs GPT Image 2 pour décider sur quoi construire, le classement est le nombre le moins utile de la page. Ce qui compte, c'est que l'un d'eux est appelable par une API aujourd'hui et l'autre non, et que les deux modèles sont optimisés pour des moitiés différentes du même travail.

Ce que les scores Arena de Grok Imagine 2.0 disent réellement

Sur les classements que xAI a référencés le jour de l'annonce, Grok Imagine 2.0 a obtenu 1320 (±12) en Texte-vers-Image et 1439 (±8) en Édition d'Image[1]. La génération précédente, Grok Imagine Quality, se situe à 1228 et 1390 sur les mêmes classements actuels.

Cela représente environ +92 Elo en génération et +49 en édition. Ce n'est pas une erreur d'arrondi, et ce n'est pas « la peau a l'air un peu mieux » non plus. Un écart de cette taille signifie généralement que le modèle a changé la façon dont il traite les instructions, pas seulement la façon dont il rend les pixels.

Voici le bémol. Les scores de Grok Imagine 2.0 comportent toujours une étiquette Préliminaire parce que le nombre de votes est faible. « Placement initial solide » est la lecture honnête. « Deuxième meilleur modèle d'image au monde, réglé » ne l'est pas, du moins pas encore. Tout verdict Grok Imagine 2.0 vs GPT Image 2 écrit ce mois-ci est provisoire par définition.

La partie qui trompe les gens

Grok Imagine 2.0 n'a pas d'API publique aujourd'hui. L'annonce de xAI se termine par les mots « L'accès à l'API arrive bientôt » et s'arrête là[1]. Pas de point de terminaison, pas de référence de paramètre, pas de date.

Entre-temps, il y a un modèle Grok image sur l'API aujourd'hui, et ce n'est pas celui-ci. grok-imagine-image-quality est appelable depuis mai 2026[2]. C'est la génération précédente, la ligne 1228/1390 du tableau ci-dessus. Câblez une intégration cette semaine en vous attendant au comportement de Grok Imagine 2.0 et vous obtiendrez le comportement Quality, puis passerez une après-midi à vous demander pourquoi l'édition semble plus faible que dans les démos.

GPT Image 2, en revanche, est appelable maintenant. Donc la question pratique pour les prochaines semaines n'est pas quel modèle est meilleur. C'est quel modèle vous pouvez réellement appeler.

Où Grok Imagine 2.0 est vraiment plus fort

Les deux modèles ne rivalisent pas pour la même place dans un pipeline.

GPT Image 2 gagne en correction au premier coup. Suivi d'instructions complexe, rendu de texte, préservation du sujet et moins de tentatives gaspillées. Via l'API Responses vous pouvez maintenir une conversation et apporter des éditions haute fidélité contre elle[3]. Si votre flux est « obtenir une image exactement juste, puis la réviser précisément », c'est l'outil plus fort, et son placement Arena le confirme.

Grok Imagine 2.0 gagne en boucle. Le modèle d'édition de Grok Imagine 2.0 est la moitié intéressante : une baguette magique qui change seulement la région que vous pointez, segmentation pour des zones précises, suppression de fond qui exporte les sujets sur transparence, et édition multi-référence qui accepte jusqu'à cinq entrées en une seule génération.

Cette dernière capacité est celle qui est sous-estimée. Au lieu de charger une seule image de référence avec chaque travail à la fois, personnage, vêtement, localisation, éclairage et aspect général, vous les divisez en cinq entrées et contrôlez exactement ce qui est hérité de où.

Le mode d'échec plus ancien est celui que ceci corrige. Vous générez une bonne image, une main est mal sortie, vous régénérez pour la corriger, et maintenant le visage, le corps, l'éclairage et la composition ont tous dérivé. L'édition délimitée par région signifie que les pièces que vous avez déjà approuvées survivent à la correction. En pratique, cela transforme la génération d'images en quelque chose de plus proche d'une séance photo avec une passe de retouche, plutôt que de tirer sur un levier de machine à sous jusqu'à ce qu'une image entière s'éteigne.

Le Redimensionnement Intelligent appartient à la même catégorie. Neuf rapports d'aspect publiés vont de 1:2 à 2:1, et plutôt que de recadrer une composition existante, le modèle remplit le cadre pour le ratio que vous choisissez. Un portrait 2:3 devient un vertical 9:16 sans perdre ce qui s'est assis en dehors de la nouvelle culture.

L'adjacence vidéo que personne ne compte

GPT Image 2 ne génère pas de vidéo. Grok Imagine le fait, et les deux moitiés sont construites pour se transmettre l'une à l'autre. Cette adjacence apparaît rarement dans un tableau de fonctionnalités Grok Imagine 2.0 vs GPT Image 2, et pour certaines équipes, elle décide de toute la question.

Video 1.5 couvre texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo avec jusqu'à sept images, 1080p natif, clips jusqu'à 15 secondes, et audio généré en un seul passage. Une génération Fast de 6 secondes en 720p est passée de plus de 40 secondes à environ 25[4]. Sur le tableau Image-to-Video Arena, il s'est classé troisième au 2 août 2026, dans un groupe supérieur dont les barres d'erreur se chevauchent.

Pour une image fixe, quelques secondes de mouvement suffisent souvent. Un regard qui se décale. Les épaules qui se lèvent avec une respiration. Les cheveux qui bougent dans le vent. Un zoom lent. Si votre sortie finit sur les réseaux sociaux, cette transmission d'image à court clip vaut plus que 90 Elo sur un classement.

Comment cela s'adapte à Gemini et Krea

Quatre modèles, quatre travaux différents :

ModèleCe dans lequel il excelle
GPT Image 2Obtenir une image exactement comme instructed, puis l'éditer précisément
Gemini / Nano Banana 2Connaissances mondiales, contexte long, édition multimodale conversationnelle
Krea 2Explorer une direction esthétique plutôt que de clouer une réponse correcte
Grok Imagine 2.0Générer, corriger par région et animer rapidement en une boucle

Gemini 3.1 Flash Image accepte audio et vidéo en entrée, peut vérifier les faits via la recherche et générer jusqu'à 4K. Si vous avez besoin d'un modèle pour raisonner sur une scène complexe ou maintenir la continuité sur une longue conversation, c'est là qu'il se démarque.

Krea 2 est construit autour de l'exploration plutôt que de l'exécution. Références de style, moodboards, curseurs d'intensité et de complexité, LoRA. Il convient à la recherche d'un aspect sur une série plutôt qu'à l'exécution d'un cahier des charges fixe.

Aucun de ceux-ci n'est un classement. Ce sont quatre formes différentes de travail, et choisir uniquement par position de classement est comment les équipes finissent avec le mauvais outil.

Ce que nous ne savons pas encore

Cela vaut la peine de le dire clairement, car beaucoup de couverture est de la spéculation.

xAI a décrit le modèle Aurora plus ancien comme un modèle de génération d'images autorégressive[5]. Pour Grok Imagine 2.0, l'architecture, le nombre de paramètres, la méthode d'entraînement et toute structure MoE ne sont simplement pas publiés. Les affirmations selon lesquelles c'est « le même MoE autorégressif qu'Aurora », ou qu'il utilise un DiT ou VAE particulier, sont de l'inférence habillée en fait.

La tarification est la même histoire. Rien de publié, ni pour le modèle ni pour l'API à venir. Quiconque cite un tarif par image pour Grok Imagine 2.0 aujourd'hui l'a inventé. Les plafonds de résolution de sortie et les limites de débit ne sont également pas divulgués.

Choisir un modèle pour ce mois

Si vous avez besoin d'un modèle image en production maintenant, GPT Image 2 est celui avec un point de terminaison, et il est premier sur les deux tableaux contre lequel il a été mesuré. C'est un appel facile, et aucun nombre de changements Elo préliminaires ne le change.

Si votre travail ressemble à une boucle, générer, corriger une région, garder le sujet cohérent sur un ensemble, puis pousser la meilleure image dans un court clip, la décision Grok Imagine 2.0 vs GPT Image 2 cesse d'être une question de qualité et devient une question de flux. Le mouvement pratique est de construire contre un point de terminaison image partagé aujourd'hui avec un modèle qui expédie, puis d'échanger l'id du modèle quand Grok Imagine 2.0 s'ouvre. Sur reAPI, c'est un changement sur une ligne plutôt qu'une migration, et la même clé API fonctionne déjà sur chaque modèle sur la plateforme.

Ce que le modèle d'édition change en pratique

La plupart des API image traitent l'édition comme un deuxième point de terminaison qui accepte une image. Grok Imagine 2.0 le traite comme le même système qui a généré l'image, et cette distinction se montre dans les modes de défaillance plutôt que dans les démos.

Prenez un coup de produit où l'étiquette se lit mal. Sur un modèle de génération uniquement, vous réécrivez le prompt et relancez, et l'éclairage se décale, l'ombre se déplace, la réflexion change, et maintenant vous comparez deux images qui diffèrent de cinq façons au lieu d'une. Avec l'édition délimitée par région, vous pointez vers l'étiquette. Tout le reste est octet pour octet ce que vous avez déjà approuvé.

La même logique couvre une série. Donnez à Grok Imagine 2.0 une référence de personnage, une référence de localisation et une référence de vêtement en tant qu'entrées séparées, et vous pouvez exécuter le même sujet à travers matin, après-midi et configurations intérieures sans que le visage ne dérive entre les prises. Une image de référence portant tout cela à la fois est où la cohérence se brise généralement.

La suppression de fond s'adapte au même flux. Exporter un sujet sur transparence n'est pas une capacité titre, mais c'est l'étape qui décide si une sortie va directement dans une mise en page ou a besoin d'un aller-retour dans un outil de masque d'abord.

Rien de tout cela ne fait de Grok Imagine 2.0 un meilleur modèle que GPT Image 2 sur le suivi d'instructions brutes. Les chiffres Arena disent le contraire, et préliminaire ou non, ils pointent dans la même direction. Ce qu'il change, c'est le nombre de générations que vous brûlez pour passer d'une image décente à un actif fini, et ce coût n'apparaît jamais sur un classement.

Références

  1. xAI. Imagine Image 2.0. Consulté en août 2026 sur x.ai/news/grok-imagine-image-2
  2. xAI. Grok Imagine Quality Mode API. Consulté en août 2026 sur x.ai/news/grok-imagine-quality-mode
  3. OpenAI. Image generation guide. Consulté en août 2026 sur platform.openai.com/docs/guides/image-generation
  4. xAI. Grok Imagine Video 1.5. Consulté en août 2026 sur x.ai/news/grok-imagine-video-1-5
  5. xAI. Grok Imagine API. Consulté en août 2026 sur x.ai/news/grok-imagine-api

Lectures complémentaires