
GPT Image 2 : rendu de texte à 99 % et réflexion
Utiliser GPT Image 2 : rendu de texte à 99 %, mode de réflexion, où il perd face à Nano Banana 2 et ajustements de prompt pour meilleurs résultats.
OpenAI a annoncé ChatGPT Images 2.0 le 21 avril 2026, alimenté par le nouveau modèle gpt-image-2, et a commencé à le déployer dès le lendemain[1]. Le changement phare n'est pas la résolution. C'est que le texte généré à l'intérieur des images fonctionne désormais.
Non pas « fonctionne en grande partie, avec quelques fautes de frappe charmantes ». Le texte atteint environ 99 % de précision sur les scripts latins, japonais, coréen, hindi, bengali, arabe et une douzaine d'autres systèmes d'écriture[1]. Pendant deux ans, le flux de travail standard consistait à générer l'image, puis à composer du texte réel par-dessus dans Figma. Cette étape a largement disparu.
Apprendre à bien utiliser GPT Image 2 tient principalement à deux choses : rédiger des briefs assez précis pour exploiter le rendu de texte, et savoir quand désactiver le mode de réflexion.
TL;DR
- Rendu de texte à environ 99 % de précision, y compris les scripts non latins à une qualité quasi natale[1].
- Le mode de réflexion permet au modèle de naviguer sur le web pour trouver des références, de planifier plusieurs variantes et de s'auto-vérifier avant de renvoyer[1].
- Résolution native 2K avec support 16:9 et connaissance mise à jour jusqu'en décembre 2025[1].
- Il remplace DALL-E 3, qui a pris sa retraite le 12 mai 2026, et le GPT Image 1.5 intérimaire[1].
- Une architecture complètement nouvelle, par passage unique plutôt que le pipeline en deux étapes antérieur, donnant une génération typique inférieure à trois secondes[1].
- Pas le leader du photoréalisme. Nano Banana 2 reste en avance sur le réalisme photographique pur et la sortie 4K ; GPT Image 2 domine en fidélité de texte et respect de prompt[1].
Ce qu'est GPT Image 2
GPT Image 2 est le modèle d'image phare d'OpenAI, disponible sur trois surfaces : à l'intérieur de ChatGPT en tant que Images 2.0, à l'intérieur de l'agent de codage Codex pour la génération d'actifs en ligne, et en tant que l'API gpt-image-2[1].
L'architecture est une rupture nette avec la gamme DALL-E. OpenAI a refusé de confirmer si elle est basée sur la diffusion, autorégrégative ou hybride, disant seulement qu'il s'agit d'une architecture complètement nouvelle passant d'un pipeline d'inférence en deux étapes à un générateur par passage unique. Les conséquences pratiques sont une génération plus rapide et un couplage beaucoup plus serré entre la sémantique du prompt et la sortie rendue[1].
La percée du rendu de texte

Les améliorations spécifiques valent la peine d'être séparées, car elles ouvrent des flux de travail différents[1] :
- Orthographe en scripts latins à environ 99 %, y compris le texte de menu dense, les étiquettes d'emballage, les tableaux de valeurs nutritionnelles, les longs gros titres éditoriaux et le texte d'interface.
- Scripts non latins à une précision quasi natale pour les principales langues du monde. Les modèles précédents les traitaient comme de la décoration : visuellement plausible, sémantiquement sans sens.
- Texte petit et iconographie dans les compositions denses, y compris les champs de formulaire, les étiquettes de badge et les petits caractères juridiques, rendus lisibles.
- Cohérence stylistique entre le texte et le langage de conception, de sorte qu'une enseigne de café de Brooklyn et une affiche de métro de Tokyo semblent sortir de designers différents plutôt que du même modèle générique.

L'exemple de librairie est celui qu'il faut étudier. Chaque titre est rendu dans un script Indic distinct, et chacun est un texte cohérent qu'un lecteur de cette langue peut identifier[1]. C'est la capacité qui ouvre les pipelines de contenu localisé : créativité publicitaire régionale, emballage multilingue, miniatures de commerce électronique en langue Indic, à une vitesse qui était auparavant impossible.
Mode de réflexion

Le mode de réflexion est la fonctionnalité qui change la façon dont vous interagissez avec le modèle. Avec les invites standard, il fait ce que tout modèle d'image fait : lire le prompt, générer les pixels. Avec le mode de réflexion activé, il aussi[1] :
Navigue sur le web pour trouver du matériel de référence quand le prompt mentionne des marques réelles, des produits ou du contenu sensible au temps.
Planifie plusieurs variantes de sortie avant de valider les pixels, ce qui fait qu'un prompt produit une campagne publicitaire en trois tailles ou une bande dessinée sur cinq panneaux.
S'auto-vérifie avant de renvoyer, vérifiant que le texte rendu est orthographié correctement et que la hiérarchie de la mise en page a survécu.
La démonstration qu'OpenAI met en avant est un seul prompt demandant une affiche sur de la marchandise actuellement sur son propre site web, qui a produit une composition précise car le modèle y a jeté un coup d'œil. Pas de téléchargement de référence, pas de liste de produits manuelle[1].
Pour les briefs contenant des phrases comme « dans le style de sa page héros actuelle », cela élimine l'étape manuelle de collecte de références. Pour la génération en masse de visuels simples, désactivez-le, car il coûte plus cher et prend plus de temps.
Production de qualité commerciale

L'annonce ci-dessus est une génération d'un seul prompt entièrement synthétique. Elle porte une photographie de produit plausible, une marque de mot cohérente dans deux scripts, un détail typographique secondaire, une annonce lisible avec localisation et poignée sociale, et cohérence stylistique entre photographie, type, texture et palette[1].
Il y a deux ans, c'était le cas classique d'échec d'image générative. Le modèle pouvait produire la photographie, mais tout texte réel dans la composition se dégénérait en glyphes brouillés.
L'implication vaut la peine d'être nommée directement : pour la plupart des petites entreprises, le goulot d'étranglement du marketing n'est plus la production visuelle. C'est le brief.
Compréhension structurelle plus profonde
La ligne de positionnement d'OpenAI est « génération d'images avec un point de vue », ce qui signifie que le modèle a une compréhension structurelle de ce qu'il rend plutôt qu'une couverture statistique d'un corpus. En pratique[1] :
- Le suivi des instructions s'améliore sur les demandes de composition : titre aligné à gauche, produit à droite, marque en bas à droite.
- La connaissance du monde est plus forte. Le modèle sait sur quel appareil photo une prise de produit devrait sembler avoir été prise, quel type de papier une couverture vintage devrait émuler.
- La cohérence des caractères se maintient sur des séquences multi-panneaux.
- L'alphabétisation iconographique s'est améliorée, de sorte que les tableaux périodiques, les diagrammes anatomiques et les plans architecturaux s'affichent correctement plutôt que comme du charabia plausible.
C'est l'axe où elle diffère le plus clairement des modèles purement photographiques. Sur une nature morte photoréaliste, Nano Banana 2 est compétitif ou en avance. Sur une composition nécessitant que le modèle sache quelque chose et le rendre correctement, GPT Image 2 domine[1].
Où ça ne convient pas
Les limites honnêtes[1] :
- Pas un remplacement pour les designers sur un travail de marque critique d'identité. La qualité du premier brouillon est excellente ; un directeur créatif devrait toujours diriger.
- Pas le leader du photoréalisme. Nano Banana 2 et les modèles photo-réalistes spécialisés conservent des avantages sur la nature morte hyper-réaliste et le portrait.
- Le mode de réflexion est plus lent et plus cher. Désactivez-le pour la génération en masse de visuels simples.
- La politique de contenu s'applique. Les personnages publics réels, les personnages protégeables par le droit d'auteur et certaines références commerciales sont restreintes.
Comment utiliser GPT Image 2 sur reAPI
reAPI expose le modèle sur un endpoint de tâche asynchrone. La soumission renvoie un task_id ; interrogez jusqu'à ce que ce soit prêt.
curl https://reapi.ai/api/v1/images/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2",
"prompt": "Affiche éditoriale pour l'ouverture d'une café Kyoto, titre main-lettre crème serif, lumière cinématographique chaude, ligne d'adresse lisible en bas",
"size": "16:9",
"resolution": "2k"
}'Trois choses à savoir avant d'écrire l'intégration.
La résolution est une dimension tarifée. La passerelle expose 1K, 2K et 4K, chacun avec son propre tarif, donc un choix de résolution est un choix de coût. Les tarifs actuels se trouvent sur reapi.ai/models/gpt-image-2, qui est la source canonique plutôt que n'importe quel chiffre cité dans un article.
Les entrées multimédias sont des URL publiques uniquement. Pas de base64, pas de charges data:, sur aucun modèle de la plateforme.
La précision du prompt paie ici plus que sur les anciens modèles. Les briefs qui ont fonctionné avec DALL-E 3, vagues et visuellement focalisés, sous-performent par rapport à ce que ce modèle fait avec des instructions explicites de mise en page, typographiques et de référence. Le plafond est plus élevé et le plancher nécessite une entrée plus précise[1].
Les formes complètes de requête et de réponse se trouvent dans la référence reapi.ai/docs/gpt-image-2.
FAQ
Qu'est-ce que GPT Image 2 ?
Le modèle de génération d'images phare d'OpenAI, annoncé le 21 avril 2026, remplaçant DALL-E 3 et GPT Image 1.5. Il est livré dans ChatGPT en tant que Images 2.0, dans Codex et en tant que l'API gpt-image-2[1].
Avec quelle précision GPT Image 2 rend-il le texte ?
Environ 99 % sur les scripts latins, avec une précision quasi natale sur les principaux scripts non latins y compris le japonais, le coréen, le hindi, le bengali et l'arabe[1].
Qu'est-ce que le mode de réflexion ?
Un mode dans lequel le modèle navigue sur le web pour trouver des références, planifie plusieurs variantes avant de générer et s'auto-vérifie avant de renvoyer la sortie. Il coûte plus cher et prend plus de temps, donc désactivez-le pour la génération simple en masse[1].
Quelle résolution GPT Image 2 supporte-t-il ?
2K natif avec support 16:9 aux côtés des rapports d'aspect existants[1]. Sur reAPI, 1K, 2K et 4K sont exposés comme des options tarifées séparément.
GPT Image 2 est-il meilleur que Nano Banana 2 ?
Ils dominent sur des axes différents. Nano Banana 2 est en avance sur le réalisme photographique pur et la sortie 4K. GPT Image 2 domine en fidélité de texte, respect de prompt et mode de réflexion intégré[1].
Que s'est-il passé avec DALL-E 3 ?
Il a pris sa retraite le 12 mai 2026. GPT Image 2 le remplace et le GPT Image 1.5 intérimaire[1].
GPT Image 2 accepte-t-il l'entrée d'image base64 sur reAPI ?
Non. Chaque modèle de la plateforme n'accepte que des URL http(s) publiques pour les entrées multimédias.
Comment dois-je rédiger des prompts pour GPT Image 2 ?
Plus spécifiquement que pour DALL-E 3. Donnez des instructions explicites de mise en page, typographiques et de référence plutôt qu'une description visuelle vague, car le modèle agit maintenant sur les détails structurels que les anciens modèles ignoraient[1].
Mettre à jour le brief, pas seulement la chaîne de modèle
Le résumé utile de cette version est qu'il déplace le goulot d'étranglement. Quand le texte généré était inutilisable, la contrainte était le modèle. Maintenant qu'une publicité de café avec un type secondaire japonais lisible sort d'un seul prompt, la contrainte est la précision avec laquelle vous pouvez décrire ce que vous voulez.
Cela a une conséquence pratique pour quiconque migre un pipeline. Les modèles de prompt écrites pour la génération précédente sont accordés pour un modèle qui ignorait l'instruction structurelle, et ils sous-utiliseront celui-ci. Réécrivez-les avec une mise en page et une typographie explicites, conservez le mode de réflexion pour les briefs qui référencent le monde réel et éteignez-le pour le volume, et choisissez la résolution délibérément car c'est une dimension tarifée. C'est comment utiliser GPT Image 2 sans payer une capacité que vos briefs ne demanderont jamais.
References
- OpenAI. GPT Image 2 — fiche du modèle, capacités et référence API. Récupéré juillet 2026 depuis platform.openai.com/docs/models
- OpenAI. Tarification — tarifs par image et par jeton par modèle. Récupéré juillet 2026 depuis platform.openai.com/docs/pricing
Further reading
- reAPI. How to use Nano Banana 2 Lite. reapi.ai/blog/how-to-use-nano-banana-2-lite
- reAPI. GPT Image 2 endpoint reference. reapi.ai/docs/gpt-image-2
- reAPI. Model catalog. reapi.ai/models
Auteur

Catégories
Plus d'articles

Seedream 5.0 Pro : limites documentées et retests
Distinguez limites documentées et paramètres par défaut de Seedream 5.0 Pro des défauts visuels. Mesurez via tests reproductibles plutôt qu'un seul résultat.


La fenêtre de contexte Claude : qu'est-ce qui la consomme
Fenêtre 1 million de tokens sur les modèles actuels, mais les définitions d'outils, la réflexion conservée et le cache la consomment. Plus n'est pas mieux.


Tarification Mammouth AI : plans, limites et accès API en 2026
Tarification Mammouth AI : comparez Starter, Standard et Expert, réinitialisation quota, crédits API inclus, facturation à l'usage et limites de fichiers.
