
Cómo usar GPT Image 2: renderizado de texto y modo Thinking
Cómo usar GPT Image 2: renderizado de texto al 99%, modo Thinking para referencias web, dónde pierde ante Nano Banana 2 y cambios en tus prompts.
OpenAI anunció ChatGPT Images 2.0 el 21 de abril de 2026, impulsado por el nuevo modelo gpt-image-2, y comenzó a implementarlo al día siguiente[1]. El cambio principal no es la resolución. Es que el texto generado dentro de las imágenes ahora funciona.
No "funciona en su mayoría, con un puñado de errores encantadores". Texto con precisión aproximada del 99% en alfabetos latino, japonés, coreano, hindi, bengalí, árabe y una docena de otros sistemas de escritura[1]. Durante dos años, el flujo de trabajo estándar era generar la imagen y luego superponer texto real en Figma. Ese paso prácticamente desapareció.
Aprender a usar GPT Image 2 bien se reduce principalmente a dos cosas: escribir descripciones lo suficientemente precisas para aprovechar el renderizado de texto, y saber cuándo desactivar el modo Thinking.
TL;DR
- Renderizado de texto al ~99% de precisión, incluidos sistemas de escritura no latinos con calidad casi nativa[1].
- Modo Thinking permite al modelo navegar por la web para buscar referencias, planificar múltiples variantes y autoverificar su salida antes de devolverla[1].
- Resolución nativa 2K con soporte 16:9, y corte de conocimiento de diciembre de 2025[1].
- Reemplaza a DALL-E 3, que se retiró el 12 de mayo de 2026, y al intermedio GPT Image 1.5[1].
- Una arquitectura completamente nueva, de una sola pasada en lugar del anterior pipeline de dos etapas, lo que proporciona generación típica en menos de tres segundos[1].
- No es el líder en fotorrealismo. Nano Banana 2 se mantiene adelante en realismo fotográfico puro y salida 4K; GPT Image 2 lidera en fidelidad de texto y adherencia a prompts[1].
Qué es GPT Image 2
GPT Image 2 es el modelo de imagen insignia de OpenAI, disponible en tres superficies: dentro de ChatGPT como Images 2.0, dentro del agente de codificación Codex para generación de activos en línea, y como la API gpt-image-2[1].
La arquitectura representa un quiebre limpio con la línea DALL-E. OpenAI se ha rehusado a confirmar si es basada en difusión, autoregresiva o híbrida, diciendo solo que es una arquitectura completamente nueva que pasa de un pipeline de inferencia de dos etapas a un generador de una sola pasada. Las consecuencias prácticas son generación más rápida y acoplamiento mucho más estrecho entre la semántica del prompt y la salida renderizada[1].
El avance en renderizado de texto

Las mejoras específicas vale la pena separarlas, porque abren diferentes flujos de trabajo[1]:
- Ortografía en alfabeto latino al ~99%, incluido texto denso en menús, etiquetas de empaque, paneles nutricionales, títulos editoriales largos y copias de interfaz.
- Sistemas de escritura no latinos con precisión casi nativa para idiomas principales del mundo. Los modelos anteriores los trataban como decoración: visualmente plausibles, semánticamente sin sentido.
- Texto pequeño e iconografía en composiciones densas, incluidos campos de formulario, etiquetas de insignia e impresión fina legal, renderizados legibles.
- Consistencia estilística entre texto y lenguaje de diseño, de modo que un letrero de café de Brooklyn y un póster del metro de Tokio se lean como de diferentes diseñadores en lugar del mismo modelo genérico.

El ejemplo de la librería es el que debes estudiar. Cada título se renderiza en un script Indic distinto, y cada uno es texto coherente que un lector de ese idioma puede identificar[1]. Esa es la capacidad que abre pipelines de contenido localizado: creatividad publicitaria regional, empaque multilingüe, miniaturas de e-commerce en idioma Indic, a una velocidad que anteriormente era imposible.
Modo Thinking

Thinking Mode es la característica que cambia cómo interactúas con el modelo. Con prompts estándar hace lo que hace cualquier modelo de imagen: lee prompt, genera pixels. Con Thinking Mode activado, también[1]:
Navega por la web buscando material de referencia cuando el prompt menciona marcas, productos o contenido sensible al tiempo.
Planifica múltiples variantes de salida antes de comprometerse con pixels, lo que hace que un prompt genere una campaña publicitaria en tres tamaños o un cómic en cinco paneles.
Se autoverifica antes de devolver, verificando que el texto renderizado esté deletreado correctamente y que la jerarquía de diseño se haya mantenido.
La demostración que OpenAI destaca es un único prompt pidiendo un póster sobre mercancía actualmente en su propio sitio, que produjo una composición precisa porque el modelo fue y lo miró. Sin carga de referencia, sin lista de productos manual[1].
Para descripciones que contengan frases como "en el estilo de su página hero actual", esto elimina el paso manual de recopilación de referencias. Para generación en lote de visuales simples, desactívalo, porque cuesta más y lleva más tiempo.
Salida de grado comercial

El anuncio anterior es una generación de única solicitud completamente sintética. Lleva una fotografía de producto plausible, marca de palabra coherente en dos escrituras, detalle tipográfico secundario, anuncio legible con ubicación e identificador social, y consistencia estilística entre fotografía, tipo, textura y paleta[1].
Hace dos años este era el caso de fallo clásico de imagen generativa. El modelo podía producir la fotografía, pero cualquier texto real en la composición se convertía en glifos garrapatos.
La implicación vale la pena nombrar directamente: para la mayoría del marketing de pequeños negocios el cuello de botella ya no es la producción visual. Es la descripción.
Comprensión estructural más profunda
La línea de posicionamiento de OpenAI es "generación de imágenes con punto de vista", lo que significa que el modelo tiene comprensión estructural de lo que renderiza en lugar de cobertura estadística de un corpus. En la práctica[1]:
- Seguimiento de instrucciones mejora en solicitudes composicionales: titular alineado a la izquierda, producto a la derecha, marca inferior derecha.
- Conocimiento del mundo es más fuerte. El modelo sabe con qué cámara debería verse que fue tomada una toma de producto, qué tipo de papel un cubre vintage debería emular.
- Consistencia de personaje se mantiene en secuencias multipanel.
- Alfabetización iconográfica mejorada, de modo que tablas periódicas, diagramas anatómicos y planos arquitectónicos se renderizan correctamente en lugar de como tonterías de aspecto plausible.
Este es el eje donde más claramente difiere de modelos puramente fotográficos. En una naturaleza muerta fotorrealista, Nano Banana 2 es competitiva o adelante. En una composición que requiere que el modelo sepa algo y lo renderice correctamente, GPT Image 2 lidera[1].
Dónde no encaja
Las limitaciones honestas[1]:
- No es un reemplazo para diseñadores en trabajo de marca crítico de identidad. La calidad de primer borrador es excelente; un director creativo aún debe dirigir.
- No es el líder en fotorrealismo. Nano Banana 2 y modelos especializados de foto real mantienen ventajas en vida muerta hiperrealista y retrato.
- Thinking Mode es más lento y más caro. Desactívalo para generación en lote de visuales simples.
- Se aplica política de contenido. Las figuras públicas reales, personajes con derechos de autor y ciertas referencias comerciales están restringidas.
Cómo usar GPT Image 2 en reAPI
reAPI expone el modelo en un punto final de tarea asincrónica. Submit devuelve un task_id; sondea hasta que esté listo.
curl https://reapi.ai/api/v1/images/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2",
"prompt": "Editorial poster for a Kyoto coffee shop opening, hand-lettered headline in cream serif, warm cinematic light, legible address line at the bottom",
"size": "16:9",
"resolution": "2k"
}'Tres cosas a saber antes de escribir la integración.
La resolución es una dimensión con precio. La puerta de enlace expone 1K, 2K y 4K, cada uno con su propia tarifa, por lo que una opción de resolución es una opción de costo. Las tarifas actuales están en reapi.ai/models/gpt-image-2, que es la fuente canónica en lugar de cualquier cifra citada en un artículo.
Las entradas de medios son solo URLs públicas. Sin base64, sin payloads data:, en ningún modelo de la plataforma.
La precisión del prompt paga aquí más que en modelos más antiguos. Descripciones que funcionaban con DALL-E 3, vagas y visualmente enfocadas, tienen un rendimiento inferior en relación con lo que este modelo hace con instrucciones explícitas de diseño, tipografía y referencia. El techo es más alto y el piso requiere entrada más precisa[1].
Las formas completas de solicitud y respuesta están en la referencia reapi.ai/docs/gpt-image-2.
Preguntas frecuentes
¿Qué es GPT Image 2?
El modelo de generación de imágenes insignia de OpenAI, anunciado el 21 de abril de 2026, reemplazando DALL-E 3 y GPT Image 1.5. Se envía en ChatGPT como Images 2.0, en Codex y como la API gpt-image-2[1].
¿Qué tan preciso es GPT Image 2 al renderizar texto?
Aproximadamente 99% en script latino, con precisión casi nativa en scripts no latinos principales incluidos japonés, coreano, hindi, bengalí y árabe[1].
¿Qué es Thinking Mode?
Un modo en el que el modelo navega por la web buscando referencias, planifica múltiples variantes antes de generar, y se autoverifica el texto renderizado y el diseño antes de devolver la salida. Cuesta más y lleva más tiempo, así que desactívalo para generación en lote de visuales simples[1].
¿Qué resolución admite GPT Image 2?
2K nativo con soporte 16:9 junto con relaciones de aspecto existentes[1]. En reAPI, 1K, 2K y 4K se exponen como opciones con precios separados.
¿Es GPT Image 2 mejor que Nano Banana 2?
Lideran en ejes diferentes. Nano Banana 2 está adelante en realismo fotográfico puro y salida 4K. GPT Image 2 lidera en fidelidad de texto, adherencia a prompts y modo Thinking integrado[1].
¿Qué pasó con DALL-E 3?
Se retiró el 12 de mayo de 2026. GPT Image 2 lo reemplaza a él y al intermedio GPT Image 1.5[1].
¿GPT Image 2 acepta entrada de imagen base64 en reAPI?
No. Cada modelo en la plataforma toma solo URLs http(s) públicas para entradas de medios.
¿Cómo debo escribir prompts para GPT Image 2?
Más específicamente que para DALL-E 3. Proporciona instrucciones explícitas de diseño, tipografía y referencia en lugar de una descripción visual vaga, porque el modelo ahora actúa sobre detalles estructurales que los modelos más antiguos ignoraban[1].
Actualizar la descripción, no solo la cadena del modelo
El resumen útil de este lanzamiento es que mueve el cuello de botella. Cuando el texto generado era inutilizable, la restricción era el modelo. Ahora que un anuncio de café con tipo secundaria japonés legible sale de un único prompt, la restricción es con qué precisión puedes describir lo que quieres.
Esto tiene una consecuencia práctica para cualquiera que migre un pipeline. Las plantillas de prompt escritas para la generación anterior están ajustadas para un modelo que ignoraba la instrucción estructural, y subutilizarán esta. Reescríbelas con diseño y tipografía explícitos, mantén Thinking Mode para descripciones que hagan referencia al mundo real y apagado para volumen, y elige la resolución deliberadamente ya que es una dimensión con precio. Así es como usas GPT Image 2 sin pagar por capacidad que tus descripciones nunca piden.
Referencias
- OpenAI. GPT Image 2 — model card, capabilities, and API reference. Retrieved July 2026 from platform.openai.com/docs/models
- OpenAI. Pricing — per-image and per-token rates by model. Retrieved July 2026 from platform.openai.com/docs/pricing
Further reading
- reAPI. How to use Nano Banana 2 Lite. reapi.ai/blog/how-to-use-nano-banana-2-lite
- reAPI. GPT Image 2 endpoint reference. reapi.ai/docs/gpt-image-2
- reAPI. Model catalog. reapi.ai/models
Autor

Categorías
Más publicaciones

Créditos de Seedance y cuotas: por qué se agota el saldo
Coste por clip según resolución, duración e entrada. La facturación por segundo responde con multiplicación exacta, sin tipo de cambio variable.


Rechazos en Seedance 2.5: cómo leer el filtro
Diagnostica rechazos de Seedance 2.5 desde el error de tarea, enrutamiento y créditos liquidados sin adivinar la verificación de seguridad que se activó.


Qué es Seedance 2.0 y cómo utilizarlo: guía de 2026
Qué es Seedance 2.0, cuáles son sus sitios oficiales, todas las plataformas disponibles y cómo llamar a la API. Verificado en julio de 2026.
