Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
GPT Image 2 使用指南:文字渲染与思考模式
2026/07/27

GPT Image 2 使用指南:文字渲染与思考模式

GPT Image 2 使用指南:99% 文字渲染精度如何消除合成步骤、思考模式的作用、相比 Nano Banana 2 的差距和提示词改进。

OpenAI 在 2026 年 4 月 21 日发布了 ChatGPT Images 2.0,采用新的 gpt-image-2 模型,并从次日开始逐步推出[1]。核心改进不是分辨率提升,而是生成图像内的文字现在能正常工作。

不是"大部分能工作,偶尔有几个有趣的拼写错误"。而是在拉丁字母、日文、韩文、印地文、孟加拉文、阿拉伯文和数十种其他文字系统中,文字精度达到约 99%[1]。过去两年的标准工作流是:生成图像,然后在 Figma 中合成真实文字。这一步现在基本消除了。

学好如何使用 GPT Image 2 主要看两点:写出足够精确的文案以充分利用文字渲染,以及知道何时关闭思考模式。

TL;DR

  • 文字渲染精度约 99%,包括非拉丁文字在内都能达到接近原生质量[1]
  • 思考模式让模型浏览网络查找参考资料、规划多个输出变体,并在返回前自我验证[1]
  • 2K 原生分辨率支持 16:9,知识截断日期为 2025 年 12 月[1]
  • 它替代了 DALL-E 3,后者已于 2026 年 5 月 12 日停用,临时的 GPT Image 1.5 也已下线[1]
  • 全新架构,从先前的两阶段管道改为单次通过生成,生成时间通常不足 3 秒[1]
  • 不是光影逼真领域。Nano Banana 2 在纯摄影写实和 4K 输出上仍有优势;GPT Image 2 在文字保真度和提示词贴切度上领先[1]

GPT Image 2 是什么

GPT Image 2 是 OpenAI 的旗舰图像模型,在三个应用面上推出:ChatGPT 内的 Images 2.0、编程代理 Codex 中的内联资产生成,以及 gpt-image-2 API[1]

架构是对 DALL-E 路线的彻底重新设计。OpenAI 拒绝确认它是否基于扩散模型、自回归或混合方式,仅表示它是全新架构,从两阶段推理管道转变为单次通过生成器。实际效果是更快的生成速度和提示词语义与渲染输出的耦合更紧密[1]

文字渲染突破

GPT Image 2 生成的编辑杂志封面,具有密集的排版层级和多个书写系统中的协调字形

具体的改进值得分别讨论,因为它们解锁了不同的工作流[1]

  • 拉丁字母拼写精度约 99%,包括密集菜单文本、包装标签、营养信息面板、长篇编辑标题和 UI 文案。
  • 非拉丁文字达到接近原生精度,覆盖世界主要语言。以前的模型把它们当装饰:视觉上似乎可信,但语义无义。
  • 稠密排版中的小文字和图标,包括表单字段、徽章标签和法律小字,都能清晰呈现。
  • 文字与设计语言之间的风格一致,所以一个布鲁克林咖啡馆的招牌和一张东京地铁海报读起来像不同设计师的作品,而非同一模型的通用输出。

GPT Image 2 生成的书店场景,每本书标题都用不同的印度字体系统渲染,显示为连贯可读的文本

书店案例值得仔细研究。每个标题都用不同的印度字体系统渲染,每一个都是那个语言的读者能识别的连贯文本[1]。正是这项能力打开了本地化内容管道的大门:区域广告创意、多语言包装、印度语电商缩略图,以前不可能做到这样的速度。

思考模式

在思考模式下从单个提示词生成的海报,其中模型浏览网络查找当前产品参考资料

思考模式是改变你与模型互动方式的功能。在标准提示下,它的作用和任何图像模型一样:读取提示词、生成像素。启用思考模式后,它还会[1]

浏览网络查找参考资料,当提示词提到真实的品牌、产品或时间敏感内容时。

在提交像素前规划多个输出变体,这就是为什么一个提示词能生成三个尺寸的广告活动或五格漫画。

返回前自我验证,检查渲染的文字拼写是否正确,排版层级是否保持完整。

OpenAI 的演示案例是一个单个提示词,要求为自己网站上的商品画海报,模型去网站查看并生成了准确的排版——无需上传参考,也无需手工产品清单[1]

对于包含"按照他们当前首页风格"这样的短语的文案,思考模式消除了手工收集参考资料的步骤。对于批量生成简单视觉,关闭思考模式,因为它成本更高、耗时更长。

商业级输出

从单个提示词完全合成生成的广告,包括产品摄影、品牌标记、日文副标题,和一个清晰可读的开场公告

上面这则广告是单次提示词生成的完全合成作品。它携带可信的产品摄影、两种文字系统中的连贯品牌标记、排版细节、一个包含地址和社交媒体句柄的清晰公告,以及摄影、文字、纹理和色调之间的风格一致性[1]

两年前这是生成式图像的经典失败案例。模型可以生成摄影,但任何真实文字在排版中都会变成乱码字形。

这意味着什么值得直言:对于大多数小企业营销,瓶颈不再是视觉制作。而是文案。

更深层的结构理解

OpenAI 的定位口号是"有观点的图像生成",意思是模型对它渲染的内容有结构性理解,而不只是语料覆盖的统计。实际上[1]

  • 指令跟随在排版请求中改进了:左对齐标题、右侧产品、右下品牌标记。
  • 世界知识更强。模型知道产品摄影应该看起来像用什么相机拍的,复古封面应该模仿什么纸张类型。
  • 角色一致性在多格序列中保持。
  • 标志性文化素养改进了,所以元素周期表、解剖图和建筑平面能正确渲染,而不是看似可信的乱码。

这是它最清楚地区别于纯摄影模型的轴线。在摄影写实的静物上,Nano Banana 2 有竞争力或领先。在需要模型了解某些内容并正确渲染的排版上,GPT Image 2 领先[1]

不适用的场景

坦诚的限制[1]

  • 不是身份关键品牌工作的设计师替代品。初稿质量很棒;创意总监仍需掌舵。
  • 不是光影逼真领域。Nano Banana 2 和专业摄影写实模型在超逼真静物和人像上仍有优势。
  • 思考模式更慢且更贵。批量生成简单视觉时禁用它。
  • 内容政策适用。真实公众人物、受版权保护的角色和某些商业参考受限。

如何在 reAPI 上使用 GPT Image 2

reAPI 在异步任务端点上暴露这个模型。提交返回 task_id;轮询直到完成。

curl https://reapi.ai/api/v1/images/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-image-2",
    "prompt": "京都咖啡馆开业编辑海报,米色衬线手写标题,温暖电影光线,底部清晰地址行",
    "size": "16:9",
    "resolution": "2k"
  }'

写集成前有三件事要知道。

分辨率是计费维度。网关暴露 1K、2K 和 4K,各有自己的费率,所以分辨率选择是成本选择。当前费率在 reapi.ai/models/gpt-image-2,这是权威来源而非文章中引用的任何数字。

媒体输入仅支持公网 URL。平台上任何模型都不接受 base64、data: 载荷。

提示词精度在这里比旧模型上收益更大。在 DALL-E 3 上工作的模糊视觉文案,相比这个模型处理的明确布局、排版和参考资料指令会表现不佳。天花板更高,地板要求更精确的输入[1]

完整的请求和响应形状见 reapi.ai/docs/gpt-image-2 参考。

FAQ

GPT Image 2 是什么?

OpenAI 于 2026 年 4 月 21 日发布的旗舰图像生成模型,替代了 DALL-E 3 和 GPT Image 1.5。它在 ChatGPT 中作为 Images 2.0、在 Codex 中,以及作为 gpt-image-2 API 推出[1]

GPT Image 2 文字渲染精度多高?

拉丁文字约 99%,日文、韩文、印地文、孟加拉文和阿拉伯文等主要非拉丁文字达到接近原生精度[1]

什么是思考模式?

一种模式,模型在其中浏览网络查找参考资料、在生成前规划多个变体,并在返回输出前自我验证渲染的文字和布局。它成本更高、耗时更长,所以批量简单生成时禁用它[1]

GPT Image 2 支持什么分辨率?

2K 原生分辨率支持 16:9,同时支持现有的纵横比[1]。在 reAPI 上,1K、2K 和 4K 作为单独定价选项暴露。

GPT Image 2 比 Nano Banana 2 更好吗?

他们在不同轴线上领先。Nano Banana 2 在纯摄影写实和 4K 输出上领先。GPT Image 2 在文字保真度、提示词贴切度和集成思考模式上领先[1]

DALL-E 3 怎么了?

它于 2026 年 5 月 12 日停用。GPT Image 2 替代了它和临时的 GPT Image 1.5[1]

reAPI 上的 GPT Image 2 接受 base64 图像输入吗?

不接受。平台上的每个模型对媒体输入只接受公网 http(s) URL。

我应该如何为 GPT Image 2 写提示词?

比 DALL-E 3 更具体。给出明确的布局、排版和参考指令而非模糊的视觉描述,因为模型现在对旧模型忽略的结构细节采取行动[1]

更新文案,不只是模型字符串

这次发布的有用总结是它移动了瓶颈。当生成文字不可用时,约束是模型。现在从单个提示词能生成带可读日文副标题的咖啡馆广告,约束是你能多精确地描述你想要的。

这对任何迁移管道的人有实际影响。为前一代模型写的提示模板是为忽视结构指令的模型优化的,在这个上面会不充分利用。用明确的布局和排版重新写它们,为引用真实世界的文案保留思考模式,为简单内容关闭它,并刻意选择分辨率因为它是计费维度。这就是如何使用 GPT Image 2 而不为你的文案从不要求的能力付费。

References

  1. OpenAI。GPT Image 2 — 模型卡、能力和 API 参考。 2026 年 7 月检索自 platform.openai.com/docs/models
  2. OpenAI。定价 — 按模型的每张图和每 token 费率。 2026 年 7 月检索自 platform.openai.com/docs/pricing

Further reading