Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
如何使用 GPT-5.5:代理能力与唯一弱点
2026/07/27

如何使用 GPT-5.5:代理能力与唯一弱点

GPT-5.5 使用指南:Terminal-Bench 领先、价格上升幅度为何偏小、86% 幻觉率无人提及、以及所需的验证环路。

OpenAI 于 2026 年 4 月 23 日发布了 GPT-5.5,称其为 GPT-4.5 以来首个完全重新训练的基础模型[1]。24 小时内,它登上了人工智能分析智能指数的榜首。

要想好好使用 GPT-5.5 需要面对一个在发布公告中没有出现的尴尬数字。在 AA-Omniscience 基准上,它在所有测试模型中准确率最高,达到 57%,但在错误的问题上幻觉率高达 86%[2]。Claude Opus 4.7 在同一指标上的幻觉率是 36%。当 GPT-5.5 出错时,它出错时充满信心。

这个事实决定了你应该如何部署它,本指南围绕它组织。

TL;DR

  • 端到端训练为代理,而非工具栏叠加的聊天模型。OpenAI 集中训练了代理编程、计算机使用、知识工作和早期科学研究[1]
  • Terminal-Bench 2.0 达到 82.7%,约领先 Claude Opus 4.7 和 Gemini 3.1 Pro 13 个百分点[1]
  • 价格上升幅度比看起来小。 列表从 $2.50/$15 上升到 $5/$30,但 Codex 任务上的输出令牌大约减少 40%,使实际任务成本上升幅度接近 20%[1]
  • 在 reAPI 运行 $4.00 / $24.00 每百万个令牌,为公布费率的 80%。
  • 幻觉特征是代价。 最高准确率,错误时信心也最高[2]
  • 编程打成平手。 SWE-bench Pro 为 Opus 4.7 所有,64.3% 对 58.6%[1]

什么是 GPT-5.5

GPT-5.5 首先是代理模型,其次是聊天模型。它以两个共享 1M 令牌上下文窗口和文本加视觉输入的变体发布[1]

  • GPT-5.5,具有推理努力级别 xhighhighmediumlow 和非推理。
  • GPT-5.5 Pro,计算量更大的变体,对长期任务施加更大压力。

领先之处

OpenAI 的 GPT-5.5 基准对比,针对 GPT-5.4、Claude Opus 4.7 和 Gemini 3.1 Pro,涵盖 Terminal-Bench、GDPval、OSWorld-Verified、BrowseComp、FrontierMath 和 CyberGym

基准GPT-5.5GPT-5.4Claude Opus 4.7Gemini 3.1 Pro
Terminal-Bench 2.082.7%75.1%69.4%68.5%
专家 SWE(内部)73.1%68.5%n/an/a
GDPval(赢或平)84.9%83.0%80.3%67.3%
OSWorld-Verified78.7%75.0%78.0%n/a
BrowseComp84.4%82.7%79.3%85.9%
FrontierMath 第 1-3 层51.7%47.6%43.8%36.9%
CyberGym81.8%79.0%73.1%n/a

三点值得标注[1]

Terminal-Bench 2.0 是明确的赢家。 它是完成真实工程任务端到端最接近的公开代理,没有手把手,13 个百分点的领先幅度在这个曲线末端是不寻常的。

GDPval 比看起来更重要。 它根据业界专业人士在 44 个职业中测试输出质量,赢得或打成平手 84.9% 的时间是实际商业宣传:知识工作与领域专家的平价。

SWE-bench Pro 是失败,社区对基准有异议。 GPT-5.5 得分 58.6%,对阵 Opus 4.7 的 64.3%,对这个特定测试的训练集记忆有开放问题。带有一些怀疑心对待 Opus 领先,但不要假设编程差距关闭了。

人工智能分析智能指数在发布后不久将 GPT-5.5 放在排名顶部

真正新的是什么

架构细节中真正重要的不在任何基准表中:GPT-5.5 被端到端训练为代理,对多步工具使用、屏幕阅读和验证有本地期望[1]

无监督多步工具调用。 OpenAI 演示了模型完成超过 1,000 个顺序工具调用而无需干预。那是 Terminal-Bench 和 OSWorld 数字的来处。

Tau-squared 板凳电信结果显示 GPT-5.5 在客户服务模拟中达到 98% 的多轮工具使用准确率

提交前自检。 模型在返回前验证自己的输出。CodeRabbit 报告预期的问题检测从 58.3% 跳到 79.2%,在他们的审查基准中,有更短的响应和对小的可工作改动更强的偏好[1]

Codex 中的计算机使用。 屏幕阅读通过 Codex 暴露,让模型看到任意桌面应用程序并与其交互。

幻觉问题

这是发布报道掩埋的部分,也是应该形成你部署的部分。

在 AA-Omniscience 上,GPT-5.5 在所有测试模型中获得最高准确率 57%,在错误的问题上幻觉率 86%。Claude Opus 4.7 为 36%,Gemini 3.1 Pro Preview 为 50%[2]

实际上:当 GPT-5.5 出错时,它不标志不确定性。对于模型在真实系统中采取真实行动的代理工作流,这是一个非平凡的失败模式。

最可能的解释是 OpenAI 优化了代理信心,训练模型采取行动而非推迟。这种交易对于工具繁重的工作流是合理的,对于纯问题回答是昂贵的。

两个缓解实际上有效:

提高推理努力。 对任何输出质量比延迟重要的情况使用 xhigh。更高的努力明显减少测试任务上的幻觉。

将其植入工具。 文件读取、测试运行、搜索结果。GPT-5.5 的强度是工具使用,所以使用工具来检查它。一个模型对文件验证的声明与它从内存生成的声明是不同类型的声明。

这也是 Opus 4.7 对生产仍然赢的地方。如果自信错误答案的成本很大,较低的幻觉率比基准上的五个百分点重要得多。

定价

模型每 1M 输入每 1M 输出
GPT-5.5$5$30
GPT-5.5 Pro$30$180
GPT-5.4(前一个)$2.50$15

天真的读法是 GPT-5.5 翻倍了价格。诚实的读法是它的令牌效率明显更高,在 Codex 任务上使用大约 40% 更少的输出令牌进行等价工作,这使实际任务成本上升更接近 20% 而不是 100%[1]。考虑更低的重试率,代理工作负载最终领先。

GPT-5.5 Pro 在 $30 / $180 是为了一个狭窄的情况:五到十个基准点证明六倍成本溢价的长期、高风险任务。这是实际流量的一小片。

在 reAPI,GPT-5.5 运行每百万令牌 $4.00 输入和 $24.00 输出,这是公布费率的 80%。

选择它前值得知道的一件事:在同一网关,GPT-5.6 Sol 成本完全相同 $4.00 / $24.00。GPT-5.6 在 7 月发布了 maxultra 推理模式和更高的 Terminal-Bench 分数。除非你的 evals 已经针对 GPT-5.5 行为校准,否则没有价格论证停留。

如何使用 GPT-5.5:它适配的地方和它不适配的地方

用于长期代理编码、Codex 中的计算机使用任务、浏览和综合研究工作流、数学推理和多职业知识工作,其中 84.9% GDPval 结果是可信号[1]

不用于任务的幻觉成本高且你无法用验证包装调用、纯编码工作负载其中 Opus 在 SWE-bench Pro 仍然领先或价格敏感的高量流量其中更便宜的模型在每令牌上欠它五到十倍。

在 reAPI 上调用 GPT-5.5

端点是 OpenAI 兼容的,所以模型字符串是唯一的变化。注意电线 id 保持点:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="gpt-5.5",
    messages=[{"role": "user", "content": "Read the failing test, find the bug, and patch it."}],
    max_tokens=16000,
    stream=True,
)

给予幻觉特征,集成细节最重要的是不是请求形。它是周围的线束是否给模型某些东西来检查自己对抗。费率在 reapi.ai/models/gpt-5-5,并切换到 gpt-5.6-solgpt-5.6-terra 是同一密钥上的一个字符串改动。

FAQ

GPT-5.5 值得超过 GPT-5.4 的价格增加吗?

对于代理和知识工作任务,是。每任务成本大约 20% 更高而不是 100%,由于令牌效率收益,质量跳跃是真的。对于简单聊天或低风险生成,旧模型是更好的价值[1]

GPT-5.5 与编码的 Claude Opus 4.7 比较如何?

Opus 4.7 领先 SWE-bench Pro 大约六个百分点,幻觉明显更低。GPT-5.5 领先 Terminal-Bench、代理工具使用和长期任务。对于代码审查和重构,Opus 更安全。对于代理循环与工具,GPT-5.5 赢[1]

为什么 GPT-5.5 幻觉比 Opus 4.7 更多?

最可能的解释是代理信心优化:模型被训练采取行动而非推迟。用 xhigh 推理加工具植入验证来缓解[2]

GPT-5.5 能可靠处理 1M 令牌吗?

是的用于检索。对于在完整窗口上的复杂推理,期望在大约 200K 之外降级,如其他 1M 上下文模型。对高风险长上下文工作进行分块或使用检索。

我应该使用 GPT-5.5 还是 GPT-5.6?

在 reAPI 上它们成本相同,GPT-5.6 添加了 maxultra 推理模式和更高的 Terminal-Bench 分数。仅当你的 evals 已经针对其行为校准时停留在 GPT-5.5。

GPT-5.5 生成图像吗?

不。它只是文本和视觉输入。OpenAI 堆栈中的图像生成是 GPT Image 2

GPT-5.5 Pro 是什么用?

长期、高风险任务,其中五到十个百分点基准获得证明在 $30 / $180 每百万令牌的六倍成本溢价[1]

我如何设置推理努力?

通过推理努力参数,具有级别 xhighhighmediumlow 和非推理。当正确性比延迟更重要时提高它[1]

小心部署一个自信模型

这个发布的标题指标,索引领先,是关于它最不有用的东西。真实的故事是从头训练为代理的模型,其主导基准都映射到多步、工具使用、真实世界任务完成。这是一个不同的重心中心,从一个高风险单步工作的精密仪器。

部署规则直接遵循幻觉数。给它工具并让它检查自己,当正确性胜过延迟时提高推理努力,永不让一个自信措辞的答案到达用户或生产系统没有模型可以被检查对抗的东西。这是如何很好使用 GPT-5.5:不是作为预言家,而是一个非常有能力的代理需要围绕它的验证环路。

References

  1. OpenAI. Models — GPT-5.5 specifications, benchmarks, and reasoning-effort levels. Retrieved July 2026 from platform.openai.com/docs/models
  2. Artificial Analysis. Intelligence Index and AA-Omniscience hallucination measurements. Retrieved July 2026 from artificialanalysis.ai/models
  3. OpenAI. Pricing — per-token rates by model and tier. Retrieved July 2026 from platform.openai.com/docs/pricing

Further reading