
GPT-5.6 使用指南:Sol、Terra 和 Luna 三档对比
Sol、Terra、Luna 三档定价与性能、Terminal-Bench 基准、max/ultra 推理模式、选档指南。
OpenAI 从 2026 年 6 月 26 日开始有限预览 GPT-5.6,这次发布最奇特的地方是几乎没有人能使用它。大约二十个经过审核的合作方通过 API 和 Codex 获得了访问权限,OpenAI 称美国政府要求了这个分阶段推出方案[1]。
这个限制随后被解除了。如今了解怎样使用 GPT-5.6 是一个实际问题,而不再是等待游戏,答案主要关乎选择三个档位中的一个:Sol 旗舰档、Terra 平衡档工作马,以及 Luna 经济档。每一档都是一个持久的能力等级,而非临时变种。
本指南覆盖三档设计、OpenAI 选择主要展示的唯一基准及其四个注脚的含义、新增的 max 和 ultra 推理模式、让 Terra 成为故事主角的定价,以及塑造这次推出的网络安全审查。
TL;DR
- 三个持久档位。 Sol(旗舰档)、Terra(平衡档,成本约为 GPT-5.5 的一半)、Luna(快速且低成本)[1]。
- Sol 在 Terminal-Bench 2.1 榜单领先 单智能体模式下为 88.8%,
ultra模式下为 91.9%。相对 Claude Mythos 5 的单智能体领先幅度为 0.8 个百分点,这个差距在噪声范围内[1]。 ultra不是单个智能体。 它协调多个子智能体并行运行,所以其分数不能直接与单智能体基线比较[1]。- Terra 是商业意义所在。 GPT-5.5 级别的编码能力,价格仅为一半[1]。
- 在 reAPI 上三个档位都运行在 OpenAI 公布价格的 80%:Sol $4.00 / $24.00,Terra $2.00 / $12.00,Luna $0.80 / $4.80(每百万 token)。
- 评估窗口被意图缩小。 OpenAI 仅发布了编码、生物学和网络安全评估,保留了 SWE-bench、GDPval、数学和幻觉数字[1]。
GPT-5.6 是什么
GPT-5.6 继承于 GPT-5.5,这是 2026 年 4 月发布的完全重训练的智能体模型。GPT-5.5 是一个具有推理努力等级的单一模型,而 GPT-5.6 是一个在同一代码号下的三档系列。OpenAI 的表述明确:代码号标识一代,而 Sol、Terra 和 Luna 标识可以独立演进的持久能力档位[1]。
这句话是这次发布中最重要的设计决策。它将"有多聪明"与"有多新"解耦了。未来的某代可能会发布新的 Luna 而不碰 Sol,Sol 升级也不会强制 Terra 上的所有人重新测试他们的管道。
| 档位 | 定位 |
|---|---|
| GPT-5.6 Sol | 旗舰档,也是唯一暴露新 max 和 ultra 推理模式的档位。网络安全和长程智能体模型 |
| GPT-5.6 Terra | 平衡工作马。与 GPT-5.5 竞争,但成本约为一半。大多数生产工作负载应在此档 |
| GPT-5.6 Luna | 快速且经济,针对高容量例行任务 |
多个第三方报告称 Sol 的上下文窗口约为 150 万 token,比 GPT-5.5 代大约 43% 更大,不过 OpenAI 的预览文章着重于安全性和评估而不是规格清单[1]。把这个数字当作已报告的而不是正式确认的。
Terminal-Bench 2.1 及其四个注脚
OpenAI 在预览中仅发布了三个基准领域的结果——编码、生物学和网络安全,明确保留了其余的供正式发布[1]。它想让你记住的是 Terminal-Bench 2.1,这个基准测试的是需要规划、迭代和工具协调的命令行智能体工作流。

| 模型 | Terminal-Bench 2.1 |
|---|---|
GPT-5.6 Sol (ultra 模式) | 91.9% |
| GPT-5.6 Sol | 88.8% |
| Claude Mythos 5 | 88.0% |
| GPT-5.6 Terra | 84.3% |
| Claude Fable 5 | 84.3% |
| GPT-5.5 | 83.4% |
| GPT-5.6 Luna | 82.5% |
| Claude Opus 4.8 | 78.9% |
| Gemini 3.1 Pro Preview | 70.7% |
仔细看这个表格,它在四个方面比"新的最先进"的标题更诚实[1]。
91.9% 的记录使用 ultra,这不是单个智能体。 它来自 Sol 编排子智能体。与单智能体基线比较它不是苹果比苹果。公平的比较是 Sol 的 88.8%。
单智能体 Sol 超越 Claude Mythos 5 仅 0.8 个百分点。 同一模型的两次运行可能不同超过这个值。OpenAI 在编码曲线顶端确实有实际领先,但在这个基准上它很窄,不是爆炸性突破。
Terra 与 Claude Fable 5 打成平手,略胜 GPT-5.5。 84.3% 与 Fable 5 完全相同,仅比它替代的模型高不到一个百分点。结合价格下降,这是真正的商业故事:同样的编码能力却以一半的价格,而不是中端档的能力飞跃。
Gemini 3.1 Pro Preview 落后约 21 个百分点。 这个差距是真实的但特定于基准。Gemini 在这里没有展示的长文本检索和多模态工作上领先。
在生物学方面,OpenAI 报告 Sol 在 GeneBench v1 上实现了比 GPT-5.5 更强的结果同时使用更少 token,但没有发布原始数字,所以那是定向声明而不是可验证的分数[1]。
max 和 ultra
最重要的补充不在任何基准单元中。GPT-5.6 引入了两个推理设置,两者都只限于 Sol[1]。

max 是熟悉的杠杆再上一档:单个智能体被给予最充足的时间在一个难题上深度推理。
ultra 是真正新的原语。它通过生成将复杂工作分割成平行片段然后重新组合结果的子智能体超越了单个智能体。这是 OpenAI 把开发者过去一年用框架手工滚动的多智能体编排产品化到单一模型端点内的方式。
实际含义是真实的:对于多文件重构或端到端审计,你不再需要自己构建编排层。代价是成本和延迟,因为子智能体意味着更多的总 token 和更多的实际时间。只在高风险任务上预留 ultra,在那里几个百分点值得花费。
它也意味着基准比较需要谨慎。由无声生成子智能体的智能体产生的分数是与单一前向传播不同的结果。
定价

| 档位 | OpenAI 标价(每百万输入/输出) | reAPI 上价格(每百万输入/输出) |
|---|---|---|
| GPT-5.6 Sol | $5 / $30 | $4.00 / $24.00 |
| GPT-5.6 Terra | $2.50 / $15 | $2.00 / $12.00 |
| GPT-5.6 Luna | $1 / $6 | $0.80 / $4.80 |
两个东西在 OpenAI 自己的数字中脱颖而出。Sol 保持了 GPT-5.5 的精确 $5 / $30 定价同时添加能力和新模式,这是更多却钱相同的罕见情况。而 Terra 以大约一半的价格提供 GPT-5.5 级编码,这是大多数团队真正会感受到的改变[1]。把 Sol 的 token 效率增益叠加上去,因为它用更少的输出 token 达到可比结果,每个任务的有效成本下降比标题费率暗示的要大。
每个档位在 reAPI 上运行在列价的 80%,所以档位间的相对经济学没有改变。Terra 仍是默认,Luna 仍是容量游戏。
GPT-5.6 也彻底改革了 prompt 缓存,添加了显式缓存断点和最少 30 分钟的缓存生命周期。缓存写入按未缓存输入费率的 1.25 倍计费,而缓存读取保持 90% 折扣[1]。对于在每一步重新发送大系统 prompt 的智能体,可预测的缓存可以主导账单。
塑造这次推出的审查
即便现在访问已开放,理解这部分仍值得关注,因为它是先例而不是脚注。
OpenAI 限制初始发布到大约二十个经过审核的合作方,其中美国政府要求在事先预览模型能力[1]。触发器是网络安全能力。Sol 显著推进了漏洞研究,在涉及 Chromium 和 Firefox 的评估中,它识别了 bug 和利用原语,即漏洞的构建块,而没有在测试条件下自主生产功能完整的全链利用。OpenAI 声称 Sol 不超越其备战框架中的网络关键阈值,这个区分是发布它的全部基础[1]。
值得注意的是,OpenAI 没有将这个安排背书为永久,说这类政府访问流程不应变成长期默认,因为它阻止了最好的工具到达需要它们的防守者[1]。
随它一起发布的安全栈值得了解,因为它预示了高能力模型将如何普遍推出:训练内置的拒绝、可以暂停生成供更大模型审查的实时网络和生物学分类器、账户级审查标记活动,以及对最敏感能力的区分访问。OpenAI 为通用越狱的自动红队投入了超过 700,000 个等效 A100 GPU 小时[1]。
OpenAI 坦言这些保障会误触:合法的安全研究者可能在双用途请求上触发拒绝。
案例强强弱弱的地方
强。 智能体命令行编码,这里单智能体 Sol 在基准上领先而 ultra 扩展了它。Token 效率,这对高容量智能体复合。中端价值,这里 Terra 的价格下降是这次发布最广泛有用的改变。以及原生多智能体编排,这消除了开发者过去必须手工构建的一层[1]。
弱。 标题是一个基准上 0.8 点的胜利。评估窗口意图小,没有 SWE-bench、GDPval、数学或幻觉数字发布,所以 GPT-5.6 是否修复了困扰 GPT-5.5 的自信幻觉问题仍未知。而一切都是 OpenAI 在其自身工具下的供应商报告[1]。
直到扩展套件和独立评分登陆,对一般能力的判断应保持保留。
如何使用 GPT-5.6:选择哪个档位
大多数生产工作负载用 Terra。 它匹配 GPT-5.5 级能力而成本大约为一半,基准显示其编码与 Claude Fable 5 平手。
长程编码、安全工作以及任何证明 ultra 合理的东西用 Sol。 子智能体编排在几个百分点改变结果的任务上值得真实的金钱,在例行调用上一文不值。
高容量、延迟敏感、例行流量用 Luna。 在 Terminal-Bench 上 82.5% 不远低于 GPT-5.5 的 83.4%,成本仅为一小部分。
在 reAPI 上调用 GPT-5.6
所有三个档位都在一个 OpenAI 兼容的 /v1/chat/completions 端点后,所以切换档位是一个模型字符串改变而不是集成。注意 wire id 保持 OpenAI 的点:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="gpt-5.6-terra",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)用 gpt-5.6-sol 或 gpt-5.6-luna 替换 gpt-5.6-terra 来切换档位。因为同一个 key 和 client 也到达 Claude 和 Gemini,档位决策和供应商决策变成同种决策,这是当一个基准表格有你的默认模型失去一行并赢另一行时的要点。
当前费率在 reapi.ai/models/gpt-5-6-sol、reapi.ai/models/gpt-5-6-terra 和 reapi.ai/models/gpt-5-6-luna。
FAQ
max 和 ultra 模式之间有什么区别?
max 是单个智能体在一个问题上更长更深的推理。ultra 协调多个子智能体,将复杂工作平行分割并重新组合。两者都只限于 Sol,ultra 产生了 91.9% Terminal-Bench 标题[1]。
GPT-5.6 Sol 在编码上比 Claude 更好吗?
在 Terminal-Bench 2.1 上,单智能体 Sol 在 88.8% 超越 Claude Mythos 5 在 88.0% 仅 0.8 点,这是一个实际但窄的领先。用 ultra Sol 到达 91.9%,但那使用子智能体而不是像对像的单智能体比较[1]。
我应该使用哪个 GPT-5.6 档位?
大多数生产工作负载用 Terra,因为它匹配 GPT-5.5 级能力而成本大约为一半。Sol 用于长程编码、安全工作或证明 ultra 合理的任务。Luna 用于高容量例行调用[1]。
为什么美国政府涉及这次发布?
Sol 显著推进了网络安全能力,包括漏洞研究,而没有超越 OpenAI 的网络关键阈值。美国政府要求 OpenAI 对约二十个经过审核的合作方进行分阶段预览,而网络框架被开发[1]。
GPT-5.6 是否修复了 GPT-5.5 的幻觉问题?
未知。OpenAI 在预览中仅发布了编码、生物学和网络安全评估而保留了幻觉和知识工作数字[1]。将模型与源地基验证配对以获得高风险输出。
GPT-5.6 Sol 的上下文窗口有多大?
第三方报告称其约为 150 万 token,大约比 GPT-5.5 代大 43%,但 OpenAI 的预览文章未确认规格清单[1]。
Prompt 缓存中改变了什么?
显式缓存断点和 30 分钟最少缓存生命周期。缓存写入按未缓存输入费率的 1.25 倍计费;缓存读取保持 90% 折扣[1]。
我如何用 OpenAI SDK 调用 GPT-5.6?
指向客户端到 https://api.reapi.ai/v1 并设置 model 为 gpt-5.6-sol、gpt-5.6-terra 或 gpt-5.6-luna,保持 id 中的点。
阅读三档发布
GPT-5.6 是两个发布穿一个声明。一个是普通、执行良好的家族更新:明智的命名重置、一个不失能力却成本减半的中端档、以及一个将多智能体编排烘焙进端点的 ultra 模式。另一个是前沿模型,其初始可用性是与政府协调设置、在 700,000-GPU 小时安全栈后发布的。
对于任何真正构建的人,有用的总结小于任一故事。顶端的基准领先是一个基准上 0.8 点且供应商报告。你会感受到的改变是 Terra 的价格。那是如何理性使用 GPT-5.6:默认中端档,保留 Sol 给为 ultra 付费的任务,并在扩展评估套件告诉你幻觉问题是否已移动前保持源地基验证。
参考资源
- OpenAI. Models — the GPT-5.6 family, reasoning modes, and specifications. Retrieved July 2026 from platform.openai.com/docs/models
- OpenAI. Pricing — per-token rates by model and tier. Retrieved July 2026 from platform.openai.com/docs/pricing
延伸阅读
- reAPI. How to use Claude Opus 5. reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. How to use Claude Fable 5. reapi.ai/blog/how-to-use-claude-fable-5
- reAPI. Model catalog. reapi.ai/models
作者

分类
max 和 ultra定价塑造这次推出的审查案例强强弱弱的地方如何使用 GPT-5.6:选择哪个档位在 reAPI 上调用 GPT-5.6FAQmax 和 ultra 模式之间有什么区别?GPT-5.6 Sol 在编码上比 Claude 更好吗?我应该使用哪个 GPT-5.6 档位?为什么美国政府涉及这次发布?GPT-5.6 是否修复了 GPT-5.5 的幻觉问题?GPT-5.6 Sol 的上下文窗口有多大?Prompt 缓存中改变了什么?我如何用 OpenAI SDK 调用 GPT-5.6?阅读三档发布参考资源延伸阅读更多文章

GPT-6 Astra 上下文窗口:为什么 Codex 可能显示 258K
理解 GPT-6 Astra 的 1.05M API 上下文窗口、为什么 Codex 会显示更小的预算、如何测量压缩而无需猜测。


2026 年最佳 CometAPI 替代方案:5 个选择对比
正在寻找 2026 年的 CometAPI 替代方案?从模型、价格、速度和 API 设计对比 OpenRouter、WaveSpeed、Together AI、Replicate 与 reAPI。


Atlas Cloud 对比 Higgsfield:选 API 还是创意工作室?
对比 Atlas Cloud、Higgsfield 和 reAPI 的 Seedance API:接入方式、工作流、定价、模型广度,助力团队选择合适方案。
