Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
如何使用 Claude Opus 5:基准、推理档位与成本
2026/07/27

如何使用 Claude Opus 5:基准、推理档位与成本

Claude Opus 5 的完整官方基准对照表、决定账单的推理档位梯队、两处 API 破坏性变更,以及具体迁移步骤和注意事项。

Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5,称之为相比 Claude Opus 4.8 的关键性改进[6]。价格与它的前任完全一致:每百万输入 token 5 美元,输出 25 美元[3]。因此,如何妥善使用 Claude Opus 5 这个问题与公开价格几乎没有关系,因为价格没变,一切都取决于一个拨杆,大多数团队从未触碰过。

这个拨杆就是推理档位。Anthropic 没有发布每个基准一个数字,而是在全部五个推理档位上发布了分数对成本的曲线[1]。这些曲线中最便宜和最贵级别之间的差异,比任何提示词重写都能恢复的要大,官方建议是根据自己的评估来扫过这个梯队,而不是把所有东西都调高[2]

TL;DR

  • 同样的公开价格,不同的模型。 每百万 token $5 / $25,与 Opus 4.8 相同[2]。在 reAPI 上同一模型运行 $2.40 / $12.00,是 Anthropic 公开价格的 48%。
  • 思考现在默认开启。 在 Opus 4.8 上,省略 thinking 字段意味着不思考。在 Opus 5 上同样的请求会思考[2]。由于 max_tokens 限制思考加响应文本的总和,迁移过来的紧张预算会被截断。
  • 关闭思考被限制在档位 high 及以下。 发送 thinking: {"type": "disabled"} 配合 xhighmax 会返回 400,每请求检查一次[2]
  • Opus 5 不是样样都赢。 Anthropic 自己的表中,在 DeepSWE v1.1 的智能代码方面输给了 GPT-5.6 Sol,68.8% 对 72.7%[1]
  • 不要继承推理档位设置。 Anthropic 说 lowmedium 现在以很少的 token 和延迟生成强劲质量,告诉你从默认 high 开始,根据自己的评估在两个方向移动[2]
  • 优先级层级不包括 Opus 5,它在自己的速率限制桶中,而不是共享的 Opus 池[5][4]

Claude Opus 5 是什么

Anthropic 将 Claude Opus 5 定位于复杂的智能代码工作和企业应用[2]。API 标识符是 claude-opus-5,不需要附加日期后缀。

特性Claude Opus 5
API 模型 IDclaude-opus-5
上下文窗口100 万 token,既是默认值又是最大值
最大输出128k token
公开价格每百万输入/输出 token $5/$25
快速模式$10/$50,仅限 Claude API
思考默认开启,自适应
推理档位lowmediumhighxhighmax,默认 high
提示缓存最小值512 token,低于之前的 1024

没有更小的上下文变体[2]。100 万 token 窗口就是你得到的。除了 Claude API,该模型还在 Amazon Bedrock 上作为 anthropic.claude-opus-5 可用,在 Google Cloud 上作为 claude-opus-5,以及在 Microsoft Foundry[2]。快速模式是例外:仅在 Claude API 上运行,不在三个云平台上[2]

完整官方基准对照表

Anthropic 发布的 Claude Opus 5 基准表,对比 Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol 在智能终端代码、知识工作、新问题求解、智能搜索、推理、计算机使用、智能代码、业务工作流、法律、医疗和生物学评估中的表现

这是 Anthropic 发布的对比,完整转录,包括 Opus 5 没有赢的行[1]。Fable 5 列中带有不同型号名称的地方,那是 Anthropic 自己的注解。

基准Opus 5Fable 5Opus 4.8GPT-5.6 Sol
智能终端代码 (Frontier-Bench v0.1)43.3%33.7%21.1%34.4%
知识工作 (GDPval-AA v2, Elo)1861174715931736
新问题求解 (ARC-AGI-3)30.2%1.5%7.8%
智能搜索 (BrowseComp)90.8%87.4%84.3%90.4%
多学科推理 (HLE, 无工具)56.3%56.5%49.8%
多学科推理 (HLE, 有工具)64.7%63.9%57.9%
计算机使用 (OSWorld 2.0)70.6%66.1%55.7%62.6%
智能代码 (DeepSWE v1.1)68.8%69.7%59.0%72.7%
智能代码 (FrontierCode v1.1, Main)53.4%53.5%46.5%47.5%
业务工作流 (AutomationBench)26.0%17.4%17.0%18.1%
法律 (Legal Agent Benchmark, held-out)11.7%13.3%10.4%2.5%
医疗 (HealthBench Professional)59.8%66.0% (Mythos 5)57.4%60.5%
生物学 (BioMysteryBench, 困难)49.4%46.5%42.4%
生物学 (BioMysteryBench, 人类解决)90.1%89.0% (Mythos 5)88.5%

发布这些数字之前的一条方法说明。在 Frontier-Bench 按推理档位分解的配套图表中,Anthropic 声称这些结果来自在 GKE 后端上的内部 mini-SWE-agent harness 运行,在五次尝试上平均奖励,并且当安全分类器拒绝来自 Opus 5 或 Fable 5 的请求时,Opus 4.8 充当了降级模型[1]。这些是厂商运行的评估。把它们当作方向信号来读,不是中立审计。

它在哪里赢,在哪里输

Opus 5 拿下了十四行中的九行。赢的地方的差异并不微妙。Frontier-Bench 从 Opus 4.8 的 21.1% 升到 43.3%,稍超过一倍。ARC-AGI-3 从 1.5% 升到 30.2%,该行最接近的竞争对手是 GPT-5.6 Sol 的 7.8%。AutomationBench 坐在 26.0% 对着 17% 到 18% 的集群[1]

它失去了另外五个,而这些对于选择模型比赢更有用。

  • DeepSWE v1.1,智能代码:68.8% 对 GPT-5.6 Sol 的 72.7%。这是棋盘上最清晰的失败,它落在 Opus 5 被营销的工作负载上。Anthropic 留下了这一行。
  • HealthBench Professional:59.8%,在 Mythos 5 的 66.0% 和 GPT-5.6 Sol 的 60.5% 后面。
  • Legal Agent Benchmark:11.7% 对 Fable 5 的 13.3%。两个数字都足够低,以至于基准主要在测量到目标的距离。
  • HLE 无工具(56.3% 对 56.5%)和 FrontierCode Main(53.4% 对 53.5%)是噪声内的平局,但它们排除了 Opus 5 在整个棋盘上支配 Fable 5 的声称。

模式:Opus 5 在任务长期运行、使用工具、需要跨多个步骤维持状态的地方赢。它在单次硬问题上平手或输。

推理档位决定你的账单

Anthropic 发布完整的分数对成本梯队,而不是每个基准一个数字,读它改变了你如何配置模型[1]

Frontier-Bench v0.1 上的智能代码分数对每次尝试的成本,在对数成本标度上绘制 Claude Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol 的推理档位梯队

三件事遵循从它。

顶级不是推荐的起点。 Anthropic 的指令是从默认 high 开始,根据你的评估在两个方向调整:在质量保持的地方下降以节省 token 和延迟,对最苛刻的工作上升[2]。注意那个句子从哪里开始。推荐的入场点是梯队的中间,而不是顶端,推理档位现在承载更多权重,因为 Opus 5 更可靠地将额外推理转换为更好的结果,比任何早期 Opus 模型[2]

低档和中档比之前更强。 Anthropic 明确点出了低档位的效率,说 lowmedium 以高档位设置的一小部分 token 和延迟生成强质量[2]。从 Opus 4.8 继承的推理档位默认值是错误的起点。

推理档位是成本杠杆,不是提示词。 官方指导是从默认 high 开始,然后根据你的评估在两个方向移动:在质量保持的地方下降以节省 token 和延迟,对最苛刻的工作上升[2]。在 xhighmax 上,设置一个大的 max_tokens 使得模型在子智能体和工具调用间有思考和行动的空间[2]

潜在的两处 API 破坏性变更

请求表面大多从 Opus 4.8 继承。采样参数仍然被拒绝,固定思考预算仍然被拒绝,最后助手转身前缀填充仍然失败。两样东西确实变了,都破坏了未修改的代码。

思考在你省略参数时运行。 在 Opus 4.8 上,没有 thinking 字段的请求运行时不思考。在 Opus 5 上,同样的请求思考,模型在每个转身上决定何时以及多少[2]。协议值没变;thinking: {"type": "adaptive"} 仍然有效且等同于默认值。改变的是当你什么都不说时会发生什么。因为 max_tokens 是思考加响应文本的硬限制,Anthropic 告诉你为任何之前运行时不思考的工作量重新访问它[2]。仅为可见输出调整的预算现在会在答案中间截断。

关闭思考需要档位 high 或以下。 thinking: {"type": "disabled"} 配对 xhighmax 返回 400。检查在每个请求上运行,所以成功于 high 的会话在之后的调用把推理档位提高时失败开始,同时思考仍然关闭[2]

Anthropic 也记录了思考关闭时的错误:模型可能会在其文本输出中写入工具调用,而不是发出 tool_use 块,或向可见响应中泄露内部 XML 标签[2]。第一个失败模式在智能体循环中是危险的,因为转身干净结束,调用永远不执行。官方建议是保持思考开启,而是用更低档位控制成本。

三个新增项值得知道:

  • 转身中工具变更(beta 头 mid-conversation-tool-changes-2026-07-01)让你在转身之间添加或移除工具,同时保留提示缓存,而不是为会话生命周期固定工具列表[2]
  • 一个 "default" 降级模式(beta 头 server-side-fallback-2026-07-01)应用 Anthropic 推荐的按拒绝类别降级模型,而不是你维护的列表[2]
  • 提示缓存最小值从 1024 token 降到 512,所以之前太短不能缓存的提示现在创建缓存条目,无代码变更[2]

真正影响账单的东西

这是完整官方费率表[3]

项目每百万 token 价格
输入$5
输出$25
缓存命中和刷新$0.50
缓存写入(5 分钟)$6.25
缓存写入(1 小时)$10
批处理输入$2.50
批处理输出$12.50
快速模式输入$10
快速模式输出$50

批处理 API 在两个维度上运行标准费率的一半,快速模式翻倍两者[3]。Anthropic 描述 Opus 5 以半 Claude Fable 5 的成本提供前沿智能[2],这与费率表相符:Fable 5 列在 $10/$50[3]

三个杠杆比每 token 费率更重要。

推理档位。 梯队上发布的每次尝试成本差异宽到足以使得一个路由从 xhigh 降到 medium 比任何提示词重写节省更多[1]

冗长性。 Anthropic 声称默认响应和书面可交付物在 Opus 5 上运行更长[2]。思考 token 计为输出,额外的散文也计。降低档位减少思考但不可靠地缩短可见输出,所以写一个明确的简洁指令。

验证支架你现在可以删除。 Opus 5 验证自己的工作而不被告知去做,Anthropic 说从早期模型继承的指令,比如"包括最终验证步骤"或"使用子智能体来验证",导致过度验证[2]。删除它们降低 token 花费,无质量权衡,这是罕见的优化。

速率限制和优先级层级

两个操作事实在推出期间抓住团队。

优先级层级不覆盖 Claude Opus 5。Anthropic 的服务层级文档声称优先级层级在所有可用 Claude 模型上支持,除了 Claude Mythos 5、Claude Mythos Preview、Claude Opus 5 和 Claude Sonnet 5[5]。如果你的容量规划假定了优先级层级覆盖,它不在这里应用。

Opus 5 也有它自己的速率限制桶。组合 Opus 限制适用于跨越 Opus 4.8、4.7、4.6 和 4.5 的流量;Opus 5 不是那个池的一部分[4]。这在迁移期间是好消息,因为 Opus 5 流量不吃你现存 Opus 4.8 路由依赖的预算。快速模式再次有专用限制,与标准 Opus 限制分开,返回 429 带 retry-after 头当超过[4]

如何使用 Claude Opus 5:迁移清单

Anthropic 的迁移指导减少到模型字符串更改加两个行为变更的审核[2]。在实践中列表稍长一点。

  1. 改变模型字符串为 claude-opus-5
  2. 审计每个关闭思考的路由。要么保持思考关闭并把档位降到 high 或以下,要么保持档位级别并移除 thinking 字段。
  3. 在从未设置 thinking 字段的路由上提高 max_tokens。它们现在思考,预算涵盖两者。
  4. 根据你的评估重新运行档位扫描。从默认 high 开始,根据你的评估在两个方向移动,而不是继承 Opus 4.8 设置。
  5. 从提示词和验证步骤中从 harness 删除验证指令。
  6. 给面向用户的路由添加显式简洁指令。
  7. 重新检查你之前写掉为不可缓存的短提示,对照新的 512 token 最小值。
  8. 将拒绝处理为响应,不是错误。安全分类器可以拒绝请求并返回停止原因,而不是 HTTP 错误,所以无条件读取第一个内容块的代码会破坏。

在你的其他模型旁调用 Claude Opus 5

上面所有内容都指向同一个操作问题。这个模型有五个推理档位,自己的速率限制桶,无优先级层级,以及一个基准表,其中它在智能代码上输给 GPT-5.6 Sol,在医疗上输给 Mythos 5。正确的配置不是一个设置。这是每个工作负载的路由决定,每次一个厂商发货时改变。

值得花力气建立的层级。代码审查通和批处理提取工作在同一推理档位没有业务,一个 Opus 5 失去的路由在同一个习惯上呆的没有业务。用一个 SDK 客户每个厂商、一个 key 每个厂商和一个计费表面每个厂商处理那个,这是多模型工作的实际成本积累的地方。

reAPI 通过 OpenAI 兼容 /v1/chat/completions endpoint 暴露 Claude Opus 5,所以你已经为 GPT 和 Gemini 调用的同一客户也调用它:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

网关上的费率是每百万输入 token $2.40,输出 $12.00,是 Anthropic 公开 $5/$25 的 48%。完整请求表面,包括 output_config.effort 和上面的思考规则,在 reapi.ai/docs/claude-opus-5 页面上文档化,当前费率在 reapi.ai/models/claude-opus-5 上。

这都不移除路由决定。它移除了做一个的集成税。

FAQ

Claude Opus 5 比 Claude Fable 5 更好吗?

在 Anthropic 发布表的十四行中的九行上,是的,而且以 Fable 5 公开价格的一半[3]。但 Fable 5 仍然拿 HLE 无工具、FrontierCode Main 和 Legal Agent Benchmark,HealthBench Professional 行去 Mythos 5[1]

Claude Opus 5 比 Opus 4.8 成本更高吗?

不。两者都列在每百万输入 token $5 和输出 $25[3]。Anthropic 在没有价格变更的情况下发货了能力跳跃[2]

从 Opus 4.8 最大的破坏性变更是什么?

思考现在默认开启。在 Opus 4.8 上省略 thinking 字段的请求运行不思考,在 Opus 5 上思考,这改变成本和 max_tokens 行为两者。第二是 thinking: {"type": "disabled"} 现在返回 400 于档位 xhighmax[2]

我应该使用哪个推理档位?

从默认 high 开始,然后根据你的评估在两个方向扫[2]。Anthropic 把 max 作为最深可能推理的顶层框架化,而不是一个更好的默认,并分开注意 lowmedium 在这个模型上以一小部分 token 和延迟维持[2]

Claude Opus 5 上下文窗口是什么?

100 万 token,既是默认值又是最大值。没有更小的上下文变体。最大输出是 128k token[2]

Claude Opus 5 被优先级层级覆盖吗?

不。优先级层级覆盖所有可用 Claude 模型除了 Mythos 5、Mythos Preview、Opus 5 和 Sonnet 5[5]。Opus 5 也坐在它自己的速率限制桶中,而不是组合 Opus 4.x 池[4]

我仍然可以关闭思考吗?

是的,于档位 high 或以下。Anthropic 建议反对它,记录模型可能将工具调用写入可见文本或泄露内部标签当思考被禁用,建议低档位代替[2]

我如何用 OpenAI SDK 调用 Claude Opus 5?

指向 OpenAI 客户于 https://api.reapi.ai/v1,设置 modelclaude-opus-5,并发送一个正常聊天请求。endpoint 是 OpenAI 兼容的,所以没有 SDK 重写是必要的。

选择推理档位并继续前进

这个版本有趣的事是价格页是它最不具参考价值的部分。公开价格没动,所以全部增量是在行为中:默认思考开启、之前不存在的 400、缓存地板减半,以及一个推荐入场点是梯队中间级别而不是顶部级别的推理档位梯队。Anthropic 也发布了五个基准行,其中它的新旗舰失去,这值得超过九个它赢的。

如果你迁移,工作是小的和具体的。改变模型字符串,审计禁用思考的路由,在思考现在隐含的地方提高 max_tokens,为一个较老模型删除你写的验证指令,扫档位根据你的评估而不是继承设置。那是如何使用 Claude Opus 5 而不为梯队停止攀登的顶级级别支付。

References

  1. Anthropic. Introducing Claude Opus 5 — benchmark comparison table and effort-level cost curves. Retrieved July 2026 from anthropic.com/news/claude-opus-5
  2. Anthropic. What's new in Claude Opus 5 — behavior changes, new features, availability, and migration. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  3. Anthropic. Pricing — token, cache, batch, and fast-mode rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Rate limits — per-model buckets and fast-mode limits. Retrieved July 2026 from platform.claude.com/docs/en/api/rate-limits
  5. Anthropic. Service tiers — Priority Tier model coverage. Retrieved July 2026 from platform.claude.com/docs/en/api/service-tiers
  6. Anthropic. Release notes — Claude Opus 5 launch entry dated July 24, 2026. Retrieved July 2026 from platform.claude.com/docs/en/release-notes/overview

Further reading