Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
如何使用 Claude Sonnet 5:推理档位、成本与限制
2026/07/27

如何使用 Claude Sonnet 5:推理档位、成本与限制

Claude Sonnet 5 使用指南:与 Opus 4.8 的基准对比、推理档位如何影响成本、更密集的分词器如何抬升账单,以及迁移步骤。

Anthropic 在 2026 年 6 月 30 日发布了 Claude Sonnet 5,核心承诺是:接近 Opus 级智能的编码和智能体工作能力,但采用 Sonnet 定价[1]。官方基准测试大多证实了这一点。

充分利用 Claude Sonnet 5 主要取决于两个要点,而发布文章并未重点强调这些。推理档位是实现成本承诺的关键杠杆,而更密集的分词器意味着相同的提示词现在比 Sonnet 4.6 消耗约 30% 更多的 token,所以仅交换模型字符串的迁移会悄悄改变账单,还可能截断输出[1]

本指南涵盖基准测试、Sonnet 5 与 Opus 4.8 的对标与差距、会破坏现有代码的四个 API 改动、包括 9 月涨价在内的定价,以及谁应该实际运行它。

要点

  • 知识工作接近 Opus 级别。 GDPval-AA v2 Elo 值为 1618,而 Opus 4.8 为 1615,在统计学上是打成平手[1]
  • 在困难尾部仍然落后。 SWE-bench Pro 63.2% 对 69.2%,USAMO 2026 79.5% 对 96.7%[1]
  • 引入价格有效期至 2026 年 8 月 31 日:每百万 token 的输入 $2、输出 $10,从 9 月 1 日起上升至 $3 / $15[1]
  • 首个拥有完整推理档位的 Sonnet 模型lowmediumhigh(默认)、xhighmax[1]
  • 分词器密度提升约 30%。 单位 token 价格不变,所以相同请求比 Sonnet 4.6 更贵。迁移前需重新基准测试[1]
  • budget_tokens 和采样参数现在返回 400 错误[1]

Claude Sonnet 5 是什么

Claude Sonnet 5(claude-sonnet-5)是 Sonnet 4.6 的继任者,可直接替代。Anthropic 称其为最具智能体特性的 Sonnet 模型,专为制定计划、驱动浏览器和终端以及长时间自主运行而构建,达到最近才需要更大更昂贵模型的能力水平[1]

它作为 claude.ai 上免费和专业用户的默认模型上线,同时在 Claude API、Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry(预览版)上推出。默认支持 1M token 的上下文窗口和 128K 的最大输出[1]

基准测试

Claude Sonnet 5 在智能体编码、推理、计算机使用和知识工作方面与 Sonnet 4.6 和 Opus 4.8 的基准对比

基准Sonnet 5Sonnet 4.6Opus 4.8(参考)
智能体编码(SWE-bench Pro)63.2%58.1%69.2%
智能体编码(Terminal-Bench 2.1)80.4%67.0%82.7%
推理(HLE,无工具)43.2%34.6%49.8%
推理(HLE,带工具)57.4%46.8%57.9%
计算机使用(OSWorld-Verified)81.2%78.5%83.4%
知识工作(GDPval-AA v2,Elo)161813951615

两个现象突出。对比 Sonnet 4.6,这是全面胜利且幅度实质性:Terminal-Bench 上升 13.4 分,知识工作 Elo 增长 223。在知识工作中 Sonnet 5 名义上领先 Opus 4.8(1618 对 1615),这是打成平手,同时在智能体编码和计算机使用上大约落后 2 到 6 分[1]

"相当接近,成本仅为三分之一" 的差距正是整个价值主张所在。

系统卡中的更多数据:经典 500 题 SWE-bench Verified 子集上 85.2%,跨九种语言的 SWE-bench Multilingual 上 78.3%,以及 Cognition 的 FrontierCode v1 上 38.8,超过 Sonnet 4.6 的 15.1 两倍。Cursor 的独立测量在 CursorBench 上给出 61.2%,而 Sonnet 4.6 为 49%,Opus 4.8 为 63.8%。BrowseComp 达到单智能体 84.7% 和多智能体 86.6%[1]

一个诚实的弱点:在 USAMO 2026 上 Sonnet 5 得分 79.5%,虽然远高于 Sonnet 4.6 的 55.0%,但远低于 Opus 4.8 的 96.7%[1]。复杂形式数学不是这个模型的工作。

推理档位是成本杠杆

Sonnet 5 是首个暴露完整档位的 Sonnet 级模型:lowmediumhigh(默认)、xhighmax[1]。这不是表面功能。正是它实现 Opus 质量配 Sonnet 价格承诺的方式。

根据 BrowseComp 的按推理档位绘制的智能体搜索性能,展示 Claude Sonnet 5、Opus 4.8 和 Sonnet 4.6 的通过率对每任务成本关系

BrowseComp 曲线是最清晰的说明。Sonnet 5 的准确度从 low 时约 60% 上升到 max 时约 85%,并在明显更低的每任务成本下达到 Opus 4.8 级准确度。Opus 4.8 仍然略微领先,但 Sonnet 5 以远低的成本达到接近性能,这正是高容量智能体循环所需的[1]

计算机使用讲述的是更冷静的故事。

计算机使用性能在 OSWorld-Verified 按推理档位,其中 Opus 4.8 在每个推理档位都领先 Claude Sonnet 5

在 OSWorld-Verified 上,Opus 4.8 在每个推理档位都保持领先。Sonnet 5 仍轻松击败 Sonnet 4.6 且成本远低,但如果像素级精准的图形界面控制是核心工作负载,旗舰机型保持真实优势[1]

实际规则:对最困难的长期编码和智能体任务使用 xhigh,大多数工作使用 high,对延迟敏感或简单任务使用 mediumlow。按路由调优而非处处使用 max

与成本可比级别对标

系统卡公布了与 GPT-5.5 和 Gemini 3.5 Flash 的竞争对手数据,这是成本可比级别而非绝对前沿。理解为 "击败同价位模型",而非 "击败所有模型"[1]

评估Sonnet 5GPT-5.5Gemini 3.5 Flash
SWE-bench Pro63.258.655.1
Terminal-Bench 2.180.483.476.2
HLE(无工具)43.241.440.2
HLE(带工具)57.452.2不适用
OSWorld-Verified81.278.778.4
FrontierCode v138.825.5不适用
GDPval-AA v2(Elo)161815091357
AutomationBench13.512.914.5
HealthBench Professional57.851.8不适用

Sonnet 5 在大多数对 GPT-5.5 的对标中获胜,在最常被引用的那个失利:Terminal-Bench 2.1,其中 GPT-5.5 使用 Codex CLI 得分 83.4 对 80.4。对 Gemini 3.5 Flash,胜算更大,仅 AutomationBench 是例外。注意 AutomationBench 分数跨整个范围都偏低;这些是未饱和基准,非已解决的[1]

与 Opus 4.8 打成平手和落后之处

打成平手或领先: GDPval-AA v2 知识工作(1618 对 1615)、BrowseComp 上同等准确度下的智能体搜索的更低任务成本、Real-World Finance v2(1219 对 1222)和 AA-Briefcase 专业工作 Elo(1393 对 1352)[1]

落后: SWE-bench Pro(63.2 对 69.2)、Terminal-Bench 2.1(80.4 对 82.7)、OSWorld(81.2 对 83.4)、HLE 无工具(43.2 对 49.8)、CursorBench(61.2 对 63.8)、Toolathlon(54.3 对 59.9)和 USAMO 2026(79.5 对 96.7)[1]

规律一致。在开放式知识工作和智能体搜索上,Sonnet 5 实际是 Opus 级。在最困难的编码、计算机使用和形式数学上,Opus 4.8 保持真实但适度的领先。对于运行多个智能体轮次且成本占主导的工作负载,Sonnet 5 是理性默认值,Opus 是困难尾部的升级路径。

如何使用 Claude Sonnet 5:四个破坏旧代码的改动

Sonnet 5 采纳 Opus 4.7/4.8 请求界面,所以迁移不仅是字符串交换[1]

自适应思考默认启用。 Sonnet 4.6 除非请求否则不思考。Sonnet 5 开箱即用自适应思考,每个请求决定任务需要多少推理。在需要原始速度时仍可显式禁用。

budget_tokens 已移除。 手动思考预算现在返回 400。通过推理档位控制深度。

采样参数被拒绝。 非默认 temperaturetop_ptop_k 返回 400。通过提示词引导。

分词器密度提升约 30%。 Sonnet 5 共享 Opus 4.7 引入的分词器,它将相同文本转化为大约 30% 更多的 token。单位 token 价格不变,所以等价请求可能比 Sonnet 4.6 上花费更多,为旧分词器调优的 max_tokens 限制现在可能截断输出于思考中。

最后一个是成本惊喜。在自己的提示词上重新测量实际支出,而非假设贴纸价格从 Sonnet 4.6 干净映射。

一个值得注意的能力增强:Sonnet 5 是首个 Sonnet 级模型有高分辨率图像级别,长边最多 2576 像素和 4784 视觉 token,对比旧的 1568 像素上限。它自动激活,对密集文档、图表和截图理解有重要意义[1]

定价

项目引入价格(至 2026 年 8 月 31 日)标准价格(从 2026 年 9 月 1 日起)
输入$2 / MTok$3 / MTok
输出$10 / MTok$15 / MTok
缓存读~$0.20 / MTok~$0.30 / MTok
批处理$1 / $5标准价的 50%

对比 Opus 4.8 的 $5 / $25,Sonnet 5 在引入价格下约为成本三分之一,标准价格下约 60%[1]。加上推理档位和提示词缓存,对调优良好的智能体工作负载差距扩大。

两个告诫。更密集的分词器意味着应重新计算实际支出而非信任贴纸对比。Priority Tier 在 Sonnet 5 上不可用[1]

代码必须处理的安全行为

Sonnet 5 是首个随实时网络安全保护上线的 Sonnet 级模型。触及禁止或高风险网络和生物学主题的请求可被拒绝,作为 成功的 HTTP 200 带拒绝停止原因而非错误 返回[1]

如果构建安全工具或生命科学工作流,其中良性但相关的请求可能触发分类器,显式处理该停止原因而非假设每个 200 携带可用内容。Anthropic 还报告低于 Sonnet 4.6 的幻觉和谄媚率,这对输出在下游被信任无人类检查时很重要[1]

谁应该使用 Claude Sonnet 5

对成本每轮复合的高容量智能体工作负载是理性默认值:编码智能体、浏览器和终端自动化、检索和研究循环。适合将 LLM 嵌入到运送功能的产品构建者,以及长上下文文档工作,其中 1M 窗口和低单位 token 价格使批量处理可行。

在困难尾部的任务上改用 Opus 4.8 或 Opus 5:最苛刻的编码、像素级精准计算机使用或形式数学,其中旗舰的几分点领先值得溢价。

在 reAPI 上运行 Sonnet 级模型

坦白地说覆盖面:Claude Sonnet 5 今天不在 reAPI 网关上。 可用的 Sonnet 级模型是 Claude Sonnet 4.6,网关上的 Claude 模型是 Opus 5、Opus 4.8、Opus 4.7、Sonnet 4.6 和 Fable 5。

这比听起来重要性少,因为实际价格落点。Sonnet 5 从 9 月起列价 $3 / $15。在 reAPI 上,Claude Opus 5 运行 $2.40 / $12.00,Sonnet 4.6 相同。所以层级上的模型在网关上成本低于 Sonnet 5 的标准列价,而 Opus 5 是 Anthropic 描述为以 Fable 5 成本一半交付前沿智能的模型。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Plan and run this multi-step refactor."}],
    max_tokens=16000,
    stream=True,
)

端点与 OpenAI 兼容,本地 Anthropic /v1/messages 界面也可用。费率和请求形态在 reapi.ai/models,Opus 5 参考在 reapi.ai/docs/claude-opus-5

如果评估特别需要 Sonnet 5 的行为而非其价格点,直接通过 Anthropic 调用它。

常见问题

Claude Sonnet 5 是否比 Opus 4.8 更好?

在开放式知识工作和智能体搜索上它们实际打成平手,而 Sonnet 5 在 GDPval-AA v2 上略微领先(1618 对 1615)。在最困难的编码、计算机使用和形式数学上,Opus 4.8 保持适度领先[1]

Claude Sonnet 5 成本是多少?

2026 年 8 月 31 日前每百万输入 token $2,输出 $10,9 月 1 日起上升至 $3 / $15。提示词缓存将缓存上下文读削减约 90%,批处理 API 将费率减半[1]

xhigh 推理档位是什么?

highmax 之间的推理设置,为长期智能体和编码任务调优。Sonnet 5 是首个支持完整档位的 Sonnet 级模型[1]

从 Sonnet 4.6 迁移后为什么我的成本上升了?

分词器密度提升约 30%,所以相同文本变成大约 30% 更多 token 且单位 token 价格不变。重新计算提示词并提升 max_tokens 所以长输出不被截断[1]

Claude Sonnet 5 支持 1M token 上下文窗口吗?

是,默认 1M 在标准单位 token 费率下无长上下文附加费用,最多 128K 输出 token[1]

从 Sonnet 4.6 迁移时什么破坏?

budget_tokens 返回 400,非默认采样参数返回 400,自适应思考现在默认启用,更密集分词器改变成本和截断行为[1]

Claude Sonnet 5 能控制计算机吗?

是。它支持工具使用、网络搜索、网页获取、代码执行和计算机使用,在 OSWorld-Verified 上得分 81.2% 对 Opus 4.8 的 83.4%[1]

Claude Sonnet 5 在 reAPI 上可用吗?

目前不。网关有 Claude Opus 5、Opus 4.8、Opus 4.7、Sonnet 4.6 和 Fable 5。Sonnet 5 标准列价上 reAPI 的 Opus 5 每 token 成本更低。

在档位和价格点之间选择

Claude Sonnet 5 兑现了核心承诺。对编码和智能体工作,它着陆足够接近 Opus 4.8 使得在引入窗口成本三分之一时它成为明智默认值并为困难尾部预留旗舰。它在大多数对 GPT-5.5 和 Gemini 3.5 Flash 的对标中胜出,在 Terminal-Bench、AutomationBench 和形式数学上有诚实例外。

两件事决定该算术是否在接触工作负载时幸存。9 月价格提升将其从 Opus 的三分之一变到约 60%,更密集分词器意味着贴纸对比低估真实支出。在自己的提示词上衡量两者才承诺。那是如何使用 Claude Sonnet 5 不在发票上发现分词器的方式,也是为什么档位标签不如实际每完成任务支付数字那么重要。

参考资源

  1. Anthropic. Introducing Claude Sonnet 5. Retrieved July 2026 from anthropic.com/news/claude-sonnet-5
  2. Anthropic. Models overview — specs and pricing for all current Claude models. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
  3. Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing

延伸阅读