Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Claude Opus 4.8:编码、诚实度与成本
2026/07/27

Claude Opus 4.8:编码、诚实度与成本

Claude Opus 4.8 官方基准对比、诚实度改进、Dynamic Workflows 功能、默认努力等级变化及迁移规划详解。

Anthropic 在 2026 年 5 月 28 日发布了 Claude Opus 4.8,距 Opus 4.7 仅 41 天,价格完全相同:每百万输入令牌 $5,每百万输出令牌 $25[1][3]。如何有效使用 Claude Opus 4.8,主要在于理解价格不变下面隐藏着什么变化。

三件事变了。代理代码能力再次提升,SWE-bench Pro 从 64.3% 升至 69.2%[1]。快速模式便宜了三倍。Anthropic 在发布声明中花最多篇幅的是一个非能力指标:该模型比 Opus 4.7 少四倍的可能性放任自己代码中的缺陷无人检查[1]。对于无人值守的代理工作,这改变了风险简况多于基准。

TL;DR

  • 价格不变,能力提升。 每百万令牌 $5 / $25,与 Opus 4.7 和 4.6 相同[3]。在 reAPI 上同一模型运行 $4.00 / $20.00,即 Anthropic 公开费率的 80%。
  • 诚实度提升是头条。 比 Opus 4.7 少约四倍的概率放任自己代码中的缺陷不言,比 Sonnet 4.6 少约十七倍的概率编造代理工作摘要[1]
  • 快速模式降至原价三分之一。 每百万令牌 $10 / $50 以换取约 2.5 倍输出速度,而旧 Claude 模型的快速模式是 $30 / $150[1]
  • 默认努力等级从 medium 改为 high 依赖旧默认的工具得到更深层推理、更高延迟和更多输出令牌,代码无需改动[1]
  • 固定思维预算已移除。 传递 budget_tokens 的代码需要迁移到 thinking: {"type": "adaptive"}[1]
  • 不是全面领先。 GPT-5.5 仍在 Terminal-Bench 2.1 上领先,78.2% 对 74.6%,GPQA Diamond 从 Opus 4.7 略微下滑[1]

Claude Opus 4.8 是什么

Claude Opus 4.8 发布宣传图

Claude Opus 4.8 是 Anthropic Claude 4 系列的前沿模型,直接替代 Opus 4.7 在 Anthropic 发布的所有平面上。API 标识是 claude-opus-4-8,无日期后缀[2]。它能在单个请求中读取最多 1M 令牌,返回最多 128K,或在 Batch API 上使用 beta 头返回最多 300K[2]

如果你想要规格级的概览,我们写过一篇:什么是 Claude Opus 4.8 涵盖了上下文窗口、模态和能力清单。这个指南关于运营方面,这是有趣决策所在的地方。

Opus 4.8 在编码和代理基准上的表现

Anthropic 的 Claude Opus 4.8 基准表比较 Opus 4.8、Opus 4.7、GPT-5.5 和 Gemini 3.1 Pro 在代理编码、终端编码、多学科推理、计算机使用、知识工作和财务分析上的表现

Anthropic 的头条对比把 Opus 4.8 对比 Opus 4.7、GPT-5.5 和 Gemini 3.1 Pro,跨越它认为代表真实代理工作的评估[1]

基准Opus 4.8Opus 4.7GPT-5.5Gemini 3.1 Pro
代理编码 (SWE-bench Pro)69.2%64.3%58.6%54.2%
代理终端编码 (Terminal-Bench 2.1)74.6%66.1%78.2%70.3%
多学科推理 (HLE,无工具)49.8%46.9%41.4%44.4%
多学科推理 (HLE,有工具)57.9%54.7%52.2%51.4%
代理计算机使用 (OSWorld-Verified)83.4%82.8%78.7%76.2%
知识工作 (GDPval-AA, Elo)1890175317691314
代理财务分析 (Finance Agent v2)53.9%51.5%51.8%43.0%

Opus 4.8 领先七行中的六行。例外是 Terminal-Bench 2.1,GPT-5.5 赢 78.2% 对 74.6%[1]

这个表旁的三条建议很重要,因为它们对实际采购决策有影响。SWE-bench Verified 单独报告,从 87.6% 移至 88.6%,这是在基准开始饱和的等级上的小步。GPQA Diamond 方向错了,从 Opus 4.7 的 94.2% 滑至 93.6%。这些是厂商运行的评估,所以把整个表读作方向信号而非中立审计。Anthropic 还报告 96.7% 在 USAMO 2026 和在单代理 BrowseComp 上升至 84.3%[1]

诚实摘要是「广泛领先,但非处处领先」。

合作伙伴从生产报告的内容

基准经常高估真实世界的收益,所以 Anthropic 发布备注中早期接入合作伙伴声明比另一行评估更值钱。有些足够具体可以行动[1]

  • Databricks 报告了代理推理的阶跃变化,令牌成本约低 61% 对比 Opus 4.7。这对生产经济学最重要,因为同时提升能力和降低支出在点版本中很少见。
  • Cursor 报告了显著更高效的工具调用,以相同智能水平完成端到端任务用更少步骤。
  • Cognition,Devin 的制造者,报告了干净的工具使用和指令遵循一致到足够让自主工程工作流无人值守运行。
  • Harvey 在其法律代理基准上记录了最高分,第一个模型清除了其最严格的全通过标准的 10%。

把 61% 数字作为在自己流量上测试的假设而非放入预算的数字。令牌成本取决于工作负载,下面描述的默认努力变化朝相反方向推动。

诚实度升级

这个版本最独特的部分是行为变化,不是能力数字。在 Anthropic 的内部错位行为评估上,评分 1 到 10,低分更好,Opus 4.8 登陆接近 Claude Mythos Preview 并远低于 Opus 4.7 和 Sonnet 4.6[1]。实际术语中 Anthropic 报告它大约四倍不太可能比 Opus 4.7 放任自己代码中的缺陷无人检查,大约十七倍不太可能比 Sonnet 4.6 编造关于自己代理工作的摘要[1]

Claude Opus 4.8 的自动行为审计分数对比 Claude Mythos Preview、Opus 4.7 和 Sonnet 4.6,低分更好

两件事保持这个视角。这些是比率降低,不是消除。一个四倍不太可能隐藏缺陷的模型仍然偶尔隐藏一个,所以代理代码的人工审查没有消失。诚实指标来自 Anthropic 自己的评估而不是第三方基准,所以它们是厂商框架直到独立测试追上。

方向仍然重要。在长的无人值守循环中,一个主动说它不确定的模型从部署角度远比可信地发货破碎结果的安全。

Dynamic Workflows

旗舰新功能在 Claude Code 中作为研究预览发布,解决每个代理编码用户最终碰到的问题:有些工作对单个代理和一个上下文窗口太大。跨数百万行的框架迁移。触及每个服务的依赖升级。回购范围重构。

设计是编排器和工作者。Opus 4.8 计划工作,分割它为独立段,并分发给数百个并行运行的子代理。每个子代理计划、执行和验证自己的切片,编排器合并已验证的结果。Anthropic 框架库存的现有测试套件作为什么计为完成的门,并描述系统从启动到合并携带代码库规模迁移[1]

这是一个编排特性,模型改进的长视野一致性使其可行,这也是诚实工作和工作流工作属于同一版本的原因。分出数百个代理只有在每一个可靠地标记无法完成的事情时才有用。

努力、快速模式和成本公式

两个变化这里,第一个如果你错过它是无声账单增加。

API 默认努力等级从 medium 改为 highxhighmax 在其上方可用[1]。任何依赖旧默认的工具现在推理更深、运行更慢并发出更多输出令牌,无需一行代码改动。如果你比较 Opus 4.8 成本对比 Opus 4.7 成本,首先匹配努力等级或比较无意义。

快速模式降至原价三分之一。 它以约 2.5 倍输出速度运行相同模型以每百万输入令牌 $10 和 $50 输出,对比旧 Claude 模型的 $30 / $150[1]。那仍然是标准费率的双倍,但把快速模式从「太昂贵不能正当」移到对延迟敏感产品的范围内。

这里是完整官方费率卡[3]

项目每百万令牌价格
输入$5
输出$25
缓存命中和刷新$0.50
缓存写 (5 分钟)$6.25
缓存写 (1 小时)$10
Batch 输入$2.50
Batch 输出$12.50
快速模式输入$10
快速模式输出$50

Batch API 半减两个维度,提示缓存让重复上下文便宜重新读取在 $0.50 每百万令牌[3]。在标准单价、更便宜的快速档和改变的努力默认之间,问题停止是否 Opus 可负担变成哪个努力等级、以哪个模式、对哪个任务类。

如何使用 Claude Opus 4.8:从 Opus 4.7 迁移

Anthropic 描述这一移动为主要非破坏性,但三个变化值得在生产流量转折前捕捉[1]

  1. 默认努力等级从 medium 改为 high 明确设置或接受更深推理、更高延迟和更多输出令牌。
  2. 固定扩展思维令牌预算已移除。 传递 budget_tokens 值的代码迁移到 thinking: {"type": "adaptive"}
  3. Messages API 现在接受系统条目中任务而不破坏提示缓存。 不是破坏性变化,但行为要知道如果你的代理中任务更新指令。

保持任何模型升级的清单:从你的生产轨迹回放 20 到 50 个真实任务在匹配的努力等级,比较端到端成本和质量而不是每令牌费率,重新调整用力或思维预算的提示,并在一个真正大的工作前导航 Dynamic Workflows 到自动化。令牌成本数学是经验性。在自己的工作负载上测量它。

谁现在应该关心

已在运行 Opus 4.7 的团队。 SWE-bench Pro 收益加上报告的令牌成本降低使迁移导航值花费时间,前提是你为新 high 努力默认分配预算并首先在真实任务上基准成本。

有代码库规模工作的团队。 Dynamic Workflows 是升级的原因如果你有一个因为太大而停滞的迁移或回购范围重构等待单个代理。用一个单一有界工作从测试套件可信开始。

任何运行无人值守代理循环的人。 诚实改进在没有人审查每一步实时地方最重要:隔夜运行、自主管道、长研究任务。

应该可能跳过它的团队。 如果你在启动新鲜而不是迁移,看 Claude Opus 5 在承诺 4.8 前。它列在相同 $5 / $25,在 reAPI 上它运行比 Opus 4.8 便宜。Opus 4.8 保持当你需要一个模型其行为你的评估已经刻画时正确答案,或当你特别想思维关闭在高努力等级,Opus 5 不再许可。

调用 Claude Opus 4.8 在你的其他模型旁

上面的一切是穿着迁移服装的路由问题。努力默认移动,所以成本按任务移动。快速模式变成对一个类它被定价外的路由可行。GPT-5.5 仍然赢终端编码。Opus 5 在相同列表价存在现在。那个都没有解决为一个设置,全部再改变在下个版本。

reAPI 通过 OpenAI 兼容的 /v1/chat/completions 端点暴露 Claude Opus 4.8,所以你已经对 GPT 和 Gemini 调用使用的客户也调用它:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-4-8",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

网关上的费率是每百万输入令牌 $4.00 和 $20.00 输出,即 Anthropic 公布的 $5 / $25 的 80%。端点参考在 reapi.ai/docs/claude-opus-4-8,当前费率在 reapi.ai/models/claude-opus-4-8

交换模型字符串是容易部分。能够交换它而不第二 SDK、第二密钥和第二发票是值得建设一次的部分。

FAQ

Claude Opus 4.8 何时发布?

2026 年 5 月 28 日,距 Opus 4.7 四十一天,在未改变的定价[1]

Claude Opus 4.8 多少钱?

每百万输入令牌 $5 和 $25 输出,缓存读在 $0.50 并且 Batch API 半价[3]。快速模式是 $10 / $50[1]

从 Opus 4.7 迁移时最大的事情捕捉是什么?

API 默认努力等级从 medium 改为 high。如果你的工具依赖旧默认,你得更深推理、更高延迟和更多输出令牌而无改动任何代码[1]

Claude Opus 4.8 战胜 GPT-5.5 吗?

在 Anthropic 直接比较它们的六行中五行,是。GPT-5.5 在代理终端编码上赢 Terminal-Bench 2.1,78.2% 对 74.6%[1]

Dynamic Workflows 是什么?

在 Claude Code 研究预览中 Opus 4.8 充当编排器,分割大工作为独立段,分发给数百个平行子代理,并使用库存自己测试套件作为门合并已验证结果[1]

诚实度改进是独立验证的吗?

不是还。四倍和十七倍数字来自 Anthropic 内部评估而不是第三方基准[1]。它们是比率降低,不是消除,所以代理输出的人工审查仍然适用。

我应该使用 Opus 4.8 或 Opus 5 吗?

Opus 5 列在相同 $5 / $25 并是阶跃变化而不是递增升级。Opus 4.8 保持相关当你的评估已经刻画其行为,或当你需要在高努力等级禁用思维,Opus 5 拒绝。

我如何使用 OpenAI SDK 调用 Claude Opus 4.8?

指向 OpenAI 客户在 https://api.reapi.ai/v1,设置 modelclaude-opus-4-8,并发送常规聊天请求。端点 OpenAI 兼容,所以不需要 SDK 重写。

匹配努力等级到工作

读这个版本的有用方式是 Anthropic 保持价格平且花费版本在只在生产中显示的东西:一个标记自己错误的模型,大工作编排原始太大对单个上下文窗口,并快速模式最终成本延迟敏感产品能支付的。基准表是真实但谦虚。行为变化是改变代理需要多少监督的部分。

如果你迁移,工作小和具体。明确钉努力等级而不是继承新 high 默认,移动任何 budget_tokens 代码为适应思维,在匹配努力前重放生产任务在真实生产成本比较前信任,并试导航 Dynamic Workflows 在一个有可信测试套件的有界工作。那是如何使用 Claude Opus 4.8 而不在账单中发现努力默认。

References

  1. Anthropic. Introducing Claude Opus 4.8 — benchmarks, honesty evaluations, Dynamic Workflows, effort defaults, and fast-mode pricing. Retrieved July 2026 from anthropic.com/news/claude-opus-4-8
  2. Anthropic. Models overview — context, output, modality, and capabilities. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
  3. Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing

Further reading