Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
编码选对模型:Claude Fable 5 对比 Opus 5
2026/07/27

编码选对模型:Claude Fable 5 对比 Opus 5

最适合编码的 Claude 模型取决于基准:Fable 5 在 SWE-Bench Pro 领先,Opus 5 胜出代理终端任务且成本仅为 1/3。

"哪个 Claude 模型最适合编码"这个问题的答案取决于衡量方式:最高基准分数、单位成本最优、或是在凌晨 2 点不会让人惊讶的模型。这三种情况指向三个不同的模型。

公开数据能解决大部分问题,其中有一行让人意外——Anthropic 自己的表格里显示其旗舰模型在这一行落了下风。

摘要

  • 最高代理编码分数:Claude Fable 5 在 SWE-Bench Pro 上达到 80.3%[1]
  • 大多数团队的最佳选择:Claude Opus 5,Anthropic 将其定位用于复杂代理编码和企业级工作[2]
  • Opus 5 在一行上落后。 GPT-5.6 Sol 在 Anthropic 自己的表格中以 72.7% 击败 Opus 5 的 68.8%(在 DeepSWE v1.1 上)[3]
  • 写作排名反向倾斜向知识工作,此处 Opus 5 领先 GDPval-AA v2,得分 1861[3]
  • effort 等级比模型选择更重要,在前沿之下:Opus 5 的 lowmedium 表现异常稳定[2]
  • 在 reAPI 上,Opus 5 成本远低于 Fable 5,这改变了权衡方程。

编码数据

三个编码基准有三个不同的赢家:Fable 5 在 SWE-Bench Pro、Opus 5 在 Frontier-Bench 和 GPT-5.6 Sol 在 DeepSWE,加上知识工作行(排名反向)

三个模型在激烈竞争。以下是 Anthropic 发布的每个基准数据。

基准Fable 5Opus 5Opus 4.8
SWE-Bench Pro(代理编码)80.3%n/a69.2%
FrontierCode Diamond(最难编码)29.3%53.4%†13.4%
Terminal-Bench 2.188.0%*n/a82.7%
Frontier-Bench v0.1(代理终端)33.7%43.3%21.1%
DeepSWE v1.1(代理编码)69.7%68.8%59.0%

* 带星号的行表示 Anthropic 指出公开的 Fable 5 与未受限版本不同,因为安全分类器被触发;预计实际调用的模型在这一行会更接近 Opus 4.8[1]。 † FrontierCode v1.1 Main,这是不同的基准子集,而非 Fable 5 列中的 Diamond 子集,所以请按列向下读而不是按行。

两个结论从表中脱颖而出。

Fable 5 在直接可比的编码基准上领先,在 SWE-Bench Pro 上尤其明显[1]

Opus 5 在新的代理终端基准上明确胜出,Frontier-Bench 分数超过 Opus 4.8 的两倍多[3]

Anthropic 留下的这一行

在 DeepSWE v1.1 上,Anthropic 自己的对比表把 GPT-5.6 Sol 列为 72.7%,而 Opus 5 是 68.8%[3]。这是最清晰的编码损失,恰好出现在 Opus 5 最被推崇的工作负载上。

这值得认真对待而不是解释掉。如果你的评估类似 DeepSWE,竞争对手在厂商自己的数据上得分更高。如果它类似长地平线终端工作,Opus 5 在同一表上以九分的优势击败该竞争对手。

教训不是某个模型更好。而是"最适合编码"会根据哪个编码基准匹配你的工作而解决不同的答案。

写作用哪个

问写作问题,排名就会重组,因为写作离知识工作更近而非离代码。

基准Opus 5Fable 5Opus 4.8
GDPval-AA v2(知识工作,Elo)186117471593
人类最后的考试,无工具56.3%56.5%49.8%
人类最后的考试,有工具64.7%63.9%57.9%

Opus 5 在知识工作上比 Fable 5 领先 114 Elo[3]。在无工具推理上两者接近统计持平。

对于起草、编辑和综合,这个 GDPval 差距是相关信号,它指向 Opus 5 而非编码基准上的冠军。

击败模型选择的变量

在前沿之下,effort 等级比切换模型更能影响结果。

Anthropic 描述 Opus 5 能将额外努力转化为更好结果,比任何早期 Opus 模型都更可靠,并且单独指出 lowmedium 以小数分之一的 token 和延迟产生强大质量[2]。官方指导是从默认 high 开始,然后根据你自己的评估向两个方向扫过。

这对整个问题有实际后果。选择"最好"的模型但保留 effort 在既有默认值的团队,往往得到比层级更低但调整了这个旋钮的团队更差的结果,也更慢。

在 reAPI 上成本多少

模型选择既是成本决定也是能力决定。

模型每百万 token 输入 / 输出
Claude Fable 5$8.00 / $40.00
Claude Opus 5$2.40 / $12.00
Claude Opus 4.8$4.00 / $20.00
Claude Sonnet 4.6$2.40 / $12.00

Fable 5 在同一网关上的成本是 Opus 5 的三倍多。这重新构架了编码问题:Fable 5 的 SWE-Bench Pro 领先是真实的,而你为此支付 3 倍以上的费用,在一个还附带强制 30 天保留和拒绝层的模型上[1]

对大多数团队来说这个交易不划算。但对于一次失败的运行成本高于 token 的仓库级迁移,就另当别论了。

选择

默认选择 Opus 5。 最好的知识工作分数,在新的代理终端基准上有决定性优势,在这个网关上是三者中最便宜的。

当任务是长地平线且困难并且你已在自己的工作上测量过它获胜时,选择 Fable 5。FrontierCode 曲线是诚实的论据:在最硬的问题上,额外努力继续买来准确性,而其他模型趋平[1]

保留 Opus 4.8 当你的评估已经校准到它,或当你需要在高 effort 等级禁用 thinking,而 Opus 5 拒绝做这件事时[2]

考虑非 Claude 模型如果你的工作负载看起来像 DeepSWE。厂商自己的表格这样说。

from openai import OpenAI

client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

在这个网关的模型字符串上做一个改变就能在它们之间切换。费率在 reapi.ai/models

常见问题

哪个 Claude 模型最适合编码?

Fable 5 在直接可比的编码基准上领先,特别是在 SWE-Bench Pro 上以 80.3%[1]。Opus 5 在新的代理终端基准上获胜且成本低很多,这让它成为大多数团队更好的默认选择[3]

哪个 Claude 模型最适合写作?

Opus 5。它在 GDPval-AA v2 上领先知识工作,Elo 1861,比 Fable 5 高 114[3]

Claude 在编码上胜过 GPT 吗?

不是在每个基准上。Anthropic 自己的表格显示 GPT-5.6 Sol 在 DeepSWE v1.1 上以 72.7% 击败 Opus 5 的 68.8%,而 Opus 5 在同一表的代理终端工作上领先[3]

Fable 5 值三倍价格吗?

只有当任务足够困难,使得它的 effort 曲线为自己买单时。它还附带强制 30 天数据保留和分类器拒绝层,而 Opus 5 没有[1]

Effort 等级比模型选择更重要吗?

在前沿之下,通常是。Opus 5 将额外努力转化为结果比早期 Opus 模型更可靠,其 lowmedium 设置表现异常稳定[2]

对于代码审查特别应该用哪个模型?

Opus 5,但有 Anthropic 指导的一个警告:它按字面意思遵循严重性过滤器,所以仅要求高严重性问题会压低它的报告。要求全部并带置信度标签,然后在下游过滤[2]

Sonnet 对编码足够好吗?

对于成本主导每次转向的高容量工作,通常是。在 reAPI 上 Sonnet 4.6 的成本与 Opus 5 相同,这消除了选择它的价格论据。

我如何在它们之间切换?

如果你通过网关而非各厂商账户调用它们,只需一个键上的一个模型字符串。

将模型与匹配你工作的基准相匹配

关于哪个 Claude 模型最适合编码的诚实答案是这个问题指定不足。Fable 5 在经典编码基准上领先。Opus 5 在新的代理终端上领先,在知识工作上明确领先,且成本仅为 1/3。竞争对手在 Anthropic 无论如何发布的一行上击败两者。

所以挑选与你实际工作相似的基准,然后读那一行。并在完全切换模型之前,对你已有的扫过 effort 旋钮,因为在前沿之下那比模型名字更能影响结果。

参考资料

  1. reAPI. 如何使用 Claude Fable 5——基准表、effort 曲线、拒绝层和保留期。 reapi.ai/blog/how-to-use-claude-fable-5
  2. Anthropic. Claude Opus 5 新增内容——effort 指导、行为变化和能力改进。 2026 年 7 月检索 platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  3. reAPI. 如何使用 Claude Opus 5——完整发布基准表。 reapi.ai/blog/how-to-use-claude-opus-5

进阶阅读