
编码选对模型:Claude Fable 5 对比 Opus 5
最适合编码的 Claude 模型取决于基准:Fable 5 在 SWE-Bench Pro 领先,Opus 5 胜出代理终端任务且成本仅为 1/3。
"哪个 Claude 模型最适合编码"这个问题的答案取决于衡量方式:最高基准分数、单位成本最优、或是在凌晨 2 点不会让人惊讶的模型。这三种情况指向三个不同的模型。
公开数据能解决大部分问题,其中有一行让人意外——Anthropic 自己的表格里显示其旗舰模型在这一行落了下风。
摘要
- 最高代理编码分数:Claude Fable 5 在 SWE-Bench Pro 上达到 80.3%[1]。
- 大多数团队的最佳选择:Claude Opus 5,Anthropic 将其定位用于复杂代理编码和企业级工作[2]。
- Opus 5 在一行上落后。 GPT-5.6 Sol 在 Anthropic 自己的表格中以 72.7% 击败 Opus 5 的 68.8%(在 DeepSWE v1.1 上)[3]。
- 写作排名反向倾斜向知识工作,此处 Opus 5 领先 GDPval-AA v2,得分 1861[3]。
- effort 等级比模型选择更重要,在前沿之下:Opus 5 的
low和medium表现异常稳定[2]。 - 在 reAPI 上,Opus 5 成本远低于 Fable 5,这改变了权衡方程。
编码数据

三个模型在激烈竞争。以下是 Anthropic 发布的每个基准数据。
| 基准 | Fable 5 | Opus 5 | Opus 4.8 |
|---|---|---|---|
| SWE-Bench Pro(代理编码) | 80.3% | n/a | 69.2% |
| FrontierCode Diamond(最难编码) | 29.3% | 53.4%† | 13.4% |
| Terminal-Bench 2.1 | 88.0%* | n/a | 82.7% |
| Frontier-Bench v0.1(代理终端) | 33.7% | 43.3% | 21.1% |
| DeepSWE v1.1(代理编码) | 69.7% | 68.8% | 59.0% |
* 带星号的行表示 Anthropic 指出公开的 Fable 5 与未受限版本不同,因为安全分类器被触发;预计实际调用的模型在这一行会更接近 Opus 4.8[1]。 † FrontierCode v1.1 Main,这是不同的基准子集,而非 Fable 5 列中的 Diamond 子集,所以请按列向下读而不是按行。
两个结论从表中脱颖而出。
Fable 5 在直接可比的编码基准上领先,在 SWE-Bench Pro 上尤其明显[1]。
Opus 5 在新的代理终端基准上明确胜出,Frontier-Bench 分数超过 Opus 4.8 的两倍多[3]。
Anthropic 留下的这一行
在 DeepSWE v1.1 上,Anthropic 自己的对比表把 GPT-5.6 Sol 列为 72.7%,而 Opus 5 是 68.8%[3]。这是最清晰的编码损失,恰好出现在 Opus 5 最被推崇的工作负载上。
这值得认真对待而不是解释掉。如果你的评估类似 DeepSWE,竞争对手在厂商自己的数据上得分更高。如果它类似长地平线终端工作,Opus 5 在同一表上以九分的优势击败该竞争对手。
教训不是某个模型更好。而是"最适合编码"会根据哪个编码基准匹配你的工作而解决不同的答案。
写作用哪个
问写作问题,排名就会重组,因为写作离知识工作更近而非离代码。
| 基准 | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| GDPval-AA v2(知识工作,Elo) | 1861 | 1747 | 1593 |
| 人类最后的考试,无工具 | 56.3% | 56.5% | 49.8% |
| 人类最后的考试,有工具 | 64.7% | 63.9% | 57.9% |
Opus 5 在知识工作上比 Fable 5 领先 114 Elo[3]。在无工具推理上两者接近统计持平。
对于起草、编辑和综合,这个 GDPval 差距是相关信号,它指向 Opus 5 而非编码基准上的冠军。
击败模型选择的变量
在前沿之下,effort 等级比切换模型更能影响结果。
Anthropic 描述 Opus 5 能将额外努力转化为更好结果,比任何早期 Opus 模型都更可靠,并且单独指出 low 和 medium 以小数分之一的 token 和延迟产生强大质量[2]。官方指导是从默认 high 开始,然后根据你自己的评估向两个方向扫过。
这对整个问题有实际后果。选择"最好"的模型但保留 effort 在既有默认值的团队,往往得到比层级更低但调整了这个旋钮的团队更差的结果,也更慢。
在 reAPI 上成本多少
模型选择既是成本决定也是能力决定。
| 模型 | 每百万 token 输入 / 输出 |
|---|---|
| Claude Fable 5 | $8.00 / $40.00 |
| Claude Opus 5 | $2.40 / $12.00 |
| Claude Opus 4.8 | $4.00 / $20.00 |
| Claude Sonnet 4.6 | $2.40 / $12.00 |
Fable 5 在同一网关上的成本是 Opus 5 的三倍多。这重新构架了编码问题:Fable 5 的 SWE-Bench Pro 领先是真实的,而你为此支付 3 倍以上的费用,在一个还附带强制 30 天保留和拒绝层的模型上[1]。
对大多数团队来说这个交易不划算。但对于一次失败的运行成本高于 token 的仓库级迁移,就另当别论了。
选择
默认选择 Opus 5。 最好的知识工作分数,在新的代理终端基准上有决定性优势,在这个网关上是三者中最便宜的。
当任务是长地平线且困难并且你已在自己的工作上测量过它获胜时,选择 Fable 5。FrontierCode 曲线是诚实的论据:在最硬的问题上,额外努力继续买来准确性,而其他模型趋平[1]。
保留 Opus 4.8 当你的评估已经校准到它,或当你需要在高 effort 等级禁用 thinking,而 Opus 5 拒绝做这件事时[2]。
考虑非 Claude 模型如果你的工作负载看起来像 DeepSWE。厂商自己的表格这样说。
from openai import OpenAI
client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)在这个网关的模型字符串上做一个改变就能在它们之间切换。费率在 reapi.ai/models。
常见问题
哪个 Claude 模型最适合编码?
Fable 5 在直接可比的编码基准上领先,特别是在 SWE-Bench Pro 上以 80.3%[1]。Opus 5 在新的代理终端基准上获胜且成本低很多,这让它成为大多数团队更好的默认选择[3]。
哪个 Claude 模型最适合写作?
Opus 5。它在 GDPval-AA v2 上领先知识工作,Elo 1861,比 Fable 5 高 114[3]。
Claude 在编码上胜过 GPT 吗?
不是在每个基准上。Anthropic 自己的表格显示 GPT-5.6 Sol 在 DeepSWE v1.1 上以 72.7% 击败 Opus 5 的 68.8%,而 Opus 5 在同一表的代理终端工作上领先[3]。
Fable 5 值三倍价格吗?
只有当任务足够困难,使得它的 effort 曲线为自己买单时。它还附带强制 30 天数据保留和分类器拒绝层,而 Opus 5 没有[1]。
Effort 等级比模型选择更重要吗?
在前沿之下,通常是。Opus 5 将额外努力转化为结果比早期 Opus 模型更可靠,其 low 和 medium 设置表现异常稳定[2]。
对于代码审查特别应该用哪个模型?
Opus 5,但有 Anthropic 指导的一个警告:它按字面意思遵循严重性过滤器,所以仅要求高严重性问题会压低它的报告。要求全部并带置信度标签,然后在下游过滤[2]。
Sonnet 对编码足够好吗?
对于成本主导每次转向的高容量工作,通常是。在 reAPI 上 Sonnet 4.6 的成本与 Opus 5 相同,这消除了选择它的价格论据。
我如何在它们之间切换?
如果你通过网关而非各厂商账户调用它们,只需一个键上的一个模型字符串。
将模型与匹配你工作的基准相匹配
关于哪个 Claude 模型最适合编码的诚实答案是这个问题指定不足。Fable 5 在经典编码基准上领先。Opus 5 在新的代理终端上领先,在知识工作上明确领先,且成本仅为 1/3。竞争对手在 Anthropic 无论如何发布的一行上击败两者。
所以挑选与你实际工作相似的基准,然后读那一行。并在完全切换模型之前,对你已有的扫过 effort 旋钮,因为在前沿之下那比模型名字更能影响结果。
参考资料
- reAPI. 如何使用 Claude Fable 5——基准表、effort 曲线、拒绝层和保留期。 reapi.ai/blog/how-to-use-claude-fable-5
- Anthropic. Claude Opus 5 新增内容——effort 指导、行为变化和能力改进。 2026 年 7 月检索 platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- reAPI. 如何使用 Claude Opus 5——完整发布基准表。 reapi.ai/blog/how-to-use-claude-opus-5
进阶阅读
- reAPI. 如何使用 Claude Opus 4.8。 reapi.ai/blog/how-to-use-claude-opus-4-8
- reAPI. 如何使用 GPT-5.6。 reapi.ai/blog/how-to-use-gpt-5-6
- reAPI. 模型目录。 reapi.ai/models
更多文章

本地 GPU 开源 AI 视频模型对比(2026 版)
对比 Wan 2.2、HunyuanVideo-1.5、CogVideoX1.5 和 Mochi 1 在显存、输出、许可证、速度和部署限制的差异。


背景移除 API 定价:每张有效图片的实际成本
从实时 88 信用的背景移除 API 费率出发,加上被拒输出、重试、存储和评审成本,精确计算每张通过评审图片的真实单价。


Seedream 5 Pro 内容过滤详解:四层工作原理
Seedream 5 Pro 的内容过滤是多层堆栈,同一请求在不同平台可能被不同层级拒绝。详解四层的工作机制、各层阻止的内容及永久限制。
