Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Claude Fable 5.1 便宜吗?缓存费率与实际成本分析
2026/09/07

Claude Fable 5.1 便宜吗?缓存费率与实际成本分析

Claude Fable 5.1 保留 $10/$50 费率,缓存读取降至 $0.25。计算实际成本,区分 API 计费与订阅用量。

Claude Fable 5.1 在 API 列表费率上并非比 Claude Fable 5 更便宜:两个模型的费率都是每百万输入 token $10、每百万输出 token $50。节省之处更为具体且可能很可观。Fable 5.1 的缓存读取成本为每百万 token $0.25,低于 Fable 5 的 $1。缓存写入费率在两个模型上都相同。[1]

这并不保证每个任务的账单都会降低。缓存命中次数少、输出更长、工具轮次更多或采用更高推理档次的任务,迁移后可能成本相同甚至更高。它也不意味着 Claude 订阅用量计会下降 75%;订阅额度和 API token 发票采用不同的计费系统。请根据你计划调用的路由使用当前 Claude Fable 5.1 模型页,然后用该路由的实际使用记录计算成本,而不是把上游费率复制进电子表格。

快速答案

  • Fable 5.1 保持 Fable 5 的 $10/MTok 输入和 $50/MTok 输出 费率。[1]
  • 可衡量的折扣是缓存读取:每百万 token $0.25,而非 $1。缓存写入价格不变。
  • 一次 500K token 的缓存命中可在输出、工具、重试和被拒工作计入前节省 $0.375。
  • 不要把 API 折扣理解为 Claude 计划额度下降;订阅计和 API 发票是分开的。[4]

"便宜"可以指四个不同的数字

这个版本发布后的大多数讨论混淆了至少两个数字:

数字衡量什么缓存费率下降能改变它吗?
API 列表价格每个 token 类别的供应商费率可以,但只有缓存读取类别改变
请求费用token 数量乘以适用费率可以,比例与缓存读取 token 成正比
单次已完成任务成本接受一个结果所需的全部请求、重试、工具和失败尝试可能;行为和输出长度也很重要
订阅用量计Claude 和 Claude Code 计划中的额度或用量学分不能通过简单 $0.75/MTok 转换

前两个可以直接从 API 使用对象和费率卡计算。第三个需要应用级任务 ID 和验收规则。第四个需要相关 Claude 计划的官方规则。

如果有人说"Fable 5.1 便宜 75%",问清楚是指哪一行。只有缓存读取单位费率下降了 75%。

费率卡对照

下面的价格都是 Anthropic API 列表价格,以美元计,每百万 token,截至 2026 年 9 月 7 日。[1]

Token 类别Claude Fable 5Claude Fable 5.1变化
基础输入$10.00$10.00
5 分钟缓存写入$12.50$12.50
1 小时缓存写入$20.00$20.00
缓存命中或刷新$1.00$0.25−75%
输出$50.00$50.00
Batch 输入$5.00$5.00
Batch 输出$25.00$25.00

Fable 5.1 的缓存读取乘数是基础输入的 0.025 倍,而 Fable 5 是通常的 0.1 倍。5 分钟写入是基础输入的 1.25 倍;1 小时写入是 2 倍。Anthropic 说这些缓存修饰符可以与其他修饰符(如 Batch 和数据驻留)叠加。[1]

例如,请求仅美国推理会在支持的最新 Claude 模型上为输入、输出、缓存写入和缓存读取增加 1.1 倍乘数。由合作伙伴运营的云服务有自己的地域定价。因此,成本工作表应记录提供商和推理区域,而不仅仅是模型名称。[1]

应纳入成本报告的公式

设每个 token 计数以百万为单位:

U   = 未缓存输入 token / 1,000,000
W5  = 写入 5 分钟缓存的 token / 1,000,000
W60 = 写入 1 小时缓存的 token / 1,000,000
R   = 缓存读取 token / 1,000,000
O   = 输出 token / 1,000,000

按直接列表费率,一个 Fable 5.1 请求的成本是:

request_cost_5_1 = 10U + 12.5W5 + 20W60 + 0.25R + 50O

对于 Fable 5,只有缓存读取项改变:

request_cost_5 = 10U + 12.5W5 + 20W60 + 1.00R + 50O

如果 token 数量保持相同,节省就是:

saving = 0.75R

用通俗语言说,每百万缓存读取 token 节省 $0.75。公式是故意有条件的。模型行为可以改变 URO,以及完成任务所需的请求数。

一个 500K 缓存前缀的完整会话示例

考虑一个假设的十次请求编码会话。每次请求看到相同的 500,000 token 存储库前缀,添加 20,000 未缓存输入 token,并生成 5,000 输出 token。第一个请求创建一个 5 分钟缓存条目;接下来的九个命中它。这是定价演示,不是测量的模型基准。

第一次请求:成本相同

500K 缓存写入  = 0.5 × $12.50 = $6.25
20K 新鲜输入   = 0.02 × $10   = $0.20
5K 输出        = 0.005 × $50  = $0.25
第一次请求                       $6.70

两个版本都是 $6.70,因为它们的写入、未缓存输入和输出费率相同。

每次后续缓存命中

行项Fable 5Fable 5.1
500K 缓存读取$0.500$0.125
20K 未缓存输入$0.200$0.200
5K 输出$0.250$0.250
请求总计$0.950$0.575

跨越九次命中:

Fable 5 总计   = $6.70 + (9 × $0.950) = $15.250
Fable 5.1 总计 = $6.70 + (9 × $0.575) = $11.875
节省                                    $3.375

对于这个构造的会话,降幅约为 22.1%,尽管缓存读取费率下降了 75%。不变的缓存写入、新鲜输入和输出稀释了节省。缓存读取占比更大的会话会节省更大的百分比;完全没有缓存命中的会话在 token 数相同时不会节省任何东西。

何时缓存写入才值得?

对比缓存与反复发送相同 token 作为普通输入。

对于 5 分钟的 Fable 5.1 缓存,第一次写入成本是普通输入费率的 1.25 倍,一次命中成本是 0.025 倍。在初始请求和一次重用中,稳定前缀成本是 1.25 + 0.025 = 1.275 输入费率单位,而不是 2.0 单位未缓存。一次缓存读取后就值得。

对于 1 小时条目,第一次写入成本是 2.0 单位。加入一次读取会得到 2.025,略多于两次未缓存发送。加入第二次读取会得到 2.05,相比 3.0 未缓存。Anthropic 的定价指南据此说 5 分钟时长在一次缓存读取后值得,1 小时时长在两次后值得。[1]

这个算术假设命中。变化的前缀可以把预期的读取变成新写入。保持稳定内容在前,放置不稳定指令在后,并监控缓存创建和读取计数,而不是假设 prompt 已缓存。Fable 5.1 API 文档涵盖路由特定的请求形状;计费确认仍来自返回的使用字段和发票。

为什么更便宜的缓存仍可能产生更贵的任务

缓存价格是多请求任务中的一项。迁移后,追踪这些变化来源:

输出长度

输出每 token 成本是按公布费率计基础输入的五倍。额外 10,000 输出 token 成本 $0.50。在早前的例子中,这等于超过一次 500K 缓存读取节省的 $0.375。设置输出限制并评分有用完成,而不是奖励长度。

工具轮次

Anthropic 指出 Fable 5.1 在某些情况下可能每轮发出一次工具调用,而 Fable 5 可能批量处理独立调用。额外往返可以便宜地重放缓存上下文,但它们也可以添加新指令、工具结果、输出和延迟。[3]统计整个循环。

推理档次

Fable 5.1 支持五个推理档次,默认为 high。从较低的旧设置迁移到 xhighmax 的任务可能消耗更多推理和时间,即使缓存改进。在已接受的结果上比较设置,而不是只把模型名称作为唯一变量。[3]

缓存失效

改变缓存前缀、工具定义或会话历史可以减少重用。Fable 5.1 也将保留的思考绑定到生成它的前缀;不小心的历史编辑可以丢弃推理并重启工作。Fable 5.1 迁移检查表涵盖这些兼容性规则。

失败和被拒的运行

如果更多运行需要人工纠正,较低的单请求费用无济于事。定义一个已接受的任务——测试通过、schema 有效、来源支持、禁止文件未改——并将总支出除以已接受任务,而不是原始请求。

cost_per_accepted_task = total_cost_for_task_cohort / accepted_tasks

如何理解 Anthropic 的 25% 和 45% 估计

Anthropic 说 Fable 5.1 对典型 token 计费工作负载成本约少 25%,对高度智能体工作可能节省约 45%。[2]其发布说明解释比较使用了 2026 年 8 月四周的使用情况,采用默认推理档次;"典型"组合覆盖 Claude Enterprise、Claude Code 和 API 流量,而智能体组合是上下文密集和工具密集的。

这些数字是有用的规划先验,不是发票模型的替代品。你的缓存读取占比可能更低。新模型可能需要不同数量的轮次。网关也可能有不同于 Anthropic 直接 API 的费率卡。标签这些估计为供应商报告,无论何时它们出现在预算提案中。

如果 API 计算下降但 Claude Code 用量计未下降,在调查缓存行为之前把它们作为分开的计费系统进行比较。计数器可能在应用计划额度或用量学分规则,而不是暴露直接 API token 发票。

API 计费不是 Claude 订阅计

Anthropic 帮助中心说 Fable 5 和 Fable 5.1 在付费 Claude 计划中的工作方式相同。[4]

  • 在 Max 计划、高级团队席位和高级座位制企业计划上,Fable 使用被包含在每周使用限额的 50% 内。它比其他 Claude 模型更快地消耗该限额;在 Fable 限额后,用户可以切换模型或继续使用学分。
  • 在 Pro 计划和标准团队席位上,Fable 5 和 5.1 使用按需学分,而不是计划的包含使用。
  • 座位制企业的标准席位需要组织启用的使用学分。
  • 基于使用的企业和 Claude API 按标准 API 费率计费。

早前的推广允许一些 Fable 5 在每周限额内使用,于 2026 年 7 月 19 日结束,从未应用于 Fable 5.1。旧帖子和截图因此可能描述不再适用的规则。[4]

实际区分很简单:API 发票暴露可以乘以费率卡的 token 类别。Claude 或 Claude Code 计划计数器代表计划政策和使用分配。除非 Anthropic 发布该账户和表面的精确转换,否则不要试图从另一个反向工程。

FAQ

Claude Fable 5.1 比 Fable 5 便宜 75% 吗?

只有它的缓存读取单位费率低 75%。基础输入、缓存写入和输出保留相同的费率。总节省等于缓存读取削减减去模型行为的任何变化。

如果我不使用 prompt 缓存会省钱吗?

当 token 数相同时,从公布的费率变化来看不会。Fable 5.1 仍可通过输出长度、工具轮次、推理档次、重试或验收率改变任务成本,但这些是工作负载结果而非列表价格削减。

自动 prompt 缓存是免费的吗?

不是。缓存创建、缓存读取和普通输入有分开的费用。自动缓存改变断点如何管理;它不移除缓存写入费用。[1]

缓存刷新使用较低的 Fable 5.1 费率吗?

Anthropic 的表将缓存命中和刷新分组为 Fable 5.1 的每百万 token $0.25。确认响应中的相关使用字段和计费报告,而不是仅从请求计数估计刷新。

Batch 能让 Fable 5.1 半价吗?

Anthropic 在两个 Fable 版本的标准费率下 50% 列出 Batch 输入和输出。缓存和其他修饰符可以叠加,所以计算每个 token 类别而不是将整个混合发票除以二。[1]

为什么我的 Claude Code 用量在切换后未下降?

计划计数器不是简单的 API 缓存读取行项。首先识别会话是否使用了包含的计划额度或使用学分,然后比较类似的会话。还要检查输出、推理档次、工具轮次、缓存命中以及 prompt 前缀是否保持稳定。

切换默认之前运行的发票测试

导出至少一个正常计费周期并按应用任务 ID 分组请求。对于每个模型,汇总未缓存输入、5 分钟写入、1 小时写入、缓存读取、输出、重试和已接受任务。用新费率卡对旧 token 数量重新定价,隔离缓存折扣;然后与实际 Fable 5.1 数量比较以暴露行为变化。

如果重新定价的估计较低但观察的任务成本较高,缓存折扣在工作——工作负载形状改变。这个发现比争论"便宜"这个词更可操作:它直接指向输出增长、丢失的缓存命中、额外轮次或失败工作。

参考

  1. Anthropic,API 定价,访问于 2026 年 9 月 7 日。
  2. Anthropic,推出 Claude Fable 5.1 和 Mythos 5.1,2026 年 9 月 1 日。
  3. Anthropic,迁移到 Claude Fable 5.1 和 Claude Mythos 5.1,访问于 2026 年 9 月 7 日。
  4. Anthropic 帮助中心,你的计划上的 Claude Fable 模型,访问于 2026 年 9 月 7 日。