
Claude Fable 5.1 便宜吗?缓存费率与实际成本分析
Claude Fable 5.1 保留 $10/$50 费率,缓存读取降至 $0.25。计算实际成本,区分 API 计费与订阅用量。
Claude Fable 5.1 在 API 列表费率上并非比 Claude Fable 5 更便宜:两个模型的费率都是每百万输入 token $10、每百万输出 token $50。节省之处更为具体且可能很可观。Fable 5.1 的缓存读取成本为每百万 token $0.25,低于 Fable 5 的 $1。缓存写入费率在两个模型上都相同。[1]
这并不保证每个任务的账单都会降低。缓存命中次数少、输出更长、工具轮次更多或采用更高推理档次的任务,迁移后可能成本相同甚至更高。它也不意味着 Claude 订阅用量计会下降 75%;订阅额度和 API token 发票采用不同的计费系统。请根据你计划调用的路由使用当前 Claude Fable 5.1 模型页,然后用该路由的实际使用记录计算成本,而不是把上游费率复制进电子表格。
快速答案
- Fable 5.1 保持 Fable 5 的 $10/MTok 输入和 $50/MTok 输出 费率。[1]
- 可衡量的折扣是缓存读取:每百万 token $0.25,而非 $1。缓存写入价格不变。
- 一次 500K token 的缓存命中可在输出、工具、重试和被拒工作计入前节省 $0.375。
- 不要把 API 折扣理解为 Claude 计划额度下降;订阅计和 API 发票是分开的。[4]
"便宜"可以指四个不同的数字
这个版本发布后的大多数讨论混淆了至少两个数字:
| 数字 | 衡量什么 | 缓存费率下降能改变它吗? |
|---|---|---|
| API 列表价格 | 每个 token 类别的供应商费率 | 可以,但只有缓存读取类别改变 |
| 请求费用 | token 数量乘以适用费率 | 可以,比例与缓存读取 token 成正比 |
| 单次已完成任务成本 | 接受一个结果所需的全部请求、重试、工具和失败尝试 | 可能;行为和输出长度也很重要 |
| 订阅用量计 | Claude 和 Claude Code 计划中的额度或用量学分 | 不能通过简单 $0.75/MTok 转换 |
前两个可以直接从 API 使用对象和费率卡计算。第三个需要应用级任务 ID 和验收规则。第四个需要相关 Claude 计划的官方规则。
如果有人说"Fable 5.1 便宜 75%",问清楚是指哪一行。只有缓存读取单位费率下降了 75%。
费率卡对照
下面的价格都是 Anthropic API 列表价格,以美元计,每百万 token,截至 2026 年 9 月 7 日。[1]
| Token 类别 | Claude Fable 5 | Claude Fable 5.1 | 变化 |
|---|---|---|---|
| 基础输入 | $10.00 | $10.00 | 无 |
| 5 分钟缓存写入 | $12.50 | $12.50 | 无 |
| 1 小时缓存写入 | $20.00 | $20.00 | 无 |
| 缓存命中或刷新 | $1.00 | $0.25 | −75% |
| 输出 | $50.00 | $50.00 | 无 |
| Batch 输入 | $5.00 | $5.00 | 无 |
| Batch 输出 | $25.00 | $25.00 | 无 |
Fable 5.1 的缓存读取乘数是基础输入的 0.025 倍,而 Fable 5 是通常的 0.1 倍。5 分钟写入是基础输入的 1.25 倍;1 小时写入是 2 倍。Anthropic 说这些缓存修饰符可以与其他修饰符(如 Batch 和数据驻留)叠加。[1]
例如,请求仅美国推理会在支持的最新 Claude 模型上为输入、输出、缓存写入和缓存读取增加 1.1 倍乘数。由合作伙伴运营的云服务有自己的地域定价。因此,成本工作表应记录提供商和推理区域,而不仅仅是模型名称。[1]
应纳入成本报告的公式
设每个 token 计数以百万为单位:
U = 未缓存输入 token / 1,000,000
W5 = 写入 5 分钟缓存的 token / 1,000,000
W60 = 写入 1 小时缓存的 token / 1,000,000
R = 缓存读取 token / 1,000,000
O = 输出 token / 1,000,000按直接列表费率,一个 Fable 5.1 请求的成本是:
request_cost_5_1 = 10U + 12.5W5 + 20W60 + 0.25R + 50O对于 Fable 5,只有缓存读取项改变:
request_cost_5 = 10U + 12.5W5 + 20W60 + 1.00R + 50O如果 token 数量保持相同,节省就是:
saving = 0.75R用通俗语言说,每百万缓存读取 token 节省 $0.75。公式是故意有条件的。模型行为可以改变 U、R 和 O,以及完成任务所需的请求数。
一个 500K 缓存前缀的完整会话示例
考虑一个假设的十次请求编码会话。每次请求看到相同的 500,000 token 存储库前缀,添加 20,000 未缓存输入 token,并生成 5,000 输出 token。第一个请求创建一个 5 分钟缓存条目;接下来的九个命中它。这是定价演示,不是测量的模型基准。
第一次请求:成本相同
500K 缓存写入 = 0.5 × $12.50 = $6.25
20K 新鲜输入 = 0.02 × $10 = $0.20
5K 输出 = 0.005 × $50 = $0.25
第一次请求 $6.70两个版本都是 $6.70,因为它们的写入、未缓存输入和输出费率相同。
每次后续缓存命中
| 行项 | Fable 5 | Fable 5.1 |
|---|---|---|
| 500K 缓存读取 | $0.500 | $0.125 |
| 20K 未缓存输入 | $0.200 | $0.200 |
| 5K 输出 | $0.250 | $0.250 |
| 请求总计 | $0.950 | $0.575 |
跨越九次命中:
Fable 5 总计 = $6.70 + (9 × $0.950) = $15.250
Fable 5.1 总计 = $6.70 + (9 × $0.575) = $11.875
节省 $3.375对于这个构造的会话,降幅约为 22.1%,尽管缓存读取费率下降了 75%。不变的缓存写入、新鲜输入和输出稀释了节省。缓存读取占比更大的会话会节省更大的百分比;完全没有缓存命中的会话在 token 数相同时不会节省任何东西。
何时缓存写入才值得?
对比缓存与反复发送相同 token 作为普通输入。
对于 5 分钟的 Fable 5.1 缓存,第一次写入成本是普通输入费率的 1.25 倍,一次命中成本是 0.025 倍。在初始请求和一次重用中,稳定前缀成本是 1.25 + 0.025 = 1.275 输入费率单位,而不是 2.0 单位未缓存。一次缓存读取后就值得。
对于 1 小时条目,第一次写入成本是 2.0 单位。加入一次读取会得到 2.025,略多于两次未缓存发送。加入第二次读取会得到 2.05,相比 3.0 未缓存。Anthropic 的定价指南据此说 5 分钟时长在一次缓存读取后值得,1 小时时长在两次后值得。[1]
这个算术假设命中。变化的前缀可以把预期的读取变成新写入。保持稳定内容在前,放置不稳定指令在后,并监控缓存创建和读取计数,而不是假设 prompt 已缓存。Fable 5.1 API 文档涵盖路由特定的请求形状;计费确认仍来自返回的使用字段和发票。
为什么更便宜的缓存仍可能产生更贵的任务
缓存价格是多请求任务中的一项。迁移后,追踪这些变化来源:
输出长度
输出每 token 成本是按公布费率计基础输入的五倍。额外 10,000 输出 token 成本 $0.50。在早前的例子中,这等于超过一次 500K 缓存读取节省的 $0.375。设置输出限制并评分有用完成,而不是奖励长度。
工具轮次
Anthropic 指出 Fable 5.1 在某些情况下可能每轮发出一次工具调用,而 Fable 5 可能批量处理独立调用。额外往返可以便宜地重放缓存上下文,但它们也可以添加新指令、工具结果、输出和延迟。[3]统计整个循环。
推理档次
Fable 5.1 支持五个推理档次,默认为 high。从较低的旧设置迁移到 xhigh 或 max 的任务可能消耗更多推理和时间,即使缓存改进。在已接受的结果上比较设置,而不是只把模型名称作为唯一变量。[3]
缓存失效
改变缓存前缀、工具定义或会话历史可以减少重用。Fable 5.1 也将保留的思考绑定到生成它的前缀;不小心的历史编辑可以丢弃推理并重启工作。Fable 5.1 迁移检查表涵盖这些兼容性规则。
失败和被拒的运行
如果更多运行需要人工纠正,较低的单请求费用无济于事。定义一个已接受的任务——测试通过、schema 有效、来源支持、禁止文件未改——并将总支出除以已接受任务,而不是原始请求。
cost_per_accepted_task = total_cost_for_task_cohort / accepted_tasks如何理解 Anthropic 的 25% 和 45% 估计
Anthropic 说 Fable 5.1 对典型 token 计费工作负载成本约少 25%,对高度智能体工作可能节省约 45%。[2]其发布说明解释比较使用了 2026 年 8 月四周的使用情况,采用默认推理档次;"典型"组合覆盖 Claude Enterprise、Claude Code 和 API 流量,而智能体组合是上下文密集和工具密集的。
这些数字是有用的规划先验,不是发票模型的替代品。你的缓存读取占比可能更低。新模型可能需要不同数量的轮次。网关也可能有不同于 Anthropic 直接 API 的费率卡。标签这些估计为供应商报告,无论何时它们出现在预算提案中。
如果 API 计算下降但 Claude Code 用量计未下降,在调查缓存行为之前把它们作为分开的计费系统进行比较。计数器可能在应用计划额度或用量学分规则,而不是暴露直接 API token 发票。
API 计费不是 Claude 订阅计
Anthropic 帮助中心说 Fable 5 和 Fable 5.1 在付费 Claude 计划中的工作方式相同。[4]
- 在 Max 计划、高级团队席位和高级座位制企业计划上,Fable 使用被包含在每周使用限额的 50% 内。它比其他 Claude 模型更快地消耗该限额;在 Fable 限额后,用户可以切换模型或继续使用学分。
- 在 Pro 计划和标准团队席位上,Fable 5 和 5.1 使用按需学分,而不是计划的包含使用。
- 座位制企业的标准席位需要组织启用的使用学分。
- 基于使用的企业和 Claude API 按标准 API 费率计费。
早前的推广允许一些 Fable 5 在每周限额内使用,于 2026 年 7 月 19 日结束,从未应用于 Fable 5.1。旧帖子和截图因此可能描述不再适用的规则。[4]
实际区分很简单:API 发票暴露可以乘以费率卡的 token 类别。Claude 或 Claude Code 计划计数器代表计划政策和使用分配。除非 Anthropic 发布该账户和表面的精确转换,否则不要试图从另一个反向工程。
FAQ
Claude Fable 5.1 比 Fable 5 便宜 75% 吗?
只有它的缓存读取单位费率低 75%。基础输入、缓存写入和输出保留相同的费率。总节省等于缓存读取削减减去模型行为的任何变化。
如果我不使用 prompt 缓存会省钱吗?
当 token 数相同时,从公布的费率变化来看不会。Fable 5.1 仍可通过输出长度、工具轮次、推理档次、重试或验收率改变任务成本,但这些是工作负载结果而非列表价格削减。
自动 prompt 缓存是免费的吗?
不是。缓存创建、缓存读取和普通输入有分开的费用。自动缓存改变断点如何管理;它不移除缓存写入费用。[1]
缓存刷新使用较低的 Fable 5.1 费率吗?
Anthropic 的表将缓存命中和刷新分组为 Fable 5.1 的每百万 token $0.25。确认响应中的相关使用字段和计费报告,而不是仅从请求计数估计刷新。
Batch 能让 Fable 5.1 半价吗?
Anthropic 在两个 Fable 版本的标准费率下 50% 列出 Batch 输入和输出。缓存和其他修饰符可以叠加,所以计算每个 token 类别而不是将整个混合发票除以二。[1]
为什么我的 Claude Code 用量在切换后未下降?
计划计数器不是简单的 API 缓存读取行项。首先识别会话是否使用了包含的计划额度或使用学分,然后比较类似的会话。还要检查输出、推理档次、工具轮次、缓存命中以及 prompt 前缀是否保持稳定。
切换默认之前运行的发票测试
导出至少一个正常计费周期并按应用任务 ID 分组请求。对于每个模型,汇总未缓存输入、5 分钟写入、1 小时写入、缓存读取、输出、重试和已接受任务。用新费率卡对旧 token 数量重新定价,隔离缓存折扣;然后与实际 Fable 5.1 数量比较以暴露行为变化。
如果重新定价的估计较低但观察的任务成本较高,缓存折扣在工作——工作负载形状改变。这个发现比争论"便宜"这个词更可操作:它直接指向输出增长、丢失的缓存命中、额外轮次或失败工作。
参考
- Anthropic,API 定价,访问于 2026 年 9 月 7 日。
- Anthropic,推出 Claude Fable 5.1 和 Mythos 5.1,2026 年 9 月 1 日。
- Anthropic,迁移到 Claude Fable 5.1 和 Claude Mythos 5.1,访问于 2026 年 9 月 7 日。
- Anthropic 帮助中心,你的计划上的 Claude Fable 模型,访问于 2026 年 9 月 7 日。
作者

分类
更多文章

用 AI 修复旧视频:完整指南与成本分析
通过 API 修复旧视频:old_film 预设配置、请求字段完整说明、真实存档成本示例从 $2.46 一卷起、对自动化修复能力边界的诚实评估。


AI 视频连续性维护:跨片段的状态账本方法
掌握状态账本、边界帧、延续提示词、API 调用、连续性检查和修复规则,在多个 AI 生成的视频片段中保持并维护完整连续性。


文档转视频 AI API: PDF、PPT、XLS、DOCX 和网页
用 Wan 3.0 从 PDF、演示文稿、表格或文档生成 2-30 秒的视频。了解输入限制、精确成本计算和完整请求示例。
