Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Ist Claude Fable 5.1 günstiger? Die Cache-Rechnung erklärt
2026/09/07

Ist Claude Fable 5.1 günstiger? Die Cache-Rechnung erklärt

Claude Fable 5.1 behält die $10/$50-Rate, spart aber 75% bei Cache-Lesevorgängen ($0,25). Berechnen Sie echte Kosten und nicht Plan-Gutschriften.

Claude Fable 5.1 ist nicht günstiger als Claude Fable 5 bei den Basis-API-Tarifen: beide kosten $10 pro Million Input-Token und $50 pro Million Output-Token. Die Ersparnis ist enger gefasst und kann erheblich sein. Ein Cache-Lesevorganz kostet bei Fable 5.1 $0,25 pro Million Token, gegenüber $1 bei Fable 5. Cache-Schreibvorgänge kosten auf beiden Modellen gleich viel.[1]

Das garantiert nicht, dass jede Task billiger wird. Ein Job mit wenigen Cache-Treffern, längeren Ausgaben, mehr Tool-Durchläufen oder höherem Effort kann nach der Migration gleich viel oder mehr kosten. Es bedeutet auch nicht, dass ein Claude-Abo-Guthaben um 75% sinkt; Abo-Quoten und API-Token-Rechnungen sind unterschiedliche Abrechnungssysteme. Verwenden Sie die aktuelle Claude-Fable-5.1-Seite für die Route, die Sie aufrufen planen, und berechnen Sie dann mit dem tatsächlichen Verbrauchsdatensatz dieser Route, nicht mit einer in eine Tabelle kopierten Headline-Nummer.

Kurze Antwort

  • Fable 5.1 behält Fable 5s $10/MTok Input und $50/MTok Output.[1]
  • Der messbare Rabatt ist Cache-Lesevorgänge: $0,25/MTok statt $1/MTok. Cache-Schreibkosten sind unverändert.
  • Ein 500K-Token-Cache-Treffer spart also $0,375 vor Ausgabe, Tools, Wiederholungen und abgelehnter Arbeit.
  • Übersetzen Sie diesen API-Rabatt nicht in einen Claude-Plan-Gutschrift-Anspruch; Abo-Quoten und API-Rechnungen sind getrennt.[4]

„Günstiger" kann sich auf vier verschiedene Zahlen beziehen

Die meisten Debatten über dieses Release vermischen mindestens zwei davon:

ZahlWas sie misstKann der Cache-Rate-Schnitt sie ändern?
API-ListenpreisVendor-Rate pro Token-KategorieJa, aber nur die Cache-Read-Kategorie änderte sich
Request-GebührToken-Mengen multipliziert mit den anwendbaren RatenJa, proportional zu Cache-Read-Tokens
Kosten pro abgeschlossener TaskAlle Requests, Wiederholungen, Tools und fehlgeschlagene Versuche für ein akzeptiertes ErgebnisMöglicherweise; Verhalten und Ausgabelänge spielen auch eine Rolle
Abo-NutzungsmeterZuteilung oder Gutschriften in Claude und Claude Code PlänenNicht durch eine einfache $0,75-pro-MTok-Umrechnung

Die ersten zwei können direkt aus einem API-Verwendungsobjekt und einer Ratencard berechnet werden. Die dritte erfordert eine Anwendungsebenen-Task-ID und eine Akzeptanzregel. Die vierte erfordert die offiziellen Regeln für den relevanten Claude-Plan.

Wenn jemand sagt „Fable 5.1 ist 75% günstiger", fragen Sie, welche Zeile sie meinen. Nur die Cache-Read-Unit-Rate fiel um 75%.

Die Ratencard Seite an Seite

Alle unten angegebenen Preise sind direkte Anthropic-API-Listenpreise in US-Dollar pro Million Token vom 7. September 2026.[1]

Token-KategorieClaude Fable 5Claude Fable 5.1Änderung
Basis-Input$10,00$10,00Keine
5-Minuten-Cache-Write$12,50$12,50Keine
1-Stunden-Cache-Write$20,00$20,00Keine
Cache-Hit oder Refresh$1,00$0,25−75%
Output$50,00$50,00Keine
Batch-Input$5,00$5,00Keine
Batch-Output$25,00$25,00Keine

Der Cache-Read-Multiplikator beträgt 0,025 Mal Basis-Input bei Fable 5.1, verglichen mit dem üblichen 0,1-Multiplikator bei Fable 5. Ein 5-Minuten-Write ist 1,25 Mal Basis-Input; ein 1-Stunden-Write ist das Zweifache. Anthropic sagt, diese Cache-Modifizierer können sich mit anderen Modifizierern wie Batch und Datenlokalisierung überlappen.[1]

Zum Beispiel fügt die Anforderung von nur US-Rückschluss einen 1,1-Multiplikator zu Input, Output, Cache-Writes und Cache-Reads auf unterstützten aktuellen Claude-Modellen hinzu. Von Partnern betriebene Cloud-Services haben ihre eigenen Regionalpreise. Ein Kostenblatt sollte daher den Anbieter und die Inferenzregion erfassen, nicht nur den Modellnamen.[1]

Die Formel, die in den Kostenbericht gehört

Jede Token-Anzahl sei in Millionen gemessen:

U   = nicht gecachte Input-Token / 1.000.000
W5  = Token, die in einen 5-Minuten-Cache geschrieben werden / 1.000.000
W60 = Token, die in einen 1-Stunden-Cache geschrieben werden / 1.000.000
R   = Cache-Read-Token / 1.000.000
O   = Output-Token / 1.000.000

Bei direkten Listenraten kostet ein Fable-5.1-Request:

request_cost_5_1 = 10U + 12.5W5 + 20W60 + 0.25R + 50O

Bei Fable 5 ändert sich nur der Cache-Read-Term:

request_cost_5 = 10U + 12.5W5 + 20W60 + 1.00R + 50O

Wenn die Token-Mengen identisch bleiben, ist die Ersparnis daher:

saving = 0.75R

In einfacher Sprache: Jede Million Cache-Read-Token spart $0,75. Die Formel ist bewusst konditioniert. Model-Verhalten kann U, R und O verändern, sowie die Anzahl der Requests, die nötig sind, um die Task zu beenden.

Eine praktische Session mit einem 500K-gecachten Präfix

Betrachten Sie eine hypothetische zehn-Request-Coding-Session. Jeder Request sieht das gleiche 500.000-Token-Repository-Präfix, fügt 20.000 nicht gecachte Input-Token hinzu und erzeugt 5.000 Output-Token. Der erste Request erstellt einen 5-Minuten-Cache-Eintrag; die nächsten neun treffen ihn. Dies ist eine Preis-Illustration, kein gemessener Model-Benchmark.

Erster Request: identische Kosten

500K Cache-Write  = 0,5 × $12,50 = $6,25
20K frischer Input   = 0,02 × $10   = $0,20
5K Output         = 0,005 × $50  = $0,25
erster Request                         $6,70

Beide Versionen kosten $6,70, da ihre Write-, nicht-gecachte-Input- und Output-Raten identisch sind.

Jeder später Cache-Hit

PostenFable 5Fable 5.1
500K Cache-Read$0,500$0,125
20K nicht gecachter Input$0,200$0,200
5K Output$0,250$0,250
Request-Total$0,950$0,575

Über die neun Treffer:

Fable 5 Gesamtbetrag   = $6,70 + (9 × $0,950) = $15,250
Fable 5.1 Gesamtbetrag = $6,70 + (9 × $0,575) = $11,875
Ersparnis                                    $3,375

Die Reduktion liegt bei etwa 22,1% für diese konstruierte Session, obwohl die Cache-Read-Rate um 75% fiel. Der unveränderte Cache-Write, frische Input und Output verdünnen die Ersparnis. Eine Session mit einem größeren Anteil an Cache-Reads würde einen größeren Prozentsatz sparen; eine ohne Cache-Treffer würde bei identischen Token-Mengen nichts sparen.

Wann zahlt sich das Schreiben des Cache aus?

Vergleichen Sie Caching mit wiederholtem Versenden der gleichen Token als normaler Input.

Bei einem 5-Minuten-Fable-5.1-Cache kostet der erste Write das 1,25-fache der normalen Input-Rate und ein Treffer kostet das 0,025-fache. Über einen anfänglichen Request und eine Wiederverwendung kosten die stabilen Präfixe 1,25 + 0,025 = 1,275 Input-Rate-Einheiten statt 2,0 Einheiten nicht gecacht. Es zahlt sich nach einem Cache-Read aus.

Für einen 1-Stunden-Eintrag kostet das erste Write 2,0 Einheiten. Ein Read hinzufügen ergibt 2,025, etwas mehr als zwei nicht-gecachte Sends. Ein zweites Read hinzufügen ergibt 2,05, verglichen mit 3,0 nicht gecacht. Anthropics Preisführer sagt daher, dass die 5-Minuten-Dauer nach einem Cache-Read rentabel ist und die 1-Stunden-Dauer nach zwei.[1]

Diese Arithmetik setzt einen Treffer voraus. Ein sich änderndes Präfix kann erwartete Reads in neue Writes verwandeln. Halten Sie stabile Inhalte zuerst, platzieren Sie volatile Anweisungen später, und überwachen Sie Cache-Erstellungs- und Read-Counts, anstatt das Prompt als gecacht anzunehmen. Die Fable-5.1-API-Dokumentation behandelt die routenspezifische Request-Form; Abrechnungsbestätigung kommt immer noch von den zurückgegebenen Nutzungsfeldern und der Rechnung.

Warum ein billigerer Cache immer noch eine teurere Task produzieren kann

Cache-Preis ist nur ein Term in einem Multi-Request-Job. Verfolgen Sie diese Bewegungsquellen nach der Migration:

Ausgabelänge

Output kostet fünfmal so viel pro Token wie Basis-Input bei den veröffentlichten Raten. Ein zusätzliche 10.000 Output-Token kosten $0,50. Im früheren Beispiel entspricht das mehr als einer 500K-Cache-Read-Ersparnis von $0,375. Legen Sie Output-Grenzen fest und beurteilen Sie nützliche Vollendung statt Länge zu belohnen.

Tool-Durchläufe

Anthropic bemerkt, dass Fable 5.1 möglicherweise einen Tool-Call pro Turn in Situationen erteilt, wo Fable 5 unabhängige Calls batchen könnte. Extra Round-Trips können gecachten Kontext billig wiedergeben, aber sie können auch frische Anweisungen, Tool-Ergebnisse, Ausgaben und Latenz hinzufügen.[3] Zählen Sie die ganze Schleife.

Effort

Fable 5.1 unterstützt fünf Effort-Levels und hat high als Standard. Eine Task, die von einem niedriger alten Setting zu xhigh oder max verschoben wird, kann mehr Reasoning und Zeit verbrauchen, auch wenn Caching verbessert. Vergleichen Sie Einstellungen auf akzeptierten Ergebnissen, anstatt nur den Modellnamen als einzige Variable zu behandeln.[3]

Cache-Ungültigkeit

Das Ändern eines gecachten Präfix, einer Tool-Definition oder eines Gesprächsverlaufs kann die Wiederverwendung reduzieren. Fable 5.1 bindet auch bewahrtes Denken an das Präfix, das es erzeugt hat; unvorsichtige Verlaufsbearbeitungen können Reasoning ablegen und Arbeit neu starten. Die Fable-5.1-Migrationscheckliste behandelt diese Kompatibilitätsregeln.

Gescheiterte und abgelehnte Läufe

Eine niedrigere Pro-Request-Gebühr hilft nicht, wenn mehr Läufe menschliche Korrektur brauchen. Definieren Sie eine akzeptierte Task—Tests bestanden, Schema gültig, Quellen unterstützt, keine verbotenen Dateien geändert—und teilen Sie die Gesamtausgabe durch akzeptierte Tasks statt rohe Requests.

cost_per_accepted_task = total_cost_for_task_cohort / accepted_tasks

Wie man Anthropics 25%- und 45%-Schätzungen liest

Anthropic sagt, Fable 5.1 kostet etwa 25% weniger als Fable 5 für typische Token-abgerechnete Workloads und kann bis etwa 45% für hochgradig agentenhafte Arbeit sparen.[2] Seine Launch-Noten erklären, dass der Vergleich vier Wochen Augusts 2026-Nutzung mit Standard-Effort verwendete; die „typische" Mischung deckte Claude Enterprise, Claude Code und API-Verkehr ab, während die agentin-hafte Mischung kontextintensiv und Tool-intensiv war.

Diese Zahlen sind nützliche Planungs-Priors, nicht Ersatzstoffe für ein Rechnungsmodell. Ihr Cache-Read-Anteil kann niedriger sein. Das neue Modell kann eine unterschiedliche Anzahl von Turns nehmen. Ein Gateway kann auch eine unterschiedliche Ratencard von Anthropics direkter API haben. Beschriften Sie die Schätzungen als vendor-berichtet, wann immer sie in einem Budgetvorschlag erscheinen.

Wenn die API-Berechnung fällt, aber das Claude-Code-Nutzungsmeter nicht, vergleichen Sie sie als separate Abrechnungssysteme, bevor Sie Cache-Verhalten untersuchen. Das Meter kann Plan-Zuteilungen oder Nutzungs-Gutschrift-Regeln anwenden, anstatt eine direkte API-Token-Rechnung freizulegen.

API-Abrechnung ist nicht das Claude-Abo-Meter

Anthropics Help Center sagt, dass Fable 5 und Fable 5.1 auf bezahlten Claude-Plänen gleich funktionieren.[4]

  • Bei Max-Plänen, Premium-Team-Sitzen und Premium-Sitzen bei älteren Seat-basierten Enterprise-Plänen ist Fable-Nutzung bis 50% des wöchentlichen Nutzungslimits enthalten. Er verbrauchte schneller als andere Claude-Modelle; nach dem Fable-Limit kann ein Nutzer Modelle wechseln oder mit Nutzungs-Gutschriften fortfahren.
  • Bei Pro-Plänen und Standard-Team-Sitzen verwenden Fable 5 und 5.1 Pay-as-you-go-Nutzungs-Gutschriften statt der im Plan enthaltenen Nutzung.
  • Standard-Sitze bei Seat-basierten Enterprise brauchen organisationsaktivierte Nutzungs-Gutschriften.
  • Usage-basierte Enterprise und die Claude API werden zu Standard-API-Raten berechnet.

Eine frühere Aktion erlaubte manche Fable-5-Nutzung innerhalb wöchentlicher Grenzen, endete am 19. Juli 2026 und betraf nie Fable 5.1. Alte Beiträge und Screenshots können daher Regeln beschreiben, die nicht mehr zutreffen.[4]

Der praktische Unterschied ist einfach: Eine API-Rechnung offenbart Token-Kategorien, die mit einer Ratencard multipliziert werden können. Ein Claude- oder Claude-Code-Plan-Meter stellt Plan-Policy und Nutzungs-Zuteilung dar. Versuchen Sie nicht, eine aus der anderen rückzuentwickeln, es sei denn, Anthropic veröffentlicht die genaue Umrechnung für dieses Konto und diese Oberfläche.

FAQ

Ist Claude Fable 5.1 75% günstiger als Fable 5?

Nur seine Cache-Read-Unit-Rate ist 75% niedriger. Basis-Input, Cache-Writes und Output behalten die gleichen Raten. Gesamteinsparungen entsprechen der Cache-Read-Reduktion nach Berücksichtigung aller unveränderten Posten und jeder Änderung im Model-Verhalten.

Spare ich Geld, wenn ich keine Prompt-Caching verwende?

Nicht von der veröffentlichten Rate-Änderung bei gleichen Token-Mengen. Fable 5.1 könnte die Task-Kosten trotzdem durch Ausgabelänge, Tool-Durchläufe, Effort, Wiederholungen oder Akzeptanzrate verändern, aber dies sind Workload-Ergebnisse statt Listenpreis-Reduktionen.

Ist automatische Prompt-Caching kostenlos?

Nein. Cache-Erstellung, Cache-Reads und normaler Input haben getrennte Gebühren. Automatisches Caching ändert, wie Breakpoints verwaltet werden; es entfernt die Cache-Write-Gebühr nicht.[1]

Verwendet ein Cache-Refresh die niedrigere Fable-5.1-Rate?

Anthropics Tabelle gruppiert Cache-Hits und Refreshes bei $0,25 pro Million Token für Fable 5.1. Bestätigen Sie die relevanten Nutzungsfelder in der Antwort und Abrechnungsbericht, statt Refreshes nur aus Request-Zahl zu schätzen.

Macht Batch Fable 5.1 halb Preis?

Anthropic führt Batch-Input und Output mit 50% unter Standard-Raten für beide Fable-Versionen auf. Cache und andere Modifizierer können stapeln, also berechnen Sie jede Token-Kategorie, statt eine gesamte gemischte Rechnung durch zwei zu teilen.[1]

Warum fiel meine Claude-Code-Nutzung nach dem Wechsel nicht?

Das Plan-Meter ist nicht einfach der API-Cache-Read-Posten. Stellen Sie zuerst fest, ob die Session in der Abo-Zuteilung enthalten oder mit Nutzungs-Gutschriften berechnet wurde, dann vergleichen Sie ähnliche-für-ähnliche Sessions. Kontrollieren Sie auch Output, Effort, Tool-Durchläufe, Cache-Hits und ob das Prompt-Präfix stabil blieb.

Der Rechnungs-Test, den Sie vor dem Wechsel der Standard durchführen sollten

Exportieren Sie mindestens einen normalen Abrechnungszyklus und gruppieren Sie Requests nach Anwendungs-Task-ID. Für jedes Modell summieren Sie nicht gecachten Input, 5-Minuten-Writes, 1-Stunden-Writes, Cache-Reads, Output, Wiederholungen und akzeptierte Tasks. Preisen Sie die alten Token-Mengen mit der neuen Ratencard neu ein, um den Cache-Rabatt zu isolieren; dann vergleichen Sie diese Schätzung mit tatsächlichen Fable-5.1-Mengen, um Verhaltensänderungen freizulegen.

Wenn die neu-eingepreiste Schätzung niedriger ist, aber die beobachtete Task-Kosten höher ist, arbeitet der Cache-Rabatt—die Workload-Form änderte sich. Dieses Ergebnis ist hilfreicher als über das Wort „günstiger" zu streiten: es zeigt direkt auf Output-Wachstum, verlorene Cache-Treffer, extra Turns oder fehlgeschlagene Arbeit hin.

Referenzen

  1. Anthropic, API pricing, accessed September 7, 2026.
  2. Anthropic, Introducing Claude Fable 5.1 and Mythos 5.1, September 1, 2026.
  3. Anthropic, Migrating to Claude Fable 5.1 and Claude Mythos 5.1, accessed September 7, 2026.
  4. Anthropic Help Center, Claude Fable models on your plan, accessed September 7, 2026.