ai-machine-learning

Claude Fable 5.1 Review: Wir haben es gegen Fable 5 und Opus 5 gemessen

Geschrieben von Mert Batur
Sep 2, 2026
8 Lesezeit
Claude Fable 5.1 Review: Wir haben es gegen Fable 5 und Opus 5 gemessen

Claude Fable 5.1 Review: Wir haben es gegen Fable 5 und Opus 5 gemessen

Claude Fable 5.1 ging am 2026-09-01 zum gleichen $10/$50 wie Fable 5 live, Cache-Reads auf $0.25 gesenkt. Am nächsten Morgen um 08:55 UTC haben wir 14 passende OpenRouter-Tasks laufen lassen. Die 45 % agentische Ersparnis stand nicht auf dieser Rechnung: alle drei Modelle bestanden 14/14, und 5.1 stellte $0.14693 in Rechnung gegen Opus 5 mit $0.080725.

Anthropics allgemein verfügbare Frontier-ID ist claude-fable-5-1, GA 2026-09-01, $10/$50 pro Million Tokens, Cache-Read $0.25. Mythos 5.1 sind dieselben Weights mit anderen (lockeren Cyber-/Bio-)Safeguards, nur Glasswing. Knowledge-Cutoff Juni 2026. Thinking ist immer an.

Claude Fable 5.1 vs Fable 5 vs Opus 5: die Wechsel-Tabelle

Bleib bei diesem 14-Task-Set bei Opus 5; Fable 5.1 traf die Genauigkeit und kostete 1.11× Fable 5.

Wir haben anthropic/claude-fable-5.1 am Morgen nach dem GA aufgerufen. Die Listenpreiskarte hat sich nicht bewegt: $10/$50, wie bei Fable 5. Claude Opus 5 liegt bei $5/$25. Cache-Read ist die einzige Listenpreis-Änderung ($0.25 vs $1.00), und hier hat sie nicht gegriffen.

Opus 5 ist auf diesem 14-Task-Set 45 % günstiger als Fable 5.1, weil der Listenpreis $5/$25 gegen $10/$50 steht, nicht weil weniger Tokens verbraucht wurden.

Fable 5.1Fable 5Opus 5
Listenpreis $ in/out$10/$50$10/$50$5/$25
Cache-Read$0.25 / MTok$1.00 / MTokn/a
Default-EffortHigh in Claude Code; Medium auf claude.ai / Coworkn/aHigh
Vendor-HeadlineTerminal-Bench-Science 52.6%24.7%29.0%
Rechnung (unser Meter)$0.14693, 14/14$0.13285, 14/14$0.080725, 14/14
WechselCache-schwere Agentenkurze uncached Callsbegrenzte Einzelaufrufe

Gleiche Weights, zwei Türen, und eine davon antwortet nicht

Mythos 5.1 sind dieselben Weights mit lockeren Cyber-/Bio-Safeguards, und es liegt nicht auf OpenRouter.

Anthropics Launch-Satz ist wörtlich: „Claude Fable 5.1 and Claude Mythos 5.1 are the same model, but with different levels of safeguards." Fable ist GA (claude-fable-5-1, Bedrock anthropic.claude-fable-5-1). Mythos ist claude-mythos-5-1 hinter Project Glasswing / CVP / LSVP, derzeit ein Kreis US-Organisationen. 1M Kontext, 128k max Output, Cutoff Juni 2026 gegen Januar 2026 bei Fable 5. Unser Experiment hat $0.53795 gekostet. Mythos wurde nicht aufgerufen.

python
# OpenRouter slugs we actually sent on 2026-09-02
MODELS = [
    "anthropic/claude-fable-5.1",
    "anthropic/claude-fable-5",
    "anthropic/claude-opus-5",
    # claude-mythos-5-1: not listed / Glasswing only
]

Welche Claude-Fable-5.1-Benches haben sich wirklich bewegt?

Terminal-Bench-Science 0.1 ist der Sprung: 52.6% bei Fable 5.1 gegen 24.7% bei Fable 5.

Fable 5 lag bei 24.7%, Opus 5 bei 29.0%. Der Sprung erklärt, warum agentic Coding-Loops mehr zählen als unsere 14 kurzen Calls.

BenchFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.6%24.7%29.0%22,4 %
Terminal-Bench 4.055.8% (Mythos 5.1: 60.9%)42,0 %52,3 %37,3 %
GDPval-AA v21853172318241711
OSWorld 2.0 partial / strict77,9 % / 41,7 %72,9 % / 36,1 %75,4 % / 39,6 %n/a
HLE no tools / with tools60.9% / 65,0 %57,8 % / 63,8 %56,6 % / 63,6 %n/a
AutomationBench31,4 %17,1 %26,9 %19,6 %
CursorBench 3.2.073,4 %70,5 %70,0 %67,2 %

Quelle: Anthropic-Ankündigung, 2026-09-01.

QuelleBefundScope
Artificial Analysis, 2026-09-01Intelligence Index 66 bei maxFable 5 max 62; Opus 5 max 63
Artificial Analysis$3.76 / Task vs Fable 5 $3.14 (+20 %)~1,7× Output; ~$5.16 ohne den Schnitt; xhigh 65 bei $2.72
Snorkel, 2026-09-0158 % weniger Tokens, 36 % schnellernur vs Opus-5-Erfolge; 18 / 5 / 2 / 2; pass@1 61,5 %; Build/Dep 18 % vs 67 %

Snorkels 58 % / 36 % gelten nur gegen Opus 5 auf erfolgreichen Läufen, nicht gegen Fable 5. Opus hat trotzdem drei Tasks mehr gelöst (18 beide / 5 nur Opus / 2 nur Fable).

  1. Terminal-Bench-Science SE ±3,5–4,5 Pkt. Das öffentliche Leaderboard (3 Trials/Task, Claude-Code-Runner) meldet Opus 5 30,0 % und Fable 5 21,4 %; Anthropics Setup reproduziert 29.0% und 24.7%, beides im Rauschen.
  2. OSWorld 2.0 ist der August-2026-Task-Release der Autoren; Fable 5 und Opus 5 wurden unter denselben Bedingungen erneut gefahren. Nicht vergleichbar mit älteren OSWorld-Zahlen.
  3. Produktions-Safeguards waren an. Interventionen zählten als Null auf OSWorld (beide Fables) und auf AutomationBench (Fable 5). Andere Cyber-Tasks fielen auf Opus 4.8 zurück; Biologie auf Opus 5. Das unterschätzt die Rohfähigkeit wahrscheinlich.

Sitzt die 25%-Ersparnis von Claude Fable 5.1 auf deiner Rechnung?

Die Cache-Read-Zeile ist 75 % günstiger; der ganze kurze Follow-up war nur 21 % günstiger.

Anthropics Launch-Post schätzt ~25 % typische und ~45 % agentische Ersparnis gegen Fable 5. Beides braucht dominante Cache-Reads und Output-Tokens, die nicht nach oben springen. Die Docs-Rate-Card: Cache-Write $12.50 / $20, Output $50, Cache-Read $1.00 → $0.25 / MTok. Workload-Kostenmodelle entscheiden, ob dieser Schnitt das Token-Budget anderswo überlebt.

SzenarioLabelFable 5Fable 5.1Delta
Zeile A: 20-Turn / ~1M (9,5M Cache-Reads, Writes $12.50, Output $50)Listenpreis-Identität, nicht unser Meter$72.00 ($9.50 Cache)$64.88 ($2.38 Cache)-9,9 %
Zeile B: Intelligence-Index-TaskArtificial Analysis, 2026-09-01$3.14$3.76 (~$5.16 ohne den Schnitt)+20 % bei max (~1,7× Output)
Zeile C: 1,165-Token-Prefix, Turn 2Techsy OpenRouter, 2026-09-02$0.005086$0.00402125ganzer Turn 21 % günstiger
Turn-2-Zeile (Rechnung, unser Meter)Fable 5.1Fable 5
Cached Input-Tokens1,1651,166
Cache-Read-Zeile$0.000291$0.001166
OpenRouter usage.cost$0.00402125$0.005086

Die Cache-Read-Zeile ist 75.0% günstiger ($0.000291 vs $0.001166). Die Ersparnis für den ganzen Turn bleibt bei 21 %, weil Output weiter mit $50/M abgerechnet wird. Skaliere die Cache-Zeile auf 40 Rereads × 200.000 Tokens: $2.00 bei 5.1 gegen $8.00 bei 5.

AY Automate fragte am 2026-09-01 „Is Claude Fable 5.1 more expensive than Fable 5?" und antwortete „No." Der Listenpreis bleibt $10/$50. Die Rechnung nicht: Artificial Analysis maß +20 % bei max, THE DECODER aktualisierte denselben Tag mit diesem +20 %, und unsere 14 uncached Calls stellten 1.11× in Rechnung.

HN-Nutzer george_max (Item 49525611, 2026-09-01) nannte es „just cache reads" und „15% more", passend zu AA bei max Effort. Subscription-5-Stunden-Fenster preisen Cache-Reads nicht wie die API.

Ein Quiz, kein Bench: Die Turn-2-Cache-Antwort von Fable 5 nutzte $2.00 / $2.50 (5.1-Preise) auf einem Prompt, der „on this model" sagte.

Was unser OpenRouter-Meter bei Claude Fable 5.1 zeigte

Alle drei Modelle bestanden 14/14 bei effort=low; Opus 5 war 45 % günstiger als Fable 5.1.

Wir haben 14 Prompts benchmarked. Genauigkeit gleichauf; Opus 5 gewann trotzdem über $5/$25 gegen $10/$50.

  1. Wann: 2026-09-02, 08:55 UTC, OpenRouter Chat-Completions. Öffentliche Raten auf der Fable-5.1-Modellseite.
  2. Was: anthropic/claude-fable-5.1 vs anthropic/claude-fable-5 vs anthropic/claude-opus-5.
  3. Wie: reasoning.effort=low, außer drei Fable-5.1-High-Coding-Calls. Kein temperature (5.1 lehnt Non-Default-Sampling ab).
  4. Grader: JSON-Schema, exakter numerischer Match, ausgeführte Unit-Tests. Artefakte: fable_bench.py, benchmark-raw.json, benchmark-aggregate.json. Wir haben die drei Slugs in unserem Benchmark getestet: 49 Calls, $0.53795.
Metrik (14 Calls, effort=low)Fable 5.1Fable 5Opus 5
Tasks bestanden14/1414/1414/14
Median-Latenz5.647 s5.383 s4.797 s
Median Completion-Tokens9490103
Median Reasoning-Tokens0823
Completion-Tokens gesamt2,5472,2712,843
Reasoning-Tokens gesamt0253380
Kosten gesamt$0.14693$0.13285$0.080725

Coding bestand jeweils 6/6 bei low.

Task (2 Trials)Fable 5.1 outFable 5 outOpus 5 out
merge_intervals175, 16896, 96155, 155
semver_satisfies414, 411405, 401493, 487
lru_ttl_cache387, 418395, 339469, 459
Coding-Median-Latenz6.523 s5.389 s6.316 s
Coding-Kosten gesamt$0.11095$0.09878$0.06154

Nimm Anthropics „more concise in plans and summaries" als Claim über Agent-Traces, nicht über Single-Shot-Funktionsdumps. Fable 5.1 brauchte ~175 Tokens für merge_intervals, wo Fable 5 96 brauchte; beide bestanden.

Was das nicht misst:

  • Mythos 5.1 (von diesem Account nicht aufrufbar).
  • Mehrstunden-Agenten, Terminal-Bench, SWE-bench, Computer Use.
  • Default-Effort (wir haben low gepinnt, außer Runde 3).
  • Cache-Writes bei 5-Minuten- vs 1-Stunden-TTL.
  • Refusals, Fallback auf Opus, Tool-Loop-Batching.

Welche drei Requests liefern 400 auf Fable 5.1?

Erzwungenes tool_choice vom Typ any oder tool liefert HTTP 400 auf claude-fable-5-1.

What's new in Fable 5.1 nennt den Fehler: tool_choice: type "tool" and "any" are not supported for this model. Prefill des Assistant-Turns ist ebenfalls 400. Non-Default temperature / top_p / top_k ist ebenfalls 400; deshalb haben wir kein Temperature geschickt. Thinking-Blöcke sind an das erzeugende Modell gebunden (thinking-binding-controls-2026-08-01): 5.1 liest frühere Blöcke, frühere Modelle können 5.1s nicht lesen, und ein Router-Fallback verwirft sie. Alles vor einem 5.1-Thinking-Block zu editieren, endet in Fehler oder Drop für Accounts, die am/nach dem 2026-08-31 angelegt wurden. Mythos 5.1 überspringt diesen Prefix-Check.

python
# HTTP 400 invalid_request_error on anthropic/claude-fable-5.1
payload = {
    "model": "anthropic/claude-fable-5.1",
    "messages": [{"role": "user", "content": "Look up the cache rate."}],
    "tools": [{"type": "function", "function": {"name": "lookup"}}],
    "tool_choice": {"type": "tool", "name": "lookup"},  # type "any" 400s too
}
# error: tool_choice: type "tool" and "any" are not supported for this model.
  1. Setze tool_choice auf auto und strict: true am Tool-Schema, oder wechsle zu Structured Outputs.
  2. Halte die History append-only; editiere nie ein Prefix vor einem 5.1-Thinking-Block.
  3. Verwirf Thinking-Blöcke, wenn du auf ein älteres Modell zurückfällst.
  4. Lass temperature / top_p / top_k weg und prefille den Assistant-Turn nicht.

Warum setzt Claude Code Fable 5.1 standardmäßig auf High?

Claude Code setzt Fable 5.1 standardmäßig auf High; bei lru_ttl_cache hat das eine Task, die bei Low schon bestand, um den Faktor 4× aufgeblasen.

Anthropics Ankündigung setzt High in Claude Code und Medium auf claude.ai / Cowork. Fünf Effort-Stufen: low / medium / high / xhigh / max. Thinking ist immer an; thinking: disabled ist 400. Das Help Center verlangt Claude Code 2.1.250 oder neuer.

TaskLow (out / reason / cost)High (out / reason / cost / latency)
merge_intervals172 / 0 / $0.010175 / 0 / $0.01024 / 4.86 s
semver_satisfies413 / 0 / $0.023401 / 0 / $0.02238 / 7.60 s
lru_ttl_cache403 / 0 / $0.0221,713 / 1,150 / $0.08798 / 22.07 s

merge_intervals und semver_satisfies wirkten wie Low. lru_ttl_cache nicht. High verbrauchte 4,25× die Completion-Tokens (1,713 vs 403), legte 1,150 Reasoning-Tokens drauf, brauchte 22.07 s gegen ~7 s und kostete eine 4.0×-Rechnung ($0.08798 vs $0.022) für Tests, die wir schon hatten. Pinne effort=low (oder Medium auf claude.ai) für begrenzte Funktionen.

Simon Willison (2026-09-01, nicht unser Pelikan): Effort lässt sich nicht abschalten; max lag bei einem Prompt bei 33× dem Output von low.

Sollst du bei Fable 5 bleiben, bei Opus 5 bleiben oder wechseln?

Bleib bei Opus 5 für begrenzte Einzelaufrufe; schiebe Cache-schwere Agenten auf Fable 5.1.

Die Docs sagen: starte mit Opus 5 und greife zu Fable 5.1, wenn High-Effort-Evals weiter zu kurz greifen. Unser Eval ist der 14/14-Meter: Opus 5 bei $0.0807 gegen $0.1469 (45 % günstiger). Wechsle Fable 5 nicht für kurze uncached Calls auf 5.1: 14/14 beide, 5.1 kostete hier 1.11× mehr.

RegelFlip, wennRechnung (unser Meter)
Bleib bei Opus 5 für begrenzte EinzelaufrufeHigh-Effort-Evals verfehlen weiter lange Agent-Sessions$0.080725, 14/14, 45 % günstiger als $0.14693
Schiebe Cache-schwere Agenten auf Fable 5.1die Session liest nie ein großes Prefix erneut75.0% günstigere Cache-Read-Zeile ($0.000291 vs $0.001166)
Lass Claude Code nicht auf Default-High für Tasks, die bei Low schon bestehender Job ist ein Terminal-Bench-Science-Klassen-Loop4.0× auf lru_ttl_cache ($0.08798 vs $0.022)
Wechsle Fable 5 → 5.1 nicht für kurze uncached Callsdu brauchst den Science-Sprung oder den $0.25-Cache-Read1.11× ($0.14693 vs $0.13285), 14/14 beide

Fable 5.1 stellte $0.14693 (1.11×) auf uncached 14/14 in Rechnung; der Gewinn sitzt auf der Cache-Read-Zeile. Fable 5 stellte $0.13285, bis ein 1,165-Token-Prefix erneut gelesen wird. Opus 5 stellte $0.080725, 45 % günstiger, mit mehr Tokens (2,843 vs 2,547).

Begrenzte Einzelaufrufe bleiben bei Opus 5. Cache-schwere Agenten wechseln zu Fable 5.1 wegen der $0.25-Cache-Read-Zeile, mit Effort auf Low gepinnt, wenn Tests schon bestehen. Kurze uncached Fable-5-Calls bleiben wo sie sind.

Häufig gestellte Fragen

Was ist die Claude-Fable-5.1-API-ID?

claude-fable-5-1 auf der Anthropic API, anthropic.claude-fable-5-1 auf Bedrock und anthropic/claude-fable-5.1 auf OpenRouter. Vertex, Foundry und Claude Platform behalten claude-fable-5-1. Mythos ist claude-mythos-5-1, nur Glasswing; es ist kein OpenRouter-Modell, das du eintippen kannst, und wir haben es am 2026-09-02 nicht aufgerufen.

Greift der Cache-Read-Schnitt bei Claude-Code-Max-Quotas?

Nein. Der 75%-Schnitt ist ein API-Cache-Read-Preis ($1.00 → $0.25 / MTok). Subscription-5-Stunden-Fenster rechnen Cache-Reads nicht so ab, also dehnt sich die typische 25%-Ersparnis nicht auf Max-Quotas. r/ClaudeCode (2026-09-01) meldete, das 5-Stunden-Fenster in 20 Minuten verbrannt zu haben, nachdem der High-Default landete.

Welche Claude-Code-Version braucht Fable 5.1?

2.1.250 oder neuer, laut Help Center vom 2026-09-01. Fable 5 war 2.1.170+. Ältere Builds verpassen die neue ID, den High-Default, der unsere LRU-Task um 4.0× aufgeblasen hat, und den Effort-Picker, den 5.1 erwartet. Upgrade, bevor du Traffic darauf zeigst.

Kommt als Nächstes Fable 6?

5.1 ist der Point-Release, den jener Post vorausgesagt hat. Fable 6 ist weiter unangekündigt. Polymarket-Threads, die nach einem 5.1-Datum fragen, sind veraltet: GA war 2026-09-01, und die Ankündigung nennt keinen Fable-6-Kalender. Warte einen 5-vs-5.1-Wechsel nicht auf Fable 6.

Ist Claude Fable 5.1 ein Covered Model?

Ja. 30 Tage Datenaufbewahrung. Nicht verfügbar unter Zero Data Retention, außer ausdrücklich autorisiert. Enterprise Frontier Safeguards (Customer-Cloud-Storage) rollen später im Herbst aus; berechtigte Kunden können bis dahin ZDR nutzen. Ein statistisches Text-Watermark geht auf allen Plattformen live (EU AI Act, Modelle nach 2026-08-02); die Detection-API ist in Private Preview.

Tags

claude-fable-5-1claude-mythos-5-1prompt-cachingclaude-opus-5openrouter

Diesen Artikel teilen

Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.