ai-machine-learning

Recensione Claude Fable 5.1: l'abbiamo misurato contro Fable 5 e Opus 5

Scritto da Mert Batur
Sep 2, 2026
10 lettura
Recensione Claude Fable 5.1: l'abbiamo misurato contro Fable 5 e Opus 5

Recensione Claude Fable 5.1: l'abbiamo misurato contro Fable 5 e Opus 5

Claude Fable 5.1 è uscito il 2026-09-01 allo stesso $10/$50 di Fable 5, con le cache read ridotte a $0.25. La mattina dopo, alle 08:55 UTC, abbiamo lanciato 14 task OpenRouter abbinati. Il risparmio agentico del 45% non c'era su quella fattura: tutti e tre i modelli hanno passato 14/14, e 5.1 ha fatturato $0.14693 contro Opus 5 a $0.080725.

L'ID frontier generalmente disponibile di Anthropic è claude-fable-5-1, GA 2026-09-01, $10/$50 per milione di token, cache read $0.25. Mythos 5.1 sono gli stessi pesi con salvaguardie cyber/bio più lasche, solo Glasswing. Knowledge cutoff giugno 2026. Thinking sempre attivo.

Claude Fable 5.1 vs Fable 5 vs Opus 5: la tabella di switch

Resta su Opus 5 per questo set di 14 task; Fable 5.1 ha pareggiato l'accuratezza e costa 1.11× Fable 5.

Abbiamo chiamato anthropic/claude-fable-5.1 la mattina dopo la GA. La scheda listino non si è mossa: $10/$50, uguale a Fable 5. Claude Opus 5 è $5/$25. La cache read è l'unica variazione di listino ($0.25 vs $1.00), e qui non si è attivata.

Opus 5 è il 45% più economico di Fable 5.1 su questo set di 14 task perché il listino è $5/$25 contro $10/$50, non perché abbia usato meno token.

Fable 5.1Fable 5Opus 5
Listino $ in/out$10/$50$10/$50$5/$25
Cache read$0.25 / MTok$1.00 / MTokn/a
Effort di defaultHigh in Claude Code; Medium su claude.ai / Coworkn/aHigh
Headline vendorTerminal-Bench-Science 52.6%24.7%29.0%
Fattura (il nostro meter)$0.14693, 14/14$0.13285, 14/14$0.080725, 14/14
Switchagenti cache-heavychiamate brevi senza cachesingle-shot delimitati

Stessi pesi, due porte, e una non risponde

Mythos 5.1 sono gli stessi pesi con salvaguardie cyber/bio più lasche, e non è su OpenRouter.

La frase di lancio di Anthropic è letterale: «Claude Fable 5.1 and Claude Mythos 5.1 are the same model, but with different levels of safeguards.» Fable è GA (claude-fable-5-1, Bedrock anthropic.claude-fable-5-1). Mythos è claude-mythos-5-1 dietro Project Glasswing / CVP / LSVP, oggi un insieme di organizzazioni USA. Contesto 1M, output max 128k, cutoff giugno 2026 contro gennaio 2026 di Fable 5. Il nostro esperimento è costato $0.53795. Mythos non è stato chiamato.

python
# OpenRouter slugs we actually sent on 2026-09-02
MODELS = [
    "anthropic/claude-fable-5.1",
    "anthropic/claude-fable-5",
    "anthropic/claude-opus-5",
    # claude-mythos-5-1: not listed / Glasswing only
]

Quali bench di Claude Fable 5.1 si sono davvero mossi?

Terminal-Bench-Science 0.1 è il salto: 52.6% su Fable 5.1 contro 24.7% su Fable 5.

Fable 5 stava al 24.7% e Opus 5 al 29.0%. Quel salto è il motivo per cui i loop di agentic coding contano più delle nostre 14 chiamate brevi.

BenchFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.6%24.7%29.0%22,4%
Terminal-Bench 4.055.8% (Mythos 5.1: 60.9%)42,0%52,3%37,3%
GDPval-AA v21853172318241711
OSWorld 2.0 partial / strict77,9% / 41,7%72,9% / 36,1%75,4% / 39,6%n/a
HLE no tools / with tools60.9% / 65,0%57,8% / 63,8%56,6% / 63,6%n/a
AutomationBench31,4%17,1%26,9%19,6%
CursorBench 3.2.073,4%70,5%70,0%67,2%

Fonte: annuncio Anthropic, 2026-09-01.

FonteFindingScope
Artificial Analysis, 2026-09-01Intelligence Index 66 a maxFable 5 max 62; Opus 5 max 63
Artificial Analysis$3.76 / task vs Fable 5 $3.14 (+20%)~1,7× output; ~$5.16 senza il taglio; xhigh 65 a $2.72
Snorkel, 2026-09-0158% token in meno, 36% più velocevs soli successi Opus 5; 18 / 5 / 2 / 2; pass@1 61,5%; build/dep 18% vs 67%

Il 58% / 36% di Snorkel è vs Opus 5 solo sulle run riuscite, non vs Fable 5. Opus ha comunque risolto tre task in più (18 entrambi / 5 solo Opus / 2 solo Fable).

  1. Terminal-Bench-Science SE ±3,5–4,5 pts. La leaderboard pubblica (3 trial/task, runner Claude Code) riporta Opus 5 30,0% e Fable 5 21,4%; il setup di Anthropic riproduce 29.0% e 24.7%, entrambi entro il rumore.
  2. OSWorld 2.0 è il rilascio task degli autori di agosto 2026; Fable 5 e Opus 5 sono stati rilanciati nelle stesse condizioni. Non confrontabile con i numeri OSWorld più vecchi.
  3. Le salvaguardie di produzione erano attive. Gli interventi sono stati conteggiati come zero su OSWorld (entrambi i Fable) e su AutomationBench (Fable 5). Altri task cyber sono tornati a Opus 4.8; biologia a Opus 5. Probabilmente sottostima la capacità grezza.

Il risparmio del 25% di Claude Fable 5.1 è sulla tua fattura?

La riga cache-read è il 75% più economica; l'intero follow-up breve è stato solo il 21% più economico.

Il post di lancio di Anthropic stima ~25% tipico e ~45% agentico vs Fable 5. Entrambi richiedono che le cache read dominino, e che i token di output non saltino. La rate card docs: cache write $12.50 / $20, output $50, cache read $1.00 → $0.25 / MTok. I modelli di costo del workload decidono se quel taglio sopravvive a tagliare la bolletta token altrove.

ScenarioLabelFable 5Fable 5.1Delta
Riga A: 20-turn / ~1M (9,5M cache read, write $12.50, output $50)identità di listino, non il nostro meter$72.00 ($9.50 cache)$64.88 ($2.38 cache)-9,9%
Riga B: task Intelligence IndexArtificial Analysis, 2026-09-01$3.14$3.76 (~$5.16 senza il taglio)+20% a max (~1,7× output)
Riga C: prefisso 1,165 token, turn 2Techsy OpenRouter, 2026-09-02$0.005086$0.00402125turn intero 21% più economico
Riga turn-2 (fattura, il nostro meter)Fable 5.1Fable 5
Token input in cache1,1651,166
Riga cache-read$0.000291$0.001166
OpenRouter usage.cost$0.00402125$0.005086

La riga cache-read è il 75.0% più economica ($0.000291 vs $0.001166). Il risparmio sul turn intero si ferma al 21% perché l'output fattura ancora a $50/M. Scala la riga cache a 40 reread × 200.000 token: $2.00 su 5.1 vs $8.00 su 5.

AY Automate ha chiesto «Is Claude Fable 5.1 more expensive than Fable 5?» il 2026-09-01 e ha risposto «No.» Il listino è invariato a $10/$50. La fattura no: Artificial Analysis ha misurato +20% a max, THE DECODER ha aggiornato lo stesso giorno con quel +20%, e le nostre 14 chiamate senza cache hanno fatturato 1.11×.

L'utente HN george_max (item 49525611, 2026-09-01) l'ha definito «just cache reads» e «15% more», allineato ad AA a max effort. Le finestre subscription da 5 ore non prezzano le cache read come l'API.

Un quiz, non un bench: la risposta cache di turn-2 di Fable 5 ha usato $2.00 / $2.50 (prezzi 5.1) su un prompt che diceva «on this model.»

Cosa ha mostrato il nostro meter OpenRouter su Claude Fable 5.1

Tutti e tre i modelli hanno passato 14/14 a effort=low; Opus 5 è risultato il 45% più economico di Fable 5.1.

Abbiamo benchmarkato 14 prompt. Accuratezza in parità; Opus 5 ha comunque vinto su $5/$25 vs $10/$50.

  1. Quando: 2026-09-02, 08:55 UTC, OpenRouter chat-completions. Tariffe pubbliche sulla pagina modello Fable 5.1.
  2. Cosa: anthropic/claude-fable-5.1 vs anthropic/claude-fable-5 vs anthropic/claude-opus-5.
  3. Come: reasoning.effort=low tranne tre chiamate coding High su Fable 5.1. Niente temperature (5.1 rifiuta il sampling non di default).
  4. Grader: JSON-schema, match numerico esatto, unit test eseguiti. Artefatti: fable_bench.py, benchmark-raw.json, benchmark-aggregate.json. Abbiamo testato i tre slug nel nostro benchmark: 49 chiamate, $0.53795.
Metrica (14 chiamate, effort=low)Fable 5.1Fable 5Opus 5
Task passati14/1414/1414/14
Latenza mediana5.647 s5.383 s4.797 s
Token completion mediani9490103
Token reasoning mediani0823
Token completion totali2,5472,2712,843
Token reasoning totali0253380
Costo totale$0.14693$0.13285$0.080725

Il coding è passato 6/6 ciascuno a low.

Task (2 trial)Fable 5.1 outFable 5 outOpus 5 out
merge_intervals175, 16896, 96155, 155
semver_satisfies414, 411405, 401493, 487
lru_ttl_cache387, 418395, 339469, 459
Latenza mediana coding6,523 s5,389 s6,316 s
Costo totale coding$0.11095$0.09878$0.06154

Tratta il «more concise in plans and summaries» di Anthropic come una claim sulle tracce agentiche, non sui dump di funzioni single-shot. Fable 5.1 ha speso ~175 token su merge_intervals dove Fable 5 ne ha spesi 96, entrambi in passaggio.

Cosa non misura questo:

  • Mythos 5.1 (non chiamabile da questo account).
  • Agenti multi-ora, Terminal-Bench, SWE-bench, computer use.
  • Effort di default (abbiamo fissato low tranne il round 3).
  • Cache write a TTL 5 minuti vs 1 ora.
  • Rifiuti, fallback a Opus, batching dei tool-loop.

Quali tre request restituiscono 400 su Fable 5.1?

Un tool_choice forzato di tipo any o tool restituisce HTTP 400 su claude-fable-5-1.

What's new in Fable 5.1 nomina l'errore: tool_choice: type "tool" and "any" are not supported for this model. Anche il prefill del turn assistant è 400. temperature / top_p / top_k non di default è 400; per questo non abbiamo mandato temperature. I thinking block sono legati al modello che li produce (thinking-binding-controls-2026-08-01): 5.1 legge i block precedenti, i modelli precedenti non possono leggere quelli di 5.1, e un fallback del router li droppa. Modificare qualsiasi cosa davanti a un thinking block 5.1 dà errore o lo droppa per gli account creati il/dopo 2026-08-31. Mythos 5.1 salta quel controllo sul prefisso.

python
# HTTP 400 invalid_request_error on anthropic/claude-fable-5.1
payload = {
    "model": "anthropic/claude-fable-5.1",
    "messages": [{"role": "user", "content": "Look up the cache rate."}],
    "tools": [{"type": "function", "function": {"name": "lookup"}}],
    "tool_choice": {"type": "tool", "name": "lookup"},  # type "any" 400s too
}
# error: tool_choice: type "tool" and "any" are not supported for this model.
  1. Imposta tool_choice su auto e strict: true sullo schema del tool, oppure passa agli structured output.
  2. Tieni la history append-only; non editare mai un prefisso davanti a un thinking block 5.1.
  3. Droppa i thinking block quando fai fallback a un modello precedente.
  4. Ometti temperature / top_p / top_k, e non fare prefill del turn assistant.

Perché Claude Code mette Fable 5.1 di default su High?

Claude Code mette Fable 5.1 di default su High; su lru_ttl_cache ha moltiplicato per 4× un task che passava già a Low.

L'annuncio di Anthropic imposta High in Claude Code e Medium su claude.ai / Cowork. Cinque livelli di effort: low / medium / high / xhigh / max. Thinking è sempre on; thinking: disabled è 400. L'Help Center richiede Claude Code 2.1.250 o successivo.

TaskLow (out / reason / cost)High (out / reason / cost / latency)
merge_intervals172 / 0 / $0.010175 / 0 / $0.01024 / 4.86 s
semver_satisfies413 / 0 / $0.023401 / 0 / $0.02238 / 7.60 s
lru_ttl_cache403 / 0 / $0.0221,713 / 1,150 / $0.08798 / 22.07 s

merge_intervals e semver_satisfies sembravano Low. lru_ttl_cache no. High ha speso 4,25× i token di completion (1,713 vs 403), ha aggiunto 1,150 token di reasoning, ha impiegato 22.07 s vs ~7 s, e ha costato una bolletta 4.0× ($0.08798 vs $0.022) per test che avevamo già. Fissa effort=low (o Medium su claude.ai) per le funzioni delimitate.

Simon Willison (2026-09-01, non il nostro pelican): l'effort non si spegne; max è stato 33× l'output di low su un prompt.

Restare su Fable 5, restare su Opus 5, o migrare?

Resta su Opus 5 per il lavoro single-shot delimitato; sposta gli agenti cache-heavy su Fable 5.1.

I docs dicono di partire da Opus 5 e raggiungere Fable 5.1 quando le eval a High-effort restano sotto. La nostra eval è il meter 14/14: Opus 5 a $0.0807 vs $0.1469 (45% più economico). Non passare da Fable 5 a 5.1 per chiamate brevi senza cache: 14/14 entrambi, qui 5.1 è costato 1.11× di più.

RegolaInvertire seFattura (il nostro meter)
Resta su Opus 5 per single-shot delimitatile eval High-effort falliscono ancora sulle sessioni agent lunghe$0.080725, 14/14, 45% più economico di $0.14693
Sposta gli agenti cache-heavy su Fable 5.1la sessione non rilegge mai un prefisso granderiga cache-read 75.0% più economica ($0.000291 vs $0.001166)
Non lasciare Claude Code sul default High per task che passano già a Lowil lavoro è un loop classe Terminal-Bench-Science4.0× su lru_ttl_cache ($0.08798 vs $0.022)
Non passare Fable 5 → 5.1 per chiamate brevi senza cacheti serve il salto Science o la cache read a $0.251.11× ($0.14693 vs $0.13285), 14/14 entrambi

Fable 5.1 ha fatturato $0.14693 (1.11×) su 14/14 senza cache; il guadagno è la riga cache-read. Fable 5 ha fatturato $0.13285 finché un prefisso da 1,165 token non viene riletto. Opus 5 ha fatturato $0.080725, 45% più economico, con più token (2,843 vs 2,547).

Il lavoro single-shot delimitato resta su Opus 5. Gli agenti cache-heavy migrano a Fable 5.1 per la riga cache-read a $0.25, con effort fissato a Low quando i test passano già. Le chiamate Fable 5 brevi senza cache restano dove sono.

Domande frequenti

Qual è l'API ID di Claude Fable 5.1?

claude-fable-5-1 sull'API Anthropic, anthropic.claude-fable-5-1 su Bedrock, e anthropic/claude-fable-5.1 su OpenRouter. Vertex, Foundry e Claude Platform tengono claude-fable-5-1. Mythos è claude-mythos-5-1, solo Glasswing; non è un modello OpenRouter che puoi digitare, e non l'abbiamo chiamato il 2026-09-02.

Il taglio cache-read vale anche sulle quote Claude Code Max?

No. Il taglio del 75% è un prezzo API di cache-read ($1.00 → $0.25 / MTok). Le finestre subscription da 5 ore non fatturano le cache read così, quindi il risparmio tipico del 25% non allunga le quote Max. r/ClaudeCode (2026-09-01) ha segnalato di aver bruciato la finestra da 5 ore in 20 minuti dopo l'arrivo del default High.

Quale versione di Claude Code serve a Fable 5.1?

2.1.250 o successiva, per l'Help Center del 2026-09-01. Fable 5 era 2.1.170+. Le build più vecchie perdono il nuovo ID, il default High che ha moltiplicato per 4.0× il nostro task LRU, e il selettore di effort che 5.1 si aspetta. Aggiorna prima di puntarci il traffico.

Fable 6 è il prossimo?

5.1 è la point-release che quel post prevedeva. Fable 6 è ancora non annunciato. I thread Polymarket che chiedono una data 5.1 sono stantii: la GA è stata il 2026-09-01, e l'annuncio non indica alcun calendario Fable 6. Non bloccare uno switch 5 vs 5.1 aspettandolo.

Claude Fable 5.1 è un Covered Model?

Sì. Retention dati 30 giorni. Non disponibile sotto zero data retention salvo autorizzazione espressa. Gli Enterprise Frontier Safeguards (storage su cloud del cliente) arrivano più avanti in autunno; i clienti idonei possono usare ZDR fino ad allora. Un watermark statistico sul testo arriva su tutte le piattaforme (EU AI Act, modelli dopo il 2026-08-02); l'API di detection è in private preview.

Tag

claude-fable-5-1claude-mythos-5-1prompt-cachingclaude-opus-5openrouter

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.