
Recensione Claude Fable 5.1: l'abbiamo misurato contro Fable 5 e Opus 5
Claude Fable 5.1 è uscito il 2026-09-01 allo stesso $10/$50 di Fable 5, con le cache read ridotte a $0.25. La mattina dopo, alle 08:55 UTC, abbiamo lanciato 14 task OpenRouter abbinati. Il risparmio agentico del 45% non c'era su quella fattura: tutti e tre i modelli hanno passato 14/14, e 5.1 ha fatturato $0.14693 contro Opus 5 a $0.080725.
L'ID frontier generalmente disponibile di Anthropic è claude-fable-5-1, GA 2026-09-01, $10/$50 per milione di token, cache read $0.25. Mythos 5.1 sono gli stessi pesi con salvaguardie cyber/bio più lasche, solo Glasswing. Knowledge cutoff giugno 2026. Thinking sempre attivo.
Claude Fable 5.1 vs Fable 5 vs Opus 5: la tabella di switch
Resta su Opus 5 per questo set di 14 task; Fable 5.1 ha pareggiato l'accuratezza e costa 1.11× Fable 5.
Abbiamo chiamato anthropic/claude-fable-5.1 la mattina dopo la GA. La scheda listino non si è mossa: $10/$50, uguale a Fable 5. Claude Opus 5 è $5/$25. La cache read è l'unica variazione di listino ($0.25 vs $1.00), e qui non si è attivata.
Opus 5 è il 45% più economico di Fable 5.1 su questo set di 14 task perché il listino è $5/$25 contro $10/$50, non perché abbia usato meno token.
| Fable 5.1 | Fable 5 | Opus 5 | |
|---|---|---|---|
| Listino $ in/out | $10/$50 | $10/$50 | $5/$25 |
| Cache read | $0.25 / MTok | $1.00 / MTok | n/a |
| Effort di default | High in Claude Code; Medium su claude.ai / Cowork | n/a | High |
| Headline vendor | Terminal-Bench-Science 52.6% | 24.7% | 29.0% |
| Fattura (il nostro meter) | $0.14693, 14/14 | $0.13285, 14/14 | $0.080725, 14/14 |
| Switch | agenti cache-heavy | chiamate brevi senza cache | single-shot delimitati |
Stessi pesi, due porte, e una non risponde
Mythos 5.1 sono gli stessi pesi con salvaguardie cyber/bio più lasche, e non è su OpenRouter.
La frase di lancio di Anthropic è letterale: «Claude Fable 5.1 and Claude Mythos 5.1 are the same model, but with different levels of safeguards.» Fable è GA (claude-fable-5-1, Bedrock anthropic.claude-fable-5-1). Mythos è claude-mythos-5-1 dietro Project Glasswing / CVP / LSVP, oggi un insieme di organizzazioni USA. Contesto 1M, output max 128k, cutoff giugno 2026 contro gennaio 2026 di Fable 5. Il nostro esperimento è costato $0.53795. Mythos non è stato chiamato.
# OpenRouter slugs we actually sent on 2026-09-02
MODELS = [
"anthropic/claude-fable-5.1",
"anthropic/claude-fable-5",
"anthropic/claude-opus-5",
# claude-mythos-5-1: not listed / Glasswing only
]Quali bench di Claude Fable 5.1 si sono davvero mossi?
Terminal-Bench-Science 0.1 è il salto: 52.6% su Fable 5.1 contro 24.7% su Fable 5.
Fable 5 stava al 24.7% e Opus 5 al 29.0%. Quel salto è il motivo per cui i loop di agentic coding contano più delle nostre 14 chiamate brevi.
| Bench | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22,4% |
| Terminal-Bench 4.0 | 55.8% (Mythos 5.1: 60.9%) | 42,0% | 52,3% | 37,3% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 partial / strict | 77,9% / 41,7% | 72,9% / 36,1% | 75,4% / 39,6% | n/a |
| HLE no tools / with tools | 60.9% / 65,0% | 57,8% / 63,8% | 56,6% / 63,6% | n/a |
| AutomationBench | 31,4% | 17,1% | 26,9% | 19,6% |
| CursorBench 3.2.0 | 73,4% | 70,5% | 70,0% | 67,2% |
Fonte: annuncio Anthropic, 2026-09-01.
| Fonte | Finding | Scope |
|---|---|---|
| Artificial Analysis, 2026-09-01 | Intelligence Index 66 a max | Fable 5 max 62; Opus 5 max 63 |
| Artificial Analysis | $3.76 / task vs Fable 5 $3.14 (+20%) | ~1,7× output; ~$5.16 senza il taglio; xhigh 65 a $2.72 |
| Snorkel, 2026-09-01 | 58% token in meno, 36% più veloce | vs soli successi Opus 5; 18 / 5 / 2 / 2; pass@1 61,5%; build/dep 18% vs 67% |
Il 58% / 36% di Snorkel è vs Opus 5 solo sulle run riuscite, non vs Fable 5. Opus ha comunque risolto tre task in più (18 entrambi / 5 solo Opus / 2 solo Fable).
- Terminal-Bench-Science SE ±3,5–4,5 pts. La leaderboard pubblica (3 trial/task, runner Claude Code) riporta Opus 5 30,0% e Fable 5 21,4%; il setup di Anthropic riproduce 29.0% e 24.7%, entrambi entro il rumore.
- OSWorld 2.0 è il rilascio task degli autori di agosto 2026; Fable 5 e Opus 5 sono stati rilanciati nelle stesse condizioni. Non confrontabile con i numeri OSWorld più vecchi.
- Le salvaguardie di produzione erano attive. Gli interventi sono stati conteggiati come zero su OSWorld (entrambi i Fable) e su AutomationBench (Fable 5). Altri task cyber sono tornati a Opus 4.8; biologia a Opus 5. Probabilmente sottostima la capacità grezza.
Il risparmio del 25% di Claude Fable 5.1 è sulla tua fattura?
La riga cache-read è il 75% più economica; l'intero follow-up breve è stato solo il 21% più economico.
Il post di lancio di Anthropic stima ~25% tipico e ~45% agentico vs Fable 5. Entrambi richiedono che le cache read dominino, e che i token di output non saltino. La rate card docs: cache write $12.50 / $20, output $50, cache read $1.00 → $0.25 / MTok. I modelli di costo del workload decidono se quel taglio sopravvive a tagliare la bolletta token altrove.
| Scenario | Label | Fable 5 | Fable 5.1 | Delta |
|---|---|---|---|---|
| Riga A: 20-turn / ~1M (9,5M cache read, write $12.50, output $50) | identità di listino, non il nostro meter | $72.00 ($9.50 cache) | $64.88 ($2.38 cache) | -9,9% |
| Riga B: task Intelligence Index | Artificial Analysis, 2026-09-01 | $3.14 | $3.76 (~$5.16 senza il taglio) | +20% a max (~1,7× output) |
| Riga C: prefisso 1,165 token, turn 2 | Techsy OpenRouter, 2026-09-02 | $0.005086 | $0.00402125 | turn intero 21% più economico |
| Riga turn-2 (fattura, il nostro meter) | Fable 5.1 | Fable 5 |
|---|---|---|
| Token input in cache | 1,165 | 1,166 |
| Riga cache-read | $0.000291 | $0.001166 |
OpenRouter usage.cost | $0.00402125 | $0.005086 |
La riga cache-read è il 75.0% più economica ($0.000291 vs $0.001166). Il risparmio sul turn intero si ferma al 21% perché l'output fattura ancora a $50/M. Scala la riga cache a 40 reread × 200.000 token: $2.00 su 5.1 vs $8.00 su 5.
AY Automate ha chiesto «Is Claude Fable 5.1 more expensive than Fable 5?» il 2026-09-01 e ha risposto «No.» Il listino è invariato a $10/$50. La fattura no: Artificial Analysis ha misurato +20% a max, THE DECODER ha aggiornato lo stesso giorno con quel +20%, e le nostre 14 chiamate senza cache hanno fatturato 1.11×.
L'utente HN george_max (item 49525611, 2026-09-01) l'ha definito «just cache reads» e «15% more», allineato ad AA a max effort. Le finestre subscription da 5 ore non prezzano le cache read come l'API.
Un quiz, non un bench: la risposta cache di turn-2 di Fable 5 ha usato $2.00 / $2.50 (prezzi 5.1) su un prompt che diceva «on this model.»
Cosa ha mostrato il nostro meter OpenRouter su Claude Fable 5.1
Tutti e tre i modelli hanno passato 14/14 a effort=low; Opus 5 è risultato il 45% più economico di Fable 5.1.
Abbiamo benchmarkato 14 prompt. Accuratezza in parità; Opus 5 ha comunque vinto su $5/$25 vs $10/$50.
- Quando: 2026-09-02, 08:55 UTC, OpenRouter chat-completions. Tariffe pubbliche sulla pagina modello Fable 5.1.
- Cosa:
anthropic/claude-fable-5.1vsanthropic/claude-fable-5vsanthropic/claude-opus-5. - Come:
reasoning.effort=lowtranne tre chiamate coding High su Fable 5.1. Nientetemperature(5.1 rifiuta il sampling non di default). - Grader: JSON-schema, match numerico esatto, unit test eseguiti. Artefatti:
fable_bench.py,benchmark-raw.json,benchmark-aggregate.json. Abbiamo testato i tre slug nel nostro benchmark: 49 chiamate, $0.53795.
| Metrica (14 chiamate, effort=low) | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Task passati | 14/14 | 14/14 | 14/14 |
| Latenza mediana | 5.647 s | 5.383 s | 4.797 s |
| Token completion mediani | 94 | 90 | 103 |
| Token reasoning mediani | 0 | 8 | 23 |
| Token completion totali | 2,547 | 2,271 | 2,843 |
| Token reasoning totali | 0 | 253 | 380 |
| Costo totale | $0.14693 | $0.13285 | $0.080725 |
Il coding è passato 6/6 ciascuno a low.
| Task (2 trial) | Fable 5.1 out | Fable 5 out | Opus 5 out |
|---|---|---|---|
merge_intervals | 175, 168 | 96, 96 | 155, 155 |
semver_satisfies | 414, 411 | 405, 401 | 493, 487 |
lru_ttl_cache | 387, 418 | 395, 339 | 469, 459 |
| Latenza mediana coding | 6,523 s | 5,389 s | 6,316 s |
| Costo totale coding | $0.11095 | $0.09878 | $0.06154 |
Tratta il «more concise in plans and summaries» di Anthropic come una claim sulle tracce agentiche, non sui dump di funzioni single-shot. Fable 5.1 ha speso ~175 token su merge_intervals dove Fable 5 ne ha spesi 96, entrambi in passaggio.
Cosa non misura questo:
- Mythos 5.1 (non chiamabile da questo account).
- Agenti multi-ora, Terminal-Bench, SWE-bench, computer use.
- Effort di default (abbiamo fissato
lowtranne il round 3). - Cache write a TTL 5 minuti vs 1 ora.
- Rifiuti, fallback a Opus, batching dei tool-loop.
Quali tre request restituiscono 400 su Fable 5.1?
Un tool_choice forzato di tipo any o tool restituisce HTTP 400 su claude-fable-5-1.
What's new in Fable 5.1 nomina l'errore: tool_choice: type "tool" and "any" are not supported for this model. Anche il prefill del turn assistant è 400. temperature / top_p / top_k non di default è 400; per questo non abbiamo mandato temperature. I thinking block sono legati al modello che li produce (thinking-binding-controls-2026-08-01): 5.1 legge i block precedenti, i modelli precedenti non possono leggere quelli di 5.1, e un fallback del router li droppa. Modificare qualsiasi cosa davanti a un thinking block 5.1 dà errore o lo droppa per gli account creati il/dopo 2026-08-31. Mythos 5.1 salta quel controllo sul prefisso.
# HTTP 400 invalid_request_error on anthropic/claude-fable-5.1
payload = {
"model": "anthropic/claude-fable-5.1",
"messages": [{"role": "user", "content": "Look up the cache rate."}],
"tools": [{"type": "function", "function": {"name": "lookup"}}],
"tool_choice": {"type": "tool", "name": "lookup"}, # type "any" 400s too
}
# error: tool_choice: type "tool" and "any" are not supported for this model.- Imposta
tool_choicesuautoestrict: truesullo schema del tool, oppure passa agli structured output. - Tieni la history append-only; non editare mai un prefisso davanti a un thinking block 5.1.
- Droppa i thinking block quando fai fallback a un modello precedente.
- Ometti
temperature/top_p/top_k, e non fare prefill del turn assistant.
Perché Claude Code mette Fable 5.1 di default su High?
Claude Code mette Fable 5.1 di default su High; su lru_ttl_cache ha moltiplicato per 4× un task che passava già a Low.
L'annuncio di Anthropic imposta High in Claude Code e Medium su claude.ai / Cowork. Cinque livelli di effort: low / medium / high / xhigh / max. Thinking è sempre on; thinking: disabled è 400. L'Help Center richiede Claude Code 2.1.250 o successivo.
| Task | Low (out / reason / cost) | High (out / reason / cost / latency) |
|---|---|---|
merge_intervals | 172 / 0 / $0.010 | 175 / 0 / $0.01024 / 4.86 s |
semver_satisfies | 413 / 0 / $0.023 | 401 / 0 / $0.02238 / 7.60 s |
lru_ttl_cache | 403 / 0 / $0.022 | 1,713 / 1,150 / $0.08798 / 22.07 s |
merge_intervals e semver_satisfies sembravano Low. lru_ttl_cache no. High ha speso 4,25× i token di completion (1,713 vs 403), ha aggiunto 1,150 token di reasoning, ha impiegato 22.07 s vs ~7 s, e ha costato una bolletta 4.0× ($0.08798 vs $0.022) per test che avevamo già. Fissa effort=low (o Medium su claude.ai) per le funzioni delimitate.
Simon Willison (2026-09-01, non il nostro pelican): l'effort non si spegne; max è stato 33× l'output di low su un prompt.
Restare su Fable 5, restare su Opus 5, o migrare?
Resta su Opus 5 per il lavoro single-shot delimitato; sposta gli agenti cache-heavy su Fable 5.1.
I docs dicono di partire da Opus 5 e raggiungere Fable 5.1 quando le eval a High-effort restano sotto. La nostra eval è il meter 14/14: Opus 5 a $0.0807 vs $0.1469 (45% più economico). Non passare da Fable 5 a 5.1 per chiamate brevi senza cache: 14/14 entrambi, qui 5.1 è costato 1.11× di più.
| Regola | Invertire se | Fattura (il nostro meter) |
|---|---|---|
| Resta su Opus 5 per single-shot delimitati | le eval High-effort falliscono ancora sulle sessioni agent lunghe | $0.080725, 14/14, 45% più economico di $0.14693 |
| Sposta gli agenti cache-heavy su Fable 5.1 | la sessione non rilegge mai un prefisso grande | riga cache-read 75.0% più economica ($0.000291 vs $0.001166) |
| Non lasciare Claude Code sul default High per task che passano già a Low | il lavoro è un loop classe Terminal-Bench-Science | 4.0× su lru_ttl_cache ($0.08798 vs $0.022) |
| Non passare Fable 5 → 5.1 per chiamate brevi senza cache | ti serve il salto Science o la cache read a $0.25 | 1.11× ($0.14693 vs $0.13285), 14/14 entrambi |
Fable 5.1 ha fatturato $0.14693 (1.11×) su 14/14 senza cache; il guadagno è la riga cache-read. Fable 5 ha fatturato $0.13285 finché un prefisso da 1,165 token non viene riletto. Opus 5 ha fatturato $0.080725, 45% più economico, con più token (2,843 vs 2,547).
- Fable 5 vs Opus 4.8 vive sul post di lancio di giugno.
- Claude Opus 5 possiede i prezzi della linea Opus.
- 5.1 è la point-release che quel post prevedeva; Fable 6 è ancora non annunciato.
- Q&A sui controlli export per il ritiro del vecchio Fable 5.
- Token-efficiency come spine di ranking vive su Grok 4.6.
- Instrada Opus vs Fable in produzione.
Il lavoro single-shot delimitato resta su Opus 5. Gli agenti cache-heavy migrano a Fable 5.1 per la riga cache-read a $0.25, con effort fissato a Low quando i test passano già. Le chiamate Fable 5 brevi senza cache restano dove sono.
Domande frequenti
Qual è l'API ID di Claude Fable 5.1?
claude-fable-5-1 sull'API Anthropic, anthropic.claude-fable-5-1 su Bedrock, e anthropic/claude-fable-5.1 su OpenRouter. Vertex, Foundry e Claude Platform tengono claude-fable-5-1. Mythos è claude-mythos-5-1, solo Glasswing; non è un modello OpenRouter che puoi digitare, e non l'abbiamo chiamato il 2026-09-02.
Il taglio cache-read vale anche sulle quote Claude Code Max?
No. Il taglio del 75% è un prezzo API di cache-read ($1.00 → $0.25 / MTok). Le finestre subscription da 5 ore non fatturano le cache read così, quindi il risparmio tipico del 25% non allunga le quote Max. r/ClaudeCode (2026-09-01) ha segnalato di aver bruciato la finestra da 5 ore in 20 minuti dopo l'arrivo del default High.
Quale versione di Claude Code serve a Fable 5.1?
2.1.250 o successiva, per l'Help Center del 2026-09-01. Fable 5 era 2.1.170+. Le build più vecchie perdono il nuovo ID, il default High che ha moltiplicato per 4.0× il nostro task LRU, e il selettore di effort che 5.1 si aspetta. Aggiorna prima di puntarci il traffico.
Fable 6 è il prossimo?
5.1 è la point-release che quel post prevedeva. Fable 6 è ancora non annunciato. I thread Polymarket che chiedono una data 5.1 sono stantii: la GA è stata il 2026-09-01, e l'annuncio non indica alcun calendario Fable 6. Non bloccare uno switch 5 vs 5.1 aspettandolo.
Claude Fable 5.1 è un Covered Model?
Sì. Retention dati 30 giorni. Non disponibile sotto zero data retention salvo autorizzazione espressa. Gli Enterprise Frontier Safeguards (storage su cloud del cliente) arrivano più avanti in autunno; i clienti idonei possono usare ZDR fino ad allora. Un watermark statistico sul testo arriva su tutte le piattaforme (EU AI Act, modelli dopo il 2026-08-02); l'API di detection è in private preview.