
Claude Fable 5 vs Opus 4.8: Vale la Pena Passare? (Mythos-Class, Testato)
Anthropic ha rilasciato oggi Claude Fable 5, 9 giugno 2026. Segna 80,3% su SWE-Bench Pro, il benchmark per l'agentic coding dove Opus 4.8 si ferma al 69,2% e GPT-5.5 rimane indietro al 58,6%. Non si tratta di un margine trascurabile. E c'è un dettaglio importante: Fable 5 è la metà pubblica e con salvaguardie di una nuova linea "Mythos-class", con un modello gemello ristretto chiamato Claude Mythos 5 tenuto dietro un programma di accesso riservato. Ecco cosa è cambiato, quanto costa davvero un task a $10/$50 per milione di token, e se conviene davvero spostare il tuo stack da Opus 4.8.
Risposta Rapida
- Fable 5 segna 80,3% su SWE-Bench Pro contro il 69,2% di Opus 4.8 e il 58,6% di GPT-5.5.
- Il prezzo è $10 input / $50 output per milione di token, meno della metà di Mythos Preview.
- Fable 5 passa automaticamente a Opus 4.8 per le query ad alto rischio (cyber/bio/chimica), che riguardano meno del 5% delle sessioni.
- Gratuito sui piani Pro/Max/Team/Enterprise fino al 22 giugno 2026; i crediti d'uso si applicano dal 23 giugno.
Cosa È Stato Lanciato: Fable 5, Mythos 5 e la Linea "Mythos-Class"
Mythos-class è il nuovo livello di capacità massima di Anthropic, e viene rilasciato come due modelli. Claude Fable 5 è la versione pubblica con salvaguardie che puoi chiamare oggi. Claude Mythos 5 è lo stesso modello frontier con le salvaguardie rimosse, accessibile solo tramite accesso ristretto. Stessa architettura, due posture di rilascio diverse.
Questa distinzione è il cuore della storia. Secondo l'annuncio di Anthropic, Mythos 5 conserva la piena capacità frontier, incluse competenze offensive nel campo informatico che potrebbero causare danni reali, quindi Anthropic non lo mette a disposizione di tutti. Fable 5 prende lo stesso modello e lo avvolge in classificatori che rilevano le richieste ad alto rischio e le instradano silenziosamente verso Opus 4.8 invece.
Quando chiami Fable 5, ottieni il ragionamento Mythos-class su tutto ciò che non è pericoloso, e un modello di fallback più sicuro sulla piccola fetta che lo è. CNBC ha descritto la situazione come Anthropic che rilascia "un'IA simile a Mythos al pubblico", il che è corretto, ma il meccanismo preciso conta più del titolo.
Fable 5 e Mythos 5 sono lo stesso modello frontier diviso in due: uno che puoi usare oggi, uno che Anthropic mantiene ristretto. Se devi ricordare una sola cosa sulla nomenclatura, ricorda questa. Mythos-class è il livello; Fable e Mythos sono le due porte di accesso.
Cosa È Cambiato Rispetto alla Linea Opus 4.x
Su ogni valutazione di coding e ragionamento pubblicata da Anthropic, Fable 5 supera Opus 4.8, non di poco ma con margini a due cifre. SWE-Bench Pro passa dal 69,2% all'80,3%. FrontierCode Diamond va da 13,4 a 29,3. Anche il prezzo è sceso, e il modello scala con un nuovo dial per il livello di ragionamento. Si tratta di un genuino passo avanti rispetto alla linea Opus 4.x, non di un aggiornamento minore.

Il confronto sui 13 benchmark qui sopra è la panoramica rapida. Ecco i numeri principali rispetto ai tre modelli che la maggior parte dei team confronta davvero:
| Benchmark | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| SWE-Bench Pro (agentic coding) | 80,3% | 69,2% | 58,6% |
| FrontierCode Diamond (coding più difficile) | 29,3 | 13,4 | 5,7 |
| Terminal-Bench 2.1 (shell agentico) | 88,0% | n/a | n/a |
| GPQA-AA (ragionamento di livello universitario, Elo) | 1932 | n/a | n/a |
| ExploitBench | 78,0% | n/a | n/a |
Il riferimento di confronto qui è Claude Opus 4.8, il modello che Fable 5 sostituisce al frontier, e lo stesso modello verso cui Fable 5 fa fallback per le query ad alto rischio. Se hai seguito la linea Opus 4.x nelle ultime due versioni, il pattern era di guadagni incrementali. Fable 5 rompe quel pattern.
Due cose da notare prima di prendere la tabella come vangelo. Primo, si tratta delle valutazioni pubblicate da Anthropic stessa, non di test indipendenti. Secondo, il dial del livello di ragionamento significa che un singolo numero di benchmark nasconde una curva di costo. Ne parliamo nella sezione prezzi, perché cambia i calcoli.
I Benchmark Che Contano per Chi Sviluppa
Quattro numeri portano il peso pratico: SWE-Bench Pro 80,3%, FrontierCode Diamond 29,3, Terminal-Bench 2.1 88,0%, e GPQA-AA 1932 Elo. Insieme coprono il lavoro su repo reali, i problemi di coding sintetici più difficili, i task shell agentici e il ragionamento di livello universitario. Se il tuo carico di lavoro tocca uno di questi, questa è la sezione che ti dice se il numero si traduce nella tua realtà.
Il grafico principale in cima a questo articolo è la prova: SWE-Bench Pro 80,3 vs 69,2 vs 58,6, e FrontierCode 29,3 vs 13,4 vs 5,7. Ma cosa misurano davvero?
- SWE-Bench Pro testa se un modello riesce a fare una pull request reale su un repo reale: clonare, capire, patchare, passare i test. Fable 5 ce la fa in 8 casi su 10. È il proxy più vicino al "riesce a fare il mio lavoro davvero."
- Terminal-Bench 2.1 valuta i task shell agentici: eseguire comandi, leggere output, recuperare dagli errori. L'88,0% conta se stai costruendo agenti di coding AI che vivono in un terminale.
- FrontierCode Diamond è il livello più difficile dei problemi di coding, quelli dove la maggior parte dei modelli segna cifre singole. 29,3 è basso in termini assoluti, ma più del doppio del 13,4 di Opus 4.8.
- GPQA-AA è il ragionamento scientifico di livello universitario, misurato come punteggio Elo. 1932 segnala un ragionamento multi-step solido al di là del codice.
Nei nostri workflow Claude Code attraverso la linea Opus 4.x, il limite ricorrente erano i task agentici a lungo orizzonte: il modello perdeva il filo a metà di una modifica su più file. I numeri di Terminal-Bench e SWE-Bench Pro di Fable 5 suggeriscono che quel limite si è spostato. Se si è spostato per il tuo repo è l'unico test che conta, ma i numeri pubblicati sono il tipo giusto di numeri a cui prestare attenzione.
Casi Reali: Cosa Fa Fable 5 Che i Modelli Precedenti Non Potevano
Anthropic ha pubblicato tre esempi concreti che mostrano la classe di problemi che Fable 5 può ora gestire: una migrazione del codebase Stripe compressa da mesi a un giorno, un videogioco completato con la sola visione, e un salto di performance 3× grazie all'auto-validazione. Ognuno punta a una capacità che i modelli precedenti non potevano raggiungere. Tutti e tre provengono da Anthropic; citiamo il loro annuncio, non test nostri.
Ecco cosa dimostra ciascuno:
-
Migrazione Ruby di Stripe. Anthropic riporta che Fable 5 ha compresso una migrazione di un codebase Ruby da circa due mesi a circa un giorno. Questa è la classe di refactor a lungo orizzonte che richiedeva un team umano con l'intero codebase in testa.
-
Pokémon FireRed con la sola visione. Secondo Anthropic, Fable 5 ha completato Pokémon FireRed usando solo la visione, dove i modelli precedenti avevano bisogno di harness personalizzati complessi per passare lo stato del gioco come testo. È un salto nel ragionamento spaziale e visivo: il modello legge lo schermo e agisce, senza scaffolding.
-
Slay the Spire, 3×. Al massimo sforzo di ragionamento, Anthropic dice che Fable 5 auto-valida le proprie mosse e ha raggiunto performance 3× migliori grazie alla memoria persistente. Il punto non è il gioco; è che il modello può verificare il proprio lavoro su un lungo orizzonte di pianificazione e migliorare da solo.
Nessuno di questi è qualcosa che dovresti prendere per buono riguardo al tuo carico di lavoro. Ma si mappano chiaramente sui salti nei benchmark della tabella: coding a lungo orizzonte (SWE-Bench Pro), ragionamento spaziale (visione) e auto-validazione (il dial del livello di ragionamento). I risultati qualitativi e quelli quantitativi raccontano la stessa storia.
Prezzi e la Realtà del Costo per Task
Fable 5 costa $10 per milione di token in input e $50 per milione di token in output. Anthropic lo presenta come "meno della metà del prezzo di Claude Mythos Preview." È anche circa 2× Opus 4.8 per token. Entrambe le cose sono vere. Il problema è che il prezzo per token è l'unità sbagliata. Quello che paghi davvero è un task completato, ed è lì che i calcoli di Fable 5 diventano interessanti.

Il livello di ragionamento è un dial che imposti per ogni richiesta. Basso sforzo significa meno token di ragionamento interno e una risposta più economica e veloce; massimo sforzo significa che il modello pensa di più, spende più token in output e segna più in alto. Il grafico sopra mostra Fable 5 che sale da circa l'11% al circa 31% su FrontierCode man mano che lo sforzo scala da basso a massimo, mentre Opus 4.8 si ferma intorno al 13% e GPT-5.5 rimane fermo vicino al 5-6%. Quindi il costo per task non è un numero fisso; è una curva su cui scegli un punto.
Facciamo un esempio concreto con i prezzi pubblicati di $10/$50. Questo è un calcolo aritmetico dalle tariffe postate da Anthropic, non un risultato di benchmark.
Prendi una singola chiamata agentica con 50.000 token in input e 15.000 token in output ad alto sforzo:
Input: 50.000 / 1.000.000 × $10 = $0,50
Output: 15.000 / 1.000.000 × $50 = $0,75
Per chiamata: $1,25Un task agentico reale concatena molte chiamate di questo tipo: leggi il repo, pianifica, modifica, esegui i test, correggi, ripeti. Diciamo che il ciclo gira 12 volte con quella forma: circa $15 per il task completato. Al massimo sforzo di ragionamento con contesto più pesante, la curva di costo di Anthropic posiziona i task difficili su FrontierCode più vicino ai $20 per task. Esegui lo stesso task su GPT-5.5 e pagherai meno per token. Ma se non riesce a completare il task a nessun livello di sforzo, il tuo costo per task completato è infinito. Fable 5 costa più per token di GPT-5.5, eppure vince sul costo per task completato, perché porta a termine lavori che GPT-5.5 non riesce a fare.
Ecco una chiamata minimale. L'annuncio di Anthropic indica claude-fable-5 come id del modello; verifica l'esatta stringa con versione nei documenti API di Anthropic prima di fare deploy, poiché gli alias con data a volte differiscono:
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-fable-5", # verify exact dated id in API docs
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000}, # reasoning effort
messages=[
{"role": "user", "content": "Migrate this module from Ruby 2.7 to 3.3 and run the tests."}
],
)
print(message.content)La tesi economica in una riga: paghi più per token di GPT-5.5, ma completi task che GPT-5.5 non riesce a completare a nessun prezzo. Per lavoro ad alto volume e bassa criticità, i calcoli favoriscono un modello più economico. Per il coding agentico difficile, favoriscono Fable 5.
La Divisione delle Salvaguardie: Perché Fable Passa a Opus 4.8
Fable 5 esegue classificatori su ogni richiesta. Quando rileva una query ad alto rischio (cyber offensivo, bio, chimica o tentativi di distillazione del modello), passa a Opus 4.8 invece di rispondere con la piena capacità Mythos-class. Anthropic dice che questo fallback si attiva su meno del 5% delle sessioni, quindi la maggior parte degli utenti non lo incontra mai. Il punto è mantenere la capacità pericolosa dietro al cancello lasciando il lavoro quotidiano intatto.

Il numero più duro è il tasso di successo degli attacchi: quanto spesso un attaccante automatizzato riesce a fare il jailbreak del modello per fargli fare qualcosa che non dovrebbe. Più basso è meglio. I risultati del red-team di Anthropic mostrano un calo netto tra le versioni: da Opus 4.6 all'83,2%, a Opus 4.7 al 72,7%, a Opus 4.8 al 56,6%, fino a Fable 5 al 5,4%. Sotto red-teaming automatizzato, gli attacchi sono riusciti contro Fable 5 solo nel 5,4% dei casi, in calo dal 56,6% di Opus 4.8.
Perché dovrebbe importarti? Se deploi un agente con accesso agli strumenti (shell, file system, rete), un jailbreak non è una risposta in chat sbagliata: è il modello che esegue comandi reali che un attaccante gli ha fatto eseguire. Un tasso di successo degli attacchi del 5,4% significa che è circa dieci volte più difficile da usare come arma rispetto a Opus 4.8. La copertura di IT Pro ha aperto proprio con il meccanismo di fallback per questo motivo: è la feature che rende un modello frontier abbastanza sicuro da affidare al pubblico.
Il compromesso è la latenza. Se il tuo workflow tocca legittimamente strumenti di sicurezza informatica, il fallback può attivarsi a metà task e scambiare i modelli, qualcosa da pianificare.
Claude Mythos 5 e la Questione del Dual-Use
Claude Mythos 5 è il fratello ristretto, lo stesso modello senza il fallback delle salvaguardie. Mantiene la capacità cyber offensiva che Fable 5 blocca, che è esattamente il motivo per cui Anthropic non lo rilascia pubblicamente. L'accesso avviene tramite Project Glasswing, un programma verificato per difensori e ricercatori che necessitano della piena capacità. Stesso modello, due posture di rilascio: una aperta, una riservata.

Il grafico rende visibile la divisione. Sulle valutazioni cyber offensive (Firefox, OSS-Fuzz, CyberGym, CyScenarioBench) Mythos 5 segna 88,4, 24,0, 83,8 e 38,7. Fable 5 restituisce un piatto 0,0 su tutti e quattro. Sulle valutazioni cyber offensive, Mythos 5 segna fino a 88,4 dove Fable 5 restituisce un piatto 0,0: la divisione delle salvaguardie, resa visibile.
Quel zero non è un gap di capacità. È il fallback che scatta ogni volta, bloccando la richiesta prima che il modello Mythos-class risponda. TechCrunch ha notato il tempismo: Anthropic ha rilasciato questo pochi giorni dopo aver avvertito che l'AI sta diventando troppo pericolosa da rilasciare apertamente. La divisione Fable/Mythos è la risposta politica a quell'avvertimento: pubblica la capacità, metti al riparo il pericolo.
Per la maggior parte degli sviluppatori, Mythos 5 è irrilevante. Non ti qualificherai mai per Project Glasswing e non ne hai bisogno. Ciò che conta è sapere che il modello che stai chiamando è deliberatamente limitato su una stretta banda di task, per scelta.
Cosa Significa: Conviene Passare?
Passa a Fable 5 per il coding agentico difficile, i task multi-step a lungo orizzonte, e il ragionamento visivo o spaziale — ovunque completare il task valga più che risparmiare centesimi per token. Resta su Opus 4.8 per il lavoro ad alto volume e sensibile ai costi, o per qualsiasi cosa che attiva comunque il fallback. Questo è l'intero framework. Il resto è abbinare il tuo carico di lavoro al lato giusto.
Quando Fable 5 vince:
- Coding agentico difficile dove Opus 4.8 si blocca; il gap su SWE-Bench Pro è reale
- Task a lungo orizzonte (refactor su più file, migrazioni) dove l'auto-validazione paga
- Carichi di lavoro con visione e ragionamento spaziale
- Qualsiasi lavoro dove un task completato vale più del premium per token
Quando Opus 4.8 vince ancora:
- Lavoro ad alto volume e sensibile ai costi dove il prezzo per token domina
- Carichi di lavoro cyber/bio/chimica, dove Fable 5 passa comunque a Opus 4.8, quindi chiamalo direttamente
- Flussi sensibili alla latenza che non possono tollerare uno scambio di modelli a metà task
| Caso d'uso | Modello consigliato |
|---|---|
| Coding agentico difficile / migrazioni | Claude Fable 5 |
| Visione / ragionamento spaziale | Claude Fable 5 |
| Classificazione ad alto volume e basso costo | Claude Opus 4.8 |
| Strumenti di sicurezza / red-team | Claude Opus 4.8 (diretto) |
Sulla disponibilità: Fable 5 è gratuito sui piani Pro/Max/Team/Enterprise fino al 22 giugno 2026, con crediti d'uso che si applicano dal 23 giugno. È generalmente disponibile sull'API, AWS Bedrock, GitHub Copilot secondo il changelog di GitHub, e Harvey. Puoi quindi testare il passaggio nel tuo editor oggi senza cambiare la fatturazione.
Sull'Autore
Mert Batur Gurbuz è co-fondatore di Techsy.io, dove il team sviluppa agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Studia all'Università di Birmingham e scrive dello stack di strumenti LLM che il team Techsy usa davvero in produzione. Connettiti su LinkedIn.
Co-Founder, Techsy.io · Università di Birmingham
Domande Frequenti
Cos'è Claude Fable 5?
Claude Fable 5 è il primo modello Mythos-class disponibile pubblicamente di Anthropic, lanciato il 9 giugno 2026. Segna 80,3% su SWE-Bench Pro e usa classificatori di salvaguardia che passano a Opus 4.8 per le query ad alto rischio. Costa $10 input / $50 output per milione di token.
Qual è la differenza tra Fable 5 e Mythos 5?
Sono lo stesso modello frontier con posture di rilascio diverse. Fable 5 è pubblico e con salvaguardie; passa a Opus 4.8 per le query pericolose. Mythos 5 è la versione a piena capacità con accesso ristretto, accessibile solo tramite il programma Project Glasswing di Anthropic per difensori e ricercatori verificati.
Claude Fable 5 è davvero migliore di Opus 4.8?
Sì sul coding agentico difficile, sulla visione e sul ragionamento spaziale: Fable 5 raggiunge l'80,3% su SWE-Bench Pro contro il 69,2% di Opus 4.8. Ma Opus 4.8 vince ancora sul lavoro ad alto volume e sensibile ai costi, e Fable 5 passa comunque a Opus 4.8 per gli argomenti ad alto rischio cyber/bio/chimica. "Migliore" dipende dal tuo carico di lavoro.
Quanto costa Claude Fable 5?
Claude Fable 5 costa $10 per milione di token in input e $50 per milione di token in output. Anthropic lo presenta come "meno della metà del prezzo di Mythos Preview." È circa 2× Opus 4.8 per token, ma il valore si misura per task completato, dato che Fable 5 porta a termine lavori che i modelli più economici non riescono a fare.
Cos'è un modello "Mythos-class"?
Mythos-class è il nuovo livello di capacità massima di Anthropic, lanciato con Fable 5 e Mythos 5. Rappresenta un salto frontier rispetto alla linea Opus 4.x sui benchmark di coding e ragionamento. Fable 5 e Mythos 5 sono due versioni di rilascio dello stesso modello Mythos-class: uno pubblico e con salvaguardie, uno ristretto.
Perché Fable 5 passa a Opus 4.8?
Fable 5 usa classificatori che rilevano le richieste ad alto rischio (cyber offensivo, bio, chimica o distillazione del modello) e le instrada verso Opus 4.8 invece di rispondere con la piena capacità Mythos-class. Questo si attiva su meno del 5% delle sessioni. Ha ridotto il tasso di successo degli attacchi avversariali dal 56,6% (Opus 4.8) al 5,4%.
Posso accedere a Claude Mythos 5?
Probabilmente no. Mythos 5 è ristretto dietro Project Glasswing, il programma di accesso verificato di Anthropic per difensori e ricercatori della sicurezza che necessitano della piena capacità cyber offensiva che Fable 5 blocca. La maggior parte degli sviluppatori non si qualificherà e non ne ha bisogno, dato che Fable 5 copre il lavoro agentico e di coding quotidiano.
Dove posso usare Claude Fable 5?
Claude Fable 5 è generalmente disponibile sull'API di Anthropic, AWS Bedrock, GitHub Copilot e Harvey. È gratuito sui piani Pro, Max, Team ed Enterprise con licenze a posto fino al 22 giugno 2026; i crediti d'uso si applicano dal 23 giugno. Puoi testarlo nel tuo editor o tramite API già oggi.
Il Verdetto Finale
Claude Fable 5 è un vero passo avanti rispetto a Opus 4.8: 80,3% vs 69,2% su SWE-Bench Pro, il doppio del punteggio su FrontierCode, e un tasso di successo degli attacchi del 5,4% che lo rende molto più sicuro da deployare con strumenti. Passa a Fable 5 per il coding agentico difficile, i task a lungo orizzonte e il lavoro con la visione. Resta su Opus 4.8 per il volume sensibile ai costi o per qualsiasi cosa che attiva comunque il fallback. È gratuito fino al 22 giugno, quindi puoi testare il passaggio prima che ti costi qualcosa. Il team Techsy sviluppa agenti in produzione esattamente su questo stack, quindi contattaci se vuoi una mano.