
Claude Fable 5 vs Opus 4.8: Chiar ar trebui să faci schimbarea? (Clasă Mythos, testat prin benchmark)
Anthropic a lansat Claude Fable 5 astăzi, 9 iunie 2026. Obține 80,3% pe SWE-Bench Pro, benchmark-ul de codare agentică în care Opus 4.8 atinge 69,2%, iar GPT-5.5 rămâne în urmă cu 58,6%. Nu e o diferență de rotunjire. Și există o întorsătură de situație: Fable 5 este jumătatea publică și protejată a unui nou model din „clasa Mythos", cu un model înrudit, cu acces restricționat, numit Claude Mythos 5, ținut în spatele unui program de acces limitat. Iată ce s-a schimbat, cât costă o sarcină reală la 10 $/50 $ per milion de tokeni și dacă chiar ar trebui să îți muți stack-ul de pe Opus 4.8.
Răspuns rapid
- Fable 5 obține 80,3% pe SWE-Bench Pro, față de 69,2% pentru Opus 4.8 și 58,6% pentru GPT-5.5.
- Prețul este de 10 $ la intrare / 50 $ la ieșire per milion de tokeni, mai puțin de jumătate din Mythos Preview.
- Fable 5 revine automat la Opus 4.8 pentru interogările cu risc ridicat din domeniile cyber/bio/chimie (sub 5% din sesiuni).
- Gratuit pe planurile Pro/Max/Team/Enterprise până pe 22 iunie 2026; creditele de utilizare se aplică din 23 iunie.
Ce s-a lansat de fapt: Fable 5, Mythos 5 și linia „clasă Mythos"
Clasa Mythos este noul nivel de top al capabilităților Anthropic și vine sub forma a două modele. Claude Fable 5 este versiunea publică și protejată pe care o poți apela astăzi. Claude Mythos 5 este același model de frontieră, dar fără măsurile de protecție, ținut în spatele unui acces restricționat. Același creier, două moduri de lansare.
Această împărțire este întreaga poveste. Potrivit anunțului din newsroom-ul Anthropic, Mythos 5 păstrează capacități de frontieră complete, inclusiv abilități cyber ofensive care ar putea cauza daune reale, așa că Anthropic nu îl oferă tuturor. Fable 5 ia același model și îl înconjoară cu clasificatoare care detectează cererile cu risc ridicat și le redirecționează discret către Opus 4.8.
Așadar, când apelezi Fable 5, primești raționament de clasă Mythos pentru tot ce nu este periculos și un model de rezervă mai sigur pentru mica parte care este periculoasă. CNBC a descris acest lucru ca Anthropic lansând publicului „un AI de tip Mythos", ceea ce este corect, dar mecanismul precis contează mai mult decât titlul.
Fable 5 și Mythos 5 sunt același model de frontieră împărțit în două: unul pe care îl poți folosi astăzi și unul pe care Anthropic îl ține cu acces restricționat. Dacă reții un singur lucru despre denumiri, reține asta. Clasa Mythos este nivelul; Fable și Mythos sunt cele două uși către el.
Ce s-a schimbat față de linia Opus 4.x
Pe fiecare evaluare de codare și raționament publicată de Anthropic, Fable 5 depășește Opus 4.8, nu la mustață, ci cu marje de două cifre. SWE-Bench Pro sare de la 69,2% la 80,3%. FrontierCode Diamond crește de la 13,4 la 29,3. Și prețul a scăzut, iar modelul scalează cu un nou reglaj al efortului de raționament. Acesta este un pas de frontieră autentic față de linia Opus 4.x, nu o lansare minoră.

Seria de 13 benchmark-uri de mai sus este versiunea pe scurt. Iată subsetul principal comparat cu cele trei modele pe care majoritatea echipelor le compară de fapt:
| Benchmark | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| SWE-Bench Pro (codare agentică) | 80,3% | 69,2% | 58,6% |
| FrontierCode Diamond (cea mai grea codare) | 29,3 | 13,4 | 5,7 |
| Terminal-Bench 2.1 (shell agentic) | 88,0% | n/a | n/a |
| GPQA-AA (raționament de nivel postuniversitar, Elo) | 1932 | n/a | n/a |
| ExploitBench | 78,0% | n/a | n/a |
Ancora de comparație aici este Claude Opus 4.8, modelul pe care Fable 5 îl înlocuiește la frontieră și același model la care Fable 5 revine pentru interogările cu risc ridicat. Dacă ai urmărit linia Opus 4.x pe parcursul ultimelor două lansări, tiparul a fost al unor câștiguri incrementale. Fable 5 rupe acest tipar.
Două lucruri de semnalat înainte să iei tabelul drept literă de lege. În primul rând, acestea sunt evaluările publicate de Anthropic însuși, nu un test independent. În al doilea rând, reglajul efortului de raționament înseamnă că un singur număr de benchmark ascunde o curbă de cost. Mai multe despre asta în secțiunea de prețuri, pentru că schimbă calculul.
Benchmark-urile care contează pentru dezvoltatori
Patru numere poartă greutatea practică: SWE-Bench Pro 80,3%, FrontierCode Diamond 29,3, Terminal-Bench 2.1 88,0% și GPQA-AA 1932 Elo. Împreună, ele acoperă lucrul real pe repo-uri, cele mai grele probleme sintetice de codare, sarcinile de shell agentic și raționamentul de nivel postuniversitar. Dacă sarcina ta atinge vreuna dintre acestea, aceasta este secțiunea care îți spune dacă numărul se aplică muncii tale.
Graficul principal din vârful acestei postări este dovada: SWE-Bench Pro 80,3 vs 69,2 vs 58,6 și FrontierCode 29,3 vs 13,4 vs 5,7. Dar ce măsoară acestea de fapt?
- SWE-Bench Pro testează dacă un model poate livra un pull request real într-un repo real: clonează, înțelege, aplică patch-uri, trece testele. SWE-Bench Pro măsoară dacă un model poate livra un pull request real într-un repo real, iar Fable 5 reușește 8 din 10. Acesta este cel mai apropiat indicator de „poate să îmi facă treaba reală".
- Terminal-Bench 2.1 evaluează sarcinile de shell agentic: rularea comenzilor, citirea outputului, recuperarea din erori. 88,0% contează dacă construiești agenți de codare AI care trăiesc într-un terminal.
- FrontierCode Diamond este cel mai greu nivel de probleme de codare, cele în care majoritatea modelelor obțin scoruri cu o singură cifră. 29,3 este scăzut în termeni absoluți, dar mai mult decât dublul lui 13,4 al lui Opus 4.8.
- GPQA-AA este raționament științific de nivel postuniversitar, evaluat ca rating Elo. 1932 semnalează un raționament puternic în mai mulți pași, dincolo de cod.
În fluxurile noastre de lucru Claude Code pe linia Opus 4.x, plafonul recurent a fost reprezentat de sarcinile agentice pe termen lung: modelul își pierdea firul la jumătatea unei modificări pe mai multe fișiere. Numerele Fable 5 pe Terminal-Bench și SWE-Bench Pro sugerează că acest plafon s-a mutat. Dacă s-a mutat pentru repo-ul tău este singurul test care contează, dar numerele publicate sunt genul potrivit de numere de care să îți pese.
Cazuri de test reale: Ce face Fable 5 și ce nu puteau modelele anterioare
Anthropic a publicat trei exemple concrete care arată clasa de probleme pe care Fable 5 o poate gestiona acum: o migrare a bazei de cod Stripe comprimată de la luni la o zi, un joc video finalizat doar cu vederea și un salt de performanță de 3× din auto-validare. Fiecare indică o capabilitate pe care modelele anterioare nu o puteau atinge. Toate trei provin de la Anthropic; cităm anunțul lor, nu un test propriu.
Iată ce demonstrează fiecare:
-
Migrarea Ruby Stripe. Anthropic raportează că Fable 5 a comprimat o migrare a bazei de cod Ruby de la aproximativ două luni la circa o zi. Stripe a comprimat o migrare Ruby de la două luni la o singură zi, iar aceasta este anvergura problemei pe care acest model o schimbă. Aceasta este clasa de refactorizare pe termen lung care înainte necesita o echipă umană care să țină întreaga bază de cod în cap.
-
Pokémon FireRed doar cu vederea. Potrivit Anthropic, Fable 5 a finalizat Pokémon FireRed folosind doar vederea, în timp ce modelele anterioare aveau nevoie de harness-uri personalizate complexe pentru a introduce starea jocului ca text. Acesta este un salt de raționament spațial și vizual: modelul citește ecranul și acționează, fără scaffolding.
-
Slay the Spire, 3×. La efort maxim de raționament, Anthropic spune că Fable 5 își auto-validează propriile mutări și a atins o performanță de 3× mai bună prin memorie persistentă. Concluzia nu este jocul în sine, ci faptul că modelul își poate verifica propria muncă pe un orizont lung de planificare și se poate îmbunătăți din asta.
Niciuna dintre acestea nu este ceva ce ar trebui să iei de bun pentru sarcina ta. Dar ele se potrivesc perfect cu salturile de benchmark din tabelul de mai sus: codare pe termen lung (SWE-Bench Pro), raționament spațial (vedere) și auto-validare (reglajul efortului de raționament). Câștigurile calitative și cele cantitative spun aceeași poveste.
Prețurile și realitatea costului per sarcină
Fable 5 costă 10 $ per milion de tokeni la intrare și 50 $ per milion de tokeni la ieșire. Anthropic încadrează asta ca „mai puțin de jumătate din prețul Claude Mythos Preview". Este, de asemenea, aproximativ 2× față de Opus 4.8 per token. Ambele sunt adevărate. Problema este că prețul per token este unitatea greșită de măsură. Ceea ce plătești de fapt este o sarcină finalizată, iar aici calculul lui Fable 5 devine interesant.

Efortul de raționament este un reglaj pe care îl setezi per cerere. Efortul scăzut înseamnă mai puțini tokeni de raționament interni și un răspuns mai ieftin și mai rapid; efortul maxim înseamnă că modelul gândește mai mult, consumă mai mulți tokeni la ieșire și obține un scor mai mare. Graficul de mai sus arată Fable 5 urcând de la ~11% la ~31% pe FrontierCode pe măsură ce efortul scalează de la scăzut la maxim, în timp ce Opus 4.8 atinge vârful în jur de 13%, iar GPT-5.5 rămâne plat aproape de 5-6%. Așadar, costul per sarcină nu este un singur număr; este o curbă pe care alegi un punct.
Să lucrăm un exemplu concret pe baza prețurilor publicate de 10 $/50 $. Aceasta este o aritmetică pe baza tarifelor afișate de Anthropic, nu un rezultat de benchmark.
Ia o singură apelare agentică cu 50.000 de tokeni la intrare și 15.000 de tokeni la ieșire, la efort ridicat:
Input: 50,000 / 1,000,000 × $10 = $0.50
Output: 15,000 / 1,000,000 × $50 = $0.75
Per call: $1.25O sarcină agentică reală înlănțuie multe astfel de apelări: citește repo-ul, planifică, editează, rulează teste, repară, repetă. Să zicem că bucla rulează 12 apelări de această formă: aproximativ 15 $ pentru sarcina finalizată. La efort maxim de raționament, cu un context mai greu, propria curbă de cost a Anthropic plasează sarcinile FrontierCode grele mai aproape de intervalul de 20 $ per sarcină. Rulează aceeași sarcină pe GPT-5.5 și vei plăti mai puțin per token. Dar dacă nu poate finaliza sarcina la niciun nivel de efort, costul tău per sarcină finalizată este infinit. Fable 5 costă mai mult per token decât GPT-5.5 și totuși câștigă la costul per sarcină finalizată, pentru că finalizează muncă pe care GPT-5.5 nu o poate face.
Iată un apel minimal. Anunțul Anthropic oferă claude-fable-5 ca id de model; verifică șirul exact cu versiune în documentația API Anthropic înainte de lansare, deoarece aliasurile datate diferă uneori:
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-fable-5", # verify exact dated id in API docs
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000}, # reasoning effort
messages=[
{"role": "user", "content": "Migrate this module from Ruby 2.7 to 3.3 and run the tests."}
],
)
print(message.content)Teza economică pe scurt: plătești mai mult per token decât GPT-5.5, dar finalizezi sarcini pe care GPT-5.5 nu le poate finaliza la niciun preț. Pentru muncă cu miză mică și volum mare, acest calcul favorizează un model mai ieftin. Pentru codare agentică grea, favorizează Fable 5.
Divizarea măsurilor de protecție: De ce Fable revine la Opus 4.8
Fable 5 rulează clasificatoare la fiecare cerere. Când detectează o interogare cu risc ridicat (cyber ofensiv, bio, chimie sau încercări de distilare a modelului), revine la Opus 4.8 în loc să răspundă cu capacitatea completă de clasă Mythos. Anthropic spune că această revenire se declanșează în sub 5% din sesiuni, deci majoritatea utilizatorilor nu o declanșează niciodată. Scopul este de a păstra capacitatea periculoasă în spatele porții, lăsând munca de zi cu zi neatinsă.

Cifra mai dură este rata de succes a atacului: cât de des un atacator automatizat poate face jailbreak modelului pentru a face ceva ce nu ar trebui. Mai scăzut este mai bine. Rezultatele red-team ale Anthropic arată o scădere abruptă de-a lungul lansărilor, de la Opus 4.6 cu 83,2%, la Opus 4.7 cu 72,7%, la Opus 4.8 cu 56,6%, până la Fable 5 cu 5,4%. În red-teaming automatizat, atacurile au reușit împotriva Fable 5 doar în 5,4% din cazuri, în scădere de la 56,6% pe Opus 4.8.
De ce ar trebui să îți pese? Dacă implementezi un agent cu acces la instrumente (shell, sistem de fișiere, rețea), un jailbreak nu este un răspuns prost de chat, ci un model care execută comenzi reale în care un atacator l-a direcționat. O rată de succes a atacului de 5,4% înseamnă că este de aproximativ zece ori mai greu de transformat în armă decât Opus 4.8. Articolul IT Pro a deschis cu mecanismul de revenire exact din acest motiv: este funcția care face un model de frontieră suficient de sigur pentru a fi oferit publicului.
Compromisul este latența. Dacă fluxul tău de lucru atinge în mod legitim instrumente de securitate, revenirea se poate declanșa în mijlocul sarcinii și poate schimba modelul sub tine, un lucru de care să ții cont.
Claude Mythos 5 și problema utilizării duale
Claude Mythos 5 este modelul înrudit cu acces restricționat, același model fără revenirea de protecție. Păstrează capacitatea cyber ofensivă pe care Fable 5 o blochează, ceea ce este exact motivul pentru care Anthropic nu îl lansează public. Accesul se face prin Project Glasswing, un program verificat pentru apărători și cercetători care au nevoie de capacitate completă. Același model, două moduri de lansare: unul deschis, unul restricționat.

Graficul face vizibilă restricționarea. Pe evaluările cyber ofensive (Firefox, OSS-Fuzz, CyberGym, CyScenarioBench), Mythos 5 obține 88,4, 24,0, 83,8 și 38,7. Fable 5 returnează un 0,0 plat pe toate patru. Pe evaluările cyber ofensive, Mythos 5 obține până la 88,4, în timp ce Fable 5 returnează un 0,0 plat: divizarea măsurilor de protecție, făcută vizibilă.
Acel zero nu este un decalaj de capabilitate. Este revenirea care se declanșează de fiecare dată, blocând cererea înainte ca modelul de clasă Mythos să răspundă. TechCrunch a remarcat momentul: Anthropic a lansat asta la câteva zile după ce a avertizat că AI-ul devine prea periculos pentru a fi lansat deschis. Divizarea Fable/Mythos este răspunsul de politică la acea avertizare: publică capacitatea, restricționează pericolul.
Pentru majoritatea dezvoltatorilor, Mythos 5 este irelevant. Nu te vei califica niciodată pentru Project Glasswing și nici nu trebuie. Ceea ce contează este să știi că modelul pe care îl apelezi este limitat deliberat pe o bandă îngustă de sarcini, prin design.
Ce înseamnă asta: Ar trebui să faci schimbarea?
Treci la Fable 5 pentru codare agentică grea, sarcini pe termen lung cu mai mulți pași și raționament vizual sau spațial, oriunde finalizarea sarcinii bate economisirea câtorva cenți per token. Rămâi pe Opus 4.8 pentru muncă cu volum mare sensibilă la cost sau pentru orice declanșează oricum revenirea. Acesta este întregul cadru. Restul înseamnă să potrivești sarcina ta pe partea potrivită a lui.
Când Fable 5 câștigă:
- Codare agentică grea în care Opus 4.8 se blochează; decalajul SWE-Bench Pro este real
- Sarcini pe termen lung (refactorizări pe mai multe fișiere, migrări) în care auto-validarea se merită
- Sarcini de raționament vizual și spațial
- Orice muncă în care o sarcină finalizată valorează mai mult decât prima per token
Când Opus 4.8 încă câștigă:
- Muncă cu volum mare, sensibilă la cost, în care prețul per token domină
- Sarcini cyber/bio/chimie, în care Fable 5 revine oricum la Opus 4.8, deci apelează-l direct
- Fluxuri sensibile la latență care nu pot tolera o schimbare de model în mijlocul sarcinii
| Caz de utilizare | Model recomandat |
|---|---|
| Codare agentică grea / migrări | Claude Fable 5 |
| Raționament vizual / spațial | Claude Fable 5 |
| Clasificare ieftină cu volum mare | Claude Opus 4.8 |
| Instrumente de securitate / red-team | Claude Opus 4.8 (direct) |
Despre disponibilitate: Fable 5 este gratuit pe planurile Pro/Max/Team/Enterprise până pe 22 iunie 2026, creditele de utilizare aplicându-se din 23 iunie. Este disponibil general pe API, AWS Bedrock, GitHub Copilot, conform jurnalului de modificări GitHub, și Harvey. Așadar, poți testa schimbarea în editorul tău astăzi, fără să îți schimbi facturarea.
Despre autor
Mert Batur Gurbuz este Co-fondator al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri voice/SDR pentru clienți B2B. Studiază la University of Birmingham și scrie despre stack-ul de instrumente LLM pe care echipa Techsy îl folosește efectiv în producție. Conectează-te pe LinkedIn.
Co-fondator, Techsy.io · University of Birmingham
Întrebări frecvente
Ce este Claude Fable 5?
Claude Fable 5 este primul model de clasă Mythos disponibil public al Anthropic, lansat pe 9 iunie 2026. Obține 80,3% pe SWE-Bench Pro și rulează clasificatoare de protecție care revin la Opus 4.8 pentru interogările cu risc ridicat. Costă 10 $ la intrare / 50 $ la ieșire per milion de tokeni.
Care este diferența dintre Fable 5 și Mythos 5?
Sunt același model de frontieră cu moduri de lansare diferite. Fable 5 este public și protejat; revine la Opus 4.8 pentru interogările periculoase. Mythos 5 este versiunea cu acces restricționat și capacitate completă, accesibilă doar prin programul Project Glasswing al Anthropic, pentru apărători și cercetători verificați.
Este Claude Fable 5 chiar mai bun decât Opus 4.8?
Da, la codare agentică grea, vedere și raționament spațial: Fable 5 atinge 80,3% pe SWE-Bench Pro față de 69,2% pentru Opus 4.8. Dar Opus 4.8 încă câștigă la munca cu volum mare sensibilă la cost, iar Fable 5 revine oricum la Opus 4.8 pentru subiectele cyber/bio/chimie cu risc ridicat. „Mai bun" depinde de sarcina ta.
Cât costă Claude Fable 5?
Claude Fable 5 costă 10 $ per milion de tokeni la intrare și 50 $ per milion de tokeni la ieșire. Încadrarea Anthropic este „mai puțin de jumătate din prețul Mythos Preview". Asta înseamnă aproximativ 2× față de Opus 4.8 per token, dar cazul de valoare este per sarcină finalizată, deoarece Fable 5 finalizează muncă pe care modelele mai ieftine nu o pot face.
Ce este un model „clasă Mythos"?
Clasa Mythos este noul nivel de top al capabilităților Anthropic, lansat împreună cu Fable 5 și Mythos 5. Reprezintă un salt de frontieră față de linia Opus 4.x pe benchmark-urile de codare și raționament. Fable 5 și Mythos 5 sunt două versiuni de lansare ale aceluiași model de clasă Mythos: unul public și protejat, unul cu acces restricționat.
De ce revine Fable 5 la Opus 4.8?
Fable 5 rulează clasificatoare care detectează cererile cu risc ridicat (cyber ofensiv, bio, chimie sau distilare de model) și le redirecționează către Opus 4.8 în loc să răspundă cu capacitatea completă de clasă Mythos. Aceasta se declanșează în sub 5% din sesiuni. A redus succesul atacurilor adversariale de la 56,6% (Opus 4.8) la 5,4%.
Pot accesa Claude Mythos 5?
Probabil că nu. Mythos 5 este restricționat în spatele Project Glasswing, programul de acces verificat al Anthropic pentru apărători și cercetători de securitate care au nevoie de capacitatea cyber ofensivă completă pe care Fable 5 o blochează. Majoritatea dezvoltatorilor nu se vor califica și nici nu trebuie, deoarece Fable 5 acoperă munca agentică și de codare de zi cu zi.
Unde pot folosi Claude Fable 5?
Claude Fable 5 este disponibil general pe API-ul Anthropic, AWS Bedrock, GitHub Copilot și Harvey. Este gratuit pe planurile Pro, Max, Team și Enterprise pe bază de locuri până pe 22 iunie 2026; creditele de utilizare se aplică din 23 iunie. Îl poți testa în editorul tău sau prin API astăzi.
Concluzia
Claude Fable 5 este un pas de frontieră real față de Opus 4.8: 80,3% vs 69,2% pe SWE-Bench Pro, dublul scorului FrontierCode și o rată de succes a atacului de 5,4% care îl face mult mai sigur de implementat cu instrumente. Treci pentru codare agentică grea, sarcini pe termen lung și muncă de vedere. Rămâi pe Opus 4.8 pentru volum sensibil la cost sau orice declanșează oricum revenirea. Este gratuit până pe 22 iunie, deci poți testa schimbarea înainte să te coste ceva. Echipa Techsy construiește agenți de producție exact pe acest stack, așa că ia legătura dacă vrei ajutor.