
Claude Fable 5 vs Opus 4.8: Bør du faktisk skifte? (Mythos-klasse, benchmarket)
Anthropic lancerede Claude Fable 5 i dag, den 9. juni 2026. Den scorer 80,3% på SWE-Bench Pro, benchmarken for agentisk kodning, hvor Opus 4.8 når 69,2% og GPT-5.5 halter bagefter med 58,6%. Det er ikke en afrundingsfejl. Og der er et twist: Fable 5 er den offentlige, sikrede halvdel af en ny "Mythos-klasse"-model, med en gate'd søskende kaldet Claude Mythos 5 bag et begrænset adgangsprogram. Her er, hvad der ændrede sig, hvad en reel opgave koster til $10/$50 pr. million tokens, og om du faktisk bør flytte din stack væk fra Opus 4.8.
Hurtigt svar
- Fable 5 scorer 80,3% på SWE-Bench Pro mod Opus 4.8's 69,2% og GPT-5.5's 58,6%.
- Prisen er $10 input / $50 output pr. million tokens, mindre end halvdelen af Mythos Preview.
- Fable 5 falder automatisk tilbage til Opus 4.8 ved højrisiko cyber/bio/kemi-forespørgsler (under 5% af sessioner).
- Gratis på Pro/Max/Team/Enterprise-planer indtil 22. juni 2026; forbrugscredits gælder fra 23. juni.
Hvad der faktisk blev lanceret: Fable 5, Mythos 5 og "Mythos-klasse"-linjen
Mythos-klasse er Anthropics nye øverste kapacitetsniveau, og det leveres som to modeller. Claude Fable 5 er den offentlige, sikrede version, du kan kalde i dag. Claude Mythos 5 er den samme frontier-model med sikkerhedsforanstaltningerne fjernet, holdt bag gate'd adgang. Samme hjerne, to udgivelsespositioner.
Opdelingen er hele historien her. Ifølge Anthropics nyhedsrum-meddelelse bevarer Mythos 5 fuld frontier-kapacitet, herunder offensive cyber-færdigheder, der kan forårsage reel skade, så Anthropic udleverer den ikke til alle. Fable 5 tager den samme model og pakker den ind i klassifikatorer, der opdager højrisiko-forespørgsler og stille dirigerer dem til Opus 4.8 i stedet.
Så når du kalder Fable 5, får du Mythos-klasse-ræsonnement på alt, der ikke er farligt, og en sikrere fallback-model på det lille udsnit, der er. CNBC beskrev det som, at Anthropic udgiver en "Mythos-lignende AI til offentligheden," hvilket er korrekt, men den præcise mekanisme betyder mere end overskriften.
Fable 5 og Mythos 5 er den samme frontier-model delt i to: en du kan bruge i dag, og en Anthropic holder gate'd. Hvis du kun husker én ting om navngivningen, så husk det. Mythos-klasse er niveauet; Fable og Mythos er de to døre ind til det.
Hvad der ændrede sig ift. Opus 4.x-linjen
På alle kodnings- og ræsonnement-evals, Anthropic offentliggjorde, slår Fable 5 Opus 4.8 — ikke med en hårsbredde, men med tocifrede marginer. SWE-Bench Pro springer fra 69,2% til 80,3%. FrontierCode Diamond går fra 13,4 til 29,3. Prisen faldt også, og modellen skalerer med en ny ræsonnement-indsats-knap. Det er et ægte frontier-skridt over Opus 4.x-linjen, ikke en punktudgivelse.

13-benchmark-gennemgangen ovenfor er overblikket. Her er hoveduddraget mod de tre modeller, de fleste teams faktisk sammenligner:
| Benchmark | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| SWE-Bench Pro (agentisk kodning) | 80,3% | 69,2% | 58,6% |
| FrontierCode Diamond (sværeste kodning) | 29,3 | 13,4 | 5,7 |
| Terminal-Bench 2.1 (agentisk shell) | 88,0% | n/a | n/a |
| GPQA-AA (akademisk ræsonnement, Elo) | 1932 | n/a | n/a |
| ExploitBench | 78,0% | n/a | n/a |
Sammenligningsankeren her er Claude Opus 4.8, modellen Fable 5 erstatter ved frontieren, og den samme model Fable 5 falder tilbage til ved højrisiko-forespørgsler. Hvis du har fulgt Opus 4.x-linjen over de seneste to udgivelser, var mønsteret inkrementelle gevinster. Fable 5 bryder det mønster.
To ting at bemærke, før du læser tabellen som evangelium. For det første er det Anthropics egne offentliggjorte evals, ikke en uafhængig test. For det andet betyder ræsonnement-indsats-knappen, at et enkelt benchmark-tal skjuler en omkostningskurve. Mere om det i prissektionen, for det ændrer matematikken.
De benchmarks, der betyder noget for buildere
Fire tal bærer den praktiske vægt: SWE-Bench Pro 80,3%, FrontierCode Diamond 29,3, Terminal-Bench 2.1 88,0% og GPQA-AA 1932 Elo. Tilsammen dækker de reelt repo-arbejde, de sværeste syntetiske kodningsproblemer, agentiske shell-opgaver og akademisk ræsonnement. Hvis din workload rører nogen af dem, er det denne sektion, der fortæller dig, om tallet matcher dit job.
Hero-grafen øverst i dette indlæg er beviset: SWE-Bench Pro 80,3 mod 69,2 mod 58,6, og FrontierCode 29,3 mod 13,4 mod 5,7. Hvad måler de så faktisk?
- SWE-Bench Pro tester, om en model kan levere en reel pull request til et reelt repo: klone, forstå, patche, bestå tests. SWE-Bench Pro måler, om en model kan levere en reel pull request til et reelt repo, og Fable 5 lander 8 ud af 10. Det er den tætteste proxy for "kan den gøre mit faktiske job."
- Terminal-Bench 2.1 scorer agentiske shell-opgaver: køre kommandoer, læse output, komme sig efter fejl. 88,0% betyder noget, hvis du bygger AI-kodningsagenter, der lever i en terminal.
- FrontierCode Diamond er det sværeste niveau af kodningsproblemer, dem hvor de fleste modeller scorer enkeltcifre. 29,3 er lavt i absolutte termer, men mere end det dobbelte af Opus 4.8's 13,4.
- GPQA-AA er akademisk videnskabeligt ræsonnement, scoret som en Elo-rating. 1932 signalerer stærkt flertrins-ræsonnement ud over kode.
I vores Claude Code-workflows på tværs af Opus 4.x-linjen var det tilbagevendende loft langsigtede agentiske opgaver: modellen mistede tråden midtvejs i en flerfils-ændring. Fable 5's Terminal-Bench- og SWE-Bench Pro-tal tyder på, at det loft flyttede sig. Om det flyttede sig for dit repo, er den eneste test, der tæller, men de offentliggjorte tal er den rigtige slags tal at bekymre sig om.
Reelle testcases: Hvad Fable 5 kan, som tidligere modeller ikke kunne
Anthropic offentliggjorde tre konkrete eksempler, der viser den klasse af problemer, Fable 5 nu kan håndtere: en Stripe-codebase-migrering komprimeret fra måneder til en dag, et videospil færdiggjort udelukkende på vision, og et 3× performance-spring fra selvvalidering. Hvert enkelt peger på en kapacitet, tidligere modeller ikke kunne nå. Alle tre er fra Anthropic; vi citerer deres meddelelse, ikke en test af vores egen.
Her er, hvad hvert enkelt beviser:
-
Stripe Ruby-migrering. Anthropic rapporterer, at Fable 5 komprimerede en Ruby-codebase-migrering fra cirka to måneder til omkring én dag. Stripe komprimerede en Ruby-migrering fra to måneder til en enkelt dag, og det er den størrelse problem, denne model ændrer. Det er den klasse af langsigtet refaktorering, der tidligere krævede et menneskeligt team, der holdt hele codebasen i hovedet.
-
Pokémon FireRed udelukkende på vision. Ifølge Anthropic færdiggjorde Fable 5 Pokémon FireRed udelukkende med vision, hvor tidligere modeller krævede komplekse custom harnesses til at fodre spiltilstand ind som tekst. Det er et spring i rumlig og visuel ræsonnement: modellen læser skærmen og handler, ingen scaffolding.
-
Slay the Spire, 3×. Ved maksimal ræsonnement-indsats siger Anthropic, at Fable 5 selvvaliderer sine egne træk og nåede 3× bedre performance via persistent hukommelse. Pointen er ikke spillet; det er, at modellen kan tjekke sit eget arbejde over en lang planlægningshorisont og forbedre sig fra det.
Ingen af disse er ting, du bør tage for givet for din workload. Men de matcher præcist benchmark-springene i tabellen ovenfor: langsigtet kodning (SWE-Bench Pro), rumlig ræsonnement (vision) og selvvalidering (ræsonnement-indsats-knappen). De kvalitative gevinster og de kvantitative fortæller den samme historie.
Prissætning og pris-pr.-opgave-virkeligheden
Fable 5 koster $10 pr. million input-tokens og $50 pr. million output-tokens. Anthropic rammer det som "mindre end halvdelen af prisen på Claude Mythos Preview." Det er også cirka 2× Opus 4.8 pr. token. Begge dele er sandt. Hagen er, at tokenpris er den forkerte enhed. Det, du faktisk betaler for, er en færdig opgave, og det er her, Fable 5's matematik bliver interessant.

Ræsonnement-indsats er en knap, du indstiller pr. forespørgsel. Lav indsats betyder færre interne ræsonnement-tokens og et billigere, hurtigere svar; maksimal indsats betyder, at modellen tænker længere, bruger flere output-tokens og scorer højere. Grafen ovenfor viser Fable 5 klatre fra ~11% til ~31% på FrontierCode, når indsatsen skalerer fra lav til maks, mens Opus 4.8 topper omkring 13% og GPT-5.5 ligger fladt nær 5-6%. Så omkostning pr. opgave er ikke ét tal; det er en kurve, du vælger et punkt på.
Lad os regne et konkret eksempel fra de offentliggjorte $10/$50-priser. Det er aritmetik fra Anthropics offentliggjorte takster, ikke et benchmarket resultat.
Tag et enkelt agentisk kald med 50.000 input-tokens og 15.000 output-tokens ved høj indsats:
Input: 50,000 / 1,000,000 × $10 = $0.50
Output: 15,000 / 1,000,000 × $50 = $0.75
Per call: $1.25En reel agentisk opgave kæder mange sådanne kald sammen: læs repo, planlæg, rediger, kør tests, ret, gentag. Sig at løkken kører 12 kald i den form: cirka $15 for den færdige opgave. Ved maksimal ræsonnement-indsats med tungere kontekst placerer Anthropics egen omkostningskurve svære FrontierCode-opgaver tættere på $20-pr.-opgave-området. Kør den samme opgave på GPT-5.5, og du betaler mindre pr. token. Men hvis den ikke kan færdiggøre opgaven på noget indsatsniveau, er din omkostning-pr.-færdig-opgave uendelig. Fable 5 koster mere pr. token end GPT-5.5 og vinder stadig på omkostning-pr.-færdig-opgave, fordi den færdiggør arbejde, GPT-5.5 ikke kan.
Her er et minimalt kald. Anthropics meddelelse angiver claude-fable-5 som model-id; verificer den præcise versionerede streng mod Anthropic API-dokumentationen, før du shipper, da daterede aliaser nogle gange afviger:
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-fable-5", # verify exact dated id in API docs
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000}, # reasoning effort
messages=[
{"role": "user", "content": "Migrate this module from Ruby 2.7 to 3.3 and run the tests."}
],
)
print(message.content)Den økonomiske tese i én linje: Du betaler mere pr. token end GPT-5.5, men du færdiggør opgaver, GPT-5.5 ikke kan færdiggøre til nogen pris. For lavrisiko-højvolumen-arbejde favoriserer matematikken en billigere model. For svær agentisk kodning favoriserer den Fable 5.
Sikkerhedsopdelingen: Hvorfor Fable falder tilbage til Opus 4.8
Fable 5 kører klassifikatorer på hver forespørgsel. Når den opdager en højrisiko-forespørgsel (offensiv cyber, bio, kemi eller modeldistillationsforsøg), falder den tilbage til Opus 4.8 i stedet for at svare med fuld Mythos-klasse-kapacitet. Anthropic siger, at denne fallback udløses på under 5% af sessioner, så de fleste brugere aldrig trigger den. Pointen er at holde den farlige kapacitet bag gaten, mens det daglige arbejde forbliver uberørt.

Det sværere tal er angrebssuccesrate: hvor ofte en automatiseret angriber kan jailbreake modellen til at gøre noget, den ikke bør. Lavere er bedre. Anthropics red-team-resultater viser et stejlt fald på tværs af udgivelser, fra Opus 4.6 på 83,2%, til Opus 4.7 på 72,7%, til Opus 4.8 på 56,6%, ned til Fable 5 på 5,4%. Under automatiseret red-teaming lykkedes angreb mod Fable 5 kun 5,4% af gangene, ned fra 56,6% på Opus 4.8.
Hvorfor bør du bekymre dig? Hvis du deployer en agent med tool-adgang (shell, filsystem, netværk), er en jailbreak ikke et dårligt chatsvar — det er en model, der eksekverer reelle kommandoer, en angriber har styret den til. En angrebssuccesrate på 5,4% betyder, at den er cirka ti gange sværere at våbenhjortgøre end Opus 4.8. IT Pro's dækning førte med fallback-mekanismen af præcis denne grund: det er funktionen, der gør en frontier-model sikker nok til at udlevere til offentligheden.
Trade-off'en er latenstid. Hvis din workflow legitimt rører sikkerhedsværktøjer, kan fallbacken udløses midt i en opgave og skifte model under dig — noget at planlægge omkring.
Claude Mythos 5 og dual-use-spørgsmålet
Claude Mythos 5 er den gate'd søskende, den samme model uden sikkerhedsfallbacken. Den bevarer offensiv cyber-kapacitet, som Fable 5 blokerer, hvilket er præcis grunden til, at Anthropic ikke udgiver den offentligt. Adgang kører gennem Project Glasswing, et verificeret program for forsvarere og forskere, der har brug for fuld kapacitet. Samme model, to udgivelsespositioner: en åben, en gate'd.

Grafen gør gate'ingen synlig. På offensiv cyber-evals (Firefox, OSS-Fuzz, CyberGym, CyScenarioBench) scorer Mythos 5 88,4, 24,0, 83,8 og 38,7. Fable 5 returnerer et fladt 0,0 på alle fire. På offensiv cyber-evals scorer Mythos 5 op til 88,4, hvor Fable 5 returnerer et fladt 0,0: sikkerhedsopdelingen, gjort synlig.
Det nul er ikke en kapacitetskløft. Det er fallbacken, der udløses hver gang og blokerer forespørgslen, før Mythos-klasse-modellen svarer. TechCrunch bemærkede timingen: Anthropic shipper dette dage efter at have advaret om, at AI bliver for farlig til at udgive åbent. Fable/Mythos-opdelingen er det politiske svar på den advarsel — udgiv kapaciteten, gate faren.
For de fleste udviklere er Mythos 5 irrelevant. Du kvalificerer aldrig til Project Glasswing, og du behøver det ikke. Det, der betyder noget, er at vide, at den model, du kalder, er bevidst begrænset på et smalt bånd af opgaver, med vilje.
Hvad det betyder: Bør du skifte?
Skift til Fable 5 for svær agentisk kodning, langsigtede flertrins-opgaver og vision eller rumlig ræsonnement — overalt hvor det at færdiggøre opgaven slår at spare ører pr. token. Bliv på Opus 4.8 for omkostningsfølsomt højvolumen-arbejde, eller for alt, der alligevel trigger fallbacken. Det er hele frameworket. Resten er at matche din workload til den rigtige side af det.
Når Fable 5 vinder:
- Svær agentisk kodning, hvor Opus 4.8 går i stå; SWE-Bench Pro-kløften er reel
- Langsigtede opgaver (flerfils-refaktoreringer, migreringer), hvor selvvalidering betaler sig
- Vision- og rumlig ræsonnement-workloads
- Ethvert job, hvor én færdig opgave er mere værd end token-præmien
Når Opus 4.8 stadig vinder:
- Højvolumen, omkostningsfølsomt arbejde, hvor tokenprisen dominerer
- Cyber/bio/kemi-workloads, hvor Fable 5 alligevel falder tilbage til Opus 4.8, så kald den direkte
- Latensfølsomme flows, der ikke kan tolerere et modelskift midt i opgaven
| Use case | Anbefalet model |
|---|---|
| Svær agentisk kodning / migreringer | Claude Fable 5 |
| Vision / rumlig ræsonnement | Claude Fable 5 |
| Højvolumen billig klassificering | Claude Opus 4.8 |
| Sikkerhed / red-team-værktøjer | Claude Opus 4.8 (direkte) |
Om tilgængelighed: Fable 5 er gratis på Pro/Max/Team/Enterprise-planer indtil 22. juni 2026, med forbrugscredits gældende fra 23. juni. Den er generelt tilgængelig på API'en, AWS Bedrock, GitHub Copilot ifølge GitHub-changeloggen og Harvey. Så du kan teste skiftet i din editor i dag uden at ændre din fakturering.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet bygger AI-agenter, automatiseringssystemer og voice/SDR-pipelines for B2B-klienter. Han studerer på University of Birmingham og skriver om det LLM-værktøjsstack, Techsy-teamet faktisk bruger i produktion. Forbind på LinkedIn.
Medstifter, Techsy.io · University of Birmingham
Ofte stillede spørgsmål
Hvad er Claude Fable 5?
Claude Fable 5 er Anthropics første offentligt tilgængelige Mythos-klasse-model, lanceret 9. juni 2026. Den scorer 80,3% på SWE-Bench Pro og kører sikkerhedsklassifikatorer, der falder tilbage til Opus 4.8 ved højrisiko-forespørgsler. Den koster $10 input / $50 output pr. million tokens.
Hvad er forskellen mellem Fable 5 og Mythos 5?
De er den samme frontier-model med forskellige udgivelsespositioner. Fable 5 er offentlig og sikret; den falder tilbage til Opus 4.8 ved farlige forespørgsler. Mythos 5 er den gate'd version med fuld kapacitet, kun tilgængelig gennem Anthropics Project Glasswing-program for verificerede forsvarere og forskere.
Er Claude Fable 5 faktisk bedre end Opus 4.8?
Ja på svær agentisk kodning, vision og rumlig ræsonnement: Fable 5 rammer 80,3% på SWE-Bench Pro mod Opus 4.8's 69,2%. Men Opus 4.8 vinder stadig på omkostningsfølsomt højvolumen-arbejde, og Fable 5 falder alligevel tilbage til Opus 4.8 for højrisiko cyber/bio/kemi-emner. "Bedre" afhænger af din workload.
Hvad koster Claude Fable 5?
Claude Fable 5 koster $10 pr. million input-tokens og $50 pr. million output-tokens. Anthropics ramme er "mindre end halvdelen af prisen på Mythos Preview." Det er cirka 2× Opus 4.8 pr. token, men værdigrundlaget er pr. færdig opgave, da Fable 5 færdiggør arbejde, billigere modeller ikke kan.
Hvad er en "Mythos-klasse"-model?
Mythos-klasse er Anthropics nye øverste kapacitetsniveau, lanceret med Fable 5 og Mythos 5. Det repræsenterer et frontier-spring over Opus 4.x-linjen på kodnings- og ræsonnement-benchmarks. Fable 5 og Mythos 5 er to udgivelsesversioner af den samme Mythos-klasse-model: en offentlig og sikret, en gate'd.
Hvorfor falder Fable 5 tilbage til Opus 4.8?
Fable 5 kører klassifikatorer, der opdager højrisiko-forespørgsler (offensiv cyber, bio, kemi eller modeldistillation) og dirigerer dem til Opus 4.8 i stedet for at svare med fuld Mythos-klasse-kapacitet. Det udløses på under 5% af sessioner. Det skar adversarial angrebssucces fra 56,6% (Opus 4.8) til 5,4%.
Kan jeg få adgang til Claude Mythos 5?
Sandsynligvis ikke. Mythos 5 er gate'd bag Project Glasswing, Anthropics verificerede adgangsprogram for forsvarere og sikkerhedsforskere, der har brug for fuld offensiv cyber-kapacitet, som Fable 5 blokerer. De fleste udviklere kvalificerer ikke og behøver det ikke, da Fable 5 dækker daglig agentisk kodning og arbejde.
Hvor kan jeg bruge Claude Fable 5?
Claude Fable 5 er generelt tilgængelig på Anthropic API'en, AWS Bedrock, GitHub Copilot og Harvey. Den er gratis på Pro, Max, Team og sædebaserede Enterprise-planer indtil 22. juni 2026; forbrugscredits gælder fra 23. juni. Du kan teste den i din editor eller via API i dag.
Konklusionen
Claude Fable 5 er et ægte frontier-skridt over Opus 4.8: 80,3% mod 69,2% på SWE-Bench Pro, dobbelt FrontierCode-score og en angrebssuccesrate på 5,4%, der gør den langt sikrere at deploye med værktøjer. Skift for svær agentisk kodning, langsigtede opgaver og vision-arbejde. Bliv på Opus 4.8 for omkostningsfølsomt volumen eller alt, der alligevel trigger fallbacken. Den er gratis indtil 22. juni, så du kan teste skiftet, før det koster dig noget. Techsy-teamet bygger produktionsagenter på præcis dette stack, så ræk ud, hvis du vil have en hånd.