
Claude Opus 5 er her: Nesten Fable 5-intelligens til halve prisen
Anthropic lanserte Claude Opus 5 den 24. juli 2026, og budskapet er kontant: nesten Fable 5s frontier-intelligens, til halve prisen. Hovedbeviset er Frontier-Bench v0.1, der Opus 5 scorer 43,3 % og mer enn dobler Opus 4.8s 21,1 %. Haken, og det finnes alltid én: den vinner ikke alt. GPT-5.6 Sol ligger fortsatt så vidt foran på én agentbasert kodingstest, og innen helse og biologi går kronen til Mythos 5. Her er hva som faktisk endret seg, den fulle benchmark-tabellen, og om du bør peke om standardmodellen din allerede i dag.
Nøkkelpunkter:
- Claude Opus 5 lanserte 24. juli 2026 på Claude API, Claude.ai, Claude Code og Claude Cowork, med modell-ID-en
claude-opus-5. - Den leder det meste av Anthropics publiserte benchmarks (Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench), men ligger etter på et par koding-, jus- og vitenskapstester.
- Prisen er uendret fra Opus 4.8 på $5/$25 per million tokens, med en Fast-modus til omtrent 2x prisen for rundt 2,5x hastigheten.
Hva som ble lansert i dag: Claude Opus 5 på ett minutt
Claude Opus 5 er Anthropics nye frontier-modell, utgitt 24. juli 2026, og tilgjengelig samme dag på API-et, Claude.ai, Claude Code og Claude Cowork. Modell-ID-en er claude-opus-5. Anthropics ramme, ifølge kunngjøringen, er at den «kommer nær frontier-intelligensen til Claude Fable 5 til halve prisen.» Standardprisen forblir på $5 inn / $25 ut per million tokens, det samme som Opus 4.8.
Dette er et reelt generasjonssprang for agentarbeid, ikke en punktutgivelse. Hvis du kommer fra Claude Opus 4.8, følger API-formen og Claude Code-integrasjonen med uendret, så migreringen er et bytte av modell-ID. Det som er annerledes, er taket: på Frontier-Bench v0.1 sier Anthropic at Opus 5 mer enn dobler 4.8s score til en lavere kostnad per oppgave, og den noterer toppresultater på GDPval-AA og ARC-AGI-3.
Posisjoneringen betyr noe. Fable 5 er Anthropics dyreste frontier-modell. Å komme innenfor slagavstand fra den til Opus-priser er hele historien med denne utgivelsen, og det er derfor «halve prisen»-linjen er den Anthropic leder med.
Hva er egentlig nytt i Opus 5 mot 4.8?
Den største endringen fra 4.8 til 5 er dømmekraften: Opus 5 er merkbart bedre til å verifisere sitt eget arbeid og iterere til en oppgave faktisk er ferdig, ikke bare tilsynelatende avsluttet. Anthropic siterer også sterkere programvareutvikling, kunnskapsarbeid og vitenskapelig forskning, pluss forbedret visuell output. Prisen og kjernen i API-et forble uendret.
Bedre dømmekraft og selvverifisering
Den tydeligste atferdsendringen er at Opus 5 sjekker seg selv. Anthropic siterer Zimu Li, et teknisk stabmedlem, som beskriver modellen som en som «verifiserer grener, sjekker maler» i stedet for å storme fremover. For alle som er avhengige av en agent for å fange sine egne feil i produksjon, er det egenskapen som gjør utslaget. Det er også det vanskeligste å selge på en benchmark-tabell, så behandle det som en påstand du bør teste på dine egne oppgaver.
Frontier-intelligens til Opus-kostnad
Sualeh Asif, medgrunnlegger av Cursor, oppsummerte utgivelsen som «nesten Fable 5-intelligens til Opus-hastighet og -kostnad.» Det er den praktiske lesningen: team som ville ha Fable-5-klasse resonnering, men ikke kunne forsvare prisen, har nå et mellomalternativ. På OSWorld 2.0 sier Anthropic at Opus 5 overgår Fable 5 til omtrent en tredjedel av kostnaden, som er det tydeligste enkelt eksemplet på verdiforslaget.
Justering og sikkerhetsprofil
Anthropic rapporterer at Opus 5 har sin hittil laveste score for feiljustert atferd (2,3) og kaller den modellen som er mest justert etter konstitusjonen. På sikkerhetssiden beskrives cybersikkerhetsklassifisererne som omtrent 85 % mindre restriktive enn Fable 5s, med et Cyber Verification Program for bedrifter for team som trenger det. Som med alle leverandørers sikkerhetspåstander: greit å vite, fortsatt verdt å validere mot dine egne rødteam-tilfeller.
Opus 5-benchmarks: Der den vinner (og der den taper)
Opus 5 leder det meste av Anthropics publiserte benchmarks, og seierne som betyr noe for agentbyggere er overveldende: Frontier-Bench v0.1 (43,3 %), GDPval-AA (1861 Elo), ARC-AGI-3 (30,2 %), OSWorld 2.0 (70,6 %) og Zapier sin AutomationBench (26,0 %). De ærlige unntakene: GPT-5.6 Sol vinner DeepSWE v1.1, Fable 5 ligger så vidt foran på FrontierCode og justestene, og Mythos 5 tar helse og biologi.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Agentbasert terminalkoding, Frontier-Bench v0.1 | 43,3 % | 33,7 % | 21,1 % | 34,4 % |
| Kunnskapsarbeid, GDPval-AA v2 (Elo) | 1861 | 1747 | 1593 | 1736 |
| Ny problemløsning, ARC-AGI-3 | 30,2 % | — | 1,5 % | 7,8 % |
| Agentbasert søk, BrowseComp | 90,8 % | 87,4 % | 84,3 % | 90,4 % |
| Tverrfaglig resonnering, Humanity's Last Exam (med verktøy) | 64,7 % | 63,9 % | 57,9 % | — |
| Agentbasert databruk, OSWorld 2.0 | 70,6 % | 66,1 % | 55,7 % | 62,6 % |
| Agentbasert koding, DeepSWE v1.1 | 68,8 % | 69,7 % | 59,0 % | 72,7 % |
| Agentbasert koding, FrontierCode v1.1 (Main) | 53,4 % | 53,5 % | 46,5 % | 47,5 % |
| Forretningsarbeidsflyter, AutomationBench | 26,0 % | 17,4 % | 17,0 % | 18,1 % |
| Legal Agent Benchmark (held-out) | 11,7 % | 13,3 % | 10,4 % | 2,5 % |
| Helse, HealthBench Professional | 59,8 % | 66,0 % | 57,4 % | 60,5 % |
| Biologi, BioMysteryBench (hard) | 49,4 % | 46,5 % | 42,4 % | — |

Les differansene, ikke bare de absolutte scorene. Frontier-Bench hoppet +22,2 poeng over Opus 4.8 (21,1 til 43,3), det største enkelt spranget og grunnen til at Anthropic kaller dette en koding-og-agenter-utgivelse. GDPval-AA økte +268 Elo (1593 til 1861) og passerte alle modellene i tabellen på kunnskapsarbeid. ARC-AGI-3 er øyefangeren: 30,2 % mot 7,8 % for GPT-5.6 Sol og 1,5 % for Opus 4.8, som Anthropic rammer inn som omtrent 3x den nest beste offentlige modellen på ny problemløsning. På AutomationBench er 26,0 % omtrent 1,5x feltet, et direkte signal for alle som bygger forretningsprosessagenter.
To ærlige notater om tapene. For det første, lederen i Fable 5-kolonnen for helse (66,0 %) og biologi-menneskeløst-skillet er faktisk Mythos 5, Anthropics vitenskapsspesialiserte modell, ikke Fable 5, så det er ikke generelle modellseire som kan sammenlignes direkte. For det andre er koding-bildet genuint delt: GPT-5.6 Sol tar DeepSWE v1.1 (72,7 % mot 68,8 %), og Fable 5 vinner FrontierCode med et hårsmonn (53,5 % mot 53,4 %). Hvis arbeidet ditt er ren SWE-bench-stil-koding, velger ikke «best totalt»-etiketten automatisk Opus 5.
Hva koster Opus 5? Priser og Fast-modus
Standardprisen for Opus 5 er $5 per million input-tokens og $25 per million output-tokens, identisk med Opus 4.8 ifølge Anthropics publiserte priser, så det er ingen prisøkning for oppgraderingen. «Halve prisen»-påstanden er relativt til Fable 5, ikke til 4.8: du får nesten Fable-5-intelligens uten å betale Fable 5-priser. Fast-modus kjører til omtrent 2x basisprisen for rundt 2,5x standardhastigheten, og API-et støtter fallback-ruting.
Så hva betyr det per oppgave? På standardpris betaler du ingenting ekstra sammenlignet med 4.8 og får et stort kapasitetsløft, noe som gjør oppgraderingen nesten gratis for de fleste arbeidsmengder. Fast-modus er spaken for interaktive økter: du bytter en 2x prispremie mot output som strømmes omtrent 2,5x raskere på samme modell, noe som lønner seg når du sitter der og venter, og gjør vondt når du kjører nattbatcher der veggtid er irrelevant. Hvis hastighetsgrenser er den virkelige begrensningen din, dekker guiden vår til Claude-bruksgrenser hvordan nivåene samspiller med kostnaden.
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}Der Opus 5 lander for produksjonsagenter
Gevinstene klumper seg nøyaktig der produksjonsagenter lever: terminalkoding (Frontier-Bench), databruk (OSWorld 2.0), agentbasert søk (BrowseComp) og flertrinns forretningsarbeidsflyter (AutomationBench). De fire er arbeidsmengdene som oftest går i stykker i virkelige utrullinger, så en modell som hopper på alle fire samtidig, endrer hva som er leverbart.
Det er delen verdt å dvele ved. En benchmark som AutomationBench måler om en agent kan fullføre en reell flerverktøy-arbeidsflyt fra start til slutt, og Opus 5s 26,0 % mot omtrent 17 % for feltet er forskjellen mellom «demonstrerer bra» og «overlever kontakt med en rotete CRM.» OSWorld 2.0-resultatet (70,6 %, slår Fable 5 til en tredjedel av kostnaden) sier det samme for databruksagenter som klikker seg gjennom faktisk programvare. For team som leverer kundevendte AI-agenter, er det tallene som oversettes til færre 02:00-feil.
Det senker også kostnaden for et designmønster vi lener oss på: billig selvverifisering. Når modellen genuint er bedre til å sjekke sine egne grener, kan du bruke færre tokens på et separat kritikersteg og fortsatt fange de samme feilene. Det er en reell budsjettlinje for alle som kjører agenter i volum.
Hvordan vi ruller Opus 5 inn i stacken vår
Vi bygger og kjører produksjons-AI-agenter på Claude-stacken hos Techsy, så en frontier-utgivelse er en evaluering samme dag, ikke en overskrift vi leser og går videre fra. Her er vår ærlige første lesning, kvalitativ der vi ikke ennå har rene før/etter-tall, spesifikk der vi har dem.
Selve byttet er trivielt, og det er poenget. Innholds- og automatiseringspipelines-ene våre fester en standardmodell i konfigurasjonen; å endre claude-opus-4-8 til claude-opus-5 og starte en økt på nytt krevde null andre endringer, det samme som hvert nyere Opus-løft. Hvis du ruter på tvers av leverandører og vil A/B-teste Opus 5 mot Fable 5 eller GPT-5.6 Sol på dine egne oppgaver, lar en proxy deg bytte modeller uten å skrive om appen din.
Det vi følger med på først, er selvverifiseringspåstanden, fordi det er den som faktisk ville endre arkitekturen vår. De nåværende agentene våre kjører et eksplisitt kritikersteg for å fange dårlige redigeringer før de lander; hvis Opus 5 pålitelig flagger sine egne svake grener, kan vi tynne ut det steget og spare tokens. Vi publiserer ikke et tall på det før vi har kjørt det over et repeterbart oppgavesett, den samme disiplinen vi ville ønske fra alle som siterer agentmetrikker. Hvis du vil ha metoden, er det den i guiden vår til evaluering av AI-agenter i produksjon: samme prompter, samme repo-tilstand, tell feiltrinnene, ikke stemningen.
Bør du bytte fra Opus 4.8? (Bytt / Vent / Forbli)
Om du skal flytte deg, avhenger av arbeidsmengden din, ikke av hvilken modell som «vinner» totalt. De agentbaserte og kunnskapsarbeid-sprangene er store og reelle, så de fleste team bør bytte. Rene koding-butikker med en GPT- eller Fable-pipeline har grunn til å teste før de forplikter seg, og brukere nær taket på billige oppgaver kan bli sittende med nesten ingenting tapt.
Bytt nå hvis: arbeidet ditt lener seg på agentbaserte oppgaver, databruk, forretningsprosessautomatisering eller kunnskapsarbeid. Frontier-Bench (+22,2 over 4.8), AutomationBench (~1,5x feltet) og GDPval-AA (+268 Elo) er de største reelle gevinstene, og prisen endret seg ikke, så det er ingen kostnadsstraff for å oppgradere.
Vent hvis: arbeidsflyten din er ren agentbasert koding, og du allerede bruker GPT-5.6 Sol eller Fable 5 til det. GPT-5.6 Sol leder fortsatt DeepSWE v1.1, og Fable 5 ligger så vidt foran på FrontierCode, så kjør din egen koding-evaluering før du peker om. Vent også hvis du er midt i et prosjekt, og et modellbytte ville grumse en evaluering du allerede kjører.
Forbli på 4.8 hvis: du er kostnadssensitiv på oppgaver som allerede var nær taket for deg, og du ikke rører de agentbaserte arbeidsmengdene der Opus 5 drar ifra. Du ville betalt en byttekostnad for en differanse du ikke kommer til å merke. For det videre feltet, se hvordan modellene står seg i Claude Sonnet 5-gjennomgangen vår og Fable 5- og Mythos 5-oversikten.
Vi velger og kobler modeller som dette for kunders agentbygg hver uke. Hvis du bestemmer hvilken modell du skal standardisere på for en produksjonsagent, få en gratis konsultasjon, så hjelper vi deg med å matche modellen til arbeidsmengden i stedet for markedsføringen.
Om forfatteren
Mert Batur Gurbuz er medgrunnlegger av Techsy.io, der teamet leverer AI-agenter, automatiseringssystemer og stemme-/SDR-pipelines for B2B-kunder. Han studerer ved University of Birmingham og skriver om LLM-verktøy-stacken Techsy-teamet faktisk kjører i produksjon.
Medgrunnlegger, Techsy.io, University of Birmingham · LinkedIn
Ofte stilte spørsmål
Hva er Claude Opus 5?
Claude Opus 5 er Anthropics frontier-modell, utgitt 24. juli 2026, med modell-ID-en claude-opus-5. Anthropic posisjonerer den som å komme nær Fable 5s intelligens til halve prisen, og den leder det meste av de publiserte benchmarkene, inkludert Frontier-Bench, GDPval-AA og ARC-AGI-3. Den er tilgjengelig på Claude API, Claude.ai, Claude Code og Claude Cowork.
Når ble Claude Opus 5 utgitt?
Claude Opus 5 ble utgitt 24. juli 2026. Den gikk live samme dag på tvers av Claude API, Claude.ai, Claude Code og Claude Cowork, uten trinnsvis utrulling, så du kan peke om standardmodellen din til claude-opus-5 umiddelbart.
Er Claude Opus 5 bedre enn Opus 4.8?
For det meste arbeidet, ja. Opus 5 mer enn dobler Opus 4.8 på Frontier-Bench v0.1 (43,3 % mot 21,1 %), vinner 268 Elo på GDPval-AA og hopper fra 1,5 % til 30,2 % på ARC-AGI-3. Prisen er uendret, så det er ingen kostnadsstraff. Unntakene er noen koding- og vitenskapstester der GPT-5.6 Sol, Fable 5 eller Mythos 5 fortsatt leder.
Hvor mye koster Claude Opus 5?
Standardprisen er $5 per million input-tokens og $25 per million output-tokens, identisk med Opus 4.8. «Halve prisen»-linjen viser til Fable 5, ikke 4.8: Opus 5 leverer nesten Fable-5-intelligens til Opus-priser. Fast-modus koster omtrent 2x basisprisen og kjører rundt 2,5x raskere på samme modell.
Slår Claude Opus 5 Fable 5?
Ikke over hele linjen. Opus 5 overgår Fable 5 på OSWorld 2.0, BrowseComp, GDPval-AA og Frontier-Bench, og gjør det til en brøkdel av Fable 5s pris. Men Fable 5 ligger fortsatt foran på FrontierCode og jus-benchmarken, og Mythos 5 (Anthropics vitenskapsmodell) leder helse og biologi. Budskapet er «nesten Fable 5 til halve prisen», ikke «bedre enn Fable 5 på alt.»
Hva taper Opus 5 på?
GPT-5.6 Sol vinner agentbasert koding på DeepSWE v1.1 (72,7 % mot 68,8 %), Fable 5 vinner FrontierCode v1.1 med 0,1 poeng og held-out jus-benchmarken (13,3 % mot 11,7 %), og Mythos 5 leder HealthBench Professional og biologitestene. Hvis arbeidsmengden din domineres av noen av disse, kjør en benchmark på det før du bytter.
Er Claude Opus 5 bra for å bygge AI-agenter?
Den er bygget for det. De største gevinstene lander på agentbasert terminalkoding (Frontier-Bench), databruk (OSWorld 2.0), agentbasert søk (BrowseComp) og flertrinns forretningsarbeidsflyter (AutomationBench), som er arbeidsmengdene produksjonsagenter kjører. Den sterkere selvverifiseringen lar deg også bruke færre tokens på et separat kritikersteg.
Hvordan bytter jeg til Opus 5 i Claude Code og API-et?
Sett modellen din til claude-opus-5 (bruk /model claude-opus-5 i Claude Code), så er du ferdig for de fleste team. I API-et endrer du model-feltet til claude-opus-5; request-formen er uendret fra Opus 4.8, så ingen andre kodeendringer trengs.
Hva er Fast-modus i Claude Opus 5?
Fast-modus er et høyt hastighetsnivå som kjører Opus 5 til omtrent 2,5x standardhastigheten for omtrent 2x standardprisen. Det holder deg på den fulle claude-opus-5-modellen i stedet for å rute deg til en mindre, noe som gjør det nyttig for interaktive økter der du venter på output, og ikke verdt det for latensufølsomme batchjobber.