Techsy
Kontakt
Kom igång
Tillbaka till bloggen
ai-machine-learning

Claude Opus 5 är här: Nära Fable 5-intelligens till halva priset

Skriven av Mert Batur Gürbüz
Jul 24, 2026
12 läsning
Innehållsförteckning
Claude Opus 5 är här: Nära Fable 5-intelligens till halva priset

Claude Opus 5 är här: Nära Fable 5-intelligens till halva priset

Anthropic lanserade Claude Opus 5 den 24 juli 2026, och budskapet är rakt på sak: nära Fable 5:s frontier-intelligens, till halva priset. Huvudbeviset är Frontier-Bench v0.1, där Opus 5 når 43,3 % och mer än fördubblar Opus 4.8:s 21,1 %. Haken, och det finns alltid en: den vinner inte allt. GPT-5.6 Sol ligger fortfarande precis före i ett agentbaserat kodningstest, och inom hälsa och biologi går kronan till Mythos 5. Här är vad som faktiskt ändrades, den fullständiga benchmark-tabellen och om du bör peka om din standardmodell redan idag.

Nyckelpunkter:

  • Claude Opus 5 lanserades 24 juli 2026 på Claude API, Claude.ai, Claude Code och Claude Cowork, med modell-ID claude-opus-5.
  • Den leder det mesta av Anthropics publicerade benchmarks (Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench), men ligger efter i ett par kodnings-, juridik- och vetenskapstester.
  • Prissättningen är oförändrad från Opus 4.8 på $5/$25 per miljon tokens, med ett Fast-läge på ungefär 2x priset för cirka 2,5x hastigheten.

Vad som lanserades idag: Claude Opus 5 på en minut

Claude Opus 5 är Anthropics nya frontier-modell, släppt 24 juli 2026, och tillgänglig samma dag på API:et, Claude.ai, Claude Code och Claude Cowork. Modell-ID:t är claude-opus-5. Anthropics ram, enligt tillkännagivandet, är att den "kommer nära frontier-intelligensen hos Claude Fable 5 till halva priset." Standardprissättningen ligger kvar på $5 in / $25 ut per miljon tokens, samma som Opus 4.8.

Det här är ett verkligt generationssprång för agentarbete, inte en punktuppdatering. Om du kommer från Claude Opus 4.8 förs API-formen och Claude Code-integrationen över oförändrade, så migrationen är ett byte av modell-ID. Det som skiljer sig är taket: på Frontier-Bench v0.1 säger Anthropic att Opus 5 mer än fördubblar 4.8:s poäng till en lägre kostnad per uppgift, och den noterar toppresultat på GDPval-AA och ARC-AGI-3.

Positioneringen spelar roll. Fable 5 är Anthropics dyraste frontier-modell. Att komma inom slagavstånd från den till Opus-priser är hela historien med den här lanseringen, och det är därför "halva priset"-raden är den Anthropic leder med.

Vad är egentligen nytt i Opus 5 mot 4.8?

Den största förändringen från 4.8 till 5 är omdömet: Opus 5 är märkbart bättre på att verifiera sitt eget arbete och iterera tills en uppgift faktiskt är klar, inte bara troligtvis avslutad. Anthropic nämner också starkare programvaruutveckling, kunskapsarbete och vetenskaplig forskning, plus förbättrad visuell output. Prissättningen och kärn-API:et låg kvar.

Bättre omdöme och självverifiering

Den tydligaste beteendeförändringen är att Opus 5 kontrollerar sig själv. Anthropic citerar Zimu Li, en teknisk medarbetare, som beskriver modellen som en som "verifierar grenar, kontrollerar mallar" snarare än att storma framåt. För alla som förlitar sig på en agent för att fånga sina egna misstag i produktion är det egenskapen som gör skillnad. Det är också det svåraste att sälja på en benchmark-tabell, så behandla det som ett påstående att testa på dina egna uppgifter.

Frontier-intelligens till Opus-kostnad

Sualeh Asif, medgrundare av Cursor, sammanfattade lanseringen som "nästan Fable 5-intelligens till Opus-hastighet och -kostnad." Det är den praktiska läsningen: team som ville ha Fable-5-klassat resonemang men inte kunde motivera priset har nu ett mittenalternativ. På OSWorld 2.0 säger Anthropic att Opus 5 överträffar Fable 5 till ungefär en tredjedel av kostnaden, vilket är det tydligaste enskilda exemplet på värdeargumentet.

Alignering och säkerhetsprofil

Anthropic rapporterar att Opus 5 har sin hittills lägsta poäng för feljusterat beteende (2,3) och kallar den den modell som är mest alignerad med dess konstitution. På säkerhetssidan beskrivs cybersäkerhetsklassificerarna som ungefär 85 % mindre restriktiva än Fable 5:s, med ett Cyber Verification Program för företag för team som behöver det. Som med alla leverantörers säkerhetspåståenden: bra att veta, fortfarande värt att validera mot dina egna rödteam-fall.

Opus 5-benchmarks: Där den vinner (och där den förlorar)

Opus 5 leder det mesta av Anthropics publicerade benchmarks, och vinsterna som spelar roll för agentbyggare är överväldigande: Frontier-Bench v0.1 (43,3 %), GDPval-AA (1861 Elo), ARC-AGI-3 (30,2 %), OSWorld 2.0 (70,6 %) och Zapier:s AutomationBench (26,0 %). De ärliga undantagen: GPT-5.6 Sol vinner DeepSWE v1.1, Fable 5 ligger precis före i FrontierCode och juridiktesterna, och Mythos 5 tar hälsa och biologi.

BenchmarkOpus 5Fable 5Opus 4.8GPT-5.6 Sol
Agentbaserad terminalkodning, Frontier-Bench v0.143,3 %33,7 %21,1 %34,4 %
Kunskapsarbete, GDPval-AA v2 (Elo)1861174715931736
Ny problemlösning, ARC-AGI-330,2 %—1,5 %7,8 %
Agentbaserad sökning, BrowseComp90,8 %87,4 %84,3 %90,4 %
Tvärvetenskapligt resonemang, Humanity's Last Exam (med verktyg)64,7 %63,9 %57,9 %—
Agentbaserad datoranvändning, OSWorld 2.070,6 %66,1 %55,7 %62,6 %
Agentbaserad kodning, DeepSWE v1.168,8 %69,7 %59,0 %72,7 %
Agentbaserad kodning, FrontierCode v1.1 (Main)53,4 %53,5 %46,5 %47,5 %
Affärsarbetsflöden, AutomationBench26,0 %17,4 %17,0 %18,1 %
Legal Agent Benchmark (held-out)11,7 %13,3 %10,4 %2,5 %
Hälsa, HealthBench Professional59,8 %66,0 %57,4 %60,5 %
Biologi, BioMysteryBench (hard)49,4 %46,5 %42,4 %—

Claude Opus 5 benchmark-jämförelse mot Fable 5, Opus 4.8 och GPT-5.6 Sol inom Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench med mera
Källa: Anthropic

Läs differenserna, inte bara de absoluta poängen. Frontier-Bench hoppade +22,2 poäng över Opus 4.8 (21,1 till 43,3), det största enskilda språnget och anledningen till att Anthropic kallar det här en kodnings- och agentlansering. GDPval-AA ökade +268 Elo (1593 till 1861) och passerade alla modeller i tabellen på kunskapsarbete. ARC-AGI-3 är ögonfångaren: 30,2 % mot 7,8 % för GPT-5.6 Sol och 1,5 % för Opus 4.8, vilket Anthropic beskriver som ungefär 3x den näst bästa publika modellen på ny problemlösning. På AutomationBench är 26,0 % ungefär 1,5x fältet, en direkt signal för alla som bygger affärsprocessagenter.

Två ärliga noter om förlusterna. För det första, ledaren i Fable 5-kolumnen för hälsa (66,0 %) och biologi-människolöst-spliten är faktiskt Mythos 5, Anthropics vetenskapsspecialiserade modell, inte Fable 5, så det är inte jämförbara generella modellvinster. För det andra är kodningsbilden genuint delad: GPT-5.6 Sol tar DeepSWE v1.1 (72,7 % mot 68,8 %), och Fable 5 vinner FrontierCode med en hårsmån (53,5 % mot 53,4 %). Om ditt arbete är ren SWE-bench-stil-kodning väljer etiketten "bäst totalt" inte automatiskt Opus 5.

Vad kostar Opus 5? Prissättning och Fast-läge

Standardprissättningen för Opus 5 är $5 per miljon input-tokens och $25 per miljon output-tokens, identisk med Opus 4.8 enligt Anthropics publicerade prissättning, så det finns ingen prishöjning för uppgraderingen. "Halva priset"-påståendet är relativt Fable 5, inte 4.8: du får nästan Fable-5-intelligens utan att betala Fable-5-priser. Fast-läget körs på ungefär 2x baspriset för cirka 2,5x standardhastigheten, och API:et stödjer fallback-routing.

Så vad betyder det per uppgift? På standardprissättning betalar du inget extra jämfört med 4.8 och får ett stort kapacitetslyft, vilket gör uppgraderingen nästan gratis för de flesta arbetsbelastningar. Fast-läget är spaken för interaktiva sessioner: du byter en 2x prisskillnad mot output som strömmas ungefär 2,5x snabbare på samma modell, vilket lönar sig när du sitter där och väntar och gör ont när du kör nattbatcher där väggklocktid är irrelevant. Om hastighetsgränser är din verkliga begränsning täcker vår guide till Claude-användningsgränser hur nivåerna samspelar med kostnaden.

bash
# Claude Code: point your default model at Opus 5
/model claude-opus-5

# API request body (model ID swap):
{
  "model": "claude-opus-5",
  "messages": [
    { "role": "user", "content": "Refactor this module and verify the tests pass." }
  ]
}

Där Opus 5 landar för produktionsagenter

Vinsterna klustrar sig exakt där produktionsagenter lever: terminalkodning (Frontier-Bench), datoranvändning (OSWorld 2.0), agentbaserad sökning (BrowseComp) och flerstegs affärsarbetsflöden (AutomationBench). De fyra är arbetsbelastningarna som oftast går sönder i verkliga driftsättningar, så en modell som hoppar på alla fyra samtidigt ändrar vad som är levererbart.

Det är delen värd att stanna upp vid. En benchmark som AutomationBench mäter om en agent kan slutföra ett verkligt flerverktygsarbetsflöde från början till slut, och Opus 5:s 26,0 % mot ungefär 17 % för fältet är skillnaden mellan "demonstrerar bra" och "överlever kontakt med en rörig CRM." OSWorld 2.0-resultatet (70,6 %, slår Fable 5 till en tredjedel av kostnaden) säger samma sak för datoranvändningsagenter som klickar sig genom faktisk programvara. För team som levererar kundnära AI-agenter är det siffrorna som översätts till färre 02:00-fel.

Det sänker också kostnaden för ett designmönster vi lutar oss mot: billig självverifiering. När modellen genuint är bättre på att kontrollera sina egna grenar kan du spendera färre tokens på ett separat kritikersteg och ändå fånga samma fel. Det är en verklig budgetpost för alla som kör agenter i volym.

Hur vi rullar in Opus 5 i vår stack

Vi bygger och kör produktions-AI-agenter på Claude-stacken på Techsy, så en frontier-lansering är en utvärdering samma dag, inte en rubrik vi läser och går vidare från. Här är vår ärliga första läsning, kvalitativ där vi inte ännu har rena före/efter-siffror, specifik där vi har det.

Själva bytet är trivialt, och det är poängen. Våra innehålls- och automatiseringspipelines fäster en standardmodell i konfigurationen; att ändra claude-opus-4-8 till claude-opus-5 och starta om en session krävde noll andra ändringar, samma som varje nyare Opus-höjning. Om du routar mellan leverantörer och vill A/B-testa Opus 5 mot Fable 5 eller GPT-5.6 Sol på dina egna uppgifter låter en proxy dig byta modeller utan att skriva om din app.

Det vi tittar på först är självverifieringspåståendet, eftersom det är det som faktiskt skulle ändra vår arkitektur. Våra nuvarande agenter kör ett explicit kritikersteg för att fånga dåliga redigeringar innan de landar; om Opus 5 tillförlitligt flaggar sina egna svaga grenar kan vi tunnka ut det steget och spara tokens. Vi publicerar ingen siffra på det tills vi har kört det över en upprepningsbar uppgiftsuppsättning, samma disciplin vi skulle vilja ha från alla som citerar agentmätvärden. Om du vill ha metoden är det den i vår guide till utvärdering av AI-agenter i produktion: samma prompter, samma repo-tillstånd, räkna felen, inte känslan.

Bör du byta från Opus 4.8? (Byt / Vänta / Stanna)

Om du ska flytta beror på din arbetsbelastning, inte på vilken modell som "vinner" totalt. De agentbaserade och kunskapsarbets-sprången är stora och verkliga, så de flesta team bör byta. Rena kodningsbutiker med en GPT- eller Fable-pipeline har anledning att testa innan de binder sig, och användare nära taket på billiga uppgifter kan stanna kvar med nästan inget förlorat.

Byt nu om: ditt arbete lutar sig mot agentbaserade uppgifter, datoranvändning, affärsprocessautomatisering eller kunskapsarbete. Frontier-Bench (+22,2 över 4.8), AutomationBench (~1,5x fältet) och GDPval-AA (+268 Elo) är de största verkliga vinsterna, och prissättningen ändrades inte, så det finns ingen kostnadsstraff för att uppgradera.

Vänta om: ditt arbetsflöde är ren agentbaserad kodning och du redan använder GPT-5.6 Sol eller Fable 5 för det. GPT-5.6 Sol leder fortfarande DeepSWE v1.1 och Fable 5 ligger precis före i FrontierCode, så kör din egen kodningsutvärdering innan du pekar om. Vänta också om du är mitt i ett projekt och ett modellbyte skulle grumla en utvärdering du redan kör.

Stanna på 4.8 om: du är kostnadskänslig på uppgifter som redan var nära taket för dig och du inte rör de agentbaserade arbetsbelastningar där Opus 5 drar ifrån. Du skulle betala en byteskostnad för en differens du inte kommer att känna. För det bredare fältet, se hur modellerna står sig i vår Claude Sonnet 5-genomgång och Fable 5- och Mythos 5-översikten.

Vi väljer och kopplar modeller som detta för kunders agentbyggen varje vecka. Om du bestämmer vilken modell du ska standardisera på för en produktionsagent, få en gratis konsultation så hjälper vi dig matcha modellen mot arbetsbelastningen istället för marknadsföringen.

Om författaren

Mert Batur Gurbuz är medgrundare av Techsy.io, där teamet levererar AI-agenter, automatiseringssystem och röst-/SDR-pipelines för B2B-kunder. Han studerar vid University of Birmingham och skriver om LLM-verktygsstacken som Techsy-teamet faktiskt kör i produktion.

Medgrundare, Techsy.io, University of Birmingham · LinkedIn

Vanliga frågor

Vad är Claude Opus 5?

Claude Opus 5 är Anthropics frontier-modell, släppt 24 juli 2026, med modell-ID claude-opus-5. Anthropic positionerar den som att komma nära Fable 5:s intelligens till halva priset, och den leder det mesta av dess publicerade benchmarks, inklusive Frontier-Bench, GDPval-AA och ARC-AGI-3. Den finns tillgänglig på Claude API, Claude.ai, Claude Code och Claude Cowork.

När släpptes Claude Opus 5?

Claude Opus 5 släpptes 24 juli 2026. Den gick live samma dag över Claude API, Claude.ai, Claude Code och Claude Cowork, utan stegvis utrullning, så du kan peka om din standardmodell till claude-opus-5 omedelbart.

Är Claude Opus 5 bättre än Opus 4.8?

För det mesta arbetet, ja. Opus 5 mer än fördubblar Opus 4.8 på Frontier-Bench v0.1 (43,3 % mot 21,1 %), vinner 268 Elo på GDPval-AA och hoppar från 1,5 % till 30,2 % på ARC-AGI-3. Prissättningen är oförändrad, så det finns ingen kostnadsstraff. Undantagen är några kodnings- och vetenskapstester där GPT-5.6 Sol, Fable 5 eller Mythos 5 fortfarande leder.

Hur mycket kostar Claude Opus 5?

Standardprissättningen är $5 per miljon input-tokens och $25 per miljon output-tokens, identisk med Opus 4.8. "Halva priset"-raden syftar på Fable 5, inte 4.8: Opus 5 levererar nästan Fable-5-intelligens till Opus-priser. Fast-läget kostar ungefär 2x baspriset och körs ungefär 2,5x snabbare på samma modell.

Slår Claude Opus 5 Fable 5?

Inte över hela linjen. Opus 5 överträffar Fable 5 på OSWorld 2.0, BrowseComp, GDPval-AA och Frontier-Bench, och gör det till en bråkdel av Fable 5:s pris. Men Fable 5 ligger fortfarande före i FrontierCode och juridik-benchmarken, och Mythos 5 (Anthropics vetenskapsmodell) leder hälsa och biologi. Budskapet är "nästan Fable 5 till halva priset", inte "bättre än Fable 5 på allt."

Vad förlorar Opus 5 på?

GPT-5.6 Sol vinner agentbaserad kodning på DeepSWE v1.1 (72,7 % mot 68,8 %), Fable 5 vinner FrontierCode v1.1 med 0,1 poäng och held-out juridik-benchmarken (13,3 % mot 11,7 %), och Mythos 5 leder HealthBench Professional och biologitesterna. Om din arbetsbelastning domineras av något av dessa, kör en benchmark på det innan du byter.

Är Claude Opus 5 bra för att bygga AI-agenter?

Den är byggd för det. De största vinsterna landar på agentbaserad terminalkodning (Frontier-Bench), datoranvändning (OSWorld 2.0), agentbaserad sökning (BrowseComp) och flerstegs affärsarbetsflöden (AutomationBench), vilket är arbetsbelastningarna produktionsagenter kör. Dess starkare självverifiering låter dig också spendera färre tokens på ett separat kritikersteg.

Hur byter jag till Opus 5 i Claude Code och API:et?

Ställ in din modell till claude-opus-5 (använd /model claude-opus-5 i Claude Code) så är du klar för de flesta team. I API:et ändrar du model-fältet till claude-opus-5; request-formen är oförändrad från Opus 4.8, så inga andra kodändringar behövs.

Vad är Fast-läge i Claude Opus 5?

Fast-läge är en höghastighetsnivå som kör Opus 5 på ungefär 2,5x standardhastigheten för ungefär 2x standardpriset. Det håller dig på den fulla claude-opus-5-modellen snarare än att routa dig till en mindre, vilket gör det användbart för interaktiva sessioner där du väntar på output och inte värt det för latensookänsliga batchjobb.

Taggar

Claude Opus 5claude-opus-5anthropicopus 5 mot opus 4.8opus 5 benchmark

Dela denna artikel

Relaterade artiklar

Mer inom ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 Bästa AI-Webbskrapnings-API:er 2026 (Testade i Vår Egen Agentstack)

Vi testade 8 AI-webbskrapnings-API:er med verkliga 2026-priser hämtade via vår egen agentstack. Firecrawl, Bright Data, ScrapingBee och 5 till, rankade efter LLM-redo utdata, anti-bot-skydd och MCP-stöd.

9 min läsning läsning
Läs
ai-machine-learning
Jul 20, 2026

Prompt Engineering för Kodning: 7 Mönster Vi Använder Dagligen i Claude Code och Cursor (2026)

De flesta artiklar om «AI-kodprompter» ger dig 50 mallar att kopiera. Den här lär dig istället de 7 mönster vi använder varje dag för att driva en 16-agent Claude Code-pipeline, med ett verkligt före-och-efter för varje mönster, plus var varje mönster finns i Claude Code, Cursor och Copilot 2026.

11 min läsning läsning
Läs
ai-machine-learning
Jul 19, 2026

Qwen3.8: Alibabas satsning på 2,4 biljoner öppna vikter – och vad vi faktiskt vet

Alibabas Qwen3.8 har 2,4 biljoner parametrar, ett löfte om öppna vikter och en live Max-Preview – men inte ett enda publicerat benchmark. Här är vad som är bekräftat, vad som inte är det, och varför de öppna vikterna är den verkliga nyheten.

9 min read läsning
Läs
Visa alla inlägg
Starta ditt projekt

Redo att bygga något utöver det vanliga?

Låt oss göra verklighet av din idé. Vårt team hjälper dig gärna att bygga mjukvara som gör skillnad.

Boka ett scoping-möte på 30 minSe vårt arbete

Senaste från biblioteket

Claude Skills

Visa alla
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automationer

Visa alla
  • Säkerhetsgranskare

    Veckovis SCA- och IaC-skanning med prioriterade åtgärds-PR:er.

  • Cold Email-skribent

    Skapar förstakontaktsmejl förankrade i en specifik offentlig detalj.

  • Agent för lead-research

    Berikar ett mejl till en profil, poängsätter passform och larmar i Slack.

Senaste från biblioteket

Claude Skills

Visa alla
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automationer

Visa alla
  • Säkerhetsgranskare

    Veckovis SCA- och IaC-skanning med prioriterade åtgärds-PR:er.

  • Cold Email-skribent

    Skapar förstakontaktsmejl förankrade i en specifik offentlig detalj.

  • Agent för lead-research

    Berikar ett mejl till en profil, poängsätter passform och larmar i Slack.

Tjänster

  • Enterprise-lösningar
  • Mobilappar
  • Webbapplikationer

Lösningar

  • CRM-system
  • AI-integration
  • ERP-lösningar
  • Röstassistenter
  • Processautomation
  • Cybersäkerhet

Bibliotek

  • Blogg
  • Portfolio

Community

  • AI-automationer
  • Claude Skills

Verktyg

  • Kostnadskalkylator för mobilappar
  • OpenAI / LLM API-kostnadskalkylator
  • Kostnadskalkylator för MVP
  • Kostnadskalkylator för röst-AI-agenter

Företag

  • Om oss
  • Partners
  • Kontakt

Juridiskt

  • Integritetspolicy
  • Användarvillkor
  • Cookiepolicy

Tjänster

  • Enterprise-lösningar
  • Mobilappar
  • Webbapplikationer

Lösningar

  • CRM-system
  • AI-integration
  • ERP-lösningar
  • Röstassistenter
  • Processautomation
  • Cybersäkerhet

Bibliotek

  • Blogg
  • Portfolio

Community

  • AI-automationer
  • Claude Skills

Verktyg

  • Kostnadskalkylator för mobilappar
  • OpenAI / LLM API-kostnadskalkylator
  • Kostnadskalkylator för MVP
  • Kostnadskalkylator för röst-AI-agenter

Företag

  • Om oss
  • Partners
  • Kontakt
JuridisktIntegritetspolicyAnvändarvillkorCookiepolicy
TECHSY
© 2026 Techsy. Med ensamrätt.