
Claude Opus 5 a sosit: inteligență aproape de Fable 5 la jumătate de preț
Anthropic a lansat Claude Opus 5 pe 24 iulie 2026, iar mesajul este direct: inteligență de frontieră aproape de Fable 5, la jumătate de preț. Dovada principală este Frontier-Bench v0.1, unde Opus 5 obține 43,3% și mai mult decât dublează cei 21,1% ai lui Opus 4.8. Problema — și întotdeauna există una — e că nu câștigă totul. GPT-5.6 Sol îl depășește încă la un test de codare agentică, iar în sănătate și biologie coroana merge la Mythos 5. Iată ce s-a schimbat de fapt, tabelul complet de benchmark-uri și dacă ar trebui să îți schimbi modelul implicit azi.
Idei principale:
- Claude Opus 5 a fost lansat pe 24 iulie 2026 pe Claude API, Claude.ai, Claude Code și Claude Cowork, cu model ID-ul
claude-opus-5. - Conduce în majoritatea benchmark-urilor publicate de Anthropic (Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench), dar rămâne în urmă la câteva teste de codare, juridice și științifice.
- Prețul rămâne neschimbat față de Opus 4.8 la $5/$25 per milion de tokeni, cu un mod Fast la aproximativ 2x prețul pentru circa 2,5x viteza.
Ce s-a lansat azi: Claude Opus 5 într-un minut
Claude Opus 5 este noul model de frontieră al Anthropic, lansat pe 24 iulie 2026 și disponibil în aceeași zi pe API, Claude.ai, Claude Code și Claude Cowork. Model ID-ul este claude-opus-5. Încadrarea Anthropic, conform anunțului, este că „se apropie de inteligența de frontieră a Claude Fable 5 la jumătate de preț." Prețul standard rămâne $5 input / $25 output per milion de tokeni, același ca Opus 4.8.
Acesta este un salt generațional real pentru munca agenților, nu o simplă actualizare. Dacă vii de la Claude Opus 4.8, forma API-ului și integrarea Claude Code se transferă neschimbate, deci migrarea este doar o schimbare de model ID. Ce e diferit este plafonul: pe Frontier-Bench v0.1, Anthropic spune că Opus 5 mai mult decât dublează scorul lui 4.8 la un cost mai mic per sarcină, și înregistrează cifre de ultimă generație pe GDPval-AA și ARC-AGI-3.
Poziționarea contează. Fable 5 este cel mai scump model de frontieră al Anthropic. A ajunge la distanță mică de el la prețuri Opus este întreaga poveste a acestei lansări, și de aceea linia „jumătate de preț" este cea cu care Anthropic deschide.
Ce e cu adevărat nou în Opus 5 față de 4.8?
Cea mai mare schimbare de la 4.8 la 5 este discernământul: Opus 5 este semnificativ mai bun la verificarea propriei munci și iterarea până când o sarcină este efectiv terminată, nu doar aparent finalizată. Anthropic menționează și inginerie software mai puternică, muncă de cunoaștere și cercetare științifică, plus output vizual îmbunătățit. Prețurile și API-ul de bază au rămas la fel.
Discernământ și autoverificare mai bune
Cea mai clară schimbare de comportament este că Opus 5 se verifică singur. Anthropic îl citează pe Zimu Li, membru tehnic al echipei, descriind modelul ca unul care „verifică ramuri, verifică șabloane" în loc să înainteze orbește. Pentru oricine se bazează pe un agent să-și prindă propriile greșeli în producție, aceasta este trăsătura care mută acul. E și cel mai greu lucru de vândut pe un grafic de benchmark, deci tratează-l ca pe o afirmație de testat pe propriile tale sarcini.
Inteligență de frontieră la cost Opus
Sualeh Asif, co-fondator al Cursor, a rezumat lansarea ca „inteligență aproape de Fable 5 la viteza și costul Opus." Aceasta este lectura practică: echipele care voiau raționament de clasă Fable 5 dar nu puteau justifica prețul au acum o opțiune de mijloc. Pe OSWorld 2.0, Anthropic spune că Opus 5 depășește Fable 5 la aproximativ o treime din cost, ceea ce este cel mai clar exemplu singular al argumentului de valoare.
Aliniere și postură de securitate
Anthropic raportează că Opus 5 are cel mai mic scor de comportament nealiniat de până acum (2,3) și îl numește modelul cel mai aliniat cu Constituția sa. Pe partea de securitate, clasificatorii de securitate cibernetică sunt descriși ca fiind cu aproximativ 85% mai puțin restrictivi decât cei ai Fable 5, cu un Cyber Verification Program enterprise pentru echipele care au nevoie. Ca orice afirmație de securitate a unui furnizor: util de știut, dar merită validată cu propriile tale cazuri de red-team.
Benchmark-uri Opus 5: unde câștigă (și unde pierde)
Opus 5 conduce în majoritatea benchmark-urilor publicate de Anthropic, iar victoriile care contează pentru constructorii de agenți sunt covârșitoare: Frontier-Bench v0.1 (43,3%), GDPval-AA (1861 Elo), ARC-AGI-3 (30,2%), OSWorld 2.0 (70,6%) și AutomationBench de la Zapier (26,0%). Excepțiile oneste: GPT-5.6 Sol câștigă DeepSWE v1.1, Fable 5 îl depășește la limită pe FrontierCode și testele juridice, iar Mythos 5 ia sănătatea și biologia.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Codare agentică de terminal, Frontier-Bench v0.1 | 43,3% | 33,7% | 21,1% | 34,4% |
| Muncă de cunoaștere, GDPval-AA v2 (Elo) | 1861 | 1747 | 1593 | 1736 |
| Rezolvare de probleme noi, ARC-AGI-3 | 30,2% | — | 1,5% | 7,8% |
| Căutare agentică, BrowseComp | 90,8% | 87,4% | 84,3% | 90,4% |
| Raționament multidisciplinar, Humanity's Last Exam (cu instrumente) | 64,7% | 63,9% | 57,9% | — |
| Utilizare agentică a computerului, OSWorld 2.0 | 70,6% | 66,1% | 55,7% | 62,6% |
| Codare agentică, DeepSWE v1.1 | 68,8% | 69,7% | 59,0% | 72,7% |
| Codare agentică, FrontierCode v1.1 (Main) | 53,4% | 53,5% | 46,5% | 47,5% |
| Fluxuri de lucru business, AutomationBench | 26,0% | 17,4% | 17,0% | 18,1% |
| Legal Agent Benchmark (held-out) | 11,7% | 13,3% | 10,4% | 2,5% |
| Sănătate, HealthBench Professional | 59,8% | 66,0% | 57,4% | 60,5% |
| Biologie, BioMysteryBench (dificil) | 49,4% | 46,5% | 42,4% | — |

Citește diferențele, nu doar scorurile absolute. Frontier-Bench a sărit +22,2 puncte peste Opus 4.8 (21,1 la 43,3) — cel mai mare salt singular și motivul pentru care Anthropic numește aceasta o lansare de codare și agenți. GDPval-AA a câștigat +268 Elo (1593 la 1861), depășind fiecare model din tabel la munca de cunoaștere. ARC-AGI-3 este cel care atrage atenția: 30,2% versus 7,8% pentru GPT-5.6 Sol și 1,5% pentru Opus 4.8, ceea ce Anthropic încadrează ca aproximativ 3x următorul cel mai bun model public la rezolvarea de probleme noi. Pe AutomationBench, 26,0% este de circa 1,5x media — un semnal direct pentru oricine construiește agenți de procese business.
Două note oneste despre înfrângeri. Prima, liderul din coloana Fable 5 pentru sănătate (66,0%) și împărțirea biologiei rezolvate de oameni este de fapt Mythos 5, modelul specializat pe știință al Anthropic, nu Fable 5, deci nu sunt victorii de model general comparabile. A doua, imaginea codării este cu adevărat împărțită: GPT-5.6 Sol ia DeepSWE v1.1 (72,7% vs 68,8%), iar Fable 5 câștigă FrontierCode la o diferență infimă (53,5% vs 53,4%). Dacă munca ta este codare pură de tip SWE-bench, eticheta „cel mai bun per total" nu alege automat Opus 5.
Cât costă Opus 5? Prețuri și modul Fast
Prețul standard al Opus 5 este $5 per milion de tokeni de input și $25 per milion de tokeni de output, identic cu Opus 4.8 conform prețurilor publicate de Anthropic, deci nu există creștere de preț pentru upgrade. Afirmația „jumătate de preț" este relativă la Fable 5, nu la 4.8: obții inteligență aproape de Fable 5 fără să plătești tarife Fable 5. Modul Fast rulează la aproximativ 2x prețul de bază pentru circa 2,5x viteza implicită, iar API-ul suportă fallback routing.
Ce înseamnă asta per sarcină? La prețurile standard nu plătești nimic în plus față de 4.8 și primești un salt mare de capabilitate, ceea ce face upgrade-ul aproape gratuit pentru majoritatea workload-urilor. Modul Fast este pârghia pentru sesiuni interactive: schimbi un premium de 2x la preț pentru output care curge de aproximativ 2,5x mai repede pe același model, ceea ce merită când stai și aștepți și doare când rulezi batch-uri peste noapte unde timpul real e irelevant. Dacă rate limits sunt constrângerea ta reală, ghidul nostru despre limitele de utilizare Claude acoperă cum interacționează nivelurile cu costul.
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}Unde se poziționează Opus 5 pentru agenții de producție
Câștigurile se concentrează exact unde trăiesc agenții de producție: codare de terminal (Frontier-Bench), utilizarea computerului (OSWorld 2.0), căutare agentică (BrowseComp) și fluxuri de lucru multi-etapă (AutomationBench). Aceste patru sunt workload-urile care se strică cel mai des în implementările reale, deci un model care sare pe toate patru deodată schimbă ce poate fi livrat.
Asta e partea la care merită să te oprești. Un benchmark ca AutomationBench măsoară dacă un agent poate completa un flux de lucru real cu mai multe instrumente de la capăt la capăt, iar 26,0% al lui Opus 5 versus aproximativ 17% media este diferența dintre „se prezintă bine în demo" și „supraviețuiește contactului cu un CRM dezordonat." Rezultatul OSWorld 2.0 (70,6%, bate Fable 5 la o treime din cost) spune același lucru pentru agenții de utilizare a computerului care dau click prin software real. Pentru echipele care livrează agenți AI orientați spre clienți, acestea sunt cifrele care se traduc în mai puține eșecuri la 2 dimineața.
De asemenea, reduce costul unui pattern de design pe care ne bazăm: autoverificare ieftină. Când modelul este cu adevărat mai bun la verificarea propriilor ramuri, poți cheltui mai puțini tokeni pe o trecere separată de critică și totuși să prinzi aceleași erori. Asta e o linie reală de buget pentru oricine rulează agenți la volum.
Cum integrăm Opus 5 în stack-ul nostru
Construim și rulăm agenți AI de producție pe stack-ul Claude la Techsy, deci o lansare de frontieră este o evaluare în aceeași zi, nu un titlu pe care îl citim și trecem mai departe. Iată lectura noastră sinceră inițială — calitativă unde nu avem încă cifre curate înainte/după, specifică unde avem.
Schimbarea în sine este trivială, și asta e ideea. Pipeline-urile noastre de conținut și automatizare fixează un model implicit în config; schimbarea din claude-opus-4-8 în claude-opus-5 și repornirea unei sesiuni nu a necesitat nicio altă modificare, la fel ca fiecare upgrade recent Opus. Dacă rutezi între furnizori și vrei să faci A/B test între Opus 5 și Fable 5 sau GPT-5.6 Sol pe propriile tale sarcini, un proxy îți permite să schimbi modele fără să rescrii aplicația.
Ce urmărim primul este afirmația de autoverificare, pentru că e cea care ne-ar schimba efectiv arhitectura. Agenții noștri actuali rulează un pas explicit de critică pentru a prinde editările proaste înainte să fie aplicate; dacă Opus 5 semnalizează fiabil propriile ramuri slabe, putem subția acel pas și economisi tokeni. Nu publicăm o cifră despre asta până nu o rulăm pe un set repetabil de sarcini — aceeași disciplină pe care am cere-o de la oricine citează metrici de agenți. Dacă vrei metoda, e cea din ghidul nostru despre evaluarea agenților AI în producție: aceleași prompturi, aceeași stare a repo-ului, numără greșelile de direcție, nu impresiile.
Ar trebui să treci de la Opus 4.8? (Schimbă / Așteaptă / Rămâi)
Dacă te muți depinde de workload-ul tău, nu de care model „câștigă" per total. Salturile agentice și de muncă de cunoaștere sunt mari și reale, deci majoritatea echipelor ar trebui să schimbe. Atelierele de codare pură cu un pipeline GPT sau Fable au motiv să testeze înainte de a se angaja, iar utilizatorii aproape de plafon pe sarcini ieftine pot rămâne fără să piardă aproape nimic.
Schimbă acum dacă: munca ta se bazează pe sarcini agentice, utilizarea computerului, automatizarea proceselor business sau muncă de cunoaștere. Frontier-Bench (+22,2 peste 4.8), AutomationBench (~1,5x media) și GDPval-AA (+268 Elo) sunt cele mai mari câștiguri reale, iar prețul nu s-a schimbat, deci nu există penalizare de cost pentru upgrade.
Așteaptă dacă: fluxul tău de lucru este codare agentică pură și deja folosești GPT-5.6 Sol sau Fable 5 pentru asta. GPT-5.6 Sol conduce încă pe DeepSWE v1.1 și Fable 5 depășește la limită FrontierCode, deci rulează propria evaluare de codare înainte să schimbi. Așteaptă și dacă ești în mijlocul unui proiect și o schimbare de model ar tulbura o evaluare pe care deja o rulezi.
Rămâi pe 4.8 dacă: ești sensibil la cost pe sarcini care erau deja aproape de plafon pentru tine și nu atingi workload-urile agentice unde Opus 5 avansează. Ai plăti costul schimbării pentru o diferență pe care nu o vei simți. Pentru peisajul mai larg, vezi cum se compară modelele în analiza noastră Claude Sonnet 5 și în prezentarea generală Fable 5 și Mythos 5.
Alegem și conectăm modele ca acestea pentru build-uri de agenți ai clienților în fiecare săptămână. Dacă decizi pe ce model să te standardizezi pentru un agent de producție, obține o consultație gratuită și te ajutăm să potrivești modelul cu workload-ul în loc de marketing.
Despre autor
Mert Batur Gurbuz este co-fondator al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri vocale/SDR pentru clienți B2B. Studiază la University of Birmingham și scrie despre stack-ul de instrumente LLM pe care echipa Techsy îl rulează efectiv în producție.
Co-fondator, Techsy.io, University of Birmingham · LinkedIn
Întrebări frecvente
Ce este Claude Opus 5?
Claude Opus 5 este modelul de frontieră al Anthropic, lansat pe 24 iulie 2026, cu model ID-ul claude-opus-5. Anthropic îl poziționează ca apropiindu-se de inteligența Fable 5 la jumătate de preț, și conduce în majoritatea benchmark-urilor publicate, inclusiv Frontier-Bench, GDPval-AA și ARC-AGI-3. Este disponibil pe Claude API, Claude.ai, Claude Code și Claude Cowork.
Când a fost lansat Claude Opus 5?
Claude Opus 5 a fost lansat pe 24 iulie 2026. A devenit disponibil în aceeași zi pe Claude API, Claude.ai, Claude Code și Claude Cowork, fără lansare etapizată, deci poți schimba modelul implicit la claude-opus-5 imediat.
Este Claude Opus 5 mai bun decât Opus 4.8?
Pentru majoritatea muncii, da. Opus 5 mai mult decât dublează Opus 4.8 pe Frontier-Bench v0.1 (43,3% vs 21,1%), câștigă 268 Elo pe GDPval-AA și sare de la 1,5% la 30,2% pe ARC-AGI-3. Prețul este neschimbat, deci nu există penalizare de cost. Excepțiile sunt câteva teste de codare și știință unde GPT-5.6 Sol, Fable 5 sau Mythos 5 conduc încă.
Cât costă Claude Opus 5?
Prețul standard este $5 per milion de tokeni de input și $25 per milion de tokeni de output, identic cu Opus 4.8. Linia „jumătate de preț" se referă la Fable 5, nu la 4.8: Opus 5 livrează inteligență aproape de Fable 5 la tarife Opus. Modul Fast costă aproximativ 2x prețul de bază și rulează de circa 2,5x mai repede pe același model.
Bate Claude Opus 5 pe Fable 5?
Nu pe toate fronturile. Opus 5 depășește Fable 5 pe OSWorld 2.0, BrowseComp, GDPval-AA și Frontier-Bench, și o face la o fracțiune din prețul Fable 5. Dar Fable 5 depășește încă la limită FrontierCode și benchmark-ul juridic, iar Mythos 5 (modelul științific al Anthropic) conduce în sănătate și biologie. Mesajul este „aproape de Fable 5 la jumătate de preț," nu „mai bun decât Fable 5 la totul."
La ce pierde Opus 5?
GPT-5.6 Sol câștigă codarea agentică pe DeepSWE v1.1 (72,7% vs 68,8%), Fable 5 câștigă FrontierCode v1.1 cu 0,1 puncte și benchmark-ul juridic held-out (13,3% vs 11,7%), iar Mythos 5 conduce pe HealthBench Professional și testele de biologie. Dacă workload-ul tău este dominat de vreunul dintre acestea, fă un benchmark înainte să schimbi.
Este Claude Opus 5 bun pentru construirea de agenți AI?
Este construit pentru asta. Cele mai mari câștiguri aterizează pe codare agentică de terminal (Frontier-Bench), utilizarea computerului (OSWorld 2.0), căutare agentică (BrowseComp) și fluxuri de lucru business multi-etapă (AutomationBench), care sunt workload-urile pe care le rulează agenții de producție. Autoverificarea sa mai puternică îți permite de asemenea să cheltui mai puțini tokeni pe o trecere separată de critică.
Cum trec la Opus 5 în Claude Code și API?
Setează modelul la claude-opus-5 (folosește /model claude-opus-5 în Claude Code) și ai terminat pentru majoritatea echipelor. În API, schimbă câmpul model la claude-opus-5; forma request-ului este neschimbată față de Opus 4.8, deci nu sunt necesare alte modificări de cod.
Ce este modul Fast în Claude Opus 5?
Modul Fast este un nivel de viteză superioară care rulează Opus 5 la aproximativ 2,5x viteza implicită pentru circa 2x prețul standard. Te menține pe modelul complet claude-opus-5 în loc să te ruteze către unul mai mic, ceea ce îl face util pentru sesiuni interactive unde aștepți output-ul și inutil pentru job-uri batch insensibile la latență.