
Claude Opus 5 już jest: inteligencja bliska Fable 5 za połowę ceny
Anthropic wydał Claude Opus 5 24 lipca 2026 roku, a przekaz jest dosadny: inteligencja frontowa zbliżona do Fable 5, za połowę ceny. Głównym dowodem jest Frontier-Bench v0.1, gdzie Opus 5 zdobywa 43,3% i ponad dwukrotnie przebija 21,1% Opus 4.8. Haczyk — a zawsze jakiś jest — model nie wygrywa wszystkiego. GPT-5.6 Sol wciąż wyprzedza go w jednym teście kodowania agentycznego, a w zdrowiu i biologii korona trafia do Mythos 5. Oto co faktycznie się zmieniło, pełna tabela benchmarków i czy warto dziś przestawić domyślny model.
Kluczowe wnioski:
- Claude Opus 5 zadebiutował 24 lipca 2026 w Claude API, Claude.ai, Claude Code i Claude Cowork, z identyfikatorem modelu
claude-opus-5. - Prowadzi w większości opublikowanych przez Anthropic benchmarków (Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench), ale ustępuje w kilku testach kodowania, prawa i nauki.
- Ceny nie zmieniły się względem Opus 4.8 — $5/$25 za milion tokenów, z trybem Fast za około 2x cenę przy około 2,5x szybkości.
Co dziś wydano: Claude Opus 5 w minutę
Claude Opus 5 to nowy model frontowy Anthropic, wydany 24 lipca 2026 i dostępny tego samego dnia przez API, Claude.ai, Claude Code i Claude Cowork. Identyfikator modelu to claude-opus-5. Jak Anthropic ujmuje to w ogłoszeniu, model „zbliża się do frontowej inteligencji Claude Fable 5 za połowę ceny". Standardowe ceny pozostają na poziomie $5 za wejście / $25 za wyjście na milion tokenów, tak samo jak Opus 4.8.
To prawdziwy skok generacyjny dla pracy agentycznej, nie punktowa aktualizacja. Jeśli przechodzisz z Claude Opus 4.8, kształt API i integracja Claude Code pozostają bez zmian, więc migracja to zamiana identyfikatora modelu. Co się zmienia, to sufit: w Frontier-Bench v0.1 Anthropic twierdzi, że Opus 5 ponad dwukrotnie przebija wynik 4.8 przy niższym koszcie na zadanie, i publikuje najnowocześniejsze wyniki w GDPval-AA i ARC-AGI-3.
Pozycjonowanie ma znaczenie. Fable 5 to najdroższy model frontowy Anthropic. Zbliżenie się do niego w cenach Opus to cała historia tego wydania i dlatego fraza „za połowę ceny" jest tą, którą Anthropic otwiera.
Co faktycznie nowego w Opus 5 vs 4.8?
Największa zmiana z 4.8 na 5 to osąd: Opus 5 jest wyraźnie lepszy w weryfikowaniu własnej pracy i iterowaniu, aż zadanie jest faktycznie ukończone, a nie tylko prawdopodobnie skończone. Anthropic wskazuje też na silniejszą inżynierię oprogramowania, pracę wiedzy i badania naukowe, plus lepszy output wizualny. Ceny i główne API pozostały bez zmian.
Lepszy osąd i samoweryfikacja
Najwyraźniejsza zmiana behawioralna to fakt, że Opus 5 sam się sprawdza. Anthropic cytuje Zimu Li, członka kadry technicznej, opisującego model jako taki, który „weryfikuje gałęzie, sprawdza szablony", zamiast pędzić naprzód. Dla każdego, kto polega na agencie, by wyłapywał własne błędy w produkcji, to cecha, która naprawdę zmienia sytuację. To też najtrudniejsza rzecz do sprzedania na wykresie benchmarkowym, więc traktuj to jako twierdzenie do przetestowania na własnych zadaniach.
Frontowa inteligencja w cenie Opus
Sualeh Asif, współzałożyciel Cursor, podsumował wydanie jako „inteligencja bliska Fable 5 w szybkości i cenie Opus". To praktyczny odczyt: zespoły, które chciały rozumowania klasy Fable 5, ale nie mogły uzasadnić ceny, mają teraz opcję pośrednią. W OSWorld 2.0 Anthropic twierdzi, że Opus 5 przewyższa Fable 5 przy około jednej trzeciej kosztu, co jest najczystszym pojedynczym przykładem argumentu wartości.
Postawa w zakresie zgodności i bezpieczeństwa
Anthropic raportuje, że Opus 5 ma najniższy dotąd wynik zachowań niezgodnych (2,3) i nazywa go modelem najbardziej zgodnym ze swoją Konstytucją. Po stronie bezpieczeństwa klasyfikatory cyberbezpieczeństwa są opisane jako około 85% mniej restrykcyjne niż w Fable 5, z programem Cyber Verification dla przedsiębiorstw, które go potrzebują. Jak każde twierdzenie dostawcy o bezpieczeństwie — warto wiedzieć, ale wciąż warto zweryfikować na własnych przypadkach red-team.
Benchmarki Opus 5: gdzie wygrywa (i gdzie przegrywa)
Opus 5 prowadzi w większości opublikowanych przez Anthropic benchmarków, a zwycięstwa istotne dla twórców agentów są przytłaczające: Frontier-Bench v0.1 (43,3%), GDPval-AA (1861 Elo), ARC-AGI-3 (30,2%), OSWorld 2.0 (70,6%) i AutomationBench Zapiera (26,0%). Uczciwe wyjątki: GPT-5.6 Sol wygrywa DeepSWE v1.1, Fable 5 wyprzedza o włos w testach FrontierCode i prawniczych, a Mythos 5 bierze zdrowie i biologię.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Agentyczne kodowanie terminalowe, Frontier-Bench v0.1 | 43,3% | 33,7% | 21,1% | 34,4% |
| Praca wiedzy, GDPval-AA v2 (Elo) | 1861 | 1747 | 1593 | 1736 |
| Rozwiązywanie nowych problemów, ARC-AGI-3 | 30,2% | — | 1,5% | 7,8% |
| Wyszukiwanie agentyczne, BrowseComp | 90,8% | 87,4% | 84,3% | 90,4% |
| Rozumowanie multidyscyplinarne, Humanity's Last Exam (z narzędziami) | 64,7% | 63,9% | 57,9% | — |
| Agentyczna obsługa komputera, OSWorld 2.0 | 70,6% | 66,1% | 55,7% | 62,6% |
| Kodowanie agentyczne, DeepSWE v1.1 | 68,8% | 69,7% | 59,0% | 72,7% |
| Kodowanie agentyczne, FrontierCode v1.1 (Main) | 53,4% | 53,5% | 46,5% | 47,5% |
| Przepływy pracy biznesowej, AutomationBench | 26,0% | 17,4% | 17,0% | 18,1% |
| Legal Agent Benchmark (held-out) | 11,7% | 13,3% | 10,4% | 2,5% |
| Zdrowie, HealthBench Professional | 59,8% | 66,0% | 57,4% | 60,5% |
| Biologia, BioMysteryBench (trudny) | 49,4% | 46,5% | 42,4% | — |

Czytaj delty, nie tylko wyniki bezwzględne. Frontier-Bench skoczył o +22,2 punktu względem Opus 4.8 (21,1 do 43,3) — największy pojedynczy skok i powód, dla którego Anthropic nazywa to wydaniem kodowania i agentów. GDPval-AA zyskał +268 Elo (1593 do 1861), wyprzedzając każdy model w tabeli w pracy wiedzy. ARC-AGI-3 przyciąga wzrok: 30,2% wobec 7,8% dla GPT-5.6 Sol i 1,5% dla Opus 4.8, co Anthropic opisuje jako około 3x najlepszy publiczny model w rozwiązywaniu nowych problemów. W AutomationBench 26,0% to około 1,5x stawki — bezpośredni sygnał dla każdego budującego agentów procesów biznesowych.
Dwie uczciwe uwagi o porażkach. Po pierwsze, lider w kolumnie Fable 5 dla zdrowia (66,0%) i podział biologii rozwiązanej przez człowieka to w rzeczywistości Mythos 5, wyspecjalizowany model naukowy Anthropic, nie Fable 5, więc to nie są porównywalne zwycięstwa modelu ogólnego. Po drugie, obraz kodowania jest naprawdę podzielony: GPT-5.6 Sol bierze DeepSWE v1.1 (72,7% vs 68,8%), a Fable 5 wygrywa FrontierCode o włos (53,5% vs 53,4%). Jeśli twoja praca to czyste kodowanie w stylu SWE-bench, etykieta „najlepszy ogólnie" nie wybiera automatycznie Opus 5.
Ile kosztuje Opus 5? Ceny i tryb Fast
Standardowe ceny Opus 5 to $5 za milion tokenów wejściowych i $25 za milion tokenów wyjściowych, identyczne jak Opus 4.8 według opublikowanych cen Anthropic, więc nie ma podwyżki za aktualizację. Twierdzenie „za połowę ceny" odnosi się do Fable 5, nie do 4.8: dostajesz inteligencję bliską Fable 5 bez płacenia stawek Fable 5. Tryb Fast działa za około 2x cenę bazową przy około 2,5x domyślnej szybkości, a API obsługuje routing awaryjny.
Co to oznacza na zadanie? Przy standardowych cenach nie płacisz nic dodatkowo względem 4.8 i dostajesz duży skok możliwości, co czyni aktualizację niemal darmową dla większości obciążeń. Tryb Fast to dźwignia sesji interaktywnych: wymieniasz 2x premię cenową na output streamowany około 2,5x szybciej na tym samym modelu, co się opłaca, gdy siedzisz i czekasz, a boli, gdy uruchamiasz nocne partie, gdzie czas rzeczywisty jest nieistotny. Jeśli limity szybkości są twoim prawdziwym ograniczeniem, nasz przewodnik po limitach użycia Claude wyjaśnia, jak poziomy współgrają z kosztami.
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}Gdzie Opus 5 ląduje dla agentów produkcyjnych
Zyski koncentrują się dokładnie tam, gdzie żyją agenci produkcyjni: kodowanie terminalowe (Frontier-Bench), obsługa komputera (OSWorld 2.0), wyszukiwanie agentyczne (BrowseComp) i wieloetapowe przepływy pracy biznesowej (AutomationBench). Te cztery to obciążenia, które najczęściej psują się w rzeczywistych wdrożeniach, więc model, który skacze we wszystkich czterech naraz, zmienia to, co można dostarczyć.
To jest część, nad którą warto się zatrzymać. Benchmark taki jak AutomationBench mierzy, czy agent potrafi ukończyć prawdziwy wielonarzędziowy przepływ pracy od początku do końca, a 26,0% Opus 5 wobec około 17% stawki to różnica między „dobrze wygląda w demo" a „przeżywa kontakt z bałaganiarskim CRM". Wynik OSWorld 2.0 (70,6%, pokonując Fable 5 przy jednej trzeciej kosztu) mówi to samo dla agentów obsługi komputera, które klikają przez prawdziwe oprogramowanie. Dla zespołów dostarczających agentów AI dla klientów to liczby, które przekładają się na mniej awarii o 2 w nocy.
Obniża też koszt wzorca projektowego, na którym polegamy: taniej samoweryfikacji. Gdy model jest naprawdę lepszy w sprawdzaniu własnych gałęzi, możesz wydać mniej tokenów na osobny przebieg krytyka i wciąż wyłapywać te same błędy. To prawdziwa pozycja budżetowa dla każdego uruchamiającego agentów na dużą skalę.
Jak wprowadzamy Opus 5 do naszego stosu
Budujemy i uruchamiamy agentów AI w produkcji na stosie Claude w Techsy, więc wydanie frontowe to ewaluacja tego samego dnia, nie nagłówek, który czytamy i idziemy dalej. Oto nasza uczciwa pierwsza ocena — jakościowa tam, gdzie nie mamy jeszcze czystych liczb przed/po, konkretna tam, gdzie mamy.
Sama zamiana jest trywialna i o to chodzi. Nasze potoki treści i automatyzacji przypinają domyślny model w konfiguracji; zmiana claude-opus-4-8 na claude-opus-5 i restart sesji nie wymagały żadnych innych zmian, tak jak każda niedawna aktualizacja Opus. Jeśli routujesz między dostawcami i chcesz A/B testować Opus 5 przeciw Fable 5 lub GPT-5.6 Sol na własnych zadaniach, proxy pozwala przełączać modele bez przepisywania aplikacji.
Co obserwujemy najpierw, to twierdzenie o samoweryfikacji, bo to jedyne, które faktycznie zmieniłoby naszą architekturę. Nasi obecni agenci uruchamiają jawny krok krytyka, by wyłapać złe edycje zanim wylądują; jeśli Opus 5 niezawodnie flaguje własne słabe gałęzie, możemy ten krok odchudzić i zaoszczędzić tokeny. Nie publikujemy liczby w tej kwestii, dopóki nie przeprowadzimy tego na powtarzalnym zestawie zadań — ta sama dyscyplina, której oczekiwalibyśmy od każdego cytującego metryki agentów. Jeśli chcesz metodę, to ta z naszego przewodnika po ewaluacji agentów AI w produkcji: te same prompty, ten sam stan repozytorium, licz błędne skręty, nie wrażenia.
Czy przejść z Opus 4.8? (Przejdź / Poczekaj / Zostań)
Czy się przestawić, zależy od twojego obciążenia, nie od tego, który model „wygrywa" ogólnie. Skoki agentyczne i w pracy wiedzy są duże i realne, więc większość zespołów powinna przejść. Czyste warsztaty kodowania z potokiem GPT lub Fable mają powód, by przetestować przed zobowiązaniem, a użytkownicy bliscy sufitu na tanich zadaniach mogą zostać, tracąc niemal nic.
Przejdź teraz, jeśli: twoja praca opiera się na zadaniach agentycznych, obsłudze komputera, automatyzacji procesów biznesowych lub pracy wiedzy. Frontier-Bench (+22,2 względem 4.8), AutomationBench (~1,5x stawki) i GDPval-AA (+268 Elo) to największe realne zyski, a ceny się nie zmieniły, więc nie ma kary kosztowej za aktualizację.
Poczekaj, jeśli: twój przepływ pracy to czyste kodowanie agentyczne i już używasz do tego GPT-5.6 Sol lub Fable 5. GPT-5.6 Sol wciąż prowadzi w DeepSWE v1.1, a Fable 5 wyprzedza o włos w FrontierCode, więc uruchom własną ewaluację kodowania przed przestawieniem. Poczekaj też, jeśli jesteś w środku projektu, a zamiana modelu zamazałaby ewaluację, którą już prowadzisz.
Zostań przy 4.8, jeśli: jesteś wrażliwy kosztowo na zadaniach, które już były blisko sufitu dla ciebie, i nie dotykasz obciążeń agentycznych, w których Opus 5 wysuwa się na prowadzenie. Płaciłbyś koszt przejścia za deltę, której nie poczujesz. Dla szerszej stawki zobacz, jak modele wypadają w naszym omówieniu Claude Sonnet 5 i przeglądzie Fable 5 i Mythos 5.
Co tydzień dobieramy i konfigurujemy takie modele dla klienckich konstrukcji agentów. Jeśli decydujesz, który model ustandaryzować dla agenta produkcyjnego, umów się na bezpłatną konsultację, a pomożemy dopasować model do obciążenia, nie do marketingu.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji i potoki głosowe/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stosie narzędzi LLM, który zespół Techsy faktycznie uruchamia w produkcji.
Współzałożyciel, Techsy.io, University of Birmingham · LinkedIn
Często zadawane pytania
Czym jest Claude Opus 5?
Claude Opus 5 to model frontowy Anthropic, wydany 24 lipca 2026, z identyfikatorem modelu claude-opus-5. Anthropic pozycjonuje go jako zbliżony do inteligencji Fable 5 za połowę ceny i prowadzi w większości opublikowanych benchmarków, w tym Frontier-Bench, GDPval-AA i ARC-AGI-3. Jest dostępny w Claude API, Claude.ai, Claude Code i Claude Cowork.
Kiedy wydano Claude Opus 5?
Claude Opus 5 został wydany 24 lipca 2026. Uruchomiono go tego samego dnia w całym Claude API, Claude.ai, Claude Code i Claude Cowork, bez etapowego wdrażania, więc możesz natychmiast przestawić domyślny model na claude-opus-5.
Czy Claude Opus 5 jest lepszy od Opus 4.8?
Dla większości pracy — tak. Opus 5 ponad dwukrotnie przebija Opus 4.8 w Frontier-Bench v0.1 (43,3% vs 21,1%), zyskuje 268 Elo w GDPval-AA i skacze z 1,5% do 30,2% w ARC-AGI-3. Ceny się nie zmieniły, więc nie ma kary kosztowej. Wyjątki to kilka testów kodowania i nauki, gdzie wciąż prowadzą GPT-5.6 Sol, Fable 5 lub Mythos 5.
Ile kosztuje Claude Opus 5?
Standardowe ceny to $5 za milion tokenów wejściowych i $25 za milion tokenów wyjściowych, identyczne jak Opus 4.8. Fraza „za połowę ceny" odnosi się do Fable 5, nie 4.8: Opus 5 dostarcza inteligencję bliską Fable 5 w stawkach Opus. Tryb Fast kosztuje około 2x cenę bazową i działa około 2,5x szybciej na tym samym modelu.
Czy Claude Opus 5 pokonuje Fable 5?
Nie we wszystkim. Opus 5 przewyższa Fable 5 w OSWorld 2.0, BrowseComp, GDPval-AA i Frontier-Bench, i robi to za ułamek ceny Fable 5. Ale Fable 5 wciąż wyprzedza o włos w FrontierCode i benchmarku prawniczym, a Mythos 5 (model naukowy Anthropic) prowadzi w zdrowiu i biologii. Przekaz to „blisko Fable 5 za połowę ceny", nie „lepszy od Fable 5 we wszystkim".
W czym Opus 5 przegrywa?
GPT-5.6 Sol wygrywa kodowanie agentyczne w DeepSWE v1.1 (72,7% vs 68,8%), Fable 5 wygrywa FrontierCode v1.1 o 0,1 punktu i held-out benchmark prawniczy (13,3% vs 11,7%), a Mythos 5 prowadzi w HealthBench Professional i testach biologii. Jeśli twoje obciążenie jest zdominowane przez któreś z nich, zbenchmarkuj przed przejściem.
Czy Claude Opus 5 nadaje się do budowy agentów AI?
Jest do tego zbudowany. Największe zyski lądują w agentycznym kodowaniu terminalowym (Frontier-Bench), obsłudze komputera (OSWorld 2.0), wyszukiwaniu agentycznym (BrowseComp) i wieloetapowych przepływach pracy biznesowej (AutomationBench) — czyli obciążeniach, które uruchamiają agenci produkcyjni. Jego silniejsza samoweryfikacja pozwala też wydać mniej tokenów na osobny przebieg krytyka.
Jak przejść na Opus 5 w Claude Code i API?
Ustaw model na claude-opus-5 (użyj /model claude-opus-5 w Claude Code) i dla większości zespołów gotowe. W API zmień pole model na claude-opus-5; kształt żądania jest niezmieniony względem Opus 4.8, więc nie są potrzebne żadne inne zmiany kodu.
Czym jest tryb Fast w Claude Opus 5?
Tryb Fast to poziom o wyższej szybkości, który uruchamia Opus 5 z około 2,5x domyślną szybkością za około 2x standardową cenę. Utrzymuje cię na pełnym modelu claude-opus-5, zamiast routować do mniejszego, co czyni go użytecznym dla sesji interaktywnych, gdzie czekasz na output, i nieopłacalnym dla niewrażliwych na opóźnienia zadań wsadowych.