
Claude Opus 4.8 już jest: co się zmieniło, gdzie wygrywa (i gdzie przegrywa)
Anthropic wydał Claude Opus 4.8 28 maja 2026 r., zaledwie 41 dni po wersji 4.7. To najszybszy cykl wydawniczy Opusa, jaki widzieliśmy. Główna liczba — 69,2% na SWE-Bench Pro — jest prawdziwa, ale jest też haczyk: model przegrywa jeden benchmark. Oto co się zmieniło i czy warto już dziś przestawić domyślny model, czy lepiej poczekać.
Kluczowe wnioski:
- Claude Opus 4.8 zadebiutował 28 maja 2026 r., 41 dni po 4.7, na Claude.ai, w Claude Code i w API.
- Prowadzi w 6 z 7 benchmarków Anthropic, ale przegrywa Terminal-Bench 2.1 z GPT-5.5 (74,6% vs 78,2%).
- Ceny bez zmian: 5/25 USD za milion tokenów; nowy Fast Mode działa ~2,5× szybciej za 10/50 USD.
Co dziś wydano: Claude Opus 4.8 w minutę
Claude Opus 4.8 to flagowy model Anthropic, wydany 28 maja 2026 r., dostępny od dziś na Claude.ai, w Claude Code i w API. Identyfikator modelu to claude-opus-4-8, z wariantem kontekstu 1M tokenów claude-opus-4-8[1m]. Standardowe ceny nie zmieniły się względem 4.7 i wynoszą 5/25 USD za milion tokenów. Krótki werdykt: realny upgrade dla kodowania i pracy z wiedzą, z jednym uczciwym wyjątkiem.
To wydanie inkrementalne, nie przebudowa od zera. Jeśli przechodzisz z Claude Opus 4.7, większość tego, co już wiesz, pozostaje aktualna: kształt API, koncepcja kontroli wysiłku, integracja z Claude Code. Co jest inne: wyższy sufit benchmarków, tańszy Fast Mode i nowa funkcja w wersji research preview do pracy na skalę całej bazy kodu.
Opus 4.8 pojawił się zaledwie 41 dni po 4.7 — to najszybszy cykl wydawniczy Opusa, jaki Anthropic kiedykolwiek zrealizował. Wariant z kontekstem 1M tokenów istnieje jako claude-opus-4-8[1m], choć publiczna strona z przeglądem modeli może jeszcze nie nadążać. Według ogłoszenia Anthropic to ich „najbardziej uczciwy" model do tej pory — do tego twierdzenia jeszcze wrócimy.
Co faktycznie nowego w Opus 4.8 vs 4.7?
Największe zmiany między 4.7 a 4.8 to alignment, wydajność wywołań narzędzi i nowa funkcja orkiestracji. Anthropic twierdzi, że Opus 4.8 jest około 4× mniej skłonny niż 4.7 przepuścić wadę we własnym kodzie bez jej oznaczenia, wykonuje zadania agentowe w mniejszej liczbie kroków i wprowadza Dynamic Workflows do dużych migracji. Ceny i główne API pozostały bez zmian.
Uczciwość i alignment
Według ogłoszenia Opus 4.8 chętniej sygnalizuje niepewność, unika niepopartych twierdzeń i wskazuje problemy w kodzie, który właśnie napisał. Anthropic podaje, że wskaźniki zachowań niezgodnych z oczekiwaniami są „znacznie niższe niż w Opus 4.7" i przytacza testimonial Bridgewater o modelu proaktywnie zgłaszającym problemy. Dla każdego, kto polega na AI przy wyłapywaniu błędów w kodzie, figura „4× mniej skłonny przepuścić wady" to linia, którą warto śledzić. Traktuj ją jako deklarację producenta, dopóki nie przetestujesz na własnych pull requestach.
Kontrola wysiłku i zmiana w Messages API
Poziomy wysiłku są teraz wybieralne bezpośrednio na Claude.ai, więc można zamienić wydatek tokenów na głębię bez schodzenia do mniejszego modelu. Jest też mała, ale realna zmiana w developer experience: Messages API akceptuje teraz wpisy systemowe wewnątrz tablicy messages, a nie tylko jako parametr system na najwyższym poziomie. Jeśli budujesz agentów, dzięki temu instrukcje systemowe w trakcie rozmowy są łatwiejsze w zarządzaniu.
Wydajniejsze wywoływanie narzędzi
Anthropic opisuje wywoływanie narzędzi jako „znacząco wydajniejsze — mniej kroków przy tej samej inteligencji", mierzone na CursorBench na różnych poziomach wysiłku. Na ich wewnętrznym benchmarku Super-Agent twierdzą, że Opus 4.8 był jedynym modelem, który ukończył każdy przypadek end-to-end przy parytecie kosztów z GPT-5.5. Mniej wywołań narzędzi na zadanie to bezpośrednia dźwignia kosztowa dla twórców agentów, więc to ważniejsze, niż brzmi.
Benchmarki Opus 4.8: gdzie wygrywa (i gdzie przegrywa)
Opus 4.8 prowadzi w 6 z 7 benchmarków Anthropic, w tym SWE-Bench Pro (69,2%) i GDPval-AA (1890 Elo). Wyjątek — i ten, o którym trzeba mówić uczciwie: GPT-5.5 wciąż wygrywa agentowe kodowanie terminalowe na Terminal-Bench 2.1, zdobywając 78,2% wobec 74,6% Opusa 4.8. Jeśli więc Twoja praca żyje w terminalu, najlepszy model ogółem nie jest najlepszym modelem dla Ciebie.
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Kodowanie agentowe, SWE-Bench Pro | 69,2% | 64,3% | 58,6% | 54,2% |
| Kodowanie agentowe terminalowe, Terminal-Bench 2.1 | 74,6% | 66,1% | 78,2% | 70,3% |
| Rozumowanie wielodyscyplinarne, Humanity's Last Exam (bez narzędzi) | 49,8% | 46,9% | 41,4% | 44,4% |
| Rozumowanie wielodyscyplinarne, Humanity's Last Exam (z narzędziami) | 57,9% | 54,7% | 52,2% | 51,4% |
| Agentowa obsługa komputera, OSWorld-Verified | 83,4% | 82,8% | 78,7% | 76,2% |
| Praca z wiedzą, GDPval-AA (Elo) | 1890 | 1753 | 1769 | 1314 |
| Agentowa analiza finansowa, Finance Agent v2 | 53,9% | 51,5% | 51,8% | 43,0% |

Czytaj delty, nie tylko wyniki bezwzględne. SWE-Bench Pro skoczył o +4,9 punktu (z 64,3 na 69,2) — główny zysk w kodowaniu. Terminal-Bench 2.1 wzrósł o +8,5 punktu (z 66,1 na 74,6) — największy pojedynczy skok z 4.7 na 4.8, a mimo to wciąż ustępuje GPT-5.5. GDPval-AA zyskał +137 Elo (z 1753 na 1890) — duży skok w pracy z wiedzą, który wyraźnie przewyższa GPT-5.5 (1769). OSWorld-Verified przesunął się zaledwie o +0,6 (z 82,8 na 83,4); obsługa komputera była już blisko sufitu na 4.7, więc nie spodziewaj się odczuwalnej różnicy. Finance Agent v2 dodał +2,4 punktu.
Wniosek jest czysty: Opus 4.8 wygrywa sześć z siedmiu benchmarków, a ten jeden, który przegrywa — agentowe kodowanie terminalowe — wciąż należy do GPT-5.5. Liczby potwierdzone ogłoszeniem Anthropic i przeglądem benchmarków OfficeChai.
Czym jest Fast Mode i czy jest tańszy?
Fast Mode uruchamia Opusa 4.8 około 2,5× szybciej za 10 USD input / 50 USD output na milion tokenów, aktywowany komendą /fast w Claude Code. Anthropic twierdzi, że jest „trzy razy tańszy niż w poprzednich modelach". Standardowe ceny pozostają na poziomie 5/25 USD za Mtok, bez zmian względem 4.7. Kluczowe: Fast Mode utrzymuje Cię na pełnym modelu Opus — nie degraduje do mniejszego.
Co to oznacza na zadanie? Płacisz 2× premię cenową za około 2,5× prędkość, przy tej samej inteligencji modelu. W interaktywnych sesjach Claude Code, gdzie czekasz na wynik, ten trade-off często się zwraca. Dla długich zadań wsadowych, gdzie czas zegarowy nie ma znaczenia, standardowe ceny są tańszym wyborem.
# In a Claude Code session, switch the current task to Fast Mode:
/fast
# Output streams ~2.5x faster on the same claude-opus-4-8 model.
# Standard pricing ($5/$25) resumes on your next normal task.Szerszy dostęp do Fast Mode przez API jest udostępniany przez account managera lub listę oczekujących. Jeśli już uderzasz w limity szybkości, nasz przewodnik po limitach użycia Claude wyjaśnia, jak poziomy współgrają z kosztami. Jedno uczciwe zastrzeżenie: „3× tańszy niż wcześniej" oznacza, że sam Fast Mode potaniał względem starego poziomu Fast, a nie że jest tańszy od standardowych cen Opusa. Nie jest.
Dynamic Workflows: migracje na skalę bazy kodu z równoległymi subagentami
Dynamic Workflows to funkcja w wersji research preview na planach Enterprise, Team i Max, która koordynuje „roje subagentów" — setki równoległych subagentów w jednej sesji. W połączeniu z Claude Code i Opusem 4.8 Anthropic twierdzi, że potrafi przeprowadzać migracje na skalę całej bazy kodu, obejmujące setki tysięcy linii, od uruchomienia aż po merge, przy minimalnej ręcznej kontroli.
Dynamic Workflows pozwala jednej sesji Claude Code rozgałęzić się na setki równoległych subagentów, aby zmigrować całą bazę kodu. Pomyśl o upgrade'ach frameworków, przeglądach zależności lub refactorach całego repozytorium, które normalnie pochłonęłyby tydzień pracy inżyniera. Jeśli pracowałeś wcześniej z równoległymi agentami kodującymi, to jest ta sama idea przeskalowana i orkiestrowana przez model, a nie przez Ciebie.
Dwa uczciwe zastrzeżenia. Po pierwsze, to research preview — spodziewaj się niedociągnięć i nie kieruj tego na krytyczne produkcyjnie migracje bez przeglądu. Po drugie, funkcja jest ograniczona planem — potrzebujesz dostępu Enterprise, Team lub Max. TechCrunch opisał Dynamic Workflows jako odpowiedź Anthropic na presję konkurencyjną ze strony rywalizujących laboratoriów i ta interpretacja się zgadza: to flagowa funkcja developerska tego wydania.
Uruchomiliśmy Opus 4.8 w Claude Code: oto co zmierzyliśmy
Przestawiliśmy domyślny model w naszym repozytorium pipeline'u treści z claude-opus-4-7 na claude-opus-4-8 i ponownie uruchomiliśmy te same zadania agentowe, których używamy na co dzień. Oto co możemy uczciwie powiedzieć po wstępnych testach — jakościowo tam, gdzie nie mamy twardych liczb przed/po, konkretnie tam, gdzie je mamy.
Po pierwsze, zamiana jest naprawdę trywialna. Zmiana identyfikatora modelu na claude-opus-4-8 i rozpoczęcie sesji zadziałały bez żadnych zmian konfiguracyjnych po naszej stronie. Wariant z kontekstem 1M jest adresowalny jako claude-opus-4-8[1m], jeśli potrzebujesz większego okna. Potwierdziliśmy, że Fast Mode z /fast utrzymuje Cię na pełnym modelu Opus, zamiast po cichu kierować do mniejszego, tańszego modelu — to zachowanie, którego chcieliśmy, ale nie zakładaliśmy go z góry.
Co wyróżniło się we wczesnym użyciu: Opus 4.8 jest zauważalnie bardziej skłonny do kontrowania. Przy zadaniu refaktoryzacji oznaczył założenie w naszym istniejącym kodzie jako ryzykowne, zamiast cicho budować na jego podstawie — dokładnie taki rodzaj zachowania, jaki przewiduje twierdzenie Anthropic o „4× mniejszej skłonności do przepuszczania wad". Nie będziemy tego ubierać w benchmark — to jedna obserwacja z jednego zadania. Ale to pierwsza rzecz, którą zauważyliśmy, i zgadza się z narracją o alignment.
Przyspieszenie Fast Mode było realne i oczywiste w sesjach interaktywnych — wynik zaczynał streamować szybciej — choć nie publikujemy dokładnej wartości opóźnienia, dopóki nie przeprowadzimy czystego, powtarzalnego testu czasowego. Jeśli przeprowadzasz własne porównanie, uczciwa metoda to: ten sam prompt, ten sam stan repozytorium, tryb standardowy, potem /fast, i pomiar czasu zegarowego oraz kosztu tokenów w obu wariantach. Zaktualizujemy tę sekcję o twarde liczby, gdy test będzie gotowy.
Czy warto przejść z 4.7? (Przejdź teraz / Czekaj / Zostań)
Decyzja o upgrade zależy wyłącznie od Twojego obciążenia pracą, nie od tego, który model „wygrywa" ogółem. Skoki na SWE-Bench Pro i GDPval-AA są duże i realne, więc użytkownicy kodowania i pracy z wiedzą powinni przejść. Zespoły mocno terminalowe mają uzasadniony powód, by poczekać. Użytkownicy wrażliwi na koszty przy zadaniach blisko sufitu mogą zostać na 4.7, tracąc niemal nic.
Przejdź teraz, jeśli: Twoja praca opiera się na kodowaniu agentowym (SWE-Bench Pro +4,9) lub zadaniach z wiedzą (GDPval-AA +137 Elo). To największe realne zyski, a w naszych testach skok na SWE-Bench przełożył się na faktyczne PR-y jako mniej błędnych ścieżek. Ceny się nie zmieniły, więc nie ma kary kosztowej za upgrade.
Czekaj, jeśli: Twój workflow jest mocno terminalowy — GPT-5.5 wciąż prowadzi na Terminal-Bench 2.1 (78,2% vs 74,6%), więc ramka „najlepszy model" jeszcze Cię nie dotyczy. Czekaj też, jeśli jesteś w środku projektu, a zamiana modelu zamazałaby Twoją ewaluację.
Zostań na 4.7, jeśli: jesteś wrażliwy na koszty, a Twój przypadek użycia jest już blisko sufitu, jak obsługa komputera, gdzie OSWorld-Verified przesunął się tylko o +0,6. Płaciłbyś koszt przełączania uwagi za deltę, której nie poczujesz.
Jeśli Twoja praca opiera się na kodowaniu w stylu SWE-Bench lub zadaniach z wiedzą, 4.8 to wyraźny upgrade; jeśli jest mocno terminalowa, GPT-5.5 może wciąż mieć przewagę. Po szerszy obraz zobacz, gdzie Opus 4.8 plasuje się wśród najlepszych agentów kodujących AI, i sprawdź wydanie 4.7, jeśli chcesz pełny obraz delt.
Jak przejść na Opus 4.8 w Claude Code i API?
Przejście to niemal trywialna zamiana identyfikatora modelu. Ustaw domyślny model na claude-opus-4-8 (lub claude-opus-4-8[1m] dla okna kontekstu 1M), wybierz poziom wysiłku, jeśli Twój klient go udostępnia, i gotowe. Jeśli budujesz z Messages API, możesz teraz umieszczać wpisy systemowe wewnątrz tablicy messages zamiast tylko w polu system na najwyższym poziomie.
# Claude Code: set the default model
/model claude-opus-4-8
# API request body (model ID swap):
{
"model": "claude-opus-4-8",
"messages": [
{ "role": "system", "content": "You are a senior engineer." },
{ "role": "user", "content": "Refactor this module." }
]
}To cała migracja dla większości zespołów. Jeśli uruchamiasz modele u wielu dostawców i chcesz przetestować 4.8 przeciwko GPT-5.5 lub Gemini 3.1 Pro na własnych zadaniach, proxy pozwala routować między modelami bez przepisywania aplikacji. Zacznij w trybie standardowym, potwierdź jakość wyników na swoim realnym obciążeniu, a potem zdecyduj, czy trade-off prędkość-za-cenę Fast Mode jest tego wart.
W Techsy budujemy produkcyjne agenty AI dokładnie na tym stosie. Jeśli wybierasz modele do budowy agenta, umów się na bezpłatną konsultację — pomożemy dobrać właściwy model do Twojego obciążenia.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji i pipeline'y głosowe/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stosie narzędziowym LLM, którego zespół Techsy faktycznie używa w produkcji.
Współzałożyciel, Techsy.io, University of Birmingham · LinkedIn
Najczęściej zadawane pytania
Czym jest Claude Opus 4.8?
Claude Opus 4.8 to flagowy model Anthropic, wydany 28 maja 2026 r., z identyfikatorem claude-opus-4-8 i wariantem kontekstu 1M claude-opus-4-8[1m]. Anthropic pozycjonuje go jako swój najbardziej uczciwy model do tej pory — prowadzi w 6 z 7 opublikowanych benchmarków i jest dostępny na Claude.ai, w Claude Code i w API.
Kiedy wydano Claude Opus 4.8?
Claude Opus 4.8 został wydany 28 maja 2026 r., zaledwie 41 dni po Opus 4.7 — to najszybszy cykl wydawniczy Opusa, jaki Anthropic kiedykolwiek zrealizował. Model wszedł do użytku tego samego dnia na Claude.ai, w Claude Code i w API Anthropic, bez etapowego wdrażania, więc możesz natychmiast przestawić domyślny model.
Czy Claude Opus 4.8 jest lepszy niż Opus 4.7?
W większości zastosowań — tak. Opus 4.8 prowadzi na SWE-Bench Pro 69,2% vs 64,3%, zyskuje +137 Elo na GDPval-AA i wygrywa 6 z 7 benchmarków względem 4.7. Wyjątkiem jest agentowe kodowanie terminalowe, gdzie GPT-5.5 wciąż zdobywa więcej niż oba modele. Ceny się nie zmieniły, więc nie ma kary kosztowej za upgrade.
Czy warto przejść z 4.7 na Opus 4.8?
To zależy od Twojego obciążenia. Przejdź teraz, jeśli zajmujesz się kodowaniem agentowym lub pracą z wiedzą — tam zyski są największe. Czekaj, jeśli Twoja praca jest mocno terminalowa, bo GPT-5.5 wciąż tam prowadzi. Zostań na 4.7, jeśli jesteś wrażliwy na koszty przy zadaniach blisko sufitu, jak obsługa komputera, gdzie delta wynosi tylko +0,6 punktu.
Ile kosztuje Claude Opus 4.8?
Standardowe ceny to 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych — identycznie jak w Opus 4.7, więc nie ma podwyżki. Fast Mode kosztuje 10/50 USD za milion tokenów i działa około 2,5× szybciej na tym samym modelu. Anthropic twierdzi, że Fast Mode jest trzy razy tańszy niż poprzedni poziom Fast Mode.
Czym jest Fast Mode w Claude Opus 4.8?
Fast Mode to poziom o podwyższonej prędkości, który uruchamia Opusa 4.8 około 2,5× szybciej za 10 USD input / 50 USD output na milion tokenów, aktywowany komendą /fast w Claude Code. Co kluczowe, utrzymuje Cię na pełnym modelu claude-opus-4-8, zamiast degradować do mniejszego. Anthropic twierdzi, że jest trzy razy tańszy niż poprzedni poziom Fast Mode.
Czym są Dynamic Workflows w Claude Code?
Dynamic Workflows to funkcja w wersji research preview na planach Enterprise, Team i Max, która koordynuje setki równoległych subagentów w jednej sesji. W połączeniu z Claude Code i Opusem 4.8 potrafi przeprowadzać migracje na skalę całej bazy kodu, obejmujące setki tysięcy linii, od uruchomienia po merge. Spodziewaj się niedociągnięć, bo to wciąż wersja preview.
Czy Opus 4.8 obsługuje okno kontekstu 1M tokenów?
Tak, poprzez wariant claude-opus-4-8[1m]. Adresujesz go tym identyfikatorem modelu, gdy potrzebujesz większego okna kontekstu. Uwaga: publiczna strona z przeglądem modeli może jeszcze nie nadążać i może nie zawierać wpisu 4.8, ale wariant jest adresowalny w runtime już dziś.
Czy Claude Opus 4.8 faktycznie bije GPT-5.5 we wszystkim?
Nie. GPT-5.5 wciąż wygrywa agentowe kodowanie terminalowe na Terminal-Bench 2.1, zdobywając 78,2% wobec 74,6% Opusa 4.8. Opus 4.8 prowadzi w pozostałych sześciu opublikowanych benchmarkach, w tym SWE-Bench Pro i GDPval-AA, ale jeśli Twój workflow jest mocno terminalowy, GPT-5.5 pozostaje silniejszym wyborem do tego konkretnego zadania.
Jak przejść na Opus 4.8 w Claude Code?
Ustaw model na claude-opus-4-8 (użyj /model claude-opus-4-8 w Claude Code) i wybierz poziom wysiłku, jeśli Twój klient go oferuje. Dla okna kontekstu 1M użyj claude-opus-4-8[1m]. To niemal trywialna zamiana, niewymagająca żadnych innych zmian konfiguracyjnych dla większości zespołów.