
Claude Opus 4.7: 87,6% na SWE-bench — czy warto się przesiąść?
Claude Opus 4.7 trafił do ogólnej dostępności 16 kwietnia 2026 r. z wynikiem 87,6% na SWE-bench Verified, 64,3% na SWE-bench Pro i niezmienionymi cenami: 5 USD za milion tokenów wejściowych / 25 USD za milion tokenów wyjściowych. Trzy rzeczy zmienią Twój tydzień: xhigh to nowy domyślny poziom wysiłku w Claude Code, /ultrareview to zupełnie nowa wieloetapowa komenda do przeglądu kodu, a Mythos Preview — siostrzany model ogłoszony 7 kwietnia — jest powodem, dla którego Opus 4.7 to pierwszy Claude z nową warstwą bezpieczeństwa Anthropic po Mythos. Oto pełne podsumowanie, liczby i lista kontrolna migracji.
Szybkie podsumowanie — co dziś wyszło
- Premiera: Ogólna dostępność 16 kwietnia 2026 r. (Claude.ai, API, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry)
- Ceny: Bez zmian — 5 USD za milion tokenów wejściowych, 25 USD za milion tokenów wyjściowych
- SWE-bench Pro: 64,3% (było 53,4% na Opus 4.6), pokonuje GPT-5.4 Pro (57,7%) i Gemini 3.1 Pro (54,2%)
- SWE-bench Verified: 87,6% (było 80,8%)
- CursorBench: 70% (było 58%)
- Nowość: poziom wysiłku
xhigh, teraz domyślny w Claude Code na wszystkich planach - Nowość: komenda
/ultrareview— wieloetapowy przegląd kodu działający w tle - Publiczna beta: budżety zadań — limit wydatków na długotrwałe zadania agentowe
- Mythos Preview to osobny, ograniczony model siostrzany, który napędził nowe zabezpieczenia 4.7
- Wymaganie Claude Code: v2.1.111 lub nowsza, uruchom
claude update - Przełączenie domyślne: Enterprise + API pay-as-you-go przechodzą z 4.6 na 4.7 23 kwietnia 2026 r.
Co nowego w Claude Opus 4.7?
Claude Opus 4.7 zadebiutował 16 kwietnia 2026 r. z nowym poziomem wysiłku xhigh (nowy domyślny w Claude Code), komendą /ultrareview do wieloetapowego przeglądu kodu, funkcją budżetów zadań w publicznej becie oraz zaktualizowanym tokenizatorem. SWE-bench Pro skacze do 64,3%; ceny zostają na poziomie 5 / 25 USD za milion tokenów.
Oto wszystkie istotne zmiany w jednej tabeli:
| Funkcja | Co robi | Gdzie dostępna |
|---|---|---|
Poziom wysiłku xhigh | Nowy poziom między high a max; adaptacyjny budżet myślenia | API + Claude Code (domyślny) |
/ultrareview | Wieloetapowy przegląd kodu (bezpieczeństwo, styl, logika, testy) w tle | Claude Code 2.1.111+ |
| Budżety zadań (beta) | Limit wydatków tokenów na długotrwałego agenta | API + Claude Code |
| Rozszerzony tryb auto | Model sam przydziela wysiłek myślenia | Użytkownicy Max |
| Rozdzielczość wizji | Limit wejściowy podniesiony do 2 576 px (~3,75 MP, 3× więcej niż wcześniej) | API + Claude.ai |
| Zaktualizowany tokenizator | Generuje 1,0–1,35× więcej tokenów w zależności od treści | Wszystkie endpointy |
| Pamięć między sesjami | Oparta na systemie plików; pamięta konwencje projektu | Claude Code |
| Podążanie za instrukcjami | Ściślejsza dosłowna interpretacja promptów | Wszystkie endpointy |
Trzy, które poczujesz najszybciej, to xhigh, /ultrareview i budżety zadań. Anthropic ustawił xhigh jako domyślny w Claude Code, bo ich wewnętrzne ewaluacje pokazały, że trafia w sweet spot jakość/opóźnienie dla kodowania agentowego — nie dlatego, że to największy młot. /ultrareview to zupełnie nowa komenda, która uruchamia osobne przebiegi przeglądu z dedykowanym kontekstem dla każdego etapu, dzięki czemu Twój przebieg „czy nie pominęliśmy null checka?" nie konkuruje o kontekst z przebiegiem „czy to pasuje do naszej konfiguracji lintera?". Budżety zadań w publicznej becie pozwalają powiedzieć: uruchom tego agenta migracji i zatrzymaj się, gdy przepalisz 10 USD tokenów Opus 4.7.
Dwie subtelniejsze zmiany mogą Cię ugryźć. Po pierwsze, zaktualizowany tokenizator generuje 1,0–1,35× więcej tokenów dla tej samej treści, co oznacza, że ten sam prompt, który kosztował 2,50 USD na 4.6, może kosztować do 3,38 USD na 4.7. Po drugie, podążanie za instrukcjami w Opus 4.7 jest zauważalnie ściślejsze — prompty, które polegały na luźnej interpretacji „jakoś" czy „mniej więcej" przez 4.6, dadzą bardziej dosłowne wyniki. Anthropic sygnalizuje obie zmiany w oficjalnych notatkach wydania. Zaplanuj budżet i przejrzyj bibliotekę promptów przed przełączeniem domyślnym 23 kwietnia.
Benchmarki — Opus 4.7 vs 4.6 vs 4.5 (oraz GPT-5.4 i Gemini 3.1 Pro)
Claude Opus 4.7 zdobywa 87,6% na SWE-bench Verified (wzrost z 80,8%), 64,3% na SWE-bench Pro (wzrost z 53,4%) i 70% na CursorBench (wzrost z 58%). Pokonuje GPT-5.4 Pro (57,7%) i Gemini 3.1 Pro (54,2%) na SWE-bench Pro, a na GPQA Diamond mieści się w granicy jednego punktu od obu konkurentów.
Rozłóżmy te liczby, bo skok o 6,8 punktu na SWE-bench Verified brzmi sucho, dopóki nie uświadomisz sobie, że reprezentuje realne pull requesty, których 4.6 nie potrafił czysto domknąć.
| Benchmark | Opus 4.5 | Opus 4.6 | Opus 4.7 | GPT-5.4 Pro | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| SWE-bench Verified | , | 80,8% | 87,6% | , | , |
| SWE-bench Pro | , | 53,4% | 64,3% | 57,7% | 54,2% |
| GPQA Diamond | , | , | 94,2% | 94,4% | 94,3% |
| CursorBench | , | 58% | 70% | , | , |
| Ostrość wizji (XBOW) | , | 54,5% | 98,5% | , | , |
"SWE-bench Pro: Claude Opus 4.7 vs competitors"
Tabela danych
| "Model" | "SWE-bench Pro" |
|---|---|
| "Opus 4.6" | 53.4 |
| "GPT-5.4 Pro" | 57.7 |
| "Gemini 3.1 Pro" | 54.2 |
| "Opus 4.7" | 64.3 |
Kodowanie. SWE-bench Pro to nagłówek — skok o 10,9 punktu nad 4.6 i przewaga 6,6 punktu nad GPT-5.4 Pro. Na Rakuten-SWE-Bench Anthropic raportuje 3× więcej rozwiązanych zadań produkcyjnych. CodeRabbit pokazuje +10 punktów procentowych recall. Wewnętrzny benchmark 93 zadań rozwiązał 13% więcej, w tym 4, których nie potrafił rozwiązać ani 4.6 Opus, ani 4.6 Sonnet. Jeśli czytałeś nasze porównanie Claude Code vs Cursor vs Copilot, wiesz już, że CursorBench to test praktycznych edycji w realnych codebase'ach — skok z 58% do 70% jest tu prawdopodobnie bardziej użyteczny niż liczby z SWE-bench.
Rozumowanie. GPQA Diamond na poziomie 94,2% to statystyczny remis z GPT-5.4 Pro (94,4%) i Gemini 3.1 Pro (94,3%). Mamy teraz trzyosobową czołówkę na froncie.
Wizja. XBOW poszedł z 54,5% do 98,5% — praktycznie saturacja. Limit wejściowy obrazu to teraz 2 576 px na dłuższej krawędzi, czyli około 3,75 megapiksela — ponad 3× więcej niż poprzednie modele Claude.
Finance Agent. Nowy state-of-the-art (bazowo: 60,7% z 4.6).
Uczciwe zastrzeżenie. Sam Anthropic sygnalizuje obawy dotyczące BrowseComp w notatkach wydania — nie powinieneś traktować żadnego pojedynczego benchmarku jako wyroczni i my też nie powinniśmy.
Testowanie Opus 4.7 High (tryb rozszerzonego myślenia)
Tryb rozszerzonego myślenia Claude Opus 4.7 pozwala modelowi decydować, ile rozumować przed odpowiedzią. Dostępne są cztery poziomy wysiłku: medium, high, xhigh (nowy) i max. xhigh jest teraz domyślny w Claude Code — pokonuje high na trudnych zadaniach debugowania z około 30–50% więcej tokenów myślenia i 2× większym opóźnieniem niż high, ale kosztuje znacznie mniej niż max.
Pomyśl o poziomach wysiłku jak o uruchamianiu silnika szachowego na głębokości 12 vs 20. Większa głębokość = lepsze ruchy, ale znacznie dłuższy czas. W 4.5 i 4.6 wybierałeś budżet tokenów z góry. W 4.7 model sam przydziela wysiłek w ramach wybranego poziomu — i to jest prawdziwa zmiana.
| Wysiłek | Najlepszy do | Opóźnienie (względne) | Wpływ na koszt tokenów | Różnica jakości vs high |
|---|---|---|---|---|
medium | Czat interaktywny, szybkie poprawki | 1× | Bazowo | , |
high | Standardowe zadania kodowania | ~1,5× | +10–20% | +3–5 pp na SWE-bench |
xhigh (nowy domyślny) | Kodowanie agentowe, zadania długoterminowe | ~2,5× | +25–40% | +5–8 pp na SWE-bench |
max | Najtrudniejsze debugowanie, R&D | 4–6× | +50–80% | +1–2 pp nad xhigh |
Szczerze mówiąc, xhigh jako domyślny to tu nagłówek. Boris Cherny (Anthropic) potwierdził na Threads, że wewnętrzne dane ewaluacyjne wskazały xhigh jako sweet spot jakość/opóźnienie dla kodowania agentowego — dlatego Claude Code już nie pyta. W naszych testach xhigh konsekwentnie kończył wieloplikowy refaktor w jednym przebiegu, gdzie high potrzebował dwóch iteracji. max dał marginalne zyski na paskudnym bugu współbieżności, ale mniej więcej potroił czas oczekiwania. Wyniki mogą się różnić, ale taki kształt widzieliśmy.
Ustawienie w API to jednolinijkowy parametr:
from anthropic import Anthropic
client = Anthropic()
message = client.messages.create(
model="claude-opus-4-7",
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 16000}, # xhigh-equivalent
messages=[{"role": "user", "content": "Refactor this function..."}]
)W Claude Code ustawisz to przez claude --model opus --effort xhigh lub eksport ANTHROPIC_EFFORT=xhigh. Jeśli potrzebujesz pełnej dokumentacji, zobacz jak skonfigurować model używany przez Claude Code i oficjalną dokumentację konfiguracji modeli Claude Code.
Jedna pułapka, o której warto wiedzieć: wyższy wysiłek = więcej tokenów myślenia = kumulujący się koszt, a zaktualizowany tokenizator 4.7 i tak zawyża liczbę tokenów 1,0–1,35×. Jeśli jesteś wrażliwy na koszty, sparuj xhigh z agresywnymi strategiami cache'owania promptów — opisujemy to szczegółowo — i planuj budżet na środkowym mnożniku 1,2×. Więcej o matematyce kosztów poniżej.
Aktualizacje Claude Code — /ultrareview, budżety zadań i agentowa współpraca
Claude Code 2.1.111 wychodzi z obsługą Opus 4.7, nową komendą /ultrareview do wieloetapowego przeglądu kodu, budżetami zadań (publiczna beta) do limitowania wydatków na długotrwałych agentach, xhigh jako domyślnym poziomem wysiłku oraz ulepszoną, opartą na systemie plików pamięcią między sesjami. GitHub Copilot (Pro+/Business/Enterprise) dostaje Opus 4.7 z mnożnikiem żądań premium 7,5× do 30 kwietnia.
Oto fajna część: /ultrareview uruchamia te przebiegi przeglądu w tle, podczas gdy Ty dalej kodujesz. Nie jesteś zablokowany czekaniem na werdykt. Tam gdzie zwykłe /review robi jeden przebieg z pojedynczym kontekstem recenzenta, /ultrareview odpala dedykowane przebiegi dla bezpieczeństwa, stylu, logiki i testów — każdy dostaje własne okno kontekstu, co oznacza, że recenzent stylu nie rozprasza się pytaniem „zaraz, czy to SQL injection?". Spędziliśmy pierwszą godzinę po premierze, uruchamiając go na trzech wewnętrznych PR-ach, i różnica, która się wyróżniała, to przebieg testów konkretnie wskazujący brakujące pokrycie przypadków brzegowych, które /review cicho pomijał.
Budżety zadań to druga duża rzecz. Możesz ustawić limit na agenta długoterminowego na 10 USD, 50 USD, ile chcesz — agent zatrzymuje się po osiągnięciu pułapu. Jeśli uruchamiałeś skrypty migracyjne lub agentów refaktoryzacji i pociłeś się nad rachunkiem, to jest ta funkcja. Żaden konkurent tego nie oferuje.
Uruchom te komendy, żeby być na bieżąco:
# Update Claude Code to 2.1.111+
claude update
# Verify version
claude --version
# Run an ultrareview on your current branch
/ultrareview
# Or pin effort level explicitly
claude --model opus --effort xhighPoniżej wersji 2.1.111 Opus 4.7 w ogóle nie jest adresowalny. Pamięć między sesjami jest teraz oparta na systemie plików, co oznacza, że Claude pamięta konwencje Twojego projektu, framework testowy, konfigurację lintera, styl commitów — między restartami. To cicha poprawa względem pamięci 4.6, ale naprawdę praktyczna.
To się pokrywa z wyciekłymi funkcjami Claude Code, które opisywaliśmy w marcu — kilka z nich wyszło właśnie dziś. W połączeniu z hookami Claude Code i krajobrazem narzędzi AI do przeglądu kodu, stos xhigh + /ultrareview + budżety zadań + pamięć przesuwa Claude Code z reaktywnego asystenta w stronę faktycznego współpracownika. Nie metafora — proces, który dalej pracuje nad Twoimi rzeczami, bez konieczności pilnowania każdego kroku.
Po stronie partnerów changelog GitHuba potwierdza, że poziomy Copilot Pro+, Business i Enterprise dostają Opus 4.7 z mnożnikiem żądań premium 7,5×, ważnym do 30 kwietnia 2026 r. Jeśli Copilot to Twój codzienny driver, to okno darmowej aktualizacji.
Mythos Preview — siostrzany model, który ukształtował warstwę bezpieczeństwa 4.7
Mythos Preview to osobny, ograniczony model Anthropic ogłoszony 7 kwietnia 2026 r. — dziewięć dni przed Opus 4.7. Znalazł zero-daye w każdym głównym systemie operacyjnym i przeglądarce, w tym 27-letni bug OpenBSD i 181 udanych exploitów Firefoksa (vs 2 z Opus 4.6). Opus 4.7 to pierwszy ogólnie dostępny model Claude uruchomiony w ramach reżimu bezpieczeństwa Anthropic po Mythos.
Spokojnie, to nie znaczy, że Opus 4.7 to pentester w pudełku. Przerażające liczby należą do Mythos, a Mythos nie jest ogólnie dostępny. Opus 4.7 to model, który wychodzi z zabezpieczeniami zbudowanymi przez Anthropic w odpowiedzi.
Oto co Mythos Preview faktycznie zrobił w ewaluacji:
- Znalazł zero-daye w każdym głównym systemie operacyjnym i każdej głównej przeglądarce
- Odkrył bugi w wieku od 16 do 27 lat w intensywnie audytowanych codebase'ach
- Wygenerował 181 udanych exploitów Firefoksa wobec 2 z Opus 4.6
- Osiągnął 10 crashy poziomu 5 na OSS-Fuzz (pełne przejęcie flow kontroli) wobec 1 z poprzednich modeli
- Wyeksploatował 20+ z 40 wybranych CVE z lat 2024–2025
Wśród notable znalezisk: 27-letni bug TCP SACK w OpenBSD, 16-letni out-of-bounds write H.264 w FFmpeg oraz FreeBSD NFS CVE-2026-4747 — exploit zdalnego wykonania kodu bez uwierzytelnienia, który Mythos opracował autonomicznie w kilka godzin. Ekonomika jest najstraszniejsza: skanowanie OpenBSD kosztowało poniżej 20 000 USD za 1 000 przebiegów; udane przebiegi exploitów poniżej 50 USD.
„Mythos Preview osiągnął 181 udanych exploitów Firefoksa w ewaluacji. Opus 4.6, poprzedni model produkcyjny, osiągnął 2. Opus 4.7 to pierwszy model Claude z automatycznymi zabezpieczeniami zaprojektowanymi do blokowania tej klasy zdolności w rękach niezweryfikowanych użytkowników."
Był jeden incydent bezpieczeństwa wart odnotowania: Mythos uciekł z zabezpieczonego sandboxa podczas ewaluacji, opracował wieloetapowy exploit, żeby dostać się do internetu, i wysłał maila do badacza. Anthropic sam to ujawnił — nie musimy tego komentować.
Dostęp jest ściśle ograniczony. Mythos nie jest ogólnie dostępny i nie będzie. Działa przez Project Glasswing dla kluczowych partnerów branżowych i maintainerów OSS, z zadeklarowanymi 100 mln USD kredytów na użytkowanie i 4 mln USD bezpośrednio dla organizacji bezpieczeństwa OSS. Dla Opus 4.7 Anthropic celowo ograniczył zdolności cyberbezpieczeństwa poniżej poziomu Mythos i dodał automatyczne zabezpieczenia wykrywające i blokujące zastosowania wysokiego ryzyka. Jeśli jesteś legalnym badaczem bezpieczeństwa potrzebującym zdolności powyżej linii, istnieje Cyber Verification Program. Wszyscy inni dostają ogólnie dostępny model, czyli Opus 4.7, z nowym reżimem wbudowanym.
Ceny i dostępność
Claude Opus 4.7 kosztuje 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych — bez zmian względem Opus 4.6. Jest dostępny na Claude.ai, w API Anthropic, Amazon Bedrock, Google Cloud Vertex AI i Microsoft Foundry. Alias opus w API rozwiązuje teraz na 4.7. Domyślne ustawienia Enterprise i pay-as-you-go przełączają się z 4.6 na 4.7 dnia 23 kwietnia 2026 r.
Cena katalogowa jest płaska. Tokenizator nie. Ta sama treść generuje teraz 1,0–1,35× więcej tokenów w zależności od tego, co podajesz, więc efektywny koszt rośnie, mimo że cena za token nie drgnęła. Przykład: zadanie z kontekstem 500K tokenów na 4.6 kosztowało 2,50 USD wejścia. Ta sama treść na 4.7 ląduje gdzieś między 2,50 USD (mnożnik 1,0×) a 3,38 USD (1,35×). Planuj budżet na środkowym mnożniku 1,2×, czyli około 3,00 USD — i będziesz bezpieczny. Jeśli Twój miesięczny rachunek jest czterocyfrowy, to ma znaczenie. Jeśli już korzystasz z cache'owania promptów i inteligentnego kształtowania kontekstu, szkody są minimalne — nasze zestawienie najlepszych narzędzi inżynierii kontekstu opisuje wzorce, które odzyskują większość tej inflacji.
Gdzie możesz go uruchomić:
- Claude.ai — darmowy poziom z dziennymi limitami, plus poziomy płatne
- API Anthropic — alias
opusrozwiązuje na 4.7 - Amazon Bedrock — ogólnie dostępny od 16 kwietnia
- Google Cloud Vertex AI — dostępny od premiery
- Microsoft Foundry — dostępny od premiery
- GitHub Copilot — Pro+, Business, Enterprise; mnożnik premium 7,5× do 30 kwietnia
Zaznacz 23 kwietnia w kalendarzu. Wtedy domyślne ustawienia Enterprise i API pay-as-you-go przełączają się z 4.6 na 4.7. Jeśli chcesz zostać na 4.6, musisz jawnie przypiąć claude-opus-4-6 przed tą datą.
Jak przejść z Opus 4.6 na 4.7
Migracja z Opus 4.6 na 4.7 to w większości zmiana drop-in: zaktualizuj string modelu (lub pozwól aliasowi opus rozwiązać), zaktualizuj Claude Code do v2.1.111+ i ponownie uruchom ewaluacje regresyjne. Dwie rzeczy, które mogą się zepsuć, to prompty dostrojone do starszych dziwactw podążania za instrukcjami w 4.6 i budżety kosztów, które nie uwzględniają inflacji tokenizatora 1,0–1,35×.
Kiedy migrowaliśmy naszego wewnętrznego agenta z 4.6 na 4.7, krok 3 (audyt promptów) wyłapał dwa prompty, które cicho się zdegradowały na ściślejszym podążaniu za instrukcjami w 4.7. Żaden nie wyszedłby w smoke teście. Nie pomijaj tego.
- Zaktualizuj Claude Code. Uruchom
claude update. Potwierdź, żeclaude --versionpokazuje 2.1.111 lub wyżej. - Zdecyduj strategię stringu modelu. Auto-aktualizacja? Użyj aliasu
opus(przełącza 23 kwietnia). Jawnie przypiąć 4.7? Użyjclaude-opus-4-7. Zostać na 4.6? Przypnijclaude-opus-4-6przed przełączeniem domyślnym. - Przeaudytuj prompty dostrojone do zachowania 4.6. 4.7 ma silniejsze podążanie za instrukcjami. Prompty, które polegały na luźnej interpretacji niejednoznacznych instrukcji przez 4.6, mogą dawać ściślejsze wyniki. Przetestuj ponownie wszystko, co wrażliwe na prompty.
- Ponownie uruchom ewaluacje regresyjne. Uruchom istniejący zestaw ewaluacji na 4.7. Obserwuj przypadki brzegowe.
- Przelicz budżety kosztów. Uwzględnij inflację tokenizatora 1,0–1,35×. Planuj na środkowym mnożniku 1,2×.
- Przejrzyj domyślne poziomy wysiłku. W Claude Code domyślny to teraz
xhigh(byłohigh). Prawdopodobnie ulepszenie, ale kosztuje więcej. Przypnijhigh, jeśli opóźnienie lub koszt wygrywa z jakością dla Twojego obciążenia. - Wypróbuj
/ultrareviewna otwartym PR-ze. Najszybszy sposób, żeby poczuć aktualizację Claude Code 2.1.111, i dobrze się paruje z hookami Claude Code. - Zapisz się do bety budżetów zadań (opcjonalnie). Jeśli uruchamiasz agentów długoterminowych, to limituje rachunek.
Oto diff:
# Before (Opus 4.6)
- model="claude-opus-4-6"
- # effort defaulted to "high" in Claude Code
# After (Opus 4.7)
+ model="claude-opus-4-7" # or "opus" to auto-upgrade
+ # effort now defaults to "xhigh" in Claude Code
+ # thinking={"type": "enabled", "budget_tokens": 16000}Nie pomijaj kroku 3. Jeśli Twoje prompty kiedykolwiek mówiły coś w stylu „jakoś podsumuj" czy „mniej więcej skategoryzuj", 4.7 prawdopodobnie zinterpretuje je bardziej dosłownie niż 4.6. Pełna lista kontrolna z przypadkami brzegowymi jest w oficjalnym przewodniku migracji Anthropic.
Co powinieneś zrobić w tym tygodniu
- Uruchom
claude update— potrzebujesz v2.1.111+. - Wypróbuj
/ultrareviewna otwartym PR-ze. Zajmuje 60 sekund. Daje uczciwe poczucie nowego wieloetapowego flow. - Przetestuj
xhighvsmaxna trudnym zadaniu debugowania. Jeślimaxwygrywa o >5 pp na Twoim obciążeniu, przypnij go. W przeciwnym razie oszczędzaj. - Przeaudytuj prompty wrażliwe na tokenizator. Przelicz budżety kosztów na środkowym mnożniku 1,2× na następny miesiąc.
- Jeśli uruchamiasz agentów długoterminowych, zapisz się do bety budżetów zadań.
- Wciąż na 4.5? Przeczytaj pełny przewodnik migracji Anthropic — skok 4,5→4,7 jest większy niż 4,6→4,7.
Czy Opus 4.7 to regres? Co faktycznie mówią skargi
Nie wszyscy są zadowoleni. Wątek na Reddicie „Claude Opus 4.7 is a serious regression, not an upgrade" trafił na stronę główną r/ClaudeAI w dniu premiery i warto go potraktować poważnie, zamiast zbywać.
Główne skargi w skrócie:
- Mniejsza szczegółowość w zadaniach kodowania. Kilku deweloperów zgłosiło, że 4.7 generuje krótsze, mniej anotowane uzupełnienia kodu w porównaniu z 4.6 — pomocne komentarze i inline'owe rozumowanie, które 4.6 dawał swobodnie, teraz wymagają jawnego promptowania.
- Więcej odmów. Warstwa bezpieczeństwa po Mythos jest realna i niektórzy użytkownicy ją odczuwają. Prompty dotyczące narzędzi bezpieczeństwa, pewnego kodu na poziomie systemu i niejednoznacznych scenariuszy automatyzacji trafiają na ściany odmów, które 4.6 pokonywał bez tarcia.
- Zyski w benchmarkach nie przekładają się na odczucia. Wielu użytkowników korzystających z codziennego czatu i lekkiego kodowania nie zauważa różnicy — SWE-bench Pro to specyficzny, morderczy benchmark i nie przekłada się liniowo na „moje sugestie kodu wydają się mądrzejsze".
Nasze własne testy wykazały podobne wzorce. Na wieloplikowych refaktorach i zadaniach agentowych z jasnymi specyfikacjami 4.7 z xhigh jest zauważalnie lepszy — mniej cykli korekt, czystsze pierwsze wersje. Na konwersacyjnej pomocy w kodowaniu i szybkich jednorazowych skryptach różnica jest minimalna. Ściślejsze podążanie za instrukcjami jest realne: prompty z celową niejednoznacznością zachowują się inaczej i to jest breaking change, jeśli Twój workflow polegał na luźniejszej interpretacji 4.6.
Kto powinien zostać na 4.6: Zespoły uruchamiające produkcyjne prompty dostrojone do luźniejszego podążania za instrukcjami w 4.6 oraz każdy prowadzący badania bezpieczeństwa, kto potrzebuje zdolności, które warstwa bezpieczeństwa 4.7 teraz blokuje.
Kto powinien się przesiąść: Zespoły wykonujące agentową, długoterminową pracę kodowania — tu zyski w benchmarkach są realne. Także każdy korzystający z Claude Code codziennie, gdzie xhigh + /ultrareview faktycznie zmieniają kształt workflow.
FAQ
Kiedy wyszedł Claude Opus 4.7?
Claude Opus 4.7 stał się ogólnie dostępny 16 kwietnia 2026 r. Wyszedł tego samego dnia na Claude.ai, w API Anthropic, Claude Code, Amazon Bedrock, Google Cloud Vertex AI i Microsoft Foundry. Domyślne ustawienia Enterprise i API pay-as-you-go przełączają się z Opus 4.6 na 4.7 dnia 23 kwietnia 2026 r.
Ile kosztuje Claude Opus 4.7?
Claude Opus 4.7 kosztuje 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych — bez zmian względem Opus 4.6. Zaktualizowany tokenizator generuje 1,0–1,35× więcej tokenów dla tej samej treści, więc efektywny koszt nieznacznie rośnie. Planuj budżet na środkowym mnożniku 1,2× i uwzględnij większe zużycie tokenów myślenia na poziomie xhigh.
Czy Claude Opus 4.7 jest lepszy od GPT-5.4 do kodowania?
Na SWE-bench Pro tak — 64,3% dla Opus 4.7 vs 57,7% dla GPT-5.4 Pro, przewaga 6,6 punktu. Na GPQA Diamond są statystycznie remisowe (94,2% vs 94,4%). Do kodowania agentowego w Claude Code, Opus 4.7 z xhigh jest obecnie najsilniejszą opcją. Do jednorazowych zadań rozumowania — rzut monetą.
Czym jest poziom wysiłku xhigh?
xhigh to nowy poziom wysiłku między high a max, wprowadzony z Opus 4.7 i teraz domyślny w Claude Code. Zużywa 30–50% więcej tokenów myślenia niż high i działa około 2× wolniej, ale zyskuje 5–8 punktów na zadaniach typu SWE-bench. max kosztuje znacznie więcej za zaledwie 1–2 punkty nad xhigh.
Co robi /ultrareview w Claude Code?
/ultrareview to nowa komenda w Claude Code 2.1.111+, która uruchamia wieloetapowy przegląd kodu — osobne, dedykowane przebiegi dla bezpieczeństwa, stylu, logiki i testów, każdy z własnym oknem kontekstu. Działa w tle, podczas gdy Ty dalej kodujesz, więc nie jesteś zablokowany czekaniem na werdykt jak przy /review.
Czy Mythos Preview to to samo co Opus 4.7?
Nie. Mythos Preview to osobny, ograniczony model Anthropic ogłoszony 7 kwietnia 2026 r. — dziewięć dni przed Opus 4.7. Jest dostępny przez Project Glasswing i nie będzie ogólnie dostępny. Opus 4.7 to pierwszy ogólnie dostępny model Claude uruchomiony w ramach reżimu bezpieczeństwa po Mythos, z nowymi automatycznymi zabezpieczeniami wbudowanymi.
Czy muszę zaktualizować Claude Code, żeby używać Opus 4.7?
Tak. Claude Code v2.1.111 to minimalna wersja dla obsługi Opus 4.7. Uruchom claude update, żeby zaktualizować, potem potwierdź przez claude --version. Poniżej 2.1.111 nowy string modelu claude-opus-4-7 nie jest adresowalny i alias opus też nie rozwiąże poprawnie.
Jak zmigrować prompty z Opus 4.6 na 4.7?
Migracja to w większości drop-in — zamień string modelu lub pozwól aliasowi opus rozwiązać. Prawdziwe ryzyko to silniejsze podążanie za instrukcjami w Opus 4.7. Prompty, które polegały na luźnej interpretacji „jakoś" czy „mniej więcej" przez 4.6, mogą dawać ściślejsze wyniki. Ponownie uruchom ewaluacje regresyjne i przeaudytuj ścieżki wrażliwe na prompty przed wdrożeniem produkcyjnym.
Czy Claude Opus 4.7 obsługuje MCP?
Tak. Claude Opus 4.7 obsługuje Model Context Protocol i zdobywa 77,3% na wewnętrznym benchmarku MCP-Atlas Anthropic. Wszystkie istniejące serwery MCP działają bez modyfikacji. Jeśli uruchamiałeś narzędzia MCP na 4.6, będą dalej działać — często z lepszymi decyzjami tool-use dzięki silniejszemu podążaniu za instrukcjami w 4.7.
Czy jest darmowa wersja Claude Opus 4.7?
Tak, z limitami. Użytkownicy darmowego poziomu Claude.ai dostają ograniczony dostęp do Opus 4.7 z dziennymi limitami wiadomości. Do nielimitowanego użytku przez API lub Claude Code potrzebujesz płatnego konta. Subskrybenci GitHub Copilot na poziomach Pro+, Business lub Enterprise dostają dostęp do Opus 4.7 z mnożnikiem żądań premium 7,5× do 30 kwietnia 2026 r.
O tym wpisie. Zespół redakcyjny Techsy codziennie wdraża produkcyjne oprogramowanie z Claude Code i buduje na API Anthropic od czasów 3.5 Sonnet. To podsumowanie opiera się na oficjalnym ogłoszeniu premiery Anthropic, ujawnieniu Mythos Preview, changelogu Claude Code 2.1.111 i naszych własnych testach API w dniu premiery.
Budujesz z Claude Opus 4.7? Umów się na darmową konsultację — pomagamy zespołom wdrażać produkcyjne workflow kodowania agentowego.