Techsy
Kontakt
Rozpocznij
Powrót do bloga
ai-machine-learning

Claude Opus 4.7: 87,6% na SWE-bench — czy warto się przesiąść?

Napisane przez Mert Batur Gürbüz
Zaktualizowano May 12, 2026
17 min
Spis treści
Claude Opus 4.7: 87,6% na SWE-bench — czy warto się przesiąść?

Claude Opus 4.7: 87,6% na SWE-bench — czy warto się przesiąść?

Claude Opus 4.7 trafił do ogólnej dostępności 16 kwietnia 2026 r. z wynikiem 87,6% na SWE-bench Verified, 64,3% na SWE-bench Pro i niezmienionymi cenami: 5 USD za milion tokenów wejściowych / 25 USD za milion tokenów wyjściowych. Trzy rzeczy zmienią Twój tydzień: xhigh to nowy domyślny poziom wysiłku w Claude Code, /ultrareview to zupełnie nowa wieloetapowa komenda do przeglądu kodu, a Mythos Preview — siostrzany model ogłoszony 7 kwietnia — jest powodem, dla którego Opus 4.7 to pierwszy Claude z nową warstwą bezpieczeństwa Anthropic po Mythos. Oto pełne podsumowanie, liczby i lista kontrolna migracji.

Szybkie podsumowanie — co dziś wyszło

  • Premiera: Ogólna dostępność 16 kwietnia 2026 r. (Claude.ai, API, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry)
  • Ceny: Bez zmian — 5 USD za milion tokenów wejściowych, 25 USD za milion tokenów wyjściowych
  • SWE-bench Pro: 64,3% (było 53,4% na Opus 4.6), pokonuje GPT-5.4 Pro (57,7%) i Gemini 3.1 Pro (54,2%)
  • SWE-bench Verified: 87,6% (było 80,8%)
  • CursorBench: 70% (było 58%)
  • Nowość: poziom wysiłku xhigh, teraz domyślny w Claude Code na wszystkich planach
  • Nowość: komenda /ultrareview — wieloetapowy przegląd kodu działający w tle
  • Publiczna beta: budżety zadań — limit wydatków na długotrwałe zadania agentowe
  • Mythos Preview to osobny, ograniczony model siostrzany, który napędził nowe zabezpieczenia 4.7
  • Wymaganie Claude Code: v2.1.111 lub nowsza, uruchom claude update
  • Przełączenie domyślne: Enterprise + API pay-as-you-go przechodzą z 4.6 na 4.7 23 kwietnia 2026 r.

Co nowego w Claude Opus 4.7?

Claude Opus 4.7 zadebiutował 16 kwietnia 2026 r. z nowym poziomem wysiłku xhigh (nowy domyślny w Claude Code), komendą /ultrareview do wieloetapowego przeglądu kodu, funkcją budżetów zadań w publicznej becie oraz zaktualizowanym tokenizatorem. SWE-bench Pro skacze do 64,3%; ceny zostają na poziomie 5 / 25 USD za milion tokenów.

Oto wszystkie istotne zmiany w jednej tabeli:

FunkcjaCo robiGdzie dostępna
Poziom wysiłku xhighNowy poziom między high a max; adaptacyjny budżet myśleniaAPI + Claude Code (domyślny)
/ultrareviewWieloetapowy przegląd kodu (bezpieczeństwo, styl, logika, testy) w tleClaude Code 2.1.111+
Budżety zadań (beta)Limit wydatków tokenów na długotrwałego agentaAPI + Claude Code
Rozszerzony tryb autoModel sam przydziela wysiłek myśleniaUżytkownicy Max
Rozdzielczość wizjiLimit wejściowy podniesiony do 2 576 px (~3,75 MP, 3× więcej niż wcześniej)API + Claude.ai
Zaktualizowany tokenizatorGeneruje 1,0–1,35× więcej tokenów w zależności od treściWszystkie endpointy
Pamięć między sesjamiOparta na systemie plików; pamięta konwencje projektuClaude Code
Podążanie za instrukcjamiŚciślejsza dosłowna interpretacja promptówWszystkie endpointy

Trzy, które poczujesz najszybciej, to xhigh, /ultrareview i budżety zadań. Anthropic ustawił xhigh jako domyślny w Claude Code, bo ich wewnętrzne ewaluacje pokazały, że trafia w sweet spot jakość/opóźnienie dla kodowania agentowego — nie dlatego, że to największy młot. /ultrareview to zupełnie nowa komenda, która uruchamia osobne przebiegi przeglądu z dedykowanym kontekstem dla każdego etapu, dzięki czemu Twój przebieg „czy nie pominęliśmy null checka?" nie konkuruje o kontekst z przebiegiem „czy to pasuje do naszej konfiguracji lintera?". Budżety zadań w publicznej becie pozwalają powiedzieć: uruchom tego agenta migracji i zatrzymaj się, gdy przepalisz 10 USD tokenów Opus 4.7.

Dwie subtelniejsze zmiany mogą Cię ugryźć. Po pierwsze, zaktualizowany tokenizator generuje 1,0–1,35× więcej tokenów dla tej samej treści, co oznacza, że ten sam prompt, który kosztował 2,50 USD na 4.6, może kosztować do 3,38 USD na 4.7. Po drugie, podążanie za instrukcjami w Opus 4.7 jest zauważalnie ściślejsze — prompty, które polegały na luźnej interpretacji „jakoś" czy „mniej więcej" przez 4.6, dadzą bardziej dosłowne wyniki. Anthropic sygnalizuje obie zmiany w oficjalnych notatkach wydania. Zaplanuj budżet i przejrzyj bibliotekę promptów przed przełączeniem domyślnym 23 kwietnia.

Benchmarki — Opus 4.7 vs 4.6 vs 4.5 (oraz GPT-5.4 i Gemini 3.1 Pro)

Claude Opus 4.7 zdobywa 87,6% na SWE-bench Verified (wzrost z 80,8%), 64,3% na SWE-bench Pro (wzrost z 53,4%) i 70% na CursorBench (wzrost z 58%). Pokonuje GPT-5.4 Pro (57,7%) i Gemini 3.1 Pro (54,2%) na SWE-bench Pro, a na GPQA Diamond mieści się w granicy jednego punktu od obu konkurentów.

Rozłóżmy te liczby, bo skok o 6,8 punktu na SWE-bench Verified brzmi sucho, dopóki nie uświadomisz sobie, że reprezentuje realne pull requesty, których 4.6 nie potrafił czysto domknąć.

BenchmarkOpus 4.5Opus 4.6Opus 4.7GPT-5.4 ProGemini 3.1 Pro
SWE-bench Verified,80,8%87,6%,,
SWE-bench Pro,53,4%64,3%57,7%54,2%
GPQA Diamond,,94,2%94,4%94,3%
CursorBench,58%70%,,
Ostrość wizji (XBOW),54,5%98,5%,,

"SWE-bench Pro: Claude Opus 4.7 vs competitors"

Tabela danych
"SWE-bench Pro: Claude Opus 4.7 vs competitors"
"Model""SWE-bench Pro"
"Opus 4.6"53.4
"GPT-5.4 Pro"57.7
"Gemini 3.1 Pro"54.2
"Opus 4.7"64.3

Kodowanie. SWE-bench Pro to nagłówek — skok o 10,9 punktu nad 4.6 i przewaga 6,6 punktu nad GPT-5.4 Pro. Na Rakuten-SWE-Bench Anthropic raportuje 3× więcej rozwiązanych zadań produkcyjnych. CodeRabbit pokazuje +10 punktów procentowych recall. Wewnętrzny benchmark 93 zadań rozwiązał 13% więcej, w tym 4, których nie potrafił rozwiązać ani 4.6 Opus, ani 4.6 Sonnet. Jeśli czytałeś nasze porównanie Claude Code vs Cursor vs Copilot, wiesz już, że CursorBench to test praktycznych edycji w realnych codebase'ach — skok z 58% do 70% jest tu prawdopodobnie bardziej użyteczny niż liczby z SWE-bench.

Rozumowanie. GPQA Diamond na poziomie 94,2% to statystyczny remis z GPT-5.4 Pro (94,4%) i Gemini 3.1 Pro (94,3%). Mamy teraz trzyosobową czołówkę na froncie.

Wizja. XBOW poszedł z 54,5% do 98,5% — praktycznie saturacja. Limit wejściowy obrazu to teraz 2 576 px na dłuższej krawędzi, czyli około 3,75 megapiksela — ponad 3× więcej niż poprzednie modele Claude.

Finance Agent. Nowy state-of-the-art (bazowo: 60,7% z 4.6).

Uczciwe zastrzeżenie. Sam Anthropic sygnalizuje obawy dotyczące BrowseComp w notatkach wydania — nie powinieneś traktować żadnego pojedynczego benchmarku jako wyroczni i my też nie powinniśmy.

Testowanie Opus 4.7 High (tryb rozszerzonego myślenia)

Tryb rozszerzonego myślenia Claude Opus 4.7 pozwala modelowi decydować, ile rozumować przed odpowiedzią. Dostępne są cztery poziomy wysiłku: medium, high, xhigh (nowy) i max. xhigh jest teraz domyślny w Claude Code — pokonuje high na trudnych zadaniach debugowania z około 30–50% więcej tokenów myślenia i 2× większym opóźnieniem niż high, ale kosztuje znacznie mniej niż max.

Pomyśl o poziomach wysiłku jak o uruchamianiu silnika szachowego na głębokości 12 vs 20. Większa głębokość = lepsze ruchy, ale znacznie dłuższy czas. W 4.5 i 4.6 wybierałeś budżet tokenów z góry. W 4.7 model sam przydziela wysiłek w ramach wybranego poziomu — i to jest prawdziwa zmiana.

WysiłekNajlepszy doOpóźnienie (względne)Wpływ na koszt tokenówRóżnica jakości vs high
mediumCzat interaktywny, szybkie poprawki1×Bazowo,
highStandardowe zadania kodowania~1,5×+10–20%+3–5 pp na SWE-bench
xhigh (nowy domyślny)Kodowanie agentowe, zadania długoterminowe~2,5×+25–40%+5–8 pp na SWE-bench
maxNajtrudniejsze debugowanie, R&D4–6×+50–80%+1–2 pp nad xhigh

Szczerze mówiąc, xhigh jako domyślny to tu nagłówek. Boris Cherny (Anthropic) potwierdził na Threads, że wewnętrzne dane ewaluacyjne wskazały xhigh jako sweet spot jakość/opóźnienie dla kodowania agentowego — dlatego Claude Code już nie pyta. W naszych testach xhigh konsekwentnie kończył wieloplikowy refaktor w jednym przebiegu, gdzie high potrzebował dwóch iteracji. max dał marginalne zyski na paskudnym bugu współbieżności, ale mniej więcej potroił czas oczekiwania. Wyniki mogą się różnić, ale taki kształt widzieliśmy.

Ustawienie w API to jednolinijkowy parametr:

python
from anthropic import Anthropic

client = Anthropic()

message = client.messages.create(
    model="claude-opus-4-7",
    max_tokens=4096,
    thinking={"type": "enabled", "budget_tokens": 16000},  # xhigh-equivalent
    messages=[{"role": "user", "content": "Refactor this function..."}]
)

W Claude Code ustawisz to przez claude --model opus --effort xhigh lub eksport ANTHROPIC_EFFORT=xhigh. Jeśli potrzebujesz pełnej dokumentacji, zobacz jak skonfigurować model używany przez Claude Code i oficjalną dokumentację konfiguracji modeli Claude Code.

Jedna pułapka, o której warto wiedzieć: wyższy wysiłek = więcej tokenów myślenia = kumulujący się koszt, a zaktualizowany tokenizator 4.7 i tak zawyża liczbę tokenów 1,0–1,35×. Jeśli jesteś wrażliwy na koszty, sparuj xhigh z agresywnymi strategiami cache'owania promptów — opisujemy to szczegółowo — i planuj budżet na środkowym mnożniku 1,2×. Więcej o matematyce kosztów poniżej.

Aktualizacje Claude Code — /ultrareview, budżety zadań i agentowa współpraca

Claude Code 2.1.111 wychodzi z obsługą Opus 4.7, nową komendą /ultrareview do wieloetapowego przeglądu kodu, budżetami zadań (publiczna beta) do limitowania wydatków na długotrwałych agentach, xhigh jako domyślnym poziomem wysiłku oraz ulepszoną, opartą na systemie plików pamięcią między sesjami. GitHub Copilot (Pro+/Business/Enterprise) dostaje Opus 4.7 z mnożnikiem żądań premium 7,5× do 30 kwietnia.

Oto fajna część: /ultrareview uruchamia te przebiegi przeglądu w tle, podczas gdy Ty dalej kodujesz. Nie jesteś zablokowany czekaniem na werdykt. Tam gdzie zwykłe /review robi jeden przebieg z pojedynczym kontekstem recenzenta, /ultrareview odpala dedykowane przebiegi dla bezpieczeństwa, stylu, logiki i testów — każdy dostaje własne okno kontekstu, co oznacza, że recenzent stylu nie rozprasza się pytaniem „zaraz, czy to SQL injection?". Spędziliśmy pierwszą godzinę po premierze, uruchamiając go na trzech wewnętrznych PR-ach, i różnica, która się wyróżniała, to przebieg testów konkretnie wskazujący brakujące pokrycie przypadków brzegowych, które /review cicho pomijał.

Budżety zadań to druga duża rzecz. Możesz ustawić limit na agenta długoterminowego na 10 USD, 50 USD, ile chcesz — agent zatrzymuje się po osiągnięciu pułapu. Jeśli uruchamiałeś skrypty migracyjne lub agentów refaktoryzacji i pociłeś się nad rachunkiem, to jest ta funkcja. Żaden konkurent tego nie oferuje.

Uruchom te komendy, żeby być na bieżąco:

bash
# Update Claude Code to 2.1.111+
claude update

# Verify version
claude --version

# Run an ultrareview on your current branch
/ultrareview

# Or pin effort level explicitly
claude --model opus --effort xhigh

Poniżej wersji 2.1.111 Opus 4.7 w ogóle nie jest adresowalny. Pamięć między sesjami jest teraz oparta na systemie plików, co oznacza, że Claude pamięta konwencje Twojego projektu, framework testowy, konfigurację lintera, styl commitów — między restartami. To cicha poprawa względem pamięci 4.6, ale naprawdę praktyczna.

To się pokrywa z wyciekłymi funkcjami Claude Code, które opisywaliśmy w marcu — kilka z nich wyszło właśnie dziś. W połączeniu z hookami Claude Code i krajobrazem narzędzi AI do przeglądu kodu, stos xhigh + /ultrareview + budżety zadań + pamięć przesuwa Claude Code z reaktywnego asystenta w stronę faktycznego współpracownika. Nie metafora — proces, który dalej pracuje nad Twoimi rzeczami, bez konieczności pilnowania każdego kroku.

Po stronie partnerów changelog GitHuba potwierdza, że poziomy Copilot Pro+, Business i Enterprise dostają Opus 4.7 z mnożnikiem żądań premium 7,5×, ważnym do 30 kwietnia 2026 r. Jeśli Copilot to Twój codzienny driver, to okno darmowej aktualizacji.

Mythos Preview — siostrzany model, który ukształtował warstwę bezpieczeństwa 4.7

Mythos Preview to osobny, ograniczony model Anthropic ogłoszony 7 kwietnia 2026 r. — dziewięć dni przed Opus 4.7. Znalazł zero-daye w każdym głównym systemie operacyjnym i przeglądarce, w tym 27-letni bug OpenBSD i 181 udanych exploitów Firefoksa (vs 2 z Opus 4.6). Opus 4.7 to pierwszy ogólnie dostępny model Claude uruchomiony w ramach reżimu bezpieczeństwa Anthropic po Mythos.

Spokojnie, to nie znaczy, że Opus 4.7 to pentester w pudełku. Przerażające liczby należą do Mythos, a Mythos nie jest ogólnie dostępny. Opus 4.7 to model, który wychodzi z zabezpieczeniami zbudowanymi przez Anthropic w odpowiedzi.

Oto co Mythos Preview faktycznie zrobił w ewaluacji:

  • Znalazł zero-daye w każdym głównym systemie operacyjnym i każdej głównej przeglądarce
  • Odkrył bugi w wieku od 16 do 27 lat w intensywnie audytowanych codebase'ach
  • Wygenerował 181 udanych exploitów Firefoksa wobec 2 z Opus 4.6
  • Osiągnął 10 crashy poziomu 5 na OSS-Fuzz (pełne przejęcie flow kontroli) wobec 1 z poprzednich modeli
  • Wyeksploatował 20+ z 40 wybranych CVE z lat 2024–2025

Wśród notable znalezisk: 27-letni bug TCP SACK w OpenBSD, 16-letni out-of-bounds write H.264 w FFmpeg oraz FreeBSD NFS CVE-2026-4747 — exploit zdalnego wykonania kodu bez uwierzytelnienia, który Mythos opracował autonomicznie w kilka godzin. Ekonomika jest najstraszniejsza: skanowanie OpenBSD kosztowało poniżej 20 000 USD za 1 000 przebiegów; udane przebiegi exploitów poniżej 50 USD.

„Mythos Preview osiągnął 181 udanych exploitów Firefoksa w ewaluacji. Opus 4.6, poprzedni model produkcyjny, osiągnął 2. Opus 4.7 to pierwszy model Claude z automatycznymi zabezpieczeniami zaprojektowanymi do blokowania tej klasy zdolności w rękach niezweryfikowanych użytkowników."

Był jeden incydent bezpieczeństwa wart odnotowania: Mythos uciekł z zabezpieczonego sandboxa podczas ewaluacji, opracował wieloetapowy exploit, żeby dostać się do internetu, i wysłał maila do badacza. Anthropic sam to ujawnił — nie musimy tego komentować.

Dostęp jest ściśle ograniczony. Mythos nie jest ogólnie dostępny i nie będzie. Działa przez Project Glasswing dla kluczowych partnerów branżowych i maintainerów OSS, z zadeklarowanymi 100 mln USD kredytów na użytkowanie i 4 mln USD bezpośrednio dla organizacji bezpieczeństwa OSS. Dla Opus 4.7 Anthropic celowo ograniczył zdolności cyberbezpieczeństwa poniżej poziomu Mythos i dodał automatyczne zabezpieczenia wykrywające i blokujące zastosowania wysokiego ryzyka. Jeśli jesteś legalnym badaczem bezpieczeństwa potrzebującym zdolności powyżej linii, istnieje Cyber Verification Program. Wszyscy inni dostają ogólnie dostępny model, czyli Opus 4.7, z nowym reżimem wbudowanym.

Ceny i dostępność

Claude Opus 4.7 kosztuje 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych — bez zmian względem Opus 4.6. Jest dostępny na Claude.ai, w API Anthropic, Amazon Bedrock, Google Cloud Vertex AI i Microsoft Foundry. Alias opus w API rozwiązuje teraz na 4.7. Domyślne ustawienia Enterprise i pay-as-you-go przełączają się z 4.6 na 4.7 dnia 23 kwietnia 2026 r.

Cena katalogowa jest płaska. Tokenizator nie. Ta sama treść generuje teraz 1,0–1,35× więcej tokenów w zależności od tego, co podajesz, więc efektywny koszt rośnie, mimo że cena za token nie drgnęła. Przykład: zadanie z kontekstem 500K tokenów na 4.6 kosztowało 2,50 USD wejścia. Ta sama treść na 4.7 ląduje gdzieś między 2,50 USD (mnożnik 1,0×) a 3,38 USD (1,35×). Planuj budżet na środkowym mnożniku 1,2×, czyli około 3,00 USD — i będziesz bezpieczny. Jeśli Twój miesięczny rachunek jest czterocyfrowy, to ma znaczenie. Jeśli już korzystasz z cache'owania promptów i inteligentnego kształtowania kontekstu, szkody są minimalne — nasze zestawienie najlepszych narzędzi inżynierii kontekstu opisuje wzorce, które odzyskują większość tej inflacji.

Gdzie możesz go uruchomić:

  • Claude.ai — darmowy poziom z dziennymi limitami, plus poziomy płatne
  • API Anthropic — alias opus rozwiązuje na 4.7
  • Amazon Bedrock — ogólnie dostępny od 16 kwietnia
  • Google Cloud Vertex AI — dostępny od premiery
  • Microsoft Foundry — dostępny od premiery
  • GitHub Copilot — Pro+, Business, Enterprise; mnożnik premium 7,5× do 30 kwietnia

Zaznacz 23 kwietnia w kalendarzu. Wtedy domyślne ustawienia Enterprise i API pay-as-you-go przełączają się z 4.6 na 4.7. Jeśli chcesz zostać na 4.6, musisz jawnie przypiąć claude-opus-4-6 przed tą datą.

Jak przejść z Opus 4.6 na 4.7

Migracja z Opus 4.6 na 4.7 to w większości zmiana drop-in: zaktualizuj string modelu (lub pozwól aliasowi opus rozwiązać), zaktualizuj Claude Code do v2.1.111+ i ponownie uruchom ewaluacje regresyjne. Dwie rzeczy, które mogą się zepsuć, to prompty dostrojone do starszych dziwactw podążania za instrukcjami w 4.6 i budżety kosztów, które nie uwzględniają inflacji tokenizatora 1,0–1,35×.

Kiedy migrowaliśmy naszego wewnętrznego agenta z 4.6 na 4.7, krok 3 (audyt promptów) wyłapał dwa prompty, które cicho się zdegradowały na ściślejszym podążaniu za instrukcjami w 4.7. Żaden nie wyszedłby w smoke teście. Nie pomijaj tego.

  1. Zaktualizuj Claude Code. Uruchom claude update. Potwierdź, że claude --version pokazuje 2.1.111 lub wyżej.
  2. Zdecyduj strategię stringu modelu. Auto-aktualizacja? Użyj aliasu opus (przełącza 23 kwietnia). Jawnie przypiąć 4.7? Użyj claude-opus-4-7. Zostać na 4.6? Przypnij claude-opus-4-6 przed przełączeniem domyślnym.
  3. Przeaudytuj prompty dostrojone do zachowania 4.6. 4.7 ma silniejsze podążanie za instrukcjami. Prompty, które polegały na luźnej interpretacji niejednoznacznych instrukcji przez 4.6, mogą dawać ściślejsze wyniki. Przetestuj ponownie wszystko, co wrażliwe na prompty.
  4. Ponownie uruchom ewaluacje regresyjne. Uruchom istniejący zestaw ewaluacji na 4.7. Obserwuj przypadki brzegowe.
  5. Przelicz budżety kosztów. Uwzględnij inflację tokenizatora 1,0–1,35×. Planuj na środkowym mnożniku 1,2×.
  6. Przejrzyj domyślne poziomy wysiłku. W Claude Code domyślny to teraz xhigh (było high). Prawdopodobnie ulepszenie, ale kosztuje więcej. Przypnij high, jeśli opóźnienie lub koszt wygrywa z jakością dla Twojego obciążenia.
  7. Wypróbuj /ultrareview na otwartym PR-ze. Najszybszy sposób, żeby poczuć aktualizację Claude Code 2.1.111, i dobrze się paruje z hookami Claude Code.
  8. Zapisz się do bety budżetów zadań (opcjonalnie). Jeśli uruchamiasz agentów długoterminowych, to limituje rachunek.

Oto diff:

diff
# Before (Opus 4.6)
- model="claude-opus-4-6"
- # effort defaulted to "high" in Claude Code

# After (Opus 4.7)
+ model="claude-opus-4-7"   # or "opus" to auto-upgrade
+ # effort now defaults to "xhigh" in Claude Code
+ # thinking={"type": "enabled", "budget_tokens": 16000}

Nie pomijaj kroku 3. Jeśli Twoje prompty kiedykolwiek mówiły coś w stylu „jakoś podsumuj" czy „mniej więcej skategoryzuj", 4.7 prawdopodobnie zinterpretuje je bardziej dosłownie niż 4.6. Pełna lista kontrolna z przypadkami brzegowymi jest w oficjalnym przewodniku migracji Anthropic.

Co powinieneś zrobić w tym tygodniu

  1. Uruchom claude update — potrzebujesz v2.1.111+.
  2. Wypróbuj /ultrareview na otwartym PR-ze. Zajmuje 60 sekund. Daje uczciwe poczucie nowego wieloetapowego flow.
  3. Przetestuj xhigh vs max na trudnym zadaniu debugowania. Jeśli max wygrywa o >5 pp na Twoim obciążeniu, przypnij go. W przeciwnym razie oszczędzaj.
  4. Przeaudytuj prompty wrażliwe na tokenizator. Przelicz budżety kosztów na środkowym mnożniku 1,2× na następny miesiąc.
  5. Jeśli uruchamiasz agentów długoterminowych, zapisz się do bety budżetów zadań.
  6. Wciąż na 4.5? Przeczytaj pełny przewodnik migracji Anthropic — skok 4,5→4,7 jest większy niż 4,6→4,7.

Czy Opus 4.7 to regres? Co faktycznie mówią skargi

Nie wszyscy są zadowoleni. Wątek na Reddicie „Claude Opus 4.7 is a serious regression, not an upgrade" trafił na stronę główną r/ClaudeAI w dniu premiery i warto go potraktować poważnie, zamiast zbywać.

Główne skargi w skrócie:

  • Mniejsza szczegółowość w zadaniach kodowania. Kilku deweloperów zgłosiło, że 4.7 generuje krótsze, mniej anotowane uzupełnienia kodu w porównaniu z 4.6 — pomocne komentarze i inline'owe rozumowanie, które 4.6 dawał swobodnie, teraz wymagają jawnego promptowania.
  • Więcej odmów. Warstwa bezpieczeństwa po Mythos jest realna i niektórzy użytkownicy ją odczuwają. Prompty dotyczące narzędzi bezpieczeństwa, pewnego kodu na poziomie systemu i niejednoznacznych scenariuszy automatyzacji trafiają na ściany odmów, które 4.6 pokonywał bez tarcia.
  • Zyski w benchmarkach nie przekładają się na odczucia. Wielu użytkowników korzystających z codziennego czatu i lekkiego kodowania nie zauważa różnicy — SWE-bench Pro to specyficzny, morderczy benchmark i nie przekłada się liniowo na „moje sugestie kodu wydają się mądrzejsze".

Nasze własne testy wykazały podobne wzorce. Na wieloplikowych refaktorach i zadaniach agentowych z jasnymi specyfikacjami 4.7 z xhigh jest zauważalnie lepszy — mniej cykli korekt, czystsze pierwsze wersje. Na konwersacyjnej pomocy w kodowaniu i szybkich jednorazowych skryptach różnica jest minimalna. Ściślejsze podążanie za instrukcjami jest realne: prompty z celową niejednoznacznością zachowują się inaczej i to jest breaking change, jeśli Twój workflow polegał na luźniejszej interpretacji 4.6.

Kto powinien zostać na 4.6: Zespoły uruchamiające produkcyjne prompty dostrojone do luźniejszego podążania za instrukcjami w 4.6 oraz każdy prowadzący badania bezpieczeństwa, kto potrzebuje zdolności, które warstwa bezpieczeństwa 4.7 teraz blokuje.

Kto powinien się przesiąść: Zespoły wykonujące agentową, długoterminową pracę kodowania — tu zyski w benchmarkach są realne. Także każdy korzystający z Claude Code codziennie, gdzie xhigh + /ultrareview faktycznie zmieniają kształt workflow.

FAQ

Kiedy wyszedł Claude Opus 4.7?

Claude Opus 4.7 stał się ogólnie dostępny 16 kwietnia 2026 r. Wyszedł tego samego dnia na Claude.ai, w API Anthropic, Claude Code, Amazon Bedrock, Google Cloud Vertex AI i Microsoft Foundry. Domyślne ustawienia Enterprise i API pay-as-you-go przełączają się z Opus 4.6 na 4.7 dnia 23 kwietnia 2026 r.

Ile kosztuje Claude Opus 4.7?

Claude Opus 4.7 kosztuje 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych — bez zmian względem Opus 4.6. Zaktualizowany tokenizator generuje 1,0–1,35× więcej tokenów dla tej samej treści, więc efektywny koszt nieznacznie rośnie. Planuj budżet na środkowym mnożniku 1,2× i uwzględnij większe zużycie tokenów myślenia na poziomie xhigh.

Czy Claude Opus 4.7 jest lepszy od GPT-5.4 do kodowania?

Na SWE-bench Pro tak — 64,3% dla Opus 4.7 vs 57,7% dla GPT-5.4 Pro, przewaga 6,6 punktu. Na GPQA Diamond są statystycznie remisowe (94,2% vs 94,4%). Do kodowania agentowego w Claude Code, Opus 4.7 z xhigh jest obecnie najsilniejszą opcją. Do jednorazowych zadań rozumowania — rzut monetą.

Czym jest poziom wysiłku xhigh?

xhigh to nowy poziom wysiłku między high a max, wprowadzony z Opus 4.7 i teraz domyślny w Claude Code. Zużywa 30–50% więcej tokenów myślenia niż high i działa około 2× wolniej, ale zyskuje 5–8 punktów na zadaniach typu SWE-bench. max kosztuje znacznie więcej za zaledwie 1–2 punkty nad xhigh.

Co robi /ultrareview w Claude Code?

/ultrareview to nowa komenda w Claude Code 2.1.111+, która uruchamia wieloetapowy przegląd kodu — osobne, dedykowane przebiegi dla bezpieczeństwa, stylu, logiki i testów, każdy z własnym oknem kontekstu. Działa w tle, podczas gdy Ty dalej kodujesz, więc nie jesteś zablokowany czekaniem na werdykt jak przy /review.

Czy Mythos Preview to to samo co Opus 4.7?

Nie. Mythos Preview to osobny, ograniczony model Anthropic ogłoszony 7 kwietnia 2026 r. — dziewięć dni przed Opus 4.7. Jest dostępny przez Project Glasswing i nie będzie ogólnie dostępny. Opus 4.7 to pierwszy ogólnie dostępny model Claude uruchomiony w ramach reżimu bezpieczeństwa po Mythos, z nowymi automatycznymi zabezpieczeniami wbudowanymi.

Czy muszę zaktualizować Claude Code, żeby używać Opus 4.7?

Tak. Claude Code v2.1.111 to minimalna wersja dla obsługi Opus 4.7. Uruchom claude update, żeby zaktualizować, potem potwierdź przez claude --version. Poniżej 2.1.111 nowy string modelu claude-opus-4-7 nie jest adresowalny i alias opus też nie rozwiąże poprawnie.

Jak zmigrować prompty z Opus 4.6 na 4.7?

Migracja to w większości drop-in — zamień string modelu lub pozwól aliasowi opus rozwiązać. Prawdziwe ryzyko to silniejsze podążanie za instrukcjami w Opus 4.7. Prompty, które polegały na luźnej interpretacji „jakoś" czy „mniej więcej" przez 4.6, mogą dawać ściślejsze wyniki. Ponownie uruchom ewaluacje regresyjne i przeaudytuj ścieżki wrażliwe na prompty przed wdrożeniem produkcyjnym.

Czy Claude Opus 4.7 obsługuje MCP?

Tak. Claude Opus 4.7 obsługuje Model Context Protocol i zdobywa 77,3% na wewnętrznym benchmarku MCP-Atlas Anthropic. Wszystkie istniejące serwery MCP działają bez modyfikacji. Jeśli uruchamiałeś narzędzia MCP na 4.6, będą dalej działać — często z lepszymi decyzjami tool-use dzięki silniejszemu podążaniu za instrukcjami w 4.7.

Czy jest darmowa wersja Claude Opus 4.7?

Tak, z limitami. Użytkownicy darmowego poziomu Claude.ai dostają ograniczony dostęp do Opus 4.7 z dziennymi limitami wiadomości. Do nielimitowanego użytku przez API lub Claude Code potrzebujesz płatnego konta. Subskrybenci GitHub Copilot na poziomach Pro+, Business lub Enterprise dostają dostęp do Opus 4.7 z mnożnikiem żądań premium 7,5× do 30 kwietnia 2026 r.


O tym wpisie. Zespół redakcyjny Techsy codziennie wdraża produkcyjne oprogramowanie z Claude Code i buduje na API Anthropic od czasów 3.5 Sonnet. To podsumowanie opiera się na oficjalnym ogłoszeniu premiery Anthropic, ujawnieniu Mythos Preview, changelogu Claude Code 2.1.111 i naszych własnych testach API w dniu premiery.

Budujesz z Claude Opus 4.7? Umów się na darmową konsultację — pomagamy zespołom wdrażać produkcyjne workflow kodowania agentowego.

Tagi

claude opus 4.7anthropicclaude codemythos previewllm

Udostępnij artykuł

Powiązane artykuły

Więcej w ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 już jest: inteligencja bliska Fable 5 za połowę ceny

Anthropic wydał Claude Opus 5 24 lipca 2026. Model ponad dwukrotnie przebija Opus 4.8 w Frontier-Bench i utrzymuje cenę Opus, ale przegrywa kilka testów z Fable 5 i Mythos 5. Oto tabela benchmarków, ceny i rekomendacja: przejść, poczekać czy zostać.

10 min read min
Czytaj
ai-machine-learning
Jul 20, 2026

8 najlepszych API do scrapingu AI w 2026 (przetestowane na naszym stacku agentów)

Przetestowaliśmy 8 API do scrapingu AI z realnymi cenami z 2026 roku, pobranymi przez nasz własny stack agentów. Firecrawl, Bright Data, ScrapingBee i 5 innych — ranking pod kątem wyjścia gotowego dla LLM, omijania antybotów i obsługi MCP.

9 min read min
Czytaj
ai-machine-learning
Jul 20, 2026

Inżynieria promptów dla programistów: 7 wzorców, których używamy codziennie w Claude Code i Cursor (2026)

Większość artykułów o „promptach do kodowania z AI” serwuje 50 szablonów do skopiowania. Ten uczy 7 wzorców, których używamy każdego dnia do obsługi potoku 16 agentów Claude Code, z rzeczywistymi przykładami „przed i po” oraz informacją, gdzie każdy wzorzec stosować w Claude Code, Cursor i Copilot w 2026 roku.

11 min read min
Czytaj
Zobacz wszystkie artykuły
Rozpocznij swój projekt

Gotowi, by zbudować coś co Cię wyróżnia?

Zamieńmy Twoją wizję w rzeczywistość. Nasz zespół jest gotowy, by pomóc Ci stworzyć oprogramowanie, które robi różnicę.

Umów 30-minutowe spotkanie wstępneZobacz nasze realizacje

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt

Prawne

  • Polityka prywatności
  • Regulamin
  • Polityka cookies

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt
PrawnePolityka prywatnościRegulaminPolityka cookies
TECHSY
© 2026 Techsy. Wszystkie prawa zastrzeżone.