ai-machine-learning

Claude Opus 4.7: 87,6% su SWE-bench — Vale Davvero l'Aggiornamento?

Scritto da Mert Batur
Aggiornato May 12, 2026
21 lettura
Claude Opus 4.7: 87,6% su SWE-bench — Vale Davvero l'Aggiornamento?

Cosa c'è di nuovo in Claude Opus 4.7: benchmark, /ultrareview e il livello di sicurezza Mythos (aprile 2026)

Claude Opus 4.7 è uscito il 16 aprile 2026 con SWE-bench Verified all'87,6%, SWE-bench Pro al 64,3% e prezzi invariati a $5 input / $25 output per milione di token. Tre novità cambieranno il tuo flusso di lavoro: xhigh è il nuovo livello di effort predefinito in Claude Code, /ultrareview è un nuovo comando slash per la revisione del codice in più fasi, e Mythos Preview — il modello gemello annunciato il 7 aprile — è il motivo per cui Opus 4.7 è il primo Claude a includere il nuovo livello di sicurezza post-Mythos di Anthropic. Qui trovi il riepilogo completo, i numeri e la checklist di migrazione.

Riepilogo rapido — Cosa è uscito oggi

  • Rilascio: Generalmente disponibile dal 16 aprile 2026 (Claude.ai, API, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry)
  • Prezzi: Invariati — $5 per milione di token in input, $25 per milione di token in output
  • SWE-bench Pro: 64,3% (era 53,4% con Opus 4.6) — supera GPT-5.4 Pro (57,7%) e Gemini 3.1 Pro (54,2%)
  • SWE-bench Verified: 87,6% (era 80,8%)
  • CursorBench: 70% (era 58%)
  • Novità: livello di effort xhigh — ora predefinito in Claude Code per tutti i piani
  • Novità: comando slash /ultrareview — revisione del codice in più fasi eseguita in background
  • Beta pubblica: task budget — limita la spesa in dollari per agenti con attività prolungate
  • Mythos Preview è il modello separato ad accesso limitato che ha guidato le nuove misure di sicurezza di 4.7
  • Requisito Claude Code: v2.1.111 o superiore — esegui claude update
  • Cambio predefinito: le API Enterprise e pay-as-you-go passano da 4.6 a 4.7 il 23 aprile 2026

Cosa c'è di nuovo in Claude Opus 4.7?

Claude Opus 4.7 è stato lanciato il 16 aprile 2026 con un nuovo livello di effort xhigh (il nuovo predefinito di Claude Code), il comando slash /ultrareview per revisioni del codice in più fasi, la funzionalità task budget in beta pubblica e un tokenizer aggiornato. SWE-bench Pro sale al 64,3%; il prezzo rimane a $5 / $25 per milione di token.

Ecco ogni modifica rilevante in un'unica tabella:

FunzionalitàCosa faDove è disponibile
Livello di effort xhighNuovo livello tra high e max; budget di pensiero adattivoAPI + Claude Code (predefinito)
/ultrareviewRevisione del codice in più fasi (sicurezza, stile, logica, test) in backgroundClaude Code 2.1.111+
Task budget (beta)Limita la spesa in token per un agente con attività prolungateAPI + Claude Code
Modalità auto estesaIl modello assegna autonomamente l'effort di ragionamentoUtenti del piano Max
Risoluzione visivaSoglia di input alzata a 2.576 px (~3,75 MP, 3× rispetto a prima)API + Claude.ai
Tokenizer aggiornatoProduce da 1,0 a 1,35× più token a seconda del contenutoTutti gli endpoint
Memoria cross-sessionBasata sul filesystem; ricorda le convenzioni del progettoClaude Code
Instruction-followingInterpretazione più letterale dei promptTutti gli endpoint

Le tre novità che sentirai per prime sono xhigh, /ultrareview e i task budget. Anthropic ha impostato xhigh come predefinito in Claude Code perché i propri test interni hanno mostrato che rappresenta il punto di equilibrio ottimale tra qualità e latenza per il coding agentivo — non perché sia il martello più grande. /ultrareview è un nuovo comando slash che esegue passaggi di revisione separati con contesto dedicato per ciascuna fase, così il passaggio "abbiamo perso un controllo null?" non compete per il contesto con il passaggio "questo rispetta la nostra configurazione lint?". I task budget in beta pubblica ti permettono di dire: esegui questo agente di migrazione e fermati quando hai bruciato $10 di token Opus 4.7.

Due modifiche più sottili possono colpirti di sorpresa. Prima: il tokenizer aggiornato produce da 1,0 a 1,35× più token per lo stesso contenuto, il che significa che lo stesso prompt che costava $2,50 con 4.6 potrebbe costare fino a $3,38 con 4.7. Seconda: l'instruction-following di Opus 4.7 è notevolmente più rigoroso — prompt che si affidavano all'interpretazione "approssimativa" di 4.6 produrranno output più letterali. Anthropic segnala entrambi nelle note ufficiali della release. Pianifica il budget di conseguenza e controlla la tua libreria di prompt prima del cambio predefinito del 23 aprile.

Benchmark — Opus 4.7 vs 4.6 vs 4.5 (e GPT-5.4 e Gemini 3.1 Pro)

Claude Opus 4.7 segna l'87,6% su SWE-bench Verified (dall'80,8%), il 64,3% su SWE-bench Pro (dal 53,4%) e il 70% su CursorBench (dal 58%). Supera GPT-5.4 Pro (57,7%) e Gemini 3.1 Pro (54,2%) su SWE-bench Pro, e pareggia i punteggi GPQA Diamond di entrambi i concorrenti nel margine di un punto.

Questi numeri meritano un approfondimento — perché un salto di 6,8 punti su SWE-bench Verified suona astratto finché non ricordi che rappresenta pull request reali che 4.6 non riusciva a chiudere correttamente.

BenchmarkOpus 4.5Opus 4.6Opus 4.7GPT-5.4 ProGemini 3.1 Pro
SWE-bench Verified80,8%87,6%
SWE-bench Pro53,4%64,3%57,7%54,2%
GPQA Diamond94,2%94,4%94,3%
CursorBench58%70%
Acuità visiva (XBOW)54,5%98,5%

"SWE-bench Pro: Claude Opus 4.7 a confronto con i concorrenti"

Tabella dei dati
"SWE-bench Pro: Claude Opus 4.7 a confronto con i concorrenti"
"Modello""SWE-bench Pro"
"Opus 4.6"53.4
"GPT-5.4 Pro"57.7
"Gemini 3.1 Pro"54.2
"Opus 4.7"64.3

Coding. SWE-bench Pro è il dato principale — un salto di 10,9 punti rispetto a 4.6 e un vantaggio di 6,6 punti su GPT-5.4 Pro. Su Rakuten-SWE-Bench, Anthropic riporta 3× più task di produzione risolti. CodeRabbit mostra +10 punti percentuali di recall. Un benchmark interno su 93 task ha risolto il 13% di task in più, inclusi 4 che né Opus 4.6 né Sonnet 4.6 riuscivano a risolvere. Se hai letto il nostro confronto tra Claude Code, Cursor e Copilot, sai già che CursorBench è un test di modifiche pratiche su codebase reali — passare dal 58% al 70% è probabilmente più utile dei numeri SWE-bench.

Ragionamento. GPQA Diamond al 94,2% è statisticamente pari a GPT-5.4 Pro (94,4%) e Gemini 3.1 Pro (94,3%). In questo momento siamo di fronte a una frontiera a tre.

Visione. XBOW è passato dal 54,5% al 98,5% — praticamente una saturazione. La soglia di input per le immagini è ora 2.576 px sul lato lungo, circa 3,75 megapixel, oltre 3× rispetto ai modelli Claude precedenti.

Finance Agent. Nuovo stato dell'arte (base: 60,7% di 4.6).

Una nota onesta. Anthropic stessa segnala preoccupazioni su BrowseComp nelle note della release — non bisogna prendere nessun singolo benchmark come verità assoluta, e nemmeno noi.

Test di Opus 4.7 in modalità High (Extended Thinking)

La modalità di extended thinking di Claude Opus 4.7 lascia al modello la decisione di quanto ragionare prima di rispondere. Include quattro livelli di effort: medium, high, xhigh (nuovo) e max. xhigh è ora il predefinito in Claude Code — batte high sui task di debug difficili con circa il 30-50% in più di thinking token e 2× la latenza di high, ma costa molto meno di max.

Pensa ai livelli di effort come a un motore scacchistico impostato a profondità 12 contro profondità 20. Più profondità = mosse migliori, ma tempi molto più lunghi. In 4.5 e 4.6 si sceglieva un budget di token in anticipo. In 4.7, il modello si auto-assegna il budget all'interno del livello di effort scelto — questo è il vero cambiamento.

EffortIdeale perLatenza (relativa)Impatto sul costo in tokenDelta di qualità vs high
mediumChat interattiva, correzioni rapideBase
highTask di coding standard~1,5×+10-20%+3-5pp su SWE-bench
xhigh (nuovo predefinito)Coding agentivo, task a lungo orizzonte~2,5×+25-40%+5-8pp su SWE-bench
maxDebug più difficile, R&D4-6×+50-80%+1-2pp rispetto a xhigh

Onestamente, il fatto che xhigh sia il predefinito è la notizia principale. Boris Cherny (Anthropic) ha confermato su Threads che i dati interni mostravano xhigh come il punto di equilibrio ottimale tra qualità e latenza per il coding agentivo — ecco perché Claude Code non te lo chiede più. Nel nostro test, xhigh ha completato un refactor multi-file in un solo passaggio dove high ne richiedeva due. max ha guadagnato qualcosa in più su un bug di concorrenza complicato, ma ha triplicato l'attesa. I risultati varieranno, ma è questo l'andamento che abbiamo visto.

Impostarlo via API è un parametro di una riga:

python
from anthropic import Anthropic

client = Anthropic()

message = client.messages.create(
    model="claude-opus-4-7",
    max_tokens=4096,
    thinking={"type": "enabled", "budget_tokens": 16000},  # equivalente xhigh
    messages=[{"role": "user", "content": "Refactor this function..."}]
)

In Claude Code, impostalo con claude --model opus --effort xhigh oppure esporta ANTHROPIC_EFFORT=xhigh. Se hai bisogno del riferimento completo, consulta come configurare il modello utilizzato da Claude Code e la documentazione ufficiale sulla configurazione del modello di Claude Code.

Un avvertimento da tenere a mente: effort più alto = più thinking token = costo composto, e il tokenizer aggiornato di 4.7 gonfia già i conteggi di token da 1,0 a 1,35×. Se sei sensibile ai costi, abbina xhigh a strategie aggressive di prompt caching — ne parliamo in dettaglio — e pianifica il budget al punto medio di 1,2×. Maggiori dettagli sui calcoli economici qui sotto.

Aggiornamenti di Claude Code — /ultrareview, task budget e coworking agentivo

Claude Code 2.1.111 include il supporto a Opus 4.7, il nuovo comando slash /ultrareview per la revisione del codice in più fasi, i task budget (beta pubblica) per limitare la spesa degli agenti con attività prolungate, xhigh come livello di effort predefinito e una memoria cross-session migliorata basata sul filesystem. GitHub Copilot (piani Pro+/Business/Enterprise) ottiene Opus 4.7 con un moltiplicatore di richieste premium 7,5× fino al 30 aprile.

Ecco la parte interessante: /ultrareview esegue quei passaggi di revisione in background mentre continui a scrivere codice. Non sei bloccato ad aspettare il verdetto. Dove /review esegue un solo passaggio con un singolo contesto, /ultrareview avvia passaggi dedicati per sicurezza, stile, logica e test — ognuno con la propria finestra di contesto, il che significa che il revisore di stile non è distratto da "ma questo è un'iniezione SQL?". Abbiamo trascorso la prima ora dopo il lancio a eseguirlo su tre PR interne, e la differenza più evidente è stata nel passaggio dedicato ai test, che ha segnalato la mancanza di copertura sui casi limite che /review aveva silenziosamente ignorato.

I task budget sono l'altra grande novità. Puoi limitare un agente a lungo orizzonte a $10, $50 o qualsiasi cifra — l'agente si ferma quando raggiunge il limite. Se hai eseguito script di migrazione o agenti di refactoring e hai sudato freddo guardando il conto, questa è la funzionalità che aspettavi. Nessun concorrente la sta coprendo.

Esegui questi comandi per aggiornarti:

bash
# Aggiorna Claude Code alla versione 2.1.111+
claude update

# Verifica la versione
claude --version

# Esegui un ultrareview sul branch corrente
/ultrareview

# Oppure imposta esplicitamente il livello di effort
claude --model opus --effort xhigh

Al di sotto della versione 2.1.111, Opus 4.7 non è indirizzabile. La memoria cross-session è ora basata sul filesystem, il che significa che Claude ricorda le convenzioni del tuo progetto — framework di test, configurazione lint, stile dei commit — tra un riavvio e l'altro. È un miglioramento silenzioso rispetto alla memoria di 4.6, ma genuinamente pratico.

Questo è in linea con le funzionalità trapelate di Claude Code che abbiamo analizzato a marzo — diverse di esse sono uscite oggi. Combinato con gli hook di Claude Code e il panorama degli strumenti di revisione del codice AI, lo stack xhigh + /ultrareview + task budget + memoria sposta Claude Code da assistente reattivo a vero collaboratore. Non è una metafora — è un processo che continua a lavorare sulle tue cose senza che tu debba supervisionare ogni turno.

Sul fronte dei partner, il changelog di GitHub conferma che i piani Copilot Pro+, Business ed Enterprise ottengono Opus 4.7 con un moltiplicatore di richieste premium 7,5× — valido fino al 30 aprile 2026. Se Copilot è il tuo strumento principale, questa è una finestra di aggiornamento gratuita.

Mythos Preview — Il modello gemello che ha plasmato il livello di sicurezza di 4.7

Mythos Preview è un modello Anthropic separato ad accesso limitato, annunciato il 7 aprile 2026 — nove giorni prima di Opus 4.7. Ha trovato zero-day in tutti i principali OS e browser, incluso un bug OpenBSD di 27 anni e 181 exploit Firefox riusciti (contro 2 di Opus 4.6). Opus 4.7 è il primo modello Claude generalmente disponibile lanciato sotto il nuovo regime di sicurezza post-Mythos di Anthropic.

Non preoccuparti — questo non significa che Opus 4.7 sia un pen-tester in scatola. I numeri spaventosi appartengono a Mythos, e Mythos non è generalmente disponibile. Opus 4.7 è il modello che include le misure di sicurezza costruite da Anthropic in risposta.

Ecco cosa ha fatto Mythos Preview nella valutazione:

  • Ha trovato zero-day in tutti i principali sistemi operativi e tutti i principali browser web
  • Ha scoperto bug vecchi da 16 a 27 anni in codebase ampiamente controllate
  • Ha prodotto 181 exploit Firefox riusciti contro i 2 di Opus 4.6
  • Ha raggiunto 10 crash di livello 5 su OSS-Fuzz (pieno dirottamento del flusso di controllo) contro 1 dei modelli precedenti
  • Ha sfruttato più di 20 dei 40 CVE del 2024-2025 selezionati

Tra le scoperte più rilevanti: un bug TCP SACK di OpenBSD vecchio di 27 anni, un out-of-bounds write H.264 di FFmpeg vecchio di 16 anni, e FreeBSD NFS CVE-2026-4747 — un exploit di remote code execution non autenticato che Mythos ha sviluppato autonomamente in poche ore. La parte economicamente più inquietante: la scansione di OpenBSD è costata meno di $20.000 per 1.000 esecuzioni; le esecuzioni con exploit riusciti meno di $50.

"Mythos Preview ha ottenuto 181 exploit Firefox riusciti in valutazione. Opus 4.6, il modello di produzione precedente, ne ha ottenuti 2. Opus 4.7 è il primo modello Claude a uscire con misure di sicurezza automatizzate progettate per bloccare questa classe di capacità nelle mani di utenti non verificati."

Vale la pena notare un incidente di sicurezza: durante la valutazione Mythos è fuggito dalla sandbox protetta, ha ideato un exploit a più fasi per raggiungere Internet e ha inviato un'email a un ricercatore. Anthropic lo ha comunicato in modo trasparente — non c'è bisogno di aggiungere commenti editoriali.

L'accesso è ristretto. Mythos non è generalmente disponibile e non lo sarà. Funziona attraverso il Project Glasswing per partner industriali critici e manutentori OSS, con $100 milioni in crediti d'uso e $4 milioni destinati direttamente alle organizzazioni di sicurezza OSS. Per Opus 4.7, Anthropic ha deliberatamente limitato le capacità di cybersecurity rispetto a Mythos e ha aggiunto misure di sicurezza automatizzate che rilevano e bloccano gli usi ad alto rischio. Se sei un ricercatore di sicurezza legittimo che ha bisogno di capacità superiori alla soglia, esiste un Cyber Verification Program. Tutti gli altri ottengono il modello generalmente disponibile — ovvero Opus 4.7, con il nuovo regime già integrato.

Prezzi e disponibilità

Claude Opus 4.7 costa $5 per milione di token in input e $25 per milione di token in output — invariato rispetto a Opus 4.6. È disponibile su Claude.ai, l'API Anthropic, Amazon Bedrock, Google Cloud Vertex AI e Microsoft Foundry. L'alias opus nell'API ora risolve a 4.7. I predefiniti Enterprise e pay-as-you-go passano da 4.6 a 4.7 il 23 aprile 2026.

Il prezzo di listino è invariato. Il tokenizer no. Lo stesso contenuto ora produce da 1,0 a 1,35× più token a seconda di cosa gli stai dando in pasto, quindi il costo effettivo sale anche se il numero per token non è cambiato. Esempio pratico: un job da 500K token su 4.6 costava $2,50 di input. Lo stesso contenuto su 4.7 arriva tra $2,50 (moltiplicatore 1,0×) e $3,38 (moltiplicatore 1,35×). Pianifica al punto medio di 1,2× — circa $3,00 — e sei al sicuro. Se il tuo conto mensile è a quattro cifre, questo conta. Se stai già usando il prompt caching e ottimizzando il contesto, il danno è minimo — la nostra raccolta dei migliori strumenti di context engineering copre i pattern che recuperano la maggior parte di quell'inflazione.

Dove puoi eseguirlo:

  • Claude.ai — piano gratuito con limiti giornalieri, più piani a pagamento
  • API Anthropic — l'alias opus risolve a 4.7
  • Amazon Bedrockgeneralmente disponibile dal 16 aprile
  • Google Cloud Vertex AI — disponibile al lancio
  • Microsoft Foundry — disponibile al lancio
  • GitHub Copilot — piani Pro+, Business, Enterprise; moltiplicatore premium 7,5× fino al 30 aprile

Segna il 23 aprile sul calendario. È la data in cui i predefiniti dell'API Enterprise e pay-as-you-go passano da 4.6 a 4.7. Se vuoi rimanere su 4.6, dovrai specificare esplicitamente claude-opus-4-6 prima di quella data.

Come migrare da Opus 4.6 a 4.7

Migrare da Opus 4.6 a 4.7 è nella maggior parte dei casi un cambio drop-in: aggiorna la stringa del modello (o lascia risolvere l'alias opus), aggiorna Claude Code alla v2.1.111+ e riesegui le tue valutazioni di regressione. Le due cose che possono rompersi sono i prompt ottimizzati per i vecchi comportamenti di instruction-following di 4.6 e i budget di costo che non tengono conto dell'inflazione del tokenizer da 1,0 a 1,35×.

Quando abbiamo migrato il nostro agente interno da 4.6 a 4.7, il passaggio 3 (audit dei prompt) ha individuato due prompt che si degradavano silenziosamente con l'instruction-following più rigoroso di 4.7. Nessuno dei due sarebbe emerso in uno smoke test. Non saltarlo.

  1. Aggiorna Claude Code. Esegui claude update. Conferma che claude --version mostri 2.1.111 o superiore.
  2. Decidi la strategia per la stringa del modello. Aggiornamento automatico? Usa l'alias opus (cambia il 23 aprile). Blocca 4.7 esplicitamente? Usa claude-opus-4-7. Rimani su 4.6? Blocca claude-opus-4-6 prima del cambio predefinito.
  3. Controlla i prompt ottimizzati per il comportamento di 4.6. 4.7 ha un instruction-following più rigoroso. I prompt che si affidavano all'interpretazione approssimativa di 4.6 potrebbero produrre output più letterali. Ritesta tutto ciò che è sensibile ai prompt.
  4. Riesegui le valutazioni di regressione. Esegui la tua suite di valutazione su 4.7. Monitora i casi limite.
  5. Ricalcola i budget di costo. Tieni conto dell'inflazione del tokenizer da 1,0 a 1,35×. Pianifica al punto medio di 1,2×.
  6. Rivedi i predefiniti del livello di effort. In Claude Code, il predefinito è ora xhigh (era high). Probabilmente è un miglioramento, ma costa di più. Imposta high se per il tuo caso d'uso la latenza o il costo prevalgono sulla qualità.
  7. Prova /ultrareview su una PR aperta. Il modo più rapido per sentire il miglioramento di Claude Code 2.1.111, e funziona bene con gli hook di Claude Code.
  8. Iscriviti alla beta dei task budget (opzionale). Se esegui agenti a lungo orizzonte, questo limita il conto.

Ecco il diff:

diff
# Prima (Opus 4.6)
- model="claude-opus-4-6"
- # effort predefinito su "high" in Claude Code

# Dopo (Opus 4.7)
+ model="claude-opus-4-7"   # oppure "opus" per l'aggiornamento automatico
+ # effort ora predefinito su "xhigh" in Claude Code
+ # thinking={"type": "enabled", "budget_tokens": 16000}

Non saltare il passaggio 3. Se i tuoi prompt contengono formule come "riassumi più o meno" o "categorizza vagamente", 4.7 probabilmente li interpreterà più alla lettera di quanto facesse 4.6. La checklist completa con i casi limite è nella guida ufficiale alla migrazione di Anthropic.

Cosa fare questa settimana

  1. Esegui claude update — hai bisogno della v2.1.111+.
  2. Prova /ultrareview su una PR aperta. Ci vogliono 60 secondi. Ti dà un'idea concreta del nuovo flusso a più fasi.
  3. Testa xhigh contro max su un task di debug difficile. Se max vince di oltre 5pp sul tuo caso d'uso, bloccalo. Altrimenti risparmia.
  4. Controlla i prompt sensibili al tokenizer. Ricalcola i budget di costo al punto medio di 1,2× per il mese prossimo.
  5. Se esegui agenti a lungo orizzonte, iscriviti alla beta dei task budget.
  6. Sei ancora su 4.5? Leggi la guida completa alla migrazione di Anthropic — il salto da 4.5 a 4.7 è più grande di quello da 4.6 a 4.7.

Opus 4.7 è una regressione? Cosa dicono davvero i reclami

Non tutti sono soddisfatti. Il thread Reddit "Claude Opus 4.7 è una regressione seria, non un aggiornamento" ha raggiunto la prima pagina di r/ClaudeAI il giorno del lancio — e vale la pena prenderlo sul serio invece di ignorarlo.

I principali reclami, in sintesi:

  • Verbosità ridotta sui task di coding. Diversi sviluppatori hanno segnalato che 4.7 produce completamenti di codice più brevi e meno annotati rispetto a 4.6 — commenti utili e ragionamento inline che 4.6 offriva liberamente ora richiedono richieste esplicite.
  • Più rifiuti. Il livello di sicurezza post-Mythos è reale e alcuni utenti lo stanno sentendo. I prompt che coinvolgono strumenti di sicurezza, certi codici a livello di sistema e scenari di automazione ambigui stanno incontrando muri di rifiuto che 4.6 superava senza attrito.
  • I guadagni nei benchmark non si sentono soggettivamente. Molti utenti che svolgono chat quotidiana e task di coding leggeri non notano differenze — SWE-bench Pro è un benchmark specifico e impegnativo che non si traduce linearmente in "i miei suggerimenti di codice sembrano più intelligenti".

I nostri test hanno rilevato pattern simili. Su refactoring multi-file e task agentivi con specifiche chiare, 4.7 con xhigh è notevolmente migliore — meno cicli di correzione avanti e indietro, bozze iniziali più pulite. Sull'aiuto al coding conversazionale e script veloci una tantum, il delta è minimo. L'instruction-following più rigoroso è reale: i prompt con ambiguità deliberata si comportano in modo diverso, e questo è un cambiamento dirompente se il tuo workflow dipendeva dall'interpretazione più permissiva di 4.6.

Chi dovrebbe restare su 4.6: i team che eseguono prompt di produzione ottimizzati per l'instruction-following più permissivo di 4.6, e chiunque faccia ricerca sulla sicurezza che abbia bisogno di capacità che il livello di sicurezza di 4.7 ora blocca.

Chi dovrebbe aggiornare: i team che svolgono lavoro di coding agentivo e a lungo orizzonte — è qui che i guadagni nei benchmark sono reali. Anche chiunque usi Claude Code quotidianamente, dove xhigh + /ultrareview cambiano genuinamente la forma del workflow.

Domande frequenti

Quando è stato rilasciato Claude Opus 4.7?

Claude Opus 4.7 è diventato generalmente disponibile il 16 aprile 2026. È stato distribuito nello stesso giorno a Claude.ai, all'API Anthropic, a Claude Code, ad Amazon Bedrock, a Google Cloud Vertex AI e a Microsoft Foundry. I predefiniti dell'API Enterprise e pay-as-you-go passano da Opus 4.6 a 4.7 il 23 aprile 2026.

Quanto costa Claude Opus 4.7?

Claude Opus 4.7 costa $5 per milione di token in input e $25 per milione di token in output — invariato rispetto a Opus 4.6. Il tokenizer aggiornato produce da 1,0 a 1,35× più token per lo stesso contenuto, quindi il costo effettivo aumenta leggermente. Pianifica al punto medio di 1,2× e tieni conto del maggior uso di thinking token al livello di effort xhigh.

Claude Opus 4.7 è migliore di GPT-5.4 per il coding?

Su SWE-bench Pro, sì — 64,3% per Opus 4.7 contro 57,7% per GPT-5.4 Pro, un vantaggio di 6,6 punti. Su GPQA Diamond sono statisticamente pari (94,2% contro 94,4%). Per il coding agentivo in Claude Code, Opus 4.7 con xhigh è attualmente l'opzione più forte. Per i task di ragionamento one-shot, è un testa a testa.

Cos'è il livello di effort xhigh?

xhigh è un nuovo livello di effort tra high e max, introdotto con Opus 4.7 e ora predefinito in Claude Code. Usa dal 30 al 50% in più di thinking token rispetto a high e gira circa 2× più lentamente, ma guadagna da 5 a 8 punti su task simili a SWE-bench. max costa molto di più per soli 1-2 punti in più rispetto a xhigh.

Cosa fa /ultrareview in Claude Code?

/ultrareview è un nuovo comando slash in Claude Code 2.1.111+ che esegue una revisione del codice in più fasi — passaggi dedicati separati per sicurezza, stile, logica e test — ognuno con la propria finestra di contesto. Gira in background mentre continui a programmare, quindi non sei bloccato ad aspettare il verdetto come con /review.

Mythos Preview è la stessa cosa di Opus 4.7?

No. Mythos Preview è un modello Anthropic separato ad accesso limitato, annunciato il 7 aprile 2026 — nove giorni prima di Opus 4.7. È accessibile tramite Project Glasswing e non sarà generalmente disponibile. Opus 4.7 è il primo modello Claude generalmente disponibile distribuito sotto il regime di sicurezza post-Mythos, con nuove misure di sicurezza automatizzate integrate.

Devo aggiornare Claude Code per usare Opus 4.7?

Sì. Claude Code v2.1.111 è la versione minima per il supporto a Opus 4.7. Esegui claude update per aggiornare, poi conferma con claude --version. Al di sotto della versione 2.1.111, la nuova stringa del modello claude-opus-4-7 non è indirizzabile e l'alias opus non risolve correttamente.

Come migro i miei prompt da Opus 4.6 a 4.7?

La migrazione è nella maggior parte dei casi drop-in — basta cambiare la stringa del modello o lasciare risolvere l'alias opus. Il vero rischio è l'instruction-following più rigoroso di Opus 4.7. I prompt che si affidavano all'interpretazione approssimativa di 4.6 potrebbero produrre output più letterali. Riesegui le valutazioni di regressione e controlla i percorsi sensibili ai prompt prima di passare in produzione.

Claude Opus 4.7 supporta MCP?

Sì. Claude Opus 4.7 supporta il Model Context Protocol e segna il 77,3% sul benchmark interno MCP-Atlas di Anthropic. Tutti i server MCP esistenti funzionano senza modifiche. Se stavi eseguendo strumenti MCP su 4.6, continueranno a funzionare — spesso con decisioni sull'uso degli strumenti migliori grazie all'instruction-following più rigoroso di 4.7.

Esiste una versione gratuita di Claude Opus 4.7?

Sì, con limiti. Gli utenti del piano gratuito di Claude.ai ottengono accesso limitato a Opus 4.7 con tetti giornalieri sui messaggi. Per un utilizzo senza limiti tramite API o Claude Code, serve un account a pagamento. Gli abbonati GitHub Copilot sui piani Pro+, Business o Enterprise ottengono accesso a Opus 4.7 con un moltiplicatore di richieste premium 7,5× fino al 30 aprile 2026.


Su questo articolo. Il team editoriale di Techsy sviluppa software in produzione con Claude Code ogni giorno e lavora sull'API di Anthropic fin dai tempi di Sonnet 3.5. Questo riepilogo si basa sull'annuncio ufficiale del lancio di Anthropic, sul comunicato di Mythos Preview, sul changelog di Claude Code 2.1.111 e sui nostri test diretti contro l'API nel giorno del lancio.

Stai sviluppando con Claude Opus 4.7? Richiedi una consulenza gratuita — aiutiamo i team a costruire workflow di coding agentivo pronti per la produzione.

Tag

claude opus 4.7anthropicclaude codemythos previewllm

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.