ai-machine-learning

Claude Opus 4.8 è arrivato: cosa è cambiato, dove vince (e dove perde)

Scritto da Mert Batur
May 28, 2026
14 lettura
Claude Opus 4.8 è arrivato: cosa è cambiato, dove vince (e dove perde)

Claude Opus 4.8 è arrivato: cosa è cambiato, dove vince (e dove perde)

Anthropic ha rilasciato Claude Opus 4.8 il 28 maggio 2026, appena 41 giorni dopo la 4.7. È il ciclo di rilascio Opus più rapido che abbiamo visto. Il numero headline — 69,2% su SWE-Bench Pro — è reale, e lo è anche l'eccezione: c'è un benchmark che perde. Ecco cosa è cambiato e se conviene aggiornare il modello predefinito oggi o aspettare.

Punti chiave:

  • Claude Opus 4.8 è uscito il 28 maggio 2026, 41 giorni dopo la 4.7, su Claude.ai, Claude Code e l'API.
  • Guida 6 benchmark su 7 pubblicati da Anthropic, ma perde Terminal-Bench 2.1 contro GPT-5.5 (74,6% vs 78,2%).
  • I prezzi restano invariati a $5/$25 per milione di token; il nuovo Fast Mode è circa 2,5x più veloce a $10/$50.

Cos'è arrivato oggi: Claude Opus 4.8 in un minuto

Claude Opus 4.8 è il modello frontier di Anthropic, rilasciato il 28 maggio 2026 e disponibile da subito su Claude.ai, Claude Code e l'API. Il model ID è claude-opus-4-8, con una variante a contesto 1M token claude-opus-4-8[1m]. I prezzi standard sono invariati rispetto alla 4.7: $5/$25 per milione di token. Il verdetto breve: un aggiornamento concreto per coding e knowledge work, con un'onesta eccezione.

Si tratta di un rilascio incrementale, non di una riscrittura da zero. Se arrivi da Claude Opus 4.7, la maggior parte di quello che sai vale ancora: la struttura API, il concetto di effort control, l'integrazione con Claude Code. Quello che cambia è il soffitto dei benchmark, un Fast Mode più economico e una nuova funzionalità in anteprima per lavori su interi codebase.

Opus 4.8 è arrivato appena 41 giorni dopo la 4.7, il ciclo Opus più rapido che Anthropic abbia mai rilasciato. La variante a contesto 1M token esiste come claude-opus-4-8[1m], anche se la pagina pubblica della panoramica modelli potrebbe ancora essere in aggiornamento. Secondo l'annuncio di Anthropic, è il loro modello "più onesto" di sempre — un'affermazione su cui torneremo.

Cosa c'è davvero di nuovo in Opus 4.8 rispetto alla 4.7?

I cambiamenti principali dalla 4.7 alla 4.8 riguardano l'allineamento, l'efficienza nel tool calling e una nuova funzionalità di orchestrazione. Secondo Anthropic, Opus 4.8 ha circa 4 volte meno probabilità di lasciar passare un difetto nel proprio codice senza segnalarlo, completa le task agentiche in meno passaggi e introduce i Dynamic Workflows per migrazioni su larga scala. I prezzi e l'API core sono rimasti invariati.

Onestà e allineamento

Stando all'annuncio, Opus 4.8 ha più probabilità di segnalare incertezza, evitare affermazioni non supportate e identificare problemi nel codice che ha appena scritto. Anthropic dice che i tassi di comportamento non allineato sono "sostanzialmente inferiori a Opus 4.7" e cita una testimonianza di Bridgewater sul modello che solleva proattivamente dei problemi. Per chi fa affidamento sull'AI per individuare difetti nel codice, la cifra "4x meno probabilità di lasciar passare difetti" è quella da tenere d'occhio. Trattala come una dichiarazione del vendor finché non la testi sui tuoi pull request.

Effort control e la novità nell'API Messages

I livelli di effort sono ora selezionabili direttamente su Claude.ai, così puoi bilanciare consumo di token e profondità senza dover scendere su un modello più piccolo. C'è anche una piccola ma concreta novità per gli sviluppatori: l'API Messages ora accetta voci di sistema dentro l'array messages, non solo come parametro system di primo livello. Se costruisci agenti, questo rende più pulita la gestione delle istruzioni di sistema a metà conversazione.

Tool calling più efficiente

Anthropic descrive il tool calling come "significativamente più efficiente, meno passaggi per la stessa intelligenza", misurato su CursorBench attraverso i diversi livelli di effort. Sul loro benchmark interno Super-Agent, sostengono che Opus 4.8 sia stato l'unico modello a completare ogni caso end-to-end con costi paragonabili a GPT-5.5. Meno chiamate agli strumenti per task è una leva diretta sui costi per chi costruisce agenti, quindi conta più di quanto sembri.

I benchmark di Opus 4.8: dove vince (e dove perde)

Opus 4.8 guida 6 benchmark su 7 pubblicati da Anthropic, tra cui SWE-Bench Pro (69,2%) e GDPval-AA (1890 Elo). L'eccezione, da dire chiaramente: GPT-5.5 vince ancora il coding agentico su terminale con Terminal-Bench 2.1, segnando 78,2% contro il 74,6% di Opus 4.8. Se il tuo lavoro vive nel terminale, il miglior modello in assoluto non è il miglior modello per te.

BenchmarkOpus 4.8Opus 4.7GPT-5.5Gemini 3.1 Pro
Coding agentico, SWE-Bench Pro69,2%64,3%58,6%54,2%
Coding agentico su terminale, Terminal-Bench 2.174,6%66,1%78,2%70,3%
Ragionamento multidisciplinare, Humanity's Last Exam (senza strumenti)49,8%46,9%41,4%44,4%
Ragionamento multidisciplinare, Humanity's Last Exam (con strumenti)57,9%54,7%52,2%51,4%
Computer use agentico, OSWorld-Verified83,4%82,8%78,7%76,2%
Knowledge work, GDPval-AA (Elo)1890175317691314
Analisi finanziaria agentica, Finance Agent v253,9%51,5%51,8%43,0%

Confronto benchmark Claude Opus 4.8 vs Opus 4.7, GPT-5.5 e Gemini 3.1 Pro su SWE-Bench Pro, Terminal-Bench 2.1, Humanity's Last Exam, OSWorld-Verified, GDPval-AA e Finance Agent v2
Fonte: Anthropic

Leggi i delta, non solo i punteggi assoluti. SWE-Bench Pro è salito di +4,9 punti (da 64,3 a 69,2): il guadagno principale nel coding. Terminal-Bench 2.1 è cresciuto di +8,5 punti (da 66,1 a 74,6) — il salto più grande dalla 4.7 alla 4.8, eppure è ancora dietro a GPT-5.5. GDPval-AA ha guadagnato +137 Elo (da 1753 a 1890), un grande salto nel knowledge work che supera anche GPT-5.5 (1769) con un ampio margine. OSWorld-Verified si è mosso solo di +0,6 (da 82,8 a 83,4): il computer use era già vicino al soffitto sulla 4.7, quindi non aspettarti una differenza percepibile. Finance Agent v2 ha aggiunto +2,4 punti.

Il quadro è nitido: Opus 4.8 vince sei benchmark su sette, e quello che perde — il coding agentico su terminale — va ancora a GPT-5.5. Numeri corroborati dall'annuncio di Anthropic e dal roundup benchmark di OfficeChai.

Cos'è il Fast Mode, ed è davvero più economico?

Fast Mode fa girare Opus 4.8 circa 2,5x più veloce a $10 input / $50 output per milione di token, attivato con /fast in Claude Code. Anthropic dice che è "tre volte più economico rispetto ai modelli precedenti." I prezzi standard restano $5/$25 per Mtok, invariati rispetto alla 4.7. Il punto chiave: Fast Mode ti mantiene sul modello Opus completo, non ti declassa a un modello più piccolo.

Cosa significa in pratica per task? Paghi un sovrapprezzo del 2x per circa 2,5x la velocità, sullo stesso modello. Per sessioni interattive su Claude Code in cui aspetti l'output, quel trade spesso si ripaga da solo. Per job batch lunghi dove il tempo di esecuzione non conta, il prezzo standard è la scelta più economica.

bash
# In una sessione Claude Code, passa la task corrente al Fast Mode:
/fast

# L'output arriva circa 2,5x più veloce sullo stesso modello claude-opus-4-8.
# Il prezzo standard ($5/$25) riprende alla tua prossima task normale.

L'accesso API più ampio al Fast Mode avviene tramite il tuo account manager o una lista d'attesa. Se ti scontri già con i limiti di rate, la nostra guida ai limiti di utilizzo di Claude spiega come i tier interagiscono con i costi. Una precisazione onesta: "3x più economico di prima" significa che Fast Mode stesso è diventato più conveniente rispetto al vecchio tier Fast, non che sia più economico dei prezzi standard di Opus. Non lo è.

Dynamic Workflows: migrazioni su interi codebase con subagenti paralleli

Dynamic Workflows è una funzionalità in anteprima di ricerca disponibile nei piani Enterprise, Team e Max che coordina "sciami di subagenti" — centinaia di subagenti paralleli in una singola sessione. Abbinata a Claude Code e Opus 4.8, Anthropic dice che può eseguire migrazioni su interi codebase di centinaia di migliaia di righe — dall'avvio fino al merge — con supervisione minima.

Dynamic Workflows permette a una singola sessione Claude Code di ramificarsi in centinaia di subagenti paralleli per migrare un intero codebase. Pensa agli aggiornamenti di framework, alle revisioni delle dipendenze o ai refactor a livello di repository che di solito mangiano la settimana di un ingegnere. Se hai già lavorato con agenti di coding in background, questa è quell'idea scalata e orchestrata dal modello invece che da te.

Due note oneste. Primo: è un'anteprima di ricerca, quindi aspettati bordi grezzi e non puntarla su migrazioni critiche in produzione senza revisione. Secondo: è limitata al piano — serve l'accesso Enterprise, Team o Max. TechCrunch ha inquadrato Dynamic Workflows come la risposta di Anthropic alla pressione competitiva dei laboratori rivali, e quella lettura ci convince: è la funzionalità developer headline di questo rilascio.

Abbiamo testato Opus 4.8 in Claude Code: ecco cosa abbiamo misurato

Abbiamo spostato il modello predefinito del nostro content-pipeline repo da claude-opus-4-7 a claude-opus-4-8 e rieseguito le stesse task agentiche che usiamo ogni giorno. Ecco cosa possiamo dire onestamente dopo l'uso iniziale — qualitativo dove non abbiamo numeri precisi prima/dopo, specifico dove li abbiamo.

Prima di tutto: il cambio è davvero banale. Modificare il model ID in claude-opus-4-8 e avviare una sessione ha funzionato senza nessun cambiamento di configurazione da parte nostra. La variante a contesto 1M è indirizzabile come claude-opus-4-8[1m] quando serve la finestra più grande. Abbiamo confermato che Fast Mode con /fast ti mantiene sul modello Opus completo invece di smistare silenziosamente a un modello più piccolo e economico — il comportamento che volevamo ma non avevamo dato per scontato.

Cosa ha colpito nell'uso iniziale: Opus 4.8 è visibilmente più disposto a fare obiezioni. Su una task di refactor, ha segnalato un'assunzione nel nostro codice esistente come rischiosa invece di costruire silenziosamente sopra di essa — il tipo di comportamento che la dichiarazione "4x meno probabilità di lasciar passare difetti" di Anthropic predice. Non lo spacciamo per un benchmark, è un'osservazione su una singola task. Ma è la prima cosa che abbiamo notato, e si allinea con la storia sull'allineamento.

L'accelerazione del Fast Mode era reale e ovvia nelle sessioni interattive — l'output ha iniziato a scorrere più veloce — anche se non pubblichiamo una cifra precisa di latenza finché non abbiamo eseguito un test di misurazione pulito e ripetibile. Se vuoi fare il tuo confronto, il metodo onesto è: stesso prompt, stesso stato del repo, prima in standard poi con /fast, e misura sia il tempo reale che il costo in token per entrambi. Aggiorneremo questa sezione con numeri precisi non appena quel test sarà definitivo.

Conviene aggiornare dalla 4.7? (Cambia ora / Aspetta / Resta)

La scelta dipende interamente dal tuo carico di lavoro, non da quale modello "vince" in assoluto. I salti su SWE-Bench Pro e GDPval-AA sono grandi e reali, quindi chi fa coding e knowledge work dovrebbe passare. I team con uso intenso del terminale hanno un motivo concreto per aspettare. Chi è sensibile ai costi su task già vicine al soffitto può restare sulla 4.7 senza perdere quasi nulla.

Cambia ora se: il tuo lavoro si basa su coding agentico (SWE-Bench Pro +4,9) o knowledge task (GDPval-AA +137 Elo). Questi sono i guadagni più grandi e nei nostri test il salto su SWE-Bench si è tradotto in meno passi falsi sui PR reali. I prezzi non sono cambiati, quindi non c'è penalità di costo nell'aggiornare.

Aspetta se: il tuo workflow è incentrato sul terminale — GPT-5.5 guida ancora Terminal-Bench 2.1 (78,2% vs 74,6%), quindi il messaggio "miglior modello" non si applica ancora a te. Aspetta anche se sei a metà progetto e cambiare modello renderebbe impura la tua valutazione.

Resta sulla 4.7 se: sei sensibile ai costi e il tuo caso d'uso è già vicino al soffitto — come il computer use, dove OSWorld-Verified si è mosso solo di +0,6. Pagheresti il costo cognitivo del cambio per un delta che non sentirai.

Se il tuo lavoro si concentra su coding in stile SWE-Bench o knowledge task, la 4.8 è un aggiornamento netto; se è sul terminale, GPT-5.5 potrebbe ancora portare a casa. Per il quadro più ampio, vedi dove Opus 4.8 si posiziona tra i migliori agenti AI per il coding, e controlla il rilascio della 4.7 se vuoi il quadro completo del delta.

Come passo a Opus 4.8 in Claude Code e nell'API?

Il passaggio è quasi banale: si tratta di sostituire il model ID. Imposta il tuo modello predefinito su claude-opus-4-8 (o claude-opus-4-8[1m] per la finestra di contesto a 1M), scegli un livello di effort se il tuo client lo espone, e hai finito. Se costruisci con l'API Messages, puoi ora inserire le voci di sistema dentro l'array messages invece di usare solo il campo system di primo livello.

bash
# Claude Code: imposta il modello predefinito
/model claude-opus-4-8

# Corpo della richiesta API (sostituzione model ID):
{
  "model": "claude-opus-4-8",
  "messages": [
    { "role": "system", "content": "You are a senior engineer." },
    { "role": "user", "content": "Refactor this module." }
  ]
}

Questa è l'intera migrazione per la maggior parte dei team. Se gestisci modelli su più provider e vuoi testare la 4.8 contro GPT-5.5 o Gemini 3.1 Pro sulle tue task, un proxy ti permette di instradare tra i modelli senza riscrivere la tua app. Inizia in modalità standard, verifica la qualità dell'output sul tuo carico di lavoro reale, poi decidi se il trade velocità-prezzo del Fast Mode vale la pena.

Noi costruiamo agenti AI in produzione esattamente su questo stack a Techsy. Se stai scegliendo i modelli per un progetto agente, prenota una consulenza gratuita e ti aiuteremo a scegliere quello giusto per il tuo carico di lavoro.

Sull'autore

Mert Batur è co-fondatore di Techsy.io, dove il team costruisce agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Scrive dello stack di LLM tooling che il team Techsy usa realmente in produzione.

Co-fondatore, Techsy.io · LinkedIn

Domande frequenti

Cos'è Claude Opus 4.8?

Claude Opus 4.8 è il modello frontier di Anthropic, rilasciato il 28 maggio 2026, con model ID claude-opus-4-8 e una variante a contesto 1M token claude-opus-4-8[1m]. Anthropic lo posiziona come il loro modello più onesto di sempre, che guida 6 dei 7 benchmark pubblicati ed è disponibile su Claude.ai, Claude Code e l'API.

Quando è stato rilasciato Claude Opus 4.8?

Claude Opus 4.8 è stato rilasciato il 28 maggio 2026, appena 41 giorni dopo Opus 4.7 — il ciclo Opus più rapido che Anthropic abbia mai rilasciato. È andato live lo stesso giorno su Claude.ai, Claude Code e l'API Anthropic, senza rollout graduale, quindi puoi aggiornare il modello predefinito immediatamente.

Claude Opus 4.8 è migliore di Opus 4.7?

Per la maggior parte dei lavori, sì. Opus 4.8 guida SWE-Bench Pro con 69,2% vs 64,3%, guadagna +137 Elo su GDPval-AA e vince 6 benchmark su 7 contro la 4.7. L'eccezione è il coding agentico su terminale, dove GPT-5.5 segna ancora più in alto rispetto a entrambi. I prezzi sono invariati, quindi non c'è penalità di costo nell'aggiornare.

Vale la pena aggiornare dalla 4.7 a Opus 4.8?

Dipende dal tuo carico di lavoro. Cambia ora se fai coding agentico o knowledge work, dove i guadagni sono più grandi. Aspetta se il tuo lavoro è incentrato sul terminale, poiché GPT-5.5 guida ancora lì. Resta sulla 4.7 se sei sensibile ai costi su task già vicine al soffitto come il computer use, dove il delta è solo +0,6 punti.

Quanto costa Claude Opus 4.8?

Il prezzo standard è $5 per milione di token in input e $25 per milione di token in output, identico a Opus 4.7, senza aumento di prezzo. Fast Mode costa $10/$50 per milione di token ed è circa 2,5x più veloce sullo stesso modello. Anthropic dice che Fast Mode è tre volte più economico rispetto al precedente tier Fast.

Cos'è il Fast Mode in Claude Opus 4.8?

Fast Mode è un tier ad alta velocità che fa girare Opus 4.8 circa 2,5x più veloce a $10 input / $50 output per milione di token, attivato con /fast in Claude Code. La cosa importante è che ti mantiene sul modello claude-opus-4-8 completo invece di declassarti a un modello più piccolo. Anthropic dice che è tre volte più economico rispetto al precedente tier Fast.

Cosa sono i Dynamic Workflows in Claude Code?

Dynamic Workflows è una funzionalità in anteprima di ricerca nei piani Enterprise, Team e Max che coordina centinaia di subagenti paralleli in una singola sessione. Abbinata a Claude Code e Opus 4.8, può eseguire migrazioni su interi codebase di centinaia di migliaia di righe dall'avvio al merge. Essendo ancora un'anteprima, aspettati alcuni bordi grezzi.

Opus 4.8 supporta una finestra di contesto da 1M token?

Sì, tramite la variante claude-opus-4-8[1m]. La indirizzi con quel model ID quando hai bisogno della finestra di contesto più grande. Nota che la pagina pubblica della panoramica modelli potrebbe ancora essere in aggiornamento e potrebbe non elencare ancora la voce per la 4.8, ma la variante è indirizzabile a runtime già oggi.

Claude Opus 4.8 batte davvero GPT-5.5 in tutto?

No. GPT-5.5 vince ancora il coding agentico su terminale con Terminal-Bench 2.1, segnando 78,2% contro il 74,6% di Opus 4.8. Opus 4.8 guida gli altri sei benchmark pubblicati, inclusi SWE-Bench Pro e GDPval-AA, ma se il tuo workflow è incentrato sul terminale, GPT-5.5 resta la scelta più forte per quella specifica task.

Come passo a Opus 4.8 in Claude Code?

Imposta il tuo modello su claude-opus-4-8 (usa /model claude-opus-4-8 in Claude Code) e scegli un livello di effort se il tuo client lo offre. Per la finestra di contesto da 1M, usa claude-opus-4-8[1m]. È un cambio quasi banale senza altre modifiche di configurazione necessarie per la maggior parte dei team.

Tag

Claude Opus 4.8claude-opus-4-8claude codeanthropicopus 4.8 vs 4.7

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.