
Claude Opus 5 è arrivato: intelligenza quasi da Fable 5 a metà prezzo
Anthropic ha rilasciato Claude Opus 5 il 24 luglio 2026, e la promessa è diretta: quasi l'intelligenza frontier di Fable 5, a metà prezzo. La prova regina è Frontier-Bench v0.1, dove Opus 5 segna 43,3% e più che raddoppia il 21,1% di Opus 4.8. Il rovescio della medaglia, perché c'è sempre: non vince tutto. GPT-5.6 Sol lo supera ancora di un soffio su un test di coding agentico, e su salute e biologia la corona va a Mythos 5. Ecco cosa è cambiato davvero, la tabella completa dei benchmark e se ti conviene cambiare il tuo modello predefinito già oggi.
Punti chiave:
- Claude Opus 5 è stato lanciato il 24 luglio 2026 su Claude API, Claude.ai, Claude Code e Claude Cowork, con ID modello
claude-opus-5. - Guida la maggior parte dei benchmark pubblicati da Anthropic (Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench), ma resta indietro su un paio di test di coding, legali e scientifici.
- I prezzi restano invariati rispetto a Opus 4.8 a $5/$25 per milione di token, con una modalità Fast a circa 2x il prezzo per circa 2,5x la velocità.
Cosa è uscito oggi: Claude Opus 5 in un minuto
Claude Opus 5 è il nuovo modello frontier di Anthropic, rilasciato il 24 luglio 2026 e disponibile lo stesso giorno su API, Claude.ai, Claude Code e Claude Cowork. L'ID modello è claude-opus-5. La cornice di Anthropic, secondo l'annuncio, è che "si avvicina all'intelligenza frontier di Claude Fable 5 a metà prezzo". I prezzi standard restano a $5 in input / $25 in output per milione di token, gli stessi di Opus 4.8.
Questo è un vero salto generazionale per il lavoro degli agenti, non una release minore. Se arrivi da Claude Opus 4.8, la forma dell'API e l'integrazione con Claude Code restano invariate, quindi la migrazione è solo uno swap dell'ID modello. Ciò che cambia è il tetto: su Frontier-Bench v0.1, Anthropic dice che Opus 5 più che raddoppia il punteggio di 4.8 a un costo per task inferiore, e segna numeri state-of-the-art su GDPval-AA e ARC-AGI-3.
Il posizionamento conta. Fable 5 è il modello frontier più costoso di Anthropic. Arrivare a un passo da lui ai prezzi di Opus è tutta la storia di questa release, ed è perché la frase "a metà prezzo" è quella che Anthropic mette in apertura.
Cosa c'è di davvero nuovo in Opus 5 rispetto a 4.8?
Il cambiamento più grande da 4.8 a 5 è il giudizio: Opus 5 è nettamente più bravo a verificare il proprio lavoro e a iterare finché un task è davvero completato, non solo plausibilmente finito. Anthropic cita anche software engineering, knowledge work e ricerca scientifica più solidi, oltre a un output visivo migliorato. Prezzi e API di base sono rimasti fermi.
Giudizio migliore e auto-verifica
Il cambiamento comportamentale più chiaro è che Opus 5 si controlla da solo. Anthropic cita Zimu Li, membro del technical staff, che descrive il modello come uno che "verifica i branch, controlla i template" invece di partire in quarta. Per chi si affida a un agente per cogliere i propri errori in produzione, è la caratteristica che sposta l'ago. È anche la cosa più difficile da vendere su un grafico di benchmark, quindi trattala come un'affermazione da testare sui tuoi task.
Intelligenza frontier al costo di Opus
Sualeh Asif, co-fondatore di Cursor, ha riassunto la release come "intelligenza quasi da Fable 5 a velocità e costo di Opus". È la lettura pratica: i team che volevano un ragionamento di classe Fable 5 ma non potevano giustificare il prezzo ora hanno un'opzione intermedia. Su OSWorld 2.0, Anthropic dice che Opus 5 supera Fable 5 a circa un terzo del costo, l'esempio singolo più pulito dell'argomento valore.
Allineamento e postura di sicurezza
Anthropic riporta che Opus 5 ha il punteggio più basso di sempre per comportamento disallineato (2,3) e lo definisce il modello più allineato alla sua Constitution. Sul fronte sicurezza, i classificatori di cybersecurity sono descritti come circa l'85% meno restrittivi di quelli di Fable 5, con un Cyber Verification Program enterprise per i team che ne hanno bisogno. Come per ogni affermazione di sicurezza di un vendor, utile da sapere, ma vale comunque la pena validarla sui tuoi casi di red-team.
Benchmark di Opus 5: dove vince (e dove perde)
Opus 5 guida la maggior parte dei benchmark pubblicati da Anthropic, e le vittorie che contano per chi costruisce agenti sono schiaccianti: Frontier-Bench v0.1 (43,3%), GDPval-AA (1861 Elo), ARC-AGI-3 (30,2%), OSWorld 2.0 (70,6%) e AutomationBench di Zapier (26,0%). Le eccezioni oneste: GPT-5.6 Sol vince DeepSWE v1.1, Fable 5 supera di un soffio i test FrontierCode e legali, e Mythos 5 si prende salute e biologia.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Coding da terminale agentico, Frontier-Bench v0.1 | 43,3% | 33,7% | 21,1% | 34,4% |
| Knowledge work, GDPval-AA v2 (Elo) | 1861 | 1747 | 1593 | 1736 |
| Problem-solving inedito, ARC-AGI-3 | 30,2% | — | 1,5% | 7,8% |
| Ricerca agentica, BrowseComp | 90,8% | 87,4% | 84,3% | 90,4% |
| Ragionamento multidisciplinare, Humanity's Last Exam (con strumenti) | 64,7% | 63,9% | 57,9% | — |
| Uso del computer agentico, OSWorld 2.0 | 70,6% | 66,1% | 55,7% | 62,6% |
| Coding agentico, DeepSWE v1.1 | 68,8% | 69,7% | 59,0% | 72,7% |
| Coding agentico, FrontierCode v1.1 (Main) | 53,4% | 53,5% | 46,5% | 47,5% |
| Workflow aziendali, AutomationBench | 26,0% | 17,4% | 17,0% | 18,1% |
| Legal Agent Benchmark (held-out) | 11,7% | 13,3% | 10,4% | 2,5% |
| Salute, HealthBench Professional | 59,8% | 66,0% | 57,4% | 60,5% |
| Biologia, BioMysteryBench (difficile) | 49,4% | 46,5% | 42,4% | — |

Leggi i delta, non solo i punteggi assoluti. Frontier-Bench è balzato di +22,2 punti rispetto a Opus 4.8 (da 21,1 a 43,3), il singolo salto più grande e il motivo per cui Anthropic definisce questa una release di coding-e-agenti. GDPval-AA ha guadagnato +268 Elo (da 1593 a 1861), superando ogni modello nella tabella sul knowledge work. ARC-AGI-3 è quello che cattura l'occhio: 30,2% contro 7,8% di GPT-5.6 Sol e 1,5% di Opus 4.8, che Anthropic inquadra come circa 3x il miglior modello pubblico successivo sul problem-solving inedito. Su AutomationBench, 26,0% è circa 1,5x il campo, un segnale diretto per chi costruisce agenti per processi aziendali.
Due note oneste sulle sconfitte. Primo, il leader nella colonna Fable 5 per la salute (66,0%) e lo split risolto da umani in biologia è in realtà Mythos 5, il modello specializzato in scienze di Anthropic, non Fable 5, quindi non sono vittorie alla pari di un modello generalista. Secondo, il quadro del coding è davvero spaccato: GPT-5.6 Sol si prende DeepSWE v1.1 (72,7% contro 68,8%) e Fable 5 vince FrontierCode per un pelo (53,5% contro 53,4%). Se il tuo lavoro è puro coding in stile SWE-bench, l'etichetta "migliore in assoluto" non sceglie automaticamente Opus 5.
Quanto costa Opus 5? Prezzi e modalità Fast
I prezzi standard di Opus 5 sono $5 per milione di token in input e $25 per milione di token in output, identici a Opus 4.8 secondo i prezzi pubblicati da Anthropic, quindi non c'è alcun aumento per l'upgrade. La frase "a metà prezzo" è relativa a Fable 5, non a 4.8: ottieni un'intelligenza quasi da Fable 5 senza pagare le tariffe di Fable 5. La modalità Fast gira a circa 2x il prezzo base per circa 2,5x la velocità predefinita, e l'API supporta il routing di fallback.
Quindi cosa significa per task? Ai prezzi standard non paghi nulla in più rispetto a 4.8 e ottieni un grande salto di capacità, il che rende l'upgrade quasi gratuito per la maggior parte dei workload. La modalità Fast è la leva per le sessioni interattive: scambi un sovrapprezzo di 2x per un output che va in streaming circa 2,5x più veloce sullo stesso modello, e conviene quando sei lì ad aspettare, mentre fa male quando giri batch notturni dove il tempo reale non conta. Se i rate limit sono il tuo vero vincolo, la nostra guida ai limiti di utilizzo di Claude spiega come i tier interagiscono con il costo.
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}Dove si posiziona Opus 5 per gli agenti in produzione
I guadagni si concentrano esattamente dove vivono gli agenti in produzione: coding da terminale (Frontier-Bench), uso del computer (OSWorld 2.0), ricerca agentica (BrowseComp) e workflow aziendali multi-step (AutomationBench). Questi quattro sono i workload che si rompono più spesso nei deployment reali, quindi un modello che balza su tutti e quattro insieme cambia ciò che è rilasciabile.
Questa è la parte su cui vale la pena soffermarsi. Un benchmark come AutomationBench misura se un agente riesce a completare un vero workflow multi-strumento da cima a fondo, e il 26,0% di Opus 5 contro circa 17% del campo è la differenza tra "fa una bella demo" e "sopravvive al contatto con un CRM disordinato". Il risultato di OSWorld 2.0 (70,6%, batte Fable 5 a un terzo del costo) dice la stessa cosa per gli agenti di computer use che cliccano dentro software reale. Per i team che rilasciano agenti IA a contatto con i clienti, sono i numeri che si traducono in meno guasti alle 2 di notte.
Abbassa anche il costo di un design pattern su cui facciamo affidamento: l'auto-verifica a basso costo. Quando il modello è davvero più bravo a controllare i propri branch, puoi spendere meno token per un passaggio critico separato e cogliere comunque gli stessi errori. È una vera voce di budget per chiunque fa girare agenti su larga scala.
Come stiamo integrando Opus 5 nel nostro stack
Noi costruiamo e gestiamo agenti IA in produzione sullo stack Claude in Techsy, quindi una release frontier è una valutazione in giornata, non un titolo che leggiamo e poi archiviamo. Ecco la nostra prima lettura onesta, qualitativa dove non abbiamo ancora numeri prima/dopo puliti, specifica dove li abbiamo.
Lo swap in sé è banale, ed è proprio questo il punto. Le nostre pipeline di contenuto e automazione fissano un modello predefinito in config; cambiare claude-opus-4-8 in claude-opus-5 e riavviare una sessione non ha richiesto nessun'altra modifica, come ogni recente bump di Opus. Se fai routing tra provider e vuoi fare un A/B di Opus 5 contro Fable 5 o GPT-5.6 Sol sui tuoi task, un proxy ti permette di cambiare modello senza riscrivere la tua app.
Ciò che osserviamo per primo è l'affermazione sull'auto-verifica, perché è quella che cambierebbe davvero la nostra architettura. I nostri agenti attuali eseguono un passaggio critico esplicito per cogliere le modifiche sbagliate prima che arrivino; se Opus 5 segnala in modo affidabile i propri branch deboli, possiamo assottigliare quel passaggio e risparmiare token. Non pubblichiamo un numero su questo finché non l'avremo fatto girare su un set di task ripetibile, la stessa disciplina che pretenderemmo da chiunque cita metriche sugli agenti. Se vuoi il metodo, è quello della nostra guida alla valutazione degli agenti IA in produzione: stessi prompt, stesso stato del repo, conta le svolte sbagliate, non le sensazioni.
Ti conviene passare da Opus 4.8? (Passare / Aspettare / Restare)
Se passare dipende dal tuo workload, non da quale modello "vince" in assoluto. I salti su agentico e knowledge work sono grandi e reali, quindi la maggior parte dei team dovrebbe passare. Le software house di puro coding con una pipeline GPT o Fable hanno un motivo per testare prima di impegnarsi, e gli utenti vicini al tetto su task economici possono restare senza quasi perdere nulla.
Passa ora se: il tuo lavoro si basa su task agentici, uso del computer, automazione di processi aziendali o knowledge work. Frontier-Bench (+22,2 rispetto a 4.8), AutomationBench (~1,5x il campo) e GDPval-AA (+268 Elo) sono i guadagni reali più grandi, e i prezzi non sono cambiati, quindi non c'è alcuna penalità di costo nell'upgrade.
Aspetta se: il tuo workflow è puro coding agentico e sei già su GPT-5.6 Sol o Fable 5 per quello. GPT-5.6 Sol guida ancora DeepSWE v1.1 e Fable 5 supera di un soffio FrontierCode, quindi fai il tuo eval di coding prima di cambiare. Aspetta anche se sei a metà progetto e uno swap di modello confonderebbe una valutazione che stai già facendo.
Resta su 4.8 se: sei sensibile al costo su task che erano già vicini al tetto per te e non tocchi i workload agentici dove Opus 5 passa avanti. Pagheresti un costo di cambio per un delta che non percepiresti. Per il campo più ampio, guarda come si confrontano i modelli nella nostra analisi di Claude Sonnet 5 e nella panoramica su Fable 5 e Mythos 5.
Noi scegliamo e colleghiamo modelli come questo ogni settimana per build di agenti dei clienti. Se stai decidendo quale modello standardizzare per un agente in produzione, ottieni una consulenza gratuita e ti aiuteremo ad abbinare il modello al workload invece che al marketing.
L'autore
Mert Batur Gurbuz è Co-Founder di Techsy.io, dove il team rilascia agenti IA, sistemi di automazione e pipeline voice/SDR per clienti B2B. Studia alla University of Birmingham e scrive dello stack di tooling LLM che il team Techsy fa girare davvero in produzione.
Co-Founder, Techsy.io, University of Birmingham · LinkedIn
Domande frequenti
Cos'è Claude Opus 5?
Claude Opus 5 è il modello frontier di Anthropic, rilasciato il 24 luglio 2026, con ID modello claude-opus-5. Anthropic lo posiziona come vicino all'intelligenza di Fable 5 a metà prezzo, e guida la maggior parte dei suoi benchmark pubblicati, inclusi Frontier-Bench, GDPval-AA e ARC-AGI-3. È disponibile su Claude API, Claude.ai, Claude Code e Claude Cowork.
Quando è stato rilasciato Claude Opus 5?
Claude Opus 5 è stato rilasciato il 24 luglio 2026. È andato live lo stesso giorno su Claude API, Claude.ai, Claude Code e Claude Cowork, senza rollout graduale, quindi puoi passare subito il tuo modello predefinito a claude-opus-5.
Claude Opus 5 è meglio di Opus 4.8?
Per la maggior parte del lavoro, sì. Opus 5 più che raddoppia Opus 4.8 su Frontier-Bench v0.1 (43,3% contro 21,1%), guadagna 268 Elo su GDPval-AA e balza da 1,5% a 30,2% su ARC-AGI-3. I prezzi sono invariati, quindi non c'è penalità di costo. Le eccezioni sono alcuni test di coding e scientifici dove GPT-5.6 Sol, Fable 5 o Mythos 5 guidano ancora.
Quanto costa Claude Opus 5?
I prezzi standard sono $5 per milione di token in input e $25 per milione di token in output, identici a Opus 4.8. La frase "a metà prezzo" si riferisce a Fable 5, non a 4.8: Opus 5 offre un'intelligenza quasi da Fable 5 alle tariffe di Opus. La modalità Fast costa circa 2x il prezzo base e gira circa 2,5x più veloce sullo stesso modello.
Claude Opus 5 batte Fable 5?
Non su tutta la linea. Opus 5 supera Fable 5 su OSWorld 2.0, BrowseComp, GDPval-AA e Frontier-Bench, e lo fa a una frazione del prezzo di Fable 5. Ma Fable 5 supera ancora di un soffio FrontierCode e il benchmark legale, e Mythos 5 (il modello scientifico di Anthropic) guida salute e biologia. La promessa è "quasi Fable 5 a metà prezzo", non "meglio di Fable 5 in tutto".
In cosa perde Opus 5?
GPT-5.6 Sol vince il coding agentico su DeepSWE v1.1 (72,7% contro 68,8%), Fable 5 vince FrontierCode v1.1 di 0,1 punti e il benchmark legale held-out (13,3% contro 11,7%), e Mythos 5 guida HealthBench Professional e i test di biologia. Se il tuo workload è dominato da uno di questi, fai un benchmark prima di cambiare.
Claude Opus 5 è adatto per costruire agenti IA?
È fatto per questo. I guadagni più grandi arrivano sul coding da terminale agentico (Frontier-Bench), sull'uso del computer (OSWorld 2.0), sulla ricerca agentica (BrowseComp) e sui workflow aziendali multi-step (AutomationBench), che sono i workload che gli agenti in produzione eseguono. La sua auto-verifica più forte ti permette anche di spendere meno token per un passaggio critico separato.
Come passo a Opus 5 in Claude Code e nell'API?
Imposta il tuo modello su claude-opus-5 (usa /model claude-opus-5 in Claude Code) e per la maggior parte dei team è fatta. Nell'API, cambia il campo model in claude-opus-5; la forma della richiesta è invariata rispetto a Opus 4.8, quindi non servono altre modifiche al codice.
Cos'è la modalità Fast in Claude Opus 5?
La modalità Fast è un tier ad alta velocità che fa girare Opus 5 a circa 2,5x la velocità predefinita per circa 2x il prezzo standard. Ti mantiene sul modello claude-opus-5 completo invece di instradarti verso uno più piccolo, il che la rende utile per le sessioni interattive dove aspetti l'output e non conveniente per job batch insensibili alla latenza.