
Claude Code Fast Mode: 2,5x più veloce su Opus 4.8 (e non è un downgrade)
La fast mode di Claude Code non sostituisce il modello con uno più economico. È questo il punto che quasi tutti fraintendono. Attivi /fast e ottieni gli stessi pesi Opus 4.8 che scrivono fino a 2,5x più veloce, fatturati a $10/$50 per milione di token invece dei $5/$25 standard. Paghi di più per la velocità, non di meno per un modello semplificato. Anthropic ha abbassato il prezzo della fast mode su Opus 4.8 il 28 maggio 2026 (era $30/$150 su Opus 4.7), e funziona con Claude Code v2.1.36 e versioni successive. Il tuo codice non diventa meno intelligente. Arriva prima, tutto qui.
Punti chiave
- La fast mode usa lo stesso modello Claude Opus fino a 2,5x più veloce, non un modello ridotto.
- Su Opus 4.8 costa $10/$50 per milione di token (input/output). Paghi di più, non di meno.
- Si attiva in Claude Code con il comando
/fast(richiede v2.1.36+ e usage credits abilitati). - "Fast mode disabled by your organization" significa che l'amministratore deve abilitarla nella Console.
Cos'è la fast mode di Claude Code?
La fast mode di Claude Code è un'opzione di serving in research preview che esegue lo stesso modello Claude Opus con una configurazione API diversa, offrendo fino a 2,5x più output token al secondo. Cambia quanto veloce il modello scrive, non come ragiona. Si attiva con /fast e Claude Code passa automaticamente a Opus.
Quando la fast mode è attiva, vedrai l'icona di stato ↯ nel terminale. L'impostazione persiste tra le sessioni per default: una volta attivata rimane accesa finché non la disattivi. Esegui /fast di nuovo in qualsiasi momento per controllare o cambiare lo stato attuale. Un piccolo avvertimento: è una funzione CLI, quindi l'estensione VS Code non la supporta ancora.
Ecco il dettaglio tecnico che i competitor omettono. La fast mode accelera gli output token al secondo (OTPS), cioè la velocità con cui il modello trasmette la risposta una volta avviata. Non accelera il time to first token (TTFT), la pausa prima che appaia la prima parola. Un prompt breve non sembrerà molto più veloce; una generazione di codice lunga sì. Questa distinzione decide se la fast mode vale la pena nel tuo workflow, e ci arriviamo.
La fast mode ti mantiene su Opus. Se vuoi effettivamente un modello diverso, è un controllo separato. Consulta la nostra guida sul cambio di modello in Claude Code con /model.
La fast mode è lo stesso cervello Opus che scrive più veloce, non un modello più piccolo che ragiona meno.
La fast mode rende Claude meno capace? (No, ecco perché)
No. La fast mode non usa un modello più piccolo o più economico, e non riduce la qualità. Secondo i documenti ufficiali di Anthropic su Claude Code, "fast mode non è un modello diverso. Usa Claude Opus con una configurazione API diversa… Ottieni qualità e capacità identiche con risposte più veloci." Stessi pesi, stesso ragionamento, consegna più rapida.
La confusione nasce da un controllo correlato chiamato effort level, che è un parametro completamente diverso. L'effort level cambia quanto il modello ragiona prima di rispondere. Abbassalo e sì, la qualità può calare, perché il modello ragiona genuinamente meno. La fast mode non tocca mai il ragionamento. È questa la trappola in cui si cade: si assume che "più veloce" significhi "più economico e peggiore", quando la fast mode è l'esatto contrario: stesso cervello, conto più alto.
Ecco il confronto che nessun'altra guida si prende la briga di mostrare:
| Parametro | Cosa cambia | Qualità | Velocità | Costo |
|---|---|---|---|---|
| Fast mode | Configurazione di serving (OTPS più alto) | Invariata | Fino a 2,5x più veloce in output | Più alto per token |
| Effort level basso | Meno ragionamento | Può calare | Più veloce | Più basso |
Sono indipendenti. Puoi usare la fast mode e abbassare l'effort level insieme, oppure uno solo dei due. Risolvono problemi diversi.
La fast mode alza il conto; l'effort level è il parametro che davvero scambia qualità per velocità.
Come funziona la fast mode?
La fast mode è un'ottimizzazione lato server. Anthropic esegue gli stessi pesi Opus 4.8 su una configurazione di serving ottimizzata per il throughput, così i token di output escono circa 2,5x più veloce mentre il time to first token rimane pressoché invariato. Il costo viene scalato dagli usage credits, non dalla quota del piano standard.
Se raggiungi un rate limit mentre la fast mode è attiva, Claude Code torna automaticamente alla velocità standard e mostra un ↯ grigio con un breve cooldown, per poi riattivare la fast mode una volta che il limite si allarga. Non devi fare nulla: si recupera da solo.
Sul percorso API, il controllo è un singolo campo. Questo corrisponde ai documenti fast mode di platform.claude.com:
{
"model": "claude-opus-4-8",
"speed": "fast",
"messages": [{ "role": "user", "content": "Refactor this module." }]
}Stessa stringa di modello, un campo in più. Questo è tutto il cambiamento API.
Come abilitare la fast mode in Claude Code
Per abilitare la fast mode: verifica di avere Claude Code v2.1.36 o successivo, assicurati che gli usage credits siano attivi per il tuo piano, esegui /fast per attivarla, poi conferma che l'indicatore ↯ sia attivo (non grigio). Claude Code passa automaticamente a Opus quando la abiliti.
Passo dopo passo:
- Controlla la versione. Esegui
claude --versione verifica che sia v2.1.36 o superiore. Le CLI più vecchie non hanno il toggle. - Attiva gli usage credits per il tuo piano o organizzazione. La fast mode si fattura dai credits, quindi devono essere abilitati.
- Esegui
/fastin Claude Code per attivarla. Questo cambia automaticamente la sessione a Opus. - Conferma l'indicatore
↯sia attivo e non grigio. Il grigio significa che sei in un cooldown di rate limit a velocità standard. - Opzionale, per i team: abilita l'opt-in per sessione così la fast mode non è sempre attiva. Aggiungi questo alle managed settings per tenere i costi prevedibili:
{
"fastModePerSessionOptIn": true,
"fastMode": true
}Per disattivarla, esegui /fast di nuovo, oppure imposta la variabile d'ambiente CLAUDE_CODE_DISABLE_FAST_MODE=1 per disabilitarla del tutto (utile in CI o per limitare la spesa su run automatizzati).
Se vuoi maggiore controllo sui toggle come questo, la nostra guida ai comandi slash di Claude Code copre i pattern dei flag, e la configurazione avanzata di Claude Code illustra nel dettaglio le managed settings.
Quanto costa la fast mode su Opus 4.8?
Su Opus 4.8, la fast mode costa $10 per milione di token in input e $50 per milione di token in output, circa 3x più economica del vecchio prezzo di $30/$150 della fast mode su Opus 4.7. Lo standard di Opus 4.8 è $5/$25, quindi la fast mode è il doppio del prezzo standard. Si fattura dagli usage credits, non dall'utilizzo del piano regolare.
Ecco come si scompone per modello:
| Modello | Fast mode input / output (per MTok) | Note |
|---|---|---|
| Opus 4.8 | $10 / $50 | Attuale; ~3x più economica della fast mode precedente |
| Opus 4.7 | $30 / $150 | Prezzo precedente (quello che le guide vecchie citano ancora) |
| Opus 4.6 | (legacy) | Rimossa ~30 giorni dopo il lancio di 4.8, poi ritorna a velocità/prezzo standard |
Alcune sfumature di fatturazione vale la pena conoscere. La fast mode scala dagli usage credits, il che significa che un utente del piano Max e un utente API la vivono diversamente: sull'API paghi per token al tasso fast, mentre su un abbonamento l'accelerazione brucia la quota credits più velocemente. È questa la parte che la maggior parte dei post sul "ne vale la pena?" saltano. Per il quadro completo, vedi i dettagli della versione Opus 4.8 e la nostra spiegazione su come funzionano gli usage credits di Claude.
La questione dell'aggiornamento conta: ogni guida editoriale che attualmente scala fu scritta contro i $30/$150 di Opus 4.7. Se un articolo cita ancora quei numeri, è indietro di una generazione di modello. La copertura di VentureBeat del lancio del 28 maggio 2026 conferma il nuovo tasso $10/$50.
Perché la fast mode è "disabilitata dalla tua organizzazione"?
Sui piani Team ed Enterprise, la fast mode è disattiva per default. Il messaggio "fast mode has been disabled by your organization" quasi sempre significa che un amministratore non l'ha ancora abilitata, non che ci sia qualcosa di rotto. La soluzione è un toggle dell'admin nella Console più gli usage credits attivi, e serve v2.1.36+.
È il problema più cercato legato alla fast mode, e ha una sua issue su GitHub (anthropics/claude-code #30891), il che dice tutto su quante persone ci incappano. Ecco la tabella delle soluzioni:
| Sintomo / causa | Soluzione |
|---|---|
| Default disattivato su Team/Enterprise | L'admin abilita la fast mode nella Console → preferenze di Claude Code (o Admin Settings di claude.ai) |
| Usage credits non abilitati | Attiva gli usage credits per l'organizzazione |
CLAUDE_CODE_DISABLE_FAST_MODE=1 è impostata | Rimuovi la variabile d'ambiente |
| CLI vecchia | Aggiorna a v2.1.36+ (claude --version) |
Segui questa lista in ordine e l'errore scompare in quasi tutti i casi.
"Disabled by your organization" quasi mai è un bug. È un toggle dell'admin più gli usage credits.
Come si sente la fast mode nella pratica (test su Opus 4.8)
Abbiamo usato /fast su Opus 4.8 in Claude Code (v2.1.41) per sei giorni di lavoro cliente normale: build di agenti, refactoring e moltissimi cicli di modifica/debug. Il salto di throughput dell'output era reale e visibile. Le generazioni lunghe che prima procedevano lente adesso finivano mentre stavi ancora leggendo il primo paragrafo.
Ecco cosa abbiamo misurato su un refactoring ripetuto di un modulo di 600 righe, stessa prompt, stesso repository, eseguito cinque volte ciascuno:
| Modalità | Velocità di output osservata | Latenza percepita sul refactoring |
|---|---|---|
| Opus 4.8 standard | ~60 token/sec | attesa percettibile su output lunghi |
Fast mode (/fast) | ~150 token/sec | output in streaming quasi alla velocità di lettura |
Sugli output lunghi abbiamo visto vicino al tetto del 2,5x citato da Anthropic. Il time to first token non è cambiato. La pausa prima della prima parola è rimasta identica, esattamente come documentato.
La nota onesta: ha smesso di pagare sui run autonomi lunghi. Quando avviavamo un task notturno per un agente e ce ne andavamo, nessuno stava aspettando lo stream, quindi il costo aggiuntivo non comprava nulla, e il consumo di usage credits era visibilmente più veloce, cosa che abbiamo notato nella dashboard la mattina dopo. La fast mode guadagna il suo costo quando c'è un essere umano lì a guardare l'output apparire. Per i job in background, la spegniamo.
Vale la pena la fast mode di Claude?
La fast mode conviene per lavoro interattivo sensibile alla latenza dove aspetti output lunghi: cicli rapidi di modifica/debug, grandi refactoring, qualsiasi cosa dove il modello produce molto testo e tu stai guardando. Saltala per job in background, run batch e prompt brevi, perché quelli sono limitati dal TTFT e la fast mode non tocca il TTFT.
Il consenso su Reddit tra gli utenti di Claude Code corrisponde a quanto abbiamo visto: le persone la amano per le sessioni di pair-programming dal vivo e si lamentano del consumo di credits sui workflow automatizzati. È l'istinto giusto. La domanda non è "la fast mode è buona?". È "sono io ad aspettare?" Se sì, attivala. Se è un robot ad aspettare, lasciala spenta e risparmia i credits.
Se stai costruendo agenti o automazioni sullo stack Claude e vuoi capire dove la velocità paga davvero in produzione, Techsy lo fa ogni giorno. Prenota una consulenza gratuita. Per un contesto più ampio sugli strumenti, guarda la nostra rassegna dei migliori agenti di codifica AI.
Sull'autore
Mert Batur è co-fondatore di Techsy.io, dove il team costruisce agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Scrive dello stack di strumenti LLM che il team Techsy usa in produzione.
Mert Batur, Co-Founder, Techsy.io. LinkedIn
Domande frequenti
Cos'è la fast mode di Claude Code?
La fast mode di Claude Code è un'opzione di serving in research preview che esegue lo stesso modello Claude Opus con una configurazione API diversa, offrendo fino a 2,5x più output token al secondo. Si attiva con il comando /fast, che passa automaticamente a Opus e mostra l'icona di stato ↯ nel terminale.
La fast mode rende Claude meno capace o usa un modello più piccolo?
No. La fast mode usa gli stessi pesi Opus con qualità e capacità identiche, secondo i documenti ufficiali di Anthropic. Cambia solo la configurazione di serving affinché l'output arrivi più veloce. Il controllo che può ridurre la qualità è l'effort level, un parametro separato che abbassa il ragionamento. La fast mode non tocca mai il ragionamento.
Come abilito la fast mode in Claude Code?
Verifica di avere Claude Code v2.1.36 o successivo con claude --version, assicurati che gli usage credits siano abilitati per il tuo piano, poi esegui /fast nel terminale. Claude Code passa automaticamente a Opus. Conferma che l'indicatore ↯ sia attivo e non grigio, il che indicherebbe un cooldown per rate limit.
Come disattivo la fast mode?
Esegui /fast di nuovo per disattivarla, dato che l'impostazione persiste tra le sessioni per default. Per disabilitarla del tutto (utile in CI o per limitare la spesa su run automatizzati), imposta la variabile d'ambiente CLAUDE_CODE_DISABLE_FAST_MODE=1. I team possono anche usare fastModePerSessionOptIn: true così non è sempre attiva.
Quanto costa la fast mode su Opus 4.8?
Su Opus 4.8, la fast mode costa $10 per milione di token in input e $50 per milione di token in output, circa 3x più economica del vecchio tasso $30/$150 su Opus 4.7. Lo standard di Opus 4.8 è $5/$25, quindi la fast mode è il doppio del prezzo standard. Si fattura dagli usage credits, non dalla quota del piano regolare.
Perché dice "fast mode has been disabled by your organization"?
Sui piani Team ed Enterprise, la fast mode è disattiva per default, quindi un admin deve abilitarla nella Console nelle preferenze di Claude Code. Verifica anche che gli usage credits siano attivi per l'organizzazione, che non sia impostata nessuna variabile d'ambiente CLAUDE_CODE_DISABLE_FAST_MODE=1, e che la CLI sia v2.1.36 o successiva. È un toggle dell'admin, non un bug.
La fast mode accelera il time to first token (TTFT)?
No. La fast mode migliora solo gli output token al secondo (OTPS), cioè quanto veloce il modello scrive una volta avviato. Il time to first token, la pausa prima che appaia la prima parola, rimane invariato. Per questo i prompt brevi sembrano appena più veloci mentre le generazioni di codice lunghe sembrano nettamente più rapide.
La fast mode di Claude vale il costo aggiuntivo?
Conviene per il lavoro interattivo dove aspetti output lunghi, come cicli di modifica/debug e grandi refactoring. Non conviene per job in background, run batch o prompt brevi, perché quelli sono limitati dal TTFT e la fast mode non aiuta lì. La regola pratica: attivala quando sei tu ad aspettare.
La fast mode funziona nell'estensione VS Code?
No. La fast mode è una funzione CLI di Claude Code e l'estensione VS Code non la supporta ancora. Devi eseguire /fast nella versione terminale di Claude Code. Lo stesso vale per il percorso API, dove imposti speed: "fast" direttamente nella richiesta.
La fast mode è uguale ad abbassare l'effort level?
No, sono parametri indipendenti. La fast mode cambia la configurazione di serving per output più veloci a costo più alto con la stessa qualità. Abbassare l'effort level riduce quanto il modello ragiona, che è più economico e più veloce ma può far calare la qualità. Puoi combinarli entrambi, ma solo l'effort level scambia qualità per velocità.
Fonti: