Calcolatore costi API OpenAI, Claude e Gemini
Confronta i costi mensili dei vari provider, risparmi di caching e batch inclusi.
I costi delle API di GPT, Claude e Gemini vanno da 0,15 $ a 75 $ per milione di token in input, con i token in output di norma 3–5× più cari. A 10 milioni di token al mese, GPT-4o costa circa 775 $, Claude Sonnet 4 circa 1.140 $ e Gemini 2.5 Pro circa 825 $. Il prompt caching abbatte di 10× il costo dei token messi in cache; la Batch API taglia del 50 % il lavoro che non richiede tempo reale. Questo calcolatore ti permette di modellare il consumo esatto su tutti e tre i provider.
I tuoi parametri
05 fieldsChi dovrebbe usare questo strumento
Founder che definiscono un progetto openai api prima di parlare coi vendor. CTO e leader engineering che costruiscono il budget annuale per nuovi prodotti. Product manager che traducono un’idea in un range difendibile per la finanza. Team procurement che verificano la coerenza dei preventivi di agenzie e freelance.
Come lo calcoliamo
Prezzi basati sui listini pubblici di OpenAI, Anthropic e Google aggiornati al 2026. Il prompt caching si applica solo ai token di input in cache (di norma il system prompt più il contesto stabile). La Batch API si applica sia ai token di input sia a quelli di output, per i lavori non in tempo reale con SLA di 24 ore.
Fonti dati
Fattori che muovono il numero
Selezione del tier di modello
I modelli di frontiera come GPT-4.5, Claude Opus 4 e Gemini 2.5 Pro sono 5–10 volte più costosi per token dei loro fratelli di fascia media. Usa la frontiera solo per i task di ragionamento difficile in cui la fascia media fallisce davvero: logica complessa a più passi, matematica, generazione di codice ambiguo o task che richiedono una profonda conoscenza del mondo. Instrada tutto il resto su Claude Sonnet 4, GPT-4o o Gemini Flash. Il divario di costo è abbastanza ampio da far sì che un routing intelligente tagli di solito la spesa del 60–80% sui carichi misti.
Prompt caching
Anthropic mette in cache i token di input per 5 minuti gratis o per 1 ora con un sovrapprezzo del 25%, tagliando il costo dei token in cache di circa il 90%. OpenAI fa caching in automatico per 5–10 minuti su certi endpoint, senza alcuna configurazione. Il caching funziona meglio quando il tuo system prompt è oltre i 2K token ed è stabile tra le richieste, cosa che descrive la maggior parte dei chatbot e dei sistemi RAG in produzione. I risparmi sono maggiori sui carichi con contesto stabile lungo e molte richieste al minuto.
Batch API
Sia OpenAI sia Anthropic offrono endpoint batch a uno sconto esatto del 50% sul prezzo standard in cambio di uno SLA di 24 ore. Il batch è ideale per classificazione, generazione di embedding, riassunto, run di valutazione e qualsiasi elaborazione in background. L'integrazione è banale: stesso modello, stesso prompt, endpoint diverso, più una coda in cui aspettare i risultati. La maggior parte dei team trascura il batch e paga il prezzo pieno per carichi che non hanno alcun requisito di tempo reale, uno dei costi AI più facili da evitare.
Token di output
I token di output costano 3–5 volte più di quelli di input su tutti i provider, e la maggior parte delle risposte non ha bisogno del buffer di output da 4K token che l'API concede di default. Se stai estraendo una risposta sì-o-no, limita l'output a 10 token. Se stai generando un riassunto breve, limitalo a 200. Spesso il modello vuole spiegare il suo ragionamento anche quando non lo hai chiesto, e tu paghi per quelle spiegazioni. Stringere max_tokens taglia spesso i costi di output del 30–50% senza impatto sulla qualità.
La context window non è uguale al prezzo
Tutti i principali provider fanno pagare per token consumato, non per dimensione della context window. Usare una context window da 200K per un prompt da 5K token costa esattamente come usare una context window da 5K per un prompt da 5K token. La conseguenza è che i modelli a contesto lungo non sono "più costosi da usare", a meno che tu non riempia davvero il contesto. Scegli il modello in base a capacità e prezzo per token, non in base a quale context window è più grande.
Come ridurre i costi
Abilita il prompt caching come prima ottimizzazione, prima di ogni altra cosa. Per Anthropic, marca il tuo system prompt stabile con gli header cache_control e i token in cache scendono a circa il 10% del prezzo di input standard. Per OpenAI, il caching avviene in automatico su certi endpoint quando il prefisso del prompt è identico tra le richieste. Il vantaggio è massimo sui carichi con contesto stabile lungo e molte richieste: chatbot con persona dettagliate, sistemi RAG con contesto di retrieval ripetuto e qualsiasi loop di agent che rispedisce un lungo set di istruzioni. La maggior parte dei team dimentica di abilitare il caching e paga 5–10 volte di più.
Sposta ogni carico non in tempo reale sulla Batch API. Sia Anthropic sia OpenAI offrono endpoint batch a uno sconto esatto del 50% sul prezzo standard in cambio di uno SLA di risposta di 24 ore. Job di classificazione, content moderation, generazione di embedding, pipeline di riassunto e run di valutazione sono tutti buoni candidati. Il lavoro di integrazione è banale, perché prompt e modello restano invariati. I team fanno girare regolarmente l'intera pipeline di tagging dei contenuti a prezzo standard, quando il batch dimezzerebbe il conto senza alcuna differenza di qualità.
Instrada le richieste per difficoltà. Le query semplici (saluti, formattazione, ricerche di base) appartengono a GPT-4o mini, Claude Haiku o Gemini Flash, a 0,15–0,80 $ per milione di token di input. Il ragionamento difficile appartiene a Claude Opus, GPT-4.5 o Gemini Pro, a 1,25–75 $ per milione. Un piccolo classificatore davanti al router dei modelli taglia di solito i costi del 60–80% sui carichi misti. Mandare tutto a un modello di frontiera è l'errore di costo AI più comune che vediamo in produzione.
Limita max_tokens con decisione. I token di output costano 3–5 volte più di quelli di input, e il buffer di output da 4K di default è ben più grande di quanto serva alla maggior parte delle risposte. Limita le risposte sì-o-no a 10 token, i riassunti brevi a 200, il JSON strutturato a quanto richiede il tuo schema più un piccolo margine. A volte il modello vuole dilungarsi anche quando non lo hai chiesto, e tu paghi quelle digressioni. Stringere max_tokens è una riduzione del costo di output del 30–50% nella maggior parte dei casi.
Riduci il contesto recuperato solo a ciò che serve per ogni query. I sistemi RAG spesso recuperano 10–20 chunk e li infilano tutti nel prompt per sicurezza. Il risultato è pagare per migliaia di token irrilevanti a richiesta. Aggiungere un reranker che filtra fino ai 3–5 chunk più rilevanti taglia di solito l'uso dei token di input del 50–70% senza perdita di qualità, spesso con un miglioramento di qualità, perché il modello non viene distratto da contesto irrilevante.
Logga ogni richiesta con conteggio dei token, modello e stato in cache rispetto a non in cache. Non puoi ottimizzare ciò che non vedi, e i costi AI possono cambiare forma da un giorno all'altro quando rilasci una nuova funzione o modifichi un prompt. Imposta avvisi di spesa giornalieri. Costruisci una dashboard che scomponga la spesa per funzione, modello ed endpoint. La maggior parte degli sforamenti che incontriamo in produzione succede perché un pattern d'uso è cambiato due settimane prima che qualcuno guardasse la fattura.
Costo per milione di token (prezzi 2026)
| Modello | Input | Output | Input in cache |
|---|---|---|---|
| GPT-4.5 | $75.00 | $150.00 | $37.50 |
| GPT-4o | $2.50 | $10.00 | $1.25 |
| GPT-4o mini | $0.15 | $0.60 | $0.075 |
| Claude Opus 4 | $15.00 | $75.00 | $1.50 |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 |
| Claude Haiku 4 | $0.80 | $4.00 | $0.08 |
| Gemini 2.5 Pro | $1.25 | $10.00 | N/A |
| Gemini 2.5 Flash | $0.075 | $0.30 | N/A |
FAQ
Domande che riceviamo ogni settimana
Risposte brevi in linguaggio chiaro. Se la tua domanda non c’è,
GPT-4o: 2,50 $ per milione di token in input, 10 $ in output. GPT-4o mini: 0,15 $/M in input, 0,60 $ in output. GPT-4.5: 75 $/M in input, 150 $ in output. A 10M di token al mese, con uno split input/output 30/70, vai dai 25 $ ai 13.000 $ a seconda del modello.
Per la maggior parte dei carichi di lavoro: GPT-4o mini, Gemini 2.5 Flash o Claude Haiku 4, tutti sotto 1 $ per milione di token in input. Per il miglior equilibrio tra qualità e prezzo: Claude Sonnet 4 o Gemini 2.5 Pro.
Anthropic e OpenAI mettono in cache i prompt di input voluminosi tra una richiesta e l'altra. I token in cache costano circa il 90 % in meno di quelli non in cache. Ideale per chatbot con system prompt stabili o per RAG con contesto fisso.
Esattamente il 50 % sia sui token in input sia su quelli in output. In cambio devi accettare uno SLA di 24 ore. Ottima per classificazione, riassunto, embedding e valutazione; da evitare per la chat in tempo reale e le esperienze interattive.
A parità di livello qualitativo, il costo è simile. Claude Sonnet 4 e GPT-4o sono più o meno alla pari. Claude Opus 4 con il prompt caching costa circa il 30 % in meno di GPT-4o sui carichi a prompt stabile.
(1) Attiva il prompt caching. (2) Usa la Batch API dove puoi. (3) Indirizza le query semplici verso i modelli mini. (4) Limita max_tokens con decisione. (5) Riduci all'essenziale il contesto recuperato.
Il punto di pareggio si aggira sui 5.000 $ al mese di spesa in API. Sotto questa soglia conviene restare sulle API. Sopra, fare self-hosting con Llama 3.1 o Mistral può ridurre i costi del 50–70 %, a patto di avere le competenze infrastrutturali.
Prendi un campione rappresentativo di 100 richieste. Misura la media dei token in input e in output. Moltiplica per il volume mensile di richieste, poi per il costo al milione di token. Aggiungi un 30 % di margine di sicurezza.
Solo per i ragionamenti più impegnativi, dove i modelli di fascia media non ce la fanno. Per l'80 % dei carichi in produzione, Sonnet 4, GPT-4o o Gemini 2.5 Pro vanno benissimo a un costo 10× inferiore.
Entro il ±15 % sui carichi tipici. Nella realtà la variabilità dipende dalla lunghezza variabile dei prompt e degli output, dai cicli di errore e retry e dalla logica di routing. Usa il calcolatore come strumento di pianificazione, non come fattura definitiva.
Strumenti simili
Altri calcolatori che la maggior parte apre subito dopo questo: scegli quello adatto alla tua prossima decisione.
Costo di sviluppo e spesa mensile di esercizio: il quadro completo, senza sorprese.
Ottieni una stima precisa dal nostro team
I calcolatori danno un range. Una call di 30 minuti ti dà scope, tempistiche e budget fissi. Consulenza gratuita, senza impegno.
Inizia la conversazione