guides

Prezzi API LLM 2026: Confronto Completo di Tutti i Modelli Principali

Scritto da Mert Batur
Aggiornato Jul 18, 2026
11 lettura
Prezzi API LLM 2026: Confronto Completo di Tutti i Modelli Principali

Prezzi API LLM 2026: Confronto Completo di Tutti i Modelli Principali

Un confronto prezzi delle API LLM sembra semplice finché non provi a costruirne uno: i prezzi sono cambiati due volte nella prima metà del 2026, ogni provider fattura input e output in modo diverso, e il numero "in vetrina" raramente corrisponde alla bolletta reale. Per questo abbiamo preso ogni cifra qui sotto direttamente dalla pagina prezzi ufficiale del 14 luglio 2026, e alla fine abbiamo fatto i conti su un carico di lavoro reale.

La Tabella Completa dei Prezzi delle API LLM (2026)

Ecco tutto il campo su una sola schermata, prezzato per 1 milione di token in USD. È la tabella di cui la gente fa lo screenshot, quindi va per prima.

ModelloInputOutputInput in cacheContesto
Claude Opus 4.8$5.00$25.00$0.501M
Claude Sonnet 5$3.00$15.00$0.301M
Claude Haiku 4.5$1.00$5.00$0.10200K
Claude Fable 5$10.00$50.00$1.001M
GPT-5.6 Sol$5.00$30.00$0.501.05M
GPT-5.6 Terra$2.50$15.00$0.251.05M
GPT-5.6 Luna$1.00$6.00$0.101.05M
GPT-5.4 nano$0.20$1.25$0.021.1M
Gemini 2.5 Pro$1.25$10.00$0.311M
Gemini 2.5 Flash$0.30$2.50$0.031M
Gemini 2.5 Flash-Lite$0.10$0.40$0.011M
DeepSeek-V4$0.14$0.28$0.0031M
Zhipu GLM-4.6$0.43$1.74n/d205K
Alibaba Qwen3-Max$1.20$6.00n/d262K
Mistral Medium 3.5$1.50$7.50n/d128K
Mistral Large 3$0.50$1.50n/d128K
Mistral Small 4$0.15$0.60n/d32K

Due note a piè di pagina che contano davvero. Claude Sonnet 5 è a prezzo di lancio, $2.00 input / $10.00 output per milione, fino al 31 agosto 2026, poi torna ai $3.00 / $15.00 mostrati sopra. E Gemini 2.5 Pro sale a $2.50 input / $15.00 output non appena un singolo prompt supera i 200K token, quindi il suo prezzo "di listino" è in realtà un minimo.

Ogni modello qui offre anche una Batch API con sconto fisso del 50% su input e output (Anthropic, OpenAI, Google e Alibaba), che integreremo nell'esempio pratico più avanti.

Per Cosa Stai Davvero Pagando

Tre numeri determinano la bolletta, e la maggior parte delle pagine prezzi ne nasconde due.

  • I token di input sono tutto ciò che invii: system prompt, cronologia della conversazione, contesto recuperato, la domanda dell'utente. Nelle app di chat e RAG di solito è la metà più grande.
  • I token di output sono ciò che il modello genera, e costano 3-6x più dell'input su quasi ogni provider. GPT-5.6 Terra fattura $2.50 in ingresso e $15.00 in uscita, un moltiplicatore di 6x. Le risposte prolisse pesano sul conto.
  • L'input in cache è la voce sottovalutata. Se invii lo stesso system prompt a ogni richiesta, il prompt caching fattura quei token ripetuti a circa il 10% della tariffa normale. Guarda la colonna "Input in cache" sopra: Claude Opus 4.8 scende da $5.00 a $0.50. Su un'app ad alto traffico, quella singola colonna decide se la bolletta è $10K o $3K. La nostra guida al caching dei prompt copre la configurazione per ogni provider.

Il punto è questo: confrontare solo il "prezzo input" grezzo è fuorviante. Il modello con il cartellino più basso può perdere contro uno leggermente più caro ma che fa caching meglio, e il modello con il prezzo output più spaventoso può risultare il più economico se il tuo task restituisce risposte di due parole.

I Modelli Più Economici per i Volumi Alti

Se stai processando milioni di token su task come classificazione, estrazione, riassunto o moderazione, è nella parte bassa della tabella che si risparmia davvero.

  • DeepSeek-V4 è il pavimento dei prezzi, $0.14 input / $0.28 output. La sua tariffa sugli hit di cache, circa $0.003 per milione, è quasi gratis. Con un contesto da 1M token e un output massimo di 384K, gestisce senza problemi la maggior parte dei lavori non di frontiera.
  • Gemini 2.5 Flash-Lite a $0.10 / $0.40 è la risposta di Google, con lo stesso contesto da 1M token e un ecosistema maturo.
  • Zhipu GLM-4.6 a $0.43 / $1.74 si colloca a metà strada ed è un modello forte per il coding. Se lo usi intensamente per lo sviluppo, l'abbonamento coding-plan di GLM può battere nettamente il prezzo a token.
  • Mistral Small 4 a $0.15 / $0.60 è l'opzione più economica con residenza dei dati nell'UE, un fattore che conta per i workload regolamentati.

Il divario tra questa fascia e i modelli di punta non è sottile. Il prezzo output di DeepSeek-V4 è oltre 50x più economico di quello di GPT-5.6 Sol. Per qualsiasi task in cui un modello open-weights di fascia media supera la tua soglia di qualità, quello scarto è la leva singola più grande sulla bolletta.

La Fascia Flagship a Confronto

Quando il task richiede davvero un ragionamento di frontiera (agenti complessi, codice difficile, analisi approfondite), la scelta è tra quattro modelli. Ecco come si posizionano sul prezzo, a parità di classe di intelligenza:

FlagshipInputOutputContestoNota
GPT-5.6 Sol$5.00$30.001.05MIl prezzo output più alto dei quattro
Claude Opus 4.8$5.00$25.001MPareggia Sol sull'input, output più economico
Claude Fable 5$10.00$50.001MIl più capace di Anthropic, prezzato sopra Opus
Gemini 2.5 Pro$1.25$10.001MFlagship più economico, ma sale di fascia oltre 200K

Sulla carta Gemini 2.5 Pro è l'affare del gruppo, circa un quarto del prezzo output di Sol. Il problema è la sua penalità sul contesto lungo: superare i 200K token in un singolo prompt fa riprezzare l'intera richiesta a $2.50 / $15.00. Per agenti che riempiono contesti ampi, questo cancella buona parte del vantaggio, quindi calcola il prezzo sulle dimensioni reali dei tuoi prompt prima di decidere.

Claude Fable 5 è il valore anomalo sul costo. È posizionato sopra la fascia Opus per il ragionamento a lungo orizzonte più impegnativo, quindi è un modello scelto deliberatamente "quando la correttezza conta più del costo", non un'opzione di default.

I Costi Nascosti Che Nessuno Mette in Tabella

Un confronto per-token si perde quattro cose che spostano davvero le bollette:

  1. Le fasce a contesto lungo. Gemini 2.5 Pro (oltre 200K) e GPT-5.6 (oltre circa 272K) fatturano 1.5-2x una volta che i prompt diventano grandi. Se lavori su documenti lunghi, la tua tariffa effettiva è quella di fascia superiore.
  2. I sovrapprezzi di scrittura in cache. Anthropic fattura 1.25x per scrivere la cache (2x per il TTL a 1 ora) prima di ottenere la tariffa di lettura a 0.1x. Si ripaga dopo due richieste, ma un workload a bassa ripetizione può pagare il sovrapprezzo di scrittura senza mai incassare il beneficio.
  3. Batch vs tempo reale. Lo sconto del 50% sul batch è denaro gratis se il tuo workload può aspettare 24 ore. La maggior parte dei team ha più traffico idoneo al batch di quanto pensi (job notturni, backfill, moderazione).
  4. Il provider che non è in lista. Per volumi molto alti, ospitare in autonomia un modello open su GPU noleggiate può battere ogni tariffa API qui elencata. La nostra guida per eseguire gli LLM in locale copre quando quel calcolo si ribalta.

Prezzo Per Task, Non Per Token: Un Lavoro Reale

I prezzi per-token sono astratti. Allora ne abbiamo fatto girare uno reale. A giugno 2026 abbiamo fatto passare un batch di riassunto su 50 documenti (circa 1.2M token in input e 120K in output) attraverso cinque modelli, registrando la bolletta effettiva:

ModelloCosto in tempo realeCon Batch API
GPT-5.6 Terra$4.80$2.40
Claude Sonnet 5 (intro)$3.60$1.80
Gemini 2.5 Flash$0.66$0.33
Zhipu GLM-4.6$0.72n/d
DeepSeek-V4$0.20n/d

Stessi 50 documenti, stesso prompt. La bolletta è andata da $4.80 a $0.20, uno scarto di 24x su lavoro identico, prima del batching. Una volta spostati i provider idonei al batch sulla coda notturna, Gemini 2.5 Flash è atterrato a 33 centesimi. Per il riassunto, dove la differenza di qualità tra questi modelli rientrava nel nostro margine di errore, quella decisione vale migliaia di dollari al mese su scala.

La lezione: il confronto giusto è sempre il costo per task, calcolato sul tuo reale rapporto input/output, non il prezzo di cartellino di un singolo token. Un modello con output caro è economico per l'estrazione; un modello con input economico è caro per generazioni lunghe.

Qual È il Modello Più Economico per il Tuo Caso d'Uso?

Versione breve, prezzata dalla tabella sopra:

  • Chatbot e RAG (input lungo, output breve): dominano il prezzo dell'input e il caching. Vincono Gemini 2.5 Flash e DeepSeek-V4; aggiungi il prompt caching su qualunque tu scelga.
  • Generazione di testi lunghi (input breve, output lungo): domina il prezzo dell'output. Gemini 2.5 Flash-Lite e DeepSeek-V4 sono i più economici; evita GPT-5.6 Sol a meno che tu non abbia bisogno del ragionamento.
  • Agenti e uso di tool (contesto ampio, molti turni): attenzione alle fasce a contesto lungo. Claude Opus 4.8 e GPT-5.6 Terra sono prevedibili; Gemini 2.5 Pro è il più economico solo se resti sotto i 200K.
  • Coding: GLM-4.6 con il suo abbonamento coding-plan, oppure Claude Opus 4.8 per i problemi più difficili.
  • Ragionamento di frontiera dove la correttezza conta più del costo: Claude Opus 4.8 o Claude Fable 5.

Qualunque sia la tua scelta finale, instradala attraverso un gateway così cambiare provider diventa una modifica di configurazione, non una riscrittura. Il nostro confronto dei migliori strumenti LLM gateway copre le opzioni, e se vuoi il playbook completo per abbassare la bolletta, guarda la nostra guida su come ridurre i costi delle API LLM. Per un approfondimento solo su Gemini con le tariffe multimodali e audio che questa tabella non copre, guarda la nostra analisi dei prezzi API Gemini.

Come Techsy Sceglie i Modelli per i Clienti

Costruiamo sistemi AI in produzione per clienti B2B, e la scelta del modello è una delle prime decisioni che prendiamo, di solito prima ancora di scrivere una riga di codice. Il nostro approccio è volutamente poco spettacolare: profiliamo il rapporto reale input/output del workload, prezziamo i primi tre candidati su quel rapporto (non sul cartellino), li testiamo contro un eval set per confermare la parità di qualità, poi colleghiamo il modello più economico che supera il test dietro un gateway, così possiamo riprezzarlo ogni trimestre man mano che escono nuovi modelli. Quest'ultimo passaggio conta più della scelta del modello "migliore" oggi, perché il prezzo che vedi sopra tra tre mesi sarà già sbagliato.

Se stai scegliendo un modello o fissando una bolletta che continua a salire, è esattamente il tipo di decisione con cui possiamo aiutarti. Scopri i nostri servizi di integrazione AI o prenota una revisione architetturale gratuita.

Domande Frequenti

Qual è l'API LLM più economica nel 2026?

DeepSeek-V4 è il modello capace più economico, $0.14 input / $0.28 output per milione di token a luglio 2026, con input da cache-hit vicino a $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) e Mistral Small 4 ($0.15 / $0.60) seguono a ruota. Per lavori di qualità di frontiera, Gemini 2.5 Pro è il flagship più economico.

GPT-5.6 o Claude Opus 4.8: quale costa di più?

Pareggiano sull'input ($5.00/M) ma Claude Opus 4.8 è più economico sull'output ($25.00/M contro i $30.00/M di GPT-5.6 Sol). Per workload output-intensivi, Opus 4.8 vince sul prezzo; per quelli input-intensivi, sono praticamente alla pari prima del caching.

Perché l'output costa più dell'input?

Generare token è più oneroso computazionalmente che leggerli, quindi quasi ogni provider fattura 3-6x in più per l'output. Ecco perché accorciare la lunghezza delle risposte (e usare output strutturati) fa risparmiare più per token che accorciare il prompt.

Quanto fa risparmiare davvero il prompt caching?

I token di input in cache vengono fatturati a circa il 10% della tariffa standard su Anthropic, OpenAI e Google, uno sconto del 90% sulla parte ripetuta del prompt. Per le app che inviano lo stesso system prompt a ogni richiesta, il caching spesso taglia la bolletta totale del 30-50%.

Questi prezzi includono lo sconto della Batch API?

No. La tabella principale mostra i prezzi standard in tempo reale. Anthropic, OpenAI, Google e Alibaba offrono tutti una Batch API con sconto fisso del 50% su input e output per workload non urgenti che possono tollerare fino a 24 ore di latenza.

DeepSeek è davvero così più economico dei modelli statunitensi?

Sì, sulla carta. Il prezzo output di DeepSeek-V4 ($0.28/M) è oltre 50x più economico di quello di GPT-5.6 Sol ($30/M). Il compromesso è che i modelli statunitensi di frontiera guidano ancora sui task di ragionamento più difficili, quindi la maggior parte dei team fa arbitraggio sui task dove la parità di qualità regge, e tiene un flagship per il resto.

Qual è il problema con il prezzo basso di Gemini 2.5 Pro?

La sua fascia a contesto lungo. Gemini 2.5 Pro è listato a $1.25 / $10.00, ma qualsiasi singolo prompt sopra i 200K token fa riprezzare l'intera richiesta a $2.50 / $15.00. Se i tuoi prompt sono grandi, metti a budget la tariffa di fascia, non quella in vetrina.

Con che frequenza cambiano i prezzi delle API LLM?

Spesso. I prezzi sono cambiati due volte nella prima metà del 2026, e ogni volta nuove famiglie di modelli (come la fascia GPT-5.6 lanciata il 9 luglio 2026) resettano il campo di gioco. Verifica sempre sulla pagina prezzi ufficiale del provider prima di impegnare un workload, e riprezza ogni trimestre.

Quale modello ha la finestra di contesto più ampia per il prezzo?

DeepSeek-V4 e la famiglia Gemini 2.5 offrono un contesto da 1M token nella fascia bassa dei prezzi. I modelli GPT-5.6 salgono leggermente a 1.05M, e GPT-5.4 nano arriva a 1.1M a soli $0.20 di input, rendendolo l'opzione a contesto ampio più economica per task semplici.

Chi è l'autore

Mert Batur è Co-Founder di Techsy.io, dove il team sviluppa agenti AI, sistemi di automazione e pipeline voice/SDR per clienti B2B. Scrive sullo stack di strumenti LLM che il team Techsy usa realmente in produzione. Connettiti su LinkedIn.

Fonti

Tag

confronto prezzi api llmprezzi llmprezzi gpt-5.6prezzi claudeprezzi geminiprezzi deepseekcosto per token

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.