
Prezzi degli Agenti Vocali IA nel 2026: La Verità su $0,05 vs $0,30 al Minuto (Con i Calcoli)
Vapi mette "$0,05/min" sulla sua pagina dei prezzi. La tua prima bolletta mensile arriva a $0,27/min. Cos'è successo? Ogni piattaforma di voice AI pubblicizza un numero — la tariffa di piattaforma — e ti fattura altri quattro livelli che non hai visto nella homepage. Questa guida ricostruisce i prezzi degli agenti vocali IA da zero: i veri costi BYOK per 8 piattaforme, la voce dei token audio che nessuno spiega, e una funzione Python che puoi forkare per prevedere la tua bolletta.

Risposta Rapida
- Il costo reale tutto incluso nel 2026 si aggira tra $0,07 e $0,30/min a seconda di bundled vs BYOK.
- Le piattaforme bundled (Retell, Bland, ElevenLabs) pubblicizzano $0,07–$0,12/min e atterrano intorno a $0,10–$0,18/min.
- Le piattaforme BYOK (Vapi $0,05/min tariffa di piattaforma) arrivano a $0,13–$0,31/min dopo LLM + TTS + STT + Twilio.
- La leva nascosta più grande è il prompt caching su OpenAI Realtime: fino a 80× più economico sui prompt di sistema.
Quanto costa davvero un agente vocale IA nel 2026?
La maggior parte degli agenti vocali IA costa da $0,07 a $0,30 al minuto tutto incluso nel 2026. Le piattaforme bundled (Retell, Bland, ElevenLabs) pubblicizzano $0,07–$0,12/min e atterrano intorno a $0,10–$0,18/min. Le piattaforme BYOK (Vapi con $0,05/min di tariffa di piattaforma) arrivano a $0,13–$0,31/min una volta aggiunti LLM, TTS, STT e Twilio. Direttamente su OpenAI Realtime è circa $0,30/min senza caching.
Tre categorie spiegano quasi tutto quello che vedrai nella tua bolletta:
- Bundled al minuto: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min fisso), Synthflow e ElevenLabs Conversational. Un numero, tutto incluso.
- Orchestrazione BYOK: Vapi addebita $0,05/min solo per il livello di gestione delle chiamate. I token LLM, i caratteri TTS, i minuti STT e il carrier si fatturano separatamente sui tuoi account.
- Direttamente sull'infrastruttura: Costruire direttamente su OpenAI Realtime più Twilio. Il più economico a scala se metti in cache i prompt. Costoso altrimenti.
Il resto di questo articolo spiega i calcoli livello per livello, poi fornisce una funzione Python tco_per_minute() che puoi incollare in un notebook.
Perché il prezzo al minuto pubblicizzato è una bugia (i 4 livelli di costo)
La tariffa di piattaforma pubblicizzata di $0,05/min copre solo l'orchestrazione. Gli altri quattro livelli si sommano sopra. Ogni agente vocale in produzione nel 2026 paga cinque voci: telefonia, STT, il LLM, TTS e la tariffa di piattaforma che le unisce. Tralascia uno qualsiasi e non hai un agente funzionante.
Ecco il pavimento, livello per livello.
Livello 1: Telefonia (il minuto del carrier)
Paghi una vera telco per l'audio che transita nel e fuori dalla rete telefonica pubblica. Twilio Programmable Voice addebita $0,014/min in uscita negli USA, più $1–$2/mese per numero di telefono. Twilio Elastic SIP varia da $0,0053 a $0,042/min a seconda dell'origine. La maggior parte delle piattaforme di voice AI rivende Twilio con un piccolo margine o lo trasferisce direttamente. In ogni caso, è $0,014/min nel tuo foglio di calcolo.
Livello 2: Riconoscimento vocale (STT)
Converti ciò che ha detto il chiamante in testo che l'LLM può leggere. Deepgram Nova-2 streaming costa circa $0,0043/min nel livello Pay-as-you-go, quindi in pratica $0,005/min. I modelli premium (equivalente a Whisper) salgono a $0,018/min. Le piattaforme bundled lo nascondono nella loro tariffa principale, ma è comunque lì.
Livello 3: L'LLM (testo o audio)
Due percorsi qui. Le pipeline in modalità testo alimentano l'audio trascritto in un modello come GPT-4o-mini ($0,15/M input, $0,60/M output) e alimentano la risposta nel TTS. Un ciclo vocale brucia tipicamente 100–300 token di input e 80–200 token di output per turno, il che ammonta a circa $0,003–$0,015/min per GPT-4o-mini, $0,015–$0,04/min per Claude Haiku. Le pipeline in modalità audio (OpenAI Realtime) saltano il ballo trascrizione/sintesi e fatturano direttamente in token audio. Ne abbiamo una sezione intera sotto; è la leva di costo che nessuno spiega.
Livello 4: Sintesi vocale (TTS)
Sintetizzi la risposta di nuovo in audio. ElevenLabs Turbo costa $0,10/min nel piano Conversational, le voci Premium salgono a $0,12/min. Le voci di fascia inferiore (Deepgram Aura, OpenAI tts-1) arrivano a $0,04–$0,06/min. Questa è di solito la seconda voce più grande dopo la tariffa di piattaforma.
Sommalo al pavimento: $0,014 telefonia + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 piattaforma = $0,114/min minimo su uno stack BYOK. Questo è prima di HIPAA, concorrenza o noleggio numeri. Se vuoi il confronto delle funzionalità testa a testa dopo questa analisi dei prezzi, consulta la nostra analisi Retell AI vs Vapi vs Bland.
Le 8 piattaforme a confronto (tabella prezzi maggio 2026)
La tabella qui sotto raccoglie le tariffe principali e le cifre realistiche tutto incluso dalla pagina dei prezzi di ogni fornitore. Usala come riferimento, non come vangelo: le pagine dei prezzi cambiano, e le tue scelte di stack cambiano il risultato finale.
| Piattaforma | Modello di prezzo | Tariffa principale | Reale tutto incluso (tipico) | HIPAA | BYOK o bundled | Trabocchetto notevole |
|---|---|---|---|---|---|---|
| Retell AI | Al minuto | $0,07–$0,31/min | $0,12–$0,18/min | Incluso | Bundled | Concorrenza $8/mese oltre l'incluso |
| Vapi | Tariffa di piattaforma + BYOK | $0,05/min | $0,13–$0,31/min | +$2.000/mese | BYOK | Tutti e quattro i livelli extra |
| Bland AI | Tariffa fissa al minuto | $0,09/min | $0,09–$0,14/min | Incluso | Bundled | $0,025/min tariffa di trasferimento |
| Synthflow | Al minuto nel piano | $0,09/min base | $0,11–$0,15/min | Incluso | Bundled | Livelli di piano $29/$99/$449/$899 |
| ElevenLabs Conversational | Al minuto | $0,08–$0,12/min | $0,10–$0,18/min | Piano Workspace | Bundled | LLM extra se non sul livello managed |
| Deepgram Voice Agent | All'ora | $4,50/ora ($0,075/min) | $0,09–$0,11/min + telefonia | Sì | Bundled | Aggiungere Twilio sopra |
| OpenAI Realtime API | Token audio | $32/M input, $64/M output | ~$0,30/min grezzo, ~$0,12 in cache | DIY | Diretto | Calcolo token audio (vedi sotto) |
| Twilio (livello telefonia) | Al minuto | $0,014/min USA in uscita | $0,014/min | n/a | n/a | Numeri di telefono $1–$2/mese |
Prezzi verificati a maggio 2026. Controlla sempre le pagine dei prezzi dei fornitori prima di firmare: Vapi ha cambiato il suo componente aggiuntivo HIPAA due volte nell'ultimo anno da solo.
Esempio pratico: quanto costa davvero una chiamata in uscita di 4 minuti?
Lo scenario canonico: una chiamata in uscita di 4 minuti, GPT-4o-mini come LLM, ElevenLabs Turbo come voce, Twilio USA come carrier, solo in inglese. Quando abbiamo eseguito questo esatto scenario su tutte e quattro le piattaforme (Vapi, Retell, Bland, OpenAI Realtime diretto), la tariffa principale spiegava meno della metà del numero finale.
Ipotesi mantenute costanti su tutti e quattro:
- 4 minuti di durata totale
- ~12 turni di conversazione, ~150 token di input + 100 token di output per turno = 1.800 in / 1.200 out per GPT-4o-mini
- Il TTS produce ~400 caratteri per turno × 12 = 4.800 caratteri (ElevenLabs Turbo @ $0,10/min output audio)
- Lo STT fattura i 4 minuti completi (Deepgram Nova-2 @ ~$0,0043/min)
- Twilio in uscita USA @ $0,014/min, $1/mese numero ammortizzato su 1.000 chiamate/mese = $0,001/chiamata
Vapi BYOK: $0,05 → $0,27/min
| Voce | Costo |
|---|---|
| Tariffa di piattaforma Vapi (4 min × $0,05) | $0,200 |
| GPT-4o-mini (1.800 in × $0,15/M + 1.200 out × $0,60/M) | $0,001 |
| ElevenLabs Turbo (4 min × $0,10) | $0,400 |
| Deepgram STT (4 min × $0,005) | $0,020 |
| Twilio (4 min × $0,014) | $0,056 |
| Noleggio numero ammortizzato | $0,001 |
| Totale per la chiamata | $0,678 |
| $/min effettivo | $0,170 |
Nota: ElevenLabs Turbo nel piano Conversational è più vicino a $0,10/min, non tariffa fissa, quindi il calcolo è un addebito al minuto di output audio. Una tariffa di piattaforma di $0,05/min più GPT-4o-mini più ElevenLabs Turbo più Twilio ammonta a più vicino a $0,17–$0,27/min, non $0,05.
Retell bundled: $0,10 → $0,16/min
| Voce | Costo |
|---|---|
| Bundle Retell (4 min × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Pass-through Twilio (4 min × $0,014) | $0,056 |
| Noleggio numero ammortizzato | $0,002 |
| Totale per la chiamata | $0,578 |
| $/min effettivo | $0,145 |
Il bundle di Retell include il LLM (scegli tu il modello), STT e il loro TTS. Ti rimane solo da pagare Twilio sopra. Tutto qui.
Bland tariffa fissa: $0,09 → $0,13/min
| Voce | Costo |
|---|---|
| Bland fisso (4 min × $0,09) | $0,360 |
| Pass-through Twilio (4 min × $0,014) | $0,056 |
| Noleggio numero ammortizzato | $0,001 |
| Totale per la chiamata | $0,417 |
| $/min effettivo | $0,104 |
Bland ha la matematica più chiara nelle SERP. Un numero, più il carrier. Il trucco sta nelle tariffe nascoste — i minuti di trasferimento si fatturano a $0,025/min in più.
OpenAI Realtime diretto (senza caching): $0,30/min
| Voce | Costo |
|---|---|
| OpenAI Realtime audio in (4 min × ~$0,077) | $0,308 |
| OpenAI Realtime audio out (4 min × ~$0,077) | $0,308 |
| Twilio (4 min × $0,014) | $0,056 |
| Noleggio numero ammortizzato | $0,001 |
| Totale per la chiamata | $0,673 |
| $/min effettivo | $0,168 |
Questa cifra presuppone che tu stia mettendo in cache i prompt di sistema. Senza caching, la stessa chiamata arriva più vicino a $1,20 ($0,30/min) perché ogni turno ri-fattura il prompt di sistema completo alle tariffe fresche. Analizziamo quella matematica di seguito.

Bundled vs BYOK: quale modello di prezzo vince per te?
Le piattaforme bundled vincono quando vuoi una sola fattura, matematica prevedibile al minuto e una buona voce di base. BYOK vince quando hai capacità di ingegneria, vuoi scegliere il tuo LLM e pianifichi di negoziare le tariffe del carrier a scala. La decisione di solito si riduce a due domande: hai una preferenza per le voci di fatturazione, e hai uno sviluppatore che si occuperà dello stack?
| Caso d'uso | Bundled vince perché | BYOK vince perché |
|---|---|---|
| Deflection del supporto in entrata | Un fornitore, una fattura, HIPAA incluso | Difficile giustificare il costo di ingegneria |
| Cold calling in uscita a scala | La matematica fissa batte le sorprese per token | Puoi negoziare i minuti del carrier oltre 100k/mese |
| RAG personalizzato + uso di strumenti | Superficie di chiamate agli strumenti limitata nella maggior parte dei bundle | Pieno controllo sulla finestra di contesto |
| Settori regolamentati | Il flag HIPAA si attiva con una casella di controllo | La conformità diventa un tuo problema |
Regola decisionale rapida:
- Sotto 10.000 minuti/mese → il bundled vince quasi sempre sul costo totale di proprietà (solo il tempo di ingegneria fa break-even).
- 10.000–100.000 minuti/mese → BYOK inizia a convenire se hai 1+ ingegnere su di esso.
- Oltre 100.000 minuti/mese → BYOK o direct-on-Realtime è di solito $0,05–$0,10/min più economico, e hai leva per negoziare le tariffe del sub-account Twilio.
Per una prospettiva più approfondita sui costi LLM dal lato BYOK, consulta la nostra analisi delle scelte di orchestrazione nei migliori framework di agenti IA.
Le tariffe nascoste che la maggior parte delle persone manca
Anche quando hai capito la matematica dei quattro livelli, la fattura arriva con voci che la homepage non ha mai menzionato. Questi sette sono quelli che vediamo colpire i clienti più spesso. La maggior parte sono sepolti nel testo piccolo delle pagine dei prezzi o nelle schermate di configurazione post-registrazione. Non sono malevoli, solo poco comunicati.
- Add-on HIPAA. Vapi addebita $2.000/mese per HIPAA secondo la sua pagina dei prezzi. Retell, Bland e Synthflow includono HIPAA senza costi aggiuntivi. Se sei in sanità e stai valutando Vapi, sono $24k/anno prima di aver effettuato una singola chiamata.
- Tassa di arrotondamento al minuto. La maggior parte delle piattaforme arrotonda a intervalli di 60 secondi: una chiamata di 61 secondi viene fatturata come 2 minuti. Con 5.000 chiamate/mese con una distribuzione tipica di 45–90 secondi, questo è un 5–8% di incremento effettivo rispetto a quanto dice la tua matematica $/min. La fatturazione al secondo (Bland, Deepgram) evita questo.
- Noleggio numeri di telefono. Twilio: $1–$2/mese per numero. Retell: $2/mese per numero, $10/mese per numeri verificati. Sembra minuscolo finché non stai gestendo 50 numeri in uscita per il cold calling; quello è un elemento da $100/mese che nessuno ha quotato.
- Tariffe di concorrenza. Retell include una baseline di chiamate concorrenti; oltre quello, sono $8/concorrenza/mese. Un team che esegue 10 chiamate simultanee oltre la baseline aggiunge $80/mese.
- Tariffe di trasferimento. Bland addebita $0,025/min quando l'agente trasferisce a un umano. Se il 20% delle tue chiamate viene trasferito, questa è una tassa significativa sul minuto medio.
- Tariffe della base di conoscenza. Retell ti dà 10 KB gratuiti; ogni ulteriore costa $8/mese. Accumula casi d'uso RAG-intensivi e si accumula velocemente.
- Upsell di voci premium. ElevenLabs Premium aggiunge +$0,04/min su Turbo. Sembra opzionale finché il tuo team di vendita fa test A/B e scopre che Premium converte l'11% meglio.
Hai bisogno di qualcuno che dettagli il tuo caso d'uso specifico prima di firmare un contratto Vapi? Lo facciamo come parte dei nostri impegni di costruzione di agenti vocali.
Token audio e prompt caching: la leva di costo che nessuno spiega
OpenAI Realtime API fattura per token audio, dove 1 token = 100ms di audio in input o 50ms di audio in output. Una chiamata di 60 secondi utilizza circa 600 token di input (il chiamante parla) e 1.200 token di output (l'agente risponde). A $32/M input e $64/M output, questo fa $0,0192 input + $0,0768 output = $0,096 di costo audio grezzo al minuto, o circa $0,10/min prima di aggiungere prompt, strumenti o Twilio.
Poi c'è il prompt di sistema. Ogni turno invia il tuo prompt di sistema completo al modello come parte della finestra di contesto. Un agente vocale tipico ha un prompt di sistema di 2.000 token che copre persona, strumenti, casi limite e logica di rifiuto. Senza caching, quel blocco di 2.000 token viene fatturato a $32/M fresco ad ogni chiamata: $64 su 1.000 chiamate.
Con il prompt caching abilitato (i token in cache costano $0,40/M secondo la documentazione di OpenAI), lo stesso carico di lavoro di 1.000 chiamate viene fatturato $0,80. Questo è uno sconto di 80× sul costo del prompt di sistema. Il prompt caching su OpenAI Realtime riduce il costo del tuo prompt di sistema di 80×. La maggior parte dei team lo scopre solo dopo la prima bolletta mensile.
Ecco la matematica come codice:
# Calcolo del costo dei token audio per OpenAI Realtime
# Input: 1 token / 100ms = 600 token/min
# Output: 1 token / 50ms = 1.200 token/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Tariffe fresche
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # Sconto 80x
# Costo audio grezzo (per chiamata, 1 minuto)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0,096/min
# Prompt di sistema su 1.000 chiamate
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0,80
print(f"Fresco: ${prompt_fresh:.2f} | In cache: ${prompt_cached:.2f}")
# Fresco: $64.00 | In cache: $0.80
Nel nostro lavoro di modellazione dei costi per i clienti che costruiscono direttamente su Realtime, questa è la singola leva più grande tra "Realtime è economico" e "Realtime costa il doppio di Vapi". Se stai usando la Responses API insieme a Realtime per le chiamate agli strumenti, consulta il nostro tutorial OpenAI Responses API per il pattern di implementazione. Ecco perché costruire direttamente su OpenAI Realtime può essere più economico o molto più costoso di Vapi, a seconda che tu faccia o meno il caching.
Come calcolare il tuo TCO (formula + Python)
Il costo totale di proprietà di un agente vocale è il costo variabile al minuto più i costi fissi mensili ammortizzati sul tuo volume di minuti. La formula:
TCO/min = tariffa_piattaforma + costo_LLM + costo_STT + costo_TTS + telefonia + (noleggio_numero + tariffa_concorrenza + tariffa_KB) / minuti_per_mese
Inserisci i tuoi numeri. O fai fork di questo:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # es. 0.05 per Vapi, 0.13 per bundle Retell
llm_in_per_1m: float, # es. 0.15 per input GPT-4o-mini
llm_out_per_1m: float, # es. 0.60 per output GPT-4o-mini
llm_in_tokens_per_call: int, # es. 1800
llm_out_tokens_per_call: int, # es. 1200
tts_per_min: float, # es. 0.10 per ElevenLabs Turbo
stt_per_min: float, # es. 0.005 per Deepgram Nova-2
telephony_per_min: float, # es. 0.014 per Twilio USA
fixed_monthly: float = 0.0, # noleggio numeri, KB, HIPAA, concorrenza
) -> dict:
"""Restituisce il costo totale di proprietà mensile e al minuto."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variabile per chiamata
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Esempio: 5.000 chiamate/mese, 4 min media, stack Vapi BYOK
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mese noleggio numero
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Quattro passaggi numerati per chiunque preveda da zero:
- Stima il tuo volume di chiamate mensile e la durata media delle chiamate.
- Scegli il tuo stack: piattaforma + LLM + TTS + STT + telefonia.
- Cerca il prezzo unitario di ogni componente dalla pagina dei prezzi del fornitore.
- Esegui la formula (o la funzione Python sopra) — l'output è il tuo $/min previsto e il totale mensile.
Se non riesci a scrivere il tuo TCO come formula in una riga, lo perderai su una tassa di arrotondamento al minuto.
Costo a scala: 1k vs 10k vs 100k minuti al mese
Le curve divergono velocemente oltre i 10.000 minuti. Le piattaforme bundled si appiattiscono perché la loro bolletta è solo minuti × tariffa. Gli stack BYOK aumentano man mano che i costi LLM e TTS scalano linearmente con te. OpenAI Realtime con caching supera Vapi intorno a 10k–20k minuti/mese, il punto di inflessione dove il direct-on-infra inizia ad avere senso.
| Piattaforma | 1.000 min/mese | 10.000 min/mese | 100.000 min/mese |
|---|---|---|---|
| Bland fisso $0,09/min + Twilio | $120 | $1.160 | $11.400 |
| Bundle Retell ~$0,145/min tutto incluso | $145 | $1.450 | $14.500 |
| Vapi BYOK ~$0,17/min tutto incluso | $170 | $1.700 | $17.000 |
| OpenAI Realtime + caching ~$0,13/min | $130 | $1.300 | $13.000 |
| Deepgram Voice Agent + Twilio | $108 | $1.080 | $10.800 |
Numeri derivati dalla formula tco_per_minute() sopra con le ipotesi canoniche di chiamata di 4 minuti. Aggiungi HIPAA ($2.000/mese Vapi), concorrenza e noleggio numeri dove applicabile. Non cambiano la forma delle curve ma alzano il pavimento per gli acquirenti a basso volume.
Il grafico hero in cima a questo articolo visualizza gli stessi numeri: Bland si appiattisce presto, Vapi aumenta man mano che i costi LLM scalano, e OpenAI Realtime con caching supera Vapi oltre i 10k minuti.
Quando NON dovresti implementare un agente vocale
La voice AI ha un vero pavimento di $0,10–$0,30/min. Sotto 200 chiamate al mese, un umano più un SaaS da $19 vince ancora in termini di costi. I noleggi di numeri di telefono, le baseline di concorrenza e i minimi di piattaforma sommano a un overhead di $50–$200/mese che un team a basso volume semplicemente non recupera.
Tre criteri onesti per "saltalo":
- Meno di 200 chiamate/mese. Noleggio numeri + addebiti minimi + baseline di concorrenza superano quello che costa un umano part-time a $20/ora. Il break-even non torna.
- Lavoro ad alto contesto e basso volume. Il tuo unico umano gestisce 15 chiamate al giorno, ciascuna con 30+ pattern di fatti unici. Il costo delle allucinazioni LLM (rimborsi, affari persi, appuntamenti sbagliati) erode i risparmi. La voice AI brilla sui flussi ripetitivi, non sul lavoro intensivo di casi limite.
- Settori regolamentati senza budget HIPAA. Il componente aggiuntivo HIPAA da $2k/mese di Vapi, le tariffe di conformità del carrier e i guard-rail PII ($0,005–$0,01/min su Retell) possono far crollare la matematica. Se non riesci a mettere in budget $25k/anno solo per le voci di conformità, esegui prima i pilota su flussi non-PHI.
Nei test, il punto di break-even contro un agente umano per la deflection del supporto arriva intorno a 250–400 chiamate/mese alle tipiche tariffe bundled. Al di sotto, un SaaS da $19/mese più un umano è più economico. Non implementare la voice AI solo perché puoi.

Se la voice AI supera il pavimento dei costi ma non vuoi cablare Retell o Vapi da solo, il nostro servizio di sviluppo di agenti vocali costruisce e gestisce lo stack completo sulla tua infrastruttura.
Come sceglieremmo davvero una piattaforma nel 2026 (verdetto per caso d'uso)
Nessuna singola piattaforma vince ovunque. La scelta più economica seria dipende dal fatto che tu sia in entrata o in uscita, dal fatto che tu abbia capacità di ingegneria e dal fatto che HIPAA sia importante. Cinque casi d'uso, cinque risposte:
- In uscita più economico serio (cold calling): Bland. Fisso $0,09/min, tariffa di trasferimento trasparente, nessuna sorpresa di costi LLM. Saltalo se hai bisogno di RAG profondo o strumenti personalizzati.
- In entrata più economico (deflection del supporto): Retell. Bundled, HIPAA incluso, analytics mature, $0,12–$0,18 tutto incluso. Saltalo se il tuo volume in entrata è sotto le 200 chiamate/mese (vedi la sezione precedente).
- Controllo massimo + RAG personalizzato: Vapi BYOK. Solo se hai capacità di ingegneria per gestire le chiavi LLM, TTS e STT. Il controllo vale $0,27/min solo quando riesci a negoziare il carrier e l'LLM in volume.
- Semplicità bundled a scala: Deepgram Voice Agent. $4,50/ora ($0,075/min) fisso, l'opzione più trascurata nelle SERP. Saltalo se hai bisogno dell'ampia libreria di voci che offre ElevenLabs.
- Livello di qualità conversazionale (demo di vendita, flussi sensibili al brand): ElevenLabs Conversational. Voci Turbo o Premium a $0,10–$0,12/min. Paga il sovrapprezzo quando la qualità vocale è la leva di conversione.
Per una visione più approfondita del settore sul lato enterprise, consulta agenti vocali IA per call center enterprise: stessa matematica, con ipotesi di volume specifiche per ristoranti e cliniche.
Come Techsy affronta la modellazione dei costi per gli agenti vocali
Non vendiamo una piattaforma vocale. Costruiamo agenti vocali in produzione per i clienti su Retell, Vapi, Deepgram e OpenAI Realtime. Questo significa che quando modelliamo i costi per un nuovo impegno, eseguiamo la formula tco_per_minute() su tre livelli di volume (1k, 10k, 100k minuti/mese) prima di raccomandare uno stack. La piattaforma che vince a 1k spesso perde a 100k.
Negoziamo i prezzi del sub-account Twilio per i clienti oltre i 100k minuti/mese (i sub-account sbloccano livelli di volume che la maggior parte dei team non sa esistano), e modelliamo sempre i risparmi del prompt caching sulle build Realtime prima di approvare una progettazione direct-infra. La metà del nostro lavoro di modellazione dei costi per i clienti è disfare ipotesi che qualcuno ha fatto da un post del blog di un fornitore.
Vuoi un agente vocale costruito end-to-end sulla piattaforma che vince davvero per il tuo volume? Scopri come costruiamo gli agenti vocali →
FAQ
Quanto costa un agente vocale IA al minuto nel 2026? Il costo tutto incluso varia da $0,07 a $0,30 al minuto. Le piattaforme bundled (Retell, Bland, ElevenLabs Conversational) arrivano a $0,10–$0,18/min una volta inclusa la telefonia. Le piattaforme BYOK come Vapi arrivano a $0,13–$0,31/min dopo aver aggiunto i costi LLM, TTS, STT e Twilio. OpenAI Realtime diretto si aggira intorno a $0,30/min grezzo o circa $0,12/min con il prompt caching abilitato sui prompt di sistema.
Qual è la piattaforma di agenti vocali IA più economica? Per l'in uscita, Bland AI a $0,09/min fisso ha la matematica più chiara nel mercato. Per il supporto in entrata, Retell a $0,10–$0,16 tutto incluso di solito vince grazie a HIPAA bundled e baseline di concorrenza. Per setup di infrastruttura pura con caching, OpenAI Realtime può scendere sotto $0,15/min. Deepgram Voice Agent a $0,075/min fisso è l'opzione più trascurata.
Perché la mia bolletta Vapi è più alta di $0,05/min? Il $0,05/min sulla pagina dei prezzi di Vapi è solo la tariffa di piattaforma. Vapi è BYOK: porti le tue chiavi per il LLM (GPT-4o-mini, Claude, ecc.), TTS (ElevenLabs, PlayHT), STT (Deepgram) e telefonia (Twilio). Il costo reale tutto incluso arriva a $0,13–$0,31/min a seconda di quale voce e modello scegli.
Qual è la differenza tra BYOK e i prezzi bundled? Le piattaforme bundled (Retell, Bland, Synthflow, ElevenLabs Conversational) includono LLM, STT e TTS in un'unica tariffa al minuto. Le piattaforme BYOK (Vapi) addebitano solo per l'orchestrazione — porti le tue chiavi API per tutto il resto e vieni fatturato separatamente da ogni fornitore. Il bundled è più semplice; BYOK ti dà controllo e leva di negoziazione a scala.
Ci sono tariffe nascoste nei prezzi degli agenti vocali IA? Sì, sette comuni. Add-on HIPAA ($2.000/mese su Vapi), arrotondamento al minuto (5–8% di incremento effettivo a scala), noleggio numeri di telefono ($1–$2/mese), tariffe di concorrenza ($8/concorrenza/mese Retell), tariffe di trasferimento ($0,025/min Bland), tariffe della base di conoscenza ($8/mese per KB su Retell) e upsell di voci premium (+$0,04/min ElevenLabs Premium su Turbo).
L'API OpenAI Realtime è più economica di Vapi? Senza prompt caching, no: OpenAI Realtime costa circa $0,30/min di costo audio grezzo. Con il prompt caching abilitato (token del prompt di sistema in cache a $0,40/M vs $32/M fresco, uno sconto di 80×), la voce del prompt di sistema crolla e il costo totale scende a circa $0,12–$0,15/min. Questo lo rende competitivo con le piattaforme bundled oltre i 10k minuti/mese.
Come prevedo il mio costo mensile dell'agente vocale?
Stima le chiamate al mese moltiplicate per la durata media delle chiamate in minuti. Moltiplica per il $/min tutto incluso della tua piattaforma. Aggiungi i costi fissi mensili: noleggio numeri di telefono, tariffe KB, baseline di concorrenza, add-on HIPAA se applicabile. La funzione Python tco_per_minute() sopra automatizza questo con una singola chiamata di funzione che puoi incollare in un notebook Jupyter.
Fatturazione al minuto o al secondo: quale è più economica? La fatturazione al secondo è significativamente più economica per le brevi chiamate in uscita. Una chiamata di 61 secondi fatturata a intervalli di 60 secondi addebita 2 minuti, il che è una tassa effettiva del 5–8% su 5.000 chiamate al mese con una tipica distribuzione di chiamate brevi. Bland e Deepgram fatturano al secondo; la maggior parte delle piattaforme BYOK eredita l'arrotondamento a 60 secondi di Twilio per impostazione predefinita.
Esistono agenti vocali IA gratuiti? Esistono prove gratuite: la maggior parte dei fornitori offre 10–60 minuti gratuiti (Retell, Vapi, Bland) per testare. Gli agenti vocali di produzione veramente gratuiti non esistono perché paghi sempre almeno i minuti del carrier ($0,014/min su Twilio USA in uscita). Anche gli stack open-source self-hosted (Pipecat, LiveKit Agents) ti lasciano pagare il telecom e l'LLM.
Qual è il ROI della voice AI rispetto a un agente umano? Gli agenti umani costano $15–$30/ora a pieno carico, il che ammonta a $0,25–$0,50/min. La voice AI a $0,10–$0,20/min supera il costo umano oltre circa 200 chiamate al mese, assumendo tassi di risoluzione comparabili. Al di sotto di quel volume, i minimi di piattaforma e l'overhead del noleggio numeri rendono un umano più un SaaS da $19/mese la risposta più economica.
Questa guida è mantenuta dal team editoriale di Techsy. Costruiamo agenti vocali IA in produzione su Retell, Vapi e OpenAI Realtime per i clienti; questi numeri provengono dal lavoro di modellazione dei costi che facciamo ogni settimana, non dai brochure dei fornitori. Prezzi verificati a maggio 2026; conferma sempre con le pagine dei prezzi dei fornitori prima di firmare.