Calcolatore costi sviluppo agente vocale AI

Il costo di sviluppo più i numeri reali al minuto quando lo fai girare su larga scala.

Un agente vocale AI in produzione costa tra 25.000 e 150.000 $ da sviluppare, più 0,08–0,30 $ al minuto di chiamata quando gira su larga scala. Il costo di sviluppo comprende le integrazioni (CRM, calendario, pagamenti), la progettazione dei dialoghi e l'infrastruttura in tempo reale. Il costo al minuto è dominato da speech-to-text, inferenza LLM e text-to-speech messi insieme. Le soluzioni self-hosted abbattono del 60 % il costo al minuto, ma richiedono un investimento iniziale più alto.

Apri il calcolatore

I tuoi parametri

05 fields

Influenza la tariffa media; i senior costano il 35 % in più.

Chi dovrebbe usare questo strumento

Founder che definiscono un progetto voice ai agent prima di parlare coi vendor. CTO e leader engineering che costruiscono il budget annuale per nuovi prodotti. Product manager che traducono un’idea in un range difendibile per la finanza. Team procurement che verificano la coerenza dei preventivi di agenzie e freelance.

Come lo calcoliamo

Il costo di build si basa su una stima a ore. Gli stack gestiti (Retell, Vapi) sono i più rapidi da mettere in produzione. La soluzione best-of-breed offre più controllo, al prezzo di un 25% in più di lavoro di integrazione. Quella self-hosted richiede competenze specifiche sull'infrastruttura vocale e fa salire del 70% il costo iniziale.

Fonti dati

Fattori che muovono il numero

Progettazione del dialogo

La progettazione del dialogo pesa di solito per il 25–35% dello sforzo totale di build ed è ciò che separa i voice agent che funzionano da quelli che frustrano ogni chiamante. La cattiva progettazione del dialogo è il motivo per cui la maggior parte dei voice agent in produzione sembra rotta: gestiscono il caso felice e crollano su tutto il resto. Metti a budget un dialog designer senior o uno specialista di AI conversazionale dal primo giorno, invece di trattarlo come una funzione che un ingegnere aggiunge alla fine. Le ore risparmiate saltando il lavoro sul dialogo le spendi dopo in churn dei clienti.

Profondità delle integrazioni

Prenotare uno slot a calendario è facile: 40–60 ore. Prenotare, più incassare il pagamento, più inviare la conferma, più registrare l'interazione nel tuo CRM, è circa il triplo del lavoro, perché ogni integrazione moltiplica le modalità di fallimento. Un voice agent che gestisce l'intero customer journey in una sola chiamata è una build sensibilmente più difficile di un voice agent che passa la mano a un umano dopo la qualifica. Ogni integrazione aggiunge 40–120 ore più manutenzione continua.

Requisiti di latenza

La voce ha vincoli stringenti di tempo reale che web e mobile non hanno. La latenza completa di andata e ritorno (il chiamante parla, l'agent ragiona, l'agent risponde) deve restare sotto gli 800 ms, altrimenti la conversazione sembra rotta. Gli stack gestiti come Retell e Vapi ci riescono in modo costante. Gli stack self-hosted possono battere la latenza dei gestiti, ma richiedono infrastruttura GPU su edge per tenere veloci speech-to-text e inferenza LLM. L'ottimizzazione della latenza è un lavoro di ingegneria tutt'altro che banale, che la maggior parte dei team sottovaluta.

Lingue e accenti

Ogni lingua aggiuntiva aggiunge localizzazione del dialogo, selezione del modello vocale e test sugli accenti regionali. Una seconda lingua è circa il 25% di lavoro in più, una terza un altro 25%. Il supporto multilingue, in cui i chiamanti passano da una lingua all'altra a metà conversazione (dall'inglese allo spagnolo, per esempio), aggiunge un altro 30%, perché non puoi limitarti a rilevare la lingua una volta sola all'inizio della chiamata. La maggior parte dei voice agent dovrebbe partire con una sola lingua e aggiungerne altre in base ai dati reali delle chiamate.

Economia al minuto

Gli stack gestiti come Retell e Vapi costano 0,12–0,30 $ al minuto end-to-end, inclusi STT, LLM, TTS e telefonia. Gli stack best-of-breed che combinano Deepgram, Claude Sonnet, ElevenLabs e Twilio costano 0,08–0,20 $ al minuto con più controllo. Il self-hosted costa 0,03–0,08 $ al minuto una volta ammortizzata l'infrastruttura, ma richiede un notevole lavoro di ingegneria iniziale. La scelta giusta dipende dal volume di chiamate: il gestito vince sotto i 50K minuti al mese, il self-hosted oltre i 200K.

Come ridurre i costi

Parti da uno stack gestito come Retell o Vapi, invece di costruire best-of-breed o self-hosted dal primo giorno. Le piattaforme gestite si occupano dell'infrastruttura vocale (STT, TTS, telefonia, orchestrazione in tempo reale), così il tuo team si concentra su progettazione del dialogo e integrazioni. Rilasci in 4–8 settimane invece di 12–20, e puoi validare il caso d'uso prima di impegnarti nella build più difficile. Migra a uno stack custom più avanti solo se il volume di chiamate supera i 100K minuti al mese o se le esigenze di qualità eccedono ciò che offrono le piattaforme gestite.

Definisci l'agent su un solo caso d'uso specifico al lancio. La tentazione è costruire un voice agent generico che gestisce tutto: prenotazioni, supporto, vendite, escalation. Il pattern che rilascia e funziona è un solo compito fatto bene, come prenotare appuntamenti o gestire i reset password. I tassi di contenimento su casi d'uso ristretti arrivano al 70–90%; su casi d'uso ampi scendono al 40–60% e i chiamanti imparano a pigiare lo zero. Aggiungi un secondo caso d'uso solo dopo che il primo è solido.

Usa Claude Sonnet 4 o GPT-4o mini per il ragionamento del dialogo invece dei modelli di punta. I voice agent non hanno bisogno di capacità di ragionamento di frontiera per la maggior parte delle chiamate; serve loro una generazione di risposte veloce, economica e affidabile. Sonnet 4 e GPT-4o mini sono 5–10 volte più economici di Opus o GPT-4.5 con qualità comparabile sui task conversazionali delimitati. Risparmiare sul modello è una riduzione del costo al minuto del 30–50% senza penalità di qualità per i tipici casi d'uso vocali.

Registra ogni chiamata, rivedi i fallimenti ogni settimana e itera il dialogo di continuo. I voice agent degradano in silenzio perché nessuno ascolta le chiamate. Imposta una revisione settimanale in cui il team ascolta 10–20 chiamate fallite campionate a caso, individua il pattern e aggiorna il dialogo o la logica di routing. Questo loop continuo è ciò che separa i voice agent che migliorano nel tempo da quelli che peggiorano in sordina man mano che i casi limite si accumulano. Costa 2–4 ore a settimana e si ripaga in tasso di contenimento.

Rilascia con una sola lingua al lancio. Il supporto multilingue aggiunge il 25–30% al costo di build per lingua e complica notevolmente il test del dialogo. Se l'80% delle tue chiamate in entrata è in inglese, rilascia solo in inglese e instrada il resto a un umano. Aggiungi lingue in base al volume reale di chiamate per lingua, non su ipotesi sulla tua base clienti. La maggior parte dei team rilascia un supporto multilingue che nessuno usa, perché ha immaginato una domanda che non si è materializzata.

Rimanda le integrazioni che non sono centrali per il caso d'uso di lancio. Parti dall'unica integrazione di cui l'agent ha assolutamente bisogno (di solito il calendario per le prenotazioni, o il CRM per il contesto di supporto) e aggiungi il resto in base a ciò che i chiamanti chiedono davvero. Ogni integrazione aggiunge 40–120 ore più manutenzione continua, e le integrazioni che costruisci in via speculativa tendono a rompersi per prime, perché nessuno le usa abbastanza da accorgersene. Il lancio più ristretto possibile rilascia più in fretta e ti dà dati reali per decidere cosa costruire dopo.

Costo del voice agent a diversi volumi

StackCosto di buildCosto al minutoCosto mensile @10K min
Gestito (Retell)$25K–$55K$0.12–$0.30/min$1.2K–$3K/mo
Best-of-breed$40K–$85K$0.08–$0.20/min$800–$2K/mo
Self-hosted$70K–$150K$0.03–$0.08/min$300–$800/mo + infra

FAQ

Domande che riceviamo ogni settimana

Risposte brevi in linguaggio chiaro. Se la tua domanda non c’è,

Costo di sviluppo: 25.000–150.000 $. Costo al minuto: 0,08–0,30 $. Un agente che gestisce 10K minuti al mese costa 800–3.000 $ al mese, oltre allo sviluppo iniziale.

Piattaforme gestite (Retell, Vapi) quando vuoi andare in produzione in fretta. Best-of-breed (Deepgram + Claude + ElevenLabs) quando ti servono qualità e controllo. Self-hosted per volumi elevati o requisiti stringenti di privacy.

Per attività ben delimitate (prenotazioni, FAQ, primo smistamento) sì, con tassi di risoluzione autonoma del 70–90 %. Sul supporto complesso l'agente copre il primo livello e poi fa escalation. La sostituzione totale resta rara.

Su attività ben circoscritte la qualità vocale è ormai indistinguibile da quella umana. Nelle conversazioni aperte si percepisce ancora che è un'AI, ma il risultato è spesso accettabile. Il nodo principale resta gestire le interruzioni e il parlato poco chiaro.

Inglese, spagnolo, francese, tedesco e portoghese hanno un supporto eccellente. Arabo, turco e mandarino sono praticabili, ma vanno testati con attenzione. Le lingue tonali presentano ancora un divario di qualità rispetto all'inglese.

MVP con stack gestito: 4–8 settimane. Best-of-breed: 8–14 settimane. Self-hosted: 12–20 settimane. Aggiungi 4–8 settimane per le integrazioni e per affinare i dialoghi.

Speech-to-text: 95–98 % di accuratezza sulle parole in inglese. Ragionamento dell'LLM: 90–95 % su attività ben delimitate. Tasso di successo end-to-end (obiettivo del chiamante raggiunto): 70–90 % a seconda dell'ambito.

Chiamate gestite × (costo umano per chiamata − costo AI per chiamata). Un agente a 0,20 $/min contro un operatore a 3 $/min fa risparmiare 2,80 $/min. Su 10K minuti al mese sono 28.000 $ risparmiati, al netto dei 65.000 $ di sviluppo ammortizzato.

Entrambi. Al telefono tramite Twilio, Vonage o Telnyx SIP; su WhatsApp tramite la Meta Business API. Stessa logica di dialogo, cambiano solo gli adattatori di interfaccia.

Si rilevano i segnali di fallimento (richieste di chiarimento ripetute, chiamante frustrato) e si passa la mano a un operatore con tutto il contesto della chiamata. Non gestire bene questo passaggio è il principale problema di UX nei voice AI in produzione.

Strumenti simili

Altri calcolatori che la maggior parte apre subito dopo questo: scegli quello adatto alla tua prossima decisione.

Ottieni una stima precisa dal nostro team

I calcolatori danno un range. Una call di 30 minuti ti dà scope, tempistiche e budget fissi. Consulenza gratuita, senza impegno.

Inizia la conversazione