
AI Voice Agent Prijzen 2026: De $0,05 vs $0,30 per Minuut Waarheid (Met Berekeningen)
Vapi zet "$0,05/min" op zijn prijspagina. Je eerste maandrekening komt uit op $0,27/min. Wat is er gebeurd? Elk voice AI-platform adverteert één getal — de platformkosten — en rekent je vier andere lagen aan die je niet op de homepage zag. Deze gids herbouwt de ai voice agent prijzen van de grond af: echte BYOK-kosten voor 8 platformen, het audio-token-bedrag dat niemand uitlegt, en een Python-functie die je kunt forken om je eigen rekening te voorspellen.

Snel Antwoord
- Werkelijke all-in kosten in 2026 liggen tussen $0,07–$0,30/min afhankelijk van bundled vs BYOK.
- Bundled platformen (Retell, Bland, ElevenLabs) adverteren $0,07–$0,12/min en landen rond $0,10–$0,18/min.
- BYOK-platformen (Vapi $0,05/min platformkosten) landen op $0,13–$0,31/min na LLM + TTS + STT + Twilio.
- De grootste verborgen hefboom is prompt caching op OpenAI Realtime: tot 80× goedkoper op systeemprompts.
Wat kost een AI voice agent werkelijk in 2026?
De meeste AI voice agents kosten $0,07 tot $0,30 per minuut all-in in 2026. Bundled platformen (Retell, Bland, ElevenLabs) adverteren $0,07–$0,12/min en landen rond $0,10–$0,18/min. BYOK-platformen (Vapi met $0,05/min platformkosten) landen op $0,13–$0,31/min zodra je LLM, TTS, STT en Twilio toevoegt. Rechtstreeks op OpenAI Realtime is het zonder caching ongeveer $0,30/min.
Drie categorieën verklaren bijna alles wat je op je rekening ziet:
- Bundled per minuut: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min vast), Synthflow en ElevenLabs Conversational. Één getal, alles inbegrepen.
- BYOK-orkestratie: Vapi rekent $0,05/min voor alleen de call-handling-laag. LLM-tokens, TTS-tekens, STT-minuten en de carrier worden apart gefactureerd op je eigen accounts.
- Direct op infrastructuur: Bouwen rechtstreeks op OpenAI Realtime plus Twilio. Goedkoopst op schaal als je prompts cacht. Duur als je dat niet doet.
De rest van dit artikel legt de berekening laag voor laag uit en levert dan een Python-functie tco_per_minute() die je in een notebook kunt plakken.
Waarom de geadverteerde prijs per minuut een leugen is (de 4 kostenlagen)
De geadverteerde $0,05/min platformkosten dekken alleen orkestratie. De andere vier lagen stapelen zich er bovenop. Elke productie-voice-agent in 2026 betaalt vijf posten: telefonie, STT, het LLM, TTS en de platformkosten die alles aan elkaar verbinden. Laat één weg en je hebt geen werkende agent.
Hier is de bodem, laag voor laag.
Laag 1: Telefonie (de carrier-minuut)
Je betaalt een echte telecom voor het geluid dat het openbare telefoonnetwerk in en uit gaat. Twilio Programmable Voice rekent $0,014/min uitgaand in de VS, plus $1–$2/maand per telefoonnummer. Twilio Elastic SIP varieert van $0,0053–$0,042/min afhankelijk van oorsprong. De meeste voice AI-platformen verkopen Twilio door met een kleine opslag of geven het direct door. Hoe dan ook: $0,014/min in je spreadsheet.
Laag 2: Spraakherkenning (STT)
Je converteert wat de beller zei naar tekst die het LLM kan lezen. Deepgram Nova-2 streaming loopt ongeveer $0,0043/min op de Pay-as-you-go-laag, in de praktijk dus $0,005/min. Premium modellen (Whisper-equivalent) klimmen naar $0,018/min. Bundled platformen verbergen dit in hun hoofdtarief, maar het zit er nog steeds in.
Laag 3: Het LLM (tekst of audio)
Hier zijn twee paden. Tekstmodus-pipelines voeden getranscribeerde audio in een model zoals GPT-4o-mini ($0,15/M input, $0,60/M output) en sturen het antwoord naar TTS. Een voice-loop verbruikt doorgaans 100–300 inputtokens en 80–200 outputtokens per beurt, wat neerkomt op ongeveer $0,003–$0,015/min voor GPT-4o-mini, $0,015–$0,04/min voor Claude Haiku. Audiomodus-pipelines (OpenAI Realtime) slaan de transcriptie/synthese-dans over en rekenen direct in audiotokens af. Daar hebben we hieronder een hele sectie over; het is de kostenhefboom die niemand uitlegt.
Laag 4: Tekst-naar-spraak (TTS)
Je synthetiseert het antwoord terug naar audio. ElevenLabs Turbo loopt $0,10/min op het Conversational-plan, Premium stemmen klimmen naar $0,12/min. Lagere kwaliteit stemmen (Deepgram Aura, OpenAI tts-1) komen op $0,04–$0,06/min. Dit is meestal de op één na grootste post na de platformkosten.
Tel het op bij de bodem: $0,014 telefonie + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 platform = $0,114/min minimum op een BYOK-stack. Dat is nog zonder HIPAA, gelijktijdigheid of nummerverhuur. Als je na deze prijsvergelijking de directe functievergelijking wilt, lees dan onze Retell AI vs Vapi vs Bland analyse.
De 8 platformen vergeleken (prijstabel mei 2026)
De onderstaande tabel trekt hoofdtarieven en realistische all-in-cijfers uit de prijspagina van elke leverancier. Gebruik het als referentie, niet als evangelie: prijspagina's veranderen, en je stackkeuzes veranderen het eindresultaat.
| Platform | Prijsmodel | Hoofdtarief | Echt all-in (typisch) | HIPAA | BYOK of bundled | Opvallende valkuil |
|---|---|---|---|---|---|---|
| Retell AI | Per minuut | $0,07–$0,31/min | $0,12–$0,18/min | Inbegrepen | Bundled | Gelijktijdigheid $8/maand per extra boven inbegrepen |
| Vapi | Platformkosten + BYOK | $0,05/min | $0,13–$0,31/min | +$2.000/maand | BYOK | Alle vier lagen extra |
| Bland AI | Vast per minuut | $0,09/min | $0,09–$0,14/min | Inbegrepen | Bundled | $0,025/min overdrachtskosten |
| Synthflow | Per minuut op abonnement | $0,09/min basis | $0,11–$0,15/min | Inbegrepen | Bundled | Abonnementslagen $29/$99/$449/$899 |
| ElevenLabs Conversational | Per minuut | $0,08–$0,12/min | $0,10–$0,18/min | Workspace-plan | Bundled | LLM extra tenzij op managed-laag |
| Deepgram Voice Agent | Per uur | $4,50/uur ($0,075/min) | $0,09–$0,11/min + telefonie | Ja | Bundled | Twilio er bovenop |
| OpenAI Realtime API | Audiotokens | $32/M input, $64/M output | ~$0,30/min rauw, ~$0,12 gecached | DIY | Direct | Audiotoken-berekening (zie hieronder) |
| Twilio (telefonie-laag) | Per minuut | $0,014/min VS uitgaand | $0,014/min | n.v.t. | n.v.t. | Telefoonnummers $1–$2/maand |
Prijzen geverifieerd mei 2026. Controleer altijd de prijspagina's van leveranciers voor het tekenen: Vapi heeft zijn HIPAA-add-on het afgelopen jaar alleen al twee keer gewijzigd.
Uitgewerkt voorbeeld: wat kost één 4-minuut uitgaand gesprek echt?
Het canonieke scenario: één 4-minuut uitgaand gesprek, GPT-4o-mini als LLM, ElevenLabs Turbo als stem, Twilio VS als carrier, alleen Engels. Toen we dit exacte scenario uitvoerden voor alle vier platformen (Vapi, Retell, Bland, OpenAI Realtime direct), verklaarde het hoofdtarief minder dan de helft van het eindgetal.
Aannames consistent gehouden voor alle vier:
- 4 minuten totale duur
- ~12 gespreksbeurten, ~150 inputtokens + 100 outputtokens per beurt = 1.800 in / 1.200 out voor GPT-4o-mini
- TTS produceert ~400 tekens per beurt × 12 = 4.800 tekens (ElevenLabs Turbo @ $0,10/min audio-output)
- STT rekent de volledige 4 minuten af (Deepgram Nova-2 @ ~$0,0043/min)
- Twilio uitgaand VS @ $0,014/min, $1/maand nummer geamortiseerd over 1.000 gesprekken/maand = $0,001/gesprek
Vapi BYOK: $0,05 → $0,27/min
| Post | Kosten |
|---|---|
| Vapi platformkosten (4 min × $0,05) | $0,200 |
| GPT-4o-mini (1.800 in × $0,15/M + 1.200 out × $0,60/M) | $0,001 |
| ElevenLabs Turbo (4 min × $0,10) | $0,400 |
| Deepgram STT (4 min × $0,005) | $0,020 |
| Twilio (4 min × $0,014) | $0,056 |
| Nummerverhuur geamortiseerd | $0,001 |
| Totaal voor het gesprek | $0,678 |
| Effectief $/min | $0,170 |
Opmerking: ElevenLabs Turbo op het Conversational-plan is dichter bij $0,10/min, niet een vast tarief, dus de berekening is een per-minuut-audiouitvoerkosten. Een $0,05/min platformkost plus GPT-4o-mini plus ElevenLabs Turbo plus Twilio telt op tot eerder $0,17–$0,27/min, niet $0,05.
Retell bundled: $0,10 → $0,16/min
| Post | Kosten |
|---|---|
| Retell bundel (4 min × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Twilio doorgifte (4 min × $0,014) | $0,056 |
| Nummerverhuur geamortiseerd | $0,002 |
| Totaal voor het gesprek | $0,578 |
| Effectief $/min | $0,145 |
Retells bundel bevat LLM (je kiest het model), STT en hun eigen TTS. Je betaalt alleen Twilio er bovenop. Dat is het.
Bland vast tarief: $0,09 → $0,13/min
| Post | Kosten |
|---|---|
| Bland vast (4 min × $0,09) | $0,360 |
| Twilio doorgifte (4 min × $0,014) | $0,056 |
| Nummerverhuur geamortiseerd | $0,001 |
| Totaal voor het gesprek | $0,417 |
| Effectief $/min | $0,104 |
Bland heeft de duidelijkste berekening in de SERP. Één getal, plus carrier. Het addertje zit in verborgen kosten — overdrachtsminuten worden extra gefactureerd tegen $0,025/min.
OpenAI Realtime direct (zonder caching): $0,30/min
| Post | Kosten |
|---|---|
| OpenAI Realtime audio in (4 min × ~$0,077) | $0,308 |
| OpenAI Realtime audio out (4 min × ~$0,077) | $0,308 |
| Twilio (4 min × $0,014) | $0,056 |
| Nummerverhuur geamortiseerd | $0,001 |
| Totaal voor het gesprek | $0,673 |
| Effectief $/min | $0,168 |
Dit cijfer gaat ervan uit dat je systeemprompts cacht. Zonder caching landt hetzelfde gesprek dichter bij $1,20 ($0,30/min) omdat elke beurt de volledige systeemprompt opnieuw factureert tegen verse tarieven. We leggen die berekening hieronder uit.

Bundled vs BYOK: welk prijsmodel wint voor jou?
Bundled platformen winnen wanneer je één rekening wilt, voorspelbare berekening per minuut en een prima basisvariatie. BYOK wint wanneer je engineering-capaciteit hebt, je eigen LLM wilt kiezen en van plan bent carriertarieven op schaal te onderhandelen. De beslissing draait meestal om twee vragen: heb je een voorkeur voor factureringsregels, en heb je een ontwikkelaar die de stack beheert?
| Gebruiksgeval | Bundled wint omdat | BYOK wint omdat |
|---|---|---|
| Inkomende ondersteuningsomleiding | Één leverancier, één rekening, HIPAA inbegrepen | Engineering-kosten moeilijk te rechtvaardigen |
| Uitgaand koud bellen op schaal | Vaste berekening klopt beter dan per-token-verrassingen | Je kunt carriersminuten onderhandelen boven 100k/maand |
| Aangepaste RAG + toolgebruik | Beperkt tool-call-oppervlak in de meeste bundles | Volledige controle over het contextvenster |
| Gereguleerde sectoren | HIPAA-vlag schakelt in via een selectievakje | Naleving wordt jouw probleem |
Snelle beslissingsregel:
- Onder 10.000 minuten/maand → bundled wint bijna altijd op totale eigendomskosten (alleen al de engineering-tijd maakt break-even).
- 10.000–100.000 minuten/maand → BYOK begint zich te lonen als je 1+ engineer daarop hebt.
- Boven 100.000 minuten/maand → BYOK of direct-on-Realtime is meestal $0,05–$0,10/min goedkoper, en je hebt onderhandelingskracht voor Twilio sub-account tarieven.
Voor een dieper LLM-kostenperspectief aan de BYOK-kant, zie onze analyse van orchestratiekeuzes in beste AI agent frameworks.
De verborgen kosten die de meeste mensen missen
Zelfs wanneer je de vier-lagen-berekening beheerst, arriveert de rekening met posten die de homepage nooit noemde. Deze zeven zijn degene die we klanten het vaakst zien treffen. De meeste zijn begraven in de kleine lettertjes van de prijspagina of in post-aanmeld configuratieschermen. Ze zijn niet kwaadaardig, gewoon ondercommuniceerd.
- HIPAA add-on. Vapi rekent $2.000/maand voor HIPAA volgens zijn prijspagina. Retell, Bland en Synthflow bevatten HIPAA zonder extra kosten. Als je in de gezondheidszorg zit en Vapi overweegt, is dat $24k/jaar voordat je één gesprek hebt gevoerd.
- Per-minuut afrondingsbelasting. De meeste platformen ronden af op 60-seconde-intervallen: een 61-seconde gesprek wordt gefactureerd als 2 minuten. Bij 5.000 gesprekken/maand met een typische 45–90 seconde verdeling is dat een 5–8% effectieve opslag boven wat je $/min-berekening zegt. Per-seconde facturering (Bland, Deepgram) slaat dit over.
- Telefoonnummerverhuur. Twilio: $1–$2/maand per nummer. Retell: $2/maand per nummer, $10/maand voor geverifieerde nummers. Ziet er klein uit totdat je 50 uitgaande nummers voor cold calling beheert; dat is een $100/maand post die niemand vermeldde.
- Gelijktijdigheidskosten. Retell bevat een basislijn van gelijktijdige gesprekken; daarboven is het $8/gelijktijdigheid/maand. Een team dat 10 gelijktijdige gesprekken boven de basislijn voert, betaalt $80/maand meer.
- Overdrachtskosten. Bland rekent $0,025/min wanneer de agent overdraagt aan een mens. Als 20% van je gesprekken overdragen, is dat een significante belasting op de gemiddelde minuut.
- Kennisbasistoelagen. Retell geeft je 10 KB's gratis; elk extra kost $8/maand. Bij RAG-intensieve gevallen componeert dat snel.
- Premium stem upsells. ElevenLabs Premium voegt +$0,04/min toe boven Turbo. Klinkt optioneel totdat je verkoopteam A/B-tests uitvoert en ontdekt dat Premium 11% beter converteert.
Heb je iemand nodig om je specifieke gebruiksgeval te specificeren voor het ondertekenen van een Vapi-contract? We doen dat als onderdeel van onze voice agent bouwengagementen.
Audiotokens en prompt caching: de kostenhefboom die niemand uitlegt
OpenAI Realtime API factureert per audiotoken, waarbij 1 token = 100ms audio-input of 50ms audio-output. Een 60-seconde gesprek gebruikt ongeveer 600 inputtokens (beller spreekt) en 1.200 outputtokens (agent antwoordt). Bij $32/M input en $64/M output is dat $0,0192 input + $0,0768 output = $0,096 rauwe audiokosten per minuut, of ongeveer $0,10/min voor je prompts, tools of Twilio toevoegt.
Dan is er de systeemprompt. Elke beurt stuurt je volledige systeemprompt naar het model als deel van het contextvenster. Een typische voice agent heeft een 2.000-token systeemprompt met persona, tools, randgevallen en weigeringslogica. Zonder caching wordt dat 2.000-token blok gefactureerd tegen $32/M vers bij elk gesprek: $64 over 1.000 gesprekken.
Met prompt caching ingeschakeld (gecachete tokens kosten $0,40/M per OpenAI's documentatie) wordt dezelfde 1.000-gesprek-workload gefactureerd voor $0,80. Dat is een 80× korting op systeempromptkosten. Prompt caching op OpenAI Realtime verlaagt je systeempromptkosten met 80×. De meeste teams ontdekken dit pas na hun eerste maandrekening.
Hier is de berekening als code:
# Audiotoken kostberekening voor OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1.200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Verse tarieven
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x korting
# Ruwe audiokosten (per gesprek, 1 minuut)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0,096/min
# Systeemprompt over 1.000 gesprekken
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0,80
print(f"Vers: ${prompt_fresh:.2f} | Gecached: ${prompt_cached:.2f}")
# Vers: $64.00 | Gecached: $0.80
In ons kostenmodelleringswerk voor klanten die direct op Realtime bouwen, is dit de enige grootste hefboom tussen "Realtime is goedkoop" en "Realtime is twee keer zo duur als Vapi". Als je de Responses API naast Realtime gebruikt voor tool calls, zie onze OpenAI Responses API handleiding voor het implementatiepatroon. Dit is waarom direct bouwen op OpenAI Realtime goedkoper of veel duurder kan zijn dan Vapi, afhankelijk van of je cacht.
Hoe je je eigen TCO berekent (formule + Python)
Totale eigendomskosten voor een voice agent is de variabele kosten per minuut plus maandelijkse vaste kosten geamortiseerd over je minutenvolume. De formule:
TCO/min = platformkosten + LLM_kosten + STT_kosten + TTS_kosten + telefonie + (nummerverhuur + gelijktijdigheidskosten + KB_kosten) / minuten_per_maand
Vul je eigen getallen in. Of fork dit:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # bijv. 0.05 voor Vapi, 0.13 voor Retell bundel
llm_in_per_1m: float, # bijv. 0.15 voor GPT-4o-mini input
llm_out_per_1m: float, # bijv. 0.60 voor GPT-4o-mini output
llm_in_tokens_per_call: int, # bijv. 1800
llm_out_tokens_per_call: int, # bijv. 1200
tts_per_min: float, # bijv. 0.10 voor ElevenLabs Turbo
stt_per_min: float, # bijv. 0.005 voor Deepgram Nova-2
telephony_per_min: float, # bijv. 0.014 voor Twilio VS
fixed_monthly: float = 0.0, # nummerverhuur, KB, HIPAA, gelijktijdigheid
) -> dict:
"""Geeft maandelijkse en per-minuut totale eigendomskosten terug."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variabel per gesprek
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Voorbeeld: 5.000 gesprekken/maand, 4-min gemiddeld, Vapi BYOK stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/maand nummerverhuur
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Vier genummerde stappen voor iedereen die vanaf nul voorspelt:
- Schat je maandelijkse gespreksvolume en gemiddelde gespreksduur.
- Kies je stack: platform + LLM + TTS + STT + telefonie.
- Zoek de prijs per eenheid van elk onderdeel op via de leveranciersprijs pagina.
- Voer de formule uit (of de bovenstaande Python-functie) — output is je voorspelde $/min en maandelijks bedrag.
Als je je TCO niet als een eenregelige formule kunt schrijven, verlies je dat aan een per-minuut afrondingsbelasting.
Kosten op schaal: 1k vs 10k vs 100k minuten per maand
De curves divergeren snel boven 10.000 minuten. Bundled platformen vlakken af omdat hun rekening gewoon minuten × tarief is. BYOK-stacks stijgen naarmate LLM- en TTS-kosten lineair meegroeien. OpenAI Realtime met caching kruist Vapi rond 10k–20k minuten/maand, het kantelpunt waar direct-on-infra zinvol begint te worden.
| Platform | 1.000 min/maand | 10.000 min/maand | 100.000 min/maand |
|---|---|---|---|
| Bland vast $0,09/min + Twilio | $120 | $1.160 | $11.400 |
| Retell bundel ~$0,145/min all-in | $145 | $1.450 | $14.500 |
| Vapi BYOK ~$0,17/min all-in | $170 | $1.700 | $17.000 |
| OpenAI Realtime + caching ~$0,13/min | $130 | $1.300 | $13.000 |
| Deepgram Voice Agent + Twilio | $108 | $1.080 | $10.800 |
Getallen afgeleid van de tco_per_minute() formule hierboven met de canonieke 4-minuut gesprekassumpties. Voeg HIPAA ($2.000/maand Vapi), gelijktijdigheid en nummerverhuur toe waar van toepassing. Ze veranderen de curvevormen niet, maar verhogen wel de bodem voor kopers met laag volume.
De hero-grafiek bovenaan dit artikel visualiseert dezelfde getallen: Bland vlakt vroeg af, Vapi stijgt naarmate LLM-kosten meegroeien, en OpenAI Realtime met caching klopt Vapi boven 10k minuten.
Wanneer je GEEN voice agent moet inzetten
Voice AI heeft een echte $0,10–$0,30/min bodem. Onder 200 gesprekken per maand wint een mens plus een $19 SaaS nog steeds op kosten. Telefoonnummerverhuur, gelijktijdigheidsbasislijnen en platform-minima tellen op tot een $50–$200/maand overhead die een laag-volume team gewoon niet terugverdient.
Drie eerlijke "sla het over" criteria:
- Minder dan 200 gesprekken/maand. Nummerverhuur + minimumkosten + gelijktijdigheidsbasislijnen overtreffen wat een deeltijdsmens kost bij $20/uur. De break-even rekent niet.
- Contextrijk, laag-volume werk. Je ene mens handelt dagelijks 15 gesprekken af, elk met 30+ unieke feitenpatronen. LLM-hallucinatiekosten (terugbetalingen, verloren deals, verkeerde afspraken) eten de besparingen op. Voice AI blinkt uit bij repetitieve stromen, niet bij edge-case-intensief werk.
- Gereguleerde sectoren zonder HIPAA-budget. Vapi's $2k/maand HIPAA add-on, carrier compliance-kosten en PII-beveiligingen ($0,005–$0,01/min bij Retell) kunnen de berekening laten instorten. Als je niet $25k/jaar kunt budgetteren voor alleen compliance-posten, voer dan eerst pilots uit op niet-PHI-stromen.
In testen landt het break-evenpunt tegenover een menselijke agent voor ondersteuningsomleiding rond 250–400 gesprekken/maand bij typische bundled tarieven. Daarvoor is een $19/maand SaaS plus een mens goedkoper. Zet geen voice agent in gewoon omdat je het kunt.

Als voice AI de kostenbodem haalt maar je Retell of Vapi niet zelf wilt bekabelen, bouwt en beheert onze voice agent-ontwikkelingsservice de volledige stack op jouw infrastructuur.
Hoe we in 2026 echt een platform zouden kiezen (oordeel per gebruiksgeval)
Geen enkel platform wint overal. De goedkoopste serieuze keuze hangt af van of je inkomend of uitgaand bent, of je engineering-capaciteit hebt en of HIPAA belangrijk is. Vijf gebruiksgevallen, vijf antwoorden:
- Goedkoopste serieuze uitgaand (koud bellen): Bland. Vast $0,09/min, transparente overdrachtskosten, geen verrassende LLM-kosten. Sla het over als je diep RAG of aangepaste tools nodig hebt.
- Goedkoopste inkomend (ondersteuningsomleiding): Retell. Gebundeld, HIPAA inbegrepen, volwassen analytics, $0,12–$0,18 all-in. Sla het over als je inkomende volume onder 200 gesprekken/maand is (zie de vorige sectie).
- Maximale controle + aangepaste RAG: Vapi BYOK. Alleen als je engineering-capaciteit hebt om de LLM-, TTS- en STT-sleutels te beheren. De controle is $0,27/min waard alleen als je de carrier en LLM in volume kunt onderhandelen.
- Gebundelde eenvoud op schaal: Deepgram Voice Agent. $4,50/uur ($0,075/min) vast, de meest over het hoofd geziene optie in de SERP. Sla het over als je de brede stembibliotheek nodig hebt die ElevenLabs biedt.
- Gespreksstandaard (verkoopdemo's, merkgevoelige stromen): ElevenLabs Conversational. Turbo- of Premium-stemmen bij $0,10–$0,12/min. Betaal de toeslag wanneer stemkwaliteit de conversiehefboom is.
Voor een dieper sectoroverzicht aan de enterprise-kant, zie AI voice agents voor enterprise callcenters: dezelfde berekening, met restaurant- en kliniekspecifieke volumeassumpties.
Hoe Techsy voice agent kostenmodellering aanpakt
We verkopen geen spraakplatform. We bouwen productie-voice-agents voor klanten op Retell, Vapi, Deepgram en OpenAI Realtime. Dat betekent dat wanneer we kosten modelleren voor een nieuw engagement, we de tco_per_minute() formule uitvoeren op drie volumelagen (1k, 10k, 100k minuten/maand) voor we een stack aanbevelen. Het platform dat wint bij 1k verliest vaak bij 100k.
We onderhandelen Twilio sub-account prijzen voor klanten boven 100k minuten/maand (sub-accounts ontgrendelen volumelagen die de meeste teams niet weten te bestaan), en we modelleren altijd de prompt-caching-besparingen op Realtime-builds voor we een direct-infra-ontwerp aftekenen. De helft van ons kostenmodelleringswerk voor klanten is aannames terugdraaien die iemand maakte vanuit een leveranciersblogpost.
Wil je een voice agent end-to-end gebouwd op het platform dat echt wint voor jouw volume? Zie hoe we voice agents bouwen →
FAQ
Hoeveel kost een AI voice agent per minuut in 2026? All-in kosten variëren van $0,07 tot $0,30 per minuut. Bundled platformen (Retell, Bland, ElevenLabs Conversational) landen op $0,10–$0,18/min zodra telefonie is inbegrepen. BYOK-platformen zoals Vapi landen op $0,13–$0,31/min nadat LLM-, TTS-, STT- en Twilio-kosten zijn toegevoegd. OpenAI Realtime direct zit rond $0,30/min rauw of ongeveer $0,12/min met prompt caching ingeschakeld op systeemprompts.
Wat is het goedkoopste AI voice agent platform? Voor uitgaand is Bland AI bij $0,09/min vast de duidelijkste berekening op de markt. Voor inkomende ondersteuning wint Retell bij $0,10–$0,16 all-in meestal dankzij gebundelde HIPAA en gelijktijdigheidsbasislijnen. Voor pure infrastructuursetups met caching kan OpenAI Realtime onder $0,15/min zakken. Deepgram Voice Agent bij $0,075/min vast is de meest over het hoofd geziene optie.
Waarom is mijn Vapi-rekening hoger dan $0,05/min? De $0,05/min op Vapi's prijspagina is alleen de platformkosten. Vapi is BYOK: je brengt je eigen sleutels mee voor het LLM (GPT-4o-mini, Claude, etc.), TTS (ElevenLabs, PlayHT), STT (Deepgram) en telefonie (Twilio). Werkelijke all-in kosten landen op $0,13–$0,31/min afhankelijk van welke stem en model je kiest.
Wat is het verschil tussen BYOK en bundled prijzen? Bundled platformen (Retell, Bland, Synthflow, ElevenLabs Conversational) bevatten LLM, STT en TTS in één per-minuut tarief. BYOK-platformen (Vapi) rekenen alleen voor orkestratie — je brengt je eigen API-sleutels mee voor al het andere en wordt apart gefactureerd door elke leverancier. Bundled is eenvoudiger; BYOK geeft je controle en onderhandelingskracht op schaal.
Zijn er verborgen kosten bij AI voice agent prijzen? Ja, zeven veelvoorkomende. HIPAA add-ons ($2.000/maand bij Vapi), per-minuut afronding (5–8% effectieve opslag op schaal), telefoonnummerverhuur ($1–$2/maand), gelijktijdigheidskosten ($8/gelijktijdigheid/maand Retell), overdrachtskosten ($0,025/min Bland), kennisbasiskosten ($8/maand per KB bij Retell) en premium stem upsells (+$0,04/min ElevenLabs Premium boven Turbo).
Is OpenAI Realtime API goedkoper dan Vapi? Zonder prompt caching niet: OpenAI Realtime kost ongeveer $0,30/min rauwe audiokosten. Met prompt caching ingeschakeld (gecachete systeemprompt-tokens bij $0,40/M vs $32/M vers, een 80× korting) klapt de systeemprompt-post in en zakken de totale kosten naar ongeveer $0,12–$0,15/min. Dat maakt het competitief met bundled platformen boven 10k minuten/maand.
Hoe voorspel ik mijn maandelijkse voice agent kosten?
Schat gesprekken per maand vermenigvuldigd met gemiddelde gespreksduur in minuten. Vermenigvuldig met de all-in $/min van je platform. Voeg maandelijkse vaste kosten toe: telefoonnummerverhuur, kennisbasiskosten, gelijktijdigheidsbasislijn, HIPAA add-on indien van toepassing. De tco_per_minute() Python-functie hierboven automatiseert dit met één functieaanroep die je in een Jupyter-notebook kunt plakken.
Per-minuut of per-seconde facturering: wat is goedkoper? Per-seconde facturering is zinvol goedkoper voor korte uitgaande gesprekken. Een 61-seconde gesprek gefactureerd in 60-seconde-intervallen rekent 2 minuten aan, wat een 5–8% effectieve belasting is bij 5.000 gesprekken per maand met een typische korte-gesprek verdeling. Bland en Deepgram factureren per seconde; de meeste BYOK-platformen erven standaard Twilio's 60-seconde afronding.
Zijn er gratis AI voice agents? Gratis proefversies bestaan: de meeste leveranciers bieden 10–60 gratis minuten (Retell, Vapi, Bland) aan om te testen. Echte gratis productie-voice-agents bestaan niet omdat je altijd minimaal carriersminuten betaalt ($0,014/min op Twilio VS uitgaand). Zelfs zelfgehoste open-source stacks (Pipecat, LiveKit Agents) laten je de telecom en het LLM betalen.
Wat is de ROI van voice AI vs een menselijke agent? Menselijke agents kosten $15–$30/uur volledig belast, wat neerkomt op $0,25–$0,50/min. Voice AI bij $0,10–$0,20/min klopt menselijke kosten boven ongeveer 200 gesprekken per maand, bij vergelijkbare oplossingspercentages. Daaronder maakt de platform-minima en nummerverhuur-overhead een mens plus een $19/maand SaaS het goedkopere antwoord.
Deze gids wordt bijgehouden door het Techsy-redactieteam. We bouwen productie AI voice agents op Retell, Vapi en OpenAI Realtime voor klanten; deze getallen komen van kostenmodelleringswerk dat we elke week doen, niet van leveranciersbrochures. Prijzen geverifieerd mei 2026; bevestig altijd met leveranciersprijs pagina's voor het ondertekenen.