Kostencalculator voor voice-AI-agents
Bouwkosten plus de economie per minuut wanneer je op schaal draait.
Een voice-AI-agent voor productie kost $25.000 tot $150.000 om te bouwen, plus $0,08 tot $0,30 per gespreksminuut op schaal. In de bouwkosten zitten de integraties (CRM, agenda, betalingen), het dialoogontwerp en de realtime-infrastructuur. De kosten per minuut draaien vooral om speech-to-text, LLM-inferentie en text-to-speech die op elkaar gestapeld zijn. Self-hosted varianten drukken de kosten per minuut met 60%, maar vragen wel een hogere investering vooraf.
Jouw invoer
05 fieldsBepaalt het gemiddelde uurtarief; senior engineers kosten 35 % meer.
Wie deze tool zou moeten gebruiken
Founders die een voice ai agent-project afbakenen voordat ze met leveranciers praten. CTO’s en engineering leaders die een jaarbudget opstellen voor nieuw productwerk. Productmanagers die een idee van één regel vertalen naar een onderbouwde range voor finance. Inkoopteams die offertes van bureaus en freelancers willen toetsen.
Hoe we dit berekenen
De bouwkosten schatten we op basis van uren. Managed stacks (Retell, Vapi) gaan het snelst live. Best-of-breed geeft je meer controle, maar kost 25% meer integratiewerk. Self-hosted vraagt expertise in spraakinfrastructuur en jaagt de aanloopkosten met 70% omhoog.
Databronnen
Wat het bedrag omhoog of omlaag duwt
Dialoogontwerp
Dialoogontwerp is doorgaans goed voor 25 tot 35% van de totale bouwinspanning en bepaalt het verschil tussen een voice-agent die werkt en een die elke beller tot wanhoop drijft. Slecht dialoogontwerp is precies waarom de meeste voice-agents in productie rammelen: ze handelen het happy path af en lopen vast op al het andere. Zet vanaf dag één een ervaren dialoogontwerper of conversational-AI-specialist in, in plaats van het ontwerp te zien als iets wat een engineer er op het eind nog even bij doet. De uren die je bespaart door het dialoogwerk over te slaan, betaal je later terug in klantverloop.
Integratiediepte
Een agendaslot inplannen is eenvoudig: 40 tot 60 uur. Inplannen plus betaling innen plus een bevestiging versturen plus het gesprek loggen in je CRM is grofweg 3 keer zoveel werk, want elke integratie vermenigvuldigt de manieren waarop het mis kan gaan. Een voice-agent die de hele klantreis in één gesprek afrondt, is een fors zwaardere bouw dan een agent die na de kwalificatie overdraagt aan een mens. Elke integratie kost 40 tot 120 uur extra, plus doorlopend onderhoud.
Latency-eisen
Voice kent harde realtime-eisen die web en mobiel niet hebben. De volledige round-trip latency (de beller spreekt, de agent denkt na, de agent antwoordt) moet onder de 800ms blijven, anders voelt het gesprek onnatuurlijk. Managed stacks als Retell en Vapi halen dit consistent. Self-hosted stacks kunnen die latency verslaan, maar dan heb je edge-GPU-infrastructuur nodig om speech-to-text en LLM-inferentie snel te houden. Latency optimaliseren is verre van triviaal engineeringwerk en wordt door de meeste teams onderschat.
Talen en accenten
Elke extra taal vraagt om dialooglokalisatie, de keuze van een stemmodel en tests over verschillende regionale accenten. Een tweede taal is grofweg 25% meer werk, een derde nog eens 25%. Ondersteuning voor gemengde talen, waarbij bellers midden in een gesprek wisselen (bijvoorbeeld van Engels naar Spaans), telt er nog eens 30% bovenop, want je kunt de taal niet één keer aan het begin van het gesprek vaststellen. De meeste voice-agents kunnen het best met één taal starten en er pas talen bij doen op basis van echte gespreksdata.
Economie per minuut
Managed stacks als Retell en Vapi kosten $0,12 tot $0,30 per minuut end-to-end, inclusief STT, LLM, TTS en telefonie. Best-of-breed stacks die Deepgram, Claude Sonnet, ElevenLabs en Twilio combineren, komen op $0,08 tot $0,20 per minuut, met meer controle. Self-hosted zit op $0,03 tot $0,08 per minuut zodra de infrastructuur is afgeschreven, maar vraagt veel engineering vooraf. De juiste keuze hangt af van je gespreksvolume: onder de 50K minuten per maand wint managed, boven de 200K wint self-hosted.
Hoe je kosten verlaagt
Begin met een managed stack als Retell of Vapi in plaats van vanaf dag één best-of-breed of self-hosted te bouwen. Managed platforms regelen de spraakinfrastructuur (STT, TTS, telefonie en realtime-orkestratie), zodat je team zich kan richten op dialoogontwerp en integraties. Je gaat live in 4 tot 8 weken in plaats van 12 tot 20, en je kunt de use case valideren voordat je je vastlegt op de zwaardere bouw. Stap pas over naar een eigen stack zodra je gespreksvolume boven de 100K minuten per maand komt of de kwaliteitseisen verder reiken dan wat managed platforms bieden.
Beperk de agent bij de lancering tot één specifieke use case. De verleiding is groot om een allesdoende voice-agent te bouwen die afspraken, support, sales én escalatie afhandelt. Wat in de praktijk wél werkt, is één taak goed doen, zoals afspraken inplannen of wachtwoordresets afhandelen. Op smalle use cases halen de containmentpercentages 70 tot 90%; bij brede use cases zakken ze naar 40 tot 60% en gaan bellers vanzelf op nul drukken om een mens te krijgen. Voeg pas een tweede use case toe als de eerste echt solide draait.
Gebruik Claude Sonnet 4 of GPT-4o mini voor de dialoog-reasoning in plaats van de vlaggenschipmodellen. Voice-agents hebben voor de meeste gesprekken geen frontier-reasoning nodig; ze hebben snelle, goedkope en betrouwbare antwoordgeneratie nodig. Sonnet 4 en GPT-4o mini zijn 5 tot 10 keer goedkoper dan Opus of GPT-4.5, met vergelijkbare kwaliteit op afgebakende conversationele taken. Op het model besparen levert 30 tot 50% lagere kosten per minuut op, zonder kwaliteitsverlies bij typische voice-toepassingen.
Neem elk gesprek op, beoordeel wekelijks de mislukte gesprekken en blijf de dialoog bijschaven. Voice-agents gaan ongemerkt achteruit omdat niemand de gesprekken terugluistert. Zet een wekelijkse review op waarin het team 10 tot 20 willekeurig gekozen mislukte gesprekken terugluistert, het patroon herkent en de dialoog- of routinglogica aanpast. Juist deze doorlopende loop maakt het verschil tussen voice-agents die met de tijd beter worden en agents die stilletjes verslechteren naarmate de edge cases zich opstapelen. Het kost 2 tot 4 uur per week en verdient zich terug in een hoger containmentpercentage.
Lanceer met één taal. Meertalige ondersteuning telt 25 tot 30% per taal op bij de bouwkosten en maakt het testen van de dialoog flink ingewikkelder. Is 80% van je inkomende gesprekken in het Engels, lanceer dan alleen in het Engels en stuur de rest door naar een mens. Voeg talen toe op basis van het werkelijke gespreksvolume per taal, niet op aannames over je klantenbestand. De meeste teams bouwen meertalige ondersteuning die niemand gebruikt, gebaseerd op vraag die er uiteindelijk nooit kwam.
Stel integraties uit die niet essentieel zijn voor de use case waarmee je lanceert. Begin met de ene integratie die de agent echt nodig heeft (meestal de agenda om af te spreken, of de CRM voor supportcontext) en voeg de rest pas toe op basis van wat bellers daadwerkelijk vragen. Elke integratie kost 40 tot 120 uur extra plus doorlopend onderhoud, en integraties die je op voorhand bouwt, breken vaak als eerste omdat niemand ze genoeg gebruikt om het op te merken. De smalst mogelijke lancering gaat het snelst live en levert je echte data om te bepalen wat je daarna bouwt.
Kosten van een voice-agent bij verschillende volumes
| Stack | Bouwkosten | Kosten per minuut | Maandkosten @10K min |
|---|---|---|---|
| Managed (Retell) | $25K–$55K | $0.12–$0.30/min | $1.2K–$3K/mo |
| Best-of-breed | $40K–$85K | $0.08–$0.20/min | $800–$2K/mo |
| Self-hosted | $70K–$150K | $0.03–$0.08/min | $300–$800/mo + infra |
FAQ
Vragen die we elke week krijgen
Korte antwoorden in duidelijke taal. Staat je vraag er niet bij,
Bouwkosten: $25.000 tot $150.000. Kosten per minuut: $0,08 tot $0,30. Een agent die 10K minuten per maand afhandelt, kost $800 tot $3.000 per maand, plus de eenmalige bouw.
Managed platforms (Retell, Vapi) als je snel live wilt. Best-of-breed (Deepgram + Claude + ElevenLabs) als je kwaliteit en controle voorop zet. Self-hosted bij hoog volume of strenge privacy-eisen.
Voor goed afgebakende taken (afspraken, FAQ, eerste triage): ja, met containmentpercentages van 70 tot 90%. Bij complexe support handelen voice-agents tier-1 zelf af en schalen ze de rest door. Volledig vervangen is zeldzaam.
Bij strak afgebakende taken is de stemkwaliteit niet meer van een mens te onderscheiden. Bij open gesprekken klinkt het nog hoorbaar als AI, maar vaak acceptabel. Het grootste resterende knelpunt: omgaan met onderbrekingen en onduidelijke spraak.
Engels, Spaans, Frans, Duits en Portugees worden uitstekend ondersteund. Arabisch, Turks en Mandarijn zijn bruikbaar, maar vragen om grondig testen. Tonale talen halen nog niet de kwaliteit van het Engels.
MVP op een managed stack: 4 tot 8 weken. Best-of-breed: 8 tot 14 weken. Self-hosted: 12 tot 20 weken. Reken nog 4 tot 8 weken extra voor integraties en het bijschaven van de dialoog.
Speech-to-text: 95 tot 98% woordnauwkeurigheid in het Engels. LLM-redenering: 90 tot 95% bij afgebakende taken. End-to-end succespercentage (de beller bereikt zijn doel): 70 tot 90%, afhankelijk van de scope.
Afgehandelde gesprekken × (kosten per gesprek voor een mens − kosten per gesprek voor de AI). Een agent van $0,20/min versus een mens van $3/min bespaart $2,80 per minuut. Op 10K minuten per maand is dat $28.000 bespaard, minus de afgeschreven bouwkosten van $65.000.
Allebei. Telefonie via Twilio, Vonage of Telnyx SIP. WhatsApp via de Meta Business API. Dezelfde dialooglogica, alleen een andere interface-adapter.
Je detecteert faalsignalen (herhaalde vragen om verduidelijking, een gefrustreerde beller) en draagt het gesprek met de volledige context over aan een mens. Niet soepel kunnen overdragen is het grootste UX-probleem in voice AI in productie.
Vergelijkbare tools
Andere calculators die mensen meestal meteen hierna openen; kies degene die past bij je volgende beslissing.
Eenmalige bouwkosten plus wat het maandelijks kost om te draaien; het complete plaatje.
Krijg een precieze schatting van ons team
Een calculator geeft je een range. Een gesprek van 30 minuten geeft een vaste scope, planning en budget. Gratis advies, vrijblijvend.
Start het gesprek