Kostnadskalkulator for utvikling av voice AI-agenter

Byggekostnad pluss økonomien per minutt når du kjører agenten i full skala.

En voice AI-agent i produksjon koster 25 000–150 000 $ å bygge, pluss 0,08–0,30 $ per samtaleminutt i skala. Byggekostnaden dekker integrasjoner (CRM, kalender, betaling), dialogdesign og sanntidsinfrastruktur. Kostnaden per minutt drives først og fremst av tale-til-tekst, LLM-inferens og tekst-til-tale lagt sammen. Selv-hostede løsninger kutter kostnaden per minutt med 60 %, men krever en høyere investering i starten.

Åpne kalkulatoren

Dine forutsetninger

05 fields

Påvirker den blandede timeraten; seniorutviklere koster 35 % mer.

Hvem bør bruke verktøyet

Gründere som skal avgrense et voice ai agent-prosjekt før de snakker med leverandører. CTO-er og teknologiledere som setter opp årsbudsjett for nytt produktarbeid. Produktledere som skal gjøre en énlinjes idé om til et spenn finansavdelingen kan stå inne for. Innkjøpsteam som vil kontrollregne tilbud fra byråer og konsulenter.

Slik beregner vi

Byggekostnaden bygger på timebasert estimering. Administrerte stacker (Retell, Vapi) er raskest å få i drift. Best-of-breed gir mer kontroll, men 25 % mer integrasjonsarbeid. Selv-hostet krever ekspertise på taleinfrastruktur og driver startkostnaden opp 70 %.

Datakilder

Faktorer som påvirker tallet

Dialogdesign

Dialogdesign står typisk for 25 til 35 % av den totale byggeinnsatsen, og det er dette som skiller voice-agenter som faktisk virker fra dem som frustrerer hver eneste innringer. Dårlig dialogdesign er grunnen til at de fleste voice-agenter i produksjon føles ødelagte: de takler den ideelle veien og kollapser på alt annet. Sett av budsjett til en senior dialogdesigner eller en spesialist på conversational AI fra dag én, i stedet for å behandle det som noe en utvikler skrur på til slutt. Timene du sparer ved å hoppe over dialogarbeidet, betaler du for senere i form av kundefrafall.

Integrasjonsdybde

Å booke en kalendertid er enkelt: 40 til 60 timer. Booking pluss betaling pluss bekreftelse pluss logging av interaksjonen i CRM-et ditt er rundt 3 ganger så mye arbeid, fordi hver integrasjon mangedobler antall ting som kan gå galt. En voice-agent som håndterer hele kundereisen i én samtale er et vesentlig tyngre bygg enn en agent som overleverer til et menneske etter kvalifisering. Hver integrasjon legger til 40 til 120 timer, pluss løpende vedlikehold.

Latenskrav

Tale har harde sanntidskrav som web og mobil ikke har. Den samlede rundtur-latensen (innringeren snakker, agenten tenker, agenten svarer) må lande under 800 ms, ellers føles samtalen ødelagt. Administrerte stacker som Retell og Vapi treffer dette konsekvent. Selv-hostede stacker kan slå administrert latens, men krever edge-GPU-infrastruktur for å holde tale-til-tekst og LLM-inferens raske nok. Latensoptimalisering er krevende ingeniørarbeid som de fleste team undervurderer.

Språk og aksenter

Hvert ekstra språk krever lokalisering av dialogen, valg av stemmemodell og testing på tvers av regionale aksenter. Et andrespråk er rundt 25 % mer arbeid, et tredje ytterligere 25 %. Støtte for blandet språk, der innringere bytter språk midt i samtalen (for eksempel fra engelsk til spansk), legger på ytterligere 30 %, fordi du ikke kan nøye deg med å oppdage språket én gang i starten av samtalen. De fleste voice-agenter bør lanseres på ett språk og utvides med flere basert på faktiske samtaledata.

Økonomi per minutt

Administrerte stacker som Retell og Vapi koster $0,12 til $0,30 per minutt ende til ende, inkludert STT, LLM, TTS og telefoni. Best-of-breed-stacker som kombinerer Deepgram, Claude Sonnet, ElevenLabs og Twilio ligger på $0,08 til $0,20 per minutt, med mer kontroll. Selv-hostet ligger på $0,03 til $0,08 per minutt når infrastrukturen er nedbetalt, men krever betydelig ingeniørarbeid i forkant. Riktig valg avhenger av samtalevolumet: administrert vinner under 50 000 minutter i måneden, selv-hostet vinner over 200 000.

Slik reduserer du kostnaden

Start med en administrert stack som Retell eller Vapi i stedet for å bygge best-of-breed eller selv-hostet fra dag én. Administrerte plattformer tar seg av taleinfrastrukturen (STT, TTS, telefoni, sanntidsorkestrering), slik at teamet ditt kan konsentrere seg om dialogdesign og integrasjoner. Du lanserer på 4 til 8 uker i stedet for 12 til 20, og du får validert bruksscenarioet før du binder deg til det tyngre bygget. Bytt til en egen stack senere bare hvis samtalevolumet passerer 100 000 minutter i måneden, eller hvis kvalitetskravene overgår det administrerte plattformer leverer.

Avgrens agenten til ett konkret bruksscenario ved lansering. Fristelsen er å bygge en altmuligagent som håndterer alt: booking, support, salg og eskalering. Mønsteret som faktisk lanserer og virker er én jobb gjort skikkelig, som å booke avtaler eller tilbakestille passord. På smale bruksscenarioer løses 70 til 90 % av samtalene uten menneske; på brede faller andelen til 40 til 60 %, og innringerne lærer seg fort å hamre på null-tasten. Legg til et nytt bruksscenario først når det første står støtt.

Bruk Claude Sonnet 4 eller GPT-4o mini til dialogresonnementet i stedet for flaggskipmodellene. Voice-agenter trenger ikke resonnement på frontier-nivå for de fleste samtaler; de trenger rask, billig og pålitelig svargenerering. Sonnet 4 og GPT-4o mini er 5 til 10 ganger billigere enn Opus eller GPT-4.5, med sammenlignbar kvalitet på avgrensede samtaleoppgaver. Å spare på modellen kutter kostnaden per minutt med 30 til 50 % uten kvalitetstap for typiske voice-scenarioer.

Ta opp hver samtale, gjennomgå feilene ukentlig og forbedre dialogen løpende. Voice-agenter forfaller i det stille fordi ingen lytter til samtalene. Sett opp en ukentlig gjennomgang der teamet lytter til 10 til 20 tilfeldig utvalgte mislykkede samtaler, finner mønsteret og oppdaterer dialogen eller rutinglogikken. Denne løpende sløyfen er det som skiller agenter som blir bedre over tid fra agenter som umerkelig blir dårligere etter hvert som spesialtilfellene hoper seg opp. Det koster 2 til 4 timer i uken og betaler seg tilbake i andelen samtaler som løses uten menneske.

Lanser på ett språk. Flerspråksstøtte legger 25 til 30 % til byggekostnaden per språk og kompliserer dialogtestingen betydelig. Hvis 80 % av de innkommende samtalene dine er på engelsk, lanser kun på engelsk og rut resten til et menneske. Legg til språk basert på faktisk samtalevolum per språk, ikke på antakelser om kundebasen. De fleste team lanserer flerspråksstøtte ingen bruker, fordi de så for seg en etterspørsel som aldri kom.

Utsett integrasjoner som ikke er sentrale for lanseringsscenarioet. Start med den ene integrasjonen agenten faktisk må ha (typisk kalender for booking, eller CRM for supportkontekst), og legg til resten basert på det innringerne faktisk etterspør. Hver integrasjon legger til 40 til 120 timer pluss løpende vedlikehold, og integrasjoner du bygger på spekulasjon ryker gjerne først, fordi ingen bruker dem nok til å oppdage at de er ødelagt. Den smalest mulige lanseringen kommer raskest ut og gir deg reelle data til å avgjøre hva du bør bygge videre.

Kostnad for voice agent ved ulike volumer

StackByggekostnadKostnad per minuttMånedlig kostnad @10K min
Administrert (Retell)$25K–$55K$0.12–$0.30/min$1.2K–$3K/mo
Best-of-breed$40K–$85K$0.08–$0.20/min$800–$2K/mo
Selv-hostet$70K–$150K$0.03–$0.08/min$300–$800/mo + infra

FAQ

Spørsmål vi får hver uke

Korte svar på vanlig norsk. Mangler spørsmålet ditt,

Byggekostnad: 25 000–150 000 $. Driftskostnad per minutt: 0,08–0,30 $. En agent som håndterer 10 000 minutter i måneden koster 800–3 000 $ i måneden, pluss selve bygget.

Administrerte plattformer (Retell, Vapi) for rask lansering. Best-of-breed (Deepgram + Claude + ElevenLabs) for kvalitet og kontroll. Selv-hostet for høyt volum eller strenge personvernkrav.

For godt avgrensede oppgaver (booking, FAQ, triage): ja, med 70–90 % av samtalene løst uten menneske. For kompleks støtte håndterer agentene førstelinje og eskalerer videre. Ren erstatning er sjelden.

På snevre, godt avgrensede oppgaver: umulig å skille fra et menneske på stemmekvalitet. På åpne samtaler: fortsatt merkbart KI, men ofte godt nok. Det største gjenstående problemet er å håndtere avbrytelser og utydelig tale.

Engelsk, spansk, fransk, tysk og portugisisk har utmerket støtte. Arabisk, tyrkisk og mandarin fungerer, men krever testing. Tonespråk har fortsatt et kvalitetsgap sammenlignet med engelsk.

MVP på administrert stack: 4–8 uker. Best-of-breed: 8–14 uker. Selv-hostet: 12–20 uker. Legg til 4–8 uker for integrasjoner og iterasjon på dialogen.

Tale-til-tekst: 95–98 % ordnøyaktighet på engelsk. LLM-resonnement: 90–95 % på godt avgrensede oppgaver. Suksessrate ende til ende (innringeren oppnår målet sitt): 70–90 % avhengig av omfang.

Håndterte samtaler × (menneskekostnad per samtale − KI-kostnad per samtale). En KI-agent til 0,20 $/min mot et menneske til 3 $/min sparer 2,80 $/min. På 10 000 minutter i måneden blir det 28 000 $ spart, minus den amortiserte byggekostnaden på 65 000 $.

Begge deler. Telefon via Twilio, Vonage eller Telnyx SIP. WhatsApp via Meta Business API. Samme dialoglogikk, bare ulike grensesnittadaptere.

Du oppdager feilsignaler (gjentatte avklaringer, frustrerte innringere) og overleverer til et menneske med hele samtalekonteksten. Å ikke klare en smidig overlevering er det største UX-problemet i voice AI i produksjon.

Lignende verktøy

Andre kalkulatorer folk flest åpner rett etter denne; velg den som passer din neste beslutning.

Få et nøyaktig estimat fra teamet vårt

Kalkulatorer gir deg et spenn. En 30-minutters samtale gir deg fast omfang, tidsplan og budsjett. Gratis rådgivning, helt uforpliktende.

Start samtalen