
AI Voice Agent-priser 2026: Sanningen om $0,05 vs $0,30 per Minut (Med Beräkningar)
Vapi skriver "$0,05/min" på sin prissida. Din första månadsräkning kommer in på $0,27/min. Vad hände? Varje voice AI-plattform marknadsför ett tal — plattformsavgiften — och fakturerar dig fyra andra lager du inte såg på startsidan. Den här guiden bygger upp ai voice agent-prissättningen från grunden: verkliga BYOK-kostnader för 8 plattformar, posten för audio-tokens som ingen förklarar, och en Python-funktion du kan forka för att förutsäga din egen faktura.

Snabbt Svar
- Verklig all-in-kostnad 2026 landar mellan $0,07–$0,30/min beroende på bundled vs BYOK.
- Bundled-plattformar (Retell, Bland, ElevenLabs) marknadsför $0,07–$0,12/min och landar runt $0,10–$0,18/min.
- BYOK-plattformar (Vapi $0,05/min plattformsavgift) landar på $0,13–$0,31/min efter LLM + TTS + STT + Twilio.
- Den största dolda hävstången är prompt caching på OpenAI Realtime: upp till 80× billigare på systemprompts.
Vad kostar en AI voice agent faktiskt 2026?
De flesta AI voice agents kostar $0,07 till $0,30 per minut all-in 2026. Bundled-plattformar (Retell, Bland, ElevenLabs) marknadsför $0,07–$0,12/min och landar runt $0,10–$0,18/min. BYOK-plattformar (Vapi med $0,05/min plattformsavgift) landar på $0,13–$0,31/min när du lägger till LLM, TTS, STT och Twilio. Direkt på OpenAI Realtime är det ungefär $0,30/min utan caching.
Tre kategorier förklarar nästan allt du ser på din faktura:
- Bundled per minut: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min fast), Synthflow och ElevenLabs Conversational. Ett tal, allt ingår.
- BYOK-orkestrering: Vapi tar $0,05/min enbart för samtalshanteringsskiktet. LLM-tokens, TTS-tecken, STT-minuter och operatören faktureras separat på dina egna konton.
- Direkt på infrastruktur: Bygga direkt på OpenAI Realtime plus Twilio. Billigast i skala om du cachar prompts. Dyrt om du inte gör det.
Resten av det här inlägget går igenom matematiken lager för lager och levererar sedan en Python-funktion tco_per_minute() du kan klistra in i en notebook.
Varför det annonserade minutpriset är en lögn (de 4 kostnadsskikten)
Den annonserade plattformsavgiften på $0,05/min täcker bara orkestrering. De andra fyra lagren staplas ovanpå. Varje produktions-voice-agent 2026 betalar fem poster: telefoni, STT, LLM, TTS och plattformsavgiften som håller ihop dem. Hoppa över en enda och du har inte en fungerande agent.
Här är golvet, lager för lager.
Lager 1: Telefoni (operatörminuten)
Du betalar en riktig telecom för det ljud som färdas in och ut ur det allmänna telenätet. Twilio Programmable Voice fakturerar $0,014/min utgående i USA, plus $1–$2/månad per telefonnummer. Twilio Elastic SIP varierar från $0,0053–$0,042/min beroende på ursprung. De flesta voice AI-plattformar säljer Twilio vidare med en liten marginal eller för det direkt vidare. Oavsett: $0,014/min i ditt kalkylblad.
Lager 2: Tal-till-text (STT)
Du konverterar vad uppringaren sade till text som LLM kan läsa. Deepgram Nova-2 streaming kostar ungefär $0,0043/min på Pay-as-you-go-nivån, i praktiken alltså $0,005/min. Premiummodeller (Whisper-ekvivalent) klättrar till $0,018/min. Bundled-plattformar gömmer detta i sin rubrikpris, men det finns ändå där.
Lager 3: LLM (text eller ljud)
Två vägar här. Text-mode-pipelines matar transkriberat ljud in i en modell som GPT-4o-mini ($0,15/M input, $0,60/M output) och matar svaret till TTS. En röstloop bränner typiskt 100–300 input-tokens och 80–200 output-tokens per tur, vilket ger ungefär $0,003–$0,015/min för GPT-4o-mini, $0,015–$0,04/min för Claude Haiku. Ljud-mode-pipelines (OpenAI Realtime) hoppar över transkriptions/syntesdansen och fakturerar direkt i audio-tokens. Vi har ett helt avsnitt om det nedan; det är kostnadshabstången som ingen förklarar.
Lager 4: Text-till-tal (TTS)
Du syntetiserar svaret tillbaka till ljud. ElevenLabs Turbo kostar $0,10/min på Conversational-planen, premiumröster klättrar till $0,12/min. Lägre röster (Deepgram Aura, OpenAI tts-1) kommer in på $0,04–$0,06/min. Det är vanligtvis den näst största posten efter plattformsavgiften.
Lägg ihop på golvet: $0,014 telefoni + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 plattform = $0,114/min minimum på ett BYOK-stack. Det är innan HIPAA, samtidighet eller nummerhyror. Om du vill ha jämförelse av funktioner ansikte mot ansikte efter den här prisdyken, se vår Retell AI vs Vapi vs Bland-genomgång.
De 8 plattformarna jämförda (pristabell maj 2026)
Tabellen nedan hämtar rubrikpriser och realistiska all-in-siffror från varje leverantörs prissida. Använd det som referens, inte som evangelium: prissidor ändras och dina stackval ändrar slutresultatet.
| Plattform | Prismodell | Rubrikpris | Verklig all-in (typisk) | HIPAA | BYOK eller bundled | Notabel fälla |
|---|---|---|---|---|---|---|
| Retell AI | Per minut | $0,07–$0,31/min | $0,12–$0,18/min | Ingår | Bundled | Samtidighet $8/mån per extra utöver inkluderat |
| Vapi | Plattformsavgift + BYOK | $0,05/min | $0,13–$0,31/min | +$2 000/mån | BYOK | Alla fyra lager extra |
| Bland AI | Fast per minut | $0,09/min | $0,09–$0,14/min | Ingår | Bundled | $0,025/min transferavgift |
| Synthflow | Per minut i plan | $0,09/min bas | $0,11–$0,15/min | Ingår | Bundled | Plannivåer $29/$99/$449/$899 |
| ElevenLabs Conversational | Per minut | $0,08–$0,12/min | $0,10–$0,18/min | Workspace-plan | Bundled | LLM extra om inte på managed-nivå |
| Deepgram Voice Agent | Per timme | $4,50/tim ($0,075/min) | $0,09–$0,11/min + telefoni | Ja | Bundled | Lägg till Twilio ovanpå |
| OpenAI Realtime API | Audio-tokens | $32/M input, $64/M output | ~$0,30/min rå, ~$0,12 cachad | DIY | Direkt | Audio-token-beräkning (se nedan) |
| Twilio (telefoniskikt) | Per minut | $0,014/min USA utgående | $0,014/min | n/a | n/a | Telefonnummer $1–$2/mån |
Priser verifierade maj 2026. Kontrollera alltid leverantörers prissidor innan du skriver på: Vapi ändrade sitt HIPAA-tillägg två gånger under det senaste året ensamt.
Bearbetat exempel: vad kostar ett 4-minuters utgående samtal egentligen?
Det kanoniska scenariot: ett 4-minuters utgående samtal, GPT-4o-mini som LLM, ElevenLabs Turbo som röst, Twilio USA som operatör, enbart engelska. När vi körde det här exakta scenariot på alla fyra plattformar (Vapi, Retell, Bland, OpenAI Realtime direkt) förklarade rubrikpriset mindre än hälften av det slutliga talet.
Antaganden hållna konstanta på alla fyra:
- 4 minuters total varaktighet
- ~12 konversationsturer, ~150 input-tokens + 100 output-tokens per tur = 1 800 in / 1 200 ut för GPT-4o-mini
- TTS producerar ~400 tecken per tur × 12 = 4 800 tecken (ElevenLabs Turbo @ $0,10/min audio-output)
- STT fakturerar hela 4 minuterna (Deepgram Nova-2 @ ~$0,0043/min)
- Twilio utgående USA @ $0,014/min, $1/mån nummer amorterat över 1 000 samtal/mån = $0,001/samtal
Vapi BYOK: $0,05 → $0,27/min
| Post | Kostnad |
|---|---|
| Vapi plattformsavgift (4 min × $0,05) | $0,200 |
| GPT-4o-mini (1 800 in × $0,15/M + 1 200 ut × $0,60/M) | $0,001 |
| ElevenLabs Turbo (4 min × $0,10) | $0,400 |
| Deepgram STT (4 min × $0,005) | $0,020 |
| Twilio (4 min × $0,014) | $0,056 |
| Nummerhyra amorterad | $0,001 |
| Totalt för samtalet | $0,678 |
| Effektivt $/min | $0,170 |
Obs: ElevenLabs Turbo på Conversational-planen är närmre $0,10/min, inte fast pris, så beräkningen är en per-minut-avgift för audio-output. En plattformsavgift på $0,05/min plus GPT-4o-mini plus ElevenLabs Turbo plus Twilio summerar till närmre $0,17–$0,27/min, inte $0,05.
Retell bundled: $0,10 → $0,16/min
| Post | Kostnad |
|---|---|
| Retell bundle (4 min × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Twilio genomgång (4 min × $0,014) | $0,056 |
| Nummerhyra amorterad | $0,002 |
| Totalt för samtalet | $0,578 |
| Effektivt $/min | $0,145 |
Retells bundle inkluderar LLM (du väljer modellen), STT och deras egna TTS. Du betalar bara Twilio ovanpå. Det är allt.
Bland fast pris: $0,09 → $0,13/min
| Post | Kostnad |
|---|---|
| Bland fast (4 min × $0,09) | $0,360 |
| Twilio genomgång (4 min × $0,014) | $0,056 |
| Nummerhyra amorterad | $0,001 |
| Totalt för samtalet | $0,417 |
| Effektivt $/min | $0,104 |
Bland har den renaste matematiken i SERP. Ett tal, plus operatör. Fällan sitter i dolda avgifter — transferminuter faktureras till $0,025/min ovanpå.
OpenAI Realtime direkt (utan caching): $0,30/min
| Post | Kostnad |
|---|---|
| OpenAI Realtime audio in (4 min × ~$0,077) | $0,308 |
| OpenAI Realtime audio out (4 min × ~$0,077) | $0,308 |
| Twilio (4 min × $0,014) | $0,056 |
| Nummerhyra amorterad | $0,001 |
| Totalt för samtalet | $0,673 |
| Effektivt $/min | $0,168 |
Den siffran förutsätter att du cachar systemprompts. Utan caching landar samma samtal närmre $1,20 ($0,30/min) eftersom varje tur återfakturerar hela systemprompteten till färska priser. Vi packar upp den matematiken nedan.

Bundled vs BYOK: vilket prismodell vinner för dig?
Bundled-plattformar vinner när du vill ha en enda faktura, förutsägbar minutmatematik och en bra grundläggande röst. BYOK vinner när du har ingenjörskapacitet, vill välja din egen LLM och planerar att förhandla om operatörspriser i skala. Beslutet handlar vanligtvis om två frågor: har du en faktureringsradspreferens, och har du en utvecklare som äger stacken?
| Användningsfall | Bundled vinner för att | BYOK vinner för att |
|---|---|---|
| Inkommande supportavledning | En leverantör, en faktura, HIPAA ingår | Svårt att motivera ingenjörskostnaden |
| Utgående kalla samtal i skala | Fast matematik slår per-token-överraskningar | Du kan förhandla operatörminuter bortom 100k/mån |
| Anpassad RAG + verktygsanvändning | Begränsad verktygssanropsyta i de flesta bundles | Full kontroll över kontextfönstret |
| Reglerade branscher | HIPAA-flaggan slås på med en kryssruta | Compliance blir ditt problem |
Snabb beslutsregel:
- Under 10 000 minuter/mån → bundled vinner nästan alltid på total ägandekostnad (ingenjörstiden ensam gör break-even).
- 10 000–100 000 minuter/mån → BYOK börjar löna sig om du har 1+ ingenjör på det.
- Över 100 000 minuter/mån → BYOK eller direct-on-Realtime är vanligtvis $0,05–$0,10/min billigare, och du har hävstång för att förhandla Twilio-underkontopriserna.
För ett djupare LLM-kostnadsperspektiv på BYOK-sidan, se vår analys av orkestreringsval i bästa AI-agentramverk.
De dolda avgifterna som de flesta missar
Även när du har klätt av sig fyrlagermatematiken, kommer fakturan med poster som hemsidan aldrig nämnde. Dessa sju är de vi ser träffa kunder oftast. De flesta är begravda i prisidornas finstilta text eller i konfigurationsskärmar efter registrering. De är inte illasinnade, bara underkommunicerade.
- HIPAA-tillägg. Vapi tar $2 000/mån för HIPAA enligt dess prissida. Retell, Bland och Synthflow inkluderar HIPAA utan extra kostnad. Om du är inom sjukvård och väger Vapi, är det $24k/år innan du har gjort ett enda samtal.
- Minutavrundningsskatt. De flesta plattformar rundar till 60-sekundersintervall: ett 61-sekunders samtal faktureras som 2 minuter. Med 5 000 samtal/mån med en typisk 45–90-sekunder-fördelning är det ett 5–8% effektivt påslag jämfört med vad din $/min-matematik säger. Per-sekund-fakturering (Bland, Deepgram) hoppar över detta.
- Telefonnummerhyror. Twilio: $1–$2/mån per nummer. Retell: $2/mån per nummer, $10/mån för verifierade nummer. Ser litet ut tills du kör 50 utgående nummer för kalla samtal; det är en $100/mån-post som ingen citerade.
- Samtidighetsavgifter. Retell inkluderar en baslinje för samtidiga samtal; bortom det är det $8/samtidighet/mån. Ett team som kör 10 simultana samtal bortom baslinjen lägger till $80/mån.
- Transferavgifter. Bland tar $0,025/min när agenten transfererar till en människa. Om 20% av dina samtal transfereras är det en meningsfull skatt på genomsnittlig minut.
- Kunskapsbas-avgifter. Retell ger dig 10 KB:er gratis; varje ytterligare är $8/mån. Stapla RAG-intensiva användningsfall och det ackumuleras snabbt.
- Premiumröstuppgraderingar. ElevenLabs Premium lägger till +$0,04/min över Turbo. Låter valfritt tills ditt säljteam A/B-testar och hittar att Premium konverterar 11% bättre.
Behöver du någon som specificerar ditt specifika användningsfall innan du skriver på ett Vapi-kontrakt? Vi gör det som en del av våra voice agent-byggengagemang.
Audio-tokens och prompt caching: kostnadshabstången som ingen förklarar
OpenAI Realtime API fakturerar per audio-token, där 1 token = 100ms audio-input eller 50ms audio-output. Ett 60-sekunders samtal använder ungefär 600 input-tokens (uppringaren pratar) och 1 200 output-tokens (agenten svarar). Till $32/M input och $64/M output ger det $0,0192 input + $0,0768 output = $0,096 rå audiokostnad per minut, eller ungefär $0,10/min innan du lägger till prompts, verktyg eller Twilio.
Sedan finns det systemprompteten. Varje tur skickar din fullständiga systempromt till modellen som en del av kontextfönstret. En typisk voice agent har en 2 000-token systempromt som täcker persona, verktyg, kantfall och avslagslogik. Utan caching faktureras det 2 000-token-blocket till $32/M färskt vid varje samtal: $64 över 1 000 samtal.
Med prompt caching aktiverat (cachade tokens kostar $0,40/M enligt OpenAIs dokumentation), faktureras samma 1 000-samtals-arbetsbelastning för $0,80. Det är en 80× rabatt på systemprompt-kostnader. Prompt caching på OpenAI Realtime minskar din systemprompt-kostnad med 80×. De flesta team hittar detta bara efter sin första månadsräkning.
Här är matematiken som kod:
# Audio-token-kostnadsberäkning för OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1 200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Färska priser
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x rabatt
# Rå audiokostnad (per samtal, 1 minut)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0,096/min
# Systemprompt över 1 000 samtal
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0,80
print(f"Färskt: ${prompt_fresh:.2f} | Cachat: ${prompt_cached:.2f}")
# Färskt: $64.00 | Cachat: $0.80
I vårt kostnadsmodelleringsarbete för kunder som bygger direkt på Realtime är detta den enskilt största hävstången mellan "Realtime är billigt" och "Realtime kostar dubbelt så mycket som Vapi". Om du använder Responses API bredvid Realtime för verktygsanrop, se vår OpenAI Responses API-handledning för implementeringsmönstret. Det är därför att bygga direkt på OpenAI Realtime kan vara billigare eller mycket dyrare än Vapi, beroende på om du cachar.
Hur du beräknar din egen TCO (formel + Python)
Total ägandekostnad för en voice agent är den variabla kostnaden per minut plus månadsliga fasta avgifter amorterade över din minutvolym. Formeln:
TCO/min = plattformsavgift + LLM_kostnad + STT_kostnad + TTS_kostnad + telefoni + (nummerhyra + samtidighetsavgift + KB_avgift) / minuter_per_månad
Stoppa in dina tal. Eller forka det här:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # t.ex. 0.05 för Vapi, 0.13 för Retell-bundle
llm_in_per_1m: float, # t.ex. 0.15 för GPT-4o-mini input
llm_out_per_1m: float, # t.ex. 0.60 för GPT-4o-mini output
llm_in_tokens_per_call: int, # t.ex. 1800
llm_out_tokens_per_call: int, # t.ex. 1200
tts_per_min: float, # t.ex. 0.10 för ElevenLabs Turbo
stt_per_min: float, # t.ex. 0.005 för Deepgram Nova-2
telephony_per_min: float, # t.ex. 0.014 för Twilio USA
fixed_monthly: float = 0.0, # nummerhyror, KB, HIPAA, samtidighet
) -> dict:
"""Returnerar månatlig och per-minut total ägandekostnad."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variabel per samtal
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Exempel: 5 000 samtal/mån, 4 min snitt, Vapi BYOK-stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mån nummerhyra
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Fyra numrerade steg för den som prognostiserar från noll:
- Uppskatta din månadsliga samtalsvolym och genomsnittlig samtalslängd.
- Välj ditt stack: plattform + LLM + TTS + STT + telefoni.
- Slå upp enhetspriset för varje komponent från leverantörens prissida.
- Kör formeln (eller Python-funktionen ovan) — output är ditt prognostiserade $/min och månadstotal.
Om du inte kan skriva din TCO som en enradsformel kommer du att förlora det på en minutavrundningsskatt.
Kostnad i skala: 1k vs 10k vs 100k minuter per månad
Kurvorna divergerar snabbt bortom 10 000 minuter. Bundled-plattformar planar ut eftersom deras faktura bara är minuter × pris. BYOK-stacks stiger när LLM- och TTS-kostnaderna skalerar linjärt med dig. OpenAI Realtime med caching korsar Vapi runt 10k–20k minuter/mån, inflektionspunkten där direct-on-infra börjar ge mening.
| Plattform | 1 000 min/mån | 10 000 min/mån | 100 000 min/mån |
|---|---|---|---|
| Bland fast $0,09/min + Twilio | $120 | $1 160 | $11 400 |
| Retell bundle ~$0,145/min all-in | $145 | $1 450 | $14 500 |
| Vapi BYOK ~$0,17/min all-in | $170 | $1 700 | $17 000 |
| OpenAI Realtime + caching ~$0,13/min | $130 | $1 300 | $13 000 |
| Deepgram Voice Agent + Twilio | $108 | $1 080 | $10 800 |
Siffror härledda från tco_per_minute()-formeln ovan med de kanoniska 4-minuterssamtalsantagandena. Lägg till HIPAA ($2 000/mån Vapi), samtidighet och nummerhyror där de gäller. De ändrar inte kurvformen men höjer golvet för köpare med låg volym.
Hero-diagrammet överst i det här inlägget visualiserar samma siffror: Bland planar tidigt, Vapi stiger när LLM-kostnaderna skalas, och OpenAI Realtime med caching slår Vapi bortom 10k minuter.
När du INTE bör distribuera en voice agent
Voice AI har ett verkligt $0,10–$0,30/min-golv. Under 200 samtal per månad vinner en människa plus en $19 SaaS fortfarande på kostnad. Telefonnummerhyror, samtidighetsbaslinjer och plattformsminimum summerar till en $50–$200/mån-overhead som ett lågvolymsteam helt enkelt inte återhämtar.
Tre ärliga "skippa det"-kriterier:
- Färre än 200 samtal/mån. Nummerhyror + minimiavgifter + samtidighetsbaslinjer överstiger vad en deltidsmänniska kostar på $20/tim. Break-even fungerar inte.
- Kontextrikt arbete med låg volym. Din enda människa hanterar 15 samtal om dagen, var och en med 30+ unika faktmönster. LLM-hallucinationskostnaden (återbetalningar, förlorade affärer, felaktiga möten) äter upp besparingarna. Voice AI lyser på repetitiva flöden, inte på kantfalls-intensivt arbete.
- Reglerade branscher utan HIPAA-budget. Vapis $2k/mån HIPAA-tillägg, operatörscompliance-avgifter och PII-skyddsräcken ($0,005–$0,01/min på Retell) kan kollapsa matematiken. Om du inte kan budgetera $25k/år på compliance-poster ensamt, kör piloter på icke-PHI-flöden först.
I tester landar break-even-punkten mot en mänsklig agent för supportavledning runt 250–400 samtal/mån vid typiska bundled-priser. Under det är en $19/mån SaaS plus en människa billigare. Distribuera inte voice AI bara för att du kan.

Om voice AI klarar kostnadsgolvet men du inte vill koppla ihop Retell eller Vapi själv, bygger och driver vår voice agent-utvecklingstjänst det kompletta stacket på din infrastruktur.
Hur vi faktiskt skulle välja en plattform 2026 (dom per användningsfall)
Ingen enskild plattform vinner överallt. Det billigaste seriösa valet beror på om du är inkommande eller utgående, om du har ingenjörskapacitet och om HIPAA spelar roll. Fem användningsfall, fem svar:
- Billigaste seriösa utgående (kalla samtal): Bland. Fast $0,09/min, transparent transferavgift, inga överraskande LLM-kostnader. Skippa om du behöver djup RAG eller anpassade verktyg.
- Billigaste inkommande (supportavledning): Retell. Bundled, HIPAA ingår, mogen analys, $0,12–$0,18 all-in. Skippa om din inkommande volym är under 200 samtal/mån (se föregående avsnitt).
- Maximal kontroll + anpassad RAG: Vapi BYOK. Bara om du har ingenjörskapacitet att äga LLM-, TTS- och STT-nycklarna. Kontrollen är värd $0,27/min bara när du kan förhandla operatören och LLM:en i volym.
- Bundled enkelhet i skala: Deepgram Voice Agent. $4,50/tim ($0,075/min) fast, det mest förbisedda alternativet i SERP. Skippa om du behöver det breda röstbiblioteket som ElevenLabs erbjuder.
- Konversationskvalitetsnivå (säljdemon, varumärkeskänsliga flöden): ElevenLabs Conversational. Turbo- eller premiumröster till $0,10–$0,12/min. Betala extrapriset när röstkvalitet är konverteringshabstången.
För en djupare branschsyn på enterprise-sidan, se AI voice agents för enterprise callcenter: samma matematik, med restaurang- och klinikspecifika volymantaganden.
Hur Techsy hanterar voice agent-kostnadsmodellering
Vi säljer inte en röstplattform. Vi bygger produktions-voice-agents för kunder på Retell, Vapi, Deepgram och OpenAI Realtime. Det betyder att när vi modellerar kostnader för ett nytt engagemang kör vi tco_per_minute()-formeln på tre volymnivåer (1k, 10k, 100k minuter/mån) innan vi rekommenderar ett stack. Plattformen som vinner vid 1k förlorar ofta vid 100k.
Vi förhandlar Twilio-underkontopriserna för kunder bortom 100k minuter/mån (underkonton låser upp volymnivåer som de flesta team inte vet existerar), och vi modellerar alltid prompt caching-besparingarna på Realtime-byggen innan vi godkänner en direct-infra-design. Hälften av vårt kostnadsmodelleringsarbete för kunder är att avveckla antaganden som någon gjort från ett leverantörsblogginlägg.
Vill du ha en voice agent byggd end-to-end på den plattform som faktiskt vinner för din volym? Se hur vi bygger voice agents →
FAQ
Hur mycket kostar en AI voice agent per minut 2026? All-in-kostnaden varierar från $0,07 till $0,30 per minut. Bundled-plattformar (Retell, Bland, ElevenLabs Conversational) landar på $0,10–$0,18/min när telefoni inkluderas. BYOK-plattformar som Vapi landar på $0,13–$0,31/min efter att LLM-, TTS-, STT- och Twilio-kostnaderna lagts till. OpenAI Realtime direkt sitter runt $0,30/min rå eller ungefär $0,12/min med prompt caching aktiverat på systemprompts.
Vilken är den billigaste AI voice agent-plattformen? För utgående är Bland AI till $0,09/min fast det renaste räknandet på marknaden. För inkommande support vinner Retell till $0,10–$0,16 all-in vanligtvis tack vare bundlad HIPAA och samtidighetsbaslinjer. För rena infrastrukturkonfigurationer med caching kan OpenAI Realtime sjunka under $0,15/min. Deepgram Voice Agent till $0,075/min fast är det mest förbisedda alternativet.
Varför är min Vapi-räkning högre än $0,05/min? $0,05/min på Vapias prissida är bara plattformsavgiften. Vapi är BYOK: du tar med dina egna nycklar för LLM (GPT-4o-mini, Claude osv.), TTS (ElevenLabs, PlayHT), STT (Deepgram) och telefoni (Twilio). Verklig all-in-kostnad landar på $0,13–$0,31/min beroende på vilken röst och modell du väljer.
Vad är skillnaden mellan BYOK och bundled-prissättning? Bundled-plattformar (Retell, Bland, Synthflow, ElevenLabs Conversational) inkluderar LLM, STT och TTS i en per-minut-tariff. BYOK-plattformar (Vapi) tar bara betalt för orkestrering — du tar med dina egna API-nycklar för allt annat och faktureras separat av varje leverantör. Bundled är enklare; BYOK ger dig kontroll och förhandlingshävstång i skala.
Finns det dolda avgifter i AI voice agent-prissättning? Ja, sju vanliga. HIPAA-tillägg ($2 000/mån på Vapi), minutavrundning (5–8% effektivt påslag i skala), telefonnummerhyror ($1–$2/mån), samtidighetsavgifter ($8/samtidighet/mån Retell), transferavgifter ($0,025/min Bland), kunskapsbas-avgifter ($8/mån per KB på Retell) och premiumröstuppgraderingar (+$0,04/min ElevenLabs Premium över Turbo).
Är OpenAI Realtime API billigare än Vapi? Utan prompt caching, nej: OpenAI Realtime kostar ungefär $0,30/min rå audiokostnad. Med prompt caching aktiverat (cachade systemprompt-tokens till $0,40/M vs $32/M färskt, en 80× rabatt) kollapsar systemprompt-posten och totalkostnaden sjunker till ungefär $0,12–$0,15/min. Det gör det konkurrenskraftigt med bundled-plattformar bortom 10k minuter/mån.
Hur prognostiserar jag min voice agent-månadskostnad?
Uppskatta samtal per månad multiplicerat med genomsnittlig samtalslängd i minuter. Multiplicera med din plattforms all-in $/min. Lägg till fasta månadskostnader: telefonnummerhyror, KB-avgifter, samtidighetsbaslinjer, HIPAA-tillägg om tillämpligt. Python-funktionen tco_per_minute() ovan automatiserar detta med ett enda funktionsanrop du kan klistra in i en Jupyter-notebook.
Per-minut eller per-sekund fakturering: vilket är billigare? Per-sekund fakturering är meningsfullt billigare för korta utgående samtal. Ett 61-sekunders samtal fakturerat i 60-sekundersintervall tar betalt för 2 minuter, vilket är en 5–8% effektiv skatt på 5 000 samtal per månad med en typisk kortsamtalsfördelning. Bland och Deepgram fakturerar per sekund; de flesta BYOK-plattformar ärver Twilios 60-sekundersavrundning som standard.
Finns det gratis AI voice agents? Gratis testversioner finns: de flesta leverantörer erbjuder 10–60 gratis minuter (Retell, Vapi, Bland) för att testa. Riktigt gratis produktionskvalitets-voice-agents finns inte eftersom du alltid betalar åtminstone operatörminuter ($0,014/min på Twilio USA utgående). Även självhostade open-source-stacks (Pipecat, LiveKit Agents) låter dig betala telco och LLM.
Vad är ROI:n för voice AI vs en mänsklig agent? Mänskliga agenter kostar $15–$30/tim fullt belastat, vilket ger $0,25–$0,50/min. Voice AI till $0,10–$0,20/min slår den mänskliga kostnaden bortom ungefär 200 samtal per månad, med antagande om jämförbara lösningsgrader. Under den volymen gör plattformsminimum och nummerhyra-overhead en människa plus en $19/mån SaaS till det billigare svaret.
Den här guiden underhålls av Techsys redaktionsteam. Vi bygger produktions-AI-voice-agents på Retell, Vapi och OpenAI Realtime för kunder; dessa siffror kommer från kostnadsmodelleringsarbete vi gör varje vecka, inte leverantörbroschyrer. Priser verifierade maj 2026; bekräfta alltid med leverantörers prissidor innan du skriver på.