
Prissætning af AI-stemmeagenter i 2026: Sandheden om $0,05 vs $0,30 i minuttet (med regnestykke)
Vapi skriver "$0,05/min" på deres prisside. Din første månedsregning lander på $0,27/min. Hvad skete der? Alle stemme-AI-platforme reklamerer med ét tal, et platformgebyr, og fakturerer dig for fire andre lag, som du ikke så på forsiden. Denne guide genopbygger regnestykket bag prissætning af AI-stemmeagenter fra bunden: reelle BYOK-omkostninger for 8 platforme, den lydtoken-post ingen forklarer, og en Python-funktion du kan forke til at prognosticere din egen regning.

Kort svar
- Reelle all-in-omkostninger i 2026 lander mellem $0,07–$0,30/min afhængigt af bundlet vs BYOK.
- Bundlet-platforme (Retell, Bland, ElevenLabs) reklamerer med $0,07–$0,12/min og lander nær $0,10–$0,18/min.
- BYOK-platforme (Vapi $0,05/min platformgebyr) lander på $0,13–$0,31/min efter LLM + TTS + STT + Twilio.
- Den største skjulte løftestang er prompt-caching på OpenAI Realtime: op til 80× billigere på systemprompts.
Hvad koster en AI-stemmeagent faktisk i 2026?
De fleste AI-stemmeagenter koster $0,07 til $0,30 i minuttet all-in i 2026. Bundlet-platforme (Retell, Bland, ElevenLabs) reklamerer med $0,07–$0,12/min og lander nær $0,10–$0,18/min. BYOK-platforme (Vapi til $0,05/min platformgebyr) lander på $0,13–$0,31/min, når du lægger LLM, TTS, STT og Twilio til. Direkte på OpenAI Realtime koster cirka $0,30/min uden caching.
Tre kategorier forklarer næsten alt, hvad du ser på din regning:
- Bundlet per minut: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min fast), Synthflow og ElevenLabs Conversational. Ét tal, alt inkluderet.
- BYOK-orkestrering: Vapi opkræver $0,05/min kun for opkaldshåndteringslaget. LLM-tokens, TTS-tegn, STT-minutter og teleudbyderen faktureres separat på dine egne konti.
- Direkte på infrastruktur: Byg direkte på OpenAI Realtime plus Twilio. Billigst i skala hvis du cacher prompts. Dyrt hvis du ikke gør.
Resten af dette indlæg gennemgår regnestykket lag for lag og leverer derefter en Python-funktion tco_per_minute(), du kan indsætte i en notebook.
Hvorfor den annoncerede minutpris er en løgn (de 4 omkostningslag)
Det annoncerede platformgebyr på $0,05/min dækker kun orkestrering. De fire andre lag lægges ovenpå. Hver produktions-stemmeagent i 2026 betaler fem poster:telefoni, STT, LLM'en, TTS og det platformgebyr der binder dem sammen. Spring ét over, og du har ikke en fungerende agent.
Her er gulvet, lag for lag.
Lag 1: Telefoni (teleudbyderens minut)
Du betaler et rigtigt teleselskab for den lyd, der rejser ind og ud af det offentlige telenet. Twilio Programmable Voice fakturerer $0,014/min udgående i USA plus $1–$2/måned per telefonnummer. Twilio Elastic SIP ligger på $0,0053–$0,042/min afhængigt af oprindelse. De fleste stemme-AI-platforme videresælger enten Twilio med et lille tillæg eller sender det videre uændret. Uanset hvad er det $0,014/min i dit regneark.
Lag 2: Tale-til-tekst (STT)
Du konverterer det, opkalderen sagde, til tekst, som LLM'en kan læse. Deepgram Nova-2 streaming kører cirka $0,0043/min på Pay-as-you-go-laget, så kald det $0,005/min i praksis. Premium-modeller (Whisper-ækvivalent) stiger til $0,018/min. Bundlet-platforme skjuler dette i deres overskriftspris, men det er der stadig.
Lag 3: LLM'en (tekst eller lyd)
To veje her. Tekstmode-pipelines sender transskriberet lyd ind i en model som GPT-4o-mini ($0,15/M input, $0,60/M output) og sender svaret videre til TTS. En stemmesløjfe bruger typisk 100–300 input-tokens og 80–200 output-tokens per tur, hvilket svarer til cirka $0,003–$0,015/min for GPT-4o-mini, $0,015–$0,04/min for Claude Haiku. Lydmode-pipelines (OpenAI Realtime) springer transskriberings/syntese-dansen over og fakturerer direkte i lyd-tokens. Vi har en hel sektion om det nedenfor; det er den omkostningsløftestang, ingen forklarer.
Lag 4: Tekst-til-tale (TTS)
Du syntetiserer svaret tilbage til lyd. ElevenLabs Turbo kører $0,10/min på Conversational-planen, Premium-stemmer stiger til $0,12/min. Billigere stemmer (Deepgram Aura, OpenAI tts-1) kommer ind på $0,04–$0,06/min. Dette er normalt den næststørste post efter platformgebyret.
Læg det sammen ved gulvet: $0,014 telefoni + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 platform = $0,114/min minimum på en BYOK-stack. Det er før HIPAA, samtidighed eller nummerleje. Hvis du vil have den direkte funktionalitetssammenligning efter denne prisgennemgang, se vores Retell AI vs Vapi vs Bland-gennemgang.
De 8 platforme sammenlignet (pristabel maj 2026)
Tabellen nedenfor trækker overskriftspriser og realistiske all-in-tal fra hver leverandørs prisside. Brug den som reference, ikke som sandhed: Prissider ændrer sig, og dine stack-valg ændrer bundlinjen.
| Platform | Prismodel | Overskriftspris | Reel all-in (typisk) | HIPAA | BYOK eller bundlet | Bemærkelsesværdig faldgrube |
|---|---|---|---|---|---|---|
| Retell AI | Per minut | $0,07–$0,31/min | $0,12–$0,18/min | Inkluderet | Bundlet | Samtidighed $8/måned hver ud over inkluderet |
| Vapi | Platformgebyr + BYOK | $0,05/min | $0,13–$0,31/min | +$2.000/måned | BYOK | Alle fire lag ekstra |
| Bland AI | Fast per minut | $0,09/min | $0,09–$0,14/min | Inkluderet | Bundlet | $0,025/min viderestillingsgebyr |
| Synthflow | Per minut på plan | $0,09/min basis | $0,11–$0,15/min | Inkluderet | Bundlet | Planlag $29/$99/$449/$899 |
| ElevenLabs Conversational | Per minut | $0,08–$0,12/min | $0,10–$0,18/min | Workspace-plan | Bundlet | LLM ekstra medmindre på managed-lag |
| Deepgram Voice Agent | Per time | $4,50/time ($0,075/min) | $0,09–$0,11/min + telefoni | Ja | Bundlet | Læg Twilio oveni |
| OpenAI Realtime API | Lyd-tokens | $32/M input, $64/M output | ~$0,30/min rå, ~$0,12 cachet | Gør-det-selv | Direkte | Lyd-token-regnestykke (se nedenfor) |
| Twilio (telefonilag) | Per minut | $0,014/min USA udgående | $0,014/min | i/t | i/t | Telefonnumre $1–$2/måned |
Priser verificeret maj 2026. Tjek altid leverandørernes prissider før underskrift: Vapi ændrede deres HIPAA-tilvalg to gange alene i det seneste år.
Gennemregnet eksempel: Hvad koster ét 4-minutters udgående opkald virkelig?
Det kanoniske scenarie: ét 4-minutters udgående opkald, GPT-4o-mini som LLM, ElevenLabs Turbo som stemme, Twilio US som teleudbyder, kun engelsk. Da vi kørte dette præcise scenarie på tværs af alle fire platforme (Vapi, Retell, Bland, OpenAI Realtime direkte), forklarede overskriftsprisen mindre end halvdelen af det endelige tal.
Antagelser holdt konstant på tværs af alle fire:
- 4 minutters væg-ur-varighed
- ~12 samtaleturneringer, ~150 input-tokens + 100 output-tokens per tur = 1.800 ind / 1.200 ud for GPT-4o-mini
- TTS producerer ~400 tegn per tur × 12 = 4.800 tegn (ElevenLabs Turbo @ $0,10/min lydoutput)
- STT fakturerer de fulde 4 minutter (Deepgram Nova-2 @ ~$0,0043/min)
- Twilio udgående USA @ $0,014/min, $1/måned nummer amortiseret over 1.000 opkald/måned = $0,001/opkald
Vapi BYOK: $0,05 → $0,27/min
| Post | Omkostning |
|---|---|
| Vapi platformgebyr (4 min × $0,05) | $0,200 |
| GPT-4o-mini (1.800 ind × $0,15/M + 1.200 ud × $0,60/M) | $0,001 |
| ElevenLabs Turbo (4 min × $0,10) | $0,400 |
| Deepgram STT (4 min × $0,005) | $0,020 |
| Twilio (4 min × $0,014) | $0,056 |
| Nummerleje amortiseret | $0,001 |
| Samlet for opkaldet | $0,678 |
| Effektiv $/min | $0,170 |
Bemærk: ElevenLabs Turbo på Conversational-planen er tættere på $0,10/min, ikke fast pris, så regnestykket er en per-minut-output-afgift. Et platformgebyr på $0,05/min plus GPT-4o-mini plus ElevenLabs Turbo plus Twilio løber op i tættere på $0,17–$0,27/min, ikke $0,05.
Retell bundlet: $0,10 → $0,16/min
| Post | Omkostning |
|---|---|
| Retell-pakke (4 min × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Twilio-gennemløb (4 min × $0,014) | $0,056 |
| Nummerleje amortiseret | $0,002 |
| Samlet for opkaldet | $0,578 |
| Effektiv $/min | $0,145 |
Rettels pakke inkluderer LLM (du vælger modellen), STT og deres egen TTS. Tilbage har du kun Twilio at betale. Det er det.
Bland fast pris: $0,09 → $0,13/min
| Post | Omkostning |
|---|---|
| Bland fast (4 min × $0,09) | $0,360 |
| Twilio-gennemløb (4 min × $0,014) | $0,056 |
| Nummerleje amortiseret | $0,001 |
| Samlet for opkaldet | $0,417 |
| Effektiv $/min | $0,104 |
Bland er det reneste regnestykke i søgeresultaterne. Ét tal plus teleudbyder. Hagen ligger i skjulte gebyrer: viderestillingsminutter faktureres til $0,025/min oveni.
OpenAI Realtime direkte (ingen caching): $0,30/min
| Post | Omkostning |
|---|---|
| OpenAI Realtime lyd ind (4 min × ~$0,077) | $0,308 |
| OpenAI Realtime lyd ud (4 min × ~$0,077) | $0,308 |
| Twilio (4 min × $0,014) | $0,056 |
| Nummerleje amortiseret | $0,001 |
| Samlet for opkaldet | $0,673 |
| Effektiv $/min | $0,168 |
Det tal forudsætter, at du cacher systemprompts. Uden caching lander det samme opkald tættere på $1,20 ($0,30/min), fordi hver tur genfakturerer den fulde systemprompt til friske priser. Vi gennemgår det regnestykke nedenfor.

Bundlet vs BYOK: Hvilken prismodel vinder for dig?
Bundlet-platforme vinder, når du vil have én regning, forudsigeligt per-minut-regnestykke og en baseline-god stemme. BYOK vinder, når du har ingeniørkapacitet, vil vælge din egen LLM og planlægger at forhandle teleudbyderpriser i skala. Beslutningen kommer typisk ned til to spørgsmål: Har du en præference for faktureringslinjen, og har du en udvikler, der vil eje stacken?
| Brugsscenarie | Bundlet vinder fordi | BYOK vinder fordi |
|---|---|---|
| Indgående supportafledning | Én leverandør, én regning, HIPAA inkluderet | Svært at retfærdiggøre ingeniøromkostningen |
| Udgående kold opkald i skala | Fast regnestykke slår per-token-overraskelser | Du kan forhandle teleudbyderminutter over 100k/måned |
| Brugerdefineret RAG + værktøjsbrug | Begrænset tool-call-flade i de fleste pakker | Fuld kontrol over kontekstvindu |
| Regulerede brancher | HIPAA-flaget vendes med et afkrydsningsfelt | Compliance bliver dit problem |
Hurtig beslutningsregel:
- Under 10.000 minutter/måned → bundlet vinder næsten altid på samlede ejeromkostninger (ingeniørtid alene går i nul).
- 10.000–100.000 minutter/måned → BYOK begynder at betale sig, hvis du har 1+ ingeniør på det.
- Over 100.000 minutter/måned → BYOK eller direkte-på-Realtime er typisk $0,05–$0,10/min billigere, og du har mulighed for at forhandle Twilio-underkontoprises.
For et dybere LLM-omkostningsperspektiv på BYOK-siden, se vores gennemgang af orkestreringsvalg i bedste AI-agent-frameworks.
De skjulte gebyrer de fleste overser
Selv når du har styr på fire-lags-regnestykket, ankommer regningen med poster, som forsiden aldrig nævnte. Disse syv er dem, vi oftest ser ramme kunder. De fleste af dem er begravet i prissidens småt eller i konfigurationsskærme efter tilmelding. De er ikke ondsindede, bare underkommunikerede.
- HIPAA-tilvalg. Vapi opkræver $2.000/måned for HIPAA ifølge deres prisside. Retell, Bland og Synthflow inkluderer HIPAA uden ekstra omkostning. Hvis du er i sundhedssektoren og overvejer Vapi, er det $24k/år, før du har foretaget et eneste opkald.
- Per-minut-afrundingsskat. De fleste platforme afrunder til 60-sekunders intervaller: et 61-sekunders opkald faktureres som 2 minutter. Ved 5.000 opkald/måned med en typisk 45-90 sekunders fordeling er det en 5–8% effektiv stigning i forhold til, hvad dit $/min-regnestykke siger. Per-sekund-fakturering (Bland, Deepgram) springer dette over.
- Telefonnummerleje. Twilio: $1–$2/måned per nummer. Retell: $2/måned per nummer, $10/måned for verificerede numre. Ser lille ud, indtil du kører 50 udgående numre til kold opkald; det er en $100/måned-post, ingen tilbød.
- Samtidighedsgebyrer. Retell inkluderer en baseline af samtidige opkald; ud over det er det $8/samtidighed/måned. Et team, der kører 10 samtidige opkald ud over baselinen, tilføjer $80/måned.
- Viderestillingsgebyrer. Bland opkræver $0,025/min, når agenten viderestiller til et menneske. Hvis 20% af dine opkald viderestilles, er det en mærkbar skat på det gennemsnitlige minut.
- Vidensbasegebyrer. Retell giver dig 10 KB'er gratis; hver ekstra koster $8/måned. Stabl RAG-tunge brugsscenarier, og det akkumuleres hurtigt.
- Premium-stemmeopgraderinger. ElevenLabs Premium tilføjer +$0,04/min over Turbo. Lyder valgfrit, indtil dit salgsteam A/B-tester og finder ud af, at Premium konverterer 11% bedre.
Har du brug for nogen til at specificere dit konkrete brugsscenarie, før du underskriver en Vapi-kontrakt? Vi gør det som en del af vores stemmeagent-byggeprojekter.
Lyd-tokens og prompt-caching: Omkostningsløftestangen ingen forklarer
OpenAI Realtime API fakturerer efter lyd-tokens, hvor 1 token = 100ms input-lyd eller 50ms output-lyd. Et 60-sekunders opkald bruger cirka 600 input-tokens (opkalderen taler) og 1.200 output-tokens (agenten svarer). Til $32/M input og $64/M output er det $0,0192 input + $0,0768 output = $0,096 rå lydomkostning per minut, eller cirka $0,10/min, før du tilføjer prompts, værktøjer eller Twilio.
Så er der systemprompten. Hver tur sender din fulde systemprompt til modellen som en del af kontekstvindet. En typisk stemmeagent har en 2.000-token systemprompt, der dækker persona, værktøjer, kanttilfælde og afvisningslogik. Uden caching faktureres den 2.000-token-blok til $32/M frisk på hvert opkald: $64 på tværs af 1.000 opkald.
Med prompt-caching aktiveret (cachede tokens koster $0,40/M ifølge OpenAIs dokumentation) faktureres den samme 1.000-opkalds-workload til $0,80. Det er en 80× rabat på systemprompt-omkostningen. Prompt-caching på OpenAI Realtime skærer din systemprompt-omkostning med 80×. De fleste teams finder først ud af dette efter deres første månedsregning.
Her er regnestykket som kode:
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Fresh rates
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x discount
# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min
# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80
I vores omkostningsmodelleringsarbejde for kunder, der bygger direkte på Realtime, er dette den største enkeltstående løftestang mellem "Realtime er billigt" og "Realtime er dobbelt så dyrt som Vapi." Hvis du bruger Responses API sammen med Realtime til værktøjskald, se vores OpenAI Responses API-vejledning for implementeringsmønsteret. Det er derfor, at det at bygge direkte på OpenAI Realtime kan være billigere eller langt dyrere end Vapi, afhængigt af om du cacher.
Sådan beregner du din egen TCO (formel + Python)
Samlede ejeromkostninger for en stemmeagent er de variable per-minut-omkostninger plus månedlige faste gebyrer amortiseret over dit minutvolumen. Formlen:
TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month
Indsæt dine tal. Eller fork dette:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # e.g., 0.05 for Vapi, 0.13 for Retell bundle
llm_in_per_1m: float, # e.g., 0.15 for GPT-4o-mini input
llm_out_per_1m: float, # e.g., 0.60 for GPT-4o-mini output
llm_in_tokens_per_call: int, # e.g., 1800
llm_out_tokens_per_call: int, # e.g., 1200
tts_per_min: float, # e.g., 0.10 for ElevenLabs Turbo
stt_per_min: float, # e.g., 0.005 for Deepgram Nova-2
telephony_per_min: float, # e.g., 0.014 for Twilio US
fixed_monthly: float = 0.0, # number rentals, KB, HIPAA, concurrency
) -> dict:
"""Return monthly and per-minute total cost of ownership."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable per-call
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Fire nummererede trin til alle, der prognosticerer fra bunden:
- Estimér dit månedlige opkaldsvolumen og gennemsnitlige opkaldsvarighed.
- Vælg din stack: platform + LLM + TTS + STT + telefoni.
- Slå hver komponents enhedspris op på leverandørens prisside.
- Kør formlen (eller Python-funktionen ovenfor); output er din prognosticerede $/min og månedlige $.
Hvis du ikke kan skrive din TCO som en én-linjes formel, taber du den på en per-minut-afrundingsskat.
Omkostninger i skala: 1k vs 10k vs 100k minutter per måned
Kurverne divergerer hurtigt over 10.000 minutter. Bundlet-platforme flader ud, fordi deres regning bare er minutter × pris. BYOK-stacks stejler, efterhånden som LLM- og TTS-omkostninger skalerer lineært med dig. OpenAI Realtime med caching krydser Vapi omkring 10k–20k minutter/måned, det vendepunkt hvor direkte-på-infrastruktur begynder at give mening.
| Platform | 1.000 min/måned | 10.000 min/måned | 100.000 min/måned |
|---|---|---|---|
| Bland fast $0,09/min + Twilio | $120 | $1.160 | $11.400 |
| Retell-pakke ~$0,145/min all-in | $145 | $1.450 | $14.500 |
| Vapi BYOK ~$0,17/min all-in | $170 | $1.700 | $17.000 |
| OpenAI Realtime + caching ~$0,13/min | $130 | $1.300 | $13.000 |
| Deepgram Voice Agent + Twilio | $108 | $1.080 | $10.800 |
Tal afledt af tco_per_minute()-formlen ovenfor med de kanoniske 4-minutters opkaldsantagelser. Læg HIPAA ($2.000/måned Vapi), samtidighed og nummerleje til, hvor de gælder. De ændrer ikke kurveformen, men de hæver gulvet for købere med lavt volumen.
Hero-diagrammet øverst i dette indlæg visualiserer de samme tal: Bland flader tidligt ud, Vapi stejler efterhånden som LLM-omkostninger skalerer, og OpenAI Realtime med caching slår Vapi over 10k minutter.
Hvornår du IKKE bør implementere en stemmeagent
Stemme-AI har et reelt $0,10–$0,30/min-gulv. Under 200 opkald per måned vinder et menneske plus en $19 SaaS stadig på omkostninger. Telefonnummerleje, samtidighedsbaselines og platformminimummer løber op i en $50–$200/måned-overhead, som et lavvolumen-team simpelthen ikke genvinder.
Tre "spring-over"-kriterier, ærligt talt:
-
Færre end 200 opkald/måned. Nummerleje + minimumsafgifter + samtidighedsbaselines overstiger, hvad et deltidsmenneske koster til $20/time. Break-even går ikke op.
-
Højkontekst, lavvolumen-arbejde. Dit ene menneske håndterer 15 opkald om dagen, hver med 30+ unikke faktamønstre. LLM-hallucinationsomkostninger (refunderinger, tabte aftaler, forkerte bookinger) æder besparelsen. Stemme-AI skinner på repetitive flows, ikke på kanttilfælde-tungt arbejde.
-
Regulerede brancher uden HIPAA-budget. Vapis $2k/måned HIPAA-tilvalg, teleudbyder-compliance-gebyrer og PII-vagtforanstaltninger ($0,005–$0,01/min på Retell) kan få regnestykket til at kollapse. Hvis du ikke kan budgettere $25k/år på compliance-poster alene, kør piloter på ikke-PHI-flows først.
I test lander break-even-punktet mod en menneskelig agent for supportafledning omkring 250–400 opkald/måned til typiske bundlet-priser. Under det er en $19/måned SaaS plus et menneske billigere. Implementér ikke stemme-AI bare fordi du kan.

Hvis stemme-AI klarer omkostningsgulvet, men du ikke selv vil koble Retell eller Vapi sammen, bygger og driver vores stemmeagent-udviklingstjeneste den fulde stack på din infrastruktur.
Hvordan vi faktisk ville vælge en platform i 2026 (dom per brugsscenarie)
Ingen enkelt platform vinder overalt. Det billigste seriøse valg afhænger af, om du er indgående eller udgående, om du har ingeniørkapacitet, og om HIPAA betyder noget. Fem brugsscenarier, fem svar:
- Billigste seriøse udgående (kold opkald): Bland. Fast $0,09/min, transparent viderestillingsgebyr, ingen overraskende LLM-omkostninger. Spring den over, hvis du har brug for dyb RAG eller brugerdefinerede værktøjer.
- Billigste indgående (supportafledning): Retell. Bundlet, HIPAA inkluderet, moden analyse, $0,12–$0,18 all-in. Spring den over, hvis dit indgående volumen er under 200 opkald/måned (se forrige sektion).
- Maksimal kontrol + brugerdefineret RAG: Vapi BYOK. Kun hvis du har ingeniørkapacitet til at eje LLM-, TTS- og STT-nøglerne. Kontrollen er $0,27/min værd, kun når du kan forhandle teleudbyderen og LLM'en ned med volumen.
- Bundlet enkelhed i skala: Deepgram Voice Agent. $4,50/time ($0,075/min) fast, den mest oversete mulighed i søgeresultaterne. Spring den over, hvis du har brug for det brede stemmebibliotek, ElevenLabs tilbyder.
- Samtalekvalitetsniveau (salgsdemoer, brandfølsomme flows): ElevenLabs Conversational. Turbo- eller Premium-stemmer til $0,10–$0,12/min. Betal tillægget, når stemmekvalitet er konverteringsløftestangen.
For et dybere brancheperspektiv på virksomhedssiden, se AI-stemmeagenter til virksomheds-callcentre: samme regnestykke, med restaurant- og klinikespecifikke volumenantagelser.
Hvordan Techsy tilgår omkostningsmodellering for stemmeagenter
Vi sælger ikke en stemmeplatform. Vi bygger produktions-stemmeagenter for kunder på Retell, Vapi, Deepgram og OpenAI Realtime. Det betyder, at når vi modellerer omkostninger for et nyt projekt, kører vi tco_per_minute()-formlen på tre volumenlag (1k, 10k, 100k minutter/måned), før vi anbefaler en stack. Den platform, der vinder ved 1k, taber ofte ved 100k.
Vi forhandler Twilio-underkontopriser for kunder over 100k minutter/måned (underkonti låser volumenlag op, som de fleste teams ikke ved eksisterer), og vi modellerer altid prompt-caching-besparelsen på Realtime-bygninger, før vi godkender et direkte-infrastruktur-design. Halvdelen af vores omkostningsmodelleringsarbejde for kunder er at fortryde antagelser, nogen har lavet ud fra en leverandørs blogindlæg.
Vil du have en stemmeagent bygget ende-til-ende på den platform, der faktisk vinder for dit volumen? Se hvordan vi bygger stemmeagenter →
FAQ
Hvad koster en AI-stemmeagent per minut i 2026? All-in-omkostninger ligger fra $0,07 til $0,30 per minut. Bundlet-platforme (Retell, Bland, ElevenLabs Conversational) lander på $0,10–$0,18/min, når telefoni er inkluderet. BYOK-platforme som Vapi lander på $0,13–$0,31/min, efter LLM-, TTS-, STT- og Twilio-omkostninger er lagt til. OpenAI Realtime direkte ligger nær $0,30/min rå eller cirka $0,12/min med prompt-caching aktiveret på systemprompts.
Hvad er den billigste AI-stemmeagent-platform? For udgående er Bland AI til $0,09/min fast det reneste regnestykke på markedet. For indgående support vinder Retell til $0,10–$0,16 all-in normalt takket være bundlet HIPAA og samtidighedsbaselines. For rene infrastruktur-spil med caching kan OpenAI Realtime komme under $0,15/min. Deepgram Voice Agent til $0,075/min fast er den mest oversete mulighed.
Hvorfor er min Vapi-regning højere end $0,05/min? $0,05/min-tallet på Vapis prisside er kun platformgebyret. Vapi er BYOK: Du medbringer dine egne nøgler til LLM'en (GPT-4o-mini, Claude osv.), TTS (ElevenLabs, PlayHT), STT (Deepgram) og telefoni (Twilio). Reelle all-in-omkostninger lander på $0,13–$0,31/min afhængigt af, hvilken stemme og model du vælger.
Hvad er forskellen mellem BYOK og bundlet prissætning? Bundlet-platforme (Retell, Bland, Synthflow, ElevenLabs Conversational) inkluderer LLM, STT og TTS i én per-minut-pris. BYOK-platforme (Vapi) opkræver kun for orkestrering; du medbringer dine egne API-nøgler til alt andet og faktureres separat af hver leverandør. Bundlet er enklere; BYOK giver dig kontrol og forhandlingsmuligheder i skala.
Er der skjulte gebyrer i AI-stemmeagent-prissætning? Ja, syv almindelige. HIPAA-tilvalg ($2.000/måned på Vapi), per-minut-afrunding (5–8% effektiv stigning i skala), telefonnummerleje ($1–$2/måned), samtidighedsgebyrer ($8/samtidighed/måned Retell), viderestillingsgebyrer ($0,025/min Bland), vidensbasegebyrer ($8/måned per KB på Retell) og premium-stemmeopgraderinger (+$0,04/min ElevenLabs Premium over Turbo).
Er OpenAI Realtime API billigere end Vapi? Uden prompt-caching, nej: OpenAI Realtime kører cirka $0,30/min i rå lydomkostning. Med prompt-caching aktiveret (cachede systemprompt-tokens til $0,40/M vs $32/M frisk, en 80× rabat) kollapser systemprompt-posten, og de samlede omkostninger falder til cirka $0,12–$0,15/min. Det gør den konkurrencedygtig med bundlet-platforme over 10k minutter/måned.
Hvordan prognosticerer jeg min stemmeagents månedlige omkostninger?
Estimér opkald per måned ganget med gennemsnitlig opkaldsvarighed i minutter. Gang med din platforms all-in $/min. Læg faste månedlige omkostninger til: telefonnummerleje, vidensbasegebyrer, samtidighedsbaseline, HIPAA-tilvalg hvis relevant. tco_per_minute() Python-funktionen ovenfor automatiserer dette med ét funktionskald, du kan indsætte i en Jupyter-notebook.
Per-minut eller per-sekund-fakturering: Hvilken er billigere? Per-sekund-fakturering er mærkbart billigere for korte udgående opkald. Et 61-sekunders opkald faktureret i 60-sekunders intervaller opkræver 2 minutter, hvilket er en 5–8% effektiv skat ved 5.000 opkald per måned med en typisk kort-opkalds-fordeling. Bland og Deepgram fakturerer per sekund; de fleste BYOK-platforme arver Twilios 60-sekunders afrunding som standard.
Findes der gratis AI-stemmeagenter? Gratis prøveperioder findes: De fleste leverandører tilbyder 10–60 gratis minutter (Retell, Vapi, Bland) til test. Rigtige gratis produktionsklare stemmeagenter findes ikke, fordi du altid som minimum betaler teleudbyderminutter ($0,014/min på Twilio USA udgående). Selv selvhostede open-source-stacks (Pipecat, LiveKit Agents) efterlader dig med at betale teleselskabet og LLM'en.
Hvad er ROI for stemme-AI vs en menneskelig agent? Menneskelige agenter kører $15–$30/time fuldt belastet, hvilket svarer til $0,25–$0,50/min. Stemme-AI til $0,10–$0,20/min slår menneskelige omkostninger over cirka 200 opkald per måned, forudsat sammenlignelige løsningsrater. Under det volumen gør platformminimummer og nummerleje-overhead et menneske plus en $19/måned SaaS til det billigere svar.
Denne guide vedligeholdes af Techsy-redaktionen. Vi bygger produktions-AI-stemmeagenter på Retell, Vapi og OpenAI Realtime for kunder; disse tal stammer fra omkostningsmodelleringsarbejde, vi udfører hver uge, ikke leverandørbrochurer. Priser verificeret pr. maj 2026; bekræft altid med leverandørernes prissider før underskrift.