
Ceny hlasových AI agentů v roce 2026: celá pravda o $0,05 vs $0,30 za minutu (i s výpočty)
Vapi uvádí na ceníkové stránce „$0,05/min". Váš účet za první měsíc ale ukáže $0,27/min. Co se stalo? Každá platforma pro hlasovou AI inzeruje jedno číslo – platformní poplatek – a účtuje vám čtyři další vrstvy, které jste na domovské stránce neviděli. Tento průvodce staví matematiku ai voice agent pricing znovu od základu: reálné BYOK náklady pro 8 platforem, řádková položka za audio tokeny, kterou nikdo nevysvětluje, a Python funkce, kterou si můžete zforkovat a odhadnout si vlastní účet.

Rychlá odpověď
- Reálné celkové náklady se v roce 2026 pohybují mezi $0,07–$0,30/min podle toho, zda jde o bundle, nebo BYOK.
- Bundlované platformy (Retell, Bland, ElevenLabs) inzerují $0,07–$0,12/min a reálně končí kolem $0,10–$0,18/min.
- BYOK platformy (Vapi s platformním poplatkem $0,05/min) po přičtení LLM + TTS + STT + Twilio skončí na $0,13–$0,31/min.
- Největší skrytou pákou je prompt caching u OpenAI Realtime: systémové prompty až 80× levnější.
Kolik hlasový AI agent v roce 2026 vlastně stojí?
Většina hlasových AI agentů v roce 2026 vyjde celkově na $0,07 až $0,30 za minutu. Bundlované platformy (Retell, Bland, ElevenLabs) inzerují $0,07–$0,12/min a reálně se pohybují kolem $0,10–$0,18/min. BYOK platformy (Vapi s platformním poplatkem $0,05/min) skončí na $0,13–$0,31/min, jakmile přičtete LLM, TTS, STT a Twilio. Přímé napojení na OpenAI Realtime vychází zhruba na $0,30/min bez cachování.
Téměř všechno, co na účtě uvidíte, vysvětlují tři kategorie:
- Bundlované za minutu: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min paušál), Synthflow a ElevenLabs Conversational. Jedno číslo, vše v ceně.
- BYOK orchestrace: Vapi účtuje $0,05/min jen za vrstvu pro zpracování hovoru. Tokeny LLM, znaky TTS, minuty STT i operátora platíte zvlášť na vlastních účtech.
- Přímo na infrastruktuře: Stavíte přímo na OpenAI Realtime plus Twilio. Pokud cachujete prompty, je to ve velkém objemu nejlevnější. Pokud ne, je to drahé.
Ve zbytku tohoto článku projdeme matematiku vrstvu po vrstvě a na konci najdete Python funkci tco_per_minute(), kterou si můžete vložit do notebooku.
Proč je inzerovaná cena za minutu lež (4 vrstvy nákladů)
Inzerovaný platformní poplatek $0,05/min pokrývá pouze orchestraci. Zbylé čtyři vrstvy se nabalují navrch. Každý produkční hlasový agent v roce 2026 platí pět položek: telefonii, STT, LLM, TTS a platformní poplatek, který to všechno drží pohromadě. Vynechte kteroukoli z nich a nemáte funkčního agenta.
Tady je minimum, vrstvu po vrstvě.
Vrstva 1: Telefonie (minuta operátora)
Platíte reálnému telekomunikačnímu operátorovi za zvuk, který putuje do veřejné telefonní sítě a z ní. Twilio Programmable Voice účtuje $0,014/min za odchozí hovor v USA, plus $1–$2 měsíčně za každé telefonní číslo. Twilio Elastic SIP se pohybuje od $0,0053 do $0,042/min podle místa původu hovoru. Většina platforem pro hlasovou AI buď přeprodává Twilio s malou přirážkou, nebo ji propouští jedna ku jedné. Tak či tak, ve vašem rozpočtu je to $0,014/min.
Vrstva 2: Převod řeči na text (STT)
Převádíte to, co volající řekl, na text, který LLM dokáže přečíst. Streamování Deepgram Nova-2 stojí na tarifu Pay-as-you-go zhruba $0,0043/min, takže v praxi počítejte s $0,005/min. Prémiové modely (ekvivalent Whisperu) šplhají k $0,018/min. Bundlované platformy to skrývají v hlavní sazbě, ale uvnitř tam pořád je.
Vrstva 3: LLM (text, nebo audio)
Tady jsou dvě cesty. Textové pipeliney posílají přepsaný audio záznam do modelu, jako je GPT-4o-mini ($0,15/M vstup, $0,60/M výstup), a odpověď posílají do TTS. Hlasová smyčka typicky spálí 100–300 vstupních tokenů a 80–200 výstupních tokenů na jeden obrat, což u GPT-4o-mini vychází zhruba na $0,003–$0,015/min, u Claude Haiku na $0,015–$0,04/min. Audio pipeliney (OpenAI Realtime) přeskočí celý tanec s přepisem a syntézou a účtují přímo v audio tokenech. Níže tomu věnujeme celou sekci; je to nákladová páka, kterou nikdo nevysvětluje.
Vrstva 4: Syntéza řeči (TTS)
Syntetizujete odpověď zpět do zvuku. ElevenLabs Turbo stojí na plánu Conversational $0,10/min, prémiové hlasy šplhají k $0,12/min. Nižší třída hlasů (Deepgram Aura, OpenAI tts-1) vychází na $0,04–$0,06/min. Tohle je obvykle druhá největší položka hned po platformním poplatku.
Sečteno na minimu: $0,014 telefonie + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 platforma = minimum $0,114/min na BYOK stacku. A to ještě před HIPAA, souběžností nebo pronájmem čísel. Pokud vás po tomto cenovém ponoru zajímá srovnání funkcí jedna ku jedné, podívejte se na náš rozbor Retell AI vs Vapi vs Bland.
Srovnání 8 platforem (cenová tabulka, květen 2026)
Tabulka níže shrnuje hlavní sazby a realistické celkové částky z ceníkových stránek každého dodavatele. Berte ji jako orientační, ne jako evangelium: ceníky se mění a vaše volba stacku mění výsledné číslo.
| Platforma | Cenový model | Hlavní sazba | Reálně celkem (typicky) | HIPAA | BYOK, nebo bundle | Významný háček |
|---|---|---|---|---|---|---|
| Retell AI | Za minutu | $0,07–$0,31/min | $0,12–$0,18/min | V ceně | Bundle | Souběžnost $8/měs. za každý nad rámec zahrnutého limitu |
| Vapi | Platformní poplatek + BYOK | $0,05/min | $0,13–$0,31/min | +$2 000/měs. | BYOK | Všechny čtyři vrstvy navíc |
| Bland AI | Paušál za minutu | $0,09/min | $0,09–$0,14/min | V ceně | Bundle | Poplatek za přepojení $0,025/min |
| Synthflow | Za minutu v rámci plánu | základ $0,09/min | $0,11–$0,15/min | V ceně | Bundle | Úrovně plánu $29/$99/$449/$899 |
| ElevenLabs Conversational | Za minutu | $0,08–$0,12/min | $0,10–$0,18/min | Plán Workspace | Bundle | LLM navíc, pokud nejste na spravovaném tarifu |
| Deepgram Voice Agent | Za hodinu | $4,50/hod ($0,075/min) | $0,09–$0,11/min + telefonie | Ano | Bundle | Navrch přidejte Twilio |
| OpenAI Realtime API | Audio tokeny | $32/M vstup, $64/M výstup | ~$0,30/min syrově, ~$0,12 s cache | Vlastní | Přímo | Matematika audio tokenů (viz níže) |
| Twilio (vrstva telefonie) | Za minutu | $0,014/min odchozí v USA | $0,014/min | – | – | Telefonní čísla $1–$2/měs. |
Ceny ověřeny v květnu 2026. Před podpisem smlouvy vždy zkontrolujte ceníkové stránky dodavatele: jen za poslední rok Vapi změnilo svůj HIPAA příplatek dvakrát.
Modelový příklad: kolik opravdu stojí jeden 4minutový odchozí hovor?
Kanonický scénář: jeden 4minutový odchozí hovor, GPT-4o-mini jako LLM, ElevenLabs Turbo jako hlas, Twilio US jako operátor, pouze angličtina. Když jsme tento scénář propočítali napříč všemi čtyřmi platformami (Vapi, Retell, Bland, OpenAI Realtime přímo), hlavní sazba vysvětlila méně než polovinu výsledného čísla.
Předpoklady platné pro všechny čtyři:
- 4 minuty reálného času hovoru
- ~12 konverzačních obratů, ~150 vstupních tokenů + 100 výstupních tokenů na obrat = 1 800 vstup / 1 200 výstup pro GPT-4o-mini
- TTS vygeneruje ~400 znaků na obrat × 12 = 4 800 znaků (ElevenLabs Turbo @ $0,10/min audio výstupu)
- STT účtuje celých 4 minuty (Deepgram Nova-2 @ ~$0,0043/min)
- Twilio odchozí v USA @ $0,014/min, $1/měs. za číslo amortizováno přes 1 000 hovorů/měs. = $0,001/hovor
Vapi BYOK: $0,05 → $0,27/min
| Položka | Náklad |
|---|---|
| Platformní poplatek Vapi (4 min × $0,05) | $0,200 |
| GPT-4o-mini (1 800 vstup × $0,15/M + 1 200 výstup × $0,60/M) | $0,001 |
| ElevenLabs Turbo (4 min × $0,10) | $0,400 |
| Deepgram STT (4 min × $0,005) | $0,020 |
| Twilio (4 min × $0,014) | $0,056 |
| Amortizovaný pronájem čísla | $0,001 |
| Celkem za hovor | $0,678 |
| Efektivní $/min | $0,170 |
Poznámka: ElevenLabs Turbo na plánu Conversational se blíží spíš $0,10/min, nejde o paušál, takže počítáme s poplatkem za minutu výstupu. Platformní poplatek $0,05/min plus GPT-4o-mini plus ElevenLabs Turbo plus Twilio dohromady dávají spíš $0,17–$0,27/min, nikoli $0,05.
Retell bundle: $0,10 → $0,16/min
| Položka | Náklad |
|---|---|
| Bundle Retell (4 min × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Průchod Twilio (4 min × $0,014) | $0,056 |
| Amortizovaný pronájem čísla | $0,002 |
| Celkem za hovor | $0,578 |
| Efektivní $/min | $0,145 |
Bundle Retell v sobě zahrnuje LLM (model si vyberete), STT i jejich vlastní TTS. Zbývá vám platit Twilio navrch. A to je vše.
Bland paušál: $0,09 → $0,13/min
| Položka | Náklad |
|---|---|
| Paušál Bland (4 min × $0,09) | $0,360 |
| Průchod Twilio (4 min × $0,014) | $0,056 |
| Amortizovaný pronájem čísla | $0,001 |
| Celkem za hovor | $0,417 |
| Efektivní $/min | $0,104 |
Bland má nejčistší matematiku ve výsledcích vyhledávání. Jedno číslo plus operátor. Háček se skrývá ve skrytých poplatcích – minuty přepojení se účtují navrch $0,025/min.
OpenAI Realtime přímo (bez cachování): $0,30/min
| Položka | Náklad |
|---|---|
| OpenAI Realtime audio vstup (4 min × ~$0,077) | $0,308 |
| OpenAI Realtime audio výstup (4 min × ~$0,077) | $0,308 |
| Twilio (4 min × $0,014) | $0,056 |
| Amortizovaný pronájem čísla | $0,001 |
| Celkem za hovor | $0,673 |
| Efektivní $/min | $0,168 |
Toto číslo předpokládá, že cachujete systémové prompty. Bez cachování vyjde stejný hovor blíž k $1,20 ($0,30/min), protože každý obrat znovu účtuje celý systémový prompt za plnou sazbu. Tuto matematiku rozebereme níže.

Bundle vs BYOK: který cenový model vyhrává pro vás?
Bundlované platformy vyhrávají, když chcete jeden účet, předvídatelnou matematiku za minutu a solidní základní hlas. BYOK vyhrává, když máte vývojářskou kapacitu, chcete si vybrat vlastní LLM a plánujete ve velkém objemu vyjednat sazby operátora. Rozhodnutí obvykle stojí na dvou otázkách: máte preferenci ohledně řádku na faktuře, a máte vývojáře, který stack převezme?
| Případ užití | Bundle vyhrává, protože | BYOK vyhrává, protože |
|---|---|---|
| Odklon příchozí podpory | Jeden dodavatel, jeden účet, HIPAA v ceně | Těžko obhájíte náklady na vývojáře |
| Odchozí cold calling ve velkém | Paušální matematika poráží překvapení za tokeny | Nad 100k min/měs. můžete vyjednat minuty operátora |
| Vlastní RAG + použití nástrojů | Většina bundlů má omezenou plochu pro volání nástrojů | Plná kontrola nad kontextovým oknem |
| Regulovaná odvětví | Vlajku HIPAA přepnete jedním zaškrtávacím políčkem | Compliance se stane vaším problémem |
Rychlé rozhodovací pravidlo:
- Pod 10 000 minut měsíčně → bundle téměř vždy vyhrává v celkových nákladech vlastnictví (jen čas vývojáře srovná účet).
- 10 000–100 000 minut měsíčně → BYOK se začne vyplácet, pokud na něj máte alespoň jednoho vývojáře.
- Nad 100 000 minut měsíčně → BYOK nebo přímé napojení na Realtime je obvykle o $0,05–$0,10/min levnější a máte páku vyjednat sazby sub-účtů Twilio.
Pro hlubší pohled na náklady LLM na straně BYOK se podívejte na náš rozbor možností orchestrace v best AI agent frameworks.
Skryté poplatky, které většina lidí přehlédne
I když máte matematiku čtyř vrstev zmáknutou, účet dorazí s položkami, o kterých se domovská stránka nikdy nezmínila. Těchto sedm vídáme u klientů nejčastěji. Většina z nich je zakopaná v drobném písmu ceníku nebo na konfiguračních obrazovkách po registraci. Nejsou zlomyslné, jen nedostatečně komunikované.
- Příplatek za HIPAA. Vapi si podle svého ceníku účtuje za HIPAA $2 000/měs. Retell, Bland a Synthflow zahrnují HIPAA bez příplatku. Pokud jste ve zdravotnictví a zvažujete Vapi, je to $24k ročně, než vůbec uskutečníte první hovor.
- Daň z zaokrouhlování na minuty. Většina platforem zaokrouhluje na 60sekundové kroky: 61sekundový hovor se účtuje jako 2 minuty. Při 5 000 hovorech měsíčně s typickým rozložením 45–90 sekund to znamená efektivní navýšení 5–8 % oproti tomu, co říká vaše matematika $/min. Účtování po sekundách (Bland, Deepgram) to obchází.
- Pronájem telefonních čísel. Twilio: $1–$2/měs. za číslo. Retell: $2/měs. za číslo, $10/měs. za ověřená čísla. Vypadá to jako drobné, dokud neprovozujete 50 odchozích čísel na cold calling; to je položka $100/měs., kterou vám nikdo nacenil.
- Poplatky za souběžnost. Retell zahrnuje základní počet souběžných hovorů; nad něj je to $8/souběžnost/měsíc. Tým, který nad rámec základu vede 10 souběžných hovorů, si připlatí $80/měs.
- Poplatky za přepojení. Bland účtuje $0,025/min, když agent hovor přepojí na člověka. Pokud se přepojí 20 % vašich hovorů, je to citelná daň na průměrné minutě.
- Poplatky za znalostní bázi. Retell vám dá 10 KB zdarma; každá další je $8/měs. U RAG-heavy případů užití se to rychle nasčítá.
- Upsell prémiových hlasů. ElevenLabs Premium přidává +$0,04/min oproti Turbo. Zní to jako volitelné, dokud váš obchodní tým neudělá A/B test a nezjistí, že Premium konvertuje o 11 % lépe.
Potřebujete někoho, kdo vám před podpisem smlouvy s Vapi položí na stůl položky pro váš konkrétní případ užití? Děláme to v rámci našich projektů stavby hlasových agentů.
Audio tokeny a prompt caching: nákladová páka, kterou nikdo nevysvětluje
OpenAI Realtime API účtuje v audio tokenech, kde 1 token = 100 ms vstupního audia nebo 50 ms výstupního audia. 60sekundový hovor spotřebuje zhruba 600 vstupních tokenů (volající mluví) a 1 200 výstupních tokenů (agent odpovídá). Při $32/M vstup a $64/M výstup to je $0,0192 vstup + $0,0768 výstup = $0,096 syrových nákladů na audio za minutu, tedy zhruba $0,10/min, než přičtete prompty, nástroje nebo Twilio.
A pak je tu systémový prompt. Každý obrat posílá modelu váš celý systémový prompt jako součást kontextového okna. Typický hlasový agent má 2 000tokenový systémový prompt pokrývající personu, nástroje, okrajové případy a logiku odmítnutí. Bez cachování se tento 2 000tokenový blok účtuje za plnou sazbu $32/M při každém hovoru: $64 napříč 1 000 hovory.
Se zapnutým prompt cachingem (cachované tokeny stojí $0,40/M podle dokumentace OpenAI) vyjde stejná zátěž 1 000 hovorů na $0,80. To je 80× sleva na nákladech za systémový prompt. Prompt caching na OpenAI Realtime srazí vaše náklady na systémový prompt 80krát. Většina týmů na to přijde až po účtu za první měsíc.
Tady je ta matematika jako kód:
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Fresh rates
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x discount
# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min
# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80
Při našem modelování nákladů pro klienty, kteří staví přímo na Realtime, je tohle ta největší páka mezi „Realtime je levné" a „Realtime je dvakrát dražší než Vapi". Pokud vedle Realtime používáte pro volání nástrojů i Responses API, podívejte se na náš OpenAI Responses API tutorial ohledně implementačního vzoru. Právě proto může být přímá stavba na OpenAI Realtime levnější nebo mnohem dražší než Vapi – podle toho, zda cachujete.
Jak si spočítat vlastní TCO (vzorec + Python)
Celkové náklady vlastnictví (TCO) hlasového agenta jsou variabilní náklady za minutu plus měsíční fixní poplatky amortizované přes váš objem minut. Vzorec:
TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month
Dosaďte svá čísla. Nebo si zforkujte tohle:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # e.g., 0.05 for Vapi, 0.13 for Retell bundle
llm_in_per_1m: float, # e.g., 0.15 for GPT-4o-mini input
llm_out_per_1m: float, # e.g., 0.60 for GPT-4o-mini output
llm_in_tokens_per_call: int, # e.g., 1800
llm_out_tokens_per_call: int, # e.g., 1200
tts_per_min: float, # e.g., 0.10 for ElevenLabs Turbo
stt_per_min: float, # e.g., 0.005 for Deepgram Nova-2
telephony_per_min: float, # e.g., 0.014 for Twilio US
fixed_monthly: float = 0.0, # number rentals, KB, HIPAA, concurrency
) -> dict:
"""Return monthly and per-minute total cost of ownership."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable per-call
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Čtyři kroky pro každého, kdo prognózuje od nuly:
- Odhadněte měsíční objem hovorů a průměrnou délku hovoru.
- Vyberte stack: platforma + LLM + TTS + STT + telefonie.
- Vyhledejte jednotkovou cenu každé komponenty na ceníkové stránce dodavatele.
- Spusťte vzorec (nebo Python funkci výše) – výstupem je vaše prognóza $/min a měsíčních $.
Pokud nedokážete své TCO zapsat jako jednořádkový vzorec, prohrajete to na dani z zaokrouhlování na minuty.
Náklady ve velkém: 1k vs 10k vs 100k minut měsíčně
Nad 10 000 minut se křivky rychle rozcházejí. Bundlované platformy se zplošťují, protože jejich účet je jen minuty × sazba. BYOK stacky se strmě zvedají, protože náklady na LLM a TTS rostou lineárně s vámi. OpenAI Realtime s cachováním se dostane pod Vapi někde mezi 10k–20k min/měs. – to je bod zlomu, kdy se začne vyplácet přímé napojení na infrastrukturu.
| Platforma | 1 000 min/měs. | 10 000 min/měs. | 100 000 min/měs. |
|---|---|---|---|
| Bland paušál $0,09/min + Twilio | $120 | $1 160 | $11 400 |
| Retell bundle ~$0,145/min celkem | $145 | $1 450 | $14 500 |
| Vapi BYOK ~$0,17/min celkem | $170 | $1 700 | $17 000 |
| OpenAI Realtime + caching ~$0,13/min | $130 | $1 300 | $13 000 |
| Deepgram Voice Agent + Twilio | $108 | $1 080 | $10 800 |
Čísla odvozena ze vzorce tco_per_minute() výše s kanonickými předpoklady pro 4minutový hovor. Tam, kde se uplatní, přičtěte HIPAA ($2 000/měs. Vapi), souběžnost a pronájem čísel. Tvar křivky to nezmění, ale pro malé objemy to zvedá minimum.
Hrdinový graf na začátku tohoto článku vizualizuje tatáž čísla: Bland se zploští brzy, Vapi se zvedá, jak rostou náklady na LLM, a OpenAI Realtime s cachováním porazí Vapi nad 10k minut.
Kdy byste hlasového agenta nasazovat NEMĚLI
Hlasová AI má reálné minimum $0,10–$0,30/min. Pod 200 hovorů měsíčně stále vyhrává na nákladech člověk plus $19 SaaS. Pronájem telefonních čísel, základní limity souběžnosti a platformní minima se nasčítají do režie $50–$200/měs., kterou nízkoobjemový tým prostě nezaplatí.
Tři kritéria pro „přeskočit", upřímně:
-
Méně než 200 hovorů/měsíc. Pronájem čísel + minimální poplatky + základní limity souběžnosti přesáhnou to, kolik stojí člověk na částečný úvazek za $20/hod. Bod zvratu prostě nevychází.
-
Vysoce kontextová práce s nízkým objemem. Váš jeden člověk zvládne 15 hovorů denně, každý s 30+ unikátními scénáři. Náklady na halucinace LLM (refundace, ztracené obchody, špatné schůzky) sežerou úspory. Hlasová AI září u repetitivních procesů, ne u práce plné okrajových případů.
-
Regulovaná odvětví bez rozpočtu na HIPAA. HIPAA příplatek Vapi $2k/měs., poplatky operátora za compliance a ochrana PII ($0,005–$0,01/min na Retell) dokážou celou matematiku pohřbít. Pokud nemůžete vyčlenit $25k ročně jen na položky compliance, spusťte piloty nejprve na procesech bez PHI.
Při testování vychází bod zvratu vůči lidskému agentovi pro odklon podpory kolem 250–400 hovorů/měsíc při typických bundlovaných sazbách. Pod tím je $19/měs. SaaS plus člověk levnější. Nenasazujte hlasovou AI jen proto, že to jde.

Pokud hlasová AI překoná cenové minimum, ale nechcete si Retell ani Vapi zapojovat sami, naše služba vývoje hlasových agentů postaví a provozuje celý stack na vaší infrastruktuře.
Jak bychom v roce 2026 platformu vybírali my (verdikt podle případu užití)
Žádná platforma nevyhrává všude. Nejlevnější seriózní volba závisí na tom, zda řešíte příchozí, nebo odchozí hovory, zda máte vývojářskou kapacitu a zda záleží na HIPAA. Pět případů užití, pět odpovědí:
- Nejlevnější seriózní odchozí (cold calling): Bland. Paušál $0,09/min, transparentní poplatek za přepojení, žádná překvapení s náklady na LLM. Přeskočte ho, pokud potřebujete hluboké RAG nebo vlastní nástroje.
- Nejlevnější příchozí (odklon podpory): Retell. Bundle, HIPAA v ceně, zralá analytika, $0,12–$0,18 celkem. Přeskočte ho, pokud je váš objem příchozích hovorů pod 200 hovorů/měs. (viz předchozí sekce).
- Maximální kontrola + vlastní RAG: Vapi BYOK. Jen pokud máte vývojářskou kapacitu převzít klíče k LLM, TTS a STT. Kontrola stojí $0,27/min jen tehdy, když dokážete objemem srazit dolů operátora a LLM.
- Bundlovaná jednoduchost ve velkém: Deepgram Voice Agent. Paušál $4,50/hod ($0,075/min), nejvíce přehlížená možnost ve výsledcích vyhledávání. Přeskočte ho, pokud potřebujete širokou knihovnu hlasů, kterou nabízí ElevenLabs.
- Laťka kvality konverzace (prodejní dema, na značku citlivé procesy): ElevenLabs Conversational. Hlasy Turbo nebo Premium za $0,10–$0,12/min. Připlaťte si, když je kvalita hlasu konverzní pákou.
Pro hlubší řez podnikovým prostředím se podívejte na AI voice agents for enterprise call centers: stejná matematika, s objemovými předpoklady pro restaurace a kliniky.
Jak v Techsy přistupujeme k modelování nákladů hlasových agentů
Neprodáváme hlasovou platformu. Stavíme produkční hlasové agenty pro klienty na Retell, Vapi, Deepgram a OpenAI Realtime. To znamená, že když pro nový projekt modelujeme náklady, propočítáme vzorec tco_per_minute() na třech objemových úrovních (1k, 10k, 100k min/měs.), než doporučíme stack. Platforma, která vyhrává při 1k, často prohrává při 100k.
Pro klienty nad 100k min/měs. vyjednáváme ceny sub-účtů Twilio (sub-účty odemykají objemové úrovně, o kterých většina týmů neví, že existují), a u staveb na Realtime vždy modelujeme úspory z prompt cachingu, než odsouhlasíme design na přímé infrastruktuře. Polovina naší práce na modelování nákladů pro klienty je vyvracení předpokladů, které někdo udělal z blogového příspěvku dodavatele.
Chcete hlasového agenta postaveného od A do Z na platformě, která pro váš objem skutečně vyhrává? Podívejte se, jak stavíme hlasové agenty →
FAQ
Kolik stojí hlasový AI agent za minutu v roce 2026? Celkové náklady se pohybují od $0,07 do $0,30 za minutu. Bundlované platformy (Retell, Bland, ElevenLabs Conversational) po započtení telefonie končí na $0,10–$0,18/min. BYOK platformy jako Vapi skončí na $0,13–$0,31/min po přičtení nákladů na LLM, TTS, STT a Twilio. Přímé OpenAI Realtime se pohybuje kolem $0,30/min syrově, nebo zhruba $0,12/min se zapnutým prompt cachingem na systémových promptech.
Která platforma pro hlasové AI agenty je nejlevnější? Pro odchozí hovory má Bland AI s paušálem $0,09/min nejčistší matematiku na trhu. Pro příchozí podporu obvykle vyhrává Retell s $0,10–$0,16 celkem, díky bundlovanému HIPAA a základním limitům souběžnosti. Pro čistě infrastrukturní řešení s cachováním může OpenAI Realtime klesnout pod $0,15/min. Deepgram Voice Agent s paušálem $0,075/min je nejvíce přehlížená možnost.
Proč je můj účet u Vapi vyšší než $0,05/min? Částka $0,05/min na ceníkové stránce Vapi je pouze platformní poplatek. Vapi je BYOK: přinášíte si vlastní klíče pro LLM (GPT-4o-mini, Claude atd.), TTS (ElevenLabs, PlayHT), STT (Deepgram) a telefonii (Twilio). Reálné celkové náklady se pohybují mezi $0,13–$0,31/min podle toho, jaký hlas a model si vyberete.
Jaký je rozdíl mezi BYOK a bundlovanými cenami? Bundlované platformy (Retell, Bland, Synthflow, ElevenLabs Conversational) zahrnují LLM, STT a TTS do jedné sazby za minutu. BYOK platformy (Vapi) účtují pouze orchestraci – na všechno ostatní si přinesete vlastní API klíče a každý dodavatel vám účtuje zvlášť. Bundle je jednodušší; BYOK vám dává kontrolu a vyjednávací páku ve velkém objemu.
Existují u cen hlasových AI agentů skryté poplatky? Ano, sedm běžných. Příplatky za HIPAA ($2 000/měs. u Vapi), zaokrouhlování na minuty (efektivní navýšení 5–8 % ve velkém), pronájem telefonních čísel ($1–$2/měs.), poplatky za souběžnost ($8/souběžnost/měs. Retell), poplatky za přepojení ($0,025/min Bland), poplatky za znalostní bázi ($8/měs. za KB u Retell) a upsell prémiových hlasů (+$0,04/min ElevenLabs Premium oproti Turbo).
Je OpenAI Realtime API levnější než Vapi? Bez prompt cachingu ne: OpenAI Realtime stojí zhruba $0,30/min syrových nákladů na audio. Se zapnutým prompt cachingem (cachované tokeny systémového promptu za $0,40/M oproti $32/M za plnou sazbu, tedy 80× sleva) se položka za systémový prompt zhroutí a celkové náklady klesnou zhruba na $0,12–$0,15/min. Díky tomu je konkurenceschopné bundlovaným platformám nad 10k minut měsíčně.
Jak si odhadnu měsíční náklady svého hlasového agenta?
Odhadněte počet hovorů za měsíc vynásobený průměrnou délkou hovoru v minutách. Vynásobte celkovou sazbou $/min vaší platformy. Přičtěte fixní měsíční náklady: pronájem telefonních čísel, poplatky za znalostní bázi, základní limit souběžnosti, případně příplatek za HIPAA. Python funkce tco_per_minute() výše to automatizuje jedním voláním, které si můžete vložit do Jupyter notebooku.
Účtování po minutách, nebo po sekundách: co je levnější? Účtování po sekundách je u krátkých odchozích hovorů znatelně levnější. 61sekundový hovor účtovaný v 60sekundových krocích se naúčtuje jako 2 minuty, což je při 5 000 hovorech měsíčně s typickým rozložením krátkých hovorů efektivní daň 5–8 %. Bland a Deepgram účtují po sekundách; většina BYOK platforem ve výchozím nastavení přebírá 60sekundové zaokrouhlování Twilio.
Existují hlasoví AI agenti zdarma? Bezplatné trialy existují: většina dodavatelů nabízí 10–60 minut zdarma na otestování (Retell, Vapi, Bland). Skuteční produkční hlasoví agenti zdarma neexistují, protože vždy platíte minimálně minuty operátora ($0,014/min u odchozích hovorů Twilio US). I u self-hosted open-source stacků (Pipecat, LiveKit Agents) pořád platíte telekomunikačního operátora a LLM.
Jaká je návratnost hlasové AI oproti lidskému agentovi? Lidští agenti stojí plně započteno $15–$30/hod, což vychází na $0,25–$0,50/min. Hlasová AI za $0,10–$0,20/min poráží náklady na člověka zhruba nad 200 hovorů měsíčně, za předpokladu srovnatelné míry vyřešení. Pod tímto objemem dělají platformní minima a režie pronájmu čísel levnější odpovědí člověka plus $19/měs. SaaS.
Tento průvodce spravuje redakční tým Techsy. Stavíme produkční hlasové AI agenty na Retell, Vapi a OpenAI Realtime pro klienty; tato čísla pocházejí z modelování nákladů, které děláme každý týden, ne z brožur dodavatelů. Ceny ověřeny k květnu 2026; před podpisem smlouvy je vždy potvrďte na ceníkových stránkách dodavatele.