Techsy
Kontakt
Začít
Zpět na blog
ai-machine-learning

Ceny AI hlasových agentů v roce 2026: Pravda o $0,05 vs $0,30 za minutu (s výpočty)

Napsal Techsy Editorial Team
May 14, 2026
17 minut čtení
Obsah
Ceny AI hlasových agentů v roce 2026: Pravda o $0,05 vs $0,30 za minutu (s výpočty)

Ceny hlasových AI agentů v roce 2026: celá pravda o $0,05 vs $0,30 za minutu (i s výpočty)

Vapi uvádí na ceníkové stránce „$0,05/min". Váš účet za první měsíc ale ukáže $0,27/min. Co se stalo? Každá platforma pro hlasovou AI inzeruje jedno číslo – platformní poplatek – a účtuje vám čtyři další vrstvy, které jste na domovské stránce neviděli. Tento průvodce staví matematiku ai voice agent pricing znovu od základu: reálné BYOK náklady pro 8 platforem, řádková položka za audio tokeny, kterou nikdo nevysvětluje, a Python funkce, kterou si můžete zforkovat a odhadnout si vlastní účet.

Graf cen hlasových AI agentů, květen 2026 – měsíční náklady napříč objemovými pásmy pro Bland, Retell, Vapi a OpenAI Realtime

Rychlá odpověď

  • Reálné celkové náklady se v roce 2026 pohybují mezi $0,07–$0,30/min podle toho, zda jde o bundle, nebo BYOK.
  • Bundlované platformy (Retell, Bland, ElevenLabs) inzerují $0,07–$0,12/min a reálně končí kolem $0,10–$0,18/min.
  • BYOK platformy (Vapi s platformním poplatkem $0,05/min) po přičtení LLM + TTS + STT + Twilio skončí na $0,13–$0,31/min.
  • Největší skrytou pákou je prompt caching u OpenAI Realtime: systémové prompty až 80× levnější.

Kolik hlasový AI agent v roce 2026 vlastně stojí?

Většina hlasových AI agentů v roce 2026 vyjde celkově na $0,07 až $0,30 za minutu. Bundlované platformy (Retell, Bland, ElevenLabs) inzerují $0,07–$0,12/min a reálně se pohybují kolem $0,10–$0,18/min. BYOK platformy (Vapi s platformním poplatkem $0,05/min) skončí na $0,13–$0,31/min, jakmile přičtete LLM, TTS, STT a Twilio. Přímé napojení na OpenAI Realtime vychází zhruba na $0,30/min bez cachování.

Téměř všechno, co na účtě uvidíte, vysvětlují tři kategorie:

  • Bundlované za minutu: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min paušál), Synthflow a ElevenLabs Conversational. Jedno číslo, vše v ceně.
  • BYOK orchestrace: Vapi účtuje $0,05/min jen za vrstvu pro zpracování hovoru. Tokeny LLM, znaky TTS, minuty STT i operátora platíte zvlášť na vlastních účtech.
  • Přímo na infrastruktuře: Stavíte přímo na OpenAI Realtime plus Twilio. Pokud cachujete prompty, je to ve velkém objemu nejlevnější. Pokud ne, je to drahé.

Ve zbytku tohoto článku projdeme matematiku vrstvu po vrstvě a na konci najdete Python funkci tco_per_minute(), kterou si můžete vložit do notebooku.

Proč je inzerovaná cena za minutu lež (4 vrstvy nákladů)

Inzerovaný platformní poplatek $0,05/min pokrývá pouze orchestraci. Zbylé čtyři vrstvy se nabalují navrch. Každý produkční hlasový agent v roce 2026 platí pět položek: telefonii, STT, LLM, TTS a platformní poplatek, který to všechno drží pohromadě. Vynechte kteroukoli z nich a nemáte funkčního agenta.

Tady je minimum, vrstvu po vrstvě.

Vrstva 1: Telefonie (minuta operátora)

Platíte reálnému telekomunikačnímu operátorovi za zvuk, který putuje do veřejné telefonní sítě a z ní. Twilio Programmable Voice účtuje $0,014/min za odchozí hovor v USA, plus $1–$2 měsíčně za každé telefonní číslo. Twilio Elastic SIP se pohybuje od $0,0053 do $0,042/min podle místa původu hovoru. Většina platforem pro hlasovou AI buď přeprodává Twilio s malou přirážkou, nebo ji propouští jedna ku jedné. Tak či tak, ve vašem rozpočtu je to $0,014/min.

Vrstva 2: Převod řeči na text (STT)

Převádíte to, co volající řekl, na text, který LLM dokáže přečíst. Streamování Deepgram Nova-2 stojí na tarifu Pay-as-you-go zhruba $0,0043/min, takže v praxi počítejte s $0,005/min. Prémiové modely (ekvivalent Whisperu) šplhají k $0,018/min. Bundlované platformy to skrývají v hlavní sazbě, ale uvnitř tam pořád je.

Vrstva 3: LLM (text, nebo audio)

Tady jsou dvě cesty. Textové pipeliney posílají přepsaný audio záznam do modelu, jako je GPT-4o-mini ($0,15/M vstup, $0,60/M výstup), a odpověď posílají do TTS. Hlasová smyčka typicky spálí 100–300 vstupních tokenů a 80–200 výstupních tokenů na jeden obrat, což u GPT-4o-mini vychází zhruba na $0,003–$0,015/min, u Claude Haiku na $0,015–$0,04/min. Audio pipeliney (OpenAI Realtime) přeskočí celý tanec s přepisem a syntézou a účtují přímo v audio tokenech. Níže tomu věnujeme celou sekci; je to nákladová páka, kterou nikdo nevysvětluje.

Vrstva 4: Syntéza řeči (TTS)

Syntetizujete odpověď zpět do zvuku. ElevenLabs Turbo stojí na plánu Conversational $0,10/min, prémiové hlasy šplhají k $0,12/min. Nižší třída hlasů (Deepgram Aura, OpenAI tts-1) vychází na $0,04–$0,06/min. Tohle je obvykle druhá největší položka hned po platformním poplatku.

Sečteno na minimu: $0,014 telefonie + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 platforma = minimum $0,114/min na BYOK stacku. A to ještě před HIPAA, souběžností nebo pronájmem čísel. Pokud vás po tomto cenovém ponoru zajímá srovnání funkcí jedna ku jedné, podívejte se na náš rozbor Retell AI vs Vapi vs Bland.

Srovnání 8 platforem (cenová tabulka, květen 2026)

Tabulka níže shrnuje hlavní sazby a realistické celkové částky z ceníkových stránek každého dodavatele. Berte ji jako orientační, ne jako evangelium: ceníky se mění a vaše volba stacku mění výsledné číslo.

PlatformaCenový modelHlavní sazbaReálně celkem (typicky)HIPAABYOK, nebo bundleVýznamný háček
Retell AIZa minutu$0,07–$0,31/min$0,12–$0,18/minV ceněBundleSouběžnost $8/měs. za každý nad rámec zahrnutého limitu
VapiPlatformní poplatek + BYOK$0,05/min$0,13–$0,31/min+$2 000/měs.BYOKVšechny čtyři vrstvy navíc
Bland AIPaušál za minutu$0,09/min$0,09–$0,14/minV ceněBundlePoplatek za přepojení $0,025/min
SynthflowZa minutu v rámci plánuzáklad $0,09/min$0,11–$0,15/minV ceněBundleÚrovně plánu $29/$99/$449/$899
ElevenLabs ConversationalZa minutu$0,08–$0,12/min$0,10–$0,18/minPlán WorkspaceBundleLLM navíc, pokud nejste na spravovaném tarifu
Deepgram Voice AgentZa hodinu$4,50/hod ($0,075/min)$0,09–$0,11/min + telefonieAnoBundleNavrch přidejte Twilio
OpenAI Realtime APIAudio tokeny$32/M vstup, $64/M výstup~$0,30/min syrově, ~$0,12 s cacheVlastníPřímoMatematika audio tokenů (viz níže)
Twilio (vrstva telefonie)Za minutu$0,014/min odchozí v USA$0,014/min––Telefonní čísla $1–$2/měs.

Ceny ověřeny v květnu 2026. Před podpisem smlouvy vždy zkontrolujte ceníkové stránky dodavatele: jen za poslední rok Vapi změnilo svůj HIPAA příplatek dvakrát.

Modelový příklad: kolik opravdu stojí jeden 4minutový odchozí hovor?

Kanonický scénář: jeden 4minutový odchozí hovor, GPT-4o-mini jako LLM, ElevenLabs Turbo jako hlas, Twilio US jako operátor, pouze angličtina. Když jsme tento scénář propočítali napříč všemi čtyřmi platformami (Vapi, Retell, Bland, OpenAI Realtime přímo), hlavní sazba vysvětlila méně než polovinu výsledného čísla.

Předpoklady platné pro všechny čtyři:

  • 4 minuty reálného času hovoru
  • ~12 konverzačních obratů, ~150 vstupních tokenů + 100 výstupních tokenů na obrat = 1 800 vstup / 1 200 výstup pro GPT-4o-mini
  • TTS vygeneruje ~400 znaků na obrat × 12 = 4 800 znaků (ElevenLabs Turbo @ $0,10/min audio výstupu)
  • STT účtuje celých 4 minuty (Deepgram Nova-2 @ ~$0,0043/min)
  • Twilio odchozí v USA @ $0,014/min, $1/měs. za číslo amortizováno přes 1 000 hovorů/měs. = $0,001/hovor

Vapi BYOK: $0,05 → $0,27/min

PoložkaNáklad
Platformní poplatek Vapi (4 min × $0,05)$0,200
GPT-4o-mini (1 800 vstup × $0,15/M + 1 200 výstup × $0,60/M)$0,001
ElevenLabs Turbo (4 min × $0,10)$0,400
Deepgram STT (4 min × $0,005)$0,020
Twilio (4 min × $0,014)$0,056
Amortizovaný pronájem čísla$0,001
Celkem za hovor$0,678
Efektivní $/min$0,170

Poznámka: ElevenLabs Turbo na plánu Conversational se blíží spíš $0,10/min, nejde o paušál, takže počítáme s poplatkem za minutu výstupu. Platformní poplatek $0,05/min plus GPT-4o-mini plus ElevenLabs Turbo plus Twilio dohromady dávají spíš $0,17–$0,27/min, nikoli $0,05.

Retell bundle: $0,10 → $0,16/min

PoložkaNáklad
Bundle Retell (4 min × $0,13, GPT-4o-mini + Retell TTS)$0,520
Průchod Twilio (4 min × $0,014)$0,056
Amortizovaný pronájem čísla$0,002
Celkem za hovor$0,578
Efektivní $/min$0,145

Bundle Retell v sobě zahrnuje LLM (model si vyberete), STT i jejich vlastní TTS. Zbývá vám platit Twilio navrch. A to je vše.

Bland paušál: $0,09 → $0,13/min

PoložkaNáklad
Paušál Bland (4 min × $0,09)$0,360
Průchod Twilio (4 min × $0,014)$0,056
Amortizovaný pronájem čísla$0,001
Celkem za hovor$0,417
Efektivní $/min$0,104

Bland má nejčistší matematiku ve výsledcích vyhledávání. Jedno číslo plus operátor. Háček se skrývá ve skrytých poplatcích – minuty přepojení se účtují navrch $0,025/min.

OpenAI Realtime přímo (bez cachování): $0,30/min

PoložkaNáklad
OpenAI Realtime audio vstup (4 min × ~$0,077)$0,308
OpenAI Realtime audio výstup (4 min × ~$0,077)$0,308
Twilio (4 min × $0,014)$0,056
Amortizovaný pronájem čísla$0,001
Celkem za hovor$0,673
Efektivní $/min$0,168

Toto číslo předpokládá, že cachujete systémové prompty. Bez cachování vyjde stejný hovor blíž k $1,20 ($0,30/min), protože každý obrat znovu účtuje celý systémový prompt za plnou sazbu. Tuto matematiku rozebereme níže.

Rozklad nákladového stacku hlasového agenta – vrstvy platformního poplatku, LLM, TTS, STT a telefonie pro jeden 4minutový odchozí hovor

Bundle vs BYOK: který cenový model vyhrává pro vás?

Bundlované platformy vyhrávají, když chcete jeden účet, předvídatelnou matematiku za minutu a solidní základní hlas. BYOK vyhrává, když máte vývojářskou kapacitu, chcete si vybrat vlastní LLM a plánujete ve velkém objemu vyjednat sazby operátora. Rozhodnutí obvykle stojí na dvou otázkách: máte preferenci ohledně řádku na faktuře, a máte vývojáře, který stack převezme?

Případ užitíBundle vyhrává, protožeBYOK vyhrává, protože
Odklon příchozí podporyJeden dodavatel, jeden účet, HIPAA v ceněTěžko obhájíte náklady na vývojáře
Odchozí cold calling ve velkémPaušální matematika poráží překvapení za tokenyNad 100k min/měs. můžete vyjednat minuty operátora
Vlastní RAG + použití nástrojůVětšina bundlů má omezenou plochu pro volání nástrojůPlná kontrola nad kontextovým oknem
Regulovaná odvětvíVlajku HIPAA přepnete jedním zaškrtávacím políčkemCompliance se stane vaším problémem

Rychlé rozhodovací pravidlo:

  • Pod 10 000 minut měsíčně → bundle téměř vždy vyhrává v celkových nákladech vlastnictví (jen čas vývojáře srovná účet).
  • 10 000–100 000 minut měsíčně → BYOK se začne vyplácet, pokud na něj máte alespoň jednoho vývojáře.
  • Nad 100 000 minut měsíčně → BYOK nebo přímé napojení na Realtime je obvykle o $0,05–$0,10/min levnější a máte páku vyjednat sazby sub-účtů Twilio.

Pro hlubší pohled na náklady LLM na straně BYOK se podívejte na náš rozbor možností orchestrace v best AI agent frameworks.

Skryté poplatky, které většina lidí přehlédne

I když máte matematiku čtyř vrstev zmáknutou, účet dorazí s položkami, o kterých se domovská stránka nikdy nezmínila. Těchto sedm vídáme u klientů nejčastěji. Většina z nich je zakopaná v drobném písmu ceníku nebo na konfiguračních obrazovkách po registraci. Nejsou zlomyslné, jen nedostatečně komunikované.

  1. Příplatek za HIPAA. Vapi si podle svého ceníku účtuje za HIPAA $2 000/měs. Retell, Bland a Synthflow zahrnují HIPAA bez příplatku. Pokud jste ve zdravotnictví a zvažujete Vapi, je to $24k ročně, než vůbec uskutečníte první hovor.
  2. Daň z zaokrouhlování na minuty. Většina platforem zaokrouhluje na 60sekundové kroky: 61sekundový hovor se účtuje jako 2 minuty. Při 5 000 hovorech měsíčně s typickým rozložením 45–90 sekund to znamená efektivní navýšení 5–8 % oproti tomu, co říká vaše matematika $/min. Účtování po sekundách (Bland, Deepgram) to obchází.
  3. Pronájem telefonních čísel. Twilio: $1–$2/měs. za číslo. Retell: $2/měs. za číslo, $10/měs. za ověřená čísla. Vypadá to jako drobné, dokud neprovozujete 50 odchozích čísel na cold calling; to je položka $100/měs., kterou vám nikdo nacenil.
  4. Poplatky za souběžnost. Retell zahrnuje základní počet souběžných hovorů; nad něj je to $8/souběžnost/měsíc. Tým, který nad rámec základu vede 10 souběžných hovorů, si připlatí $80/měs.
  5. Poplatky za přepojení. Bland účtuje $0,025/min, když agent hovor přepojí na člověka. Pokud se přepojí 20 % vašich hovorů, je to citelná daň na průměrné minutě.
  6. Poplatky za znalostní bázi. Retell vám dá 10 KB zdarma; každá další je $8/měs. U RAG-heavy případů užití se to rychle nasčítá.
  7. Upsell prémiových hlasů. ElevenLabs Premium přidává +$0,04/min oproti Turbo. Zní to jako volitelné, dokud váš obchodní tým neudělá A/B test a nezjistí, že Premium konvertuje o 11 % lépe.

Potřebujete někoho, kdo vám před podpisem smlouvy s Vapi položí na stůl položky pro váš konkrétní případ užití? Děláme to v rámci našich projektů stavby hlasových agentů.

Audio tokeny a prompt caching: nákladová páka, kterou nikdo nevysvětluje

OpenAI Realtime API účtuje v audio tokenech, kde 1 token = 100 ms vstupního audia nebo 50 ms výstupního audia. 60sekundový hovor spotřebuje zhruba 600 vstupních tokenů (volající mluví) a 1 200 výstupních tokenů (agent odpovídá). Při $32/M vstup a $64/M výstup to je $0,0192 vstup + $0,0768 výstup = $0,096 syrových nákladů na audio za minutu, tedy zhruba $0,10/min, než přičtete prompty, nástroje nebo Twilio.

A pak je tu systémový prompt. Každý obrat posílá modelu váš celý systémový prompt jako součást kontextového okna. Typický hlasový agent má 2 000tokenový systémový prompt pokrývající personu, nástroje, okrajové případy a logiku odmítnutí. Bez cachování se tento 2 000tokenový blok účtuje za plnou sazbu $32/M při každém hovoru: $64 napříč 1 000 hovory.

Se zapnutým prompt cachingem (cachované tokeny stojí $0,40/M podle dokumentace OpenAI) vyjde stejná zátěž 1 000 hovorů na $0,80. To je 80× sleva na nákladech za systémový prompt. Prompt caching na OpenAI Realtime srazí vaše náklady na systémový prompt 80krát. Většina týmů na to přijde až po účtu za první měsíc.

Tady je ta matematika jako kód:

python
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min

INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000

# Fresh rates
COST_IN_FRESH = 32 / 1_000_000   # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000  # 80x discount

# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min

# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS    # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS  # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80

Diagram účtování audio tokenů – vstupní tokeny OpenAI Realtime po 100 ms a výstupní tokeny po 50 ms napříč 60sekundovým hovorem

Při našem modelování nákladů pro klienty, kteří staví přímo na Realtime, je tohle ta největší páka mezi „Realtime je levné" a „Realtime je dvakrát dražší než Vapi". Pokud vedle Realtime používáte pro volání nástrojů i Responses API, podívejte se na náš OpenAI Responses API tutorial ohledně implementačního vzoru. Právě proto může být přímá stavba na OpenAI Realtime levnější nebo mnohem dražší než Vapi – podle toho, zda cachujete.

Jak si spočítat vlastní TCO (vzorec + Python)

Celkové náklady vlastnictví (TCO) hlasového agenta jsou variabilní náklady za minutu plus měsíční fixní poplatky amortizované přes váš objem minut. Vzorec:

TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month

Dosaďte svá čísla. Nebo si zforkujte tohle:

python
def tco_per_minute(
    calls_per_month: int,
    avg_duration_seconds: float,
    platform_fee_per_min: float,        # e.g., 0.05 for Vapi, 0.13 for Retell bundle
    llm_in_per_1m: float,               # e.g., 0.15 for GPT-4o-mini input
    llm_out_per_1m: float,              # e.g., 0.60 for GPT-4o-mini output
    llm_in_tokens_per_call: int,        # e.g., 1800
    llm_out_tokens_per_call: int,       # e.g., 1200
    tts_per_min: float,                 # e.g., 0.10 for ElevenLabs Turbo
    stt_per_min: float,                 # e.g., 0.005 for Deepgram Nova-2
    telephony_per_min: float,           # e.g., 0.014 for Twilio US
    fixed_monthly: float = 0.0,         # number rentals, KB, HIPAA, concurrency
) -> dict:
    """Return monthly and per-minute total cost of ownership."""
    minutes_per_month = (calls_per_month * avg_duration_seconds) / 60

    # Variable per-call
    llm_cost_per_call = (
        (llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
        + (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
    )
    avg_minutes_per_call = avg_duration_seconds / 60
    variable_per_call = (
        platform_fee_per_min * avg_minutes_per_call
        + llm_cost_per_call
        + tts_per_min * avg_minutes_per_call
        + stt_per_min * avg_minutes_per_call
        + telephony_per_min * avg_minutes_per_call
    )

    monthly_variable = variable_per_call * calls_per_month
    monthly_total = monthly_variable + fixed_monthly
    cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0

    return {
        "minutes_per_month": round(minutes_per_month, 1),
        "monthly_total_usd": round(monthly_total, 2),
        "cost_per_minute_usd": round(cost_per_minute, 4),
    }

# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
    calls_per_month=5000,
    avg_duration_seconds=240,
    platform_fee_per_min=0.05,
    llm_in_per_1m=0.15, llm_out_per_1m=0.60,
    llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
    tts_per_min=0.10,
    stt_per_min=0.005,
    telephony_per_min=0.014,
    fixed_monthly=2.0,  # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}

Čtyři kroky pro každého, kdo prognózuje od nuly:

  1. Odhadněte měsíční objem hovorů a průměrnou délku hovoru.
  2. Vyberte stack: platforma + LLM + TTS + STT + telefonie.
  3. Vyhledejte jednotkovou cenu každé komponenty na ceníkové stránce dodavatele.
  4. Spusťte vzorec (nebo Python funkci výše) – výstupem je vaše prognóza $/min a měsíčních $.

Pokud nedokážete své TCO zapsat jako jednořádkový vzorec, prohrajete to na dani z zaokrouhlování na minuty.

Náklady ve velkém: 1k vs 10k vs 100k minut měsíčně

Nad 10 000 minut se křivky rychle rozcházejí. Bundlované platformy se zplošťují, protože jejich účet je jen minuty × sazba. BYOK stacky se strmě zvedají, protože náklady na LLM a TTS rostou lineárně s vámi. OpenAI Realtime s cachováním se dostane pod Vapi někde mezi 10k–20k min/měs. – to je bod zlomu, kdy se začne vyplácet přímé napojení na infrastrukturu.

Platforma1 000 min/měs.10 000 min/měs.100 000 min/měs.
Bland paušál $0,09/min + Twilio$120$1 160$11 400
Retell bundle ~$0,145/min celkem$145$1 450$14 500
Vapi BYOK ~$0,17/min celkem$170$1 700$17 000
OpenAI Realtime + caching ~$0,13/min$130$1 300$13 000
Deepgram Voice Agent + Twilio$108$1 080$10 800

Čísla odvozena ze vzorce tco_per_minute() výše s kanonickými předpoklady pro 4minutový hovor. Tam, kde se uplatní, přičtěte HIPAA ($2 000/měs. Vapi), souběžnost a pronájem čísel. Tvar křivky to nezmění, ale pro malé objemy to zvedá minimum.

Hrdinový graf na začátku tohoto článku vizualizuje tatáž čísla: Bland se zploští brzy, Vapi se zvedá, jak rostou náklady na LLM, a OpenAI Realtime s cachováním porazí Vapi nad 10k minut.

Kdy byste hlasového agenta nasazovat NEMĚLI

Hlasová AI má reálné minimum $0,10–$0,30/min. Pod 200 hovorů měsíčně stále vyhrává na nákladech člověk plus $19 SaaS. Pronájem telefonních čísel, základní limity souběžnosti a platformní minima se nasčítají do režie $50–$200/měs., kterou nízkoobjemový tým prostě nezaplatí.

Tři kritéria pro „přeskočit", upřímně:

  1. Méně než 200 hovorů/měsíc. Pronájem čísel + minimální poplatky + základní limity souběžnosti přesáhnou to, kolik stojí člověk na částečný úvazek za $20/hod. Bod zvratu prostě nevychází.

  2. Vysoce kontextová práce s nízkým objemem. Váš jeden člověk zvládne 15 hovorů denně, každý s 30+ unikátními scénáři. Náklady na halucinace LLM (refundace, ztracené obchody, špatné schůzky) sežerou úspory. Hlasová AI září u repetitivních procesů, ne u práce plné okrajových případů.

  3. Regulovaná odvětví bez rozpočtu na HIPAA. HIPAA příplatek Vapi $2k/měs., poplatky operátora za compliance a ochrana PII ($0,005–$0,01/min na Retell) dokážou celou matematiku pohřbít. Pokud nemůžete vyčlenit $25k ročně jen na položky compliance, spusťte piloty nejprve na procesech bez PHI.

Při testování vychází bod zvratu vůči lidskému agentovi pro odklon podpory kolem 250–400 hovorů/měsíc při typických bundlovaných sazbách. Pod tím je $19/měs. SaaS plus člověk levnější. Nenasazujte hlasovou AI jen proto, že to jde.

Tichá opuštěná podlaha call centra za soumraku s nepoužívanými headsety, symbolizující realitu cenového minima hlasové AI

Pokud hlasová AI překoná cenové minimum, ale nechcete si Retell ani Vapi zapojovat sami, naše služba vývoje hlasových agentů postaví a provozuje celý stack na vaší infrastruktuře.

Jak bychom v roce 2026 platformu vybírali my (verdikt podle případu užití)

Žádná platforma nevyhrává všude. Nejlevnější seriózní volba závisí na tom, zda řešíte příchozí, nebo odchozí hovory, zda máte vývojářskou kapacitu a zda záleží na HIPAA. Pět případů užití, pět odpovědí:

  • Nejlevnější seriózní odchozí (cold calling): Bland. Paušál $0,09/min, transparentní poplatek za přepojení, žádná překvapení s náklady na LLM. Přeskočte ho, pokud potřebujete hluboké RAG nebo vlastní nástroje.
  • Nejlevnější příchozí (odklon podpory): Retell. Bundle, HIPAA v ceně, zralá analytika, $0,12–$0,18 celkem. Přeskočte ho, pokud je váš objem příchozích hovorů pod 200 hovorů/měs. (viz předchozí sekce).
  • Maximální kontrola + vlastní RAG: Vapi BYOK. Jen pokud máte vývojářskou kapacitu převzít klíče k LLM, TTS a STT. Kontrola stojí $0,27/min jen tehdy, když dokážete objemem srazit dolů operátora a LLM.
  • Bundlovaná jednoduchost ve velkém: Deepgram Voice Agent. Paušál $4,50/hod ($0,075/min), nejvíce přehlížená možnost ve výsledcích vyhledávání. Přeskočte ho, pokud potřebujete širokou knihovnu hlasů, kterou nabízí ElevenLabs.
  • Laťka kvality konverzace (prodejní dema, na značku citlivé procesy): ElevenLabs Conversational. Hlasy Turbo nebo Premium za $0,10–$0,12/min. Připlaťte si, když je kvalita hlasu konverzní pákou.

Pro hlubší řez podnikovým prostředím se podívejte na AI voice agents for enterprise call centers: stejná matematika, s objemovými předpoklady pro restaurace a kliniky.

Jak v Techsy přistupujeme k modelování nákladů hlasových agentů

Neprodáváme hlasovou platformu. Stavíme produkční hlasové agenty pro klienty na Retell, Vapi, Deepgram a OpenAI Realtime. To znamená, že když pro nový projekt modelujeme náklady, propočítáme vzorec tco_per_minute() na třech objemových úrovních (1k, 10k, 100k min/měs.), než doporučíme stack. Platforma, která vyhrává při 1k, často prohrává při 100k.

Pro klienty nad 100k min/měs. vyjednáváme ceny sub-účtů Twilio (sub-účty odemykají objemové úrovně, o kterých většina týmů neví, že existují), a u staveb na Realtime vždy modelujeme úspory z prompt cachingu, než odsouhlasíme design na přímé infrastruktuře. Polovina naší práce na modelování nákladů pro klienty je vyvracení předpokladů, které někdo udělal z blogového příspěvku dodavatele.

Chcete hlasového agenta postaveného od A do Z na platformě, která pro váš objem skutečně vyhrává? Podívejte se, jak stavíme hlasové agenty →

FAQ

Kolik stojí hlasový AI agent za minutu v roce 2026? Celkové náklady se pohybují od $0,07 do $0,30 za minutu. Bundlované platformy (Retell, Bland, ElevenLabs Conversational) po započtení telefonie končí na $0,10–$0,18/min. BYOK platformy jako Vapi skončí na $0,13–$0,31/min po přičtení nákladů na LLM, TTS, STT a Twilio. Přímé OpenAI Realtime se pohybuje kolem $0,30/min syrově, nebo zhruba $0,12/min se zapnutým prompt cachingem na systémových promptech.

Která platforma pro hlasové AI agenty je nejlevnější? Pro odchozí hovory má Bland AI s paušálem $0,09/min nejčistší matematiku na trhu. Pro příchozí podporu obvykle vyhrává Retell s $0,10–$0,16 celkem, díky bundlovanému HIPAA a základním limitům souběžnosti. Pro čistě infrastrukturní řešení s cachováním může OpenAI Realtime klesnout pod $0,15/min. Deepgram Voice Agent s paušálem $0,075/min je nejvíce přehlížená možnost.

Proč je můj účet u Vapi vyšší než $0,05/min? Částka $0,05/min na ceníkové stránce Vapi je pouze platformní poplatek. Vapi je BYOK: přinášíte si vlastní klíče pro LLM (GPT-4o-mini, Claude atd.), TTS (ElevenLabs, PlayHT), STT (Deepgram) a telefonii (Twilio). Reálné celkové náklady se pohybují mezi $0,13–$0,31/min podle toho, jaký hlas a model si vyberete.

Jaký je rozdíl mezi BYOK a bundlovanými cenami? Bundlované platformy (Retell, Bland, Synthflow, ElevenLabs Conversational) zahrnují LLM, STT a TTS do jedné sazby za minutu. BYOK platformy (Vapi) účtují pouze orchestraci – na všechno ostatní si přinesete vlastní API klíče a každý dodavatel vám účtuje zvlášť. Bundle je jednodušší; BYOK vám dává kontrolu a vyjednávací páku ve velkém objemu.

Existují u cen hlasových AI agentů skryté poplatky? Ano, sedm běžných. Příplatky za HIPAA ($2 000/měs. u Vapi), zaokrouhlování na minuty (efektivní navýšení 5–8 % ve velkém), pronájem telefonních čísel ($1–$2/měs.), poplatky za souběžnost ($8/souběžnost/měs. Retell), poplatky za přepojení ($0,025/min Bland), poplatky za znalostní bázi ($8/měs. za KB u Retell) a upsell prémiových hlasů (+$0,04/min ElevenLabs Premium oproti Turbo).

Je OpenAI Realtime API levnější než Vapi? Bez prompt cachingu ne: OpenAI Realtime stojí zhruba $0,30/min syrových nákladů na audio. Se zapnutým prompt cachingem (cachované tokeny systémového promptu za $0,40/M oproti $32/M za plnou sazbu, tedy 80× sleva) se položka za systémový prompt zhroutí a celkové náklady klesnou zhruba na $0,12–$0,15/min. Díky tomu je konkurenceschopné bundlovaným platformám nad 10k minut měsíčně.

Jak si odhadnu měsíční náklady svého hlasového agenta? Odhadněte počet hovorů za měsíc vynásobený průměrnou délkou hovoru v minutách. Vynásobte celkovou sazbou $/min vaší platformy. Přičtěte fixní měsíční náklady: pronájem telefonních čísel, poplatky za znalostní bázi, základní limit souběžnosti, případně příplatek za HIPAA. Python funkce tco_per_minute() výše to automatizuje jedním voláním, které si můžete vložit do Jupyter notebooku.

Účtování po minutách, nebo po sekundách: co je levnější? Účtování po sekundách je u krátkých odchozích hovorů znatelně levnější. 61sekundový hovor účtovaný v 60sekundových krocích se naúčtuje jako 2 minuty, což je při 5 000 hovorech měsíčně s typickým rozložením krátkých hovorů efektivní daň 5–8 %. Bland a Deepgram účtují po sekundách; většina BYOK platforem ve výchozím nastavení přebírá 60sekundové zaokrouhlování Twilio.

Existují hlasoví AI agenti zdarma? Bezplatné trialy existují: většina dodavatelů nabízí 10–60 minut zdarma na otestování (Retell, Vapi, Bland). Skuteční produkční hlasoví agenti zdarma neexistují, protože vždy platíte minimálně minuty operátora ($0,014/min u odchozích hovorů Twilio US). I u self-hosted open-source stacků (Pipecat, LiveKit Agents) pořád platíte telekomunikačního operátora a LLM.

Jaká je návratnost hlasové AI oproti lidskému agentovi? Lidští agenti stojí plně započteno $15–$30/hod, což vychází na $0,25–$0,50/min. Hlasová AI za $0,10–$0,20/min poráží náklady na člověka zhruba nad 200 hovorů měsíčně, za předpokladu srovnatelné míry vyřešení. Pod tímto objemem dělají platformní minima a režie pronájmu čísel levnější odpovědí člověka plus $19/měs. SaaS.


Tento průvodce spravuje redakční tým Techsy. Stavíme produkční hlasové AI agenty na Retell, Vapi a OpenAI Realtime pro klienty; tato čísla pocházejí z modelování nákladů, které děláme každý týden, ne z brožur dodavatelů. Ceny ověřeny k květnu 2026; před podpisem smlouvy je vždy potvrďte na ceníkových stránkách dodavatele.

Štítky

ceny-ai-hlasovych-agentuhlasova-airetell-aivapibland-ainaklady-llmopenai-realtime

Sdílet článek

Související články

Více z kategorie ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 nejlepších API pro AI web scraping v roce 2026 (otestováno na našem vlastním agentním stacku)

Otestovali jsme 8 API pro AI web scraping s reálnými cenami pro rok 2026 staženými přes náš vlastní agentní stack. Firecrawl, Bright Data, ScrapingBee a 5 dalších, seřazené podle výstupu připraveného pro LLM, anti-bot a podpory MCP.

9 min read minut čtení
Číst
ai-machine-learning
Jul 20, 2026

Prompt Engineering pro kódování: 7 vzorů, které denně používáme v Claude Code a Cursor (2026)

Většina článků o „promptech pro AI kódování“ vám nabídne 50 šablon ke kopírování. Tento článek učí 7 vzorů, které každý den používáme k provozu pipeline s 16 agenty v Claude Code, včetně skutečných příkladů před a po úpravě pro každý z nich, a ukazuje, kde se každý vzor nachází v nástrojích Claude Code, Cursor a Copilot v roce 2026.

11 min read minut čtení
Číst
ai-machine-learning
Jul 19, 2026

AI PoC do produkce: 12bodový kontrolní seznam před nasazením

Funkční AI demo není produkční systém. Tento 12bodový kontrolní seznam prochází tři fáze, které každá AI funkce před spuštěním potřebuje: zpevnit, stabilizovat a nasadit – s konkrétními prahy pro cenové stropy, omezení rychlosti, záložní řešení a spouštěče rollbacku.

10 min read minut čtení
Číst
Zobrazit všechny články
Začněte svůj projekt

Pojďme něco postavit nevšedního?

Proměňme vaši vizi ve skutečnost. Náš tým je připraven vám pomoct vytvořit software, který dělá rozdíl.

Rezervovat 30minutový úvodní hovorNaše projekty

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt

Právní informace

  • Zásady ochrany osobních údajů
  • Podmínky poskytování služeb
  • Zásady používání cookies

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt
Právní informaceZásady ochrany osobních údajůPodmínky poskytování služebZásady používání cookies
TECHSY
© 2026 Techsy. Všechna práva vyhrazena.