Kalkulačka nákladů na vývoj hlasového AI agenta
Náklady na vývoj plus ekonomika provozu v režii minut při škálování.
Produkční hlasový AI agent stojí 25 000 až 150 000 $ na vývoj, plus 0,08 až 0,30 $ za minutu hovoru při velkém objemu. Náklady na vývoj zahrnují integrace (CRM, kalendář, platby), návrh dialogu a infrastrukturu pro reálný čas. Minutové náklady tvoří především speech-to-text, inference LLM a text-to-speech dohromady. Self-hosted varianty snižují minutové náklady o 60 %, ale za cenu vyšší počáteční investice.
Vaše vstupy
05 fieldsOvlivňuje průměrnou sazbu; senioři stojí o 35 % více.
Kdo by měl tento nástroj používat
Zakladatelé definující rozsah projektu voice ai agent před konzultacemi s dodavateli. CTOs a technologičtí lídři budující roční rozpočet na vývoj nových produktů. Product manažeři převádějící jednorázový nápad na udržitelný rozpočtový rámec pro finance. Nákupní týmy ověřující nabídky agentur a freelancerů.
Jak počítáme
Odhad nákladů na vývoj vychází z hodinové náročnosti. Managed stacky (Retell, Vapi) nasadíte nejrychleji. Best-of-breed přístup nabízí větší kontrolu, ale za cenu o 25 % více práce na integracích. Self-hosted varianta vyžaduje odborné znalosti hlasové infrastruktury a znamená o 70 % vyšší počáteční náklady.
Zdroje dat
- Projekty hlasových agentů společnosti Techsy 2024–2026
- Veřejné ceny Retell AI
- Veřejné ceny Vapi
- Ceny převodu řeči na text Deepgram
- Ceny syntézy hlasu ElevenLabs
- Ceny Programmable Voice od Twilia
- Ceny API Anthropic Claude
Co cenu ovlivňuje
Návrh dialogu
Design dialogu tvoří obvykle 25 až 35 % celkové náročnosti vývoje a právě on odděluje hlasové agenty, které fungují, od těch, které každého volajícího přivedou k zoufalství. Kvůli špatnému designu dialogu působí většina hlasových agentů v ostrém provozu rozbitě: zvládnou happy path a na čemkoli jiném pohoří. Počítejte se seniorním dialogovým designérem nebo specialistou na konverzační AI už od prvního dne, místo abyste dialog považovali za funkci, kterou na konci doplní vývojář. Hodiny ušetřené vynecháním práce na dialogu se vám později vrátí v odlivu zákazníků.
Hloubka integrace
Rezervace termínu v kalendáři je snadná: 40 až 60 hodin. Rezervace plus přijetí platby plus odeslání potvrzení plus uložení interakce do CRM je zhruba trojnásobek práce, protože každá integrace násobí možné scénáře selhání. Hlasový agent, který vyřeší celou zákaznickou cestu v jednom hovoru, je výrazně náročnější na vývoj než agent, který po kvalifikaci předá hovor člověku. Každá integrace přidá 40 až 120 hodin plus průběžnou údržbu.
Požadavky na latenci
Hlas má tvrdé real-time limity, které web a mobilní aplikace nemají. Celková latence odezvy (volající mluví, agent přemýšlí, agent odpovídá) se musí vejít pod 800 ms, jinak konverzace působí rozbitě. Managed stacky jako Retell a Vapi to zvládají stabilně. Self-hosted stacky mohou mít nižší latenci než managed řešení, ale vyžadují GPU infrastrukturu na edge, aby převod řeči na text a inference LLM zůstaly rychlé. Optimalizace latence je netriviální inženýrská práce, kterou většina týmů podceňuje.
Jazyky a přízvuky
Každý další jazyk znamená lokalizaci dialogu, výběr hlasového modelu a testování napříč regionálními přízvuky. Druhý jazyk je zhruba o 25 % více práce, třetí dalších 25 %. Podpora smíšených jazyků, kdy volající uprostřed konverzace přepíná mezi jazyky (třeba z angličtiny do španělštiny), přidává dalších 30 %, protože jazyk nelze detekovat jen jednou na začátku hovoru. Většina hlasových agentů by měla začít s jedním jazykem a další přidávat na základě reálných dat z hovorů.
Ekonomika za minutu hovoru
Managed stacky jako Retell a Vapi stojí 0,12 až 0,30 $ za minutu end-to-end včetně STT, LLM, TTS a telefonie. Best-of-breed stacky kombinující Deepgram, Claude Sonnet, ElevenLabs a Twilio vyjdou na 0,08 až 0,20 $ za minutu a nabízejí větší kontrolu. Self-hosted řešení vyjde po amortizaci infrastruktury na 0,03 až 0,08 $ za minutu, ale vyžaduje značné počáteční úsilí na vývoj. Správná volba závisí na objemu hovorů: do 50 tisíc minut měsíčně vyhrává managed varianta, nad 200 tisíc minut self-hosted.
Jak snížit náklady
Začněte s managed stackem jako Retell nebo Vapi, místo abyste od prvního dne budovali best-of-breed nebo self-hosted řešení. Managed platformy se postarají o hlasovou infrastrukturu (STT, TTS, telefonii, real-time orchestraci), takže se váš tým může soustředit na design dialogu a integrace. Spustíte ho za 4 až 8 týdnů místo 12 až 20 a ověříte si use case dřív, než se pustíte do náročnějšího vývoje. Na vlastní stack později migrujte jen tehdy, když objem hovorů překročí 100 tisíc minut měsíčně nebo nároky na kvalitu přesáhnou možnosti managed platforem.
Při spuštění omezte agenta na jeden konkrétní use case. Lákavé je postavit univerzálního hlasového agenta, který zvládne všechno: rezervace, podporu, prodej, eskalace. Vzorec, který se reálně nasazuje a funguje, je jedna věc udělaná pořádně – třeba rezervace termínů nebo resetování hesel. Míra vyřešení bez přepojení se u úzkých use cases pohybuje mezi 70 a 90 %; u širokých klesá na 40 až 60 % a volající se naučí mačkat nulu. Druhý use case přidejte teprve ve chvíli, kdy ten první běží spolehlivě.
Pro dialogovou logiku používejte Claude Sonnet 4 nebo GPT-4o mini místo vlajkových modelů. Hlasoví agenti u většiny hovorů nepotřebují špičkové uvažovací schopnosti; potřebují rychlé, levné a spolehlivé generování odpovědí. Sonnet 4 a GPT-4o mini jsou 5–10× levnější než Opus nebo GPT-4.5 a u přesně vymezených konverzačních úloh nabízejí srovnatelnou kvalitu. Úspora na modelu znamená snížení nákladů na minutu o 30–50 % bez ztráty kvality u typických hlasových scénářů.
Nahrávejte každý hovor, každý týden vyhodnocujte neúspěšné hovory a dialog průběžně vylepšujte. Hlasoví agenti degradují potichu, protože si jejich hovory nikdo neposlouchá. Zaveďte týdenní kontrolu, při které tým poslechne 10–20 náhodně vybraných neúspěšných hovorů, odhalí opakující se vzorec a upraví dialog nebo logiku směrování. Právě tento průběžný cyklus odlišuje hlasové agenty, kteří se časem zlepšují, od těch, kteří se s přibývajícími okrajovými případy tiše zhoršují. Náklady jsou 2–4 hodiny týdně a vrátí se v míře vyřešených hovorů bez operátora.
Při spuštění nabídněte pouze jeden jazyk. Vícejazyčná podpora zvyšuje náklady na vývoj o 25–30 % za každý jazyk a výrazně komplikuje testování dialogů. Pokud je 80 % příchozích hovorů v angličtině, spusťte pouze angličtinu a zbytek směrujte na operátora. Přidávejte jazyky podle skutečného objemu hovorů v jednotlivých jazycích, ne podle předpokladů o vaší zákaznické bázi. Většina týmů spustí vícejazyčnou podporu, kterou nikdo nepoužívá, kvůli domnělé poptávce, která se nenaplnila.
Odložte integrace, které nejsou klíčové pro případ použití při spuštění. Začněte s jedinou integrací, kterou agent nezbytně potřebuje (obvykle kalendář pro rezervace nebo CRM pro kontext podpory), a další přidávejte podle toho, co volající skutečně požadují. Každá integrace znamená 40–120 hodin práce navíc plus průběžnou údržbu a spekulativně postavené integrace se často rozbijí jako první, protože je nikdo nepoužívá natolik, aby si toho všiml. Co nejužší rozsah při spuštění znamená nejrychlejší nasazení a poskytne vám reálná data pro rozhodování, co vyvinout dál.
Náklady na hlasového agenta při různých objemech
| Technologie | Náklady na vývoj | Cena za minutu | Měsíční náklady @10K min |
|---|---|---|---|
| Spravované (Retell) | $25 000–$55 000 | $0,12–$0,30/min | $1 200–$3 000/měs. |
| Nejlepší kombinace | $40 000–$85 000 | $0,08–$0,20/min | $800–$2 000/měs. |
| Vlastní hosting | $70 000–$150 000 | $0,03–$0,08/min | $300–$800/měs. + infra |
Časté dotazy
Otázky, které dostáváme každý týden
Stručné odpovědi srozumitelnou řečí. Pokud svou otázku nenajdete,
Náklady na vývoj: 25 000–150 000 $. Provozní náklady: 0,08–0,30 $ za minutu. Při 10 000 minutách měsíčně vyjde hlasový agent na 800–3 000 $ měsíčně plus náklady na vývoj.
Managed platformy (Retell, Vapi) pro rychlé uvedení na trh. Best-of-breed řešení (Deepgram + Claude + ElevenLabs) pro kvalitu a kontrolu. Self-hosted pro velký objem nebo přísné požadavky na soukromí.
U dobře vymezených úkolů (rezervace, FAQ, třídění): ano, se 70–90% podílem hovorů vyřešených bez zásahu člověka. U komplexní podpory: hlasoví agenti zvládnou první linii a eskalují. Úplná náhrada je vzácná.
U úzce vymezených úkolů: kvalitou hlasu k nerozeznání od člověka. U otevřených konverzací: je stále znát, že jde o AI, ale často je to přijatelné. Největší přetrvávající problém: zvládání přerušování a nesrozumitelné řeči.
Angličtina, španělština, francouzština, němčina a portugalština mají vynikající podporu. Arabština, turečtina a mandarínština jsou použitelné, ale vyžadují testování. Tónové jazyky mají oproti angličtině stále nedostatky v kvalitě.
Spravovaná zásoba MVP: 4–8 týdnů. Best-of-breed řešení: 8–14 týdnů. Self-hosted: 12–20 týdnů. K tomu připočítejte 4–8 týdnů na integrace a iteraci dialogu.
Speech-to-text: 95–98% přesnost slov v angličtině. Uvažování LLM: 90–95 % u dobře vymezených úkolů. End-to-end úspěšnost (volající dosáhne cíle): 70–90 % podle rozsahu.
Počet odbavených hovorů × (náklady na člověka za hovor − náklady na AI za hovor). Agent za 0,20 $/min oproti člověku za 3 $/min ušetří 2,80 $/min. Při 10 000 minutách měsíčně jde o úsporu 28 000 $ minus amortizované náklady na vývoj ve výši 65 000 $.
Oba případy. Telefon přes Twilio, Vonage nebo Telnyx SIP. WhatsApp přes Meta Business API. Stejná logika dialogu, jiné rozhraní.
Detekujte signály selhání (opakovaná upřesnění, frustrace volajícího) a předejte hovor člověku včetně celého kontextu hovoru. Když předání neproběhne hladce, je to největší UX problém hlasové AI v produkčním prostředí.
Podobné nástroje
Další kalkulačky, které si lidé otevřou hned poté; vyberte tu, která nejlépe odpovídá vašemu dalšímu rozhodnutí.
Náklady na vývoj plus měsíční provoz; kompletní přehled.
Získejte přesnou kalkulaci od našeho týmu
Kalkulačky vám dají rozmezí cen. 30minutový hovor vám přinese pevně stanovený rozsah, harmonogram i rozpočet. Konzultace zdarma a bez závazků.
Zahájit konverzaci