
Vyrobit vs. koupit AI hlasového agenta: Rozhodovací rámec pro rok 2026 (se skrytou třetí možností)
Většina průvodců „vyrobit vs. koupit" vám nabízí binární volbu. Upřímná odpověď pro rok 2026 je trojcestná matice a možnost, o které nikdo nemluví (najmout agenturu, aby postavila vlastní toky na vrcholu platformy), vyhrává zhruba u čtvrtiny týmů, které auditujeme.
Vývoj AI hlasového agenta od nuly v roce 2026 stojí v prvním roce $250K, $2M a trvá 4–9 měsíců. Nákup SaaS (Vapi, Retell, Bland) vyjde na $5K, $100K a jde naživo za 5–14 dní. Třetí cesta, najmutí agentury, která postaví vlastní toky na vrcholu platformy, stojí $30K, $150K a dodá se za 4–10 týdnů.
Rychlá odpověď (upřímný verdikt se 3 možnostmi):
- Nákup SaaS (Vapi/Retell/Bland) vyhrává u ~65 % týmů. 1. rok: $5K, $100K, naživo za 5–14 dní.
- Vývoj agenturou na platformě vyhrává u ~25 %. 1. rok: $30K, $150K, naživo za 4–10 týdnů, plně vlastní toky.
- Čistě vlastní vývoj vyhrává u ~5 %. 1. rok: $250K, $2M, naživo za 4–9 měsíců, dává smysl jen nad 500K min/měs.
- Hybrid (nákup platformy + vlastní interní vrstva) pokrývá zbývajících ~5 %, obvykle F500 plus regulovaná odvětví.
Vyrobit, koupit, nebo kombinovat? Tři cesty vedle sebe
Každý existující průvodce vyrobit vs. koupit AI hlasového agenta představuje dvě možnosti. V reálných nasazeních dominují tři cesty: koupit hostovanou platformu, vyvinout od nuly s vlastními inženýry, nebo zkombinovat obojí najmutím agentury, která dodá vlastní toky na vrcholu Vapi, Retell nebo Bland. Mají zásadně odlišné křivky nákladů, časové osy a rizikové profily a rozhodnutí obvykle není těsné, jakmile to upřímně spočítáte.
| Cesta | Náklady v 1. roce | Čas do produkce | Přizpůsobení | Nejlepší pro |
|---|---|---|---|---|
| Nákup SaaS | $5K, $100K | 5–14 dní | Šablona + prompt + nástroje | SMB až střední firmy, standardní toky |
| Vývoj agenturou na platformě | $30K, $150K | 4–10 týdnů | Plně vlastní toky na hostovaném runtime | Střední firmy s unikátními procesy |
| Čistě vlastní vývoj | $250K, $2M | 4–9 měsíců | Totální: každá vrstva je vaše | F500, >500K min/měs., hlas = klíčový produkt |

Dvě poznámky k tabulce. Zaprvé, „náklady v 1. roce" u nákupu předpokládají 50K–200K minut měsíčně; pod touto hranicí jste na spodním konci, nad ní se blížíte úrovni agentury. Zadruhé, úroveň agentury ukazuje celkové výdaje včetně průchodu platformy, nejen poplatek agentuře. Výpočet uvidíte v H2 #5.
Rámec nákupních týmů „make or buy AI" třetí cestu zcela míjí. McKinsey tomu z dobrého důvodu říká „vyrobit, koupit, nebo kombinovat". Když jsme end-to-end měřili Retell vs Vapi vs Bland na reálné zátěži, každé vítězné nasazení, které jsme v roce 2025 dodali, spadalo do kategorie kombinace, nikoli binární volby. (Čísla na straně platformy viz srovnání Retell vs Vapi vs Bland; cenové rozsahy v tabulce výše ukotvuje rozbor „true cost of AI voice agents" od Master of Code.)
Většina průvodců „vyrobit vs. koupit" vám nabízí binární volbu. Upřímná odpověď pro rok 2026 je trojcestná matice.
Kolik opravdu stojí koupit AI hlasového agenta?
Skutečná cena nákupu hlasové AI jako SaaS je $0,15–$0,33 za minutu, což je 2–4× více než inzerovaná sazba, jakmile se načtou ASR (automatické rozpoznávání řeči), TTS (syntéza řeči), LLM, telefonie a poplatky platformy. Náklady v prvním roce při 100K minutách měsíčně činí zhruba $20K, $50K v závislosti na dodavateli a volbě hlasu. Titulková cena je upřímná; jen to není to, co ve skutečnosti zaplatíte.
Zde je ověřený výpočet z května 2026, když se rozhodnete koupit AI hlasového agenta z krabice.
| Dodavatel | Inzerováno | Skutečná cena celkem/min | Zdroj (získáno 2026-05-17) |
|---|---|---|---|
| Vapi | $0,05 | $0,18–$0,33 | vapi.ai/pricing |
| Retell AI | $0,07 | $0,13–$0,31 | retellai.com/pricing |
| Bland | $0,09–$0,11 | $0,15–$0,30 | bland.ai/pricing |
| Synthflow | $0,08–$0,13 (v balíčku) | $0,10–$0,18 | Cenová stránka Synthflow |
Proč ten rozdíl existuje: inzerované číslo je podíl platformy. Navíc platíte poskytovateli STT (Deepgram je typický, ~$0,0043/min), za LLM (GPT-4o-mini za $0,15/$0,60 za 1M tokenů, nebo Claude Haiku za podobnou cenu), za engine TTS (ElevenLabs Turbo za $0,06/min u prémiových hlasů, nebo v balíčku dodavatele v nižší kvalitě), za SIP trunk ($0,014/min přes Twilio) a za pronájem čísla ($1–$5/měsíc za každé). Přidejte analýzu po hovoru, úložiště znalostní báze a úroveň dedikované podpory a dostanete se tam, kam ukazuje tabulka.
Modelové příklady pro 1. rok na žebříčku ceny hlasového AI agenta, na který většina týmů narazí:
- 10K min/měs. (raný pilot): celkové výdaje zhruba $2,000–$4,000. SaaS vyhrává absurdním náskokem proti jakémukoli vlastnímu vývoji.
- 100K min/měs. (nasazení ve střední firmě): $20K, $50K celkem. Stále území SaaS, pokud nemáte extrémně unikátní případ užití.
- 500K min/měs. (měřítko call centra): $90K, $180K. Teď začínáte chápat, proč týmy vytahují tabulku pro vlastní vývoj.
Kompletní položkový rozpis podle dodavatele a funkce najdete v našem položkovém rozpisu cen hlasových agentů.
Titulková cena $0,05/min je reálná. Stejně tak účet $0,28/min na konci měsíce.
Kolik ve skutečnosti stojí vyvinout AI hlasového agenta od nuly?
Vývoj produkčního AI hlasového agenta od nuly stojí v prvním roce $250K, $2M, trvá 4–9 měsíců a vyžaduje tým 3–5 senior inženýrů se zkušenostmi s ASR, LLM a telefonií. Položkové TCO (celkové náklady vlastnictví) vychází zhruba na 60 % mzdy inženýrů, 15 % infrastruktura a API, 10 % compliance, 15 % náklady obětované příležitosti a téměř každý interní vývoj zdvojnásobí svůj původní odhad.
Inženýři rádi tvrdí: „Postavíme to za 8 týdnů za $80K." Zde je položkové TCO, které každý blog dodavatele skrývá, řádek po řádku, s předpokladem plně naložených amerických mezd (úpravu pro Indii/EU ukážeme poté).
| Položka | Náklady v 1. roce (USA) | Poznámky |
|---|---|---|
| Inženýrský tým (3 senioři × $180K) | $540,000 | Tým v Indii: ~$180K. Střední EU: ~$360K. |
| Infrastruktura (výpočty, úložiště, observabilita) | $24,000 | AWS/GCP, logy, traces, on-call alerting |
| Průchod ASR API (Deepgram nebo Whisper) | $15,000–$60,000 | Závisí na objemu |
| Průchod TTS API (ElevenLabs) | $15,000–$60,000 | Prémiové hlasy to zdvojnásobí |
| Telefonie (Twilio Programmable Voice) | $0,014/min × objem | $17K při 100K min/měs. |
| Audit compliance (rozsah HIPAA / SOC 2 / PCI) | $20,000–$80,000 | Plus roční obnova |
| Náklady obětované příležitosti (6 měs. odložené roadmapy) | Proměnlivé, obvykle $200K+ | Co jiného ti inženýři nedodají |
| Celkem za 1. rok (typický střední scénář) | $650K, $850K | Při zpožděních často překročí $1M |
„Pravidlo 2×" je reálné: každý interní vývoj hlasové AI, který jsme auditovali, vyšel zhruba na dvojnásobek původního odhadu, téměř vždy proto, že tým podcenil compliance rozvody a okrajové případy střídání řeči. Master of Code zdokumentoval stejný násobitel ve svém rozboru a TCO model Caller.Digital vychází ve stejném pásmu. Počítejte s tím, nebo vývoj zavčasu ukončete.
Nezapomeňte na vrstvu orchestrace LLM: framework, který svazuje STT, retrieval, volání nástrojů a TTS do smyčky střídání řeči. Budete zvažovat LangGraph, OpenAI Agents SDK nebo vlastní konečný automat. (Nejlepší volby benchmarkujeme v AI agent frameworky pro stavitele a nasazovací stránku v agentic AI platforma pro nasazení.) Nic z toho není věda, ale každá vrstva je další integrační test, další nespolehlivý režim selhání, další on-call pager ve 2 ráno.
Správa stavu si zaslouží vlastní položku. Agenti, kteří zapomenou jméno volajícího po dvou tazích, působí na uživatele rozbitě. Trade-offy jsme rozebrali v paměť pro AI agenty; zkráceně, buď se spolehnete na Redis s vlastní serializací, nebo si pronajmete spravovanou paměťovou vrstvu za $200–$2,000/měsíc.
Zde je kumulativní křivka nákladů za tři roky porovnávající všechny tři cesty:
"Cumulative Cost (Year 1–3): Build vs Buy vs Agency-Built"
Tabulka dat
| "Months from kickoff" | "Pure Build" | "Buy SaaS" | "Agency-Built on Platform" |
|---|---|---|---|
| "Month 6" | 350000 | 15000 | 45000 |
| "Month 12" | 650000 | 45000 | 90000 |
| "Month 18" | 800000 | 75000 | 135000 |
| "Month 24" | 950000 | 105000 | 180000 |
| "Month 30" | 1100000 | 135000 | 225000 |
| "Month 36" | 1250000 | 165000 | 270000 |
Předpoklady: zátěž 100K minut/měsíc, plně naložené americké mzdy inženýrů, ceny dodavatelů dle získání z května 2026. Křížení vlastního vývoje s vývojem agenturou nastane až kolem 32. měsíce, kdy objem hovorů překročí 500K min/měs. (viz H2 #6).
Každý interní vývoj hlasové AI vyjde na dvojnásobek původního odhadu. Počítejte s tím, nebo to zavčasu ukončete.
Skrytá třetí cesta: Vývoj agenturou na platformě
Zde je možnost, kterou každý blog dodavatele přeskakuje: najměte agenturu, aby postavila toky vašeho AI hlasového agenta na míru na vrcholu existující platformy (Vapi, Retell nebo Bland). Přeskočíte past najímání inženýrů, dodáte za 4–10 týdnů a vlastníte stejnou business logiku, kterou byste vlastnili při vlastním vývoji, aniž byste si pronajímali pětičlenný ASR-LLM-TTS tým na její údržbu.
Definice: externí inženýrský tým napíše vaše toky, prompty, integrace, evaluace a CRM napojení na vrcholu hostované hlasové platformy. Platíte projektový poplatek za vývoj a poté minutový průchod platformy za provoz. Agentura vlastní kód; vy vlastníte agenta.
Výpočet nákladů:
- Projektový poplatek: $30K, $80K podle složitosti toků (počet integrací, regulační rozsah, důkladnost evaluací)
- Průchod platformy: $0,15–$0,30/min při celkových sazbách z H2 #3
- Výsledek za 1. rok: $50K, $150K celkem, zhruba 4–10 týdnů do prvního produkčního hovoru
Komu to sedí (~25 %):
- Střední firmy s unikátními procesy, které se nevejdou do šablony Vapi
- Regulovaná odvětví (zdravotnictví, finance, právo) potřebující evaluace připravené na audit + dokumentaci compliance
- Týmy bez jediného interního inženýra na hlasovou AI a bez chuti najímat specializovaný tým kvůli jednomu projektu
- Multi-vertikální agentury a franšízoři, kteří potřebují paralelně dodat 5+ různých toků
Komu to NEsedí (brána upřímnosti – přečtěte si to, pokud to zvažujete):
- Osamělý zakladatel stavějící MVP: udělejte si to sami přímo na Vapi nebo Retell. Poplatek agentuře se při objemu MVP nevrátí. (Zkombinujte s n8n pro low-code toky agentů, pokud chcete orchestraci bez kódu.)
- F500 s 50členným týmem na hlasovou AI: vyviňte to. Máte tým, objem i důvod z hlediska IP.
- Požadavek na latenci pod 300 ms: toho dosáhne jen kolokovaný vlastní vývoj. Žádná platforma to nezvládne, ať toky píše kdokoli.
- Případy užití vyžadující plné vlastnictví modelu (trénujete proprietární LLM na přepisech hovorů): potřebujete cestu vlastního vývoje kvůli přístupu k ML. Platformy tuto vrstvu abstractují.
Pokud váš tým spadá do kategorie vývoje agenturou, můžete si o vymezení rozsahu promluvit s partnerem pro vývoj hlasových agentů na míru. Žádný spěch, žádný tvrdý prodej. Většina týmů, které se ozvou, stráví 2–4 týdny jen mapováním svých toků hovorů, než vůbec začne řešit smlouvu, a to je správné tempo.
Většina středních firem chce hlasového agenta na míru. Málokterá chce najímat pětičlenný ASR-LLM-TTS tým, aby ho postavil.
Kdy vlastně vlastní vývoj vyhrává? Výpočet bodu zvratu
Vývoj AI hlasového agenta na míru se vrátí jen tehdy, když měsíční objem hovorů překročí zhruba 500,000 minut A zároveň případ užití vyžaduje méně než 5 integrací A zároveň je hlasová AI klíčovým produktovým odlišením, nikoli komoditní funkcí. Pod touto hranicí nákup SaaS nebo najmutí agentury na platformě poráží vlastní vývoj 2–4× na tříletém TCO. Vzorec je ostřejší, než si většina týmů přizná.
Jednoduše řečeno:
Vlastní vývoj vyhrává, když měsíční minuty > 500,000 A případ užití vyžaduje <5 integrací A hlasová AI je klíčovým odlišením (ne komodita).
Modelový příklad č. 1, řetězec klinik SMB s 50K min/měs. Nákup vyhrává ~4× za tři roky. Nákup SaaS: ~$15K v 1. roce, ~$45K kumulativně ve 3. roce. Čistý vlastní vývoj: ~$650K v 1. roce, ~$1.25M kumulativně ve 3. roce. Řetězec klinik nemá inženýry na hlasovou AI, nemá objem hovorů, nemá regulační okrajový případ, který by platformy nezvládly. SaaS není jen levnější. Je to jediná rozumná odpověď. (Ekvivalentní výpočet pro potravinářský vertikál, který vychází stejně, viz hlasoví agenti pro restaurace.)
Modelový příklad č. 2, podnikové kontaktní centrum s 2M min/měs. Vlastní vývoj dosáhne bodu zvratu s vývojem agenturou zhruba v 28. měsíci a vyhrává ~1,6× do 3. roku, pouze pokud je případ užití opakovatelný napříč vertikálami kontaktního centra. Čistý vlastní vývoj: ~$650K v 1. roce, ~$3.5M kumulativně ve 3. roce (většinou průběžné náklady na inženýry). Nákup SaaS při průměru $0,20/min: ~$4.8M ve 3. roce. Vlastní vývoj zde vyhrává matematicky, ale jen proto, že objem amortizuje inženýrský tým.
Okrajový případ hybridu pokrývá zbývajících ~5 %: firmy F500 s >5M min/měs., regulovaná odvětví s proprietárními ML vrstvami nebo týmy, jejichž odlišením je skutečně samotný model. Kupují platformu pro komoditní vrstvy telefonie + STT + TTS a LLM a ML po hovoru si vyvíjejí interně. To je to, co Caller.Digital identifikuje jako hranici „nad 500K min/měs. a pod 5 integrací", kde opakovatelnost znamená vše.
Pod 500K minutami platíte inženýry za to, aby znovu postavili, co už Vapi dodalo.
Vlastní vývoj matematicky vyhrává při 500,000 minutách měsíčně. Pod tím platíte inženýry za to, aby znovu postavili, co už Vapi dodalo.
Jaká skrytá integrační práce nafoukne váš odhad vývoje?
Skrytá integrační práce při vývoji hlasového agenta na míru zahrnuje registraci A2P 10DLC (application-to-person 10-digit long code), atestaci hovorů STIR/SHAKEN, zachycení souhlasu dle TCPA (Telephone Consumer Protection Act), logiku zveřejnění nahrávání podle jurisdikce, autentizaci CRM webhooků a anonymizaci PII. Platformy jako Vapi, Retell a Bland řeší každý řádek toho hned první den. Váš 8týdenní odhad zapomněl na 6 týdnů compliance rozvodů telefonie.
Zde je lešení AI telefonního agenta, které nikdo nedává do původní specifikace:
- Registrace A2P 10DLC: 2–6 týdnů, poplatky $50–$1,000, vyžadováno pro jakýkoli tok v USA související se SMS (připomínky schůzek, potvrzení zpětného volání). Registrační matici viz dokumentace Twilio k A2P 10DLC.
- Atestace STIR/SHAKEN: podepisování ID volajícího závislé na operátorovi. Bez něj jsou vaše odchozí hovory označeny jako „Spam Likely" ve 30–60 % mobilních případů. Průběžná údržba, nikoli jednorázovka.
- Zachycení souhlasu TCPA: zveřejnění nahrávání, integrace seznamu do-not-call, uložení písemného opt-in. Rozhodnutí FCC z roku 2024 o AI robocalls rozšířilo TCPA na AI hlas; nesoulad znamená $500–$1,500 za hovor.
- Zveřejnění nahrávání po státech: 12 amerických států vyžaduje souhlas obou stran (Kalifornie, Florida, Illinois atd.), plus GDPR pro jakéhokoli volajícího z EU. Váš agent musí vědět, kde volající je, ještě před druhou větou.
- Autentizace CRM webhooků + logika opakování: obnova OAuth, exponenciální backoff, fronty mrtvých zpráv (dead-letter). Zní to triviálně; není.
- Anonymizace PII + ukládání shrnutí po hovoru: čísla platebních karet, SSN, lékařské údaje smazány před uložením. HIPAA to vyžaduje; auditoři SOC 2 také.
Sečtěte to a máte 4–8 týdnů práce navíc, která se v původním odhadu „postavíme to za 8 týdnů" neobjeví. Platformy dodávají každý řádek toho předpřipravený.
Váš 8týdenní odhad vývoje zapomněl na 6 týdnů compliance rozvodů telefonie.
Proč vlastní vývoj hlasu zní pomaleji než platformy?
Celkový rozpočet latence pro přirozeně působící hlasovou AI je pod 700 ms end-to-end: STT (150–250 ms) + první token LLM (200–400 ms) + první byte TTS (100–200 ms) + síť/jitter (100–250 ms). Platformy tohoto mediánu dosahují; vlastní vývoj se často dostane na 1,2–2,0 s, protože týmy podceňují latenci sítě a cold startu. Volající začnou přerušovat agenta po 400 ms ticha, takže ten rozdíl je slyšitelný.
Aritmetika, kterou většina odhadů vývoje ignoruje:
| Fáze | Latence (typická) | Co uklouzne |
|---|---|---|
| První chunk STT | 150–250 ms | Streaming vs. batch; studený model = +200 ms |
| První token LLM | 200–400 ms | Cold start přidá 400 ms+; dlouhé systémové prompty přidají 100 ms |
| První byte TTS | 100–200 ms | Prémiové hlasy pomalejší; bez streamingu = +500 ms |
| Síťové RTT | 50–150 ms | Horší, pokud váš AWS region nesousedí s operátorem volajícího |
| Jitter buffer | 50–100 ms | Část, na kterou týmy zapomínají |
| Celkový rozpočet | 550–1,100 ms | Nad 1,2 s a hovor působí divně |

Proč platformy dosahují mediánu 700–900 ms: optimalizace pipelineu (prokládaný streaming STT/LLM), síťová blízkost k telefonním operátorům a teplé pooly modelů, které nikdy nedělají cold start. Proč se interní vývoj rutinně dostane na 1,2–2,0 s: týmy nezapočítávají část sítě/jitteru, cold-start volání LLM přidají 400 ms v prvním tahu každého hovoru a většina domácích implementací TTS nestreamuje první byte audia, dokud není připravená celá odpověď. Data Close o hranici 0,4 s, kdy volající začne přerušovat, jsou nejcitovanějším číslem v hlasové AI z dobrého důvodu. Je to hranice, kde se přirozené střídání řeči láme. Benchmarky latence Deepgram potvrzují, že spodní hranice prvního chunku STT leží kolem 150 ms.
Vapi dosahuje 700 ms, protože vlastní síťovou blízkost. Váš vývoj v AWS regionu toho nedosáhne.
Opravdu lze postavit hlasového agenta v 15 řádcích kódu?
Moderní platformy hlasové AI jako Vapi a Retell nabízejí 10–20řádkové volání SDK, které vytvoří produkčně připraveného hlasového agenta. Stejná funkcionalita od nuly (STT, orchestrace LLM, TTS, telefonie, střídání řeči) obvykle zabere 4–9 měsíců inženýrské práce. Kontraintuitivně, ukázání kódu dělá argument pro nákup silnějším, nikoli slabším.
Zde je funkční hlasový agent Vapi Web SDK v 15 řádcích (ověřeno proti docs.vapi.ai/quickstart/web, získáno 2026-05-17):
import Vapi from "@vapi-ai/web";
const vapi = new Vapi(process.env.VAPI_PUBLIC_KEY);
await vapi.start({
model: {
provider: "openai",
model: "gpt-4o-mini",
systemPrompt: "You are a friendly clinic receptionist. Book appointments, answer FAQs, escalate emergencies.",
},
voice: { provider: "11labs", voiceId: "rachel" },
transcriber: { provider: "deepgram", model: "nova-2" },
firstMessage: "Hi, this is the clinic. How can I help today?",
});
vapi.on("call-end", (data) => console.log("Call ended:", data.summary));Každý řádek v tom úryvku nahrazuje měsíce interní práce. Pole transcriber je vaše integrace STT. Pole voice je celý váš pipeline TTS včetně handlingu streamování prvního bytu. systemPrompt je celá vrstva střídání řeči a volání nástrojů (Vapi pod kapotou řeší barge-in, endpointing a směrování nástrojů). call-end vám dává shrnutí po hovoru, na které byste jinak stavěli pipeline Whisper + GPT-4.
Tohle je to, co váš vlastní vývoj reprodukuje 4–9 měsíců. Čím pozorněji SDK čtete, tím těžší je vlastní vývoj obhájit.
Kontraintuitivně, čím lépe kódu rozumíte, tím silněji vypadá argument pro nákup.
Kdy je vývoj hlasového agenta špatná odpověď?
Vývoj hlasového agenta je špatná odpověď, když váš tým nemá zkušenosti s dodáním hlasové AI do produkce, váš odhad je pod $150K v 1. roce, váš časový plán je pod 8 týdnů, váš případ užití čistě odpovídá existující šabloně platformy, nebo je váš objem hovorů pod 500K minut/měsíc. Trefte jakékoli dva z těchto bodů a cesta vlastního vývoje je fušeřina, ne inženýrství.
Váš inženýrský tým bude prosazovat vývoj. Nelžou. Umí to postavit. Otázka je, zda by měli. Hlídejte si těchto pět signálů anti-patternu:
- „Prostě napojíme Whisper a GPT-4." Nikdo, kdo dodal hlas do produkce, tohle neříká. Ty těžké části jsou střídání řeči, detekce barge-in a streaming TTS, nic z toho v té větě není.
- Odhad pro 1. rok pod $150K. Buď tým nechápe rozsah compliance, nebo nenacenil vrstvu telefonie, nebo předpokládal, že nebude potřebovat observabilitu. Všechny tři jsou varovné signály.
- Žádný inženýr v týmu předtím nedodal hlas do produkce. Režimy selhání hlasové AI jsou jiné než u chatu. Potlačení echa, jitter buffering, barge-in: to nejsou problémy webového vývoje.
- Časový plán pod 8 týdnů. I platformy, které dodávají předpřipravené primitivy, potřebují 2–4 týdny na napojení integrací + CRM + evaluací. Od nuly za 8 týdnů znamená oříznout compliance, oříznout evaluace, nebo obojí.
- „TTS si postavíme sami." Ne, nepostavíte. ElevenLabs a Cartesia mají každý stovky inženýrů a dedikované výzkumníky audio modelů. Kupte to, co je komoditizované.
Proč inženýři přesto prosazují vývoj: kariérní kapitál, zkreslení NIH („not invented here"), zdůvodňování počtu lidí, upřímná radost z greenfield inženýrství. Nic z toho nejsou špatné důvody chtít stavět. Jsou to jen špatné důvody skutečně stavět.
Přeformulujte rozhodnutí: vyviňte to, co vás odlišuje, kupte to, co je komoditizované. Vrstvy LLM, ASR a TTS se v letech 2025–2026 komoditizovaly. Vaše odlišení spočívá v tocích, promptech, evaluacích a integraci CRM. Nebudujte znovu vrstvy, které už Vapi, Retell, OpenAI a Deepgram dodaly.
Vyviňte to, co odlišuje. Kupte to, co se komoditizovalo v roce 2025.
Upřímná rozhodovací matice
Poté, co jsme hlasovou AI pro kontaktní centra stavěli pro klienty oběma způsoby, je naše uvážené rozdělení: ~65 % týmů by mělo koupit SaaS (Vapi, Retell, Bland), ~25 % by mělo najmout agenturu na vývoj na platformě, ~5 % potřebuje hybrid (platforma + vlastní interní vrstva) a ~5 % by mělo vyvíjet od nuly. Čistě vlastní vývoj se vrátí jen nad 500K minut/měsíc s dedikovaným týmem na hlasovou AI. To jsou naše doporučení po auditu výpočtů u 4 klientských rozhodnutí v letech 2025–2026, nikoli oborové statistiky.
| Podíl | Cesta | Nejlepší pro | Náklady v 1. roce |
|---|---|---|---|
| ~65 % | Nákup SaaS | SMB až střední firmy, standardní toky, <500K min/měs. | $5K, $100K |
| ~25 % | Vývoj agenturou na platformě | Unikátní toky, regulovaná odvětví, žádný tým na hlasovou AI | $30K, $150K |
| ~5 % | Hybrid (platforma + interní ML) | F500, regulovaná, proprietární vrstva modelu | $200K, $600K |
| ~5 % | Čistě vlastní vývoj | Hlasová AI je klíčový produkt, >500K min/měs., má tým | $250K, $2M |

Rozhodovací strom se čtyřmi uzly, kterým klienty provázíme:
- Zpracujete >500K minut/měsíc? Ne → nákup nebo vývoj agenturou. Ano → pokračujte.
- Je hlasová AI klíčovým produktovým odlišením (ne jen funkcí)? Ne → nákup nebo vývoj agenturou. Ano → pokračujte.
- Máte interní inženýrský tým na hlasovou AI (3+ dodané hlasové produkty)? Ne → vývoj agenturou nebo hybrid. Ano → pokračujte.
- Potřebujete celkovou latenci <300 ms nebo trénink proprietárního modelu? Ne → hybrid. Ano → čistý vlastní vývoj.
Většina týmů skončí na uzlu 1 nebo 2, proto 90 % matice skončí v nákupu nebo vývoji agenturou.
Pokud spadáte do kategorie 25 %, zde je návod, jak stavíme na Retell nebo Vapi pro klienty. Začněte u svých toků hovorů, ne u smlouvy.
Vyviňte to, co vás odlišuje. Kupte to, co je komoditizované. Pro většinu týmů v roce 2026 to znamená koupit platformu a přizpůsobit toky.
Verdikt
- Existují tři cesty, ne dvě. Nákup SaaS pro ~65 % týmů. Vývoj agenturou na platformě pro ~25 %. Čistý vlastní vývoj jen nad 500K min/měs. s reálným týmem.
- Vzorec bodu zvratu je jednoduchý: měsíční minuty > 500K A <5 integrací A hlasová AI je klíčová. Minete kteroukoli ze tří podmínek a výpočet vývoje nefunguje.
- Rozhodovací pravidlo: vyviňte to, co vás odlišuje, kupte to, co je komoditizované. V roce 2026 to znamená koupit vrstvu platformy téměř pokaždé.
Pokud jste v kategorii 25 %, kde dává smysl vývoj agenturou, začněte namapováním svých toků hovorů na whiteboard a pak si promluvte s partnerem, který dodal na Retell nebo Vapi. Žádný spěch. Správný krok je vymezit rozsah, než podepíšete.
FAQ
Je lepší AI hlasového agenta vyvinout, nebo koupit?
Pro zhruba 65 % týmů je lepší nákup hlasové platformy SaaS (Vapi, Retell, Bland). Je to 5–14 dní do produkce za $5K, $100K v 1. roce, oproti 4–9 měsícům a $250K, $2M za vlastní vývoj. Vývoj vyhrává jen nad 500K minut/měsíc, když je hlasová AI klíčovým produktovým odlišením a máte interní tým na hlasovou AI o 3+ inženýrech.
Kolik stojí vyvinout AI hlasového agenta od nuly?
Vývoj od nuly stojí u týmů s americkými mzdami $250K, $2M v 1. roce. Rozpis je zhruba $540K za inženýry (3 senior inženýři), $24K infrastruktura, $30K, $120K za průchod ASR a TTS API, $0,014/min telefonie a $20K, $80K za audity compliance HIPAA/SOC 2. Většina vývojů vyjde na 2× původní odhad kvůli compliance a práci na okrajových případech, která je podceněná.
Jak dlouho trvá vyvinout produkčního hlasového AI agenta?
Vývoj od nuly trvá 4–9 měsíců pro produkčně připraveného agenta s řádnou compliance, evaluacemi a observabilitou. Nákup platformy SaaS jako Vapi nebo Retell trvá 5–14 dní. Skrytá třetí cesta (najmutí agentury na vývoj vlastních toků na existující platformě) trvá 4–10 týdnů. Ten rozdíl je většinou lešení telefonie a compliance (A2P 10DLC, STIR/SHAKEN, TCPA), které platformy řeší hned první den.
Můžu hlasového agenta postavit na Vapi nebo Retell místo od nuly?
Ano, to je cesta vývoje agenturou na platformě. Vy (nebo externí agentura) postavíte vlastní toky, prompty, integrace a evaluace na vrcholu hostovaného runtime Vapi, Retell nebo Bland. Náklady v 1. roce jsou $30K, $150K celkem (projektový poplatek $30K, $80K plus průchod $0,15–$0,30/minuta) a dodáte za 4–10 týdnů místo 4–9 měsíců. Vlastníte business logiku; platforma řeší STT, TTS, telefonii a střídání řeči.
Jaký je bod zvratu objemu hovorů pro vývoj hlasové AI?
Hranice bodu zvratu je kolem 500,000 minut měsíčně, a to jen pokud případ užití vyžaduje méně než 5 integrací a hlasová AI je klíčovým produktovým odlišením. Pod 500K min/měs. SaaS nebo vývoj agenturou na platformě poráží vlastní vývoj 2–4× na tříletém TCO. Nad 500K min/měs. se správným týmem a případem užití čistý vlastní vývoj dosáhne bodu zvratu s vývojem agenturou kolem 28. měsíce a vyhrává do 3. roku.
Je levnější použít hlasovou platformu SaaS, nebo si postavit vlastní?
Pro téměř každý tým pod 500K minut/měsíc je SaaS výrazně levnější, obvykle 4–10× levnější na tříletém TCO. Skutečná sazba SaaS je $0,15–$0,33 za minutu (2–4× inzerované číslo, jakmile se načtou ASR, TTS, LLM a telefonie), ale to stále poráží $650K, $1.25M nákladů na inženýry, infrastrukturu a compliance, které byste nesli při vlastním vývoji.
Jaké inženýrské dovednosti potřebuji k vývoji hlasového agenta?
Potřebujete alespoň 3 senior inženýry s kombinovanými zkušenostmi v real-time streamování audia, integraci ASR (Deepgram nebo Whisper), orchestraci LLM (LangGraph, OpenAI Agents SDK nebo vlastní stavové automaty), streamování TTS (ElevenLabs nebo Cartesia), SIP telefonii (Twilio Programmable Voice nebo Telnyx), střídání řeči a detekci barge-in a v práci s compliance (TCPA, HIPAA, SOC 2). Pokud váš tým nedodal hlas do produkce, křivka učení přidá k časovému plánu 2–4 měsíce.
Jak se liší latence mezi vlastním vývojem a platformami?
Platformy dosahují mediánu 700–900 ms end-to-end (Vapi, Retell, Bland). Vlastní interní vývoj se rutinně dostane na 1,2–2,0 sekundy, protože týmy nezapočítávají části sítě a jitteru a cold-start volání LLM přidají 400 ms v každém prvním tahu. Nad 1,2 sekundy začnou volající přerušovat agenta a střídání řeči se láme. Strop 700 ms je důležitý, protože platformy vlastní síťovou blízkost k telefonním operátorům. Váš vývoj v AWS regionu toho nedosáhne.
Kdy dává vývoj hlasové AI finanční smysl?
Vývoj dává finanční smysl, když měsíční objem hovorů překročí 500,000 minut, případ užití vyžaduje méně než 5 integrací, hlasová AI je klíčovým produktovým odlišením (ne jen funkcí) a máte interní tým na hlasovou AI o 3+ inženýrech. Minete kteroukoli z těchto podmínek a výpočet vývoje nefunguje. To je zhruba 5 % týmů, které auditujeme, obvykle kontaktní centra F500 nebo AI-native firmy, kde hlas je produkt.
Jaké jsou skryté náklady interního vývoje hlasové AI?
Skryté náklady jsou registrace A2P 10DLC (2–6 týdnů, $50–$1,000), atestace STIR/SHAKEN, zachycení souhlasu TCPA, logika zveřejnění nahrávání po státech, autentizace CRM webhooků, anonymizace PII, ukládání shrnutí po hovoru, observabilita a on-call infrastruktura a 6 měsíců nákladů obětované příležitosti na vašem odloženém produktovém plánu. Platformy řeší každý řádek toho hned první den. Pravidlo 2× odhadu vývoje existuje proto, že týmy na tyto položky zapomínají.