
6 nejlepších open-source frameworků pro hlasové agenty v roce 2026 (seřazeno)
Minulé čtvrtletí jsme nasadili tři telefonní hlasové agenty na Pipecat a jednoho pak přestavěli na LiveKit Agents, když klient vyskočil z 20 na 400 souběžných hovorů. Oba jsou open-source frameworky pro hlasové agenty. Ani jeden není „ten nejlepší". Jsou dobří na různé věci a špatná volba vás stojí týdny.
Tento žebříček vychází z toho, co se reálně nasazuje, ne z toho, co hezky vypadá v README. Stáhli jsme aktuální čísla z GitHubu k 14. červenci 2026: Pipecat má 13 416 hvězd, LiveKit Agents 11 356 a TEN Framework 10 898. Hvězdy neříkají celý příběh, takže jsme zvažovali i aktivitu commitů, podporu telefonie, licenční podmínky a to, jak si každý framework vede při reálném objemu hovorů.
Rychlá odpověď: Pro většinu týmů je v roce 2026 nejsilnějším open-source frameworkem pro hlasové agenty Pipecat, díky rozsáhlé knihovně integrací a téměř každodennímu vývoji. LiveKit Agents vyhrává v měřítku a nativní telefonii, TEN Framework v multimodální orchestraci grafů a Bolna v nasazení telefonního agenta za odpoledne.
Pokud byste raději hotový produkt koupili, než si ho skládat, jsou lepší výchozí bod naše srovnání spravovaných platforem jako ElevenLabs, Vapi a Synthflow a Retell AI vs Vapi vs Bland. Jste v kategorii noví? Začněte tím, co to vlastně hlasový AI agent je.
Jak jsme frameworky seřadili
Každý framework jsme hodnotili podle pěti věcí, na kterých reálný projekt stojí nebo padá: jak aktivní je vývoj (commity za posledních 90 dní), šířka integrací STT/LLM/TTS, podpora telefonie (dokáže zvednout reálné telefonní číslo), licenční podmínky a chování při souběžnosti. Zde je přehled shortlistu.
| Pořadí | Framework | Hvězdy (červenec 2026) | Licence | Jazyk | Telefonie | Nejlepší pro |
|---|---|---|---|---|---|---|
| 1 | Pipecat | 13 416 | BSD-2-Clause | Python | Twilio, Daily, Telnyx | Univerzální produkční nasazení |
| 2 | LiveKit Agents | 11 356 | Apache-2.0 | Python, Node | Nativní SIP + telefonní čísla | Škálování a real-time |
| 3 | TEN Framework | 10 898 | Apache-2.0 (hybridní) | C, Go, Python, JS | Přes Agora RTC | Multimodalita a edge |
| 4 | Bolna | 695 | MIT | Python | Twilio, Plivo, Exotel, SIP | Rychlí telefonní agenti |
| 5 | FastRTC | 4 618 | MIT | Python | WebRTC (vlastní) | Prototypy a dema |
| 6 | Vocode | 3 773 | MIT | Python | Twilio, Vonage | Reference, s výhradami |
1. Pipecat — nejlepší univerzální volba
Pipecat, který vytvořil tým stojící za Daily, je pythonový framework, který modeluje konverzaci jako pipeline: zvuk přijde, proteče přes převod řeči na text, jazykový model a syntézu textu na řeč a zvuk se vrátí zpět. Tento mentální model se snadno chápe a v dubnu 2026 dosáhl stabilní verze 1.0.
Co ho odlišuje, je knihovna integrací. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs a desítky dalších jsou už zapojené, takže výměna dodavatele TTS je změna na jednom řádku místo přepisování. Telefonie funguje přes Twilio, Daily nebo Telnyx. S 13 416 hvězdami a commity, které přistávají téměř každý den, má také největší dynamiku ze všech na tomto seznamu.
Nevýhoda: protože vám Pipecat dává spíš stavební kameny než hotového agenta, orchestrační logika je na vás. Žádný drag-and-drop builder neexistuje. Píšete Python. Pro tým, který už kóduje, je to výhoda, ne chyba.
Vyberte si ho, pokud: chcete vendor-neutrální, produkčně zralý základ s nejširší podporou modelů a psaní Pythonu vám nevadí. Pro většinu klientských projektů je to náš výchozí bod.
2. LiveKit Agents — stavěný na škálování a real-time
LiveKit Agents jde na věc jinak. Místo lineární pipeline se váš agent připojí do místnosti jako účastník přes WebRTC, stejnou technologii, která stojí za hovory ve stylu Zoomu. Právě tato architektura září, když potřebujete nízkou latenci a mnoho souběžných konverzací.
Velkým příběhem roku 2026 je telefonie. LiveKit nasadil nativní SIP a telefonní čísla, takže příchozí a odchozí volání už nepotřebuje Twilio bridge uprostřed. Dodává také first-party podporu pro OpenAI Realtime API a od řady 1.5.x nativní nástroje Model Context Protocol a adaptivní zpracování přerušení. Podrobnosti si můžete přečíst v dokumentaci LiveKit Agents. Pokud chcete pochopit real-time API, které obaluje, zvlášť rozebíráme OpenAI Realtime API pro hlasové agenty.
Protože běží na open-source WebRTC media serveru LiveKit, můžete si celý stack hostovat sami. Křivka učení je strmější než u Pipecat a uvažování v místnostech a účastnících chvíli trvá, než si sedne.
Vyberte si ho, pokud: očekáváte reálnou souběžnost, chcete nativní telefonii bez bridge, nebo stavíte agenta na OpenAI Realtime, který musí přežít špičky v provozu.
3. TEN Framework — multimodální a založený na grafech
TEN Framework (Transformative Extensions Network), za kterým stojí Agora, popisuje vašeho agenta jako graf uzlů: STT, LLM, nástroje, paměť, vidění. Graf sestavíte ve workflow builderu a TEN ho spustí. Je to nejflexibilnější možnost zde pro cokoliv za hranicí čistého hlasu a jeho C++ jádro je vyladěné na nízkou latenci zvuku.
Mluví také nejširší škálou jazyků ze všech frameworků na tomto seznamu, s rozšířeními v C, Go, Pythonu, JavaScriptu a TypeScriptu a hotovými konektory pro Dify a Coze. Stránka Agora TEN Framework je nejjasnější přehled toho, co dokáže.
Dvě výhrady. Zaprvé, licence je hybridní: většina frameworku je Apache-2.0, ale s dodatečnými omezeními u některých složek, takže než to nasadíte komerčně, přečtěte si LICENSE. Zadruhé, real-time transport se opírá o síť Agora, což znamená Agora App ID a nad bezplatnou úrovní i náklady za využití Agory.
Vyberte si ho, pokud: stavíte multimodálního agenta (hlas plus vidění nebo avatary), ceníte si kompozice založené na grafech nebo chcete nejnižší úroveň zvukového výkonu dostupnou v open source.
4. Bolna — nejrychlejší cesta k telefonnímu agentovi
Bolna je menší (695 hvězd) a vyhraněnější než první tři a právě to je její síla. Je telefonie-na-prvním-místě. Zatímco jiné frameworky vás nutí volání skládat, Bolna ho dodává: Twilio pro globální hovory, Plivo a Exotel pro Indii a vlastní SIP trunky, vše nakonfigurované v agent definici ve stylu JSON místo v kódu.
Toto nastavení řízené konfigurací znamená, že příchozího nebo odchozího telefonního agenta, který zvedá reálné hovory, můžete mít rychleji než téměř s čímkoli jiným zde. Pod kapotou orchestrjuje poskytovatele ASR, LLM a TTS přes websockety, takže si stále vybíráte vlastní modely. Vývoj zůstal aktivní i v polovině roku 2026.
Cenou za tuto rychlost je menší komunita a méně integrací než Pipecat nebo LiveKit. Pokud narazíte na okrajový případ, je pravděpodobnější, že budete první, kdo založí issue. Pro nasazení s důrazem na telefonii ji zvažte vůči možnostem v našem srovnání telefonie hlasových agentů.
Vyberte si ji, pokud: váš případ užití jsou na prvním místě telefonní hovory (připomínky schůzek, odchozí kvalifikace, příchozí podpora) a chcete se úplně vyhnout instalatérství telefonie.
5. FastRTC — odlehčená možnost pro prototypování
FastRTC od týmu Hugging Face a Gradio není plnohodnotný framework pro agenty, a to je právě pointa. Je to pythonová knihovna pro real-time zvuk a video přes WebRTC nebo websockety. Vlastní STT, LLM a TTS si přinesete sami a FastRTC obstará streamovací transport jen několika řádky kódu.
Pro proof of concept, demo nebo výzkumný pokus je tento minimalismus dar. Mluvící prototyp můžete postavit za odpoledne, aniž byste se upsali konvencím těžkého frameworku. Přirozeně se páruje s ekosystémem Hugging Face, takže otevřené modely se zapojují snadno.
Rubem je, že zodpovídáte za vše, co by vám jinak poskytl framework: detekci střídání, zpracování přerušení, telefonii, správu stavu. Škáluje se dolů krásně a nahoru bolestivě.
Vyberte si ho, pokud: prototypujete, učíte nebo stavíte prohlížečové demo a chcete maximální kontrolu s minimální režií frameworku.
6. Vocode — historicky důležitý, s výhradou k údržbě
Vocode pomohl definovat celou tuto kategorii. Jeho modulární design STT/LLM/TTS a vestavěná telefonie Twilio a Vonage z něj udělaly jeden z prvních opravdu použitelných open-source hlasových frameworků a se 3 773 hvězdami se stále objevuje v spoustě návodů.
Teď upřímná část, a proto je poslední: open-source jádro ztichlo. Poslední commit do vocode-core přistál v listopadu 2024 a repozitář má jen dva otevřené issues, což obvykle signalizuje, že pozornost se přesunula na hostovaný produkt firmy, ne na zdravý backlog. Kód stále běží a design stojí za studium, ale stavěli byste na základu, který nikdo aktivně neopravuje.
Vyberte si ho, pokud: studujete architekturu hlasových agentů, udržujete existující projekt Vocode nebo konkrétně chcete jeho návrhové vzory a smíříte se s tím, že základ budete udržovat sami.
Co také stojí za vědění
Několik nástrojů leží těsně za žebříčkem, ale patří na váš radar:
- OpenAI Agents SDK (27 900+ hvězd) dodává rozšíření pro hlasovou pipeline. Je to spíš obecné SDK pro agenty než hlas-na-prvním-místě, ale je to rozumná volba, pokud na něm už jste standardizovaní.
- Gabber je novější multimodální framework pro agenty, kteří vidí, slyší a mluví, zaměřený na případy užití s obrazovkou a kamerou.
- Jambonz je open-source páteř telefonie. Nestaví mozek agenta, ale je to způsob v kvalitě operátora, jak připojit jakýkoli framework k reálným telefonním sítím.
- Rasa (21 000+ hvězd) zůstává těžkou vahou pro podnikový dialog a NLU napříč textem i hlasem, i když je náročnější na provoz než cokoli výše.
- Ultravox je rychlý jazykový model pro řeč, ne orchestrační framework, takže ho berte jako zapojitelnou komponentu, ne jako konkurenta.
Co bychom reálně použili pro klientské nasazení
V Techsy stavíme hlasové agenty pro B2B klienty, takže tady je nelákavá realita za žebříčkem.
Náš výchozí stack je Pipecat, který zapojuje Deepgram Nova-3 pro převod řeči na text, GPT-4o-mini pro jazykový model a Cartesia Sonic pro syntézu textu na řeč. Jakmile se vyladí detekce střídání, latence hlas-k-hlasu se obvykle pohybuje mezi 0,7 a 1,1 sekundy, což je dost blízko lidské konverzaci, aby si toho volající přestali všímat. Posuňte kteroukoli z těchto komponent na pomalejší model a okamžitě to ucítíte.
Telefonie je místo, kde se projekty komplikují. V produkci jsme provozovali dva vzory: Twilio SIP trunk přemostěný do nativního SIP LiveKit pro vysoké objemy příchozí podpory a vestavěné zpracování Plivo od Bolny, když klient potřeboval jen odchozí připomínkové hovory. Cesta přes LiveKit stojí víc inženýrských hodin na začátku, ale drží stabilně, když dorazí 300 hovorů ve stejné minutě. Bolna vás dostane do provozu do pátku.
Matematika vlastního hostingu lidi mate. Provozování lokálního STT a TTS na jedné GPU A10G stojí zhruba 0,50 až 0,90 dolaru za hodinu, ať už přijde jediný hovor, nebo ne. API s platbou za minutu jako Deepgram a Cartesia nestojí nic, když jsou nečinná, ale rychle se nasčítají po několika tisících minutách měsíčně. Pod zhruba 15 000 minutami měsíčně téměř vždy vyhrávají API a to doporučujeme většině klientů. Po LiveKit místo Pipecat saháme hlavně tehdy, když souběžnost překročí několik set současných hovorů.
Pokud je u vás otázka stavět-versus-koupit stále otevřená, celý rozpis nákladů procházíme v našem průvodci stavět vs koupit hlasového AI agenta. A pokud byste raději, aby tým vyřešil latenci, telefonii a škálování za vás, přesně to děláme v praxi hlasových agentů Techsy.
Jak vybrat za jednu minutu
Přeskočte analytickou paralýzu. Tady je rozhodnutí v odrážkách:
- Chcete nejbezpečnější univerzální výchozí volbu: Pipecat.
- Potřebujete reálnou souběžnost nebo nativní telefonii: LiveKit Agents.
- Jdete do multimodality (hlas plus vidění nebo avatary): TEN Framework.
- Potřebujete telefonního agenta v provozu tento týden: Bolna.
- Prototypujete nebo učíte: FastRTC.
- Radši koupíte než stavíte: spravovaná platforma jako Vapi, Retell nebo Synthflow, ne framework.
Časté dotazy
Co je open-source framework pro hlasové agenty?
Je to codebase, který si můžete hostovat sami a který propojuje převod řeči na text, jazykový model a syntézu textu na řeč, aby software mohl vést mluvenou konverzaci. Na rozdíl od spravovaných platforem ho provozujete na vlastní infrastruktuře, vybíráte si vlastní modely a platíte jen za podkladové služby, ne za přirážku za minutu.
Který open-source framework pro hlasové agenty má nejnižší latenci?
TEN Framework vede v surovém výkonu zvukové pipeline díky svému C++ jádru, ale v praxi celkový čas dominuje síťová a modelová latence. Dobře vyladěný stack Pipecat nebo LiveKit na rychlém modelu běžně dosahuje 0,7 až 1,1 sekundy hlas-k-hlasu, což se ve většině reálných nasazeních vyrovná TEN.
Je open source opravdu levnější než Vapi nebo Retell?
Ne vždy. Open source odstraňuje přirážku platformy za minutu, ale berete na sebe náklady na vývoj, hosting a údržbu. Pod několika tisíci minutami hovorů měsíčně je spravovaná platforma obvykle levnější, jakmile započítáte čas vývojářů. Nad desítkami tisíc minut se vlastní hosting frameworku dostává do vedení.
Dokážou tyto frameworky zvedat reálné telefonní hovory?
Ano. Pipecat se připojuje přes Twilio, Daily nebo Telnyx; LiveKit Agents dodává nativní SIP a telefonní čísla; Bolna má vestavěné Twilio, Plivo a Exotel; a Vocode podporuje Twilio a Vonage. FastRTC je zaměřený na prohlížeč a pro telefonní síť potřebuje externí bridge jako Jambonz.
Potřebuji odbornost na strojové učení, abych je používal?
Ne. Potřebujete softwarově inženýrské dovednosti, hlavně Python. Těžkou práci (přepis, uvažování, syntézu řeči) obstarávají modely, které zapojíte přes API. Orchstrujete služby, netrénujete modely, pokud se záměrně nerozhodnete hostovat si otevřené modely s otevřenými vahami.
Který framework je nejlepší pro začátečníka?
Pipecat, protože jeho pipeline model se chápe nejlépe a jeho dokumentace a příklady jsou nejúplnější. FastRTC je dobrá druhá volba, pokud chcete začít ještě menší a pochopit surovou transportní vrstvu, než si osvojíte plný framework.
Jsou open-source hlasové frameworky produkčně zralé v roce 2026?
První tři ano. Pipecat dosáhl verze 1.0, LiveKit Agents je na řadě 1.5.x a TEN Framework pohání komerční nasazení přes Agora. Hlavní riziko nejsou samotné frameworky, ale stav údržby menších projektů, proto jsme upozornili na zaseknuté jádro Vocode.
Čím se to liší od TTS API jako ElevenLabs?
TTS API jen mění text na řeč, což je jedna komponenta. Framework pro hlasové agenty orchestruje celou smyčku: poslouchá, přepisuje, posílá text do jazykového modelu, získá odpověď a vysloví ji zpět, přičemž zvládá přerušení a střídání. Framework volá TTS API, ne naopak.
O autorovi
Mert Batur Gurbuz je spoluzakladatel Techsy.io, kde tým nasazuje AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Studuje na University of Birmingham a píše o stacku nástrojů pro LLM, který tým Techsy reálně používá v produkci. Spojte se na LinkedIn.