Techsy
Kontakt
Začít
Zpět na blog
ai-machine-learning

6 nejlepších open-source frameworků pro hlasové agenty v roce 2026 (seřazeno)

Napsal Mert Batur Gürbüz
Jul 15, 2026
11 minut čtení
Obsah
6 nejlepších open-source frameworků pro hlasové agenty v roce 2026 (seřazeno)

6 nejlepších open-source frameworků pro hlasové agenty v roce 2026 (seřazeno)

Minulé čtvrtletí jsme nasadili tři telefonní hlasové agenty na Pipecat a jednoho pak přestavěli na LiveKit Agents, když klient vyskočil z 20 na 400 souběžných hovorů. Oba jsou open-source frameworky pro hlasové agenty. Ani jeden není „ten nejlepší". Jsou dobří na různé věci a špatná volba vás stojí týdny.

Tento žebříček vychází z toho, co se reálně nasazuje, ne z toho, co hezky vypadá v README. Stáhli jsme aktuální čísla z GitHubu k 14. červenci 2026: Pipecat má 13 416 hvězd, LiveKit Agents 11 356 a TEN Framework 10 898. Hvězdy neříkají celý příběh, takže jsme zvažovali i aktivitu commitů, podporu telefonie, licenční podmínky a to, jak si každý framework vede při reálném objemu hovorů.

Rychlá odpověď: Pro většinu týmů je v roce 2026 nejsilnějším open-source frameworkem pro hlasové agenty Pipecat, díky rozsáhlé knihovně integrací a téměř každodennímu vývoji. LiveKit Agents vyhrává v měřítku a nativní telefonii, TEN Framework v multimodální orchestraci grafů a Bolna v nasazení telefonního agenta za odpoledne.

Pokud byste raději hotový produkt koupili, než si ho skládat, jsou lepší výchozí bod naše srovnání spravovaných platforem jako ElevenLabs, Vapi a Synthflow a Retell AI vs Vapi vs Bland. Jste v kategorii noví? Začněte tím, co to vlastně hlasový AI agent je.

Jak jsme frameworky seřadili

Každý framework jsme hodnotili podle pěti věcí, na kterých reálný projekt stojí nebo padá: jak aktivní je vývoj (commity za posledních 90 dní), šířka integrací STT/LLM/TTS, podpora telefonie (dokáže zvednout reálné telefonní číslo), licenční podmínky a chování při souběžnosti. Zde je přehled shortlistu.

PořadíFrameworkHvězdy (červenec 2026)LicenceJazykTelefonieNejlepší pro
1Pipecat13 416BSD-2-ClausePythonTwilio, Daily, TelnyxUniverzální produkční nasazení
2LiveKit Agents11 356Apache-2.0Python, NodeNativní SIP + telefonní číslaŠkálování a real-time
3TEN Framework10 898Apache-2.0 (hybridní)C, Go, Python, JSPřes Agora RTCMultimodalita a edge
4Bolna695MITPythonTwilio, Plivo, Exotel, SIPRychlí telefonní agenti
5FastRTC4 618MITPythonWebRTC (vlastní)Prototypy a dema
6Vocode3 773MITPythonTwilio, VonageReference, s výhradami

1. Pipecat — nejlepší univerzální volba

Pipecat, který vytvořil tým stojící za Daily, je pythonový framework, který modeluje konverzaci jako pipeline: zvuk přijde, proteče přes převod řeči na text, jazykový model a syntézu textu na řeč a zvuk se vrátí zpět. Tento mentální model se snadno chápe a v dubnu 2026 dosáhl stabilní verze 1.0.

Co ho odlišuje, je knihovna integrací. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs a desítky dalších jsou už zapojené, takže výměna dodavatele TTS je změna na jednom řádku místo přepisování. Telefonie funguje přes Twilio, Daily nebo Telnyx. S 13 416 hvězdami a commity, které přistávají téměř každý den, má také největší dynamiku ze všech na tomto seznamu.

Nevýhoda: protože vám Pipecat dává spíš stavební kameny než hotového agenta, orchestrační logika je na vás. Žádný drag-and-drop builder neexistuje. Píšete Python. Pro tým, který už kóduje, je to výhoda, ne chyba.

Vyberte si ho, pokud: chcete vendor-neutrální, produkčně zralý základ s nejširší podporou modelů a psaní Pythonu vám nevadí. Pro většinu klientských projektů je to náš výchozí bod.

2. LiveKit Agents — stavěný na škálování a real-time

LiveKit Agents jde na věc jinak. Místo lineární pipeline se váš agent připojí do místnosti jako účastník přes WebRTC, stejnou technologii, která stojí za hovory ve stylu Zoomu. Právě tato architektura září, když potřebujete nízkou latenci a mnoho souběžných konverzací.

Velkým příběhem roku 2026 je telefonie. LiveKit nasadil nativní SIP a telefonní čísla, takže příchozí a odchozí volání už nepotřebuje Twilio bridge uprostřed. Dodává také first-party podporu pro OpenAI Realtime API a od řady 1.5.x nativní nástroje Model Context Protocol a adaptivní zpracování přerušení. Podrobnosti si můžete přečíst v dokumentaci LiveKit Agents. Pokud chcete pochopit real-time API, které obaluje, zvlášť rozebíráme OpenAI Realtime API pro hlasové agenty.

Protože běží na open-source WebRTC media serveru LiveKit, můžete si celý stack hostovat sami. Křivka učení je strmější než u Pipecat a uvažování v místnostech a účastnících chvíli trvá, než si sedne.

Vyberte si ho, pokud: očekáváte reálnou souběžnost, chcete nativní telefonii bez bridge, nebo stavíte agenta na OpenAI Realtime, který musí přežít špičky v provozu.

3. TEN Framework — multimodální a založený na grafech

TEN Framework (Transformative Extensions Network), za kterým stojí Agora, popisuje vašeho agenta jako graf uzlů: STT, LLM, nástroje, paměť, vidění. Graf sestavíte ve workflow builderu a TEN ho spustí. Je to nejflexibilnější možnost zde pro cokoliv za hranicí čistého hlasu a jeho C++ jádro je vyladěné na nízkou latenci zvuku.

Mluví také nejširší škálou jazyků ze všech frameworků na tomto seznamu, s rozšířeními v C, Go, Pythonu, JavaScriptu a TypeScriptu a hotovými konektory pro Dify a Coze. Stránka Agora TEN Framework je nejjasnější přehled toho, co dokáže.

Dvě výhrady. Zaprvé, licence je hybridní: většina frameworku je Apache-2.0, ale s dodatečnými omezeními u některých složek, takže než to nasadíte komerčně, přečtěte si LICENSE. Zadruhé, real-time transport se opírá o síť Agora, což znamená Agora App ID a nad bezplatnou úrovní i náklady za využití Agory.

Vyberte si ho, pokud: stavíte multimodálního agenta (hlas plus vidění nebo avatary), ceníte si kompozice založené na grafech nebo chcete nejnižší úroveň zvukového výkonu dostupnou v open source.

4. Bolna — nejrychlejší cesta k telefonnímu agentovi

Bolna je menší (695 hvězd) a vyhraněnější než první tři a právě to je její síla. Je telefonie-na-prvním-místě. Zatímco jiné frameworky vás nutí volání skládat, Bolna ho dodává: Twilio pro globální hovory, Plivo a Exotel pro Indii a vlastní SIP trunky, vše nakonfigurované v agent definici ve stylu JSON místo v kódu.

Toto nastavení řízené konfigurací znamená, že příchozího nebo odchozího telefonního agenta, který zvedá reálné hovory, můžete mít rychleji než téměř s čímkoli jiným zde. Pod kapotou orchestrjuje poskytovatele ASR, LLM a TTS přes websockety, takže si stále vybíráte vlastní modely. Vývoj zůstal aktivní i v polovině roku 2026.

Cenou za tuto rychlost je menší komunita a méně integrací než Pipecat nebo LiveKit. Pokud narazíte na okrajový případ, je pravděpodobnější, že budete první, kdo založí issue. Pro nasazení s důrazem na telefonii ji zvažte vůči možnostem v našem srovnání telefonie hlasových agentů.

Vyberte si ji, pokud: váš případ užití jsou na prvním místě telefonní hovory (připomínky schůzek, odchozí kvalifikace, příchozí podpora) a chcete se úplně vyhnout instalatérství telefonie.

5. FastRTC — odlehčená možnost pro prototypování

FastRTC od týmu Hugging Face a Gradio není plnohodnotný framework pro agenty, a to je právě pointa. Je to pythonová knihovna pro real-time zvuk a video přes WebRTC nebo websockety. Vlastní STT, LLM a TTS si přinesete sami a FastRTC obstará streamovací transport jen několika řádky kódu.

Pro proof of concept, demo nebo výzkumný pokus je tento minimalismus dar. Mluvící prototyp můžete postavit za odpoledne, aniž byste se upsali konvencím těžkého frameworku. Přirozeně se páruje s ekosystémem Hugging Face, takže otevřené modely se zapojují snadno.

Rubem je, že zodpovídáte za vše, co by vám jinak poskytl framework: detekci střídání, zpracování přerušení, telefonii, správu stavu. Škáluje se dolů krásně a nahoru bolestivě.

Vyberte si ho, pokud: prototypujete, učíte nebo stavíte prohlížečové demo a chcete maximální kontrolu s minimální režií frameworku.

6. Vocode — historicky důležitý, s výhradou k údržbě

Vocode pomohl definovat celou tuto kategorii. Jeho modulární design STT/LLM/TTS a vestavěná telefonie Twilio a Vonage z něj udělaly jeden z prvních opravdu použitelných open-source hlasových frameworků a se 3 773 hvězdami se stále objevuje v spoustě návodů.

Teď upřímná část, a proto je poslední: open-source jádro ztichlo. Poslední commit do vocode-core přistál v listopadu 2024 a repozitář má jen dva otevřené issues, což obvykle signalizuje, že pozornost se přesunula na hostovaný produkt firmy, ne na zdravý backlog. Kód stále běží a design stojí za studium, ale stavěli byste na základu, který nikdo aktivně neopravuje.

Vyberte si ho, pokud: studujete architekturu hlasových agentů, udržujete existující projekt Vocode nebo konkrétně chcete jeho návrhové vzory a smíříte se s tím, že základ budete udržovat sami.

Co také stojí za vědění

Několik nástrojů leží těsně za žebříčkem, ale patří na váš radar:

  • OpenAI Agents SDK (27 900+ hvězd) dodává rozšíření pro hlasovou pipeline. Je to spíš obecné SDK pro agenty než hlas-na-prvním-místě, ale je to rozumná volba, pokud na něm už jste standardizovaní.
  • Gabber je novější multimodální framework pro agenty, kteří vidí, slyší a mluví, zaměřený na případy užití s obrazovkou a kamerou.
  • Jambonz je open-source páteř telefonie. Nestaví mozek agenta, ale je to způsob v kvalitě operátora, jak připojit jakýkoli framework k reálným telefonním sítím.
  • Rasa (21 000+ hvězd) zůstává těžkou vahou pro podnikový dialog a NLU napříč textem i hlasem, i když je náročnější na provoz než cokoli výše.
  • Ultravox je rychlý jazykový model pro řeč, ne orchestrační framework, takže ho berte jako zapojitelnou komponentu, ne jako konkurenta.

Co bychom reálně použili pro klientské nasazení

V Techsy stavíme hlasové agenty pro B2B klienty, takže tady je nelákavá realita za žebříčkem.

Náš výchozí stack je Pipecat, který zapojuje Deepgram Nova-3 pro převod řeči na text, GPT-4o-mini pro jazykový model a Cartesia Sonic pro syntézu textu na řeč. Jakmile se vyladí detekce střídání, latence hlas-k-hlasu se obvykle pohybuje mezi 0,7 a 1,1 sekundy, což je dost blízko lidské konverzaci, aby si toho volající přestali všímat. Posuňte kteroukoli z těchto komponent na pomalejší model a okamžitě to ucítíte.

Telefonie je místo, kde se projekty komplikují. V produkci jsme provozovali dva vzory: Twilio SIP trunk přemostěný do nativního SIP LiveKit pro vysoké objemy příchozí podpory a vestavěné zpracování Plivo od Bolny, když klient potřeboval jen odchozí připomínkové hovory. Cesta přes LiveKit stojí víc inženýrských hodin na začátku, ale drží stabilně, když dorazí 300 hovorů ve stejné minutě. Bolna vás dostane do provozu do pátku.

Matematika vlastního hostingu lidi mate. Provozování lokálního STT a TTS na jedné GPU A10G stojí zhruba 0,50 až 0,90 dolaru za hodinu, ať už přijde jediný hovor, nebo ne. API s platbou za minutu jako Deepgram a Cartesia nestojí nic, když jsou nečinná, ale rychle se nasčítají po několika tisících minutách měsíčně. Pod zhruba 15 000 minutami měsíčně téměř vždy vyhrávají API a to doporučujeme většině klientů. Po LiveKit místo Pipecat saháme hlavně tehdy, když souběžnost překročí několik set současných hovorů.

Pokud je u vás otázka stavět-versus-koupit stále otevřená, celý rozpis nákladů procházíme v našem průvodci stavět vs koupit hlasového AI agenta. A pokud byste raději, aby tým vyřešil latenci, telefonii a škálování za vás, přesně to děláme v praxi hlasových agentů Techsy.

Jak vybrat za jednu minutu

Přeskočte analytickou paralýzu. Tady je rozhodnutí v odrážkách:

  • Chcete nejbezpečnější univerzální výchozí volbu: Pipecat.
  • Potřebujete reálnou souběžnost nebo nativní telefonii: LiveKit Agents.
  • Jdete do multimodality (hlas plus vidění nebo avatary): TEN Framework.
  • Potřebujete telefonního agenta v provozu tento týden: Bolna.
  • Prototypujete nebo učíte: FastRTC.
  • Radši koupíte než stavíte: spravovaná platforma jako Vapi, Retell nebo Synthflow, ne framework.

Časté dotazy

Co je open-source framework pro hlasové agenty?

Je to codebase, který si můžete hostovat sami a který propojuje převod řeči na text, jazykový model a syntézu textu na řeč, aby software mohl vést mluvenou konverzaci. Na rozdíl od spravovaných platforem ho provozujete na vlastní infrastruktuře, vybíráte si vlastní modely a platíte jen za podkladové služby, ne za přirážku za minutu.

Který open-source framework pro hlasové agenty má nejnižší latenci?

TEN Framework vede v surovém výkonu zvukové pipeline díky svému C++ jádru, ale v praxi celkový čas dominuje síťová a modelová latence. Dobře vyladěný stack Pipecat nebo LiveKit na rychlém modelu běžně dosahuje 0,7 až 1,1 sekundy hlas-k-hlasu, což se ve většině reálných nasazeních vyrovná TEN.

Je open source opravdu levnější než Vapi nebo Retell?

Ne vždy. Open source odstraňuje přirážku platformy za minutu, ale berete na sebe náklady na vývoj, hosting a údržbu. Pod několika tisíci minutami hovorů měsíčně je spravovaná platforma obvykle levnější, jakmile započítáte čas vývojářů. Nad desítkami tisíc minut se vlastní hosting frameworku dostává do vedení.

Dokážou tyto frameworky zvedat reálné telefonní hovory?

Ano. Pipecat se připojuje přes Twilio, Daily nebo Telnyx; LiveKit Agents dodává nativní SIP a telefonní čísla; Bolna má vestavěné Twilio, Plivo a Exotel; a Vocode podporuje Twilio a Vonage. FastRTC je zaměřený na prohlížeč a pro telefonní síť potřebuje externí bridge jako Jambonz.

Potřebuji odbornost na strojové učení, abych je používal?

Ne. Potřebujete softwarově inženýrské dovednosti, hlavně Python. Těžkou práci (přepis, uvažování, syntézu řeči) obstarávají modely, které zapojíte přes API. Orchstrujete služby, netrénujete modely, pokud se záměrně nerozhodnete hostovat si otevřené modely s otevřenými vahami.

Který framework je nejlepší pro začátečníka?

Pipecat, protože jeho pipeline model se chápe nejlépe a jeho dokumentace a příklady jsou nejúplnější. FastRTC je dobrá druhá volba, pokud chcete začít ještě menší a pochopit surovou transportní vrstvu, než si osvojíte plný framework.

Jsou open-source hlasové frameworky produkčně zralé v roce 2026?

První tři ano. Pipecat dosáhl verze 1.0, LiveKit Agents je na řadě 1.5.x a TEN Framework pohání komerční nasazení přes Agora. Hlavní riziko nejsou samotné frameworky, ale stav údržby menších projektů, proto jsme upozornili na zaseknuté jádro Vocode.

Čím se to liší od TTS API jako ElevenLabs?

TTS API jen mění text na řeč, což je jedna komponenta. Framework pro hlasové agenty orchestruje celou smyčku: poslouchá, přepisuje, posílá text do jazykového modelu, získá odpověď a vysloví ji zpět, přičemž zvládá přerušení a střídání. Framework volá TTS API, ne naopak.

O autorovi

Mert Batur Gurbuz je spoluzakladatel Techsy.io, kde tým nasazuje AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Studuje na University of Birmingham a píše o stacku nástrojů pro LLM, který tým Techsy reálně používá v produkci. Spojte se na LinkedIn.

Štítky

open-source-frameworky-pro-hlasove-agentypipecatlivekit-agentsten-frameworkhlasova-ai

Sdílet článek

Související články

Více z kategorie ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 nejlepších API pro AI web scraping v roce 2026 (otestováno na našem vlastním agentním stacku)

Otestovali jsme 8 API pro AI web scraping s reálnými cenami pro rok 2026 staženými přes náš vlastní agentní stack. Firecrawl, Bright Data, ScrapingBee a 5 dalších, seřazené podle výstupu připraveného pro LLM, anti-bot a podpory MCP.

9 min read minut čtení
Číst
ai-machine-learning
Jul 20, 2026

Prompt Engineering pro kódování: 7 vzorů, které denně používáme v Claude Code a Cursor (2026)

Většina článků o „promptech pro AI kódování“ vám nabídne 50 šablon ke kopírování. Tento článek učí 7 vzorů, které každý den používáme k provozu pipeline s 16 agenty v Claude Code, včetně skutečných příkladů před a po úpravě pro každý z nich, a ukazuje, kde se každý vzor nachází v nástrojích Claude Code, Cursor a Copilot v roce 2026.

11 min read minut čtení
Číst
ai-machine-learning
Jul 19, 2026

AI PoC do produkce: 12bodový kontrolní seznam před nasazením

Funkční AI demo není produkční systém. Tento 12bodový kontrolní seznam prochází tři fáze, které každá AI funkce před spuštěním potřebuje: zpevnit, stabilizovat a nasadit – s konkrétními prahy pro cenové stropy, omezení rychlosti, záložní řešení a spouštěče rollbacku.

10 min read minut čtení
Číst
Zobrazit všechny články
Začněte svůj projekt

Pojďme něco postavit nevšedního?

Proměňme vaši vizi ve skutečnost. Náš tým je připraven vám pomoct vytvořit software, který dělá rozdíl.

Rezervovat 30minutový úvodní hovorNaše projekty

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt

Právní informace

  • Zásady ochrany osobních údajů
  • Podmínky poskytování služeb
  • Zásady používání cookies

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt
Právní informaceZásady ochrany osobních údajůPodmínky poskytování služebZásady používání cookies
TECHSY
© 2026 Techsy. Všechna práva vyhrazena.