
6 najlepszych open-source'owych frameworków agentów głosowych w 2026 (ranking)
W zeszłym kwartale wdrożyliśmy trzech telefonicznych agentów głosowych na Pipecat, a następnie przebudowaliśmy jednego na LiveKit Agents, gdy klient przeskoczył z 20 do 400 jednoczesnych połączeń. Oba to open-source'owe frameworki agentów głosowych. Żaden nie jest „najlepszy". Są dobre w różnych zadaniach, a błędny wybór kosztuje tygodnie.
Ten ranking opiera się na tym, co faktycznie trafia do produkcji, a nie na tym, co dobrze wygląda w README. Pobraliśmy aktualne dane z GitHuba z 14 lipca 2026: Pipecat ma 13 416 gwiazdek, LiveKit Agents 11 356, a TEN Framework 10 898. Gwiazdki nie mówią wszystkiego, więc uwzględniliśmy też aktywność commitów, obsługę telefonii, warunki licencji i zachowanie przy realnym obciążeniu połączeniami.
Szybka odpowiedź: Dla większości zespołów w 2026 roku Pipecat jest najsilniejszym open-source'owym frameworkiem agentów głosowych dzięki dużej bibliotece integracji i niemal codziennemu rozwojowi. LiveKit Agents wygrywa w skali i natywnej telefonii, TEN Framework w multimodalnej orkiestracji grafowej, a Bolna w uruchamianiu agenta telefonicznego w jedno popołudnie.
Jeśli wolisz kupić gotowy produkt zamiast go składać, nasze porównania platform zarządzanych, jak ElevenLabs, Vapi i Synthflow oraz Retell AI vs Vapi vs Bland będą lepszym punktem wyjścia. Nowy w kategorii? Zacznij od czym właściwie jest agent głosowy AI.
Jak ułożyliśmy ten ranking
Ocenialiśmy każdy framework w pięciu obszarach, od których zależy powodzenie realnego projektu: jak aktywny jest rozwój (commity z ostatnich 90 dni), szerokość integracji STT/LLM/TTS, obsługa telefonii (czy potrafi odebrać prawdziwy numer telefonu), warunki licencji oraz zachowanie przy współbieżności. Oto krótka lista w pigułce.
| Pozycja | Framework | Gwiazdki (lipiec 2026) | Licencja | Język | Telefonia | Najlepszy do |
|---|---|---|---|---|---|---|
| 1 | Pipecat | 13 416 | BSD-2-Clause | Python | Twilio, Daily, Telnyx | Wszechstronne wdrożenia produkcyjne |
| 2 | LiveKit Agents | 11 356 | Apache-2.0 | Python, Node | Natywne SIP + numery telefonów | Skala i czas rzeczywisty |
| 3 | TEN Framework | 10 898 | Apache-2.0 (hybrydowa) | C, Go, Python, JS | Przez Agora RTC | Multimodalność i edge |
| 4 | Bolna | 695 | MIT | Python | Twilio, Plivo, Exotel, SIP | Szybcy agenci telefoniczni |
| 5 | FastRTC | 4 618 | MIT | Python | WebRTC (przynieś własną) | Prototypy i dema |
| 6 | Vocode | 3 773 | MIT | Python | Twilio, Vonage | Referencja, z zastrzeżeniami |
1. Pipecat — najlepszy wszechstronny wybór
Pipecat, zbudowany przez zespół stojący za Daily, to pythonowy framework, który modeluje rozmowę jako potok: dźwięk wchodzi, przepływa przez zamianę mowy na tekst, model językowy i syntezę mowy, a dźwięk wraca. Ten model mentalny jest łatwy do ogarnięcia, a w kwietniu 2026 osiągnął stabilną wersję v1.0.
To, co go wyróżnia, to biblioteka integracji. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs i dziesiątki innych są już podłączone, więc zmiana dostawcy TTS to jednolinijkowa zmiana zamiast przepisywania. Telefonia działa przez Twilio, Daily lub Telnyx. Przy 13 416 gwiazdkach i commitach lądujących niemal codziennie ma też największy impet ze wszystkiego na tej liście.
Kompromis: ponieważ Pipecat daje ci klocki zamiast gotowego agenta, logika orkiestracji należy do ciebie. Nie ma buildera typu przeciągnij-i-upuść. Piszesz w Pythonie. Dla zespołu, który już koduje, to zaleta, nie wada.
Wybierz, jeśli: chcesz neutralnej względem dostawców, produkcyjnej bazy z najszerszym wsparciem modeli i czujesz się swobodnie pisząc w Pythonie. To nasz domyślny punkt wyjścia dla większości prac klienckich.
2. LiveKit Agents — zbudowany dla skali i czasu rzeczywistego
LiveKit Agents przyjmuje inne podejście. Zamiast liniowego potoku twój agent dołącza do pokoju jako uczestnik przez WebRTC, tę samą technologię, która stoi za połączeniami w stylu Zooma. Ta architektura sprawia, że błyszczy, gdy potrzebujesz niskich opóźnień i wielu jednoczesnych rozmów.
Wielką historią 2026 jest telefonia. LiveKit wypuścił natywne SIP i numery telefonów, więc połączenia przychodzące i wychodzące nie potrzebują już mostka Twilio siedzącego pośrodku. Dostarcza też pierwszostronne wsparcie dla OpenAI Realtime API, a od linii 1.5.x natywne narzędzia Model Context Protocol i adaptacyjną obsługę przerywania. Szczegóły przeczytasz w dokumentacji LiveKit Agents. Jeśli chcesz zrozumieć API czasu rzeczywistego, które opakowuje, osobno omawiamy OpenAI Realtime API dla agentów głosowych.
Ponieważ działa na open-source'owym serwerze mediów WebRTC LiveKit, możesz hostować cały stos samodzielnie. Krzywa uczenia jest bardziej stroma niż w Pipecat, a myślenie w kategoriach pokoi i uczestników wymaga chwili, by zaskoczyć.
Wybierz, jeśli: spodziewasz się realnej współbieżności, chcesz natywnej telefonii bez mostka lub stawiasz agenta OpenAI Realtime, który musi przetrwać skoki ruchu.
3. TEN Framework — multimodalny i oparty na grafie
TEN Framework (Transformative Extensions Network), wspierany przez Agorę, opisuje twojego agenta jako graf węzłów: STT, LLM, narzędzia, pamięć, wizja. Komponujesz graf w builderze przepływów, a TEN go wykonuje. To najbardziej elastyczna opcja tutaj dla wszystkiego poza czystym głosem, a jego rdzeń w C++ jest dostrojony do dźwięku o niskich opóźnieniach.
Mówi też w najszerszym zakresie języków spośród wszystkich frameworków na tej liście, z rozszerzeniami w C, Go, Pythonie, JavaScripcie i TypeScripcie oraz gotowymi konektorami dla Dify i Coze. Strona Agora TEN Framework to najjaśniejszy przegląd tego, co potrafi.
Dwa zastrzeżenia. Po pierwsze, licencja jest hybrydowa: większość frameworka to Apache-2.0, ale z dodatkowymi ograniczeniami w niektórych folderach, więc przeczytaj LICENSE, zanim wypuścisz komercyjnie. Po drugie, transport czasu rzeczywistego opiera się na sieci Agory, co oznacza Agora App ID, a powyżej darmowego poziomu, koszty użycia Agory.
Wybierz, jeśli: budujesz agenta multimodalnego (głos plus wizja lub awatary), cenisz kompozycję opartą na grafie lub chcesz najniższego poziomu wydajności dźwięku dostępnego w open source.
4. Bolna — najszybsza droga do agenta telefonicznego
Bolna jest mniejsza (695 gwiazdek) i bardziej zdecydowana w opiniach niż pierwsza trójka, i to dokładnie jej siła. Jest przede wszystkim telefoniczna. Tam, gdzie inne frameworki każą ci składać dzwonienie, Bolna je dostarcza: Twilio dla połączeń globalnych, Plivo i Exotel dla Indii oraz własne trunki SIP, wszystko skonfigurowane w definicji agenta w stylu JSON zamiast w kodzie.
To podejście oparte na konfiguracji oznacza, że możesz mieć przychodzącego lub wychodzącego agenta telefonicznego odbierającego prawdziwe połączenia szybciej niż niemal cokolwiek innego tutaj. Pod maską orkiestruje dostawców ASR, LLM i TTS przez websockety, więc nadal wybierasz własne modele. Rozwój pozostał aktywny przez połowę 2026.
Koszt tej szybkości to mniejsza społeczność i mniej integracji niż Pipecat czy LiveKit. Jeśli trafisz na przypadek brzegowy, jest bardziej prawdopodobne, że będziesz pierwszą osobą, która zgłosi problem. Dla wdrożeń mocno telefonicznych porównaj go z opcjami w naszym porównaniu telefonii agentów głosowych.
Wybierz, jeśli: twój przypadek użycia to przede wszystkim połączenia telefoniczne (przypomnienia o wizytach, wychodząca kwalifikacja, przychodzące wsparcie) i chcesz całkowicie pominąć hydraulikę telefoniczną.
5. FastRTC — lekka opcja prototypowania
FastRTC, od zespołu Hugging Face i Gradio, nie jest pełnym frameworkiem agentów i o to chodzi. To pythonowa biblioteka do dźwięku i wideo w czasie rzeczywistym przez WebRTC lub websockety. Przynosisz własne STT, LLM i TTS, a FastRTC obsługuje transport strumieniowy w zaledwie kilku linijkach kodu.
Dla proof of concept, dema czy badawczego spike'a ten minimalizm jest darem. Możesz postawić działający prototyp w jedno popołudnie bez zobowiązywania się do konwencji ciężkiego frameworka. Naturalnie łączy się z ekosystemem Hugging Face, więc otwarte modele łatwo podłączyć.
Druga strona jest taka, że odpowiadasz za wszystko, co framework by ci dał: detekcję tury, obsługę przerywania, telefonię, zarządzanie stanem. Skaluje się w dół pięknie, a w górę boleśnie.
Wybierz, jeśli: prototypujesz, uczysz lub budujesz demo w przeglądarce i chcesz maksymalnej kontroli przy minimalnym narzucie frameworka.
6. Vocode — historycznie ważny, z zastrzeżeniem o utrzymaniu
Vocode pomógł zdefiniować całą tę kategorię. Jego modularny projekt STT/LLM/TTS i wbudowana telefonia Twilio i Vonage uczyniły go jednym z pierwszych naprawdę użytecznych open-source'owych frameworków głosowych, a przy 3 773 gwiazdkach wciąż pojawia się w wielu tutorialach.
Oto szczera część i dlatego jest ostatni: open-source'owy rdzeń ucichł. Ostatni commit do vocode-core wylądował w listopadzie 2024, a repozytorium ma zaledwie dwa otwarte problemy, co zwykle sygnalizuje, że uwaga przeniosła się na hostowany produkt firmy zamiast zdrowego backlogu. Kod nadal działa, a projekt warto studiować, ale budowałbyś na fundamencie, którego nikt aktywnie nie łata.
Wybierz, jeśli: studiujesz architekturę agentów głosowych, utrzymujesz istniejący projekt Vocode lub konkretnie chcesz jego wzorców projektowych i akceptujesz, że będziesz utrzymywać bazę samodzielnie.
Warto też wiedzieć
Kilka narzędzi siedzi tuż poza rankingiem, ale należy je mieć na radarze:
- OpenAI Agents SDK (27 900+ gwiazdek) dostarcza rozszerzenie potoku głosowego. To raczej agentowy SDK ogólnego przeznaczenia niż przede wszystkim głosowy, ale to rozsądny wybór, jeśli już go ustandaryzowałeś.
- Gabber to nowszy multimodalny framework dla agentów, które widzą, słyszą i mówią, skierowany do przypadków użycia z ekranem i kamerą.
- Jambonz to open-source'owy kręgosłup telefoniczny. Nie buduje mózgu agenta, ale jest operatorskiej klasy sposobem na podłączenie dowolnego frameworka do prawdziwych sieci telefonicznych.
- Rasa (21 000+ gwiazdek) pozostaje ciężką wagą dla przedsiębiorczego dialogu i NLU w tekście i głosie, choć jest bardziej wymagający w uruchomieniu niż cokolwiek powyżej.
- Ultravox to szybki językowy model mowy, nie framework orkiestracji, więc traktuj go jako podłączalny komponent, nie konkurenta.
Czego faktycznie użylibyśmy do wdrożenia klienckiego
W Techsy budujemy agentów głosowych dla klientów B2B, więc oto nieglamorna rzeczywistość za rankingiem.
Nasz domyślny stos to Pipecat spinający Deepgram Nova-3 do zamiany mowy na tekst, GPT-4o-mini dla modelu językowego i Cartesia Sonic do syntezy mowy. Gdy detekcja tury jest dostrojona, opóźnienie głos-do-głosu zwykle ląduje między 0,7 a 1,1 sekundy, co jest wystarczająco blisko ludzkiej rozmowy, że dzwoniący przestają zauważać. Popchnij którykolwiek z tych komponentów do wolniejszego modelu, a poczujesz to natychmiast.
Telefonia to miejsce, gdzie projekty się komplikują. Uruchomiliśmy dwa wzorce w produkcji: trunk SIP Twilio zmostkowany do natywnego SIP LiveKit dla wysokonakładowego wsparcia przychodzącego oraz wbudowaną obsługę Plivo Bolny, gdy klient potrzebował tylko wychodzących połączeń przypominających. Ścieżka LiveKit kosztuje więcej godzin inżynierskich z góry, ale trzyma się stabilnie, gdy 300 połączeń przychodzi w tej samej minucie. Bolna uruchamia cię do piątku.
Matematyka samodzielnego hostowania myli ludzi. Uruchomienie lokalnego STT i TTS na pojedynczym GPU A10G kosztuje z grubsza 0,50 do 0,90 dolara za godzinę, niezależnie od tego, czy przychodzi choć jedno połączenie. API płatne za minutę, jak Deepgram i Cartesia, nie kosztują nic w bezczynności, ale szybko się sumują powyżej kilku tysięcy minut miesięcznie. Poniżej około 15 000 minut miesięcznie API niemal zawsze wygrywają i to rekomendujemy większości klientów. Sięgamy po LiveKit zamiast Pipecat głównie, gdy współbieżność przekracza kilkaset jednoczesnych połączeń.
Jeśli pytanie buduj-versus-kup jest wciąż otwarte po twojej stronie, przeprowadzamy pełną analizę kosztów w naszym przewodniku buduj vs kup agenta głosowego AI. A jeśli wolisz, by zespół spiął za ciebie opóźnienia, telefonię i skalowanie, to dokładnie to robimy w praktyce agentów głosowych Techsy.
Jak wybrać w minutę
Pomiń paraliż analityczny. Oto decyzja w punktach:
- Chcesz najbezpieczniejszego wszechstronnego domyślnego wyboru: Pipecat.
- Potrzebujesz realnej współbieżności lub natywnej telefonii: LiveKit Agents.
- Idziesz w multimodalność (głos plus wizja lub awatary): TEN Framework.
- Potrzebujesz agenta telefonicznego w tym tygodniu: Bolna.
- Prototypujesz lub uczysz: FastRTC.
- Wolisz kupić niż budować: platforma zarządzana, jak Vapi, Retell czy Synthflow, w ogóle nie framework.
Często zadawane pytania
Czym jest open-source'owy framework agenta głosowego?
To możliwy do samodzielnego hostowania kod, który spina zamianę mowy na tekst, model językowy i syntezę mowy, by oprogramowanie mogło prowadzić mówioną rozmowę. W przeciwieństwie do platform zarządzanych uruchamiasz go na własnej infrastrukturze, wybierasz własne modele i płacisz tylko za usługi bazowe zamiast marży za minutę.
Który open-source'owy framework agenta głosowego ma najniższe opóźnienia?
TEN Framework prowadzi w surowej wydajności potoku dźwiękowego dzięki rdzeniowi w C++, ale w praktyce opóźnienia sieci i modelu dominują w całości. Dobrze dostrojony stos Pipecat lub LiveKit na szybkim modelu rutynowo osiąga 0,7 do 1,1 sekundy głos-do-głosu, co dorównuje TEN w większości realnych wdrożeń.
Czy open source jest faktycznie tańszy niż Vapi czy Retell?
Nie zawsze. Open source usuwa marżę platformy za minutę, ale bierzesz na siebie koszty inżynierii, hostingu i utrzymania. Poniżej kilku tysięcy minut połączeń miesięcznie platforma zarządzana jest zwykle tańsza, gdy policzysz czas programisty. Powyżej dziesiątek tysięcy minut samodzielne hostowanie frameworka wychodzi na prowadzenie.
Czy te frameworki potrafią odbierać prawdziwe połączenia telefoniczne?
Tak. Pipecat łączy się przez Twilio, Daily lub Telnyx; LiveKit Agents dostarcza natywne SIP i numery telefonów; Bolna ma wbudowane Twilio, Plivo i Exotel; a Vocode wspiera Twilio i Vonage. FastRTC jest skupiony na przeglądarce i potrzebuje zewnętrznego mostka jak Jambonz dla sieci telefonicznej.
Czy potrzebuję wiedzy z uczenia maszynowego, by ich używać?
Nie. Potrzebujesz umiejętności inżynierii oprogramowania, głównie Pythona. Ciężką pracę (transkrypcja, rozumowanie, synteza mowy) wykonują modele, które podłączasz przez API. Orkiestrujesz usługi, nie trenujesz modeli, chyba że celowo wybierzesz samodzielne hostowanie modeli o otwartych wagach.
Który framework jest najlepszy dla początkującego?
Pipecat, bo jego model potoku jest najłatwiejszy do ogarnięcia, a dokumentacja i przykłady są najbardziej kompletne. FastRTC to dobry drugi wybór, jeśli chcesz zacząć jeszcze mniejszy i zrozumieć surową warstwę transportu przed przyjęciem pełnego frameworka.
Czy open-source'owe frameworki głosowe są gotowe produkcyjnie w 2026?
Pierwsza trójka jest. Pipecat osiągnął v1.0, LiveKit Agents jest na linii 1.5.x, a TEN Framework napędza komercyjne wdrożenia przez Agorę. Główne ryzyko to nie same frameworki, lecz status utrzymania mniejszych projektów, dlatego wskazaliśmy na zastój rdzenia Vocode.
Czym to się różni od API TTS jak ElevenLabs?
API TTS tylko zamienia tekst na mowę, co jest jednym komponentem. Framework agenta głosowego orkiestruje całą pętlę: słucha, transkrybuje, wysyła tekst do modelu językowego, dostaje odpowiedź i ją wypowiada, zarządzając przerywaniem i turami rozmowy. Framework wywołuje API TTS, nie odwrotnie.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół wdraża agentów AI, systemy automatyzacji i potoki głosowe/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stosie narzędzi LLM, którego zespół Techsy faktycznie używa w produkcji. Połącz się na LinkedIn.