ai-machine-learning

De 6 beste open source spraakagent-frameworks van 2026 (gerangschikt)

Geschreven door Mert Batur
Jul 15, 2026
12 leestijd
De 6 beste open source spraakagent-frameworks van 2026 (gerangschikt)

Vorig kwartaal leverden we drie telefoongebaseerde spraakagents op Pipecat, en bouwden we er één om naar LiveKit Agents toen de klant van 20 naar 400 gelijktijdige gesprekken sprong. Beide zijn open source spraakagent-frameworks. Geen van beide is "de beste". Ze zijn goed in andere dingen, en de verkeerde keuze kost je weken.

Deze rangschikking is gebaseerd op wat daadwerkelijk in productie draait, niet op wat goed leest in een README. We haalden live GitHub-cijfers op 14 juli 2026: Pipecat staat op 13,416 sterren, LiveKit Agents op 11,356, en TEN Framework op 10,898. Sterren vertellen niet het hele verhaal, dus wogen we ook commit-activiteit, telefonie-ondersteuning, licentievoorwaarden en hoe elk framework standhoudt bij echt gespreksvolume mee.

Snel antwoord: Voor de meeste teams is Pipecat in 2026 het sterkste open source spraakagent-framework dankzij de grote integratiebibliotheek en de bijna dagelijkse ontwikkeling. LiveKit Agents wint op schaal en native telefonie, TEN Framework op multimodale graph-orchestratie, en Bolna als je in een middag een telefoonagent live wilt hebben.

Wil je liever een kant-en-klaar product kopen dan er zelf één samenstellen? Dan zijn onze vergelijkingen van managed platforms zoals ElevenLabs, Vapi en Synthflow en Retell AI vs Vapi vs Bland een beter startpunt. Nieuw in deze categorie? Begin met wat een AI-spraakagent precies is.

Hoe we deze frameworks rangschikten

We beoordeelden elk framework op vijf punten waar een echt project op staat of valt: hoe actief de ontwikkeling is (commits in de laatste 90 dagen), de breedte van STT/LLM/TTS-integraties, telefonie-ondersteuning (kan het een echt telefoonnummer beantwoorden), licentievoorwaarden en gedrag onder gelijktijdige belasting. Hier is de shortlist in één oogopslag.

RangFrameworkSterren (juli 2026)LicentieTaalTelefonieGeschikt voor
1Pipecat13,416BSD-2-ClausePythonTwilio, Daily, TelnyxAllround productiebuilds
2LiveKit Agents11,356Apache-2.0Python, NodeNative SIP + phone numbersSchaal en realtime
3TEN Framework10,898Apache-2.0 (hybrid)C, Go, Python, JSVia Agora RTCMultimodaal en edge
4Bolna695MITPythonTwilio, Plivo, Exotel, SIPSnelle telefoonagents
5FastRTC4,618MITPythonWebRTC (bring your own)Prototypes en demo's
6Vocode3,773MITPythonTwilio, VonageReferentie, met voorbehoud

1. Pipecat: de beste allround keuze

Pipecat, gebouwd door het team achter Daily, is een Python-framework dat een gesprek modelleert als een pipeline: audio komt binnen, stroomt door speech-to-text, een taalmodel en text-to-speech, en komt er als audio weer uit. Dat mentale model is makkelijk te doorgronden, en het bereikte in april 2026 een stabiele v1.0.

Wat het onderscheidt is de integratiebibliotheek. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs en tientallen andere zijn al aangesloten, waardoor je TTS-leverancier wisselen neerkomt op een wijziging van één regel code in plaats van een herschrijving. Telefonie werkt via Twilio, Daily of Telnyx. Met 13,416 sterren en commits die bijna elke dag binnenkomen, heeft het ook de meeste momentum van alles op deze lijst.

De keerzijde: omdat Pipecat je de bouwstenen geeft in plaats van een kant-en-klare agent, ben je zelf verantwoordelijk voor de orchestratielogica. Er is geen drag-and-drop-builder. Je schrijft Python. Voor een team dat toch al code schrijft, is dat geen nadeel maar juist een pluspunt.

Kies dit als: je een leveranciersneutrale, productieklare basis wilt met de breedste modelondersteuning en je Python kunt schrijven. Dit is ons standaard startpunt voor de meeste klantprojecten.

2. LiveKit Agents: gebouwd voor schaal en realtime

LiveKit Agents kiest een andere aanpak. In plaats van een lineaire pipeline treedt je agent toe tot een "room" als deelnemer via WebRTC, dezelfde technologie achter Zoom-achtige gesprekken. Die architectuur is waarom het uitblinkt zodra je lage latentie en veel gelijktijdige gesprekken nodig hebt.

Het grote verhaal van 2026 is telefonie. LiveKit introduceerde native SIP en telefoonnummers, waardoor inkomende en uitgaande gesprekken geen Twilio-bridge er meer tussen nodig hebben. Het biedt ook first-party ondersteuning voor de OpenAI Realtime API en, sinds de 1.5.x-lijn, native Model Context Protocol-tools en adaptieve interruption handling. De details lees je in de LiveKit Agents-documentatie. Wil je begrijpen welke realtime API eronder zit? Dat behandelen we apart in OpenAI's Realtime API voor spraakagents.

Omdat het draait op LiveKit's open source WebRTC-mediaserver, kun je de hele stack zelf hosten. De leercurve is steiler dan die van Pipecat, en het denken in "rooms" en deelnemers vergt even wat gewenning.

Kies dit als: je echte gelijktijdigheid verwacht, native telefonie zonder bridge wilt, of je een OpenAI Realtime-agent opzet die verkeerspieken moet overleven.

3. TEN Framework: multimodaal en graph-based

TEN Framework (Transformative Extensions Network), gesteund door Agora, beschrijft je agent als een graaf van nodes: STT, LLM, tools, memory, vision. Je stelt de graaf samen in een workflow-builder, en TEN voert hem uit. Het is de meest flexibele optie hier voor alles wat verder gaat dan pure spraak, en de C++-kern is afgestemd op audio met lage latentie.

Het ondersteunt ook de breedste range aan programmeertalen van alle frameworks op deze lijst, met extensies in C, Go, Python, JavaScript en TypeScript, plus kant-en-klare connectors voor Dify en Coze. De Agora TEN Framework-pagina geeft het duidelijkste overzicht van wat het kan.

Twee kanttekeningen. Ten eerste is de licentie een hybride: het grootste deel van het framework valt onder Apache-2.0, maar met extra restricties op bepaalde mappen, dus lees het LICENSE-bestand voordat je commercieel uitrolt. Ten tweede leunt realtime transport op Agora's netwerk, wat een Agora App ID vereist en, boven de gratis laag, Agora-gebruikskosten met zich meebrengt.

Kies dit als: je een multimodale agent bouwt (spraak plus vision of avatars), je graph-based compositie waardeert, of je de laagste-niveau audioprestaties wilt die beschikbaar zijn in open source.

4. Bolna: de snelste weg naar een telefoonagent

Bolna is kleiner (695 sterren) en uitgesprokener dan de top drie, en dat is precies zijn kracht. Het is telefonie-first. Waar andere frameworks je zelf laten uitzoeken hoe je gaat bellen, levert Bolna het kant-en-klaar: Twilio voor wereldwijde gesprekken, Plivo en Exotel voor India, en aangepaste SIP-trunks, allemaal geconfigureerd in een JSON-achtige agentdefinitie in plaats van code.

Die config-gedreven opzet betekent dat je sneller dan bijna alles wat hier verder staat een inkomende of uitgaande telefoonagent live kunt hebben die echte gesprekken beantwoordt. Onder de motorkap orchestreert het ASR-, LLM- en TTS-providers via websockets, dus je kiest nog steeds je eigen modellen. De ontwikkeling bleef actief tot medio 2026.

De prijs van die snelheid is een kleinere community en minder integraties dan Pipecat of LiveKit. Loop je tegen een edge case aan, dan is de kans groot dat jij de eerste bent die de issue meldt. Bij telefonie-zware builds weeg je het best af tegen de opties in onze vergelijking van voice agent telefonie.

Kies dit als: je use case draait om telefoongesprekken (afspraakherinneringen, uitgaande kwalificatie, inkomende support) en je de telefonie-loodgieterij volledig wilt overslaan.

5. FastRTC: de lichtgewicht prototype-optie

FastRTC, van het Hugging Face- en Gradio-team, is geen volwaardig agentframework, en dat is precies het punt. Het is een Python-bibliotheek voor realtime audio en video via WebRTC of websockets. Je brengt je eigen STT, LLM en TTS mee, en FastRTC regelt het streaming-transport met slechts een paar regels code.

Voor een proof of concept, een demo of een research spike is die minimalistische aanpak een cadeau. Je zet in een middag een pratend prototype op zonder je vast te leggen aan de conventies van een zwaargewicht-framework. Het sluit natuurlijk aan op het Hugging Face-ecosysteem, waardoor open modellen makkelijk aan te sluiten zijn.

De keerzijde is dat je zelf verantwoordelijk bent voor alles wat een framework anders voor je zou regelen: turn detection, interruption handling, telefonie, state management. Het schaalt prachtig naar beneden en pijnlijk naar boven.

Kies dit als: je aan het prototypen bent, lesgeeft, of een browserdemo bouwt, en je maximale controle wilt met minimale framework-overhead.

6. Vocode: historisch belangrijk, met een onderhoudskanttekening

Vocode hielp deze hele categorie mee vormgeven. Het modulaire STT/LLM/TTS-ontwerp en de ingebouwde Twilio- en Vonage-telefonie maakten het een van de eerste écht bruikbare open source spraakframeworks, en met 3,773 sterren duikt het nog steeds op in talloze tutorials.

En hier komt het eerlijke deel, en dat is waarom het onderaan staat: de open source kern is stilgevallen. De laatste commit naar vocode-core dateert van november 2024, en de repository telt slechts twee open issues, wat meestal betekent dat de aandacht is verschoven naar het gehoste product van het bedrijf in plaats van een gezonde backlog. De code werkt nog steeds, en het ontwerp is de moeite van het bestuderen waard, maar je bouwt op een fundament dat niemand nog actief onderhoudt.

Kies dit als: je spraakagent-architectuur bestudeert, een bestaand Vocode-project onderhoudt, of je specifiek zijn ontwerppatronen wilt en accepteert dat je de basis zelf moet blijven onderhouden.

Ook de moeite waard om te kennen

Een paar tools vallen net buiten de rangschikking, maar horen wel op je radar:

  • OpenAI Agents SDK (27,900+ sterren) levert een voice-pipeline-extensie. Het is eerder een general-purpose agent-SDK dan voice-first, maar een redelijke keuze als je er al op gestandaardiseerd bent.
  • Gabber is een nieuwer multimodaal framework voor agents die zien, horen en spreken, gericht op scherm-en-camera use cases.
  • Jambonz is een open source telefonie-backbone. Het bouwt niet het brein van de agent, maar is een carrier-grade manier om elk framework aan te sluiten op echte telefoonnetwerken.
  • Rasa (21,000+ sterren) blijft het zwaargewicht voor enterprise-dialoog en NLU, zowel tekst als spraak, al is het omslachtiger om te draaien dan alles hierboven.
  • Ultravox is een snel speech-language-model, geen orchestratieframework, dus behandel het als een aan te sluiten component in plaats van een concurrent.

Wat we in de praktijk gebruiken voor een klantproject

Bij Techsy bouwen we spraakagents voor B2B-klanten, dus hier is de weinig glamoureuze realiteit achter de rangschikking.

Onze standaardstack is Pipecat met Deepgram Nova-3 voor speech-to-text, GPT-4o-mini als taalmodel, en Cartesia Sonic voor text-to-speech. Zodra turn detection is afgesteld, ligt de voice-to-voice-latentie meestal tussen 0.7 en 1.1 seconden, dicht genoeg bij een menselijk gesprek dat bellers het niet meer opmerken. Zet je een van die componenten om naar een trager model, dan voel je dat onmiddellijk.

Telefonie is waar projecten rommelig worden. We hebben twee patronen in productie gedraaid: een Twilio SIP-trunk gebridged naar LiveKit's native SIP voor inkomende support met hoog volume, en Bolna's ingebouwde Plivo-afhandeling wanneer een klant simpelweg uitgaande herinneringsgesprekken nodig had. De LiveKit-route kost vooraf meer engineering-uren, maar houdt stand als er 300 gesprekken binnen dezelfde minuut binnenkomen. Met Bolna sta je vrijdag al live.

De rekensom van self-hosting struikelt mensen. Lokale STT en TTS draaien op een enkele A10G-GPU kost ruwweg $0.50 tot $0.90 per uur, of er nou één gesprek binnenkomt of niet. Pay-per-minute API's zoals Deepgram en Cartesia kosten niets in rust, maar lopen snel op na een paar duizend minuten per maand. Onder ongeveer 15,000 minuten per maand winnen de API's bijna altijd, en dat is wat we de meeste klanten adviseren. We grijpen naar LiveKit in plaats van Pipecat vooral zodra de gelijktijdigheid een paar honderd gesprekken tegelijk overschrijdt.

Staat de build-versus-buy-vraag bij jou nog open? Dan lopen we de volledige kostenopbouw door in onze gids bouwen of kopen: AI-spraakagent. En wil je liever een team dat de latentie, telefonie en schaling voor je regelt? Dat is precies wat we doen bij Techsy's spraakagent-praktijk.

Hoe je in één minuut kiest

Sla de analyseverlamming over. Hier is de beslissing in bullets:

  • Je wilt de veiligste allround standaardkeuze: Pipecat.
  • Je hebt echte gelijktijdigheid of native telefonie nodig: LiveKit Agents.
  • Je gaat multimodaal (spraak plus vision of avatars): TEN Framework.
  • Je hebt deze week een live telefoonagent nodig: Bolna.
  • Je prototypet of geeft les: FastRTC.
  • Je koopt liever dan dat je bouwt: een managed platform zoals Vapi, Retell of Synthflow, geen framework.

Veelgestelde vragen

Wat is een open source spraakagent-framework?

Het is een zelf te hosten codebase die speech-to-text, een taalmodel en text-to-speech aan elkaar koppelt, zodat software een gesproken gesprek kan voeren. In tegenstelling tot managed platforms draai je het op je eigen infrastructuur, kies je je eigen modellen, en betaal je alleen voor de onderliggende services in plaats van een opslag per minuut.

Welk open source spraakagent-framework heeft de laagste latentie?

TEN Framework leidt op ruwe audio-pipelineprestaties dankzij de C++-kern, maar in de praktijk domineren netwerk- en modellatentie het totaal. Een goed afgestelde Pipecat- of LiveKit-stack op een snel model haalt routinematig 0.7 tot 1.1 seconden voice-to-voice, wat TEN in de meeste echte deployments evenaart.

Is open source daadwerkelijk goedkoper dan Vapi of Retell?

Niet altijd. Open source haalt de opslag per minuut van het platform weg, maar je neemt engineering-, hosting- en onderhoudskosten op je. Onder een paar duizend gespreksminuten per maand is een managed platform meestal goedkoper zodra je developer-tijd meerekent. Voorbij tienduizenden minuten trekt een zelf gehost framework de kop.

Kunnen deze frameworks echte telefoongesprekken beantwoorden?

Ja. Pipecat verbindt via Twilio, Daily of Telnyx; LiveKit Agents levert native SIP en telefoonnummers; Bolna heeft Twilio, Plivo en Exotel ingebouwd; en Vocode ondersteunt Twilio en Vonage. FastRTC is browsergericht en heeft een externe bridge zoals Jambonz nodig voor het telefoonnetwerk.

Heb ik machine-learning-expertise nodig om ze te gebruiken?

Nee. Je hebt software-engineeringvaardigheden nodig, vooral Python. Het zware werk (transcriptie, redeneren, spraaksynthese) wordt afgehandeld door de modellen die je via een API aansluit. Je orchestreert services, je traint geen modellen, tenzij je er bewust voor kiest om open-weight modellen zelf te hosten.

Welk framework is het beste voor een beginner?

Pipecat, omdat het pipelinemodel het makkelijkst te doorgronden is en de documentatie en voorbeelden het meest compleet zijn. FastRTC is een goede tweede keuze als je nog kleiner wilt beginnen en de ruwe transportlaag wilt begrijpen voordat je een volledig framework adopteert.

Zijn open source spraakframeworks productieklaar in 2026?

De top drie wel. Pipecat bereikte v1.0, LiveKit Agents zit op de 1.5.x-lijn, en TEN Framework draait commerciële deployments via Agora. Het grootste risico zit niet in de frameworks zelf, maar in de onderhoudsstatus van kleinere projecten, en dat is precies waarom we Vocode's stilgevallen kern hebben gesignaleerd.

Hoe verschilt dit van een TTS-API zoals ElevenLabs?

Een TTS-API zet alleen tekst om in spraak, dat is één component. Een spraakagent-framework orchestreert de hele lus: het luistert, transcribeert, stuurt tekst naar een taalmodel, krijgt een antwoord en spreekt dat weer uit, terwijl het onderbrekingen en beurtwisseling beheert. Het framework roept de TTS-API aan, niet andersom.

Over de auteur

Mert Batur is medeoprichter van Techsy.io, waar het team AI-agents, automatiseringssystemen en voice/SDR-pipelines bouwt voor B2B-klanten. Hij schrijft over de LLM-toolingstack die het Techsy-team daadwerkelijk in productie gebruikt. Connect via LinkedIn.

Tags

open-source-spraakagent-frameworkspipecatlivekit-agentsten-frameworkspraak-ai

Dit artikel delen

Start je project

Klaar om iets buitengewoons te bouwen?

Laten we je idee werkelijkheid maken. Ons team staat klaar om software te bouwen die het verschil maakt.