
De 6 bedste open source-frameworks til stemmeagenter i 2026 (rangeret)
I sidste kvartal sendte vi tre telefonbaserede stemmeagenter i produktion på Pipecat og genopbyggede så én på LiveKit Agents, da kunden gik fra 20 til 400 samtidige opkald. Begge er open source-frameworks til stemmeagenter. Ingen af dem er "den bedste". De er gode til forskellige opgaver, og vælger du forkert, koster det dig uger.
Denne rangering kommer fra det, der faktisk kommer i produktion, ikke det, der læser sig godt i en README. Vi trak live GitHub-tal den 14. juli 2026: Pipecat ligger på 13.416 stjerner, LiveKit Agents på 11.356 og TEN Framework på 10.898. Stjerner fortæller ikke hele historien, så vi vægtede også commit-aktivitet, telefonisupport, licensvilkår og hvordan hver klarer sig under reelt opkaldsvolumen.
Det korte svar: For de fleste teams i 2026 er Pipecat det stærkeste open source-framework til stemmeagenter på grund af dets store integrationsbibliotek og næsten daglige udvikling. LiveKit Agents vinder på skala og native telefoni, TEN Framework på multimodal graf-orkestrering og Bolna på at få en telefonagent live på en eftermiddag.
Vil du hellere købe et færdigt produkt end at samle et selv, er vores sammenligninger af administrerede platforme som ElevenLabs, Vapi og Synthflow og Retell AI vs Vapi vs Bland det bedre udgangspunkt. Ny i kategorien? Start med hvad en AI-stemmeagent egentlig er.
Sådan rangerede vi disse frameworks
Vi scorede hvert framework på fem ting, som et reelt projekt står eller falder på: hvor aktiv udviklingen er (commits de seneste 90 dage), bredden af STT/LLM/TTS-integrationer, telefonisupport (kan den besvare et rigtigt telefonnummer), licensvilkår og adfærd under samtidighed. Her er shortlisten ved første øjekast.
| Plads | Framework | Stjerner (jul. 2026) | Licens | Sprog | Telefoni | Bedst til |
|---|---|---|---|---|---|---|
| 1 | Pipecat | 13.416 | BSD-2-Clause | Python | Twilio, Daily, Telnyx | Alsidige produktionssystemer |
| 2 | LiveKit Agents | 11.356 | Apache-2.0 | Python, Node | Native SIP + telefonnumre | Skala og realtid |
| 3 | TEN Framework | 10.898 | Apache-2.0 (hybrid) | C, Go, Python, JS | Via Agora RTC | Multimodal og edge |
| 4 | Bolna | 695 | MIT | Python | Twilio, Plivo, Exotel, SIP | Hurtige telefonagenter |
| 5 | FastRTC | 4.618 | MIT | Python | WebRTC (medbring selv) | Prototyper og demoer |
| 6 | Vocode | 3.773 | MIT | Python | Twilio, Vonage | Reference, med forbehold |
1. Pipecat — det bedste alsidige valg
Pipecat, bygget af teamet bag Daily, er et Python-framework, der modellerer en samtale som en pipeline: lyd kommer ind, flyder gennem tale-til-tekst, en sprogmodel og tekst-til-tale, og lyd ryger tilbage ud. Den mentale model er let at forholde sig til, og den ramte en stabil v1.0 i april 2026.
Det, der adskiller det, er integrationsbiblioteket. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs og snesevis flere er allerede koblet på, så det at skifte TTS-leverandør er en én-linjes ændring i stedet for en omskrivning. Telefoni fungerer via Twilio, Daily eller Telnyx. Med 13.416 stjerner og commits, der lander næsten hver dag, har det også mest momentum af alt på denne liste.
Afvæjningen: fordi Pipecat giver dig byggestenene frem for en færdig agent, ejer du selv orkestreringslogikken. Der er ingen drag-and-drop-bygger. Du skriver Python. For et team, der allerede koder, er det en feature, ikke en bug.
Vælg dette, hvis: du vil have en leverandørneutral, produktionsklar base med den bredeste modelunderstøttelse og er tryg ved at skrive Python. Det er vores standard udgangspunkt for det meste kundearbejde.
2. LiveKit Agents — bygget til skala og realtid
LiveKit Agents tager en anden tilgang. I stedet for en lineær pipeline slutter din agent sig til et rum som deltager over WebRTC, den samme teknologi bag Zoom-lignende opkald. Den arkitektur er grunden til, at den skinner, når du har brug for lav latenstid og mange samtidige samtaler.
Den store historie i 2026 er telefoni. LiveKit sendte native SIP og telefonnumre, så indgående og udgående opkald ikke længere kræver en Twilio-bro siddende i midten. Den leverer også førstepartsunderstøttelse af OpenAI Realtime API og, fra 1.5.x-serien, native Model Context Protocol-værktøjer og adaptiv afbrydelseshåndtering. Du kan læse detaljerne i LiveKit Agents-dokumentationen. Vil du forstå det realtids-API, den wrapper, dækker vi OpenAIs Realtime API til stemmeagenter separat.
Fordi den kører på LiveKits open source WebRTC-medieserver, kan du selv hoste hele stacken. Læringskurven er stejlere end Pipecats, og rum-og-deltagere-tænkningen tager et øjeblik at falde på plads.
Vælg dette, hvis: du forventer reel samtidighed, vil have native telefoni uden en bro, eller du rejser en OpenAI Realtime-agent, der skal overleve trafikspidser.
3. TEN Framework — multimodal og graf-baseret
TEN Framework (Transformative Extensions Network), bakket op af Agora, beskriver din agent som en graf af noder: STT, LLM, værktøjer, hukommelse, syn. Du komponerer grafen i en workflow-bygger, og TEN eksekverer den. Det er den mest fleksible mulighed her til alt ud over ren stemme, og dens C++-kerne er tunet til lav latenstid på lyd.
Den taler også det bredeste udvalg af sprog af alle frameworks på denne liste, med udvidelser i C, Go, Python, JavaScript og TypeScript plus færdige stik til Dify og Coze. Agora TEN Framework-siden er det klareste overblik over, hvad den kan.
To forbehold. For det første er licensen en hybrid: det meste af frameworket er Apache-2.0, men med yderligere begrænsninger på visse mapper, så læs LICENSE, før du sender kommercielt. For det andet læner realtids-transporten sig op ad Agoras netværk, hvilket betyder et Agora App ID og, ud over det gratis niveau, Agora-brugsomkostninger.
Vælg dette, hvis: du bygger en multimodal agent (stemme plus syn eller avatarer), værdsætter graf-baseret komposition eller vil have den mest lavniveaus lydydelse, der findes i open source.
4. Bolna — den hurtigste vej til en telefonagent
Bolna er mindre (695 stjerner) og mere egenrådig end de tre øverste, og det er præcis dens styrke. Den er telefoni-først. Hvor andre frameworks får dig til at samle opkald, leverer Bolna det: Twilio til globale opkald, Plivo og Exotel til Indien og brugerdefinerede SIP-trunks, alt sammen konfigureret i en JSON-agt agentdefinition frem for kode.
Den konfigurationsstyrede opsætning betyder, at du kan have en indgående eller udgående telefonagent, der besvarer rigtige opkald, hurtigere end næsten alt andet her. Under hjelmen orkestrerer den ASR-, LLM- og TTS-udbydere over websockets, så du stadig vælger dine egne modeller. Udviklingen forblev aktiv gennem midten af 2026.
Prisen for den hastighed er et mindre fællesskab og færre integrationer end Pipecat eller LiveKit. Rammer du en edge case, er det mere sandsynligt, at du er den første til at oprette issue'et. Til telefoni-tunge systemer bør du veje den mod mulighederne i vores sammenligning af stemmeagent-telefoni.
Vælg denne, hvis: din use case er telefonopkald først (aftalepåmindelser, udgående kvalificering, indgående support) og du helt vil springe telefoni-blikkenslageriet over.
5. FastRTC — den lette prototyping-mulighed
FastRTC, fra Hugging Face- og Gradio-teamet, er ikke et fuld agent-framework, og det er pointen. Det er et Python-bibliotek til realtidslyd og -video over WebRTC eller websockets. Du medbringer selv din STT, LLM og TTS, og FastRTC håndterer streaming-transporten med kun et par linjer kode.
Til et proof of concept, en demo eller en research-spike er den minimalisme en gave. Du kan rejse en talende prototype på en eftermiddag uden at binde dig til et tungt frameworks konventioner. Den passer naturligt sammen med Hugging Face-økosystemet, så åbne modeller er lette at koble på.
Bagsiden er, at du selv er ansvarlig for alt, et framework ellers ville give dig: tur-detektion, afbrydelseshåndtering, telefoni, tilstandsstyring. Den skalerer smukt ned og smertefuldt op.
Vælg dette, hvis: du prototyper, underviser eller bygger en browserdemo og vil have maksimal kontrol med minimal framework-overhead.
6. Vocode — historisk vigtig, med en vedligeholdelsescaveat
Vocode var med til at definere hele denne kategori. Dens modulære STT/LLM/TTS-design og indbyggede Twilio- og Vonage-telefoni gjorde den til et af de første virkelig brugbare open source-stemmeframeworks, og med 3.773 stjerner dukker den stadig op i masser af tutorials.
Her er den ærlige del, og det er grunden til, at den rangerer sidst: open source-kernen er blevet stille. Det sidste commit til vocode-core landede i november 2024, og repositoriet ligger på blot to åbne issues, hvilket som regel signalerer, at opmærksomheden er flyttet til virksomhedens hostede produkt frem for en sund backlog. Koden kører stadig, og designet er værd at studere, men du ville bygge på et fundament, ingen aktivt patcher.
Vælg denne, hvis: du studerer stemmeagent-arkitektur, vedligeholder et eksisterende Vocode-projekt eller specifikt vil have dens designmønstre og accepterer, at du selv vedligeholder basen.
Også værd at kende
Et par værktøjer ligger lige uden for rangeringen, men hører hjemme på din radar:
- OpenAI Agents SDK (27.900+ stjerner) leverer en stemme-pipeline-udvidelse. Det er en generel agent-SDK frem for stemme-først, men det er et fornuftigt valg, hvis du allerede er standardiseret på den.
- Gabber er et nyere multimodalt framework til agenter, der ser, hører og taler, rettet mod skærm- og kamera-use cases.
- Jambonz er en open source-telefoni-rygrad. Den bygger ikke agenthjernen, men det er en carrier-grade måde at forbinde ethvert framework til rigtige telefonnetværk.
- Rasa (21.000+ stjerner) er stadig sværvægteren til enterprise-dialog og NLU på tværs af tekst og stemme, selvom den er mere involveret at køre end alt ovenstående.
- Ultravox er en hurtig tale-sprogmodel, ikke et orkestreringsframework, så behandl den som en plugbar komponent frem for en konkurrent.
Hvad vi faktisk ville bruge til et kundeprojekt
Hos Techsy bygger vi stemmeagenter til B2B-kunder, så her er den uglamorøse virkelighed bag rangeringen.
Vores standard stack er Pipecat, der kobler Deepgram Nova-3 til tale-til-tekst, GPT-4o-mini til sprogmodellen og Cartesia Sonic til tekst-til-tale. Når tur-detektionen er tunet, lander stemme-til-stemme-latensen typisk mellem 0,7 og 1,1 sekunder, hvilket er tæt nok på menneskelig samtale til, at opkaldere holder op med at lægge mærke til det. Skub én af disse komponenter til en langsommere model, og du mærker det med det samme.
Telefoni er dér, hvor projekter bliver rodede. Vi har kørt to mønstre i produktion: en Twilio SIP-trunk broet ind i LiveKits native SIP til højvolumen indgående support, og Bolnas indbyggede Plivo-håndtering, når en kunde bare havde brug for udgående påmindelsesopkald. LiveKit-ruten koster flere ingeniørtimer foran, men den holder stabilt, når 300 opkald ankommer i samme minut. Bolna får dig live inden fredag.
Selv-hosting-matematikken får folk til at snuble. At køre lokal STT og TTS på en enkelt A10G GPU koster nogenlunde $0,50 til $0,90 i timen, uanset om der kommer ét eneste opkald eller ej. Pay-per-minute API'er som Deepgram og Cartesia koster intet i tomgang, men løber hurtigt op ud over et par tusinde minutter om måneden. Under omkring 15.000 minutter månedligt vinder API'erne næsten altid, og det er, hvad vi anbefaler til de fleste kunder. Vi rækker efter LiveKit frem for Pipecat hovedsageligt, når samtidigheden krydser et par hundrede samtidige opkald.
Hvis build-versus-buy-spørgsmålet stadig er åbent hos dig, gennemgår vi den fulde omkostningsfordeling i vores build vs buy en AI-stemmeagent-guide. Og vil du hellere have et team til at koble latens, telefoni og skalering for dig, er det præcis det, vi gør hos Techsys stemmeagent-praksis.
Sådan vælger du på ét minut
Spring analyseparalysen over. Her er beslutningen i punktopstilling:
- Du vil have den sikreste alsidige standard: Pipecat.
- Du har brug for reel samtidighed eller native telefoni: LiveKit Agents.
- Du går multimodalt (stemme plus syn eller avatarer): TEN Framework.
- Du har brug for en telefonagent live i denne uge: Bolna.
- Du prototyper eller underviser: FastRTC.
- Du vil hellere købe end bygge: en administreret platform som Vapi, Retell eller Synthflow, slet ikke et framework.
Ofte stillede spørgsmål
Hvad er et open source-framework til stemmeagenter?
Det er en selv-hostbar kodebase, der kobler tale-til-tekst, en sprogmodel og tekst-til-tale sammen, så software kan føre en talt samtale. I modsætning til administrerede platforme kører du den på din egen infrastruktur, vælger dine egne modeller og betaler kun for de underliggende tjenester frem for et pr.-minut-tillæg.
Hvilket open source-framework til stemmeagenter har den laveste latenstid?
TEN Framework fører på rå lyd-pipeline-ydelse takket være dens C++-kerne, men i praksis dominerer netværks- og modellatenstid totalen. En veltunet Pipecat- eller LiveKit-stack på en hurtig model rammer rutinemæssigt 0,7 til 1,1 sekunder stemme-til-stemme, hvilket matcher TEN i de fleste reelle deploymenter.
Er open source faktisk billigere end Vapi eller Retell?
Ikke altid. Open source fjerner platformens pr.-minut-tillæg, men du påtager dig ingeniør-, hosting- og vedligeholdelsesomkostninger. Under et par tusinde opkaldsminutter om måneden er en administreret platform som regel billigere, når du medregner udviklertid. Ud over titusinder af minutter trækker selv-hosting af et framework foran.
Kan disse frameworks besvare rigtige telefonopkald?
Ja. Pipecat forbinder via Twilio, Daily eller Telnyx; LiveKit Agents leverer native SIP og telefonnumre; Bolna har Twilio, Plivo og Exotel indbygget; og Vocode understøtter Twilio og Vonage. FastRTC er browserfokuseret og har brug for en ekstern bro som Jambonz til telefonnetværket.
Har jeg brug for machine learning-ekspertise for at bruge dem?
Nej. Du har brug for software engineering-færdigheder, primært Python. Det tunge arbejde (transskription, ræsonnement, talesyntese) håndteres af de modeller, du kobler på via et API. Du orkestrerer tjenester, ikke træner modeller, medmindre du bevidst vælger at selv-hoste åbne vægte.
Hvilket framework er bedst for en begynder?
Pipecat, fordi dens pipeline-model er den letteste at forholde sig til, og dens dokumentation og eksempler er de mest komplette. FastRTC er et godt andet valg, hvis du vil starte endnu mindre og forstå det rå transportlag, før du adopterer et fuld framework.
Er open source-stemmeframeworks produktionsklare i 2026?
De tre øverste er. Pipecat nåede v1.0, LiveKit Agents er på sin 1.5.x-serie, og TEN Framework driver kommercielle deploymenter via Agora. Den største risiko er ikke selve frameworkene, men vedligeholdelsesstatussen for mindre projekter, hvilket er grunden til, at vi flaggede Vocodes stalled kerne.
Hvordan adskiller det sig fra et TTS-API som ElevenLabs?
Et TTS-API omdanner kun tekst til tale, hvilket er én komponent. Et stemmeagent-framework orkestrerer hele løkken: det lytter, transskriberer, sender tekst til en sprogmodel, får et svar og taler det tilbage, mens det håndterer afbrydelser og tur-tagning. Frameworket kalder TTS-API'et, ikke omvendt.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet sender AI-agenter, automatiseringssystemer og stemme-/SDR-pipelines til B2B-kunder. Han studerer på University of Birmingham og skriver om det LLM-værktøjs-stack, Techsy-teamet faktisk bruger i produktion. Forbind på LinkedIn.