ai-machine-learning

Die 6 besten Open-Source-Sprachagent-Frameworks 2026 (im Ranking)

Geschrieben von Mert Batur
Jul 15, 2026
12 Lesezeit
Die 6 besten Open-Source-Sprachagent-Frameworks 2026 (im Ranking)

Im letzten Quartal haben wir drei telefonbasierte Sprachagenten mit Pipecat ausgeliefert und einen davon auf LiveKit Agents umgebaut, als der Kunde von 20 auf 400 gleichzeitige Anrufe sprang. Beide sind Open-Source-Sprachagent-Frameworks. Keines ist „das beste". Sie eignen sich für unterschiedliche Aufgaben, und die falsche Wahl kostet Sie Wochen.

Dieses Ranking basiert darauf, was in der Praxis wirklich funktioniert, nicht darauf, was sich in einem README gut liest. Wir haben am 14. Juli 2026 die aktuellen GitHub-Zahlen abgerufen: Pipecat liegt bei 13,416 Stars, LiveKit Agents bei 11,356 und TEN Framework bei 10,898. Stars allein erzählen nicht die ganze Geschichte, daher haben wir auch Commit-Aktivität, Telefonie-Support, Lizenzbedingungen und das Verhalten unter echtem Anrufvolumen gewichtet.

Kurzantwort: Für die meisten Teams ist Pipecat 2026 das stärkste Open-Source-Sprachagent-Framework, dank seiner umfangreichen Integrationsbibliothek und der fast täglichen Weiterentwicklung. LiveKit Agents gewinnt bei Skalierung und nativer Telefonie, TEN Framework bei multimodaler Graph-Orchestrierung und Bolna, wenn ein Telefonagent an einem Nachmittag live gehen soll.

Wenn Sie lieber ein fertiges Produkt kaufen, statt selbst etwas zusammenzustellen, sind unsere Vergleiche von Managed-Plattformen wie ElevenLabs, Vapi und Synthflow und Retell AI vs. Vapi vs. Bland der bessere Einstieg. Neu in diesem Bereich? Beginnen Sie mit was ein KI-Sprachagent eigentlich ist.

Wie wir diese Frameworks bewertet haben

Wir haben jedes Framework anhand von fünf Kriterien bewertet, die über Erfolg oder Misserfolg eines echten Projekts entscheiden: wie aktiv die Entwicklung ist (Commits in den letzten 90 Tagen), die Breite der STT-/LLM-/TTS-Integrationen, den Telefonie-Support (kann es eine echte Telefonnummer bedienen), die Lizenzbedingungen und das Verhalten unter gleichzeitiger Last. Hier die Kurzübersicht.

RangFrameworkStars (Jul 2026)LizenzSpracheTelefonieAm besten für
1Pipecat13,416BSD-2-ClausePythonTwilio, Daily, TelnyxAllround-Produktions-Builds
2LiveKit Agents11,356Apache-2.0Python, NodeNative SIP + phone numbersSkalierung und Echtzeit
3TEN Framework10,898Apache-2.0 (hybrid)C, Go, Python, JSVia Agora RTCMultimodal und Edge
4Bolna695MITPythonTwilio, Plivo, Exotel, SIPSchnelle Telefonagenten
5FastRTC4,618MITPythonWebRTC (bring your own)Prototypen und Demos
6Vocode3,773MITPythonTwilio, VonageReferenz, mit Einschränkungen

1. Pipecat — die beste Allround-Wahl

Pipecat, entwickelt vom Team hinter Daily, ist ein Python-Framework, das ein Gespräch als Pipeline modelliert: Audio kommt herein, durchläuft Speech-to-Text, ein Sprachmodell und Text-to-Speech, und Audio geht wieder hinaus. Dieses Denkmodell lässt sich leicht nachvollziehen, und im April 2026 erreichte Pipecat die stabile Version v1.0.

Was Pipecat auszeichnet, ist die Integrationsbibliothek. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs und Dutzende weitere sind bereits angebunden, sodass ein Wechsel des TTS-Anbieters eine einzige Codezeile statt einer Neuentwicklung erfordert. Telefonie läuft über Twilio, Daily oder Telnyx. Mit 13,416 Stars und Commits, die fast täglich eintreffen, hat es zudem die meiste Dynamik in dieser Liste.

Der Kompromiss: Da Pipecat Ihnen die Bausteine liefert und keinen fertigen Agenten, liegt die Orchestrierungslogik bei Ihnen. Es gibt keinen Drag-and-Drop-Builder. Sie schreiben Python. Für ein Team, das ohnehin programmiert, ist das kein Nachteil, sondern ein Vorteil.

Wählen Sie das, wenn: Sie eine anbieterneutrale, produktionsreife Basis mit der breitesten Modellunterstützung wollen und Python-Code kein Problem für Sie ist. Das ist unser Standard-Ausgangspunkt für die meisten Kundenprojekte.

2. LiveKit Agents — für Skalierung und Echtzeit gebaut

LiveKit Agents verfolgt einen anderen Ansatz. Statt einer linearen Pipeline tritt Ihr Agent als Teilnehmer über WebRTC einem Raum bei, derselben Technologie, auf der auch Zoom-artige Anrufe laufen. Genau diese Architektur macht LiveKit Agents stark, wenn Sie niedrige Latenz und viele gleichzeitige Gespräche brauchen.

Die große 2026er-Neuerung ist die Telefonie. LiveKit hat natives SIP und eigene Telefonnummern ausgeliefert, sodass ein- und ausgehende Anrufe keine Twilio-Bridge mehr in der Mitte brauchen. Außerdem gibt es nativen Support für die OpenAI Realtime API sowie, ab der 1.5.x-Linie, native Model-Context-Protocol-Tools und adaptives Interruption-Handling. Details finden Sie in der LiveKit-Agents-Dokumentation. Wenn Sie die zugrunde liegende Realtime API verstehen möchten, behandeln wir OpenAIs Realtime API für Sprachagenten in einem eigenen Beitrag.

Da es auf LiveKits Open-Source-WebRTC-Medienserver läuft, können Sie den gesamten Stack selbst hosten. Die Lernkurve ist steiler als bei Pipecat, und das Denken in Räumen und Teilnehmern braucht etwas Zeit, bis es sich einprägt.

Wählen Sie das, wenn: Sie echte Nebenläufigkeit erwarten, native Telefonie ohne Bridge wollen oder einen OpenAI-Realtime-Agenten aufbauen, der Lastspitzen standhalten muss.

3. TEN Framework — multimodal und graphbasiert

TEN Framework (Transformative Extensions Network), unterstützt von Agora, beschreibt Ihren Agenten als Graph aus Knoten: STT, LLM, Tools, Memory, Vision. Sie setzen den Graph in einem Workflow-Builder zusammen, und TEN führt ihn aus. Das macht es zur flexibelsten Option in dieser Liste für alles, was über reine Sprache hinausgeht, und sein C++-Kern ist auf latenzarmes Audio getrimmt.

Zudem unterstützt es die meisten Programmiersprachen aller Frameworks in dieser Liste, mit Extensions in C, Go, Python, JavaScript und TypeScript sowie fertigen Connectoren für Dify und Coze. Die Agora-TEN-Framework-Seite bietet den klarsten Überblick über die Möglichkeiten.

Zwei Einschränkungen. Erstens ist die Lizenz eine Hybridlösung: Der Großteil des Frameworks steht unter Apache-2.0, allerdings mit zusätzlichen Einschränkungen für bestimmte Ordner. Lesen Sie deshalb die LICENSE-Datei, bevor Sie kommerziell ausliefern. Zweitens läuft der Echtzeit-Transport über Agoras Netzwerk, was eine Agora App-ID und, jenseits der kostenlosen Stufe, Nutzungskosten bei Agora bedeutet.

Wählen Sie das, wenn: Sie einen multimodalen Agenten bauen (Sprache plus Vision oder Avatare), Wert auf graphbasierte Komposition legen oder die bestmögliche Low-Level-Audio-Performance im Open-Source-Bereich wollen.

4. Bolna — der schnellste Weg zum Telefonagenten

Bolna ist kleiner (695 Stars) und meinungsstärker als die Top drei, und genau das ist seine Stärke. Es ist telefonie-first gedacht. Wo andere Frameworks Sie die Anrufabwicklung selbst zusammenbauen lassen, liefert Bolna sie direkt mit: Twilio für globale Anrufe, Plivo und Exotel für Indien sowie individuelle SIP-Trunks, alles konfiguriert in einer JSON-artigen Agentendefinition statt in Code.

Dieses konfigurationsgetriebene Setup bedeutet, dass Sie einen eingehenden oder ausgehenden Telefonagenten schneller live bekommen als mit fast jedem anderen Framework hier. Unter der Haube orchestriert Bolna ASR-, LLM- und TTS-Anbieter über Websockets, sodass Sie weiterhin Ihre eigenen Modelle wählen. Die Entwicklung blieb bis Mitte 2026 aktiv.

Der Preis für dieses Tempo ist eine kleinere Community und weniger Integrationen als bei Pipecat oder LiveKit. Stoßen Sie auf einen Grenzfall, sind Sie mit höherer Wahrscheinlichkeit die erste Person, die das Issue meldet. Für telefonielastige Builds sollten Sie es gegen die Optionen in unserem Telefonie-Vergleich für Sprachagenten abwägen.

Wählen Sie das, wenn: Ihr Anwendungsfall in erster Linie Telefonanrufe sind (Terminerinnerungen, ausgehende Qualifizierung, eingehender Support) und Sie sich die gesamte Telefonie-Verkabelung sparen wollen.

5. FastRTC — die leichtgewichtige Prototyping-Option

FastRTC vom Hugging-Face- und Gradio-Team ist kein vollständiges Agenten-Framework, und genau das ist der Punkt. Es handelt sich um eine Python-Bibliothek für Echtzeit-Audio und -Video über WebRTC oder Websockets. Sie bringen Ihr eigenes STT, LLM und TTS mit, und FastRTC übernimmt den Streaming-Transport mit nur wenigen Zeilen Code.

Für einen Proof of Concept, eine Demo oder einen Forschungs-Spike ist dieser Minimalismus ein Geschenk. Sie können an einem Nachmittag einen sprechenden Prototypen aufbauen, ohne sich auf die Konventionen eines schwergewichtigen Frameworks festzulegen. Es passt natürlich zum Hugging-Face-Ökosystem, sodass sich offene Modelle leicht einbinden lassen.

Die Kehrseite: Sie sind für alles verantwortlich, was ein Framework Ihnen sonst abnehmen würde: Turn-Detection, Interruption-Handling, Telefonie, State-Management. Es skaliert wunderbar nach unten und schmerzhaft nach oben.

Wählen Sie das, wenn: Sie prototypen, unterrichten oder eine Browser-Demo bauen und maximale Kontrolle bei minimalem Framework-Overhead wollen.

6. Vocode — historisch wichtig, aber mit Wartungs-Vorbehalt

Vocode hat diese ganze Kategorie mitgeprägt. Sein modulares STT/LLM/TTS-Design und die eingebaute Twilio- und Vonage-Telefonie machten es zu einem der ersten wirklich brauchbaren Open-Source-Sprach-Frameworks, und mit 3,773 Stars taucht es noch immer in vielen Tutorials auf.

Und hier kommt der ehrliche Teil, der auch erklärt, warum es auf dem letzten Platz landet: Der Open-Source-Kern ist ruhig geworden. Der letzte Commit zu vocode-core stammt aus November 2024, und das Repository verzeichnet gerade einmal zwei offene Issues, ein Muster, das meist bedeutet, dass die Aufmerksamkeit zum gehosteten Produkt des Unternehmens gewandert ist, statt auf einem gesunden Backlog zu ruhen. Der Code läuft noch, und das Design lohnt das Studium, aber Sie würden auf einem Fundament aufbauen, das niemand mehr aktiv pflegt.

Wählen Sie das, wenn: Sie Sprachagenten-Architektur studieren, ein bestehendes Vocode-Projekt pflegen oder gezielt seine Design-Patterns wollen und akzeptieren, dass Sie die Basis selbst warten müssen.

Ebenfalls einen Blick wert

Ein paar Tools liegen knapp außerhalb des Rankings, gehören aber trotzdem auf Ihren Radar:

  • OpenAI Agents SDK (27,900+ Stars) bringt eine Voice-Pipeline-Extension mit. Es ist eher ein universelles Agenten-SDK als ein Voice-First-Tool, aber eine sinnvolle Wahl, wenn Sie ohnehin schon darauf standardisiert sind.
  • Gabber ist ein neueres multimodales Framework für Agenten, die sehen, hören und sprechen, ausgelegt auf Screen-und-Kamera-Anwendungsfälle.
  • Jambonz ist ein Open-Source-Telefonie-Backbone. Es baut nicht das Agenten-Gehirn, ist aber eine carrier-taugliche Möglichkeit, jedes Framework mit echten Telefonnetzen zu verbinden.
  • Rasa (21,000+ Stars) bleibt das Schwergewicht für Enterprise-Dialoge und NLU über Text und Sprache hinweg, auch wenn der Betrieb aufwendiger ist als bei allem oben.
  • Ultravox ist ein schnelles Speech-Language-Model, kein Orchestrierungs-Framework, behandeln Sie es also eher als steckbare Komponente denn als Konkurrenten.

Was wir für ein Kundenprojekt tatsächlich einsetzen würden

Bei Techsy bauen wir Sprachagenten für B2B-Kunden, deshalb hier die wenig glamouröse Realität hinter diesem Ranking.

Unser Standard-Stack ist Pipecat mit Deepgram Nova-3 für Speech-to-Text, GPT-4o-mini als Sprachmodell und Cartesia Sonic für Text-to-Speech. Sobald die Turn-Detection eingestellt ist, liegt die Voice-to-Voice-Latenz meist zwischen 0.7 und 1.1 Sekunden, nah genug an menschlicher Gesprächsgeschwindigkeit, dass Anrufer es nicht mehr bemerken. Tauschen Sie eine dieser Komponenten gegen ein langsameres Modell, spüren Sie es sofort.

Bei der Telefonie wird es unübersichtlich. Wir haben zwei Muster im Produktivbetrieb gefahren: einen Twilio-SIP-Trunk, gebrückt in LiveKits natives SIP für eingehenden Support mit hohem Volumen, und Bolnas eingebaute Plivo-Anbindung, wenn ein Kunde nur ausgehende Erinnerungsanrufe brauchte. Der LiveKit-Weg kostet vorab mehr Entwicklungsstunden, hält aber stand, wenn 300 Anrufe in derselben Minute eintreffen. Mit Bolna sind Sie bis Freitag live.

Bei der Selbsthosting-Rechnung tappen viele in die Falle. Lokales STT und TTS auf einer einzelnen A10G-GPU kostet ungefähr $0.50 bis $0.90 pro Stunde, unabhängig davon, ob überhaupt ein Anruf eingeht. Pay-per-Minute-APIs wie Deepgram und Cartesia kosten im Leerlauf nichts, summieren sich aber schnell, sobald Sie über ein paar tausend Minuten im Monat kommen. Unterhalb von etwa 15,000 Minuten im Monat gewinnen die APIs fast immer, und das empfehlen wir auch den meisten Kunden. Zu LiveKit statt Pipecat greifen wir vor allem, wenn die Nebenläufigkeit ein paar hundert gleichzeitige Anrufe übersteigt.

Wenn die Build-versus-Buy-Frage bei Ihnen noch offen ist, gehen wir die vollständige Kostenaufschlüsselung in unserem Leitfaden KI-Sprachagent selbst bauen oder kaufen durch. Und wenn Sie lieber ein Team Latenz, Telefonie und Skalierung für Sie verkabeln lassen möchten, genau das machen wir bei Techsys Sprachagenten-Praxis.

So entscheiden Sie in einer Minute

Sparen Sie sich die Analyse-Paralyse. Hier die Entscheidung in Stichpunkten:

  • Sie wollen die sicherste Allround-Standardwahl: Pipecat.
  • Sie brauchen echte Nebenläufigkeit oder native Telefonie: LiveKit Agents.
  • Sie gehen multimodal (Sprache plus Vision oder Avatare): TEN Framework.
  • Sie brauchen diese Woche einen Telefonagenten live: Bolna.
  • Sie prototypen oder unterrichten: FastRTC.
  • Sie kaufen lieber, statt selbst zu bauen: eine Managed-Plattform wie Vapi, Retell oder Synthflow, gar kein Framework.

Häufig gestellte Fragen

Was ist ein Open-Source-Sprachagent-Framework?

Es handelt sich um eine selbst hostbare Codebasis, die Speech-to-Text, ein Sprachmodell und Text-to-Speech miteinander verbindet, damit Software ein gesprochenes Gespräch führen kann. Anders als bei Managed-Plattformen betreiben Sie es auf eigener Infrastruktur, wählen Ihre eigenen Modelle und zahlen nur für die zugrunde liegenden Dienste statt für einen Aufschlag pro Minute.

Welches Open-Source-Sprachagent-Framework hat die niedrigste Latenz?

TEN Framework führt bei der reinen Audio-Pipeline-Performance dank seines C++-Kerns, in der Praxis dominieren aber Netzwerk- und Modell-Latenz die Gesamtzeit. Ein gut abgestimmter Pipecat- oder LiveKit-Stack auf einem schnellen Modell erreicht regelmäßig 0.7 bis 1.1 Sekunden voice-to-voice, was in den meisten realen Deployments an TEN heranreicht.

Ist Open Source tatsächlich günstiger als Vapi oder Retell?

Nicht immer. Open Source entfernt den Aufschlag pro Minute der Plattform, dafür übernehmen Sie Engineering-, Hosting- und Wartungskosten. Unterhalb von einigen tausend Anrufminuten im Monat ist eine Managed-Plattform meist günstiger, sobald Sie die Entwicklerzeit einrechnen. Jenseits von einigen Zehntausend Minuten zieht das Selbsthosting eines Frameworks vorbei.

Können diese Frameworks echte Telefonanrufe entgegennehmen?

Ja. Pipecat verbindet sich über Twilio, Daily oder Telnyx; LiveKit Agents bringt natives SIP und Telefonnummern mit; Bolna hat Twilio, Plivo und Exotel eingebaut; und Vocode unterstützt Twilio und Vonage. FastRTC ist browserfokussiert und braucht für das Telefonnetz eine externe Bridge wie Jambonz.

Brauche ich Machine-Learning-Expertise, um sie zu nutzen?

Nein. Sie brauchen Software-Engineering-Fähigkeiten, meist in Python. Die eigentliche Arbeit (Transkription, Reasoning, Sprachsynthese) übernehmen die Modelle, die Sie per API einbinden. Sie orchestrieren Dienste, statt Modelle zu trainieren, es sei denn, Sie entscheiden sich bewusst dafür, offene Gewichte selbst zu hosten.

Welches Framework eignet sich am besten für Einsteiger?

Pipecat, weil sich sein Pipeline-Modell am leichtesten nachvollziehen lässt und Dokumentation sowie Beispiele am vollständigsten sind. FastRTC ist eine gute zweite Wahl, wenn Sie noch kleiner anfangen und die rohe Transportschicht verstehen wollen, bevor Sie ein vollständiges Framework einführen.

Sind Open-Source-Sprach-Frameworks 2026 produktionsreif?

Die Top drei sind es. Pipecat hat v1.0 erreicht, LiveKit Agents ist bei der 1.5.x-Linie, und TEN Framework treibt über Agora kommerzielle Deployments an. Das Hauptrisiko liegt nicht in den Frameworks selbst, sondern im Wartungsstatus kleinerer Projekte, weshalb wir auf Vocodes stillstehenden Kern hingewiesen haben.

Wie unterscheidet sich das von einer TTS-API wie ElevenLabs?

Eine TTS-API wandelt lediglich Text in Sprache um, das ist nur eine Komponente. Ein Sprachagent-Framework orchestriert die gesamte Schleife: Es hört zu, transkribiert, schickt Text an ein Sprachmodell, erhält eine Antwort und spricht sie zurück, während es Unterbrechungen und Sprecherwechsel steuert. Das Framework ruft die TTS-API auf, nicht umgekehrt.

Über den Autor

Mert Batur ist Co-Founder von Techsy.io, wo das Team KI-Agenten, Automatisierungssysteme und Voice/SDR-Pipelines für B2B-Kunden entwickelt. Er schreibt über den LLM-Tooling-Stack, den das Techsy-Team tatsächlich in der Produktion einsetzt. Kontakt über LinkedIn.

Tags

open-source-sprachagent-frameworkspipecatlivekit-agentsten-frameworksprach-ki

Diesen Artikel teilen

Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.