ai-machine-learning

Les 6 meilleurs frameworks d'agents vocaux open source en 2026 (classement)

Écrit par Mert Batur
Jul 15, 2026
14 lecture
Les 6 meilleurs frameworks d'agents vocaux open source en 2026 (classement)

Le trimestre dernier, nous avons déployé trois agents vocaux téléphoniques sur Pipecat, puis reconstruit l'un d'eux sur LiveKit Agents quand le client est passé de 20 à 400 appels simultanés. Les deux sont des frameworks d'agents vocaux open source. Aucun n'est « le meilleur ». Ils excellent chacun dans un rôle différent, et se tromper de choix coûte des semaines.

Ce classement repose sur ce qui tourne vraiment en production, pas sur ce qui se lit bien dans un README. Nous avons relevé les chiffres GitHub en direct le 14 juillet 2026 : Pipecat affiche 13,416 étoiles, LiveKit Agents 11,356, et TEN Framework 10,898. Les étoiles ne racontent pas toute l'histoire, nous avons donc aussi pesé l'activité des commits, la prise en charge de la téléphonie, les conditions de licence et le comportement de chaque framework sous une charge d'appels réelle.

Réponse rapide : pour la plupart des équipes en 2026, Pipecat est le framework d'agent vocal open source le plus solide grâce à sa vaste bibliothèque d'intégrations et son rythme de développement quasi quotidien. LiveKit Agents l'emporte sur la montée en charge et la téléphonie native, TEN Framework sur l'orchestration multimodale en graphe, et Bolna sur la mise en ligne d'un agent téléphonique en une après-midi.

Si vous préférez acheter un produit clé en main plutôt que d'en assembler un, nos comparatifs des plateformes managées comme ElevenLabs, Vapi et Synthflow et Retell AI vs Vapi vs Bland sont un meilleur point de départ. Nouveau dans la catégorie ? Commencez par ce qu'est vraiment un agent vocal IA.

Comment nous avons classé ces frameworks

Nous avons noté chaque framework sur cinq critères qui font vraiment la différence sur un projet réel : le niveau d'activité du développement (commits sur les 90 derniers jours), l'étendue des intégrations STT/LLM/TTS, la prise en charge de la téléphonie (peut-il répondre à un vrai numéro de téléphone ?), les conditions de licence, et le comportement sous forte concurrence. Voici la sélection en un coup d'œil.

RangFrameworkÉtoiles (juil. 2026)LicenceLangageTéléphonieIdéal pour
1Pipecat13,416BSD-2-ClausePythonTwilio, Daily, TelnyxBuilds de production polyvalents
2LiveKit Agents11,356Apache-2.0Python, NodeNative SIP + phone numbersMontée en charge et temps réel
3TEN Framework10,898Apache-2.0 (hybrid)C, Go, Python, JSVia Agora RTCMultimodal et edge
4Bolna695MITPythonTwilio, Plivo, Exotel, SIPAgents téléphoniques rapides
5FastRTC4,618MITPythonWebRTC (bring your own)Prototypes et démos
6Vocode3,773MITPythonTwilio, VonageRéférence, avec réserves

1. Pipecat : le meilleur choix polyvalent

Pipecat, conçu par l'équipe derrière Daily, est un framework Python qui modélise une conversation comme un pipeline : l'audio entre, traverse la reconnaissance vocale, un modèle de langage, puis la synthèse vocale, et l'audio ressort. Ce modèle mental est simple à appréhender, et le framework a atteint une version stable v1.0 en avril 2026.

Ce qui le distingue, c'est sa bibliothèque d'intégrations. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs et des dizaines d'autres sont déjà connectés, si bien que changer de fournisseur TTS se résume à une ligne de code plutôt qu'à une réécriture complète. La téléphonie passe par Twilio, Daily ou Telnyx. Avec 13,416 étoiles et des commits publiés presque tous les jours, c'est aussi le projet le plus dynamique de cette liste.

Le compromis : Pipecat vous fournit les briques plutôt qu'un agent clé en main, donc c'est vous qui gérez la logique d'orchestration. Pas de constructeur glisser-déposer. Vous écrivez du Python. Pour une équipe qui code déjà, ce n'est pas un défaut, c'est un atout.

À choisir si : vous voulez une base neutre vis-à-vis des fournisseurs, prête pour la production, avec le plus large support de modèles, et que vous êtes à l'aise en Python. C'est notre point de départ par défaut pour la plupart des projets clients.

2. LiveKit Agents : conçu pour la montée en charge et le temps réel

LiveKit Agents adopte une approche différente. Plutôt qu'un pipeline linéaire, votre agent rejoint une salle en tant que participant via WebRTC, la même technologie qui fait fonctionner les appels de type Zoom. Cette architecture explique pourquoi il excelle dès qu'il faut une faible latence et de nombreuses conversations simultanées.

La grande nouveauté de 2026, c'est la téléphonie. LiveKit a lancé le SIP natif et les numéros de téléphone, si bien que les appels entrants et sortants n'ont plus besoin d'un pont Twilio au milieu. Le framework offre aussi un support natif de l'API Realtime d'OpenAI et, depuis la version 1.5.x, des outils Model Context Protocol natifs ainsi qu'une gestion adaptative des interruptions. Vous trouverez les détails dans la documentation de LiveKit Agents. Pour comprendre l'API temps réel qu'il encapsule, nous en parlons séparément dans notre article sur l'API Realtime d'OpenAI pour les agents vocaux.

Comme il s'appuie sur le serveur média WebRTC open source de LiveKit, vous pouvez auto-héberger toute la stack. La courbe d'apprentissage est plus raide que celle de Pipecat, et il faut un temps d'adaptation pour penser en termes de salles et de participants.

À choisir si : vous anticipez une vraie charge concurrente, voulez une téléphonie native sans pont intermédiaire, ou vous déployez un agent OpenAI Realtime qui doit encaisser des pics de trafic.

3. TEN Framework : multimodal et basé sur les graphes

TEN Framework (Transformative Extensions Network), soutenu par Agora, décrit votre agent comme un graphe de nœuds : STT, LLM, outils, mémoire, vision. Vous composez ce graphe dans un constructeur de workflow, et TEN l'exécute. C'est l'option la plus flexible de cette liste dès que l'on sort de la voix pure, et son cœur en C++ est optimisé pour un audio à faible latence.

C'est aussi celui qui prend en charge le plus grand nombre de langages de cette liste, avec des extensions en C, Go, Python, JavaScript et TypeScript, ainsi que des connecteurs prêts à l'emploi pour Dify et Coze. La page TEN Framework d'Agora donne la vue d'ensemble la plus claire de ce qu'il permet de faire.

Deux réserves. D'abord, la licence est hybride : la majeure partie du framework est en Apache-2.0, mais avec des restrictions supplémentaires sur certains dossiers, donc lisez le fichier LICENSE avant tout déploiement commercial. Ensuite, le transport temps réel repose sur le réseau d'Agora, ce qui implique un App ID Agora et, au-delà du palier gratuit, des coûts d'usage Agora.

À choisir si : vous construisez un agent multimodal (voix plus vision ou avatars), vous appréciez la composition par graphe, ou vous voulez la meilleure performance audio bas niveau disponible en open source.

4. Bolna : le chemin le plus rapide vers un agent téléphonique

Bolna est plus modeste (695 étoiles) et plus tranché que les trois premiers, et c'est justement sa force. C'est un framework téléphonie d'abord. Là où les autres frameworks vous laissent assembler la téléphonie vous-même, Bolna la fournit clé en main : Twilio pour les appels mondiaux, Plivo et Exotel pour l'Inde, et des trunks SIP personnalisés, le tout configuré dans une définition d'agent au format JSON plutôt qu'en code.

Cette approche pilotée par la configuration signifie que vous pouvez avoir un agent téléphonique entrant ou sortant qui répond à de vrais appels plus vite que presque tout le reste de cette liste. Sous le capot, il orchestre des fournisseurs ASR, LLM et TTS via websockets, donc vous choisissez toujours vos propres modèles. Le développement est resté actif jusqu'à mi-2026.

Le prix de cette rapidité, c'est une communauté plus petite et moins d'intégrations que Pipecat ou LiveKit. Si vous tombez sur un cas limite, il y a de bonnes chances que vous soyez le premier à ouvrir l'issue. Pour des projets à forte composante téléphonique, comparez-le aux options de notre comparatif de téléphonie pour agents vocaux.

À choisir si : votre cas d'usage est d'abord téléphonique (rappels de rendez-vous, qualification sortante, support entrant) et que vous voulez éviter toute la plomberie téléphonique.

5. FastRTC : l'option légère pour le prototypage

FastRTC, signé par l'équipe Hugging Face et Gradio, n'est pas un framework d'agent complet, et c'est justement l'idée. C'est une bibliothèque Python pour l'audio et la vidéo en temps réel via WebRTC ou websockets. Vous apportez votre propre STT, LLM et TTS, et FastRTC gère le transport en streaming en quelques lignes de code seulement.

Pour une preuve de concept, une démo ou une exploration technique, ce minimalisme est un cadeau. Vous pouvez monter un prototype parlant en une après-midi sans vous engager dans les conventions d'un framework lourd. Il s'intègre naturellement à l'écosystème Hugging Face, donc les modèles ouverts se branchent facilement.

Le revers de la médaille, c'est que vous êtes responsable de tout ce qu'un framework vous offrirait autrement : détection de tour de parole, gestion des interruptions, téléphonie, gestion d'état. Il descend en échelle avec grâce et monte en échelle avec douleur.

À choisir si : vous prototypez, enseignez, ou construisez une démo dans le navigateur, et que vous voulez un contrôle maximal avec le minimum de surcharge liée au framework.

6. Vocode : historiquement important, avec une réserve sur la maintenance

Vocode a contribué à définir toute cette catégorie. Sa conception modulaire STT/LLM/TTS et sa téléphonie Twilio et Vonage intégrée en ont fait l'un des premiers frameworks vocaux open source réellement utilisables, et avec 3,773 étoiles, il apparaît encore dans de nombreux tutoriels.

Voici la partie honnête, et c'est pour cela qu'il ferme ce classement : le cœur open source s'est éteint. Le dernier commit sur vocode-core remonte à novembre 2024, et le dépôt n'affiche plus que deux issues ouvertes, ce qui signale en général que l'attention s'est déplacée vers le produit hébergé de l'entreprise plutôt que vers un backlog sain. Le code fonctionne toujours, et l'architecture mérite d'être étudiée, mais vous construiriez sur une base que personne ne corrige plus activement.

À choisir si : vous étudiez l'architecture des agents vocaux, vous maintenez un projet Vocode existant, ou vous voulez spécifiquement ses patterns de conception et acceptez de maintenir la base vous-même.

Autres options à connaître

Quelques outils restent hors classement mais méritent votre attention :

  • OpenAI Agents SDK (27,900+ étoiles) propose une extension pipeline vocal. C'est un SDK d'agent généraliste plutôt qu'un outil voix d'abord, mais c'est un choix raisonnable si vous êtes déjà standardisés dessus.
  • Gabber est un framework multimodal plus récent pour des agents qui voient, entendent et parlent, pensé pour des cas d'usage écran et caméra.
  • Jambonz est une colonne vertébrale de téléphonie open source. Il ne construit pas le cerveau de l'agent, mais c'est un moyen de qualité opérateur pour connecter n'importe quel framework aux vrais réseaux téléphoniques.
  • Rasa (21,000+ étoiles) reste la référence lourde pour le dialogue d'entreprise et le NLU, à la fois en texte et en voix, même si son exploitation est plus exigeante que tout ce qui précède.
  • Ultravox est un modèle de langage vocal rapide, pas un framework d'orchestration, à considérer donc comme un composant enfichable plutôt que comme un concurrent.

Ce que nous utiliserions vraiment pour un projet client

Chez Techsy, nous construisons des agents vocaux pour des clients B2B, alors voici la réalité peu glamour derrière ce classement.

Notre stack par défaut, c'est Pipecat avec Deepgram Nova-3 pour la reconnaissance vocale, GPT-4o-mini comme modèle de langage, et Cartesia Sonic pour la synthèse vocale. Une fois la détection de tour de parole calibrée, la latence voix-à-voix se situe généralement entre 0.7 et 1.1 seconde, ce qui est assez proche d'une conversation humaine pour que les appelants arrêtent de le remarquer. Basculez l'un de ces composants vers un modèle plus lent, et vous le sentez immédiatement.

La téléphonie, c'est là que les projets se compliquent. Nous avons utilisé deux schémas en production : un trunk SIP Twilio relié au SIP natif de LiveKit pour du support entrant à fort volume, et la gestion Plivo intégrée de Bolna quand un client avait simplement besoin d'appels de rappel sortants. La voie LiveKit coûte plus d'heures d'ingénierie au départ, mais elle tient bon quand 300 appels arrivent dans la même minute. Bolna vous met en ligne dès vendredi.

Le calcul de l'auto-hébergement piège beaucoup de gens. Faire tourner du STT et du TTS en local sur un seul GPU A10G coûte environ $0.50 à $0.90 de l'heure, qu'un seul appel arrive ou non. Les API facturées à la minute comme Deepgram et Cartesia ne coûtent rien à l'arrêt mais grimpent vite au-delà de quelques milliers de minutes par mois. En dessous d'environ 15,000 minutes par mois, les API l'emportent presque toujours, et c'est ce que nous recommandons à la plupart de nos clients. Nous préférons LiveKit à Pipecat surtout quand la concurrence dépasse quelques centaines d'appels simultanés.

Si la question de construire ou acheter reste ouverte de votre côté, nous détaillons le calcul de coût complet dans notre guide construire ou acheter un agent vocal IA. Et si vous préférez qu'une équipe s'occupe pour vous de la latence, de la téléphonie et de la montée en charge, c'est exactement ce que nous faisons au sein de notre practice agents vocaux chez Techsy.

Comment choisir en une minute

Évitez la paralysie de l'analyse. Voici la décision sous forme de liste :

  • Vous voulez le choix par défaut le plus sûr et le plus polyvalent : Pipecat.
  • Vous avez besoin d'une vraie montée en charge ou d'une téléphonie native : LiveKit Agents.
  • Vous partez sur du multimodal (voix plus vision ou avatars) : TEN Framework.
  • Vous avez besoin d'un agent téléphonique en ligne cette semaine : Bolna.
  • Vous prototypez ou enseignez : FastRTC.
  • Vous préférez acheter plutôt que construire : une plateforme managée comme Vapi, Retell ou Synthflow, pas un framework du tout.

Foire aux questions

Qu'est-ce qu'un framework d'agent vocal open source ?

C'est une base de code auto-hébergeable qui relie reconnaissance vocale, modèle de langage et synthèse vocale pour permettre à un logiciel de tenir une conversation parlée. Contrairement aux plateformes managées, vous l'exécutez sur votre propre infrastructure, choisissez vos propres modèles, et ne payez que les services sous-jacents plutôt qu'une marge à la minute.

Quel framework d'agent vocal open source a la latence la plus faible ?

TEN Framework est en tête sur la performance brute du pipeline audio grâce à son cœur en C++, mais en pratique la latence réseau et celle du modèle dominent le total. Une stack Pipecat ou LiveKit bien calibrée sur un modèle rapide atteint régulièrement 0.7 à 1.1 seconde voix-à-voix, ce qui rejoint TEN dans la plupart des déploiements réels.

L'open source est-il vraiment moins cher que Vapi ou Retell ?

Pas toujours. L'open source supprime la marge à la minute de la plateforme, mais vous prenez en charge les coûts d'ingénierie, d'hébergement et de maintenance. En dessous de quelques milliers de minutes d'appel par mois, une plateforme managée est en général moins chère une fois le temps de développeur compté. Au-delà de dizaines de milliers de minutes, l'auto-hébergement d'un framework prend l'avantage.

Ces frameworks peuvent-ils répondre à de vrais appels téléphoniques ?

Oui. Pipecat se connecte via Twilio, Daily ou Telnyx ; LiveKit Agents propose le SIP natif et les numéros de téléphone ; Bolna intègre Twilio, Plivo et Exotel ; et Vocode prend en charge Twilio et Vonage. FastRTC est centré sur le navigateur et a besoin d'un pont externe comme Jambonz pour accéder au réseau téléphonique.

Faut-il une expertise en machine learning pour les utiliser ?

Non. Il faut des compétences en ingénierie logicielle, surtout en Python. Le gros du travail (transcription, raisonnement, synthèse vocale) est géré par les modèles que vous branchez via une API. Vous orchestrez des services, vous n'entraînez pas de modèles, sauf si vous choisissez délibérément d'auto-héberger des modèles à poids ouverts.

Quel framework convient le mieux à un débutant ?

Pipecat, parce que son modèle en pipeline est le plus simple à appréhender et que sa documentation et ses exemples sont les plus complets. FastRTC est un bon second choix si vous voulez commencer encore plus petit et comprendre la couche de transport brute avant d'adopter un framework complet.

Les frameworks vocaux open source sont-ils prêts pour la production en 2026 ?

Les trois premiers, oui. Pipecat a atteint la v1.0, LiveKit Agents en est à sa version 1.5.x, et TEN Framework alimente des déploiements commerciaux via Agora. Le principal risque ne vient pas des frameworks eux-mêmes mais du niveau de maintenance des projets plus petits, ce qui explique pourquoi nous avons signalé le cœur à l'arrêt de Vocode.

En quoi est-ce différent d'une API TTS comme ElevenLabs ?

Une API TTS ne fait que transformer du texte en voix, ce qui n'est qu'un seul maillon. Un framework d'agent vocal orchestre toute la boucle : il écoute, transcrit, envoie le texte à un modèle de langage, récupère une réponse et la restitue à voix haute, tout en gérant les interruptions et les tours de parole. C'est le framework qui appelle l'API TTS, pas l'inverse.

À propos de l'auteur

Mert Batur est cofondateur de Techsy.io, où l'équipe conçoit des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la pile d'outils LLM que l'équipe Techsy utilise réellement en production. Retrouvez-le sur LinkedIn.

Tags

frameworks-agents-vocaux-open-sourcepipecatlivekit-agentsten-frameworkia-vocale

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.