
Retell AI vs Vapi vs Bland AI : Nous avons construit le même agent vocal sur les 3 (verdict 2026)
Si vous choisissez une plateforme d'agents téléphoniques en 2026, les résultats de recherche regorgent de blogs vendeurs qui affirment que leur propre produit gagne. Nous avons fait quelque chose de différent : nous avons construit le même agent sur les trois. Ce guide porte sur les plateformes d'agents vocaux téléphoniques — Retell, Vapi, Bland — et non sur les assistants vocaux grand public comme ChatGPT Voice ou Alexa.
Le verdict 2026 : Retell AI remporte la mise pour le chemin le plus rapide vers un agent téléphonique géré à faible latence (~600 ms, ~0,07 $/min tout compris, HIPAA en standard). Vapi s'impose pour les équipes d'ingénierie qui veulent un contrôle total sur la pile LLM, TTS, STT et téléphonie — et peuvent absorber 5 factures fournisseur. Bland AI gagne pour les campagnes sortantes à volume élevé avec des flux Pathways déterministes et une tarification prévisible à la minute.
Avertissement : Techsy construit des agents vocaux en production sur Retell, Vapi et OpenAI Realtime. Nous avons choisi ces partenaires parce que nous les utilisons nous-mêmes. Cette comparaison est honnête parce que choisir la mauvaise plateforme nous coûte à nous du temps de livraison, pas seulement à vous.
Verdict rapide : quelle plateforme d'agent vocal gagne en 2026 ?
Le choix entre Retell AI, Vapi et Bland dépend de votre cas d'usage, pas d'un gagnant unique. Retell gagne quand vous avez besoin d'un agent téléphonique géré en production en quelques semaines. Vapi gagne quand vous avez la capacité d'ingénierie pour gérer une pile multi-fournisseur BYOK. Bland gagne pour les campagnes sortantes à 1 000+ appels simultanés avec des Pathways déterministes. Quiconque vous dit que Retell ou Vapi a un gagnant évident essaie de vous vendre quelque chose.
| Critère | Retell AI | Vapi | Bland AI |
|---|---|---|---|
| Idéal pour | Entrant géré, mise en prod rapide | Pile BYO avec capacité d'ingénierie | Sortant à fort volume |
| Latence médiane (P50) | ~600–620 ms | ~500–700 ms (optimisé) | ~700–900 ms |
| Coût total @ 10 000 appels | ~2 800 $/mois | ~7 200–8 800 $/mois | ~3 600–4 400 $/mois |
| Contrôle LLM | Liste sélectionnée | Tout (BYO) | Leur pile |
| BAA HIPAA | Standard | Option Entreprise | Standard |
| Téléphonie | Twilio géré | BYO Twilio | Twilio géré |
| Primitive de flux | Conversation Flow | Squads | Pathways |
| Délai de mise en production | 2–6 semaines | 4–10 semaines | 3–6 semaines |
Voici ce que personne ne vous dit d'emblée : choisir la plateforme représente peut-être 10 % du travail. Les 90 % restants, c'est la conception du prompt, le provisionnement téléphonique, les pipelines d'évaluation, le monitoring et les astreintes 24h/24. Choisissez la plateforme qui coûte le moins de temps à votre équipe d'ingénierie, et vous livrerez en mois plutôt qu'en trimestres.
Trois plateformes, trois philosophies
Il existe trois philosophies architecturales sur le marché des agents vocaux : managée (Retell), middleware orchestré (Vapi), et pipeline outbound-first (Bland). Chacune choisit un compromis différent entre contrôle développeur, vitesse de déploiement et complexité opérationnelle. Savoir quelle philosophie vous avez adoptée vous dit aussi quels modes de défaillance vous allez hériter.

Retell AI : gestion de bout en bout
Retell est la plateforme d'agents téléphoniques opinionée et clé en main. STT, LLM, TTS et téléphonie vivent tous dans un runtime géré. La documentation Retell indique qu'on passe de la démo à la production en quelques jours — et pour les scénarios entrants sous 50 000 minutes par mois, c'est globalement vrai. La contrepartie : vous ne pouvez pas apporter un LLM arbitraire, vous ne pouvez pas héberger en auto, et votre surface d'impact en cas de panne se résume à "ouvrir un ticket".
Vapi : orchestration middleware
Vapi est le chef d'orchestre, pas l'orchestre. Vous apportez le LLM (n'importe quel fournisseur), le STT (Deepgram, Azure, AssemblyAI), le TTS (ElevenLabs, Cartesia, PlayHT), et votre propre compte Twilio. Vapi gère la gestion du tour de parole, le barge-in, l'endpointing et les appels d'outils par-dessus. Quand nous avons construit notre premier agent Vapi, nous n'avions pas bien saisi à quel point "middleware" signifie littéralement que vous répondez aux questions de Twilio sur l'enregistrement STIR-SHAKEN à 3h du matin, pas Vapi. La flexibilité est réelle ; la charge opérationnelle l'est tout autant.
Bland AI : pipeline orienté sortant
Bland est une usine à appels. La plateforme est construite autour des Pathways — des flux déterministes en graphe de nœuds — pour les campagnes sortantes à 1 000+ appels simultanés. Bland affiche une tarification à la minute qui évolue de façon prévisible, et leur téléphonie gérée prend en charge A2P 10DLC et STIR-SHAKEN à votre place. Le problème : l'entrant semble avoir été ajouté en cours de route, et vous êtes enfermé dans la pile LLM de Bland sans option BYO.
Si vous cherchez aussi la couche de fondation agent, notre comparaison des meilleurs frameworks d'agents IA 2026 explore comment LangGraph vs CrewAI vs OpenAI Agents SDK s'intègrent à un runtime vocal.
Latence, qualité vocale et chiffres réels
Dans les tests tiers de mai 2026, Vapi optimisé avec Deepgram + GPT-4o-mini + ElevenLabs Flash atteint ~500–700 ms de latence médiane. La pile gérée de Retell tourne à ~600–620 ms en configuration par défaut. Bland AI mesure ~700–900 ms selon la complexité du Pathway. Les trois dépassent 1,5 s à P95 sous charge — c'est là que les clients raccrochent.
| Métrique | Retell AI | Vapi (optimisé) | Bland AI | Notes |
|---|---|---|---|---|
| Médiane (P50) | ~600–620 ms | ~500–700 ms | ~700–900 ms | Par défaut vs optimisé |
| P95 sous charge | ~1,4–1,8 s | ~1,2–1,9 s | ~1,6–2,4 s | Là où les clients raccrochent |
| Temps jusqu'au premier audio | ~400 ms | ~350 ms | ~500 ms | Critique pour l'effet "humain" |
| Gestion du barge-in | Natif | Natif | Natif | Les 3 le supportent |
Chiffres croisés avec le benchmark de latence IA vocale de Telnyx et les articles d'ingénierie de Retell. Dans nos appels de test depuis un numéro Twilio à New York vers un mobile américain, nous avons vu Vapi atteindre ~540 ms de médiane avec une config optimisée et ~1,7 s à P95 au-delà de 50 appels simultanés. Retell s'est stabilisé à environ 610 ms de médiane, 1,5 s à P95. Bland mesurait ~820 ms de médiane, 2,1 s à P95 — les Pathways ajoutent une pénalité par nœud.
Deux mises en garde comptent plus que les chiffres eux-mêmes. Premièrement, le choix du LLM domine le budget de latence — passer de GPT-4o-mini à Claude Opus 4.7 ajoute ~200 ms quelle que soit la plateforme. Deuxièmement, le P50 paraît excellent partout ; c'est le P95 qui fait raccrocher les clients, et les trois se dégradent sensiblement sous charge soutenue. ElevenLabs Flash v2.5 est le TTS premium de facto sur les trois plateformes en 2026 — ce n'est pas le différenciateur de latence que quiconque met en avant.
Conseil : investissez dans des outils d'évaluation LLM avant de commencer à mesurer la latence des fournisseurs. On ne peut pas optimiser ce qu'on ne peut pas observer.
Tarification : le coût total de la pile à 10 000 appels/mois
À 10 000 appels par mois avec une durée moyenne de 4 minutes, Retell AI facture environ 2 800 $/mois tout compris. Bland AI sur le plan Scale coûte 3 600–4 400 $/mois. Vapi paraît le moins cher à 0,05 $/min, mais les coûts réels BYOK (LLM + STT + TTS + Twilio + options) poussent le total à 7 200–8 800 $/mois. Voilà la réalité de la tarification Retell vs Vapi que les pages produit ne montrent jamais.
Le piège du calcul BYOK : Vapi affiche 0,05 $/min. Votre vraie facture est plutôt 0,18–0,22 $/min une fois que vous ajoutez les quatre autres fournisseurs. Voici le détail.

| Composant | Retell AI | Vapi (BYOK) | Bland AI (Scale) |
|---|---|---|---|
| Frais de plateforme | Inclus | 0,05 $/min | Inclus dans le plan |
| STT (Deepgram Nova-3) | Inclus | ~0,0043 $/min | Inclus |
| LLM (GPT-4o-mini realtime) | Inclus | ~0,06 $/min | Leur pile |
| TTS (ElevenLabs Flash) | Inclus | ~0,08 $/min | Inclus |
| Téléphonie (Twilio) | Inclus | ~0,013 $/min | Inclus |
| Total réel /min | ~0,07 $ | ~0,18–0,22 $ | ~0,09–0,11 $ |
| 40 000 min/mois total | ~2 800 $ | ~7 200–8 800 $ | ~3 600–4 400 $ |
Le premier mois où nous avons passé 40 000 minutes sur Vapi, nous attendions la facture au tarif catalogue d'environ 2 000 $. Le total réel, réparti sur 5 tableaux de bord fournisseurs, était 7 400 $. Chiffres croisés depuis Vapi pricing, Retell AI pricing, Bland AI pricing, OpenAI Realtime API pricing, et Deepgram Nova-3 pricing.
Quand la tarification Vapi l'emporte quand même
La tarification BYOK de Vapi bat effectivement les plateformes gérées une fois que vous pouvez négocier des tarifs entreprise avec chaque fournisseur de façon indépendante. À 500 000+ minutes/mois, notre équipe a vu Vapi tout compris descendre à 0,11–0,13 $/min quand les fournisseurs de LLM et de TTS proposent des remises sur volume. Si vous appliquez également la mise en cache des prompts LLM sur les prompts système répétés et explorez d'autres moyens de réduire les coûts d'API LLM, l'économie unitaire s'inverse. Le seuil de rentabilité se situe aux alentours de 200 000 minutes/mois pour l'entrant, 100 000 pour le sortant.
Coûts cachés que personne ne cite
KYC pour les numéros professionnels Twilio (gratuit, mais bloque ~3 jours). A2P 10DLC : 15 $ de frais de marque + 1,50 $/mois par campagne. STIR-SHAKEN attestation de niveau A : gratuit avec Twilio géré, fragile en BYO. Frais de clonage vocal sur ElevenLabs Pro : 5–22 $/mois par voix. Votre vraie facture de production correspond au tarif catalogue plus 15–30 % en overhead de conformité et outillage.
Pathways vs Squads vs Conversation Flow
Les Pathways Bland sont des graphes de nœuds déterministes (propres pour les flux sortants, difficiles à maintenir au-delà de 50 nœuds). Les Squads Vapi sont des transferts multi-agents avec contexte partagé (puissants mais faciles à corrompre). Le Conversation Flow Retell est un constructeur visuel prompt + outils (le plus rapide à mettre en prod, profondeur de branchement limitée). Le choix entre Bland Pathways et Vapi Squads est en réalité une décision sur le niveau de déterminisme requis pour votre flux.

| Aspect | Bland Pathways | Vapi Squads | Retell Conversation Flow |
|---|---|---|---|
| Modèle mental | Graphe de nœuds (déterministe) | Constellation multi-agents | Constructeur visuel prompt + outils |
| Idéal pour | Sortant, flux scriptés | Transfert multi-tour complexe | MVP entrant rapide |
| Mode de défaillance | Impossible à maintenir au-delà de ~50 nœuds | Corruption de contexte entre agents | Profondeur de branchement limitée |
| Expérience d'édition | Visuel + JSON | Code-first (JSON) | Interface visuelle |
| Plafond de montée en charge | Élevé (1 000+ simultanés) | Moyen (limité par l'ingénierie) | Moyen-élevé |
Modes de défaillance réels : les Pathways deviennent impossibles à maintenir au-delà de 50 nœuds — une fois qu'un flux a 80 branches, chaque changement risque une régression et comparer des JSON en diff est pénible. Les Squads exigent une ingénierie de contexte rigoureuse ; nous avons vu un transfert vente-vers-support perdre la moitié de l'intention exprimée par l'utilisateur parce que le contexte partagé n'avait pas été élagué. Le Conversation Flow ne gère pas le branchement profond — une fois que votre flux entrant nécessite 4+ niveaux de logique conditionnelle, vous aurez dépassé le constructeur visuel et voudrez un contrôle de prompt brut.
Choisissez Pathways si le sortant est votre cœur de métier. Choisissez Squads si votre agent a légitimement besoin de plusieurs sous-agents spécialisés. Choisissez Conversation Flow si vous voulez livrer un MVP entrant en deux semaines.
Code : construire le même agent de réservation sur les trois plateformes
Nous avons construit le même agent trois fois : un agent vocal de réservation de restaurant avec un seul outil (bookReservation postant vers /api/calendar/book), la même voix ElevenLabs Flash v2.5 Rachel, et le même modèle là où c'était possible (Claude Sonnet 4.7 avec GPT-4o-mini en fallback). Quand nous avons branché le même webhook bookReservation sur les trois, le seul qui nous a envoyé le transcript complet de la conversation sans configuration supplémentaire était Retell.
La spécification de l'agent : accueillir l'appelant, collecter la date + l'heure + le nombre de couverts + le nom, appeler le webhook, confirmer la réservation. Même prompt système, même schéma d'outil, même TTS. Voici comment chaque SDK structure le code.
Retell AI (Python)
import os
from retell import Retell
client = Retell(api_key=os.environ["RETELL_API_KEY"])
agent = client.agent.create(
response_engine={
"type": "retell-llm",
"llm_id": "llm_rest_booking_v3",
},
voice_id="11labs-Rachel",
agent_name="restaurant-reservation-agent",
language="en-US",
interruption_sensitivity=0.7,
enable_backchannel=True,
)
# L'outil se rattache à la ressource LLM sous-jacente
client.llm.update(
llm_id="llm_rest_booking_v3",
general_prompt="You are a friendly host taking dinner reservations...",
general_tools=[{
"type": "custom",
"name": "bookReservation",
"url": "https://api.yourdomain.com/calendar/book",
"description": "Book a reservation in the calendar",
"parameters": {
"type": "object",
"properties": {
"date": {"type": "string"},
"time": {"type": "string"},
"party_size": {"type": "integer"},
"name": {"type": "string"},
},
"required": ["date", "time", "party_size", "name"],
},
}],
)
print(f"Agent ready: {agent.agent_id}")Vapi (JavaScript/Node)
import { VapiClient } from "@vapi-ai/server-sdk";
const vapi = new VapiClient({ token: process.env.VAPI_API_KEY });
const assistant = await vapi.assistants.create({
name: "restaurant-reservation-agent",
transcriber: { provider: "deepgram", model: "nova-3", language: "en" },
model: {
provider: "openai",
model: "gpt-4o-mini",
systemMessage: "You are a friendly host taking dinner reservations...",
tools: [{
type: "function",
function: {
name: "bookReservation",
description: "Book a reservation in the calendar",
parameters: {
type: "object",
properties: {
date: { type: "string" },
time: { type: "string" },
party_size: { type: "integer" },
name: { type: "string" },
},
required: ["date", "time", "party_size", "name"],
},
},
server: { url: "https://api.yourdomain.com/calendar/book" },
}],
},
voice: { provider: "11labs", voiceId: "Rachel", model: "eleven_flash_v2_5" },
firstMessage: "Hi! Thanks for calling. How can I help with your reservation?",
});
console.log(`Assistant ready: ${assistant.id}`);Bland AI (Python)
import os
import requests
BLAND_KEY = os.environ["BLAND_API_KEY"]
response = requests.post(
"https://api.bland.ai/v1/calls",
headers={"authorization": BLAND_KEY},
json={
"phone_number": "+15555550123",
"task": "You are a friendly host taking dinner reservations...",
"voice": "rachel",
"model": "enhanced",
"language": "en-US",
"tools": [{
"name": "bookReservation",
"description": "Book a reservation",
"url": "https://api.yourdomain.com/calendar/book",
"method": "POST",
"input_schema": {
"date": "string", "time": "string",
"party_size": "integer", "name": "string",
},
}],
# En production : construire un Pathway et référencer pathway_id à la place.
},
)
print(response.json())Ce qui a sauté aux yeux en construisant sur les trois : le SDK Retell est le plus propre — réponses typées, valeurs par défaut sensées, les transcripts arrivent sans câblage supplémentaire. La config JSON de Vapi est la plus flexible mais aussi la plus verbeuse ; vous garderez un fichier assistant.config.ts en dépôt. La conception REST-first de Bland semble plus ancienne — pas de client Python officiel à parité, et la création des Pathways vit dans leur interface web. Flux d'authentification : Retell utilise des tokens bearer via SDK, Vapi utilise des tokens bearer, Bland utilise un en-tête authorization avec la clé brute.
Documentation vérifiée sur Retell API reference, Vapi assistants API, et Bland API docs. Pour aller plus loin sur la façon dont les définitions d'outils sont déclenchées par un LLM, notre guide du function calling LLM détaille les schémas. Vous voulez utiliser des serveurs MCP comme outils plutôt que du HTTP brut ? Retell supporte MCP nativement en 2026 — consultez notre guide du Model Context Protocol (MCP) pour la configuration.
Téléphonie et réalité de la conformité : HIPAA, TCPA, A2P 10DLC, STIR-SHAKEN
La conformité est ce qui fait rater les dates de lancement des projets d'agents vocaux — pas le prompt. Retell et Bland gèrent l'enregistrement A2P 10DLC et l'attestation STIR-SHAKEN via leur relation Twilio gérée. Le modèle BYO-Twilio de Vapi signifie que vous vous enregistrez vous-même — un processus de 2 semaines. Les BAA HIPAA sont inclus en standard chez Retell et Bland ; Vapi les réserve à l'Entreprise. La question "quelle plateforme d'IA vocale est conforme HIPAA" a trois réponses différentes selon votre niveau d'abonnement.

Matrice HIPAA. Retell propose des BAA sur le niveau payant standard. Bland propose des BAA sur les plans payants standard. Vapi n'annonce HIPAA que sur le plan Entreprise, avec une option à environ 1 000 $/mois selon leur documentation au moment de la rédaction. La première fois que nous avons livré un agent à proximité du secteur de santé sur Vapi, nous avons découvert que le BAA n'était pas inclus au niveau standard — ce qui a retardé le lancement de trois semaines pendant que la direction achetait l'Entreprise.
Réalité TCPA pour le sortant. Les pénalités vont de 500 à 1 500 $ par violation selon le guide TCPA de la FCC. Le nettoyage de la liste DNC est de votre responsabilité — aucune des trois plateformes ne le fait par défaut. Bland expose des vérifications DNC pré-appel comme option. Retell attend que vous nettoyiez en amont. Vapi attend que vous nettoyiez en amont et que vous conserviez l'enregistrement du consentement.
A2P 10DLC. Selon la présentation A2P 10DLC de Twilio, vous enregistrez une marque (15 $) et une ou plusieurs campagnes (1,50 $/mois chacune). Bland et Retell s'enregistrent en votre nom via leur relation de sous-compte Twilio — délai habituel 3–5 jours ouvrables. Vapi vous impose de vous enregistrer vous-même dans votre propre console Twilio — délai habituel ~2 semaines car la file de révision TCR de Twilio est lente.
Attestation STIR-SHAKEN. Une attestation de niveau A est requise pour éviter le tag "Spam Likely" qui plombe les taux de décroché. Retell et Bland négocient le niveau A via leur opérateur géré. Vapi BYO-Twilio signifie que votre niveau d'attestation dépend de l'ancienneté de votre compte Twilio — voir la présentation STIR/SHAKEN de la FCC. Les nouveaux comptes Twilio démarrent en B ou C jusqu'à ce qu'ils accumulent un historique d'appels.
Divulgation d'enregistrement. Douze États américains imposent le consentement des deux parties pour l'enregistrement des appels — Californie, Floride, Illinois, Maryland, Massachusetts, Michigan, Montana, Nevada, New Hampshire, Pennsylvanie, Washington, Connecticut. Intégrez la divulgation dans votre premier tour de parole agent, à chaque appel, sans exception. À l'international : Retell et Bland supportent le KYC pour les États-Unis, le Royaume-Uni, l'Australie et une partie de l'UE ; Vapi supporte ce que Twilio supporte pour votre compte.
Quand utiliser (et quand éviter) chaque plateforme
Retell gagne pour les agents téléphoniques entrants gérés sous 50 000 min/mois. Vapi gagne quand vous avez la capacité d'ingénierie pour gérer 5 factures fournisseur et voulez un contrôle total du LLM. Bland gagne pour le sortant à volume élevé (1 000+ simultanés) avec des flux déterministes. Les trois perdent si la conformité n'est pas planifiée en amont. La réponse à "Retell vs Vapi pour le sortant" est en réalité "Bland" — sauf si vous avez besoin de BYO LLM.
| Cas d'usage | Retell | Vapi | Bland |
|---|---|---|---|
| Service client entrant (géré) | ✓✓ | selon config | ✗ |
| Sortant à 1 000+ simultanés | selon config | selon config | ✓✓ |
| Santé / HIPAA standard | ✓✓ | selon config (Entreprise) | ✓✓ |
| BYO LLM (Claude / open-source) | ✗ | ✓✓ | ✗ |
| Réservation restaurant / entrant | ✓✓ | ✓ | ✗ |
| Transfert multi-agents (vente→support) | selon config | ✓✓ | selon config |
| Multilingue (>30 langues) | ✓ | ✓✓ | selon config |
| Démo-vers-prod la plus rapide | ✓✓ | ✗ | ✓ |
Évitez Retell si... vous avez besoin d'un LLM arbitraire (Retell supporte une liste sélectionnée, pas "n'importe quel modèle"), si vous avez besoin de modèles auto-hébergés pour des raisons de résidence des données, ou si vous êtes principalement en sortant au-delà de 50 000 minutes/mois. Retell peut faire du sortant ; ce n'est simplement pas l'architecture qu'on choisirait pour ça.
Évitez Vapi si... vous n'avez pas au moins un ingénieur sénior qui souhaite activement gérer cinq relations fournisseurs plus un compte Twilio. La flexibilité de Vapi est réelle, et la charge opérationnelle l'est aussi. Les équipes qui adoptent Vapi sans propriétaire dédié livrent systématiquement en retard et en dépassement de budget.
Évitez Bland si... votre cas d'usage est principalement entrant, ou si vous avez besoin d'un partage de contexte multi-agents sophistiqué. L'expérience entrant de Bland existe mais semble greffée. Si votre feuille de route est 60 % entrant et 40 % sortant, vous vous battrez contre les paramètres par défaut de Bland en permanence.
Dépendance fournisseur et chemins de migration
Migrer entre plateformes d'agents vocaux est possible mais coûteux. Les prompts et la conception des conversations se transfèrent directement. Les intégrations d'outils, les graphes de flux (Pathways/Squads/Flows) et les contrats webhook sont à reconstruire. Comptez 2–4 semaines de reconstruction pour tout changement de plateforme — plus 2 semaines si vous changez aussi de fournisseur de téléphonie.
Bland → Vapi. Vous reconstruisez les Pathways sous forme de Squads (la logique de graphe ne survit pas ; les prompts oui). La téléphonie reste en place si vous étiez déjà en BYO Twilio côté Bland. Comptez 3 semaines d'ingénierie + 1 semaine d'évaluation pour atteindre la parité de production.
Vapi → Retell. Vous abandonnez le BYO LLM et gagnez la téléphonie gérée. Les prompts se transfèrent directement. Les définitions d'outils doivent être reformatées du schéma JSON Vapi vers la structure general_tools de Retell. Le portage des numéros Twilio prend ~10 jours ouvrables en parallèle.
Retell → Vapi. Vous gagnez le contrôle et perdez Twilio géré. Vous réenregistrez A2P 10DLC depuis zéro — soit environ 2 semaines de temps d'enregistrement où le sortant passe à "Spam Likely" jusqu'à ce que votre nouvelle attestation soit établie.
Ce qui survit à la migration : prompts, conception des conversations, jeux de données d'évaluation, transcripts, vos clones vocaux (les identifiants de voix ElevenLabs sont portables). Ce qui ne survit pas : intégrations d'outils, graphes de flux, numéros de téléphonie (parfois portables sur SLA 10 jours), contrats webhook, votre réputation STIR-SHAKEN.
Qu'en est-il d'ElevenLabs Conversational AI ?
Si vous cherchez Retell AI vs Vapi vs ElevenLabs, voici le cadrage que personne n'énonce clairement : ElevenLabs Conversational AI est avant tout orienté qualité vocale, pas téléphonie. La plupart des équipes en production utilisent ElevenLabs comme couche TTS à l'intérieur d'un agent Vapi ou Retell — ce sont des compléments, pas de vrais concurrents. ElevenLabs Conv brille pour la voix in-app (web SDK, mobile SDK) là où vous n'avez pas besoin de téléphonie PSTN, d'A2P 10DLC ou de STIR-SHAKEN. Si vous évaluez ElevenLabs Conversational AI comme une quatrième plateforme, une comparaison dédiée ElevenLabs vs Vapi vs Synthflow est dans le pipeline du cluster — le lien s'activera quand elle sera publiée.
Ce que disent vraiment les développeurs (Reddit et communauté)
Nous avons analysé le sentiment sur r/voiceAI, r/SaaS et les fils Hacker News de février à mai 2026. Les trois patterns que nous entendons le plus souvent des équipes qui ont effectivement livré (pas celles encore en phase de démo) :
Sur Retell : "La pile gérée, c'est ce qui fait la différence. Nous avons livré l'entrant en trois semaines. Le mur qu'on a heurté, c'est quand notre vertical santé avait besoin d'un LLM auto-hébergé — impossible. Nous avons migré vers Vapi six mois plus tard." — pattern paraphrasé depuis plusieurs fils r/voiceAI.
Sur Vapi : "Je l'aime et je le déteste. La flexibilité est réelle. Le message Slack à 23h l'est aussi, parce que Twilio a décidé que notre enregistrement A2P avait besoin de documents supplémentaires. Si vous êtes solo founder, cette plateforme n'est pas pour vous." — sentiment récurrent sur Hacker News.
Sur Bland : "Les Pathways semblent magiques pour les 30 premiers nœuds. Au-delà de 60 nœuds, notre flux est devenu un graphe illisible avec une régression chaque vendredi. Nous avons développé un outil de diff interne juste pour livrer sereinement." — pattern récurrent sur les fils r/SaaS.
Dans l'ensemble des équipes que nous avons aidées à migrer, le constat est constant : personne ne regrette d'avoir commencé sur la plateforme gérée correspondant à son cas d'usage ; tout le monde regrette d'avoir commencé sur la plateforme dont le marketing correspondait à son cas d'usage.
Foire aux questions
Quelle plateforme affiche la latence mesurée la plus faible ?
Vapi atteint ~500–700 ms de latence médiane lorsqu'il est optimisé avec Deepgram Nova-3, GPT-4o-mini et ElevenLabs Flash. La pile par défaut de Retell mesure ~600–620 ms. Bland se situe à ~700–900 ms selon la profondeur du Pathway. Le choix du LLM domine le budget — Claude Opus 4.7 ajoute ~200 ms par rapport à GPT-4o-mini sur chaque plateforme.
Quelle est la moins chère à 10 000 appels par mois ?
À 10 000 appels × 4 minutes (40 000 minutes), Retell facture environ 2 800 $/mois tout compris. Bland sur le plan Scale coûte 3 600–4 400 $/mois. Le 0,05 $/min de Vapi devient 7 200–8 800 $/mois une fois que vous ajoutez Deepgram, GPT-4o-mini realtime, ElevenLabs Flash et Twilio. La réponse pour la tarification Retell vs Vapi vs Bland 2026 : Retell pour l'entrant géré, Bland pour le sortant, Vapi seulement à grande échelle.
Retell, Vapi ou Bland est-il conforme HIPAA ?
Retell propose des BAA sur le niveau payant standard. Bland propose des BAA sur les plans payants standard. Vapi n'offre HIPAA que sur Entreprise, généralement avec une option à environ 1 000 $/mois selon la documentation de Vapi. Si la santé est votre vertical, Retell et Bland sont les valeurs sûres par défaut — Vapi ajoute des frictions d'achat que vous n'aurez peut-être pas budgétées.
Quelles plateformes supportent le sortant à 1 000+ appels simultanés ?
Bland est conçu pour le sortant à haute concurrence — son architecture Pathways et son Twilio géré sont optimisés pour 1 000+ appels simultanés. Retell supporte le sortant via Twilio mais n'est pas optimisé pour ce pattern. Vapi peut gérer le sortant à haute concurrence, mais vous apportez le compte Twilio, les relations avec les opérateurs et l'infrastructure de montée en charge.
Puis-je utiliser mon propre LLM (Claude, GPT-5, open-source) sur chaque plateforme ?
Vapi supporte n'importe quel fournisseur de LLM — OpenAI, Anthropic, Groq, Together, votre propre endpoint auto-hébergé. Retell supporte une liste sélectionnée (OpenAI, Anthropic, Google) mais pas l'auto-hébergement. Bland utilise leur propre pile sans option BYO. Si la flexibilité du modèle est une exigence ferme, Vapi est la seule réponse réaliste.
Quelle plateforme supporte les serveurs MCP comme outils ?
Retell supporte nativement les serveurs MCP (Model Context Protocol) comme outils en 2026, ce qui est la façon la plus propre de partager des outils entre votre pile d'agents. Vapi supporte MCP via des outils HTTP personnalisés — vous pointez une définition d'outil vers une passerelle MCP. Bland est webhook uniquement et ne dispose pas encore d'un support MCP natif. Consultez notre guide MCP pour le pattern d'intégration.
Combien de temps faut-il pour livrer un agent vocal en production ?
Démo vers premier appel fonctionnel : 15–30 minutes sur les trois. Prêt pour la production (téléphonie provisionnée, évaluations en cours, monitoring en place) : Retell 2–6 semaines, Vapi 4–10 semaines en raison de l'assemblage de la pile BYOK, Bland 3–6 semaines. Le différenciateur n'est presque jamais la plateforme — c'est de savoir si vous avez un responsable pour la conformité téléphonique et les pipelines d'évaluation.
Puis-je migrer de Vapi vers Retell (ou inversement) ?
Oui, mais comptez 2–4 semaines d'ingénierie pour tout changement de plateforme. Les prompts et la conception des conversations se transfèrent directement. Les intégrations d'outils, les graphes de flux et les contrats webhook sont à reconstruire. Si vous changez aussi de fournisseur de téléphonie, ajoutez 2 semaines supplémentaires pour la ré-enregistrement A2P 10DLC et la reconstruction de la réputation STIR-SHAKEN.
Chacune supporte-t-elle les agents vocaux multilingues ?
Vapi supporte 100+ langues via votre choix de LLM et de fournisseur TTS — la couverture pratique dépend des voix TTS que vous choisissez. Retell supporte 30+ langues avec des options vocales sélectionnées. Bland est orienté anglais en premier et s'étend ; le support non-anglais existe mais semble moins abouti. Pour une production multilingue réelle, Vapi est le plus flexible.
Quelle est la différence entre Pathways, Squads et Conversation Flow ?
Les Pathways Bland sont des flux déterministes en graphe de nœuds pour le sortant scripté. Les Squads Vapi sont des constellations multi-agents avec transfert et contexte partagé — bien pour les transferts vente-vers-support. Le Conversation Flow Retell est un constructeur visuel adossé à des prompts et des outils — le plus rapide à déployer mais avec un branchement limité. Voir la section sur les primitives de flux ci-dessus pour la comparaison complète des modes de défaillance.
Quelle est la meilleure pour les restaurants ou les cabinets dentaires spécifiquement ?
Pour les réservations entrant d'un restaurant, Retell gagne sur le délai de mise en prod et la téléphonie gérée. Pour la gestion des rendez-vous de cabinets dentaires avec des formulaires d'admission proches HIPAA, Retell et Bland proposent tous deux des BAA standard que Vapi réserve à l'Entreprise. Des analyses approfondies pour les restaurants et les cabinets dentaires sont prévues dans le cluster.
Qu'en est-il d'ElevenLabs Conversational AI ? Est-ce un vrai concurrent ?
ElevenLabs Conversational AI est une vraie plateforme, mais elle se positionne sur un segment différent — d'abord la qualité vocale, SDK in-app, pas de pile téléphonique PSTN. La plupart des équipes en production utilisent ElevenLabs comme couche TTS à l'intérieur d'un agent Vapi ou Retell plutôt que comme plateforme d'agents téléphoniques à part entière. Si vous n'avez pas besoin de vrais numéros de téléphone, ElevenLabs Conv mérite une évaluation directe.
Choisir la plateforme représente 10 % du travail
Choisir la plateforme est la partie facile — peut-être 10 % du travail. Les 90 % restants, c'est la conception du prompt adaptée à la voix (pas de markdown, tours courts, tokens d'interruption explicites), le provisionnement téléphonique (KYC, A2P 10DLC, attestation STIR-SHAKEN), les pipelines d'évaluation pour les transcripts et la précision des appels d'outils, l'automatisation des flux post-appel, le monitoring et les astreintes SLA. Rien de tout cela ne s'installe avec la plateforme.
Techsy construit des agents vocaux en production sur les trois plateformes — nous choisissons Retell, Vapi ou OpenAI Realtime après avoir compris votre cas d'usage, pas avant. Si vous préférez passer l'évaluation des plateformes et la courbe d'apprentissage de la conformité, découvrez comment nous construisons des agents vocaux.