ai-machine-learning

Tarifs des agents vocaux IA en 2026 : La vérité sur $0,05 vs $0,30 par minute (avec les calculs)

Écrit par Techsy Editorial Team
May 14, 2026
20 lecture
Tarifs des agents vocaux IA en 2026 : La vérité sur $0,05 vs $0,30 par minute (avec les calculs)

Tarifs des agents vocaux IA en 2026 : La vérité sur $0,05 vs $0,30 par minute (avec les calculs)

Vapi affiche « $0,05/min » sur sa page de tarifs. Votre première facture mensuelle arrive à $0,27/min. Que s'est-il passé ? Chaque plateforme de voice AI communique un seul chiffre — les frais de plateforme — et vous facture quatre autres couches que vous n'avez pas vues sur la page d'accueil. Ce guide reconstruit le calcul des tarifs des agents vocaux IA depuis le début : les vrais coûts BYOK pour 8 plateformes, le poste audio-tokens que personne n'explique, et une fonction Python que vous pouvez forker pour prévoir votre propre facture.

Graphique de tarifs des agents vocaux IA mai 2026 montrant les coûts mensuels sur différents paliers de volume pour Bland, Retell, Vapi et OpenAI Realtime

Réponse rapide

  • Le coût réel tout compris en 2026 se situe entre $0,07 et $0,30/min selon le mode bundled ou BYOK.
  • Les plateformes bundled (Retell, Bland, ElevenLabs) affichent $0,07–$0,12/min et atterrissent autour de $0,10–$0,18/min.
  • Les plateformes BYOK (Vapi à $0,05/min de frais de plateforme) atteignent $0,13–$0,31/min après LLM + TTS + STT + Twilio.
  • Le levier caché le plus important est le prompt caching sur OpenAI Realtime : jusqu'à 80× moins cher sur les prompts système.

Combien coûte vraiment un agent vocal IA en 2026 ?

La plupart des agents vocaux IA coûtent $0,07 à $0,30 par minute tout compris en 2026. Les plateformes bundled (Retell, Bland, ElevenLabs) affichent $0,07–$0,12/min et atteignent $0,10–$0,18/min. Les plateformes BYOK (Vapi à $0,05/min de frais de plateforme) arrivent à $0,13–$0,31/min une fois qu'on ajoute LLM, TTS, STT et Twilio. En accès direct sur OpenAI Realtime, c'est environ $0,30/min sans caching.

Trois catégories expliquent presque tout ce que vous verrez sur votre facture :

  • Facturation au forfait par minute (Bundled) : Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min fixe), Synthflow et ElevenLabs Conversational. Un seul chiffre, tout inclus.
  • Orchestration BYOK : Vapi facture $0,05/min uniquement pour la couche de gestion d'appels. Les tokens LLM, les caractères TTS, les minutes STT et l'opérateur se facturent séparément sur vos propres comptes.
  • Directement sur l'infrastructure : Construire directement sur OpenAI Realtime plus Twilio. Le moins cher à grande échelle si vous mettez les prompts en cache. Coûteux sinon.

La suite de cet article explique les calculs couche par couche, puis livre une fonction Python tco_per_minute() que vous pouvez coller dans un notebook.

Pourquoi le tarif affiché par minute est un mensonge (les 4 couches de coût)

Les $0,05/min de frais de plateforme ne couvrent que l'orchestration. Les quatre autres couches s'empilent par-dessus. Tout agent vocal en production en 2026 paie cinq postes : la téléphonie, le STT, le LLM, le TTS et les frais de plateforme qui les relient. En oublier un seul, et vous n'avez pas d'agent fonctionnel.

Voici le plancher, couche par couche.

Couche 1 : La téléphonie (la minute opérateur)

Vous payez un vrai opérateur télécom pour l'audio qui transite dans et hors du réseau téléphonique public. Twilio Programmable Voice facture $0,014/min en sortie aux États-Unis, plus $1–$2/mois par numéro de téléphone. Twilio Elastic SIP varie de $0,0053 à $0,042/min selon l'origine. La plupart des plateformes de voice AI revendent Twilio avec une petite marge ou le répercutent directement. Dans tous les cas, c'est $0,014/min dans votre tableur.

Couche 2 : La reconnaissance vocale (STT)

Vous convertissez ce que l'appelant a dit en texte que le LLM peut lire. Deepgram Nova-2 en streaming coûte environ $0,0043/min sur le palier Pay-as-you-go, soit $0,005/min en pratique. Les modèles premium (équivalent Whisper) montent à $0,018/min. Les plateformes bundled cachent ça dans leur tarif principal, mais c'est toujours là.

Couche 3 : Le LLM (texte ou audio)

Deux chemins possibles. Les pipelines en mode texte alimentent l'audio transcrit dans un modèle comme GPT-4o-mini ($0,15/M en entrée, $0,60/M en sortie) et passent la réponse au TTS. Une boucle vocale brûle typiquement 100–300 tokens en entrée et 80–200 tokens en sortie par tour, ce qui donne environ $0,003–$0,015/min pour GPT-4o-mini, $0,015–$0,04/min pour Claude Haiku. Les pipelines en mode audio (OpenAI Realtime) sautent la danse transcription/synthèse et facturent directement en tokens audio. Nous y consacrons une section complète ci-dessous ; c'est le levier de coût que personne n'explique.

Couche 4 : La synthèse vocale (TTS)

Vous synthétisez la réponse en audio. ElevenLabs Turbo coûte $0,10/min sur le plan Conversational, les voix Premium montent à $0,12/min. Les voix bas de gamme (Deepgram Aura, OpenAI tts-1) arrivent à $0,04–$0,06/min. C'est généralement le deuxième plus gros poste après les frais de plateforme.

Additionnez au plancher : $0,014 téléphonie + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 plateforme = $0,114/min minimum sur un stack BYOK. Et c'est sans HIPAA, concurrence, ou locations de numéros. Si vous voulez la comparaison de fonctionnalités tête-à-tête après cette plongée dans les tarifs, consultez notre analyse Retell AI vs Vapi vs Bland.

Les 8 plateformes comparées (tableau de tarifs mai 2026)

Le tableau ci-dessous recueille les tarifs affichés et les chiffres réalistes tout compris depuis la page de tarification de chaque fournisseur. Utilisez-le comme référence, pas comme évangile : les pages de tarifs changent, et vos choix de stack modifient le résultat final.

PlateformeModèle tarifaireTarif affichéRéel tout compris (typique)HIPAABYOK ou bundledPiège notable
Retell AIPar minute$0,07–$0,31/min$0,12–$0,18/minInclusBundledConcurrence $8/mois au-delà de l'inclus
VapiFrais de plateforme + BYOK$0,05/min$0,13–$0,31/min+$2.000/moisBYOKLes quatre couches en supplément
Bland AIForfait par minute$0,09/min$0,09–$0,14/minInclusBundled$0,025/min de frais de transfert
SynthflowPar minute sur abonnement$0,09/min de base$0,11–$0,15/minInclusBundledPaliers d'abonnement $29/$99/$449/$899
ElevenLabs ConversationalPar minute$0,08–$0,12/min$0,10–$0,18/minPlan WorkspaceBundledLLM en supplément sauf sur le palier managed
Deepgram Voice AgentPar heure$4,50/h ($0,075/min)$0,09–$0,11/min + téléphonieOuiBundledAjouter Twilio en plus
OpenAI Realtime APITokens audio$32/M entrée, $64/M sortie~$0,30/min brut, ~$0,12 en cacheDIYDirectCalcul audio-tokens (voir ci-dessous)
Twilio (couche téléphonie)Par minute$0,014/min US sortant$0,014/minn/an/aNuméros de téléphone $1–$2/mois

Tarifs vérifiés en mai 2026. Vérifiez toujours les pages de tarifs des fournisseurs avant de signer : Vapi a changé son add-on HIPAA deux fois dans la dernière année.

Exemple concret : combien coûte vraiment un appel sortant de 4 minutes ?

Le scénario canonique : un appel sortant de 4 minutes, GPT-4o-mini comme LLM, ElevenLabs Turbo comme voix, Twilio US comme opérateur, en anglais uniquement. Quand nous avons exécuté ce scénario exact sur les quatre plateformes (Vapi, Retell, Bland, OpenAI Realtime direct), le tarif affiché expliquait moins de la moitié du chiffre final.

Hypothèses maintenues constantes pour les quatre :

  • 4 minutes de durée totale
  • ~12 tours de conversation, ~150 tokens d'entrée + 100 tokens de sortie par tour = 1 800 en / 1 200 out pour GPT-4o-mini
  • Le TTS produit ~400 caractères par tour × 12 = 4 800 caractères (ElevenLabs Turbo @ $0,10/min sortie audio)
  • Le STT facture les 4 minutes complètes (Deepgram Nova-2 @ ~$0,0043/min)
  • Twilio sortant US @ $0,014/min, $1/mois de numéro amorti sur 1 000 appels/mois = $0,001/appel

Vapi BYOK : $0,05 → $0,27/min

PosteCoût
Frais de plateforme Vapi (4 min × $0,05)$0,200
GPT-4o-mini (1 800 in × $0,15/M + 1 200 out × $0,60/M)$0,001
ElevenLabs Turbo (4 min × $0,10)$0,400
Deepgram STT (4 min × $0,005)$0,020
Twilio (4 min × $0,014)$0,056
Location de numéro amortie$0,001
Total pour l'appel$0,678
$/min effectif$0,170

Note : ElevenLabs Turbo sur le plan Conversational est plus proche de $0,10/min, pas en forfait fixe, donc le calcul est une facturation par minute de sortie audio. Des frais de plateforme de $0,05/min plus GPT-4o-mini plus ElevenLabs Turbo plus Twilio donnent plutôt $0,17–$0,27/min, pas $0,05.

Retell bundled : $0,10 → $0,16/min

PosteCoût
Bundle Retell (4 min × $0,13, GPT-4o-mini + Retell TTS)$0,520
Pass-through Twilio (4 min × $0,014)$0,056
Location de numéro amortie$0,002
Total pour l'appel$0,578
$/min effectif$0,145

Le bundle de Retell inclut le LLM (vous choisissez le modèle), le STT et leur propre TTS. Vous payez juste Twilio en plus. C'est tout.

Bland forfait fixe : $0,09 → $0,13/min

PosteCoût
Forfait Bland (4 min × $0,09)$0,360
Pass-through Twilio (4 min × $0,014)$0,056
Location de numéro amortie$0,001
Total pour l'appel$0,417
$/min effectif$0,104

Bland propose le calcul le plus clair du marché. Un seul chiffre, plus l'opérateur. Le piège se cache dans les frais cachés — les minutes de transfert se facturent à $0,025/min en plus.

OpenAI Realtime direct (sans caching) : $0,30/min

PosteCoût
OpenAI Realtime audio in (4 min × ~$0,077)$0,308
OpenAI Realtime audio out (4 min × ~$0,077)$0,308
Twilio (4 min × $0,014)$0,056
Location de numéro amortie$0,001
Total pour l'appel$0,673
$/min effectif$0,168

Ce chiffre suppose que vous mettez les prompts système en cache. Sans caching, le même appel atterrit plutôt à $1,20 ($0,30/min) car chaque tour refacture le prompt système complet aux tarifs frais. Nous détaillons ce calcul ci-dessous.

Décomposition du coût d'un agent vocal montrant les couches frais de plateforme, LLM, TTS, STT et téléphonie pour un appel sortant de 4 minutes

Bundled vs BYOK : quel modèle tarifaire vous convient ?

Les plateformes bundled gagnent quand vous voulez une seule facture, un calcul prévisible à la minute et une voix de bonne qualité de base. BYOK gagne quand vous avez de la capacité engineering, voulez choisir votre propre LLM et prévoyez de négocier les tarifs opérateur à grande échelle. La décision se résume généralement à deux questions : avez-vous une préférence de ligne de facturation, et avez-vous un développeur qui sera propriétaire du stack ?

Cas d'usageBundled gagne carBYOK gagne car
Déviation du support entrantUn seul fournisseur, une seule facture, HIPAA inclusDifficile de justifier le coût d'engineering
Démarchage sortant à grande échelleLe calcul fixe bat les surprises par tokenVous pouvez négocier les minutes opérateur à plus de 100k/mois
RAG personnalisé + usage d'outilsSurface d'appel d'outils limitée dans la plupart des bundlesContrôle total sur la fenêtre de contexte
Industries réglementéesLe flag HIPAA s'active en cochant une caseLa conformité devient votre problème

Règle de décision rapide :

  • Moins de 10 000 minutes/mois → le bundled gagne presque toujours en coût total de possession (le seul temps d'engineering rentabilise l'écart).
  • 10 000–100 000 minutes/mois → BYOK commence à être rentable si vous avez 1+ développeur dessus.
  • Au-delà de 100 000 minutes/mois → BYOK ou direct-on-Realtime est généralement $0,05–$0,10/min moins cher, et vous avez un levier pour négocier les tarifs de sous-compte Twilio.

Pour un angle plus approfondi sur les coûts LLM côté BYOK, consultez notre analyse des choix d'orchestration dans les meilleurs frameworks d'agents IA.

Les frais cachés que la plupart des gens manquent

Même quand vous maîtrisez le calcul des quatre couches, la facture arrive avec des postes que la page d'accueil n'a jamais mentionnés. Ces sept-là sont ceux qu'on voit frapper les clients le plus souvent. La plupart sont enfouis dans les petits caractères des pages de tarifs ou dans des écrans de configuration post-inscription. Ce n'est pas de la malveillance, juste un manque de communication.

  1. Add-on HIPAA. Vapi facture $2 000/mois pour HIPAA selon sa page de tarifs. Retell, Bland et Synthflow incluent HIPAA sans supplément. Si vous êtes dans le secteur de la santé et pesez Vapi, c'est $24k/an avant d'avoir passé un seul appel.
  2. La taxe d'arrondi à la minute. La plupart des plateformes arrondissent à des intervalles de 60 secondes : un appel de 61 secondes est facturé 2 minutes. Avec 5 000 appels/mois et une distribution typique de 45–90 secondes, c'est un uplift effectif de 5–8% par rapport à ce que dit votre calcul $/min. La facturation à la seconde (Bland, Deepgram) évite ça.
  3. Locations de numéros de téléphone. Twilio : $1–$2/mois par numéro. Retell : $2/mois par numéro, $10/mois pour les numéros vérifiés. Ça semble minuscule jusqu'à ce que vous gériez 50 numéros sortants pour du démarchage ; c'est un poste de $100/mois que personne n'a devisé.
  4. Frais de concurrence. Retell inclut une base d'appels simultanés ; au-delà, c'est $8/concurrence/mois. Une équipe qui dépasse la baseline avec 10 appels simultanés ajoute $80/mois.
  5. Frais de transfert. Bland facture $0,025/min quand l'agent transfère à un humain. Si 20% de vos appels sont transférés, c'est une taxe significative sur la minute moyenne.
  6. Frais de base de connaissances. Retell vous donne 10 KB gratuits ; chaque supplémentaire coûte $8/mois. Sur des cas d'usage RAG intensifs, ça s'accumule vite.
  7. Upsells de voix premium. ElevenLabs Premium ajoute +$0,04/min par rapport à Turbo. Ça semble optionnel jusqu'à ce que votre équipe commerciale fasse des A/B tests et découvre que Premium convertit 11% mieux.

Vous avez besoin de quelqu'un pour détailler votre cas d'usage spécifique avant de signer un contrat Vapi ? Nous le faisons dans le cadre de nos engagements de construction d'agents vocaux.

Tokens audio et prompt caching : le levier de coût que personne n'explique

OpenAI Realtime API facture par tokens audio, où 1 token = 100ms d'audio en entrée ou 50ms d'audio en sortie. Un appel de 60 secondes utilise environ 600 tokens en entrée (l'appelant parle) et 1 200 tokens en sortie (l'agent répond). À $32/M en entrée et $64/M en sortie, ça donne $0,0192 entrée + $0,0768 sortie = $0,096 de coût audio brut par minute, soit environ $0,10/min avant d'ajouter les prompts, les outils ou Twilio.

Puis il y a le prompt système. Chaque tour envoie votre prompt système complet au modèle dans la fenêtre de contexte. Un agent vocal typique a un prompt système de 2 000 tokens couvrant la persona, les outils, les cas limites et la logique de refus. Sans caching, ce bloc de 2 000 tokens est facturé à $32/M en frais frais à chaque appel : $64 pour 1 000 appels.

Avec le prompt caching activé (les tokens en cache coûtent $0,40/M selon la documentation d'OpenAI), la même charge de 1 000 appels est facturée $0,80. C'est une réduction de 80× sur le coût du prompt système. Le prompt caching sur OpenAI Realtime réduit le coût de votre prompt système de 80×. La plupart des équipes le découvrent seulement après leur première facture mensuelle.

Voici le calcul en code :

python
# Calcul du coût en tokens audio pour OpenAI Realtime
# Entrée : 1 token / 100ms = 600 tokens/min
# Sortie : 1 token / 50ms = 1 200 tokens/min

INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000

# Tarifs frais
COST_IN_FRESH = 32 / 1_000_000   # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000  # Réduction 80x

# Coût audio brut (par appel, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0,096/min

# Prompt système sur 1 000 appels
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS    # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS  # $0,80
print(f"Frais frais : ${prompt_fresh:.2f} | En cache : ${prompt_cached:.2f}")
# Frais frais : $64.00 | En cache : $0.80

Diagramme de facturation en tokens audio montrant les tokens d'entrée OpenAI Realtime à 100ms et les tokens de sortie à 50ms sur un appel de 60 secondes

Dans notre travail de modélisation des coûts pour les clients qui construisent directement sur Realtime, c'est le levier unique entre « Realtime est pas cher » et « Realtime coûte le double de Vapi ». Si vous utilisez l'API Responses en parallèle de Realtime pour les appels d'outils, consultez notre tutoriel OpenAI Responses API pour le modèle d'implémentation. C'est pourquoi construire directement sur OpenAI Realtime peut être moins cher ou bien plus coûteux que Vapi, selon que vous mettez en cache ou non.

Comment calculer votre propre TCO (formule + Python)

Le coût total de possession d'un agent vocal est le coût variable par minute plus les frais fixes mensuels amortis sur votre volume de minutes. La formule :

TCO/min = frais_plateforme + coût_LLM + coût_STT + coût_TTS + téléphonie + (location_numéro + frais_concurrence + frais_KB) / minutes_par_mois

Branchez vos chiffres. Ou forkez ça :

python
def tco_per_minute(
    calls_per_month: int,
    avg_duration_seconds: float,
    platform_fee_per_min: float,        # ex. 0.05 pour Vapi, 0.13 pour bundle Retell
    llm_in_per_1m: float,               # ex. 0.15 pour GPT-4o-mini entrée
    llm_out_per_1m: float,              # ex. 0.60 pour GPT-4o-mini sortie
    llm_in_tokens_per_call: int,        # ex. 1800
    llm_out_tokens_per_call: int,       # ex. 1200
    tts_per_min: float,                 # ex. 0.10 pour ElevenLabs Turbo
    stt_per_min: float,                 # ex. 0.005 pour Deepgram Nova-2
    telephony_per_min: float,           # ex. 0.014 pour Twilio US
    fixed_monthly: float = 0.0,         # locations de numéros, KB, HIPAA, concurrence
) -> dict:
    """Retourne le coût total de possession mensuel et par minute."""
    minutes_per_month = (calls_per_month * avg_duration_seconds) / 60

    # Variable par appel
    llm_cost_per_call = (
        (llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
        + (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
    )
    avg_minutes_per_call = avg_duration_seconds / 60
    variable_per_call = (
        platform_fee_per_min * avg_minutes_per_call
        + llm_cost_per_call
        + tts_per_min * avg_minutes_per_call
        + stt_per_min * avg_minutes_per_call
        + telephony_per_min * avg_minutes_per_call
    )

    monthly_variable = variable_per_call * calls_per_month
    monthly_total = monthly_variable + fixed_monthly
    cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0

    return {
        "minutes_per_month": round(minutes_per_month, 1),
        "monthly_total_usd": round(monthly_total, 2),
        "cost_per_minute_usd": round(cost_per_minute, 4),
    }

# Exemple : 5 000 appels/mois, 4 min en moyenne, stack Vapi BYOK
print(tco_per_minute(
    calls_per_month=5000,
    avg_duration_seconds=240,
    platform_fee_per_min=0.05,
    llm_in_per_1m=0.15, llm_out_per_1m=0.60,
    llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
    tts_per_min=0.10,
    stt_per_min=0.005,
    telephony_per_min=0.014,
    fixed_monthly=2.0,  # $2/mois de location de numéro
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}

Quatre étapes numérotées pour quiconque fait une prévision depuis zéro :

  1. Estimez votre volume d'appels mensuel et la durée moyenne d'un appel.
  2. Choisissez votre stack : plateforme + LLM + TTS + STT + téléphonie.
  3. Récupérez le tarif unitaire de chaque composant sur la page de tarifs du fournisseur.
  4. Exécutez la formule (ou la fonction Python ci-dessus) — le résultat est votre $/min prévu et votre montant mensuel.

Si vous ne pouvez pas écrire votre TCO comme une formule en une ligne, vous allez perdre ça sur une taxe d'arrondi à la minute.

Coût à grande échelle : 1k vs 10k vs 100k minutes par mois

Les courbes divergent rapidement au-delà de 10 000 minutes. Les plateformes bundled s'aplatissent parce que leur facture n'est que minutes × tarif. Les stacks BYOK s'accentuent car les coûts LLM et TTS scalent linéairement avec vous. OpenAI Realtime avec caching croise Vapi autour de 10k–20k minutes/mois, le point d'inflexion où le direct-on-infra commence à avoir du sens.

Plateforme1 000 min/mois10 000 min/mois100 000 min/mois
Bland forfait $0,09/min + Twilio$120$1 160$11 400
Bundle Retell ~$0,145/min tout compris$145$1 450$14 500
Vapi BYOK ~$0,17/min tout compris$170$1 700$17 000
OpenAI Realtime + caching ~$0,13/min$130$1 300$13 000
Deepgram Voice Agent + Twilio$108$1 080$10 800

Chiffres dérivés de la formule tco_per_minute() ci-dessus avec les hypothèses canoniques d'appel de 4 minutes. Ajoutez HIPAA ($2 000/mois Vapi), la concurrence et les locations de numéros là où elles s'appliquent. Elles ne changent pas la forme des courbes mais elles élèvent le plancher pour les acheteurs à faible volume.

Le graphique hero en haut de cet article visualise les mêmes chiffres : Bland s'aplatit tôt, Vapi monte à mesure que les coûts LLM scalent, et OpenAI Realtime avec caching bat Vapi au-delà de 10k minutes.

Quand vous ne devriez PAS déployer un agent vocal

La voice AI a un vrai plancher de $0,10–$0,30/min. En dessous de 200 appels par mois, un humain plus un SaaS à $19 gagne encore en termes de coût. Les locations de numéros, les bases de concurrence et les minimums de plateforme s'accumulent pour créer un overhead de $50–$200/mois qu'une équipe à faible volume ne récupère tout simplement pas.

Trois critères « laissez tomber », honnêtement :

  1. Moins de 200 appels/mois. Les locations de numéros + frais minimaux + bases de concurrence dépassent ce que coûte un humain à temps partiel à $20/h. Le break-even ne tient pas.
  2. Travail à fort contexte et faible volume. Votre unique humain gère 15 appels par jour, chacun avec 30+ schémas de faits uniques. Le coût des hallucinations LLM (remboursements, deals perdus, rendez-vous incorrects) mange les économies. La voice AI brille sur les flux répétitifs, pas sur les travaux à forte concentration de cas limites.
  3. Industries réglementées sans budget HIPAA. L'add-on HIPAA à $2k/mois de Vapi, les frais de conformité opérateur et les garde-fous PII ($0,005–$0,01/min chez Retell) peuvent s'effondrer sur le calcul. Si vous ne pouvez pas budgéter $25k/an rien que pour les postes de conformité, pilotez d'abord sur des flux non-PHI.

En test, le point de break-even contre un agent humain pour la déviation du support tombe autour de 250–400 appels/mois aux tarifs bundled typiques. En dessous, un SaaS à $19/mois plus un humain est moins cher. Ne déployez pas de voice AI juste parce que vous le pouvez.

Sol de call center abandonné au crépuscule avec des casques inutilisés symbolisant la réalité du plancher de coût de la voice AI

Si la voice AI franchit le seuil du coût mais que vous ne voulez pas câbler Retell ou Vapi vous-même, notre service de développement d'agents vocaux construit et opère le stack complet sur votre infrastructure.

Comment nous choisirions vraiment une plateforme en 2026 (verdict par cas d'usage)

Aucune plateforme ne gagne partout. Le choix le moins cher dépend de si vous faites de l'entrant ou du sortant, de si vous avez une capacité engineering, et de si HIPAA compte. Cinq cas d'usage, cinq réponses :

  • Sortant le moins cher (démarchage) : Bland. Forfait $0,09/min, frais de transfert transparents, pas de surprises de coût LLM. À éviter si vous avez besoin de RAG profond ou d'outils personnalisés.
  • Entrant le moins cher (déviation du support) : Retell. Bundled, HIPAA inclus, analytique mature, $0,12–$0,18 tout compris. À éviter si votre volume entrant est inférieur à 200 appels/mois (voir la section précédente).
  • Contrôle maximal + RAG personnalisé : Vapi BYOK. Seulement si vous avez la capacité engineering pour gérer les clés LLM, TTS et STT. Le contrôle vaut $0,27/min uniquement si vous pouvez négocier l'opérateur et le LLM en volume.
  • Simplicité bundled à grande échelle : Deepgram Voice Agent. $4,50/h ($0,075/min) fixe, l'option la plus sous-estimée du marché. À éviter si vous avez besoin de la large bibliothèque de voix qu'offre ElevenLabs.
  • Niveau de qualité conversationnelle (démos commerciales, flux sensibles à la marque) : ElevenLabs Conversational. Voix Turbo ou Premium à $0,10–$0,12/min. Payez le supplément quand la qualité vocale est le levier de conversion.

Pour une vision plus approfondie sur le secteur enterprise, consultez les agents vocaux IA pour les centres d'appels enterprise : même calcul, avec des hypothèses de volume spécifiques aux restaurants et aux cliniques.

Comment Techsy aborde la modélisation des coûts pour les agents vocaux

Nous ne vendons pas de plateforme vocale. Nous construisons des agents vocaux en production pour des clients sur Retell, Vapi, Deepgram et OpenAI Realtime. Ça signifie que quand nous modélisons les coûts pour un nouvel engagement, nous exécutons la formule tco_per_minute() sur trois paliers de volume (1k, 10k, 100k minutes/mois) avant de recommander un stack. La plateforme qui gagne à 1k perd souvent à 100k.

Nous négocions les tarifs de sous-compte Twilio pour les clients au-delà de 100k minutes/mois (les sous-comptes débloquent des paliers de volume que la plupart des équipes ne savent pas exister), et nous modélisons toujours les économies du prompt caching sur les builds Realtime avant de valider une conception en direct-infra. La moitié de notre travail de modélisation des coûts pour les clients consiste à défaire des hypothèses que quelqu'un a faites depuis un article de blog d'un fournisseur.

Vous voulez un agent vocal construit de bout en bout sur la plateforme qui gagne vraiment pour votre volume ? Voir comment nous construisons des agents vocaux →

FAQ

Combien coûte un agent vocal IA par minute en 2026 ? Le coût tout compris varie de $0,07 à $0,30 par minute. Les plateformes bundled (Retell, Bland, ElevenLabs Conversational) arrivent à $0,10–$0,18/min une fois la téléphonie incluse. Les plateformes BYOK comme Vapi atteignent $0,13–$0,31/min après l'ajout des coûts LLM, TTS, STT et Twilio. OpenAI Realtime direct se situe autour de $0,30/min brut ou environ $0,12/min avec le prompt caching activé sur les prompts système.

Quelle est la plateforme d'agent vocal IA la moins chère ? Pour le sortant, Bland AI à $0,09/min fixe propose le calcul le plus clair du marché. Pour le support entrant, Retell à $0,10–$0,16 tout compris gagne généralement grâce au HIPAA bundled et aux bases de concurrence. Pour les setups purement infrastructure avec caching, OpenAI Realtime peut descendre sous $0,15/min. Deepgram Voice Agent à $0,075/min fixe est l'option la plus méconnue.

Pourquoi ma facture Vapi est-elle plus haute que $0,05/min ? Les $0,05/min sur la page de tarifs de Vapi correspondent uniquement aux frais de plateforme. Vapi est BYOK : vous apportez vos propres clés pour le LLM (GPT-4o-mini, Claude, etc.), le TTS (ElevenLabs, PlayHT), le STT (Deepgram) et la téléphonie (Twilio). Le coût réel tout compris arrive à $0,13–$0,31/min selon la voix et le modèle choisis.

Quelle est la différence entre BYOK et les tarifs bundled ? Les plateformes bundled (Retell, Bland, Synthflow, ElevenLabs Conversational) incluent LLM, STT et TTS dans un tarif unique à la minute. Les plateformes BYOK (Vapi) ne facturent que l'orchestration — vous apportez vos propres clés API pour tout le reste et êtes facturé séparément par chaque fournisseur. Le bundled est plus simple ; BYOK vous donne le contrôle et le levier de négociation à grande échelle.

Y a-t-il des frais cachés dans les tarifs des agents vocaux IA ? Oui, sept courants. Les add-ons HIPAA ($2 000/mois chez Vapi), l'arrondi à la minute (uplift effectif de 5–8% à grande échelle), les locations de numéros ($1–$2/mois), les frais de concurrence ($8/concurrence/mois chez Retell), les frais de transfert ($0,025/min chez Bland), les frais de base de connaissances ($8/mois par KB chez Retell) et les upsells de voix premium (+$0,04/min ElevenLabs Premium vs Turbo).

L'API OpenAI Realtime est-elle moins chère que Vapi ? Sans prompt caching, non : OpenAI Realtime coûte environ $0,30/min de coût audio brut. Avec le prompt caching activé (tokens de prompt système en cache à $0,40/M vs $32/M frais, une réduction de 80×), le poste prompt système s'effondre et le coût total descend à environ $0,12–$0,15/min. Ça le rend compétitif avec les plateformes bundled au-delà de 10k minutes/mois.

Comment prévoir mon coût mensuel d'agent vocal ? Estimez les appels par mois multipliés par la durée moyenne d'appel en minutes. Multipliez par le $/min tout compris de votre plateforme. Ajoutez les frais fixes mensuels : locations de numéros, frais de KB, base de concurrence, add-on HIPAA si applicable. La fonction Python tco_per_minute() ci-dessus automatise ça avec un seul appel de fonction que vous pouvez coller dans un notebook Jupyter.

Facturation à la minute ou à la seconde : laquelle est moins chère ? La facturation à la seconde est significativement moins chère pour les appels sortants courts. Un appel de 61 secondes facturé par tranches de 60 secondes coûte 2 minutes, soit une taxe effective de 5–8% sur 5 000 appels par mois avec une distribution typique d'appels courts. Bland et Deepgram facturent à la seconde ; la plupart des plateformes BYOK héritent de l'arrondi à 60 secondes de Twilio par défaut.

Existe-t-il des agents vocaux IA gratuits ? Des versions d'essai existent : la plupart des fournisseurs offrent 10–60 minutes gratuites (Retell, Vapi, Bland) pour tester. De vrais agents vocaux gratuits en production n'existent pas car vous payez toujours les minutes opérateur au minimum ($0,014/min sur Twilio US sortant). Même les stacks open-source auto-hébergés (Pipecat, LiveKit Agents) vous laissent payer le télécom et le LLM.

Quel est le ROI de la voice AI vs un agent humain ? Les agents humains coûtent $15–$30/h tout compris, ce qui correspond à $0,25–$0,50/min. La voice AI à $0,10–$0,20/min bat le coût humain à partir d'environ 200 appels par mois, en supposant des taux de résolution comparables. En dessous de ce volume, les minimums de plateforme et l'overhead de location de numéro font d'un humain plus un SaaS à $19/mois la réponse la moins chère.


Ce guide est maintenu par l'équipe éditoriale de Techsy. Nous construisons des agents vocaux IA en production sur Retell, Vapi et OpenAI Realtime pour des clients ; ces chiffres proviennent du travail de modélisation des coûts que nous effectuons chaque semaine, pas de brochures de fournisseurs. Tarifs vérifiés en mai 2026 ; confirmez toujours avec les pages de tarifs des fournisseurs avant de signer.

Tags

ai-voice-agent-pricingvoice-airetell-aivapibland-aillm-costopenai-realtime

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.