
KI-Sprachagenten Preise 2026: Die $0,05 vs. $0,30 pro Minute Wahrheit (mit Rechenbeispielen)
Vapi schreibt „$0,05/Min" auf seine Preisseite. Ihre erste Monatsrechnung kommt bei $0,27/Min an. Was ist passiert? Jede Voice-AI-Plattform bewirbt eine Zahl — die Plattformgebühr — und stellt Ihnen vier weitere Ebenen in Rechnung, die auf der Startseite nirgends erwähnt wurden. Dieser Leitfaden baut die KI-Sprachagenten-Preise von Grund auf neu auf: echte BYOK-Kosten für 8 Plattformen, der Audio-Token-Posten, den niemand erklärt, und eine Python-Funktion, die Sie für Ihre eigene Kostenprognose nutzen können.

Kurze Antwort
- Die tatsächlichen Gesamtkosten 2026 liegen zwischen $0,07–$0,30/Min, abhängig von Bundled vs. BYOK.
- Bundle-Plattformen (Retell, Bland, ElevenLabs) werben mit $0,07–$0,12/Min und landen bei $0,10–$0,18/Min.
- BYOK-Plattformen (Vapi $0,05/Min Plattformgebühr) landen bei $0,13–$0,31/Min nach LLM + TTS + STT + Twilio.
- Der größte versteckte Hebel ist Prompt-Caching bei OpenAI Realtime: bis zu 80× günstiger bei System-Prompts.
Was kostet ein KI-Sprachagent wirklich im Jahr 2026?
Die meisten KI-Sprachagenten kosten $0,07 bis $0,30 pro Minute insgesamt im Jahr 2026. Bundle-Plattformen (Retell, Bland, ElevenLabs) werben mit $0,07–$0,12/Min und landen bei $0,10–$0,18/Min. BYOK-Plattformen (Vapi mit $0,05/Min Plattformgebühr) landen bei $0,13–$0,31/Min, sobald LLM, TTS, STT und Twilio hinzukommen. Direkt über OpenAI Realtime kostet es ohne Caching rund $0,30/Min.
Drei Kategorien erklären fast alles, was Sie auf Ihrer Rechnung sehen werden:
- Pauschal pro Minute (Bundled): Retell AI ($0,07–$0,31/Min), Bland AI ($0,09/Min pauschal), Synthflow und ElevenLabs Conversational. Eine Zahl, alles inklusive.
- BYOK-Orchestrierung: Vapi berechnet $0,05/Min nur für die Call-Handling-Schicht. LLM-Tokens, TTS-Zeichen, STT-Minuten und der Carrier werden separat über Ihre eigenen Accounts abgerechnet.
- Direkt auf Infrastruktur: Aufbau direkt auf OpenAI Realtime plus Twilio. Günstigster bei Scale wenn Sie Prompts cachen. Teuer, wenn nicht.
Der Rest dieses Beitrags erklärt die Kalkulation Schicht für Schicht und liefert dann eine Python-Funktion tco_per_minute(), die Sie in ein Notebook einfügen können.
Warum der beworbene Minutenpreis eine Lüge ist (die 4 Kostenebenen)
Die beworbene $0,05/Min Plattformgebühr deckt nur die Orchestrierung ab. Die anderen vier Ebenen stapeln sich obendrauf. Jeder produktive Sprachagent im Jahr 2026 zahlt fünf Posten: Telefonie, STT, das LLM, TTS und die Plattformgebühr, die alles zusammenhält. Lassen Sie einen davon weg und Sie haben keinen funktionierenden Agenten.
Hier ist der Boden, Schicht für Schicht.
Ebene 1: Telefonie (die Carrier-Minute)
Sie zahlen ein echtes Telekommunikationsunternehmen für den Ton, der ins und aus dem öffentlichen Telefonnetz geht. Twilio Programmable Voice berechnet $0,014/Min ausgehend in den USA, plus $1–$2/Monat pro Telefonnummer. Twilio Elastic SIP liegt je nach Herkunft bei $0,0053–$0,042/Min. Die meisten Voice-AI-Plattformen verkaufen Twilio entweder mit kleinem Aufschlag weiter oder geben es direkt durch. So oder so: $0,014/Min in Ihrer Tabelle.
Ebene 2: Speech-to-Text (STT)
Sie wandeln das Gesprochene in Text um, den das LLM lesen kann. Deepgram Nova-2 Streaming kostet etwa $0,0043/Min im Pay-as-you-go-Tarif, in der Praxis also $0,005/Min. Premium-Modelle (Whisper-Äquivalent) steigen auf $0,018/Min. Bundle-Plattformen verstecken das in ihrer Hauptrate, aber es steckt trotzdem drin.
Ebene 3: Das LLM (Text oder Audio)
Zwei Wege stehen zur Wahl. Text-Mode-Pipelines speisen transkribiertes Audio in ein Modell wie GPT-4o-mini ($0,15/M Input, $0,60/M Output) und geben die Antwort an TTS weiter. Eine Voice-Loop verbraucht typischerweise 100–300 Input-Tokens und 80–200 Output-Tokens pro Turn, was etwa $0,003–$0,015/Min für GPT-4o-mini ergibt, $0,015–$0,04/Min für Claude Haiku. Audio-Mode-Pipelines (OpenAI Realtime) überspringen den Transkriptions-/Synthese-Schritt und rechnen direkt in Audio-Tokens ab. Dazu haben wir weiter unten einen eigenen Abschnitt — das ist der Kostenhebel, den niemand erklärt.
Ebene 4: Text-to-Speech (TTS)
Sie synthetisieren die Antwort zurück in Audio. ElevenLabs Turbo kostet $0,10/Min im Conversational-Tarif, Premium-Stimmen steigen auf $0,12/Min. Günstigere Stimmen (Deepgram Aura, OpenAI tts-1) liegen bei $0,04–$0,06/Min. Das ist meist der zweitgrößte Posten nach der Plattformgebühr.
Addieren Sie alles: $0,014 Telefonie + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 Plattform = $0,114/Min Minimum auf einem BYOK-Stack. Das ist noch ohne HIPAA, Parallelität oder Nummernmieten. Wenn Sie den direkten Feature-Vergleich nach dieser Preisübersicht möchten, lesen Sie unseren Retell AI vs. Vapi vs. Bland Vergleich.
Die 8 Plattformen im Vergleich (Preistabelle Mai 2026)
Die folgende Tabelle zeigt Headline-Rates und realistische Gesamtpreise von den Preisseiten der jeweiligen Anbieter. Nutzen Sie diese als Referenz, nicht als Evangelium: Preisseiten ändern sich, und Ihre Stack-Entscheidungen verändern das Ergebnis.
| Plattform | Preismodell | Headline-Rate | Realer Gesamtpreis (typisch) | HIPAA | BYOK oder Bundled | Besonderer Knackpunkt |
|---|---|---|---|---|---|---|
| Retell AI | Pro Minute | $0,07–$0,31/Min | $0,12–$0,18/Min | Inklusive | Bundled | Parallelität $8/Monat je über Inklusivmenge |
| Vapi | Plattformgebühr + BYOK | $0,05/Min | $0,13–$0,31/Min | +$2.000/Monat | BYOK | Alle vier Ebenen extra |
| Bland AI | Pauschale pro Minute | $0,09/Min | $0,09–$0,14/Min | Inklusive | Bundled | $0,025/Min Transfergebühr |
| Synthflow | Pro Minute im Tarif | $0,09/Min Basis | $0,11–$0,15/Min | Inklusive | Bundled | Tarifstaffeln $29/$99/$449/$899 |
| ElevenLabs Conversational | Pro Minute | $0,08–$0,12/Min | $0,10–$0,18/Min | Workspace-Tarif | Bundled | LLM extra, außer beim Managed-Tarif |
| Deepgram Voice Agent | Pro Stunde | $4,50/Std ($0,075/Min) | $0,09–$0,11/Min + Telefonie | Ja | Bundled | Twilio zusätzlich |
| OpenAI Realtime API | Audio-Tokens | $32/M Input, $64/M Output | ~$0,30/Min roh, ~$0,12 gecacht | DIY | Direkt | Audio-Token-Kalkulation (siehe unten) |
| Twilio (Telefonie-Ebene) | Pro Minute | $0,014/Min US ausgehend | $0,014/Min | n/a | n/a | Telefonnummern $1–$2/Monat |
Preise verifiziert im Mai 2026. Überprüfen Sie immer die Preisseiten der Anbieter vor der Unterzeichnung: Vapi hat sein HIPAA-Add-on allein im letzten Jahr zweimal geändert.
Praxisbeispiel: Was kostet ein 4-minütiger Ausgehendanruf wirklich?
Das typische Szenario: ein 4-minütiger ausgehender Anruf, GPT-4o-mini als LLM, ElevenLabs Turbo als Stimme, Twilio US als Carrier, nur Englisch. Als wir dieses exakte Szenario für alle vier Plattformen (Vapi, Retell, Bland, OpenAI Realtime direkt) durchgeführt haben, erklärte die Headline-Rate weniger als die Hälfte der Endzahl.
Annahmen, die für alle vier konstant gehalten wurden:
- 4 Minuten Gesamtdauer
- ~12 Gesprächsrunden, ~150 Input-Tokens + 100 Output-Tokens pro Runde = 1.800 in / 1.200 out für GPT-4o-mini
- TTS produziert ~400 Zeichen pro Runde × 12 = 4.800 Zeichen (ElevenLabs Turbo @ $0,10/Min Audio-Output)
- STT rechnet die vollen 4 Minuten ab (Deepgram Nova-2 @ ~$0,0043/Min)
- Twilio ausgehend USA @ $0,014/Min, $1/Monat Nummer auf 1.000 Anrufe/Monat amortisiert = $0,001/Anruf
Vapi BYOK: $0,05 → $0,27/Min
| Posten | Kosten |
|---|---|
| Vapi Plattformgebühr (4 Min × $0,05) | $0,200 |
| GPT-4o-mini (1.800 in × $0,15/M + 1.200 out × $0,60/M) | $0,001 |
| ElevenLabs Turbo (4 Min × $0,10) | $0,400 |
| Deepgram STT (4 Min × $0,005) | $0,020 |
| Twilio (4 Min × $0,014) | $0,056 |
| Nummernmiete amortisiert | $0,001 |
| Gesamtkosten für den Anruf | $0,678 |
| Effektiver $/Min | $0,170 |
Hinweis: ElevenLabs Turbo im Conversational-Tarif liegt näher an $0,10/Min, nicht als Pauschale, sodass die Kalkulation eine Minutengebühr für Audio-Output ist. Eine $0,05/Min-Plattformgebühr plus GPT-4o-mini plus ElevenLabs Turbo plus Twilio ergibt zusammen eher $0,17–$0,27/Min, nicht $0,05.
Retell Bundled: $0,10 → $0,16/Min
| Posten | Kosten |
|---|---|
| Retell Bundle (4 Min × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Twilio Durchleitung (4 Min × $0,014) | $0,056 |
| Nummernmiete amortisiert | $0,002 |
| Gesamtkosten für den Anruf | $0,578 |
| Effektiver $/Min | $0,145 |
Retells Bundle enthält LLM (Modellwahl freigestellt), STT und deren eigene TTS. Sie zahlen nur noch Twilio obendrauf. Das war's.
Bland Pauschale: $0,09 → $0,13/Min
| Posten | Kosten |
|---|---|
| Bland pauschale (4 Min × $0,09) | $0,360 |
| Twilio Durchleitung (4 Min × $0,014) | $0,056 |
| Nummernmiete amortisiert | $0,001 |
| Gesamtkosten für den Anruf | $0,417 |
| Effektiver $/Min | $0,104 |
Bland ist die klarste Kalkulation im SERP. Eine Zahl, plus Carrier. Der Haken liegt in versteckten Gebühren — Transferminuten werden mit $0,025/Min zusätzlich berechnet.
OpenAI Realtime direkt (ohne Caching): $0,30/Min
| Posten | Kosten |
|---|---|
| OpenAI Realtime Audio in (4 Min × ~$0,077) | $0,308 |
| OpenAI Realtime Audio out (4 Min × ~$0,077) | $0,308 |
| Twilio (4 Min × $0,014) | $0,056 |
| Nummernmiete amortisiert | $0,001 |
| Gesamtkosten für den Anruf | $0,673 |
| Effektiver $/Min | $0,168 |
Diese Zahl setzt voraus, dass Sie System-Prompts cachen. Ohne Caching landet der gleiche Anruf näher bei $1,20 ($0,30/Min), weil jeder Turn den vollständigen System-Prompt zu Frischpreisen abrechnet. Wir erklären diese Kalkulation weiter unten.

Bundled vs. BYOK: Welches Preismodell gewinnt für Sie?
Bundle-Plattformen gewinnen, wenn Sie eine einzige Rechnung, kalkulierbare Minutenpreise und eine solide Basisstimme möchten. BYOK gewinnt, wenn Sie technische Kapazität haben, Ihr eigenes LLM wählen möchten und planen, Carrier-Raten bei Scale zu verhandeln. Die Entscheidung hängt meistens von zwei Fragen ab: Haben Sie eine Präferenz für Abrechnungszeilen, und haben Sie einen Entwickler, der den Stack verantwortet?
| Anwendungsfall | Bundled gewinnt, weil | BYOK gewinnt, weil |
|---|---|---|
| Eingehende Support-Deflection | Ein Anbieter, eine Rechnung, HIPAA inklusive | Engineeringkosten lassen sich kaum rechtfertigen |
| Ausgehende Kaltakquise bei Scale | Pauschale Kalkulation schlägt Token-Überraschungen | Sie können Carrier-Minuten über 100k/Monat verhandeln |
| Custom RAG + Tool-Nutzung | Begrenzte Tool-Call-Oberfläche in den meisten Bundles | Volle Kontrolle über das Kontextfenster |
| Regulierte Branchen | HIPAA-Flag per Checkbox aktivierbar | Compliance wird Ihr Problem |
Schnelle Entscheidungsregel:
- Unter 10.000 Minuten/Monat → Bundled gewinnt fast immer bei den Gesamtbetriebskosten (allein die Entwicklungszeit macht Break-even).
- 10.000–100.000 Minuten/Monat → BYOK beginnt sich auszuzahlen, wenn Sie 1+ Entwickler dafür haben.
- Über 100.000 Minuten/Monat → BYOK oder Direct-on-Realtime ist meistens $0,05–$0,10/Min günstiger, und Sie haben Verhandlungsmacht für Twilio-Sub-Account-Raten.
Für eine tiefere LLM-Kosten-Perspektive auf der BYOK-Seite, lesen Sie unsere Übersicht der Orchestrierungsoptionen in beste KI-Agenten-Frameworks.
Die versteckten Gebühren, die die meisten übersehen
Selbst wenn Sie die Vier-Ebenen-Kalkulation im Griff haben, kommt die Rechnung mit Posten, die auf der Startseite nie erwähnt wurden. Diese sieben treffen Kunden am häufigsten. Die meisten davon sind im Kleingedruckten der Preisseite oder in Post-Signup-Konfigurationsbildschirmen versteckt. Sie sind nicht böswillig, nur unzureichend kommuniziert.
- HIPAA-Add-on. Vapi berechnet $2.000/Monat für HIPAA laut Preisseite. Retell, Bland und Synthflow inkludieren HIPAA ohne Aufpreis. Wenn Sie im Gesundheitswesen tätig sind und Vapi abwägen, sind das $24k/Jahr, bevor Sie einen einzigen Anruf getätigt haben.
- Minuten-Rundungssteuer. Die meisten Plattformen runden auf 60-Sekunden-Intervalle: ein 61-Sekunden-Anruf wird als 2 Minuten berechnet. Bei 5.000 Anrufen/Monat mit typischer 45–90-Sekunden-Verteilung sind das ein 5–8% effektiver Aufschlag gegenüber Ihrer $/Min-Kalkulation. Sekundenabrechnung (Bland, Deepgram) umgeht das.
- Telefonnummernmieten. Twilio: $1–$2/Monat pro Nummer. Retell: $2/Monat pro Nummer, $10/Monat für verifizierte Nummern. Klingt winzig, bis Sie 50 ausgehende Nummern für Kaltakquise betreiben; das ist ein $100/Monat-Posten, den niemand angekündigt hat.
- Parallelitätsgebühren. Retell enthält eine Basis-Parallelität; darüber hinaus sind es $8/Parallelität/Monat. Ein Team mit 10 gleichzeitigen Anrufen über die Basis hinaus zahlt $80/Monat mehr.
- Transfergebühren. Bland berechnet $0,025/Min, wenn der Agent an einen Menschen übergibt. Wenn 20% Ihrer Anrufe transferiert werden, ist das eine spürbare Steuer auf die Durchschnittsminute.
- Knowledge-Base-Gebühren. Retell gibt Ihnen 10 KBs gratis; jede weitere kostet $8/Monat. Bei RAG-lastigen Anwendungsfällen summiert sich das schnell.
- Premium-Stimmen-Upgrades. ElevenLabs Premium fügt +$0,04/Min gegenüber Turbo hinzu. Klingt optional, bis Ihr Vertriebsteam A/B-Tests macht und festellt, dass Premium 11% besser konvertiert.
Benötigen Sie jemanden, der Ihren spezifischen Anwendungsfall vor der Unterzeichnung eines Vapi-Vertrags aufschlüsselt? Wir tun das als Teil unserer Voice-Agent-Build-Engagements.
Audio-Tokens und Prompt-Caching: der Kostenhebel, den niemand erklärt
OpenAI Realtime API rechnet nach Audio-Tokens ab, wobei 1 Token = 100ms Audio-Input oder 50ms Audio-Output entspricht. Ein 60-Sekunden-Anruf verbraucht ungefähr 600 Input-Tokens (Anrufer spricht) und 1.200 Output-Tokens (Agent antwortet). Bei $32/M Input und $64/M Output ergibt das $0,0192 Input + $0,0768 Output = $0,096 reine Audio-Kosten pro Minute, also etwa $0,10/Min bevor Prompts, Tools oder Twilio hinzukommen.
Dann gibt es den System-Prompt. Jeder Turn sendet Ihren vollständigen System-Prompt als Teil des Kontextfensters an das Modell. Ein typischer Sprachagent hat einen 2.000-Token-System-Prompt, der Persona, Tools, Randfälle und Ablehnungslogik abdeckt. Ohne Caching wird dieser 2.000-Token-Block bei $32/M frisch bei jedem Anruf abgerechnet: $64 über 1.000 Anrufe.
Mit Prompt-Caching aktiviert (gecachte Token kosten $0,40/M laut OpenAI-Dokumentation) wird die gleiche 1.000-Anruf-Workload mit $0,80 abgerechnet. Das ist ein 80-facher Rabatt auf System-Prompt-Kosten. Prompt-Caching bei OpenAI Realtime senkt Ihre System-Prompt-Kosten um das 80-Fache. Die meisten Teams entdecken das erst nach der ersten Monatsrechnung.
Hier ist die Kalkulation als Code:
# Audio-Token-Kostenkalkulation für OpenAI Realtime
# Input: 1 Token / 100ms = 600 Tokens/Min
# Output: 1 Token / 50ms = 1.200 Tokens/Min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Frische Preise
COST_IN_FRESH = 32 / 1_000_000 # $/Token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x Rabatt
# Reine Audio-Kosten (pro Anruf, 1 Minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0,096/Min
# System-Prompt über 1.000 Anrufe
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0,80
print(f"Frisch: ${prompt_fresh:.2f} | Gecacht: ${prompt_cached:.2f}")
# Frisch: $64.00 | Gecacht: $0.80
In unserem Kostenmodellierungs-Aufwand für Kunden, die direkt auf Realtime aufbauen, ist das der entscheidende Hebel zwischen „Realtime ist günstig" und „Realtime kostet doppelt so viel wie Vapi". Wenn Sie die Responses API neben Realtime für Tool-Calls nutzen, finden Sie das Implementierungsmuster in unserem OpenAI Responses API Tutorial. Deshalb kann der direkte Aufbau auf OpenAI Realtime günstiger oder weit teurer als Vapi sein — je nachdem, ob Sie cachen.
Wie Sie Ihren eigenen TCO berechnen (Formel + Python)
Die Gesamtbetriebskosten für einen Sprachagenten sind die variablen Kosten pro Minute plus monatliche Fixgebühren, auf Ihr Minutenvolumen amortisiert. Die Formel:
TCO/Min = Plattformgebühr + LLM-Kosten + STT-Kosten + TTS-Kosten + Telefonie + (Nummernmiete + Parallelitätsgebühr + KB-Gebühr) / Minuten_pro_Monat
Geben Sie Ihre Zahlen ein. Oder forken Sie das hier:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # z.B. 0.05 für Vapi, 0.13 für Retell Bundle
llm_in_per_1m: float, # z.B. 0.15 für GPT-4o-mini Input
llm_out_per_1m: float, # z.B. 0.60 für GPT-4o-mini Output
llm_in_tokens_per_call: int, # z.B. 1800
llm_out_tokens_per_call: int, # z.B. 1200
tts_per_min: float, # z.B. 0.10 für ElevenLabs Turbo
stt_per_min: float, # z.B. 0.005 für Deepgram Nova-2
telephony_per_min: float, # z.B. 0.014 für Twilio US
fixed_monthly: float = 0.0, # Nummernmieten, KB, HIPAA, Parallelität
) -> dict:
"""Gibt monatliche und Gesamt-Betriebskosten pro Minute zurück."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable pro Anruf
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Beispiel: 5.000 Anrufe/Monat, 4-Min Durchschnitt, Vapi BYOK Stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/Monat Nummernmiete
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Vier nummerierte Schritte für jeden, der von Null an prognostiziert:
- Schätzen Sie Ihr monatliches Anrufvolumen und die durchschnittliche Anrufdauer.
- Wählen Sie Ihren Stack: Plattform + LLM + TTS + STT + Telefonie.
- Schauen Sie den Stückpreis jeder Komponente auf der Anbieterpreisseite nach.
- Führen Sie die Formel (oder die obige Python-Funktion) aus — der Output ist Ihr prognostizierter $/Min und monatlicher $.
Wenn Sie Ihren TCO nicht als einzeilige Formel schreiben können, verlieren Sie das auf einer Minuten-Rundungssteuer.
Kosten bei Scale: 1k vs. 10k vs. 100k Minuten pro Monat
Die Kurven divergieren schnell über 10.000 Minuten. Bundle-Plattformen flachen ab, weil ihre Rechnung einfach Minuten × Rate ist. BYOK-Stacks steigen an, da LLM- und TTS-Kosten linear mitskalieren. OpenAI Realtime mit Caching überholt Vapi bei rund 10k–20k Minuten/Monat — der Inflexionspunkt, ab dem Direct-on-Infra Sinn ergibt.
| Plattform | 1.000 Min/Monat | 10.000 Min/Monat | 100.000 Min/Monat |
|---|---|---|---|
| Bland pauschale $0,09/Min + Twilio | $120 | $1.160 | $11.400 |
| Retell Bundle ~$0,145/Min gesamt | $145 | $1.450 | $14.500 |
| Vapi BYOK ~$0,17/Min gesamt | $170 | $1.700 | $17.000 |
| OpenAI Realtime + Caching ~$0,13/Min | $130 | $1.300 | $13.000 |
| Deepgram Voice Agent + Twilio | $108 | $1.080 | $10.800 |
Zahlen aus der tco_per_minute() Formel oben mit den kanonischen 4-Minuten-Anrufannahmen. Fügen Sie HIPAA ($2.000/Monat Vapi), Parallelität und Nummernmieten hinzu, wo sie anfallen. Sie verändern die Kurvenform nicht, erhöhen aber den Boden für Käufer mit geringem Volumen.
Das Hero-Chart oben in diesem Beitrag visualisiert die gleichen Zahlen: Bland flacht früh ab, Vapi steigt mit LLM-Kosten an, und OpenAI Realtime mit Caching schlägt Vapi ab 10k Minuten.
Wann Sie KEINEN Voice-Agenten einsetzen sollten
Voice-AI hat einen realen $0,10–$0,30/Min-Boden. Unter 200 Anrufen pro Monat gewinnt ein Mensch plus ein $19-SaaS noch immer bei den Kosten. Telefonnummernmieten, Parallelitäts-Baselines und Plattform-Minima summieren sich zu einem $50–$200/Monat-Overhead, den ein Team mit geringem Volumen einfach nicht wieder hereinholt.
Drei ehrliche „Lass es sein"-Kriterien:
- Weniger als 200 Anrufe/Monat. Nummernmieten + Mindestgebühren + Parallelitäts-Baselines übersteigen, was ein Teilzeitmensch bei $20/Std kostet. Der Break-even rechnet sich nicht.
- Kontextreiche, volumenarme Arbeit. Ihr einen Mensch bearbeitet täglich 15 Anrufe, jeder mit 30+ einzigartigen Faktmustern. LLM-Halluzinationskosten (Rückerstattungen, verlorene Deals, falsche Termine) fressen die Einsparungen auf. Voice-AI glänzt bei repetitiven Abläufen, nicht bei edge-case-intensiver Arbeit.
- Regulierte Branchen ohne HIPAA-Budget. Vapis $2k/Monat HIPAA-Add-on, Carrier-Compliance-Gebühren und PII-Schutzmaßnahmen ($0,005–$0,01/Min bei Retell) können die Kalkulation zusammenbrechen lassen. Wenn Sie nicht $25k/Jahr für Compliance-Posten allein budgetieren können, starten Sie erst Pilotversuche auf nicht-PHI-Abläufen.
Im Test liegt der Break-even-Punkt gegenüber einem menschlichen Agenten für Support-Deflection bei rund 250–400 Anrufen/Monat bei typischen Bundle-Raten. Darunter ist ein $19/Monat-SaaS plus ein Mensch günstiger. Setzen Sie keinen Voice-Agenten ein, nur weil Sie es können.

Wenn Voice-AI den Kostenboden übersteigt, Sie aber Retell oder Vapi nicht selbst verkabeln möchten, baut unser Voice-Agent-Entwicklungsservice den vollständigen Stack auf Ihrer Infrastruktur auf und betreibt ihn.
Wie wir eine Plattform 2026 wirklich auswählen würden (Urteil nach Anwendungsfall)
Keine einzelne Plattform gewinnt überall. Die günstigste ernsthafte Wahl hängt davon ab, ob Sie eingehend oder ausgehend arbeiten, ob Sie technische Kapazität haben und ob HIPAA wichtig ist. Fünf Anwendungsfälle, fünf Antworten:
- Günstigste seriöse ausgehende Option (Kaltakquise): Bland. Pauschale $0,09/Min, transparente Transfergebühr, keine LLM-Kostüberraschungen. Überspringen Sie es, wenn Sie tiefes RAG oder benutzerdefinierte Tools benötigen.
- Günstigste eingehende Option (Support-Deflection): Retell. Gebündelt, HIPAA inklusive, ausgereifte Analysen, $0,12–$0,18 gesamt. Überspringen Sie es, wenn Ihr eingehendes Volumen unter 200 Anrufen/Monat liegt (siehe vorherigen Abschnitt).
- Maximale Kontrolle + Custom RAG: Vapi BYOK. Nur wenn Sie technische Kapazität haben, um LLM-, TTS- und STT-Keys zu verwalten. Die Kontrolle ist $0,27/Min wert nur wenn Sie Carrier und LLM bei Volumen verhandeln können.
- Bundle-Einfachheit bei Scale: Deepgram Voice Agent. $4,50/Std ($0,075/Min) pauschal, die am meisten übersehene Option im SERP. Überspringen Sie es, wenn Sie die breite Stimmbibliothek von ElevenLabs benötigen.
- Konversationsqualitätsniveau (Verkaufs-Demos, markensensitive Abläufe): ElevenLabs Conversational. Turbo- oder Premium-Stimmen bei $0,10–$0,12/Min. Zahlen Sie den Aufpreis, wenn Stimmqualität der Konversions-Hebel ist.
Für eine tiefere Branchenübersicht auf der Enterprise-Seite, lesen Sie KI-Sprachagenten für Enterprise-Callcenter: gleiche Kalkulation, mit restaurant- und klinikspezifischen Volumenannahmen.
Wie Techsy die Kostenmodellierung für Sprachagenten angeht
Wir verkaufen keine Sprachplattform. Wir bauen Produktions-Sprachagenten für Kunden auf Retell, Vapi, Deepgram und OpenAI Realtime. Das bedeutet: Wenn wir Kosten für ein neues Engagement modellieren, führen wir die tco_per_minute() Formel bei drei Volumenstufen (1k, 10k, 100k Minuten/Monat) aus, bevor wir einen Stack empfehlen. Die Plattform, die bei 1k gewinnt, verliert oft bei 100k.
Wir verhandeln Twilio-Sub-Account-Preise für Kunden ab 100k Minuten/Monat (Sub-Accounts schalten Volumenstufen frei, von denen die meisten Teams nichts wissen), und wir modellieren immer die Prompt-Caching-Einsparungen auf Realtime-Builds, bevor wir ein Direct-Infra-Design absegnen. Die Hälfte unserer Kostenmodellierungsarbeit für Kunden ist, Annahmen zurückzubauen, die jemand aus einem Anbieter-Blogbeitrag gemacht hat.
Möchten Sie einen Voice-Agenten End-to-End auf der Plattform gebaut haben, die für Ihr Volumen wirklich gewinnt? Sehen Sie, wie wir Voice-Agenten bauen →
FAQ
Was kostet ein KI-Sprachagent pro Minute im Jahr 2026? Die Gesamtkosten liegen zwischen $0,07 und $0,30 pro Minute. Bundle-Plattformen (Retell, Bland, ElevenLabs Conversational) landen bei $0,10–$0,18/Min sobald Telefonie eingerechnet ist. BYOK-Plattformen wie Vapi landen bei $0,13–$0,31/Min, nachdem LLM-, TTS-, STT- und Twilio-Kosten hinzukommen. OpenAI Realtime direkt liegt bei rund $0,30/Min roh oder etwa $0,12/Min mit aktiviertem Prompt-Caching für System-Prompts.
Was ist die günstigste KI-Sprachagenten-Plattform? Für ausgehende Anrufe ist Bland AI mit $0,09/Min pauschal die klarste Kalkulation auf dem Markt. Für eingehenden Support gewinnt Retell mit $0,10–$0,16 gesamt meistens dank gepacktem HIPAA und Parallelitäts-Baselines. Für reine Infrastruktur-Setups mit Caching kann OpenAI Realtime unter $0,15/Min fallen. Deepgram Voice Agent mit $0,075/Min pauschal ist die am meisten übersehene Option.
Warum ist meine Vapi-Rechnung höher als $0,05/Min? Die $0,05/Min auf Vapis Preisseite ist nur die Plattformgebühr. Vapi ist BYOK: Sie bringen Ihre eigenen Keys für das LLM (GPT-4o-mini, Claude etc.), TTS (ElevenLabs, PlayHT), STT (Deepgram) und Telefonie (Twilio). Die tatsächlichen Gesamtkosten landen bei $0,13–$0,31/Min, abhängig davon, welche Stimme und welches Modell Sie wählen.
Was ist der Unterschied zwischen BYOK und Bundle-Preisen? Bundle-Plattformen (Retell, Bland, Synthflow, ElevenLabs Conversational) enthalten LLM, STT und TTS in einem Minutenpreis. BYOK-Plattformen (Vapi) berechnen nur die Orchestrierung — Sie bringen Ihre eigenen API-Keys für alles andere und werden separat von jedem Anbieter abgerechnet. Bundle ist einfacher; BYOK gibt Ihnen Kontrolle und Verhandlungsmacht bei Scale.
Gibt es versteckte Gebühren bei KI-Sprachagenten-Preisen? Ja, sieben häufige. HIPAA-Add-ons ($2.000/Monat bei Vapi), Minuten-Rundung (5–8% effektiver Aufschlag bei Scale), Telefonnummernmieten ($1–$2/Monat), Parallelitätsgebühren ($8/Parallelität/Monat Retell), Transfergebühren ($0,025/Min Bland), Knowledge-Base-Gebühren ($8/Monat pro KB bei Retell) und Premium-Stimmen-Upgrades (+$0,04/Min ElevenLabs Premium gegenüber Turbo).
Ist OpenAI Realtime API günstiger als Vapi? Ohne Prompt-Caching nein: OpenAI Realtime kostet rund $0,30/Min reine Audio-Kosten. Mit aktiviertem Prompt-Caching (gecachte System-Prompt-Tokens bei $0,40/M vs. $32/M frisch, ein 80-facher Rabatt) kollabiert der System-Prompt-Posten und die Gesamtkosten fallen auf rund $0,12–$0,15/Min. Das macht es wettbewerbsfähig mit Bundle-Plattformen über 10k Minuten/Monat.
Wie prognostiziere ich meine monatlichen Voice-Agenten-Kosten?
Schätzen Sie Anrufe pro Monat multipliziert mit der durchschnittlichen Anrufdauer in Minuten. Multiplizieren Sie mit dem Gesamt-$/Min Ihrer Plattform. Addieren Sie monatliche Fixkosten: Telefonnummernmieten, Knowledge-Base-Gebühren, Parallelitäts-Baseline, HIPAA-Add-on falls zutreffend. Die obige Python-Funktion tco_per_minute() automatisiert das mit einem Funktionsaufruf, den Sie in ein Jupyter-Notebook einfügen können.
Abrechnung pro Minute oder pro Sekunde: Was ist günstiger? Sekundenabrechnung ist spürbar günstiger für kurze ausgehende Anrufe. Ein 61-Sekunden-Anruf, der in 60-Sekunden-Intervallen abgerechnet wird, kostet 2 Minuten, was eine 5–8% effektive Steuer bei 5.000 Anrufen pro Monat mit typischer Kurzanruf-Verteilung ist. Bland und Deepgram rechnen sekundengenau ab; die meisten BYOK-Plattformen erben Twilios 60-Sekunden-Rundung standardmäßig.
Gibt es kostenlose KI-Sprachagenten? Kostenlose Testversionen existieren: Die meisten Anbieter bieten 10–60 Freiminuten (Retell, Vapi, Bland) zum Testen an. Echte kostenlose produktionsreife Sprachagenten gibt es nicht, da Sie immer mindestens Carrier-Minuten zahlen ($0,014/Min bei Twilio US ausgehend). Selbst selbst gehostete Open-Source-Stacks (Pipecat, LiveKit Agents) lassen Sie für Telco und LLM zahlen.
Was ist der ROI von Voice-AI gegenüber einem menschlichen Agenten? Menschliche Agenten kosten $15–$30/Std vollständig belastet, was $0,25–$0,50/Min entspricht. Voice-AI bei $0,10–$0,20/Min schlägt menschliche Kosten ab rund 200 Anrufen pro Monat, bei vergleichbaren Lösungsraten. Darunter machen die Plattform-Minima und Nummernmiet-Overhead einen Menschen plus ein $19/Monat-SaaS zur günstigeren Antwort.
Dieser Leitfaden wird vom Techsy-Redaktionsteam gepflegt. Wir bauen produktive KI-Sprachagenten auf Retell, Vapi und OpenAI Realtime für Kunden; diese Zahlen stammen aus Kostenmodellierungsarbeit, die wir jede Woche durchführen, nicht aus Anbieter-Broschüren. Preise verifiziert im Mai 2026; bestätigen Sie immer mit den Preisseiten der Anbieter, bevor Sie unterschreiben.