
KI-Sprachagent: Selbst bauen oder kaufen? Das ehrliche Entscheidungsframework 2026 (Mit dem versteckten dritten Weg)
Die meisten Kaufen-oder-Bauen-Ratgeber präsentieren Ihnen eine Ja-Nein-Entscheidung. Die ehrliche Antwort für 2026 ist eine Drei-Wege-Matrix — und die Option, über die niemand spricht (eine Agentur beauftragen, um maßgeschneiderte Flows auf einer Plattform zu bauen), gewinnt für ungefähr ein Viertel der Teams, die wir beraten.
Einen KI-Sprachagenten von Grund auf selbst zu bauen kostet 2026 250.000–2 Mio. $ im ersten Jahr und dauert 4–9 Monate. SaaS kaufen (Vapi, Retell, Bland) kostet 5.000–100.000 $ und geht in 5–14 Tagen live. Ein dritter Weg — eine Agentur damit zu beauftragen, maßgeschneiderte Flows auf einer Plattform aufzubauen — kostet 30.000–150.000 $ und ist in 4–10 Wochen produktionsreif.
Kurzantwort (ehrliches Urteil für alle 3 Optionen):
- SaaS kaufen (Vapi/Retell/Bland) gewinnt für ~65 % der Teams. Jahr 1: 5.000–100.000 $, live in 5–14 Tagen.
- Agentur auf Plattform gewinnt für ~25 %. Jahr 1: 30.000–150.000 $, live in 4–10 Wochen, vollständig maßgeschneiderte Flows.
- Vollständiger Eigenbau gewinnt für ~5 %. Jahr 1: 250.000–2 Mio. $, live in 4–9 Monaten — sinnvoll erst ab 500.000 Min./Monat.
- Hybrid (Plattform kaufen + interne maßgeschneiderte Schicht) deckt die verbleibenden ~5 % ab, meist Großkonzerne und regulierte Branchen.
Bauen, Kaufen oder Mischen? Die drei Wege im Vergleich
Jeder bestehende Leitfaden zum Thema KI-Sprachagent kaufen oder bauen stellt zwei Optionen vor. In realen Deployments dominieren drei Wege: eine gehostete Plattform kaufen, von Grund auf mit eigenen Ingenieuren bauen, oder beides mischen — indem man eine Agentur damit beauftragt, maßgeschneiderte Flows auf Vapi, Retell oder Bland umzusetzen. Die Kostenverläufe, Zeitpläne und Risikoprofile sind grundverschieden. Sobald man die Zahlen ehrlich durchrechnet, ist die Entscheidung meist eindeutig.
| Weg | Kosten Jahr 1 | Zeit bis Produktion | Anpassbarkeit | Am besten für |
|---|---|---|---|---|
| SaaS kaufen | 5.000–100.000 $ | 5–14 Tage | Template + Prompt + Tools | KMU bis Mid-Market, Standardflows |
| Agentur auf Plattform | 30.000–150.000 $ | 4–10 Wochen | Vollständig maßgef. Flows auf gehostetem Laufzeit | Mid-Market mit einzigartigen Workflows |
| Vollständiger Eigenbau | 250.000–2 Mio. $ | 4–9 Monate | Total: jede Schicht gehört Ihnen | Großkonzern, >500.000 Min./Monat, Sprache als Kernprodukt |

Zwei Anmerkungen zur Tabelle. Erstens: Die „Kosten Jahr 1" für den Kauf basieren auf 50.000–200.000 Minuten pro Monat — darunter sind Sie am unteren Ende, darüber nähern Sie sich der Agentur-Tier. Zweitens: Die Agentur-Tier zeigt die Gesamtausgaben inklusive Plattform-Durchleitung, nicht nur die Agenturgebühr. Die Rechnung dazu finden Sie in Abschnitt 5.
Das Beschaffungsrahmen-Denken „Selbst machen oder kaufen" übersieht den dritten Weg vollständig. McKinsey nennt es aus gutem Grund „bauen, kaufen oder mischen". Als wir Retell, Vapi und Bland im echten Betrieb verglichen haben, fielen alle erfolgreichen Deployments, die wir 2025 umgesetzt haben, in die Misch-Kategorie — nicht in das Binär-Schema. (Die plattformseitigen Zahlen finden Sie im Retell vs. Vapi vs. Bland Vergleich; die Kostenspannen in der Tabelle stützen sich auf den Master of Code „True Cost of AI Voice Agents"-Teardown.)
Die meisten Kaufen-oder-Bauen-Ratgeber präsentieren eine Binär-Entscheidung. Die ehrliche Antwort für 2026 ist eine Drei-Wege-Matrix.
Was kostet es wirklich, einen KI-Sprachagenten zu kaufen?
Der wahre Preis für SaaS-Voice-AI liegt bei 0,15–0,33 $ pro Minute — das ist 2–4× der beworbenen Rate, sobald ASR (automatische Spracherkennung), TTS (Text-to-Speech), LLM, Telefonie und Plattformgebühren zusammenkommen. Die Jahr-1-Kosten bei 100.000 Minuten/Monat liegen bei rund 20.000–50.000 $ je nach Anbieter und Stimmenwahl. Der Listenpreis ist korrekt — er ist nur nicht das, was Sie am Monatsende zahlen.
Hier ist die verifizierte Rechnung für Mai 2026, wenn Sie einen KI-Sprachagenten von der Stange kaufen.
| Anbieter | Beworbener Preis | Wahrer Preis /Min. | Quelle (abgerufen 2026-05-17) |
|---|---|---|---|
| Vapi | 0,05 $ | 0,18–0,33 $ | vapi.ai/pricing |
| Retell AI | 0,07 $ | 0,13–0,31 $ | retellai.com/pricing |
| Bland | 0,09–0,11 $ | 0,15–0,30 $ | bland.ai/pricing |
| Synthflow | 0,08–0,13 $ (gebündelt) | 0,10–0,18 $ | Synthflow Preisseite |
Warum die Lücke existiert: Der beworbene Preis ist der Plattformanteil. Dazu kommen der STT-Anbieter (Deepgram ist typisch, ~0,0043 $/Min.), das LLM (GPT-4o-mini für 0,15 $/0,60 $ pro 1 Mio. Token oder Claude Haiku ähnlich), die TTS-Engine (ElevenLabs Turbo bei ~0,06 $/Min. für Premium-Stimmen oder vom Anbieter gebündelt zu niedrigerer Qualität), der SIP-Trunk (~0,014 $/Min. via Twilio) und die Rufnummernmiete (1–5 $/Monat pro Nummer). Dazu kommen Post-Call-Analysen, Wissensdatenbank-Speicher und ein dedizierter Support-Tier — und schon landen Sie bei dem, was die Tabelle zeigt.
Durchgerechnete Jahr-1-Beispiele auf der Voice-AI-Kosten-Leiter:
- 10.000 Min./Monat (früher Pilot): rund 2.000–4.000 $ Gesamtausgaben. SaaS gewinnt gegenüber jedem Eigenbau mit absurdem Abstand.
- 100.000 Min./Monat (Mid-Market-Deployment): 20.000–50.000 $ all-in. Immer noch SaaS-Territorium, es sei denn, Sie haben einen absolut einzigartigen Anwendungsfall.
- 500.000 Min./Monat (Call-Center-Skala): 90.000–180.000 $. Jetzt beginnen Teams, das Bauen-Tabellenblatt aufzumachen.
Die vollständige Auflistung nach Anbieter und Feature finden Sie in unserem detaillierten KI-Sprachagenten-Preisvergleich.
Der 0,05 $/Min.-Listenpreis stimmt. Genauso wie die 0,28 $/Min.-Rechnung am Monatsende.
Was kostet es wirklich, einen KI-Sprachagenten von Grund auf zu bauen?
Einen KI-Sprachagenten von Grund auf in Produktion zu bringen kostet 250.000–2 Mio. $ im ersten Jahr, dauert 4–9 Monate und erfordert 3–5 erfahrene Ingenieure mit ASR-, LLM- und Telefonie-Erfahrung. Die aufgeschlüsselte TCO (Gesamtbetriebskosten) verteilt sich auf rund 60 % Ingenieursgehälter, 15 % Infrastruktur und APIs, 10 % Compliance, 15 % Opportunitätskosten — und fast jedes interne Bauprojekt verdoppelt die ursprüngliche Schätzung.
Ingenieure nennen gern „Wir bauen das in 8 Wochen für 80.000 $." Hier ist die aufgeschlüsselte TCO, die jeder Anbieter-Blog versteckt, Zeile für Zeile, mit US-Vollkosten-Gehältern (die Anpassung für Indien/EU folgt):
| Posten | Jahr-1-Kosten (US) | Anmerkungen |
|---|---|---|
| Ingenieursteam (3 Senior × 180.000 $) | 540.000 $ | Indien-Team: ~180.000 $. EU-Mittelwert: ~360.000 $. |
| Infrastruktur (Compute, Storage, Observability) | 24.000 $ | AWS/GCP, Logs, Traces, On-Call-Alerts |
| ASR-API-Durchleitung (Deepgram oder Whisper) | 15.000–60.000 $ | Volumenabhängig |
| TTS-API-Durchleitung (ElevenLabs) | 15.000–60.000 $ | Premium-Stimmen verdoppeln das |
| Telefonie (Twilio Programmable Voice) | 0,014 $/Min. × Volumen | 17.000 $ bei 100.000 Min./Monat |
| Compliance-Audit (HIPAA / SOC 2 / PCI) | 20.000–80.000 $ | Plus jährliche Erneuerung |
| Opportunitätskosten (6 Monate verlorene Roadmap) | Variabel, meist 200.000 $+ | Was diese Ingenieure sonst nicht liefern |
| Jahr-1-Gesamtkosten (typischer Mittelfall) | 650.000–850.000 $ | Übersteigt häufig 1 Mio. $, wenn Verzögerungen eintreten |
Die „2×-Regel" ist real: Jedes interne Voice-AI-Projekt, das wir ausgewertet haben, kostete am Ende ungefähr das Doppelte der ursprünglichen Schätzung — fast immer, weil das Team Compliance-Aufwand und Edge-Cases beim Gesprächswechsel unterbudgetiert hatte. Master of Code hat denselben Multiplikator dokumentiert, und Caller.Digitals TCO-Modell landet in derselben Größenordnung. Plan Sie dafür ein oder steigen Sie frühzeitig aus dem Eigenbau aus.
Vergessen Sie nicht die LLM-Orchestrierungsschicht: das Framework, das STT, Retrieval, Tool-Calls und TTS in eine Turn-Taking-Schleife bindet. Sie werden LangGraph, das OpenAI Agents SDK oder eine eigene Finite-State-Machine evaluieren. (Wir vergleichen die Top-Kandidaten in KI-Agenten-Frameworks für Entwickler und die Deployment-Seite in Agentische KI-Deployment-Plattform.) Nichts davon ist Raketenwissenschaft — aber jede Schicht ist ein weiterer Integrationstest, ein weiterer flaky Fehlermodus, ein weiterer On-Call-Alarm um 2 Uhr nachts.
State-Management bekommt seinen eigenen Posten. Agenten, die den Namen des Anrufers zwei Gesprächsrunden später vergessen, wirken kaputt. Die Trade-offs haben wir in Gedächtnis für KI-Agenten besprochen; Kurzversion: Entweder stützen Sie sich auf Redis mit eigener Serialisierung oder mieten eine verwaltete Gedächtnisschicht für 200–2.000 $/Monat.
Hier ist die kumulative Kostenkurve über drei Jahre für alle drei Wege:
"Cumulative Cost (Year 1–3): Build vs Buy vs Agency-Built"
Datentabelle
| "Months from kickoff" | "Pure Build" | "Buy SaaS" | "Agency-Built on Platform" |
|---|---|---|---|
| "Month 6" | 350000 | 15000 | 45000 |
| "Month 12" | 650000 | 45000 | 90000 |
| "Month 18" | 800000 | 75000 | 135000 |
| "Month 24" | 950000 | 105000 | 180000 |
| "Month 30" | 1100000 | 135000 | 225000 |
| "Month 36" | 1250000 | 165000 | 270000 |
Annahmen: 100.000 Minuten/Monat, US-Vollkosten-Gehälter, Anbieterpreise per Mai 2026. Der Eigenbau kreuzt die Agentur-Kurve erst um Monat 32, wenn das Anrufvolumen 500.000 Min./Monat übersteigt (siehe Abschnitt 6).
Jedes interne Voice-AI-Projekt kommt doppelt so teuer raus wie geschätzt. Planen Sie dafür ein oder steigen Sie früh aus.
Der versteckte dritte Weg: Agentur auf Plattform
Hier ist die Option, die jeder Anbieter-Blog weglässt: Beauftragen Sie eine Agentur, Ihre maßgeschneiderten KI-Sprachagenten-Flows auf einer vorhandenen Plattform (Vapi, Retell oder Bland) zu bauen. Sie umgehen die Ingenieur-Einstellungsfalle, gehen in 4–10 Wochen produktiv und besitzen dieselbe Geschäftslogik wie beim Eigenbau — ohne ein fünfköpfiges ASR-LLM-TTS-Team unterhalten zu müssen.
Definition: Ein externes Engineering-Team schreibt Ihre Flows, Prompts, Integrationen, Evals und CRM-Hooks auf einer gehosteten Sprachplattform. Sie zahlen eine Projektgebühr für den Build und anschließend Pro-Minuten-Plattform-Durchleitung für den Betrieb. Die Agentur schreibt den Code; Ihnen gehört der Agent.
Die Kostenrechnung:
- Projektgebühr: 30.000–80.000 $ je nach Flow-Komplexität (Anzahl Integrationen, regulatorischer Umfang, Eval-Strenge)
- Plattform-Durchleitung: 0,15–0,30 $/Min. zu den All-in-Raten aus Abschnitt 3
- Jahr-1-Ergebnis: 50.000–150.000 $ gesamt, rund 4–10 Wochen bis zum ersten Produktionsanruf
Für wen es passt (die ~25 %):
- Mid-Market mit einzigartigen Workflows, die nicht in ein Vapi-Template passen
- Regulierte Branchen (Gesundheitswesen, Finanzen, Recht), die auditfähige Evals und Compliance-Dokumentation brauchen
- Teams ohne hauseigene Voice-AI-Ingenieure und ohne Lust, für ein einzelnes Projekt eine Spezialisten-Einheit einzustellen
- Multi-vertikale Agenturen und Franchise-Geber, die 5+ verschiedene Flows parallel brauchen
Für wen es nicht passt (der Ehrlichkeits-Check — lesen Sie das, wenn Sie es in Betracht ziehen):
- Einzelgründer mit MVP: Gehen Sie direkt zu Vapi oder Retell. Die Agenturgebühr amortisiert sich beim MVP-Volumen nicht. (Kombinieren Sie es mit n8n für Low-Code-Agenten-Workflows, wenn Sie Orchestrierung ohne viel Code wollen.)
- Großkonzern mit 50 Voice-AI-Ingenieuren: Bauen Sie selbst. Sie haben die Kapazität, das Volumen und die IP-Begründung.
- Anforderung unter 300ms Latenz: Nur ein co-located Eigenbau erreicht das. Keine Plattform schafft das, egal wer die Flows schreibt.
- Anwendungsfälle, die vollständige Modell-Eigentümerschaft erfordern (Sie trainieren ein proprietäres LLM auf Anruf-Transkripten): Hier brauchen Sie den Eigenbau-Pfad für ML-Zugang. Plattformen abstrahieren diese Schicht weg.
Wenn Ihr Team in den Agentur-Bucket fällt, können Sie mit einem maßgeschneiderten Sprachagenten-Entwicklungspartner über den Scope sprechen. Kein Druck, keine Hard-Sales. Die meisten Teams, die sich melden, verbringen 2–4 Wochen damit, ihre Call-Flows zu kartieren, bevor es zu einem Vertragsgespräch kommt — und das ist das richtige Tempo.
Die meisten Mid-Market-Teams wollen einen maßgeschneiderten Sprachagenten. Die wenigsten wollen dafür ein fünfköpfiges ASR-LLM-TTS-Team einstellen.
Wann lohnt sich der Eigenbau wirklich? Die Break-even-Rechnung
Ein maßgeschneiderter KI-Sprachagent aus eigener Hand rechnet sich nur, wenn das monatliche Anrufvolumen rund 500.000 Minuten übersteigt UND der Anwendungsfall weniger als 5 Integrationen erfordert UND Voice-AI ein Kernprodukt-Differenziator ist — kein Commodity-Feature. Unter dieser Schwelle schlägt SaaS oder eine Agentur auf Plattform den Eigenbau bei der 3-Jahres-TCO um das 2–4-Fache. Die Formel ist klarer, als die meisten Teams zugeben.
Vereinfacht ausgedrückt:
Eigenbau gewinnt, wenn Minuten/Monat > 500.000 UND der Anwendungsfall <5 Integrationen erfordert UND Voice-AI ein Kernprodukt-Differenziator ist (kein Commodity-Feature).
Durchgerechnetes Beispiel #1, 50.000 Min./Monat, mittelständische Klinik. Kaufen gewinnt über drei Jahre um ~4×. SaaS kaufen: ~15.000 $ Jahr 1, ~45.000 $ kumulativ Jahr 3. Vollständiger Eigenbau: ~650.000 $ Jahr 1, ~1,25 Mio. $ kumulativ Jahr 3. Die Klinik hat keine Voice-AI-Ingenieure, kein ausreichendes Anrufvolumen und keinen regulatorischen Sonderfall, den die Plattformen nicht lösen können. SaaS ist nicht nur günstiger. Es ist die einzig vernünftige Antwort. (Die äquivalente Rechnung für das Food-Segment, die zum gleichen Ergebnis kommt, finden Sie in KI-Sprachagenten für Restaurants.)
Durchgerechnetes Beispiel #2, 2 Mio. Min./Monat, Enterprise-Contact-Center. Der Eigenbau erreicht den Break-even mit der Agentur-Variante bei etwa Monat 28 und gewinnt bis Jahr 3 um ~1,6× — aber nur, wenn der Anwendungsfall über die Verticals des Contact-Centers hinweg replizierbar ist. Vollständiger Eigenbau: ~650.000 $ Jahr 1, ~3,5 Mio. $ kumulativ Jahr 3 (hauptsächlich laufende Ingenieurkosten). SaaS kaufen bei 0,20 $/Min. Durchschnitt: ~4,8 Mio. $ Jahr 3. Der Eigenbau gewinnt hier rechnerisch, aber nur weil das Volumen das Engineering-Team amortisiert.
Der Hybrid-Sonderfall deckt die letzten ~5 % ab: Großkonzerne mit >5 Mio. Min./Monat, regulierte Branchen mit proprietären ML-Schichten oder Teams, deren Differenziator tatsächlich das Modell selbst ist. Sie kaufen die Plattform für Telefonie + STT + TTS als Commodity-Schichten und bauen LLM und Post-Call-ML intern. Das ist, was Caller.Digital als „über 500.000 Min./Monat und unter 5 Integrationen"-Schwelle identifiziert, wo Wiederholbarkeit alles ist.
Unter 500.000 Minuten zahlen Sie Ingenieure dafür, neu zu bauen, was Vapi schon geliefert hat.
Der Eigenbau gewinnt rechnerisch ab 500.000 Minuten pro Monat. Darunter zahlen Sie Ingenieure, um das nachzubauen, was Vapi schon fertig hat.
Welche versteckten Integrationsarbeiten sprengen Ihre Bauskostenplan?
Versteckte Integrationsarbeiten bei einem maßgeschneiderten Sprachagenten-Eigenbau sind A2P 10DLC (Application-to-Person 10-Digit Long Code)-Registrierung, STIR/SHAKEN-Anruf-Attestierung, TCPA (Telephone Consumer Protection Act)-Einwilligungserfassung, jurisdiktionsabhängige Aufzeichnungs-Offenlegungslogik, CRM-Webhook-Authentifizierung und PII-Redaktion. Plattformen wie Vapi, Retell und Bland lösen jede dieser Zeilen ab Tag 1. Ihre 8-Wochen-Schätzung hat 6 Wochen Telefonie-Compliance-Aufwand vergessen.
Hier ist das KI-Telefon-Agenten-Gerüst, das niemand in die ursprüngliche Spezifikation schreibt:
- A2P 10DLC-Registrierung: 2–6 Wochen, 50–1.000 $ an Gebühren, erforderlich für jeden US-SMS-nahen Flow (Terminbestätigungen, Callback-Bestätigungen). Weitere Infos in den Twilio A2P 10DLC-Docs.
- STIR/SHAKEN-Attestierung: Carrier-abhängige Anrufer-ID-Signierung. Ohne sie werden Ihre Outbound-Anrufe bei 30–60 % der Mobilgeräte als „Spam Likely" markiert. Laufende Wartung, nicht einmalig.
- TCPA-Einwilligungserfassung: Aufzeichnungs-Offenlegung, Do-Not-Call-Listenintegration, schriftliche Opt-in-Speicherung. Die FCC-AI-Robocall-Regulierung von 2024 hat TCPA auf KI-Sprachagenten ausgedehnt; Nichteinhaltung kostet 500–1.500 $ pro Anruf.
- Bundesstaatliche Aufzeichnungs-Offenlegungspflicht: 12 US-Bundesstaaten verlangen Zwei-Parteien-Einwilligung (Kalifornien, Florida, Illinois usw.), plus DSGVO für jeden EU-Anrufer. Ihr Agent muss den Standort des Anrufers kennen, bevor der zweite Satz kommt.
- CRM-Webhook-Auth + Retry-Logik: OAuth-Refresh, exponentielles Backoff, Dead-Letter-Queues. Klingt trivial; ist es nicht.
- PII-Redaktion + Post-Call-Zusammenfassungsspeicher: Kreditkartennummern, Sozialversicherungsnummern, medizinische Details werden vor der Speicherung gelöscht. HIPAA fordert das; SOC-2-Prüfer auch.
Rechnen Sie das zusammen, und Sie haben 4–8 Wochen Mehrarbeit, die in der ursprünglichen „Wir bauen das in 8 Wochen"-Schätzung nicht auftauchen. Plattformen liefern jede Zeile davon fertig verdrahtet.
Ihre 8-Wochen-Bauskostenplan hat 6 Wochen Telefonie-Compliance-Aufwand vergessen.
Warum sind maßgeschneiderte Sprachagenten-Builds langsamer als Plattformen?
Das gesamte Latenzbudget für natürlich klingende Voice-AI liegt unter 700ms Ende-zu-Ende: STT (150–250ms) + LLM First-Token (200–400ms) + TTS First-Byte (100–200ms) + Netzwerk/Jitter (100–250ms). Plattformen treffen diesen Median; interne Builds landen häufig bei 1,2–2,0 Sekunden, weil Teams Netzwerk- und Cold-Start-Latenz unterschätzen. Anrufer fangen ab 400ms Stille an, den Agenten zu übersprechen — der Unterschied ist hörbar.
Die Arithmetik, die die meisten Bauskostenpläne ignorieren:
| Stufe | Latenz (typisch) | Was schiefläuft |
|---|---|---|
| STT First-Chunk | 150–250ms | Streaming vs. Batch; kaltes Modell = +200ms |
| LLM First-Token | 200–400ms | Cold-Start addiert 400ms+; lange System-Prompts addieren 100ms |
| TTS First-Byte | 100–200ms | Premium-Stimmen langsamer; kein Streaming = +500ms |
| Netzwerk RTT | 50–150ms | Schlechter, wenn Ihre AWS-Region nicht neben dem Carrier des Anrufers liegt |
| Jitter-Buffer | 50–100ms | Die Scheibe, die Teams vergessen |
| Gesamtbudget | 550–1.100ms | Über 1,2s fühlt sich der Anruf schief an |

Warum Plattformen 700–900ms Median erreichen: Pipeline-Optimierung (interleaved STT/LLM-Streaming), Netzwerk-Nähe zu Telefonie-Carriern und warme Modell-Pools ohne Cold-Start. Warum interne Builds routinemäßig bei 1,2–2,0s landen: Teams budgetieren den Netzwerk/Jitter-Anteil nicht, Cold-Start-LLM-Aufrufe addieren 400ms beim ersten Gesprächswechsel jedes Anrufs, und die meisten selbst gebauten TTS-Implementierungen streamen kein First-Byte-Audio vor der vollständigen Antwort. Close's Daten zum 0,4-Sekunden-Anrufer-Übersprechschwellenwert ist aus gutem Grund die meistzitierte Zahl in Voice-AI. Es ist die Grenze, ab der natürliches Turn-Taking zusammenbricht. Deepgrams Latenz-Benchmarks bestätigen, dass STT-First-Chunk-Böden nahe 150ms liegen.
Vapi erreicht 700ms, weil sie die Netzwerk-Nähe besitzen. Ihr AWS-Region-Build wird das nicht.
Lässt sich ein Sprachagent wirklich in 15 Zeilen Code bauen?
Moderne Voice-AI-Plattformen wie Vapi und Retell bieten SDK-Aufrufe mit 10–20 Zeilen, die einen produktionsreifen Sprachagenten erstellen. Dieselbe Funktionalität von Grund auf (STT, LLM-Orchestrierung, TTS, Telefonie, Turn-Taking) braucht typischerweise 4–9 Monate Engineering-Arbeit. Kontraintuitiv: Das Zeigen des Codes stärkt das Kaufen-Argument, nicht das Bauen-Argument.
Hier ist ein funktionierender Vapi Web-SDK-Sprachagent in 15 Zeilen (verifiziert gegen docs.vapi.ai/quickstart/web, abgerufen 2026-05-17):
import Vapi from "@vapi-ai/web";
const vapi = new Vapi(process.env.VAPI_PUBLIC_KEY);
await vapi.start({
model: {
provider: "openai",
model: "gpt-4o-mini",
systemPrompt: "You are a friendly clinic receptionist. Book appointments, answer FAQs, escalate emergencies.",
},
voice: { provider: "11labs", voiceId: "rachel" },
transcriber: { provider: "deepgram", model: "nova-2" },
firstMessage: "Hi, this is the clinic. How can I help today?",
});
vapi.on("call-end", (data) => console.log("Call ended:", data.summary));Jede Zeile in diesem Snippet ersetzt Monate interner Arbeit. Das transcriber-Feld ist Ihre STT-Integration. Das voice-Feld ist Ihre gesamte TTS-Pipeline inklusive Streaming-First-Byte-Handling. systemPrompt ist die gesamte Turn-Taking- und Tool-Calling-Schicht (Vapi kümmert sich intern um Barge-in, Endpointing und Tool-Routing). call-end liefert Ihnen die Post-Call-Zusammenfassung, für die Sie sonst eine Whisper + GPT-4-Pipeline bauen müssten.
Das ist, was Ihr Eigenbau 4–9 Monate lang reproduziert. Je genauer Sie das SDK lesen, desto schwieriger wird es, den Eigenbau zu rechtfertigen.
Kontraintuitiv: Je mehr Sie den Code verstehen, desto stärker wird das Kaufen-Argument.
Wann ist der Eigenbau eines Sprachagenten die falsche Antwort?
Der Eigenbau eines Sprachagenten ist die falsche Antwort, wenn Ihr Team keine Voice-AI-Shipping-Erfahrung hat, Ihre Schätzung unter 150.000 $ Jahr 1 liegt, Ihr Zeitplan unter 8 Wochen ist, Ihr Anwendungsfall sauber auf ein vorhandenes Plattform-Template passt oder Ihr Anrufvolumen unter 500.000 Minuten/Monat liegt. Treffen zwei dieser Punkte zu, ist der Eigenbau-Pfad Malpractice, keine Ingenieursleistung.
Ihr Engineering-Team wird für den Eigenbau plädieren. Die lügen nicht. Sie können es bauen. Die Frage ist, ob sie es sollten. Achten Sie auf diese fünf Anti-Pattern-Signale:
- „Wir können einfach Whisper und GPT-4 verdrahten." Niemand, der Voice in Produktion gebracht hat, sagt das. Die schwierigen Teile sind Turn-Taking, Barge-in-Erkennung und TTS-Streaming — keiner davon kommt in diesem Satz vor.
- Jahr-1-Schätzung unter 150.000 $. Entweder versteht das Team den Compliance-Umfang nicht, hat die Telefonie-Schicht nicht eingepreist oder hat keine Observability eingeplant. Alle drei sind rote Flaggen.
- Kein Ingenieur im Team hat Voice je in Produktion gebracht. Voice-AI-Fehlerbilder unterscheiden sich von Chat. Echo-Cancellation, Jitter-Buffering, Barge-in: Das sind keine Web-Dev-Probleme.
- Zeitplan unter 8 Wochen. Selbst Plattformen mit fertigen Primitiven brauchen 2–4 Wochen, um Integrationen + CRM + Evals zu verdrahten. Von Grund auf in 8 Wochen bedeutet Compliance kürzen, Evals kürzen oder beides.
- „Wir bauen TTS intern." Nein, das werden Sie nicht. ElevenLabs und Cartesia haben jeweils Hunderte von Ingenieuren und dedizierte Audio-Modell-Forscher. Kaufen Sie, was sich zur Commodity entwickelt hat.
Warum Ingenieure trotzdem für den Eigenbau plädieren: Karriere-Kapital, NIH-Syndrom (Not Invented Here), Headcount-Rechtfertigung, die echte Freude an Greenfield-Engineering. Das sind keine schlechten Gründe, bauen zu wollen. Sie sind nur schlechte Gründe, es tatsächlich zu tun.
Formulieren Sie die Entscheidung um: Bauen Sie, was Sie differenziert. Kaufen Sie, was zur Commodity geworden ist. Die LLM-, ASR- und TTS-Schichten haben sich 2025–2026 zur Commodity entwickelt. Ihr Differenzierungsmerkmal liegt in Flows, Prompts, Evals und CRM-Integration. Bauen Sie nicht nach, was Vapi, Retell, OpenAI und Deepgram schon geliefert haben.
Bauen Sie, was differenziert. Kaufen Sie, was 2025 zur Commodity geworden ist.
Die ehrliche Entscheidungsmatrix
Nach der Erfahrung, Voice-AI für Contact-Center-Kunden auf beide Arten gebaut zu haben, ist unser begründetes Verhältnis: ~65 % der Teams sollten SaaS kaufen (Vapi, Retell, Bland), ~25 % sollten eine Agentur beauftragen, auf einer Plattform zu bauen, ~5 % brauchen einen Hybrid (Plattform + maßgeschneiderte In-house-Schicht), und ~5 % sollten von Grund auf bauen. Vollständiger Eigenbau lohnt sich erst über 500.000 Minuten/Monat mit einem dedizierten Voice-AI-Team. Diese Empfehlungen basieren auf der Auswertung von 4 Kundenentscheidungen in 2025–2026, nicht auf Branchenstatistiken.
| Anteil | Weg | Am besten für | Jahr-1-Kosten |
|---|---|---|---|
| ~65 % | SaaS kaufen | KMU bis Mid-Market, Standardflows, <500.000 Min./Monat | 5.000–100.000 $ |
| ~25 % | Agentur auf Plattform | Einzigartige Flows, regulierte Branchen, kein Voice-AI-Team | 30.000–150.000 $ |
| ~5 % | Hybrid (Plattform + In-house-ML) | Großkonzern, reguliert, proprietäre Modellschicht | 200.000–600.000 $ |
| ~5 % | Vollständiger Eigenbau | Voice-AI als Kernprodukt, >500.000 Min./Monat, Team vorhanden | 250.000–2 Mio. $ |

Der Vier-Knoten-Entscheidungsbaum, den wir mit Kunden durcharbeiten:
- Verarbeiten Sie >500.000 Minuten/Monat? Nein → Kaufen oder Agentur. Ja → weiter.
- Ist Voice-AI ein Kernprodukt-Differenziator (kein Feature)? Nein → Kaufen oder Agentur. Ja → weiter.
- Haben Sie ein hauseigenes Voice-AI-Engineering-Team (3+ in Produktion gebrachte Voice-Produkte)? Nein → Agentur oder Hybrid. Ja → weiter.
- Brauchen Sie <300ms Gesamtlatenz oder proprietäres Modell-Training? Nein → Hybrid. Ja → vollständiger Eigenbau.
Die meisten Teams stoppen bei Knoten 1 oder Knoten 2 — deshalb landen 90 % der Matrix beim Kaufen oder der Agentur-Variante.
Wenn Sie in die 25 %-Gruppe fallen, erfahren Sie hier, wie wir auf Retell oder Vapi für Kunden bauen. Starten Sie mit Ihren Call-Flows, nicht mit einem Vertrag.
Bauen Sie, was Sie differenziert. Kaufen Sie, was zur Commodity geworden ist. Für die meisten Teams 2026 bedeutet das: Plattform kaufen, Flows anpassen.
Das Urteil
- Drei Wege existieren, nicht zwei. SaaS kaufen für ~65 % der Teams. Agentur auf Plattform für ~25 %. Vollständiger Eigenbau erst über 500.000 Min./Monat mit echtem Team.
- Die Break-even-Formel ist einfach: Minuten/Monat > 500.000 UND <5 Integrationen UND Voice-AI ist Kern. Verfehlen Sie eine der drei Bedingungen, funktioniert die Eigenbau-Rechnung nicht.
- Entscheidungsregel: Bauen Sie, was differenziert. Kaufen Sie, was zur Commodity geworden ist. 2026 bedeutet das fast immer: die Plattformschicht kaufen.
Wenn Sie in die 25 %-Gruppe gehören, wo Agentur-gebaut sinnvoll ist: Kartieren Sie zuerst Ihre Call-Flows auf einem Whiteboard, dann sprechen Sie mit einem Partner, der auf Retell oder Vapi geliefert hat. Kein Druck. Der richtige Schritt ist, den Scope zu klären, bevor Sie unterschreiben.
FAQ
Ist es besser, einen KI-Sprachagenten selbst zu bauen oder zu kaufen?
Für rund 65 % der Teams ist der Kauf einer SaaS-Sprachplattform (Vapi, Retell, Bland) besser. In 5–14 Tagen ist man in Produktion, für 5.000–100.000 $ im Jahr 1 — im Vergleich zu 4–9 Monaten und 250.000–2 Mio. $ für einen Eigenbau. Der Eigenbau gewinnt nur über 500.000 Minuten/Monat, wenn Voice-AI ein Kernprodukt-Differenziator ist und man ein hauseigenes Team aus 3+ Voice-AI-Ingenieuren hat.
Was kostet es, einen KI-Sprachagenten von Grund auf zu bauen?
Der Eigenbau kostet 250.000–2 Mio. $ im ersten Jahr für US-Teams. Die Aufschlüsselung ist grob: 540.000 $ Engineering (3 Senior-Ingenieure), 24.000 $ Infrastruktur, 30.000–120.000 $ ASR- und TTS-API-Durchleitung, 0,014 $/Min. Telefonie und 20.000–80.000 $ für HIPAA/SOC-2-Compliance-Audits. Die meisten Builds landen am Ende beim Doppelten der ursprünglichen Schätzung, wegen Compliance- und Edge-Case-Aufwand, der unterbudgetiert wurde.
Wie lange dauert es, einen produktionsreifen Voice-AI-Agenten zu bauen?
Der Eigenbau dauert 4–9 Monate für einen produktionsreifen Agenten mit ordentlicher Compliance, Evals und Observability. Eine SaaS-Plattform wie Vapi oder Retell zu kaufen dauert 5–14 Tage. Der versteckte dritte Weg (eine Agentur beauftragen, maßgeschneiderte Flows auf einer vorhandenen Plattform zu bauen) dauert 4–10 Wochen. Der Unterschied ist hauptsächlich das Telefonie- und Compliance-Gerüst (A2P 10DLC, STIR/SHAKEN, TCPA), das Plattformen ab Tag 1 gelöst haben.
Kann ich einen Sprachagenten auf Vapi oder Retell bauen statt von Grund auf?
Ja, das ist der Agentur-auf-Plattform-Weg. Sie (oder eine externe Agentur) bauen maßgeschneiderte Flows, Prompts, Integrationen und Evals auf dem gehosteten Laufzeit von Vapi, Retell oder Bland. Die Jahr-1-Kosten liegen bei 30.000–150.000 $ gesamt (30.000–80.000 $ Projektgebühr plus 0,15–0,30 $/Minute Durchleitung), und Sie gehen in 4–10 Wochen live statt in 4–9 Monaten. Die Geschäftslogik gehört Ihnen; die Plattform übernimmt STT, TTS, Telefonie und Turn-Taking.
Ab welchem Anrufvolumen lohnt sich der Eigenbau von Voice-AI?
Die Break-even-Schwelle liegt bei rund 500.000 Minuten pro Monat — und auch nur, wenn der Anwendungsfall weniger als 5 Integrationen erfordert und Voice-AI ein Kernprodukt-Differenziator ist. Unter 500.000 Min./Monat schlägt SaaS oder Agentur-auf-Plattform den Eigenbau bei der 3-Jahres-TCO um das 2–4-Fache. Über 500.000 Min./Monat mit dem richtigen Team und Anwendungsfall erreicht ein vollständiger Eigenbau den Break-even mit der Agentur-Variante bei Monat 28 und gewinnt bis Jahr 3.
Ist eine SaaS-Sprachplattform günstiger als der Eigenbau?
Für fast jedes Team unter 500.000 Minuten/Monat ist SaaS deutlich günstiger — meistens 4–10× günstiger bei der 3-Jahres-TCO. Der wahre SaaS-Preis liegt bei 0,15–0,33 $/Min. (2–4× die beworbene Zahl, sobald ASR, TTS, LLM und Telefonie zusammenkommen) — aber das schlägt immer noch 650.000–1,25 Mio. $ an Engineering-, Infrastruktur- und Compliance-Kosten, die Sie beim Eigenbau tragen würden.
Welche Engineering-Kenntnisse brauche ich, um einen Sprachagenten zu bauen?
Sie brauchen mindestens 3 Senior-Ingenieure mit kombinierter Erfahrung in Echtzeit-Audio-Streaming, ASR-Integration (Deepgram oder Whisper), LLM-Orchestrierung (LangGraph, OpenAI Agents SDK oder eigene State-Machines), TTS-Streaming (ElevenLabs oder Cartesia), SIP-Telefonie (Twilio Programmable Voice oder Telnyx), Turn-Taking und Barge-in-Erkennung sowie Compliance-Arbeit (TCPA, HIPAA, SOC 2). Wenn Ihr Team noch nie Voice in Produktion gebracht hat, addiert die Lernkurve 2–4 Monate auf den Zeitplan.
Wie unterscheidet sich die Latenz zwischen Eigenbau und Plattformen?
Plattformen erreichen 700–900ms Ende-zu-Ende-Median (Vapi, Retell, Bland). Interne Builds landen routinemäßig bei 1,2–2,0 Sekunden, weil Teams den Netzwerk- und Jitter-Anteil nicht budgetieren und Cold-Start-LLM-Aufrufe beim ersten Gesprächswechsel jedes Anrufs 400ms addieren. Über 1,2 Sekunden fangen Anrufer an, den Agenten zu übersprechen, und das Turn-Taking bricht zusammen. Die 700ms-Grenze ist wichtig, weil Plattformen die Netzwerk-Nähe zu Telefonie-Carriern besitzen. Ihr AWS-Region-Build wird das nicht schaffen.
Wann rechnet sich Voice-AI-Eigenbau finanziell?
Der Eigenbau rechnet sich finanziell, wenn das monatliche Anrufvolumen 500.000 Minuten übersteigt, der Anwendungsfall weniger als 5 Integrationen erfordert, Voice-AI ein Kernprodukt-Differenziator (kein Feature) ist und Sie ein hauseigenes Voice-AI-Team aus 3+ Ingenieuren haben. Verfehlen Sie eine dieser Bedingungen, funktioniert die Eigenbau-Rechnung nicht. Das trifft auf rund 5 % der Teams zu, die wir beraten — meist F500-Contact-Center oder KI-native Unternehmen, bei denen Sprache das Produkt ist.
Was sind die versteckten Kosten beim internen Voice-AI-Eigenbau?
Die versteckten Kosten sind A2P 10DLC-Registrierung (2–6 Wochen, 50–1.000 $), STIR/SHAKEN-Attestierung, TCPA-Einwilligungserfassung, bundesstaatliche Aufzeichnungs-Offenlegungslogik, CRM-Webhook-Authentifizierung, PII-Redaktion, Post-Call-Zusammenfassungsspeicher, Observability- und On-Call-Infrastruktur sowie 6 Monate Opportunitätskosten auf Ihrer entgangenen Produkt-Roadmap. Plattformen lösen jede Zeile davon ab Tag 1. Die 2×-Bauskostenplan-Regel existiert, weil Teams diese Posten vergessen.