
Ceny agentów głosowych AI w 2026 roku: prawda o stawkach $0.05 i $0.30 za minutę (z wyliczeniami)
Vapi umieszcza na swojej stronie cennika stawkę „$0.05/min". Twój pierwszy miesięczny rachunek opiewa na $0.27/min. Co się stało? Każda platforma voice AI reklamuje jedną liczbę — opłatę platformową — a dolicza ci cztery kolejne warstwy, których na stronie głównej nie widać. Ten przewodnik odbudowuje wyliczenia dotyczące cen agentów głosowych AI od podstaw: realne koszty BYOK dla 8 platform, pozycja z tokenami audio, której nikt nie wyjaśnia, oraz funkcja w Pythonie, którą możesz skopiować, by prognozować własny rachunek.

Szybka odpowiedź
- Realny całkowity koszt w 2026 roku mieści się w przedziale $0.07–$0.30/min, w zależności od tego, czy wybierasz pakiet, czy BYOK.
- Platformy pakietowe (Retell, Bland, ElevenLabs) reklamują $0.07–$0.12/min, a realnie wychodzą w okolicach $0.10–$0.18/min.
- Platformy BYOK (Vapi z opłatą platformową $0.05/min) po doliczeniu LLM + TTS + STT + Twilio wychodzą $0.13–$0.31/min.
- Największą ukrytą dźwignią jest cache'owanie promptów w OpenAI Realtime: nawet 80× taniej na promptach systemowych.
Ile naprawdę kosztuje agent głosowy AI w 2026 roku?
Większość agentów głosowych AI kosztuje w 2026 roku łącznie od $0.07 do $0.30 za minutę. Platformy pakietowe (Retell, Bland, ElevenLabs) reklamują $0.07–$0.12/min, a realnie wychodzą w okolicach $0.10–$0.18/min. Platformy BYOK (Vapi z opłatą platformową $0.05/min) po doliczeniu LLM, TTS, STT i Twilio dochodzą do $0.13–$0.31/min. Bezpośrednio na OpenAI Realtime wychodzi mniej więcej $0.30/min bez cache'owania.
Trzy kategorie wyjaśniają niemal wszystko, co zobaczysz na rachunku:
- Pakietowa stawka za minutę: Retell AI ($0.07–$0.31/min), Bland AI ($0.09/min ryczałtowo), Synthflow oraz ElevenLabs Conversational. Jedna liczba, wszystko w cenie.
- Orkiestracja BYOK: Vapi pobiera $0.05/min wyłącznie za warstwę obsługi połączeń. Tokeny LLM, znaki TTS, minuty STT i operator telefoniczny rozliczani są osobno na twoich własnych kontach.
- Bezpośrednio na infrastrukturze: Budujesz wprost na OpenAI Realtime plus Twilio. Najtaniej przy dużej skali, jeśli cache'ujesz prompty. Drogo, jeśli tego nie robisz.
W dalszej części tego wpisu przechodzimy przez wyliczenia warstwa po warstwie, a na końcu dostarczamy funkcję tco_per_minute() w Pythonie, którą możesz wkleić do notatnika.
Dlaczego reklamowana stawka za minutę to kłamstwo (4 warstwy kosztów)
Reklamowana opłata platformowa $0.05/min pokrywa tylko orkiestrację. Pozostałe cztery warstwy nakładają się na nią. Każdy produkcyjny agent głosowy w 2026 roku płaci za pięć pozycji: telefonię, STT, LLM, TTS oraz opłatę platformową, która spina to w całość. Pomiń którąkolwiek, a nie masz działającego agenta.
Oto kosztowe minimum, warstwa po warstwie.
Warstwa 1: Telefonia (minuta u operatora)
Płacisz realnemu operatorowi telekomunikacyjnemu za dźwięk przepływający do i z publicznej sieci telefonicznej. Twilio Programmable Voice nalicza $0.014/min za połączenia wychodzące w USA, plus $1–$2 miesięcznie za numer telefonu. Twilio Elastic SIP kosztuje $0.0053–$0.042/min w zależności od punktu wyjścia. Większość platform voice AI albo odsprzedaje Twilio z niewielką marżą, albo przekazuje koszty bez zmian. Tak czy inaczej, w twoim arkuszu to $0.014/min.
Warstwa 2: Rozpoznawanie mowy (STT)
Zamieniasz to, co powiedział dzwoniący, na tekst, który LLM potrafi odczytać. Streaming Deepgram Nova-2 kosztuje około $0.0043/min w warstwie Pay-as-you-go, więc w praktyce przyjmij $0.005/min. Modele premium (odpowiedniki Whispera) dochodzą do $0.018/min. Platformy pakietowe ukrywają to w swojej głównej stawce, ale ten koszt wciąż tam jest.
Warstwa 3: LLM (tekst lub audio)
Są tu dwie ścieżki. Potoki w trybie tekstowym karmią transkrybowany dźwięk do modelu takiego jak GPT-4o-mini ($0.15/M wejście, $0.60/M wyjście), a odpowiedź przekazują do TTS. Pętla głosowa zużywa zwykle 100–300 tokenów wejściowych i 80–200 tokenów wyjściowych na turę, co dla GPT-4o-mini przekłada się na mniej więcej $0.003–$0.015/min, a dla Claude Haiku na $0.015–$0.04/min. Potoki w trybie audio (OpenAI Realtime) pomijają taniec transkrypcji i syntezy, rozliczając bezpośrednio tokeny audio. Mamy na ten temat całą sekcję poniżej — to dźwignia kosztowa, której nikt nie wyjaśnia.
Warstwa 4: Synteza mowy (TTS)
Syntetyzujesz odpowiedź z powrotem do postaci dźwięku. ElevenLabs Turbo kosztuje $0.10/min w planie Conversational, głosy Premium dochodzą do $0.12/min. Głosy z niższej półki (Deepgram Aura, OpenAI tts-1) mieszczą się w $0.04–$0.06/min. To zwykle druga co do wielkości pozycja po opłacie platformowej.
Zsumujmy to na poziomie minimum: $0.014 telefonia + $0.005 STT + $0.005 LLM (4o-mini) + $0.04 TTS + $0.05 platforma = co najmniej $0.114/min w stacku BYOK. I to zanim doliczysz HIPAA, współbieżność czy wynajem numerów. Jeśli po tym przeglądzie cen chcesz zobaczyć porównanie funkcji jeden do jednego, zajrzyj do naszego zestawienia Retell AI vs Vapi vs Bland.
Porównanie 8 platform (tabela cen z maja 2026)
Poniższa tabela zbiera główne stawki i realistyczne wartości całkowite ze stron cenników każdego dostawcy. Traktuj ją jako punkt odniesienia, a nie wyrocznię: strony cenników się zmieniają, a twoje wybory stacku zmieniają wynik końcowy.
| Platforma | Model cenowy | Stawka główna | Realny koszt całkowity (typowo) | HIPAA | BYOK czy pakiet | Znaczący haczyk |
|---|---|---|---|---|---|---|
| Retell AI | Za minutę | $0.07–$0.31/min | $0.12–$0.18/min | W cenie | Pakiet | Współbieżność $8/mies. za sztukę ponad limit |
| Vapi | Opłata platformowa + BYOK | $0.05/min | $0.13–$0.31/min | +$2,000/mies. | BYOK | Wszystkie cztery warstwy dodatkowo |
| Bland AI | Ryczałt za minutę | $0.09/min | $0.09–$0.14/min | W cenie | Pakiet | Opłata za przekierowanie $0.025/min |
| Synthflow | Za minutę w planie | $0.09/min baza | $0.11–$0.15/min | W cenie | Pakiet | Progi planów $29/$99/$449/$899 |
| ElevenLabs Conversational | Za minutę | $0.08–$0.12/min | $0.10–$0.18/min | Plan Workspace | Pakiet | LLM dodatkowo, chyba że warstwa managed |
| Deepgram Voice Agent | Za godzinę | $4.50/godz. ($0.075/min) | $0.09–$0.11/min + telefonia | Tak | Pakiet | Dołóż Twilio na wierzch |
| OpenAI Realtime API | Tokeny audio | $32/M wejście, $64/M wyjście | ~$0.30/min surowo, ~$0.12 z cache | Własnoręcznie | Bezpośrednio | Wyliczenia tokenów audio (patrz niżej) |
| Twilio (warstwa telefonii) | Za minutę | $0.014/min wychodzące USA | $0.014/min | nd. | nd. | Numery telefonów $1–$2/mies. |
Ceny zweryfikowane w maju 2026. Przed podpisaniem umowy zawsze sprawdzaj strony cenników dostawców: samo Vapi w ciągu ostatniego roku dwukrotnie zmieniało swój dodatek HIPAA.
Przykład z życia: ile naprawdę kosztuje jedno 4-minutowe połączenie wychodzące?
Klasyczny scenariusz: jedno 4-minutowe połączenie wychodzące, GPT-4o-mini jako LLM, ElevenLabs Turbo jako głos, Twilio US jako operator, tylko język angielski. Gdy przeprowadziliśmy dokładnie ten scenariusz na wszystkich czterech platformach (Vapi, Retell, Bland, bezpośrednio OpenAI Realtime), główna stawka wyjaśniała mniej niż połowę końcowej kwoty.
Założenia stałe dla wszystkich czterech:
- 4 minuty czasu rzeczywistego
- ~12 tur rozmowy, ~150 tokenów wejściowych + 100 tokenów wyjściowych na turę = 1,800 wejście / 1,200 wyjście dla GPT-4o-mini
- TTS generuje ~400 znaków na turę × 12 = 4,800 znaków (ElevenLabs Turbo @ $0.10/min wyjścia audio)
- STT rozlicza pełne 4 minuty (Deepgram Nova-2 @ ~$0.0043/min)
- Twilio wychodzące USA @ $0.014/min, numer $1/mies. rozłożony na 1,000 połączeń/mies. = $0.001/połączenie
Vapi BYOK: $0.05 → $0.27/min
| Pozycja | Koszt |
|---|---|
| Opłata platformowa Vapi (4 min × $0.05) | $0.200 |
| GPT-4o-mini (1,800 wejście × $0.15/M + 1,200 wyjście × $0.60/M) | $0.001 |
| ElevenLabs Turbo (4 min × $0.10) | $0.400 |
| Deepgram STT (4 min × $0.005) | $0.020 |
| Twilio (4 min × $0.014) | $0.056 |
| Wynajem numeru (amortyzacja) | $0.001 |
| Suma za połączenie | $0.678 |
| Efektywne $/min | $0.170 |
Uwaga: ElevenLabs Turbo w planie Conversational kosztuje bliżej $0.10/min, a nie ryczałtowo, więc wyliczenie to opłata za minutę wyjścia. Opłata platformowa $0.05/min plus GPT-4o-mini plus ElevenLabs Turbo plus Twilio sumują się bliżej $0.17–$0.27/min, a nie $0.05.
Retell pakietowo: $0.10 → $0.16/min
| Pozycja | Koszt |
|---|---|
| Pakiet Retell (4 min × $0.13, GPT-4o-mini + Retell TTS) | $0.520 |
| Przepuszczenie Twilio (4 min × $0.014) | $0.056 |
| Wynajem numeru (amortyzacja) | $0.002 |
| Suma za połączenie | $0.578 |
| Efektywne $/min | $0.145 |
Pakiet Retell zawiera w sobie LLM (wybierasz model), STT i ich własne TTS. Tobie zostaje dopłacić do Twilio. I tyle.
Bland ryczałtowo: $0.09 → $0.13/min
| Pozycja | Koszt |
|---|---|
| Ryczałt Bland (4 min × $0.09) | $0.360 |
| Przepuszczenie Twilio (4 min × $0.014) | $0.056 |
| Wynajem numeru (amortyzacja) | $0.001 |
| Suma za połączenie | $0.417 |
| Efektywne $/min | $0.104 |
Bland to najprostsze wyliczenie w wynikach wyszukiwania. Jedna liczba plus operator. Haczyk kryje się w ukrytych opłatach — minuty przekierowań rozliczane są dodatkowo po $0.025/min.
OpenAI Realtime bezpośrednio (bez cache'owania): $0.30/min
| Pozycja | Koszt |
|---|---|
| OpenAI Realtime audio wejście (4 min × ~$0.077) | $0.308 |
| OpenAI Realtime audio wyjście (4 min × ~$0.077) | $0.308 |
| Twilio (4 min × $0.014) | $0.056 |
| Wynajem numeru (amortyzacja) | $0.001 |
| Suma za połączenie | $0.673 |
| Efektywne $/min | $0.168 |
Ta wartość zakłada, że cache'ujesz prompty systemowe. Bez cache'owania to samo połączenie wychodzi bliżej $1.20 ($0.30/min), bo każda tura na nowo rozlicza pełen prompt systemowy po świeżych stawkach. Te wyliczenia rozkładamy na czynniki poniżej.

Pakiet kontra BYOK: który model cenowy wygrywa w twoim przypadku?
Platformy pakietowe wygrywają, gdy chcesz jeden rachunek, przewidywalne wyliczenia za minutę i przyzwoitej jakości głos w standardzie. BYOK wygrywa, gdy masz moce inżynieryjne, chcesz sam wybrać LLM i planujesz negocjować stawki operatorskie przy dużej skali. Decyzja zwykle sprowadza się do dwóch pytań: czy masz preferencje co do pozycji na rachunku i czy masz dewelopera, który weźmie odpowiedzialność za stack?
| Przypadek użycia | Pakiet wygrywa, bo | BYOK wygrywa, bo |
|---|---|---|
| Odciążanie wsparcia przychodzącego | Jeden dostawca, jeden rachunek, HIPAA w cenie | Trudno uzasadnić koszt inżynieryjny |
| Cold calling wychodzący na dużą skalę | Ryczałt bije niespodzianki za tokeny | Możesz negocjować minuty operatorskie powyżej 100 tys./mies. |
| Własny RAG + wywoływanie narzędzi | Ograniczona powierzchnia tool-call w większości pakietów | Pełna kontrola nad oknem kontekstu |
| Branże regulowane | Flagę HIPAA włączasz jednym checkboxem | Zgodność staje się twoim problemem |
Prosta reguła decyzyjna:
- Poniżej 10,000 minut/miesiąc → pakiet niemal zawsze wygrywa pod względem całkowitego kosztu posiadania (sam czas inżynieryjny wychodzi na zero).
- 10,000–100,000 minut/miesiąc → BYOK zaczyna się opłacać, jeśli masz nad tym co najmniej jednego inżyniera.
- Powyżej 100,000 minut/miesiąc → BYOK lub bezpośrednio na Realtime jest zwykle o $0.05–$0.10/min tańsze, a do tego masz pole do negocjacji stawek subkont Twilio.
Aby głębiej spojrzeć na koszty LLM po stronie BYOK, zobacz nasz przegląd opcji orkiestracji w best AI agent frameworks.
Ukryte opłaty, które większość przeoczają
Nawet gdy opanujesz wyliczenia czterech warstw, rachunek przychodzi z pozycjami, o których strona główna nigdy nie wspomniała. Te siedem najczęściej dotyka naszych klientów. Większość z nich jest zakopana w drobnym druku strony cennika lub na ekranach konfiguracji po rejestracji. Nie są złośliwe — po prostu słabo komunikowane.
- Dodatek HIPAA. Vapi pobiera $2,000/mies. za HIPAA, zgodnie ze swoją stroną cennika. Retell, Bland i Synthflow zawierają HIPAA bez dodatkowych kosztów. Jeśli działasz w ochronie zdrowia i rozważasz Vapi, to $24 tys. rocznie, zanim wykonasz choćby jedno połączenie.
- Podatek od zaokrągleń do pełnych minut. Większość platform zaokrągla do pełnych 60 sekund: 61-sekundowe połączenie rozliczane jest jako 2 minuty. Przy 5,000 połączeń/miesiąc z typowym rozkładem 45–90 sekund to efektywna podwyżka o 5–8% względem tego, co mówią twoje wyliczenia $/min. Rozliczanie sekundowe (Bland, Deepgram) tego unika.
- Wynajem numerów telefonicznych. Twilio: $1–$2/mies. za numer. Retell: $2/mies. za numer, $10/mies. za numery zweryfikowane. Wygląda na drobiazg, dopóki nie używasz 50 numerów wychodzących do cold callingu — to pozycja $100/mies., której nikt nie wycenił.
- Opłaty za współbieżność. Retell zawiera bazowy limit jednoczesnych połączeń; powyżej to $8/współbieżność/miesiąc. Zespół prowadzący 10 jednoczesnych rozmów ponad limit dokłada $80/mies.
- Opłaty za przekierowanie. Bland nalicza $0.025/min, gdy agent przekierowuje do człowieka. Jeśli 20% twoich połączeń jest przekierowywanych, to istotny podatek od średniej minuty.
- Opłaty za bazę wiedzy. Retell daje 10 baz wiedzy za darmo; każda kolejna to $8/mies. Przy przypadkach użycia intensywnie korzystających z RAG koszty szybko rosną.
- Droższe głosy premium. ElevenLabs Premium dolicza +$0.04/min względem Turbo. Brzmi jak opcja, dopóki twój zespół sprzedaży nie zrobi testu A/B i nie odkryje, że Premium konwertuje o 11% lepiej.
Potrzebujesz kogoś, kto rozpisze twój konkretny przypadek użycia przed podpisaniem umowy z Vapi? Robimy to w ramach naszych usług budowy agentów głosowych.
Tokeny audio i cache'owanie promptów: dźwignia kosztowa, której nikt nie wyjaśnia
OpenAI Realtime API rozlicza tokeny audio, gdzie 1 token = 100 ms dźwięku wejściowego lub 50 ms dźwięku wyjściowego. 60-sekundowe połączenie zużywa mniej więcej 600 tokenów wejściowych (mówi dzwoniący) i 1,200 tokenów wyjściowych (odpowiada agent). Przy $32/M wejście i $64/M wyjście daje to $0.0192 wejście + $0.0768 wyjście = $0.096 surowego kosztu audio na minutę, czyli mniej więcej $0.10/min, zanim doliczysz prompty, narzędzia czy Twilio.
Dochodzi jeszcze prompt systemowy. Każda tura wysyła do modelu pełen prompt systemowy jako część okna kontekstu. Typowy agent głosowy ma 2,000-tokenowy prompt systemowy opisujący personę, narzędzia, przypadki brzegowe i logikę odmów. Bez cache'owania ten blok 2,000 tokenów rozliczany jest po świeżej stawce $32/M przy każdym połączeniu: $64 na 1,000 połączeń.
Z włączonym cache'owaniem promptów (tokeny z cache kosztują $0.40/M według dokumentacji OpenAI) ten sam wolumen 1,000 połączeń kosztuje $0.80. To 80× taniej na koszcie promptu systemowego. Cache'owanie promptów w OpenAI Realtime obniża koszt promptu systemowego 80-krotnie. Większość zespołów dowiaduje się o tym dopiero po pierwszym miesięcznym rachunku.
Oto te wyliczenia w postaci kodu:
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Fresh rates
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x discount
# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min
# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80
W naszej pracy nad modelowaniem kosztów dla klientów budujących bezpośrednio na Realtime to właśnie największa dźwignia między „Realtime jest tani" a „Realtime jest dwa razy droższy od Vapi". Jeśli obok Realtime używasz Responses API do wywoływania narzędzi, zajrzyj do naszego OpenAI Responses API tutorial po wzorzec implementacji. Dlatego właśnie budowanie bezpośrednio na OpenAI Realtime może być tańsze albo znacznie droższe niż Vapi — w zależności od tego, czy cache'ujesz.
Jak obliczyć własne TCO (wzór + Python)
Całkowity koszt posiadania agenta głosowego to zmienny koszt za minutę plus miesięczne opłaty stałe rozłożone na twój wolumen minut. Wzór:
TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month
Podstaw swoje liczby. Albo skopiuj to:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # e.g., 0.05 for Vapi, 0.13 for Retell bundle
llm_in_per_1m: float, # e.g., 0.15 for GPT-4o-mini input
llm_out_per_1m: float, # e.g., 0.60 for GPT-4o-mini output
llm_in_tokens_per_call: int, # e.g., 1800
llm_out_tokens_per_call: int, # e.g., 1200
tts_per_min: float, # e.g., 0.10 for ElevenLabs Turbo
stt_per_min: float, # e.g., 0.005 for Deepgram Nova-2
telephony_per_min: float, # e.g., 0.014 for Twilio US
fixed_monthly: float = 0.0, # number rentals, KB, HIPAA, concurrency
) -> dict:
"""Return monthly and per-minute total cost of ownership."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable per-call
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Cztery ponumerowane kroki dla każdego, kto prognozuje od zera:
- Oszacuj miesięczny wolumen połączeń i średni czas trwania połączenia.
- Wybierz stack: platforma + LLM + TTS + STT + telefonia.
- Sprawdź cenę jednostkową każdego komponentu na stronie cennika dostawcy.
- Zastosuj wzór (lub powyższą funkcję w Pythonie) — wynikiem jest prognozowane $/min i miesięczna kwota w $.
Jeśli nie potrafisz zapisać swojego TCO jako jednolinijkowego wzoru, przegrasz na podatku od zaokrągleń do pełnych minut.
Koszt przy dużej skali: 1 tys. kontra 10 tys. kontra 100 tys. minut miesięcznie
Krzywe szybko się rozjeżdżają powyżej 10,000 minut. Platformy pakietowe się wypłaszczają, bo ich rachunek to po prostu minuty × stawka. Stacki BYOK stromieją, bo koszty LLM i TTS rosną liniowo razem z tobą. OpenAI Realtime z cache'owaniem wyprzedza Vapi w okolicach 10–20 tys. minut/mies. — to punkt zwrotny, w którym budowanie bezpośrednio na infrastrukturze zaczyna mieć sens.
| Platforma | 1,000 min/mies. | 10,000 min/mies. | 100,000 min/mies. |
|---|---|---|---|
| Bland ryczałt $0.09/min + Twilio | $120 | $1,160 | $11,400 |
| Pakiet Retell ~$0.145/min łącznie | $145 | $1,450 | $14,500 |
| Vapi BYOK ~$0.17/min łącznie | $170 | $1,700 | $17,000 |
| OpenAI Realtime + cache ~$0.13/min | $130 | $1,300 | $13,000 |
| Deepgram Voice Agent + Twilio | $108 | $1,080 | $10,800 |
Liczby wyprowadzone z powyższego wzoru tco_per_minute() przy klasycznych założeniach 4-minutowego połączenia. Dolicz HIPAA ($2,000/mies. Vapi), współbieżność i wynajem numerów tam, gdzie mają zastosowanie. Nie zmieniają one kształtu krzywej, ale podnoszą minimum dla kupujących o małym wolumenie.
Główny wykres na górze tego wpisu wizualizuje te same liczby: Bland wcześnie się wypłaszcza, Vapi stromieje w miarę wzrostu kosztów LLM, a OpenAI Realtime z cache'owaniem bije Vapi powyżej 10 tys. minut.
Kiedy NIE wdrażać agenta głosowego
Voice AI ma realne minimum na poziomie $0.10–$0.30/min. Poniżej 200 połączeń miesięcznie człowiek plus SaaS za $19 wciąż wygrywa kosztowo. Wynajem numerów telefonicznych, bazowe limity współbieżności i minima platformowe sumują się w narzut $50–$200/mies., którego zespół o małym wolumenie po prostu nie odzyska.
Trzy kryteria „odpuść sobie", szczerze:
-
Mniej niż 200 połączeń/miesiąc. Wynajem numerów + opłaty minimalne + bazowe limity współbieżności przewyższają koszt człowieka na część etatu przy $20/godz. Próg rentowności się nie spina.
-
Praca o wysokim kontekście i małym wolumenie. Twój jeden człowiek obsługuje 15 połączeń dziennie, każde z ponad 30 unikalnymi schematami faktów. Koszt halucynacji LLM (zwroty, utracone transakcje, błędne terminy) zjada oszczędności. Voice AI błyszczy w powtarzalnych procesach, a nie w pracy pełnej przypadków brzegowych.
-
Branże regulowane bez budżetu na HIPAA. Dodatek HIPAA Vapi za $2 tys./mies., opłaty za zgodność po stronie operatora i zabezpieczenia PII ($0.005–$0.01/min w Retell) mogą zawalić całe wyliczenie. Jeśli nie jesteś w stanie zaplanować $25 tys. rocznie na same pozycje zgodności, najpierw prowadź pilotaże na procesach bez danych PHI.
W testach próg rentowności względem ludzkiego agenta przy odciążaniu wsparcia wypada w okolicach 250–400 połączeń/miesiąc przy typowych stawkach pakietowych. Poniżej tego SaaS za $19/mies. plus człowiek jest tańszy. Nie wdrażaj voice AI tylko dlatego, że możesz.

Jeśli voice AI mieści się w twoim minimum kosztowym, ale nie chcesz samodzielnie spinać Retell ani Vapi, nasza usługa tworzenia agentów głosowych buduje i utrzymuje pełny stack na twojej infrastrukturze.
Jak naprawdę wybralibyśmy platformę w 2026 roku (werdykt według przypadku użycia)
Żadna pojedyncza platforma nie wygrywa wszędzie. Najtańszy rozsądny wybór zależy od tego, czy działasz przychodząco czy wychodząco, czy masz moce inżynieryjne i czy HIPAA ma znaczenie. Pięć przypadków użycia, pięć odpowiedzi:
- Najtańsze rozsądne połączenia wychodzące (cold calling): Bland. Ryczałtowe $0.09/min, przejrzysta opłata za przekierowanie, brak niespodzianek z kosztami LLM. Odpuść, jeśli potrzebujesz głębokiego RAG lub własnych narzędzi.
- Najtańsze połączenia przychodzące (odciążanie wsparcia): Retell. Pakietowo, HIPAA w cenie, dojrzała analityka, $0.12–$0.18 łącznie. Odpuść, jeśli twój wolumen przychodzący jest poniżej 200 połączeń/mies. (patrz poprzednia sekcja).
- Maksymalna kontrola + własny RAG: Vapi BYOK. Tylko jeśli masz moce inżynieryjne, by zarządzać kluczami LLM, TTS i STT. Kontrola jest warta $0.27/min tylko wtedy, gdy dzięki wolumenowi możesz negocjować w dół stawki operatora i LLM.
- Pakietowa prostota przy dużej skali: Deepgram Voice Agent. Ryczałtowe $4.50/godz. ($0.075/min), najbardziej niedoceniana opcja w wynikach wyszukiwania. Odpuść, jeśli potrzebujesz szerokiej biblioteki głosów, jaką oferuje ElevenLabs.
- Poprzeczka jakości rozmowy (dema sprzedażowe, procesy wrażliwe wizerunkowo): ElevenLabs Conversational. Głosy Turbo lub Premium po $0.10–$0.12/min. Dopłać, gdy jakość głosu jest dźwignią konwersji.
Aby głębiej wejść w perspektywę branżową po stronie enterprise, zobacz AI voice agents for enterprise call centers: te same wyliczenia, z założeniami wolumenu specyficznymi dla restauracji i klinik.
Jak Techsy podchodzi do modelowania kosztów agentów głosowych
Nie sprzedajemy platformy głosowej. Budujemy produkcyjnych agentów głosowych dla klientów na Retell, Vapi, Deepgram i OpenAI Realtime. Oznacza to, że gdy modelujemy koszt dla nowego projektu, przepuszczamy wzór tco_per_minute() przez trzy progi wolumenu (1 tys., 10 tys., 100 tys. min/mies.), zanim zarekomendujemy stack. Platforma, która wygrywa przy 1 tys., często przegrywa przy 100 tys.
Negocjujemy ceny subkont Twilio dla klientów powyżej 100 tys. min/mies. (subkonta odblokowują progi wolumenowe, o których większość zespołów nie wie) i zawsze modelujemy oszczędności z cache'owania promptów w projektach na Realtime, zanim zatwierdzimy projekt na bezpośredniej infrastrukturze. Połowa naszej pracy nad modelowaniem kosztów dla klientów to odkręcanie założeń, które ktoś zrobił na podstawie wpisu na blogu dostawcy.
Chcesz agenta głosowego zbudowanego od A do Z na platformie, która naprawdę wygrywa przy twoim wolumenie? Zobacz, jak budujemy agentów głosowych →
FAQ
Ile kosztuje agent głosowy AI za minutę w 2026 roku? Całkowity koszt mieści się w przedziale od $0.07 do $0.30 za minutę. Platformy pakietowe (Retell, Bland, ElevenLabs Conversational) po doliczeniu telefonii wychodzą $0.10–$0.18/min. Platformy BYOK, takie jak Vapi, po doliczeniu kosztów LLM, TTS, STT i Twilio dochodzą do $0.13–$0.31/min. OpenAI Realtime bezpośrednio to blisko $0.30/min surowo lub mniej więcej $0.12/min z włączonym cache'owaniem promptów systemowych.
Jaka jest najtańsza platforma z agentami głosowymi AI? Dla połączeń wychodzących Bland AI z ryczałtowymi $0.09/min to najprostsze wyliczenie na rynku. Dla wsparcia przychodzącego Retell z $0.10–$0.16 łącznie zwykle wygrywa dzięki pakietowemu HIPAA i bazowym limitom współbieżności. Dla czysto infrastrukturalnego podejścia z cache'owaniem OpenAI Realtime może zejść poniżej $0.15/min. Deepgram Voice Agent z ryczałtowymi $0.075/min to najbardziej przeoczona opcja.
Dlaczego mój rachunek Vapi jest wyższy niż $0.05/min? Wartość $0.05/min na stronie cennika Vapi to wyłącznie opłata platformowa. Vapi działa w modelu BYOK: przynosisz własne klucze do LLM (GPT-4o-mini, Claude itp.), TTS (ElevenLabs, PlayHT), STT (Deepgram) i telefonii (Twilio). Realny koszt całkowity wynosi $0.13–$0.31/min w zależności od wybranego głosu i modelu.
Jaka jest różnica między cenami BYOK a pakietowymi? Platformy pakietowe (Retell, Bland, Synthflow, ElevenLabs Conversational) zawierają LLM, STT i TTS w jednej stawce za minutę. Platformy BYOK (Vapi) pobierają opłatę tylko za orkiestrację — do całej reszty przynosisz własne klucze API i każdy dostawca rozlicza cię osobno. Pakiet jest prostszy; BYOK daje kontrolę i pole do negocjacji przy dużej skali.
Czy w cenach agentów głosowych AI są ukryte opłaty? Tak, siedem powszechnych. Dodatki HIPAA ($2,000/mies. w Vapi), zaokrąglenia do pełnych minut (efektywna podwyżka o 5–8% przy dużej skali), wynajem numerów telefonicznych ($1–$2/mies.), opłaty za współbieżność ($8/współbieżność/mies. Retell), opłaty za przekierowanie ($0.025/min Bland), opłaty za bazę wiedzy ($8/mies. za bazę w Retell) oraz droższe głosy premium (+$0.04/min ElevenLabs Premium względem Turbo).
Czy OpenAI Realtime API jest tańsze niż Vapi? Bez cache'owania promptów — nie: OpenAI Realtime kosztuje około $0.30/min surowego kosztu audio. Z włączonym cache'owaniem promptów (tokeny promptu systemowego z cache po $0.40/M wobec $32/M świeżych, czyli 80× taniej) pozycja promptu systemowego się załamuje, a całkowity koszt spada do mniej więcej $0.12–$0.15/min. To czyni je konkurencyjnym wobec platform pakietowych powyżej 10 tys. minut miesięcznie.
Jak prognozować miesięczny koszt mojego agenta głosowego?
Oszacuj liczbę połączeń miesięcznie pomnożoną przez średni czas trwania połączenia w minutach. Pomnóż przez całkowite $/min swojej platformy. Dolicz stałe koszty miesięczne: wynajem numerów telefonicznych, opłaty za bazę wiedzy, bazowy limit współbieżności, dodatek HIPAA, jeśli dotyczy. Powyższa funkcja tco_per_minute() w Pythonie automatyzuje to jednym wywołaniem, które możesz wkleić do notatnika Jupyter.
Rozliczanie za minutę czy za sekundę: co jest tańsze? Rozliczanie sekundowe jest wyraźnie tańsze dla krótkich połączeń wychodzących. 61-sekundowe połączenie rozliczane w krokach 60-sekundowych liczone jest jako 2 minuty, co przy 5,000 połączeń miesięcznie z typowym rozkładem krótkich połączeń daje efektywny podatek 5–8%. Bland i Deepgram rozliczają sekundowo; większość platform BYOK domyślnie dziedziczy 60-sekundowe zaokrąglenia Twilio.
Czy istnieją darmowi agenci głosowi AI? Istnieją darmowe okresy próbne: większość dostawców oferuje 10–60 darmowych minut (Retell, Vapi, Bland) na testy. Prawdziwie darmowi agenci głosowi klasy produkcyjną nie istnieją, bo zawsze płacisz co najmniej za minuty operatorskie ($0.014/min za wychodzące Twilio US). Nawet przy samodzielnie hostowanych, otwartoźródłowych stackach (Pipecat, LiveKit Agents) zostajesz z opłatami za operatora i LLM.
Jaki jest zwrot z inwestycji voice AI względem ludzkiego agenta? Ludzcy agenci kosztują $15–$30/godz. z pełnym obciążeniem, co przekłada się na $0.25–$0.50/min. Voice AI przy $0.10–$0.20/min bije koszt człowieka powyżej mniej więcej 200 połączeń miesięcznie, przy założeniu porównywalnych wskaźników rozwiązania sprawy. Poniżej tego wolumenu minima platformowe i narzut wynajmu numerów sprawiają, że tańszą odpowiedzią jest człowiek plus SaaS za $19/mies.
Ten przewodnik jest utrzymywany przez zespół redakcyjny Techsy. Budujemy produkcyjnych agentów głosowych AI na Retell, Vapi i OpenAI Realtime dla klientów; te liczby pochodzą z prac nad modelowaniem kosztów, które wykonujemy co tydzień, a nie z broszur dostawców. Ceny zweryfikowane według stanu na maj 2026; przed podpisaniem umowy zawsze potwierdzaj na stronach cenników dostawców.