Techsy
Контакти
Розпочати
Назад до блогу
ai-machine-learning

Ціни на AI голосових агентів у 2026: правда про $0,05 проти $0,30 за хвилину (з розрахунками)

Автор Techsy Editorial Team
May 14, 2026
16 хв на читання
Зміст
Ціни на AI голосових агентів у 2026: правда про $0,05 проти $0,30 за хвилину (з розрахунками)

Ціни на AI-голосових агентів у 2026 році: правда про $0,05 проти $0,30 за хвилину (з розрахунками)

Vapi виводить «$0,05/хв» на своїй сторінці тарифів. Ваш рахунок за перший місяць приходить із сумою $0,27/хв. Що сталося? Кожна платформа голосового AI рекламує одну цифру — плату за платформу, — а потім виставляє вам рахунок ще за чотири рівні, яких ви не бачили на головній сторінці. Цей посібник відновлює математику цін на ai-голосових агентів з нуля: реальні витрати BYOK для 8 платформ, рядок про аудіотокени, який ніхто не пояснює, та Python-функція, яку ви можете скопіювати, щоб спрогнозувати власний рахунок.

Діаграма цін на AI-голосових агентів за травень 2026 року, що показує місячну вартість за обсягами для Bland, Retell, Vapi та OpenAI Realtime

Швидка відповідь

  • Реальна повна вартість у 2026 році становить від $0,07 до $0,30/хв залежно від пакетного чи BYOK-підходу.
  • Пакетні платформи (Retell, Bland, ElevenLabs) рекламують $0,07–$0,12/хв і на практиці виходять близько $0,10–$0,18/хв.
  • BYOK-платформи (Vapi з платою за платформу $0,05/хв) виходять $0,13–$0,31/хв після додавання LLM + TTS + STT + Twilio.
  • Найбільший прихований важіль — кешування промптів в OpenAI Realtime: до 80× дешевше для системних промптів.

Скільки насправді коштує AI-голосовий агент у 2026 році?

Більшість AI-голосових агентів у 2026 році коштують від $0,07 до $0,30 за хвилину загалом. Пакетні платформи (Retell, Bland, ElevenLabs) рекламують $0,07–$0,12/хв і на практиці виходять близько $0,10–$0,18/хв. BYOK-платформи (Vapi з платою за платформу $0,05/хв) виходять $0,13–$0,31/хв, щойно ви додасте LLM, TTS, STT і Twilio. Пряма робота на OpenAI Realtime коштує приблизно $0,30/хв без кешування.

Три категорії пояснюють майже все, що ви побачите у своєму рахунку:

  • Пакетна погодинна оплата: Retell AI ($0,07–$0,31/хв), Bland AI (фіксовані $0,09/хв), Synthflow та ElevenLabs Conversational. Одна цифра, все включено.
  • BYOK-оркестрація: Vapi стягує $0,05/хв лише за рівень обробки викликів. Токени LLM, символи TTS, хвилини STT та оператор — усе тарифікується окремо на ваших власних акаунтах.
  • Прямо на інфраструктурі: Будуйте одразу на OpenAI Realtime плюс Twilio. Найдешевше у великих масштабах, якщо ви кешуєте промпти. Дорого, якщо ні.

Решта цієї статті розбирає математику шар за шаром, а потім пропонує Python-функцію tco_per_minute(), яку ви можете вставити у нотатник.

Чому рекламована ціна за хвилину — це брехня (4 рівні витрат)

Рекламована плата за платформу $0,05/хв покриває лише оркестрацію. Інші чотири рівні накладаються зверху. Кожен продакшн-голосовий агент у 2026 році сплачує п'ять рядків: телефонія, STT, LLM, TTS та плата за платформу, що їх поєднує. Пропустіть будь-який — і у вас немає робочого агента.

Ось мінімум, рівень за рівнем.

Рівень 1: Телефонія (хвилина оператора)

Ви платите реальному телеком-оператору за аудіо, що проходить у публічну телефонну мережу та з неї. Twilio Programmable Voice тарифікує $0,014/хв для вихідних дзвінків у США, плюс $1–$2 на місяць за кожен телефонний номер. Twilio Elastic SIP коштує $0,0053–$0,042/хв залежно від точки входу. Більшість голосових AI-платформ або перепродають Twilio з невеликою націнкою, або передають як є. У будь-якому разі, у вашій таблиці це $0,014/хв.

Рівень 2: Розпізнавання мовлення (STT)

Ви перетворюєте те, що сказав абонент, на текст, який може прочитати LLM. Потокове розпізнавання Deepgram Nova-2 коштує приблизно $0,0043/хв на тарифі Pay-as-you-go, тож на практиці вважайте $0,005/хв. Преміальні моделі (еквівалент Whisper) зростають до $0,018/хв. Пакетні платформи приховують це у своєму головному тарифі, але воно все одно там є.

Рівень 3: LLM (текст або аудіо)

Тут два шляхи. Текстові конвеєри подають транскрибоване аудіо в модель на кшталт GPT-4o-mini ($0,15/М вхід, $0,60/М вихід) і передають відповідь у TTS. Голосовий цикл зазвичай спалює 100–300 вхідних токенів і 80–200 вихідних токенів за один обмін, що виходить приблизно $0,003–$0,015/хв для GPT-4o-mini, $0,015–$0,04/хв для Claude Haiku. Аудіо-конвеєри (OpenAI Realtime) пропускають етап транскрипції/синтезу й тарифікують безпосередньо в аудіотокенах. Нижче ми маємо цілий розділ про це; це той важіль витрат, який ніхто не пояснює.

Рівень 4: Синтез мовлення (TTS)

Ви синтезуєте відповідь назад в аудіо. ElevenLabs Turbo коштує $0,10/хв на тарифі Conversational, преміальні голоси зростають до $0,12/хв. Голоси нижчого рівня (Deepgram Aura, OpenAI tts-1) коштують $0,04–$0,06/хв. Зазвичай це другий за величиною рядок після плати за платформу.

Підсумуємо за мінімумом: $0,014 телефонія + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 платформа = щонайменше $0,114/хв на BYOK-стеку. Це до HIPAA, паралельних викликів чи оренди номерів. Якщо після цього розбору цін вам потрібне порівняння функцій віч-на-віч, дивіться наш розбір Retell AI vs Vapi vs Bland.

Порівняння 8 платформ (таблиця цін за травень 2026 року)

Наведена нижче таблиця містить головні тарифи та реалістичні повні цифри зі сторінок тарифів кожного постачальника. Використовуйте її як орієнтир, а не як істину: сторінки цін змінюються, а ваш вибір стеку змінює підсумок.

ПлатформаМодель ціноутворенняГоловний тарифРеальна повна (типова)HIPAABYOK чи пакетПомітний підступ
Retell AIЗа хвилину$0,07–$0,31/хв$0,12–$0,18/хвВключеноПакетПаралельні виклики $8/міс кожен понад включені
VapiПлата за платформу + BYOK$0,05/хв$0,13–$0,31/хв+$2 000/місBYOKУсі чотири рівні додатково
Bland AIФіксовано за хвилину$0,09/хв$0,09–$0,14/хвВключеноПакетКомісія за переадресацію $0,025/хв
SynthflowЗа хвилину на тарифіБазові $0,09/хв$0,11–$0,15/хвВключеноПакетРівні тарифів $29/$99/$449/$899
ElevenLabs ConversationalЗа хвилину$0,08–$0,12/хв$0,10–$0,18/хвТариф WorkspaceПакетLLM додатково, якщо не на керованому рівні
Deepgram Voice AgentЗа годину$4,50/год ($0,075/хв)$0,09–$0,11/хв + телефоніяТакПакетДодайте Twilio зверху
OpenAI Realtime APIАудіотокени$32/М вхід, $64/М вихід~$0,30/хв без обробки, ~$0,12 з кешемСамостійноПрямоМатематика аудіотокенів (див. нижче)
Twilio (рівень телефонії)За хвилину$0,014/хв вихідні США$0,014/хвн/дн/дТелефонні номери $1–$2/міс

Ціни перевірено у травні 2026 року. Завжди звіряйтеся зі сторінками тарифів постачальників перед підписанням: лише за минулий рік Vapi двічі змінювала свій HIPAA-додаток.

Практичний приклад: скільки насправді коштує один 4-хвилинний вихідний дзвінок?

Класичний сценарій: один 4-хвилинний вихідний дзвінок, GPT-4o-mini як LLM, ElevenLabs Turbo як голос, Twilio US як оператор, лише англійська. Коли ми прогнали цей самий сценарій на всіх чотирьох платформах (Vapi, Retell, Bland, OpenAI Realtime напряму), головний тариф пояснював менше половини підсумкової суми.

Припущення, однакові для всіх чотирьох:

  • 4 хвилини фактичної тривалості
  • ~12 обмінів у розмові, ~150 вхідних токенів + 100 вихідних токенів за обмін = 1 800 вхід / 1 200 вихід для GPT-4o-mini
  • TTS генерує ~400 символів за обмін × 12 = 4 800 символів (ElevenLabs Turbo @ $0,10/хв аудіовиходу)
  • STT тарифікує повні 4 хвилини (Deepgram Nova-2 @ ~$0,0043/хв)
  • Вихідні Twilio US @ $0,014/хв, номер $1/міс, амортизований на 1 000 дзвінків/міс = $0,001/дзвінок

Vapi BYOK: $0,05 → $0,27/хв

РядокВартість
Плата за платформу Vapi (4 хв × $0,05)$0,200
GPT-4o-mini (1 800 вхід × $0,15/М + 1 200 вихід × $0,60/М)$0,001
ElevenLabs Turbo (4 хв × $0,10)$0,400
Deepgram STT (4 хв × $0,005)$0,020
Twilio (4 хв × $0,014)$0,056
Амортизована оренда номера$0,001
Разом за дзвінок$0,678
Ефективні $/хв$0,170

Примітка: ElevenLabs Turbo на тарифі Conversational ближче до $0,10/хв, а не фіксована ставка, тож математика — це погодинна плата за вихід. Плата за платформу $0,05/хв плюс GPT-4o-mini плюс ElevenLabs Turbo плюс Twilio в сумі дають ближче до $0,17–$0,27/хв, а не $0,05.

Retell пакет: $0,10 → $0,16/хв

РядокВартість
Пакет Retell (4 хв × $0,13, GPT-4o-mini + Retell TTS)$0,520
Пропуск Twilio (4 хв × $0,014)$0,056
Амортизована оренда номера$0,002
Разом за дзвінок$0,578
Ефективні $/хв$0,145

Пакет Retell включає LLM (ви обираєте модель), STT та їхній власний TTS. Вам залишається платити Twilio зверху. Ось і все.

Bland фіксований тариф: $0,09 → $0,13/хв

РядокВартість
Фіксований Bland (4 хв × $0,09)$0,360
Пропуск Twilio (4 хв × $0,014)$0,056
Амортизована оренда номера$0,001
Разом за дзвінок$0,417
Ефективні $/хв$0,104

Bland — найчистіша математика у пошуковій видачі. Одна цифра плюс оператор. Підступ криється у прихованих комісіях: хвилини переадресації тарифікуються додатково по $0,025/хв.

OpenAI Realtime напряму (без кешування): $0,30/хв

РядокВартість
Вхід аудіо OpenAI Realtime (4 хв × ~$0,077)$0,308
Вихід аудіо OpenAI Realtime (4 хв × ~$0,077)$0,308
Twilio (4 хв × $0,014)$0,056
Амортизована оренда номера$0,001
Разом за дзвінок$0,673
Ефективні $/хв$0,168

Ця цифра передбачає, що ви кешуєте системні промпти. Без кешування той самий дзвінок виходить ближче до $1,20 ($0,30/хв), тому що кожен обмін повторно тарифікує повний системний промпт за свіжими ставками. Ми розберемо цю математику нижче.

Розбивка стеку вартості голосового агента, що показує рівні плати за платформу, LLM, TTS, STT і телефонії для одного 4-хвилинного вихідного дзвінка

Пакет проти BYOK: яка модель ціноутворення виграє для вас?

Пакетні платформи виграють, коли вам потрібен один рахунок, передбачувана погодинна математика та базово якісний голос. BYOK виграє, коли у вас є інженерні потужності, ви хочете обрати власну LLM і плануєте домовлятися про тарифи оператора у великих масштабах. Рішення зазвичай зводиться до двох питань: чи є у вас перевага щодо рядка в рахунку, і чи є у вас розробник, який візьме на себе стек?

Кейс використанняПакет виграє, тому щоBYOK виграє, тому що
Розвантаження вхідної підтримкиОдин постачальник, один рахунок, HIPAA включеноВажко обґрунтувати інженерні витрати
Масові вихідні холодні дзвінкиФіксована математика краща за несподіванки з токенамиМожна домовитися про хвилини оператора після 100 тис./міс
Кастомний RAG + використання інструментівОбмежена поверхня викликів інструментів у більшості пакетівПовний контроль над вікном контексту
Регульовані галузіПрапорець HIPAA вмикається галочкоюКомплаєнс стає вашою проблемою

Швидке правило рішення:

  • Понад 10 000 хвилин/місяць → пакет майже завжди виграє за загальною вартістю володіння (лише час інженера окупається).
  • 10 000–100 000 хвилин/місяць → BYOK починає окупатися, якщо у вас є 1+ інженер на цьому.
  • Понад 100 000 хвилин/місяць → BYOK або прямо на Realtime зазвичай на $0,05–$0,10/хв дешевше, і у вас є привід домовлятися про тарифи субакаунтів Twilio.

Для глибшого погляду на витрати LLM на боці BYOK дивіться наш розбір варіантів оркестрації у best AI agent frameworks.

Приховані комісії, які більшість пропускає

Навіть коли ви опанували математику чотирьох рівнів, рахунок приходить із рядками, які головна сторінка ніколи не згадувала. Ці сім — ті, що найчастіше б'ють наших клієнтів. Більшість із них заховані у дрібному шрифті сторінки тарифів або на екранах налаштування після реєстрації. Вони не зловмисні, просто недостатньо комуніковані.

  1. HIPAA-додаток. Vapi стягує $2 000/міс за HIPAA згідно зі своєю сторінкою тарифів. Retell, Bland та Synthflow включають HIPAA без додаткової плати. Якщо ви в охороні здоров'я й розглядаєте Vapi, це $24 тис./рік ще до того, як ви зробили перший дзвінок.
  2. Податок округлення за хвилину. Більшість платформ округлюють до 60-секундних кроків: 61-секундний дзвінок тарифікується як 2 хвилини. При 5 000 дзвінків/місяць із типовим розподілом 45–90 секунд це ефективне зростання на 5–8% понад те, що каже ваша математика $/хв. Погодинна тарифікація (Bland, Deepgram) пропускає це.
  3. Оренда телефонних номерів. Twilio: $1–$2/міс за номер. Retell: $2/міс за номер, $10/міс за верифіковані номери. Виглядає мізерним, доки ви не тримаєте 50 вихідних номерів для холодних дзвінків; це рядок $100/міс, який ніхто не озвучував.
  4. Комісії за паралельність. Retell включає базовий рівень паралельних дзвінків; понад це — $8/паралельний/місяць. Команда, що тримає 10 одночасних дзвінків понад базу, додає $80/міс.
  5. Комісії за переадресацію. Bland стягує $0,025/хв, коли агент переадресовує на людину. Якщо 20% ваших дзвінків переадресовуються, це відчутний податок на середню хвилину.
  6. Комісії за базу знань. Retell дає 10 баз знань безкоштовно; кожна додаткова — $8/міс. Накладіть RAG-інтенсивні кейси, і це швидко накопичується.
  7. Апсейл преміальних голосів. ElevenLabs Premium додає +$0,04/хв понад Turbo. Звучить як опція, доки ваша команда з продажу не проведе A/B-тест і не виявить, що Premium конвертує на 11% краще.

Потрібен хтось, хто деталізує ваш конкретний кейс перед підписанням контракту з Vapi? Ми робимо це як частину наших проєктів з розробки голосових агентів.

Аудіотокени та кешування промптів: важіль витрат, який ніхто не пояснює

OpenAI Realtime API тарифікує в аудіотокенах, де 1 токен = 100 мс вхідного аудіо або 50 мс вихідного аудіо. 60-секундний дзвінок використовує приблизно 600 вхідних токенів (абонент говорить) і 1 200 вихідних токенів (агент відповідає). При $32/М вхід і $64/М вихід це $0,0192 вхід + $0,0768 вихід = $0,096 вартості чистого аудіо за хвилину, або приблизно $0,10/хв до того, як ви додасте промпти, інструменти чи Twilio.

А ще є системний промпт. Кожен обмін надсилає ваш повний системний промпт моделі як частину вікна контексту. Типовий голосовий агент має системний промпт на 2 000 токенів, що покриває персону, інструменти, крайні випадки та логіку відмов. Без кешування цей блок на 2 000 токенів тарифікується по $32/М як свіжий на кожному дзвінку: $64 на 1 000 дзвінків.

З увімкненим кешуванням промптів (кешовані токени коштують $0,40/М згідно з документацією OpenAI) той самий обсяг на 1 000 дзвінків тарифікується по $0,80. Це знижка 80× на вартість системного промпту. Кешування промптів в OpenAI Realtime скорочує вартість системного промпту у 80 разів. Більшість команд дізнається про це лише після рахунку за перший місяць.

Ось математика як код:

python
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min

INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000

# Fresh rates
COST_IN_FRESH = 32 / 1_000_000   # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000  # 80x discount

# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min

# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS    # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS  # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80

Діаграма тарифікації аудіотокенів, що показує вхідні токени OpenAI Realtime по 100 мс кожен і вихідні токени по 50 мс кожен упродовж 60-секундного дзвінка

У нашій роботі з моделювання витрат для клієнтів, які будують прямо на Realtime, це єдиний найбільший важіль між «Realtime дешевий» і «Realtime удвічі дорожчий за Vapi». Якщо ви використовуєте Responses API поряд із Realtime для викликів інструментів, дивіться наш посібник з OpenAI Responses API щодо патерну реалізації. Ось чому розробка прямо на OpenAI Realtime може бути дешевшою або значно дорожчою за Vapi, залежно від того, чи кешуєте ви.

Як розрахувати власну TCO (формула + Python)

Загальна вартість володіння голосовим агентом — це змінна вартість за хвилину плюс місячні фіксовані комісії, амортизовані на ваш обсяг хвилин. Формула:

TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month

Підставте свої цифри. Або скопіюйте це:

python
def tco_per_minute(
    calls_per_month: int,
    avg_duration_seconds: float,
    platform_fee_per_min: float,        # e.g., 0.05 for Vapi, 0.13 for Retell bundle
    llm_in_per_1m: float,               # e.g., 0.15 for GPT-4o-mini input
    llm_out_per_1m: float,              # e.g., 0.60 for GPT-4o-mini output
    llm_in_tokens_per_call: int,        # e.g., 1800
    llm_out_tokens_per_call: int,       # e.g., 1200
    tts_per_min: float,                 # e.g., 0.10 for ElevenLabs Turbo
    stt_per_min: float,                 # e.g., 0.005 for Deepgram Nova-2
    telephony_per_min: float,           # e.g., 0.014 for Twilio US
    fixed_monthly: float = 0.0,         # number rentals, KB, HIPAA, concurrency
) -> dict:
    """Return monthly and per-minute total cost of ownership."""
    minutes_per_month = (calls_per_month * avg_duration_seconds) / 60

    # Variable per-call
    llm_cost_per_call = (
        (llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
        + (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
    )
    avg_minutes_per_call = avg_duration_seconds / 60
    variable_per_call = (
        platform_fee_per_min * avg_minutes_per_call
        + llm_cost_per_call
        + tts_per_min * avg_minutes_per_call
        + stt_per_min * avg_minutes_per_call
        + telephony_per_min * avg_minutes_per_call
    )

    monthly_variable = variable_per_call * calls_per_month
    monthly_total = monthly_variable + fixed_monthly
    cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0

    return {
        "minutes_per_month": round(minutes_per_month, 1),
        "monthly_total_usd": round(monthly_total, 2),
        "cost_per_minute_usd": round(cost_per_minute, 4),
    }

# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
    calls_per_month=5000,
    avg_duration_seconds=240,
    platform_fee_per_min=0.05,
    llm_in_per_1m=0.15, llm_out_per_1m=0.60,
    llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
    tts_per_min=0.10,
    stt_per_min=0.005,
    telephony_per_min=0.014,
    fixed_monthly=2.0,  # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}

Чотири нумеровані кроки для тих, хто прогнозує з нуля:

  1. Оцініть свій місячний обсяг дзвінків та середню тривалість дзвінка.
  2. Оберіть свій стек: платформа + LLM + TTS + STT + телефонія.
  3. Знайдіть ціну за одиницю кожного компонента на сторінці тарифів постачальника.
  4. Застосуйте формулу (або Python-функцію вище), результат — ваш прогнозований $/хв і місячний $.

Якщо ви не можете записати свою TCO як однорядкову формулу, ви програєте на податку округлення за хвилину.

Вартість у масштабі: 1 тис. проти 10 тис. проти 100 тис. хвилин на місяць

Криві швидко розходяться після 10 000 хвилин. Пакетні платформи вирівнюються, бо їхній рахунок — це просто хвилини × ставка. BYOK-стеки крутішають, оскільки витрати LLM і TTS масштабуються лінійно з вами. OpenAI Realtime з кешуванням перетинає Vapi близько 10 тис.–20 тис. хвилин/міс — точка перегину, де пряма робота на інфраструктурі починає мати сенс.

Платформа1 000 хв/міс10 000 хв/міс100 000 хв/міс
Bland фіксовано $0,09/хв + Twilio$120$1 160$11 400
Пакет Retell ~$0,145/хв загалом$145$1 450$14 500
Vapi BYOK ~$0,17/хв загалом$170$1 700$17 000
OpenAI Realtime + кешування ~$0,13/хв$130$1 300$13 000
Deepgram Voice Agent + Twilio$108$1 080$10 800

Цифри виведені з формули tco_per_minute() вище з класичними припущеннями 4-хвилинного дзвінка. Додайте HIPAA ($2 000/міс Vapi), паралельність та оренду номерів там, де вони застосовні. Вони не змінюють форму кривої, але піднімають мінімум для покупців з малим обсягом.

Головна діаграма на початку цієї статті візуалізує ті самі цифри: Bland вирівнюється рано, Vapi крутішає зі зростанням витрат LLM, а OpenAI Realtime з кешуванням перевершує Vapi після 10 тис. хвилин.

Коли вам НЕ варто розгортати голосового агента

Голосовий AI має реальний мінімум $0,10–$0,30/хв. Понад 200 дзвінків на місяць людина плюс SaaS за $19 досі виграє за вартістю. Оренда телефонних номерів, базові рівні паралельності та мінімуми платформ складаються у накладні витрати $50–$200/міс, які команда з малим обсягом просто не відбиває.

Три критерії «пропустити», чесно:

  1. Менше 200 дзвінків/місяць. Оренда номерів + мінімальні комісії + базові рівні паралельності перевищують те, що коштує людина на частковій зайнятості при $20/год. Точка беззбитковості не сходиться.

  2. Висококонтекстна робота з малим обсягом. Ваша одна людина обробляє 15 дзвінків на день, кожен із 30+ унікальними фактичними обставинами. Вартість галюцинацій LLM (повернення коштів, втрачені угоди, неправильні записи) з'їдає економію. Голосовий AI сяє на повторюваних потоках, а не на роботі з великою кількістю крайніх випадків.

  3. Регульовані галузі без бюджету на HIPAA. HIPAA-додаток Vapi за $2 тис./міс, комплаєнс-комісії оператора та захист PII ($0,005–$0,01/хв на Retell) можуть обвалити математику. Якщо ви не можете закласти $25 тис./рік лише на комплаєнс-рядки, спочатку проведіть пілоти на потоках без PHI.

У тестуванні точка беззбитковості проти людського агента для розвантаження підтримки припадає приблизно на 250–400 дзвінків/місяць за типових пакетних тарифів. Нижче цього SaaS за $19/міс плюс людина — дешевше. Не розгортайте голосовий AI лише тому, що можете.

Тиха покинута підлога кол-центру в сутінках з невикористаними гарнітурами, що символізує реальність мінімуму вартості голосового AI

Якщо голосовий AI долає мінімум вартості, але ви не хочете самі налаштовувати Retell чи Vapi, наш сервіс розробки голосових агентів будує та обслуговує повний стек на вашій інфраструктурі.

Як ми насправді обирали б платформу у 2026 році (вердикт за кейсами використання)

Жодна платформа не виграє скрізь. Найдешевший серйозний вибір залежить від того, вхідні у вас дзвінки чи вихідні, чи є у вас інженерні потужності, і чи має значення HIPAA. П'ять кейсів використання, п'ять відповідей:

  • Найдешевші серйозні вихідні (холодні дзвінки): Bland. Фіксовані $0,09/хв, прозора комісія за переадресацію, жодних несподіваних витрат LLM. Пропустіть, якщо вам потрібен глибокий RAG або кастомні інструменти.
  • Найдешевші вхідні (розвантаження підтримки): Retell. Пакет, HIPAA включено, зріла аналітика, $0,12–$0,18 загалом. Пропустіть, якщо ваш обсяг вхідних менше 200 дзвінків/міс (див. попередній розділ).
  • Максимальний контроль + кастомний RAG: Vapi BYOK. Лише якщо у вас є інженерні потужності тримати ключі LLM, TTS і STT. Контроль вартий $0,27/хв лише тоді, коли ви можете збити ціни оператора та LLM обсягом.
  • Пакетна простота у масштабі: Deepgram Voice Agent. Фіксовані $4,50/год ($0,075/хв), найменш помітний варіант у пошуковій видачі. Пропустіть, якщо вам потрібна широка бібліотека голосів, яку пропонує ElevenLabs.
  • Планка якості розмови (демо для продажу, чутливі до бренду потоки): ElevenLabs Conversational. Голоси Turbo або Premium за $0,10–$0,12/хв. Платіть надбавку, коли якість голосу — важіль конверсії.

Для глибшого галузевого зрізу на корпоративному боці дивіться AI voice agents for enterprise call centers: та сама математика, з припущеннями обсягів для ресторанів і клінік.

Як Techsy підходить до моделювання вартості голосових агентів

Ми не продаємо голосову платформу. Ми будуємо продакшн-голосових агентів для клієнтів на Retell, Vapi, Deepgram та OpenAI Realtime. Це означає, що коли ми моделюємо вартість для нового проєкту, ми проганяємо формулу tco_per_minute() на трьох рівнях обсягу (1 тис., 10 тис., 100 тис. хвилин/міс) перед рекомендацією стеку. Платформа, що виграє на 1 тис., часто програє на 100 тис.

Ми домовляємося про ціни субакаунтів Twilio для клієнтів понад 100 тис. хвилин/міс (субакаунти відкривають рівні обсягу, про які більшість команд не знає), і ми завжди моделюємо економію від кешування промптів на збірках Realtime перед затвердженням дизайну на прямій інфраструктурі. Половина нашої роботи з моделювання витрат для клієнтів — це виправлення припущень, які хтось зробив зі статті блогу постачальника.

Хочете голосового агента, побудованого під ключ на платформі, яка насправді виграє для вашого обсягу? Дивіться, як ми будуємо голосових агентів →

FAQ

Скільки коштує AI-голосовий агент за хвилину у 2026 році? Повна вартість коливається від $0,07 до $0,30 за хвилину. Пакетні платформи (Retell, Bland, ElevenLabs Conversational) виходять $0,10–$0,18/хв, щойно включено телефонію. BYOK-платформи на кшталт Vapi виходять $0,13–$0,31/хв після додавання витрат LLM, TTS, STT і Twilio. OpenAI Realtime напряму тримається біля $0,30/хв без обробки або приблизно $0,12/хв з увімкненим кешуванням промптів для системних промптів.

Яка найдешевша платформа AI-голосових агентів? Для вихідних Bland AI з фіксованими $0,09/хв — найчистіша математика на ринку. Для вхідної підтримки Retell із $0,10–$0,16 загалом зазвичай виграє завдяки включеному HIPAA та базовим рівням паралельності. Для чистих інфраструктурних рішень із кешуванням OpenAI Realtime може впасти нижче $0,15/хв. Deepgram Voice Agent із фіксованими $0,075/хв — найбільш недооцінений варіант.

Чому мій рахунок Vapi вищий за $0,05/хв? Цифра $0,05/хв на сторінці тарифів Vapi — це лише плата за платформу. Vapi — це BYOK: ви приносите власні ключі для LLM (GPT-4o-mini, Claude тощо), TTS (ElevenLabs, PlayHT), STT (Deepgram) і телефонії (Twilio). Реальна повна вартість виходить $0,13–$0,31/хв залежно від того, який голос і модель ви оберете.

У чому різниця між BYOK і пакетним ціноутворенням? Пакетні платформи (Retell, Bland, Synthflow, ElevenLabs Conversational) включають LLM, STT і TTS в один тариф за хвилину. BYOK-платформи (Vapi) стягують лише за оркестрацію, ви приносите власні API-ключі для всього іншого й отримуєте окремі рахунки від кожного постачальника. Пакет простіший; BYOK дає контроль і привід для переговорів у масштабі.

Чи є приховані комісії в цінах на AI-голосових агентів? Так, сім поширених. HIPAA-додатки ($2 000/міс на Vapi), округлення за хвилину (ефективне зростання 5–8% у масштабі), оренда телефонних номерів ($1–$2/міс), комісії за паралельність ($8/паралельний/міс Retell), комісії за переадресацію ($0,025/хв Bland), комісії за базу знань ($8/міс за базу на Retell) та апсейл преміальних голосів (+$0,04/хв ElevenLabs Premium понад Turbo).

Чи OpenAI Realtime API дешевший за Vapi? Без кешування промптів — ні: OpenAI Realtime коштує приблизно $0,30/хв вартості чистого аудіо. З увімкненим кешуванням промптів (кешовані токени системного промпту по $0,40/М проти $32/М свіжі, знижка 80×) рядок системного промпту згортається, і загальна вартість падає приблизно до $0,12–$0,15/хв. Це робить його конкурентним із пакетними платформами після 10 тис. хвилин/місяць.

Як спрогнозувати місячну вартість мого голосового агента? Оцініть кількість дзвінків на місяць, помножену на середню тривалість дзвінка в хвилинах. Помножте на повний $/хв вашої платформи. Додайте фіксовані місячні витрати: оренду телефонних номерів, комісії за базу знань, базовий рівень паралельності, HIPAA-додаток, якщо застосовно. Python-функція tco_per_minute() вище автоматизує це одним викликом функції, який можна вставити у нотатник Jupyter.

Тарифікація за хвилину чи за секунду: що дешевше? Тарифікація за секунду помітно дешевша для коротких вихідних дзвінків. 61-секундний дзвінок, тарифікований 60-секундними кроками, рахується як 2 хвилини, що є ефективним податком 5–8% при 5 000 дзвінків на місяць із типовим розподілом коротких дзвінків. Bland і Deepgram тарифікують за секунду; більшість BYOK-платформ успадковують 60-секундне округлення Twilio за замовчуванням.

Чи існують безкоштовні AI-голосові агенти? Безкоштовні пробні версії існують: більшість постачальників пропонують 10–60 безкоштовних хвилин (Retell, Vapi, Bland) для тестування. Справжніх безкоштовних голосових агентів продакшн-рівня не існує, бо ви завжди щонайменше платите за хвилини оператора ($0,014/хв на вихідних Twilio US). Навіть self-hosted опенсорс-стеки (Pipecat, LiveKit Agents) залишають вам оплату телеком-оператору та LLM.

Який ROI голосового AI проти людського агента? Людські агенти коштують $15–$30/год з усіма витратами, що виходить $0,25–$0,50/хв. Голосовий AI за $0,10–$0,20/хв перевершує вартість людини після приблизно 200 дзвінків на місяць, за умови порівнянних показників вирішення. Нижче цього обсягу мінімуми платформ та накладні витрати на оренду номерів роблять людину плюс SaaS за $19/міс дешевшою відповіддю.


Цей посібник підтримує редакційна команда Techsy. Ми будуємо продакшн-AI-голосових агентів на Retell, Vapi та OpenAI Realtime для клієнтів; ці цифри взяті з роботи з моделювання витрат, яку ми робимо щотижня, а не з брошур постачальників. Ціни перевірено станом на травень 2026 року; завжди підтверджуйте на сторінках тарифів постачальників перед підписанням.

Теги

ціни-ai-голосових-агентівголосовий-airetell-aivapibland-aiвартість-llmopenai-realtime

Поділилися статтею

Схожі статті

Більше у категорії ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 найкращих AI API для веб-скрапінгу у 2026 (перевірено на нашому агент-стеку)

Ми протестували 8 AI API для веб-скрапінгу з реальними цінами 2026 року, отриманими через наш власний агент-стек. Firecrawl, Bright Data, ScrapingBee та ще 5 — за готовністю виводу для LLM, антибот-захистом і підтримкою MCP.

9 min read хв на читання
Читати
ai-machine-learning
Jul 20, 2026

Інжиніринг промптів для кодування: 7 шаблонів, які ми щодня використовуємо в Claude Code та Cursor (2026)

Більшість статей про «промпти для AI-кодування» просто дають вам 50 шаблонів для копіювання. Ця стаття навчає 7 шаблонам, які ми використовуємо щодня для керування пайплайном із 16 агентів у Claude Code, із реальними прикладами «до» і «після» для кожного, а також пояснює, де кожен шаблон застосовується в Claude Code, Cursor і Copilot у 2026 році.

11 min read хв на читання
Читати
ai-machine-learning
Jul 19, 2026

Від PoC ШІ до продакшену: чек-лист із 12 пунктів перед релізом

Працююча демо-версія ШІ — це ще не продакшн-система. Цей чек-лист із 12 пунктів охоплює три етапи, які потрібні кожному ШІ-функціоналу перед запуском: зміцнення, стабілізація та розгортання, з конкретними пороговими значеннями для лімітів витрат, обмежень частоти запитів, резервних варіантів і тригерів відкату.

10 min read хв на читання
Читати
Переглянути всі публікації
Розпочати проєкт

Готові створити щось щось надзвичайне?

Втілимо ваше бачення в реальність. Наша команда готова допомогти вам створити програмне забезпечення, яке справді має значення.

Записатись на 30-хвилинну дзвінокНаші проєкти

З бібліотеки

Навички Claude

Переглянути всі
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-автоматизації

Переглянути всі
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

З бібліотеки

Навички Claude

Переглянути всі
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-автоматизації

Переглянути всі
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Послуги

  • Корпоративні рішення
  • Мобільні додатки
  • Веб-додатки

Рішення

  • CRM-системи
  • Інтеграція ШІ
  • ERP-розв'язання
  • Голосові аґенти
  • Автоматизація процесів
  • кібербезпека

Бібліотека

  • Блог
  • Портфоліо

Спільнота

  • AI-автоматизації
  • Навички Claude

Інструменти

  • Калькулятор вартості мобільного додатка
  • Калькулятор вартості OpenAI / LLM API
  • Калькулятор вартості MVP
  • Калькулятор вартості голосового AI-агента

Компанія

  • Про нас
  • Партнери
  • Контакти

Юридична інформація

  • Політика конфіденційності
  • Умови використання
  • Політика cookie

Послуги

  • Корпоративні рішення
  • Мобільні додатки
  • Веб-додатки

Рішення

  • CRM-системи
  • Інтеграція ШІ
  • ERP-розв'язання
  • Голосові аґенти
  • Автоматизація процесів
  • кібербезпека

Бібліотека

  • Блог
  • Портфоліо

Спільнота

  • AI-автоматизації
  • Навички Claude

Інструменти

  • Калькулятор вартості мобільного додатка
  • Калькулятор вартості OpenAI / LLM API
  • Калькулятор вартості MVP
  • Калькулятор вартості голосового AI-агента

Компанія

  • Про нас
  • Партнери
  • Контакти
Юридична інформаціяПолітика конфіденційностіУмови використанняПолітика cookie
TECHSY
© 2026 Techsy. Усі права захищені.