
Створити чи купити AI-голосового агента: фреймворк рішення на 2026 рік (з прихованим третім варіантом)
Більшість гайдів «створити чи купити» пропонують бінарний вибір. Чесна відповідь на 2026 рік — це матриця з трьох варіантів, і той, про який ніхто не говорить (найняти агенцію для побудови кастомних флоу поверх платформи), виграє приблизно для чверті команд, які ми аудитуємо.
Розробка AI-голосового агента з нуля у 2026 році коштує $250K–$2M за перший рік і триває 4–9 місяців. Покупка SaaS (Vapi, Retell, Bland) коштує $5K–$100K і запускається за 5–14 днів. Третій шлях — найняти агенцію для побудови кастомних флоу поверх платформи — коштує $30K–$150K і виходить у продакшн за 4–10 тижнів.
Швидка відповідь (чесний вердикт із 3 варіантів):
- Купити SaaS (Vapi/Retell/Bland) виграє для ~65% команд. Перший рік: $5K–$100K, запуск за 5–14 днів.
- Розробка агенцією поверх платформи виграє для ~25%. Перший рік: $30K–$150K, запуск за 4–10 тижнів, повністю кастомні флоу.
- Чиста власна розробка виграє для ~5%. Перший рік: $250K–$2M, запуск за 4–9 місяців, має сенс лише понад 500K хв/міс.
- Гібрид (купити платформу + власний кастомний шар) покриває останні ~5%, зазвичай F500 плюс регульовані галузі.
Створити, купити чи змішати? Три шляхи поруч
Кожен наявний гайд створити чи купити AI-голосового агента пропонує два варіанти. У реальних впровадженнях домінують три шляхи: купити хостингову платформу, створити з нуля власними інженерами або змішати обидва, найнявши агенцію для запуску кастомних флоу поверх Vapi, Retell чи Bland. Вони мають кардинально різні криві витрат, термінів та ризиків, і рішення зазвичай не є спірним, щойно ви чесно підрахуєте вартість.
| Шлях | Витрати за 1-й рік | Час до продакшну | Кастомізація | Найкраще для |
|---|---|---|---|---|
| Купити SaaS | $5K–$100K | 5–14 днів | Шаблон + промпт + інструменти | SMB та mid-market, стандартні флоу |
| Розробка агенцією поверх платформи | $30K–$150K | 4–10 тижнів | Повністю кастомні флоу на хостинговому рантаймі | Mid-market з унікальними воркфлоу |
| Чиста власна розробка | $250K–$2M | 4–9 місяців | Повна: кожен шар ваш | F500, >500K хв/міс, голос = основний продукт |

Дві примітки щодо таблиці. По-перше, «витрати за 1-й рік» для варіанта купити передбачають 50K–200K хвилин на місяць; нижче цього ви на нижній межі, вище — наближаєтеся до рівня агенції. По-друге, рівень агенції показує загальні витрати, включно з транзитом платформи, а не лише комісію агенції. Ви побачите розрахунки у H2 №5.
Формулювання команди закупівлі «зробити чи купити AI» повністю пропускає третій шлях. McKinsey не дарма називає це «створити, купити чи змішати». Коли ми наскрізно виміряли Retell проти Vapi проти Bland на реальному навантаженні, кожне переможне впровадження, яке ми запустили у 2025 році, потрапило у категорію змішування, а не бінарного вибору. (Дивіться порівняння Retell vs Vapi vs Bland для цифр зі сторони платформ; розбір «справжньої вартості AI-голосових агентів» від Master of Code закріплює діапазони витрат у таблиці вище.)
Більшість гайдів «створити чи купити» пропонують бінарний вибір. Чесна відповідь на 2026 рік — це матриця з трьох варіантів.
Скільки насправді коштує купити AI-голосового агента?
Справжня вартість покупки SaaS голосового AI — $0.15–$0.33 за хвилину, що у 2–4 рази більше за рекламний тариф, щойно накладаються комісії за ASR (автоматичне розпізнавання мовлення), TTS (синтез мовлення), LLM, телефонію та платформу. Витрати за перший рік при 100K хвилин/міс становлять приблизно $20K–$50K залежно від вендора та вибору голосу. Заголовна ціна чесна; просто це не те, що ви насправді заплатите.
Ось підтверджені розрахунки на травень 2026 року, коли ви вирішуєте купити AI-голосового агента з коробки.
| Вендор | Рекламна | Справжня повна/хв | Джерело (отримано 17.05.2026) |
|---|---|---|---|
| Vapi | $0.05 | $0.18–$0.33 | vapi.ai/pricing |
| Retell AI | $0.07 | $0.13–$0.31 | retellai.com/pricing |
| Bland | $0.09–$0.11 | $0.15–$0.30 | bland.ai/pricing |
| Synthflow | $0.08–$0.13 (у пакеті) | $0.10–$0.18 | Сторінка цін Synthflow |
Чому існує розрив: рекламна цифра — це частка платформи. Поверх того ви платите за провайдера STT (Deepgram типовий, ~$0.0043/хв), LLM (GPT-4o-mini за $0.15/$0.60 на 1M токенів, або Claude Haiku за схожою ціною), рушій TTS (ElevenLabs Turbo $0.06/хв за преміум-голоси, або вбудований у вендора нижчої якості), SIP-транк ($0.014/хв через Twilio) та оренду номера ($1–$5/міс кожен). Додайте аналітику після дзвінка, зберігання бази знань та рівень виділеної підтримки — і ви опиняєтеся там, де каже таблиця.
Практичні приклади за перший рік на драбині вартості голосового AI-агента, яку досягає більшість команд:
- 10K хв/міс (ранній пілот): приблизно $2,000–$4,000 загальних витрат. SaaS виграє з абсурдним відривом проти будь-якої розробки.
- 100K хв/міс (mid-market впровадження): $20K–$50K повністю. Все ще територія SaaS, якщо у вас немає шалено унікального кейсу.
- 500K хв/міс (масштаб кол-центру): $90K–$180K. Тепер ви починаєте розуміти, чому команди дістають таблицю розробки.
Щоб побачити повний посторінковий розбір за вендорами та функціями, дивіться наш детальний розбір цін на голосових агентів.
Заголовна ціна $0.05/хв реальна. Рахунок $0.28/хв наприкінці місяця — теж.
Скільки насправді коштує створити AI-голосового агента з нуля?
Створення продакшн AI-голосового агента з нуля коштує $250K–$2M за перший рік, триває 4–9 місяців і потребує команди з 3–5 старших інженерів із досвідом в ASR, LLM та телефонії. Детальний TCO (загальна вартість володіння) становить приблизно 60% зарплати інженерів, 15% інфраструктура та API, 10% комплаєнс, 15% альтернативні витрати, і майже кожна внутрішня розробка подвоює початкову оцінку.
Інженери люблять казати «ми можемо створити це за 8 тижнів за $80K». Ось детальний TCO, який приховує кожен блог вендора, рядок за рядком, із зарплатами США з навантаженням (ми покажемо коригування для Індії/ЄС далі).
| Стаття | Витрати за 1-й рік (США) | Примітки |
|---|---|---|
| Команда інженерів (3 старші × $180K) | $540,000 | Команда з Індії: ~$180K. ЄС середній: ~$360K. |
| Інфраструктура (обчислення, зберігання, observability) | $24,000 | AWS/GCP, логи, трейси, on-call сповіщення |
| Транзит ASR API (Deepgram або Whisper) | $15,000–$60,000 | Залежить від обсягу |
| Транзит TTS API (ElevenLabs) | $15,000–$60,000 | Преміум-голоси подвоюють це |
| Телефонія (Twilio Programmable Voice) | $0.014/хв × обсяг | $17K при 100K хв/міс |
| Комплаєнс-аудит (HIPAA / SOC 2 / PCI scope) | $20,000–$80,000 | Плюс щорічне поновлення |
| Альтернативні витрати (6 місяців втраченого роадмапу) | Змінні, зазвичай $200K+ | Що ще ці інженери не випустять |
| Разом за 1-й рік (типовий середній випадок) | $650K–$850K | Часто перевищує $1M, коли настають затримки |
«Правило 2×» реальне: кожна внутрішня розробка голосового AI, яку ми аудитували, виходила приблизно вдвічі більшою за початкову оцінку, майже завжди тому, що команда недооцінювала комплаєнс-обв'язку та крайні випадки чергування ходів. Master of Code задокументував той самий множник у своєму розборі, і модель TCO від Caller.Digital потрапляє в той самий діапазон. Плануйте на це, або кидайте розробку рано.
Не забувайте про шар оркестрації LLM: фреймворк, що пов'язує STT, retrieval, виклики інструментів та TTS у цикл чергування ходів. Ви оцінюватимете LangGraph, OpenAI Agents SDK або кастомний скінченний автомат. (Ми бенчмаркимо найкращі варіанти у AI-фреймворки для агентів для розробників, а сторону деплою у платформа деплою агентного AI.) Нічого з цього не є ракетобудуванням, але кожен шар — це ще один інтеграційний тест, ще один нестабільний режим відмови, ще один on-call пейдж о 2 ночі.
Управління станами отримує власну статтю. Агенти, які забувають ім'я абонента через два ходи, відчуваються зламаними для користувачів. Ми розібрали компроміси у пам'ять для AI-агентів; коротка версія: ви або спиратиметеся на Redis із кастомною серіалізацією, або орендуватимете керований шар пам'яті за $200–$2,000/міс.
Ось кумулятивна крива витрат за три роки, що порівнює всі три шляхи:
"Cumulative Cost (Year 1–3): Build vs Buy vs Agency-Built"
Таблиця даних
| "Months from kickoff" | "Pure Build" | "Buy SaaS" | "Agency-Built on Platform" |
|---|---|---|---|
| "Month 6" | 350000 | 15000 | 45000 |
| "Month 12" | 650000 | 45000 | 90000 |
| "Month 18" | 800000 | 75000 | 135000 |
| "Month 24" | 950000 | 105000 | 180000 |
| "Month 30" | 1100000 | 135000 | 225000 |
| "Month 36" | 1250000 | 165000 | 270000 |
Припущення: навантаження 100K хвилин/міс, зарплати інженерів США з навантаженням, ціни вендорів за даними на травень 2026. Перетин розробки з розробкою агенцією відбувається лише близько 32-го місяця, коли обсяг дзвінків перевищує 500K хв/міс (див. H2 №6).
Кожна внутрішня розробка голосового AI виходить удвічі більшою за початкову оцінку. Плануйте на це або кидайте рано.
Прихований третій шлях: розробка агенцією поверх платформи
Ось варіант, який пропускає кожен блог вендора: найміть агенцію, щоб побудувати ваші кастомні флоу AI-голосового агента поверх наявної платформи (Vapi, Retell або Bland). Ви уникаєте пастки найму інженерів, запускаєте за 4–10 тижнів і володієте тією ж бізнес-логікою, якою володіли б при власній розробці, не орендуючи лаву з п'яти ASR-LLM-TTS-спеціалістів для її підтримки.
Визначення: зовнішня команда інженерів пише ваші флоу, промпти, інтеграції, оцени та CRM-хуки поверх хостингової голосової платформи. Ви платите комісію за проєкт за розробку, потім похвилинний транзит платформи за рантайм. Агенція володіє кодом; ви володієте агентом.
Розрахунок вартості:
- Комісія за проєкт: $30K–$80K залежно від складності флоу (кількість інтеграцій, регуляторний обсяг, ретельність оцінів)
- Транзит платформи: $0.15–$0.30/хв за повними тарифами з H2 №3
- Результат за 1-й рік: $50K–$150K загалом, приблизно 4–10 тижнів до першого продакшн-дзвінка
Кому підходить (~25%):
- Mid-market з унікальними воркфлоу, які не вписуються в шаблон Vapi
- Регульовані галузі (охорона здоров'я, фінанси, юриспруденція), що потребують готових до аудиту оцінів + комплаєнс-документації
- Команди з нульовим штатом голосових AI-інженерів і без бажання наймати команду спеціалістів заради одного проєкту
- Мультивертикальні агенції та франчайзери, яким потрібно паралельно запустити 5+ різних флоу
Кому НЕ підходить (ворота чесності, прочитайте це, якщо розглядаєте):
- Самотній фаундер, що будує MVP: зробіть самостійно на Vapi або Retell напряму. Комісія агенції не окупиться на обсягах MVP. (Поєднайте з n8n для low-code воркфлоу агентів, якщо хочете оркестрацію без коду.)
- F500 з командою з 50 голосових AI-інженерів: створюйте. У вас є команда, обсяг та IP-обґрунтування.
- Вимога латентності <300ms: лише колокована власна розробка досягає цього. Жодна платформа ні, незалежно від того, хто пише флоу.
- Кейси, що потребують повного володіння моделлю (ви навчаєте власний LLM на транскриптах дзвінків): вам потрібен шлях розробки для ML-доступу. Платформи абстрагують цей шар.
Якщо ваша команда потрапляє у категорію розробки агенцією, ви можете поговорити з партнером із розробки кастомних голосових агентів щодо оцінки обсягу. Без поспіху, без жорсткого пітчу. Більшість команд, які звертаються, витрачають 2–4 тижні лише на мапінг своїх дзвінкових флоу перед будь-якою розмовою про контракт, і це правильний темп.
Більшість mid-market команд хочуть кастомного голосового агента. Мало хто хоче наймати команду з п'яти ASR-LLM-TTS-спеціалістів, щоб його створити.
Коли розробка насправді виграє? Математика окупності
Створення кастомного AI-голосового агента окупається лише тоді, коли місячний обсяг дзвінків перевищує приблизно 500,000 хвилин, І кейс потребує менше 5 інтеграцій, І голосовий AI є ключовим продуктовим диференціатором, а не комодитизованою функцією. Нижче цього порогу покупка SaaS або наймання агенції на платформі перевершує розробку у 2–4 рази за трирічним TCO. Формула точніша, ніж визнає більшість команд.
Простою мовою:
Розробка виграє, коли місячні хвилини > 500,000 І кейс потребує <5 інтеграцій І голосовий AI є ключовим диференціатором (не комодиті).
Практичний приклад №1, SMB-мережа клінік, 50K хв/міс. Покупка виграє у ~4 рази за три роки. Купити SaaS: ~$15K за 1-й рік, ~$45K кумулятивно за 3-й рік. Чиста розробка: ~$650K за 1-й рік, ~$1.25M кумулятивно за 3-й рік. Мережа клінік не має голосових AI-інженерів, не має обсягу дзвінків, не має регуляторного крайнього випадку, який платформи не можуть обробити. SaaS не просто дешевший. Це єдина розумна відповідь. (Дивіться голосові агенти для ресторанів для еквівалентних розрахунків у харчовій вертикалі, які приходять до того самого.)
Практичний приклад №2, ентерпрайз контакт-центр, 2M хв/міс. Розробка досягає окупності з розробкою агенцією приблизно на 28-й місяць і виграє у ~1.6 рази до 3-го року, лише якщо кейс повторюваний у вертикалях контакт-центру. Чиста розробка: ~$650K за 1-й рік, ~$3.5M кумулятивно за 3-й рік (переважно поточна підтримка інженерів). Купити SaaS за $0.20/хв у середньому: ~$4.8M за 3-й рік. Розробка тут виграє за розрахунками, але лише тому, що обсяг амортизує команду інженерів.
Гібридний крайній випадок покриває останні ~5%: компанії F500, що працюють із >5M хв/міс, регульовані галузі з власними ML-шарами, або команди, чий диференціатор — справді сама модель. Вони купують платформу для комодитизованих шарів телефонії + STT + TTS і створюють LLM та ML після дзвінка власними силами. Це те, що Caller.Digital визначає як поріг «понад 500K хв/міс і менше 5 інтеграцій», де повторюваність — це все.
Нижче 500K хвилин ви платите інженерам за перебудову того, що Vapi вже випустив.
Розробка виграє за розрахунками на 500,000 хвилин на місяць. Нижче цього ви платите інженерам за перебудову того, що Vapi вже випустив.
Яка прихована інтеграційна робота зруйнує вашу оцінку розробки?
Прихована інтеграційна робота у розробці кастомного голосового агента включає реєстрацію A2P 10DLC (application-to-person 10-digit long code), атестацію дзвінків STIR/SHAKEN, захоплення згоди TCPA (Telephone Consumer Protection Act), логіку розкриття запису за юрисдикціями, автентифікацію CRM-вебхуків та редагування PII. Платформи на кшталт Vapi, Retell та Bland вирішують кожен рядок цього з першого дня. Ваша оцінка у 8 тижнів забула 6 тижнів комплаєнс-обв'язки телефонії.
Ось скелет AI-телефонного агента, який ніхто не вносить у початкову специфікацію:
- Реєстрація A2P 10DLC: 2–6 тижнів, $50–$1,000 комісій, обов'язково для будь-якого флоу, суміжного з SMS у США (нагадування про зустрічі, підтвердження зворотного дзвінка). Дивіться документацію Twilio з A2P 10DLC для матриці реєстрації.
- Атестація STIR/SHAKEN: підписання caller-ID залежно від оператора. Без нього ваші вихідні дзвінки позначаються «Spam Likely» у 30–60% мобільних випадків. Це постійна підтримка, а не одноразово.
- Захоплення згоди TCPA: розкриття запису, інтеграція списку do-not-call, зберігання письмового opt-in. Постанова FCC 2024 року про AI-рободзвінки поширила TCPA на AI-голос; недотримання — $500–$1,500 за дзвінок.
- Розкриття запису за штатами: 12 штатів США вимагають згоди обох сторін (Каліфорнія, Флорида, Іллінойс тощо), плюс GDPR для будь-якого абонента з ЄС. Ваш агент має знати, де абонент, до другого речення.
- Автентифікація CRM-вебхуків + логіка повторів: оновлення OAuth, експоненційна затримка, черги dead-letter. Звучить тривіально; таким не є.
- Редагування PII + зберігання підсумків після дзвінка: номери кредитних карток, SSN, медичні дані очищуються перед зберіганням. HIPAA цього хоче; аудитори SOC 2 також.
Додайте все це, і ви додали 4–8 тижнів роботи, яка не з'являється у початковій оцінці «ми можемо створити це за 8 тижнів». Платформи постачають кожен рядок цього попередньо підключеним.
Ваша оцінка розробки у 8 тижнів забула 6 тижнів комплаєнс-обв'язки телефонії.
Чому власні голосові розробки звучать повільніше за платформи?
Загальний бюджет латентності для голосового AI, що відчувається природним, — менше 700ms наскрізно: STT (150–250ms) + перший токен LLM (200–400ms) + перший байт TTS (100–200ms) + мережа/джитер (100–250ms). Платформи досягають цієї медіани; власні розробки часто потрапляють на 1.2–2.0s, бо команди недооцінюють мережеву латентність та латентність холодного старту. Абоненти починають перебивати агента на 400ms тиші, тож різниця чутна.
Арифметика, яку більшість оцінок розробки ігнорує:
| Етап | Латентність (типова) | Що просідає |
|---|---|---|
| Перший чанк STT | 150–250ms | Стрімінг проти пакетної обробки; холодна модель = +200ms |
| Перший токен LLM | 200–400ms | Холодний старт додає 400ms+; довгі системні промпти додають 100ms |
| Перший байт TTS | 100–200ms | Преміум-голоси повільніші; без стрімінгу = +500ms |
| Мережевий RTT | 50–150ms | Гірше, якщо ваш регіон AWS не суміжний з оператором абонента |
| Джитер-буфер | 50–100ms | Частка, яку команди забувають |
| Загальний бюджет | 550–1,100ms | Понад 1.2s — і дзвінок відчувається не так |

Чому платформи досягають медіани 700–900ms: оптимізація пайплайну (перемежований стрімінг STT/LLM), мережева суміжність із телефонними операторами та теплі пули моделей, які ніколи не стартують холодними. Чому внутрішні розробки регулярно потрапляють на 1.2–2.0s: команди не закладають частку мережі/джитеру, холодні старти викликів LLM додають 400ms на першому ході кожного дзвінка, і більшість саморобних TTS-імплементацій не стрімять перший байт аудіо до готовності повної відповіді. Дані Close про поріг перебивання абонентом у 0.4s — найбільш цитована цифра у голосовому AI не дарма. Це межа, де природне чергування ходів ламається. Бенчмарки латентності Deepgram підтверджують нижню межу першого чанку STT близько 150ms.
Vapi досягає 700ms, бо вони володіють мережевою суміжністю. Ваша розробка в регіоні AWS — ні.
Чи можна справді створити голосового агента у 15 рядків коду?
Сучасні платформи голосового AI, як-от Vapi та Retell, пропонують виклики SDK у 10–20 рядків, які створюють готового до продакшну голосового агента. Та сама функціональність з нуля (STT, оркестрація LLM, TTS, телефонія, чергування ходів) зазвичай потребує 4–9 місяців інженерної роботи. Контрінтуїтивно, демонстрація коду робить кейс купити сильнішим, а не слабшим.
Ось робочий голосовий агент Vapi Web SDK у 15 рядках (перевірено за docs.vapi.ai/quickstart/web, отримано 17.05.2026):
import Vapi from "@vapi-ai/web";
const vapi = new Vapi(process.env.VAPI_PUBLIC_KEY);
await vapi.start({
model: {
provider: "openai",
model: "gpt-4o-mini",
systemPrompt: "You are a friendly clinic receptionist. Book appointments, answer FAQs, escalate emergencies.",
},
voice: { provider: "11labs", voiceId: "rachel" },
transcriber: { provider: "deepgram", model: "nova-2" },
firstMessage: "Hi, this is the clinic. How can I help today?",
});
vapi.on("call-end", (data) => console.log("Call ended:", data.summary));Кожен рядок у цьому сніпеті замінює місяці внутрішньої роботи. Поле transcriber — це ваша інтеграція STT. Поле voice — це весь ваш TTS-пайплайн, включно з обробкою першого байта стрімінгу. systemPrompt — це весь шар чергування ходів та викликів інструментів (Vapi обробляє barge-in, endpointing та маршрутизацію інструментів під капотом). call-end дає вам підсумок після дзвінка, для якого ви інакше будували б пайплайн Whisper + GPT-4.
Ось що ваша власна розробка відтворює 4–9 місяців. Чим уважніше ви читаєте SDK, тим важче обґрунтувати розробку.
Контрінтуїтивно: чим краще ви розумієте код, тим сильнішим виглядає кейс покупки.
Коли створення голосового агента — неправильна відповідь?
Створення голосового агента — неправильна відповідь, коли ваша команда не має досвіду запуску голосового AI, ваша оцінка менша за $150K за 1-й рік, ваш термін менший за 8 тижнів, ваш кейс чітко лягає на наявний шаблон платформи, або ваш обсяг дзвінків менший за 500K хвилин/міс. Зачепіть будь-які два з цих — і шлях розробки є халатністю, а не інженерією.
Ваша команда інженерів пропонуватиме створити. Вони не брешуть. Вони можуть це створити. Питання в тому, чи мають. Слідкуйте за цими п'ятьма сигналами антипатернів:
- «Ми просто зв'яжемо Whisper і GPT-4.» Ніхто, хто запустив голос у продакшн, так не каже. Складні частини — це чергування ходів, виявлення barge-in та стрімінг TTS, нічого з чого немає в тому реченні.
- Оцінка за 1-й рік менша за $150K. Або команда не розуміє обсягу комплаєнсу, не оцінила шар телефонії, або припустила, що observability не знадобиться. Усі три — червоні прапорці.
- Жоден інженер у команді раніше не запускав голос. Режими відмови голосового AI відрізняються від чату. Придушення луни, джитер-буферизація, barge-in: це не проблеми веб-розробки.
- Термін менший за 8 тижнів. Навіть платформам, що постачають готові примітиви, потрібно 2–4 тижні, щоб підключити інтеграції + CRM + оцени. З нуля за 8 тижнів означає вирізати комплаєнс, вирізати оцени або й те, й інше.
- «Ми створимо TTS власними силами.» Ні, не створите. ElevenLabs і Cartesia мають по сотні інженерів та виділених дослідників аудіо-моделей. Купуйте те, що комодитизоване.
Чому інженери все одно пропонують створити: кар'єрний капітал, упередження NIH («не винайдено тут»), обґрунтування штату, щира радість від інженерії з чистого аркуша. Жодна з них не є поганою причиною хотіти створити. Вони просто погані причини, щоб справді створювати.
Переосмисліть рішення: створюйте те, що вас диференціює, купуйте те, що комодитизоване. Шари LLM, ASR та TTS комодитизувалися у 2025–2026. Ваша диференціація живе у флоу, промптах, оцени та CRM-інтеграції. Не перебудовуйте шари, які Vapi, Retell, OpenAI та Deepgram вже випустили.
Створюйте те, що диференціює. Купуйте те, що комодитизоване у 2025.
Чесна матриця рішень
Після створення голосового AI для контакт-центру для клієнтів обома шляхами, наш обґрунтований розподіл такий: ~65% команд мають купити SaaS (Vapi, Retell, Bland), ~25% мають найняти агенцію для розробки на платформі, ~5% потребують гібриду (платформа + власний кастомний шар), і ~5% мають створити з нуля. Чиста власна розробка окупається лише понад 500K хвилин/міс із виділеною командою голосового AI. Це наші рекомендації після аудиту розрахунків у 4 рішеннях клієнтів у 2025–2026, а не галузева статистика.
| Розподіл | Шлях | Найкраще для | Витрати за 1-й рік |
|---|---|---|---|
| ~65% | Купити SaaS | SMB та mid-market, стандартні флоу, <500K хв/міс | $5K–$100K |
| ~25% | Розробка агенцією поверх платформи | Унікальні флоу, регульовані галузі, немає команди голосового AI | $30K–$150K |
| ~5% | Гібрид (платформа + власний ML) | F500, регульовані, власний шар моделі | $200K–$600K |
| ~5% | Чиста власна розробка | Голосовий AI — основний продукт, >500K хв/міс, є команда | $250K–$2M |

Дерево рішень із чотирьох вузлів, яким ми проводимо клієнтів:
- Ви обробляєте >500K хвилин/міс? Ні → купити або розробка агенцією. Так → продовжуйте.
- Голосовий AI — ключовий продуктовий диференціатор (не функція)? Ні → купити або розробка агенцією. Так → продовжуйте.
- У вас є внутрішня команда інженерів голосового AI (3+ запущених голосових продукти)? Ні → розробка агенцією або гібрид. Так → продовжуйте.
- Вам потрібна загальна латентність <300ms або власне навчання моделі? Ні → гібрид. Так → чиста розробка.
Більшість команд зупиняються на вузлі 1 або вузлі 2, тому 90% матриці потрапляє у купити або розробку агенцією.
Якщо ви потрапляєте у 25%, ось як ми будуємо на Retell або Vapi для клієнтів. Починайте зі своїх дзвінкових флоу, а не з контракту.
Створюйте те, що вас диференціює. Купуйте те, що комодитизоване. Для більшості команд у 2026 році це означає купити шар платформи та кастомізувати флоу.
Вердикт
- Існує три шляхи, а не два. Купити SaaS для ~65% команд. Розробка агенцією поверх платформи для ~25%. Чиста розробка лише понад 500K хв/міс із реальною командою.
- Формула окупності проста: місячні хвилини > 500K І <5 інтеграцій І голосовий AI є ключовим. Пропустіть будь-який із трьох — і математика розробки не працює.
- Правило рішення: створюйте те, що вас диференціює, купуйте те, що комодитизоване. У 2026 році це означає купувати шар платформи майже завжди.
Якщо ви у 25%, де розробка агенцією має сенс, почніть з мапінгу своїх дзвінкових флоу на дошці, потім поговоріть з партнером, який запускав на Retell або Vapi. Без поспіху. Правильний крок — оцінити обсяг перед підписанням.
FAQ
Краще створити чи купити AI-голосового агента?
Для приблизно 65% команд краще купити SaaS-платформу голосу (Vapi, Retell, Bland). Це 5–14 днів до продакшну за $5K–$100K за 1-й рік, проти 4–9 місяців і $250K–$2M за власну розробку. Розробка виграє лише понад 500K хвилин/міс, коли голосовий AI є ключовим продуктовим диференціатором і у вас є внутрішня команда з 3+ голосових AI-інженерів.
Скільки коштує створити AI-голосового агента з нуля?
Створення з нуля коштує $250K–$2M за 1-й рік для команд із зарплатами США. Розподіл приблизно $540K на інженерію (3 старші інженери), $24K інфраструктура, $30K–$120K на транзит ASR та TTS API, $0.014/хв телефонія, та $20K–$80K на комплаєнс-аудити HIPAA/SOC 2. Більшість розробок виходять у 2× більшими за початкову оцінку через комплаєнс та роботу з крайніми випадками, яку недооцінюють.
Скільки часу потрібно, щоб створити продакшн голосового AI-агента?
Створення з нуля триває 4–9 місяців для готового до продакшну агента з належним комплаєнсом, оцени та observability. Покупка SaaS-платформи, як-от Vapi або Retell, триває 5–14 днів. Прихований третій шлях (найняти агенцію для побудови кастомних флоу на наявній платформі) триває 4–10 тижнів. Розрив — це здебільшого скелет телефонії та комплаєнсу (A2P 10DLC, STIR/SHAKEN, TCPA), який платформи вирішують з першого дня.
Чи можу я створити голосового агента на Vapi або Retell замість того, щоб з нуля?
Так, це шлях розробки агенцією поверх платформи. Ви (або зовнішня агенція) будуєте кастомні флоу, промпти, інтеграції та оцени поверх хостингового рантайму Vapi, Retell або Bland. Витрати за 1-й рік — $30K–$150K загалом ($30K–$80K комісія за проєкт плюс $0.15–$0.30/хвилину транзит), і ви запускаєте за 4–10 тижнів замість 4–9 місяців. Ви володієте бізнес-логікою; платформа обробляє STT, TTS, телефонію та чергування ходів.
Який обсяг дзвінків для окупності розробки голосового AI?
Поріг окупності — близько 500,000 хвилин на місяць, і лише якщо кейс потребує менше 5 інтеграцій і голосовий AI є ключовим продуктовим диференціатором. Нижче 500K хв/міс SaaS або розробка агенцією поверх платформи перевершує розробку у 2–4 рази за трирічним TCO. Понад 500K хв/міс із правильною командою та кейсом чиста розробка досягає окупності з розробкою агенцією близько 28-го місяця і виграє до 3-го року.
Дешевше використовувати SaaS-платформу голосу чи створити власну?
Для майже кожної команди до 500K хвилин/міс SaaS дешевший з великим відривом, зазвичай у 4–10 разів дешевший за трирічним TCO. Справжній тариф SaaS — $0.15–$0.33 за хвилину (у 2–4 рази більше за рекламну цифру, щойно накладаються ASR, TTS, LLM та телефонія), але це все одно перевершує $650K–$1.25M витрат на інженерію, інфраструктуру та комплаєнс, які ви несли б, створюючи власноруч.
Які інженерні навички потрібні, щоб створити голосового агента?
Вам потрібно щонайменше 3 старші інженери з сумарним досвідом у стрімінгу аудіо в реальному часі, інтеграції ASR (Deepgram або Whisper), оркестрації LLM (LangGraph, OpenAI Agents SDK або кастомні скінченні автомати), стрімінгу TTS (ElevenLabs або Cartesia), SIP-телефонії (Twilio Programmable Voice або Telnyx), чергуванні ходів та виявленні barge-in, і комплаєнс-роботі (TCPA, HIPAA, SOC 2). Якщо ваша команда не запускала голос у продакшн, крива навчання додає 2–4 місяці до терміну.
Як відрізняється латентність між власними розробками та платформами?
Платформи досягають медіани 700–900ms наскрізно (Vapi, Retell, Bland). Власні внутрішні розробки регулярно потрапляють на 1.2–2.0 секунди, бо команди не закладають частки мережі та джитеру, а холодні старти викликів LLM додають 400ms на кожному першому ході. Понад 1.2 секунди абоненти починають перебивати агента, і чергування ходів ламається. Стеля у 700ms має значення, бо платформи володіють мережевою суміжністю з телефонними операторами. Ваша розробка в регіоні AWS — ні.
Коли створення голосового AI має фінансовий сенс?
Створення має фінансовий сенс, коли місячний обсяг дзвінків перевищує 500,000 хвилин, кейс потребує менше 5 інтеграцій, голосовий AI є ключовим продуктовим диференціатором (не функцією), і у вас є внутрішня команда з 3+ голосових AI-інженерів. Пропустіть будь-який із цих — і математика розробки не працює. Це приблизно 5% команд, які ми аудитуємо, зазвичай контакт-центри F500 або AI-нативні компанії, де голос є продуктом.
Які приховані витрати створення голосового AI власними силами?
Приховані витрати — це реєстрація A2P 10DLC (2–6 тижнів, $50–$1,000), атестація STIR/SHAKEN, захоплення згоди TCPA, логіка розкриття запису за штатами, автентифікація CRM-вебхуків, редагування PII, зберігання підсумків після дзвінка, інфраструктура observability та on-call, і 6 місяців альтернативних витрат на втрачений продуктовий роадмап. Платформи вирішують кожен рядок цього з першого дня. Правило 2× для оцінки розробки існує, бо команди забувають ці статті.