
Harga Agen Suara AI 2026: Kebenaran $0,05 vs $0,30 Per Menit (Dengan Hitungan)
Vapi menampilkan "$0,05/menit" di halaman harganya. Tagihan bulan pertama Anda datang dengan angka $0,27/menit. Apa yang terjadi? Setiap platform suara AI mengiklankan satu angka, yaitu biaya platform, dan menagih Anda untuk empat lapisan lain yang tidak Anda lihat di beranda. Panduan ini membangun kembali perhitungan harga agen suara ai dari dasar: biaya BYOK nyata untuk 8 platform, pos biaya audio-token yang tidak dijelaskan siapa pun, dan fungsi Python yang bisa Anda fork untuk memproyeksikan tagihan Anda sendiri.

Jawaban Cepat
- Biaya riil semua-inclusif di tahun 2026 berada di kisaran $0,07–$0,30/menit tergantung pada paket bundling vs BYOK.
- Platform terbundel (Retell, Bland, ElevenLabs) mengiklankan $0,07–$0,12/menit dan berakhir di sekitar $0,10–$0,18/menit.
- Platform BYOK (biaya platform Vapi $0,05/menit) berakhir di $0,13–$0,31/menit setelah LLM + TTS + STT + Twilio.
- Tuas tersembunyi terbesar adalah prompt caching pada OpenAI Realtime: hingga 80× lebih murah untuk prompt sistem.
Berapa sebenarnya biaya agen suara AI di tahun 2026?
Sebagian besar agen suara AI berharga $0,07 hingga $0,30 per menit secara all-in di tahun 2026. Platform terbundel (Retell, Bland, ElevenLabs) mengiklankan $0,07–$0,12/menit dan berakhir di sekitar $0,10–$0,18/menit. Platform BYOK (Vapi dengan biaya platform $0,05/menit) berakhir di $0,13–$0,31/menit setelah Anda menambahkan LLM, TTS, STT, dan Twilio. Langsung ke OpenAI Realtime berkisar sekitar $0,30/menit tanpa caching.
Tiga kategori menjelaskan hampir semua hal yang akan Anda lihat dalam tagihan Anda:
- Per-menit terbundel: Retell AI ($0,07–$0,31/menit), Bland AI ($0,09/menit flat), Synthflow, dan ElevenLabs Conversational. Satu angka, semuanya termasuk.
- Orkestrasi BYOK: Vapi mengenakan biaya $0,05/menit hanya untuk lapisan penanganan panggilan. Token LLM, karakter TTS, menit STT, dan operator telekomunikasi ditagihkan secara terpisah di akun Anda sendiri.
- Langsung ke infrastruktur: Bangun langsung di atas OpenAI Realtime ditambah Twilio. Paling murah dalam skala besar jika Anda melakukan cache prompt. Mahal jika tidak.
Sisa artikel ini akan membahas perhitungan lapis demi lapis, lalu menyediakan fungsi Python tco_per_minute() yang bisa Anda tempelkan ke notebook.
Mengapa harga per-menit yang diiklankan adalah bohong (4 lapisan biaya)
Biaya platform $0,05/menit yang diiklankan hanya mencakup orkestrasi. Empat lapisan lainnya menumpuk di atasnya. Setiap agen suara produksi di tahun 2026 membayar lima pos biaya: telekomunikasi, STT, LLM, TTS, dan biaya platform yang menyatukan semuanya. Lewati salah satunya dan Anda tidak memiliki agen yang berfungsi.
Berikut adalah batas bawahnya, lapis demi lapis.
Lapisan 1: Telekomunikasi (menit operator)
Anda membayar penyedia telekomunikasi nyata untuk audio yang masuk dan keluar dari jaringan telepon publik. Twilio Programmable Voice menagih $0,014/menit untuk panggilan keluar di AS, ditambah $1–$2/bulan per nomor telepon. Twilio Elastic SIP berkisar $0,0053–$0,042/menit tergantung asal panggilan. Sebagian besar platform suara-AI menjual kembali Twilio dengan markup kecil atau meneruskannya apa adanya. Bagaimanapun juga, itu adalah $0,014/menit di spreadsheet Anda.
Lapisan 2: Speech-to-text (STT)
Anda mengubah apa yang dikatakan penelepon menjadi teks yang dapat dibaca oleh LLM. Streaming Deepgram Nova-2 berjalan sekitar $0,0043/menit pada tier Pay-as-you-go, jadi anggap saja $0,005/menit dalam praktiknya. Model premium (setara Whisper) naik ke $0,018/menit. Platform terbundel menyembunyikan ini dalam tarif utama mereka, tetapi biayanya tetap ada di sana.
Lapisan 3: LLM (teks atau audio)
Ada dua jalur di sini. Pipelines mode teks memasukkan audio yang ditranskripsi ke dalam model seperti GPT-4o-mini ($0,15/juta input, $0,60/juta output) dan memasukkan respons ke TTS. Sebuah loop suara biasanya membakar 100–300 token input dan 80–200 token output per giliran, yang menghasilkan sekitar $0,003–$0,015/menit untuk GPT-4o-mini, $0,015–$0,04/menit untuk Claude Haiku. Pipelines mode audio (OpenAI Realtime) melewatkan tarian transkripsi/sintesis dan menagih dalam token audio secara langsung. Kami memiliki bagian khusus tentang hal itu di bawah; ini adalah tuas biaya yang tidak dijelaskan siapa pun.
Lapisan 4: Text-to-speech (TTS)
Anda mensintesis respons kembali ke audio. ElevenLabs Turbo berjalan $0,10/menit pada paket Conversational, suara Premium naik ke $0,12/menit. Suara kelas bawah (Deepgram Aura, OpenAI tts-1) berada di $0,04–$0,06/menit. Ini biasanya merupakan pos biaya terbesar kedua setelah biaya platform.
Jumlahkan di batas bawah: $0,014 telekomunikasi + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 platform = minimum $0,114/menit pada tumpukan BYOK. Itu sebelum HIPAA, konkurensi, atau sewa nomor. Jika Anda ingin perbandingan fitur head-to-head setelah pendalaman harga ini, lihat rincian kami Retell AI vs Vapi vs Bland.
8 Platform dibandingkan (tabel harga Mei 2026)
Tabel di bawah ini mengambil tarif utama dan angka all-in yang realistis dari halaman harga setiap vendor. Gunakan ini sebagai referensi, bukan kitab suci: halaman harga berubah, dan pilihan tumpukan Anda mengubah hasil akhir.
| Platform | Model harga | Tarif utama | All-in riil (tipikal) | HIPAA | BYOK atau terbundel | Jebakan penting |
|---|---|---|---|---|---|---|
| Retell AI | Per-menit | $0,07–$0,31/menit | $0,12–$0,18/menit | Termasuk | Terbundel | Konkurensi $8/bln masing-masing di luar yang disertakan |
| Vapi | Biaya platform + BYOK | $0,05/menit | $0,13–$0,31/menit | +$2.000/bln | BYOK | Keempat lapisan tambahan |
| Bland AI | Flat per-menit | $0,09/menit | $0,09–$0,14/menit | Termasuk | Terbundel | Biaya transfer $0,025/menit |
| Synthflow | Per-menit berdasarkan paket | Dasar $0,09/menit | $0,11–$0,15/menit | Termasuk | Terbundel | Tier paket $29/$99/$449/$899 |
| ElevenLabs Conversational | Per-menit | $0,08–$0,12/menit | $0,10–$0,18/menit | Paket Workspace | Terbundel | LLM ekstra kecuali pada tier terkelola |
| Deepgram Voice Agent | Per-jam | $4,50/jam ($0,075/menit) | $0,09–$0,11/menit + telekomunikasi | Ya | Terbundel | Tambahkan Twilio di atasnya |
| OpenAI Realtime API | Token audio | $32/juta input, $64/juta output | ~$0,30/menit mentah, ~$0,12 cached | DIY | Langsung | Matematika token audio (lihat di bawah) |
| Twilio (lapisan telekomunikasi) | Per-menit | $0,014/menit US keluar | $0,014/menit | n/a | n/a | Nomor telepon $1–$2/bln |
Harga diverifikasi Mei 2026. Selalu periksa halaman harga vendor sebelum menandatangani: Vapi mengubah add-on HIPAA-nya dua kali dalam setahun terakhir saja.
Contoh kerja: berapa sebenarnya biaya satu panggilan keluar 4 menit?
Skenario kanonik: satu panggilan keluar 4 menit, GPT-4o-mini sebagai LLM, ElevenLabs Turbo sebagai suara, Twilio US sebagai operator, bahasa Inggris saja. Ketika kami menjalankan skenario persis ini di keempat platform (Vapi, Retell, Bland, OpenAI Realtime langsung), tarif utama menjelaskan kurang dari setengah angka akhir.
Asumsi yang sama untuk keempatnya:
- Durasi waktu dinding 4 menit
- ~12 giliran percakapan, ~150 token input + 100 token output per giliran = 1.800 in / 1.200 out untuk GPT-4o-mini
- TTS menghasilkan ~400 karakter per giliran × 12 = 4.800 karakter (ElevenLabs Turbo @ $0,10/menit output audio)
- STT menagih penuh 4 menit (Deepgram Nova-2 @ ~$0,0043/menit)
- Twilio outbound US @ $0,014/menit, nomor $1/bln diamortisasi selama 1.000 panggilan/bln = $0,001/panggilan
Vapi BYOK: $0,05 → $0,27/menit
| Pos biaya | Biaya |
|---|---|
| Biaya platform Vapi (4 mnt × $0,05) | $0,200 |
| GPT-4o-mini (1.800 in × $0,15/juta + 1.200 out × $0,60/juta) | $0,001 |
| ElevenLabs Turbo (4 mnt × $0,10) | $0,400 |
| Deepgram STT (4 mnt × $0,005) | $0,020 |
| Twilio (4 mnt × $0,014) | $0,056 |
| Sewa nomor diamortisasi | $0,001 |
| Total untuk panggilan | $0,678 |
| Efektif $/menit | $0,170 |
Catatan: ElevenLabs Turbo pada paket Conversational lebih dekat ke $0,10/menit, bukan tarif flat, jadi perhitungannya adalah biaya per-menit output. Biaya platform $0,05/menit ditambah GPT-4o-mini ditambah ElevenLabs Turbo ditambah Twilio berjumlah lebih dekat ke $0,17–$0,27/menit, bukan $0,05.
Retell terbundel: $0,10 → $0,16/menit
| Pos biaya | Biaya |
|---|---|
| Paket Retell (4 mnt × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Twilio passthrough (4 mnt × $0,014) | $0,056 |
| Sewa nomor diamortisasi | $0,002 |
| Total untuk panggilan | $0,578 |
| Efektif $/menit | $0,145 |
Paket Retell memasukkan LLM (Anda memilih model), STT, dan TTS mereka sendiri. Anda hanya perlu membayar Twilio di atasnya. Itu saja.
Bland tarif flat: $0,09 → $0,13/menit
| Pos biaya | Biaya |
|---|---|
| Bland flat (4 mnt × $0,09) | $0,360 |
| Twilio passthrough (4 mnt × $0,014) | $0,056 |
| Sewa nomor diamortisasi | $0,001 |
| Total untuk panggilan | $0,417 |
| Efektif $/menit | $0,104 |
Bland memiliki perhitungan paling bersih di SERP. Satu angka, ditambah operator. Jebakannya terletak pada biaya tersembunyi, menit transfer ditagih $0,025/menit di atasnya.
OpenAI Realtime langsung (tanpa caching): $0,30/menit
| Pos biaya | Biaya |
|---|---|
| Audio masuk OpenAI Realtime (4 mnt × ~$0,077) | $0,308 |
| Audio keluar OpenAI Realtime (4 mnt × ~$0,077) | $0,308 |
| Twilio (4 mnt × $0,014) | $0,056 |
| Sewa nomor diamortisasi | $0,001 |
| Total untuk panggilan | $0,673 |
| Efektif $/menit | $0,168 |
Angka tersebut mengasumsikan Anda melakukan cache prompt sistem. Tanpa caching, panggilan yang sama berakhir mendekati $1,20 ($0,30/menit) karena setiap giliran menagih ulang prompt sistem penuh dengan tarif baru. Kami menguraikan perhitungan itu di bawah.

Bundled vs BYOK: model harga mana yang menang untuk Anda?
Platform terbundel menang ketika Anda menginginkan satu tagihan, matematika per-menit yang dapat diprediksi, dan suara baseline yang bagus. BYOK menang ketika Anda memiliki kapasitas rekayasa, ingin memilih LLM Anda sendiri, dan berencana menegosiasikan tarif operator dalam skala besar. Keputusan biasanya bermuara pada dua pertanyaan: apakah Anda memiliki preferensi garis tagihan, dan apakah Anda memiliki developer yang akan mengelola tumpukan tersebut?
| Kasus penggunaan | Bundled menang karena | BYOK menang karena |
|---|---|---|
| Pengalihan dukungan inbound | Satu vendor, satu tagihan, HIPAA termasuk | Sulit membenarkan biaya rekayasa |
| Panggilan dingin outbound skala besar | Matematika flat mengalahkan kejutan per-token | Anda dapat menegosiasikan menit operator melewati 100k/bln |
| RAG Kustom + penggunaan alat | Permukaan panggilan alat terbatas di sebagian besar bundel | Kontrol penuh atas jendela konteks |
| Industri yang diatur | Flag HIPAA aktif dengan satu centang | Kepatuhan menjadi masalah Anda |
Aturan keputusan cepat:
- Di bawah 10.000 menit/bulan → bundled hampir selalu menang dalam total biaya kepemilikan (waktu rekayasa saja sudah impas).
- 10.000–100.000 menit/bulan → BYOK mulai menguntungkan jika Anda memiliki 1+ engineer di dalamnya.
- Di atas 100.000 menit/bulan → BYOK atau langsung-ke-Realtime biasanya $0,05–$0,10/menit lebih murah, dan Anda memiliki leverage untuk menegosiasikan tarif sub-akun Twilio.
Untuk lensa biaya LLM yang lebih dalam di sisi BYOK, lihat rincian kami tentang pilihan orkestrasi di framework agen AI terbaik.
Biaya tersembunyi yang sering dilewatkan orang
Bahkan ketika Anda telah menguasai matematika empat lapisan, tagihan datang dengan pos-pos yang tidak pernah disebutkan di beranda. Tujuh ini adalah yang paling sering kami lihat menghantam klien. Sebagian besar terkubur dalam cetakan kecil halaman harga atau layar konfigurasi pasca-pendaftaran. Mereka tidak jahat, hanya kurang dikomunikasikan.
- Add-on HIPAA. Vapi mengenakan biaya $2.000/bln untuk HIPAA sesuai halaman harganya. Retell, Bland, dan Synthflow menyertakan HIPAA tanpa biaya tambahan. Jika Anda berada di sektor kesehatan dan mempertimbangkan Vapi, itu berarti $24k/tahun sebelum Anda melakukan satu panggilan pun.
- Pajak pembulatan per-menit. Sebagian besar platform membulatkan ke kenaikan 60 detik: panggilan 61 detik ditagih sebagai 2 menit. Pada 5.000 panggilan/bulan dengan distribusi tipikal 45-90 detik, itu adalah peningkatan efektif 5–8% di atas apa yang dikatakan matematika $/menit Anda. Penagihan per-detik (Bland, Deepgram) menghindari ini.
- Sewa nomor telepon. Twilio: $1–$2/bln per nomor. Retell: $2/bln per nomor, $10/bln untuk nomor terverifikasi. Terlihat kecil sampai Anda menjalankan 50 nomor outbound untuk panggilan dingin; itu adalah pos $100/bln yang tidak dikutip siapa pun.
- Biaya konkurensi. Retell menyertakan baseline panggilan konkuren; di luar itu, biayanya $8/konkurensi/bulan. Tim yang menjalankan 10 panggilan simultan di luar baseline menambahkan $80/bln.
- Biaya transfer. Bland mengenakan biaya $0,025/menit ketika agen mentransfer ke manusia. Jika 20% panggilan Anda ditransfer, itu adalah pajak yang berarti pada menit rata-rata.
- Biaya basis pengetahuan. Retell memberi Anda 10 KB gratis; setiap tambahan adalah $8/bln. Tumpukan kasus penggunaan RAG-heavy dan itu bertambah cepat.
- Upsell suara premium. ElevenLabs Premium menambahkan +$0,04/menit di atas Turbo. Terdengar opsional sampai tim penjualan Anda melakukan A/B testing dan menemukan Premium mengonversi 11% lebih baik.
Butuh seseorang untuk merinci kasus penggunaan spesifik Anda sebelum menandatangani kontrak Vapi? Kami melakukannya sebagai bagian dari engagement pembuatan agen suara kami.
Token audio dan prompt caching: tuas biaya yang tidak dijelaskan siapa pun
OpenAI Realtime API menagih berdasarkan token audio, di mana 1 token = 100ms audio input atau 50ms audio output. Panggilan 60 detik menggunakan sekitar 600 token input (penelepon berbicara) dan 1.200 token output (agen merespons). Pada $32/juta input dan $64/juta output, itu adalah $0,0192 input + $0,0768 output = $0,096 biaya audio mentah per menit, atau sekitar $0,10/menit sebelum Anda menambahkan prompt, alat, atau Twilio.
Lalu ada prompt sistem. Setiap giliran mengirimkan prompt sistem penuh Anda ke model sebagai bagian dari jendela konteks. Agen suara tipikal memiliki prompt sistem 2.000 token yang mencakup persona, alat, kasus tepi, dan logika penolakan. Tanpa caching, blok 2.000 token itu ditagih $32/juta segar di setiap panggilan: $64 di seluruh 1.000 panggilan.
Dengan prompt caching diaktifkan (token cached biaya $0,40/juta per dokumen OpenAI), beban kerja 1.000 panggilan yang sama ditagih $0,80. Itu adalah diskon 80× pada biaya prompt sistem. Prompt caching pada OpenAI Realtime memotong biaya prompt sistem Anda sebesar 80×. Sebagian besar tim mengetahui ini hanya setelah tagihan bulan pertama mereka.
Berikut adalah perhitungannya sebagai kode:
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Fresh rates
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x discount
# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min
# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80
Dalam pekerjaan pemodelan biaya kami untuk klien yang membangun langsung di Realtime, ini adalah tuas tunggal terbesar antara "Realtime itu murah" dan "Realtime dua kali lipat Vapi." Jika Anda menggunakan Responses API bersama Realtime untuk panggilan alat, lihat tutorial OpenAI Responses API kami untuk pola implementasinya. Inilah mengapa membangun langsung di OpenAI Realtime bisa lebih murah atau jauh lebih mahal daripada Vapi, tergantung pada apakah Anda melakukan cache.
Cara menghitung TCO Anda sendiri (rumus + Python)
Total cost of ownership untuk agen suara adalah biaya variabel per-menit ditambah biaya tetap bulanan yang diamortisasi atas volume menit Anda. Rumusnya:
TCO/menit = biaya_platform + biaya_LLM + biaya_STT + biaya_TTS + telekomunikasi + (sewa_nomor + biaya_konkurensi + biaya_KB) / menit_per_bulan
Masukkan angka Anda. Atau fork ini:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # e.g., 0.05 for Vapi, 0.13 for Retell bundle
llm_in_per_1m: float, # e.g., 0.15 for GPT-4o-mini input
llm_out_per_1m: float, # e.g., 0.60 for GPT-4o-mini output
llm_in_tokens_per_call: int, # e.g., 1800
llm_out_tokens_per_call: int, # e.g., 1200
tts_per_min: float, # e.g., 0.10 for ElevenLabs Turbo
stt_per_min: float, # e.g., 0.005 for Deepgram Nova-2
telephony_per_min: float, # e.g., 0.014 for Twilio US
fixed_monthly: float = 0.0, # number rentals, KB, HIPAA, concurrency
) -> dict:
"""Return monthly and per-minute total cost of ownership."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable per-call
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Empat langkah bernomor bagi siapa saja yang memproyeksikan dari nol:
- Perkirakan volume panggilan bulanan dan durasi panggilan rata-rata.
- Pilih tumpukan Anda: platform + LLM + TTS + STT + telekomunikasi.
- Cari harga per-unit setiap komponen dari halaman harga vendor.
- Jalankan rumus (atau fungsi Python di atas), outputnya adalah proyeksi $/menit dan bulanan Anda.
Jika Anda tidak dapat menulis TCO Anda sebagai rumus satu baris, Anda akan kalah dalam pajak pembulatan per-menit.
Biaya dalam skala: 1k vs 10k vs 100k menit per bulan
Kurva menyimpang dengan cepat di atas 10.000 menit. Platform terbundel mendatar karena tagihan mereka hanyalah menit × tarif. Tumpukan BYOK menjadi curam karena biaya LLM dan TTS meningkat secara linear dengan Anda. OpenAI Realtime dengan caching melampaui Vapi di sekitar 10k–20k menit/bln, titik infleksi di mana langsung-ke-infra mulai masuk akal.
| Platform | 1.000 mnt/bln | 10.000 mnt/bln | 100.000 mnt/bln |
|---|---|---|---|
| Bland flat $0,09/menit + Twilio | $120 | $1.160 | $11.400 |
| Paket Retell ~$0,145/menit all-in | $145 | $1.450 | $14.500 |
| Vapi BYOK ~$0,17/menit all-in | $170 | $1.700 | $17.000 |
| OpenAI Realtime + caching ~$0,13/menit | $130 | $1.300 | $13.000 |
| Deepgram Voice Agent + Twilio | $108 | $1.080 | $10.800 |
Angka berasal dari rumus tco_per_minute() di atas dengan asumsi panggilan 4 menit kanonik. Tambahkan HIPAA ($2.000/bln Vapi), konkurensi, dan sewa nomor di mana berlaku. Mereka tidak mengubah bentuk kurva tetapi mereka menaikkan batas bawah untuk pembeli volume kecil.
Grafik hero di bagian atas postingan ini memvisualisasikan angka yang sama: Bland mendatar lebih awal, Vapi menjadi curam saat biaya LLM meningkat, dan OpenAI Realtime dengan caching mengalahkan Vapi setelah 10k menit.
Kapan Anda TIDAK BOLEH menerapkan agen suara
AI Suara memiliki batas bawah riil $0,10–$0,30/menit. Di bawah 200 panggilan per bulan, manusia plus SaaS $19 masih menang dalam hal biaya. Sewa nomor telepon, baseline konkurensi, dan minimum platform bertambah menjadi overhead $50–$200/bln yang tidak dapat dipulihkan oleh tim volume rendah.
Tiga kriteria "lewati saja", secara jujur:
-
Kurang dari 200 panggilan/bulan. Sewa nomor + biaya minimum + baseline konkurensi melebihi biaya manusia paruh waktu pada $20/jam. Titik impas tidak masuk akal.
-
Konteks tinggi, volume rendah. Satu manusia Anda menangani 15 panggilan sehari, masing-masing dengan 30+ pola fakta unik. Biaya halusinasi LLM (pengembalian dana, kehilangan kesepakatan, janji temu salah) memakan penghematan. AI Suara bersinar pada alur berulang, bukan pada pekerjaan yang berat akan kasus tepi.
-
Industri yang diatur tanpa anggaran HIPAA. Add-on HIPAA Vapi seharga $2k/bln, biaya kepatuhan operator, dan pagar pengaman PII ($0,005–$0,01/menit di Retell) dapat meruntuhkan perhitungan. Jika Anda tidak dapat menganggarkan $25k/tahun hanya untuk pos kepatuhan, jalankan pilot pada alur non-PHI terlebih dahulu.
Dalam pengujian, titik impas terhadap agen manusia untuk pengalihan dukungan berada di sekitar 250–400 panggilan/bulan pada tarif terbundel tipikal. Di bawah itu, SaaS $19/bln plus manusia lebih murah. Jangan menerapkan AI Suara hanya karena Anda bisa.

Jika AI Suara memenuhi batas bawah biaya tetapi Anda tidak ingin menghubungkan Retell atau Vapi sendiri, layanan pengembangan agen suara kami membangun dan mengoperasikan tumpukan penuh di infrastruktur Anda.
Bagaimana kami sebenarnya akan memilih platform di tahun 2026 (vonis berdasarkan kasus penggunaan)
Tidak ada satu platform yang menang di mana-mana. Pilihan serius termurah tergantung pada apakah Anda inbound atau outbound, apakah Anda memiliki kapasitas rekayasa, dan apakah HIPAA penting. Lima kasus penggunaan, lima jawaban:
- Outbound serius termurah (cold calling): Bland. Flat $0,09/menit, biaya transfer transparan, tanpa kejutan biaya LLM. Lewati jika Anda membutuhkan RAG mendalam atau alat kustom.
- Inbound termurah (pengalihan dukungan): Retell. Terbundel, HIPAA termasuk, analitik matang, $0,12–$0,18 all-in. Lewati jika volume inbound Anda di bawah 200 panggilan/bln (lihat bagian sebelumnya).
- Kontrol maksimal + RAG kustom: Vapi BYOK. Hanya jika Anda memiliki kapasitas rekayasa untuk memiliki kunci LLM, TTS, dan STT. Kontrol tersebut bernilai $0,27/menit hanya ketika Anda dapat menegosiasikan operator dan LLM turun dengan volume.
- Kesederhanaan terbundel dalam skala: Deepgram Voice Agent. $4,50/jam ($0,075/menit) flat, opsi paling under-the-radar di SERP. Lewati jika Anda membutuhkan pustaka suara luas yang ditawarkan ElevenLabs.
- Ambang batas kualitas konversasional (demo penjualan, alur sensitif merek): ElevenLabs Conversational. Suara Turbo atau Premium pada $0,10–$0,12/menit. Bayar biaya tambahan ketika kualitas suara adalah tuas konversi.
Untuk irisan industri yang lebih dalam di sisi enterprise, lihat agen suara AI untuk pusat panggilan enterprise: matematika yang sama, dengan asumsi volume khusus restoran dan klinik.
Bagaimana Techsy mendekati pemodelan biaya agen suara
Kami tidak menjual platform suara. Kami membangun agen suara produksi untuk klien di Retell, Vapi, Deepgram, dan OpenAI Realtime. Itu berarti ketika kami memodelkan biaya untuk engagement baru, kami menjalankan rumus tco_per_minute() di tiga tier volume (1k, 10k, 100k menit/bln) sebelum merekomendasikan tumpukan. Platform yang menang di 1k sering kalah di 100k.
Kami menegosiasikan harga sub-akun Twilio untuk klien melewati 100k menit/bln (sub-akun membuka tier volume yang sebagian besar tim tidak tahu ada), dan kami selalu memodelkan penghematan prompt-caching pada build Realtime sebelum menyetujui desain infra-langsung. Separuh dari pekerjaan pemodelan biaya kami untuk klien adalah membatalkan asumsi yang dibuat seseorang dari posting blog vendor.
Ingin agen suara dibangun end-to-end pada platform yang sebenarnya menang untuk volume Anda? Lihat bagaimana kami membangun agen suara →
FAQ
Berapa biaya agen suara AI per menit di tahun 2026? Biaya all-in berkisar dari $0,07 hingga $0,30 per menit. Platform terbundel (Retell, Bland, ElevenLabs Conversational) berakhir di $0,10–$0,18/menit setelah telekomunikasi disertakan. Platform BYOK seperti Vapi berakhir di $0,13–$0,31/menit setelah biaya LLM, TTS, STT, dan Twilio ditambahkan. OpenAI Realtime langsung berada di sekitar $0,30/menit mentah atau sekitar $0,12/menit dengan prompt caching diaktifkan pada prompt sistem.
Apa platform agen suara AI termurah? Untuk outbound, Bland AI pada $0,09/menit flat adalah perhitungan paling bersih di pasar. Untuk dukungan inbound, Retell pada $0,10–$0,16 all-in biasanya menang berkat HIPAA terbundel dan baseline konkurensi. Untuk permainan infrastruktur murni dengan caching, OpenAI Realtime bisa turun di bawah $0,15/menit. Deepgram Voice Agent pada $0,075/menit flat adalah opsi yang paling sering diabaikan.
Mengapa tagihan Vapi saya lebih tinggi dari $0,05/menit? Angka $0,05/menit di halaman harga Vapi adalah biaya platform saja. Vapi adalah BYOK: Anda membawa kunci Anda sendiri untuk LLM (GPT-4o-mini, Claude, dll.), TTS (ElevenLabs, PlayHT), STT (Deepgram), dan telekomunikasi (Twilio). Biaya all-in riil berakhir di $0,13–$0,31/menit tergantung pada suara dan model yang Anda pilih.
Apa perbedaan antara harga BYOK dan terbundel? Platform terbundel (Retell, Bland, Synthflow, ElevenLabs Conversational) menyertakan LLM, STT, dan TTS dalam satu tarif per-menit. Platform BYOK (Vapi) hanya menagih untuk orkestrasi, Anda membawa kunci API Anda sendiri untuk segala sesuatu yang lain dan ditagih secara terpisah oleh setiap vendor. Bundled lebih sederhana; BYOK memberi Anda kontrol dan leverage negosiasi dalam skala besar.
Apakah ada biaya tersembunyi dalam harga agen suara AI? Ya, tujuh yang umum. Add-on HIPAA ($2.000/bln di Vapi), pembulatan per-menit (peningkatan efektif 5–8% dalam skala), sewa nomor telepon ($1–$2/bln), biaya konkurensi ($8/konkurensi/bln Retell), biaya transfer ($0,025/menit Bland), biaya basis pengetahuan ($8/bln per KB di Retell), dan upsell suara premium (+$0,04/menit ElevenLabs Premium di atas Turbo).
Apakah OpenAI Realtime API lebih murah daripada Vapi? Tanpa prompt caching, tidak: OpenAI Realtime berjalan sekitar $0,30/menit biaya audio mentah. Dengan prompt caching diaktifkan (token prompt sistem cached pada $0,40/juta vs $32/juta segar, diskon 80×), pos biaya prompt sistem runtuh dan total biaya turun ke sekitar $0,12–$0,15/menit. Itu membuatnya kompetitif dengan platform terbundel di atas 10k menit/bulan.
Bagaimana cara memproyeksikan biaya bulanan agen suara saya?
Perkirakan panggilan per bulan dikalikan dengan durasi panggilan rata-rata dalam menit. Kalikan dengan $/menit all-in platform Anda. Tambahkan biaya tetap bulanan: sewa nomor telepon, biaya basis pengetahuan, baseline konkurensi, add-on HIPAA jika berlaku. Fungsi Python tco_per_minute() di atas mengotomatisasi ini dengan satu panggilan fungsi yang dapat Anda tempelkan ke notebook Jupyter.
Penagihan per-menit atau per-detik: mana yang lebih murah? Penagihan per-detik secara signifikan lebih murah untuk panggilan outbound pendek. Panggilan 61 detik yang ditagih dalam kenaikan 60 detik menagih 2 menit, yang merupakan pajak efektif 5–8% pada 5.000 panggilan per bulan dengan distribusi panggilan pendek tipikal. Bland dan Deepgram menagih per-detik; sebagian besar platform BYOK mewarisi pembulatan 60 detik Twilio secara default.
Apakah ada agen suara AI gratis? Uji coba gratis ada: sebagian besar vendor menawarkan 10–60 menit gratis (Retell, Vapi, Bland) untuk diuji. Agen suara produksi-grade benar-benar gratis tidak ada karena Anda selalu membayar menit operator minimal ($0,014/menit di Twilio US outbound). Bahkan tumpukan open-source self-hosted (Pipecat, LiveKit Agents) membuat Anda membayar telco dan LLM.
Apa ROI AI suara vs agen manusia? Agen manusia berjalan $15–$30/jam fully loaded, yang setara dengan $0,25–$0,50/menit. AI Suara pada $0,10–$0,20/menit mengalahkan biaya manusia di atas sekitar 200 panggilan per bulan, dengan asumsi tingkat resolusi yang sebanding. Di bawah volume itu, minimum platform dan overhead sewa nomor membuat manusia plus SaaS $19/bln menjadi jawaban yang lebih murah.
Panduan ini dikelola oleh tim editorial Techsy. Kami membangun agen suara AI produksi di Retell, Vapi, dan OpenAI Realtime untuk klien; angka-angka ini berasal dari pekerjaan pemodelan biaya yang kami lakukan setiap minggu, bukan brosur vendor. Harga diverifikasi pada Mei 2026; selalu konfirmasi dengan halaman harga vendor sebelum menandatangani.