
Bảng giá AI Voice Agent năm 2026: Sự thật về mức $0.05 và $0.30 mỗi phút (kèm tính toán chi tiết)
Vapi ghi "$0.05/phút" ngay trên trang bảng giá. Hóa đơn tháng đầu tiên của bạn lại lên tới $0.27/phút. Chuyện gì đã xảy ra? Mọi nền tảng voice AI đều quảng cáo một con số, đó là phí nền tảng, rồi tính thêm cho bạn bốn lớp chi phí khác mà bạn không hề thấy trên trang chủ. Bài viết này xây dựng lại toàn bộ bài toán bảng giá ai voice agent từ con số không: chi phí BYOK thực tế của 8 nền tảng, khoản mục audio-token mà chẳng ai chịu giải thích, và một hàm Python bạn có thể fork để tự dự báo hóa đơn của mình.

Câu trả lời nhanh
- Chi phí toàn bộ thực tế năm 2026 nằm trong khoảng $0.07–$0.30/phút tùy thuộc vào mô hình trọn gói hay BYOK.
- Các nền tảng trọn gói (Retell, Bland, ElevenLabs) quảng cáo $0.07–$0.12/phút và thực tế rơi vào khoảng $0.10–$0.18/phút.
- Các nền tảng BYOK (Vapi với phí nền tảng $0.05/phút) rơi vào $0.13–$0.31/phút sau khi cộng thêm LLM + TTS + STT + Twilio.
- Đòn bẩy ẩn lớn nhất là prompt caching trên OpenAI Realtime: rẻ hơn tới 80 lần cho system prompt.
Một AI voice agent thực sự tốn bao nhiêu tiền trong năm 2026?
Hầu hết các AI voice agent có chi phí toàn bộ từ $0.07 đến $0.30 mỗi phút trong năm 2026. Các nền tảng trọn gói (Retell, Bland, ElevenLabs) quảng cáo $0.07–$0.12/phút và thực tế rơi vào khoảng $0.10–$0.18/phút. Các nền tảng BYOK (Vapi với phí nền tảng $0.05/phút) rơi vào $0.13–$0.31/phút một khi bạn cộng thêm LLM, TTS, STT và Twilio. Dùng trực tiếp OpenAI Realtime rơi vào khoảng $0.30/phút nếu không có caching.
Ba nhóm sau đây giải thích gần như mọi thứ bạn sẽ thấy trên hóa đơn:
- Trọn gói theo phút: Retell AI ($0.07–$0.31/phút), Bland AI ($0.09/phút giá cố định), Synthflow, và ElevenLabs Conversational. Một con số, bao gồm tất cả.
- Điều phối BYOK: Vapi chỉ tính $0.05/phút cho lớp xử lý cuộc gọi. Token LLM, ký tự TTS, số phút STT và nhà mạng đều được tính riêng trên các tài khoản của chính bạn.
- Trực tiếp trên hạ tầng: Xây thẳng trên OpenAI Realtime cộng với Twilio. Rẻ nhất ở quy mô lớn nếu bạn cache prompt. Đắt đỏ nếu bạn không làm vậy.
Phần còn lại của bài viết này sẽ đi qua bài toán theo từng lớp, rồi cung cấp một hàm Python tco_per_minute() mà bạn có thể dán thẳng vào notebook.
Vì sao mức giá theo phút được quảng cáo là một lời nói dối (4 lớp chi phí)
Mức phí nền tảng $0.05/phút được quảng cáo chỉ bao gồm phần điều phối. Bốn lớp còn lại chồng lên trên. Mọi voice agent chạy thực tế (production) trong năm 2026 đều phải trả năm khoản mục: điện thoại (telephony), STT, LLM, TTS, và phí nền tảng để gắn kết chúng lại với nhau. Thiếu bất kỳ khoản nào, bạn sẽ không có một agent hoạt động được.
Đây là mức sàn, theo từng lớp.
Lớp 1: Điện thoại (số phút của nhà mạng)
Bạn trả tiền cho một nhà mạng viễn thông thực sự cho phần âm thanh đi vào và đi ra khỏi mạng điện thoại công cộng. Twilio Programmable Voice tính $0.014/phút cho chiều gọi ra tại Mỹ, cộng thêm $1–$2 mỗi tháng cho mỗi số điện thoại. Twilio Elastic SIP dao động từ $0.0053–$0.042/phút tùy thuộc vào điểm khởi tạo. Hầu hết các nền tảng voice AI hoặc bán lại Twilio với một mức chênh lệch nhỏ, hoặc chuyển nguyên giá gốc. Dù cách nào, đó vẫn là $0.014/phút trong bảng tính của bạn.
Lớp 2: Nhận dạng giọng nói (STT)
Bạn chuyển những gì người gọi nói thành văn bản để LLM có thể đọc. Deepgram Nova-2 dạng streaming chạy khoảng $0.0043/phút ở gói Pay-as-you-go, nên thực tế cứ tính là $0.005/phút. Các mô hình cao cấp (tương đương Whisper) leo lên tới $0.018/phút. Các nền tảng trọn gói giấu khoản này trong mức giá chung, nhưng nó vẫn nằm ở đó.
Lớp 3: LLM (văn bản hoặc âm thanh)
Có hai hướng ở đây. Các pipeline chế độ văn bản đưa âm thanh đã phiên âm vào một mô hình như GPT-4o-mini ($0.15/M đầu vào, $0.60/M đầu ra) rồi đưa phản hồi vào TTS. Một vòng thoại thường tiêu tốn 100–300 token đầu vào và 80–200 token đầu ra mỗi lượt, tương đương khoảng $0.003–$0.015/phút cho GPT-4o-mini, và $0.015–$0.04/phút cho Claude Haiku. Các pipeline chế độ âm thanh (OpenAI Realtime) bỏ qua khâu phiên âm/tổng hợp và tính tiền trực tiếp bằng audio token. Chúng tôi có hẳn một phần riêng về chuyện này ở bên dưới; đó là đòn bẩy chi phí mà chẳng ai giải thích.
Lớp 4: Tổng hợp giọng nói (TTS)
Bạn tổng hợp phản hồi ngược lại thành âm thanh. ElevenLabs Turbo chạy ở mức $0.10/phút với gói Conversational, các giọng Premium leo lên tới $0.12/phút. Các giọng phân khúc thấp hơn (Deepgram Aura, OpenAI tts-1) rơi vào $0.04–$0.06/phút. Đây thường là khoản mục lớn thứ hai sau phí nền tảng.
Cộng lại ở mức sàn: $0.014 điện thoại + $0.005 STT + $0.005 LLM (4o-mini) + $0.04 TTS + $0.05 nền tảng = tối thiểu $0.114/phút trên một stack BYOK. Đó là chưa kể HIPAA, độ trễ (concurrency), hay thuê số. Nếu bạn muốn xem phần so sánh tính năng đối đầu sau khi đã đọc xong phần giá này, hãy xem bài phân tích Retell AI vs Vapi vs Bland của chúng tôi.
So sánh 8 nền tảng (bảng giá tháng 5 năm 2026)
Bảng dưới đây tổng hợp mức giá chung và con số toàn bộ thực tế từ trang bảng giá của từng nhà cung cấp. Hãy dùng nó như tài liệu tham khảo, đừng coi là chân lý: các trang bảng giá thay đổi, và lựa chọn stack của bạn sẽ thay đổi kết quả cuối cùng.
| Nền tảng | Mô hình giá | Mức giá chung | Toàn bộ thực tế (điển hình) | HIPAA | BYOK hay trọn gói | Điểm cần lưu ý |
|---|---|---|---|---|---|---|
| Retell AI | Theo phút | $0.07–$0.31/phút | $0.12–$0.18/phút | Đã bao gồm | Trọn gói | Concurrency $8/tháng mỗi đơn vị vượt mức bao gồm |
| Vapi | Phí nền tảng + BYOK | $0.05/phút | $0.13–$0.31/phút | +$2,000/tháng | BYOK | Cả bốn lớp đều tính thêm |
| Bland AI | Cố định theo phút | $0.09/phút | $0.09–$0.14/phút | Đã bao gồm | Trọn gói | Phí chuyển cuộc gọi $0.025/phút |
| Synthflow | Theo phút trong gói | $0.09/phút cơ bản | $0.11–$0.15/phút | Đã bao gồm | Trọn gói | Các gói $29/$99/$449/$899 |
| ElevenLabs Conversational | Theo phút | $0.08–$0.12/phút | $0.10–$0.18/phút | Gói Workspace | Trọn gói | LLM tính thêm trừ khi ở gói managed |
| Deepgram Voice Agent | Theo giờ | $4.50/giờ ($0.075/phút) | $0.09–$0.11/phút + điện thoại | Có | Trọn gói | Cộng thêm Twilio |
| OpenAI Realtime API | Audio token | $32/M đầu vào, $64/M đầu ra | ~$0.30/phút thô, ~$0.12 khi cache | Tự làm | Trực tiếp | Bài toán audio token (xem bên dưới) |
| Twilio (lớp điện thoại) | Theo phút | $0.014/phút chiều ra tại Mỹ | $0.014/phút | k/a | k/a | Số điện thoại $1–$2/tháng |
Giá được xác minh vào tháng 5 năm 2026. Luôn kiểm tra trang bảng giá của nhà cung cấp trước khi ký hợp đồng: riêng Vapi đã thay đổi gói bổ sung HIPAA hai lần chỉ trong năm ngoái.
Ví dụ thực tế: một cuộc gọi ra 4 phút thực sự tốn bao nhiêu?
Kịch bản kinh điển: một cuộc gọi ra kéo dài 4 phút, GPT-4o-mini làm LLM, ElevenLabs Turbo làm giọng nói, Twilio Mỹ làm nhà mạng, chỉ dùng tiếng Anh. Khi chúng tôi chạy chính xác kịch bản này trên cả bốn nền tảng (Vapi, Retell, Bland, và trực tiếp OpenAI Realtime), mức giá chung chỉ giải thích được chưa tới một nửa con số cuối cùng.
Các giả định được giữ nguyên trên cả bốn:
- Thời lượng thực tế 4 phút
- ~12 lượt hội thoại, ~150 token đầu vào + 100 token đầu ra mỗi lượt = 1,800 vào / 1,200 ra cho GPT-4o-mini
- TTS tạo ra ~400 ký tự mỗi lượt × 12 = 4,800 ký tự (ElevenLabs Turbo @ $0.10/phút âm thanh đầu ra)
- STT tính phí trọn 4 phút (Deepgram Nova-2 @ ~$0.0043/phút)
- Twilio chiều ra tại Mỹ @ $0.014/phút, số $1/tháng phân bổ trên 1,000 cuộc gọi/tháng = $0.001/cuộc gọi
Vapi BYOK: $0.05 → $0.27/phút
| Khoản mục | Chi phí |
|---|---|
| Phí nền tảng Vapi (4 phút × $0.05) | $0.200 |
| GPT-4o-mini (1,800 vào × $0.15/M + 1,200 ra × $0.60/M) | $0.001 |
| ElevenLabs Turbo (4 phút × $0.10) | $0.400 |
| Deepgram STT (4 phút × $0.005) | $0.020 |
| Twilio (4 phút × $0.014) | $0.056 |
| Thuê số phân bổ | $0.001 |
| Tổng cho cuộc gọi | $0.678 |
| $/phút hiệu quả | $0.170 |
Lưu ý: ElevenLabs Turbo ở gói Conversational gần với $0.10/phút hơn, không phải giá cố định, nên phép tính ở đây là mức phí đầu ra theo phút. Phí nền tảng $0.05/phút cộng GPT-4o-mini cộng ElevenLabs Turbo cộng Twilio cộng lại gần với $0.17–$0.27/phút hơn, chứ không phải $0.05.
Retell trọn gói: $0.10 → $0.16/phút
| Khoản mục | Chi phí |
|---|---|
| Gói Retell (4 phút × $0.13, GPT-4o-mini + Retell TTS) | $0.520 |
| Twilio tính theo thực tế (4 phút × $0.014) | $0.056 |
| Thuê số phân bổ | $0.002 |
| Tổng cho cuộc gọi | $0.578 |
| $/phút hiệu quả | $0.145 |
Gói của Retell đã gộp sẵn LLM (bạn chọn mô hình), STT, và TTS riêng của họ. Bạn chỉ còn phải trả thêm Twilio. Hết.
Bland giá cố định: $0.09 → $0.13/phút
| Khoản mục | Chi phí |
|---|---|
| Bland cố định (4 phút × $0.09) | $0.360 |
| Twilio tính theo thực tế (4 phút × $0.014) | $0.056 |
| Thuê số phân bổ | $0.001 |
| Tổng cho cuộc gọi | $0.417 |
| $/phút hiệu quả | $0.104 |
Bland là phép tính sạch sẽ nhất trên trang kết quả tìm kiếm. Một con số, cộng thêm nhà mạng. Cái bẫy nằm ở các khoản phí ẩn: số phút chuyển cuộc gọi bị tính thêm $0.025/phút.
OpenAI Realtime trực tiếp (không cache): $0.30/phút
| Khoản mục | Chi phí |
|---|---|
| OpenAI Realtime âm thanh vào (4 phút × ~$0.077) | $0.308 |
| OpenAI Realtime âm thanh ra (4 phút × ~$0.077) | $0.308 |
| Twilio (4 phút × $0.014) | $0.056 |
| Thuê số phân bổ | $0.001 |
| Tổng cho cuộc gọi | $0.673 |
| $/phút hiệu quả | $0.168 |
Con số đó giả định rằng bạn đang cache system prompt. Không có caching, cùng cuộc gọi ấy rơi vào khoảng $1.20 ($0.30/phút) vì mỗi lượt đều tính lại toàn bộ system prompt ở mức giá mới. Chúng tôi sẽ bóc tách phép tính đó ở bên dưới.

Trọn gói và BYOK: mô hình giá nào thắng thế với bạn?
Các nền tảng trọn gói thắng khi bạn muốn một hóa đơn duy nhất, phép tính theo phút dễ dự đoán, và một giọng nói ở mức khá. BYOK thắng khi bạn có năng lực kỹ thuật, muốn tự chọn LLM, và dự định đàm phán giá nhà mạng ở quy mô lớn. Quyết định thường quy về hai câu hỏi: bạn có ưu tiên một đầu mối thanh toán không, và bạn có một lập trình viên sẵn sàng chịu trách nhiệm cho cả stack không?
| Trường hợp sử dụng | Trọn gói thắng vì | BYOK thắng vì |
|---|---|---|
| Giảm tải hỗ trợ chiều gọi đến | Một nhà cung cấp, một hóa đơn, HIPAA đã bao gồm | Khó mà biện minh cho chi phí kỹ thuật |
| Gọi lạnh chiều ra ở quy mô lớn | Phép tính cố định tốt hơn những bất ngờ theo token | Bạn có thể đàm phán số phút nhà mạng khi vượt 100k/tháng |
| RAG tùy chỉnh + dùng tool | Bề mặt tool-call hạn chế ở hầu hết các gói | Toàn quyền kiểm soát context window |
| Ngành bị quản lý chặt | Cờ HIPAA chỉ cần bật bằng một ô checkbox | Tuân thủ trở thành vấn đề của bạn |
Quy tắc ra quyết định nhanh:
- Dưới 10,000 phút/tháng → trọn gói gần như luôn thắng về tổng chi phí sở hữu (chỉ riêng thời gian kỹ thuật đã hòa vốn).
- 10,000–100,000 phút/tháng → BYOK bắt đầu đáng giá nếu bạn có từ 1 kỹ sư trở lên phụ trách.
- Trên 100,000 phút/tháng → BYOK hoặc trực tiếp trên Realtime thường rẻ hơn $0.05–$0.10/phút, và bạn có vị thế để đàm phán giá sub-account Twilio.
Để có góc nhìn sâu hơn về chi phí LLM ở phía BYOK, hãy xem bài phân tích của chúng tôi về các lựa chọn điều phối trong best AI agent frameworks.
Những khoản phí ẩn mà hầu hết mọi người bỏ sót
Ngay cả khi bạn đã tính chắc bài toán bốn lớp, hóa đơn vẫn đến kèm những khoản mục mà trang chủ không bao giờ nhắc tới. Bảy khoản sau đây là những thứ chúng tôi thấy ảnh hưởng đến khách hàng thường xuyên nhất. Phần lớn chúng bị chôn trong dòng chữ nhỏ của trang bảng giá hoặc trong các màn hình cấu hình sau khi đăng ký. Chúng không hề ác ý, chỉ là không được truyền đạt đầy đủ.
- Gói bổ sung HIPAA. Vapi tính $2,000/tháng cho HIPAA theo trang bảng giá của họ. Retell, Bland, và Synthflow bao gồm HIPAA không tính thêm phí. Nếu bạn làm trong lĩnh vực y tế và đang cân nhắc Vapi, đó là $24k/năm trước cả khi bạn thực hiện cuộc gọi đầu tiên.
- Thuế làm tròn theo phút. Hầu hết các nền tảng làm tròn theo từng khoảng 60 giây: một cuộc gọi 61 giây bị tính thành 2 phút. Với 5,000 cuộc gọi/tháng và phân bố thời lượng điển hình từ 45-90 giây, đó là mức tăng hiệu quả 5–8% so với phép tính $/phút của bạn. Tính phí theo giây (Bland, Deepgram) bỏ qua khoản này.
- Thuê số điện thoại. Twilio: $1–$2/tháng mỗi số. Retell: $2/tháng mỗi số, $10/tháng cho số đã xác minh. Nghe có vẻ nhỏ cho đến khi bạn chạy 50 số chiều ra để gọi lạnh; đó là khoản $100/tháng mà không ai báo giá cho bạn.
- Phí concurrency. Retell bao gồm một mức cơ bản các cuộc gọi đồng thời; vượt quá mức đó, giá là $8/concurrency/tháng. Một đội chạy 10 cuộc gọi đồng thời vượt mức cơ bản sẽ phải trả thêm $80/tháng.
- Phí chuyển cuộc gọi. Bland tính $0.025/phút khi agent chuyển cho người thật. Nếu 20% cuộc gọi của bạn được chuyển tiếp, đó là một khoản thuế đáng kể trên mỗi phút trung bình.
- Phí knowledge base. Retell cho bạn 10 KB miễn phí; mỗi KB thêm là $8/tháng. Chồng các trường hợp dùng nặng RAG lên và khoản này tăng rất nhanh.
- Upsell giọng cao cấp. ElevenLabs Premium cộng thêm +$0.04/phút so với Turbo. Nghe có vẻ tùy chọn cho đến khi đội sales của bạn A/B test và phát hiện Premium chuyển đổi tốt hơn 11%.
Cần ai đó liệt kê chi tiết trường hợp sử dụng cụ thể của bạn trước khi ký hợp đồng Vapi? Chúng tôi làm việc đó như một phần trong các dự án xây dựng voice agent của mình.
Audio token và prompt caching: đòn bẩy chi phí mà chẳng ai giải thích
OpenAI Realtime API tính phí theo audio token, trong đó 1 token = 100ms âm thanh đầu vào hoặc 50ms âm thanh đầu ra. Một cuộc gọi 60 giây dùng khoảng 600 token đầu vào (người gọi nói) và 1,200 token đầu ra (agent phản hồi). Với $32/M đầu vào và $64/M đầu ra, đó là $0.0192 đầu vào + $0.0768 đầu ra = $0.096 chi phí âm thanh thô mỗi phút, hay khoảng $0.10/phút trước khi bạn cộng thêm prompt, tool, hay Twilio.
Rồi còn system prompt. Mỗi lượt đều gửi toàn bộ system prompt của bạn đến mô hình như một phần của context window. Một voice agent điển hình có system prompt 2,000 token bao quát tính cách (persona), tool, các trường hợp ngoại lệ, và logic từ chối. Không có caching, khối 2,000 token đó bị tính ở mức $32/M mới trên mỗi cuộc gọi: $64 cho 1,000 cuộc gọi.
Khi bật prompt caching (token được cache có giá $0.40/M theo tài liệu của OpenAI), cùng khối lượng 1,000 cuộc gọi đó chỉ bị tính $0.80. Đó là mức giảm 80 lần cho chi phí system prompt. Prompt caching trên OpenAI Realtime cắt giảm chi phí system prompt của bạn đi 80 lần. Hầu hết các đội chỉ phát hiện ra điều này sau hóa đơn tháng đầu tiên.
Đây là phép tính dưới dạng code:
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Fresh rates
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x discount
# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min
# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80
Trong công việc mô hình hóa chi phí cho các khách hàng xây trực tiếp trên Realtime, đây là đòn bẩy đơn lẻ lớn nhất giữa một bên là "Realtime rẻ" và bên kia là "Realtime đắt gấp đôi Vapi." Nếu bạn đang dùng Responses API song song với Realtime cho các lệnh gọi tool, hãy xem hướng dẫn OpenAI Responses API của chúng tôi để biết mẫu triển khai. Đây là lý do vì sao xây trực tiếp trên OpenAI Realtime có thể rẻ hơn hoặc đắt hơn rất nhiều so với Vapi, tùy thuộc vào việc bạn có cache hay không.
Cách tự tính TCO của riêng bạn (công thức + Python)
Tổng chi phí sở hữu (TCO) của một voice agent là chi phí biến đổi theo phút cộng với các khoản phí cố định hàng tháng được phân bổ trên sản lượng phút của bạn. Công thức:
TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month
Hãy điền các con số của bạn vào. Hoặc fork cái này:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # e.g., 0.05 for Vapi, 0.13 for Retell bundle
llm_in_per_1m: float, # e.g., 0.15 for GPT-4o-mini input
llm_out_per_1m: float, # e.g., 0.60 for GPT-4o-mini output
llm_in_tokens_per_call: int, # e.g., 1800
llm_out_tokens_per_call: int, # e.g., 1200
tts_per_min: float, # e.g., 0.10 for ElevenLabs Turbo
stt_per_min: float, # e.g., 0.005 for Deepgram Nova-2
telephony_per_min: float, # e.g., 0.014 for Twilio US
fixed_monthly: float = 0.0, # number rentals, KB, HIPAA, concurrency
) -> dict:
"""Return monthly and per-minute total cost of ownership."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable per-call
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Bốn bước được đánh số cho bất kỳ ai đang dự báo từ con số không:
- Ước tính sản lượng cuộc gọi hàng tháng và thời lượng cuộc gọi trung bình.
- Chọn stack của bạn: nền tảng + LLM + TTS + STT + điện thoại.
- Tra giá theo đơn vị của từng thành phần từ trang bảng giá của nhà cung cấp.
- Chạy công thức (hoặc hàm Python ở trên), kết quả là $/phút và $ hàng tháng dự báo của bạn.
Nếu bạn không thể viết TCO của mình thành một công thức một dòng, bạn sẽ thua ở khoản thuế làm tròn theo phút.
Chi phí ở quy mô lớn: 1k và 10k và 100k phút mỗi tháng
Các đường cong phân kỳ rất nhanh ở trên mốc 10,000 phút. Các nền tảng trọn gói đi ngang vì hóa đơn của họ chỉ là số phút × đơn giá. Các stack BYOK dốc lên khi chi phí LLM và TTS tăng tuyến tính theo bạn. OpenAI Realtime có caching vượt qua Vapi ở khoảng 10k–20k phút/tháng, điểm uốn mà việc xây trực tiếp trên hạ tầng bắt đầu hợp lý.
| Nền tảng | 1,000 phút/tháng | 10,000 phút/tháng | 100,000 phút/tháng |
|---|---|---|---|
| Bland cố định $0.09/phút + Twilio | $120 | $1,160 | $11,400 |
| Retell trọn gói ~$0.145/phút toàn bộ | $145 | $1,450 | $14,500 |
| Vapi BYOK ~$0.17/phút toàn bộ | $170 | $1,700 | $17,000 |
| OpenAI Realtime + caching ~$0.13/phút | $130 | $1,300 | $13,000 |
| Deepgram Voice Agent + Twilio | $108 | $1,080 | $10,800 |
Các con số được suy ra từ công thức tco_per_minute() ở trên với các giả định cuộc gọi 4 phút kinh điển. Cộng thêm HIPAA ($2,000/tháng với Vapi), concurrency, và thuê số ở những nơi áp dụng. Chúng không thay đổi hình dạng đường cong nhưng nâng mức sàn cho những người mua sản lượng thấp.
Biểu đồ hero ở đầu bài viết này trực quan hóa chính những con số đó: Bland đi ngang sớm, Vapi dốc lên khi chi phí LLM tăng, và OpenAI Realtime có caching đánh bại Vapi sau mốc 10k phút.
Khi nào bạn KHÔNG nên triển khai voice agent
Voice AI có một mức sàn $0.10–$0.30/phút thực sự. Dưới 200 cuộc gọi mỗi tháng, một con người cộng với một SaaS $19 vẫn thắng về chi phí. Thuê số điện thoại, mức concurrency cơ bản, và các mức tối thiểu của nền tảng cộng lại thành khoản chi phí chung $50–$200/tháng mà một đội sản lượng thấp đơn giản là không bù đắp được.
Ba tiêu chí "nên bỏ qua", nói thẳng:
-
Ít hơn 200 cuộc gọi/tháng. Thuê số + phí tối thiểu + mức concurrency cơ bản vượt quá chi phí của một nhân viên bán thời gian ở mức $20/giờ. Điểm hòa vốn không tính nổi.
-
Công việc ngữ cảnh cao, sản lượng thấp. Một nhân viên duy nhất của bạn xử lý 15 cuộc gọi mỗi ngày, mỗi cuộc có hơn 30 mẫu sự kiện riêng biệt. Chi phí ảo giác của LLM (hoàn tiền, mất hợp đồng, đặt lịch sai) ăn mòn hết phần tiết kiệm. Voice AI tỏa sáng ở các luồng lặp đi lặp lại, không phải ở công việc nặng trường hợp ngoại lệ.
-
Ngành bị quản lý chặt mà không có ngân sách HIPAA. Gói bổ sung HIPAA $2k/tháng của Vapi, phí tuân thủ của nhà mạng, và hàng rào bảo vệ PII ($0.005–$0.01/phút trên Retell) có thể làm sụp đổ cả phép tính. Nếu bạn không thể dành ngân sách $25k/năm chỉ riêng cho các khoản mục tuân thủ, hãy chạy thử nghiệm trên các luồng không chứa PHI trước.
Trong quá trình thử nghiệm, điểm hòa vốn so với một nhân viên thật cho việc giảm tải hỗ trợ rơi vào khoảng 250–400 cuộc gọi/tháng ở các mức giá trọn gói điển hình. Dưới mức đó, một SaaS $19/tháng cộng với một con người rẻ hơn. Đừng triển khai voice AI chỉ vì bạn có thể.

Nếu voice AI vượt qua được mức sàn chi phí nhưng bạn không muốn tự mình kết nối Retell hay Vapi, dịch vụ phát triển voice agent của chúng tôi sẽ xây dựng và vận hành toàn bộ stack trên hạ tầng của bạn.
Cách chúng tôi thực sự chọn nền tảng trong năm 2026 (phán quyết theo từng trường hợp)
Không có nền tảng đơn lẻ nào thắng ở mọi mặt. Lựa chọn nghiêm túc rẻ nhất phụ thuộc vào việc bạn làm chiều gọi đến hay gọi ra, bạn có năng lực kỹ thuật hay không, và HIPAA có quan trọng hay không. Năm trường hợp sử dụng, năm câu trả lời:
- Gọi ra nghiêm túc rẻ nhất (gọi lạnh): Bland. Cố định $0.09/phút, phí chuyển cuộc gọi minh bạch, không có chi phí LLM bất ngờ. Bỏ qua nếu bạn cần RAG sâu hoặc tool tùy chỉnh.
- Gọi đến rẻ nhất (giảm tải hỗ trợ): Retell. Trọn gói, HIPAA đã bao gồm, phân tích trưởng thành, $0.12–$0.18 toàn bộ. Bỏ qua nếu sản lượng gọi đến của bạn dưới 200 cuộc gọi/tháng (xem phần trước).
- Tối đa kiểm soát + RAG tùy chỉnh: Vapi BYOK. Chỉ khi bạn có năng lực kỹ thuật để tự quản lý các khóa LLM, TTS, và STT. Quyền kiểm soát chỉ đáng $0.27/phút khi bạn có thể đàm phán giảm giá nhà mạng và LLM theo sản lượng.
- Sự đơn giản trọn gói ở quy mô lớn: Deepgram Voice Agent. $4.50/giờ ($0.075/phút) cố định, lựa chọn ít được chú ý nhất trên trang kết quả tìm kiếm. Bỏ qua nếu bạn cần thư viện giọng rộng mà ElevenLabs cung cấp.
- Chuẩn chất lượng hội thoại (demo bán hàng, luồng nhạy cảm về thương hiệu): ElevenLabs Conversational. Giọng Turbo hoặc Premium ở mức $0.10–$0.12/phút. Trả thêm khi chất lượng giọng nói là đòn bẩy chuyển đổi.
Để có lát cắt sâu hơn về ngành ở phía doanh nghiệp, hãy xem AI voice agents for enterprise call centers: cùng bài toán, với các giả định sản lượng riêng cho nhà hàng và phòng khám.
Cách Techsy tiếp cận mô hình hóa chi phí voice agent
Chúng tôi không bán một nền tảng voice. Chúng tôi xây các voice agent chạy thực tế cho khách hàng trên Retell, Vapi, Deepgram, và OpenAI Realtime. Điều đó có nghĩa là khi chúng tôi mô hình hóa chi phí cho một dự án mới, chúng tôi chạy công thức tco_per_minute() ở ba mức sản lượng (1k, 10k, 100k phút/tháng) trước khi đề xuất một stack. Nền tảng thắng ở mức 1k thường thua ở mức 100k.
Chúng tôi đàm phán giá sub-account Twilio cho các khách hàng vượt 100k phút/tháng (sub-account mở khóa các mức sản lượng mà hầu hết các đội không biết là tồn tại), và chúng tôi luôn mô hình hóa phần tiết kiệm từ prompt caching trên các bản dựng Realtime trước khi chốt một thiết kế hạ tầng trực tiếp. Một nửa công việc mô hình hóa chi phí cho khách hàng của chúng tôi là gỡ bỏ những giả định mà ai đó đã đưa ra từ một bài blog của nhà cung cấp.
Muốn một voice agent được xây dựng từ đầu đến cuối trên nền tảng thực sự thắng thế cho sản lượng của bạn? Xem cách chúng tôi xây voice agent →
FAQ
Một AI voice agent tốn bao nhiêu tiền mỗi phút trong năm 2026? Chi phí toàn bộ dao động từ $0.07 đến $0.30 mỗi phút. Các nền tảng trọn gói (Retell, Bland, ElevenLabs Conversational) rơi vào $0.10–$0.18/phút một khi đã bao gồm điện thoại. Các nền tảng BYOK như Vapi rơi vào $0.13–$0.31/phút sau khi cộng thêm chi phí LLM, TTS, STT, và Twilio. OpenAI Realtime trực tiếp nằm ở khoảng $0.30/phút thô hoặc chừng $0.12/phút khi bật prompt caching cho system prompt.
Nền tảng AI voice agent nào rẻ nhất? Với chiều gọi ra, Bland AI ở mức $0.09/phút cố định là phép tính sạch sẽ nhất trên thị trường. Với hỗ trợ chiều gọi đến, Retell ở mức $0.10–$0.16 toàn bộ thường thắng nhờ HIPAA trọn gói và mức concurrency cơ bản. Với hướng đi thuần hạ tầng có caching, OpenAI Realtime có thể xuống dưới $0.15/phút. Deepgram Voice Agent ở mức $0.075/phút cố định là lựa chọn bị bỏ qua nhiều nhất.
Vì sao hóa đơn Vapi của tôi cao hơn $0.05/phút? Con số $0.05/phút trên trang bảng giá của Vapi chỉ là phí nền tảng. Vapi là BYOK: bạn tự mang khóa riêng cho LLM (GPT-4o-mini, Claude, v.v.), TTS (ElevenLabs, PlayHT), STT (Deepgram), và điện thoại (Twilio). Chi phí toàn bộ thực tế rơi vào $0.13–$0.31/phút tùy thuộc vào giọng và mô hình bạn chọn.
Sự khác biệt giữa giá BYOK và trọn gói là gì? Các nền tảng trọn gói (Retell, Bland, Synthflow, ElevenLabs Conversational) bao gồm LLM, STT, và TTS trong một mức giá theo phút duy nhất. Các nền tảng BYOK (Vapi) chỉ tính phí điều phối, bạn tự mang khóa API riêng cho mọi thứ khác và được từng nhà cung cấp tính phí riêng. Trọn gói đơn giản hơn; BYOK cho bạn quyền kiểm soát và vị thế đàm phán ở quy mô lớn.
Có những khoản phí ẩn nào trong bảng giá AI voice agent không? Có, bảy khoản phổ biến. Gói bổ sung HIPAA ($2,000/tháng trên Vapi), làm tròn theo phút (tăng hiệu quả 5–8% ở quy mô lớn), thuê số điện thoại ($1–$2/tháng), phí concurrency ($8/concurrency/tháng với Retell), phí chuyển cuộc gọi ($0.025/phút với Bland), phí knowledge base ($8/tháng mỗi KB trên Retell), và upsell giọng cao cấp (+$0.04/phút cho ElevenLabs Premium so với Turbo).
OpenAI Realtime API có rẻ hơn Vapi không? Không có prompt caching thì không: OpenAI Realtime chạy khoảng $0.30/phút chi phí âm thanh thô. Khi bật prompt caching (token system prompt được cache ở mức $0.40/M so với $32/M giá mới, giảm 80 lần), khoản mục system prompt sụp xuống và tổng chi phí giảm còn khoảng $0.12–$0.15/phút. Điều đó khiến nó cạnh tranh được với các nền tảng trọn gói ở trên mốc 10k phút/tháng.
Làm sao để dự báo chi phí hàng tháng cho voice agent của tôi?
Ước tính số cuộc gọi mỗi tháng nhân với thời lượng cuộc gọi trung bình tính bằng phút. Nhân với $/phút toàn bộ của nền tảng bạn chọn. Cộng thêm chi phí cố định hàng tháng: thuê số điện thoại, phí knowledge base, mức concurrency cơ bản, gói bổ sung HIPAA nếu áp dụng. Hàm Python tco_per_minute() ở trên tự động hóa việc này bằng một lời gọi hàm duy nhất mà bạn có thể dán vào Jupyter notebook.
Tính phí theo phút hay theo giây: cái nào rẻ hơn? Tính phí theo giây rẻ hơn đáng kể cho các cuộc gọi ra ngắn. Một cuộc gọi 61 giây bị tính theo từng khoảng 60 giây sẽ bị tính 2 phút, tương đương mức thuế hiệu quả 5–8% ở 5,000 cuộc gọi mỗi tháng với phân bố cuộc gọi ngắn điển hình. Bland và Deepgram tính phí theo giây; hầu hết các nền tảng BYOK mặc định kế thừa cách làm tròn 60 giây của Twilio.
Có AI voice agent miễn phí không? Các bản dùng thử miễn phí thì có: hầu hết nhà cung cấp cho 10–60 phút miễn phí (Retell, Vapi, Bland) để thử nghiệm. AI voice agent cấp production thực sự miễn phí thì không tồn tại vì tối thiểu bạn luôn phải trả số phút của nhà mạng ($0.014/phút cho chiều gọi ra tại Mỹ trên Twilio). Ngay cả các stack mã nguồn mở tự host (Pipecat, LiveKit Agents) vẫn khiến bạn phải trả tiền cho nhà mạng và LLM.
ROI của voice AI so với một nhân viên thật là bao nhiêu? Nhân viên thật tốn $15–$30/giờ tính đầy đủ chi phí, tương đương $0.25–$0.50/phút. Voice AI ở mức $0.10–$0.20/phút đánh bại chi phí nhân viên ở trên khoảng 200 cuộc gọi mỗi tháng, giả sử tỷ lệ giải quyết tương đương. Dưới sản lượng đó, các mức tối thiểu của nền tảng và chi phí chung thuê số khiến một con người cộng với SaaS $19/tháng trở thành câu trả lời rẻ hơn.
Bài viết này được đội ngũ biên tập Techsy duy trì. Chúng tôi xây các AI voice agent chạy thực tế trên Retell, Vapi, và OpenAI Realtime cho khách hàng; những con số này đến từ công việc mô hình hóa chi phí mà chúng tôi làm mỗi tuần, không phải từ tài liệu quảng cáo của nhà cung cấp. Giá được xác minh tính đến tháng 5 năm 2026; luôn xác nhận với trang bảng giá của nhà cung cấp trước khi ký hợp đồng.