
2026 年 AI 語音代理人定價:每分鐘 $0.05 與 $0.30 的真相(附計算)
Vapi 在定價頁面上寫著「$0.05/分鐘」。你第一個月的帳單卻來了 $0.27/分鐘。怎麼回事?每個語音 AI 平台都只廣告一個數字——平台費——然後就你在首頁看不到的另外四層費用向你收費。本指南從零開始重建 AI 語音代理人定價的數學:8 個平台的真實 BYOK 成本、沒人解釋的音訊 token 帳目,以及一個你可以 fork 來預估自己帳單的 Python 函式。

快速解答
- 2026 年真實的總成本落在每分鐘 $0.07–$0.30 之間,取決於綁定式還是 BYOK。
- 綁定式平台(Retell、Bland、ElevenLabs)廣告 $0.07–$0.12/分鐘,實際落在 $0.10–$0.18/分鐘附近。
- BYOK 平台(Vapi $0.05/分鐘平台費)加上 LLM + TTS + STT + Twilio 後落在 $0.13–$0.31/分鐘。
- 最大的隱藏槓桿是 OpenAI Realtime 的提示快取:系統提示最高可便宜 80 倍。
2026 年 AI 語音代理人到底要花多少錢?
2026 年,大多數 AI 語音代理人的總成本落在每分鐘 $0.07 到 $0.30 之間。綁定式平台(Retell、Bland、ElevenLabs)廣告 $0.07–$0.12/分鐘,實際落在 $0.10–$0.18/分鐘附近。BYOK 平台(Vapi 平台費 $0.05/分鐘)加上 LLM、TTS、STT 和 Twilio 後落在 $0.13–$0.31/分鐘。直接使用 OpenAI Realtime 在沒有快取的情況下大約是 $0.30/分鐘。
三個類別幾乎可以解釋你在帳單上看到的一切:
- 綁定式按分鐘計費:Retell AI($0.07–$0.31/分鐘)、Bland AI($0.09/分鐘固定費率)、Synthflow 和 ElevenLabs Conversational。一個數字,全部包含。
- BYOK 編排:Vapi 只對通話處理層收取 $0.05/分鐘。LLM token、TTS 字元數、STT 分鐘數和電信商都在你自己的帳戶上分別計費。
- **直接建在基礎設施上:**直接建在 OpenAI Realtime 加 Twilio 上。如果你有做提示快取,大規模下最便宜。沒有的話就很貴。
本文接下來會逐層拆解數學,最後提供一個你可以貼到 notebook 裡的 Python tco_per_minute() 函式。
為什麼廣告的每分鐘價格是騙人的(4 層成本結構)
廣告的 $0.05/分鐘平台費只涵蓋編排。其他四層會疊加上去。2026 年每個生產環境的語音代理人都要支付五個帳目:電話、STT、LLM、TTS,以及把它們黏在一起的平台費。少任何一個,你就沒有能運作的代理人。
以下是逐層的最低成本。
第一層:電話(電信商分鐘數)
你付錢給真正的電信公司,讓音訊進出公共電話網路。Twilio Programmable Voice 在美國外撥每分鐘 $0.014,加上每個電話號碼每月 $1–$2。Twilio Elastic SIP 依發話來源不同,範圍在 $0.0053–$0.042/分鐘。大多數語音 AI 平台要嘛以小幅加價轉售 Twilio,要嘛原封不動地轉嫁。不管哪種,在你的試算表裡就是 $0.014/分鐘。
第二層:語音轉文字(STT)
你把來電者說的話轉換成 LLM 能讀的文字。Deepgram Nova-2 串流在隨付即用方案大約 $0.0043/分鐘,實務上算 $0.005/分鐘。高級模型(Whisper 等級)攀升到 $0.018/分鐘。綁定式平台把這個藏在他們的標示費率裡,但它確實存在。
第三層:LLM(文字或音訊)
這裡有兩條路。文字模式管線將轉錄的音訊送入像 GPT-4o-mini 這樣的模型(輸入 $0.15/M,輸出 $0.60/M),再把回應送入 TTS。語音對話迴圈每輪通常消耗 100–300 個輸入 token 和 80–200 個輸出 token,換算下來 GPT-4o-mini 大約 $0.003–$0.015/分鐘,Claude Haiku 則為 $0.015–$0.04/分鐘。音訊模式管線(OpenAI Realtime)跳過轉錄/合成的步驟,直接以音訊 token 計費。下面有完整章節說明;這是沒人解釋的成本槓桿。
第四層:文字轉語音(TTS)
你把回應合成回音訊。ElevenLabs Turbo 在 Conversational 方案是 $0.10/分鐘,Premium 聲音攀升到 $0.12/分鐘。低階聲音(Deepgram Aura、OpenAI tts-1)落在 $0.04–$0.06/分鐘。這通常是僅次於平台費的第二大帳目。
加總最低成本:$0.014 電話 + $0.005 STT + $0.005 LLM (4o-mini) + $0.04 TTS + $0.05 平台 = BYOK 架構最低 $0.114/分鐘。這還沒算 HIPAA、併發或號碼租用。如果你想在這次定價深入分析之後看完整的功能比較,請參考我們的 Retell AI vs Vapi vs Bland 拆解。
8 大平台比較(2026 年 5 月定價表)
下表從各廠商定價頁面整理出標示費率和實際總成本數字。當作參考,不要當聖經:定價頁面會變,你的架構選擇也會影響最終數字。
| 平台 | 定價模式 | 標示費率 | 實際總成本(典型) | HIPAA | BYOK 或綁定 | 值得注意的陷阱 |
|---|---|---|---|---|---|---|
| Retell AI | 按分鐘 | $0.07–$0.31/分鐘 | $0.12–$0.18/分鐘 | 已包含 | 綁定 | 超出包含量的併發每路 $8/月 |
| Vapi | 平台費 + BYOK | $0.05/分鐘 | $0.13–$0.31/分鐘 | +$2,000/月 | BYOK | 四層全部額外計費 |
| Bland AI | 固定按分鐘 | $0.09/分鐘 | $0.09–$0.14/分鐘 | 已包含 | 綁定 | 轉接費 $0.025/分鐘 |
| Synthflow | 方案內按分鐘 | 基本 $0.09/分鐘 | $0.11–$0.15/分鐘 | 已包含 | 綁定 | 方案級距 $29/$99/$449/$899 |
| ElevenLabs Conversational | 按分鐘 | $0.08–$0.12/分鐘 | $0.10–$0.18/分鐘 | Workspace 方案 | 綁定 | 除非用託管級距,否則 LLM 額外計費 |
| Deepgram Voice Agent | 按小時 | $4.50/小時($0.075/分鐘) | $0.09–$0.11/分鐘 + 電話 | 有 | 綁定 | 需另加 Twilio |
| OpenAI Realtime API | 音訊 token | 輸入 $32/M,輸出 $64/M | 原始約 $0.30/分鐘,快取後約 $0.12 | 自行處理 | 直接 | 音訊 token 計算(見下文) |
| Twilio(電話層) | 按分鐘 | 美國外撥 $0.014/分鐘 | $0.014/分鐘 | 不適用 | 不適用 | 電話號碼 $1–$2/月 |
價格於 2026 年 5 月驗證。簽約前務必確認廠商定價頁面:光是過去一年,Vapi 就改了兩次 HIPAA 加購方案。
實際範例:一通 4 分鐘外撥電話到底花多少?
標準情境:一通 4 分鐘外撥電話,LLM 用 GPT-4o-mini,語音用 ElevenLabs Turbo,電信商用 Twilio 美國,僅英文。當我們在四個平台(Vapi、Retell、Bland、OpenAI Realtime 直連)上跑這個完全相同的情境時,標示費率只能解釋最終數字的一半不到。
四個平台保持一致的假設:
- 4 分鐘實際通話時長
- 約 12 輪對話,每輪約 150 輸入 token + 100 輸出 token = GPT-4o-mini 共 1,800 輸入 / 1,200 輸出
- TTS 每輪產生約 400 字元 × 12 = 4,800 字元(ElevenLabs Turbo @ $0.10/分鐘音訊輸出)
- STT 對完整 4 分鐘計費(Deepgram Nova-2 @ 約 $0.0043/分鐘)
- Twilio 美國外撥 @ $0.014/分鐘,$1/月號碼攤提到 1,000 通/月 = $0.001/通
Vapi BYOK:$0.05 → $0.27/分鐘
| 帳目 | 成本 |
|---|---|
| Vapi 平台費(4 分鐘 × $0.05) | $0.200 |
| GPT-4o-mini(1,800 輸入 × $0.15/M + 1,200 輸出 × $0.60/M) | $0.001 |
| ElevenLabs Turbo(4 分鐘 × $0.10) | $0.400 |
| Deepgram STT(4 分鐘 × $0.005) | $0.020 |
| Twilio(4 分鐘 × $0.014) | $0.056 |
| 號碼租用攤提 | $0.001 |
| 本通電話總計 | $0.678 |
| 實際每分鐘成本 | $0.170 |
注意:Conversational 方案上的 ElevenLabs Turbo 接近 $0.10/分鐘,不是固定費率,所以這裡的計算是按分鐘輸出收費。$0.05/分鐘平台費加上 GPT-4o-mini 加上 ElevenLabs Turbo 加上 Twilio,加起來接近 $0.17–$0.27/分鐘,而不是 $0.05。
Retell 綁定式:$0.10 → $0.16/分鐘
| 帳目 | 成本 |
|---|---|
| Retell 綁定(4 分鐘 × $0.13,GPT-4o-mini + Retell TTS) | $0.520 |
| Twilio 轉嫁(4 分鐘 × $0.014) | $0.056 |
| 號碼租用攤提 | $0.002 |
| 本通電話總計 | $0.578 |
| 實際每分鐘成本 | $0.145 |
Retell 的綁定方案內含 LLM(你選模型)、STT 和他們自家的 TTS。你只需要額外付 Twilio。就這樣。
Bland 固定費率:$0.09 → $0.13/分鐘
| 帳目 | 成本 |
|---|---|
| Bland 固定費(4 分鐘 × $0.09) | $0.360 |
| Twilio 轉嫁(4 分鐘 × $0.014) | $0.056 |
| 號碼租用攤提 | $0.001 |
| 本通電話總計 | $0.417 |
| 實際每分鐘成本 | $0.104 |
Bland 是搜尋結果中數學最乾淨的。一個數字,加上電信商。陷阱藏在隱藏費用裡——轉接分鐘數額外收 $0.025/分鐘。
OpenAI Realtime 直連(無快取):$0.30/分鐘
| 帳目 | 成本 |
|---|---|
| OpenAI Realtime 音訊輸入(4 分鐘 × 約 $0.077) | $0.308 |
| OpenAI Realtime 音訊輸出(4 分鐘 × 約 $0.077) | $0.308 |
| Twilio(4 分鐘 × $0.014) | $0.056 |
| 號碼租用攤提 | $0.001 |
| 本通電話總計 | $0.673 |
| 實際每分鐘成本 | $0.168 |
這個數字假設你有做系統提示快取。沒有快取的話,同一通電話會接近 $1.20($0.30/分鐘),因為每一輪都會以全新費率重新計費完整的系統提示。我們下面會拆解這個計算。

綁定式 vs BYOK:哪種定價模式適合你?
綁定式平台在你想要單一帳單、可預測的每分鐘計算、以及基本水準的聲音品質時勝出。BYOK 在你有工程能量、想自己選 LLM、並計劃在大規模時與電信商談費率時勝出。這個決定通常取決於兩個問題:你有沒有帳單歸屬的偏好,以及你有沒有能負責這個架構的工程師?
| 使用情境 | 綁定式勝出的原因 | BYOK 勝出的原因 |
|---|---|---|
| 進線客服分流 | 一個廠商、一張帳單、HIPAA 已包含 | 很難合理化工程成本 |
| 大規模外撥陌生開發 | 固定計算勝過按 token 的意外 | 超過 10 萬分鐘/月時可以跟電信商談費率 |
| 自訂 RAG + 工具使用 | 大多數綁定方案的工具呼叫功能有限 | 完全掌控上下文視窗 |
| 受監管產業 | 勾選核取方塊即可開啟 HIPAA | 合規變成你的問題 |
快速決策法則:
- 每月低於 10,000 分鐘 → 綁定式在總擁有成本上幾乎總是勝出(光是工程時間就打平了)。
- 每月 10,000–100,000 分鐘 → 如果你有 1 位以上工程師投入,BYOK 開始划算。
- 每月超過 100,000 分鐘 → BYOK 或直連 Realtime 通常便宜 $0.05–$0.10/分鐘,而且你有籌碼去談 Twilio 子帳戶費率。
想從 LLM 成本角度深入了解 BYOK 面,請參考我們關於編排選擇的拆解:best AI agent frameworks。
大多數人忽略的隱藏費用
即使你搞定了四層計算,帳單上還是會出現首頁從沒提到的帳目。這七項是我們最常在客戶身上看到的。大多數藏在定價頁面的細則裡,或簽約後的設定畫面中。它們不是惡意的,只是溝通不足。
- **HIPAA 加購。**Vapi 依其定價頁面收取 HIPAA $2,000/月。Retell、Bland 和 Synthflow 免費包含 HIPAA。如果你在醫療產業且考慮 Vapi,在你打出第一通電話之前,每年就是 $24k。
- **每分鐘進位稅。**大多數平台以 60 秒為單位進位:61 秒的通話算 2 分鐘。在每月 5,000 通、典型 45–90 秒分佈的情況下,這比你的每分鐘計算多出 5–8% 的實際溢價。按秒計費(Bland、Deepgram)可以避開這個。
- **電話號碼租用。**Twilio:每個號碼 $1–$2/月。Retell:每個號碼 $2/月,驗證號碼 $10/月。看起來很小,直到你為了陌生開發跑了 50 個外撥號碼;那就是沒人報價過的 $100/月帳目。
- 併發費用。Retell 包含基本的併發通話數;超出後是每路併發 $8/月。一個團隊在基本量之外同時跑 10 通電話,每月多出 $80。
- **轉接費。**Bland 在代理人轉接給真人時收取 $0.025/分鐘。如果你有 20% 的電話會轉接,這對平均每分鐘成本來說是有意義的稅。
- **知識庫費用。**Retell 免費提供 10 個知識庫;每多一個 $8/月。疊加 RAG 密集的使用情境,這會快速累積。
- **Premium 聲音加價。**ElevenLabs Premium 比 Turbo 多加 $0.04/分鐘。聽起來是選配,直到你的業務團隊 A/B 測試發現 Premium 轉換率高 11%。
需要在簽 Vapi 合約前有人幫你逐項列出你的使用情境嗎?我們的語音代理人建置服務包含這項工作。
音訊 token 與提示快取:沒人解釋的成本槓桿
OpenAI Realtime API 以音訊 token 計費,其中 1 token = 100ms 輸入音訊或 50ms 輸出音訊。一通 60 秒的電話大約使用 600 個輸入 token(來電者說話)和 1,200 個輸出 token(代理人回應)。以輸入 $32/M、輸出 $64/M 計算,就是 $0.0192 輸入 + $0.0768 輸出 = 每分鐘 $0.096 的原始音訊成本,大約 $0.10/分鐘,還沒加提示、工具或 Twilio。
然後是系統提示。每一輪都會把完整的系統提示作為上下文視窗的一部分送給模型。典型的語音代理人有 2,000 token 的系統提示,涵蓋角色設定、工具、邊緣案例和拒絕邏輯。沒有快取的話,這 2,000 token 的區塊每通電話都以 $32/M 的全新費率計費:1,000 通電話就是 $64。
啟用提示快取後(依 OpenAI 文件,快取 token 為 $0.40/M),同樣 1,000 通電話的工作量只需 $0.80。這是系統提示成本的 80 倍折扣。OpenAI Realtime 的提示快取讓你的系統提示成本降低 80 倍。大多數團隊是在第一個月的帳單來了之後才發現這件事。
以下是用程式碼呈現的計算:
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Fresh rates
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x discount
# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min
# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80
在我們為直接建在 Realtime 上的客戶做成本建模的工作中,這是「Realtime 很便宜」和「Realtime 是 Vapi 的兩倍」之間最大的單一槓桿。如果你同時使用 Responses API 搭配 Realtime 做工具呼叫,請參考我們的 OpenAI Responses API 教學了解實作模式。這就是為什麼直接建在 OpenAI Realtime 上可以比 Vapi 便宜,也可以貴得多——取決於你有沒有做快取。
如何計算你自己的 TCO(公式 + Python)
語音代理人的總擁有成本是每分鐘變動成本加上攤提到分鐘量的每月固定費用。公式:
TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month
代入你的數字。或者直接 fork 這個:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # e.g., 0.05 for Vapi, 0.13 for Retell bundle
llm_in_per_1m: float, # e.g., 0.15 for GPT-4o-mini input
llm_out_per_1m: float, # e.g., 0.60 for GPT-4o-mini output
llm_in_tokens_per_call: int, # e.g., 1800
llm_out_tokens_per_call: int, # e.g., 1200
tts_per_min: float, # e.g., 0.10 for ElevenLabs Turbo
stt_per_min: float, # e.g., 0.005 for Deepgram Nova-2
telephony_per_min: float, # e.g., 0.014 for Twilio US
fixed_monthly: float = 0.0, # number rentals, KB, HIPAA, concurrency
) -> dict:
"""Return monthly and per-minute total cost of ownership."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable per-call
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}給從零開始預估的人四個步驟:
- 估算你的月通話量和平均通話時長。
- 選定你的架構:平台 + LLM + TTS + STT + 電話。
- 從廠商定價頁面查出每個元件的單位價格。
- 跑公式(或上面的 Python 函式),輸出就是你預估的每分鐘成本和每月費用。
如果你沒辦法把 TCO 寫成一行公式,你就會在每分鐘進位稅上吃虧。
規模化成本:每月 1k vs 10k vs 100k 分鐘
超過 10,000 分鐘後曲線快速分化。綁定式平台趨平,因為帳單就是分鐘數 × 費率。BYOK 架構隨著 LLM 和 TTS 成本與你線性成長而變陡。有快取的 OpenAI Realtime 在大約 10k–20k 分鐘/月時與 Vapi 交叉——這是直連基礎設施開始合理的轉折點。
| 平台 | 1,000 分鐘/月 | 10,000 分鐘/月 | 100,000 分鐘/月 |
|---|---|---|---|
| Bland 固定 $0.09/分鐘 + Twilio | $120 | $1,160 | $11,400 |
| Retell 綁定 約 $0.145/分鐘總成本 | $145 | $1,450 | $14,500 |
| Vapi BYOK 約 $0.17/分鐘總成本 | $170 | $1,700 | $17,000 |
| OpenAI Realtime + 快取 約 $0.13/分鐘 | $130 | $1,300 | $13,000 |
| Deepgram Voice Agent + Twilio | $108 | $1,080 | $10,800 |
數字由上述 tco_per_minute() 公式以標準 4 分鐘通話假設推導。在適用處加入 HIPAA(Vapi $2,000/月)、併發和號碼租用。它們不改變曲線形狀,但會提高低量買家的最低門檻。
本文頂部的主圖視覺化了相同的數字:Bland 很早就趨平,Vapi 隨 LLM 成本規模化而變陡,有快取的 OpenAI Realtime 在超過 10k 分鐘後勝過 Vapi。
什麼時候你不該部署語音代理人
語音 AI 有真實的每分鐘 $0.10–$0.30 下限。每月低於 200 通電話時,一個真人加 $19 的 SaaS 在成本上仍然勝出。電話號碼租用、併發基本量和平台最低消費加起來是 $50–$200/月的開銷,低量團隊根本回收不了。
三個「跳過吧」的標準,老實說:
-
**每月少於 200 通電話。**號碼租用 + 最低消費 + 併發基本量超過一個兼職真人在 $20/小時下的成本。損益平衡算不過來。
-
**高情境、低量的工作。**你唯一的一位真人每天處理 15 通電話,每通有 30 種以上獨特的事實模式。LLM 幻覺成本(退款、丟單、錯誤預約)會吃掉省下的錢。語音 AI 在重複性流程上發光,不是在邊緣案例密集的工作上。
-
**沒有 HIPAA 預算的受監管產業。**Vapi 的 $2k/月 HIPAA 加購、電信商合規費用、以及 PII 防護(Retell 上 $0.005–$0.01/分鐘)可能讓整個計算崩塌。如果你無法編列每年 $25k 在合規帳目上,先在非 PHI 流程上跑試點。
在測試中,以典型綁定費率計算,客服分流的損益平衡點大約落在每月 250–400 通電話。低於那個量,$19/月的 SaaS 加一個真人比較便宜。不要只因為你可以就部署語音 AI。

如果語音 AI 通過了成本下限的檢驗,但你不想自己接 Retell 或 Vapi,我們的語音代理人開發服務會在你的基礎設施上建置並維運完整架構。
2026 年我們實際上怎麼選平台(依使用情境給結論)
沒有單一平台在所有地方都贏。最便宜的認真選擇取決於你是進線還是外撥、你有沒有工程能量、以及 HIPAA 重不重要。五個使用情境,五個答案:
- 最便宜的認真相外撥(陌生開發): Bland。固定 $0.09/分鐘,透明的轉接費,沒有意外的 LLM 成本。如果你需要深度 RAG 或自訂工具就跳過。
- 最便宜的進線(客服分流): Retell。綁定式,HIPAA 已包含,成熟的分析,總成本 $0.12–$0.18。如果你的進線量低於每月 200 通就跳過(見前一節)。
- 最大控制力 + 自訂 RAG: Vapi BYOK。只有在你有工程能量能自己管 LLM、TTS 和 STT 金鑰時才選。只有當你能用量去跟電信商和 LLM 談下來時,$0.27/分鐘的控制力才值得。
- 規模化的綁定式簡潔: Deepgram Voice Agent。$4.50/小時($0.075/分鐘)固定費,是搜尋結果中最被低估的選項。如果你需要 ElevenLabs 提供的廣泛聲音庫就跳過。
- 對話品質標竿(業務演示、品牌敏感流程): ElevenLabs Conversational。Turbo 或 Premium 聲音,$0.10–$0.12/分鐘。當聲音品質是轉換槓桿時,值得付加價。
想從企業端深入了解產業切面,請參考 AI voice agents for enterprise call centers:相同的數學,加上餐飲和診所特定的用量假設。
Techsy 怎麼做語音代理人成本建模
我們不賣語音平台。我們為客戶在 Retell、Vapi、Deepgram 和 OpenAI Realtime 上建置生產環境的語音代理人。這代表當我們為新案件建模成本時,會在推薦架構之前,先在三個用量級距(1k、10k、100k 分鐘/月)上跑 tco_per_minute() 公式。在 1k 時贏的平台,在 100k 時往往輸。
我們為超過 10 萬分鐘/月的客戶談 Twilio 子帳戶定價(子帳戶解鎖大多數團隊不知道存在的用量級距),而且我們總是在簽核直連基礎設施設計之前,先建模 Realtime 建置上的提示快取節省。我們一半的客戶成本建模工作,是在修正某人從廠商部落格文章做出的假設。
想要在真正適合你用量的平台上,從頭到尾建置一個語音代理人嗎?看看我們怎麼建置語音代理人 →
常見問題
2026 年 AI 語音代理人每分鐘多少錢? 總成本範圍在每分鐘 $0.07 到 $0.30。綁定式平台(Retell、Bland、ElevenLabs Conversational)包含電話後落在 $0.10–$0.18/分鐘。像 Vapi 這樣的 BYOK 平台加上 LLM、TTS、STT 和 Twilio 成本後落在 $0.13–$0.31/分鐘。OpenAI Realtime 直連原始約 $0.30/分鐘,啟用系統提示快取後約 $0.12/分鐘。
最便宜的 AI 語音代理人平台是什麼? 外撥的話,Bland AI 固定 $0.09/分鐘是市場上最乾淨的計算。進線客服的話,Retell 總成本 $0.10–$0.16 通常因為綁定 HIPAA 和併發基本量而勝出。純基礎設施搭配快取的話,OpenAI Realtime 可以降到 $0.15/分鐘以下。Deepgram Voice Agent 固定 $0.075/分鐘是最被忽視的選項。
為什麼我的 Vapi 帳單超過 $0.05/分鐘? Vapi 定價頁面上的 $0.05/分鐘只是平台費。Vapi 是 BYOK:你自己帶 LLM(GPT-4o-mini、Claude 等)、TTS(ElevenLabs、PlayHT)、STT(Deepgram)和電話(Twilio)的金鑰。實際總成本依你選的聲音和模型落在 $0.13–$0.31/分鐘。
BYOK 和綁定式定價有什麼差別? 綁定式平台(Retell、Bland、Synthflow、ElevenLabs Conversational)在一個每分鐘費率中包含 LLM、STT 和 TTS。BYOK 平台(Vapi)只收編排費,你自己帶所有其他的 API 金鑰,由各廠商分別向你計費。綁定式比較簡單;BYOK 給你控制力和規模化的談判籌碼。
AI 語音代理人定價有隱藏費用嗎? 有,常見的有七項。HIPAA 加購(Vapi 上 $2,000/月)、每分鐘進位(規模化時 5–8% 的實際溢價)、電話號碼租用($1–$2/月)、併發費(Retell 每路 $8/月)、轉接費(Bland $0.025/分鐘)、知識庫費(Retell 每個 KB $8/月)、以及 Premium 聲音加價(ElevenLabs Premium 比 Turbo 多 $0.04/分鐘)。
OpenAI Realtime API 比 Vapi 便宜嗎? 沒有提示快取的話,不是:OpenAI Realtime 原始音訊成本約 $0.30/分鐘。啟用提示快取後(快取的系統提示 token $0.40/M vs 全新 $32/M,80 倍折扣),系統提示帳目大幅縮減,總成本降到約 $0.12–$0.15/分鐘。這讓它在每月超過 10k 分鐘時能與綁定式平台競爭。
我怎麼預估語音代理人的月成本?
估算每月通話數乘以平均通話分鐘數。乘以你平台的總成本每分鐘費用。加上每月固定成本:電話號碼租用、知識庫費、併發基本量、適用的話加 HIPAA 加購。上面的 tco_per_minute() Python 函式用一次函式呼叫就能自動完成,你可以貼到 Jupyter notebook 裡。
按分鐘還是按秒計費:哪個比較便宜? 按秒計費對短外撥電話明顯比較便宜。一通 61 秒的電話以 60 秒為單位計費會收 2 分鐘,在每月 5,000 通、典型短通話分佈下是 5–8% 的實際稅。Bland 和 Deepgram 按秒計費;大多數 BYOK 平台預設繼承 Twilio 的 60 秒進位。
有免費的 AI 語音代理人嗎? 免費試用是有的:大多數廠商提供 10–60 分鐘免費(Retell、Vapi、Bland)供測試。真正免費的生產級語音代理人不存在,因為你至少永遠要付電信商分鐘數(Twilio 美國外撥 $0.014/分鐘)。即使是自架的開源架構(Pipecat、LiveKit Agents),你還是要付電信商和 LLM 的錢。
語音 AI 相較於真人客服的 ROI 是什麼? 真人客服含所有成本約 $15–$30/小時,換算下來是 $0.25–$0.50/分鐘。語音 AI 在 $0.10–$0.20/分鐘,假設解決率相當,在每月大約 200 通以上時成本勝過真人。低於那個量,平台最低消費和號碼租用開銷讓真人加 $19/月 SaaS 成為更便宜的選擇。
本指南由 Techsy 編輯團隊維護。我們為客戶在 Retell、Vapi 和 OpenAI Realtime 上建置生產環境的 AI 語音代理人;這些數字來自我們每週都在做的成本建模工作,不是廠商宣傳手冊。定價於 2026 年 5 月驗證;簽約前務必與廠商定價頁面確認。