
2026 年最適合開發者的 9 款文字轉語音 API:真實延遲與每分鐘成本比較
對開發者來說,最好的文字轉語音 API 不是那個拥有最炫展示影片的,而是能在不燒垮你帳單的前提下達成延遲目標的那一個。我們這麼說,是因為我們就是在這些 API 之上打造語音代理的。上一季,Cartesia 的 Sonic-3 宣稱首音延遲(time-to-first-audio)為 40 到 90 毫秒,但 Coval 的獨立基準測試測出的真實 P50 約為 188 毫秒。價格從每 100 萬字元 4 美元到 100 美元不等。廠商的延遲數字很少能撐過一通真實的電話通話。所以這裡是一份 9 款文字轉語音 API 的誠實排名,附帶那些廠商在自己榜單上絕口不提的數字。
我們不賣 TTS API。我們是在這些 API 之上打造語音代理的,所以這份排名裡沒有我們想推銷的產品。先把範圍講清楚:本文談的是文字轉語音合成 API,也就是把文字轉成音訊的那一層,而非完整的語音代理平台或創作者影片工具。剛接觸這個領域嗎?先從什麼是 AI 語音代理讀起。
快速解答:最佳 TTS API 一覽
- 整體語音品質最佳: ElevenLabs(Flash 號稱約 75ms),是本文中最貴的選項,每百萬字元要價 50 至 100 美元。
- 性價比最高且整合最簡單: OpenAI gpt-4o-mini-tts,每分鐘音訊大約 0.015 美元。
- 即時語音代理延遲最低: Cartesia Sonic,原生串流 WebSocket,號稱首音延遲僅 40 至 90ms。
- 最便宜且可自建: Google Cloud 和 Amazon Polly 每百萬字元 4 美元;OmniVoice 自建則完全免費。
9 款最佳 TTS API 一覽
以下將所有 API 並列比較,並從開發者的角度進行排名,適用於將文字轉語音整合至應用程式或語音代理的情境。每分鐘費用為我們的估算值,並非廠商提供的數字(計算方式見表格下方)。
| API | 定價(美元/每百萬字元) | 預估每分鐘費用(美元)* | 免費方案 | 串流 | 語音複製 | 自行託管 | 最適合 |
|---|---|---|---|---|---|---|---|
| ElevenLabs | $50 Flash/$100 Multilingual | ~$0.045 | 試用 | 是 | 透過 ID 即時複製 | 否 | 頂級語音品質 |
| OpenAI | $15 tts-1/gpt-4o-mini-tts 約 $0.015/分鐘 | ~$0.015 | $5 額度 | 是 | 有限 | 否 | 高性價比且最簡單 |
| Cartesia | ~$39(Sonic) | ~$0.035 | 每月約 27 分鐘 | 是(websocket) | 即時(Pro) | 否 | 低延遲代理 |
| Deepgram | $15 Aura-1/$30 Aura-2 | ~$0.014-0.027 | $200 額度 | 是 | 否(預設) | 是(企業版) | STT 加 TTS,單一廠商 |
| Google Cloud | $4 Std/WaveNet/$16 Neural2 | ~$0.004-0.014 | 每月 400 萬字元(Std) | 是 | 否 | 否 | 多語言加免費方案 |
| Amazon Polly | $4 Std/$16 Neural | ~$0.004-0.014 | 每月 500 萬/100 萬字元 | 是 | 否 | 否 | 便宜、大規模穩定可靠 |
| Azure AI Speech | $16 Neural/$22 Neural HD | ~$0.014-0.020 | 每月 50 萬字元 | 是 | Custom Neural Voice | 是(氣隙容器) | 合規/地端部署 |
| PlayHT | 訂閱約 $39-99/月(預估) | ~$0.07(預估) | 試用 | 是 | 即時(3-10 秒) | 否 | 大型多語言庫 |
| OmniVoice | $0(Apache-2.0) | 僅 GPU 成本 | 無限制(自行執行) | 否(批次) | 零樣本約 3 秒 | 是(完全本地) | 自行託管/罕見語言 |
*每分鐘費用為我們的估算:每百萬字元價格乘以每分鐘約 900 字元(約每分鐘 150 詞)。非廠商數字。
我們如何排名(以及為什麼我們不賣 TTS API)?
我們權衡了五個要素:語音品質、延遲與串流支援、成本(按字元與按分鐘計費)、SDK 功能範圍,以及自架選項。我們在其中幾款工具上打造了生產環境的語音代理,因此排名反映的是適用程度,而非偏袒。沒有任何廠商付費置入。
這種中立性正是重點所在。你能找到的每一份「最佳 TTS API」清單,都是由 TTS 廠商撰寫、並把自己的產品排在第一。我們賣的是代理,不是語音合成,所以在這裡沒有任何需要推銷的東西。如果某款工具在價格、延遲或聲音複製方面表現較弱,我們會在它的「何時該略過」說明中直接指出。沒有稻草人,也沒有偏愛。
1. ElevenLabs:整體語音品質最佳
ElevenLabs 提供目前透過 API 所能買到的最自然合成語音,擁有龐大的語音庫,並支援以 voice ID 即時複製聲音。其 Flash v2.5 模型是即時運算選項。
根據 ElevenLabs 的 API 定價頁面(截至 2026 年 7 月),Flash 與 Turbo 的費用為每 100 萬字元 50 美元,Multilingual v2/v3 則為每 100 萬字元 100 美元,依我們估算約為每分鐘 0.045 至 0.09 美元。ElevenLabs 宣稱 Flash 的延遲約為 75 毫秒。串流可透過 REST 與 websocket 運作。從任何 voice ID 皆可即時複製聲音。
正在打造完整的電話語音代理人嗎?來看看它與 Vapi 和 Synthflow 等語音代理人平台的比較。
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb?output_format=mp3_44100_128" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Your table for two is confirmed for 8pm.", "model_id": "eleven_flash_v2_5"}' \
--output speech.mp3如果語音品質不容妥協、預算也不是你的首要考量,就選這個。如果每字元成本是障礙,那就跳過它,因為它是這裡最貴的選項。
2. OpenAI TTS:性價比最高、整合最簡單
如果你已經在呼叫 OpenAI API,OpenAI TTS 就是阻力最小的選擇。gpt-4o-mini-tts 模型新增了可控性,也就是說你可以用提示詞指定語氣該怎麼呈現(例如「像一位溫暖、有耐心的老師那樣說」),而不只是決定它要說什麼。
根據 OpenAI 的定價文件(截至 2026 年 7 月),tts-1 為每 100 萬字元 $15 美元,tts-1-hd 為每 100 萬字元 $30 美元,而 gpt-4o-mini-tts 的計費方式為每 100 萬文字 token $0.60 美元加上每 100 萬音訊 token $12 美元,換算下來大約是每分鐘音訊 $0.015 美元。支援串流播放。語音複製功能有限。
正在打造即時電話語音助理嗎?可以搭配 OpenAI 的 Realtime API 來建構語音助理。
from openai import OpenAI
client = OpenAI() # reads OPENAI_API_KEY from env
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="alloy",
input="Say it like a warm, patient teacher.",
) as response:
response.stream_to_file("speech.mp3")適合選它的情況: 你想要在既有的技術架構中取得便宜、夠用的音訊品質。不適合的情況: 你需要多種截然不同的聲音,或真正的語音複製功能。
3. Cartesia (Sonic):超低延遲即時代理的最佳選擇
Cartesia 的 Sonic 是專為對話而打造的。它原生支援串流 websocket,並擁有我們在託管 API 中測得的最短首音延遲(time-to-first-audio)。
根據 Cartesia 的價格頁面(截至 2026 年 7 月),Startup 方案約為每 100 萬字元 39 美元(約每分鐘 0.035 美元),每月大約提供 20,000 個免費點數(約 27 分鐘的音訊)。Cartesia 宣稱 Sonic-3 的首音延遲為 40 到 90 毫秒。串流 API 原生採用 websocket,而在 Pro 方案中聲音複製可即時完成。以下是代理實際使用的模式,直接將 PCM 區塊串流傳送給來電者:
from cartesia import Cartesia
import os
client = Cartesia(api_key=os.environ["CARTESIA_API_KEY"])
ws = client.tts.websocket()
for chunk in ws.send(
model_id="sonic-3",
transcript="Booking confirmed. See you at eight.",
voice={"id": "a0e99841-438c-4a64-b679-ae501e7d6091"},
output_format={"container": "raw", "encoding": "pcm_f32le", "sample_rate": 44100},
stream=True,
):
play(chunk.audio) # push audio to the caller as it arrives適合選擇的情況:你正在打造亞秒級的對話式語音代理。不建議選擇的情況:你不需要即時功能,且希望擁有更豐富的語音選擇。
4. Deepgram (Aura-2):最佳的單一供應商 STT + TTS
Deepgram 是唯一一家能把語音機器人兩個環節都做好的供應商:聆聽(語音轉文字)與說話(TTS)。Aura-2 採用字元計費,並針對對話延遲進行最佳化。
根據 Deepgram 的價格頁面(截至 2026 年 7 月),Aura-1 為每 100 萬字元 15 美元,Aura-2 為每 100 萬字元 30 美元(約每分鐘 0.014 至 0.027 美元),並提供 200 美元的註冊額度,企業方案可自架部署。Deepgram 宣稱對話式 AI 的延遲低於 250 毫秒。支援串流;但不支援聲音複製,因此只能使用預設聲音。
適合你,如果你想用單一供應商搞定聆聽與說話的整個流程。不適合你,如果你需要聲音複製功能。
5. Google Cloud Text-to-Speech:多語言支援最廣、免費方案最佛心
Google Cloud Text-to-Speech 提供超過 380 種語音、涵蓋 50 種以上的語言,其免費方案也是原型開發中最慷慨的。
根據 Google Cloud 的定價頁面(截至 2026 年 7 月),Standard 與 WaveNet 為每 100 萬字元 4 美元,Neural2 為每 100 萬 16 美元,Chirp 3 HD 為每 100 萬 30 美元,Studio 則為每 100 萬 160 美元。免費方案每月提供 400 萬個 Standard 字元,但 WaveNet、Neural2 與 Chirp 3 HD 各僅有每月 100 萬,因此請確認你實際使用的語音類型。支援串流;不支援語音複製(自訂語音為另一項獨立產品)。
適合選擇:你需要大量語言且預算有限、並運行於 GCP 之上。建議跳過:你希望在不支付 Studio 每 100 萬 160 美元的情況下,獲得頂級的表現力音質。
6. Amazon Polly:無聊但可靠、規模化後最便宜的選擇
Amazon Polly 是可靠的勞動力:可預期、便宜,並與 AWS 深度整合。它非常適合 IVR 和交易型語音提示——這種場景不需要戲劇化的表現力,而是需要高可用率。
根據 AWS 的 Polly 定價頁面(截至 2026 年 7 月),Standard 為每百萬字元 $4 美元,Neural 為每百萬 $16 美元,Generative 為每百萬 $30 美元,Long-Form 為每百萬 $100 美元(約每分鐘 $0.004 至 $0.09 美元)。免費方案在前 12 個月內每月提供 500 萬個 Standard 字元和 100 萬個 Neural 字元。支援串流;不支援聲音複製。
**適合選擇它的情況:**你已在使用 AWS,且需要大量、可預期的 TTS。**應跳過它的情況:**你想要富有表現力、可複製的聲音。
7. Azure AI Speech:最適合合規與地端部署
Azure AI Speech 的差異化優勢不在於語音本身,而在於你可以將它們部署在哪裡:標準 Neural、Custom Neural Voice,以及適用於依法不得離開內部網路之資料的離線(氣隔)容器。
根據 Azure 的語音定價頁面(截至 2026 年 7 月),標準 Neural 的價格為每 100 萬字元 16 美元,Neural HD 則為每 100 萬字元 22 美元(已從 2026 年 3 月的 30 美元調降)。F0 免費層級每月提供 50 萬字元,且永不過期。離線氣隔容器每年約需 47,424 美元,可處理 48 億字元(需註冊申請),這個數字正是你的合規團隊會在意的。支援串流處理;語音複製則屬於 Custom Neural Voice 的功能。
適合選擇它的情況:你需要地端部署或氣隔式合成,或者你的團隊以 Microsoft 生態系為主。不適合的情況:你並未使用 Azure,也不需要合規管控功能。
8. PlayHT:最豐富的多語言語音庫
PlayHT 的吸引力在於其廣度:超過 900 種語音、142 種語言、低於 300 毫秒的 Turbo 延遲,以及只需 3 到 10 秒的樣本即可即時複製聲音。
以下是關於定價的誠實提醒。根據 PlayHT 的價格頁面(截至 2026 年 7 月),方案大約從**每月 39 美元(Professional)到每月 99 美元(Premium/無限制)**不等,而 API 存取則位於較高階及企業級方案。官方並未公布明確的每字元 API 費率,因此任何每分鐘的數字(我們估計約為 0.07 美元)都僅能視為估算值。支援串流播放;只需一段短音訊即可即時複製聲音。
**適合選擇它的情況:**你想要為對話式產品提供豐富的語音選擇,而 ElevenLabs 又太貴。**不適合的情況:**你想要透明的按字元計費、用多少付多少的方案。
9. OmniVoice:資料無法離開伺服器時的最佳選擇
OmniVoice(由 k2-fsa 團隊開發)採用 Apache-2.0 授權,每字元 0 美元,支援 646 種語言,可從約 3 秒的音訊片段進行零樣本複製,並完全在本機端運行。我們在自己的硬體上進行了實測。
完全沒有按字元計費的帳單。你只需支付 GPU 與電費,別無其他。代價是:OmniVoice 屬於批次合成(即時率約 0.03),而非低於 300 毫秒的串流處理,因此不適合即時對話。複製功能可從幾秒鐘的參考音訊進行零樣本處理。如需設定細節與音質說明,請參閱我們的 OmniVoice 實測評論。
適合選擇它的情況:你需要地端部署、符合 HIPAA 規範、支援稀有語言,或者你厭倦了在大量使用時按字元計費。不適合的情況:你需要即時對話的低延遲。
TTS API 每分鐘實際成本到底是多少?
文字轉語音(TTS)API 在 2026 年的合成音訊成本大約是每分鐘 0.004 美元到 0.09 美元。最便宜的是 Google Cloud 和 Amazon Polly Standard,約每分鐘 0.004 美元;OpenAI 的 gpt-4o-mini-tts 大約落在每分鐘 0.015 美元;ElevenLabs 的頂級語音則高達每分鐘 0.09 美元。自行託管的 OmniVoice 則是每字元 0 美元。
這裡所有的每分鐘數字都是我們自己算出來的,而不是廠商提供的數據。我們把每 100 萬字元的價格換算成每分鐘成本,假設每分鐘約 900 個字元(相當於自然語速每分鐘約 150 個字)。光是這一個換算方式,就會改變你的預算編列思維:語音代理的開發者不會用「每百萬字元多少美元」來編預算,而是用「每分鐘通話時間多少美元」來估算。以下是沒有人公開過的換算方式。
"Estimated TTS cost per minute of audio (USD, ~900 chars/min)"
資料表
| "Provider (representative model)" | "USD per minute" |
|---|---|
| "Google Cloud (WaveNet)" | 0.004 |
| "Amazon Polly (Standard)" | 0.004 |
| "Azure (Neural)" | 0.014 |
| "OpenAI (gpt-4o-mini-tts)" | 0.015 |
| "Deepgram (Aura-2)" | 0.027 |
| "Cartesia (Sonic)" | 0.035 |
| "ElevenLabs (Flash)" | 0.045 |
| "PlayHT (Turbo, est)" | 0.07 |
| "OmniVoice (self-host)" | 0 |
每分鐘數字是我們的估算值(每 100 萬字元的價格乘以每分鐘約 900 字元)。PlayHT 採訂閱制,因此其數字為估算值;OmniVoice 則是每字元 0 美元(你只需支付 GPU 和電費)。不過,TTS 只是其中一項成本而已。若要了解完整的全貌,請參閱我們的全端語音代理成本拆解。
將 TTS 接入生產環境語音代理後,我們學到的事
宣稱的延遲不等於實測的延遲。在我們 2026 年上線的一套餐廳訂位語音代理中,ElevenLabs Flash 宣傳的 75ms 在單獨測試時確實屬實,但在我們的管線中,一旦疊加上 LLM token 生成、網路跳轉與音訊緩衝,來電者聽到的第一段音訊實際上落在 300 到 400ms 左右。這段差距,正是自然回應與尷尬停頓之間的分野。
Coval 的獨立基準測試佐證了這一點。該測試測得 Cartesia Sonic-3 的首次音訊延遲(time-to-first-audio)P50 約為 188ms(IQR 100ms),ElevenLabs Turbo v2.5 約 264ms,Flash v2.5 約 288ms,全都高於廠商宣稱的數字。正因如此,凡是對話類場景,我們預設採用串流 WebSocket API(Cartesia、Deepgram),而非批次 REST。同時也要留意這個指標:串流 API 回傳的最初幾個位元組是容器與標頭中繼資料,並非可播放的音訊。首次「位元組」延遲會讓廠商數字好看;首次「音訊」延遲才是來電者真正聽到的。
有一筆我們沒編列進預算的成本意外:在一條使用 ElevenLabs Multilingual v3(約 $0.09/min)的高話量線路上,代理在通話中講話時間約佔六成通話時長的 40%,一通六分鐘的通話會合成約 2.4 分鐘的音訊,換算下來每通約 $0.22。以每天 1,500 通計算,光 TTS 一項每月就接近 $9,700。將該線路改用 gpt-4o-mini-tts(約 $0.015/min)後,費用降到 $1,700 以下。還有一個我們踩過的坑:模型一直把某客戶的餐廳名稱唸錯,直到我們加入了音素別名(phoneme alias)才解決,因此上線前請務必預留時間建立發音辭典。
你可以自行託管或執行開源 TTS 嗎?
可以,而且在 2026 年這是切實可行的選項,不是什麼實驗性專案。自行託管意味著在你自己的 GPU 上執行模型,讓音訊完全不經過第三方 API。主要的開源選擇包括 OmniVoice(支援 646 種語言、零樣本語音複製)、Piper(快速、輕量,在 Raspberry Pi 上表現出色)、Kokoro(小巧且高品質),以及較早期的 Coqui TTS。
也有託管式的自行託管方案。Azure 的離線(氣隙隔離)容器與 Deepgram 的企業級地端部署,讓你無需進行原始的開源部署,就能在自己的網路內執行廠商級品質的語音。
當資料依法不得離開你的伺服器(HIPAA、氣隙隔離環境)、需要稀有或低資源語言,或是按字元計費在極高用量下變得難以負荷時,自行託管就是更好的選擇。但當你需要即時對話的低延遲,或是團隊規模小、沒有多餘的 GPU 維運資源時,它就不那麼適合。對這些情況而言,一旦把工程時間的成本算進去,串流 API 才是更划算的解答。
如何選擇合適的 TTS API?
請根據你最大的單一限制條件來選擇,而不是對照功能清單。以下是我們與客戶合作時使用的快速決策樹:
- 正在打造即時語音代理? Cartesia 或 Deepgram(串流 websocket,實測延遲最低)。
- 語音品質毫無妥協空間? ElevenLabs。
- 便宜且支援多語言? Google Cloud 或 Amazon Polly。
- 需要地端部署或氣隔環境(air-gapped)? Azure 離線容器或 OmniVoice。
- 已經深度使用某個生態系? OpenAI、AWS Polly 或 Google Cloud,選與你現有技術棧相符的那個。
- 需要最豐富的語音庫? PlayHT。
先從那個一旦選錯就會讓專案失敗的限制條件著手,其餘的之後再最佳化。
Techsy 的做法
我們打造語音智能體,而非銷售 TTS API,正因如此,我們才能在此保持中立。實務上,我們會依據每位客戶的延遲預算、成本上限與合規要求,為其挑選不同的 TTS,再將其整合進完整的智能體:語音轉文字、LLM、電話系統,以及串接其間的流式管道。餐廳訂位專線與受 HIPAA 規範約束的診所專線,幾乎不會使用同一套語音合成引擎。
如果你正在評估自建還是採購,我們打造生產級語音智能體,提供端到端建置,能告訴你哪種 TTS 真正適合你的通話量。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人——University of Birmingham。歡迎在 LinkedIn 上與他連結。
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶打造 AI 代理、自動化系統以及語音/SDR 流程。他就讀於 University of Birmingham,並撰寫 Techsy 團隊在生產環境中實際使用的 LLM 工具鏈相關文章。
常見問題
對開發者來說,最好的文字轉語音 API 是什麼?
這取決於你最大的單一限制條件。若追求頂級語音品質,選擇 ElevenLabs。若要最低的即時延遲,選 Cartesia。若要便宜的多語言音訊,選 Google Cloud 或 Amazon Polly。若要地端部署或完全離線的資料環境,選 Azure 離線容器或自行託管的 OmniVoice。沒有放諸四海皆準的贏家。
哪個 TTS API 的延遲最低,最適合即時語音代理?
Cartesia 宣稱首次發音延遲(time-to-first-audio)為 40 到 90 毫秒,ElevenLabs Flash 宣稱約 75 毫秒,Deepgram 則標榜低於 250 毫秒。但宣稱值不等於實測值:Coval 的獨立基準測試顯示,在真實環境下 Cartesia Sonic-3 的 P50 約為 188 毫秒,ElevenLabs Flash 約為 288 毫秒。對於語音代理,建議優先採用串流式的 websocket API。
文字轉語音 API 每分鐘音訊的成本是多少?
2026 年大約每分鐘 0.004 至 0.09 美元。Google 和 Polly Standard 約為每分鐘 0.004 美元,OpenAI gpt-4o-mini-tts 約為每分鐘 0.015 美元,ElevenLabs 的高階語音則可達每分鐘 0.09 美元。這些是我們以每分鐘約 900 個字元估算的結果;自行託管的 OmniVoice 則為每字元 0 美元。
有沒有免費的文字轉語音 API?哪個免費方案最好?
有的。Google Cloud 每月提供 400 萬個標準字元(較高等級的語音類型則各為 100 萬個),Amazon Polly 為期 12 個月提供 500 萬個標準字元與 100 萬個神經網路字元,Azure F0 永久每月提供 50 萬個,Cartesia 每月則包含約 27 分鐘。OpenAI 和 Deepgram 則改為提供註冊贈送額度。
最便宜的語音合成 API 是哪個?
就託管 API 而言,OpenAI 的 gpt-4o-mini-tts 每分鐘約 $0.015,是最便宜的優質選項;而 Google Cloud 和 Amazon Polly Standard 則為每百萬字元 $4(約每分鐘 $0.004)。如果你能跑 GPU,自建 OmniVoice 每字元 $0,只需負擔運算與電費。
我可以自行託管文字轉語音模型,而不使用 API 嗎?
可以。OmniVoice、Piper、Kokoro 和 Coqui 都是開源方案,可完全在本機端執行。若需要受管的內部部署方案,Azure 提供離線(氣隙)容器,Deepgram 則提供企業級自行託管服務。如果你需要符合 HIPAA 規範、處理氣隙隔離資料、支援罕見語言,或是用量極大導致按字元計費成本過高,那麼自行託管就值得考慮。
哪些 TTS API 支援串流或 WebSocket?
Cartesia、Deepgram、OpenAI、ElevenLabs 和 PlayHT 都支援串流,其中 Cartesia 和 Deepgram 原生支援 WebSocket,最適合即時對話場景。OmniVoice 僅支援批次處理,會先合成完整音訊片段再回傳音檔,因此不適用於即時語音代理。
OpenAI 和 ElevenLabs 的 TTS API 哪個比較好?
兩者各有所長。OpenAI 在價格與可控性(可透過提示詞指定語句該如何發聲)上勝出,而且它本來就在你的技術棧中。ElevenLabs 則在語音品質、更龐大的語音庫以及即時語音複製方面領先。若要打造完整的語音代理,建議將兩者與我們 語音代理平台比較 中的編排方案一併評估。
如何透過 TTS API 複製語音?需要多長的音訊片段?
所需片段長度各不相同。ElevenLabs 可透過任何語音 ID 即時複製;Cartesia 和 OmniVoice 需要約 3 秒的樣本;PlayHT 則需要 3 到 10 秒。Amazon Polly、Deepgram 和 Google Cloud 僅提供預設語音(Azure 的 Custom Neural Voice 則需經過正式的申請流程)。
按字元計費與按 token/按分鐘計費有什麼差別?
大多數 TTS API 是根據輸入文字的字元數來計費,這種方式很容易預估成本。而 OpenAI 的 gpt-4o-mini-tts 則是根據音訊輸出的 token 數計費,因此成本會隨著產生語音的長度變動,而非來源文字的長度。若要用於語音代理,建議將兩者都換算成每分鐘通話時間的美元成本,才能公平地比較。
參考資料
- ElevenLabs API 價格:https://elevenlabs.io/pricing/api (檢索日期 2026-07-14)
- Cartesia 價格:https://cartesia.ai/pricing (檢索日期 2026-07-14)
- Deepgram 價格:https://deepgram.com/pricing (檢索日期 2026-07-14)
- Amazon Polly 價格:https://aws.amazon.com/polly/pricing/ (檢索日期 2026-07-14)
- OpenAI API 價格:https://developers.openai.com/api/docs/pricing (檢索日期 2026-07-14)
- Google Cloud Text-to-Speech 價格:https://cloud.google.com/text-to-speech/pricing (檢索日期 2026-07-14)
- Azure AI Speech 價格:https://azure.microsoft.com/en-us/pricing/details/speech/ (檢索日期 2026-07-14)
- OmniVoice (k2-fsa):https://github.com/k2-fsa/OmniVoice (檢索日期 2026-07-14)
- Coval 獨立 TTS 基準測試:https://www.coval.ai/blog/best-text-to-speech-providers-in-2026-how-to-choose-(and-why-vendor-benchmarks-lie)/ (檢索日期 2026-07-14)
- MarkTechPost,基於基準測試的 TTS 比較:https://www.marktechpost.com/2026/05/30/best-text-to-speech-tts-models-in-2026-a-benchmark-based-comparison/ (檢索日期 2026-07-14)