
9 najlepszych API text-to-speech dla programistów (2026): porównanie rzeczywistych opóźnień i kosztu za minutę
Najlepsze API text-to-speech dla programisty to nie to z najładniejszym demem. To takie, które mieści się w Twoim budżecie opóźnienia, nie rozsadzając rachunku. Wiemy to, bo budujemy agentów głosowych na tych API. W zeszłym kwartale Cartesia Sonic-3 reklamowała 40–90 ms do pierwszego dźwięku, lecz niezależny benchmark Coval zmierzył jej realne P50 na około 188 ms. Ceny wahają się od 4 do 100 USD za milion znaków. Firmowe liczby o opóźnieniu rzadko przeżywają prawdziwą rozmowę telefoniczną. Oto więc uczciwy ranking 9 API text-to-speech, z liczbami, które dostawcy pomijają we własnych zestawieniach.
Nie sprzedajemy API TTS. Budujemy na nich agentów głosowych, więc nie mamy w tym rankingu produktu do promowania. I żeby była jasność co do zakresu: chodzi o API syntezy mowy, warstwę zamieniającą tekst w dźwięk, a nie o pełne platformy agentów głosowych czy narzędzia wideo dla twórców. Nowy w temacie? Zacznij od czym właściwie jest agent głosowy AI.
Szybka odpowiedź: najlepsze API TTS w skrócie
- Najlepsza ogólna jakość głosu: ElevenLabs (Flash, deklarowane ~75 ms), najdroższy tutaj — 50–100 USD za milion znaków.
- Najlepsza opłacalność i najprostsza integracja: OpenAI gpt-4o-mini-tts, około 0,015 USD za minutę dźwięku.
- Najniższe opóźnienie dla agentów czasu rzeczywistego: Cartesia Sonic, natywne strumieniowanie po websocket, deklarowane 40–90 ms do pierwszego dźwięku.
- Najtaniej i self-host: Google Cloud i Amazon Polly po 4 USD za milion znaków; OmniVoice za 0 USD w self-hostingu.
9 najlepszych API TTS w skrócie
Oto wszystkie API obok siebie, w rankingu dla programisty integrującego text-to-speech z aplikacją lub agentem głosowym. Wartości na minutę to nasze szacunki, nie liczby dostawcy (matematyka pod tabelą).
| API | Cena ($/mln znaków) | Szac. $/min* | Darmowy plan | Strumieniowanie | Klonowanie głosu | Self-host | Najlepsze do |
|---|---|---|---|---|---|---|---|
| ElevenLabs | $50 Flash / $100 Multilingual | ~$0,045 | trial | Tak | Natychmiast po ID | Nie | Najwyższa jakość głosu |
| OpenAI | $15 tts-1 / gpt-4o-mini-tts ~$0,015/min | ~$0,015 | kredyt $5 | Tak | Ograniczone | Nie | Opłacalność i prostota |
| Cartesia | ~$39 (Sonic) | ~$0,035 | ~27 min/mies. | Tak (websocket) | Natychmiast (Pro) | Nie | Agenci o niskim opóźnieniu |
| Deepgram | $15 Aura-1 / $30 Aura-2 | ~$0,014-0,027 | kredyt $200 | Tak | Nie (presety) | Tak (enterprise) | STT i TTS u jednego dostawcy |
| Google Cloud | $4 Std/WaveNet / $16 Neural2 | ~$0,004-0,014 | 4 mln znaków/mies. (Std) | Tak | Nie | Nie | Wielojęzyczność i darmowy plan |
| Amazon Polly | $4 Std / $16 Neural | ~$0,004-0,014 | 5 mln/1 mln znaków/mies. | Tak | Nie | Nie | Tanio i niezawodnie w skali |
| Azure AI Speech | $16 Neural / $22 Neural HD | ~$0,014-0,020 | 500 tys. znaków/mies. | Tak | Custom Neural Voice | Tak (kontenery air-gapped) | Zgodność / on-prem |
| PlayHT | subskrypcja ~$39-99/mies. (szac.) | ~$0,07 (szac.) | trial | Tak | Natychmiast (3-10 s) | Nie | Duża wielojęzyczna biblioteka |
| OmniVoice | $0 (Apache-2.0) | tylko koszt GPU | bez limitu (self-run) | Nie (batch) | Zero-shot ~3 s | Tak (w pełni lokalnie) | Self-host / rzadkie języki |
*Wartość na minutę to nasz szacunek: cena za milion znaków razy ~900 znaków/min (około 150 słów/min). Nie liczba dostawcy.
Jak ułożyliśmy ten ranking (i dlaczego nie sprzedajemy API TTS)?
Ważyliśmy pięć rzeczy: jakość głosu, opóźnienie i obsługę strumieniowania, koszt (za znak i za minutę), powierzchnię SDK oraz opcje self-host. Budujemy produkcyjnych agentów głosowych na kilku z nich, więc kolejność oddaje dopasowanie, nie faworyzowanie. Nikt nie zapłacił za miejsce.
Ta neutralność to cały sens. Każdą listę „najlepszych API TTS", jaką znajdziesz, pisze dostawca TTS ustawiający własny produkt na pierwszym miejscu. My sprzedajemy agentów, nie syntezę, więc nie mamy tu czego promować. Gdy narzędzie przegrywa ceną, opóźnieniem lub klonowaniem, mówimy to wprost w jego wierszu „Pomiń, jeśli". Bez słomianych chochołów i bez faworytów.
1. ElevenLabs: najlepsza ogólna jakość głosu
ElevenLabs tworzy najbardziej naturalne syntetyczne głosy, jakie można dziś kupić przez API, z dużą biblioteką głosów i natychmiastowym klonowaniem po identyfikatorze głosu. Model Flash v2.5 to opcja czasu rzeczywistego.
Według strony cennika API ElevenLabs (stan na lipiec 2026) Flash i Turbo kosztują 50 USD za milion znaków, a Multilingual v2/v3 — 100 USD za milion, co według naszych obliczeń daje około 0,045–0,09 USD za minutę. ElevenLabs deklaruje około 75 ms opóźnienia na Flash. Strumieniowanie działa przez REST i websocket. Klonowanie jest natychmiastowe z dowolnego identyfikatora głosu.
Budujesz pełnego agenta telefonicznego? Zobacz, jak wypada na tle platform agentów głosowych, takich jak Vapi i Synthflow.
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb?output_format=mp3_44100_128" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Your table for two is confirmed for 8pm.", "model_id": "eleven_flash_v2_5"}' \
--output speech.mp3Wybierz, jeśli jakość głosu jest niepodważalna, a budżet nie jest Twoim pierwszym ograniczeniem. Pomiń, jeśli blokerem jest koszt za znak — to najdroższa opcja tutaj.
2. OpenAI TTS: najlepsza opłacalność i najprostsza integracja
OpenAI TTS to ścieżka najmniejszego oporu, jeśli już wywołujesz API OpenAI. Model gpt-4o-mini-tts dodaje sterowność, co znaczy, że promptem określasz jak ma brzmieć kwestia („powiedz to jak ciepły, cierpliwy nauczyciel"), a nie tylko co mówi.
Według dokumentacji cennika OpenAI (stan na lipiec 2026) tts-1 kosztuje 15 USD za milion znaków, tts-1-hd — 30 USD za milion, a gpt-4o-mini-tts rozlicza 0,60 USD za milion tokenów tekstu plus 12 USD za milion tokenów audio, co ląduje blisko 0,015 USD za minutę dźwięku. Strumieniowanie jest obsługiwane. Klonowanie jest ograniczone.
Budujesz agenta telefonicznego czasu rzeczywistego? Sparuj go z Realtime API OpenAI dla agentów głosowych.
from openai import OpenAI
client = OpenAI() # reads OPENAI_API_KEY from env
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="alloy",
input="Say it like a warm, patient teacher.",
) as response:
response.stream_to_file("speech.mp3")Wybierz, jeśli chcesz taniego, wystarczająco dobrego dźwięku w stacku, który już masz. Pomiń, jeśli potrzebujesz wielu różnych głosów lub prawdziwego klonowania głosu.
3. Cartesia (Sonic): najlepsza do agentów czasu rzeczywistego o ultraniskim opóźnieniu
Sonic od Cartesii jest zbudowany do rozmowy. Oferuje natywne strumieniowanie po websocket i najniższy czas do pierwszego dźwięku, jaki zmierzyliśmy w hostowanym API.
Według strony cennika Cartesii (stan na lipiec 2026) plan Startup kosztuje około 39 USD za milion znaków (~$0,035/min) i daje mniej więcej 20 000 darmowych kredytów miesięcznie (około 27 minut dźwięku). Cartesia deklaruje 40–90 ms do pierwszego dźwięku na Sonic-3. API strumieniowania jest natywnie websocketowe, a klonowanie jest natychmiastowe na planach Pro. Oto wzorzec, którego faktycznie używają agenci — strumieniowanie fragmentów PCM wprost do rozmówcy:
from cartesia import Cartesia
import os
client = Cartesia(api_key=os.environ["CARTESIA_API_KEY"])
ws = client.tts.websocket()
for chunk in ws.send(
model_id="sonic-3",
transcript="Booking confirmed. See you at eight.",
voice={"id": "a0e99841-438c-4a64-b679-ae501e7d6091"},
output_format={"container": "raw", "encoding": "pcm_f32le", "sample_rate": 44100},
stream=True,
):
play(chunk.audio) # push audio to the caller as it arrivesWybierz, jeśli budujesz konwersacyjnych agentów głosowych z opóźnieniem poniżej sekundy. Pomiń, jeśli nie potrzebujesz czasu rzeczywistego i chcesz większego katalogu głosów.
4. Deepgram (Aura-2): najlepszy pojedynczy dostawca STT + TTS
Deepgram to jedyny dostawca, który dobrze robi obie połowy bota głosowego: słuchanie (speech-to-text) i mówienie (TTS). Aura-2 jest rozliczana za znaki i dostrojona do opóźnień konwersacyjnych.
Według strony cennika Deepgram (stan na lipiec 2026) Aura-1 kosztuje 15 USD za milion znaków, a Aura-2 — 30 USD za milion (~$0,014–0,027/min), z kredytem powitalnym 200 USD i self-hostem na planach enterprise. Deepgram podaje poniżej 250 ms dla konwersacyjnej AI. Strumieniowanie jest obsługiwane; klonowania nie ma, więc jesteś ograniczony do presetów głosów.
Wybierz, jeśli chcesz jednego dostawcy do całej pętli słuchania i mówienia. Pomiń, jeśli potrzebujesz klonowania głosu.
5. Google Cloud Text-to-Speech: najlepsza wielojęzyczność i hojny darmowy plan
Google Cloud Text-to-Speech obejmuje ponad 380 głosów w ponad 50 językach, a jego darmowy plan jest najhojniejszy do prototypowania.
Według strony cennika Google Cloud (stan na lipiec 2026) Standard i WaveNet kosztują 4 USD za milion znaków, Neural2 — 16 USD za milion, Chirp 3 HD — 30 USD za milion, a Studio — 160 USD za milion. Darmowy plan daje 4 mln znaków Standard miesięcznie, ale tylko po 1 mln miesięcznie na WaveNet, Neural2 i Chirp 3 HD, więc sprawdź, którego typu głosu faktycznie używasz. Strumieniowanie jest obsługiwane; klonowania nie ma (głos niestandardowy to osobny produkt).
Wybierz, jeśli potrzebujesz wielu języków tanio i siedzisz w GCP. Pomiń, jeśli chcesz najwyższej jakości ekspresji bez płacenia 160 USD za milion w Studio.
6. Amazon Polly: najlepszy nudny, niezawodny i tani w skali
Amazon Polly to niezawodny wół roboczy: przewidywalny, tani i głęboko wpięty w AWS. Idealny do IVR i komunikatów transakcyjnych, gdzie nie potrzebujesz dramaturgii, tylko czasu działania.
Według strony cennika Polly AWS (stan na lipiec 2026) Standard kosztuje 4 USD za milion znaków, Neural — 16 USD za milion, Generative — 30 USD za milion, a Long-Form — 100 USD za milion (~$0,004–0,09/min). Darmowy plan obejmuje 5 mln znaków Standard i 1 mln Neural miesięcznie przez pierwsze 12 miesięcy. Strumieniowanie jest obsługiwane; klonowania nie ma.
Wybierz, jeśli jesteś w AWS i chcesz przewidywalnego TTS w dużych wolumenach. Pomiń, jeśli chcesz ekspresyjnych, klonowalnych głosów.
7. Azure AI Speech: najlepszy do zgodności i on-prem
Wyróżnikiem Azure AI Speech nie są głosy, lecz to, gdzie można je uruchomić: standardowe Neural, Custom Neural Voice oraz odłączone kontenery (air-gapped) dla danych, które prawnie nie mogą opuścić Twojej sieci.
Według strony cennika Speech Azure (stan na lipiec 2026) standardowe Neural kosztuje 16 USD za milion znaków, a Neural HD — 22 USD za milion (obniżone z 30 USD w marcu 2026). Darmowy plan F0 obejmuje 500 tys. znaków miesięcznie i nigdy nie wygasa. Odłączone kontenery air-gapped kosztują około 47 424 USD rocznie za 4,8 mld znaków (wymagana rejestracja) — i to jest liczba, która obchodzi Twój zespół compliance. Strumieniowanie jest obsługiwane; klonowanie to Custom Neural Voice.
Wybierz, jeśli potrzebujesz syntezy on-prem lub air-gapped albo jesteś w środowisku Microsoftu. Pomiń, jeśli nie jesteś w Azure i nie potrzebujesz kontroli zgodności.
8. PlayHT: najlepsza duża wielojęzyczna biblioteka głosów
Atutem PlayHT jest szerokość: ponad 900 głosów, 142 języki, opóźnienie Turbo poniżej 300 ms i natychmiastowe klonowanie z próbki 3–10 sekund.
Oto uczciwe zastrzeżenie co do cen. Według strony cennika PlayHT (stan na lipiec 2026) plany kosztują mniej więcej 39 USD/mies. (Professional) do 99 USD/mies. (Premium/bez limitu), a dostęp do API znajduje się na wyższych i enterprise'owych planach. Czysta stawka API za znak nie jest publikowana, więc każdą wartość na minutę (szacujemy około 0,07 USD) traktuj dokładnie jako to, czym jest — szacunek. Strumieniowanie jest obsługiwane; klonowanie jest natychmiastowe z krótkiego klipu.
Wybierz, jeśli chcesz szerokości głosów do produktu konwersacyjnego, a ElevenLabs jest za drogi. Pomiń, jeśli chcesz przejrzystego rozliczenia za znak w modelu pay-as-you-go.
9. OmniVoice: najlepszy, gdy dane nie mogą opuścić Twoich serwerów
OmniVoice (od zespołu k2-fsa) ma licencję Apache-2.0, kosztuje 0 USD za znak, obsługuje 646 języków i klonowanie zero-shot z klipu ~3 s, działając w pełni lokalnie. Przepuściliśmy go przez praktyczny test na własnym sprzęcie.
Nie ma tu w ogóle rachunku za znak. Płacisz za GPU i prąd, nic więcej. Kompromis: OmniVoice to synteza wsadowa (współczynnik czasu rzeczywistego około 0,03), a nie strumieniowanie poniżej 300 ms, więc nie nadaje się do rozmowy na żywo. Klonowanie jest zero-shot z kilku sekund dźwięku referencyjnego. Po szczegóły konfiguracji i uwagi o jakości przeczytaj naszą praktyczną recenzję OmniVoice.
Wybierz, jeśli potrzebujesz on-prem, HIPAA, rzadkich języków albo nienawidzisz rozliczenia za znak przy bardzo dużych wolumenach. Pomiń, jeśli potrzebujesz opóźnienia konwersacyjnego w czasie rzeczywistym.
Ile naprawdę kosztuje API TTS za minutę?
API text-to-speech kosztuje w 2026 roku mniej więcej 0,004–0,09 USD za minutę syntezowanego dźwięku. Najtańsze są Google Cloud i Amazon Polly Standard — około 0,004 USD/min; gpt-4o-mini-tts od OpenAI ląduje blisko 0,015 USD/min; najlepsze głosy ElevenLabs sięgają 0,09 USD/min. Self-hostowany OmniVoice kosztuje 0 USD za znak.
Każda wartość na minutę tutaj to nasze obliczenia, nie liczba dostawcy. Przeliczamy cenę za milion znaków na koszt za minutę, zakładając ~900 znaków na minutę (około 150 słów naturalnej mowy na minutę). Ta jedna konwersja zmienia sposób budżetowania: twórcy agentów głosowych nie budżetują w dolarach za milion znaków — budżetują w dolarach za minutę rozmowy. Oto konwersja, której nikt nie publikuje.
"Estimated TTS cost per minute of audio (USD, ~900 chars/min)"
Tabela danych
| "Provider (representative model)" | "USD per minute" |
|---|---|
| "Google Cloud (WaveNet)" | 0.004 |
| "Amazon Polly (Standard)" | 0.004 |
| "Azure (Neural)" | 0.014 |
| "OpenAI (gpt-4o-mini-tts)" | 0.015 |
| "Deepgram (Aura-2)" | 0.027 |
| "Cartesia (Sonic)" | 0.035 |
| "ElevenLabs (Flash)" | 0.045 |
| "PlayHT (Turbo, est)" | 0.07 |
| "OmniVoice (self-host)" | 0 |
Wartość na minutę to nasz szacunek (cena za milion znaków razy ~900 znaków/min). PlayHT jest abonamentowy, więc jego wartość to szacunek; OmniVoice kosztuje 0 USD za znak (płacisz tylko za GPU i prąd). TTS to jednak tylko jedna pozycja kosztowa. Po pełny obraz zobacz nasze pełne rozbicie kosztów agenta głosowego.
Czego nauczyliśmy się, wpinając TTS w produkcyjnych agentów głosowych
Deklarowane opóźnienie to nie zmierzone opóźnienie. W agencie głosowym do rezerwacji stolików, który wdrożyliśmy w 2026 roku, reklamowane 75 ms ElevenLabs Flash było prawdziwe w izolacji, ale w naszym pipeline — gdy doszła generacja tokenów LLM, skoki sieciowe i buforowanie dźwięku — pierwszy dźwięk, który słyszał rozmówca, lądował bliżej 300–400 ms. Ta luka to różnica między naturalną odpowiedzią a niezręczną pauzą.
Niezależny benchmark Coval to potwierdza. Zmierzył Cartesię Sonic-3 na około 188 ms P50 do pierwszego dźwięku (IQR 100 ms), ElevenLabs Turbo v2.5 blisko 264 ms, a Flash v2.5 blisko 288 ms — wszystko wyżej niż liczby deklarowane przez dostawców. Dlatego domyślnie wybieramy strumieniujące API websocket (Cartesia, Deepgram) zamiast wsadowego REST do wszystkiego, co konwersacyjne. Uważaj też na metrykę: pierwsze bajty, które zwraca API strumieniujące, to metadane kontenera i nagłówka, nie odtwarzalny dźwięk. Czas do pierwszego bajtu schlebia dostawcy; czas do pierwszego dźwięku jest tym, co faktycznie słyszy rozmówca.
Niespodzianka kosztowa, której nie ujęliśmy w budżecie: na linii o dużym wolumenie działającej na ElevenLabs Multilingual v3 (~$0,09/min) agent mówiący przez 40% sześciominutowej rozmowy syntezuje około 2,4 minuty dźwięku, mniej więcej 0,22 USD za rozmowę. Przy 1500 rozmowach dziennie to blisko 9700 USD miesięcznie tylko za TTS. Przełączenie tej linii na gpt-4o-mini-tts ($0,015/min) ścięło koszt poniżej 1700 USD. I jedna pułapka, która nas ugryzła: model źle wymawiał nazwę restauracji klienta, dopóki nie dodaliśmy aliasu fonemowego, więc zarezerwuj czas na słownik wymowy przed startem.
Czy można self-hostować lub uruchomić open-source'owy TTS?
Tak i w 2026 roku to realna opcja, nie projekt naukowy. Self-hosting oznacza uruchamianie modelu na własnych GPU, tak by dźwięk nigdy nie dotykał API strony trzeciej. Główne wybory open-source to OmniVoice (646 języków, klonowanie zero-shot), Piper (szybki, lekki, świetny na Raspberry Pi), Kokoro (mały i wysokiej jakości) oraz starszy Coqui TTS.
Są też zarządzane ścieżki self-host. Odłączone kontenery (air-gapped) Azure i enterprise'owy on-prem Deepgram pozwalają uruchamiać głosy klasy dostawcy we własnej sieci bez surowego wdrożenia open-source.
Self-hosting wygrywa, gdy dane prawnie nie mogą opuścić Twoich serwerów (HIPAA, air-gapped), gdy potrzebujesz rzadkich lub nisko-zasobowych języków albo gdy rozliczenie za znak staje się brutalne przy bardzo dużych wolumenach. Przegrywa, gdy potrzebujesz opóźnienia konwersacyjnego w czasie rzeczywistym albo jesteś małym zespołem bez zapasowych mocy GPU. Dla nich strumieniujące API jest tańszą odpowiedzią, gdy wliczysz czas inżynierów.
Jak wybrać właściwe API TTS?
Wybieraj według jednego największego ograniczenia, nie według listy funkcji. Oto szybkie drzewo decyzyjne, którego używamy z klientami:
- Budujesz agenta głosowego czasu rzeczywistego? Cartesia lub Deepgram (strumieniowanie websocket, najniższe zmierzone opóźnienie).
- Jakość głosu niepodważalna? ElevenLabs.
- Tanio i wielojęzycznie? Google Cloud lub Amazon Polly.
- On-prem lub air-gapped? Odłączone kontenery Azure lub OmniVoice.
- Już głęboko w ekosystemie? OpenAI, AWS Polly lub Google Cloud — ten, który pasuje do istniejącego stacku.
- Potrzebujesz najszerszej biblioteki głosów? PlayHT.
Zacznij od ograniczenia, które zabiłoby projekt, gdybyś źle je ocenił. Resztę optymalizuj później.
Jak podchodzi do tego Techsy
Budujemy agentów głosowych, nie sprzedajemy API TTS — i właśnie dlatego możemy być tu neutralni. W praktyce dobieramy inny TTS dla każdego klienta na podstawie jego budżetu opóźnienia, pułapu kosztów i reguł zgodności, a potem wpinamy go w pełnego agenta: speech-to-text, LLM, telefonię i strumieniujący klej pomiędzy. Linia do rezerwacji stolików i linia kliniki objętej HIPAA rzadko używają tego samego silnika syntezy.
Jeśli ważysz budowę versus kupno, budujemy produkcyjnych agentów głosowych od końca do końca i potrafimy powiedzieć, który TTS naprawdę pasuje do Twojego wolumenu rozmów.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io — University of Birmingham. Połącz się na LinkedIn.
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji oraz pipeline'y głosowe/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stacku narzędzi LLM, którego zespół Techsy faktycznie używa w produkcji.
Często zadawane pytania
Jakie jest najlepsze API text-to-speech dla programistów?
To zależy od Twojego jednego największego ograniczenia. Po najwyższą jakość głosu wybierz ElevenLabs. Po najniższe opóźnienie czasu rzeczywistego — Cartesię. Po tani wielojęzyczny dźwięk — Google Cloud lub Amazon Polly. Po on-prem lub dane air-gapped — odłączone kontenery Azure lub self-hostowany OmniVoice. Nie ma uniwersalnego zwycięzcy.
Które API TTS ma najniższe opóźnienie dla agentów głosowych czasu rzeczywistego?
Cartesia deklaruje 40–90 ms do pierwszego dźwięku, ElevenLabs Flash deklaruje ~75 ms, a Deepgram podaje poniżej 250 ms. Ale deklaracja to nie pomiar: niezależny benchmark Coval zmierzył Cartesię Sonic-3 na blisko 188 ms P50, a ElevenLabs Flash na blisko 288 ms w realnych warunkach. Dla agentów preferuj strumieniujące API websocket.
Ile kosztuje API text-to-speech za minutę dźwięku?
Mniej więcej 0,004–0,09 USD za minutę w 2026 roku. Google i Polly Standard lądują blisko 0,004 USD/min, OpenAI gpt-4o-mini-tts blisko 0,015 USD/min, a premiumowe głosy ElevenLabs sięgają 0,09 USD/min. To nasze szacunki przy ~900 znakach na minutę; self-hostowany OmniVoice kosztuje 0 USD za znak.
Czy istnieje darmowe API text-to-speech? Który darmowy plan jest najlepszy?
Tak. Google Cloud daje 4 mln znaków Standard miesięcznie (po 1 mln na wyższych typach głosów), Amazon Polly oferuje 5 mln Standard i 1 mln Neural przez 12 miesięcy, Azure F0 obejmuje 500 tys. miesięcznie na zawsze, a Cartesia dorzuca ~27 minut miesięcznie. OpenAI i Deepgram dają zamiast tego kredyty powitalne.
Jakie jest najtańsze API text-to-speech?
Wśród hostowanych API gpt-4o-mini-tts od OpenAI za $0,015 za minutę jest najtańszą jakościową opcją, podczas gdy Google Cloud i Amazon Polly Standard kosztują 4 USD za milion znaków ($0,004/min). Jeśli możesz uruchomić GPU, self-hostowany OmniVoice kosztuje 0 USD za znak — tylko Twoje obliczenia i prąd.
Czy mogę self-hostować model text-to-speech zamiast używać API?
Tak. OmniVoice, Piper, Kokoro i Coqui są open-source'owe i działają w pełni lokalnie. W zarządzanym on-prem Azure oferuje odłączone kontenery (air-gapped), a Deepgram — enterprise'owy self-host. Self-hosting opłaca się dla HIPAA, danych air-gapped, rzadkich języków lub bardzo dużych wolumenów, gdzie rozliczenie za znak boli.
Które API TTS obsługują strumieniowanie lub websocket?
Cartesia, Deepgram, OpenAI, ElevenLabs i PlayHT obsługują strumieniowanie, przy czym Cartesia i Deepgram są natywnie websocketowe i najlepiej pasują do rozmowy na żywo. OmniVoice jest tylko wsadowy, więc syntezuje cały klip przed zwróceniem dźwięku i nie nadaje się do agentów głosowych czasu rzeczywistego.
OpenAI czy ElevenLabs — które ma lepsze API TTS?
Różne zadania. OpenAI wygrywa ceną i sterownością (promptem określasz, jak ma brzmieć kwestia) i już jest w Twoim stacku. ElevenLabs wygrywa surową jakością głosu, większą biblioteką i natychmiastowym klonowaniem. Dla pełnych agentów porównaj oba z opcjami orkiestracji w naszym rozbiciu platform agentów głosowych.
Jak sklonować głos przez API TTS i jak długi klip jest potrzebny?
Długość klipu się różni. ElevenLabs klonuje natychmiast z dowolnego identyfikatora głosu, Cartesia i OmniVoice potrzebują próbki około 3 sekund, a PlayHT chce 3–10 sekund. Amazon Polly, Deepgram i Google Cloud używają tylko presetów głosów (Custom Neural Voice w Azure wymaga formalnego procesu wdrożenia).
Jaka jest różnica między ceną za znak a ceną za token/minutę?
Większość API TTS rozlicza za znak tekstu wejściowego, co łatwo przewidzieć. gpt-4o-mini-tts od OpenAI rozlicza zamiast tego za token dźwięku wyjściowego, więc koszt podąża za długością wygenerowanej mowy, nie tekstu źródłowego. Dla agentów głosowych przelicz oba na dolary za minutę rozmowy, by porównać uczciwie.
Źródła
- Cennik API ElevenLabs: https://elevenlabs.io/pricing/api (dostęp 2026-07-14)
- Cennik Cartesia: https://cartesia.ai/pricing (dostęp 2026-07-14)
- Cennik Deepgram: https://deepgram.com/pricing (dostęp 2026-07-14)
- Cennik Amazon Polly: https://aws.amazon.com/polly/pricing/ (dostęp 2026-07-14)
- Cennik API OpenAI: https://developers.openai.com/api/docs/pricing (dostęp 2026-07-14)
- Cennik Google Cloud Text-to-Speech: https://cloud.google.com/text-to-speech/pricing (dostęp 2026-07-14)
- Cennik Azure AI Speech: https://azure.microsoft.com/en-us/pricing/details/speech/ (dostęp 2026-07-14)
- OmniVoice (k2-fsa): https://github.com/k2-fsa/OmniVoice (dostęp 2026-07-14)
- Niezależny benchmark TTS Coval: https://www.coval.ai/blog/best-text-to-speech-providers-in-2026-how-to-choose-(and-why-vendor-benchmarks-lie)/ (dostęp 2026-07-14)
- MarkTechPost, porównanie TTS oparte na benchmarkach: https://www.marktechpost.com/2026/05/30/best-text-to-speech-tts-models-in-2026-a-benchmark-based-comparison/ (dostęp 2026-07-14)