Techsy
Kontakt
Začít
Zpět na blog
ai-machine-learning

9 nejlepších API pro převod textu na řeč pro vývojáře (2026): Reálná latence a náklady na minutu ve srovnání

Napsal Mert Batur Gürbüz
Jul 16, 2026
16 minut čtení
Obsah
9 nejlepších API pro převod textu na řeč pro vývojáře (2026): Reálná latence a náklady na minutu ve srovnání

9 nejlepších API pro převod textu na řeč pro vývojáře (2026): Srovnání reálné latence a nákladů za minutu

Nejlepší API pro převod textu na řeč pro vývojáře není to s nejvychytanějším demo videem. Je to to, které dodrží váš latenční rozpočet, aniž by vám zničilo účet. Víme to, protože na těchto API stavíme hlasové agenty. Minulé čtvrtletí inzerovala Cartesia u svého Sonic-3 čas do prvního zvuku 40 až 90 ms, přitom nezávislý benchmark Coval naměřil reálné P50 přibližně 188 ms. Ceny se pohybují od 4 do 100 $ za 1M znaků. Latenční údaje prodejců zřídkakdy přežijí živý telefonní hovor. Takže tady je upřímné hodnocení 9 API pro převod textu na řeč – s čísly, která prodejci ve svých vlastních přehledech vynechávají.

Neprodáváme žádné TTS API. Stavíme na nich hlasové agenty, takže v tomto hodnocení nemáme žádný produkt, který bychom prosazovali. A abychom si ujasnili rozsah: jde o API pro syntézu převodu textu na řeč, tedy vrstvu, která převádí text na zvuk – ne o kompletní platformy hlasových agentů ani nástroje pro tvůrce videí. Jste v tomto oboru noví? Začněte článkem Co vlastně je AI hlasový agent.

Rychlá odpověď: Nejlepší TTS API na první pohled

  • Nejlepší celková kvalita hlasu: ElevenLabs (Flash, udávaná latence ~75 ms), zde nejdražší – 50 až 100 $ za 1 milion znaků.
  • Nejlepší poměr cena/výkon a nejjednodušší integrace: OpenAI gpt-4o-mini-tts, přibližně 0,015 $ za minutu audia.
  • Nejnižší latence pro agenty v reálném čase: Cartesia Sonic, nativní streamovací websockety, udávaný čas do prvního zvuku 40 až 90 ms.
  • Nejlevnější a self-host: Google Cloud a Amazon Polly za 4 $ za 1 milion znaků; OmniVoice je zdarma při vlastním hostování.

9 nejlepších TTS API v kostce

Zde jsou všechna API vedle sebe, seřazená pro vývojáře, který integruje text-to-speech do aplikace nebo hlasového agenta. Částky za minutu jsou naším odhadem, nikoli údajem od dodavatele (výpočet najdete pod tabulkou).

APICena ($/1 mil. znaků)Odhad $/min*Bezplatný plánStreamováníKlonování hlasuVlastní hostingNejlepší pro
ElevenLabs$50 Flash / ~$0,045zkušební verzeAnoOkamžité podle IDNeNejlepší kvalita hlasu
OpenAI$15 tts-1 / gpt-4o-mini-tts ~$0,015/min~$0,015kredit $5AnoOmezenéNeVýhodné a nejjednodušší
Cartesia~$39 (Sonic)~$0,035~27 min/měs.Ano (websocket)Okamžité (Pro)NeAgenti s nízkou latencí
Deepgram$15 Aura-1 / $30 Aura-2~$0,014–0,027kredit $200AnoNe (přednastavené)Ano (enterprise)STT i TTS, jeden dodavatel
Google Cloud$4 Std/WaveNet / $16 Neural2~$0,004–0,0144 mil. znaků/měs. (Std)AnoNeNeVícejazyčnost a bezplatný plán
Amazon Polly$4 Std / $16 Neural~$0,004–0,0145 mil./1 mil. znaků/měs.AnoNeNeLevné, spolehlivé ve velkém měřítku
Azure AI Speech$16 Neural / $22 Neural HD~$0,014–0,020500 tis. znaků/měs.AnoCustom Neural VoiceAno (kontejnery izolované od sítě)Compliance / on-prem
PlayHTpředplatné ~$39–99/měs. (odhad)~$0,07 (odhad)zkušební verzeAnoOkamžité (3–10 s)NeVelká vícejazyčná knihovna
OmniVoice$0 (Apache-2.0)pouze náklady na GPUneomezeně (vlastní provoz)Ne (dávkové)Zero-shot ~3 sAno (plně lokální)Vlastní hosting / vzácné jazyky

*Částka za minutu je naším odhadem: cena za 1 mil. znaků vynásobená ~900 znaky/min (přibližně 150 slov/min). Nejedná se o údaj od dodavatele.

Jak jsme je hodnotili (a proč neprodáváme žádné TTS API)?

Zvažovali jsme pět věcí: kvalitu hlasu, latenci a podporu streamování, cenu (za znak a za minutu), rozsah SDK a možnosti vlastního hostování. Na několika z nich stavíme produkční hlasové agenty, takže pořadí odráží vhodnost, ne nadržování. Nikdo si místo nezaplatil.

Právě v té neutralitě je celý smysl. Každý seznam „nejlepších TTS API", který najdete, napsal dodavatel TTS, který svůj vlastní produkt řadí na první místo. My prodáváme agenty, ne syntézu, takže tady nemáme co protlačovat. Když nástroj ztrácí v ceně, latenci nebo klonování, otevřeně to píšeme do jeho řádku „Kdy ho přeskočit". Žádné slaměné panáky, žádní favoriti.

1. ElevenLabs: Nejlepší celková kvalita hlasu

ElevenLabs nabízí v současnosti nejpřirozenější syntetické hlasy, které lze pořídit přes API, s rozsáhlou knihovnou hlasů a okamžitým klonováním podle ID hlasu. Jeho model Flash v2.5 je varianta pro reálný čas.

Podle stránky s cenami API od ElevenLabs (k červenci 2026) vychází Flash a Turbo na 50 $ za 1 milion znaků a Multilingual v2/v3 na 100 $ za 1 milion, tedy podle našich výpočtů zhruba 0,045 až 0,09 $ za minutu. ElevenLabs uvádí u modelu Flash latenci kolem 75 ms. Streamování funguje přes REST a websocket. Klonování je okamžité z libovolného ID hlasu.

Stavíte kompletního telefonního agenta? Podívejte se, jak si stojí oproti platformám hlasových agentů, jako jsou Vapi a Synthflow.

bash
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb?output_format=mp3_44100_128" \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text": "Your table for two is confirmed for 8pm.", "model_id": "eleven_flash_v2_5"}' \
  --output speech.mp3

Zvolte ho, pokud je kvalita hlasu nepostradatelná a rozpočet není vaším hlavním omezením. Přeskočte ho, pokud je překážkou cena za znak, protože jde o nejdražší variantu v tomto přehledu.

2. OpenAI TTS: Nejlepší poměr cena/výkon a nejjednodušší integrace

OpenAI TTS je cesta nejmenšího odporu, pokud už voláte OpenAI API. Model gpt-4o-mini-tts přidává řiditelnost, což znamená, že v promptu určujete jak má věta znít („řekni to jako vřelý, trpělivý učitel"), a ne jen co říká.

Podle cenové dokumentace OpenAI (k červenci 2026) stojí tts-1 15 $ za 1M znaků, tts-1-hd 30 $ za 1M a gpt-4o-mini-tts účtuje 0,60 $ za 1M textových tokenů plus 12 $ za 1M audio tokenů, což vychází přibližně na 0,015 $ za minutu audia. Streamování je podporováno. Klonování je omezené.

Stavíte real-time telefonního agenta? Zkombinujte ho s Realtime API OpenAI pro hlasové agenty.

python
from openai import OpenAI
client = OpenAI()  # reads OPENAI_API_KEY from env

with client.audio.speech.with_streaming_response.create(
    model="gpt-4o-mini-tts",
    voice="alloy",
    input="Say it like a warm, patient teacher.",
) as response:
    response.stream_to_file("speech.mp3")

Vyberte si ho, pokud chcete levné, dostatečně kvalitní audio v rámci stacku, který už provozujete. Přeskočte ho, pokud potřebujete mnoho odlišných hlasů nebo skutečné klonování hlasu.

3. Cartesia (Sonic): Nejlepší pro real-time agenty s ultra nízkou latencí

Sonic od Cartesie je stvořen pro konverzaci. Přináší nativní streamovací websockety a nejnižší time-to-first-audio, jaké jsme u hostovaného API naměřili.

Podle ceníku Cartesie (k červenci 2026) vyjde plán Startup přibližně na 39 $ za 1 milion znaků (~0,035 $/min), a to s zhruba 20 000 bezplatnými kredity měsíčně (asi 27 minut audia). Cartesia u modelu Sonic-3 uvádí time-to-first-audio 40 až 90 ms. Streamovací API je postavené přímo na websocketch a klonování hlasu je u Pro plánů okamžité. Tady je vzor, který agenti skutečně používají – streamují PCM úseky přímo volajícímu:

python
from cartesia import Cartesia
import os

client = Cartesia(api_key=os.environ["CARTESIA_API_KEY"])
ws = client.tts.websocket()

for chunk in ws.send(
    model_id="sonic-3",
    transcript="Booking confirmed. See you at eight.",
    voice={"id": "a0e99841-438c-4a64-b679-ae501e7d6091"},
    output_format={"container": "raw", "encoding": "pcm_f32le", "sample_rate": 44100},
    stream=True,
):
    play(chunk.audio)  # push audio to the caller as it arrives

Vyberte ji, pokud stavíte konverzační hlasové agenty s odezvou pod jednu sekundu. Přeskočte ji, pokud nepotřebujete real-time a chcete širší katalog hlasů.

4. Deepgram (Aura-2): Nejlepší jednotný dodavatel pro STT + TTS

Deepgram je jediný dodavatel, který dobře zvládá obě části hlasového bota: poslech (speech-to-text) i mluvení (TTS). Aura-2 se účtuje podle počtu znaků a je vyladěná pro konverzační latenci.

Podle ceníku Deepgramu (k červenci 2026) stojí Aura-1 15 $ za 1 milion znaků a Aura-2 30 $ za 1 milion (přibližně 0,014–0,027 $/min), s registračním kreditem 200 $ a self-hostováním u enterprise tarifů. Deepgram uvádí latenci pod 250 ms pro konverzační AI. Streamování je podporované; klonování ne, takže jste omezeni na přednastavené hlasy.

Zvolte ho, pokud chcete jednoho dodavatele pro celý cyklus poslechu a mluvení. Přeskočte ho, pokud potřebujete klonování hlasu.

5. Google Cloud Text-to-Speech: Nejširší multilingvní podpora a štědrá bezplatná úroveň

Google Cloud Text-to-Speech nabízí více než 380 hlasů ve více než 50 jazycích a jeho bezplatná úroveň je pro prototypování nejštědřejší.

Podle ceníku Google Cloud (k červenci 2026) stojí Standard a WaveNet 4 $ za 1 milion znaků, Neural2 16 $ za 1 milion, Chirp 3 HD 30 $ za 1 milion a Studio 160 $ za 1 milion. Bezplatná úroveň vám měsíčně poskytne 4 miliony znaků pro Standard, ale pouze 1 milion měsíčně pro WaveNet, Neural2 a Chirp 3 HD, takže si ověřte, jaký typ hlasu skutečně používáte. Streamování je podporováno; klonování hlasu není k dispozici (vlastní hlas je samostatný produkt).

Zvolte tuto službu, pokud potřebujete mnoho jazyků za nízkou cenu a pohybujete se v prostředí GCP. Vyhněte se jí, pokud chcete špičkovou expresivní kvalitu, aniž byste platili 160 $ za 1 milion u Studia.

6. Amazon Polly: Nejlepší nudná, spolehlivá a levná ve velkém měřítku

Amazon Polly je spolehlivý pracant: předvídatelná, levná a hluboce propojená s AWS. Je ideální pro IVR a transakční hlasové výzvy, kde nepotřebujete drama, ale spolehlivý provoz.

Podle ceníku Polly od AWS (k červenci 2026) stojí Standard 4 $ za 1 milion znaků, Neural 16 $ za 1 milion, Generative 30 $ za 1 milion a Long-Form 100 $ za 1 milion (přibližně 0,004 až 0,09 $/min). Bezplatná úroveň pokrývá 5 milionů znaků Standard a 1 milion znaků Neural měsčně během prvních 12 měsíců. Streamování je podporováno; klonování hlasu ne.

Vyberte ji, pokud používáte AWS a chcete předvídatelné TTS ve velkém objemu. Přeskočte ji, pokud chcete výrazné, klonovatelné hlasy.

7. Azure AI Speech: Nejlepší pro compliance a on-prem

Azure AI Speech se neodlišuje samotnými hlasy, ale tím, kde je můžete spustit: standardní Neural, Custom Neural Voice a odpojené (air-gapped) kontejnery pro data, která ze zákona nemohou opustit vaši síť.

Podle stránky s cenami Speech od Azure (k červenci 2026) stojí standardní Neural 16 USD za 1 milion znaků a Neural HD 22 USD za 1 milion (sníženo z 30 USD v březnu 2026). Bezplatná úroveň F0 zahrnuje 500 tisíc znaků měsíčně a nikdy nevyprší. Odpojené air-gapped kontejnery vyjdou přibližně na 47 424 USD ročně za 4,8 miliardy znaků (vyžaduje registraci), což je číslo, které bude zajímat váš compliance tým. Streamování je podporováno; klonování spadá pod Custom Neural Voice.

Vyberte si, pokud potřebujete on-prem nebo air-gapped syntézu, nebo pokud vaše firma staví na technologiích Microsoft. Vyhněte se mu, pokud nejste na Azure a nepotřebujete compliance kontroly.

8. PlayHT: Nejlepší rozsáhlá vícejazyčná knihovna hlasů

PlayHT láká především šíří nabídky: více než 900 hlasů, 142 jazyků, latence Turbo pod 300 ms a okamžité klonování z 3–10sekundové ukázky.

Teď upřímná poznámka k cenám. Podle ceníku PlayHT (k červenci 2026) se tarify pohybují zhruba od 39 $/měs. (Professional) do 99 $/měs. (Premium/neomezený) a přístup k API je dostupný až u vyšších a podnikových tarifů. Přehledná sazba API za znak není zveřejněna, takže jakoukoli hodnotu za minutu (odhadujeme zhruba 0,07 $) berte přesně jako to, co to je – odhad. Streamování je podporováno; klonování probíhá okamžitě z krátké nahrávky.

Zvolte jej, pokud chcete široký výběr hlasů pro konverzační produkt a ElevenLabs je příliš drahý. Vyhněte se mu, pokud chcete transparentní průběžné účtování po znacích (pay-as-you-go).

9. OmniVoice: Nejlepší, když data nemohou opustit vaše servery

OmniVoice (od týmu k2-fsa) má licenci Apache-2.0, stojí 0 $ za znak, podporuje 646 jazyků a nabízí zero-shot klonování z přibližně 3sekundové ukázky, přičemž běží zcela lokálně. Vyzkoušeli jsme si ho v praktickém testu na vlastním hardwaru.

Neplatíte vůbec nic za jednotlivé znaky. Platíte jen za GPU a elektřinu, nic víc. Na druhou stranu: OmniVoice je dávková syntéza (faktor reálného času kolem 0,03), nikoli streamování pod 300 ms, takže se nehodí pro živou konverzaci. Klonování je zero-shot z několika sekund referenčního audia. Podrobnosti o nastavení a poznámky ke kvalitě najdete v naší praktické recenzi OmniVoice.

Zvolte ho, pokud potřebujete on-prem řešení, soulad s HIPAA, vzácné jazyky, nebo nesnášíte účtování za znak při velmi vysokém objemu. Vyhněte se mu, pokud potřebujete konverzační latenci v reálném čase.

Kolik ve skutečnosti stojí TTS API za minutu?

API pro převod textu na řeč stojí v roce 2026 zhruba 0,004 až 0,09 $ za minutu syntetizovaného zvuku. Nejlevnější jsou Google Cloud a Amazon Polly Standard s cenou přibližně 0,004 $/min; OpenAI gpt-4o-mini-tts se pohybuje kolem 0,015 $/min; špičkové hlasy ElevenLabs dosahují 0,09 $/min. Self-hosted OmniVoice vychází na 0 $ za znak.

Každý údaj za minutu je zde náš vlastní výpočet, nikoli číslo od dodavatele. Přepočítáváme cenu za 1 milion znaků na náklady za minutu za předpokladu přibližně 900 znaků za minutu (což odpovídá zhruba 150 slovům za minutu přirozené řeči). Právě tento jediný přepočet mění způsob, jakým sestavujete rozpočet: tvůrci hlasových agentů neplánují v dolarech za milion znaků, ale v dolarech za minutu mluveného času. Zde je ten přepočet, který nikdo nezveřejňuje.

"Estimated TTS cost per minute of audio (USD, ~900 chars/min)"

Tabulka dat
"Estimated TTS cost per minute of audio (USD, ~900 chars/min)"
"Provider (representative model)""USD per minute"
"Google Cloud (WaveNet)"0.004
"Amazon Polly (Standard)"0.004
"Azure (Neural)"0.014
"OpenAI (gpt-4o-mini-tts)"0.015
"Deepgram (Aura-2)"0.027
"Cartesia (Sonic)"0.035
"ElevenLabs (Flash)"0.045
"PlayHT (Turbo, est)"0.07
"OmniVoice (self-host)"0

Údaj za minutu je náš odhad (cena za 1 milion znaků vynásobená přibližně 900 znaky/min). PlayHT funguje na bázi předplatného, takže jeho hodnota je odhadem; OmniVoice stojí 0 $ za znak (platíte pouze za GPU a elektřinu). TTS je však jen jednou z položek. Pro kompletní přehled viz náš rozpis nákladů na full-stack hlasového agenta.

Co jsme se naučili při napojování TTS na produkční hlasové agenty

Deklarovaná latence není totéž co naměřená latence. U hlasového agenta pro rezervace v restauracích, kterého jsme nasadili v roce 2026, bylo inzerovaných 75 ms u ElevenLabs Flash reálných v izolovaném testu, ale v našem pipeline, když se k tomu přičetlo generování tokenů LLM, síťové přeskoky a bufferování zvuku, se první zvuk, který volající slyšel, pohyboval spíše kolem 300 až 400 ms. Právě tento rozdíl rozhoduje mezi přirozenou odpovědí a trapnou pauzou.

Potvrzuje to i nezávislý benchmark Coval. Naměřil u Cartesia Sonic-3 přibližně 188 ms P50 pro time-to-first-audio (IQR 100 ms), u ElevenLabs Turbo v2.5 kolem 264 ms a u Flash v2.5 kolem 288 ms, tedy vše výše než hodnoty deklarované výrobci. Proto u všeho konverzačního ve výchozím nastavení používáme streamovací websocket API (Cartesia, Deepgram) místo dávkového RESTu. Dávejte si pozor i na metriku: první byty, které streamovací API vrátí, jsou metadata kontejneru a hlavičky, nikoli přehratelný zvuk. Time-to-first-byte výrobci lichotí; time-to-first-audio je to, co volající skutečně slyší.

Nákladové překvapení, se kterým jsme nepočítali: na lince s vysokým provozem, kde běžel ElevenLabs Multilingual v3 (~0,09 $/min), agent, který mluví ~40 % šestiminutového hovoru, syntetizuje přibližně 2,4 minuty zvuku, tedy zhruba 0,22 $ na hovor. Při 1 500 hovorech denně to dělá téměř 9 700 $ měsčně jen za TTS. Když jsme tuto linku přepnuli na gpt-4o-mini-tts (~0,015 $/min), kleslo to pod 1 700 $. A jeden zádrhel, který nás potrápil: model špatně vyslovoval název klientovy restaurace, dokud jsme nepřidali fonémový alias, takže si před spuštěním vyhraďte čas na výslovnostní slovník.

Lze si TTS hostovat svépomocí nebo spouštět open-source řešení?

Ano, a v roce 2026 jde o reálnou možnost, ne o vědecký experiment. Vlastní hosting znamená spouštět model na vlastních GPU, takže se zvuk nikdy nedostane k API třetí strany. Hlavní open-source možnosti jsou OmniVoice (646 jazyků, klonování zero-shot), Piper (rychlý, nenáročný, skvělý na Raspberry Pi), Kokoro (malý a kvalitní) a starší Coqui TTS.

Existují i cesty k hostování svépomocí s podporou dodavatele. Odpojené (air-gapped) kontejnery od Azure a podnikové on-prem řešení od Deepgram vám umožní spouštět hlasy na úrovni dodavatele uvnitř vlastní sítě bez nutnosti nasazení čistého open-source řešení.

Vlastní hosting se vyplatí, když data ze zákonných důvodů nesmí opustit vaše servery (HIPAA, air-gapped prostředí), když potřebujete vzácné či málo rozšířené jazyky, nebo když se účtování za znak při velmi vysokém objemu prodraží. Naopak se nevyplatí, když potřebujete latenci pro konverzaci v reálném čase nebo jste malý tým bez kapacity na správu GPU. Pro takové případy je levnější odpovědí streamovací API, jakmile započítáte čas vývojářů.

Jak vybrat správné TTS API?

Vybírejte podle svého jednoho největšího omezení, ne podle seznamu funkcí. Tady je rychlý rozhodovací strom, který používáme s klienty:

  • Budujete hlasového agenta v reálném čase? Cartesia nebo Deepgram (streamovací websockety, nejnižší naměřená latence).
  • Kvalita hlasu je nepopiratelná priorita? ElevenLabs.
  • Levné a vícejazyčné? Google Cloud nebo Amazon Polly.
  • On-prem nebo izolovaná síť? Azure disconnected containers nebo OmniVoice.
  • Už jste hluboko v nějakém ekosystému? OpenAI, AWS Polly nebo Google Cloud – podle toho, co odpovídá vašemu stávajícímu stacku.
  • Potřebujete nejširší knihovnu hlasů? PlayHT.

Začněte omezením, které by projekt zabíjelo, kdybyste ho podcenili. Zbytek optimalizujte později.

Jak k tomu přistupujeme v Techsy

Stavíme hlasové agenty, neprodáváme TTS API – a právě proto si můžeme dovolit být neutrální. V praxi vybíráme pro každého klienta jiný TTS podle jeho latencového rozpočtu, cenového stropu a požadavků na compliance a poté ho napojíme na kompletního agenta: speech-to-text, LLM, telefonii i streamovací vrstvu mezi tím. Linka na rezervace v restauraci a linka kliniky podléhající HIPAA zřídkakdy používají stejný syntézový engine.

Pokud zvažujete, zda stavět vlastní řešení, nebo koupit hotové, stavíme produkční hlasové agenty od A do Z a dokážeme vám říct, který TTS skutečně odpovídá vašemu objemu hovorů.

O autorovi

Mert Batur Gurbuz je spoluzakladatelem Techsy.io — University of Birmingham. Spojte se na LinkedIn.

Mert Batur Gurbuz je spoluzakladatelem Techsy.io, kde tým dodává AI agenty, automatizační systémy a hlasové/SDR pipeline pro klienty v B2B. Studuje na University of Birmingham a píše o stacku nástrojů pro LLM, který tým Techsy skutečně používá v produkci.

Často kladené otázky

Jaké je nejlepší text-to-speech API pro vývojáře?

Záleží na vašem nejdůležitějším omezení. Pro nejvyšší kvalitu hlasu zvolte ElevenLabs. Pro nejnižší latenci v reálném čase Cartesia. Pro levný vícejazyčný zvuk Google Cloud nebo Amazon Polly. Pro on-prem nebo vzduchem izolovaná data Azure disconnected containers nebo self-hosted OmniVoice. Univerzální vítěz neexistuje.

Které TTS API má nejnižší latenci pro hlasové agenty v reálném čase?

Cartesia uvádí dobu do prvního zvuku 40 až 90 ms, ElevenLabs Flash přibližně 75 ms a Deepgram udává méně než 250 ms. Udávané hodnoty se ale nerovnají naměřeným: nezávislý benchmark Coval naměřil u Cartesia Sonic-3 přibližně 188 ms P50 a u ElevenLabs Flash přibližně 288 ms v reálných podmínkách. Pro agenty upřednostněte streamovací websocket API.

Kolik stojí API pro převod textu na řeč za minutu audia?

V roce 2026 přibližně 0,004 až 0,09 $ za minutu. Google a Polly Standard se pohybují kolem 0,004 $/min, OpenAI gpt-4o-mini-tts kolem 0,015 $/min a prémiové hlasy ElevenLabs dosahují 0,09 $/min. Jde o naše odhady při přibližně 900 znacích za minutu; self-hosted OmniVoice vychází na 0 $ za znak.

Existuje bezplatné API pro převod textu na řeč? Která bezplatná úroveň je nejlepší?

Ano. Google Cloud poskytuje 4 miliony znaků Standard měsíčně (1 milion u každého vyššího typu hlasu), Amazon Polly nabízí 5 milionů znaků Standard a 1 milion znaků Neural na 12 měsíců, Azure F0 pokrývá 500 tisíc měsíčně navždy a Cartesia zahrnuje přibližně 27 minut měsíčně. OpenAI a Deepgram místo toho poskytují kredity při registraci.

Jaké je nejlevnější API pro převod textu na řeč?

V případě hostovaného API je nejlevnější kvalitní možností OpenAI gpt-4o-mini-tts za přibližně 0,015 $ za minutu, zatímco Google Cloud a Amazon Polly Standard stojí 4 $ za 1 milion znaků (přibližně 0,004 $/min). Pokud můžete využít GPU, self-hosted OmniVoice vyjde na 0 $ za znak, platíte pouze za výpočetní výkon a elektřinu.

Mohu místo použití API hostovat vlastní model převodu textu na řeč?

Ano. OmniVoice, Piper, Kokoro a Coqui jsou open-source a běží plně lokálně. Pro spravované on-prem nasazení nabízí Azure odpojené (air-gapped) kontejnery a Deepgram podnikové self-host řešení. Self-hosting se vyplatí v případě HIPAA, air-gapped dat, vzácných jazyků nebo velmi vysokého objemu, kde účtování za znak příliš zatěžuje rozpočet.

Která TTS API podporují streamování nebo websockety?

Cartesia, Deepgram, OpenAI, ElevenLabs a PlayHT všechna podporují streamování, přičemž Cartesia a Deepgram jsou nativně postavená na websocketech a nejlépe se hodí pro živou konverzaci. OmniVoice je pouze dávkové, takže syntetizuje celý klip před vrácením zvuku a nehodí se pro hlasové agenty v reálném čase.

Má OpenAI, nebo ElevenLabs lepší TTS API?

Záleží na účelu. OpenAI vítězí v ceně a v možnostech řízení (pomocí promptu určíte, jak má věta znít) a navíc ho už pravděpodobně máte ve svém stacku. ElevenLabs vítězí v samotné kvalitě hlasu, širší knihovně a okamžitém klonování hlasu. Pro plnohodnotné agenty porovnejte obě řešení i s možnostmi orchestrace v našem přehledu platforem pro hlasové agenty.

Jak naklonuji hlas pomocí TTS API a jak dlouhá nahrávka je potřeba?

Délka nahrávky se liší. ElevenLabs naklonuje hlas okamžitě z libovolného voice ID, Cartesia a OmniVoice potřebují zhruba 3sekundový vzorek a PlayHT vyžaduje 3 až 10 sekund. Amazon Polly, Deepgram a Google Cloud používají pouze přednastavené hlasy (Azure Custom Neural Voice vyžaduje oficiální proces registrace).

Jaký je rozdíl mezi cenou za znak a cenou za token/minutu?

Většina TTS API účtuje poplatky za znak vstupního textu, což se snadno odhaduje. Model gpt-4o-mini-tts od OpenAI místo toho účtuje poplatky za token výstupního audia, takže cena odpovídá délce vygenerované řeči, nikoli zdrojovému textu. U hlasových agentů převeďte obě varianty na dolary za minutu mluveného času, abyste získali férové srovnání.

Zdroje

  • Ceník API ElevenLabs: https://elevenlabs.io/pricing/api (citováno 2026-07-14)
  • Ceník Cartesia: https://cartesia.ai/pricing (citováno 2026-07-14)
  • Ceník Deepgram: https://deepgram.com/pricing (citováno 2026-07-14)
  • Ceník Amazon Polly: https://aws.amazon.com/polly/pricing/ (citováno 2026-07-14)
  • Ceník API OpenAI: https://developers.openai.com/api/docs/pricing (citováno 2026-07-14)
  • Ceník Google Cloud Text-to-Speech: https://cloud.google.com/text-to-speech/pricing (citováno 2026-07-14)
  • Ceník Azure AI Speech: https://azure.microsoft.com/en-us/pricing/details/speech/ (citováno 2026-07-14)
  • OmniVoice (k2-fsa): https://github.com/k2-fsa/OmniVoice (citováno 2026-07-14)
  • Nezávislý benchmark TTS Coval: https://www.coval.ai/blog/best-text-to-speech-providers-in-2026-how-to-choose-(and-why-vendor-benchmarks-lie)/ (citováno 2026-07-14)
  • MarkTechPost, srovnání TTS založené na benchmarcích: https://www.marktechpost.com/2026/05/30/best-text-to-speech-tts-models-in-2026-a-benchmark-based-comparison/ (citováno 2026-07-14)

Štítky

api pro převod textu na řečtts apinejlepší tts apielevenlabs apiopenai tts

Sdílet článek

Související články

Více z kategorie ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 nejlepších API pro AI web scraping v roce 2026 (otestováno na našem vlastním agentním stacku)

Otestovali jsme 8 API pro AI web scraping s reálnými cenami pro rok 2026 staženými přes náš vlastní agentní stack. Firecrawl, Bright Data, ScrapingBee a 5 dalších, seřazené podle výstupu připraveného pro LLM, anti-bot a podpory MCP.

9 min read minut čtení
Číst
ai-machine-learning
Jul 20, 2026

Prompt Engineering pro kódování: 7 vzorů, které denně používáme v Claude Code a Cursor (2026)

Většina článků o „promptech pro AI kódování“ vám nabídne 50 šablon ke kopírování. Tento článek učí 7 vzorů, které každý den používáme k provozu pipeline s 16 agenty v Claude Code, včetně skutečných příkladů před a po úpravě pro každý z nich, a ukazuje, kde se každý vzor nachází v nástrojích Claude Code, Cursor a Copilot v roce 2026.

11 min read minut čtení
Číst
ai-machine-learning
Jul 19, 2026

AI PoC do produkce: 12bodový kontrolní seznam před nasazením

Funkční AI demo není produkční systém. Tento 12bodový kontrolní seznam prochází tři fáze, které každá AI funkce před spuštěním potřebuje: zpevnit, stabilizovat a nasadit – s konkrétními prahy pro cenové stropy, omezení rychlosti, záložní řešení a spouštěče rollbacku.

10 min read minut čtení
Číst
Zobrazit všechny články
Začněte svůj projekt

Pojďme něco postavit nevšedního?

Proměňme vaši vizi ve skutečnost. Náš tým je připraven vám pomoct vytvořit software, který dělá rozdíl.

Rezervovat 30minutový úvodní hovorNaše projekty

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Než z knihovny

Claude dovednosti

Zobrazit vše
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI automatizace

Zobrazit vše
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt

Právní informace

  • Zásady ochrany osobních údajů
  • Podmínky poskytování služeb
  • Zásady používání cookies

Služby

  • Podniková řešení
  • Mobilní aplikace
  • Webové aplikace

Řešení

  • CRM systémy
  • Integrace AI
  • ERP systémy
  • Hlasoví agenti
  • Automatizace procesů
  • Kybernetická bezpečnost

Knihovna

  • Blog
  • Reference

Komunita

  • AI automatizace
  • Claude dovednosti

Nástroje

  • Kalkulátor ceny mobilní aplikace
  • Kalkulátor ceny OpenAI / LLM API
  • Kalkulátor ceny MVP
  • Kalkulátor ceny hlasového AI agenta

Společnost

  • O projektu
  • Partneři
  • Kontakt
Právní informaceZásady ochrany osobních údajůPodmínky poskytování služebZásady používání cookies
TECHSY
© 2026 Techsy. Všechna práva vyhrazena.