
9 bedste text-to-speech APIs til udviklere (2026): Sammenligning af reel latens og pris pr. minut
Den bedste text-to-speech API til udviklere er ikke den med den smarteste demo-video. Det er den, der holder sig inden for dit latensbudget uden at ødelægge din regning. Det ved vi, fordi vi bygger voice agents oven på disse API'er. I sidste kvartal annoncerede Cartesias Sonic-3 en time-to-first-audio på 40 til 90 ms, men Covals uafhængige benchmark målte dens reelle P50 til cirka 188 ms. Priserne ligger fra $4 til $100 pr. 1 mio. tegn. Leverandørernes latenstal overlever sjældent et live telefonopkald. Så her er en ærlig rangering af 9 text-to-speech API'er – med de tal, som leverandørerne udelader fra deres egne lister.
Vi sælger ikke en TTS-API. Vi bygger voice agents oven på dem, så der er intet produkt, vi skal promovere i denne rangering. Og for at være helt klare om omfanget: Dette handler om text-to-speech-syntese-API'en, laget der omdanner tekst til lyd – ikke om komplette voice agent-platforme eller video-værktøjer til creators. Ny i feltet? Start med hvad en AI voice agent egentlig er.
Hurtigt svar: De bedste TTS-API'er i overblik
- Bedste stemmekvalitet samlet set: ElevenLabs (Flash, angiveligt ca. 75 ms), den dyreste her med 50 til 100 dollars per 1 mio. tegn.
- Bedste pris-ydelse og nemmeste integration: OpenAI gpt-4o-mini-tts, cirka 0,015 dollars per minuts lyd.
- Laveste latenstid til realtidsagenter: Cartesia Sonic, native streaming-websockets, angiveligt 40 til 90 ms tid til første lyd.
- Billigst og selvhosting: Google Cloud og Amazon Polly til 4 dollars per 1 mio. tegn; OmniVoice kan selvhostes for 0 dollars.
De 9 bedste TTS-API'er ved første øjekast
Her er alle API'er side om side, rangeret til en udvikler, der integrerer text-to-speech i en app eller stemmeagent. Minutpriserne er vores estimat, ikke et leverandørtal (beregningen findes under tabellen).
| API | Priser ($/1 mio. tegn) | Est. $/min* | Gratis niveau | Streaming | Stemmekloning | Self-host | Bedst til |
|---|---|---|---|---|---|---|---|
| ElevenLabs | $50 Flash / $100 Multilingual | ~$0,045 | prøveperiode | Ja | Øjeblikkelig via ID | Nej | Bedste stemmekvalitet |
| OpenAI | $15 tts-1 / gpt-4o-mini-tts ~$0,015/min | ~$0,015 | $5 kredit | Ja | Begrænset | Nej | God værdi og nemmest |
| Cartesia | ~$39 (Sonic) | ~$0,035 | ~27 min/md. | Ja (websocket) | Øjeblikkelig (Pro) | Nej | Agenter med lav latenstid |
| Deepgram | $15 Aura-1 / $30 Aura-2 | ~$0,014-0,027 | $200 kredit | Ja | Nej (forudindstillet) | Ja (enterprise) | STT plus TTS, én leverandør |
| Google Cloud | $4 Std/WaveNet / $16 Neural2 | ~$0,004-0,014 | 4 mio. tegn/md. (Std) | Ja | Nej | Nej | Flersproget plus gratis niveau |
| Amazon Polly | $4 Std / $16 Neural | ~$0,004-0,014 | 5 mio./1 mio. tegn/md. | Ja | Nej | Nej | Billig, driftssikker i stor skala |
| Azure AI Speech | $16 Neural / $22 Neural HD | ~$0,014-0,020 | 500K tegn/md. | Ja | Custom Neural Voice | Ja (air-gapped containere) | Compliance / on-prem |
| PlayHT | abonnement ~$39-99/md. (est.) | ~$0,07 (est.) | prøveperiode | Ja | Øjeblikkelig (3-10 sek.) | Nej | Stort flersproget bibliotek |
| OmniVoice | $0 (Apache-2.0) | Kun GPU-omkostninger | ubegrænset (selvkørt) | Nej (batch) | Zero-shot ~3 sek. | Ja (fuldt lokalt) | Self-host / sjældne sprog |
*Minutprisen er vores estimat: pris pr. 1 mio. tegn ganget med ~900 tegn/min (ca. 150 ord/min). Ikke et leverandørtal.
Hvordan rangerede vi disse (og hvorfor sælger vi ingen TTS-API)?
Vi vægtede fem ting: stemmekvalitet, latens og streaming-understøttelse, omkostninger (pr. tegn og pr. minut), SDK-flade og self-host-muligheder. Vi bygger produktionsklare stemmeagenter på flere af disse, så rækkefølgen afspejler egnethed, ikke favorisering. Ingen har betalt for en plads.
Den neutralitet er hele pointen. Hver eneste "bedste TTS-API"-liste, du finder, er skrevet af en TTS-leverandør, der rangerer sit eget produkt øverst. Vi sælger agenter, ikke syntese, så vi har ingen egen hest i væddeløbet. Hvor et værktøj taber på pris, latens eller kloning, siger vi det i dets "Spring over, hvis"-linje. Ingen stråmænd, ingen favoritter.
1. ElevenLabs: Bedste samlede stemmekvalitet
ElevenLabs leverer de mest naturlige syntetiske stemmer, du kan købe via en API lige nu, med et stort stemmebibliotek og øjeblikkelig kloning via stemme-ID. Deres Flash v2.5-model er realtidsmuligheden.
Ifølge ElevenLabs' API-prisside (pr. juli 2026) kører Flash og Turbo til 50 $ pr. 1 mio. tegn, og Multilingual v2/v3 kører til 100 $ pr. 1 mio., hvilket efter vores beregning svarer til cirka 0,045 $ til 0,09 $ i minuttet. ElevenLabs hævder omkring 75 ms latenstid på Flash. Streaming fungerer via REST og websocket. Kloning sker øjeblikkeligt fra ethvert stemme-ID.
Bygger du en komplet telefonagent? Se, hvordan den klarer sig mod stemmeagentplatforme som Vapi og Synthflow.
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb?output_format=mp3_44100_128" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Your table for two is confirmed for 8pm.", "model_id": "eleven_flash_v2_5"}' \
--output speech.mp3Vælg denne, hvis stemmekvalitet er ikke-forhandlingsbar, og budgettet ikke er din primære begrænsning. Spring den over, hvis prisen pr. tegn er den afgørende hindring, for det er den dyreste mulighed her.
2. OpenAI TTS: Bedste værdi og nemmeste integration
OpenAI TTS er den mindst modstandsfulde vej, hvis du allerede kalder OpenAI's API. Modellen gpt-4o-mini-tts tilføjer styrbarhed, hvilket betyder, at du prompter hvordan en sætning skal lyde ("sig det som en varm, tålmodig lærer"), og ikke kun hvad der siges.
Ifølge OpenAIs prisdokumentation (pr. juli 2026) koster tts-1 15 USD pr. 1 mio. tegn, tts-1-hd koster 30 USD pr. 1 mio., og gpt-4o-mini-tts fakturerer 0,60 USD pr. 1 mio. tekst-tokens plus 12 USD pr. 1 mio. lyd-tokens, hvilket lander på omkring 0,015 USD pr. minut lyd. Streaming understøttes. Kloning er begrænset.
Bygger du en realtids-telefonagent? Kombinér den med OpenAIs Realtime API til stemmeagenter.
from openai import OpenAI
client = OpenAI() # reads OPENAI_API_KEY from env
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="alloy",
input="Say it like a warm, patient teacher.",
) as response:
response.stream_to_file("speech.mp3")Vælg denne, hvis du vil have billig, tilstrækkelig lyd i en stack, du allerede kører. Spring den over, hvis du har brug for mange forskellige stemmer eller ægte stemmekloning.
3. Cartesia (Sonic): Bedst til realtidsagenter med ultralav latency
Cartesias Sonic er bygget til samtale. Den leveres med native streaming-websockets og den laveste time-to-first-audio, vi har målt fra en hosted API.
Ifølge Cartesias prisside (pr. juli 2026) koster Startup-planen omkring 39 $ pr. 1 mio. tegn (~0,035 $/min) med cirka 20.000 gratis credits om måneden (ca. 27 minutters lyd). Cartesia hævder 40 til 90 ms time-to-first-audio på Sonic-3. Streaming-API'et er websocket-native, og kloning er øjeblikkelig på Pro-niveauer. Her er det mønster, agenter faktisk bruger, hvor PCM-chunks streames direkte til opkalderen:
from cartesia import Cartesia
import os
client = Cartesia(api_key=os.environ["CARTESIA_API_KEY"])
ws = client.tts.websocket()
for chunk in ws.send(
model_id="sonic-3",
transcript="Booking confirmed. See you at eight.",
voice={"id": "a0e99841-438c-4a64-b679-ae501e7d6091"},
output_format={"container": "raw", "encoding": "pcm_f32le", "sample_rate": 44100},
stream=True,
):
play(chunk.audio) # push audio to the caller as it arrivesVælg denne, hvis du bygger konversationelle stemmeagenter med svartider under et sekund. Spring den over, hvis du ikke har brug for realtid og ønsker et større stemmekatalog.
4. Deepgram (Aura-2): Bedste STT + TTS fra én leverandør
Deepgram er den leverandør, der gør begge halvdele af en voicebot godt: lytningen (tale-til-tekst) og talen (TTS). Aura-2 afregnes pr. tegn og er optimeret til samtalelatens.
Ifølge Deepgrams prisside (pr. juli 2026) koster Aura-1 15 $ pr. 1 mio. tegn, og Aura-2 koster 30 $ pr. 1 mio. (ca. 0,014–0,027 $/min.), med en tilmeldingskredit på 200 $ og selvhosting på enterprise-planer. Deepgram angiver under 250 ms for konversationel AI. Streaming understøttes; kloning gør ikke, så du er begrænset til forudindstillede stemmer.
Vælg denne, hvis du vil have én leverandør til hele lytte-og-tale-løkken. Spring den over, hvis du har brug for stemmekloning.
5. Google Cloud Text-to-Speech: Bedste flersprogede bredde og en fed gratisversion
Google Cloud Text-to-Speech dækker over 380 stemmer på tværs af mere end 50 sprog, og gratisversionen er den mest generøse til prototyping.
Ifølge Google Clouds prisside (pr. juli 2026) koster Standard og WaveNet 4 USD per 1 mio. tegn, Neural2 koster 16 USD per 1 mio., Chirp 3 HD koster 30 USD per 1 mio., og Studio koster 160 USD per 1 mio. Gratisversionen giver dig 4 mio. Standard-tegn om måneden, men kun 1 mio. om måneden hver for WaveNet, Neural2 og Chirp 3 HD, så tjek hvilken stemmetype du faktisk bruger. Streaming understøttes; der er ingen kloning (custom voice er et separat produkt).
Vælg denne, hvis du har brug for mange sprog til en billig pris og arbejder på GCP. Spring den over, hvis du vil have førsteklasses ekspressiv kvalitet uden at betale Studios 160 USD per 1 mio.
6. Amazon Polly: Den bedste kedelige, pålidelige løsning, der er billig i stor skala
Amazon Polly er den pålidelige arbejdshest: forudsigelig, billig og dybt integreret i AWS. Den er ideel til IVR og transaktionsbaserede prompts, hvor du ikke har brug for dramatik, men oppetid.
Ifølge AWS' Polly-prisside (pr. juli 2026) koster Standard $4 pr. 1 mio. tegn, Neural $16 pr. 1 mio., Generative $30 pr. 1 mio. og Long-Form $100 pr. 1 mio. (~$0,004 til $0,09/min.). Gratisniveauet dækker 5 mio. Standard- og 1 mio. Neural-tegn om måneden i dine første 12 måneder. Streaming understøttes; der er ingen kloning.
Vælg denne, hvis du er på AWS og ønsker forudsigelig TTS i stor skala. Spring den over, hvis du vil have udtryksfulde, klonbare stemmer.
7. Azure AI Speech: Bedst til compliance og on-prem
Det, der adskiller Azure AI Speech, er ikke stemmerne, men hvor du kan køre dem: standard Neural, Custom Neural Voice og frakoblede (air-gapped) containere til data, som juridisk ikke må forlade dit netværk.
Ifølge Azures prisoversigt for Speech (pr. juli 2026) koster standard Neural $16 pr. 1 mio. tegn, og Neural HD koster $22 pr. 1 mio. (sat ned fra $30 i marts 2026). Det gratis F0-niveau dækker 500.000 tegn om måneden og udløber aldrig. Air-gappede frakoblede containere koster cirka $47.424 om året for 4,8 mia. tegn (kræver tilmelding), og det er det tal, dit compliance-team vil bekymre sig om. Streaming understøttes; kloning sker via Custom Neural Voice.
Vælg denne, hvis du har brug for on-prem eller air-gapped syntese, eller hvis I er en Microsoft-virksomhed. Spring den over, hvis I ikke er på Azure og ikke har brug for compliance-kontroller.
8. PlayHT: Bedste store flersprogede stemmebibliotek
Det, der trækker ved PlayHT, er bredden: 900+ stemmer, 142 sprog, Turbo-latency under 300 ms og øjeblikkelig kloning fra en 3 til 10 sekunders lydprøve.
Her er det ærlige forbehold om prissætningen. Ifølge PlayHTs prisside (pr. juli 2026) koster abonnementerne cirka 39 $/md. (Professional) til 99 $/md. (Premium/ubegrænset), og API-adgang ligger på de højere niveauer samt enterprise-niveauet. En klar API-pris pr. tegn er ikke offentliggjort, så behandl ethvert per-minut-tal (vi estimerer cirka 0,07 $) som netop det, et estimat. Streaming understøttes; kloning er øjeblikkelig fra et kort klip.
Vælg denne hvis du ønsker stemmebredde til et konversationsprodukt, og ElevenLabs er for dyrt. Spring den over hvis du ønsker transparent betal-efter-forbrug-prissætning pr. tegn.
9. OmniVoice: Bedst når data ikke kan forlade dine servere
OmniVoice (fra k2-fsa-teamet) er Apache-2.0, 0 $ pr. tegn, 646 sprog og zero-shot-kloning fra et klip på ca. 3 sekunder, og kører fuldt ud lokalt. Vi udsatte den for en praktisk test på vores egen hardware.
Der er overhovedet ingen regning pr. tegn. Du betaler for GPU'en og strømmen, intet andet. Til gengæld er OmniVoice batch-syntese (real-time-faktor omkring 0,03), ikke streaming under 300 ms, så den egner sig ikke til live samtale. Kloning er zero-shot fra få sekunders referenceaudio. For opsætningsdetaljer og kvalitetsnoter, læs vores praktiske OmniVoice-anmeldelse.
Vælg denne hvis du har brug for on-prem, HIPAA, sjældne sprog, eller hvis du hader pr.-tegn-fakturering ved meget høje mængder. Spring den over hvis du har brug for realtidssamtale-latens.
Hvad koster en TTS-API egentlig pr. minut?
En tekst-til-tale-API koster cirka 0,004 til 0,09 USD pr. minut af syntetiseret lyd i 2026. De billigste er Google Cloud og Amazon Polly Standard til omkring 0,004 USD/min.; OpenAIs gpt-4o-mini-tts ligger på ca. 0,015 USD/min.; ElevenLabs' bedste stemmer når op på 0,09 USD/min. Selvhostet OmniVoice koster 0 USD pr. tegn.
Alle tal pr. minut her er vores egen beregning, ikke et leverandørtal. Vi omregner prisen pr. 1 mio. tegn til en omkostning pr. minut ved at antage ~900 tegn pr. minut (ca. 150 ord pr. minuts naturlig tale). Den ene omregning ændrer, hvordan man lægger budget: bygger man voice-agents, budgetterer man ikke i dollar pr. million tegn — man budgetterer i dollar pr. minuts taletid. Her er den omregning, ingen offentliggør.
"Estimated TTS cost per minute of audio (USD, ~900 chars/min)"
Datatable
| "Provider (representative model)" | "USD per minute" |
|---|---|
| "Google Cloud (WaveNet)" | 0.004 |
| "Amazon Polly (Standard)" | 0.004 |
| "Azure (Neural)" | 0.014 |
| "OpenAI (gpt-4o-mini-tts)" | 0.015 |
| "Deepgram (Aura-2)" | 0.027 |
| "Cartesia (Sonic)" | 0.035 |
| "ElevenLabs (Flash)" | 0.045 |
| "PlayHT (Turbo, est)" | 0.07 |
| "OmniVoice (self-host)" | 0 |
Tallene pr. minut er vores estimat (pris pr. 1 mio. tegn ganget med ~900 tegn/min.). PlayHT er abonnementsbaseret, så dets tal er et estimat; OmniVoice koster 0 USD pr. tegn (man betaler kun for GPU og strøm). TTS er dog kun én post på regnskabet. For det fulde overblik, se vores fuld-stack omkostningsgennemgang for voice-agents.
Hvad vi lærte af at integrere TTS i produktionsklare voice-agenter
Oplyst latens er ikke det samme som målt latens. På en voice-agent til restaurantreservationer, som vi leverede i 2026, var ElevenLabs Flash's annoncerede 75 ms reelle nok isoleret set, men i vores pipeline — når LLM-token-generering, netværkshops og audiobuffering lagde sig oveni — landede den første lyd, som den opkaldende hørte, tættere på 300 til 400 ms. Det gab er forskellen på et naturligt svar og en akavet pause.
Covals uafhængige benchmark bakker dette op. Det målte Cartesia Sonic-3 til cirka 188 ms P50-tid-til-første-lyd (100 ms IQR), ElevenLabs Turbo v2.5 til omkring 264 ms og Flash v2.5 til omkring 288 ms — alt sammen højere end leverandørernes oplyste tal. Derfor bruger vi som standard streaming-websocket-API'er (Cartesia, Deepgram) frem for batch-REST til alt konversationsbaseret. Hold også øje med måletallet: de første bytes, en streaming-API returnerer, er container- og header-metadata, ikke afspillelig lyd. Tid-til-første-byte smigrer leverandøren; tid-til-første-lyd er det, den opkaldende faktisk hører.
Den prisoverraskelse, vi ikke havde budgetteret med: på en højvolumenlinje, der kørte ElevenLabs Multilingual v3 (ca. 0,09 $/min.), syntetiserer en agent, der taler i ca. 40 % af et seks minutter langt opkald, cirka 2,4 minutters lyd — omtrent 0,22 $ pr. opkald. Ved 1.500 opkald om dagen er det tæt på 9.700 $ om måneden i TTS alene. Da vi skiftede den linje til gpt-4o-mini-tts (ca. 0,015 $/min.), kom det ned under 1.700 $. Og én faldgrube, der bed os: modellen udtalte en kundes restaurantnavn forkert, indtil vi tilføjede et fonem-alias, så afsæt tid til en udtaleordbog inden lancering.
Kan du selv hoste eller køre open source-TTS?
Ja, og det er en reel mulighed i 2026, ikke et videnskabsprojekt. Selvhosting betyder at køre modellen på dine egne GPU'er, så lyden aldrig rører en tredjeparts-API. De vigtigste open source-valg er OmniVoice (646 sprog, zero-shot kloning), Piper (hurtig, letvægts, fremragende på en Raspberry Pi), Kokoro (lille og høj kvalitet) og den ældre Coqui TTS.
Der findes også administrerede selvhosting-muligheder. Azures frakoblede (air-gapped) containere og Deepgrams enterprise on-prem lader dig køre leverandørkvalitets-stemmer i dit eget netværk uden en rå open source-udrulning.
Selvhosting vinder, når data juridisk ikke kan forlade dine servere (HIPAA, air-gapped), når du har brug for sjældne eller lavressourcesprog, eller når prissætning pr. tegn bliver brutal ved meget høje volumener. Det taber, når du har brug for realtidssamtalelatens, eller du er et lille team uden GPU-drift til overs. For dem er en streaming-API det billigere svar, når man medregner ingeniørtid.
Hvordan vælger du den rigtige TTS-API?
Vælg ud fra din største begrænsning, ikke ud fra en tjekliste over funktioner. Her er det hurtige beslutningstræ, vi bruger sammen med vores kunder:
- Bygger du en realtids-stemmeagent? Cartesia eller Deepgram (streaming websockets, laveste målte latenstid).
- Er stemmekvalitet ikke til forhandling? ElevenLabs.
- Billig og flersproget? Google Cloud eller Amazon Polly.
- On-prem eller air-gapped? Azure disconnected containers eller OmniVoice.
- Allerede dybt inde i et økosystem? OpenAI, AWS Polly eller Google Cloud, alt efter hvad der matcher din eksisterende stack.
- Har du brug for det største stemmebibliotek? PlayHT.
Start med den begrænsning, der ville dræbe projektet, hvis du fik den forkert. Optimér resten bagefter.
Sådan griber Techsy det an
Vi bygger stemmeagenter, vi sælger ikke en TTS-API, og det er netop derfor, vi kan være neutrale her. I praksis vælger vi en forskellig TTS til hver kunde baseret på deres latensbudget, omkostningsloft og compliance-regler og integrerer den derefter i den fulde agent: speech-to-text, LLM'en, telefoni og den streaming-lim, der binder det hele sammen. En reservationslinje til en restaurant og en kliniklinje omfattet af HIPAA bruger sjældent den samme syntesemotor.
Hvis du overvejer at bygge eller købe, bygger vi produktionsklare stemmeagenter fra ende til anden og kan fortælle dig, hvilken TTS der faktisk passer til dit opkaldsvolumen.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io — University of Birmingham. Forbind på LinkedIn.
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automationssystemer og voice/SDR-pipelines til B2B-kunder. Han studerer på University of Birmingham og skriver om den LLM-værktøjsstack, som Techsy-teamet faktisk bruger i produktion.
Ofte stillede spørgsmål
Hvad er den bedste tekst-til-tale-API for udviklere?
Det afhænger af din største begrænsning. For den bedste stemmekvalitet, vælg ElevenLabs. For den laveste latenstid i realtid, Cartesia. For billig flersproget lyd, Google Cloud eller Amazon Polly. For on-prem eller air-gapped data, Azure disconnected containers eller selvhostet OmniVoice. Der er ingen universel vinder.
Hvilken TTS-API har den laveste latenstid for realtids-taleagenter?
Cartesia hævder 40 til 90 ms tid-til-første-lyd, ElevenLabs Flash hævder ~75 ms, og Deepgram angiver under 250 ms. Men hævdet er ikke det samme som målt: den uafhængige Coval-benchmark målte Cartesia Sonic-3 til omkring 188 ms P50 og ElevenLabs Flash til omkring 288 ms under reelle forhold. For agenter bør du foretrække streaming-websocket-API'er.
Hvad koster en tekst-til-tale-API pr. minut lyd?
Cirka $0,004 til $0,09 pr. minut i 2026. Google og Polly Standard ligger tæt på $0,004/min, OpenAI gpt-4o-mini-tts tæt på $0,015/min, og ElevenLabs' premium-stemmer når op på $0,09/min. Det er vores estimater ved ~900 tegn pr. minut; selvhostet OmniVoice koster $0 pr. tegn.
Findes der en gratis tekst-til-tale-API? Hvilken gratisplan er bedst?
Ja. Google Cloud giver 4 mio. Standard-tegn om måneden (1 mio. hver på højere stemmetyper), Amazon Polly tilbyder 5 mio. Standard- og 1 mio. Neural-tegn i 12 måneder, Azure F0 dækker 500.000 om måneden for altid, og Cartesia inkluderer ~27 minutter månedligt. OpenAI og Deepgram giver i stedet oprettelseskreditter.
Hvad er den billigste tekst-til-tale-API?
For en hosted API er OpenAIs gpt-4o-mini-tts til ca. $0,015 pr. minut den billigste mulighed i høj kvalitet, mens Google Cloud og Amazon Polly Standard koster $4 pr. 1 mio. tegn (ca. $0,004/min.). Hvis du kan køre en GPU, koster den selvhostede OmniVoice $0 pr. tegn – du betaler kun for beregningskraft og strøm.
Kan jeg selv hoste en tekst-til-tale-model i stedet for at bruge en API?
Ja. OmniVoice, Piper, Kokoro og Coqui er open source og kører fuldt ud lokalt. Til administreret on-premises tilbyder Azure frakoblede (air-gapped) containere, og Deepgram tilbyder selv-hosting til virksomheder. Selv-hosting kan betale sig ved HIPAA, air-gapped data, sjældne sprog eller meget stor volumen, hvor fakturering pr. tegn gør ondt.
Hvilke TTS-API'er understøtter streaming eller websockets?
Cartesia, Deepgram, OpenAI, ElevenLabs og PlayHT understøtter alle streaming, hvor Cartesia og Deepgram er websocket-native og bedst egnet til live samtale. OmniVoice er kun batch, så den syntetiserer et fuldt klip, før den returnerer lyd, og er ikke egnet til stemmeagenter i realtid.
Har OpenAI eller ElevenLabs den bedste TTS-API?
Forskellige opgaver. OpenAI vinder på pris og styrbarhed (prompt hvordan en replik skal lyde), og den er allerede i din stack. ElevenLabs vinder på rå stemmekvalitet, et større bibliotek og øjeblikkelig kloning. For komplette agenter kan du sammenligne begge med orkestreringsmuligheder i vores gennemgang af voice-agent-platforme.
Hvordan kloner jeg en stemme via en TTS-API, og hvor langt et klip skal jeg bruge?
Klippets længde varierer. ElevenLabs kloner øjeblikkeligt fra et hvilket som helst stemme-ID, Cartesia og OmniVoice kræver en prøve på cirka 3 sekunder, og PlayHT kræver 3 til 10 sekunder. Amazon Polly, Deepgram og Google Cloud bruger kun forudindstillede stemmer (Azures Custom Neural Voice kræver en formel registreringsproces).
Hvad er forskellen mellem prissætning pr. tegn og pr. token/pr. minut?
De fleste TTS-API'er fakturerer pr. tegn i inputteksten, hvilket er nemt at forudsige. OpenAIs gpt-4o-mini-tts fakturerer i stedet pr. lydoutput-token, så omkostningerne følger længden af den genererede tale, ikke kildeteksten. For voice-agenter omregner du begge til dollar pr. minuts taletid for at sammenligne retfærdigt.
Kilder
- ElevenLabs API-priser: https://elevenlabs.io/pricing/api (tilgået 14. juli 2026)
- Cartesia-priser: https://cartesia.ai/pricing (tilgået 14. juli 2026)
- Deepgram-priser: https://deepgram.com/pricing (tilgået 14. juli 2026)
- Amazon Polly-priser: https://aws.amazon.com/polly/pricing/ (tilgået 14. juli 2026)
- OpenAI API-priser: https://developers.openai.com/api/docs/pricing (tilgået 14. juli 2026)
- Google Cloud Text-to-Speech-priser: https://cloud.google.com/text-to-speech/pricing (tilgået 14. juli 2026)
- Azure AI Speech-priser: https://azure.microsoft.com/en-us/pricing/details/speech/ (tilgået 14. juli 2026)
- OmniVoice (k2-fsa): https://github.com/k2-fsa/OmniVoice (tilgået 14. juli 2026)
- Uafhængig TTS-benchmark fra Coval: https://www.coval.ai/blog/best-text-to-speech-providers-in-2026-how-to-choose-(and-why-vendor-benchmarks-lie)/ (tilgået 14. juli 2026)
- MarkTechPost, benchmarkbaseret TTS-sammenligning: https://www.marktechpost.com/2026/05/30/best-text-to-speech-tts-models-in-2026-a-benchmark-based-comparison/ (tilgået 14. juli 2026)