
As 9 Melhores APIs de Text-to-Speech para Programadores (2026): Latência Real e Custo por Minuto Comparados
A melhor API de text-to-speech para programadores não é aquela que tem a demonstração mais impressionante. É aquela que cumpre o seu orçamento de latência sem arruinar a fatura. Sabemos disso, porque construímos agentes de voz com base nestas APIs. No trimestre passado, o Sonic-3 da Cartesia anunciava um time-to-first-audio de 40 a 90 ms, mas o benchmark independente da Coval mediu o seu P50 real em cerca de 188 ms. Os preços variam entre 4 e 100 dólares por 1 milhão de caracteres. Os números de latência dos fornecedores raramente sobrevivem a uma chamada telefónica real. Eis, por isso, um ranking honesto de 9 APIs de text-to-speech, com os números que os fornecedores omitem das suas próprias listas.
Não vendemos nenhuma API de TTS. Construímos agentes de voz com base nestas APIs, pelo que não há nenhum produto a promover neste ranking. E para ser claro quanto ao âmbito: falamos da API de síntese de text-to-speech, a camada que converte texto em áudio, e não de plataformas completas de agentes de voz ou de ferramentas de vídeo para criadores. É novo nesta área? Comece por o que é realmente um agente de voz de IA.
Resposta Rápida: As Melhores APIs de TTS Num Relance
- Melhor qualidade de voz global: ElevenLabs (Flash ~75 ms declarados), a mais cara aqui, entre $50 e $100 por 1M de caracteres.
- Melhor relação qualidade-preço e integração mais simples: OpenAI gpt-4o-mini-tts, aproximadamente $0,015 por minuto de áudio.
- Menor latência para agentes em tempo real: Cartesia Sonic, websockets de streaming nativos, 40 a 90 ms declarados de tempo até ao primeiro áudio.
- Mais baratas e em alojamento próprio: Google Cloud e Amazon Polly a $4 por 1M de caracteres; a OmniVoice é $0 em alojamento próprio.
As 9 Melhores APIs de TTS Num Relance
Aqui estão todas as APIs lado a lado, classificadas para um programador que integre text-to-speech numa aplicação ou agente de voz. Os valores por minuto são a nossa estimativa, não um número do fornecedor (os cálculos estão abaixo da tabela).
| API | Preços ($/1M carateres) | $/min estimado* | Nível gratuito | Streaming | Clonagem de voz | Autoalojamento | Melhor para |
|---|---|---|---|---|---|---|---|
| ElevenLabs | $50 Flash / $100 Multilingual | ~$0,045 | teste | Sim | Instantânea por ID | Não | Melhor qualidade de voz |
| OpenAI | $15 tts-1 / gpt-4o-mini-tts ~$0,015/min | ~$0,015 | $5 de crédito | Sim | Limitada | Não | Melhor relação qualidade-preço e mais simples |
| Cartesia | ~$39 (Sonic) | ~$0,035 | ~27 min/mês | Sim (websocket) | Instantânea (Pro) | Não | Agentes de baixa latência |
| Deepgram | $15 Aura-1 / $30 Aura-2 | ~$0,014-0,027 | $200 de crédito | Sim | Não (predefinida) | Sim (empresarial) | STT e TTS, um só fornecedor |
| Google Cloud | $4 Std/WaveNet / $16 Neural2 | ~$0,004-0,014 | 4M carateres/mês (Std) | Sim | Não | Não | Multilingue com nível gratuito |
| Amazon Polly | $4 Std / $16 Neural | ~$0,004-0,014 | 5M/1M carateres/mês | Sim | Não | Não | Económico, fiável em escala |
| Azure AI Speech | $16 Neural / $22 Neural HD | ~$0,014-0,020 | 500K carateres/mês | Sim | Voz Neural Personalizada | Sim (contentores isolados) | Conformidade / on-prem |
| PlayHT | subscrição ~$39-99/mês (est.) | ~$0,07 (est.) | teste | Sim | Instantânea (3-10s) | Não | Grande biblioteca multilingue |
| OmniVoice | $0 (Apache-2.0) | Apenas custo de GPU | ilimitado (execução própria) | Não (em lote) | Zero-shot ~3s | Sim (totalmente local) | Autoalojamento / idiomas raros |
*O valor por minuto é a nossa estimativa: o preço por 1M de carateres multiplicado por ~900 carateres/min (cerca de 150 ppm). Não é um número do fornecedor.
Como Classificámos Estas Opções (e Porque Não Vendemos Nenhuma API de TTS)?
Ponderámos cinco fatores: qualidade da voz, latência e suporte de streaming, custo (por caractere e por minuto), abrangência do SDK e opções de alojamento próprio. Construímos agentes de voz em produção com várias destas soluções, pelo que a ordem reflete adequação, não favoritismo. Ninguém pagou por um lugar.
Essa neutralidade é precisamente o ponto. Todas as listas de "melhor API de TTS" que vai encontrar são escritas por um fornecedor de TTS que coloca o seu próprio produto em primeiro lugar. Nós vendemos agentes, não síntese, por isso não temos nada a promover aqui. Quando uma ferramenta perde em preço, latência ou clonagem, dizemo-lo na respetiva linha "Evite-a se". Sem espantalhos, sem favoritos.
1. ElevenLabs: Melhor Qualidade de Voz Global
A ElevenLabs disponibiliza as vozes sintéticas mais naturais que pode adquirir através de uma API atualmente, com uma vasta biblioteca de vozes e clonagem instantânea por ID de voz. O seu modelo Flash v2.5 é a opção em tempo real.
De acordo com a página de preços da API da ElevenLabs (à data de julho de 2026), o Flash e o Turbo custam $50 por 1M de caracteres e o Multilingual v2/v3 custa $100 por 1M, o que equivale aproximadamente a $0,045 a $0,09 por minuto, segundo os nossos cálculos. A ElevenLabs afirma uma latência de cerca de 75 ms no Flash. O streaming funciona através de REST e websocket. A clonagem é instantânea a partir de qualquer ID de voz.
Está a construir um agente telefónico completo? Veja como se compara com plataformas de agentes de voz como a Vapi e a Synthflow.
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb?output_format=mp3_44100_128" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Your table for two is confirmed for 8pm.", "model_id": "eleven_flash_v2_5"}' \
--output speech.mp3Escolha esta opção se a qualidade de voz for inegociável e o orçamento não for a sua principal limitação. Evite-a se o custo por caractere for o obstáculo, porque é a opção mais cara aqui.
2. OpenAI TTS: Melhor relação qualidade-preço e integração mais simples
OpenAI TTS é o caminho de menor resistência se já utiliza a API da OpenAI. O modelo gpt-4o-mini-tts acrescenta capacidade de orientação, ou seja, indica como uma frase deve soar ("diz isto como um professor caloroso e paciente"), e não apenas o que ela diz.
De acordo com a documentação de preços da OpenAI (em julho de 2026), o tts-1 custa $15 por 1M de caracteres, o tts-1-hd custa $30 por 1M, e o gpt-4o-mini-tts cobra $0,60 por 1M de tokens de texto mais $12 por 1M de tokens de áudio, o que fica perto de $0,015 por minuto de áudio. O streaming é suportado. A clonagem é limitada.
Está a construir um agente telefónico em tempo real? Combine-o com a API Realtime da OpenAI para agentes de voz.
from openai import OpenAI
client = OpenAI() # reads OPENAI_API_KEY from env
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="alloy",
input="Say it like a warm, patient teacher.",
) as response:
response.stream_to_file("speech.mp3")Escolha esta opção se quer áudio barato e suficientemente bom dentro de uma stack que já utiliza. Evite-a se precisa de muitas vozes distintas ou de clonagem de voz real.
3. Cartesia (Sonic): O melhor para agentes em tempo real com latência ultrabaixa
O Sonic da Cartesia foi concebido para a conversação. Inclui websockets de streaming nativos e o menor tempo até ao primeiro áudio que medimos numa API alojada.
De acordo com a página de preços da Cartesia (em julho de 2026), o plano Startup custa cerca de 39 $ por 1 milhão de caracteres (~0,035 $/min), com aproximadamente 20.000 créditos gratuitos por mês (cerca de 27 minutos de áudio). A Cartesia afirma que o Sonic-3 atinge um tempo até ao primeiro áudio de 40 a 90 ms. A API de streaming é nativa em websocket e a clonagem é instantânea nos planos Pro. Eis o padrão que os agentes realmente usam, transmitindo blocos PCM em streaming diretamente para o interlocutor:
from cartesia import Cartesia
import os
client = Cartesia(api_key=os.environ["CARTESIA_API_KEY"])
ws = client.tts.websocket()
for chunk in ws.send(
model_id="sonic-3",
transcript="Booking confirmed. See you at eight.",
voice={"id": "a0e99841-438c-4a64-b679-ae501e7d6091"},
output_format={"container": "raw", "encoding": "pcm_f32le", "sample_rate": 44100},
stream=True,
):
play(chunk.audio) # push audio to the caller as it arrivesEscolhe esta opção se estás a criar agentes de voz conversacionais com resposta inferior a um segundo. Ignora-a se não precisas de tempo real e queres um catálogo de vozes mais vasto.
4. Deepgram (Aura-2): O Melhor STT + TTS de Fornecedor Único
O Deepgram é o único fornecedor que faz bem as duas partes de um voice bot: a escuta (speech-to-text) e a fala (TTS). O Aura-2 é faturado por caracteres e otimizado para latência conversacional.
Segundo a página de preços do Deepgram (à data de julho de 2026), o Aura-1 custa 15 $ por 1M de caracteres e o Aura-2 custa 30 $ por 1M (~0,014 $ a 0,027 $/min), com um crédito de 200 $ no registo e self-hosting nos planos enterprise. O Deepgram reporta menos de 250 ms para IA conversacional. O streaming é suportado; a clonagem não, pelo que fica limitado às vozes predefinidas.
Escolha esta opção se quer um único fornecedor para todo o ciclo de escuta e fala. Evite-a se precisar de clonagem de voz.
5. Google Cloud Text-to-Speech: A Maior Amplitude Multilingue e um Nível Gratuito Generoso
O Google Cloud Text-to-Speech cobre mais de 380 vozes em mais de 50 idiomas, e o seu nível gratuito é o mais generoso para prototipagem.
De acordo com a página de preços do Google Cloud (em julho de 2026), os modelos Standard e WaveNet custam 4 $ por 1 milhão de caracteres, o Neural2 custa 16 $ por 1 milhão, o Chirp 3 HD custa 30 $ por 1 milhão e o Studio custa 160 $ por 1 milhão. O nível gratuito oferece 4 milhões de caracteres Standard por mês, mas apenas 1 milhão por mês para cada um dos modelos WaveNet, Neural2 e Chirp 3 HD, por isso verifique que tipo de voz está efetivamente a usar. O streaming é suportado; não há clonagem (a voz personalizada é um produto separado).
Escolha esta opção se precisa de muitos idiomas a baixo custo e já trabalha na GCP. Evite-a se quer qualidade expressiva de topo sem pagar os 160 $ por 1 milhão do Studio.
6. Amazon Polly: O Melhor em Ser Fiável, Barato e Sem Surpresas
O Amazon Polly é o cavalo de batalha de confiança: previsível, económico e profundamente integrado na AWS. É ideal para IVR e mensagens transacionais em que não precisa de dramatismo — precisa de disponibilidade.
Segundo a página de preços do Polly da AWS (à data de julho de 2026), o Standard custa 4 USD por 1M de caracteres, o Neural 16 USD por 1M, o Generative 30 USD por 1M e o Long-Form 100 USD por 1M (~0,004 a 0,09 USD/min). O nível gratuito cobre 5M de caracteres Standard e 1M Neural por mês durante os primeiros 12 meses. O streaming é suportado; não existe clonagem de voz.
Escolha esta opção se estiver na AWS e quiser TTS previsível em volume. Evite-a se quiser vozes expressivas e clonáveis.
7. Azure AI Speech: O melhor para conformidade e on-prem
O fator diferenciador do Azure AI Speech não são as vozes, mas sim onde as pode executar: Neural padrão, Custom Neural Voice e contentores desligados (air-gapped) para dados que, por lei, não podem sair da sua rede.
De acordo com a página de preços do Speech da Azure (em julho de 2026), o Neural padrão custa 16 $ por 1M de caracteres e o Neural HD custa 22 $ por 1M (reduzido de 30 $ em março de 2026). O escalão gratuito F0 cobre 500K caracteres por mês e nunca expira. Os contentores desligados air-gapped custam cerca de 47 424 $ por ano para 4,8B de caracteres (requer inscrição), que é o número que interessará à sua equipa de conformidade. O streaming é suportado; a clonagem é o Custom Neural Voice.
Escolha esta opção se precisar de síntese on-prem ou air-gapped, ou se for uma empresa Microsoft. Evite-a se não estiver no Azure e não precisar de controlos de conformidade.
8. PlayHT: A Melhor Grande Biblioteca de Vozes Multilingue
O atrativo da PlayHT é a amplitude: mais de 900 vozes, 142 idiomas, latência Turbo inferior a 300 ms e clonagem instantânea a partir de uma amostra de 3 a 10 segundos.
Eis a ressalva honesta sobre os preços. De acordo com a página de preços da PlayHT (à data de julho de 2026), os planos variam aproximadamente entre 39 $/mês (Professional) e 99 $/mês (Premium/ilimitado), e o acesso à API está disponível nos planos superiores e empresariais. Não é publicada uma tarifa API clara por caractere, pelo que qualquer valor por minuto (estimamos cerca de 0,07 $) deve ser tratado exatamente como isso: uma estimativa. O streaming é suportado; a clonagem é instantânea a partir de um curto excerto.
Escolhe-a se queres variedade de vozes para um produto conversacional e a ElevenLabs é demasiado cara. Evita-a se preferes uma faturação transparente por caractere, com pagamento por utilização.
9. OmniVoice: A Melhor Opção Quando os Dados Não Podem Sair dos Seus Servidores
OmniVoice (da equipa k2-fsa) é Apache-2.0, 0 $ por caráter, 646 idiomas e clonagem zero-shot a partir de um clipe de cerca de 3 segundos, funcionando totalmente em local. Submetemo-lo a um teste prático no nosso próprio hardware.
Não existe qualquer faturação por caráter. Paga pela GPU e pela eletricidade, nada mais. A contrapartida: o OmniVoice é síntese em lote (fator de tempo real em torno de 0,03), não streaming abaixo de 300 ms, pelo que não é adequado para conversação em direto. A clonagem é zero-shot a partir de alguns segundos de áudio de referência. Para detalhes de configuração e notas sobre a qualidade, leia a nossa análise prática ao OmniVoice.
Escolha esta opção se precisa de on-prem, HIPAA, idiomas raros, ou se detesta a faturação por caráter em volumes muito elevados. Evite-a se precisa de latência conversacional em tempo real.
Quanto custa realmente uma API de TTS por minuto?
Uma API de texto para fala custa aproximadamente $0,004 a $0,09 por minuto de áudio sintetizado em 2026. As mais económicas são a Google Cloud e a Amazon Polly Standard, a cerca de $0,004/min; a gpt-4o-mini-tts da OpenAI situa-se perto de $0,015/min; as vozes de topo da ElevenLabs atingem $0,09/min. A OmniVoice auto-hospedada custa $0 por caractere.
Todos os valores por minuto apresentados aqui são cálculos nossos, e não números dos fornecedores. Convertemos o preço por 1 milhão de caracteres em custo por minuto, assumindo cerca de 900 caracteres por minuto (cerca de 150 palavras por minuto de fala natural). Esta simples conversão muda a forma de orçamentar: os criadores de agentes de voz não orçamentam em dólares por milhão de caracteres, orçamentam em dólares por minuto de tempo de conversação. Eis a conversão que ninguém publica.
"Estimated TTS cost per minute of audio (USD, ~900 chars/min)"
Tabela de dados
| "Provider (representative model)" | "USD per minute" |
|---|---|
| "Google Cloud (WaveNet)" | 0.004 |
| "Amazon Polly (Standard)" | 0.004 |
| "Azure (Neural)" | 0.014 |
| "OpenAI (gpt-4o-mini-tts)" | 0.015 |
| "Deepgram (Aura-2)" | 0.027 |
| "Cartesia (Sonic)" | 0.035 |
| "ElevenLabs (Flash)" | 0.045 |
| "PlayHT (Turbo, est)" | 0.07 |
| "OmniVoice (self-host)" | 0 |
Os valores por minuto são estimativas nossas (preço por 1 milhão de caracteres vezes cerca de 900 caracteres/min). O PlayHT funciona por subscrição, pelo que o seu valor é uma estimativa; a OmniVoice custa $0 por caractere (paga-se apenas a GPU e a eletricidade). Ainda assim, o TTS é apenas uma rubrica. Para uma visão completa, consulte a nossa análise de custos de agentes de voz full-stack.
O Que Aprendemos ao Integrar TTS em Agentes de Voz em Produção
A latência anunciada não é a latência medida. Num agente de voz para reservas de restaurantes que lançámos em 2026, os 75ms anunciados do ElevenLabs Flash eram reais em isolamento, mas no nosso pipeline, assim que a geração de tokens do LLM, os saltos de rede e o buffering de áudio se acumulavam, o primeiro áudio que o interlocutor ouvia ficava mais perto dos 300 a 400ms. Essa diferença é o que separa uma resposta natural de uma pausa constrangedora.
O benchmark independente da Coval confirma isto. Mediu o Cartesia Sonic-3 com cerca de 188ms de P50 de tempo até ao primeiro áudio (IQR de 100ms), o ElevenLabs Turbo v2.5 perto dos 264ms e o Flash v2.5 perto dos 288ms, todos superiores aos números anunciados pelos fornecedores. É por isso que, por defeito, usamos APIs websocket em streaming (Cartesia, Deepgram) em vez de REST em batch para tudo o que seja conversacional. Atenção também à métrica: os primeiros bytes que uma API de streaming devolve são metadados de container e de header, não áudio reproduzível. O tempo até ao primeiro byte favorece o fornecedor; o tempo até ao primeiro áudio é o que o interlocutor realmente ouve.
A surpresa de custos que não tínhamos previsto: numa linha de alto volume a correr o ElevenLabs Multilingual v3 (~$0,09/min), um agente a falar 40% de uma chamada de seis minutos sintetiza cerca de 2,4 minutos de áudio, aproximadamente $0,22 por chamada. Com 1.500 chamadas por dia, isso fica perto de $9.700 por mês só em TTS. Mudar essa linha para o gpt-4o-mini-tts ($0,015/min) reduziu para menos de $1.700. E uma armadilha que nos apanhou: o modelo pronunciava mal o nome do restaurante de um cliente até adicionarmos um alias de fonema, por isso, reservem tempo para um dicionário de pronúncia antes do lançamento.
É possível fazer self-host ou usar TTS open-source?
Sim, e em 2026 é uma opção real, não um projeto de ciência. Fazer self-host significa executar o modelo nas suas próprias GPUs, para que o áudio nunca passe por uma API de terceiros. As principais escolhas open-source são OmniVoice (646 idiomas, clonagem zero-shot), Piper (rápido, leve, excelente num Raspberry Pi), Kokoro (pequeno e de alta qualidade) e o mais antigo TTS Coqui.
Também existem opções de self-host gerido. Os contentores isolados (air-gapped) da Azure e as soluções on-prem empresariais da Deepgram permitem executar vozes de nível comercial dentro da sua própria rede, sem uma implementação open-source em bruto.
O self-host compensa quando os dados não podem legalmente sair dos seus servidores (HIPAA, air-gapped), quando precisa de idiomas raros ou com poucos recursos, ou quando a faturação por caractere se torna brutal em volumes muito elevados. Não compensa quando precisa de latência conversacional em tempo real ou quando é uma equipa pequena sem capacidade de operações de GPU. Nesses casos, uma API de streaming é a resposta mais barata, depois de contabilizar o tempo de engenharia.
Como Escolher a API de TTS Certa?
Escolha com base na sua principal restrição, não numa lista de funcionalidades. Eis a árvore de decisão rápida que usamos com os clientes:
- A criar um agente de voz em tempo real? Cartesia ou Deepgram (websockets em streaming, a menor latência medida).
- A qualidade de voz é inegociável? ElevenLabs.
- Barato e multilingue? Google Cloud ou Amazon Polly.
- On-prem ou air-gapped? Contentores desligados do Azure ou OmniVoice.
- Já está profundamente integrado num ecossistema? OpenAI, AWS Polly ou Google Cloud, aquele que corresponder à sua stack existente.
- Precisa da maior biblioteca de vozes? PlayHT.
Comece pela restrição que mataria o projeto se fosse mal resolvida. Otimize o resto depois.
Como a Techsy Aborda Isto
Construímos agentes de voz, não vendemos uma API de TTS, o que é exatamente a razão pela qual podemos ser neutros aqui. Na prática, escolhemos um TTS diferente para cada cliente com base no seu orçamento de latência, teto de custos e regras de conformidade, e depois integramo-lo no agente completo: speech-to-text, o LLM, telefonia e a cola de streaming pelo meio. Uma linha de reservas de restaurante e uma linha de clínica sujeita à HIPAA raramente usam o mesmo motor de síntese.
Se está a ponderar construir versus comprar, construímos agentes de voz de produção de ponta a ponta e podemos dizer-lhe qual o TTS que realmente se adequa ao seu volume de chamadas.
Sobre o Autor
Mert Batur Gurbuz é Cofundador da Techsy.io — Universidade de Birmingham. Ligue-se no LinkedIn.
Mert Batur Gurbuz é Cofundador da Techsy.io, onde a equipa entrega agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas de LLM que a equipa da Techsy realmente usa em produção.
Perguntas Frequentes
Qual é a melhor API de conversão de texto em fala para programadores?
Depende da sua maior limitação. Para a melhor qualidade de voz, escolha a ElevenLabs. Para a menor latência em tempo real, a Cartesia. Para áudio multilingue económico, o Google Cloud ou o Amazon Polly. Para dados em instalações locais ou isolados da rede, os contentores desconectados do Azure ou o OmniVoice autoalojado. Não existe um vencedor universal.
Qual é a API de TTS com menor latência para agentes de voz em tempo real?
A Cartesia reivindica um tempo até ao primeiro áudio de 40 a 90 ms, o ElevenLabs Flash afirma cerca de 75 ms, e a Deepgram cita valores inferiores a 250 ms. Mas reivindicado não é o mesmo que medido: o benchmark independente da Coval situou o Cartesia Sonic-3 perto de 188 ms P50 e o ElevenLabs Flash perto de 288 ms em condições reais. Para agentes, privilegie as APIs de streaming via websocket.
Quanto custa uma API de conversão de texto em fala por minuto de áudio?
Aproximadamente 0,004 a 0,09 dólares por minuto em 2026. O Google e o Polly Standard situam-se perto de 0,004 dólares/min, o OpenAI gpt-4o-mini-tts perto de 0,015 dólares/min, e as vozes premium da ElevenLabs atingem 0,09 dólares/min. Estas são as nossas estimativas a cerca de 900 caracteres por minuto; o OmniVoice auto-hospedado custa 0 dólares por caractere.
Existe uma API de conversão de texto em fala gratuita? Qual é o melhor nível gratuito?
Sim. A Google Cloud oferece 4 milhões de caracteres Standard por mês (1 milhão em cada tipo de voz superior), o Amazon Polly disponibiliza 5 milhões de caracteres Standard e 1 milhão de caracteres Neural durante 12 meses, o Azure F0 cobre 500 mil por mês para sempre, e o Cartesia inclui cerca de 27 minutos mensais. A OpenAI e o Deepgram oferecem créditos de registo em vez disso.
Qual é a API de conversão de texto em fala mais barata?
Para uma API alojada, o gpt-4o-mini-tts da OpenAI, a ~0,015 $ por minuto, é a opção de qualidade mais acessível, enquanto o Google Cloud e o Amazon Polly Standard custam 4 $ por 1 milhão de caracteres (~0,004 $/min). Se puder usar uma GPU, o OmniVoice autoalojado custa 0 $ por caractere — apenas o custo de processamento e eletricidade.
Posso alojar por conta própria um modelo de conversão de texto em voz em vez de usar uma API?
Sim. O OmniVoice, o Piper, o Kokoro e o Coqui são de código aberto e funcionam inteiramente em local. Para soluções on-prem geridas, o Azure disponibiliza contentores desligados (air-gapped) e a Deepgram oferece autoalojamento empresarial. O autoalojamento compensa em casos de HIPAA, dados air-gapped, idiomas raros ou volumes muito elevados em que a faturação por caráter se torna penalizadora.
Que APIs de TTS suportam streaming ou websockets?
A Cartesia, a Deepgram, a OpenAI, a ElevenLabs e a PlayHT suportam todas streaming, sendo a Cartesia e a Deepgram nativas em websocket e as mais adequadas para conversação em tempo real. A OmniVoice funciona apenas em batch, pelo que sintetiza um clip completo antes de devolver o áudio, não sendo adequada para agentes de voz em tempo real.
A OpenAI ou a ElevenLabs tem a melhor API de TTS?
São trabalhos diferentes. A OpenAI ganha no preço e na capacidade de orientação (indicar como uma frase deve soar) e já faz parte do teu stack. A ElevenLabs ganha na qualidade bruta da voz, numa biblioteca maior e na clonagem instantânea. Para agentes completos, compara ambas com as opções de orquestração na nossa análise de plataformas de agentes de voz.
Como clono uma voz através de uma API de TTS e qual a duração de clip necessária?
A duração do clip varia. O ElevenLabs clona instantaneamente a partir de qualquer ID de voz, o Cartesia e o OmniVoice precisam de uma amostra de cerca de 3 segundos e o PlayHT requer de 3 a 10 segundos. O Amazon Polly, o Deepgram e o Google Cloud utilizam apenas vozes predefinidas (a Custom Neural Voice da Azure requer um processo de registo formal).
Qual é a diferença entre preços por caráter e por token/por minuto?
A maioria das APIs de TTS fatura por caráter do texto de entrada, o que é fácil de prever. O gpt-4o-mini-tts da OpenAI, em vez disso, fatura por token de áudio de saída, pelo que o custo acompanha a duração da fala gerada, e não a do texto de origem. Para agentes de voz, converta ambos para dólares por minuto de tempo de conversa para uma comparação justa.
Fontes
- Preços da API da ElevenLabs: https://elevenlabs.io/pricing/api (consultado em 14-07-2026)
- Preços da Cartesia: https://cartesia.ai/pricing (consultado em 14-07-2026)
- Preços da Deepgram: https://deepgram.com/pricing (consultado em 14-07-2026)
- Preços do Amazon Polly: https://aws.amazon.com/polly/pricing/ (consultado em 14-07-2026)
- Preços da API da OpenAI: https://developers.openai.com/api/docs/pricing (consultado em 14-07-2026)
- Preços do Google Cloud Text-to-Speech: https://cloud.google.com/text-to-speech/pricing (consultado em 14-07-2026)
- Preços do Azure AI Speech: https://azure.microsoft.com/en-us/pricing/details/speech/ (consultado em 14-07-2026)
- OmniVoice (k2-fsa): https://github.com/k2-fsa/OmniVoice (consultado em 14-07-2026)
- Benchmark independente de TTS da Coval: https://www.coval.ai/blog/best-text-to-speech-providers-in-2026-how-to-choose-(and-why-vendor-benchmarks-lie)/ (consultado em 14-07-2026)
- MarkTechPost, comparação de TTS baseada em benchmarks: https://www.marktechpost.com/2026/05/30/best-text-to-speech-tts-models-in-2026-a-benchmark-based-comparison/ (consultado em 14-07-2026)