
9 Mejores APIs de Texto a Voz para Desarrolladores (2026): Latencia y Coste por Minuto Reales Comparados
La mejor API de texto a voz para desarrolladores no es la que tiene el demo más vistoso. Es la que cumple tu presupuesto de latencia sin destrozar tu factura. Lo sabemos porque construimos agentes de voz sobre estas APIs. El trimestre pasado, Cartesia anunció que Sonic-3 tenía un time-to-first-audio de 40 a 90ms, pero el benchmark independiente de Coval midió un P50 real de unos 188ms. Los precios van de $4 a $100 por 1M de caracteres. Las cifras de latencia de los proveedores casi nunca sobreviven a una llamada telefónica real. Así que aquí tienes un ranking honesto de 9 APIs de texto a voz, con los números que los proveedores omiten en sus propias listas.
No vendemos ninguna API de TTS. Construimos agentes de voz sobre estas, así que no tenemos ningún producto que promocionar en este ranking. Y para dejar claro el alcance: esto trata sobre la API de síntesis de texto a voz, la capa que convierte texto en audio, no sobre plataformas completas de agentes de voz ni herramientas de vídeo para creadores. ¿Eres nuevo en esto? Empieza por qué es realmente un agente de voz con IA.
Respuesta Rápida: Las Mejores APIs de TTS de un Vistazo
- Mejor calidad de voz general: ElevenLabs (Flash ~75ms según el proveedor), la opción más cara aquí, de $50 a $100 por 1M de caracteres.
- Mejor relación calidad-precio e integración más simple: OpenAI gpt-4o-mini-tts, unos $0.015 por minuto de audio.
- Menor latencia para agentes en tiempo real: Cartesia Sonic, websockets de streaming nativo, time-to-first-audio de 40 a 90ms según el proveedor.
- Más barata y autoalojable: Google Cloud y Amazon Polly a $4 por 1M de caracteres; OmniVoice es $0 en modo autoalojado.
Las 9 Mejores APIs de TTS de un Vistazo
Aquí tienes todas las APIs una junto a otra, ordenadas para un desarrollador que va a integrar texto a voz en una app o un agente de voz. Las cifras por minuto son nuestra estimación, no un dato del proveedor (el cálculo está debajo de la tabla).
| API | Precio ($/1M car.) | Est. $/min* | Nivel gratuito | Streaming | Clonación de voz | Autoalojado | Ideal para |
|---|---|---|---|---|---|---|---|
| ElevenLabs | $50 Flash / $100 Multilingual | ~$0.045 | trial | Yes | Instant by ID | No | Mejor calidad de voz |
| OpenAI | $15 tts-1 / gpt-4o-mini-tts ~$0.015/min | ~$0.015 | $5 credit | Yes | Limited | No | Relación calidad-precio y simplicidad |
| Cartesia | ~$39 (Sonic) | ~$0.035 | ~27 min/mo | Yes (websocket) | Instant (Pro) | No | Agentes de baja latencia |
| Deepgram | $15 Aura-1 / $30 Aura-2 | ~$0.014-0.027 | $200 credit | Yes | No (preset) | Yes (enterprise) | STT más TTS, un solo proveedor |
| Google Cloud | $4 Std/WaveNet / $16 Neural2 | ~$0.004-0.014 | 4M chars/mo (Std) | Yes | No | No | Multilingüe y nivel gratuito |
| Amazon Polly | $4 Std / $16 Neural | ~$0.004-0.014 | 5M/1M chars/mo | Yes | No | No | Barata y fiable a escala |
| Azure AI Speech | $16 Neural / $22 Neural HD | ~$0.014-0.020 | 500K chars/mo | Yes | Custom Neural Voice | Yes (air-gapped containers) | Cumplimiento normativo / on-prem |
| PlayHT | subscription ~$39-99/mo (est) | ~$0.07 (est) | trial | Yes | Instant (3-10s) | No | Gran biblioteca multilingüe |
| OmniVoice | $0 (Apache-2.0) | GPU cost only | unlimited (self-run) | No (batch) | Zero-shot ~3s | Yes (fully local) | Autoalojamiento / idiomas raros |
*El coste por minuto es nuestra estimación: precio por 1M de caracteres multiplicado por ~900 car./min (unas 150 palabras por minuto). No es un dato del proveedor.
¿Cómo Hicimos Este Ranking (y Por Qué No Vendemos Ninguna API de TTS)?
Valoramos cinco factores: calidad de voz, latencia y soporte de streaming, coste (por carácter y por minuto), superficie del SDK y opciones de autoalojamiento. Construimos agentes de voz en producción sobre varias de estas APIs, así que el orden refleja el ajuste real, no favoritismo. Nadie pagó por un puesto.
Esa neutralidad es la clave. Casi todos los listados de "mejores APIs de TTS" que vas a encontrar están escritos por un proveedor de TTS que se coloca a sí mismo primero. Nosotros vendemos agentes, no síntesis de voz, así que aquí no tenemos nada que promocionar. Cuando una herramienta pierde en precio, latencia o clonación, lo decimos en su línea "Evítala si". Sin rivales de pega, sin favoritismos.
1. ElevenLabs: La Mejor Calidad de Voz General
ElevenLabs genera las voces sintéticas más naturales que puedes comprar a través de una API ahora mismo, con una biblioteca de voces enorme y clonación instantánea por ID de voz. Su modelo Flash v2.5 es la opción para tiempo real.
Según la página de precios de la API de ElevenLabs (a julio de 2026), Flash y Turbo cuestan $50 por 1M de caracteres y Multilingual v2/v3 cuesta $100 por 1M, unos $0.045 a $0.09 por minuto según nuestros cálculos. ElevenLabs afirma una latencia de unos 75ms en Flash. El streaming funciona por REST y por websocket. La clonación es instantánea desde cualquier ID de voz.
¿Vas a construir un agente telefónico completo? Mira cómo se compara con plataformas de agentes de voz como Vapi y Synthflow.
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb?output_format=mp3_44100_128" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Your table for two is confirmed for 8pm.", "model_id": "eleven_flash_v2_5"}' \
--output speech.mp3Elígela si la calidad de voz es innegociable y el presupuesto no es tu primera limitación. Evítala si el coste por carácter es el problema, porque es la opción más cara de esta lista.
2. OpenAI TTS: La Mejor Relación Calidad-Precio y la Integración Más Simple
OpenAI TTS es el camino de menor resistencia si ya llamas a la API de OpenAI. El modelo gpt-4o-mini-tts añade "steerability": puedes indicarle en el prompt cómo debe sonar una frase ("dilo como una profesora cálida y paciente"), no solo qué debe decir.
Según la documentación de precios de OpenAI (a julio de 2026), tts-1 cuesta $15 por 1M de caracteres, tts-1-hd cuesta $30 por 1M, y gpt-4o-mini-tts cobra $0.60 por 1M de tokens de texto más $12 por 1M de tokens de audio, lo que se acerca a $0.015 por minuto de audio. El streaming está soportado. La clonación es limitada.
¿Vas a construir un agente telefónico en tiempo real? Combínalo con la API Realtime de OpenAI para agentes de voz.
from openai import OpenAI
client = OpenAI() # reads OPENAI_API_KEY from env
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="alloy",
input="Say it like a warm, patient teacher.",
) as response:
response.stream_to_file("speech.mp3")Elígela si quieres audio barato y suficientemente bueno dentro de un stack que ya usas. Evítala si necesitas muchas voces distintas o clonación de voz real.
3. Cartesia (Sonic): La Mejor para Agentes en Tiempo Real de Latencia Ultrabaja
Sonic de Cartesia está diseñado para la conversación. Incluye websockets de streaming nativo y el time-to-first-audio más bajo que hemos medido en una API alojada.
Según la página de precios de Cartesia (a julio de 2026), el plan Startup cuesta unos $39 por 1M de caracteres (~$0.035/min), con unos 20,000 créditos gratis al mes (unos 27 minutos de audio). Cartesia afirma un time-to-first-audio de 40 a 90ms en Sonic-3. La API de streaming es nativa de websocket, y la clonación es instantánea en los planes Pro. Así es el patrón que realmente usan los agentes, enviando fragmentos PCM en streaming directamente a quien llama:
from cartesia import Cartesia
import os
client = Cartesia(api_key=os.environ["CARTESIA_API_KEY"])
ws = client.tts.websocket()
for chunk in ws.send(
model_id="sonic-3",
transcript="Booking confirmed. See you at eight.",
voice={"id": "a0e99841-438c-4a64-b679-ae501e7d6091"},
output_format={"container": "raw", "encoding": "pcm_f32le", "sample_rate": 44100},
stream=True,
):
play(chunk.audio) # push audio to the caller as it arrivesElígela si estás construyendo agentes de voz conversacionales de menos de un segundo. Evítala si no necesitas tiempo real y quieres un catálogo de voces más grande.
4. Deepgram (Aura-2): El Mejor Proveedor Único para STT + TTS
Deepgram es el único proveedor que hace bien las dos mitades de un bot de voz: la escucha (speech-to-text) y el habla (TTS). Aura-2 se factura por carácter y está ajustado para latencia conversacional.
Según la página de precios de Deepgram (a julio de 2026), Aura-1 cuesta $15 por 1M de caracteres y Aura-2 cuesta $30 por 1M (~$0.014 a $0.027/min), con un crédito de registro de $200 y autoalojamiento en los planes enterprise. Deepgram cita menos de 250ms para IA conversacional. El streaming está soportado; la clonación no, así que estás limitado a voces preestablecidas.
Elígela si quieres un solo proveedor para todo el ciclo de escuchar y hablar. Evítala si necesitas clonación de voz.
5. Google Cloud Text-to-Speech: La Mayor Amplitud Multilingüe y el Nivel Gratuito Más Generoso
Google Cloud Text-to-Speech cubre más de 380 voces en más de 50 idiomas, y su nivel gratuito es el más generoso para prototipar.
Según la página de precios de Google Cloud (a julio de 2026), Standard y WaveNet cuestan $4 por 1M de caracteres, Neural2 cuesta $16 por 1M, Chirp 3 HD cuesta $30 por 1M, y Studio cuesta $160 por 1M. El nivel gratuito te da 4M de caracteres Standard al mes, pero solo 1M al mes cada uno en WaveNet, Neural2 y Chirp 3 HD, así que revisa en qué tipo de voz estás realmente. El streaming está soportado; no hay clonación (la voz personalizada es un producto aparte).
Elígela si necesitas muchos idiomas a bajo coste y vives en GCP. Evítala si quieres una calidad expresiva de primer nivel sin pagar los $160 por 1M de Studio.
6. Amazon Polly: La Más Aburrida, Fiable y Barata a Escala
Amazon Polly es el caballo de batalla fiable: predecible, barata y profundamente integrada en AWS. Es ideal para IVR y mensajes transaccionales donde no necesitas dramatismo, necesitas disponibilidad.
Según la página de precios de Polly de AWS (a julio de 2026), Standard cuesta $4 por 1M de caracteres, Neural cuesta $16 por 1M, Generative cuesta $30 por 1M, y Long-Form cuesta $100 por 1M (~$0.004 a $0.09/min). El nivel gratuito cubre 5M de caracteres Standard y 1M de caracteres Neural al mes durante tus primeros 12 meses. El streaming está soportado; no hay clonación.
Elígela si estás en AWS y quieres TTS predecible a gran volumen. Evítala si quieres voces expresivas y clonables.
7. Azure AI Speech: La Mejor para Cumplimiento Normativo y On-Prem
El diferenciador de Azure AI Speech no son las voces, es dónde puedes ejecutarlas: Neural estándar, Custom Neural Voice y contenedores desconectados (air-gapped) para datos que legalmente no pueden salir de tu red.
Según la página de precios de Speech de Azure (a julio de 2026), Neural estándar cuesta $16 por 1M de caracteres y Neural HD cuesta $22 por 1M (rebajado desde $30 en marzo de 2026). El nivel gratuito F0 cubre 500K caracteres al mes y nunca caduca. Los contenedores desconectados air-gapped cuestan alrededor de $47,424 al año por 4.8B de caracteres (requiere registro), que es el número que le interesará a tu equipo de cumplimiento. El streaming está soportado; la clonación es mediante Custom Neural Voice.
Elígela si necesitas síntesis on-prem o air-gapped, o si tu empresa ya trabaja con Microsoft. Evítala si no estás en Azure y no necesitas controles de cumplimiento.
8. PlayHT: La Mejor Biblioteca de Voces Multilingüe
El atractivo de PlayHT es la amplitud: más de 900 voces, 142 idiomas, latencia Turbo de menos de 300ms y clonación instantánea a partir de una muestra de 3 a 10 segundos.
Aquí va la advertencia honesta sobre el precio. Según la página de precios de PlayHT (a julio de 2026), los planes cuestan aproximadamente de $39/mes (Professional) a $99/mes (Premium/ilimitado), y el acceso a la API está en los niveles superiores y enterprise. No hay publicada una tarifa clara por carácter para la API, así que trata cualquier cifra por minuto (nosotros estimamos unos $0.07) exactamente como eso, una estimación. El streaming está soportado; la clonación es instantánea a partir de un clip corto.
Elígela si quieres amplitud de voces para un producto conversacional y ElevenLabs te resulta demasiado cara. Evítala si quieres una facturación por carácter transparente y de pago por uso.
9. OmniVoice: La Mejor Cuando los Datos No Pueden Salir de Tus Servidores
OmniVoice (del equipo k2-fsa) es Apache-2.0, $0 por carácter, 646 idiomas y clonación zero-shot a partir de un clip de ~3 segundos, ejecutándose completamente en local. La probamos a fondo en nuestro propio hardware.
No hay factura por carácter en absoluto. Pagas la GPU y la electricidad, nada más. La contrapartida: OmniVoice es síntesis por lotes (real-time factor de alrededor de 0.03), no streaming de menos de 300ms, así que no encaja en una conversación en directo. La clonación es zero-shot a partir de unos segundos de audio de referencia. Para detalles de configuración y notas sobre la calidad, lee nuestro análisis práctico de OmniVoice.
Elígela si necesitas on-prem, cumplimiento HIPAA, idiomas raros, o si odias la facturación por carácter a volúmenes muy altos. Evítala si necesitas latencia conversacional en tiempo real.
¿Cuánto Cuesta Realmente una API de TTS por Minuto?
Una API de texto a voz cuesta aproximadamente $0.004 a $0.09 por minuto de audio sintetizado en 2026. Las más baratas son Google Cloud y Amazon Polly Standard, con unos $0.004/min; gpt-4o-mini-tts de OpenAI ronda los $0.015/min; las voces top de ElevenLabs llegan a $0.09/min. OmniVoice autoalojado cuesta $0 por carácter.
Cada cifra por minuto aquí es nuestro cálculo, no un dato del proveedor. Convertimos el precio por 1M de caracteres en coste por minuto asumiendo ~900 caracteres por minuto (unas 150 palabras por minuto de habla natural). Esa única conversión cambia cómo presupuestas: quienes construyen agentes de voz no presupuestan en dólares por millón de caracteres, presupuestan en dólares por minuto de conversación. Aquí está la conversión que nadie publica.
"Coste estimado de TTS por minuto de audio (USD, ~900 car./min)"
Tabla de datos
| "Proveedor (modelo representativo)" | "USD por minuto" |
|---|---|
| "Google Cloud (WaveNet)" | 0.004 |
| "Amazon Polly (Standard)" | 0.004 |
| "Azure (Neural)" | 0.014 |
| "OpenAI (gpt-4o-mini-tts)" | 0.015 |
| "Deepgram (Aura-2)" | 0.027 |
| "Cartesia (Sonic)" | 0.035 |
| "ElevenLabs (Flash)" | 0.045 |
| "PlayHT (Turbo, est)" | 0.07 |
| "OmniVoice (autoalojado)" | 0 |
El coste por minuto es nuestra estimación (precio por 1M de caracteres multiplicado por ~900 car./min). PlayHT funciona por suscripción, así que su cifra es una estimación; OmniVoice cuesta $0 por carácter (solo pagas GPU y electricidad). Pero el TTS es solo una partida más. Para ver el panorama completo, consulta nuestro desglose de costes de un agente de voz completo.
Lo Que Aprendimos al Integrar TTS en Agentes de Voz de Producción
La latencia anunciada no es la latencia medida. En un agente de voz para reservas de restaurante que lanzamos en 2026, los 75ms anunciados de ElevenLabs Flash eran reales de forma aislada, pero en nuestro pipeline, una vez que se sumaban la generación de tokens del LLM, los saltos de red y el buffering de audio, el primer audio que escuchaba quien llamaba llegaba más cerca de los 300 a 400ms. Esa diferencia es lo que separa una respuesta natural de una pausa incómoda.
El benchmark independiente de Coval lo confirma. Midió Cartesia Sonic-3 en unos 188ms de time-to-first-audio P50 (100ms de IQR), ElevenLabs Turbo v2.5 cerca de 264ms, y Flash v2.5 cerca de 288ms, todos por encima de las cifras anunciadas por los proveedores. Por eso usamos por defecto APIs de streaming websocket (Cartesia, Deepgram) en lugar de REST por lotes para cualquier cosa conversacional. Presta atención también a la métrica: los primeros bytes que devuelve una API de streaming son metadatos del contenedor y la cabecera, no audio reproducible. El time-to-first-byte favorece al proveedor; el time-to-first-audio es lo que realmente escucha quien llama.
La sorpresa de coste que no habíamos presupuestado: en una línea de alto volumen con ElevenLabs Multilingual v3 (~$0.09/min), un agente que habla 40% de una llamada de seis minutos sintetiza unos 2.4 minutos de audio, unos $0.22 por llamada. Con 1,500 llamadas al día eso son casi $9,700 al mes solo en TTS. Cambiar esa línea a gpt-4o-mini-tts ($0.015/min) lo redujo a menos de $1,700. Y un problema que nos pilló por sorpresa: el modelo pronunciaba mal el nombre del restaurante de un cliente hasta que añadimos un alias fonético, así que reserva tiempo para un diccionario de pronunciación antes del lanzamiento.
¿Se Puede Autoalojar o Usar TTS de Código Abierto?
Sí, y en 2026 es una opción real, no un proyecto experimental. Autoalojar significa ejecutar el modelo en tus propias GPUs para que el audio nunca pase por una API de terceros. Las opciones de código abierto principales son OmniVoice (646 idiomas, clonación zero-shot), Piper (rápida, ligera, funciona muy bien en una Raspberry Pi), Kokoro (pequeña y de alta calidad) y la más veterana Coqui TTS.
También hay rutas de autoalojamiento gestionadas. Los contenedores desconectados (air-gapped) de Azure y el on-prem enterprise de Deepgram te permiten ejecutar voces de nivel profesional dentro de tu propia red sin un despliegue de código abierto puro.
Autoalojar gana cuando los datos legalmente no pueden salir de tus servidores (HIPAA, air-gapped), cuando necesitas idiomas raros o de pocos recursos, o cuando la facturación por carácter se vuelve brutal a volúmenes muy altos. Pierde cuando necesitas latencia conversacional en tiempo real o eres un equipo pequeño sin capacidad de operar GPUs de sobra. Para esos casos, una API de streaming es la respuesta más barata en cuanto sumas el tiempo de ingeniería.
¿Cómo Elegir la API de TTS Adecuada?
Elige según tu mayor limitación, no según una lista de funciones. Aquí está el árbol de decisión rápido que usamos con nuestros clientes:
- ¿Construyes un agente de voz en tiempo real? Cartesia o Deepgram (websockets de streaming, la menor latencia medida).
- ¿La calidad de voz es innegociable? ElevenLabs.
- ¿Barata y multilingüe? Google Cloud o Amazon Polly.
- ¿On-prem o air-gapped? Contenedores desconectados de Azure u OmniVoice.
- ¿Ya estás metido de lleno en un ecosistema? OpenAI, AWS Polly o Google Cloud, el que encaje con tu stack actual.
- ¿Necesitas la biblioteca de voces más amplia? PlayHT.
Empieza por la limitación que arruinaría el proyecto si te equivocas. Optimiza el resto después.
Cómo lo Aborda Techsy
Construimos agentes de voz, no vendemos ninguna API de TTS, y precisamente por eso podemos ser neutrales aquí. En la práctica, elegimos un TTS distinto para cada cliente según su presupuesto de latencia, su tope de coste y sus reglas de cumplimiento normativo, y luego lo integramos en el agente completo: speech-to-text, el LLM, la telefonía y el pegamento de streaming que lo une todo. Una línea de reservas de restaurante y una línea de una clínica sujeta a HIPAA casi nunca usan el mismo motor de síntesis.
Si estás decidiendo entre construir o comprar, construimos agentes de voz de producción de principio a fin y podemos decirte qué TTS encaja de verdad con tu volumen de llamadas.
Sobre el Autor
Mert Batur es cofundador de Techsy.io. Conecta con él en LinkedIn.
Mert Batur es cofundador de Techsy.io, donde el equipo lanza agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre el stack de herramientas LLM que el equipo de Techsy usa de verdad en producción.
Preguntas Frecuentes
¿Cuál es la mejor API de texto a voz para desarrolladores?
Depende de tu mayor limitación. Para la mejor calidad de voz, elige ElevenLabs. Para la menor latencia en tiempo real, Cartesia. Para audio multilingüe barato, Google Cloud o Amazon Polly. Para datos on-prem o air-gapped, los contenedores desconectados de Azure u OmniVoice autoalojado. No hay una ganadora universal.
¿Qué API de TTS tiene la menor latencia para agentes de voz en tiempo real?
Cartesia afirma un time-to-first-audio de 40 a 90ms, ElevenLabs Flash afirma ~75ms, y Deepgram cita menos de 250ms. Pero lo anunciado no es lo medido: el benchmark independiente de Coval situó a Cartesia Sonic-3 cerca de 188ms P50 y a ElevenLabs Flash cerca de 288ms en condiciones reales. Para agentes, prioriza las APIs de streaming websocket.
¿Cuánto cuesta una API de texto a voz por minuto de audio?
Aproximadamente entre $0.004 y $0.09 por minuto en 2026. Google y Polly Standard rondan los $0.004/min, gpt-4o-mini-tts de OpenAI se acerca a $0.015/min, y las voces premium de ElevenLabs llegan a $0.09/min. Son nuestras estimaciones a ~900 caracteres por minuto; OmniVoice autoalojado cuesta $0 por carácter.
¿Existe una API de texto a voz gratuita? ¿Cuál es el mejor nivel gratuito?
Sí. Google Cloud da 4M de caracteres Standard al mes (1M cada uno en los tipos de voz superiores), Amazon Polly ofrece 5M de caracteres Standard y 1M Neural durante 12 meses, Azure F0 cubre 500K al mes para siempre, y Cartesia incluye ~27 minutos mensuales. OpenAI y Deepgram, en cambio, dan créditos de registro.
¿Cuál es la API de texto a voz más barata?
Para una API alojada, gpt-4o-mini-tts de OpenAI a $0.015 por minuto es la opción más barata con buena calidad, mientras que Google Cloud y Amazon Polly Standard cuestan $4 por 1M de caracteres ($0.004/min). Si puedes ejecutar una GPU, OmniVoice autoalojado cuesta $0 por carácter, solo pagas tu cómputo y electricidad.
¿Puedo autoalojar un modelo de texto a voz en lugar de usar una API?
Sí. OmniVoice, Piper, Kokoro y Coqui son de código abierto y se ejecutan completamente en local. Para on-prem gestionado, Azure ofrece contenedores desconectados (air-gapped) y Deepgram ofrece autoalojamiento enterprise. Autoalojar merece la pena para HIPAA, datos air-gapped, idiomas raros o volúmenes muy altos donde la facturación por carácter duele.
¿Qué APIs de TTS soportan streaming o websockets?
Cartesia, Deepgram, OpenAI, ElevenLabs y PlayHT soportan streaming, y Cartesia y Deepgram son nativas de websocket y las más adecuadas para conversación en directo. OmniVoice es solo por lotes, así que sintetiza el clip completo antes de devolver el audio y no encaja en agentes de voz en tiempo real.
¿OpenAI o ElevenLabs tiene la mejor API de TTS?
Depende del trabajo. OpenAI gana en precio y en "steerability" (controlar en el prompt cómo debe sonar una frase) y ya está en tu stack. ElevenLabs gana en calidad de voz pura, una biblioteca más grande y clonación instantánea. Para agentes completos, compara ambas frente a las opciones de orquestación en nuestro desglose de plataformas de agentes de voz.
¿Cómo clono una voz a través de una API de TTS, y cuánto dura el clip que necesito?
La duración del clip varía. ElevenLabs clona al instante desde cualquier ID de voz, Cartesia y OmniVoice necesitan una muestra de unos 3 segundos, y PlayHT quiere entre 3 y 10 segundos. Amazon Polly, Deepgram y Google Cloud solo usan voces preestablecidas (Custom Neural Voice de Azure requiere un proceso formal de inscripción).
¿Cuál es la diferencia entre el precio por carácter y el precio por token/minuto?
La mayoría de las APIs de TTS facturan por carácter del texto de entrada, lo que es fácil de predecir. gpt-4o-mini-tts de OpenAI, en cambio, factura por token de audio de salida, así que el coste sigue la duración del habla generada, no del texto original. Para agentes de voz, convierte ambos a dólares por minuto de conversación para comparar de forma justa.
Fuentes
- Precios de la API de ElevenLabs: https://elevenlabs.io/pricing/api (consultado el 2026-07-14)
- Precios de Cartesia: https://cartesia.ai/pricing (consultado el 2026-07-14)
- Precios de Deepgram: https://deepgram.com/pricing (consultado el 2026-07-14)
- Precios de Amazon Polly: https://aws.amazon.com/polly/pricing/ (consultado el 2026-07-14)
- Precios de la API de OpenAI: https://developers.openai.com/api/docs/pricing (consultado el 2026-07-14)
- Precios de Google Cloud Text-to-Speech: https://cloud.google.com/text-to-speech/pricing (consultado el 2026-07-14)
- Precios de Azure AI Speech: https://azure.microsoft.com/en-us/pricing/details/speech/ (consultado el 2026-07-14)
- OmniVoice (k2-fsa): https://github.com/k2-fsa/OmniVoice (consultado el 2026-07-14)
- Benchmark independiente de TTS de Coval: https://www.coval.ai/blog/best-text-to-speech-providers-in-2026-how-to-choose-(and-why-vendor-benchmarks-lie)/ (consultado el 2026-07-14)
- MarkTechPost, comparación de TTS basada en benchmarks: https://www.marktechpost.com/2026/05/30/best-text-to-speech-tts-models-in-2026-a-benchmark-based-comparison/ (consultado el 2026-07-14)