
Precios de Agentes de Voz IA en 2026: La Verdad de $0,05 vs $0,30 por Minuto (Con Cálculos)
Vapi pone "$0,05/min" en su página de precios. Tu primera factura mensual llega a $0,27/min. ¿Qué pasó? Cada plataforma de voice AI anuncia un número — la tarifa de plataforma — y te cobra otras cuatro capas que no viste en la página de inicio. Esta guía reconstruye los precios de agentes de voz IA desde cero: costos BYOK reales para 8 plataformas, el concepto de tokens de audio que nadie explica, y una función Python que puedes hacer fork para pronosticar tu propia factura.

Respuesta Rápida
- El costo real todo incluido en 2026 está entre $0,07–$0,30/min dependiendo de bundled vs BYOK.
- Las plataformas bundled (Retell, Bland, ElevenLabs) anuncian $0,07–$0,12/min y aterrizan cerca de $0,10–$0,18/min.
- Las plataformas BYOK (Vapi $0,05/min tarifa de plataforma) llegan a $0,13–$0,31/min tras LLM + TTS + STT + Twilio.
- La palanca oculta más grande es el prompt caching en OpenAI Realtime: hasta 80× más barato en prompts del sistema.
¿Cuánto cuesta realmente un agente de voz IA en 2026?
La mayoría de los agentes de voz IA cuestan $0,07 a $0,30 por minuto todo incluido en 2026. Las plataformas bundled (Retell, Bland, ElevenLabs) anuncian $0,07–$0,12/min y aterrizan cerca de $0,10–$0,18/min. Las plataformas BYOK (Vapi con $0,05/min de tarifa de plataforma) llegan a $0,13–$0,31/min una vez que agregas LLM, TTS, STT y Twilio. Directamente en OpenAI Realtime es aproximadamente $0,30/min sin caching.
Tres categorías explican casi todo lo que verás en tu factura:
- Bundled por minuto: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min fijo), Synthflow y ElevenLabs Conversational. Un número, todo incluido.
- Orquestación BYOK: Vapi cobra $0,05/min solo por la capa de manejo de llamadas. Los tokens LLM, caracteres TTS, minutos STT y el carrier se facturan por separado en tus propias cuentas.
- Directo en infraestructura: Construir directamente en OpenAI Realtime más Twilio. El más barato a escala si haces cache de prompts. Caro si no lo haces.
El resto de este artículo explica los cálculos capa por capa, y luego entrega una función Python tco_per_minute() que puedes pegar en un notebook.
Por qué el precio anunciado por minuto es una mentira (las 4 capas de costo)
La tarifa de plataforma anunciada de $0,05/min solo cubre la orquestación. Las otras cuatro capas se apilan encima. Cada agente de voz en producción en 2026 paga cinco líneas: telefonía, STT, el LLM, TTS y la tarifa de plataforma que los une. Omite cualquiera y no tienes un agente funcional.
Aquí está el suelo, capa por capa.
Capa 1: Telefonía (el minuto del carrier)
Pagas a una telco real por el audio que viaja dentro y fuera de la red telefónica pública. Twilio Programmable Voice cobra $0,014/min saliente en EE.UU., más $1–$2/mes por número de teléfono. Twilio Elastic SIP varía de $0,0053–$0,042/min dependiendo del origen. La mayoría de las plataformas de voice AI revenden Twilio con un pequeño margen o lo pasan directamente. De cualquier forma, es $0,014/min en tu hoja de cálculo.
Capa 2: Reconocimiento de voz (STT)
Conviertes lo que dijo el llamante en texto que el LLM puede leer. Deepgram Nova-2 streaming cuesta aproximadamente $0,0043/min en el nivel Pay-as-you-go, así que en la práctica $0,005/min. Los modelos premium (equivalente a Whisper) suben a $0,018/min. Las plataformas bundled ocultan esto en su tarifa principal, pero sigue estando ahí.
Capa 3: El LLM (texto o audio)
Dos caminos aquí. Los pipelines en modo texto alimentan audio transcrito a un modelo como GPT-4o-mini ($0,15/M entrada, $0,60/M salida) y alimentan la respuesta al TTS. Un bucle de voz típicamente quema 100–300 tokens de entrada y 80–200 tokens de salida por turno, lo que resulta en aproximadamente $0,003–$0,015/min para GPT-4o-mini, $0,015–$0,04/min para Claude Haiku. Los pipelines en modo audio (OpenAI Realtime) omiten el baile de transcripción/síntesis y facturan directamente en tokens de audio. Tenemos una sección completa sobre eso a continuación; es la palanca de costo que nadie explica.
Capa 4: Síntesis de voz (TTS)
Sintetizas la respuesta de vuelta en audio. ElevenLabs Turbo cuesta $0,10/min en el plan Conversational, las voces Premium suben a $0,12/min. Las voces más básicas (Deepgram Aura, OpenAI tts-1) llegan a $0,04–$0,06/min. Esta es generalmente la segunda línea más grande después de la tarifa de plataforma.
Súmalo al suelo: $0,014 telefonía + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 plataforma = $0,114/min mínimo en un stack BYOK. Eso es antes de HIPAA, concurrencia, o alquiler de números. Si quieres la comparación de características cara a cara después de esta inmersión en precios, consulta nuestro análisis Retell AI vs Vapi vs Bland.
Las 8 plataformas comparadas (tabla de precios mayo 2026)
La tabla a continuación extrae tarifas principales y cifras realistas todo incluido de la página de precios de cada proveedor. Úsala como referencia, no como evangelio: las páginas de precios cambian, y tus elecciones de stack cambian el resultado final.
| Plataforma | Modelo de precios | Tarifa principal | Real todo incluido (típico) | HIPAA | BYOK o bundled | Trampa notable |
|---|---|---|---|---|---|---|
| Retell AI | Por minuto | $0,07–$0,31/min | $0,12–$0,18/min | Incluido | Bundled | Concurrencia $8/mes por encima de lo incluido |
| Vapi | Tarifa de plataforma + BYOK | $0,05/min | $0,13–$0,31/min | +$2.000/mes | BYOK | Las cuatro capas extra |
| Bland AI | Tarifa fija por minuto | $0,09/min | $0,09–$0,14/min | Incluido | Bundled | $0,025/min tarifa de transferencia |
| Synthflow | Por minuto en plan | $0,09/min base | $0,11–$0,15/min | Incluido | Bundled | Niveles de plan $29/$99/$449/$899 |
| ElevenLabs Conversational | Por minuto | $0,08–$0,12/min | $0,10–$0,18/min | Plan Workspace | Bundled | LLM extra a menos que sea tier managed |
| Deepgram Voice Agent | Por hora | $4,50/hr ($0,075/min) | $0,09–$0,11/min + telefonía | Sí | Bundled | Agregar Twilio encima |
| OpenAI Realtime API | Tokens de audio | $32/M entrada, $64/M salida | ~$0,30/min crudo, ~$0,12 en cache | DIY | Directo | Cálculo de tokens de audio (ver abajo) |
| Twilio (capa de telefonía) | Por minuto | $0,014/min EE.UU. saliente | $0,014/min | n/a | n/a | Números de teléfono $1–$2/mes |
Precios verificados mayo 2026. Siempre verifica las páginas de precios de los proveedores antes de firmar: Vapi cambió su complemento HIPAA dos veces solo en el último año.
Ejemplo concreto: ¿cuánto cuesta realmente una llamada saliente de 4 minutos?
El escenario canónico: una llamada saliente de 4 minutos, GPT-4o-mini como LLM, ElevenLabs Turbo como voz, Twilio EE.UU. como carrier, solo en inglés. Cuando ejecutamos este escenario exacto en las cuatro plataformas (Vapi, Retell, Bland, OpenAI Realtime directo), la tarifa principal explicaba menos de la mitad del número final.
Supuestos mantenidos constantes en las cuatro:
- 4 minutos de duración total
- ~12 turnos de conversación, ~150 tokens de entrada + 100 tokens de salida por turno = 1.800 en / 1.200 fuera para GPT-4o-mini
- TTS produce ~400 caracteres por turno × 12 = 4.800 caracteres (ElevenLabs Turbo @ $0,10/min salida de audio)
- STT factura los 4 minutos completos (Deepgram Nova-2 @ ~$0,0043/min)
- Twilio saliente EE.UU. @ $0,014/min, $1/mes de número amortizado sobre 1.000 llamadas/mes = $0,001/llamada
Vapi BYOK: $0,05 → $0,27/min
| Concepto | Costo |
|---|---|
| Tarifa de plataforma Vapi (4 min × $0,05) | $0,200 |
| GPT-4o-mini (1.800 en × $0,15/M + 1.200 fuera × $0,60/M) | $0,001 |
| ElevenLabs Turbo (4 min × $0,10) | $0,400 |
| Deepgram STT (4 min × $0,005) | $0,020 |
| Twilio (4 min × $0,014) | $0,056 |
| Alquiler de número amortizado | $0,001 |
| Total por la llamada | $0,678 |
| $/min efectivo | $0,170 |
Nota: ElevenLabs Turbo en el plan Conversational está más cerca de $0,10/min, no tarifa plana, así que el cálculo es un cargo por minuto de salida de audio. Una tarifa de plataforma de $0,05/min más GPT-4o-mini más ElevenLabs Turbo más Twilio suma más cerca de $0,17–$0,27/min, no $0,05.
Retell bundled: $0,10 → $0,16/min
| Concepto | Costo |
|---|---|
| Bundle Retell (4 min × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Paso a través de Twilio (4 min × $0,014) | $0,056 |
| Alquiler de número amortizado | $0,002 |
| Total por la llamada | $0,578 |
| $/min efectivo | $0,145 |
El bundle de Retell incluye el LLM (tú eliges el modelo), STT y su propio TTS. Solo te queda pagar Twilio encima. Eso es todo.
Bland tarifa plana: $0,09 → $0,13/min
| Concepto | Costo |
|---|---|
| Bland plana (4 min × $0,09) | $0,360 |
| Paso a través de Twilio (4 min × $0,014) | $0,056 |
| Alquiler de número amortizado | $0,001 |
| Total por la llamada | $0,417 |
| $/min efectivo | $0,104 |
Bland tiene el cálculo más claro en el SERP. Un número, más el carrier. El truco está en las tarifas ocultas — los minutos de transferencia se facturan a $0,025/min adicionales.
OpenAI Realtime directo (sin caching): $0,30/min
| Concepto | Costo |
|---|---|
| OpenAI Realtime audio entrada (4 min × ~$0,077) | $0,308 |
| OpenAI Realtime audio salida (4 min × ~$0,077) | $0,308 |
| Twilio (4 min × $0,014) | $0,056 |
| Alquiler de número amortizado | $0,001 |
| Total por la llamada | $0,673 |
| $/min efectivo | $0,168 |
Esa cifra asume que estás haciendo cache de los prompts del sistema. Sin caching, la misma llamada aterriza más cerca de $1,20 ($0,30/min) porque cada turno vuelve a facturar el prompt del sistema completo a tarifas frescas. Desglosamos ese cálculo a continuación.

Bundled vs BYOK: ¿qué modelo de precios gana para ti?
Las plataformas bundled ganan cuando quieres una sola factura, cálculo predecible por minuto y una buena voz de base. BYOK gana cuando tienes capacidad de ingeniería, quieres elegir tu propio LLM y planeas negociar tarifas de carrier a escala. La decisión generalmente se reduce a dos preguntas: ¿tienes preferencia de línea de facturación, y tienes un desarrollador que será dueño del stack?
| Caso de uso | Bundled gana porque | BYOK gana porque |
|---|---|---|
| Deflexión de soporte entrante | Un proveedor, una factura, HIPAA incluido | Difícil justificar el costo de ingeniería |
| Llamadas frías salientes a escala | El cálculo fijo supera las sorpresas por token | Puedes negociar minutos de carrier a más de 100k/mes |
| RAG personalizado + uso de herramientas | Superficie limitada de llamadas a herramientas en la mayoría de bundles | Control total sobre la ventana de contexto |
| Industrias reguladas | El flag HIPAA se activa con una casilla | La conformidad se convierte en tu problema |
Regla de decisión rápida:
- Menos de 10.000 minutos/mes → bundled casi siempre gana en costo total de propiedad (solo el tiempo de ingeniería hace break-even).
- 10.000–100.000 minutos/mes → BYOK empieza a compensar si tienes 1+ ingeniero en ello.
- Más de 100.000 minutos/mes → BYOK o direct-on-Realtime es usualmente $0,05–$0,10/min más barato, y tienes influencia para negociar tarifas de subcuenta de Twilio.
Para una perspectiva más profunda de costos de LLM en el lado BYOK, consulta nuestro análisis de opciones de orquestación en mejores frameworks de agentes IA.
Los costos ocultos que la mayoría no ve
Incluso cuando dominas el cálculo de las cuatro capas, la factura llega con conceptos que la página de inicio nunca mencionó. Estos siete son los que vemos impactar más seguido a los clientes. La mayoría están enterrados en la letra pequeña de las páginas de precios o en pantallas de configuración post-registro. No son maliciosos, solo están poco comunicados.
- Complemento HIPAA. Vapi cobra $2.000/mes por HIPAA según su página de precios. Retell, Bland y Synthflow incluyen HIPAA sin costo adicional. Si estás en salud y estás evaluando Vapi, eso es $24k/año antes de haber hecho una sola llamada.
- Impuesto de redondeo por minuto. La mayoría de las plataformas redondean a intervalos de 60 segundos: una llamada de 61 segundos se factura como 2 minutos. Con 5.000 llamadas/mes con una distribución típica de 45–90 segundos, eso es un 5–8% de incremento efectivo sobre lo que dice tu cálculo de $/min. La facturación por segundo (Bland, Deepgram) evita esto.
- Alquiler de números de teléfono. Twilio: $1–$2/mes por número. Retell: $2/mes por número, $10/mes para números verificados. Parece pequeño hasta que estás manejando 50 números salientes para llamadas frías; eso es un concepto de $100/mes que nadie cotizó.
- Tarifas de concurrencia. Retell incluye una base de llamadas concurrentes; más allá de eso, son $8/concurrencia/mes. Un equipo que ejecuta 10 llamadas simultáneas más allá de la base agrega $80/mes.
- Tarifas de transferencia. Bland cobra $0,025/min cuando el agente transfiere a un humano. Si el 20% de tus llamadas se transfieren, eso es un impuesto significativo en el minuto promedio.
- Tarifas de base de conocimiento. Retell te da 10 KB gratis; cada adicional es $8/mes. Acumula casos de uso RAG-intensivos y eso se compone rápido.
- Mejoras de voz premium. ElevenLabs Premium agrega +$0,04/min sobre Turbo. Parece opcional hasta que tu equipo de ventas hace pruebas A/B y encuentra que Premium convierte 11% mejor.
¿Necesitas a alguien que detalle tu caso de uso específico antes de firmar un contrato de Vapi? Lo hacemos como parte de nuestros compromisos de construcción de agentes de voz.
Tokens de audio y prompt caching: la palanca de costos que nadie explica
OpenAI Realtime API factura por tokens de audio, donde 1 token = 100ms de audio de entrada o 50ms de audio de salida. Una llamada de 60 segundos usa aproximadamente 600 tokens de entrada (el llamante habla) y 1.200 tokens de salida (el agente responde). A $32/M de entrada y $64/M de salida, eso es $0,0192 entrada + $0,0768 salida = $0,096 de costo de audio crudo por minuto, o aproximadamente $0,10/min antes de agregar prompts, herramientas o Twilio.
Luego está el prompt del sistema. Cada turno envía tu prompt del sistema completo al modelo como parte de la ventana de contexto. Un agente de voz típico tiene un prompt del sistema de 2.000 tokens que cubre persona, herramientas, casos límite y lógica de rechazo. Sin caching, ese bloque de 2.000 tokens se factura a $32/M fresco en cada llamada: $64 en 1.000 llamadas.
Con prompt caching habilitado (los tokens en cache cuestan $0,40/M según la documentación de OpenAI), la misma carga de 1.000 llamadas se factura por $0,80. Eso es un descuento de 80× en el costo del prompt del sistema. El prompt caching en OpenAI Realtime reduce el costo de tu prompt del sistema en 80×. La mayoría de los equipos descubren esto solo después de su primera factura mensual.
Aquí está el cálculo como código:
# Cálculo de costo en tokens de audio para OpenAI Realtime
# Entrada: 1 token / 100ms = 600 tokens/min
# Salida: 1 token / 50ms = 1.200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Tarifas frescas
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # Descuento 80x
# Costo de audio crudo (por llamada, 1 minuto)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0,096/min
# Prompt del sistema en 1.000 llamadas
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0,80
print(f"Fresco: ${prompt_fresh:.2f} | En cache: ${prompt_cached:.2f}")
# Fresco: $64.00 | En cache: $0.80
En nuestro trabajo de modelado de costos para clientes que construyen directamente en Realtime, esta es la mayor palanca única entre "Realtime es barato" y "Realtime cuesta el doble que Vapi". Si usas la API de Responses junto con Realtime para llamadas a herramientas, consulta nuestro tutorial de OpenAI Responses API para el patrón de implementación. Por esto construir directamente en OpenAI Realtime puede ser más barato o mucho más costoso que Vapi, dependiendo de si haces cache.
Cómo calcular tu propio TCO (fórmula + Python)
El costo total de propiedad de un agente de voz es el costo variable por minuto más los costos fijos mensuales amortizados sobre tu volumen de minutos. La fórmula:
TCO/min = tarifa_plataforma + costo_LLM + costo_STT + costo_TTS + telefonía + (alquiler_número + tarifa_concurrencia + tarifa_KB) / minutos_por_mes
Ingresa tus números. O haz fork de esto:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # ej. 0.05 para Vapi, 0.13 para bundle de Retell
llm_in_per_1m: float, # ej. 0.15 para entrada GPT-4o-mini
llm_out_per_1m: float, # ej. 0.60 para salida GPT-4o-mini
llm_in_tokens_per_call: int, # ej. 1800
llm_out_tokens_per_call: int, # ej. 1200
tts_per_min: float, # ej. 0.10 para ElevenLabs Turbo
stt_per_min: float, # ej. 0.005 para Deepgram Nova-2
telephony_per_min: float, # ej. 0.014 para Twilio EE.UU.
fixed_monthly: float = 0.0, # alquiler de números, KB, HIPAA, concurrencia
) -> dict:
"""Devuelve el costo total de propiedad mensual y por minuto."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable por llamada
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Ejemplo: 5.000 llamadas/mes, 4 min promedio, stack Vapi BYOK
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mes alquiler de número
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Cuatro pasos numerados para quien pronostica desde cero:
- Estima tu volumen de llamadas mensual y la duración promedio de llamada.
- Elige tu stack: plataforma + LLM + TTS + STT + telefonía.
- Busca el precio por unidad de cada componente en la página de precios del proveedor.
- Ejecuta la fórmula (o la función Python de arriba) — la salida es tu $/min previsto y el monto mensual.
Si no puedes escribir tu TCO como una fórmula de una línea, lo vas a perder en un impuesto de redondeo por minuto.
Costo a escala: 1k vs 10k vs 100k minutos por mes
Las curvas divergen rápidamente por encima de 10.000 minutos. Las plataformas bundled se aplanan porque su factura es solo minutos × tarifa. Los stacks BYOK se empujan hacia arriba a medida que los costos de LLM y TTS escalan linealmente contigo. OpenAI Realtime con caching cruza a Vapi alrededor de 10k–20k minutos/mes, el punto de inflexión donde el direct-on-infra empieza a tener sentido.
| Plataforma | 1.000 min/mes | 10.000 min/mes | 100.000 min/mes |
|---|---|---|---|
| Bland plana $0,09/min + Twilio | $120 | $1.160 | $11.400 |
| Bundle Retell ~$0,145/min todo incluido | $145 | $1.450 | $14.500 |
| Vapi BYOK ~$0,17/min todo incluido | $170 | $1.700 | $17.000 |
| OpenAI Realtime + caching ~$0,13/min | $130 | $1.300 | $13.000 |
| Deepgram Voice Agent + Twilio | $108 | $1.080 | $10.800 |
Números derivados de la fórmula tco_per_minute() de arriba con los supuestos canónicos de llamada de 4 minutos. Agrega HIPAA ($2.000/mes Vapi), concurrencia y alquiler de números donde apliquen. No cambian la forma de las curvas pero elevan el piso para compradores de bajo volumen.
El gráfico hero en la parte superior de este artículo visualiza los mismos números: Bland se aplana temprano, Vapi sube a medida que los costos de LLM escalan, y OpenAI Realtime con caching supera a Vapi más allá de los 10k minutos.
Cuándo NO deberías implementar un agente de voz
La voice AI tiene un piso real de $0,10–$0,30/min. Por debajo de 200 llamadas por mes, un humano más un SaaS de $19 todavía gana en costo. El alquiler de números de teléfono, las bases de concurrencia y los mínimos de plataforma suman un overhead de $50–$200/mes que un equipo de bajo volumen simplemente no recupera.
Tres criterios honestos de "sáltalo":
- Menos de 200 llamadas/mes. Alquiler de números + cargos mínimos + bases de concurrencia superan lo que cuesta un humano a tiempo parcial a $20/hr. El break-even no funciona.
- Trabajo de alto contexto y bajo volumen. Tu único humano maneja 15 llamadas al día, cada una con 30+ patrones de hechos únicos. El costo de alucinación del LLM (reembolsos, negocios perdidos, citas incorrectas) se come los ahorros. La voice AI brilla en flujos repetitivos, no en trabajo intensivo en casos extremos.
- Industrias reguladas sin presupuesto HIPAA. El complemento HIPAA de $2k/mes de Vapi, las tarifas de conformidad del carrier y los controles PII ($0,005–$0,01/min en Retell) pueden colapsar el cálculo. Si no puedes presupuestar $25k/año solo en partidas de conformidad, primero ejecuta pilotos en flujos no-PHI.
En pruebas, el punto de break-even contra un agente humano para la deflexión de soporte aterriza alrededor de 250–400 llamadas/mes a tarifas bundled típicas. Por debajo de eso, un SaaS de $19/mes más un humano es más barato. No implementes voice AI solo porque puedes.

Si la voice AI supera el piso de costos pero no quieres cablear Retell o Vapi tú mismo, nuestro servicio de desarrollo de agentes de voz construye y opera el stack completo en tu infraestructura.
Cómo elegiríamos realmente una plataforma en 2026 (veredicto por caso de uso)
Ninguna plataforma gana en todos lados. La elección más barata seria depende de si eres entrante o saliente, si tienes capacidad de ingeniería y si HIPAA importa. Cinco casos de uso, cinco respuestas:
- Saliente más barato serio (llamadas frías): Bland. Plana $0,09/min, tarifa de transferencia transparente, sin sorpresas de costos de LLM. Sáltalo si necesitas RAG profundo o herramientas personalizadas.
- Entrante más barato (deflexión de soporte): Retell. Bundled, HIPAA incluido, análitica madura, $0,12–$0,18 todo incluido. Sáltalo si tu volumen entrante es menor de 200 llamadas/mes (ver la sección anterior).
- Control máximo + RAG personalizado: Vapi BYOK. Solo si tienes capacidad de ingeniería para gestionar las claves LLM, TTS y STT. El control vale $0,27/min solo cuando puedes negociar el carrier y el LLM en volumen.
- Simplicidad bundled a escala: Deepgram Voice Agent. $4,50/hr ($0,075/min) plana, la opción más pasada por alto en el SERP. Sáltalo si necesitas la amplia biblioteca de voces que ofrece ElevenLabs.
- Nivel de calidad conversacional (demos de ventas, flujos sensibles a la marca): ElevenLabs Conversational. Voces Turbo o Premium a $0,10–$0,12/min. Paga el precio adicional cuando la calidad de voz es la palanca de conversión.
Para una visión sectorial más profunda en el lado empresarial, consulta agentes de voz IA para centros de llamadas empresariales: el mismo cálculo, con supuestos de volumen específicos para restaurantes y clínicas.
Cómo aborda Techsy el modelado de costos para agentes de voz
No vendemos una plataforma de voz. Construimos agentes de voz en producción para clientes en Retell, Vapi, Deepgram y OpenAI Realtime. Eso significa que cuando modelamos costos para un nuevo compromiso, ejecutamos la fórmula tco_per_minute() en tres niveles de volumen (1k, 10k, 100k minutos/mes) antes de recomendar un stack. La plataforma que gana a 1k a menudo pierde a 100k.
Negociamos precios de subcuenta de Twilio para clientes que superan los 100k minutos/mes (las subcuentas desbloquean niveles de volumen que la mayoría de los equipos no saben que existen), y siempre modelamos los ahorros de prompt caching en builds de Realtime antes de aprobar un diseño direct-infra. La mitad de nuestro trabajo de modelado de costos para clientes es deshacer suposiciones que alguien hizo de una entrada de blog de un proveedor.
¿Quieres un agente de voz construido de principio a fin en la plataforma que realmente gana para tu volumen? Ve cómo construimos agentes de voz →
FAQ
¿Cuánto cuesta un agente de voz IA por minuto en 2026? El costo todo incluido varía de $0,07 a $0,30 por minuto. Las plataformas bundled (Retell, Bland, ElevenLabs Conversational) aterrizan en $0,10–$0,18/min una vez incluida la telefonía. Las plataformas BYOK como Vapi llegan a $0,13–$0,31/min después de agregar los costos de LLM, TTS, STT y Twilio. OpenAI Realtime directo está cerca de $0,30/min crudo o aproximadamente $0,12/min con el prompt caching habilitado en prompts del sistema.
¿Cuál es la plataforma de agente de voz IA más barata? Para saliente, Bland AI a $0,09/min plana tiene el cálculo más claro del mercado. Para soporte entrante, Retell a $0,10–$0,16 todo incluido generalmente gana gracias al HIPAA incluido y las bases de concurrencia. Para setups de infraestructura pura con caching, OpenAI Realtime puede caer por debajo de $0,15/min. Deepgram Voice Agent a $0,075/min plana es la opción más pasada por alto.
¿Por qué mi factura de Vapi es más alta que $0,05/min? Los $0,05/min en la página de precios de Vapi es solo la tarifa de plataforma. Vapi es BYOK: traes tus propias claves para el LLM (GPT-4o-mini, Claude, etc.), TTS (ElevenLabs, PlayHT), STT (Deepgram) y telefonía (Twilio). El costo real todo incluido llega a $0,13–$0,31/min dependiendo de qué voz y modelo elijas.
¿Cuál es la diferencia entre BYOK y los precios bundled? Las plataformas bundled (Retell, Bland, Synthflow, ElevenLabs Conversational) incluyen LLM, STT y TTS en una tarifa por minuto. Las plataformas BYOK (Vapi) cobran solo por la orquestación — traes tus propias claves API para todo lo demás y te factura por separado cada proveedor. Bundled es más simple; BYOK te da control e influencia de negociación a escala.
¿Hay costos ocultos en los precios de agentes de voz IA? Sí, siete comunes. Complementos HIPAA ($2.000/mes en Vapi), redondeo por minuto (5–8% de incremento efectivo a escala), alquiler de números de teléfono ($1–$2/mes), tarifas de concurrencia ($8/concurrencia/mes Retell), tarifas de transferencia ($0,025/min Bland), tarifas de base de conocimiento ($8/mes por KB en Retell) y mejoras de voz premium (+$0,04/min ElevenLabs Premium sobre Turbo).
¿Es OpenAI Realtime API más barato que Vapi? Sin prompt caching, no: OpenAI Realtime cuesta aproximadamente $0,30/min de costo de audio crudo. Con el prompt caching habilitado (tokens de prompt del sistema en cache a $0,40/M vs $32/M fresco, un descuento de 80×), el concepto del prompt del sistema colapsa y el costo total cae a aproximadamente $0,12–$0,15/min. Eso lo hace competitivo con las plataformas bundled por encima de los 10k minutos/mes.
¿Cómo pronostico mi costo mensual de agente de voz?
Estima las llamadas por mes multiplicadas por la duración promedio de llamada en minutos. Multiplica por el $/min todo incluido de tu plataforma. Agrega costos fijos mensuales: alquiler de números de teléfono, tarifas de KB, base de concurrencia, complemento HIPAA si aplica. La función Python tco_per_minute() de arriba automatiza esto con una sola llamada de función que puedes pegar en un notebook de Jupyter.
Facturación por minuto o por segundo: ¿cuál es más barata? La facturación por segundo es significativamente más barata para las llamadas salientes cortas. Una llamada de 61 segundos facturada en intervalos de 60 segundos cobra 2 minutos, lo que es un impuesto efectivo de 5–8% en 5.000 llamadas por mes con una distribución típica de llamadas cortas. Bland y Deepgram facturan por segundo; la mayoría de las plataformas BYOK heredan el redondeo de 60 segundos de Twilio por defecto.
¿Existen agentes de voz IA gratis? Existen versiones de prueba: la mayoría de los proveedores ofrecen 10–60 minutos gratis (Retell, Vapi, Bland) para probar. Los agentes de voz de producción verdaderamente gratis no existen porque siempre pagas al menos los minutos del carrier ($0,014/min en Twilio EE.UU. saliente). Incluso los stacks de código abierto autohospedados (Pipecat, LiveKit Agents) te dejan pagando la telco y el LLM.
¿Cuál es el ROI de la voice AI vs un agente humano? Los agentes humanos cuestan $15–$30/hr completamente cargados, lo que resulta en $0,25–$0,50/min. La voice AI a $0,10–$0,20/min supera el costo humano por encima de aproximadamente 200 llamadas por mes, asumiendo tasas de resolución comparables. Por debajo de ese volumen, los mínimos de plataforma y el overhead de alquiler de números hacen de un humano más un SaaS de $19/mes la respuesta más barata.
Esta guía es mantenida por el equipo editorial de Techsy. Construimos agentes de voz IA en producción en Retell, Vapi y OpenAI Realtime para clientes; estos números provienen del trabajo de modelado de costos que hacemos cada semana, no de folletos de proveedores. Precios verificados en mayo 2026; siempre confirma con las páginas de precios de los proveedores antes de firmar.