Calculadora de coste de desarrollo de agentes de voz con IA
Inversión inicial y rentabilidad por minuto cuando lo pones a funcionar a escala.
Desarrollar un agente de voz con IA en producción cuesta entre 25.000 y 150.000 $, más 0,08–0,30 $ por minuto de llamada cuando operas a escala. La inversión inicial cubre las integraciones (CRM, calendario, pagos), el diseño conversacional y la infraestructura en tiempo real. El coste por minuto lo marcan, sumados, el speech-to-text, la inferencia del LLM y el text-to-speech. Alojarlo en tu propia infraestructura recorta ese coste por minuto un 60 %, a cambio de una inversión inicial mayor.
Tus parámetros
05 fieldsInfluye en la tarifa media; un perfil senior cuesta un 35 % más.
Quién debería usar esta herramienta
Fundadores que dimensionan un proyecto de voice ai agent antes de hablar con proveedores. CTOs y responsables de ingeniería que preparan el presupuesto anual de nuevo producto. Product managers que convierten una idea de una línea en un rango defendible ante finanzas. Equipos de compras que contrastan los presupuestos de agencias y contratistas.
Cómo lo calculamos
La inversión inicial se estima por horas de trabajo. Los stacks gestionados (Retell, Vapi) son los más rápidos de lanzar. La opción best-of-breed ofrece más control a cambio de un 25 % más de trabajo de integración. El self-hosted exige experiencia en infraestructura de voz y dispara el coste inicial un 70 %.
Fuentes de datos
- Proyectos de voice agents de Techsy entre 2024 y 2026
- Precios públicos de Retell AI
- Precios públicos de Vapi
- Precios de speech-to-text de Deepgram
- Precios de síntesis de voz de ElevenLabs
- Precios de Twilio Programmable Voice
- Precios de la Claude API de Anthropic
Factores que mueven el número
Diseño de diálogo
El diseño conversacional suele suponer entre el 25 % y el 35 % del esfuerzo total de desarrollo, y es lo que separa los agentes de voz que funcionan de los que frustran a cada persona que llama. Un mal diseño conversacional es la razón por la que la mayoría de los agentes en producción dan la sensación de estar rotos: resuelven el caso ideal y se desmoronan ante cualquier otro. Reserva presupuesto para un diseñador conversacional sénior o un especialista en IA conversacional desde el primer día, en lugar de tratarlo como una funcionalidad que un ingeniero añade al final. Las horas que te ahorras saltándote ese trabajo las pagas después en clientes perdidos.
Profundidad de las integraciones
Reservar un hueco en el calendario es fácil: entre 40 y 60 horas. Reservar, más cobrar el pago, más enviar la confirmación, más registrar la interacción en tu CRM es más o menos el triple de trabajo, porque cada integración multiplica los puntos de fallo. Un agente de voz que resuelve todo el recorrido del cliente en una sola llamada es un desarrollo bastante más complejo que uno que deriva a una persona tras la cualificación. Cada integración suma entre 40 y 120 horas, más su mantenimiento continuo.
Requisitos de latencia
La voz impone restricciones de tiempo real estrictas que la web y el móvil no tienen. La latencia completa de ida y vuelta (la persona habla, el agente piensa, el agente responde) tiene que quedar por debajo de los 800 ms o la conversación se siente rota. Los stacks gestionados como Retell y Vapi lo consiguen de forma consistente. Los stacks self-hosted pueden mejorar la latencia de los gestionados, pero exigen infraestructura de GPU en el edge para mantener ágiles el speech-to-text y la inferencia del LLM. Optimizar la latencia es un trabajo de ingeniería nada trivial que la mayoría de los equipos subestima.
Idiomas y acentos
Cada idioma adicional añade localización de la conversación, elección del modelo de voz y pruebas con acentos regionales. Un segundo idioma supone más o menos un 25 % más de trabajo; un tercero, otro 25 %. Admitir idioma mixto, cuando quien llama cambia de idioma a mitad de conversación (de inglés a español, por ejemplo), suma otro 30 %, porque no basta con detectar el idioma una sola vez al inicio de la llamada. La mayoría de los agentes de voz debería lanzarse con un solo idioma y añadir más en función de los datos reales de las llamadas.
Economía por minuto
Los stacks gestionados como Retell y Vapi cuestan entre 0,12 $ y 0,30 $ por minuto de principio a fin, incluyendo STT, LLM, TTS y telefonía. Los stacks best-of-breed que combinan Deepgram, Claude Sonnet, ElevenLabs y Twilio salen entre 0,08 $ y 0,20 $ por minuto, con más control. El self-hosted ronda los 0,03 $ a 0,08 $ por minuto una vez amortizada la infraestructura, pero exige una inversión de ingeniería inicial importante. La elección correcta depende del volumen de llamadas: el gestionado gana por debajo de los 50.000 minutos al mes; el self-hosted, por encima de los 200.000.
Cómo reducir el coste
Empieza con un stack gestionado como Retell o Vapi en lugar de montar best-of-breed o self-hosted desde el primer día. Las plataformas gestionadas se encargan de la infraestructura de voz (STT, TTS, telefonía, orquestación en tiempo real) para que tu equipo se centre en el diseño conversacional y las integraciones. Lanzas en 4 a 8 semanas en lugar de en 12 a 20, y validas el caso de uso antes de comprometerte con el desarrollo más complejo. Da el salto a un stack a medida más adelante, solo si el volumen de llamadas supera los 100.000 minutos al mes o si las exigencias de calidad superan lo que dan las plataformas gestionadas.
Acota el agente a un caso de uso concreto en el lanzamiento. La tentación es construir un agente de voz de propósito general que lo haga todo: reservas, soporte, ventas, escalado. Lo que de verdad sale a producción y funciona es una sola tarea bien resuelta, como reservar citas o gestionar el restablecimiento de contraseñas. La tasa de resolución autónoma en casos de uso acotados llega al 70 %–90 %; en casos amplios baja al 40 %–60 % y la gente que llama acaba aporreando el cero para hablar con una persona. Añade un segundo caso de uso solo cuando el primero esté sólido.
Usa Claude Sonnet 4 o GPT-4o mini para el razonamiento de la conversación en lugar de los modelos insignia. Los agentes de voz no necesitan capacidad de razonamiento de frontera en la mayoría de las llamadas; necesitan generar respuestas rápidas, baratas y fiables. Sonnet 4 y GPT-4o mini son de 5 a 10 veces más baratos que Opus o GPT-4.5, con una calidad comparable en tareas conversacionales acotadas. Ahorrar en el modelo supone reducir el coste por minuto entre un 30 % y un 50 % sin penalizar la calidad en los casos de uso de voz habituales.
Graba cada llamada, revisa los fallos cada semana e itera la conversación de forma continua. Los agentes de voz se degradan en silencio porque nadie escucha las llamadas. Monta una revisión semanal en la que el equipo escuche entre 10 y 20 llamadas fallidas tomadas al azar, identifique el patrón y actualice la conversación o la lógica de enrutamiento. Este ciclo continuo es lo que separa los agentes que mejoran con el tiempo de los que empeoran en silencio a medida que se acumulan los casos límite. Cuesta entre 2 y 4 horas por semana y se recupera en forma de mayor tasa de resolución autónoma.
Lanza con un solo idioma. Admitir varios idiomas suma entre un 25 % y un 30 % al coste de desarrollo por cada idioma y complica bastante las pruebas conversacionales. Si el 80 % de tus llamadas entrantes son en inglés, lanza solo en inglés y deriva el resto a una persona. Añade idiomas en función del volumen real de llamadas por idioma, no de suposiciones sobre tu base de clientes. La mayoría de los equipos lanza un soporte multilingüe que nadie usa, porque imaginó una demanda que nunca llegó.
Aplaza las integraciones que no sean clave para el caso de uso del lanzamiento. Empieza con la única integración imprescindible (normalmente el calendario para las reservas, o el CRM para el contexto de soporte) y añade el resto según lo que pida de verdad la gente que llama. Cada integración suma entre 40 y 120 horas, más su mantenimiento continuo, y las que construyes de forma especulativa suelen ser las primeras en romperse, precisamente porque nadie las usa lo suficiente como para detectarlo. El lanzamiento más acotado posible es el que sale antes y el que te da datos reales para decidir qué construir después.
Coste de un agente de voz según el volumen
| Stack | Coste de construcción | Coste por minuto | Coste mensual @10K min |
|---|---|---|---|
| Gestionado (Retell) | $25K–$55K | $0.12–$0.30/min | $1.2K–$3K/mo |
| Best-of-breed | $40K–$85K | $0.08–$0.20/min | $800–$2K/mo |
| Self-hosted | $70K–$150K | $0.03–$0.08/min | $300–$800/mo + infra |
FAQ
Preguntas que recibimos cada semana
Respuestas cortas en lenguaje claro. Si tu pregunta no está aquí,
Inversión inicial: 25.000–150.000 $. Coste por minuto: 0,08–0,30 $. Un agente que gestiona 10.000 minutos al mes cuesta entre 800 y 3.000 $ mensuales, además del desarrollo.
Plataformas gestionadas (Retell, Vapi) cuando buscas salir rápido al mercado. Best-of-breed (Deepgram + Claude + ElevenLabs) cuando priorizas calidad y control. Infraestructura propia cuando manejas mucho volumen o tienes requisitos estrictos de privacidad.
En tareas bien acotadas (reservas, preguntas frecuentes, primer filtrado), sí: resuelven entre el 70 % y el 90 % de las llamadas sin intervención humana. En soporte complejo se ocupan del primer nivel y derivan el resto. La sustitución total es poco habitual.
En tareas muy acotadas, su voz es indistinguible de la de una persona. En conversaciones abiertas, todavía se nota que es una IA, aunque suele resultar aceptable. El reto que queda por resolver: gestionar las interrupciones y el habla poco clara.
Inglés, español, francés, alemán y portugués funcionan de maravilla. Árabe, turco y mandarín son viables, pero conviene probarlos a fondo. Las lenguas tonales todavía arrastran una brecha de calidad frente al inglés.
MVP con stack gestionado: 4–8 semanas. Best-of-breed: 8–14 semanas. Infraestructura propia: 12–20 semanas. Suma otras 4–8 semanas para las integraciones y para afinar la conversación.
Speech-to-text: 95–98 % de acierto por palabra en inglés. Razonamiento del LLM: 90–95 % en tareas bien acotadas. Tasa de éxito de principio a fin (la persona logra su objetivo): 70–90 % según el alcance.
Llamadas atendidas × (coste por llamada de una persona − coste por llamada de la IA). Un agente a 0,20 $/min frente a una persona a 3 $/min ahorra 2,80 $/min. En 10.000 minutos al mes son 28.000 $ ahorrados, menos los 65.000 $ del desarrollo, amortizados.
Por ambos. Por teléfono mediante Twilio, Vonage o el SIP de Telnyx. Por WhatsApp mediante la API de Meta Business. La lógica de la conversación es la misma; solo cambia el adaptador de cada canal.
Lo ideal es detectar las señales de fallo (aclaraciones repetidas, frustración de quien llama) y pasar la llamada a una persona con todo el contexto. Una transferencia mal resuelta es el mayor problema de experiencia de los agentes de voz en producción.
Herramientas similares
Otras calculadoras que la mayoría abre justo después de esta; elige la que encaje con tu próxima decisión.
Coste de desarrollo más coste mensual de operación; la foto completa.
Obtén una estimación precisa de nuestro equipo
Las calculadoras te dan un rango. Una llamada de 30 minutos te da alcance, plazo y presupuesto cerrados. Consulta gratuita, sin compromiso.
Iniciar la conversación