Coste por resolución, no coste por minuto: una metodología para fijar el precio de los agentes de voz
Resumen
Los proveedores de agentes de voz cotizan el precio en dólares por minuto. Los compradores pagan por incidencias de cliente resueltas, no por minutos. Este artículo cierra esa brecha. Definimos una fórmula de coste por resolución que compone precio por minuto, tiempo medio de gestión, tasa de contención y coste del escalado humano en un único número, y la aplicamos a cuatro stacks públicos: Retell AI a $0.31/min, un stack descompuesto al estilo Vapi a $0.243/min, un stack autoalojado de Pipecat + Deepgram + Claude Haiku + ElevenLabs Flash + Twilio a aproximadamente $0.105/min, y un proveedor empresarial de voice-AI con un precio mínimo de $0.50/min y una contención comprometida de 0.55. Los rangos de contención se remontan al benchmark τ-Voice, y el coste de escalado a la divulgación pública de un proveedor de $7.40 por llamada. El ejercicio produjo dos inversiones de ranking: Vapi era el segundo más barato por minuto y el último por resolución; el proveedor empresarial era el más caro por minuto y el segundo más barato por resolución. El coste por resolución osciló entre $5.29 y $7.15 en los cuatro stacks, frente a diferencias por minuto de casi 5×. Una rejilla de sensibilidad bidimensional sobre los desplazamientos de contención y el coste de escalado muestra que el orden del ranking lo determina el coste de escalado, no el precio por minuto; la inversión entre el Stack D y Retell aparece en cada E ≥ $8.80 con independencia del desplazamiento de contención. El análisis de sensibilidad recupera la regla del centro de contacto según la cual una mejora de un punto en la resolución en la primera llamada reduce el coste operativo en un punto, y una derivación de Erlang C en el apéndice demuestra que el término de escalado de la fórmula se reduce al modelo estándar de dimensionamiento de personal. Los equipos de compras que evalúan a los proveedores de agentes de voz por el $/min están optimizando el número equivocado; la metodología de este artículo les da el correcto.
1. Introducción
Un comprador de un agente de voz se sienta frente a un proveedor que cotiza $0.31 por minuto. El presupuesto del comprador está expresado en incidencias de cliente resueltas, no en minutos. La cotización del proveedor y el presupuesto del comprador están en unidades distintas, y casi toda comparación pública de stacks de agentes de voz se alinea con la unidad del proveedor, no con la del comprador. Escribimos este artículo porque se nos acabó la paciencia con esa asimetría en las reuniones de compras.
La pregunta empírica es acotada. Dado un stack de agente de voz con un precio por minuto conocido, un tiempo medio de gestión conocido, una tasa de contención conocida y un coste de respaldo conocido cuando el agente escala a un humano, ¿cuál es la forma correcta de calcular el coste de una llamada resuelta? Y una vez que ese número existe, ¿coinciden los rankings que produce sobre stacks públicos reales con los rankings que produce el precio por minuto? Si los rankings coinciden, la elección de la unidad es cosmética y los equipos de compras pueden seguir usando la unidad que cotizan los proveedores. Si los rankings difieren, la elección de la unidad es en sí misma una decisión de compras, y un comprador que evalúa a los proveedores por el precio por minuto queda expuesto a un error estructural que la hoja de cálculo no señala.
Tres observaciones motivan la pregunta. Primera: toda comparación de precios de proveedores que revisamos cotiza tarifas por minuto [14, 15, 16, 17] sin componerlas en una cifra por resolución, aunque los mismos autores reconocen que la contención es lo que impulsa el coste real [15]. Segunda: la literatura de operaciones de centros de contacto sabe desde hace al menos una década que el coste por contacto enmascara el coste del retrabajo. Belfiore cuantificó una brecha de 10 puntos en la resolución en la primera llamada como $1.2M de coste anual evitable en una operación de 1M de llamadas [2], y la subcontratación de pago por resolución ya es un formato de compras con tarifas de lista de $1 a $7 [5]. La unidad es significativa para el comprador. Tercera: el benchmark τ-Voice reporta tasas de finalización de tarea de los agentes de voz del 31 al 51% en condiciones limpias y del 26 al 38% con ruido realista [19], de modo que la variable que fija el coste por resolución se mueve más de lo que admiten los blogs de los proveedores. La regla de composición que convierte estas entradas en un número comparable no parece haberse publicado.
Un lector podría preguntar, con razón, por qué tiene que existir un artículo metodológico sobre una fórmula de cuatro entradas. La razón es que las cuatro entradas provienen de cuatro literaturas distintas (páginas de precios de proveedores, operaciones de centros de contacto, benchmarking de agentes de voz y un coste laboral divulgado por un proveedor) y ninguna fuente publicada las compone. Las páginas de precios de los proveedores se detienen en las tarifas por minuto [14, 16, 17]; la literatura académica de benchmarking de agentes de voz [18, 19, 20] reporta la finalización de tareas como métrica de calidad sin traducirla en coste; la literatura de centros de contacto define el coste por resolución conceptualmente [4, 7] pero es anterior al stack de costes de la IA; y los modelos de dimensionamiento de personal de la gestión de operaciones [1, 26] describen el lado humano de la sustitución pero no el lado de la IA. Cada pieza está publicada. La composición no.
Nuestras contribuciones son: (1) una fórmula de coste por resolución en forma cerrada que compone precio por minuto, tiempo de gestión, contención y coste por escalado; (2) un ejemplo trabajado sobre cuatro stacks reales de agentes de voz (Retell AI, un stack al estilo Vapi descompuesto por componentes, un stack autoalojado best-of-breed y un proveedor empresarial de voice-AI con precio mínimo) usando precios de lista públicos y rangos de contención de benchmarks públicos; (3) dos inversiones de ranking entre el orden por minuto y el orden por resolución que muestran que la elección de la unidad cambia la decisión de compras; (4) una rejilla de sensibilidad bidimensional sobre el desplazamiento de contención y el coste de escalado que identifica el coste de escalado, y no el precio por minuto, como el motor estructural del orden del ranking; y (5) una derivación de Erlang C en el apéndice que fundamenta el término de escalado de la fórmula en el modelo estándar de dimensionamiento de personal de la literatura de gestión de operaciones [1, 26].
El artículo se estructura como sigue. La Sección 2 repasa los dos linajes, la economía unitaria del centro de contacto y la economía de la inferencia de LLM, que tocan el problema sin resolverlo. La Sección 3 especifica la fórmula, los cuatro stacks, el diseño del ejemplo trabajado y las entradas que mantuvimos constantes. La Sección 4 reporta la tabla de cuatro stacks, las dos inversiones de ranking y la rejilla de sensibilidad multivariable. La Sección 5 analiza qué significan las inversiones de ranking para las compras, por qué domina el término de escalado y dónde falla la fórmula. La Sección 6 enumera lo que la metodología no puede concluir. La Sección 7 cierra. El Apéndice A deriva el término de escalado a partir de Erlang C.
3. Método
Este artículo es un artículo metodológico en el sentido de paper-research-method: la fórmula es la contribución, el ejemplo trabajado existe para demostrar que la fórmula produce rankings útiles y no obvios, y el análisis de sensibilidad existe para demostrar que la fórmula recupera una regularidad empírica conocida de trabajos previos. No realizamos nuevas mediciones. Compusimos entradas que existen de forma publicada en una sola regla, aplicamos esa regla a cuatro stacks públicos reales y sometimos el resultado a prueba de estrés.
3.1 La fórmula
Sea p el precio de lista por minuto de un stack de agente de voz en dólares, T el tiempo medio de gestión de una llamada contenida en minutos, c la tasa de contención como fracción en [0, 1], y E el coste por llamada del escalado humano en dólares. Definimos el coste por resolución como
Cres = (p · T) / c + (1 − c) · E
El primer término es el precio por minuto multiplicado por el tiempo de gestión, dividido por la contención. Responde a la pregunta: cuando contamos como resoluciones solo las llamadas resueltas por IA, ¿cuánto cuesta cada una en gasto de minutos de agente, dado que también pagamos por los minutos de cada llamada que no se resolvió? El segundo término es la prima de escalado esperada por llamada entrante: con probabilidad (1 − c) la llamada se escala, y cada escalado incurre en un coste E. Los dos términos suman una única cifra en dólares por resolución.
La construcción es deliberadamente simple. Trata el stack de IA como un servicio de coste marginal fijo que se paga por minuto con independencia de si la llamada se resuelve, y trata el escalado humano como un coste fijo por llamada; el planteamiento estándar de los centros de contacto en [3, 8]. No amortiza el coste de construcción, no incluye precios mínimos de licencia ni mínimos de plataforma, y no acredita la desviación aguas arriba (llamadas que nunca llegan al agente por el autoservicio en el IVR). Cada uno de estos se nombra en el §6 como limitación.
La fórmula compone las cuatro entradas que los proveedores cotizan de forma inconsistente. El precio por minuto p está publicado en toda página de precios de proveedor [14, 16]. El tiempo de gestión T es una medición del lado del comprador disponible en cualquier registro histórico de llamadas. La contención c es la ratio especificada en [12] y medida de extremo a extremo en [19]. El coste de escalado E es el coste por llamada de derivar la llamada a un agente humano; la cifra que Replicant divulgó en $7.40 [8] y la cifra que Belfiore usó en $8.00 [2]. Adoptamos $7.40 como proxy del ejemplo trabajado porque es la divulgación más reciente y la fuente publica junto a ella el comparador por llamada de IA. El Apéndice A muestra que esta cifra es coherente con el modelo de dimensionamiento de Erlang C de [1, 26] bajo un coste laboral cargado en el rango de $50/h, una ocupación cercana a 0.85 y un factor de 1.5× para llamadas de seguimiento.
3.2 Los cuatro stacks
Aplicamos la fórmula a cuatro stacks de agentes de voz elegidos para abarcar la forma del mercado público, desde la configuración autoalojada más barata hasta el nivel empresarial de precio más alto.
Stack A, Retell AI, es una plataforma de agentes de voz gestionada de extremo a extremo con un precio de una única tarifa por minuto que incluye STT, LLM, TTS y telefonía. Usamos $0.31/minuto, la tarifa que Retell publica junto a su comparación con la competencia [14].
Stack B, descompuesto al estilo Vapi, es un orquestador gestionado que expone los componentes subyacentes y los factura por separado. Siguiendo la disciplina de descomposición publicada por Ahmed [15], compusimos STT a $0.05/min, LLM a $0.06/min para un modelo de clase OpenAI, TTS a $0.07/min para una voz de clase ElevenLabs, telefonía a $0.013/min para la tarifa PSTN de Twilio y plataforma a $0.05/min, totalizando $0.243/min.
Stack C, autoalojado best-of-breed, es la configuración pública de menor coste: Pipecat como orquestador, Deepgram para STT en streaming, Claude Haiku 4.5 como LLM, ElevenLabs Flash como TTS y Twilio como telefonía. Tomamos tarifas públicas aproximadas por componente y las compusimos en aproximadamente $0.105/min. La cifra por minuto del Stack C es la más expuesta a supuestos; la tratamos como una estimación defendible del límite superior del coste variable autoalojado y la divulgamos como tal.
Stack D, proveedor empresarial de voice-AI, modela el nivel de precio mínimo de una plataforma importante de centro de contacto; NICE, Genesys Cloud, Verint o similar; compuesto de minutos de voice-AI más tarifas de plataforma, ajuste de servicios profesionales y un gasto mínimo comprometido a alto volumen. El precio de voice-AI publicado por CloudTalk de $0.50/min PAYG y $350/mes por 1.000 minutos [16] y la comparación de proveedores de Retell [14] reportan tarifas de nivel empresarial en el rango de $0.45-$0.66/min con las tarifas de plataforma amortizadas. Adoptamos $0.50/min como el mínimo del ejemplo trabajado y lo emparejamos con un compromiso de contención de 0.55, cerca del extremo superior del rango limpio de τ-Voice [19], sobre la base de que los proveedores empresariales suelen incluir un equipo de ajuste dedicado y SLA comprometidos que elevan la contención por encima del rango de arranque en frío. Por tanto, el Stack D somete a prueba de estrés la fórmula en el extremo alto del precio acoplado al extremo alto de la contención comprometida; el escenario de compras en el que el comprador paga explícitamente por una garantía de contención.
Para los valores de contención de los stacks A-C, anclamos el ejemplo trabajado en los rangos de finalización de tarea reportados por τ-Voice [19]: del 31 al 51% en condiciones limpias y del 26 al 38% con ruido realista. Elegimos un punto medio defendible por stack con justificación explícita en lugar de cifras publicadas por los proveedores, porque la contención publicada por los proveedores está condicionada a cargas de trabajo que el comprador no controla [20] y no es directamente comparable entre proveedores. Retell recibió una contención de 0.45, cerca del extremo superior del rango limpio de τ-Voice, justificada por el ajuste de la plataforma hacia los flujos comunes de atención al cliente. Vapi recibió 0.38, en la frontera entre los rangos limpio y ruidoso de τ-Voice, justificada por ser Vapi una capa de orquestación más delgada que traslada más responsabilidad de ajuste del stack al comprador; en un escenario de compras de arranque en frío, la contención real está más cerca del rango ruidoso. Autoalojado recibió 0.42, entre Retell y Vapi, justificada por que los componentes best-of-breed ofrecen calidad de media, pero la ausencia de ajuste del lado de la plataforma deprime la cifra respecto a un stack gestionado. Stack D recibió 0.55, justificada por el equipo de ajuste dedicado y el compromiso de SLA que suele llevar aparejado el contrato de precio mínimo.
Para el tiempo medio de gestión usamos un valor típico del sector de 4 minutos como línea base [3], y ejecutamos sensibilidad a 2.5, 4 y 6 minutos para cubrir el tramo realista entre llamadas sencillas tipo FAQ y llamadas de servicio más largas de varios pasos.
Para el coste de escalado usamos $7.40 por llamada [8]. La cifra es una divulgación de un proveedor y se publicó como el comparador del agente humano frente al stack de IA que el proveedor vende; el mismo artículo la trata como el coste operativo por llamada de la gestión humana, que es el papel en el que la situamos. También ejecutamos la rejilla multivariable del §4.4 a lo largo de E ∈ {$5, $7.40, $10, $15} para cubrir mercados laborales desde la subcontratación de bajo coste hasta sectores regulados de alto coste donde los escalados conllevan penalizaciones por transferencia en frío [10].
3.3 El diseño del ejemplo trabajado
Nos comprometimos de antemano con cinco análisis antes de calcular ningún número. Primero, la tabla de cuatro stacks con las entradas de línea base: T = 4, contención según el §3.2, E = 7.40. Segundo, la comparación de rankings entre el orden por minuto y el orden por resolución de los cuatro stacks. Tercero, un análisis de sensibilidad de una variable a la vez sobre Retell como stack de referencia: contención en c ± 0.10, tiempo de gestión en T × {0.625, 1.5} (es decir, 2.5 y 6 minutos) y coste de escalado en 2E. Cuarto, una sensibilidad solo de contención sobre Vapi para probar la robustez de la inversión de ranking; en concreto, la contención a la que el coste por resolución de Vapi cruza el de Retell. Quinto, una rejilla bidimensional sobre el desplazamiento de contención Δc ∈ {−0.10, −0.05, 0, +0.05, +0.10} (aplicado de manera uniforme a la c de línea base de cada stack) y el coste de escalado E ∈ {$5, $7.40, $10, $15}, reportando el orden del ranking en cada celda. Nos comprometimos de antemano a reportar cualquier inversión de ranking como hallazgo real solo si sobrevive a una perturbación de ±0.05 en la contención relevante, porque una inversión de ranking que desaparece bajo un error de supuesto de medio punto porcentual no es robusta.
3.4 Lo que la metodología no incluye
Excluimos deliberadamente cuatro cosas. Coste de construcción. Los stacks autoalojados conllevan un capex de ingeniería que los stacks gestionados no [17]; incluirlo requiere una regla de amortización que depende del volumen de llamadas y de la vida del proyecto, ambos específicos del comprador. Lo tratamos como una etapa aparte de la decisión de compras y lo discutimos de forma cualitativa en el §5. Precios mínimos de licencia y mínimos. Varias cotizaciones de proveedores incluyen mínimos mensuales o licencias por puesto [16] que doblan la tarifa por minuto a bajo volumen. Modelamos el régimen de alto volumen en el que estos quedan amortizados. Repetidores. La contención puede enmascarar patrones de repetidores [11]; nuestra c es la contención de una sola llamada, no neta de repeticiones. Resolución ajustada por calidad. Una llamada resuelta con bajo CSAT sigue siendo una resolución en la fórmula; ponderar por satisfacción es un ajuste aguas abajo que no hicimos. Cada uno de estos se nombra de nuevo en el §6.
3.5 Reproducibilidad
La fórmula y las entradas están completamente especificadas arriba. Un lector puede reejecutar el ejemplo trabajado en una hoja de cálculo en menos de cinco minutos. Las cuatro filas de entrada de proveedores se remontan a las entradas bibliográficas [14], [15], [16] y a una composición aproximada por componentes públicos para el Stack C; los rangos de contención se remontan a [19]; el coste de escalado se remonta a [8]. No realizamos nuevas mediciones, y no hay semillas aleatorias, especificaciones de hardware ni protocolos de prueba que divulgar. La carga de reproducibilidad de un artículo metodológico es la especificación de la fórmula, que figura en el §3.1, y la tabla explícita de entradas del §4.1.
3.6 Por qué importa un cuarto stack
El ejemplo trabajado original de tres stacks cubría la forma del mercado público; totalmente gestionado, gestionado-descompuesto y autoalojado; pero no llegaba al régimen con el que los equipos de compras se topan con más frecuencia en sectores regulados: el proveedor empresarial de voice-AI con precio mínimo y mínimos comprometidos. El Stack D llena ese vacío. Pone a prueba la fórmula en el régimen donde el precio por minuto es más alto y la contención también es más alta, porque el precio mínimo financia el equipo de ajuste dedicado que eleva la contención. Este es el escenario de compras en el que un director financiero sospecha con más frecuencia que está pagando de más; la tarifa por minuto es de dos a cinco veces la de las alternativas más baratas, pero el proveedor argumenta que el precio se justifica por un compromiso de contención que las alternativas más baratas no ofrecen. La fórmula es la regla de decisión que permite al director financiero comprobar si el argumento se sostiene. Sin el Stack D, el ejemplo trabajado cubre solo el régimen donde el precio más alto viene con una contención marginalmente más alta; con el Stack D, el ejemplo trabajado cubre el régimen donde el precio más alto viene con una contención materialmente más alta, que es estructuralmente distinto. La Sección 4.4 muestra el cruce: en cada coste de escalado por encima de $8.80, el Stack D supera a Retell en coste por resolución pese a costar 1.6× más por minuto; en cada coste de escalado por encima de $6.34, el Stack D supera a Vapi pese a costar 2.1× más por minuto. La pregunta de compras deja de ser si el proveedor empresarial de precio mínimo está sobrevalorado y pasa a ser si el coste de escalado del comprador se sitúa por encima o por debajo del cruce.
4. Resultados
4.1 Línea base de cuatro stacks
La Tabla 1 reporta la salida de la fórmula con las entradas de línea base. La columna más a la derecha es la cifra de coste por resolución que el artículo argumenta que debería reemplazar al precio por minuto como titular de compras.
| Stack | p ($/min) | T (min) | c | (p·T)/c ($) | (1−c)·E ($) | Cres ($) | Cuota esc. |
|---|---|---|---|---|---|---|---|
| Retell AI | 0.310 | 4.00 | 0.45 | 2.76 | 4.07 | 6.83 | 60% |
| Descompuesto al estilo Vapi | 0.243 | 4.00 | 0.38 | 2.56 | 4.59 | 7.15 | 64% |
| Autoalojado best-of-breed | 0.105 | 4.00 | 0.42 | 1.00 | 4.29 | 5.29 | 81% |
| Stack D, mínimo empresarial | 0.500 | 4.00 | 0.55 | 3.64 | 3.33 | 6.97 | 48% |
El coste por resolución osciló entre $5.29 y $7.15 en los cuatro stacks, una diferencia de aproximadamente el 35%. La diferencia por minuto en los mismos stacks era del 376% ($0.105 a $0.50). La elección de la unidad comprime la diferencia aparente entre proveedores en más de 10×, lo que es en sí mismo la señal de compras: las diferencias por minuto adelgazan drásticamente una vez que se convierten en la unidad que paga el comprador.
El término de escalado (1 − c) · E aportó la mayor parte de la cifra de coste por resolución en todos los stacks salvo el Stack D; 60% para Retell, 64% para Vapi, 81% para el autoalojado y 48% para el nivel empresarial. Este es el resultado estructural que motiva el §5: el coste por resolución es una métrica dominada por el coste de escalado para cualquier stack actual de agente de voz con contención por debajo de aproximadamente 0.5, y el orden del ranking lo fija, por tanto, la contención y no el precio por minuto. El Stack D es el único stack del ejemplo que baja del 50% de cuota de escalado, y lo hace porque su contención comprometida de 0.55 reduce la proporción de llamadas que arrastran la prima de escalado de $7.40 sobre cada resolución.
4.2 Inversiones de ranking
La Tabla 2 contrasta el ranking por minuto con el ranking por resolución.
| Stack | Ranking por minuto | Ranking por resolución | Veredicto |
|---|---|---|---|
| Autoalojado best-of-breed | 1 ($0.105/min) | 1 ($5.29/res) | Ganador estable |
| Descompuesto al estilo Vapi | 2 ($0.243/min) | 4 ($7.15/res) | Cae dos puestos |
| Retell AI | 3 ($0.310/min) | 2 ($6.83/res) | Sube un puesto |
| Stack D, mínimo empresarial | 4 ($0.500/min) | 3 ($6.97/res) | Sube un puesto |
Emergen dos inversiones de ranking en la línea base. La primera, entre Retell y Vapi, es la inversión ya presente en la versión de tres stacks del análisis: la mayor contención de Retell (0.45 frente a 0.38) reduce la proporción de llamadas que incurren en el coste de escalado de $7.40 lo suficiente como para superar la brecha de precio de $0.067/min en los propios minutos de agente. La segunda inversión, más llamativa, es el Stack D, que cuesta 1.6× Retell por minuto y 2.1× Vapi por minuto pero es más barato por resolución que Vapi en $0.18 (2.5%). El mecanismo es el mismo que el de la primera inversión pero más pronunciado: la contención comprometida de 0.55 del Stack D reduce la cuota de escalado del coste del 64% (Vapi) al 48%, y la prima absoluta de escalado de $4.59 a $3.33. La reducción del 17% en el coste de escalado por llamada le compra al comprador un stack que cuesta más por minuto y menos por resolución, que es estructuralmente el argumento de compras que hacen los proveedores empresariales de voice-AI.
Vapi cae del segundo más barato por minuto al último por resolución. Esta es la mayor desviación de ranking que la fórmula identifica en el ejemplo trabajado, y aquella en la que una decisión de compras anclada en el precio por minuto produciría el peor resultado.
4.3 Sensibilidad de una variable
Nos comprometimos de antemano a perturbar una variable a la vez sobre la línea base de Retell y a una perturbación solo de contención sobre Vapi. La Tabla 3 reporta las cuatro perturbaciones.
| Perturbación | Stack | p ($/min) | T (min) | c | E ($) | Cres ($) | Δ |
|---|---|---|---|---|---|---|---|
| Contención −10 pts | Retell | 0.310 | 4.00 | 0.35 | 7.40 | 8.35 | +22% |
| Contención +10 pts | Retell | 0.310 | 4.00 | 0.55 | 7.40 | 5.58 | −18% |
| AHT 2.5 / 6.0 min | Retell | 0.310 | 2.5 → 6.0 | 0.45 | 7.40 | 5.79 → 8.20 | −15% / +20% |
| Coste de escalado ×2 | Retell | 0.310 | 4.00 | 0.45 | 14.80 | 10.90 | +60% |
| Contención +5 pts | Vapi | 0.243 | 4.00 | 0.43 | 7.40 | 6.48 | −9% |
Tres observaciones emergen de la Tabla 3. Primera: la contención movió el coste por resolución en aproximadamente un 20% por cada 10 puntos porcentuales en torno a la línea base, una elasticidad cercana a 1:1 que recupera la regla empírica de SQM citada por [6]: una mejora de un punto en la resolución en la primera llamada produce una reducción de un punto en el coste operativo. Nuestra metodología no se diseñó para reproducir esta regularidad, y el hecho de que lo haga es señal de que la regla de composición no es patológica. Segunda: el coste de escalado fue la variable de mayor impacto: duplicar E aumentó el coste por resolución de Retell en un 60%, más de tres veces el movimiento de una oscilación de contención de 10 puntos. Tercera: la inversión de ranking Retell-frente-a-Vapi sobrevivió a la comprobación de robustez preregistrada. Una perturbación al alza de 5 puntos sobre la contención de Vapi (a 0.43) llevó su coste por resolución a $6.48, por debajo de la línea base de $6.83 de Retell. La inversión se revierte si la contención real de Vapi está medio punto por encima de la de Retell. Tratamos la inversión de ranking como un hallazgo real bajo las entradas que usamos, no como uno robusto frente a todas las entradas plausibles; que es precisamente el argumento del artículo. La elección de la unidad cambia el ranking, y el ranking es sensible a una variable que los proveedores no miden de forma consistente.
4.4 Sensibilidad multivariable: una rejilla (Δc, E)
La sensibilidad de una variable del §4.3 mantiene fijas tres variables y mueve la cuarta. Los equipos de compras rara vez se enfrentan a ese cuadro. Las decisiones reales de compras covarían la contención y el coste de escalado: un comprador de servicios financieros de gama alta afronta a la vez un coste de escalado más alto (mano de obra cargada, traspaso regulado) y una contención menor que la línea base (filtrado de PII, tráfico multilingüe). Un comprador de retail afronta lo contrario (bajo coste de escalado, alta contención). Para que la fórmula sea útil en la capa de compras, ejecutamos una rejilla bidimensional sobre el desplazamiento de contención y el coste de escalado, manteniendo el tiempo de gestión fijo en 4 minutos y el precio por minuto fijo en la línea base de cada stack.
El desplazamiento Δc se aplica de manera uniforme a la c de línea base de cada stack del §3.2; por ejemplo, en Δc = −0.05, la contención efectiva de Retell es 0.40, la de Vapi es 0.33, la del autoalojado es 0.37 y la del Stack D es 0.50. Esto trata Δc como un modificador del dominio del comprador; un reflejo de cuán lejos se sitúa la mezcla de llamadas del comprador respecto a la línea base de τ-Voice, en lugar de una perturbación de rendimiento por stack. La Tabla 4 reporta el orden del ranking en cada celda.
| Δc \ E | $5 | $7.40 | $10 | $15 |
|---|---|---|---|---|
| −0.10 | S < R < V < D | S < R < D < V | S < D < R < V | S < D < R < V |
| −0.05 | S < R < V < D | S < R < D < V | S < D < R < V | S < D < R < V |
| 0.00 (línea base) | S < R < V < D | S < R < D < V | S < D < R < V | S < D < R < V |
| +0.05 | S < R < V < D | S < R < D < V | S < D < R < V | S < D < R < V |
| +0.10 | S < R < V < D | S < R < D < V | S < D < R < V | S < D < R < V |
La rejilla produce un resultado estructural llamativo: el orden del ranking lo fija casi por completo E, no Δc. Leyendo hacia abajo cualquier columna, el ranking es idéntico en cada desplazamiento de contención. Leyendo a lo ancho de cualquier fila, el ranking cambia a medida que sube el coste de escalado. Los cruces son nítidos:
- En
E = $5(mano de obra subcontratada de bajo coste, tráfico de retail de un solo idioma), el precio por minuto sigue ganando. El Stack D, el más caro por minuto, es el más caro por resolución. - En
E = $7.40(la línea base de divulgación pública [8]), el Stack D pasa al puesto 3; superando a Vapi, el segundo más barato por minuto, pese a costar 2.1× más por minuto. - En
E ≥ $10(sectores regulados, mano de obra cargada empresarial), el Stack D pasa al puesto 2, superando también a Retell. El mínimo empresarial es la segunda mejor opción por resolución en cada celda conE ≥ $10.
Los puntos de cruce se calculan directamente a partir de la fórmula. Igualando Cres(D) = Cres(Retell) y resolviendo: E = (pD · T / cD − pR · T / cR) / (cD − cR) = ($3.636 − $2.756) / 0.10 = $8.80. Por debajo de E = $8.80, Retell es más barato por resolución; por encima, lo es el Stack D. El mismo álgebra sitúa el cruce entre el Stack D y Vapi en E = $6.34, que es la razón por la que el Stack D ya supera a Vapi en la línea base divulgada de $7.40. Estos umbrales de cruce son los números operativos que un equipo de compras debería calcular contra su propio coste de escalado cargado, porque reducen la comparación de cuatro stacks a una regla de decisión de una sola línea.
La robustez del ranking frente a las perturbaciones de Δc refleja una característica estructural de la fórmula: el orden del ranking lo fija la brecha de contención entre stacks, no el nivel absoluto. Desplazar la contención de todos los stacks en la misma cantidad preserva la brecha, de modo que el ranking no cambia. Este es un hallazgo significativo para las compras porque la brecha entre stacks (el compromiso de contención del Stack D menos la contención de arranque en frío de los stacks más baratos) es la variable que controla un proveedor, mientras que el nivel absoluto es función de la mezcla de llamadas del comprador, que el proveedor no controla. La fórmula aísla la señal relevante para las compras del ruido específico del comprador.
5. Discusión
El resultado que nos sorprendió en el ejemplo trabajado original de tres stacks no fue la inversión de ranking en sí, sino lo estrecho que era el margen. La versión de cuatro stacks agudiza la sorpresa. El Stack D, el más caro por minuto, es el segundo más barato por resolución con el coste de escalado de línea base divulgado y el segundo más barato por resolución con cada coste de escalado superior. El argumento de compras que hacen los proveedores empresariales de voice-AI; que el precio mínimo compra un compromiso de contención que se paga por sí mismo a alto coste de escalado; es, en este ejercicio, estructuralmente correcto. La fórmula da al equipo de compras el umbral a partir del cual el argumento se vuelve correcto (E ≥ $8.80 frente a Retell, E ≥ $6.34 frente a Vapi), que es la conversación que el equipo de compras necesita tener con el proveedor.
El hallazgo estructural, que el término de escalado (1 − c) · E domina el coste por resolución para cualquier stack con contención por debajo de aproximadamente 0.5, no es nuevo en la literatura de centros de contacto [2, 6] pero está en gran medida ausente de la literatura de proveedores de agentes de voz. La contención domina porque cada llamada sin resolver arrastra el coste de una llamada entera gestionada por humanos al libro de la IA, y las llamadas gestionadas por humanos son un orden de magnitud más caras que las gestionadas por IA [8]. Esta es la razón por la que el objetivo de Sharma de contención >70% para estar listo en producción [12] tiene la forma correcta, aunque el corte concreto sea convención y no derivación. Por debajo del 70%, el agente de IA se paga por sí mismo pero sigue dejando la mayor parte del coste operativo en el lado humano; por encima del 70%, la sustitución empieza a dominar. El Stack D en nuestro ejemplo trabajado se sitúa en 0.55, razón por la que su cuota de escalado es la más baja de la Tabla 1 (48%) y aun así representa casi la mitad del coste total.
Creemos que los proveedores no cotizan en unidades de resolución por dos razones. La primera es mecánica: la contención no es una propiedad solo del stack del proveedor; depende de la mezcla de llamadas del comprador, de la cobertura de idiomas y del esfuerzo de ajuste, ninguno de los cuales puede comprometer de antemano el proveedor. Cotizar en unidades de resolución obligaría a los proveedores a asumir un riesgo de carga de trabajo que actualmente no ponen en precio. El mercado de subcontratación de pago por resolución de [5] es la prueba de existencia de que un proveedor puede asumir riesgo de carga de trabajo si el modelo de precios se diseña para ello; los proveedores de voice-AI aún no han construido ese modelo de precios. La segunda es comercial: el precio por minuto dramatiza el margen entre proveedores. Retell a $0.31 frente a Vapi a $0.243 parece una diferencia significativa; $6.83 frente a $7.15 parece ruido. El Stack D a $0.50/min frente a Retell a $0.31/min parece una prima del 60%; $6.97 frente a $6.83 es una prima del 2%. Los proveedores que cotizan por minuto mantienen la conversación de compras en una diferencia que les favorece. La traducción a unidades de resolución devuelve la conversación a la diferencia que el comprador realmente paga.
¿Qué deberían hacer de forma distinta los equipos de compras tras leer este artículo? Tres cosas, por orden. Primera: pedir a todo proveedor de agentes de voz un compromiso de contención o, al menos, la contención que han observado en cargas de trabajo similares a la suya, con la carga de trabajo definida con la precisión suficiente para falsar la cifra. El mercado de subcontratación de pago por resolución documentado en [5] demuestra que esta conversación es posible. Segunda: ejecutar la fórmula del §3.1 contra el propio tiempo de gestión y el propio coste de escalado cargado en lugar de las cifras de este artículo. Ambos son datos del lado del comprador y suelen estar disponibles en el registro histórico de llamadas. Tercera: calcular los umbrales de cruce en la forma del §4.4: ¿a qué coste de escalado empatan cada par de stacks en coste por resolución? El umbral de cruce reduce una comparación de cuatro stacks a una regla de decisión de una sola línea contra el propio coste laboral del comprador. La calculadora de agentes de voz en /resources/tools/voice-agent-cost-calculator expone esta composición para las cifras del lado del comprador que un equipo de compras tiene más probabilidades de tener a mano.
Una nota sobre los stacks autoalojados. El Stack C produjo el coste por resolución más bajo en nuestra línea base, pero la metodología excluyó deliberadamente el coste de construcción. Los stacks autoalojados conllevan un capex de ingeniería que el análisis de TCO de Dograh valora a $150/h [17] y que, según señalan los autores, se recupera en meses a alto volumen pero no a bajo volumen. La forma correcta de incorporar el coste de construcción es como una amortización por resolución a lo largo de la vida del proyecto, (coste_de_construcción) / (resoluciones_totales_esperadas), sumada a Cres. Lo dejamos como un ajuste de segunda etapa porque es específico del comprador y la contribución del artículo es la regla de composición del coste variable. Un comprador con 1.000 minutos mensuales concluirá de forma distinta a un comprador con 100.000 minutos mensuales, y ambas conclusiones deberían derivarse de la misma regla de composición aplicada con el volumen de cada comprador.
5.1 Cuándo falla la fórmula
La fórmula compone cuatro entradas en un único número y produce órdenes de ranking limpios bajo un amplio rango de entradas plausibles. Hay tres regímenes en los que produce números engañosos, y un equipo de compras debería reconocerlos antes de aplicar la regla.
Contención extremadamente alta (c ≥ 0.85). A medida que c se acerca a 1, el término de escalado (1 − c) · E se acerca a cero y el término de coste de IA (p · T) / c se acerca a p · T. El coste por resolución converge en el gasto por minuto de una llamada contenida. En este régimen, la fórmula se reduce al precio por minuto escalado por el tiempo de gestión, y el orden del ranking coincide con el orden por minuto. Esto es coherente con la intuición; una vez que la IA gestiona esencialmente cada llamada sin escalado, la decisión de compras versa sobre el coste por minuto de agente y nada más; pero significa que la fórmula pierde su poder discriminante precisamente en el régimen que la literatura de proveedores [12] declara listo para producción. Un comprador que compara dos stacks comprometidos ambos con una contención del 90%+ no debería esperar que la fórmula identifique un ganador estructural; la diferencia a ese nivel está dominada por el precio por minuto y por el ajuste de coste de construcción que el §5 deja como consideración de segunda etapa.
Contención extremadamente baja (c ≤ 0.20). A medida que c se acerca a cero, el término de coste de IA (p · T) / c se dispara y el término de escalado se acerca a E. El coste por resolución se vuelve patológico porque casi cada llamada se escala y se paga por la IA por minutos que no contuvo. Este régimen es degenerado para cualquier stack de producción; un comprador no desplegaría con un 20% de contención en producción; pero aparece en la evaluación previa al ajuste, cuando un comprador está midiendo a un proveedor sobre tráfico de arranque en frío antes de hacer el trabajo de ajuste dedicado. Una medición previa al ajuste de c = 0.15 produce una cifra de Cres que sobrestima drásticamente el coste, porque la mayor parte del coste es el término de minutos de agente dividido por un denominador pequeño. Un equipo de compras que ejecute la fórmula contra datos piloto debería ajustar por esto reportando la cifra de coste por resolución junto a la trayectoria de contención, no como un número único.
Llamadas de seguimiento fuera de la contención de una sola llamada. La fórmula trata la llamada gestionada por humanos como el evento terminal de una trayectoria sin resolver. En la práctica, una llamada escalada puede producir ella misma contactos de seguimiento dentro de la ventana de resolución, y una llamada contenida puede producir contactos de seguimiento si la resolución de la IA no resolvió en realidad la incidencia subyacente. Belfiore [2] usa un factor de 1.5× para convertir las llamadas sin resolver en coste de seguimiento, y PolyAI [11] advierte específicamente de que la contención puede enmascarar a los repetidores. La E de la fórmula debe leerse como el coste cargado de toda la trayectoria escalada, no solo de la primera llamada gestionada por humanos; un comprador que use un proxy de solo coste laboral para E subestimará la prima de escalado en un 30-50%. La derivación de Erlang C del Apéndice A lo hace explícito: el equivalente de coste de dimensionamiento que produce nuestra cifra de línea base de $7.40 ya incluye el factor de 1.5× del volumen de seguimiento.
Un cuarto modo de fallo menos común merece señalarse: cuando el modelo de precios del comprador incluye mínimos de plataforma o licencias por puesto que doblan la tarifa por minuto a bajo volumen [16]. Nuestra fórmula modela el régimen de alto volumen en el que estos quedan amortizados; a bajo volumen, la tarifa efectiva por minuto es más alta que la tarifa publicada y el orden del ranking puede cambiar. Un comprador con menos de 1.000 minutos mensuales debería ejecutar la fórmula contra la tarifa efectiva por minuto del comprador (gasto mensual total dividido por los minutos), no contra el titular por minuto del proveedor.
6. Limitaciones
La metodología es una regla de composición, y una regla de composición es solo tan honesta como las entradas que compone. Nombramos las cosas concretas que este artículo no puede concluir.
Los precios de los proveedores son precios de lista, no tarifas negociadas. Retell a $0.31, la descomposición al estilo Vapi de $0.243 y el mínimo de $0.50 del Stack D son las tarifas que un comprador pagaría por autoservicio o como precio mínimo publicado; las compras empresariales producen de forma rutinaria descuentos del 30-50% en niveles de volumen por encima de 100.000 minutos mensuales, y no tuvimos acceso a cotizaciones negociadas. El orden del ranking de la Tabla 2 puede cambiar bajo precios empresariales realistas.
El precio por minuto del Stack D es la entrada de menor confianza del ejemplo trabajado. El precio de voice-AI empresarial es genuinamente opaco: precio mínimo, paquetes de servicios profesionales, descuentos por gasto comprometido y tarifas de plataforma se combinan en un equivalente por minuto que el proveedor rara vez publica. Nuestros $0.50/min provienen de la tarifa de voice-AI publicada por CloudTalk [16] y están corroborados por el límite superior de la comparación de proveedores de Retell [14], pero un comprador que firme un contrato de clase Stack D negociará contra la cotización real del proveedor, no contra un precio mínimo publicado. La inversión de ranking que reportamos en E ≥ $8.80 (el Stack D superando a Retell) es robusta a una perturbación de ±15% sobre la tarifa por minuto del Stack D, pero un comprador debería reejecutar la rejilla del §4.4 contra la tarifa negociada antes de extraer una conclusión de compras.
Los valores de contención son proxies de benchmark, no mediciones del dominio del comprador. τ-Voice [19] reporta la finalización de tareas en tareas fundamentadas de retail y aerolíneas, lo que está más cerca de una línea base previa al ajuste que de la contención posterior al ajuste que experimenta un comprador real tras tres a seis meses de iteración. Un comprador con un caso de uso limpio y bien acotado puede superar nuestras entradas en 10 a 20 puntos; un comprador con tráfico multilingüe, ruidoso o cargado de PII puede situarse por debajo de ellas. La contención de 0.55 del Stack D es la más alejada del ancla de τ-Voice y es la entrada más expuesta al sesgo de afirmación del proveedor; un equipo de compras debería exigir al proveedor que cotice un compromiso de contención contra una carga de trabajo definida en lugar de aceptar la cifra mínima por fe.
El coste de escalado es una divulgación de un único punto. Los $7.40/llamada provienen de la comparación publicada de un proveedor [8] y están calibrados a una mezcla de llamadas específica y a un mercado laboral específico. Los $8.00 de Belfiore [2] se sitúan dentro de un 8% de esa cifra, lo que aporta cierta triangulación, pero ninguno es un metanálisis. Un comprador en un mercado donde la mano de obra cargada de atención al cliente sea la mitad o el doble del rango divulgado calcularía cifras distintas de coste por resolución, y el orden del ranking de la Tabla 2 es sensible a esto. La rejilla del §4.4 cubre el rango realista de $5 a $15.
El precio por minuto del Stack C es una composición aproximada. El coste variable autoalojado depende del nivel de volumen de Deepgram, de si ElevenLabs Flash se compromete mensualmente o se paga por uso, de la tarifa regional de Twilio y de la mezcla de tokens de entrada/salida de Claude Haiku por llamada. Compusimos tarifas plausibles de nivel medio; un comprador cuidadoso reemplazaría nuestros $0.105 por su propia cifra basada en cotizaciones antes de extraer una conclusión de compras.
La rejilla multivariable del §4.4 es una muestra de 5×4 de una superficie continua. Una rejilla más fina o un gráfico de contornos revelaría los umbrales de cruce con mayor precisión; reportamos los umbrales analíticos de cruce en el §4.4 como los números operativos y tratamos la rejilla discreta como una ilustración de la estabilidad del ranking entre contextos de dominio del comprador. La rejilla no varía el tiempo de gestión ni el precio por minuto, ambos de los cuales desplazarían los cruces.
La fórmula no acredita la desviación aguas arriba. Las llamadas desviadas por el IVR o el autoservicio antes de llegar al agente de voz nunca entran en el denominador. Un stack que se integra bien con el IVR existente del comprador puede mostrar un peor coste por resolución mientras reduce el coste operativo total. La métrica es una comparación dentro del agente de voz, no una cuenta de resultados del centro de contacto.
La contención es una definición de una sola llamada. Usamos la contención como la ratio de llamadas que la IA resolvió sin escalado en una sola llamada. PolyAI [11] señala que esto puede enmascarar patrones de repetidores donde la misma incidencia vuelve a aparecer en un plazo de siete días. Una contención neta de repeticiones reduciría todos los valores de la Tabla 1; no la modelamos.
La resolución no se pondera por calidad. Una resolución que produce un bajo CSAT cuenta como resolución. La literatura sobre métricas de resolución ponderadas por calidad [4, 7] respalda un ajuste aguas abajo, y un comprador con un umbral duro de CSAT querría aplicar uno.
El ejemplo trabajado son cuatro stacks. Cuatro stacks abarcan la forma del mercado público (totalmente gestionado, gestionado-descompuesto, autoalojado, mínimo empresarial) pero no son exhaustivos. Una construcción interna en un banco importante, un proveedor especialista vertical en sanidad o un BPO offshore líder en costes con agentes aumentados por IA desplazarían cada uno el cuadro; no tuvimos divulgaciones públicas de precios para esos.
7. Conclusión
Definimos una fórmula de coste por resolución en forma cerrada para agentes de voz, la aplicamos a cuatro stacks públicos reales con entradas de línea base extraídas de páginas de precios de proveedores y de un benchmark público, y reportamos dos inversiones de ranking en las que el orden por minuto y el orden por resolución de esos stacks discreparon. Las cifras de coste por resolución oscilaron entre $5.29 y $7.15; una diferencia del 35% sobre stacks cuyas tarifas por minuto abarcaban un 376%. Una rejilla de sensibilidad bidimensional mostró que el orden del ranking lo fija el coste de escalado, no el desplazamiento de contención; los umbrales analíticos de cruce (el Stack D supera a Retell en E ≥ $8.80, supera a Vapi en E ≥ $6.34) reducen la comparación de cuatro stacks a una regla de decisión de una sola línea contra el propio coste laboral del comprador. La contención dominó la métrica y recuperó la regla 1:1 del centro de contacto entre las mejoras de resolución en la primera llamada y las reducciones de coste operativo, y el Apéndice A muestra que el término de escalado de la fórmula se reduce al modelo estándar de dimensionamiento de Erlang C de la literatura de gestión de operaciones. La regla de composición es la contribución. Los equipos de compras que evalúan a los proveedores de agentes de voz por la unidad que cotizan los proveedores están optimizando el número equivocado; la fórmula del §3.1 les da la unidad en la que realmente pagan.
Apéndice A. Derivación de Erlang C del término de escalado
El coste de escalado E del §3.1 es el coste por llamada de la gestión humana. Adoptamos $7.40 a partir de la divulgación pública de un proveedor [8] y señalamos que los $8.00 de Belfiore [2] se sitúan dentro de un 8% de esa cifra. Este apéndice muestra que la cifra divulgada es coherente con el modelo de dimensionamiento de Erlang C usado en el software de gestión de la fuerza de trabajo [1, 26], fundamentando el brazo de escalado de la fórmula en el linaje de la gestión de operaciones.
A.1 Dimensionamiento con Erlang C
En un centro de contacto atendido por humanos, el modelo de Erlang C da la probabilidad de que una llamada entrante quede en cola en lugar de ser atendida de inmediato, en función de la tasa de llegada λ (llamadas por hora), el tiempo medio de gestión Th (horas por llamada) y el número de agentes N [1]. La decisión de dimensionamiento es el menor N tal que la probabilidad de cola cae por debajo de un umbral objetivo de nivel de servicio (típicamente P(espera > 20s) ≤ 0.20).
Para un centro de contacto operando con una ocupación ρ = λ · Th / N, el coste laboral cargado por llamada atendida es
Cper_call = (Wloaded · Th) / ρ
donde Wloaded es el salario por hora cargado de un agente (salario base más beneficios, gastos de supervisión, instalaciones y herramientas, típicamente 1.4-1.6× el base [1]). Th es el tiempo medio de gestión incluyendo el trabajo posterior a la llamada. La ocupación ρ rara vez supera 0.85 en la práctica porque una ocupación mayor degrada el nivel de servicio [26].
Ejemplo trabajado. Con Wloaded = $52.50/h (tarifa cargada representativa de EE. UU. para atención al cliente entrante, mediados de la década de 2020), Th = 4 minutos = 1/15 h y ρ = 0.85:
Cper_call = ($52.50 · (1/15)) / 0.85 = $3.50 / 0.85 = $4.12 por llamada atendida
A.2 Añadiendo el factor de seguimiento
Belfiore [2] reporta que las llamadas sin resolver producen de media 1.5 contactos de seguimiento en la ventana de resolución. Cada contacto de seguimiento incurre en el mismo Cper_call más el coste de experiencia de cliente del retrabajo. Tratando los seguimientos como un añadido de 1.5× el coste por llamada; la lectura conservadora de Belfiore; el coste cargado de una trayectoria escalada pasa a ser
E = Cper_call · (1 + f) = $4.12 · 1.5 = $6.18
donde f = 0.5 es el multiplicador fraccional de seguimiento sobre la llamada inicial gestionada por humanos (0.5 porque una llamada inicial más 0.5 en seguimientos esperados equivale a los 1.5 contactos que documenta Belfiore). La cifra de $6.18 está aproximadamente un 17% por debajo de la línea base de $7.40 divulgada por [8]. Añadiendo un 15-20% por la penalización de transferencia en frío [10]; el coste de la pérdida de contexto cuando la llamada se traspasa de la IA al humano; se cierra la brecha hasta la cifra divulgada dentro del redondeo.
Los $7.40 divulgados por [8] corresponden, por tanto, a un coste laboral cargado en el rango de $50-60/h, una ocupación cercana al techo estándar de 0.85 y un factor de seguimiento en el rango de Belfiore. Cada una de estas entradas está publicada de forma independiente, y la cifra divulgada es coherente con las tres.
A.3 El crédito de sustitución
Cuando un agente de IA contiene una fracción c de las llamadas entrantes, el requisito de dimensionamiento del lado humano cae en proporción. Con una tasa de llegada λ de llamadas totales por hora, la tasa de llegada del lado humano pasa a ser (1 − c) · λ, y el requisito de dimensionamiento de Erlang C escala aproximadamente de forma lineal con la tasa de llegada a un nivel de servicio fijo, de modo que el coste de dimensionamiento del lado humano por llamada entrante cae de Cper_call a (1 − c) · Cper_call. Incluyendo el factor de seguimiento, el coste del lado humano por llamada entrante es (1 − c) · E, que es exactamente el segundo término de la fórmula del §3.1.
El primer término (p · T) / c es el coste del lado de la IA cargado sobre cada llamada resuelta: el comprador paga p · T en minutos de agente por llamada entrante, y las resoluciones del comprador son c por llamada entrante, de modo que cada resolución carga (p · T) / c de gasto en minutos de agente.
Sumar los dos términos da el coste por resolución de una llamada entrante procesada de extremo a extremo: gasto del lado de la IA por resolución más el coste esperado del lado humano por llamada entrante. Esta es la fórmula. Su brazo de escalado no es un proxy ad-hoc, sino una reducción del coste de dimensionamiento de Erlang C bajo sustitución proporcional, que es el supuesto de linealidad que documenta la referencia de la SWPP [26] y que revisan Akşin et al. [1].
A.4 Dónde falla el supuesto de linealidad
Dos regímenes merecen señalarse. Primero, el dimensionamiento de Erlang C es no lineal cerca del umbral de nivel de servicio: una pequeña caída en la tasa de llegada puede no reducir el personal requerido en la misma proporción, porque el umbral opera sobre el número entero de agentes. En centros de contacto pequeños (menos de ~30 agentes), el crédito de sustitución se sobrestima con la regla proporcional; el ahorro real es escalonado. Segundo, el supuesto de linealidad requiere que las llamadas contenidas por la IA y las gestionadas por humanos tengan distribuciones de tiempo de gestión similares. Si la IA contiene predominantemente llamadas fáciles (tiempo de gestión corto) y escala predominantemente llamadas difíciles (tiempo de gestión largo); un patrón común, ya que los agentes de IA tienen dificultades en la cola difícil; entonces el tiempo de gestión del lado humano en las llamadas escaladas es más largo que el promedio Th, y el coste del lado humano por llamada entrante es mayor que (1 − c) · E. Un equipo de compras en un dominio donde el tiempo de gestión de las llamadas contenidas por la IA sea claramente más corto que el promedio general de la operación debería tratar E como un límite inferior y considerar un multiplicador explícito del tiempo de gestión en los escalados. La limitación del §6 sobre la resolución ajustada por calidad capta la misma preocupación desde otro ángulo.
Referencias
- [1]Akşin, Z., Armony, M., Mehrotra, V. (2007). The Modern Call Center: A Multi-Disciplinary Perspective on Operations Management Research. Production and Operations Management 16(6): 665–688. http://www.columbia.edu/~ww2040/4615S13/AAM07.pdf (consultado el 2026-05-04) · doi:10.1111/j.1937-5956.2007.tb00288.x
- [2]Belfiore, B. (2014). Contact Center Economics 101: First Call Resolution; It's Not Only a Quality Metric. BenchmarkPortal. https://resources.benchmarkportal.com/contact-center-articles/contact-center-economics-101-first-call-resolution-its-not-only-a-quality-metric (consultado el 2026-05-04)
- [3]Rumburg, J. (2021). The Metric of Cost Per Contact. ICMI / MetricNet. https://www.icmi.com/resources/2021/contact-center-metric-cost-per-contact (consultado el 2026-05-04)
- [4]Cole, A. (2026). Contact Center Cost Per Resolution: The KPI Your Metrics Miss. CX Today. https://www.cxtoday.com/contact-center/are-your-contact-center-metrics-hiding-true-costs/ (consultado el 2026-05-04)
- [5]Mehta, M. (2025). Outsourced Call Center Pricing Guide for 2026. Crescendo. https://www.crescendo.ai/blog/outsourced-call-center-pricing-guide (consultado el 2026-05-04)
- [6]The Team at CallMiner (2019). Why First Call Resolution Matters and How to Improve FCR. CallMiner blog. https://callminer.com/blog/first-call-resolution-benefits (consultado el 2026-05-04)
- [7]Şimşek, T. (2025). The True Cost of Customer Support: 2025 Analysis Across 50 Industries. LiveChatAI. https://livechatai.com/blog/customer-support-cost-benchmarks (consultado el 2026-05-04)
- [8]Jonas, T. (2025). What AI Agents Actually Save: Real Contact Center ROI with Automation. Replicant blog. https://www.replicant.com/blog/contact-center-automation-roi (consultado el 2026-05-04)
- [9]Replicant (2025). When to Hand Off to a Human: How to Set Effective AI Escalation Rules. Replicant blog. https://www.replicant.com/blog/when-to-hand-off-to-a-human-how-to-set-effective-ai-escalation-rules (consultado el 2026-05-04)
- [10]Bucher + Suter (2026). Escalation Design: Why AI Fails at the Handoff (Not the Automation). Bucher + Suter blog. https://www.bucher-suter.com/escalation-design-why-ai-fails-at-the-handoff-not-the-automation/ (consultado el 2026-05-04)
- [11]Haynes, T. (2024). 8 Metrics You Must Know to Evaluate the Impact of Call Center Voice AI. PolyAI blog. https://poly.ai/blog/8-metrics-you-must-know-to-evaluate-the-impact-of-call-center-voice-ai/ (consultado el 2026-05-04)
- [12]Sharma, S. (2026). Voice Agent Evaluation Metrics: Definitions, Formulas & Benchmarks. Hamming AI Resources. https://hamming.ai/resources/voice-agent-evaluation-metrics-guide (consultado el 2026-05-04)
- [13]Sharma, S. (2025). Best Voice Agent Stack: A Complete Selection Framework. Hamming AI Resources. https://hamming.ai/resources/best-voice-agent-stack (consultado el 2026-05-04)
- [14]Retell AI (2025). Real-Time Pricing Showdown: What 10K Minutes Cost on Each Voice AI Platform. Retell AI Resources. https://www.retellai.com/resources/voice-ai-platform-pricing-comparison-2025 (consultado el 2026-05-04)
- [15]Ahmed, J. (2026). AI Voice Agent Pricing Breakdown. jahanzaib.ai. https://www.jahanzaib.ai/blog/ai-voice-agent-pricing-breakdown (consultado el 2026-05-04)
- [16]Lucido-Balestrieri, S. (2026). How Much Does Voice AI Cost?. CloudTalk blog. https://www.cloudtalk.io/blog/how-much-does-voice-ai-cost/ (consultado el 2026-05-04)
- [17]Dograh AI (2026). Self-Hosted Voice Agents vs. Vapi: Real Cost Analysis and TCO Break-Even. Dograh blog. https://blog.dograh.com/self-hosted-voice-agents-vs-vapi-real-cost-analysis-tco-break-even/ (consultado el 2026-05-04)
- [18]Yao, S., Shinn, N., Razavi, P., Narasimhan, K. (2024). τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. arXiv:2406.12045. https://arxiv.org/abs/2406.12045 (consultado el 2026-05-04) · doi:10.48550/arXiv.2406.12045
- [19]Ray, S., Dhandhania, K., Barres, V., Narasimhan, K. (2026). τ-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains. arXiv:2603.13686. https://arxiv.org/abs/2603.13686 (consultado el 2026-05-04) · doi:10.48550/arXiv.2603.13686
- [20]Ethiraj, V., David, A., Menon, S., Vijay, D. (2025). Toward Low-Latency End-to-End Voice Agents for Telecommunications Using Streaming ASR, Quantized LLMs, and Real-Time TTS. arXiv:2508.04721. https://arxiv.org/abs/2508.04721 (consultado el 2026-05-04) · doi:10.48550/arXiv.2508.04721
- [21]Pan, G., Chodnekar, V., Roy, A., Wang, H. (2025). A Cost-Benefit Analysis of On-Premise Large Language Model Deployment: Breaking Even with Commercial LLM Services. arXiv:2509.18101. https://arxiv.org/abs/2509.18101 (consultado el 2026-05-04) · doi:10.48550/arXiv.2509.18101
- [22]Erdil, E. (2025). Inference Economics of Language Models. arXiv:2506.04645. https://arxiv.org/abs/2506.04645 (consultado el 2026-05-04) · doi:10.48550/arXiv.2506.04645
- [23]Zhuang, B., Qiao, J., Liu, M., Yu, M., Hong, P., Li, R., Song, X., Xu, X., Chen, X., Ma, Y., Gao, Y. (2025). Beyond Benchmarks: The Economics of AI Inference. arXiv:2510.26136. https://arxiv.org/abs/2510.26136 (consultado el 2026-05-04) · doi:10.48550/arXiv.2510.26136
- [24]Gao, N., Zhang, W., Dai, Y., Shi, L., Wang, Z., Wang, Y., He, W., Wang, J., Wang, C. (2026). Reinforcing Real-World Service Agents: Balancing Utility and Cost in Task-Oriented Dialogue. arXiv:2602.22697. https://arxiv.org/abs/2602.22697 (consultado el 2026-05-04) · doi:10.48550/arXiv.2602.22697
- [25]Braggaar, A., Liebrecht, C., van Miltenburg, E., Krahmer, E. (2023). Evaluating Task-Oriented Dialogue Systems: A Systematic Review of Measures, Constructs and Their Operationalisations. arXiv:2312.13871. https://arxiv.org/abs/2312.13871 (consultado el 2026-05-04) · doi:10.48550/arXiv.2312.13871
- [26]Society of Workforce Planning Professionals (2024). Calculating Call Center Staff. SWPP Certification Resources. https://swpp.org/certification/articles/calculating-call-center-staff/ (consultado el 2026-05-04)
Reproducir
- Datos
papers/cost-per-resolution-methodology/ - Scripts
papers/cost-per-resolution-methodology/