
Preços de Agentes de Voz com IA em 2026: A Verdade dos $0,05 vs $0,30 por Minuto (Com Cálculos)
A Vapi coloca "$0,05/min" na sua página de preços. A fatura do primeiro mês chega a $0,27/min. O que aconteceu? Todas as plataformas de voz com IA anunciam um único número, uma taxa de plataforma, e cobram-lhe por outras quatro camadas que não viu na página inicial. Este guia reconstrói a matemática dos preços de agentes de voz com IA desde a base: custos BYOK reais para 8 plataformas, a linha de tokens de áudio que ninguém explica, e uma função Python que pode bifurcar para prever a sua própria fatura.

Resposta Rápida
- O custo real total em 2026 situa-se entre $0,07–$0,30/min, dependendo de bundled vs BYOK.
- Plataformas bundled (Retell, Bland, ElevenLabs) anunciam $0,07–$0,12/min e ficam perto de $0,10–$0,18/min.
- Plataformas BYOK (Vapi com taxa de plataforma de $0,05/min) ficam em $0,13–$0,31/min após LLM + TTS + STT + Twilio.
- A maior alavanca oculta é a cache de prompts no OpenAI Realtime: até 80× mais barata em system prompts.
Quanto custa realmente um agente de voz com IA em 2026?
A maioria dos agentes de voz com IA custa $0,07 a $0,30 por minuto, tudo incluído, em 2026. Plataformas bundled (Retell, Bland, ElevenLabs) anunciam $0,07–$0,12/min e ficam perto de $0,10–$0,18/min. Plataformas BYOK (Vapi com taxa de plataforma de $0,05/min) ficam em $0,13–$0,31/min depois de somar LLM, TTS, STT e Twilio. Direto no OpenAI Realtime fica em aproximadamente $0,30/min sem caching.
Três categorias explicam quase tudo o que verá na sua fatura:
- Por minuto bundled: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min fixo), Synthflow e ElevenLabs Conversational. Um único número, tudo incluído.
- Orquestração BYOK: A Vapi cobra $0,05/min apenas pela camada de gestão de chamadas. Tokens de LLM, caracteres de TTS, minutos de STT e a operadora são faturados separadamente nas suas próprias contas.
- Direto na infraestrutura: Construir diretamente sobre OpenAI Realtime mais Twilio. Mais barato em escala se fizer cache de prompts. Caro se não o fizer.
O resto deste artigo percorre a matemática camada a camada e, no final, disponibiliza um tco_per_minute() em Python que pode colar num notebook.
Porque é que o preço por minuto anunciado é uma mentira (as 4 camadas de custo)
A taxa de plataforma anunciada de $0,05/min cobre apenas a orquestração. As outras quatro camadas acumulam-se por cima. Todos os agentes de voz em produção em 2026 pagam cinco linhas: telefonia, STT, o LLM, TTS e a taxa de plataforma que os une. Se saltar qualquer uma, não tem um agente funcional.
Aqui está o mínimo, camada a camada.
Camada 1: Telefonia (o minuto da operadora)
Paga a uma operadora de telecomunicações real pelo áudio que entra e sai da rede telefónica pública. A Twilio Programmable Voice cobra $0,014/min para chamadas de saída nos EUA, mais $1–$2/mês por número de telefone. A Twilio Elastic SIP varia entre $0,0053–$0,042/min dependendo da origem. A maioria das plataformas de voz com IA ou revende a Twilio com uma pequena margem ou repassa o custo integralmente. De qualquer forma, são $0,014/min na sua folha de cálculo.
Camada 2: Reconhecimento de fala (STT)
Converte o que o interlocutor disse em texto que o LLM consiga ler. O Deepgram Nova-2 em streaming custa cerca de $0,0043/min no escalão Pay-as-you-go, portanto conte com $0,005/min na prática. Modelos premium (equivalentes ao Whisper) sobem até $0,018/min. Plataformas bundled escondem isto na tarifa principal, mas continua lá.
Camada 3: O LLM (texto ou áudio)
Dois caminhos aqui. Pipelines em modo texto enviam o áudio transcrito para um modelo como o GPT-4o-mini ($0,15/M input, $0,60/M output) e enviam a resposta para TTS. Um ciclo de voz típico consome 100–300 tokens de input e 80–200 tokens de output por turno, o que equivale a aproximadamente $0,003–$0,015/min para GPT-4o-mini, $0,015–$0,04/min para Claude Haiku. Pipelines em modo áudio (OpenAI Realtime) dispensam a transcrição/síntese e faturam diretamente em tokens de áudio. Temos uma secção inteira sobre isso mais abaixo; é a alavanca de custo que ninguém explica.
Camada 4: Síntese de fala (TTS)
Sintetiza a resposta de volta em áudio. O ElevenLabs Turbo custa $0,10/min no plano Conversational, vozes Premium sobem até $0,12/min. Vozes de gama mais baixa (Deepgram Aura, OpenAI tts-1) ficam em $0,04–$0,06/min. Esta é normalmente a segunda maior linha de custo depois da taxa de plataforma.
Somando tudo no mínimo: $0,014 telefonia + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 plataforma = $0,114/min no mínimo numa stack BYOK. Isto antes de HIPAA, concorrência ou aluguer de números. Se quiser a comparação funcional detalhada depois desta análise de preços, veja o nosso artigo Retell AI vs Vapi vs Bland.
As 8 plataformas comparadas (tabela de preços de maio de 2026)
A tabela abaixo reúne as tarifas principais e os valores realistas totais da página de preços de cada fornecedor. Use-a como referência, não como verdade absoluta: as páginas de preços mudam, e as escolhas da sua stack alteram o resultado final.
| Plataforma | Modelo de preços | Tarifa principal | Custo real total (típico) | HIPAA | BYOK ou bundled | Armadilha notável |
|---|---|---|---|---|---|---|
| Retell AI | Por minuto | $0,07–$0,31/min | $0,12–$0,18/min | Incluído | Bundled | Concorrência a $8/mês cada, além do incluído |
| Vapi | Taxa de plataforma + BYOK | $0,05/min | $0,13–$0,31/min | +$2.000/mês | BYOK | Todas as quatro camadas são extra |
| Bland AI | Por minuto fixo | $0,09/min | $0,09–$0,14/min | Incluído | Bundled | Taxa de transferência de $0,025/min |
| Synthflow | Por minuto no plano | $0,09/min base | $0,11–$0,15/min | Incluído | Bundled | Escalões de plano $29/$99/$449/$899 |
| ElevenLabs Conversational | Por minuto | $0,08–$0,12/min | $0,10–$0,18/min | Plano Workspace | Bundled | LLM extra exceto no escalão gerido |
| Deepgram Voice Agent | Por hora | $4,50/h ($0,075/min) | $0,09–$0,11/min + telefonia | Sim | Bundled | Acrescentar Twilio por cima |
| OpenAI Realtime API | Tokens de áudio | $32/M input, $64/M output | ~$0,30/min bruto, ~$0,12 com cache | DIY | Direto | Matemática de tokens de áudio (ver abaixo) |
| Twilio (camada de telefonia) | Por minuto | $0,014/min saída EUA | $0,014/min | n/a | n/a | Números de telefone $1–$2/mês |
Preços verificados em maio de 2026. Confirme sempre as páginas de preços dos fornecedores antes de assinar: a Vapi alterou o seu add-on HIPAA duas vezes só no último ano.
Exemplo prático: quanto custa realmente uma chamada de saída de 4 minutos?
O cenário canónico: uma chamada de saída de 4 minutos, GPT-4o-mini como LLM, ElevenLabs Turbo como voz, Twilio EUA como operadora, apenas inglês. Quando executámos este cenário exato nas quatro plataformas (Vapi, Retell, Bland, OpenAI Realtime direto), a tarifa principal explicou menos de metade do número final.
Pressupostos mantidos constantes nas quatro:
- 4 minutos de duração real
- ~12 turnos de conversação, ~150 tokens de input + 100 tokens de output por turno = 1.800 in / 1.200 out para GPT-4o-mini
- TTS produz ~400 caracteres por turno × 12 = 4.800 caracteres (ElevenLabs Turbo @ $0,10/min de output de áudio)
- STT fatura os 4 minutos completos (Deepgram Nova-2 @ ~$0,0043/min)
- Twilio saída EUA @ $0,014/min, número de $1/mês amortizado em 1.000 chamadas/mês = $0,001/chamada
Vapi BYOK: $0,05 → $0,27/min
| Linha de custo | Custo |
|---|---|
| Taxa de plataforma Vapi (4 min × $0,05) | $0,200 |
| GPT-4o-mini (1.800 in × $0,15/M + 1.200 out × $0,60/M) | $0,001 |
| ElevenLabs Turbo (4 min × $0,10) | $0,400 |
| Deepgram STT (4 min × $0,005) | $0,020 |
| Twilio (4 min × $0,014) | $0,056 |
| Aluguer de número amortizado | $0,001 |
| Total da chamada | $0,678 |
| $/min efetivo | $0,170 |
Nota: ElevenLabs Turbo no plano Conversational está mais próximo de $0,10/min, não é tarifa fixa, portanto a matemática é um custo por minuto de output. Uma taxa de plataforma de $0,05/min mais GPT-4o-mini mais ElevenLabs Turbo mais Twilio soma aproximadamente $0,17–$0,27/min, não $0,05.
Retell bundled: $0,10 → $0,16/min
| Linha de custo | Custo |
|---|---|
| Bundle Retell (4 min × $0,13, GPT-4o-mini + Retell TTS) | $0,520 |
| Twilio passthrough (4 min × $0,014) | $0,056 |
| Aluguer de número amortizado | $0,002 |
| Total da chamada | $0,578 |
| $/min efetivo | $0,145 |
O bundle da Retell inclui LLM (escolhe o modelo), STT e o TTS próprio. Resta-lhe pagar a Twilio por cima. É só isso.
Bland tarifa fixa: $0,09 → $0,13/min
| Linha de custo | Custo |
|---|---|
| Bland fixo (4 min × $0,09) | $0,360 |
| Twilio passthrough (4 min × $0,014) | $0,056 |
| Aluguer de número amortizado | $0,001 |
| Total da chamada | $0,417 |
| $/min efetivo | $0,104 |
A Bland tem a matemática mais limpa nos resultados de pesquisa. Um número, mais a operadora. A armadilha está nas taxas ocultas: minutos de transferência são faturados a $0,025/min por cima.
OpenAI Realtime direto (sem caching): $0,30/min
| Linha de custo | Custo |
|---|---|
| OpenAI Realtime áudio in (4 min × ~$0,077) | $0,308 |
| OpenAI Realtime áudio out (4 min × ~$0,077) | $0,308 |
| Twilio (4 min × $0,014) | $0,056 |
| Aluguer de número amortizado | $0,001 |
| Total da chamada | $0,673 |
| $/min efetivo | $0,168 |
Esse valor pressupõe que está a fazer cache de system prompts. Sem caching, a mesma chamada fica perto de $1,20 ($0,30/min) porque cada turno refatura o system prompt completo a taxas normais. Explicamos essa matemática abaixo.

Bundled vs BYOK: que modelo de preços ganha no seu caso?
Plataformas bundled ganham quando quer uma fatura única, matemática previsível por minuto e uma voz de qualidade razoável. BYOK ganha quando tem capacidade de engenharia, quer escolher o seu próprio LLM e planeia negociar tarifas de operadora em escala. A decisão resume-se normalmente a duas perguntas: tem preferência de linha de faturação e tem um developer que assuma a responsabilidade pela stack?
| Caso de uso | Bundled ganha porque | BYOK ganha porque |
|---|---|---|
| Desvio de suporte inbound | Um fornecedor, uma fatura, HIPAA incluído | Difícil justificar o custo de engenharia |
| Cold calling outbound em escala | Matemática fixa supera surpresas por token | Pode negociar minutos de operadora acima de 100k/mês |
| RAG personalizado + uso de ferramentas | Superfície de tool-calls limitada na maioria dos bundles | Controlo total sobre a janela de contexto |
| Setores regulados | A flag HIPAA ativa-se com uma checkbox | A conformidade passa a ser problema seu |
Regra rápida de decisão:
- Abaixo de 10.000 minutos/mês → bundled ganha quase sempre no custo total de propriedade (só o tempo de engenharia já empata).
- 10.000–100.000 minutos/mês → BYOK começa a compensar se tiver 1+ engineer dedicado.
- Acima de 100.000 minutos/mês → BYOK ou direto no Realtime é normalmente $0,05–$0,10/min mais barato, e tem volume para negociar tarifas de sub-conta Twilio.
Para uma análise mais aprofundada dos custos de LLM no lado BYOK, veja a nossa análise de opções de orquestração em melhores frameworks de agentes de IA.
As taxas ocultas que a maioria das pessoas ignora
Mesmo quando domina a matemática das quatro camadas, a fatura chega com linhas que a página inicial nunca mencionou. Estas sete são as que vemos atingir clientes com mais frequência. A maioria está enterrada nas letras miúdas da página de preços ou nos ecrãs de configuração pós-registo. Não são maliciosas, apenas mal comunicadas.
- Add-on HIPAA. A Vapi cobra $2.000/mês por HIPAA, segundo a sua página de preços. Retell, Bland e Synthflow incluem HIPAA sem custo extra. Se está na área da saúde e pondera a Vapi, são $24k/ano antes de fazer uma única chamada.
- Imposto de arredondamento por minuto. A maioria das plataformas arredonda em incrementos de 60 segundos: uma chamada de 61 segundos é faturada como 2 minutos. Com 5.000 chamadas/mês numa distribuição típica de 45–90 segundos, isso representa um acréscimo efetivo de 5–8% sobre o que a sua matemática de $/min indica. A faturação por segundo (Bland, Deepgram) elimina isto.
- Aluguer de números de telefone. Twilio: $1–$2/mês por número. Retell: $2/mês por número, $10/mês para números verificados. Parece insignificante até estar a operar 50 números outbound para cold calling; isso é uma linha de $100/mês que ninguém orçamentou.
- Taxas de concorrência. A Retell inclui uma base de chamadas simultâneas; acima disso, são $8/concorrência/mês. Uma equipa a fazer 10 chamadas simultâneas acima da base acrescenta $80/mês.
- Taxas de transferência. A Bland cobra $0,025/min quando o agente transfere para um humano. Se 20% das suas chamadas forem transferidas, é um imposto significativo sobre o minuto médio.
- Taxas de base de conhecimento. A Retell oferece 10 KBs grátis; cada adicional custa $8/mês. Acumule casos de uso com RAG intensivo e isso composta rapidamente.
- Upsells de vozes premium. ElevenLabs Premium acrescenta +$0,04/min sobre o Turbo. Parece opcional até a sua equipa comercial fazer testes A/B e descobrir que Premium converte 11% melhor.
Precisa de alguém que detalhe o seu caso de uso específico antes de assinar um contrato com a Vapi? Fazemos isso como parte dos nossos projetos de construção de agentes de voz.
Tokens de áudio e cache de prompts: a alavanca de custo que ninguém explica
A OpenAI Realtime API fatura por tokens de áudio, onde 1 token = 100ms de áudio de input ou 50ms de áudio de output. Uma chamada de 60 segundos usa aproximadamente 600 tokens de input (o interlocutor fala) e 1.200 tokens de output (o agente responde). A $32/M input e $64/M output, isso é $0,0192 input + $0,0768 output = $0,096 de custo bruto de áudio por minuto, ou aproximadamente $0,10/min antes de acrescentar prompts, ferramentas ou Twilio.
Depois há o system prompt. Cada turno envia o seu system prompt completo ao modelo como parte da janela de contexto. Um agente de voz típico tem um system prompt de 2.000 tokens cobrindo persona, ferramentas, casos limite e lógica de recusa. Sem caching, esse bloco de 2.000 tokens é faturado a $32/M como novo em cada chamada: $64 em 1.000 chamadas.
Com cache de prompts ativada (tokens em cache custam $0,40/M segundo a documentação da OpenAI), a mesma carga de 1.000 chamadas é faturada a $0,80. Isso é um desconto de 80× no custo do system prompt. A cache de prompts no OpenAI Realtime reduz o custo do system prompt em 80×. A maioria das equipas só descobre isto após a fatura do primeiro mês.
Aqui está a matemática em código:
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# Fresh rates
COST_IN_FRESH = 32 / 1_000_000 # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # 80x discount
# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min
# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80
No nosso trabalho de modelação de custos para clientes que constroem diretamente sobre o Realtime, esta é a maior alavanca entre "o Realtime é barato" e "o Realtime custa o dobro da Vapi". Se está a usar a Responses API juntamente com o Realtime para tool calls, veja o nosso tutorial da OpenAI Responses API para o padrão de implementação. É por isto que construir diretamente sobre o OpenAI Realtime pode ser mais barato ou muito mais caro do que a Vapi, dependendo de fazer ou não cache.
Como calcular o seu próprio TCO (fórmula + Python)
O custo total de propriedade de um agente de voz é o custo variável por minuto mais as taxas fixas mensais amortizadas pelo seu volume de minutos. A fórmula:
TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month
Insira os seus números. Ou bifurque isto:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # e.g., 0.05 for Vapi, 0.13 for Retell bundle
llm_in_per_1m: float, # e.g., 0.15 for GPT-4o-mini input
llm_out_per_1m: float, # e.g., 0.60 for GPT-4o-mini output
llm_in_tokens_per_call: int, # e.g., 1800
llm_out_tokens_per_call: int, # e.g., 1200
tts_per_min: float, # e.g., 0.10 for ElevenLabs Turbo
stt_per_min: float, # e.g., 0.005 for Deepgram Nova-2
telephony_per_min: float, # e.g., 0.014 for Twilio US
fixed_monthly: float = 0.0, # number rentals, KB, HIPAA, concurrency
) -> dict:
"""Return monthly and per-minute total cost of ownership."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# Variable per-call
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}Quatro passos numerados para quem está a prever do zero:
- Estime o volume mensal de chamadas e a duração média de cada chamada.
- Escolha a sua stack: plataforma + LLM + TTS + STT + telefonia.
- Consulte o preço por unidade de cada componente na página de preços do fornecedor.
- Execute a fórmula (ou a função Python acima); o resultado é a sua previsão de $/min e $ mensal.
Se não consegue escrever o seu TCO como uma fórmula de uma linha, vai perder dinheiro no imposto de arredondamento por minuto.
Custo em escala: 1k vs 10k vs 100k minutos por mês
As curvas divergem rapidamente acima dos 10.000 minutos. Plataformas bundled achatam porque a fatura é simplesmente minutos × tarifa. Stacks BYOK inclinam-se à medida que os custos de LLM e TTS escalam linearmente consigo. O OpenAI Realtime com caching cruza a Vapi por volta dos 10k–20k minutos/mês, o ponto de inflexão onde direto na infraestrutura começa a fazer sentido.
| Plataforma | 1.000 min/mês | 10.000 min/mês | 100.000 min/mês |
|---|---|---|---|
| Bland fixo $0,09/min + Twilio | $120 | $1.160 | $11.400 |
| Retell bundle ~$0,145/min tudo incluído | $145 | $1.450 | $14.500 |
| Vapi BYOK ~$0,17/min tudo incluído | $170 | $1.700 | $17.000 |
| OpenAI Realtime + caching ~$0,13/min | $130 | $1.300 | $13.000 |
| Deepgram Voice Agent + Twilio | $108 | $1.080 | $10.800 |
Números derivados da fórmula tco_per_minute() acima com os pressupostos da chamada canónica de 4 minutos. Acrescente HIPAA ($2.000/mês Vapi), concorrência e aluguer de números onde aplicável. Não alteram a forma da curva, mas elevam o mínimo para compradores de baixo volume.
O gráfico principal no topo deste artigo visualiza os mesmos números: a Bland achata cedo, a Vapi inclina-se à medida que os custos de LLM escalam, e o OpenAI Realtime com caching supera a Vapi acima dos 10k minutos.
Quando NÃO deve implementar um agente de voz
A voz com IA tem um piso real de $0,10–$0,30/min. Abaixo de 200 chamadas por mês, um humano mais um SaaS de $19 continua a ganhar em custo. Aluguer de números, bases de concorrência e mínimos de plataforma somam um overhead de $50–$200/mês que uma equipa de baixo volume simplesmente não recupera.
Três critérios de "não avançar", honestamente:
-
Menos de 200 chamadas/mês. Aluguer de números + taxas mínimas + bases de concorrência excedem o custo de um humano a tempo parcial a $20/h. O ponto de equilíbrio não fecha.
-
Trabalho de alto contexto, baixo volume. O seu único humano trata 15 chamadas por dia, cada uma com 30+ padrões de factos únicos. O custo de alucinação do LLM (reembolsos, negócios perdidos, marcações erradas) come as poupanças. A voz com IA brilha em fluxos repetitivos, não em trabalho com muitos casos limite.
-
Setores regulados sem orçamento HIPAA. O add-on HIPAA de $2k/mês da Vapi, taxas de conformidade da operadora e proteções de PII ($0,005–$0,01/min na Retell) podem fazer a matemática colapsar. Se não consegue orçamentar $25k/ano só em linhas de conformidade, faça pilotos em fluxos sem PHI primeiro.
Em testes, o ponto de equilíbrio face a um agente humano para desvio de suporte situa-se por volta das 250–400 chamadas/mês nas tarifas bundled típicas. Abaixo disso, um SaaS de $19/mês mais um humano é mais barato. Não implemente voz com IA só porque pode.

Se a voz com IA ultrapassa o piso de custo mas não quer configurar a Retell ou a Vapi você mesmo, o nosso serviço de desenvolvimento de agentes de voz constrói e opera a stack completa na sua infraestrutura.
Como escolheríamos realmente uma plataforma em 2026 (veredicto por caso de uso)
Nenhuma plataforma ganha em tudo. A escolha séria mais barata depende de ser inbound ou outbound, de ter capacidade de engenharia e de o HIPAA ser relevante. Cinco casos de uso, cinco respostas:
- Outbound sério mais barato (cold calling): Bland. $0,09/min fixo, taxa de transferência transparente, sem surpresas de custos de LLM. Ignore se precisar de RAG profundo ou ferramentas personalizadas.
- Inbound mais barato (desvio de suporte): Retell. Bundled, HIPAA incluído, analytics maduros, $0,12–$0,18 tudo incluído. Ignore se o seu volume inbound for inferior a 200 chamadas/mês (ver secção anterior).
- Máximo controlo + RAG personalizado: Vapi BYOK. Só se tiver capacidade de engenharia para gerir as chaves de LLM, TTS e STT. O controlo só vale $0,27/min quando consegue negociar a operadora e o LLM para baixo com volume.
- Simplicidade bundled em escala: Deepgram Voice Agent. $4,50/h ($0,075/min) fixo, a opção mais discreta nos resultados de pesquisa. Ignore se precisar da biblioteca alargada de vozes que a ElevenLabs oferece.
- Referência de qualidade conversacional (demos comerciais, fluxos sensíveis à marca): ElevenLabs Conversational. Vozes Turbo ou Premium a $0,10–$0,12/min. Pague o extra quando a qualidade da voz é a alavanca de conversão.
Para uma análise setorial mais aprofundada no lado empresarial, veja agentes de voz com IA para call centers empresariais: a mesma matemática, com pressupostos de volume específicos para restaurantes e clínicas.
Como a Techsy aborda a modelação de custos de agentes de voz
Não vendemos uma plataforma de voz. Construímos agentes de voz em produção para clientes em Retell, Vapi, Deepgram e OpenAI Realtime. Isso significa que, quando modelamos custos para um novo projeto, executamos a fórmula tco_per_minute() em três escalões de volume (1k, 10k, 100k minutos/mês) antes de recomendar uma stack. A plataforma que ganha em 1k muitas vezes perde em 100k.
Negociamos preços de sub-conta Twilio para clientes acima de 100k minutos/mês (sub-contas desbloqueiam escalões de volume que a maioria das equipas desconhece), e modelamos sempre as poupanças de cache de prompts em projetos Realtime antes de aprovar um design de infraestrutura direta. Metade do nosso trabalho de modelação de custos para clientes é desfazer pressupostos que alguém fez a partir de um post de blog de um fornecedor.
Quer um agente de voz construído de ponta a ponta na plataforma que realmente ganha para o seu volume? Veja como construímos agentes de voz →
FAQ
Quanto custa um agente de voz com IA por minuto em 2026? O custo total situa-se entre $0,07 e $0,30 por minuto. Plataformas bundled (Retell, Bland, ElevenLabs Conversational) ficam em $0,10–$0,18/min com telefonia incluída. Plataformas BYOK como a Vapi ficam em $0,13–$0,31/min após custos de LLM, TTS, STT e Twilio. O OpenAI Realtime direto fica perto de $0,30/min bruto ou aproximadamente $0,12/min com cache de prompts ativada nos system prompts.
Qual é a plataforma de agentes de voz com IA mais barata? Para outbound, a Bland AI a $0,09/min fixo tem a matemática mais limpa do mercado. Para suporte inbound, a Retell a $0,10–$0,16 tudo incluído ganha normalmente graças ao HIPAA bundled e às bases de concorrência. Para jogadas de infraestrutura pura com caching, o OpenAI Realtime pode descer abaixo de $0,15/min. O Deepgram Voice Agent a $0,075/min fixo é a opção mais subestimada.
Porque é que a minha fatura da Vapi é superior a $0,05/min? O valor de $0,05/min na página de preços da Vapi é apenas a taxa de plataforma. A Vapi é BYOK: traz as suas próprias chaves para o LLM (GPT-4o-mini, Claude, etc.), TTS (ElevenLabs, PlayHT), STT (Deepgram) e telefonia (Twilio). O custo real total situa-se em $0,13–$0,31/min dependendo da voz e do modelo que escolher.
Qual é a diferença entre preços BYOK e bundled? Plataformas bundled (Retell, Bland, Synthflow, ElevenLabs Conversational) incluem LLM, STT e TTS numa única tarifa por minuto. Plataformas BYOK (Vapi) cobram apenas pela orquestração; traz as suas próprias chaves de API para tudo o resto e é faturado separadamente por cada fornecedor. Bundled é mais simples; BYOK dá-lhe controlo e capacidade de negociação em escala.
Existem taxas ocultas nos preços de agentes de voz com IA? Sim, sete comuns. Add-ons HIPAA ($2.000/mês na Vapi), arredondamento por minuto (acréscimo efetivo de 5–8% em escala), aluguer de números de telefone ($1–$2/mês), taxas de concorrência ($8/concorrência/mês Retell), taxas de transferência ($0,025/min Bland), taxas de base de conhecimento ($8/mês por KB na Retell) e upsells de vozes premium (+$0,04/min ElevenLabs Premium sobre Turbo).
A OpenAI Realtime API é mais barata que a Vapi? Sem cache de prompts, não: o OpenAI Realtime custa cerca de $0,30/min em custo bruto de áudio. Com cache de prompts ativada (tokens de system prompt em cache a $0,40/M vs $32/M como novo, um desconto de 80×), a linha do system prompt colapsa e o custo total desce para aproximadamente $0,12–$0,15/min. Isso torna-o competitivo com plataformas bundled acima de 10k minutos/mês.
Como prevejo o custo mensal do meu agente de voz?
Estime as chamadas por mês multiplicadas pela duração média em minutos. Multiplique pelo $/min total da sua plataforma. Some os custos fixos mensais: aluguer de números de telefone, taxas de base de conhecimento, base de concorrência, add-on HIPAA se aplicável. A função Python tco_per_minute() acima automatiza isto com uma única chamada de função que pode colar num Jupyter notebook.
Faturação por minuto ou por segundo: qual é mais barata? A faturação por segundo é significativamente mais barata para chamadas outbound curtas. Uma chamada de 61 segundos faturada em incrementos de 60 segundos cobra 2 minutos, o que é um imposto efetivo de 5–8% com 5.000 chamadas por mês numa distribuição típica de chamadas curtas. Bland e Deepgram faturam por segundo; a maioria das plataformas BYOK herda o arredondamento de 60 segundos da Twilio por defeito.
Existem agentes de voz com IA gratuitos? Existem trials gratuitos: a maioria dos fornecedores oferece 10–60 minutos grátis (Retell, Vapi, Bland) para testar. Agentes de voz com IA gratuitos para produção não existem porque paga sempre, no mínimo, os minutos da operadora ($0,014/min na Twilio EUA outbound). Mesmo stacks open-source self-hosted (Pipecat, LiveKit Agents) deixam-no a pagar à operadora e ao LLM.
Qual é o ROI da voz com IA vs um agente humano? Agentes humanos custam $15–$30/h com todos os encargos, o que equivale a $0,25–$0,50/min. A voz com IA a $0,10–$0,20/min bate o custo humano acima de aproximadamente 200 chamadas por mês, assumindo taxas de resolução comparáveis. Abaixo desse volume, os mínimos de plataforma e o overhead de aluguer de números tornam um humano mais um SaaS de $19/mês a resposta mais barata.
Este guia é mantido pela equipa editorial da Techsy. Construímos agentes de voz com IA em produção em Retell, Vapi e OpenAI Realtime para clientes; estes números vêm do trabalho de modelação de custos que fazemos todas as semanas, não de brochuras de fornecedores. Preços verificados em maio de 2026; confirme sempre nas páginas de preços dos fornecedores antes de assinar.