Techsy
Contacto
Começar
Voltar ao blog
ai-machine-learning

Preços de Agentes de Voz IA em 2026: A Verdade dos $0,05 vs $0,30 Por Minuto (Com Cálculos)

Escrito por Techsy Editorial Team
May 14, 2026
19 min de leitura
Índice
Preços de Agentes de Voz IA em 2026: A Verdade dos $0,05 vs $0,30 Por Minuto (Com Cálculos)

Preços de Agentes de Voz com IA em 2026: A Verdade dos $0,05 vs $0,30 por Minuto (Com Cálculos)

A Vapi coloca "$0,05/min" na sua página de preços. A fatura do primeiro mês chega a $0,27/min. O que aconteceu? Todas as plataformas de voz com IA anunciam um único número, uma taxa de plataforma, e cobram-lhe por outras quatro camadas que não viu na página inicial. Este guia reconstrói a matemática dos preços de agentes de voz com IA desde a base: custos BYOK reais para 8 plataformas, a linha de tokens de áudio que ninguém explica, e uma função Python que pode bifurcar para prever a sua própria fatura.

Gráfico de preços de agentes de voz com IA, maio de 2026, mostrando o custo mensal por escalões de volume para Bland, Retell, Vapi e OpenAI Realtime

Resposta Rápida

  • O custo real total em 2026 situa-se entre $0,07–$0,30/min, dependendo de bundled vs BYOK.
  • Plataformas bundled (Retell, Bland, ElevenLabs) anunciam $0,07–$0,12/min e ficam perto de $0,10–$0,18/min.
  • Plataformas BYOK (Vapi com taxa de plataforma de $0,05/min) ficam em $0,13–$0,31/min após LLM + TTS + STT + Twilio.
  • A maior alavanca oculta é a cache de prompts no OpenAI Realtime: até 80× mais barata em system prompts.

Quanto custa realmente um agente de voz com IA em 2026?

A maioria dos agentes de voz com IA custa $0,07 a $0,30 por minuto, tudo incluído, em 2026. Plataformas bundled (Retell, Bland, ElevenLabs) anunciam $0,07–$0,12/min e ficam perto de $0,10–$0,18/min. Plataformas BYOK (Vapi com taxa de plataforma de $0,05/min) ficam em $0,13–$0,31/min depois de somar LLM, TTS, STT e Twilio. Direto no OpenAI Realtime fica em aproximadamente $0,30/min sem caching.

Três categorias explicam quase tudo o que verá na sua fatura:

  • Por minuto bundled: Retell AI ($0,07–$0,31/min), Bland AI ($0,09/min fixo), Synthflow e ElevenLabs Conversational. Um único número, tudo incluído.
  • Orquestração BYOK: A Vapi cobra $0,05/min apenas pela camada de gestão de chamadas. Tokens de LLM, caracteres de TTS, minutos de STT e a operadora são faturados separadamente nas suas próprias contas.
  • Direto na infraestrutura: Construir diretamente sobre OpenAI Realtime mais Twilio. Mais barato em escala se fizer cache de prompts. Caro se não o fizer.

O resto deste artigo percorre a matemática camada a camada e, no final, disponibiliza um tco_per_minute() em Python que pode colar num notebook.

Porque é que o preço por minuto anunciado é uma mentira (as 4 camadas de custo)

A taxa de plataforma anunciada de $0,05/min cobre apenas a orquestração. As outras quatro camadas acumulam-se por cima. Todos os agentes de voz em produção em 2026 pagam cinco linhas: telefonia, STT, o LLM, TTS e a taxa de plataforma que os une. Se saltar qualquer uma, não tem um agente funcional.

Aqui está o mínimo, camada a camada.

Camada 1: Telefonia (o minuto da operadora)

Paga a uma operadora de telecomunicações real pelo áudio que entra e sai da rede telefónica pública. A Twilio Programmable Voice cobra $0,014/min para chamadas de saída nos EUA, mais $1–$2/mês por número de telefone. A Twilio Elastic SIP varia entre $0,0053–$0,042/min dependendo da origem. A maioria das plataformas de voz com IA ou revende a Twilio com uma pequena margem ou repassa o custo integralmente. De qualquer forma, são $0,014/min na sua folha de cálculo.

Camada 2: Reconhecimento de fala (STT)

Converte o que o interlocutor disse em texto que o LLM consiga ler. O Deepgram Nova-2 em streaming custa cerca de $0,0043/min no escalão Pay-as-you-go, portanto conte com $0,005/min na prática. Modelos premium (equivalentes ao Whisper) sobem até $0,018/min. Plataformas bundled escondem isto na tarifa principal, mas continua lá.

Camada 3: O LLM (texto ou áudio)

Dois caminhos aqui. Pipelines em modo texto enviam o áudio transcrito para um modelo como o GPT-4o-mini ($0,15/M input, $0,60/M output) e enviam a resposta para TTS. Um ciclo de voz típico consome 100–300 tokens de input e 80–200 tokens de output por turno, o que equivale a aproximadamente $0,003–$0,015/min para GPT-4o-mini, $0,015–$0,04/min para Claude Haiku. Pipelines em modo áudio (OpenAI Realtime) dispensam a transcrição/síntese e faturam diretamente em tokens de áudio. Temos uma secção inteira sobre isso mais abaixo; é a alavanca de custo que ninguém explica.

Camada 4: Síntese de fala (TTS)

Sintetiza a resposta de volta em áudio. O ElevenLabs Turbo custa $0,10/min no plano Conversational, vozes Premium sobem até $0,12/min. Vozes de gama mais baixa (Deepgram Aura, OpenAI tts-1) ficam em $0,04–$0,06/min. Esta é normalmente a segunda maior linha de custo depois da taxa de plataforma.

Somando tudo no mínimo: $0,014 telefonia + $0,005 STT + $0,005 LLM (4o-mini) + $0,04 TTS + $0,05 plataforma = $0,114/min no mínimo numa stack BYOK. Isto antes de HIPAA, concorrência ou aluguer de números. Se quiser a comparação funcional detalhada depois desta análise de preços, veja o nosso artigo Retell AI vs Vapi vs Bland.

As 8 plataformas comparadas (tabela de preços de maio de 2026)

A tabela abaixo reúne as tarifas principais e os valores realistas totais da página de preços de cada fornecedor. Use-a como referência, não como verdade absoluta: as páginas de preços mudam, e as escolhas da sua stack alteram o resultado final.

PlataformaModelo de preçosTarifa principalCusto real total (típico)HIPAABYOK ou bundledArmadilha notável
Retell AIPor minuto$0,07–$0,31/min$0,12–$0,18/minIncluídoBundledConcorrência a $8/mês cada, além do incluído
VapiTaxa de plataforma + BYOK$0,05/min$0,13–$0,31/min+$2.000/mêsBYOKTodas as quatro camadas são extra
Bland AIPor minuto fixo$0,09/min$0,09–$0,14/minIncluídoBundledTaxa de transferência de $0,025/min
SynthflowPor minuto no plano$0,09/min base$0,11–$0,15/minIncluídoBundledEscalões de plano $29/$99/$449/$899
ElevenLabs ConversationalPor minuto$0,08–$0,12/min$0,10–$0,18/minPlano WorkspaceBundledLLM extra exceto no escalão gerido
Deepgram Voice AgentPor hora$4,50/h ($0,075/min)$0,09–$0,11/min + telefoniaSimBundledAcrescentar Twilio por cima
OpenAI Realtime APITokens de áudio$32/M input, $64/M output~$0,30/min bruto, ~$0,12 com cacheDIYDiretoMatemática de tokens de áudio (ver abaixo)
Twilio (camada de telefonia)Por minuto$0,014/min saída EUA$0,014/minn/an/aNúmeros de telefone $1–$2/mês

Preços verificados em maio de 2026. Confirme sempre as páginas de preços dos fornecedores antes de assinar: a Vapi alterou o seu add-on HIPAA duas vezes só no último ano.

Exemplo prático: quanto custa realmente uma chamada de saída de 4 minutos?

O cenário canónico: uma chamada de saída de 4 minutos, GPT-4o-mini como LLM, ElevenLabs Turbo como voz, Twilio EUA como operadora, apenas inglês. Quando executámos este cenário exato nas quatro plataformas (Vapi, Retell, Bland, OpenAI Realtime direto), a tarifa principal explicou menos de metade do número final.

Pressupostos mantidos constantes nas quatro:

  • 4 minutos de duração real
  • ~12 turnos de conversação, ~150 tokens de input + 100 tokens de output por turno = 1.800 in / 1.200 out para GPT-4o-mini
  • TTS produz ~400 caracteres por turno × 12 = 4.800 caracteres (ElevenLabs Turbo @ $0,10/min de output de áudio)
  • STT fatura os 4 minutos completos (Deepgram Nova-2 @ ~$0,0043/min)
  • Twilio saída EUA @ $0,014/min, número de $1/mês amortizado em 1.000 chamadas/mês = $0,001/chamada

Vapi BYOK: $0,05 → $0,27/min

Linha de custoCusto
Taxa de plataforma Vapi (4 min × $0,05)$0,200
GPT-4o-mini (1.800 in × $0,15/M + 1.200 out × $0,60/M)$0,001
ElevenLabs Turbo (4 min × $0,10)$0,400
Deepgram STT (4 min × $0,005)$0,020
Twilio (4 min × $0,014)$0,056
Aluguer de número amortizado$0,001
Total da chamada$0,678
$/min efetivo$0,170

Nota: ElevenLabs Turbo no plano Conversational está mais próximo de $0,10/min, não é tarifa fixa, portanto a matemática é um custo por minuto de output. Uma taxa de plataforma de $0,05/min mais GPT-4o-mini mais ElevenLabs Turbo mais Twilio soma aproximadamente $0,17–$0,27/min, não $0,05.

Retell bundled: $0,10 → $0,16/min

Linha de custoCusto
Bundle Retell (4 min × $0,13, GPT-4o-mini + Retell TTS)$0,520
Twilio passthrough (4 min × $0,014)$0,056
Aluguer de número amortizado$0,002
Total da chamada$0,578
$/min efetivo$0,145

O bundle da Retell inclui LLM (escolhe o modelo), STT e o TTS próprio. Resta-lhe pagar a Twilio por cima. É só isso.

Bland tarifa fixa: $0,09 → $0,13/min

Linha de custoCusto
Bland fixo (4 min × $0,09)$0,360
Twilio passthrough (4 min × $0,014)$0,056
Aluguer de número amortizado$0,001
Total da chamada$0,417
$/min efetivo$0,104

A Bland tem a matemática mais limpa nos resultados de pesquisa. Um número, mais a operadora. A armadilha está nas taxas ocultas: minutos de transferência são faturados a $0,025/min por cima.

OpenAI Realtime direto (sem caching): $0,30/min

Linha de custoCusto
OpenAI Realtime áudio in (4 min × ~$0,077)$0,308
OpenAI Realtime áudio out (4 min × ~$0,077)$0,308
Twilio (4 min × $0,014)$0,056
Aluguer de número amortizado$0,001
Total da chamada$0,673
$/min efetivo$0,168

Esse valor pressupõe que está a fazer cache de system prompts. Sem caching, a mesma chamada fica perto de $1,20 ($0,30/min) porque cada turno refatura o system prompt completo a taxas normais. Explicamos essa matemática abaixo.

Diagrama de camadas de custo de agente de voz mostrando taxa de plataforma, LLM, TTS, STT e camadas de telefonia para uma chamada de saída de 4 minutos

Bundled vs BYOK: que modelo de preços ganha no seu caso?

Plataformas bundled ganham quando quer uma fatura única, matemática previsível por minuto e uma voz de qualidade razoável. BYOK ganha quando tem capacidade de engenharia, quer escolher o seu próprio LLM e planeia negociar tarifas de operadora em escala. A decisão resume-se normalmente a duas perguntas: tem preferência de linha de faturação e tem um developer que assuma a responsabilidade pela stack?

Caso de usoBundled ganha porqueBYOK ganha porque
Desvio de suporte inboundUm fornecedor, uma fatura, HIPAA incluídoDifícil justificar o custo de engenharia
Cold calling outbound em escalaMatemática fixa supera surpresas por tokenPode negociar minutos de operadora acima de 100k/mês
RAG personalizado + uso de ferramentasSuperfície de tool-calls limitada na maioria dos bundlesControlo total sobre a janela de contexto
Setores reguladosA flag HIPAA ativa-se com uma checkboxA conformidade passa a ser problema seu

Regra rápida de decisão:

  • Abaixo de 10.000 minutos/mês → bundled ganha quase sempre no custo total de propriedade (só o tempo de engenharia já empata).
  • 10.000–100.000 minutos/mês → BYOK começa a compensar se tiver 1+ engineer dedicado.
  • Acima de 100.000 minutos/mês → BYOK ou direto no Realtime é normalmente $0,05–$0,10/min mais barato, e tem volume para negociar tarifas de sub-conta Twilio.

Para uma análise mais aprofundada dos custos de LLM no lado BYOK, veja a nossa análise de opções de orquestração em melhores frameworks de agentes de IA.

As taxas ocultas que a maioria das pessoas ignora

Mesmo quando domina a matemática das quatro camadas, a fatura chega com linhas que a página inicial nunca mencionou. Estas sete são as que vemos atingir clientes com mais frequência. A maioria está enterrada nas letras miúdas da página de preços ou nos ecrãs de configuração pós-registo. Não são maliciosas, apenas mal comunicadas.

  1. Add-on HIPAA. A Vapi cobra $2.000/mês por HIPAA, segundo a sua página de preços. Retell, Bland e Synthflow incluem HIPAA sem custo extra. Se está na área da saúde e pondera a Vapi, são $24k/ano antes de fazer uma única chamada.
  2. Imposto de arredondamento por minuto. A maioria das plataformas arredonda em incrementos de 60 segundos: uma chamada de 61 segundos é faturada como 2 minutos. Com 5.000 chamadas/mês numa distribuição típica de 45–90 segundos, isso representa um acréscimo efetivo de 5–8% sobre o que a sua matemática de $/min indica. A faturação por segundo (Bland, Deepgram) elimina isto.
  3. Aluguer de números de telefone. Twilio: $1–$2/mês por número. Retell: $2/mês por número, $10/mês para números verificados. Parece insignificante até estar a operar 50 números outbound para cold calling; isso é uma linha de $100/mês que ninguém orçamentou.
  4. Taxas de concorrência. A Retell inclui uma base de chamadas simultâneas; acima disso, são $8/concorrência/mês. Uma equipa a fazer 10 chamadas simultâneas acima da base acrescenta $80/mês.
  5. Taxas de transferência. A Bland cobra $0,025/min quando o agente transfere para um humano. Se 20% das suas chamadas forem transferidas, é um imposto significativo sobre o minuto médio.
  6. Taxas de base de conhecimento. A Retell oferece 10 KBs grátis; cada adicional custa $8/mês. Acumule casos de uso com RAG intensivo e isso composta rapidamente.
  7. Upsells de vozes premium. ElevenLabs Premium acrescenta +$0,04/min sobre o Turbo. Parece opcional até a sua equipa comercial fazer testes A/B e descobrir que Premium converte 11% melhor.

Precisa de alguém que detalhe o seu caso de uso específico antes de assinar um contrato com a Vapi? Fazemos isso como parte dos nossos projetos de construção de agentes de voz.

Tokens de áudio e cache de prompts: a alavanca de custo que ninguém explica

A OpenAI Realtime API fatura por tokens de áudio, onde 1 token = 100ms de áudio de input ou 50ms de áudio de output. Uma chamada de 60 segundos usa aproximadamente 600 tokens de input (o interlocutor fala) e 1.200 tokens de output (o agente responde). A $32/M input e $64/M output, isso é $0,0192 input + $0,0768 output = $0,096 de custo bruto de áudio por minuto, ou aproximadamente $0,10/min antes de acrescentar prompts, ferramentas ou Twilio.

Depois há o system prompt. Cada turno envia o seu system prompt completo ao modelo como parte da janela de contexto. Um agente de voz típico tem um system prompt de 2.000 tokens cobrindo persona, ferramentas, casos limite e lógica de recusa. Sem caching, esse bloco de 2.000 tokens é faturado a $32/M como novo em cada chamada: $64 em 1.000 chamadas.

Com cache de prompts ativada (tokens em cache custam $0,40/M segundo a documentação da OpenAI), a mesma carga de 1.000 chamadas é faturada a $0,80. Isso é um desconto de 80× no custo do system prompt. A cache de prompts no OpenAI Realtime reduz o custo do system prompt em 80×. A maioria das equipas só descobre isto após a fatura do primeiro mês.

Aqui está a matemática em código:

python
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min

INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000

# Fresh rates
COST_IN_FRESH = 32 / 1_000_000   # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000  # 80x discount

# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min

# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS    # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS  # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80

Diagrama de faturação de tokens de áudio mostrando tokens de input do OpenAI Realtime a 100ms cada e tokens de output a 50ms cada ao longo de uma chamada de 60 segundos

No nosso trabalho de modelação de custos para clientes que constroem diretamente sobre o Realtime, esta é a maior alavanca entre "o Realtime é barato" e "o Realtime custa o dobro da Vapi". Se está a usar a Responses API juntamente com o Realtime para tool calls, veja o nosso tutorial da OpenAI Responses API para o padrão de implementação. É por isto que construir diretamente sobre o OpenAI Realtime pode ser mais barato ou muito mais caro do que a Vapi, dependendo de fazer ou não cache.

Como calcular o seu próprio TCO (fórmula + Python)

O custo total de propriedade de um agente de voz é o custo variável por minuto mais as taxas fixas mensais amortizadas pelo seu volume de minutos. A fórmula:

TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month

Insira os seus números. Ou bifurque isto:

python
def tco_per_minute(
    calls_per_month: int,
    avg_duration_seconds: float,
    platform_fee_per_min: float,        # e.g., 0.05 for Vapi, 0.13 for Retell bundle
    llm_in_per_1m: float,               # e.g., 0.15 for GPT-4o-mini input
    llm_out_per_1m: float,              # e.g., 0.60 for GPT-4o-mini output
    llm_in_tokens_per_call: int,        # e.g., 1800
    llm_out_tokens_per_call: int,       # e.g., 1200
    tts_per_min: float,                 # e.g., 0.10 for ElevenLabs Turbo
    stt_per_min: float,                 # e.g., 0.005 for Deepgram Nova-2
    telephony_per_min: float,           # e.g., 0.014 for Twilio US
    fixed_monthly: float = 0.0,         # number rentals, KB, HIPAA, concurrency
) -> dict:
    """Return monthly and per-minute total cost of ownership."""
    minutes_per_month = (calls_per_month * avg_duration_seconds) / 60

    # Variable per-call
    llm_cost_per_call = (
        (llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
        + (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
    )
    avg_minutes_per_call = avg_duration_seconds / 60
    variable_per_call = (
        platform_fee_per_min * avg_minutes_per_call
        + llm_cost_per_call
        + tts_per_min * avg_minutes_per_call
        + stt_per_min * avg_minutes_per_call
        + telephony_per_min * avg_minutes_per_call
    )

    monthly_variable = variable_per_call * calls_per_month
    monthly_total = monthly_variable + fixed_monthly
    cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0

    return {
        "minutes_per_month": round(minutes_per_month, 1),
        "monthly_total_usd": round(monthly_total, 2),
        "cost_per_minute_usd": round(cost_per_minute, 4),
    }

# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
    calls_per_month=5000,
    avg_duration_seconds=240,
    platform_fee_per_min=0.05,
    llm_in_per_1m=0.15, llm_out_per_1m=0.60,
    llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
    tts_per_min=0.10,
    stt_per_min=0.005,
    telephony_per_min=0.014,
    fixed_monthly=2.0,  # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}

Quatro passos numerados para quem está a prever do zero:

  1. Estime o volume mensal de chamadas e a duração média de cada chamada.
  2. Escolha a sua stack: plataforma + LLM + TTS + STT + telefonia.
  3. Consulte o preço por unidade de cada componente na página de preços do fornecedor.
  4. Execute a fórmula (ou a função Python acima); o resultado é a sua previsão de $/min e $ mensal.

Se não consegue escrever o seu TCO como uma fórmula de uma linha, vai perder dinheiro no imposto de arredondamento por minuto.

Custo em escala: 1k vs 10k vs 100k minutos por mês

As curvas divergem rapidamente acima dos 10.000 minutos. Plataformas bundled achatam porque a fatura é simplesmente minutos × tarifa. Stacks BYOK inclinam-se à medida que os custos de LLM e TTS escalam linearmente consigo. O OpenAI Realtime com caching cruza a Vapi por volta dos 10k–20k minutos/mês, o ponto de inflexão onde direto na infraestrutura começa a fazer sentido.

Plataforma1.000 min/mês10.000 min/mês100.000 min/mês
Bland fixo $0,09/min + Twilio$120$1.160$11.400
Retell bundle ~$0,145/min tudo incluído$145$1.450$14.500
Vapi BYOK ~$0,17/min tudo incluído$170$1.700$17.000
OpenAI Realtime + caching ~$0,13/min$130$1.300$13.000
Deepgram Voice Agent + Twilio$108$1.080$10.800

Números derivados da fórmula tco_per_minute() acima com os pressupostos da chamada canónica de 4 minutos. Acrescente HIPAA ($2.000/mês Vapi), concorrência e aluguer de números onde aplicável. Não alteram a forma da curva, mas elevam o mínimo para compradores de baixo volume.

O gráfico principal no topo deste artigo visualiza os mesmos números: a Bland achata cedo, a Vapi inclina-se à medida que os custos de LLM escalam, e o OpenAI Realtime com caching supera a Vapi acima dos 10k minutos.

Quando NÃO deve implementar um agente de voz

A voz com IA tem um piso real de $0,10–$0,30/min. Abaixo de 200 chamadas por mês, um humano mais um SaaS de $19 continua a ganhar em custo. Aluguer de números, bases de concorrência e mínimos de plataforma somam um overhead de $50–$200/mês que uma equipa de baixo volume simplesmente não recupera.

Três critérios de "não avançar", honestamente:

  1. Menos de 200 chamadas/mês. Aluguer de números + taxas mínimas + bases de concorrência excedem o custo de um humano a tempo parcial a $20/h. O ponto de equilíbrio não fecha.

  2. Trabalho de alto contexto, baixo volume. O seu único humano trata 15 chamadas por dia, cada uma com 30+ padrões de factos únicos. O custo de alucinação do LLM (reembolsos, negócios perdidos, marcações erradas) come as poupanças. A voz com IA brilha em fluxos repetitivos, não em trabalho com muitos casos limite.

  3. Setores regulados sem orçamento HIPAA. O add-on HIPAA de $2k/mês da Vapi, taxas de conformidade da operadora e proteções de PII ($0,005–$0,01/min na Retell) podem fazer a matemática colapsar. Se não consegue orçamentar $25k/ano só em linhas de conformidade, faça pilotos em fluxos sem PHI primeiro.

Em testes, o ponto de equilíbrio face a um agente humano para desvio de suporte situa-se por volta das 250–400 chamadas/mês nas tarifas bundled típicas. Abaixo disso, um SaaS de $19/mês mais um humano é mais barato. Não implemente voz com IA só porque pode.

Piso silencioso de call center abandonado ao anoitecer com headsets sem uso, simbolizando a realidade do piso de custo da voz com IA

Se a voz com IA ultrapassa o piso de custo mas não quer configurar a Retell ou a Vapi você mesmo, o nosso serviço de desenvolvimento de agentes de voz constrói e opera a stack completa na sua infraestrutura.

Como escolheríamos realmente uma plataforma em 2026 (veredicto por caso de uso)

Nenhuma plataforma ganha em tudo. A escolha séria mais barata depende de ser inbound ou outbound, de ter capacidade de engenharia e de o HIPAA ser relevante. Cinco casos de uso, cinco respostas:

  • Outbound sério mais barato (cold calling): Bland. $0,09/min fixo, taxa de transferência transparente, sem surpresas de custos de LLM. Ignore se precisar de RAG profundo ou ferramentas personalizadas.
  • Inbound mais barato (desvio de suporte): Retell. Bundled, HIPAA incluído, analytics maduros, $0,12–$0,18 tudo incluído. Ignore se o seu volume inbound for inferior a 200 chamadas/mês (ver secção anterior).
  • Máximo controlo + RAG personalizado: Vapi BYOK. Só se tiver capacidade de engenharia para gerir as chaves de LLM, TTS e STT. O controlo só vale $0,27/min quando consegue negociar a operadora e o LLM para baixo com volume.
  • Simplicidade bundled em escala: Deepgram Voice Agent. $4,50/h ($0,075/min) fixo, a opção mais discreta nos resultados de pesquisa. Ignore se precisar da biblioteca alargada de vozes que a ElevenLabs oferece.
  • Referência de qualidade conversacional (demos comerciais, fluxos sensíveis à marca): ElevenLabs Conversational. Vozes Turbo ou Premium a $0,10–$0,12/min. Pague o extra quando a qualidade da voz é a alavanca de conversão.

Para uma análise setorial mais aprofundada no lado empresarial, veja agentes de voz com IA para call centers empresariais: a mesma matemática, com pressupostos de volume específicos para restaurantes e clínicas.

Como a Techsy aborda a modelação de custos de agentes de voz

Não vendemos uma plataforma de voz. Construímos agentes de voz em produção para clientes em Retell, Vapi, Deepgram e OpenAI Realtime. Isso significa que, quando modelamos custos para um novo projeto, executamos a fórmula tco_per_minute() em três escalões de volume (1k, 10k, 100k minutos/mês) antes de recomendar uma stack. A plataforma que ganha em 1k muitas vezes perde em 100k.

Negociamos preços de sub-conta Twilio para clientes acima de 100k minutos/mês (sub-contas desbloqueiam escalões de volume que a maioria das equipas desconhece), e modelamos sempre as poupanças de cache de prompts em projetos Realtime antes de aprovar um design de infraestrutura direta. Metade do nosso trabalho de modelação de custos para clientes é desfazer pressupostos que alguém fez a partir de um post de blog de um fornecedor.

Quer um agente de voz construído de ponta a ponta na plataforma que realmente ganha para o seu volume? Veja como construímos agentes de voz →

FAQ

Quanto custa um agente de voz com IA por minuto em 2026? O custo total situa-se entre $0,07 e $0,30 por minuto. Plataformas bundled (Retell, Bland, ElevenLabs Conversational) ficam em $0,10–$0,18/min com telefonia incluída. Plataformas BYOK como a Vapi ficam em $0,13–$0,31/min após custos de LLM, TTS, STT e Twilio. O OpenAI Realtime direto fica perto de $0,30/min bruto ou aproximadamente $0,12/min com cache de prompts ativada nos system prompts.

Qual é a plataforma de agentes de voz com IA mais barata? Para outbound, a Bland AI a $0,09/min fixo tem a matemática mais limpa do mercado. Para suporte inbound, a Retell a $0,10–$0,16 tudo incluído ganha normalmente graças ao HIPAA bundled e às bases de concorrência. Para jogadas de infraestrutura pura com caching, o OpenAI Realtime pode descer abaixo de $0,15/min. O Deepgram Voice Agent a $0,075/min fixo é a opção mais subestimada.

Porque é que a minha fatura da Vapi é superior a $0,05/min? O valor de $0,05/min na página de preços da Vapi é apenas a taxa de plataforma. A Vapi é BYOK: traz as suas próprias chaves para o LLM (GPT-4o-mini, Claude, etc.), TTS (ElevenLabs, PlayHT), STT (Deepgram) e telefonia (Twilio). O custo real total situa-se em $0,13–$0,31/min dependendo da voz e do modelo que escolher.

Qual é a diferença entre preços BYOK e bundled? Plataformas bundled (Retell, Bland, Synthflow, ElevenLabs Conversational) incluem LLM, STT e TTS numa única tarifa por minuto. Plataformas BYOK (Vapi) cobram apenas pela orquestração; traz as suas próprias chaves de API para tudo o resto e é faturado separadamente por cada fornecedor. Bundled é mais simples; BYOK dá-lhe controlo e capacidade de negociação em escala.

Existem taxas ocultas nos preços de agentes de voz com IA? Sim, sete comuns. Add-ons HIPAA ($2.000/mês na Vapi), arredondamento por minuto (acréscimo efetivo de 5–8% em escala), aluguer de números de telefone ($1–$2/mês), taxas de concorrência ($8/concorrência/mês Retell), taxas de transferência ($0,025/min Bland), taxas de base de conhecimento ($8/mês por KB na Retell) e upsells de vozes premium (+$0,04/min ElevenLabs Premium sobre Turbo).

A OpenAI Realtime API é mais barata que a Vapi? Sem cache de prompts, não: o OpenAI Realtime custa cerca de $0,30/min em custo bruto de áudio. Com cache de prompts ativada (tokens de system prompt em cache a $0,40/M vs $32/M como novo, um desconto de 80×), a linha do system prompt colapsa e o custo total desce para aproximadamente $0,12–$0,15/min. Isso torna-o competitivo com plataformas bundled acima de 10k minutos/mês.

Como prevejo o custo mensal do meu agente de voz? Estime as chamadas por mês multiplicadas pela duração média em minutos. Multiplique pelo $/min total da sua plataforma. Some os custos fixos mensais: aluguer de números de telefone, taxas de base de conhecimento, base de concorrência, add-on HIPAA se aplicável. A função Python tco_per_minute() acima automatiza isto com uma única chamada de função que pode colar num Jupyter notebook.

Faturação por minuto ou por segundo: qual é mais barata? A faturação por segundo é significativamente mais barata para chamadas outbound curtas. Uma chamada de 61 segundos faturada em incrementos de 60 segundos cobra 2 minutos, o que é um imposto efetivo de 5–8% com 5.000 chamadas por mês numa distribuição típica de chamadas curtas. Bland e Deepgram faturam por segundo; a maioria das plataformas BYOK herda o arredondamento de 60 segundos da Twilio por defeito.

Existem agentes de voz com IA gratuitos? Existem trials gratuitos: a maioria dos fornecedores oferece 10–60 minutos grátis (Retell, Vapi, Bland) para testar. Agentes de voz com IA gratuitos para produção não existem porque paga sempre, no mínimo, os minutos da operadora ($0,014/min na Twilio EUA outbound). Mesmo stacks open-source self-hosted (Pipecat, LiveKit Agents) deixam-no a pagar à operadora e ao LLM.

Qual é o ROI da voz com IA vs um agente humano? Agentes humanos custam $15–$30/h com todos os encargos, o que equivale a $0,25–$0,50/min. A voz com IA a $0,10–$0,20/min bate o custo humano acima de aproximadamente 200 chamadas por mês, assumindo taxas de resolução comparáveis. Abaixo desse volume, os mínimos de plataforma e o overhead de aluguer de números tornam um humano mais um SaaS de $19/mês a resposta mais barata.


Este guia é mantido pela equipa editorial da Techsy. Construímos agentes de voz com IA em produção em Retell, Vapi e OpenAI Realtime para clientes; estes números vêm do trabalho de modelação de custos que fazemos todas as semanas, não de brochuras de fornecedores. Preços verificados em maio de 2026; confirme sempre nas páginas de preços dos fornecedores antes de assinar.

Etiquetas

preços-agentes-de-voz-iavoz-iaretell-aivapibland-aicusto-llmopenai-realtime

Partilhar este artigo

Artigos relacionados

Mais em ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 Melhores APIs de Web Scraping com IA em 2026 (Testadas na Nossa Própria Stack de Agentes)

Testámos 8 APIs de web scraping com IA com preços reais de 2026, obtidos através da nossa própria stack de agentes. Firecrawl, Bright Data, ScrapingBee e mais 5, classificadas por output pronto para LLM, anti-bot e suporte MCP.

9 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

Engenharia de Prompts para Programação: 7 Padrões Que Usamos Diariamente no Claude Code e Cursor (2026)

A maioria dos artigos sobre 'prompts de IA para programação' oferece 50 modelos para copiar. Este ensina os 7 padrões que usamos todos os dias para gerir um pipeline de 16 agentes no Claude Code, com exemplos reais de antes e depois, além de indicar onde cada padrão se encaixa no Claude Code, Cursor e Copilot em 2026.

11 min read min de leitura
Ler
ai-machine-learning
Jul 19, 2026

Da PoC de IA à Produção: O Checklist de 12 Pontos Antes de Lançar

Uma demo de IA funcional não é um sistema em produção. Este checklist de 12 pontos percorre as três fases que qualquer funcionalidade de IA precisa antes do lançamento: reforçar, estabilizar e implementar, com limites concretos para tetos de custos, limites de taxa, fallbacks e gatilhos de rollback.

10 min read min de leitura
Ler
Ver todos os artigos
Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.

Marca uma chamada de scope 30 minVer o Nosso Trabalho

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.