Techsy
Contacto
Começar
Voltar ao blog
ai-machine-learning

Os 6 Melhores Frameworks de Agentes de Voz Open Source em 2026 (Ranking)

Escrito por Mert Batur Gürbüz
Jul 15, 2026
14 min de leitura
Índice
Os 6 Melhores Frameworks de Agentes de Voz Open Source em 2026 (Ranking)

Os 6 Melhores Frameworks de Agentes de Voz Open Source em 2026 (Ranking)

No último trimestre, lançámos três agentes de voz telefónicos em Pipecat e, depois, reconstruímos um em LiveKit Agents quando o cliente passou de 20 para 400 chamadas simultâneas. Ambos são frameworks de agentes de voz open source. Nenhum é "o melhor". São bons em tarefas diferentes, e escolher mal custa semanas.

Este ranking resulta do que realmente chega a produção, não do que fica bem num README. Obtivemos os números do GitHub em direto a 14 de julho de 2026: o Pipecat tem 13 416 estrelas, o LiveKit Agents 11 356 e o TEN Framework 10 898. As estrelas não contam a história toda, por isso também ponderámos a atividade de commits, o suporte de telefonia, os termos de licença e como cada um se comporta sob volume real de chamadas.

Resposta rápida: Para a maioria das equipas em 2026, o Pipecat é o framework de agentes de voz open source mais forte, graças à sua vasta biblioteca de integrações e desenvolvimento quase diário. O LiveKit Agents vence na escala e telefonia nativa, o TEN Framework na orquestração de grafos multimodais e o Bolna em colocar um agente telefónico no ar numa tarde.

Se prefere comprar um produto acabado em vez de montar um, as nossas comparações de plataformas geridas como ElevenLabs, Vapi e Synthflow e Retell AI vs Vapi vs Bland são o melhor ponto de partida. É novo nesta categoria? Comece com o que é realmente um agente de voz AI.

Como classificámos estes frameworks

Avaliámos cada framework em cinco aspetos dos quais um projeto real depende: quão ativo é o desenvolvimento (commits nos últimos 90 dias), a amplitude das integrações de STT/LLM/TTS, o suporte de telefonia (consegue atender um número de telefone real), os termos de licença e o comportamento sob concorrência. Eis a lista resumida.

PosiçãoFrameworkEstrelas (jul 2026)LicençaLinguagemTelefoniaMelhor para
1Pipecat13 416BSD-2-ClausePythonTwilio, Daily, TelnyxProjetos de produção completos
2LiveKit Agents11 356Apache-2.0Python, NodeSIP nativo + números de telefoneEscala e tempo real
3TEN Framework10 898Apache-2.0 (híbrida)C, Go, Python, JSVia Agora RTCMultimodal e edge
4Bolna695MITPythonTwilio, Plivo, Exotel, SIPAgentes telefónicos rápidos
5FastRTC4 618MITPythonWebRTC (traga a sua)Protótipos e demos
6Vocode3 773MITPythonTwilio, VonageReferência, com ressalvas

1. Pipecat — a melhor escolha completa

Pipecat, criado pela equipa por detrás do Daily, é um framework em Python que modela uma conversa como um pipeline: o áudio entra, passa pelo speech-to-text, um modelo de linguagem e text-to-speech, e o áudio sai. Esse modelo mental é fácil de compreender, e atingiu um v1.0 estável em abril de 2026.

O que o distingue é a biblioteca de integrações. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs e dezenas de outros já estão ligados, por isso trocar o fornecedor de TTS é uma alteração de uma linha em vez de uma reescrita. A telefonia funciona através de Twilio, Daily ou Telnyx. Com 13 416 estrelas e commits a chegar quase todos os dias, tem também o maior ímpeto de tudo nesta lista.

O compromisso: como o Pipecat lhe dá as peças em vez de um agente acabado, a lógica de orquestração é sua. Não há um construtor de arrastar e largar. Escreve Python. Para uma equipa que já programa, isso é uma vantagem, não um defeito.

Escolha se: quer uma base neutra em termos de fornecedores, de grau de produção, com o suporte de modelos mais alargado e sente-se à vontade a escrever Python. É o nosso ponto de partida por defeito para a maioria do trabalho com clientes.

2. LiveKit Agents — feito para escala e tempo real

LiveKit Agents adota uma abordagem diferente. Em vez de um pipeline linear, o seu agente junta-se a uma sala como participante via WebRTC, a mesma tecnologia por detrás das chamadas estilo Zoom. Essa arquitetura é a razão pela qual brilha quando precisa de baixa latência e muitas conversas simultâneas.

A grande história de 2026 é a telefonia. O LiveKit lançou SIP e números de telefone nativos, pelo que as chamadas recebidas e efetuadas já não precisam de uma ponte Twilio no meio. Também traz suporte de primeira parte para a OpenAI Realtime API e, a partir da linha 1.5.x, ferramentas nativas de Model Context Protocol e tratamento adaptativo de interrupções. Pode ler os detalhes na documentação do LiveKit Agents. Se quer compreender a API de tempo real que envolve, cobrimos a Realtime API da OpenAI para agentes de voz separadamente.

Como corre no servidor de media WebRTC open source do LiveKit, pode alojar toda a stack por conta própria. A curva de aprendizagem é mais íngreme do que a do Pipecat, e a mentalidade de salas e participantes demora um pouco a entranhar.

Escolha se: espera concorrência real, quer telefonia nativa sem ponte, ou está a montar um agente OpenAI Realtime que tem de sobreviver a picos de tráfego.

3. TEN Framework — multimodal e baseado em grafos

TEN Framework (Transformative Extensions Network), apoiado pela Agora, descreve o seu agente como um grafo de nós: STT, LLM, ferramentas, memória, visão. Compõe o grafo num construtor de fluxos e o TEN executa-o. É a opção mais flexível aqui para tudo o que vá além da voz simples, e o seu núcleo em C++ está afinado para áudio de baixa latência.

Também fala a maior variedade de linguagens de qualquer framework nesta lista, com extensões em C, Go, Python, JavaScript e TypeScript, além de conectores prontos para Dify e Coze. A página do Agora TEN Framework é a visão geral mais clara do que consegue fazer.

Duas ressalvas. Primeiro, a licença é híbrida: a maior parte do framework é Apache-2.0, mas com restrições adicionais em certas pastas, por isso leia a LICENSE antes de lançar comercialmente. Segundo, o transporte em tempo real depende da rede da Agora, o que significa um Agora App ID e, acima do nível gratuito, custos de utilização da Agora.

Escolha se: está a construir um agente multimodal (voz mais visão ou avatares), valoriza a composição baseada em grafos, ou quer o desempenho de áudio de mais baixo nível disponível em open source.

4. Bolna — o caminho mais rápido para um agente telefónico

Bolna é mais pequeno (695 estrelas) e mais opinativo do que os três primeiros, e é exatamente essa a sua força. É telefonia em primeiro lugar. Onde outros frameworks o obrigam a montar as chamadas, o Bolna já as traz: Twilio para chamadas globais, Plivo e Exotel para a Índia, e troncos SIP personalizados, tudo configurado numa definição de agente em estilo JSON em vez de código.

Essa configuração orientada significa que pode ter um agente telefónico de entrada ou saída a atender chamadas reais mais depressa do que quase tudo o resto aqui. Por baixo, orquestra fornecedores de ASR, LLM e TTS sobre websockets, pelo que continua a escolher os seus próprios modelos. O desenvolvimento manteve-se ativo até meados de 2026.

O custo dessa velocidade é uma comunidade mais pequena e menos integrações do que o Pipecat ou o LiveKit. Se encontrar um caso extremo, é mais provável que seja a primeira pessoa a reportar o problema. Para projetos com muita telefonia, compare-o com as opções na nossa comparação de telefonia de agentes de voz.

Escolha se: o seu caso de uso é chamadas telefónicas em primeiro lugar (lembretes de marcações, qualificação de saída, suporte de entrada) e quer saltar por completo a canalização de telefonia.

5. FastRTC — a opção leve de prototipagem

FastRTC, da equipa da Hugging Face e do Gradio, não é um framework de agentes completo, e é esse o objetivo. É uma biblioteca em Python para áudio e vídeo em tempo real sobre WebRTC ou websockets. Traz o seu próprio STT, LLM e TTS, e o FastRTC trata do transporte de streaming com apenas algumas linhas de código.

Para uma prova de conceito, uma demo ou uma investigação rápida, esse minimalismo é uma dádiva. Pode montar um protótipo funcional numa tarde sem se comprometer com as convenções de um framework pesado. Combina naturalmente com o ecossistema da Hugging Face, pelo que os modelos abertos são fáceis de ligar.

O outro lado é que fica responsável por tudo o que um framework lhe daria: deteção de turno, tratamento de interrupções, telefonia, gestão de estado. Escala para baixo lindamente e escala para cima dolorosamente.

Escolha se: está a prototipar, a ensinar ou a construir uma demo de navegador, e quer o máximo de controlo com o mínimo de sobrecarga de framework.

6. Vocode — historicamente importante, com uma ressalva de manutenção

Vocode ajudou a definir toda esta categoria. O seu design modular de STT/LLM/TTS e a telefonia integrada de Twilio e Vonage tornaram-no um dos primeiros frameworks de voz open source verdadeiramente utilizáveis, e com 3 773 estrelas ainda aparece em muitos tutoriais.

Eis a parte honesta, e é por isso que fica em último: o núcleo open source ficou silencioso. O último commit ao vocode-core chegou em novembro de 2024, e o repositório tem apenas dois problemas abertos, o que normalmente sinaliza que a atenção se mudou para o produto alojado da empresa em vez de um backlog saudável. O código ainda corre, e o design vale a pena estudar, mas estaria a construir sobre uma fundação que ninguém está ativamente a corrigir.

Escolha se: está a estudar arquitetura de agentes de voz, a manter um projeto Vocode existente, ou quer especificamente os seus padrões de design e aceita que irá manter a base por conta própria.

Também vale a pena saber

Algumas ferramentas ficam logo fora do ranking, mas merecem estar no seu radar:

  • OpenAI Agents SDK (27 900+ estrelas) traz uma extensão de pipeline de voz. É um SDK de agentes de uso geral em vez de voz em primeiro lugar, mas é uma escolha razoável se já o padronizou.
  • Gabber é um framework multimodal mais recente para agentes que veem, ouvem e falam, orientado para casos de uso com ecrã e câmara.
  • Jambonz é uma espinha dorsal de telefonia open source. Não constrói o cérebro do agente, mas é uma forma de nível de operadora para ligar qualquer framework a redes telefónicas reais.
  • Rasa (21 000+ estrelas) continua a ser o peso-pesado para diálogo empresarial e NLU em texto e voz, embora seja mais trabalhoso de correr do que qualquer coisa acima.
  • Ultravox é um modelo de linguagem de fala rápido, não um framework de orquestração, por isso trate-o como um componente encaixável em vez de um concorrente.

O que usaríamos realmente num projeto de cliente

Na Techsy construímos agentes de voz para clientes B2B, por isso eis a realidade pouco glamorosa por detrás do ranking.

A nossa stack por defeito é Pipecat a ligar Deepgram Nova-3 para speech-to-text, GPT-4o-mini para o modelo de linguagem e Cartesia Sonic para text-to-speech. Quando a deteção de turno está afinada, a latência voz-a-voz fica normalmente entre 0,7 e 1,1 segundos, o que é suficientemente próximo de uma conversa humana para que quem liga deixe de notar. Empurre qualquer um desses componentes para um modelo mais lento e sente-o de imediato.

A telefonia é onde os projetos ficam complicados. Corremos dois padrões em produção: um tronco SIP da Twilio com ponte para o SIP nativo do LiveKit para suporte de entrada de alto volume, e o tratamento Plivo integrado do Bolna quando um cliente só precisava de chamadas de lembrete de saída. A via LiveKit custa mais horas de engenharia à partida, mas mantém-se estável quando chegam 300 chamadas no mesmo minuto. O Bolna põe-no no ar até sexta-feira.

A matemática da autoalojagem confunde as pessoas. Correr STT e TTS locais numa única GPU A10G custa aproximadamente 0,50 a 0,90 dólares por hora, quer entre uma única chamada ou não. APIs de pagamento por minuto como Deepgram e Cartesia não custam nada quando inativas, mas somam depressa acima de alguns milhares de minutos por mês. Abaixo de cerca de 15 000 minutos mensais, as APIs ganham quase sempre, e é isso que recomendamos à maioria dos clientes. Recorremos ao LiveKit em vez do Pipecat sobretudo quando a concorrência ultrapassa algumas centenas de chamadas simultâneas.

Se a questão construir-versus-comprar ainda está em aberto do seu lado, percorremos a análise de custos completa no nosso guia construir vs comprar um agente de voz AI. E se prefere que uma equipa ligue a latência, a telefonia e a escala por si, é exatamente isso que fazemos na prática de agentes de voz da Techsy.

Como escolher num minuto

Salte a paralisia de análise. Eis a decisão em pontos:

  • Quer o padrão completo mais seguro: Pipecat.
  • Precisa de concorrência real ou telefonia nativa: LiveKit Agents.
  • Vai para multimodal (voz mais visão ou avatares): TEN Framework.
  • Precisa de um agente telefónico esta semana: Bolna.
  • Está a prototipar ou a ensinar: FastRTC.
  • Prefere comprar a construir: uma plataforma gerida como Vapi, Retell ou Synthflow, não um framework de todo.

Perguntas Frequentes

O que é um framework de agentes de voz open source?

É uma base de código autoalocável que liga speech-to-text, um modelo de linguagem e text-to-speech para que o software possa manter uma conversa falada. Ao contrário das plataformas geridas, corre-o na sua própria infraestrutura, escolhe os seus próprios modelos e paga apenas pelos serviços subjacentes em vez de uma margem por minuto.

Qual o framework de agentes de voz open source com menor latência?

O TEN Framework lidera no desempenho bruto do pipeline de áudio graças ao seu núcleo em C++, mas na prática a latência de rede e de modelo domina o total. Uma stack Pipecat ou LiveKit bem afinada num modelo rápido atinge rotineiramente 0,7 a 1,1 segundos voz-a-voz, o que iguala o TEN na maioria das implementações reais.

O open source é realmente mais barato do que Vapi ou Retell?

Nem sempre. O open source remove a margem por minuto da plataforma, mas assume custos de engenharia, alojamento e manutenção. Abaixo de alguns milhares de minutos de chamada por mês, uma plataforma gerida é normalmente mais barata depois de contar o tempo de programador. Acima de dezenas de milhares de minutos, autoalojar um framework passa à frente.

Estes frameworks conseguem atender chamadas telefónicas reais?

Sim. O Pipecat liga-se através de Twilio, Daily ou Telnyx; o LiveKit Agents traz SIP e números de telefone nativos; o Bolna tem Twilio, Plivo e Exotel integrados; e o Vocode suporta Twilio e Vonage. O FastRTC é focado no navegador e precisa de uma ponte externa como o Jambonz para a rede telefónica.

Preciso de conhecimentos de machine learning para os usar?

Não. Precisa de competências de engenharia de software, sobretudo Python. O trabalho pesado (transcrição, raciocínio, síntese de fala) é tratado pelos modelos que liga através de uma API. Está a orquestrar serviços, não a treinar modelos, a menos que escolha deliberadamente autoalojar modelos de pesos abertos.

Qual o melhor framework para um iniciante?

Pipecat, porque o seu modelo de pipeline é o mais fácil de compreender e a sua documentação e exemplos são os mais completos. O FastRTC é uma boa segunda escolha se quer começar ainda mais pequeno e compreender a camada de transporte bruta antes de adotar um framework completo.

Os frameworks de voz open source estão prontos para produção em 2026?

Os três primeiros estão. O Pipecat atingiu o v1.0, o LiveKit Agents está na linha 1.5.x e o TEN Framework alimenta implementações comerciais através da Agora. O principal risco não são os frameworks em si, mas o estado de manutenção dos projetos mais pequenos, e é por isso que sinalizámos o núcleo estagnado do Vocode.

Em que difere isto de uma API de TTS como a ElevenLabs?

Uma API de TTS apenas transforma texto em fala, o que é um componente. Um framework de agentes de voz orquestra o ciclo completo: ouve, transcreve, envia o texto a um modelo de linguagem, obtém uma resposta e di-la de volta, enquanto gere interrupções e turnos de fala. O framework chama a API de TTS, não o contrário.

Sobre o autor

Mert Batur Gurbuz é Cofundador da Techsy.io, onde a equipa lança agentes de AI, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na University of Birmingham e escreve sobre a stack de ferramentas de LLM que a equipa da Techsy usa realmente em produção. Ligue-se no LinkedIn.

Etiquetas

frameworks de agentes de voz open sourcepipecatlivekit-agentsten-frameworkvoice ai

Partilhar este artigo

Artigos relacionados

Mais em ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 Melhores APIs de Web Scraping com IA em 2026 (Testadas na Nossa Própria Stack de Agentes)

Testámos 8 APIs de web scraping com IA com preços reais de 2026, obtidos através da nossa própria stack de agentes. Firecrawl, Bright Data, ScrapingBee e mais 5, classificadas por output pronto para LLM, anti-bot e suporte MCP.

9 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

Engenharia de Prompts para Programação: 7 Padrões Que Usamos Diariamente no Claude Code e Cursor (2026)

A maioria dos artigos sobre 'prompts de IA para programação' oferece 50 modelos para copiar. Este ensina os 7 padrões que usamos todos os dias para gerir um pipeline de 16 agentes no Claude Code, com exemplos reais de antes e depois, além de indicar onde cada padrão se encaixa no Claude Code, Cursor e Copilot em 2026.

11 min read min de leitura
Ler
ai-machine-learning
Jul 19, 2026

Da PoC de IA à Produção: O Checklist de 12 Pontos Antes de Lançar

Uma demo de IA funcional não é um sistema em produção. Este checklist de 12 pontos percorre as três fases que qualquer funcionalidade de IA precisa antes do lançamento: reforçar, estabilizar e implementar, com limites concretos para tetos de custos, limites de taxa, fallbacks e gatilhos de rollback.

10 min read min de leitura
Ler
Ver todos os artigos
Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.

Marca uma chamada de scope 30 minVer o Nosso Trabalho

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.