
Os 6 Melhores Frameworks de Agentes de Voz Open Source em 2026 (Ranking)
No último trimestre, lançámos três agentes de voz telefónicos em Pipecat e, depois, reconstruímos um em LiveKit Agents quando o cliente passou de 20 para 400 chamadas simultâneas. Ambos são frameworks de agentes de voz open source. Nenhum é "o melhor". São bons em tarefas diferentes, e escolher mal custa semanas.
Este ranking resulta do que realmente chega a produção, não do que fica bem num README. Obtivemos os números do GitHub em direto a 14 de julho de 2026: o Pipecat tem 13 416 estrelas, o LiveKit Agents 11 356 e o TEN Framework 10 898. As estrelas não contam a história toda, por isso também ponderámos a atividade de commits, o suporte de telefonia, os termos de licença e como cada um se comporta sob volume real de chamadas.
Resposta rápida: Para a maioria das equipas em 2026, o Pipecat é o framework de agentes de voz open source mais forte, graças à sua vasta biblioteca de integrações e desenvolvimento quase diário. O LiveKit Agents vence na escala e telefonia nativa, o TEN Framework na orquestração de grafos multimodais e o Bolna em colocar um agente telefónico no ar numa tarde.
Se prefere comprar um produto acabado em vez de montar um, as nossas comparações de plataformas geridas como ElevenLabs, Vapi e Synthflow e Retell AI vs Vapi vs Bland são o melhor ponto de partida. É novo nesta categoria? Comece com o que é realmente um agente de voz AI.
Como classificámos estes frameworks
Avaliámos cada framework em cinco aspetos dos quais um projeto real depende: quão ativo é o desenvolvimento (commits nos últimos 90 dias), a amplitude das integrações de STT/LLM/TTS, o suporte de telefonia (consegue atender um número de telefone real), os termos de licença e o comportamento sob concorrência. Eis a lista resumida.
| Posição | Framework | Estrelas (jul 2026) | Licença | Linguagem | Telefonia | Melhor para |
|---|---|---|---|---|---|---|
| 1 | Pipecat | 13 416 | BSD-2-Clause | Python | Twilio, Daily, Telnyx | Projetos de produção completos |
| 2 | LiveKit Agents | 11 356 | Apache-2.0 | Python, Node | SIP nativo + números de telefone | Escala e tempo real |
| 3 | TEN Framework | 10 898 | Apache-2.0 (híbrida) | C, Go, Python, JS | Via Agora RTC | Multimodal e edge |
| 4 | Bolna | 695 | MIT | Python | Twilio, Plivo, Exotel, SIP | Agentes telefónicos rápidos |
| 5 | FastRTC | 4 618 | MIT | Python | WebRTC (traga a sua) | Protótipos e demos |
| 6 | Vocode | 3 773 | MIT | Python | Twilio, Vonage | Referência, com ressalvas |
1. Pipecat — a melhor escolha completa
Pipecat, criado pela equipa por detrás do Daily, é um framework em Python que modela uma conversa como um pipeline: o áudio entra, passa pelo speech-to-text, um modelo de linguagem e text-to-speech, e o áudio sai. Esse modelo mental é fácil de compreender, e atingiu um v1.0 estável em abril de 2026.
O que o distingue é a biblioteca de integrações. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs e dezenas de outros já estão ligados, por isso trocar o fornecedor de TTS é uma alteração de uma linha em vez de uma reescrita. A telefonia funciona através de Twilio, Daily ou Telnyx. Com 13 416 estrelas e commits a chegar quase todos os dias, tem também o maior ímpeto de tudo nesta lista.
O compromisso: como o Pipecat lhe dá as peças em vez de um agente acabado, a lógica de orquestração é sua. Não há um construtor de arrastar e largar. Escreve Python. Para uma equipa que já programa, isso é uma vantagem, não um defeito.
Escolha se: quer uma base neutra em termos de fornecedores, de grau de produção, com o suporte de modelos mais alargado e sente-se à vontade a escrever Python. É o nosso ponto de partida por defeito para a maioria do trabalho com clientes.
2. LiveKit Agents — feito para escala e tempo real
LiveKit Agents adota uma abordagem diferente. Em vez de um pipeline linear, o seu agente junta-se a uma sala como participante via WebRTC, a mesma tecnologia por detrás das chamadas estilo Zoom. Essa arquitetura é a razão pela qual brilha quando precisa de baixa latência e muitas conversas simultâneas.
A grande história de 2026 é a telefonia. O LiveKit lançou SIP e números de telefone nativos, pelo que as chamadas recebidas e efetuadas já não precisam de uma ponte Twilio no meio. Também traz suporte de primeira parte para a OpenAI Realtime API e, a partir da linha 1.5.x, ferramentas nativas de Model Context Protocol e tratamento adaptativo de interrupções. Pode ler os detalhes na documentação do LiveKit Agents. Se quer compreender a API de tempo real que envolve, cobrimos a Realtime API da OpenAI para agentes de voz separadamente.
Como corre no servidor de media WebRTC open source do LiveKit, pode alojar toda a stack por conta própria. A curva de aprendizagem é mais íngreme do que a do Pipecat, e a mentalidade de salas e participantes demora um pouco a entranhar.
Escolha se: espera concorrência real, quer telefonia nativa sem ponte, ou está a montar um agente OpenAI Realtime que tem de sobreviver a picos de tráfego.
3. TEN Framework — multimodal e baseado em grafos
TEN Framework (Transformative Extensions Network), apoiado pela Agora, descreve o seu agente como um grafo de nós: STT, LLM, ferramentas, memória, visão. Compõe o grafo num construtor de fluxos e o TEN executa-o. É a opção mais flexível aqui para tudo o que vá além da voz simples, e o seu núcleo em C++ está afinado para áudio de baixa latência.
Também fala a maior variedade de linguagens de qualquer framework nesta lista, com extensões em C, Go, Python, JavaScript e TypeScript, além de conectores prontos para Dify e Coze. A página do Agora TEN Framework é a visão geral mais clara do que consegue fazer.
Duas ressalvas. Primeiro, a licença é híbrida: a maior parte do framework é Apache-2.0, mas com restrições adicionais em certas pastas, por isso leia a LICENSE antes de lançar comercialmente. Segundo, o transporte em tempo real depende da rede da Agora, o que significa um Agora App ID e, acima do nível gratuito, custos de utilização da Agora.
Escolha se: está a construir um agente multimodal (voz mais visão ou avatares), valoriza a composição baseada em grafos, ou quer o desempenho de áudio de mais baixo nível disponível em open source.
4. Bolna — o caminho mais rápido para um agente telefónico
Bolna é mais pequeno (695 estrelas) e mais opinativo do que os três primeiros, e é exatamente essa a sua força. É telefonia em primeiro lugar. Onde outros frameworks o obrigam a montar as chamadas, o Bolna já as traz: Twilio para chamadas globais, Plivo e Exotel para a Índia, e troncos SIP personalizados, tudo configurado numa definição de agente em estilo JSON em vez de código.
Essa configuração orientada significa que pode ter um agente telefónico de entrada ou saída a atender chamadas reais mais depressa do que quase tudo o resto aqui. Por baixo, orquestra fornecedores de ASR, LLM e TTS sobre websockets, pelo que continua a escolher os seus próprios modelos. O desenvolvimento manteve-se ativo até meados de 2026.
O custo dessa velocidade é uma comunidade mais pequena e menos integrações do que o Pipecat ou o LiveKit. Se encontrar um caso extremo, é mais provável que seja a primeira pessoa a reportar o problema. Para projetos com muita telefonia, compare-o com as opções na nossa comparação de telefonia de agentes de voz.
Escolha se: o seu caso de uso é chamadas telefónicas em primeiro lugar (lembretes de marcações, qualificação de saída, suporte de entrada) e quer saltar por completo a canalização de telefonia.
5. FastRTC — a opção leve de prototipagem
FastRTC, da equipa da Hugging Face e do Gradio, não é um framework de agentes completo, e é esse o objetivo. É uma biblioteca em Python para áudio e vídeo em tempo real sobre WebRTC ou websockets. Traz o seu próprio STT, LLM e TTS, e o FastRTC trata do transporte de streaming com apenas algumas linhas de código.
Para uma prova de conceito, uma demo ou uma investigação rápida, esse minimalismo é uma dádiva. Pode montar um protótipo funcional numa tarde sem se comprometer com as convenções de um framework pesado. Combina naturalmente com o ecossistema da Hugging Face, pelo que os modelos abertos são fáceis de ligar.
O outro lado é que fica responsável por tudo o que um framework lhe daria: deteção de turno, tratamento de interrupções, telefonia, gestão de estado. Escala para baixo lindamente e escala para cima dolorosamente.
Escolha se: está a prototipar, a ensinar ou a construir uma demo de navegador, e quer o máximo de controlo com o mínimo de sobrecarga de framework.
6. Vocode — historicamente importante, com uma ressalva de manutenção
Vocode ajudou a definir toda esta categoria. O seu design modular de STT/LLM/TTS e a telefonia integrada de Twilio e Vonage tornaram-no um dos primeiros frameworks de voz open source verdadeiramente utilizáveis, e com 3 773 estrelas ainda aparece em muitos tutoriais.
Eis a parte honesta, e é por isso que fica em último: o núcleo open source ficou silencioso. O último commit ao vocode-core chegou em novembro de 2024, e o repositório tem apenas dois problemas abertos, o que normalmente sinaliza que a atenção se mudou para o produto alojado da empresa em vez de um backlog saudável. O código ainda corre, e o design vale a pena estudar, mas estaria a construir sobre uma fundação que ninguém está ativamente a corrigir.
Escolha se: está a estudar arquitetura de agentes de voz, a manter um projeto Vocode existente, ou quer especificamente os seus padrões de design e aceita que irá manter a base por conta própria.
Também vale a pena saber
Algumas ferramentas ficam logo fora do ranking, mas merecem estar no seu radar:
- OpenAI Agents SDK (27 900+ estrelas) traz uma extensão de pipeline de voz. É um SDK de agentes de uso geral em vez de voz em primeiro lugar, mas é uma escolha razoável se já o padronizou.
- Gabber é um framework multimodal mais recente para agentes que veem, ouvem e falam, orientado para casos de uso com ecrã e câmara.
- Jambonz é uma espinha dorsal de telefonia open source. Não constrói o cérebro do agente, mas é uma forma de nível de operadora para ligar qualquer framework a redes telefónicas reais.
- Rasa (21 000+ estrelas) continua a ser o peso-pesado para diálogo empresarial e NLU em texto e voz, embora seja mais trabalhoso de correr do que qualquer coisa acima.
- Ultravox é um modelo de linguagem de fala rápido, não um framework de orquestração, por isso trate-o como um componente encaixável em vez de um concorrente.
O que usaríamos realmente num projeto de cliente
Na Techsy construímos agentes de voz para clientes B2B, por isso eis a realidade pouco glamorosa por detrás do ranking.
A nossa stack por defeito é Pipecat a ligar Deepgram Nova-3 para speech-to-text, GPT-4o-mini para o modelo de linguagem e Cartesia Sonic para text-to-speech. Quando a deteção de turno está afinada, a latência voz-a-voz fica normalmente entre 0,7 e 1,1 segundos, o que é suficientemente próximo de uma conversa humana para que quem liga deixe de notar. Empurre qualquer um desses componentes para um modelo mais lento e sente-o de imediato.
A telefonia é onde os projetos ficam complicados. Corremos dois padrões em produção: um tronco SIP da Twilio com ponte para o SIP nativo do LiveKit para suporte de entrada de alto volume, e o tratamento Plivo integrado do Bolna quando um cliente só precisava de chamadas de lembrete de saída. A via LiveKit custa mais horas de engenharia à partida, mas mantém-se estável quando chegam 300 chamadas no mesmo minuto. O Bolna põe-no no ar até sexta-feira.
A matemática da autoalojagem confunde as pessoas. Correr STT e TTS locais numa única GPU A10G custa aproximadamente 0,50 a 0,90 dólares por hora, quer entre uma única chamada ou não. APIs de pagamento por minuto como Deepgram e Cartesia não custam nada quando inativas, mas somam depressa acima de alguns milhares de minutos por mês. Abaixo de cerca de 15 000 minutos mensais, as APIs ganham quase sempre, e é isso que recomendamos à maioria dos clientes. Recorremos ao LiveKit em vez do Pipecat sobretudo quando a concorrência ultrapassa algumas centenas de chamadas simultâneas.
Se a questão construir-versus-comprar ainda está em aberto do seu lado, percorremos a análise de custos completa no nosso guia construir vs comprar um agente de voz AI. E se prefere que uma equipa ligue a latência, a telefonia e a escala por si, é exatamente isso que fazemos na prática de agentes de voz da Techsy.
Como escolher num minuto
Salte a paralisia de análise. Eis a decisão em pontos:
- Quer o padrão completo mais seguro: Pipecat.
- Precisa de concorrência real ou telefonia nativa: LiveKit Agents.
- Vai para multimodal (voz mais visão ou avatares): TEN Framework.
- Precisa de um agente telefónico esta semana: Bolna.
- Está a prototipar ou a ensinar: FastRTC.
- Prefere comprar a construir: uma plataforma gerida como Vapi, Retell ou Synthflow, não um framework de todo.
Perguntas Frequentes
O que é um framework de agentes de voz open source?
É uma base de código autoalocável que liga speech-to-text, um modelo de linguagem e text-to-speech para que o software possa manter uma conversa falada. Ao contrário das plataformas geridas, corre-o na sua própria infraestrutura, escolhe os seus próprios modelos e paga apenas pelos serviços subjacentes em vez de uma margem por minuto.
Qual o framework de agentes de voz open source com menor latência?
O TEN Framework lidera no desempenho bruto do pipeline de áudio graças ao seu núcleo em C++, mas na prática a latência de rede e de modelo domina o total. Uma stack Pipecat ou LiveKit bem afinada num modelo rápido atinge rotineiramente 0,7 a 1,1 segundos voz-a-voz, o que iguala o TEN na maioria das implementações reais.
O open source é realmente mais barato do que Vapi ou Retell?
Nem sempre. O open source remove a margem por minuto da plataforma, mas assume custos de engenharia, alojamento e manutenção. Abaixo de alguns milhares de minutos de chamada por mês, uma plataforma gerida é normalmente mais barata depois de contar o tempo de programador. Acima de dezenas de milhares de minutos, autoalojar um framework passa à frente.
Estes frameworks conseguem atender chamadas telefónicas reais?
Sim. O Pipecat liga-se através de Twilio, Daily ou Telnyx; o LiveKit Agents traz SIP e números de telefone nativos; o Bolna tem Twilio, Plivo e Exotel integrados; e o Vocode suporta Twilio e Vonage. O FastRTC é focado no navegador e precisa de uma ponte externa como o Jambonz para a rede telefónica.
Preciso de conhecimentos de machine learning para os usar?
Não. Precisa de competências de engenharia de software, sobretudo Python. O trabalho pesado (transcrição, raciocínio, síntese de fala) é tratado pelos modelos que liga através de uma API. Está a orquestrar serviços, não a treinar modelos, a menos que escolha deliberadamente autoalojar modelos de pesos abertos.
Qual o melhor framework para um iniciante?
Pipecat, porque o seu modelo de pipeline é o mais fácil de compreender e a sua documentação e exemplos são os mais completos. O FastRTC é uma boa segunda escolha se quer começar ainda mais pequeno e compreender a camada de transporte bruta antes de adotar um framework completo.
Os frameworks de voz open source estão prontos para produção em 2026?
Os três primeiros estão. O Pipecat atingiu o v1.0, o LiveKit Agents está na linha 1.5.x e o TEN Framework alimenta implementações comerciais através da Agora. O principal risco não são os frameworks em si, mas o estado de manutenção dos projetos mais pequenos, e é por isso que sinalizámos o núcleo estagnado do Vocode.
Em que difere isto de uma API de TTS como a ElevenLabs?
Uma API de TTS apenas transforma texto em fala, o que é um componente. Um framework de agentes de voz orquestra o ciclo completo: ouve, transcreve, envia o texto a um modelo de linguagem, obtém uma resposta e di-la de volta, enquanto gere interrupções e turnos de fala. O framework chama a API de TTS, não o contrário.
Sobre o autor
Mert Batur Gurbuz é Cofundador da Techsy.io, onde a equipa lança agentes de AI, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na University of Birmingham e escreve sobre a stack de ferramentas de LLM que a equipa da Techsy usa realmente em produção. Ligue-se no LinkedIn.