ai-machine-learning

Los 6 Mejores Frameworks de Agentes de Voz Open Source en 2026 (Clasificados)

Escrito por Mert Batur
Jul 15, 2026
14 lectura
Los 6 Mejores Frameworks de Agentes de Voz Open Source en 2026 (Clasificados)

El trimestre pasado lanzamos tres agentes de voz telefónicos con Pipecat, y luego reconstruimos uno con LiveKit Agents cuando el cliente pasó de 20 a 400 llamadas simultáneas. Ambos son frameworks de agentes de voz open source. Ninguno es "el mejor". Cada uno hace bien un trabajo distinto, y elegir mal te cuesta semanas.

Esta clasificación se basa en lo que realmente funciona en producción, no en lo que suena bien en un README. Sacamos los datos en vivo de GitHub el 14 de julio de 2026: Pipecat tiene 13,416 estrellas, LiveKit Agents 11,356 y TEN Framework 10,898. Las estrellas no cuentan toda la historia, así que también valoramos la actividad de commits, el soporte de telefonía, los términos de licencia y cómo se comporta cada uno bajo un volumen real de llamadas.

Respuesta rápida: Para la mayoría de los equipos en 2026, Pipecat es el framework de agentes de voz open source más sólido gracias a su amplia biblioteca de integraciones y su desarrollo casi diario. LiveKit Agents gana en escala y telefonía nativa, TEN Framework en orquestación multimodal por grafos, y Bolna en poner un agente telefónico en marcha en una tarde.

Si prefieres comprar un producto terminado en lugar de montarlo tú mismo, nuestras comparativas de plataformas gestionadas como ElevenLabs, Vapi y Synthflow y Retell AI vs Vapi vs Bland son mejor punto de partida. ¿Eres nuevo en esta categoría? Empieza por qué es realmente un agente de voz con IA.

Cómo clasificamos estos frameworks

Puntuamos cada framework en cinco aspectos de los que depende la vida o muerte de un proyecto real: qué tan activo está el desarrollo (commits en los últimos 90 días), la amplitud de integraciones de STT/LLM/TTS, el soporte de telefonía (si puede responder a un número de teléfono real), los términos de la licencia y el comportamiento bajo concurrencia. Aquí tienes la lista resumida de un vistazo.

PosiciónFrameworkEstrellas (jul. 2026)LicenciaLenguajeTelefoníaMejor para
1Pipecat13,416BSD-2-ClausePythonTwilio, Daily, TelnyxCompilaciones de producción todoterreno
2LiveKit Agents11,356Apache-2.0Python, NodeNative SIP + phone numbersEscala y tiempo real
3TEN Framework10,898Apache-2.0 (hybrid)C, Go, Python, JSVia Agora RTCMultimodal y edge
4Bolna695MITPythonTwilio, Plivo, Exotel, SIPAgentes telefónicos rápidos
5FastRTC4,618MITPythonWebRTC (bring your own)Prototipos y demos
6Vocode3,773MITPythonTwilio, VonageReferencia, con matices

1. Pipecat: la mejor opción todoterreno

Pipecat, creado por el equipo detrás de Daily, es un framework en Python que modela una conversación como un pipeline: el audio entra, pasa por speech-to-text, un modelo de lenguaje y text-to-speech, y vuelve a salir como audio. Ese modelo mental es fácil de entender, y alcanzó una v1.0 estable en abril de 2026.

Lo que lo distingue es su biblioteca de integraciones. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs y docenas más ya están conectados, así que cambiar de proveedor de TTS es un cambio de una línea en lugar de una reescritura completa. La telefonía funciona a través de Twilio, Daily o Telnyx. Con 13,416 estrellas y commits que llegan casi todos los días, también es el que tiene más impulso de toda esta lista.

La contrapartida: como Pipecat te da las piezas en lugar de un agente terminado, tú te encargas de la lógica de orquestación. No hay un editor de arrastrar y soltar. Escribes Python. Para un equipo que ya programa, eso es una ventaja, no un problema.

Elígelo si: quieres una base neutral respecto a proveedores, lista para producción, con el mayor soporte de modelos, y te sientes cómodo escribiendo Python. Este es nuestro punto de partida por defecto para la mayoría de proyectos con clientes.

2. LiveKit Agents: creado para escala y tiempo real

LiveKit Agents plantea un enfoque diferente. En lugar de un pipeline lineal, tu agente se une a una sala como un participante más a través de WebRTC, la misma tecnología detrás de las llamadas al estilo Zoom. Esa arquitectura es la razón por la que brilla cuando necesitas baja latencia y muchas conversaciones simultáneas.

La gran novedad de 2026 es la telefonía. LiveKit lanzó SIP nativo y números de teléfono propios, así que las llamadas entrantes y salientes ya no necesitan un puente de Twilio en medio. También incluye soporte de primera parte para la OpenAI Realtime API y, desde la línea 1.5.x, herramientas nativas de Model Context Protocol y gestión adaptativa de interrupciones. Puedes leer los detalles en la documentación de LiveKit Agents. Si quieres entender la realtime API que envuelve, lo cubrimos por separado en la Realtime API de OpenAI para agentes de voz.

Como funciona sobre el servidor de medios WebRTC open source de LiveKit, puedes autoalojar todo el stack. La curva de aprendizaje es más pronunciada que la de Pipecat, y pensar en términos de salas y participantes tarda un poco en encajar.

Elígelo si: esperas concurrencia real, quieres telefonía nativa sin un puente intermedio, o estás montando un agente con OpenAI Realtime que tiene que aguantar picos de tráfico.

3. TEN Framework: multimodal y basado en grafos

TEN Framework (Transformative Extensions Network), respaldado por Agora, describe tu agente como un grafo de nodos: STT, LLM, herramientas, memoria, visión. Compones el grafo en un editor de flujos de trabajo, y TEN lo ejecuta. Es la opción más flexible de esta lista para cualquier cosa que vaya más allá de la voz pura, y su núcleo en C++ está optimizado para audio de baja latencia.

También es el que soporta la gama más amplia de lenguajes de programación de todos los frameworks de esta lista, con extensiones en C, Go, Python, JavaScript y TypeScript, además de conectores listos para usar con Dify y Coze. La página de TEN Framework en Agora es el resumen más claro de lo que puede hacer.

Dos advertencias. La primera: la licencia es híbrida. La mayor parte del framework es Apache-2.0, pero con restricciones adicionales en ciertas carpetas, así que lee el archivo LICENSE antes de lanzarlo comercialmente. La segunda: el transporte en tiempo real depende de la red de Agora, lo que implica un Agora App ID y, más allá del nivel gratuito, costes de uso de Agora.

Elígelo si: estás construyendo un agente multimodal (voz más visión o avatares), valoras la composición basada en grafos, o quieres el mejor rendimiento de audio a bajo nivel disponible en open source.

4. Bolna: el camino más rápido a un agente telefónico

Bolna es más pequeño (695 estrellas) y mucho más definido en sus decisiones de diseño que los tres primeros, y ahí está precisamente su fortaleza. Está pensado ante todo para la telefonía. Donde otros frameworks te obligan a montar tú mismo las llamadas, Bolna las trae listas: Twilio para llamadas globales, Plivo y Exotel para India, y troncales SIP personalizadas, todo configurado en una definición de agente en formato JSON en lugar de código.

Ese enfoque basado en configuración significa que puedes tener un agente telefónico entrante o saliente respondiendo llamadas reales más rápido que casi cualquier otra opción de esta lista. Por debajo, orquesta proveedores de ASR, LLM y TTS a través de websockets, así que sigues eligiendo tus propios modelos. El desarrollo se mantuvo activo hasta mediados de 2026.

El precio de esa velocidad es una comunidad más pequeña y menos integraciones que Pipecat o LiveKit. Si te topas con un caso límite, es probable que seas la primera persona en reportar ese issue. Para proyectos con mucho peso en telefonía, compáralo con las opciones de nuestra comparativa de telefonía para agentes de voz.

Elígelo si: tu caso de uso es ante todo llamadas telefónicas (recordatorios de citas, calificación de leads saliente, soporte entrante) y quieres saltarte por completo la fontanería de telefonía.

5. FastRTC: la opción ligera para prototipos

FastRTC, del equipo de Hugging Face y Gradio, no es un framework de agentes completo, y esa es justo la idea. Es una biblioteca de Python para audio y vídeo en tiempo real sobre WebRTC o websockets. Tú aportas tu propio STT, LLM y TTS, y FastRTC gestiona el transporte en streaming con apenas unas líneas de código.

Para una prueba de concepto, una demo o una investigación rápida, ese minimalismo es un regalo. Puedes montar un prototipo que hable en una tarde sin comprometerte con las convenciones de un framework pesado. Encaja de forma natural con el ecosistema de Hugging Face, así que es fácil conectar modelos abiertos.

La otra cara de la moneda es que tú eres responsable de todo lo que un framework te daría por defecto: detección de turnos, gestión de interrupciones, telefonía, gestión de estado. Se reduce de maravilla, pero escalar hacia arriba es doloroso.

Elígelo si: estás prototipando, enseñando o construyendo una demo de navegador, y quieres el máximo control con el mínimo peso de framework.

6. Vocode: históricamente importante, con una advertencia de mantenimiento

Vocode ayudó a definir toda esta categoría. Su diseño modular de STT/LLM/TTS y su telefonía integrada con Twilio y Vonage lo convirtieron en uno de los primeros frameworks de voz open source realmente utilizables, y con 3,773 estrellas todavía aparece en un montón de tutoriales.

Y aquí va la parte honesta, la razón por la que queda en último lugar: el núcleo open source se ha quedado en silencio. El último commit a vocode-core llegó en noviembre de 2024, y el repositorio tiene solo dos issues abiertos, lo cual suele indicar que la atención se ha movido al producto gestionado de la empresa en lugar de a un backlog sano. El código todavía funciona, y el diseño merece la pena estudiarlo, pero estarías construyendo sobre una base que nadie está parcheando activamente.

Elígelo si: estás estudiando la arquitectura de agentes de voz, mantienes un proyecto Vocode existente, o quieres específicamente sus patrones de diseño y aceptas que tendrás que mantener tú mismo la base.

También merece la pena conocer

Hay algunas herramientas que quedan justo fuera de la clasificación pero merecen estar en tu radar:

  • OpenAI Agents SDK (27,900+ estrellas) incluye una extensión de pipeline de voz. Es un SDK de agentes de propósito general en lugar de estar centrado en voz, pero es una opción razonable si ya lo tienes como estándar.
  • Gabber es un framework multimodal más reciente para agentes que ven, oyen y hablan, pensado para casos de uso con pantalla y cámara.
  • Jambonz es una columna vertebral de telefonía open source. No construye el "cerebro" del agente, pero es una forma de nivel operador para conectar cualquier framework a redes telefónicas reales.
  • Rasa (21,000+ estrellas) sigue siendo el peso pesado para diálogo empresarial y NLU en texto y voz, aunque es más complejo de operar que cualquiera de las opciones anteriores.
  • Ultravox es un modelo de lenguaje de voz rápido, no un framework de orquestación, así que trátalo como un componente conectable en lugar de un competidor.

Qué usaríamos de verdad para un proyecto con un cliente

En Techsy construimos agentes de voz para clientes B2B, así que aquí va la realidad poco glamurosa detrás de esta clasificación.

Nuestro stack por defecto es Pipecat conectando Deepgram Nova-3 para speech-to-text, GPT-4o-mini como modelo de lenguaje y Cartesia Sonic para text-to-speech. Una vez que la detección de turnos está bien ajustada, la latencia voz-a-voz suele quedar entre 0.7 y 1.1 segundos, lo bastante cerca de una conversación humana como para que quien llama deje de notarlo. Si cambias cualquiera de esos componentes por un modelo más lento, lo notas al instante.

La telefonía es donde los proyectos se complican. Hemos usado dos patrones en producción: un troncal SIP de Twilio conectado al SIP nativo de LiveKit para soporte entrante de alto volumen, y el manejo integrado de Plivo de Bolna cuando un cliente solo necesitaba llamadas salientes de recordatorio. La ruta de LiveKit cuesta más horas de ingeniería por adelantado, pero se mantiene estable cuando llegan 300 llamadas en el mismo minuto. Con Bolna lo tienes en producción para el viernes.

Las cuentas del autoalojamiento suelen confundir a la gente. Ejecutar STT y TTS locales en una sola GPU A10G cuesta aproximadamente entre $0.50 y $0.90 por hora, tanto si entra una llamada como si no entra ninguna. Las APIs de pago por minuto como Deepgram y Cartesia no cuestan nada en reposo, pero se disparan rápido a partir de unos pocos miles de minutos al mes. Por debajo de unos 15,000 minutos mensuales, las APIs casi siempre ganan, y eso es lo que recomendamos a la mayoría de los clientes. Recurrimos a LiveKit en lugar de Pipecat sobre todo cuando la concurrencia supera unos cientos de llamadas simultáneas.

Si la pregunta de construir o comprar sigue abierta en tu caso, repasamos el desglose completo de costes en nuestra guía construir o comprar un agente de voz con IA. Y si prefieres que un equipo se encargue de la latencia, la telefonía y el escalado por ti, eso es exactamente lo que hacemos en la práctica de agentes de voz de Techsy.

Cómo elegir en un minuto

Sáltate la parálisis por análisis. Aquí tienes la decisión en forma de lista:

  • Quieres la opción por defecto más segura y todoterreno: Pipecat.
  • Necesitas concurrencia real o telefonía nativa: LiveKit Agents.
  • Vas a por multimodal (voz más visión o avatares): TEN Framework.
  • Necesitas un agente telefónico en producción esta semana: Bolna.
  • Estás prototipando o enseñando: FastRTC.
  • Prefieres comprar en lugar de construir: una plataforma gestionada como Vapi, Retell o Synthflow, no un framework.

Preguntas Frecuentes

¿Qué es un framework de agentes de voz open source?

Es una base de código autoalojable que conecta speech-to-text, un modelo de lenguaje y text-to-speech para que el software pueda mantener una conversación hablada. A diferencia de las plataformas gestionadas, lo ejecutas en tu propia infraestructura, eliges tus propios modelos y solo pagas por los servicios subyacentes en lugar de un margen por minuto.

¿Qué framework de agentes de voz open source tiene la latencia más baja?

TEN Framework lidera en rendimiento puro del pipeline de audio gracias a su núcleo en C++, pero en la práctica la latencia de red y de modelo dominan el total. Un stack de Pipecat o LiveKit bien ajustado sobre un modelo rápido suele alcanzar entre 0.7 y 1.1 segundos voz-a-voz, lo que iguala a TEN en la mayoría de los despliegues reales.

¿Es el open source realmente más barato que Vapi o Retell?

No siempre. El open source elimina el margen por minuto de la plataforma, pero asumes costes de ingeniería, hosting y mantenimiento. Por debajo de unos pocos miles de minutos de llamada al mes, una plataforma gestionada suele salir más barata en cuanto cuentas el tiempo de desarrollo. Por encima de decenas de miles de minutos, autoalojar un framework toma la delantera.

¿Pueden estos frameworks responder llamadas telefónicas reales?

Sí. Pipecat se conecta a través de Twilio, Daily o Telnyx; LiveKit Agents incluye SIP nativo y números de teléfono; Bolna tiene Twilio, Plivo y Exotel integrados; y Vocode es compatible con Twilio y Vonage. FastRTC está centrado en el navegador y necesita un puente externo como Jambonz para conectar con la red telefónica.

¿Necesito experiencia en machine learning para usarlos?

No. Necesitas habilidades de ingeniería de software, sobre todo Python. El trabajo pesado (transcripción, razonamiento, síntesis de voz) lo hacen los modelos que conectas a través de una API. Estás orquestando servicios, no entrenando modelos, a menos que decidas deliberadamente autoalojar modelos de pesos abiertos.

¿Qué framework es mejor para un principiante?

Pipecat, porque su modelo de pipeline es el más fácil de entender y su documentación y ejemplos son los más completos. FastRTC es una buena segunda opción si quieres empezar todavía más pequeño y entender la capa de transporte en bruto antes de adoptar un framework completo.

¿Están los frameworks de voz open source listos para producción en 2026?

Los tres primeros sí lo están. Pipecat alcanzó la v1.0, LiveKit Agents va por su línea 1.5.x, y TEN Framework impulsa despliegues comerciales a través de Agora. El principal riesgo no son los frameworks en sí, sino el estado de mantenimiento de los proyectos más pequeños, que es justo por lo que señalamos el núcleo estancado de Vocode.

¿En qué se diferencia esto de una API de TTS como ElevenLabs?

Una API de TTS solo convierte texto en voz, que es un único componente. Un framework de agentes de voz orquesta todo el ciclo: escucha, transcribe, envía el texto a un modelo de lenguaje, recibe una respuesta y la dice en voz alta, mientras gestiona las interrupciones y los turnos de conversación. El framework llama a la API de TTS, no al revés.

Sobre el autor

Mert Batur es cofundador de Techsy.io, donde el equipo construye agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre el stack de herramientas LLM que el equipo de Techsy usa de verdad en producción. Conecta en LinkedIn.

Etiquetas

frameworks-agentes-voz-open-sourcepipecatlivekit-agentsten-frameworkvoice-ai

Compartir este artículo

Inicia Tu Proyecto

¿Listo para construir algo extraordinario?

Convirtamos tu visión en realidad. Nuestro equipo está listo para ayudarte a crear software que marque la diferencia.