ai-machine-learning

Análisis de OmniVoice: la alternativa open source a ElevenLabs (600+ idiomas)

Escrito por Mert Batur
Jun 5, 2026
13 lectura
Análisis de OmniVoice: la alternativa open source a ElevenLabs (600+ idiomas)

Instalamos OmniVoice v0.1.5 de k2-fsa la semana pasada en una RTX 4090, le dimos un clip de 6 segundos de una voz en inglés y le pedimos que leyera un párrafo en tres idiomas. Arranque en frío: unos 14 segundos con la carga del modelo. ¿Y las ejecuciones en caliente después? Alrededor de RTF 0,03, cerca de 30 veces el tiempo real. La versión corta de este análisis: sí, este proyecto open source es una verdadera alternativa open source a ElevenLabs para cierto tipo de usuario, y no, no sustituirá una API en la nube pulida para todo el mundo. Veamos quién es quién.

Puntos clave:

  • OmniVoice es un TTS gratuito bajo Apache-2.0 de k2-fsa que cubre 600+ idiomas con clonación de voz zero-shot.
  • En nuestra prueba alcanzó un RTF de ~0,03 en una RTX 4090; con unos 8 GB de VRAM basta.
  • Supera a ElevenLabs en idiomas (646 frente a ~32), coste (0 $ frente a 5–330 $/mes) y privacidad, no en pulido ni en streaming en tiempo real.
  • Ideal para doblaje, trabajo on-premise e idiomas poco dotados; evítalo para agentes conversacionales por debajo de 300 ms.

¿Qué es OmniVoice (y por qué importa)?

OmniVoice es un modelo de síntesis de voz open source bajo Apache-2.0 de k2-fsa, el equipo de investigación de voz detrás de Kaldi y k2. Es un TTS de 0,6 mil millones de parámetros al estilo de un modelo de lenguaje por difusión, que funciona en local, cubre 600+ idiomas y clona voces en zero-shot. Importa porque, por primera vez, un modelo local realmente gratuito se acerca lo suficiente a un servicio en la nube de pago como para que la decisión sea real, no solo teórica.

El repositorio (github.com/k2-fsa/OmniVoice) ronda las 7,1k estrellas, y la última versión es la v0.1.5 del 28 de abril de 2026. Por dentro está afinado a partir de Qwen3-0.6B-Base y produce audio a 24 kHz. Si has leído nuestro repaso de las mejores herramientas de voz con IA, piensa en OmniVoice como el extremo autoalojado de ese espectro, la opción a la que recurres cuando los datos no pueden salir de tus servidores.

El origen k2-fsa es la parte que la mayoría de los artículos pasa por alto. No es un proyecto de fin de semana de una cuenta anónima. Es el mismo linaje que ha moldeado el reconocimiento de voz abierto durante más de una década, una gran razón por la que la calidad ya es tan buena tan pronto.

Funciones de OmniVoice de un vistazo

OmniVoice mete el conjunto de funciones que esperarías de una plataforma de pago en un modelo que descargas una vez. Las cifras destacadas, de su ficha de modelo en HuggingFace: 646 idiomas, clonación zero-shot a partir de un clip de referencia de ~3 segundos, y un RTF que baja hasta 0,025, unas 40 veces más rápido que el tiempo real.

Esto es lo que obtienes en concreto:

  • Clonación de voz a partir de un clip corto, en zero-shot, sin entrenamiento por voz.
  • Diseño de voz por atributos: género, edad, tono, dialecto o acento, e incluso un modo susurro.
  • Control fino con símbolos no verbales y corrección de pronunciación para nombres difíciles.
  • Tres interfaces: una interfaz web Gradio (omnivoice-demo), una API de Python con tres modos de generación y una CLI (omnivoice-infer).
  • Velocidad: RTF por lotes de 0,022, unos 60 segundos de audio en cerca de 1,3 segundos.

En calidad, OmniVoice reporta una puntuación de similitud de hablante (SIM-o) de 0,830 frente al 0,655 de ElevenLabs en pruebas multilingües, y una tasa de error de palabras de solo 0,84 % en el conjunto Seed-TTS chino, superando a ElevenLabs v2 y MiniMax en ese benchmark. Con ~2,5 millones de descargas al mes en HuggingFace, mucha gente está poniendo a prueba esas afirmaciones.

Lo que vimos al ejecutar OmniVoice

Queríamos cifras reales, no promesas del repositorio, así que lo probamos nosotros mismos. Ejecutamos pip install omnivoice en una RTX 4090 (24 GB) en junio de 2026, tomamos una grabación de referencia en inglés limpia de 6 segundos y generamos un párrafo de 60 segundos en inglés, turco y árabe, todo a partir de esa única referencia.

El arranque en frío, con la primera carga del modelo incluida, tardó unos 14 segundos. Después, las ejecuciones por lotes en caliente se estabilizaron en torno a un RTF de 0,03, unas 30 veces el tiempo real en nuestra máquina, un pelín más lento que el 0,025 anunciado por el repositorio pero cercano, y de sobra rápido para doblaje por lotes. El uso de VRAM se mantuvo cómodamente por debajo de lo que ofrecía la tarjeta de 24 GB; la recomendación de ~8 GB de la ficha del modelo se cumplió.

En cuanto a calidad, el inglés y el turco salieron limpios y naturales, con un timbre clonado claramente reconocible a partir de una muestra de seis segundos. El árabe estuvo sólido en frases cortas, pero la prosodia se volvía algo plana en las largas, inteligible, solo que menos expresiva. Un detalle que conviene señalar: querrás pasar ref_text (una transcripción de tu clip de referencia) para la mejor fidelidad de clonación. Sin ella, la coincidencia de voz se desvía. Cuando lo probamos con la transcripción, la similitud subió notablemente.

Es el tipo de resultado que hace que OmniVoice merezca una mirada seria para pipelines multilingües, con los ojos abiertos a sus asperezas.

OmniVoice frente a ElevenLabs: ¿cuán diferentes son?

OmniVoice y ElevenLabs resuelven el mismo problema desde extremos opuestos. ElevenLabs es una API en la nube pulida con una enorme biblioteca de voces predefinidas y baja latencia de streaming; OmniVoice es un modelo local gratuito con 20 veces más cobertura de idiomas y coste cero por carácter. La elección correcta depende de si valoras control y privacidad o comodidad y pulido.

DimensiónOmniVoiceElevenLabs
Idiomas646~32
Coste0 $ (Apache-2.0)5–330 $/mes, por carácter
AlojamientoLocal / sin conexiónSolo nube
LatenciaRTF por lotes ~0,03 (rápido)Baja latencia de streaming
Biblioteca de vocesDIY / clona la tuyaGran biblioteca predefinida
Clonación de vozZero-shot, autogestionadaConsentimiento gestionado por la plataforma
SoporteComunidad / GitHubSLA comercial
Calidad multilingüeSIM-o 0,830SIM-o 0,655, más pulido/consistente

Si estás presupuestando un stack de voz para un agente de voz con IA, esta tabla cambia el cálculo rápido, sobre todo a escala, donde la facturación por carácter de ElevenLabs se acumula (lo desglosamos en nuestra guía de precios de agentes de voz con IA). El veredicto honesto: ElevenLabs es más consistente y fácil; OmniVoice es más barato, más privado y mucho más multilingüe.

¿Cómo se compara OmniVoice con otros modelos TTS open source?

OmniVoice no es el único aspirante open source, y no gana todas las categorías. Tiene con diferencia la cobertura de idiomas más amplia, pero Chatterbox gana las pruebas a ciegas en inglés, Fish Audio encabeza la clasificación independiente EmergentTTS-Eval, y Kokoro es más rápido si no necesitas clonación. Este es el campo honesto.

OmniVoice vs ElevenLabs vs Chatterbox vs Fish Audio vs Qwen3-TTS comparados por número de idiomas y similitud de voz
Cinco modelos TTS open source comparados por cobertura de idiomas y similitud de hablante

ModeloCreadorParámetrosIdiomasClonaciónPunto fuerteElígelo si…
OmniVoicek2-fsa0,6B646Zero-shot, 3sLa cobertura de idiomas más ampliaNecesitas muchos idiomas u on-premise
Chatterbox-TurboResemble AI350MSolo inglésPreferido al 65,3 % en prueba ciega vs ElevenLabs (24,5 %)Solo necesitas inglés y quieres máxima calidad
Fish Audio S2 ProFish Audion/d80+1.º en EmergentTTS-Eval (81,88 % de victorias)Quieres salida expresiva líder en benchmarks
Qwen3-TTS-0.6BAlibaba0,6B10No97 ms de latencia en streamingNecesitas baja latencia en streaming
KokoroOpen source82MCentrado en inglésNo (54 preajustes)210 veces el tiempo real en una RTX 4090Quieres velocidad máxima, sin clonación

La mayoría de estos modelos corren en 4–8 GB de VRAM en fp16, así que el hardware no es el factor decisivo, lo es el caso de uso. Mantenemos la lista actualizada en nuestro repaso de las mejores herramientas de voz con IA.

¿Cuándo deberías usar de verdad OmniVoice?

OmniVoice brilla allí donde la amplitud de idiomas, el coste o el control de los datos pesan más que la necesidad de una API en la nube pulida. Es un caballo de batalla para procesamiento por lotes, no un motor conversacional en tiempo real, así que ajústalo a tareas en las que generas audio por adelantado o ejecutas en tu propio hardware.

  • Doblaje de vídeo a decenas de idiomas a partir de una sola voz de referencia, el flujo de doblaje de vídeo con IA donde la facturación por carácter sería brutal.
  • IVR multilingüe y TTS de agentes de voz, la capa de voz que alimenta un agente de voz para restaurantes o ese tipo de sistemas que reemplazan agentes de centros de llamadas.
  • Audiolibros en largas ejecuciones por lotes donde el RTF importa más que la latencia.
  • Accesibilidad y narración para lectores de pantalla en idiomas que los proveedores en la nube ignoran.
  • Idiomas poco dotados que ElevenLabs simplemente no cubre.
  • Trabajo on-premise y sensible al RGPD donde el audio no puede tocar un servidor de terceros.

Eso último es la función decisiva y silenciosa. Para un cliente de salud o legal, «el audio nunca sale de nuestra máquina» no es algo deseable, es la razón entera por la que se descarta un TTS en la nube.

Pros y contras de OmniVoice (incluido para qué NO sirve)

OmniVoice se gana sus estrellas, pero no es un reemplazo directo de ElevenLabs para todos los equipos. Los pros van de libertad y amplitud; los contras, de pulido, latencia y el peso operativo de ejecutar tu propio modelo.

Pros:

  • Gratis bajo Apache-2.0, sin facturación por carácter, sin límites.
  • 646 idiomas, incluidos algunos que ningún gran proveedor en la nube toca.
  • Funciona totalmente en local, tus datos se quedan donde están.
  • Fuerte calidad de clonación multilingüe (SIM-o 0,830) a partir de un clip de 3 segundos.
  • Rendimiento por lotes rápido (RTF ~0,03 en nuestra prueba).

Contras, los límites honestos:

  • No está hecho para conversación en tiempo real por debajo de 300 ms.
  • Menos pulido y consistente que las mejores voces comerciales como ElevenLabs.
  • Sin soporte gestionado ni SLA, dependes de los issues de GitHub.
  • Necesita una GPU (~8 GB de VRAM); en CPU corre unas 3 veces más lento.
  • Biblioteca de voces predefinidas más pequeña que el catálogo de ElevenLabs.
  • El consentimiento y la licencia de las voces clonadas son tu responsabilidad legal, no de la plataforma.

Si tu producto necesita respuestas instantáneas y pulidas dentro de una llamada en directo, OmniVoice hoy es la herramienta equivocada. Si generas audio por lotes, en más de 600 idiomas, en tu propio hardware, es difícil de superar al precio de gratis.

Cómo empezar con OmniVoice

Poner OmniVoice en marcha lleva un comando de instalación y unas pocas líneas de Python, sin cuenta, sin clave de API, sin configurar facturación. Ese es el beneficio práctico de un modelo open source: pasas de cero a una voz clonada en minutos, y nada de lo que generas sale de tu máquina.

python
# Instalación (build GPU, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
#   --extra-index-url https://download.pytorch.org/whl/cu128

from omnivoice import OmniVoice

model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")

audio = model.generate(
    text="Hello, this is a test of zero-shot voice cloning.",
    ref_audio="ref.wav",                       # clip de referencia ~3-6s
    ref_text="Transcription of the reference audio.",  # mejora la fidelidad del clon
)
# audio -> np.ndarray a 24 kHz

Los modelos se descargan automáticamente desde HuggingFace en el primer arranque. ¿Prefieres no escribir código? Lanza la interfaz Gradio con omnivoice-demo, o procesa archivos por lotes con la CLI omnivoice-infer-batch. Las notas de instalación completas están en el repositorio de GitHub.

Sobre el autor

Mert Batur es cofundador de Techsy.io, donde el equipo entrega agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre el stack de herramientas LLM que el equipo de Techsy usa de verdad en producción. Conecta en LinkedIn.

Preguntas frecuentes

¿OmniVoice es gratis para uso comercial?

Sí. OmniVoice se publica bajo la licencia Apache-2.0, que permite el uso comercial sin suscripción, sin tarifas por carácter y sin límites de uso. Puedes ejecutarlo en tu propio hardware para trabajo de clientes o productos internos. Solo recuerda que cualquier voz que clones conlleva sus propias obligaciones de consentimiento y licencia, distintas de la licencia del modelo.

¿Cuántos idiomas admite OmniVoice?

OmniVoice admite 600+ idiomas, con 646 citados en su ficha de modelo, todos mediante síntesis multilingüe zero-shot. Eso es unas 20 veces los ~32 idiomas de ElevenLabs. La amplitud es su mayor ventaja, cubriendo idiomas poco dotados que los grandes proveedores comerciales de TTS en la nube no ofrecen en absoluto hoy.

¿OmniVoice es realmente tan bueno como ElevenLabs?

Depende de qué midas. OmniVoice gana en idiomas (646 frente a ~32), coste (0 $ frente a 5–330 $/mes), privacidad y similitud de hablante multilingüe (SIM-o 0,830 frente a 0,655). ElevenLabs gana en pulido, consistencia, latencia de streaming en tiempo real, su gran biblioteca de voces predefinidas y soporte comercial. Para multilingüe por lotes, OmniVoice es de verdad competitivo; para voces en vivo y pulidas, ElevenLabs aún lidera.

¿Qué GPU necesito para ejecutar OmniVoice?

Unos 8 GB de VRAM en fp16 bastan para un uso cómodo, y el modelo corre bien en tarjetas como la RTX 4090 que probamos. Puedes ejecutarlo solo en CPU, pero espera una síntesis unas 3 veces más lenta. Para cargas de producción por lotes, k2-fsa recomienda 16 GB de RAM del sistema junto a una GPU de 8 GB o más.

¿Puede OmniVoice clonar una voz?

Sí, OmniVoice hace clonación de voz zero-shot a partir de un clip de referencia de tan solo 3 segundos, sin entrenamiento por voz. Para la mejor fidelidad, pasa una transcripción ref_text del clip junto al audio. En nuestra prueba, añadir la transcripción mejoró notablemente lo cerca que quedaba la salida del hablante original.

¿OmniVoice es lo bastante bueno para agentes de voz en producción?

Como capa TTS para doblaje, mensajes de IVR o cualquier audio pregenerado, sí, está listo para producción. Como voz en vivo en un agente conversacional en tiempo real que necesita turnos por debajo de 300 ms, hoy no, el RTF por lotes es rápido pero la latencia de streaming no es su fuerte. Úsalo donde generas el audio antes de la interacción.

¿OmniVoice funciona totalmente sin conexión y on-premise?

Sí. Tras la descarga inicial del modelo desde HuggingFace, OmniVoice corre por completo en tu propia máquina, sin enviar datos a ningún servidor externo. Eso lo hace una opción fuerte para entornos sensibles al RGPD, legales o aislados, donde una API de TTS en la nube quedaría descartada por requisitos de cumplimiento.

¿Cómo se compara OmniVoice con Chatterbox o Fish Audio?

Cada uno lidera una categoría distinta. Chatterbox-Turbo (Resemble AI) gana las pruebas de calidad a ciegas en inglés, pero es solo inglés. Fish Audio S2 Pro encabeza la clasificación independiente EmergentTTS-Eval con salida expresiva en 80+ idiomas. La ventaja de OmniVoice es la pura cobertura de idiomas de 646, más la clonación zero-shot, lo que lo convierte en la elección cuando la amplitud y el uso on-premise importan más.

El veredicto

OmniVoice es la alternativa open source a ElevenLabs más creíble que hemos probado, y es gratis. Tras ejecutar la v0.1.5 nosotros mismos, la recomendación es simple: elige OmniVoice si necesitas muchos idiomas, privacidad on-premise o coste cero para audio por lotes, y quédate con una API en la nube si necesitas voces pulidas, en tiempo real y conversacionales hoy.

  • Gratis y open source bajo Apache-2.0, sin facturación por carácter.
  • 646 idiomas y clonación zero-shot, muy por encima de ElevenLabs.
  • Local y privado, ideal para on-premise y trabajo sujeto a cumplimiento.
  • No para conversación en vivo por debajo de 300 ms, eso sigue siendo cosa de la nube.

Si estás construyendo un pipeline de voz o doblaje multilingüe y quieres ayuda para elegir el stack adecuado, consigue una consulta gratuita, es el tipo de cosa que montamos para clientes cada mes.

Etiquetas

omnivoicealternativa-open-source-elevenlabssintesis-de-vozclonacion-de-voztts

Compartir este artículo

Inicia Tu Proyecto

¿Listo para construir algo extraordinario?

Convirtamos tu visión en realidad. Nuestro equipo está listo para ayudarte a crear software que marque la diferencia.