Techsy
Contacto
Começar
Voltar ao blog
ai-machine-learning

Análise do OmniVoice: Testámos o Rival Open-Source da ElevenLabs (600+ Idiomas)

Escrito por Mert Batur Gürbüz
Jun 5, 2026
13 min de leitura
Índice
Análise do OmniVoice: Testámos o Rival Open-Source da ElevenLabs (600+ Idiomas)

Análise do OmniVoice: Testámos o Rival Open-Source da ElevenLabs (600+ Idiomas)

Na semana passada, instalámos o OmniVoice v0.1.5 da k2-fsa numa RTX 4090, fornecemos-lhe um clipe de 6 segundos de uma voz em inglês e pedimos que lesse um parágrafo em três idiomas diferentes. Arranque a frio: cerca de 14 segundos com o carregamento do modelo. Execuções subsequentes ("warm runs")? Aproximadamente RTF 0,03, ou seja, quase 30 vezes mais rápido que o tempo real. Em resumo: sim, este projeto open-source é uma verdadeira alternativa ElevenLabs open source para um tipo específico de utilizador; não, não substituirá uma API cloud polida para todos. Vamos analisar quem deve usar o quê.

Principais conclusões:

  • O OmniVoice é um sistema TTS gratuito, sob licença Apache-2.0, da k2-fsa, que abrange mais de 600 idiomas com clonagem de voz zero-shot.
  • Nos nossos testes, atingiu um RTF de ~0,03 numa RTX 4090; cerca de 8 GB de VRAM são suficientes para o executar.
  • Supera a ElevenLabs em idiomas (646 contra ~32), custo (0 $ contra 5–330 $/mês) e privacidade, mas não em acabamento ou streaming em tempo real.
  • Ideal para dobragem, trabalho on-premise e idiomas com poucos recursos; evite-o para agentes conversacionais com latência inferior a 300 ms.

O Que É o OmniVoice (e Por Que É Importante)?

O OmniVoice é um modelo de texto-para-fala (TTS) open-source, sob licença Apache-2.0, desenvolvido pela k2-fsa, a equipa de investigação de fala responsável pelo Kaldi e pelo k2. É um modelo TTS baseado em difusão com 0,6 mil milhões de parâmetros, que funciona localmente, cobre mais de 600 idiomas e permite clonar vozes em regime zero-shot. É importante porque, pela primeira vez, um modelo local genuinamente gratuito se aproxima o suficiente de um serviço cloud pago para que a troca valha a pena, não sendo apenas teórica.

O repositório (github.com/k2-fsa/OmniVoice) tem cerca de 7,1 mil estrelas e a versão mais recente é a v0.1.5, de 28 de abril de 2026. Internamente, é ajustado a partir do Qwen3-0.6B-Base e produz áudio a 24 kHz. Se leu a nossa compilação das melhores ferramentas de voz IA, considere o OmniVoice como a extremidade autoalojada desse espetro, a opção escolhida quando os dados não podem sair dos seus servidores.

A linhagem da k2-fsa é a parte que a maioria das análises ignora. Não se trata de um projeto de fim de semana de uma conta anónima. Pertence à mesma linhagem que moldou o reconhecimento de fala open-source durante mais de uma década, o que explica em grande parte a qualidade elevada tão cedo no seu desenvolvimento.

Funcionalidades do OmniVoice em Resumo

O OmniVoice reúne o conjunto de funcionalidades que esperaria de uma plataforma paga num modelo que descarrega uma única vez. Os números de destaque, retirados do seu cartão de modelo HuggingFace: 646 idiomas, clonagem zero-shot a partir de um clipe de referência de ~3 segundos e um RTF tão baixo quanto 0,025, cerca de 40 vezes mais rápido que o tempo real.

Eis o que obtém realmente:

  • Clonagem de voz a partir de um clipe curto, zero-shot, sem treino por voz.
  • Design de voz por atributos: género, idade, tom, dialeto ou sotaque, incluindo até um modo sussurrado.
  • Controlo fino com símbolos não verbais e correção de pronúncia para nomes complicados.
  • Três interfaces: uma UI web Gradio (omnivoice-demo), uma API Python com três modos de geração e uma CLI (omnivoice-infer).
  • Velocidade: RTF em lote de 0,022, gerando aproximadamente 60 segundos de áudio em cerca de 1,3 segundos.

Em termos de qualidade, o OmniVoice reporta uma pontuação de similaridade do orador (SIM-o) de 0,830, contra os 0,655 da ElevenLabs em testes multilingues, e uma taxa de erro de palavras de apenas 0,84% no conjunto Seed-TTS chinês, superando a ElevenLabs v2 e a MiniMax nesse benchmark. Com ~2,5 milhões de descargas mensais no HuggingFace, muitas pessoas estão a testar rigorosamente essas afirmações.

O Que Observámos Ao Executar o OmniVoice

Queríamos números reais, não alegações de repositórios, por isso testámos nós próprios. Executámos pip install omnivoice numa RTX 4090 (24 GB) em junho de 2026, obtivemos uma gravação de referência limpa de 6 segundos em inglês e gerámos um parágrafo de 60 segundos em inglês, turco e árabe a partir dessa mesma referência única.

O arranque a frio, incluindo o primeiro carregamento do modelo, demorou cerca de 14 segundos. Depois disso, as execuções em lote estabilizaram num RTF de 0,03, ou seja, cerca de 30 vezes mais rápido que o tempo real na nossa máquina, um pouco mais lento que os 0,025 anunciados no repositório, mas próximo, e mais do que rápido o suficiente para trabalhos de dobragem em lote. O uso de VRAM manteve-se confortavelmente abaixo do oferecido pela placa de 24 GB; a recomendação de ~8 GB do cartão do modelo confirmou-se.

Em termos de qualidade, o inglês e o turco regressaram limpos e naturais, com o timbre clonado claramente reconhecível a partir de uma amostra de seis segundos. O árabe foi sólido em frases curtas, mas a prosódia tornou-se um pouco plana em frases mais longas; inteligível, apenas não tão expressivo. Um ponto a destacar: deverá passar ref_text (uma transcrição do seu clipe de referência) para obter a melhor fidelidade de clonagem. Se o omitir, a correspondência da voz desvia-se. Quando o testámos com a transcrição, a similaridade aumentou notoriamente.

Este é o tipo de resultado que torna o OmniVoice digno de uma análise séria para pipelines multilingues, mantendo os olhos abertos às suas arestas.

OmniVoice vs ElevenLabs: Quão Diferentes São?

O OmniVoice e a ElevenLabs resolvem o mesmo problema a partir de extremos opostos. A ElevenLabs é uma API cloud polida com uma vasta biblioteca de vozes predefinidas e baixa latência de streaming; o OmniVoice é um modelo local gratuito com 20 vezes mais cobertura linguística e custo zero por caractere. A escolha certa depende se valoriza controlo e privacidade ou conveniência e acabamento.

DimensãoOmniVoiceElevenLabs
Idiomas646~32
Custo0 $ (Apache-2.0)5–330 $/mês, por caractere
AlojamentoLocal / offlineApenas Cloud
LatênciaLote RTF ~0,03 (rápido)Baixa latência de streaming
Biblioteca de vozesDIY / clone a sua própriaGrande biblioteca predefinida
Clonagem de vozZero-shot, autogeridaConsentimento controlado pela plataforma
SuporteComunidade / GitHubSLA Comercial
Qualidade multilingueSIM-o 0,830SIM-o 0,655, mais polido/consistente

Se está a calcular custos para uma stack de voz para um agente de voz IA, esta tabela altera rapidamente os cálculos, especialmente à escala onde a faturação por caractere da ElevenLabs se acumula (analisámos isso no nosso guia de preços de agentes de voz). O veredito honesto: a ElevenLabs é mais consistente e fácil; o OmniVoice é mais barato, mais privado e muito mais multilingue.

Como Se Compara o OmniVoice a Outros Modelos TTS Open-Source?

O OmniVoice não é o único concorrente open-source e não ganha em todas as categorias. Tem a maior cobertura linguística de longe, mas o Chatterbox vence nos testes cegos em inglês, o Fish Audio lidera o ranking independente EmergentTTS-Eval e o Kokoro é mais rápido se não precisar de clonagem. Eis o campo honesto.

OmniVoice vs ElevenLabs vs Chatterbox vs Fish Audio vs Qwen3-TTS comparados por contagem de idiomas e similaridade de voz
Cinco modelos TTS open-source comparados por cobertura linguística e pontuação de similaridade do orador

ModeloCriadorParâmetrosIdiomasClonagemDestaqueEscolha este se…
OmniVoicek2-fsa0,6B646Zero-shot, 3sMaior cobertura linguísticaPrecisa de suporte amplo de idiomas ou on-prem
Chatterbox-TurboResemble AI350MApenas inglêsSim65,3% preferido cegamente vs ElevenLabs (24,5%)Só precisa de inglês e quer qualidade máxima
Fish Audio S2 ProFish Audion/a80+Sim#1 no EmergentTTS-Eval (taxa de vitória de 81,88%)Quer saída expressiva líder em benchmarks
Qwen3-TTS-0.6BAlibaba0,6B10NãoLatência de streaming de 97msPrecisa de streaming de baixa latência
Kokoroopen-source82MFocado em inglêsNão (54 predefinições)210x tempo real numa RTX 4090Quer velocidade máxima, sem necessidade de clonagem

A maioria destes funciona com 4–8 GB de VRAM em fp16, por isso o hardware não é o fator decisivo, mas sim o caso de uso. Mantemos a lista atualizada na nossa compilação das melhores ferramentas de voz IA.

Quando Deve Realmente Usar o OmniVoice?

O OmniVoice brilha sempre que a amplitude linguística, o custo ou o controlo de dados superam a necessidade de uma API cloud polida. É um cavalo de batalha para processamento em lote, não um motor conversacional em tempo real, por isso adapte-o a tarefas onde gera áudio antecipadamente ou executa operações no seu próprio hardware.

  • Dobragem de vídeo para dezenas de idiomas a partir de uma voz de referência única, o fluxo de trabalho de dobragem de vídeo IA onde a precificação por caractere seria brutal.
  • IVR multilingue e TTS para agentes de voz, a camada de voz que alimenta um agente de voz para restaurantes ou o tipo de sistema que substitui agentes de voz de call centers.
  • Audiolivros em execuções longas em lote, onde o RTF importa mais do que a latência.
  • Acessibilidade e narração para leitores de ecrã em idiomas que os fornecedores cloud ignoram.
  • Idiomas com poucos recursos que a ElevenLabs simplesmente não cobre.
  • Trabalho on-prem e sensível à HIPAA onde o áudio não pode tocar num servidor de terceiros.

Este último ponto é a funcionalidade killer silenciosa. Para um cliente de saúde ou jurídico, "o áudio nunca sai da nossa máquina" não é um extra, é a razão inteira pela qual um TTS cloud é excluído.

Prós e Contras do OmniVoice (Incluindo Para Que NÃO Serve)

O OmniVoice merece as suas estrelas, mas não é um substituto direto da ElevenLabs para todas as equipas. Os prós relacionam-se com liberdade e amplitude; os contras com acabamento, latência e o peso operacional de executar o seu próprio modelo.

Prós:

  • Gratuito sob licença Apache-2.0, sem faturação por caractere, sem limites.
  • 646 idiomas, incluindo alguns que nenhum grande fornecedor cloud toca.
  • Funciona totalmente local, os seus dados permanecem no lugar.
  • Forte qualidade de clonagem multilingue (SIM-o 0,830) a partir de um clipe de 3 segundos.
  • Rápido throughput em lote (RTF ~0,03 no nosso teste).

Contras, os limites honestos:

  • Não foi construído para conversação em tempo real com turn-taking inferior a 300 ms.
  • Menos polido e consistente do que as melhores vozes comerciais como a ElevenLabs.
  • Sem suporte gerido ou SLA, depende das issues do GitHub.
  • Necessita de um GPU (~8 GB VRAM); execuções em CPU são cerca de 3x mais lentas.
  • Biblioteca de vozes pré-feitas menor do que o catálogo da ElevenLabs.
  • O consentimento e licenciamento de vozes clonadas são da sua responsabilidade legal, não da plataforma.

Se o seu produto precisa de respostas instantâneas e polidas durante uma chamada telefónica ao vivo, o OmniVoice é a ferramenta errada hoje. Se está a gerar áudio em lotes, através de mais de 600 idiomas, no seu próprio hardware, é difícil superar ao preço de gratuito.

Como Começar Com o OmniVoice

Colocar o OmniVoice a funcionar requer um comando de instalação e algumas linhas de Python, sem conta, sem chave API, sem configuração de faturação. Essa é a vantagem prática de um modelo open-source: passa de zero a uma voz clonada em minutos, e nada do que gera sai da sua máquina.

python
# Install (GPU build, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
#   --extra-index-url https://download.pytorch.org/whl/cu128

from omnivoice import OmniVoice

model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")

audio = model.generate(
    text="Hello, this is a test of zero-shot voice cloning.",
    ref_audio="ref.wav",                       # ~3-6s reference clip
    ref_text="Transcription of the reference audio.",  # boosts clone fidelity
)
# audio -> np.ndarray at 24 kHz

Os modelos são descarregados automaticamente do HuggingFace na primeira execução. Prefere não escrever código? Lance a UI Gradio com omnivoice-demo, ou processe ficheiros em lote com a CLI omnivoice-infer-batch. As notas completas de instalação estão no repositório GitHub.

Sobre o Autor

Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa desenvolve agentes IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas LLM que a equipa da Techsy utiliza realmente em produção. Ligue-se no LinkedIn.

Perguntas Frequentes

O OmniVoice é gratuito para uso comercial?

Sim. O OmniVoice é distribuído sob a licença Apache-2.0, que permite uso comercial sem subscrição, sem taxas por caractere e sem limites de uso. Pode executá-lo no seu próprio hardware para trabalho com clientes ou produtos internos. Lembre-se apenas de que qualquer voz que clone carrega as suas próprias obrigações de consentimento e licenciamento, separadas da licença do modelo.

Quantos idiomas suporta o OmniVoice?

O OmniVoice suporta mais de 600 idiomas, com 646 citados no seu cartão de modelo, todos via síntese multilingue zero-shot. Isso é cerca de 20 vezes os ~32 idiomas da ElevenLabs. A amplitude é a sua maior vantagem isolada, cobrindo idiomas com poucos recursos que os principais fornecedores comerciais de TTS cloud não oferecem atualmente.

O OmniVoice é realmente tão bom quanto a ElevenLabs?

Depende do que mede. O OmniVoice vence em idiomas (646 contra ~32), custo (0 $ contra 5–330 $/mês), privacidade e similaridade do orador multilingue (SIM-o 0,830 contra 0,655). A ElevenLabs vence em acabamento, consistência, latência de streaming em tempo real, na sua grande biblioteca de vozes predefinidas e suporte comercial. Para trabalho multilingue em lote, o OmniVoice é genuinamente competitivo; para vozes ao vivo e polidas, a ElevenLabs ainda lidera.

De que GPU preciso para executar o OmniVoice?

Cerca de 8 GB de VRAM em fp16 são suficientes para um uso confortável, e o modelo funciona bem em placas como a RTX 4090 que testámos. Pode executá-lo apenas em CPU, mas espere uma síntese cerca de 3x mais lenta. Para cargas de trabalho em lote de produção, a k2-fsa recomenda 16 GB de RAM do sistema juntamente com um GPU com 8 GB ou mais.

O OmniVoice pode clonar uma voz?

Sim, o OmniVoice realiza clonagem de voz zero-shot a partir de um clipe de referência tão curto quanto 3 segundos, sem necessidade de treino por voz. Para a melhor fidelidade, passe uma transcrição ref_text do clipe juntamente com o áudio. No nosso teste, adicionar a transcrição melhorou notoriamente a proximidade da saída com o orador original.

O OmniVoice é suficientemente bom para agentes de voz de produção?

Como camada TTS para dobragem, prompts IVR ou qualquer áudio pré-gerado, sim, está pronto para produção. Como voz ao vivo num agente conversacional em tempo real que necessita de turn-taking inferior a 300 ms, não ainda; o RTF em lote é rápido, mas a latência de streaming não é o seu forte. Use-o onde gera áudio antes da interação.

O OmniVoice funciona totalmente offline e on-prem?

Sim. Após a descarga inicial do modelo do HuggingFace, o OmniVoice funciona inteiramente na sua própria máquina sem enviar dados para qualquer servidor externo. Isso torna-o uma opção forte para ambientes sensíveis à HIPAA, jurídicos ou isolados ("air-gapped"), onde uma API TTS cloud seria excluída por requisitos de conformidade.

Como se compara o OmniVoice ao Chatterbox ou Fish Audio?

Cada um lidera uma categoria diferente. O Chatterbox-Turbo (Resemble AI) vence testes cegos de qualidade em inglês, mas é apenas em inglês. O Fish Audio S2 Pro lidera o ranking independente EmergentTTS-Eval com saída expressiva em mais de 80 idiomas. A vantagem do OmniVoice é a pura cobertura linguística de 646 idiomas, mais clonagem zero-shot, tornando-o a escolha quando a amplitude e o uso on-prem importam mais.

O Veredito

O OmniVoice é a alternativa ElevenLabs open source mais credível que testámos, e é gratuita. Após executarmos a v0.1.5 nós próprios, a recomendação é simples: escolha o OmniVoice se precisar de ampla cobertura linguística, privacidade on-prem ou custo zero para trabalho de áudio em lote, e mantenha-se numa API cloud se precisar de vozes polidas, em tempo real e conversacionais hoje.

  • Gratuito e aberto sob licença Apache-2.0, sem faturação por caractere.
  • 646 idiomas e clonagem zero-shot, muito além da ElevenLabs.
  • Local e privado, ideal para trabalho on-prem e vinculado à conformidade.
  • Não serve para conversação ao vivo inferior a 300 ms, isso continua a ser um trabalho para a cloud.

Se está a construir um pipeline de voz ou dobragem multilingue e quer ajuda para escolher a stack certa, obtenha uma consulta gratuita, é o tipo de coisa que configuramos para clientes todos os meses.

Etiquetas

omnivoicealternativa elevenlabs open sourcetexto para falaclonagem de voztts

Partilhar este artigo

Artigos relacionados

Mais em ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 chegou: inteligência quase Fable 5 a metade do preço

A Anthropic lançou o Claude Opus 5 a 24 de julho de 2026. Mais do que duplica o Opus 4.8 no Frontier-Bench e mantém o preço do Opus, mas perde alguns testes para o Fable 5 e o Mythos 5. Eis a tabela de benchmarks, o preço e a recomendação de mudar/esperar/ficar.

10 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

8 Melhores APIs de Web Scraping com IA em 2026 (Testadas na Nossa Própria Stack de Agentes)

Testámos 8 APIs de web scraping com IA com preços reais de 2026, obtidos através da nossa própria stack de agentes. Firecrawl, Bright Data, ScrapingBee e mais 5, classificadas por output pronto para LLM, anti-bot e suporte MCP.

9 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

Engenharia de Prompts para Programação: 7 Padrões Que Usamos Diariamente no Claude Code e Cursor (2026)

A maioria dos artigos sobre 'prompts de IA para programação' oferece 50 modelos para copiar. Este ensina os 7 padrões que usamos todos os dias para gerir um pipeline de 16 agentes no Claude Code, com exemplos reais de antes e depois, além de indicar onde cada padrão se encaixa no Claude Code, Cursor e Copilot em 2026.

11 min read min de leitura
Ler
Ver todos os artigos
Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.

Marca uma chamada de scope 30 minVer o Nosso Trabalho

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.