ai-machine-learning

Test d'OmniVoice : l'alternative open source à ElevenLabs (600+ langues)

Écrit par Mert Batur
Jun 5, 2026
13 lecture
Test d'OmniVoice : l'alternative open source à ElevenLabs (600+ langues)

Nous avons installé OmniVoice v0.1.5 de k2-fsa la semaine dernière sur une RTX 4090, nous lui avons donné un extrait de 6 secondes d'une voix anglaise et lui avons demandé de relire un paragraphe en trois langues. Démarrage à froid : environ 14 secondes, chargement du modèle compris. Les exécutions à chaud ensuite ? Environ RTF 0,03, proche de 30 fois le temps réel. La version courte de ce test : oui, ce projet open source est une vraie alternative open source à ElevenLabs pour un certain type d'utilisateur, et non, il ne remplacera pas pour tout le monde une API cloud aboutie. Voyons qui est qui.

Points clés :

  • OmniVoice est un TTS gratuit sous Apache-2.0 de k2-fsa couvrant 600+ langues avec clonage de voix zero-shot.
  • Dans notre test, il a atteint un RTF de ~0,03 sur une RTX 4090 ; environ 8 Go de VRAM suffisent.
  • Il bat ElevenLabs sur les langues (646 contre ~32), le coût (0 $ contre 5–330 $/mois) et la confidentialité, pas sur la finition ni le streaming temps réel.
  • Idéal pour le doublage, le travail sur site et les langues peu dotées ; à éviter pour les agents conversationnels sous 300 ms.

Qu'est-ce qu'OmniVoice (et pourquoi c'est important) ?

OmniVoice est un modèle de synthèse vocale open source sous Apache-2.0 de k2-fsa, l'équipe de recherche vocale derrière Kaldi et k2. C'est un TTS de 0,6 milliard de paramètres de type modèle de langage à diffusion, qui tourne en local, couvre 600+ langues et clone des voix en zero-shot. C'est important parce que, pour la première fois, un modèle local réellement gratuit s'approche suffisamment d'un service cloud payant pour que l'arbitrage devienne réel, pas seulement théorique.

Le dépôt (github.com/k2-fsa/OmniVoice) compte environ 7,1k étoiles, et la dernière version est la v0.1.5 du 28 avril 2026. Sous le capot, il est affiné à partir de Qwen3-0.6B-Base et produit de l'audio en 24 kHz. Si vous avez lu notre panorama des meilleurs outils vocaux IA, voyez OmniVoice comme l'extrémité auto-hébergée de ce spectre, l'option vers laquelle on se tourne quand les données ne peuvent pas quitter vos serveurs.

L'origine k2-fsa est la partie que la plupart des articles oublient. Ce n'est pas un projet de week-end signé par un compte anonyme. C'est la même lignée qui façonne la reconnaissance vocale ouverte depuis plus d'une décennie, une grande raison pour laquelle la qualité est déjà aussi bonne si tôt.

Les fonctionnalités d'OmniVoice en bref

OmniVoice rassemble l'ensemble de fonctions qu'on attend d'une plateforme payante dans un modèle qu'on télécharge une fois. Les chiffres clés, tirés de sa fiche modèle HuggingFace : 646 langues, clonage zero-shot à partir d'un extrait de référence de ~3 secondes, et un RTF descendant jusqu'à 0,025, soit environ 40 fois plus rapide que le temps réel.

Voici ce que vous obtenez concrètement :

  • Clonage de voix à partir d'un court extrait, en zero-shot, sans entraînement par voix.
  • Conception de voix par attributs : genre, âge, hauteur, dialecte ou accent, et même un mode chuchotement.
  • Contrôle fin avec des symboles non verbaux et une correction de prononciation pour les noms difficiles.
  • Trois interfaces : une interface web Gradio (omnivoice-demo), une API Python avec trois modes de génération, et une CLI (omnivoice-infer).
  • Vitesse : RTF de 0,022 en lot, soit environ 60 secondes d'audio en à peu près 1,3 seconde.

Côté qualité, OmniVoice annonce un score de similarité de locuteur (SIM-o) de 0,830 contre 0,655 pour ElevenLabs sur des tests multilingues, et un taux d'erreur sur les mots de seulement 0,84 % sur le jeu Seed-TTS chinois, battant ElevenLabs v2 et MiniMax sur ce benchmark. Avec ~2,5 millions de téléchargements par mois sur HuggingFace, beaucoup de monde met ces affirmations à l'épreuve.

Ce que nous avons constaté en exécutant OmniVoice

Nous voulions de vrais chiffres, pas des promesses de dépôt, alors nous l'avons testé nous-mêmes. Nous avons lancé pip install omnivoice sur une RTX 4090 (24 Go) en juin 2026, pris un enregistrement de référence anglais propre de 6 secondes, et généré un paragraphe de 60 secondes en anglais, turc et arabe, le tout à partir de cette unique référence.

Le démarrage à froid, premier chargement du modèle compris, a pris environ 14 secondes. Ensuite, les exécutions par lot à chaud se sont stabilisées autour d'un RTF de 0,03, soit environ 30 fois le temps réel sur notre machine, un poil plus lent que le 0,025 annoncé par le dépôt mais proche, et largement assez rapide pour du doublage par lots. L'usage de VARM est resté confortablement sous ce qu'offrait la carte de 24 Go ; la recommandation de ~8 Go de la fiche modèle a tenu.

Côté qualité, l'anglais et le turc sont revenus nets et naturels, avec un timbre cloné clairement reconnaissable à partir d'un échantillon de six secondes. L'arabe était solide sur les phrases courtes mais la prosodie devenait un peu plate sur les longues, intelligible, juste moins expressive. Un piège à signaler : il vaut mieux passer ref_text (une transcription de votre extrait de référence) pour la meilleure fidélité de clonage. Sans elle, la correspondance de voix dérive. Quand nous avons essayé avec la transcription, la similarité a bondi nettement.

C'est le genre de résultat qui rend OmniVoice digne d'un examen sérieux pour des pipelines multilingues, en gardant les yeux ouverts sur les aspérités.

OmniVoice contre ElevenLabs : à quel point sont-ils différents ?

OmniVoice et ElevenLabs résolvent le même problème par les deux bouts. ElevenLabs est une API cloud aboutie avec une énorme bibliothèque de voix prédéfinies et une faible latence de streaming ; OmniVoice est un modèle local gratuit avec 20 fois plus de couverture linguistique et zéro coût au caractère. Le bon choix dépend de la priorité : contrôle et confidentialité, ou commodité et finition.

DimensionOmniVoiceElevenLabs
Langues646~32
Coût0 $ (Apache-2.0)5–330 $/mois, au caractère
HébergementLocal / hors ligneCloud uniquement
LatenceRTF par lot ~0,03 (rapide)Faible latence de streaming
Bibliothèque de voixDIY / clonez la vôtreGrande bibliothèque prédéfinie
Clonage de voixZero-shot, autogéréConsentement encadré par la plateforme
SupportCommunauté / GitHubSLA commercial
Qualité multilingueSIM-o 0,830SIM-o 0,655, plus abouti/cohérent

Si vous chiffrez une pile vocale pour un agent vocal IA, ce tableau change vite le calcul, surtout à grande échelle où la facturation au caractère d'ElevenLabs s'accumule (nous l'avons détaillé dans notre guide des tarifs des agents vocaux IA). Le verdict honnête : ElevenLabs est plus cohérent et plus simple ; OmniVoice est moins cher, plus confidentiel et bien plus multilingue.

Comment OmniVoice se compare-t-il aux autres modèles TTS open source ?

OmniVoice n'est pas le seul prétendant open source, et il ne gagne pas toutes les catégories. Il a de loin la plus large couverture linguistique, mais Chatterbox gagne les tests à l'aveugle en anglais, Fish Audio domine le classement indépendant EmergentTTS-Eval, et Kokoro est plus rapide si vous n'avez pas besoin de clonage. Voici le terrain honnête.

OmniVoice vs ElevenLabs vs Chatterbox vs Fish Audio vs Qwen3-TTS comparés par nombre de langues et similarité de voix
Cinq modèles TTS open source comparés par couverture linguistique et similarité de locuteur

ModèleÉditeurParamètresLanguesClonageAtoutChoisissez-le si…
OmniVoicek2-fsa0,6B646Zero-shot, 3sLa plus large couverture linguistiqueVous voulez beaucoup de langues ou du sur-site
Chatterbox-TurboResemble AI350MAnglais uniquementOuiPréféré à 65,3 % en test à l'aveugle vs ElevenLabs (24,5 %)Vous ne voulez que l'anglais et la meilleure qualité
Fish Audio S2 ProFish Audion/d80+Oui1er sur EmergentTTS-Eval (81,88 % de taux de victoire)Vous voulez une sortie expressive en tête des benchmarks
Qwen3-TTS-0.6BAlibaba0,6B10Non97 ms de latence en streamingVous voulez une faible latence en streaming
KokoroOpen source82MAxé anglaisNon (54 préréglages)210 fois le temps réel sur une RTX 4090Vous voulez une vitesse maximale, sans clonage

La plupart de ces modèles tournent dans 4–8 Go de VRAM en fp16, donc le matériel n'est pas le facteur décisif, c'est l'usage qui l'est. Nous tenons la liste à jour dans notre panorama des meilleurs outils vocaux IA.

Quand devriez-vous vraiment utiliser OmniVoice ?

OmniVoice brille partout où l'étendue linguistique, le coût ou le contrôle des données l'emportent sur le besoin d'une API cloud aboutie. C'est un cheval de trait pour le traitement par lots, pas un moteur conversationnel temps réel, alors associez-le à des tâches où vous générez l'audio à l'avance ou exécutez sur votre propre matériel.

  • Doublage vidéo dans des dizaines de langues à partir d'une seule voix de référence, le flux de doublage vidéo IA où une facturation au caractère serait brutale.
  • SVI multilingue et TTS d'agents vocaux, la couche vocale qui alimente un agent vocal pour restaurant ou ce type de systèmes qui remplacent les agents de centres d'appels.
  • Livres audio en longues exécutions par lots où le RTF compte plus que la latence.
  • Accessibilité et narration pour lecteurs d'écran dans des langues que les fournisseurs cloud ignorent.
  • Langues peu dotées qu'ElevenLabs ne couvre tout simplement pas.
  • Travail sur site et sensible au RGPD où l'audio ne doit toucher aucun serveur tiers.

Ce dernier point est la fonctionnalité décisive et silencieuse. Pour un client de la santé ou du droit, « l'audio ne quitte jamais notre machine » n'est pas un agrément, c'est toute la raison pour laquelle un TTS cloud est écarté.

Avantages et inconvénients d'OmniVoice (y compris ce pour quoi il N'EST PAS fait)

OmniVoice mérite ses étoiles, mais ce n'est pas un remplacement clé en main d'ElevenLabs pour toutes les équipes. Les avantages tiennent à la liberté et à l'étendue ; les inconvénients à la finition, à la latence et au poids opérationnel d'exécuter son propre modèle.

Avantages :

  • Gratuit sous Apache-2.0, sans facturation au caractère, sans plafonds.
  • 646 langues, dont certaines qu'aucun grand fournisseur cloud ne touche.
  • Tourne entièrement en local, vos données restent chez vous.
  • Forte qualité de clonage multilingue (SIM-o 0,830) à partir d'un extrait de 3 secondes.
  • Débit par lots rapide (RTF ~0,03 dans notre test).

Inconvénients, les limites honnêtes :

  • Pas conçu pour le conversationnel temps réel sous 300 ms.
  • Moins abouti et cohérent que les meilleures voix commerciales comme ElevenLabs.
  • Aucun support géré ni SLA, vous comptez sur les tickets GitHub.
  • Nécessite un GPU (~8 Go de VRAM) ; le CPU tourne environ 3 fois plus lentement.
  • Bibliothèque de voix prédéfinies plus petite que le catalogue d'ElevenLabs.
  • Le consentement et la licence des voix clonées relèvent de votre responsabilité légale, pas de la plateforme.

Si votre produit a besoin de réponses instantanées et abouties dans un appel téléphonique en direct, OmniVoice est aujourd'hui le mauvais outil. Si vous générez de l'audio par lots, dans plus de 600 langues, sur votre propre matériel, il est difficile à battre au prix du gratuit.

Comment démarrer avec OmniVoice

Mettre OmniVoice en route prend une commande d'installation et quelques lignes de Python, pas de compte, pas de clé d'API, pas de configuration de facturation. C'est le gain concret d'un modèle open source : vous passez de zéro à une voix clonée en quelques minutes, et rien de ce que vous générez ne quitte votre machine.

python
# Installation (build GPU, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
#   --extra-index-url https://download.pytorch.org/whl/cu128

from omnivoice import OmniVoice

model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")

audio = model.generate(
    text="Hello, this is a test of zero-shot voice cloning.",
    ref_audio="ref.wav",                       # extrait de référence ~3-6s
    ref_text="Transcription of the reference audio.",  # améliore la fidélité du clonage
)
# audio -> np.ndarray en 24 kHz

Les modèles se téléchargent automatiquement depuis HuggingFace au premier lancement. Vous préférez ne pas coder ? Lancez l'interface Gradio avec omnivoice-demo, ou traitez vos fichiers par lots avec la CLI omnivoice-infer-batch. Les notes d'installation complètes se trouvent dans le dépôt GitHub.

À propos de l'auteur

Mert Batur est cofondateur de Techsy.io, où l'équipe livre des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la pile d'outils LLM que l'équipe Techsy utilise réellement en production. Connectez-vous sur LinkedIn.

Foire aux questions

OmniVoice est-il gratuit pour un usage commercial ?

Oui. OmniVoice est publié sous licence Apache-2.0, qui autorise l'usage commercial sans abonnement, sans frais au caractère et sans plafond d'utilisation. Vous pouvez l'exécuter sur votre propre matériel pour du travail client ou des produits internes. Souvenez-vous simplement que toute voix clonée porte ses propres obligations de consentement et de licence, distinctes de la licence du modèle.

Combien de langues OmniVoice prend-il en charge ?

OmniVoice prend en charge 600+ langues, 646 étant citées sur sa fiche modèle, toutes via une synthèse multilingue zero-shot. C'est environ 20 fois les ~32 langues d'ElevenLabs. L'étendue est son plus grand avantage, couvrant des langues peu dotées que les grands fournisseurs de TTS cloud commerciaux n'offrent pas du tout aujourd'hui.

OmniVoice est-il vraiment aussi bon qu'ElevenLabs ?

Cela dépend de ce que vous mesurez. OmniVoice gagne sur les langues (646 contre ~32), le coût (0 $ contre 5–330 $/mois), la confidentialité et la similarité de locuteur multilingue (SIM-o 0,830 contre 0,655). ElevenLabs gagne sur la finition, la cohérence, la latence de streaming temps réel, sa grande bibliothèque de voix prédéfinies et le support commercial. Pour le multilingue par lots, OmniVoice est vraiment compétitif ; pour des voix en direct et abouties, ElevenLabs garde l'avance.

Quel GPU faut-il pour exécuter OmniVoice ?

Environ 8 Go de VRAM en fp16 suffisent pour un usage confortable, et le modèle tourne bien sur des cartes comme la RTX 4090 que nous avons testée. Vous pouvez l'exécuter en CPU seul, mais attendez-vous à une synthèse environ 3 fois plus lente. Pour des charges de production par lots, k2-fsa recommande 16 Go de RAM système aux côtés d'un GPU de 8 Go ou plus.

OmniVoice peut-il cloner une voix ?

Oui, OmniVoice réalise un clonage de voix zero-shot à partir d'un extrait de référence aussi court que 3 secondes, sans entraînement par voix. Pour la meilleure fidélité, passez une transcription ref_text de l'extrait avec l'audio. Dans notre test, l'ajout de la transcription a nettement amélioré la proximité de la sortie avec le locuteur d'origine.

OmniVoice est-il assez bon pour des agents vocaux en production ?

Comme couche TTS pour le doublage, les messages SVI ou tout audio pré-généré, oui, il est prêt pour la production. Comme voix en direct dans un agent conversationnel temps réel exigeant des échanges sous 300 ms, pas aujourd'hui, le RTF par lots est rapide mais la latence de streaming n'est pas son point fort. Utilisez-le là où vous générez l'audio avant l'interaction.

OmniVoice fonctionne-t-il entièrement hors ligne et sur site ?

Oui. Après le téléchargement initial du modèle depuis HuggingFace, OmniVoice tourne entièrement sur votre propre machine, sans aucune donnée envoyée à un serveur externe. Cela en fait un bon choix pour les environnements sensibles au RGPD, juridiques ou isolés, où une API TTS cloud serait écartée par les exigences de conformité.

Comment OmniVoice se compare-t-il à Chatterbox ou Fish Audio ?

Chacun domine une catégorie différente. Chatterbox-Turbo (Resemble AI) gagne les tests de qualité à l'aveugle en anglais mais reste anglais uniquement. Fish Audio S2 Pro domine le classement indépendant EmergentTTS-Eval avec une sortie expressive sur 80+ langues. L'atout d'OmniVoice est la pure couverture linguistique de 646, plus le clonage zero-shot, ce qui en fait le choix quand l'étendue et l'usage sur site comptent le plus.

Le verdict

OmniVoice est l'alternative open source à ElevenLabs la plus crédible que nous ayons testée, et elle est gratuite. Après avoir exécuté la v0.1.5 nous-mêmes, la recommandation est simple : choisissez OmniVoice si vous avez besoin de beaucoup de langues, de confidentialité sur site ou d'un coût nul pour de l'audio par lots, et restez sur une API cloud si vous avez besoin de voix abouties, temps réel et conversationnelles aujourd'hui.

  • Gratuit et open source sous Apache-2.0, sans facturation au caractère.
  • 646 langues et clonage zero-shot, bien au-delà d'ElevenLabs.
  • Local et confidentiel, idéal pour le sur-site et le travail soumis à conformité.
  • Pas pour la conversation en direct sous 300 ms, ça reste un travail pour le cloud.

Si vous construisez un pipeline vocal ou de doublage multilingue et voulez de l'aide pour choisir la bonne pile, obtenez une consultation gratuite, c'est le genre de chose que nous mettons en place pour des clients chaque mois.

Tags

omnivoicealternative-open-source-elevenlabssynthese-vocaleclonage-de-voixtts

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.