
We installeerden vorige week OmniVoice v0.1.5 van k2-fsa op een RTX 4090, gaven het een clip van 6 seconden van een Engelse stem en vroegen het een alinea terug te lezen in drie talen. Koude start: zo'n 14 seconden inclusief het laden van het model. En de warme runs daarna? Ongeveer RTF 0,03, bijna 30 keer realtime. De korte versie van deze review: ja, dit open source project is een echt open source alternatief voor ElevenLabs voor een bepaald type gebruiker, en nee, het vervangt niet voor iedereen een gepolijste cloud-API. Laten we kijken wie wie is.
Belangrijkste punten:
- OmniVoice is een gratis TTS onder Apache-2.0 van k2-fsa met 600+ talen en zero-shot stemklonen.
- In onze test haalde het RTF ~0,03 op een RTX 4090; ongeveer 8 GB VRAM is genoeg.
- Het verslaat ElevenLabs op talen (646 versus ~32), kosten ($0 versus $5–330/maand) en privacy, niet op afwerking of realtime streaming.
- Het beste voor nasynchronisatie, on-premise werk en talen met weinig data; sla het over voor conversatie-agents onder 300 ms.
Wat is OmniVoice (en waarom is het belangrijk)?
OmniVoice is een open source tekst-naar-spraakmodel onder Apache-2.0 van k2-fsa, het spraakonderzoeksteam achter Kaldi en k2. Het is een TTS van 0,6 miljard parameters in de stijl van een diffusietaalmodel, draait lokaal, dekt 600+ talen en kloont stemmen zero-shot. Het is belangrijk omdat voor het eerst een echt gratis lokaal model dicht genoeg bij een betaalde clouddienst komt om de afweging echt te maken, niet alleen theoretisch.
De repo (github.com/k2-fsa/OmniVoice) staat op zo'n 7,1k sterren, en de nieuwste versie is v0.1.5 van 28 april 2026. Onder de motorkap is het bijgesteld vanuit Qwen3-0.6B-Base en produceert het audio op 24 kHz. Als je onze rondgang langs de beste AI-stemtools hebt gelezen, zie OmniVoice dan als het zelf-gehoste uiteinde van dat spectrum, de optie die je pakt als de data je servers niet mogen verlaten.
De k2-fsa-herkomst is het deel dat de meeste artikelen overslaan. Dit is geen weekendproject van een anoniem account. Het is dezelfde lijn die de open spraakherkenning al ruim tien jaar vormgeeft, een grote reden waarom de kwaliteit al zo vroeg zo goed is.
OmniVoice-functies in één oogopslag
OmniVoice stopt het functiepakket dat je van een betaald platform verwacht in een model dat je één keer downloadt. De kerncijfers, uit de HuggingFace-modelkaart: 646 talen, zero-shot klonen vanaf een referentieclip van ~3 seconden, en een RTF tot zo laag als 0,025, ongeveer 40 keer sneller dan realtime.
Dit krijg je concreet:
- Stemklonen vanaf een korte clip, zero-shot, zonder training per stem.
- Stemontwerp op attributen: geslacht, leeftijd, toonhoogte, dialect of accent, zelfs een fluistermodus.
- Fijne sturing met non-verbale symbolen en uitspraakcorrectie voor lastige namen.
- Drie interfaces: een Gradio-webinterface (
omnivoice-demo), een Python-API met drie generatiemodi en een CLI (omnivoice-infer). - Snelheid: batch-RTF van 0,022, zo'n 60 seconden audio in ongeveer 1,3 seconde.
Op kwaliteit meldt OmniVoice een sprekergelijkenis-score (SIM-o) van 0,830 tegen 0,655 van ElevenLabs op meertalige tests, en een woordfoutpercentage van slechts 0,84 % op de Seed-TTS Chinese set, waarmee het ElevenLabs v2 en MiniMax verslaat op die benchmark. Met ~2,5 miljoen downloads per maand op HuggingFace zetten veel mensen die claims onder druk.
Wat we zagen toen we OmniVoice draaiden
We wilden echte cijfers, geen repo-claims, dus we testten het zelf. We draaiden pip install omnivoice op een RTX 4090 (24 GB) in juni 2026, namen een schone Engelse referentieopname van 6 seconden en genereerden een alinea van 60 seconden in het Engels, Turks en Arabisch, allemaal vanuit diezelfde ene referentie.
De koude start, inclusief het eerste laden van het model, duurde zo'n 14 seconden. Daarna pendelden de warme batch-runs rond een RTF van 0,03, dus ongeveer 30 keer realtime op onze machine, een tikje langzamer dan de 0,025 uit de repo maar dichtbij, en ruim snel genoeg voor batch-nasynchronisatie. Het VRAM-gebruik bleef comfortabel onder wat de 24 GB-kaart bood; de ~8 GB-aanbeveling van de modelkaart hield stand.
Qua kwaliteit kwamen Engels en Turks schoon en natuurlijk terug, met een gekloond timbre dat duidelijk herkenbaar was uit een sample van zes seconden. Arabisch was solide bij korte zinnen, maar de prosodie werd wat vlak bij lange, verstaanbaar, alleen minder expressief. Eén valkuil om te noemen: je wilt ref_text (een transcriptie van je referentieclip) meegeven voor de beste kloontrouw. Laat je die weg, dan dwaalt de stemmatch af. Toen we het met de transcriptie probeerden, sprong de gelijkenis merkbaar omhoog.
Het is het soort resultaat dat OmniVoice een serieuze blik waard maakt voor meertalige pipelines, met de ogen open voor de ruwe randjes.
OmniVoice versus ElevenLabs: hoe verschillend zijn ze?
OmniVoice en ElevenLabs lossen hetzelfde probleem op vanaf tegenovergestelde kanten. ElevenLabs is een gepolijste cloud-API met een enorme bibliotheek vooraf ingestelde stemmen en lage streaminglatentie; OmniVoice is een gratis lokaal model met 20 keer meer taaldekking en nul kosten per teken. De juiste keuze hangt af van of je controle en privacy waardeert of gemak en afwerking.
| Dimensie | OmniVoice | ElevenLabs |
|---|---|---|
| Talen | 646 | ~32 |
| Kosten | $0 (Apache-2.0) | $5–330/maand, per teken |
| Hosting | Lokaal / offline | Alleen cloud |
| Latentie | Batch-RTF ~0,03 (snel) | Lage streaminglatentie |
| Stembibliotheek | DIY / kloon je eigen | Grote vooraf ingestelde bibliotheek |
| Stemklonen | Zero-shot, zelf beheerd | Toestemming via het platform |
| Support | Community / GitHub | Commerciële SLA |
| Meertalige kwaliteit | SIM-o 0,830 | SIM-o 0,655, gepolijster/consistenter |
Als je een spraakstack begroot voor een AI-spraakagent, verandert deze tabel de rekensom snel, vooral op schaal waar de facturering per teken van ElevenLabs oploopt (we splitsten dat uit in onze gids over AI-spraakagent prijzen). Het eerlijke oordeel: ElevenLabs is consistenter en eenvoudiger; OmniVoice is goedkoper, privacyvriendelijker en veel meertaliger.
Hoe verhoudt OmniVoice zich tot andere open source TTS-modellen?
OmniVoice is niet de enige open source kandidaat, en wint niet elke categorie. Het heeft veruit de breedste taaldekking, maar Chatterbox wint blinde Engelse tests, Fish Audio voert het onafhankelijke EmergentTTS-Eval-klassement aan, en Kokoro is sneller als je geen klonen nodig hebt. Hier is het eerlijke veld.

| Model | Maker | Parameters | Talen | Klonen | Sterkte | Kies dit als… |
|---|---|---|---|---|---|---|
| OmniVoice | k2-fsa | 0,6B | 646 | Zero-shot, 3s | Breedste taaldekking | Je veel talen of on-premise nodig hebt |
| Chatterbox-Turbo | Resemble AI | 350M | Alleen Engels | Ja | 65,3 % voorkeur in blinde test vs ElevenLabs (24,5 %) | Je alleen Engels nodig hebt en topkwaliteit wilt |
| Fish Audio S2 Pro | Fish Audio | n.v.t. | 80+ | Ja | #1 op EmergentTTS-Eval (81,88 % winstpercentage) | Je benchmark-leidende, expressieve output wilt |
| Qwen3-TTS-0.6B | Alibaba | 0,6B | 10 | Nee | 97 ms streaminglatentie | Je lage streaminglatentie nodig hebt |
| Kokoro | Open source | 82M | Engels-gericht | Nee (54 presets) | 210 keer realtime op een RTX 4090 | Je maximale snelheid wilt, zonder klonen |
De meeste van deze modellen draaien in 4–8 GB VRAM in fp16, dus hardware is niet de doorslaggevende factor, de use case wel. We houden de lijst bij in onze rondgang langs de beste AI-stemtools.
Wanneer zou je OmniVoice echt moeten gebruiken?
OmniVoice blinkt uit overal waar taalbreedte, kosten of datacontrole zwaarder wegen dan de behoefte aan een gepolijste cloud-API. Het is een batch-werkpaard, geen realtime conversatiemotor, dus koppel het aan taken waarbij je audio vooraf genereert of dingen op je eigen hardware draait.
- Video-nasynchronisatie naar tientallen talen vanuit één referentiestem, de AI-video-nasynchronisatie-workflow waar facturering per teken bruut zou zijn.
- Meertalige IVR en spraakagent-TTS, de spraaklaag achter een restaurant-spraakagent of het soort systemen dat callcenter-spraakagents vervangt.
- Audioboeken in lange batch-runs waar RTF meer telt dan latentie.
- Toegankelijkheid en schermlezer-vertelling in talen die cloudaanbieders overslaan.
- Talen met weinig data die ElevenLabs simpelweg niet dekt.
- On-premise en AVG-gevoelig werk waar audio geen server van derden mag raken.
Dat laatste is de stille doorslaggevende functie. Voor een klant in de zorg of het recht is "de audio verlaat onze machine nooit" geen extraatje, het is de hele reden waarom een cloud-TTS afvalt.
Voordelen en nadelen van OmniVoice (inclusief waar het NIET voor is)
OmniVoice verdient zijn sterren, maar het is geen kant-en-klare vervanger van ElevenLabs voor elk team. De voordelen draaien om vrijheid en breedte; de nadelen om afwerking, latentie en het operationele gewicht van een eigen model draaien.
Voordelen:
- Gratis onder Apache-2.0, geen facturering per teken, geen limieten.
- 646 talen, waaronder enkele die geen grote cloudaanbieder aanraakt.
- Draait volledig lokaal, je data blijft waar die is.
- Sterke meertalige kloonkwaliteit (SIM-o 0,830) vanaf een clip van 3 seconden.
- Snelle batch-doorvoer (RTF ~0,03 in onze test).
Nadelen, de eerlijke grenzen:
- Niet gebouwd voor realtime conversatie onder 300 ms.
- Minder gepolijst en consistent dan topcommerciële stemmen zoals ElevenLabs.
- Geen beheerde support of SLA, je bent op GitHub-issues aangewezen.
- Vereist een GPU (~8 GB VRAM); op CPU draait het zo'n 3 keer langzamer.
- Kleinere bibliotheek vooraf ingestelde stemmen dan de catalogus van ElevenLabs.
- Toestemming en licentie van gekloonde stemmen zijn jouw juridische verantwoordelijkheid, niet die van het platform.
Als je product directe, gepolijste antwoorden nodig heeft in een live telefoongesprek, is OmniVoice vandaag het verkeerde gereedschap. Als je audio in batches genereert, in meer dan 600 talen, op je eigen hardware, is het moeilijk te verslaan tegen de prijs van gratis.
Aan de slag met OmniVoice
OmniVoice aan de praat krijgen kost één installatiecommando en een paar regels Python, geen account, geen API-sleutel, geen facturatie-instellingen. Dat is het praktische voordeel van een open source model: je gaat in minuten van nul naar een gekloonde stem, en niets van wat je genereert verlaat je machine.
# Installatie (GPU-build, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
# --extra-index-url https://download.pytorch.org/whl/cu128
from omnivoice import OmniVoice
model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")
audio = model.generate(
text="Hello, this is a test of zero-shot voice cloning.",
ref_audio="ref.wav", # referentieclip ~3-6s
ref_text="Transcription of the reference audio.", # verhoogt de kloontrouw
)
# audio -> np.ndarray op 24 kHzModellen worden bij de eerste start automatisch opgehaald van HuggingFace. Liever geen code schrijven? Start de Gradio-interface met omnivoice-demo, of verwerk bestanden in batch met de omnivoice-infer-batch-CLI. Volledige installatienotities staan in de GitHub-repo.
Over de auteur
Mert Batur is medeoprichter van Techsy.io, waar het team AI-agents, automatiseringssystemen en spraak-/SDR-pipelines levert voor B2B-klanten. Hij schrijft over de LLM-toolingstack die het Techsy-team echt in productie gebruikt. Maak contact op LinkedIn.
Veelgestelde vragen
Is OmniVoice gratis voor commercieel gebruik?
Ja. OmniVoice wordt uitgebracht onder de Apache-2.0-licentie, die commercieel gebruik toestaat zonder abonnement, zonder kosten per teken en zonder gebruikslimieten. Je kunt het op je eigen hardware draaien voor klantwerk of interne producten. Onthoud alleen dat elke stem die je kloont eigen toestemmings- en licentieverplichtingen draagt, los van de modellicentie.
Hoeveel talen ondersteunt OmniVoice?
OmniVoice ondersteunt 600+ talen, met 646 genoemd op de modelkaart, alle via zero-shot meertalige synthese. Dat is ongeveer 20 keer de ~32 talen van ElevenLabs. De breedte is zijn grootste voordeel, met dekking van talen met weinig data die grote commerciële cloud-TTS-aanbieders vandaag helemaal niet aanbieden.
Is OmniVoice echt net zo goed als ElevenLabs?
Dat hangt af van wat je meet. OmniVoice wint op talen (646 versus ~32), kosten ($0 versus $5–330/maand), privacy en meertalige sprekergelijkenis (SIM-o 0,830 versus 0,655). ElevenLabs wint op afwerking, consistentie, realtime streaminglatentie, zijn grote bibliotheek vooraf ingestelde stemmen en commerciële support. Voor meertalig batchwerk is OmniVoice echt concurrerend; voor live, gepolijste stemmen loopt ElevenLabs nog voor.
Welke GPU heb ik nodig om OmniVoice te draaien?
Ongeveer 8 GB VRAM in fp16 is genoeg voor comfortabel gebruik, en het model draait prima op kaarten zoals de RTX 4090 die we testten. Je kunt het alleen op CPU draaien, maar verwacht zo'n 3 keer langzamere synthese. Voor batch-productiebelasting raadt k2-fsa 16 GB systeemgeheugen aan naast een GPU met 8 GB of meer.
Kan OmniVoice een stem klonen?
Ja, OmniVoice doet zero-shot stemklonen vanaf een referentieclip van slechts 3 seconden, zonder training per stem. Voor de beste trouw geef je een ref_text-transcriptie van de clip mee naast de audio. In onze test verbeterde het toevoegen van de transcriptie merkbaar hoe dicht de output bij de oorspronkelijke spreker bleef.
Is OmniVoice goed genoeg voor productie-spraakagents?
Als TTS-laag voor nasynchronisatie, IVR-meldingen of elke vooraf gegenereerde audio, ja, het is productieklaar. Als live stem in een realtime conversatie-agent die beurtwisselingen onder 300 ms nodig heeft, vandaag niet, de batch-RTF is snel maar streaminglatentie is niet zijn sterkste punt. Gebruik het waar je de audio voor de interactie genereert.
Draait OmniVoice volledig offline en on-premise?
Ja. Na de eerste modeldownload van HuggingFace draait OmniVoice volledig op je eigen machine, zonder dat er data naar een externe server gaat. Dat maakt het een sterke keuze voor AVG-gevoelige, juridische of afgeschermde omgevingen, waar een cloud-TTS-API zou afvallen door nalevingseisen.
Hoe verhoudt OmniVoice zich tot Chatterbox of Fish Audio?
Elk leidt een andere categorie. Chatterbox-Turbo (Resemble AI) wint blinde kwaliteitstests in het Engels maar is alleen Engels. Fish Audio S2 Pro voert het onafhankelijke EmergentTTS-Eval-klassement aan met expressieve output over 80+ talen. De voorsprong van OmniVoice is de pure taaldekking van 646, plus zero-shot klonen, wat het de keuze maakt wanneer breedte en on-premise gebruik het zwaarst wegen.
Het oordeel
OmniVoice is het meest geloofwaardige open source alternatief voor ElevenLabs dat we hebben getest, en het is gratis. Na zelf v0.1.5 te hebben gedraaid is de aanbeveling simpel: kies OmniVoice als je veel talen, on-premise privacy of nul kosten nodig hebt voor batch-audio, en blijf bij een cloud-API als je vandaag gepolijste, realtime, conversatie-stemmen nodig hebt.
- Gratis en open source onder Apache-2.0, geen facturering per teken.
- 646 talen en zero-shot klonen, ver voorbij ElevenLabs.
- Lokaal en privé, ideaal voor on-premise en compliance-gebonden werk.
- Niet voor live conversatie onder 300 ms, dat blijft een cloud-klus.
Bouw je een meertalige spraak- of nasynchronisatiepipeline en wil je hulp bij het kiezen van de juiste stack? Vraag een gratis consult aan, het soort dingen dat we elke maand voor klanten opzetten.