ai-machine-learning

OmniVoice-anmeldelse: vi testet open source-alternativet til ElevenLabs (600+ språk)

Skrevet av Mert Batur
Jun 5, 2026
10 lesing
OmniVoice-anmeldelse: vi testet open source-alternativet til ElevenLabs (600+ språk)

Vi installerte OmniVoice v0.1.5 fra k2-fsa forrige uke på en RTX 4090, ga den et 6-sekunders klipp av en engelsk stemme og ba den lese opp et avsnitt på tre språk. Kaldstart: rundt 14 sekunder inkludert modellinnlastingen. Og de varme kjøringene etterpå? Omtrent RTF 0,03, nær 30 ganger sanntid. Kortversjonen av denne anmeldelsen: ja, dette open source-prosjektet er et ekte open source-alternativ til ElevenLabs for en bestemt type bruker, og nei, det erstatter ikke et polert sky-API for alle. La oss finne ut hvem som er hvem.

Hovedpunkter:

  • OmniVoice er en gratis TTS under Apache-2.0 fra k2-fsa som dekker 600+ språk med zero-shot stemmekloning.
  • I testen vår nådde den RTF ~0,03 på en RTX 4090; rundt 8 GB VRAM holder.
  • Den slår ElevenLabs på språk (646 mot ~32), kostnad (0 $ mot 5–330 $/måned) og personvern, ikke på finish eller sanntidsstrømming.
  • Best for dubbing, lokal drift og språk med lite data; hopp over den for samtaleagenter under 300 ms.

Hva er OmniVoice (og hvorfor betyr det noe)?

OmniVoice er en open source tekst-til-tale-modell under Apache-2.0 fra k2-fsa, taleforskningsteamet bak Kaldi og k2. Det er en TTS med 0,6 milliarder parametere i stil med en diffusjonsspråkmodell, som kjører lokalt, dekker 600+ språk og kloner stemmer zero-shot. Det betyr noe fordi en virkelig gratis lokal modell for første gang kommer nær nok en betalt skytjeneste til at avveiningen blir reell, ikke bare teoretisk.

Repoet (github.com/k2-fsa/OmniVoice) ligger på rundt 7,1k stjerner, og den nyeste versjonen er v0.1.5 fra 28. april 2026. Under panseret er den finjustert fra Qwen3-0.6B-Base og gir lyd i 24 kHz. Hvis du har lest gjennomgangen vår av de beste AI-stemmeverktøyene, tenk på OmniVoice som den selvhostede enden av det spekteret, alternativet du tyr til når data ikke får forlate serverne dine.

k2-fsa-opphavet er delen de fleste artikler hopper over. Dette er ikke et helgeprosjekt fra en anonym konto. Det er den samme slekten som har formet åpen talegjenkjenning i over et tiår, en stor grunn til at kvaliteten allerede er så god så tidlig.

OmniVoice-funksjoner i korte trekk

OmniVoice pakker funksjonssettet du venter fra en betalt plattform inn i en modell du laster ned én gang. Nøkkeltallene, fra HuggingFace-modellkortet: 646 språk, zero-shot-kloning fra et referanseklipp på ~3 sekunder, og en RTF ned til 0,025, omtrent 40 ganger raskere enn sanntid.

Dette får du konkret:

  • Stemmekloning fra et kort klipp, zero-shot, uten trening per stemme.
  • Stemmedesign etter attributter: kjønn, alder, tonehøyde, dialekt eller aksent, til og med en hviskemodus.
  • Finstyring med ikke-verbale symboler og uttalekorreksjon for vanskelige navn.
  • Tre grensesnitt: et Gradio-webgrensesnitt (omnivoice-demo), et Python-API med tre genereringsmoduser og en CLI (omnivoice-infer).
  • Hastighet: batch-RTF på 0,022, rundt 60 sekunder lyd på omtrent 1,3 sekunder.

På kvalitet rapporterer OmniVoice en talerlikhetsskår (SIM-o) på 0,830 mot ElevenLabs' 0,655 i flerspråklige tester, og en ordfeilrate på bare 0,84 % på Seed-TTS-kinesisk-settet, noe som slår ElevenLabs v2 og MiniMax på det benchmarket. Med ~2,5 millioner nedlastinger i måneden på HuggingFace setter mange disse påstandene på prøve.

Hva vi så da vi kjørte OmniVoice

Vi ville ha ekte tall, ikke repo-påstander, så vi testet den selv. Vi kjørte pip install omnivoice på en RTX 4090 (24 GB) i juni 2026, tok et rent engelsk referanseopptak på 6 sekunder og genererte et 60-sekunders avsnitt på engelsk, tyrkisk og arabisk, alt fra den ene referansen.

Kaldstarten, inkludert den første modellinnlastingen, tok rundt 14 sekunder. Deretter la de varme batch-kjøringene seg rundt RTF 0,03, altså omtrent 30 ganger sanntid på maskinen vår, et hakk tregere enn repoets overskrift på 0,025 men nær, og mer enn raskt nok for batch-dubbing. VRAM-bruken holdt seg komfortabelt under det 24 GB-kortet tilbød; modellkortets anbefaling på ~8 GB holdt.

Kvalitetsmessig kom engelsk og tyrkisk tilbake rene og naturlige, med en klonet klang tydelig gjenkjennelig fra en seks sekunders prøve. Arabisk var solid på korte setninger, men prosodien ble litt flat på lange, forståelig, bare mindre uttrykksfull. Én felle verdt å nevne: du vil sende med ref_text (en transkripsjon av referanseklippet) for best kloningstroskap. Hopper du over den, driver stemmematchen av sted. Da vi prøvde med transkripsjonen, hoppet likheten merkbart opp.

Det er den typen resultat som gjør OmniVoice verdt en seriøs titt for flerspråklige pipelines, med åpne øyne for de ru kantene.

OmniVoice mot ElevenLabs: hvor forskjellige er de?

OmniVoice og ElevenLabs løser det samme problemet fra motsatte ender. ElevenLabs er et polert sky-API med et enormt bibliotek av forhåndsdefinerte stemmer og lav strømmingslatens; OmniVoice er en gratis lokal modell med 20 ganger mer språkdekning og null kostnad per tegn. Riktig valg avhenger av om du verdsetter kontroll og personvern eller bekvemmelighet og finish.

DimensjonOmniVoiceElevenLabs
Språk646~32
Kostnad0 $ (Apache-2.0)5–330 $/måned, per tegn
HostingLokalt / offlineKun sky
LatensBatch-RTF ~0,03 (rask)Lav strømmingslatens
StemmebibliotekGjør-det-selv / klon din egenStort forhåndsdefinert bibliotek
StemmekloningZero-shot, egen håndteringPlattformstyrt samtykke
StøtteFellesskap / GitHubKommersiell SLA
Flerspråklig kvalitetSIM-o 0,830SIM-o 0,655, mer polert/konsekvent

Hvis du kalkulerer en stemmestabel for en AI-stemmeagent, endrer denne tabellen regnestykket raskt, særlig i skala der ElevenLabs' fakturering per tegn hoper seg opp (vi brøt det ned i guiden vår om priser for AI-stemmeagenter). Den ærlige dommen: ElevenLabs er mer konsekvent og enklere; OmniVoice er billigere, mer privat og langt mer flerspråklig.

Hvordan står OmniVoice seg mot andre open source-TTS-modeller?

OmniVoice er ikke den eneste open source-utfordreren, og den vinner ikke hver kategori. Den har den klart bredeste språkdekningen, men Chatterbox vinner blindtester på engelsk, Fish Audio leder den uavhengige EmergentTTS-Eval-rangeringen, og Kokoro er raskere hvis du ikke trenger kloning. Her er det ærlige feltet.

OmniVoice sammenlignet med ElevenLabs, Chatterbox, Fish Audio og Qwen3-TTS etter antall språk og stemmelikhet
Fem open source-TTS-modeller sammenlignet etter språkdekning og talerlikhet

ModellProdusentParametereSpråkKloningStyrkeVelg denne hvis…
OmniVoicek2-fsa0,6B646Zero-shot, 3sBredeste språkdekningDu trenger mange språk eller lokal drift
Chatterbox-TurboResemble AI350MKun engelskJaForetrukket i 65,3 % av blindtest mot ElevenLabs (24,5 %)Du bare trenger engelsk og vil ha toppkvalitet
Fish Audio S2 ProFish Audiomangler80+Ja1. på EmergentTTS-Eval (81,88 % vinnerandel)Du vil ha benchmark-ledende, uttrykksfull output
Qwen3-TTS-0.6BAlibaba0,6B10Nei97 ms strømmingslatensDu trenger lav strømmingslatens
KokoroOpen source82MEngelskorientertNei (54 forhåndsinnstillinger)210 ganger sanntid på en RTX 4090Du vil ha maksimal hastighet, uten kloning

De fleste av disse modellene kjører i 4–8 GB VRAM i fp16, så maskinvaren er ikke den avgjørende faktoren, men bruksområdet. Vi holder listen oppdatert i gjennomgangen vår av de beste AI-stemmeverktøyene.

Når bør du faktisk bruke OmniVoice?

OmniVoice skinner overalt der språkbredde, kostnad eller datakontroll veier tyngre enn behovet for et polert sky-API. Det er en batch-arbeidshest, ikke en sanntids samtalemotor, så par den med oppgaver der du genererer lyd på forhånd eller kjører ting på din egen maskinvare.

  • Videodubbing til dusinvis av språk fra én referansestemme, AI-videodubbing-flyten der fakturering per tegn ville vært brutal.
  • Flerspråklig IVR og stemmeagent-TTS, stemmelaget bak en stemmeagent for restauranter eller den typen systemer som erstatter kundesentre.
  • Lydbøker i lange batch-kjøringer der RTF betyr mer enn latens.
  • Tilgjengelighet og skjermleserfortelling på språk skyleverandører hopper over.
  • Språk med lite data som ElevenLabs rett og slett ikke dekker.
  • Lokal drift og GDPR-sensitivt arbeid der lyd ikke kan røre en tredjepartsserver.

Det siste er den stille avgjørende funksjonen. For en kunde innen helse eller jus er "lyden forlater aldri maskinen vår" ikke et pluss, det er hele grunnen til at en sky-TTS utelukkes.

OmniVoice fordeler og ulemper (inkludert hva det IKKE passer for)

OmniVoice fortjener stjernene sine, men det er ikke en plug-and-play-erstatning for ElevenLabs for hvert team. Fordelene handler om frihet og bredde; ulempene om finish, latens og den operative tyngden ved å drifte en egen modell.

Fordeler:

  • Gratis under Apache-2.0, ingen fakturering per tegn, ingen tak.
  • 646 språk, inkludert noen ingen stor skyleverandør rører.
  • Kjører helt lokalt, dataene dine blir der de er.
  • Sterk flerspråklig kloningskvalitet (SIM-o 0,830) fra et 3-sekunders klipp.
  • Rask batch-gjennomstrømning (RTF ~0,03 i testen vår).

Ulemper, de ærlige grensene:

  • Ikke bygget for sanntidssamtale under 300 ms.
  • Mindre polert og konsekvent enn de beste kommersielle stemmene som ElevenLabs.
  • Ingen administrert støtte eller SLA, du er henvist til GitHub-saker.
  • Krever en GPU (~8 GB VRAM); på CPU kjører den omtrent 3 ganger tregere.
  • Mindre bibliotek av forhåndsdefinerte stemmer enn ElevenLabs' katalog.
  • Samtykke og lisens for klonede stemmer er ditt juridiske ansvar, ikke plattformens.

Hvis produktet ditt trenger umiddelbare, polerte svar i en live telefonsamtale, er OmniVoice feil verktøy i dag. Hvis du genererer lyd i batcher, på over 600 språk, på din egen maskinvare, er det vanskelig å slå til prisen gratis.

Slik kommer du i gang med OmniVoice

Å få OmniVoice i gang tar én installasjonskommando og noen linjer Python, ingen konto, ingen API-nøkkel, ingen faktureringsoppsett. Det er den praktiske gevinsten med en open source-modell: du går fra null til en klonet stemme på minutter, og ingenting av det du genererer forlater maskinen din.

python
# Installasjon (GPU-bygg, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
#   --extra-index-url https://download.pytorch.org/whl/cu128

from omnivoice import OmniVoice

model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")

audio = model.generate(
    text="Hello, this is a test of zero-shot voice cloning.",
    ref_audio="ref.wav",                       # referanseklipp ~3-6s
    ref_text="Transcription of the reference audio.",  # øker kloningstroskapen
)
# audio -> np.ndarray i 24 kHz

Modeller hentes automatisk fra HuggingFace ved første kjøring. Foretrekker du å slippe å kode? Start Gradio-grensesnittet med omnivoice-demo, eller batch-behandle filer med omnivoice-infer-batch-CLI-en. Fullstendige installasjonsnotater finnes i GitHub-repoet.

Om forfatteren

Mert Batur er medgründer av Techsy.io, der teamet leverer AI-agenter, automasjonssystemer og stemme-/SDR-pipelines for B2B-kunder. Han skriver om LLM-verktøystabelen Techsy-teamet faktisk bruker i produksjon. Koble til på LinkedIn.

Ofte stilte spørsmål

Er OmniVoice gratis til kommersiell bruk?

Ja. OmniVoice er utgitt under Apache-2.0-lisensen, som tillater kommersiell bruk uten abonnement, uten avgifter per tegn og uten brukstak. Du kan kjøre den på din egen maskinvare for kundeoppdrag eller interne produkter. Husk bare at hver stemme du kloner bærer sine egne forpliktelser om samtykke og lisens, atskilt fra modellens lisens.

Hvor mange språk støtter OmniVoice?

OmniVoice støtter 600+ språk, med 646 oppgitt på modellkortet, alle via zero-shot flerspråklig syntese. Det er omtrent 20 ganger ElevenLabs' ~32 språk. Bredden er den største fordelen, og dekker språk med lite data som store kommersielle sky-TTS-leverandører ikke tilbyr i det hele tatt i dag.

Er OmniVoice virkelig like god som ElevenLabs?

Det kommer an på hva du måler. OmniVoice vinner på språk (646 mot ~32), kostnad (0 $ mot 5–330 $/måned), personvern og flerspråklig talerlikhet (SIM-o 0,830 mot 0,655). ElevenLabs vinner på finish, konsekvens, sanntidsstrømmingslatens, sitt store bibliotek av forhåndsdefinerte stemmer og kommersiell støtte. For flerspråklig batch-arbeid er OmniVoice virkelig konkurransedyktig; for live, polerte stemmer leder ElevenLabs fortsatt.

Hvilken GPU trenger jeg for å kjøre OmniVoice?

Rundt 8 GB VRAM i fp16 holder for komfortabel bruk, og modellen kjører fint på kort som RTX 4090 vi testet. Du kan kjøre den kun på CPU, men forvent omtrent 3 ganger tregere syntese. For batch-produksjonslaster anbefaler k2-fsa 16 GB systemminne ved siden av en GPU med 8 GB eller mer.

Kan OmniVoice klone en stemme?

Ja, OmniVoice gjør zero-shot stemmekloning fra et referanseklipp så kort som 3 sekunder, uten trening per stemme. For best troskap, send med en ref_text-transkripsjon av klippet sammen med lyden. I testen vår forbedret det å legge til transkripsjonen merkbart hvor nær outputen lå originaltaleren.

Er OmniVoice god nok for stemmeagenter i produksjon?

Som TTS-lag for dubbing, IVR-meldinger eller hvilken som helst forhåndsgenerert lyd, ja, det er produksjonsklart. Som live-stemme i en sanntids samtaleagent som trenger turtaking under 300 ms, ikke i dag, batch-RTF er rask men strømmingslatens er ikke styrken. Bruk den der du genererer lyden før interaksjonen.

Kjører OmniVoice helt offline og lokalt?

Ja. Etter den første modellnedlastingen fra HuggingFace kjører OmniVoice helt på din egen maskin, uten at data sendes til noen ekstern server. Det gjør den til et sterkt valg for GDPR-sensitive, juridiske eller isolerte miljøer, der et sky-TTS-API ville bli utelukket av etterlevelseskrav.

Hvordan står OmniVoice seg mot Chatterbox eller Fish Audio?

Hver leder en ulik kategori. Chatterbox-Turbo (Resemble AI) vinner blinde kvalitetstester på engelsk, men er kun engelsk. Fish Audio S2 Pro leder den uavhengige EmergentTTS-Eval-rangeringen med uttrykksfull output på 80+ språk. OmniVoices fortrinn er den rene språkdekningen på 646, pluss zero-shot-kloning, noe som gjør den til valget når bredde og lokal drift veier tyngst.

Dommen

OmniVoice er det mest troverdige open source-alternativet til ElevenLabs vi har testet, og det er gratis. Etter å ha kjørt v0.1.5 selv er anbefalingen enkel: velg OmniVoice hvis du trenger mange språk, lokalt personvern eller null kostnad for batch-lyd, og hold deg til et sky-API hvis du trenger polerte, sanntids, samtalestemmer i dag.

  • Gratis og åpen kildekode under Apache-2.0, ingen fakturering per tegn.
  • 646 språk og zero-shot-kloning, langt forbi ElevenLabs.
  • Lokal og privat, ideell for lokal drift og etterlevelsesbundet arbeid.
  • Ikke for live-samtale under 300 ms, det forblir en sky-jobb.

Hvis du bygger en flerspråklig stemme- eller dubbingpipeline og vil ha hjelp til å velge riktig stabel, få en gratis konsultasjon, den typen ting vi setter opp for kunder hver måned.

Emneord

omnivoiceopen-source-elevenlabs-alternativtekst-til-talestemmekloningtts

Del denne artikkelen

Kom i gang

Klar til å bygge noe ekstraordinært?

La oss gjøre visjonen din til virkelighet. Teamet vårt er klart til å hjelpe deg med å lage programvare som utgjør en forskjell.