
Recenze OmniVoice: Otestovali jsme open-source rivala ElevenLabs (600+ jazyků)
Minulý týden jsme na RTX 4090 nainstalovali OmniVoice v0.1.5 od k2-fsa, předali mu 6sekundovou ukázku anglického hlasu a nechali jej přečíst odstavec ve třech jazycích. Studený start včetně načtení modelu trval asi 14 sekund. Následné „zahřáté“ běhy? Přibližně RTF 0,03, což je téměř 30× rychleji než v reálném čase. Stručné shrnutí této recenze zní: ano, tento open-source projekt je skutečnou open-source alternativou k ElevenLabs pro specifický typ uživatelů, ale ne, nenahradí vyladěné cloudové API pro každého. Podívejme se, kdo je pro koho.
Klíčová zjištění:
- OmniVoice je bezplatný TTS s licencí Apache-2.0 od k2-fsa, který pokrývá více než 600 jazyků a nabízí klonování hlasu zero-shot.
- V našem testu dosáhl na RTX 4090 hodnoty RTF ~0,03; pro jeho provoz stačí přibližně 8 GB VRAM.
- Poráží ElevenLabs v počtu jazyků (646 oproti ~32), nákladech (0 USD oproti 5–330 USD/měsíc) a soukromí, nikoliv však v propracovanosti nebo streamování v reálném čase.
- Nejvhodnější pro dabing, práci on-premise a jazyky s nízkými zdroji dat; vyhněte se mu pro konverzační agenty s odezvou pod 300 ms.
Co je OmniVoice (a proč na tom záleží)?
OmniVoice je open-source model převodu textu na řeč (TTS) s licencí Apache-2.0 od k2-fsa, týmu zabývajícího se výzkumem řeči, který stojí za projekty Kaldi a k2. Jde o TTS stylizovaný jako difúzní jazykový model s 0,6 miliardy parametrů, který běží lokálně, pokrývá více než 600 jazyků a umožňuje klonování hlasů metodou zero-shot. Je důležitý, protože poprvé existuje skutečně bezplatný lokální model, který se kvalitou dostatečně přiblížil placené cloudové službě, takže kompromis mezi nimi je reálný, nikoliv teoretický.
Repozitář (github.com/k2-fsa/OmniVoice) má kolem 7,1 tisíce hvězdiček a nejnovější verze v0.1.5 vyšla 28. dubna 2026. Uvnitř je fine-tunován z modelu Qwen3-0.6B-Base a produkuje audio o vzorkovací frekvenci 24 kHz. Pokud jste četli náš přehled nejlepších nástrojů AI pro hlas, představte si OmniVoice jako samostatně hostovanou část tohoto spektra – možnost, po které sáhnete, když data nesmí opustit vaše serveru.
Původ od k2-fsa je aspektem, který většina článků opomíjí. Nejde o víkendový projekt od anonymního účtu. Jde o stejnou linii, která formovala open-source rozpoznávání řeči více než deset let, což je hlavní důvod, proč je kvalita tak vysoká již v této rané fázi.
Funkce OmniVoice v kostce
OmniVoice balí sadu funkcí, kterou byste očekávali od placené platformy, do modelu, který si stáhnete jednou. Hlavní čísla převzatá z jeho karty modelu na HuggingFace: 646 jazyků, klonování zero-shot z referenční ukázky dlouhé ~3 sekundy a RTF až 0,025, což je zhruba 40× rychleji než v reálném čase.
Zde je to, co skutečně získáte:
- Klonování hlasu z krátké ukázky, zero-shot, bez nutnosti tréninku pro každý hlas.
- Design hlasu podle atributů: pohlaví, věk, výška tónu, dialekt nebo přízvuk, dokonce i režim šepotu.
- Jemná kontrola pomocí neverbálních symbolů a korekce výslovnosti pro obtížná jména.
- Tři rozhraní: webové UI Gradio (
omnivoice-demo), Python API se třemi režimy generování a CLI (omnivoice-infer). - Rychlost: dávkové RTF 0,022, generující zhruba 60 sekund audia za přibližně 1,3 sekundy.
Pokud jde o kvalitu, OmniVoice hlásí skóre podobnosti mluvčího (SIM-o) 0,830 oproti 0,655 u ElevenLabs při vícejazyčných testech a míru chybovosti slov pouhých 0,84 % na čínské sadě Seed-TTS, čímž poráží ElevenLabs v2 a MiniMax v tomto benchmarku. S přibližně 2,5 milionu stažení měsíčně na HuggingFace mnoho lidí tyto tvrzení důkladně testuje.
Co jsme viděli, když jsme spustili OmniVoice
Chtěli jsme reálná čísla, ne jen tvrzení z repozitáře, takže jsme ho otestovali sami. Spustili jsme pip install omnivoice na RTX 4090 (24 GB) v červnu 2026, vzali čistý 6sekundový anglický referenční záznam a vygenerovali 60sekundový odstavec v angličtině, turečtině a arabštině z téže jediné reference.
Studený start včetně prvního načtení modelu trval asi 14 sekund. Poté se dávkové běhy ustálily kolem RTF 0,03, tedy zhruba 30× rychleji než v reálném čase na našem stroji, což je o něco pomalejší než headline hodnota 0,025 z repozitáře, ale blízké a více než dostatečně rychlé pro dávkovou dabingovou práci. Využití VRAM zůstalo pohodlně pod limitem nabízeným 24 GB kartou; doporučení ~8 GB z karty modelu se potvrdilo.
Co se týče kvality, angličtina a turečtina byly čisté a přirozené, s klonovaným timbrem jasně rozpoznatelným ze šestisekundové ukázky. Arabština byla solidní u krátkých vět, ale prozódie byla u delších vět trochu plochá – srozumitelná, jen ne tak expresivní. Jeden háček, který stojí za zmínku: pro nejlepší věrnost klonu budete chtít předat ref_text (transkripci vaší referenční ukázky). Pokud ji vynecháte, shoda hlasu se začne odchylkovat. Když jsme to zkusili s transkripcí, podobnost znatelně vzrostla.
To je druh výsledku, díky kterému stojí OmniVoice za seriózní zvážení pro vícejazyčné pipeline, s otevřenýma očima ohledně nedostatků.
OmniVoice vs ElevenLabs: Jak moc se liší?
OmniVoice a ElevenLabs řeší stejný problém z opačných konců. ElevenLabs je vyladěné cloudové API s obrovskou knihovnou přednastavených hlasů a nízkou latencí streamování; OmniVoice je bezplatný lokální model s 20násobným pokrytím jazyků a nulovými náklady za znak. Správná volba závisí na tom, zda upřednostňujete kontrolu a soukromí, nebo pohodlí a propracovanost.
| Dimenze | OmniVoice | ElevenLabs |
|---|---|---|
| Jazyky | 646 | ~32 |
| Cena | 0 USD (Apache-2.0) | 5–330 USD/měsíc, za znak |
| Hosting | Lokální / offline | Pouze cloud |
| Latence | Dávkové RTF ~0,03 (rychlé) | Nízká latence streamování |
| Knihovna hlasů | DIY / klonujte si vlastní | Velká knihovna přednastavení |
| Klonování hlasu | Zero-shot, spravováno uživatelem | Souhlas řízený platformou |
| Podpora | Komunita / GitHub | Komerční SLA |
| Vícejazyčná kvalita | SIM-o 0,830 | SIM-o 0,655, propracovanější/konzistentnější |
Pokud kalkulujete náklady na hlasový stack pro AI hlasového agenta, tato tabulka rychle mění matematiku, zejména ve velkém měřítku, kde se účtování za znak u ElevenLabs sčítá (rozebrali jsme to v naší příručce cenotvorba hlasových agentů). Upřímný verdikt: ElevenLabs je konzistentnější a snazší; OmniVoice je levnější, více soukromý a mnohem více vícejazyčný.
Jak se OmniVoice srovnává s jinými open-source TTS modely?
OmniVoice není jediným open-source uchazečem a nevyhrává v každé kategorii. Má daleko nejširší pokrytí jazyků, ale Chatterbox vyhrává slepé testy v angličtině, Fish Audio vede nezávislý žebříček EmergentTTS-Eval a Kokoro je rychlejší, pokud nepotřebujete klonování. Zde je upřímný přehled pole.

| Model | Tvůrce | Parametry | Jazyky | Klonování | Přednost | Vyberte si tento, pokud… |
|---|---|---|---|---|---|---|
| OmniVoice | k2-fsa | 0,6B | 646 | Zero-shot, 3s | Nejširší pokrytí jazyků | Potřebujete širokou podporu jazyků nebo on-prem |
| Chatterbox-Turbo | Resemble AI | 350M | Pouze angličtina | Ano | 65,3 % preferováno v slepých testech oproti ElevenLabs (24,5 %) | Potřebujete pouze angličtinu a chcete špičkovou kvalitu |
| Fish Audio S2 Pro | Fish Audio | n/a | 80+ | Ano | #1 na EmergentTTS-Eval (81,88 % míra výher) | Chcete expresivní výstup vedoucí v benchmarcích |
| Qwen3-TTS-0.6B | Alibaba | 0,6B | 10 | Ne | 97ms latence streamování | Potřebujete nízkou latenci streamování |
| Kokoro | open-source | 82M | Zaměřeno na angličtinu | Ne (54 předvoleb) | 210× reálný čas na RTX 4090 | Chcete maximální rychlost, klonování není potřeba |
Většina z nich běží na 4–8 GB VRAM v fp16, takže hardware není rozhodujícím faktorem, tím je použití. Průběžně aktualizovaný seznam udržujeme v našem přehledu nejlepších nástrojů AI pro hlas.
Kdy byste měli OmniVoice skutečně používat?
OmniVoice vyniká všude tam, kde šíře jazyků, náklady nebo kontrola dat převyšují potřebu vyladěného cloudového API. Je to pracovní kůň pro dávkové zpracování, ne engine pro konverzace v reálném čase, proto jej přiřaďte úlohám, kde generujete audio předem nebo běžíte na vlastním hardwaru.
- Video dabing do desítek jazyků z jednoho referenčního hlasu, workflow AI video dabingu, kde by účtování za znak bylo brutální.
- Vícejazyčné IVR a TTS pro hlasové agenty, hlasová vrstva napájející hlasového agenta pro restaurace nebo systém nahrazující hlasové agenty call center.
- Audioknihy v dlouhých dávkách, kde záleží více na RTF než na latenci.
- Přístupnost a narrace pro screen readery v jazycích, které cloudoví prodejci ignorují.
- Jazyky s nízkými zdroji dat, které ElevenLabs jednoduše nepokrývá.
- On-premise a práce citlivá na HIPAA, kde audio nesmí přijít do kontaktu se serverem třetí strany.
Ten poslední bod je tichým killer feature. Pro klienta ze zdravotnictví nebo právní sféry není „audio nikdy neopustí náš stroj“ jen příjemným bonusem, je to celý důvod, proč je cloudové TTS vyloučeno.
Výhody a nevýhody OmniVoice (včetně toho, pro co NENÍ určen)
OmniVoice si své hvězdičky zaslouží, ale není náhradou za ElevenLabs pro každý tým. Výhody se týkají svobody a šíře; nevýhody se týkají propracovanosti, latence a operační zátěže spojené s provozem vlastního modelu.
Výhody:
- Bezplatný pod licencí Apache-2.0, žádné účtování za znak, žádné limity.
- 646 jazyků, včetně těch, kterých se žádný velký cloudový poskytovatel nedotýká.
- Běží zcela lokálně, vaše data zůstávají na místě.
- Silná kvalita vícejazyčného klonování (SIM-o 0,830) z 3sekundové ukázky.
- Rychlá propustnost dávek (RTF ~0,03 v našem testu).
Nevýhody, upřímné limity:
- Není určen pro konverzační interakce v reálném čase s odezvou pod 300 ms.
- Méně propracovaný a konzistentní než špičkové komerční hlasy jako ElevenLabs.
- Žádná spravovaná podpora ani SLA, jste odkázáni na GitHub issues.
- Vyžaduje GPU (~8 GB VRAM); běh na CPU je přibližně 3× pomalejší.
- Menší knihovna předpřipravených hlasů než katalog ElevenLabs.
- Souhlas a licencování klonovaných hlasů jsou vaší právní odpovědností, nikoliv odpovědností platformy.
Pokud váš produkt potřebuje okamžité, vyladěné odpovědi během živého telefonátu, OmniVoice je dnes špatným nástrojem. Pokud generujete audio v dávkách, ve více než 600 jazycích, na vlastním hardwaru, je těžké ho porazit za cenu zdarma.
Jak začít s OmniVoice
Spuštění OmniVoice vyžaduje jeden instalační příkaz a několik řádků Pythonu, žádný účet, žádný API klíč, žádné nastavení fakturace. To je praktický přínos open-source modelu: za pár minut se dostanete od nuly ke klonovanému hlasu a nic, co vygenerujete, neopustí váš stroj.
# Install (GPU build, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
# --extra-index-url https://download.pytorch.org/whl/cu128
from omnivoice import OmniVoice
model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")
audio = model.generate(
text="Hello, this is a test of zero-shot voice cloning.",
ref_audio="ref.wav", # ~3-6s reference clip
ref_text="Transcription of the reference audio.", # boosts clone fidelity
)
# audio -> np.ndarray at 24 kHzModely se při prvním spuštění automaticky stáhnou z HuggingFace. Neradi píšete kód? Spusťte Gradio UI pomocí omnivoice-demo nebo dávkově zpracovávejte soubory pomocí CLI omnivoice-infer-batch. Kompletní instalační poznámky najdete v repozitáři na GitHubu.
O autorovi
Mert Batur Gurbuz je spoluzakladatelem Techsy.io, kde tým dodává AI agenty, automatizační systémy a hlasové/SDR pipeline pro B2B klienty. Studuje na University of Birmingham a píše o stacku nástrojů LLM, který tým Techsy skutečně používá v produkci. Spoňte se na LinkedIn.
Často kladené otázky
Je OmniVoice zdarma pro komerční použití?
Ano. OmniVoice je vydáván pod licencí Apache-2.0, která povoluje komerční použití bez předplatného, bez poplatků za znak a bez limitů využití. Můžete jej provozovat na vlastním hardwaru pro klientskou práci nebo interní produkty. Nezapomeňte však, že jakýkoli hlas, který klonujete, nese vlastní povinnosti týkající se souhlasu a licencování, oddělené od licence modelu.
Kolik jazyků OmniVoice podporuje?
OmniVoice podporuje více než 600 jazyků, přičemž na kartě modelu je uvedeno 646, vše prostřednictvím vícejazyčné syntézy zero-shot. To je zhruba 20krát více než ~32 jazyků u ElevenLabs. Šíře je jeho největší výhodou, pokrývá jazyky s nízkými zdroji dat, které hlavní komerční cloudoví poskytovatelé TTS dnes vůbec nenabízejí.
Je OmniVoice skutečně stejně dobrý jako ElevenLabs?
Záleží na tom, co měříte. OmniVoice vítězí v počtu jazyků (646 oproti ~32), ceně (0 USD oproti 5–330 USD/měsíc), soukromí a vícejazyčné podobnosti mluvčího (SIM-o 0,830 oproti 0,655). ElevenLabs vítězí v propracovanosti, konzistenci, latenci streamování v reálném čase, velké knihovně přednastavených hlasů a komerční podpoře. Pro dávkovou vícejazyčnou práci je OmniVoice skutečně konkurenceschopný; pro živé, vyladěné hlasy stále vede ElevenLabs.
Jaké GPU potřebuji pro spuštění OmniVoice?
Pro pohodlné použití stačí přibližně 8 GB VRAM v fp16 a model běží dobře na kartách, jako je námi testovaná RTX 4090. Můžete jej spustit pouze na CPU, ale očekávejte přibližně 3× pomalejší syntézu. Pro produkční dávkové úlohy doporučuje k2-fsa 16 GB systémové RAM spolu s GPU s 8 GB nebo více.
Může OmniVoice klonovat hlas?
Ano, OmniVoice provádí klonování hlasu zero-shot z referenční ukázky dlouhé pouhé 3 sekundy, bez nutnosti tréninku pro každý hlas. Pro nejlepší věrnost předejte transkripci ukázky ref_text spolu s audiem. V našem testu přidání transkripce znatelně zlepšilo, jak closely výstup odpovídal původnímu mluvčímu.
Je OmniVoice dostatečně dobrý pro produkční hlasové agenty?
Jako vrstva TTS pro dabing, IVR výzvy nebo jakékoli předgenerované audio ano, je připraven pro produkci. Jako živý hlas v konverzačním agentovi v reálném čase, který potřebuje střídání tahů pod 300 ms, dnes ne, dávkové RTF je rychlé, ale latence streamování není jeho silnou stránkou. Používejte jej tam, kde generujete audio před interakcí.
Běží OmniVoice zcela offline a on-premise?
Ano. Po počátečním stažení modelu z HuggingFace běží OmniVoice zcela na vašem stroji bez odesílání dat na jakýkoli externí server. To z něj činí silnou volbu pro prostředí citlivá na HIPAA, právní nebo air-gapped, kde by cloudové TTS API bylo vyloučeno požadavky na compliance.
Jak se OmniVoice srovnává s Chatterbox nebo Fish Audio?
Každý vede v jiné kategorii. Chatterbox-Turbo (Resemble AI) vítězí v testech kvality angličtiny naslepo, ale je pouze v angličtině. Fish Audio S2 Pro vede nezávislý žebříček EmergentTTS-Eval s expresivním výstupem ve více než 80 jazycích. Výhodou OmniVoice je sheer pokrytí jazyků na úrovni 646 plus klonování zero-shot, což z něj činí volbu, když je nejdůležitější šíře a použití on-premise.
Verdikt
OmniVoice je nejvěrohodnější open-source alternativou k ElevenLabs, kterou jsme testovali, a je zdarma. Po vlastním spuštění v0.1.5 je doporučení jednoduché: zvolte OmniVoice, pokud potřebujete široké pokrytí jazyků, soukromí on-premise nebo nulové náklady pro dávkovou práci s audiem, a držte se cloudového API, pokud dnes potřebujete vyladěné, konverzační hlasy v reálném čase.
- Bezplatný a open-source pod licencí Apache-2.0, žádné účtování za znak.
- 646 jazyků a klonování zero-shot, daleko beyond ElevenLabs.
- Lokální a soukromý, ideální pro on-premise a práci vázanou compliance.
- Není určen pro živou konverzaci s odezvou pod 300 ms, to je stále doménou cloudu.
Pokud budujete vícejazyčný hlasový nebo dabingový pipeline a potřebujete pomoc s výběrem správného stacku, získejte bezplatnou konzultaci, je to něco, co pro klienty nastavujeme každý měsíc.