
Recenzja OmniVoice: Przetestowaliśmy open-source'owego rywala ElevenLabs (600+ języków)
W zeszłym tygodniu zainstalowaliśmy OmniVoice v0.1.5 od k2-fsa na karcie RTX 4090, podaliśmy mu 6-sekundowy klip angielskiego głosu i poprosiliśmy o odczytanie akapitu w trzech językach. Zimny start: około 14 sekund z ładowaniem modelu. Kolejne uruchomienia? Współczynnik RTF na poziomie ~0,03, czyli blisko 30-krotna prędkość rzeczywista. Krótka wersja tej recenzji brzmi: tak, ten projekt open-source jest prawdziwą alternatywą dla ElevenLabs typu open source dla określonego typu użytkowników, ale nie, nie zastąpi dopracowanego API chmurowego dla każdego. Przyjrzyjmy się szczegółom.
Kluczowe wnioski:
- OmniVoice to darmowy system TTS na licencji Apache-2.0 od k2-fsa, obsługujący ponad 600 języków z klonowaniem głosu zero-shot.
- W naszych testach osiągnął RTF ~0,03 na RTX 4090; do jego działania wystarczy około 8 GB pamięci VRAM.
- Wygrywa z ElevenLabs pod względem liczby języków (646 vs ~32), kosztów (0 USD vs 5–330 USD/mies.) i prywatności, ale przegrywa w kwestii dopracowania i streamingu w czasie rzeczywistym.
- Najlepszy do dubbingu, pracy on-premise i języków o niskiej zasobowości; odrzuć go, jeśli budujesz agentów konwersacyjnych wymagających opóźnień poniżej 300 ms.
Czym jest OmniVoice (i dlaczego to ważne)?
OmniVoice to model text-to-speech (TTS) typu open-source na licencji Apache-2.0 stworzony przez k2-fsa, zespół badawczy zajmujący się mową, stojący za projektami Kaldi i k2. Jest to model TTS oparty na dyfuzji, posiadający 0,6 miliarda parametrów, który działa lokalnie, obsługuje ponad 600 języków i umożliwia klonowanie głosu w trybie zero-shot. To ważne, ponieważ po raz pierwszy genuinely darmowy model lokalny zbliża się na tyle do płatnej usługi chmurowej, że kompromis między nimi staje się realny, a nie tylko teoretyczny.
Repozytorium (github.com/k2-fsa/OmniVoice) ma około 7,1 tys. gwiazdek, a najnowsze wydanie to v0.1.5 z 28 kwietnia 2026 roku. Pod maską jest to model dostrojony na bazie Qwen3-0.6B-Base, generujący audio o częstotliwości 24 kHz. Jeśli czytałeś nasz przegląd najlepszych narzędzi AI do głosu, pomyśl o OmniVoice jako o końcu spektrum self-hosted – opcji, po którą sięgasz, gdy dane nie mogą opuścić Twoich serwerów.
Rodowód k2-fsa to aspekt, który większość opracowań pomija. Nie jest to weekendowy projekt anonimowego konta. To ta sama linia rozwojowa, która kształtuje otwartą rozpoznawanie mowy od ponad dekady, co jest głównym powodem, dla którego jakość jest tak dobra już na tak wczesnym etapie.
Funkcje OmniVoice w skrócie
OmniVoice pakietuje zestaw funkcji, których można by oczekiwać od płatnej platformy, w model, który pobierasz raz. Główne liczby, zaczerpnięte z karty modelu na HuggingFace: 646 języków, klonowanie zero-shot z ~3-sekundowego klipu referencyjnego oraz RTF na poziomie nawet 0,025, co oznacza około 40-krotną prędkość względem czasu rzeczywistego.
Oto co faktycznie otrzymujesz:
- Klonowanie głosu z krótkiego klipu, zero-shot, bez konieczności trenowania dla każdego głosu.
- Projektowanie głosu poprzez atrybuty: płeć, wiek, wysokość tonu, dialekt lub akcent, a nawet tryb szeptu.
- Precyzyjna kontrola dzięki symbolom niewerbalnym i korekcji wymowy dla trudnych nazwisk.
- Trzy interfejsy: webowy UI Gradio (
omnivoice-demo), API Pythona z trzema trybami generowania oraz CLI (omnivoice-infer). - Szybkość: wsadowe RTF 0,022, generujące około 60 sekund audio w zaledwie 1,3 sekundy.
Jeśli chodzi o jakość, OmniVoice raportuje wynik podobieństwa mówcy (SIM-o) na poziomie 0,830 w porównaniu do 0,655 dla ElevenLabs w testach wielojęzycznych oraz wskaźnik błędu słów (WER) na poziomie zaledwie 0,84% na chińskim zbiorze Seed-TTS, pokonując ElevenLabs v2 i MiniMax w tym benchmarku. Przy około 2,5 mln pobrań miesięcznie na HuggingFace, wiele osób stres-testuje te twierdzenia.
Co zobaczyliśmy, uruchamiając OmniVoice
Chcieliśmy rzeczywistych liczb, a nie deklaracji z repozytorium, więc przetestowaliśmy to sami. Uruchomiliśmy pip install omnivoice na RTX 4090 (24 GB) w czerwcu 2026 roku, pobraliśmy czyste 6-sekundowe nagranie referencyjne w języku angielskim i wygenerowaliśmy 60-sekundowy akapit w języku angielskim, tureckim i arabskim, używając tego samego pojedynczego odniesienia.
Zimny start, włączając pierwsze ładowanie modelu, zajął około 14 sekund. Później ciepłe uruchomienia wsadowe ustabilizowały się na poziomie RTF 0,03, czyli około 30-krotnej prędkości rzeczywistej na naszej maszynie – nieco wolniej niż reklamowane 0,025, ale blisko i wystarczająco szybko do pracy nad dubbingiem wsadowym. Zużycie VRAM pozostało komfortowo poniżej limitu karty 24 GB; rekomendacja ~8 GB z karty modelu potwierdziła się.
Pod względem jakości, angielski i turecki brzmiały czysto i naturalnie, a sklonowana barwa głosu była wyraźnie rozpoznawalna nawet z sześciosekundowej próbki. Arabski był solidny w krótkich zdaniach, ale prozodia stała się nieco płaska w dłuższych fragmentach – zrozumiała, ale mniej ekspresyjna. Jeden haczyk wart odnotowania: warto przekazać ref_text (transkrypcję klipu referencyjnego), aby uzyskać najlepszą wierność klonu. Jeśli to pominiesz, dopasowanie głosu może się rozjechać. Gdy przetestowaliśmy to z transkrypcją, podobieństwo zauważalnie wzrosło.
To właśnie taki rodzaj wyniku sprawia, że OmniVoice warto poważnie rozważyć do wielojęzycznych pipeline'ów, mając świadomość jego niedoskonałości.
OmniVoice vs ElevenLabs: Jak bardzo się różnią?
OmniVoice i ElevenLabs rozwiązują ten sam problem z dwóch przeciwległych stron. ElevenLabs to dopracowane API chmurowe z ogromną biblioteką gotowych głosów i niskim opóźnieniem streamingu; OmniVoice to darmowy model lokalny z 20-krotnie większym pokryciem językowym i zerowym kosztem za znak. Prawidłowy wybór zależy od tego, czy cenisz kontrolę i prywatność, czy wygodę i dopracowanie.
| Wymiar | OmniVoice | ElevenLabs |
|---|---|---|
| Języki | 646 | ~32 |
| Koszt | 0 USD (Apache-2.0) | 5–330 USD/mies., za znak |
| Hosting | Lokalny / offline | Tylko chmura |
| Opóźnienie | Wsadowe RTF ~0,03 (szybkie) | Niskie opóźnienie streamingu |
| Biblioteka głosów | DIY / sklonuj swój własny | Duża biblioteka presetów |
| Klonowanie głosu | Zero-shot, zarządzane samodzielnie | Zgoda zarządzana przez platformę |
| Wsparcie | Społeczność / GitHub | Komercyjne SLA |
| Jakość wielojęzyczna | SIM-o 0,830 | SIM-o 0,655, bardziej dopracowana/spójna |
Jeśli wyceniasz stos technologiczny głosu dla agenta głosowego AI, ta tabela szybko zmienia matematykę, zwłaszcza przy dużej skali, gdzie naliczanie opłat za znak przez ElevenLabs sumuje się (rozpisaliśmy to w naszym przewodniku po cenach agentów głosowych). Szczera werdykt: ElevenLabs jest bardziej spójne i łatwiejsze; OmniVoice jest tańsze, bardziej prywatne i znacznie bardziej wielojęzyczne.
Jak OmniVoice wypada na tle innych modeli TTS open-source?
OmniVoice nie jest jedynym kandydatem open-source i nie wygrywa w każdej kategorii. Ma największe pokrycie językowe z dużym zapasem, ale Chatterbox wygrywa ślepe testy w języku angielskim, Fish Audio prowadzi w niezależnym rankingu EmergentTTS-Eval, a Kokoro jest szybsze, jeśli nie potrzebujesz klonowania. Oto szczere zestawienie pola.

| Model | Twórca | Parametry | Języki | Klonowanie | Wyróżnik | Wybierz to, jeśli… |
|---|---|---|---|---|---|---|
| OmniVoice | k2-fsa | 0,6B | 646 | Zero-shot, 3s | Najszersze pokrycie językowe | Potrzebujesz szerokiego wsparcia językowego lub pracy on-prem |
| Chatterbox-Turbo | Resemble AI | 350M | Tylko angielski | Tak | 65,3% preferencji w ślepym teście vs ElevenLabs (24,5%) | Potrzebujesz tylko angielskiego i chcesz najwyższej jakości |
| Fish Audio S2 Pro | Fish Audio | b.d. | 80+ | Tak | #1 w EmergentTTS-Eval (81,88% wskaźnik wygranych) | Chcesz prowadzącej w benchmarkach ekspresyjności |
| Qwen3-TTS-0.6B | Alibaba | 0,6B | 10 | Nie | 97 ms opóźnienia streamingu | Potrzebujesz streamingu o niskim opóźnieniu |
| Kokoro | open-source | 82M | Skupiony na angielskim | Nie (54 presety) | 210x prędkość rzeczywista na RTX 4090 | Chcesz maksymalnej prędkości, bez klonowania |
Większość z nich działa na 4–8 GB VRAM w formacie fp16, więc sprzęt nie jest czynnikiem decydującym – liczy się przypadek użycia. Aktualizujemy działającą listę w naszym przeglądu najlepszych narzędzi AI do głosu.
Kiedy faktycznie powinieneś używać OmniVoice?
OmniVoice błyszczy tam, gdzie szerokość językowa, koszt lub kontrola nad danymi przeważają nad potrzebą dopracowanego API chmurowego. To koń roboczy do zadań wsadowych, a nie silnik konwersacyjny w czasie rzeczywistym, więc dopasuj go do zadań, w których generujesz audio z wyprzedzeniem lub uruchamiasz rzeczy na własnym sprzęcie.
- Dubbing wideo do dziesiątek języków z jednego głosu referencyjnego, workflow dubbingu wideo AI, gdzie naliczanie opłat za znak byłoby brutalne.
- Wielojęzyczne IVR i TTS dla agentów głosowych, warstwa głosowa zasilająca agenta głosowego dla restauracji lub systemy zastępujące agentów głosowych w call center.
- Audiobooki w długich przebiegach wsadowych, gdzie RTF jest ważniejsze niż opóźnienie.
- Dostępność i narracja czytników ekranowych w językach pomijanych przez dostawców chmurowych.
- Języki o niskiej zasobności, których ElevenLabs po prostu nie obsługuje.
- Praca on-premise i zgodna z HIPAA, gdzie audio nie może trafić na serwer strony trzeciej.
Ten ostatni punkt to cicha, zabójcza funkcja. Dla klienta z sektora ochrony zdrowia lub prawnego „audio nigdy nie opuszcza naszej maszyny” nie jest miłym dodatkiem, lecz całym powodem, dla którego chmurowy TTS zostaje wykluczony.
Zalety i wady OmniVoice (w tym do czego NIE służy)
OmniVoice zasługuje na uznanie, ale nie jest zamiennikiem ElevenLabs „plug-and-play” dla każdego zespołu. Zalety dotyczą wolności i zakresu; wady dotyczą dopracowania, opóźnień i operacyjnego ciężaru uruchamiania własnego modelu.
Zalety:
- Darmowy na licencji Apache-2.0, bez opłat za znak, bez limitów.
- 646 języków, w tym takie, których nie dotyka żaden główny dostawca chmurowy.
- Działa całkowicie lokalnie, Twoje dane zostają u Ciebie.
- Wysoka jakość klonowania wielojęzycznego (SIM-o 0,830) z 3-sekundowego klipu.
- Szybka przepustowość wsadowa (RTF ~0,03 w naszym teście).
Wady, szczerze limity:
- Nie został zaprojektowany do konwersacji w czasie rzeczywistym z opóźnieniami poniżej 300 ms.
- Mniej dopracowany i spójny niż najlepsze komercyjne głosy, takie jak ElevenLabs.
- Brak zarządzanego wsparcia lub SLA, jesteś zdany na zgłoszenia na GitHubie.
- Wymaga GPU (~8 GB VRAM); działanie na CPU jest około 3 razy wolniejsze.
- Mniejsza biblioteka gotowych głosów niż katalog ElevenLabs.
- Zgoda na klonowanie głosu i licencjonowanie są Twoją odpowiedzialnością prawną, a nie platformy.
Jeśli Twój produkt wymaga natychmiastowych, dopracowanych odpowiedzi podczas żywej rozmowy telefonicznej, OmniVoice jest dziś złym narzędziem. Jeśli generujesz audio wsadowo, w ponad 600 językach, na własnym sprzęcie, trudno go pokonać przy cenie równej zero.
Jak zacząć z OmniVoice
Uruchomienie OmniVoice wymaga jednej komendy instalacyjnej i kilku linii kodu Pythona, bez konta, klucza API czy konfiguracji billingowej. To praktyczna korzyść z modelu open-source: przechodzisz od zera do sklonowanego głosu w kilka minut, a nic, co wygenerujesz, nie opuszcza Twojej maszyny.
# Install (GPU build, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
# --extra-index-url https://download.pytorch.org/whl/cu128
from omnivoice import OmniVoice
model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")
audio = model.generate(
text="Hello, this is a test of zero-shot voice cloning.",
ref_audio="ref.wav", # ~3-6s reference clip
ref_text="Transcription of the reference audio.", # boosts clone fidelity
)
# audio -> np.ndarray at 24 kHzModele pobierają się automatycznie z HuggingFace przy pierwszym uruchomieniu. Nie chcesz pisać kodu? Uruchom interfejs Gradio za pomocą omnivoice-demo lub przetwarzaj pliki wsadowo za pomocą CLI omnivoice-infer-batch. Pełne notatki instalacyjne znajdują się w repozytorium GitHub.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji oraz pipeline'y głosowe/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stosie narzędzi LLM, z którego zespół Techsy faktycznie korzysta w produkcji. Połącz się na LinkedIn.
Często zadawane pytania
Czy OmniVoice jest darmowy do użytku komercyjnego?
Tak. OmniVoice jest wydawany na licencji Apache-2.0, która zezwala na użytkowanie komercyjne bez subskrypcji, opłat za znak czy limitów użytkowania. Możesz uruchamiać go na własnym sprzęcie do pracy dla klientów lub produktów wewnętrznych. Pamiętaj jednak, że każdy klonowany głos niesie ze sobą własne obowiązki związane ze zgodą i licencjonowaniem, oddzielne od licencji modelu.
Ile języków obsługuje OmniVoice?
OmniVoice obsługuje ponad 600 języków, z 646 wymienionymi na karcie modelu, wszystkie poprzez syntezę wielojęzyczną zero-shot. To około 20 razy więcej niż ~32 języki oferowane przez ElevenLabs. Szerokość jest jego największą przewagą, obejmując języki o niskiej zasobności, których główni komercyjni dostawcy TTS w chmurze obecnie w ogóle nie oferują.
Czy OmniVoice jest naprawdę tak dobry jak ElevenLabs?
To zależy od tego, co mierzysz. OmniVoice wygrywa pod względem liczby języków (646 vs ~32), kosztów (0 USD vs 5–330 USD/mies.), prywatności i podobieństwa mówcy w językach obcych (SIM-o 0,830 vs 0,655). ElevenLabs wygrywa pod względem dopracowania, spójności, opóźnień streamingu w czasie rzeczywistym, dużej biblioteki presetów głosów i wsparcia komercyjnego. Do wsadowej pracy wielojęzycznej OmniVoice jest naprawdę konkurencyjny; do live'owych, dopracowanych głosów ElevenLabs nadal prowadzi.
Jakie GPU potrzebuję do uruchomienia OmniVoice?
Około 8 GB VRAM w formacie fp16 wystarczy do komfortowego użytkowania, a model działa dobrze na kartach takich jak testowany przez nas RTX 4090. Możesz uruchomić go tylko na CPU, ale spodziewaj się około 3-krotnie wolniejszej syntezy. Do produkcyjnych obciążeń wsadowych k2-fsa zaleca 16 GB pamięci RAM systemu wraz z GPU posiadającym 8 GB lub więcej.
Czy OmniVoice potrafi sklonować głos?
Tak, OmniVoice wykonuje klonowanie głosu zero-shot z klipu referencyjnego mającego zaledwie 3 sekundy, bez konieczności treningu dla każdego głosu. Dla najlepszej wierności przekaż transkrypcję ref_text klipu wraz z audio. W naszym teście dodanie transkrypcji zauważalnie poprawiło stopień, w jakim wynik odpowiadał oryginalnemu mówcy.
Czy OmniVoice wystarcza do produkcyjnych agentów głosowych?
Jako warstwa TTS do dubbingu, promptów IVR lub dowolnego wstępnie generowanego audio – tak, jest gotowy do produkcji. Jako żywy głos w agencie konwersacyjnym w czasie rzeczywistym, wymagającym zmiany tur poniżej 300 ms – nie dzisiaj. Szybkość wsadowa RTF jest duża, ale opóźnienie streamingu nie jest jego mocną stroną. Używaj go tam, gdzie generujesz audio przed interakcją.
Czy OmniVoice działa całkowicie offline i on-premise?
Tak. Po początkowym pobraniu modelu z HuggingFace, OmniVoice działa całkowicie na Twojej maszynie, bez wysyłania danych na żadne zewnętrzne serwery. To sprawia, że jest idealny do środowisk wrażliwych na HIPAA, prawnych lub odizolowanych od sieci (air-gapped), gdzie API chmurowego TTS zostałoby wykluczone przez wymagania zgodności.
Jak OmniVoice wypada w porównaniu do Chatterbox lub Fish Audio?
Każdy z nich prowadzi w innej kategorii. Chatterbox-Turbo (Resemble AI) wygrywa ślepe testy jakości w języku angielskim, ale obsługuje tylko ten język. Fish Audio S2 Pro prowadzi w niezależnym rankingu EmergentTTS-Eval z ekspresyjnym outputem w ponad 80 językach. Przewagą OmniVoice jest sheer coverage językowe na poziomie 646 języków plus klonowanie zero-shot, co czyni go wyborem, gdy najważniejsza jest szerokość i użytkowanie on-premise.
Werdykt
OmniVoice jest najbardziej wiarygodną alternatywą dla ElevenLabs typu open source, jaką przetestowaliśmy, i jest darmowa. Po samodzielnym uruchomieniu v0.1.5 rekomendacja jest prosta: wybierz OmniVoice, jeśli potrzebujesz szerokiego pokrycia językowego, prywatności on-premise lub zerowego kosztu do wsadowej pracy z audio, i trzymaj się API chmurowego, jeśli dziś potrzebujesz dopracowanych, konwersacyjnych głosów w czasie rzeczywistym.
- Darmowy i otwarty na licencji Apache-2.0, bez opłat za znak.
- 646 języków i klonowanie zero-shot, daleko poza zasięg ElevenLabs.
- Lokalny i prywatny, idealny do pracy on-premise i zgodnej z przepisami.
- Nie do live'owej rozmowy z opóźnieniami poniżej 300 ms – to wciąż zadanie dla chmury.
Jeśli budujesz wielojęzyczny pipeline głosowy lub dubbingowy i potrzebujesz pomocy w wyborze odpowiedniego stosu technologicznego, umów bezpłatną konsultację – to rodzaj rzeczy, które konfigurujemy dla klientów co miesiąc.