ai-machine-learning

OmniVoice İncelemesi: ElevenLabs'in Açık Kaynak Rakibini Test Ettik (600+ Dil)

Yazan Mert Batur
Jun 5, 2026
10 okuma
OmniVoice İncelemesi: ElevenLabs'in Açık Kaynak Rakibini Test Ettik (600+ Dil)

Geçen hafta k2-fsa'nın OmniVoice v0.1.5 sürümünü bir RTX 4090 üzerine kurduk, ona İngilizce bir sesin 6 saniyelik klibini verdik ve bir paragrafı üç dilde okumasını istedik. Soğuk başlangıç: model yüklemesiyle birlikte yaklaşık 14 saniye. Peki sonraki sıcak çalıştırmalar? Aşağı yukarı RTF 0,03, gerçek zamanın neredeyse 30 katı. Bu incelemenin kısa hâli şu: evet, bu açık kaynak proje belirli bir kullanıcı tipi için gerçek bir ElevenLabs açık kaynak alternatifi, ve hayır, herkes için cilalı bir bulut API'sinin yerini tutmaz. Kimin kim olduğuna bakalım.

Önemli noktalar:

  • OmniVoice, k2-fsa'nın Apache-2.0 lisanslı, 600+ dili sıfır atış ses klonlamayla kapsayan ücretsiz bir TTS modelidir.
  • Testimizde RTX 4090 üzerinde RTF ~0,03'e ulaştı; yaklaşık 8 GB VRAM yeterli.
  • Diller (646'ya karşı ~32), maliyet (0 $'a karşı ayda 5–330 $) ve gizlilik konusunda ElevenLabs'i geçiyor; cila ve gerçek zamanlı akış konusunda değil.
  • Dublaj, yerinde (on-premise) iş ve az kaynaklı diller için en iyisi; 300 ms altı sohbet ajanları için tercih etmeyin.

OmniVoice Nedir (ve Neden Önemli)?

OmniVoice, Kaldi ve k2'nin arkasındaki konuşma araştırma ekibi k2-fsa'dan gelen, Apache-2.0 lisanslı açık kaynak bir metin okuma modelidir. Yerel çalışan, 600+ dili kapsayan ve sesleri sıfır atışla klonlayan, difüzyon dil modeli tarzında 0,6 milyar parametreli bir TTS'tir. Önemli, çünkü ilk kez gerçekten ücretsiz bir yerel model, ücretli bir bulut hizmetine yeterince yaklaşıp tercihi teorik olmaktan çıkarıp gerçek kılıyor.

Depo (github.com/k2-fsa/OmniVoice) yaklaşık 7,1 bin yıldızda, ve en son sürüm 28 Nisan 2026 tarihli v0.1.5. Kaputun altında Qwen3-0.6B-Base üzerinden ince ayar yapılmış ve 24 kHz ses üretiyor. En iyi yapay zeka ses araçları derlememizi okuduysanız, OmniVoice'u o yelpazenin kendi kendine barındırılan ucu olarak düşünün; verilerin sunucularınızdan çıkamayacağı durumlarda başvurduğunuz seçenek.

k2-fsa kökeni, çoğu yazının atladığı kısım. Bu, anonim bir hesabın hafta sonu projesi değil. Açık konuşma tanımayı on yıldan uzun süredir biçimlendiren aynı soydan geliyor; kalitenin bu kadar erken bu kadar iyi olmasının büyük bir nedeni de bu.

OmniVoice Özelliklerine Bir Bakış

OmniVoice, ücretli bir platformdan beklediğiniz özellik setini bir kez indirdiğiniz bir modele sığdırıyor. HuggingFace model kartından öne çıkan sayılar: 646 dil, ~3 saniyelik referans klibinden sıfır atış klonlama, ve 0,025'e kadar inen bir RTF, gerçek zamandan yaklaşık 40 kat hızlı.

İşte somut olarak elde ettikleriniz:

  • Kısa bir klipten, sıfır atışla, ses başına eğitim gerekmeden ses klonlama.
  • Niteliklere göre ses tasarımı: cinsiyet, yaş, perde, lehçe veya aksan, hatta bir fısıltı modu.
  • Sözel olmayan sembollerle ve zor adlar için telaffuz düzeltmesiyle ince denetim.
  • Üç arayüz: bir Gradio web arayüzü (omnivoice-demo), üç üretim moduyla bir Python API'si ve bir CLI (omnivoice-infer).
  • Hız: 0,022'lik toplu RTF, yaklaşık 60 saniyelik sesi 1,3 saniye civarında üretir.

Kalitede OmniVoice, çok dilli testlerde ElevenLabs'in 0,655'ine karşı 0,830 konuşmacı benzerliği (SIM-o) puanı ve Seed-TTS Çince setinde yalnızca %0,84 kelime hata oranı bildiriyor; bu kıyaslamada ElevenLabs v2 ve MiniMax'i geçiyor. HuggingFace'te ayda ~2,5 milyon indirmeyle pek çok kişi bu iddiaları zorluyor.

OmniVoice'u Çalıştırınca Ne Gördük

Depo iddiaları değil, gerçek sayılar istedik, bu yüzden kendimiz test ettik. Haziran 2026'da bir RTX 4090 (24 GB) üzerinde pip install omnivoice çalıştırdık, temiz 6 saniyelik İngilizce bir referans kaydı aldık ve bu tek referanstan İngilizce, Türkçe ve Arapça olarak 60 saniyelik bir paragraf ürettik.

İlk model yüklemesi dâhil soğuk başlangıç yaklaşık 14 saniye sürdü. Sonrasında sıcak toplu çalıştırmalar RTF 0,03 civarına oturdu, yani makinemizde gerçek zamanın yaklaşık 30 katı; deponun 0,025'lik manşet değerinden bir nebze yavaş ama yakın, ve toplu dublaj için fazlasıyla hızlı. VRAM kullanımı 24 GB'lık kartın sunduğunun rahatça altında kaldı; model kartının ~8 GB önerisi tuttu.

Kalite açısından İngilizce ve Türkçe temiz ve doğal döndü; klonlanan tını altı saniyelik bir örnekten açıkça tanınabiliyordu. Arapça kısa cümlelerde sağlamdı ama uzunlarda tonlama biraz düzleşti; anlaşılır, sadece daha az ifade gücü olan. Belirtmeye değer bir tuzak: en iyi klon doğruluğu için ref_text (referans klibinizin dökümünü) iletmek isteyeceksiniz. Onu atlarsanız ses eşleşmesi sapıyor. Dökümle denediğimizde benzerlik gözle görülür şekilde yükseldi.

Bu, OmniVoice'u çok dilli iş hatları için ciddi şekilde göz önüne almaya değer kılan türden bir sonuç; pürüzlü kenarlara gözünüz açık olmak kaydıyla.

OmniVoice ve ElevenLabs: Ne Kadar Farklılar?

OmniVoice ve ElevenLabs aynı sorunu zıt uçlardan çözüyor. ElevenLabs, devasa bir hazır ses kütüphanesi ve düşük akış gecikmesiyle cilalı bir bulut API'si; OmniVoice ise 20 kat daha fazla dil kapsamına ve karakter başına sıfır maliyete sahip ücretsiz yerel bir model. Doğru tercih, denetim ve gizliliğe mi yoksa kolaylık ve cilaya mı değer verdiğinize bağlı.

BoyutOmniVoiceElevenLabs
Diller646~32
Maliyet0 $ (Apache-2.0)Ayda 5–330 $, karakter başına
BarındırmaYerel / çevrimdışıYalnızca bulut
GecikmeToplu RTF ~0,03 (hızlı)Düşük akış gecikmesi
Ses kütüphanesiKendin yap / kendininkini klonlaBüyük hazır kütüphane
Ses klonlamaSıfır atış, kendi yönetiminizdePlatform denetimli onay
DestekTopluluk / GitHubTicari SLA
Çok dilli kaliteSIM-o 0,830SIM-o 0,655, daha cilalı/tutarlı

Bir yapay zeka sesli ajanı için ses yığınının maliyetini çıkarıyorsanız, bu tablo hesabı hızla değiştirir; özellikle ElevenLabs'in karakter başına faturalamasının biriktiği büyük ölçekte (bunu yapay zeka sesli ajan fiyatları rehberimizde ayrıntılandırdık). Dürüst karar: ElevenLabs daha tutarlı ve daha kolay; OmniVoice daha ucuz, daha gizli ve çok daha çok dilli.

OmniVoice Diğer Açık Kaynak TTS Modelleriyle Nasıl Kıyaslanır?

OmniVoice tek açık kaynak aday değil ve her kategoriyi kazanmıyor. Açık ara en geniş dil kapsamına sahip, ama İngilizce kör testleri Chatterbox kazanıyor, bağımsız EmergentTTS-Eval sıralamasının başını Fish Audio çekiyor, ve klonlamaya ihtiyacınız yoksa Kokoro daha hızlı. İşte dürüst tablo.

OmniVoice ile ElevenLabs, Chatterbox, Fish Audio ve Qwen3-TTS'in dil sayısı ve ses benzerliğine göre karşılaştırması
Beş açık kaynak TTS modelinin dil kapsamı ve konuşmacı benzerliğine göre karşılaştırması

ModelÜreticiParametreDillerKlonlamaÖne çıkanŞunu seçin…
OmniVoicek2-fsa0,6B646Sıfır atış, 3sEn geniş dil kapsamıÇok dil veya yerinde kurulum gerekiyorsa
Chatterbox-TurboResemble AI350MYalnızca İngilizceEvetKör testte ElevenLabs'e (%24,5) karşı %65,3 tercihYalnızca İngilizce ve en üst kalite istiyorsanız
Fish Audio S2 ProFish Audioyok80+EvetEmergentTTS-Eval'de 1. (%81,88 kazanma)Kıyaslama lideri, ifadeli çıktı istiyorsanız
Qwen3-TTS-0.6BAlibaba0,6B10Hayır97 ms akış gecikmesiDüşük akış gecikmesi gerekiyorsa
KokoroAçık kaynak82Mİngilizce odaklıHayır (54 hazır ayar)RTX 4090'da gerçek zamanın 210 katıKlonlama olmadan azami hız istiyorsanız

Bu modellerin çoğu fp16'da 4–8 GB VRAM'de çalışır, yani belirleyici etken donanım değil, kullanım senaryosu. Güncel listeyi en iyi yapay zeka ses araçları derlememizde tutuyoruz.

OmniVoice'u Gerçekte Ne Zaman Kullanmalısınız?

OmniVoice, dil genişliği, maliyet veya veri denetiminin cilalı bir bulut API'sine olan ihtiyacı geçtiği her yerde parlar. Gerçek zamanlı bir sohbet motoru değil, toplu işin yük beygiri; bu yüzden onu sesi önceden ürettiğiniz veya kendi donanımınızda çalıştırdığınız işlerle eşleştirin.

  • Tek bir referans sesten onlarca dile video dublajı, karakter başına faturalamanın acımasız olacağı yapay zeka video dublaj iş akışı.
  • Çok dilli IVR ve sesli ajan TTS'i, bir restoran sesli ajanını ya da çağrı merkezlerinin yerini alan sistemleri besleyen ses katmanı.
  • Gecikmenin değil RTF'nin önemli olduğu uzun toplu çalıştırmalarda sesli kitaplar.
  • Bulut sağlayıcılarının atladığı dillerde erişilebilirlik ve ekran okuyucu anlatımı.
  • ElevenLabs'in basitçe kapsamadığı az kaynaklı diller.
  • Sesin üçüncü taraf bir sunucuya dokunamayacağı yerinde ve KVKK'ya duyarlı işler.

Sonuncusu sessiz ama belirleyici özellik. Sağlık veya hukuk alanından bir müşteri için "ses asla makinemizden çıkmaz" bir lüks değil, bir bulut TTS'inin elenmesinin tam sebebidir.

OmniVoice Artıları ve Eksileri (Neye UYGUN OLMADIĞI Dâhil)

OmniVoice yıldızlarını hak ediyor, ama her ekip için doğrudan bir ElevenLabs ikamesi değil. Artılar özgürlük ve genişlikle, eksiler cila, gecikme ve kendi modelinizi çalıştırmanın işletme yüküyle ilgili.

Artılar:

  • Apache-2.0 altında ücretsiz, karakter başına faturalama yok, sınır yok.
  • 646 dil, hiçbir büyük bulut sağlayıcının dokunmadığı bazıları dâhil.
  • Tamamen yerel çalışır, verileriniz olduğu yerde kalır.
  • 3 saniyelik klipten güçlü çok dilli klon kalitesi (SIM-o 0,830).
  • Hızlı toplu işlem hacmi (testimizde RTF ~0,03).

Eksiler, dürüst sınırlar:

  • 300 ms altı gerçek zamanlı sohbet için kurulmadı.
  • ElevenLabs gibi en iyi ticari seslerden daha az cilalı ve tutarlı.
  • Yönetilen destek veya SLA yok, GitHub sorunlarına bağlısınız.
  • Bir GPU gerektirir (~8 GB VRAM); CPU yaklaşık 3 kat daha yavaş çalışır.
  • ElevenLabs'in kataloğundan daha küçük hazır ses kütüphanesi.
  • Klonlanan seslerin onayı ve lisansı platformun değil, sizin yasal sorumluluğunuzdur.

Ürününüz canlı bir telefon görüşmesinde anında, cilalı yanıtlara ihtiyaç duyuyorsa, OmniVoice bugün yanlış araç. Sesi toplu hâlde, 600'den fazla dilde, kendi donanımınızda üretiyorsanız, ücretsiz fiyatına yenmesi zor.

OmniVoice'a Nasıl Başlanır

OmniVoice'u çalıştırmak bir kurulum komutu ve birkaç satır Python alır; hesap yok, API anahtarı yok, faturalama kurulumu yok. Açık kaynak bir modelin pratik kazancı budur: dakikalar içinde sıfırdan klonlanmış bir sese geçersiniz ve ürettiğiniz hiçbir şey makinenizden çıkmaz.

python
# Kurulum (GPU derlemesi, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
#   --extra-index-url https://download.pytorch.org/whl/cu128

from omnivoice import OmniVoice

model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")

audio = model.generate(
    text="Hello, this is a test of zero-shot voice cloning.",
    ref_audio="ref.wav",                       # ~3-6s referans klibi
    ref_text="Transcription of the reference audio.",  # klon doğruluğunu artırır
)
# audio -> 24 kHz'de np.ndarray

Modeller ilk çalıştırmada HuggingFace üzerinden otomatik indirilir. Kod yazmak istemiyor musunuz? omnivoice-demo ile Gradio arayüzünü başlatın veya omnivoice-infer-batch CLI'siyle dosyaları toplu işleyin. Tam kurulum notları GitHub deposunda yer alır.

Yazar Hakkında

Mert Batur, ekibin B2B müşterileri için yapay zeka ajanları, otomasyon sistemleri ve ses/SDR iş hatları geliştirdiği Techsy.io'nun kurucu ortağıdır. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor. LinkedIn üzerinden bağlantı kurun.

Sıkça Sorulan Sorular

OmniVoice ticari kullanım için ücretsiz mi?

Evet. OmniVoice, abonelik, karakter başına ücret ve kullanım sınırı olmadan ticari kullanıma izin veren Apache-2.0 lisansı altında yayımlanır. Müşteri işleri veya iç ürünler için kendi donanımınızda çalıştırabilirsiniz. Yalnızca, klonladığınız her sesin model lisansından ayrı kendi onay ve lisans yükümlülüklerini taşıdığını unutmayın.

OmniVoice kaç dili destekliyor?

OmniVoice, model kartında 646 olarak belirtilen 600+ dili, tamamı sıfır atış çok dilli sentezle destekler. Bu, ElevenLabs'in ~32 dilinin yaklaşık 20 katıdır. Genişlik en büyük avantajıdır; büyük ticari bulut TTS sağlayıcılarının bugün hiç sunmadığı az kaynaklı dilleri kapsar.

OmniVoice gerçekten ElevenLabs kadar iyi mi?

Neyi ölçtüğünüze bağlı. OmniVoice diller (646'ya karşı ~32), maliyet (0 $'a karşı ayda 5–330 $), gizlilik ve çok dilli konuşmacı benzerliği (SIM-o 0,830'a karşı 0,655) konusunda kazanır. ElevenLabs cila, tutarlılık, gerçek zamanlı akış gecikmesi, büyük hazır ses kütüphanesi ve ticari destekte kazanır. Toplu çok dilli iş için OmniVoice gerçekten rekabetçi; canlı, cilalı sesler için ElevenLabs hâlâ önde.

OmniVoice'u çalıştırmak için hangi GPU gerekir?

Rahat kullanım için fp16'da yaklaşık 8 GB VRAM yeterli ve model test ettiğimiz RTX 4090 gibi kartlarda iyi çalışıyor. Yalnızca CPU'da çalıştırabilirsiniz, ama yaklaşık 3 kat daha yavaş sentez bekleyin. Toplu üretim yükleri için k2-fsa, 8 GB veya üzeri bir GPU'nun yanında 16 GB sistem belleği öneriyor.

OmniVoice bir sesi klonlayabilir mi?

Evet, OmniVoice yalnızca 3 saniye kadar kısa bir referans klibinden, ses başına eğitim gerekmeden sıfır atış ses klonlaması yapar. En iyi doğruluk için klibin bir ref_text dökümünü sesle birlikte iletin. Testimizde dökümü eklemek, çıktının orijinal konuşmacıya ne kadar yakın kaldığını gözle görülür şekilde iyileştirdi.

OmniVoice üretim sesli ajanları için yeterince iyi mi?

Dublaj, IVR anonsları veya önceden üretilmiş herhangi bir ses için TTS katmanı olarak, evet, üretime hazır. 300 ms altı sıra değişimi gerektiren gerçek zamanlı bir sohbet ajanında canlı ses olarak, bugün değil; toplu RTF hızlı ama akış gecikmesi güçlü yanı değil. Sesi etkileşimden önce ürettiğiniz yerlerde kullanın.

OmniVoice tamamen çevrimdışı ve yerinde çalışır mı?

Evet. HuggingFace'ten ilk model indirmesinden sonra OmniVoice tamamen kendi makinenizde çalışır, hiçbir veri harici bir sunucuya gönderilmez. Bu, bulut TTS API'sinin uyumluluk gereklilikleri yüzünden eleneceği KVKK'ya duyarlı, hukuki veya izole ortamlar için onu güçlü bir seçim yapar.

OmniVoice, Chatterbox veya Fish Audio ile nasıl kıyaslanır?

Her biri farklı bir kategorinin başını çeker. Chatterbox-Turbo (Resemble AI) İngilizce kör kalite testlerini kazanır ama yalnızca İngilizcedir. Fish Audio S2 Pro, 80+ dilde ifadeli çıktısıyla bağımsız EmergentTTS-Eval sıralamasının başını çeker. OmniVoice'un avantajı 646'lık salt dil kapsamı, artı sıfır atış klonlama; bu da genişlik ve yerinde kullanım en çok önem taşıdığında onu tercih yapar.

Karar

OmniVoice, test ettiğimiz en inandırıcı ElevenLabs açık kaynak alternatifi ve ücretsiz. v0.1.5'i kendimiz çalıştırdıktan sonra öneri basit: Toplu ses işi için çok sayıda dil, yerinde gizlilik veya sıfır maliyet istiyorsanız OmniVoice'u seçin; bugün cilalı, gerçek zamanlı, sohbet odaklı sesler istiyorsanız bir bulut API'sinde kalın.

  • Apache-2.0 altında ücretsiz ve açık kaynak, karakter başına faturalama yok.
  • ElevenLabs'in çok ötesinde 646 dil ve sıfır atış klonlama.
  • Yerel ve gizli, yerinde ve uyumluluğa bağlı işler için ideal.
  • 300 ms altı canlı sohbet için uygun değil, bu hâlâ bir bulut işi.

Çok dilli bir ses veya dublaj iş hattı kuruyorsanız ve doğru yığını seçmek için yardım istiyorsanız, ücretsiz danışmanlık alın; her ay müşteriler için kurduğumuz türden bir şey.

Etiketler

omnivoiceelevenlabs-acik-kaynak-alternatifimetin-okumases-klonlamatts

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.