
Abbiamo installato OmniVoice v0.1.5 di k2-fsa la scorsa settimana su una RTX 4090, gli abbiamo dato una clip di 6 secondi di una voce inglese e gli abbiamo chiesto di rileggere un paragrafo in tre lingue. Avvio a freddo: circa 14 secondi con il caricamento del modello. E le esecuzioni a caldo dopo? Intorno a RTF 0,03, vicino a 30 volte il tempo reale. La versione breve di questa recensione: sì, questo progetto open source è una vera alternativa open source a ElevenLabs per un certo tipo di utente, e no, non sostituirà per tutti un'API cloud rifinita. Vediamo chi è chi.
Punti chiave:
- OmniVoice è un TTS gratuito sotto Apache-2.0 di k2-fsa che copre 600+ lingue con clonazione vocale zero-shot.
- Nel nostro test ha raggiunto un RTF di ~0,03 su una RTX 4090; bastano circa 8 GB di VRAM.
- Batte ElevenLabs su lingue (646 contro ~32), costo (0 $ contro 5–330 $/mese) e privacy, non su rifinitura o streaming in tempo reale.
- Ideale per doppiaggio, lavoro on-premise e lingue poco diffuse; da evitare per agenti conversazionali sotto i 300 ms.
Cos'è OmniVoice (e perché conta)?
OmniVoice è un modello di sintesi vocale open source sotto Apache-2.0 di k2-fsa, il team di ricerca sul parlato dietro Kaldi e k2. È un TTS da 0,6 miliardi di parametri in stile modello linguistico a diffusione, gira in locale, copre 600+ lingue e clona voci in zero-shot. Conta perché, per la prima volta, un modello locale davvero gratuito si avvicina abbastanza a un servizio cloud a pagamento da rendere reale la scelta, non solo teorica.
Il repository (github.com/k2-fsa/OmniVoice) è intorno alle 7,1k stelle, e l'ultima versione è la v0.1.5 del 28 aprile 2026. Sotto il cofano è messo a punto a partire da Qwen3-0.6B-Base e produce audio a 24 kHz. Se hai letto la nostra panoramica dei migliori strumenti vocali IA, pensa a OmniVoice come all'estremità self-hosted di quello spettro, l'opzione a cui ricorri quando i dati non possono lasciare i tuoi server.
L'origine k2-fsa è la parte che la maggior parte degli articoli salta. Non è un progetto del fine settimana di un account anonimo. È la stessa stirpe che plasma il riconoscimento vocale aperto da oltre un decennio, una grande ragione per cui la qualità è già così buona così presto.
Le funzioni di OmniVoice in breve
OmniVoice racchiude l'insieme di funzioni che ti aspetteresti da una piattaforma a pagamento in un modello che scarichi una volta. I numeri principali, dalla sua scheda modello HuggingFace: 646 lingue, clonazione zero-shot da una clip di riferimento di ~3 secondi, e un RTF fino a 0,025, circa 40 volte più veloce del tempo reale.
Ecco cosa ottieni in concreto:
- Clonazione vocale da una clip breve, in zero-shot, senza addestramento per voce.
- Progettazione vocale per attributi: genere, età, tono, dialetto o accento, persino una modalità sussurro.
- Controllo fine con simboli non verbali e correzione della pronuncia per nomi difficili.
- Tre interfacce: un'interfaccia web Gradio (
omnivoice-demo), un'API Python con tre modalità di generazione e una CLI (omnivoice-infer). - Velocità: RTF in batch di 0,022, circa 60 secondi di audio in poco più di 1,3 secondi.
Sulla qualità, OmniVoice riporta un punteggio di similarità del parlante (SIM-o) di 0,830 contro lo 0,655 di ElevenLabs su test multilingue, e un tasso di errore sulle parole di appena 0,84 % sul set Seed-TTS cinese, battendo ElevenLabs v2 e MiniMax su quel benchmark. Con ~2,5 milioni di download al mese su HuggingFace, in tanti stanno mettendo alla prova queste affermazioni.
Cosa abbiamo visto eseguendo OmniVoice
Volevamo numeri veri, non promesse del repository, così lo abbiamo testato noi stessi. Abbiamo eseguito pip install omnivoice su una RTX 4090 (24 GB) a giugno 2026, preso una registrazione di riferimento inglese pulita di 6 secondi e generato un paragrafo di 60 secondi in inglese, turco e arabo, il tutto da quell'unico riferimento.
L'avvio a freddo, incluso il primo caricamento del modello, ha richiesto circa 14 secondi. Dopodiché le esecuzioni in batch a caldo si sono assestate intorno a un RTF di 0,03, quindi circa 30 volte il tempo reale sulla nostra macchina, un filo più lento dello 0,025 dichiarato dal repository ma vicino, e più che abbastanza veloce per il doppiaggio in batch. L'uso di VRAM è rimasto comodamente sotto quanto offriva la scheda da 24 GB; la raccomandazione di ~8 GB della scheda modello ha tenuto.
In termini di qualità, inglese e turco sono tornati puliti e naturali, con un timbro clonato chiaramente riconoscibile da un campione di sei secondi. L'arabo era solido sulle frasi corte, ma la prosodia diventava un po' piatta su quelle lunghe, comprensibile, solo meno espressiva. Un intoppo da segnalare: conviene passare ref_text (una trascrizione della clip di riferimento) per la migliore fedeltà di clonazione. Senza, la corrispondenza vocale deriva. Quando lo abbiamo provato con la trascrizione, la similarità è salita in modo evidente.
È il tipo di risultato che rende OmniVoice degno di uno sguardo serio per pipeline multilingue, con gli occhi aperti sui lati grezzi.
OmniVoice contro ElevenLabs: quanto sono diversi?
OmniVoice ed ElevenLabs risolvono lo stesso problema da estremi opposti. ElevenLabs è un'API cloud rifinita con un'enorme libreria di voci preimpostate e bassa latenza di streaming; OmniVoice è un modello locale gratuito con 20 volte più copertura linguistica e costo zero per carattere. La scelta giusta dipende dal fatto che tu valuti controllo e privacy oppure comodità e rifinitura.
| Dimensione | OmniVoice | ElevenLabs |
|---|---|---|
| Lingue | 646 | ~32 |
| Costo | 0 $ (Apache-2.0) | 5–330 $/mese, per carattere |
| Hosting | Locale / offline | Solo cloud |
| Latenza | RTF in batch ~0,03 (veloce) | Bassa latenza di streaming |
| Libreria voci | DIY / cloni la tua | Grande libreria preimpostata |
| Clonazione voce | Zero-shot, autogestita | Consenso gestito dalla piattaforma |
| Supporto | Community / GitHub | SLA commerciale |
| Qualità multilingue | SIM-o 0,830 | SIM-o 0,655, più rifinita/coerente |
Se stai stimando uno stack vocale per un agente vocale IA, questa tabella cambia in fretta i conti, soprattutto su scala dove la fatturazione a carattere di ElevenLabs si accumula (lo abbiamo scomposto nella nostra guida ai prezzi degli agenti vocali IA). Il verdetto onesto: ElevenLabs è più coerente e più facile; OmniVoice è più economico, più privato e molto più multilingue.
Come si confronta OmniVoice con altri modelli TTS open source?
OmniVoice non è l'unico contendente open source, e non vince ogni categoria. Ha di gran lunga la copertura linguistica più ampia, ma Chatterbox vince i test alla cieca in inglese, Fish Audio guida la classifica indipendente EmergentTTS-Eval, e Kokoro è più veloce se non ti serve la clonazione. Ecco il campo onesto.

| Modello | Produttore | Parametri | Lingue | Clonazione | Punto di forza | Scegli questo se… |
|---|---|---|---|---|---|---|
| OmniVoice | k2-fsa | 0,6B | 646 | Zero-shot, 3s | Copertura linguistica più ampia | Ti servono molte lingue o l'on-premise |
| Chatterbox-Turbo | Resemble AI | 350M | Solo inglese | Sì | Preferito al 65,3 % nel test alla cieca vs ElevenLabs (24,5 %) | Ti serve solo l'inglese e vuoi la massima qualità |
| Fish Audio S2 Pro | Fish Audio | n/d | 80+ | Sì | 1° su EmergentTTS-Eval (81,88 % di vittorie) | Vuoi output espressivo al vertice dei benchmark |
| Qwen3-TTS-0.6B | Alibaba | 0,6B | 10 | No | 97 ms di latenza in streaming | Ti serve bassa latenza in streaming |
| Kokoro | Open source | 82M | Orientato all'inglese | No (54 preset) | 210 volte il tempo reale su una RTX 4090 | Vuoi velocità massima, senza clonazione |
La maggior parte di questi modelli gira in 4–8 GB di VRAM in fp16, quindi l'hardware non è il fattore decisivo, lo è il caso d'uso. Teniamo aggiornata la lista nella nostra panoramica dei migliori strumenti vocali IA.
Quando dovresti davvero usare OmniVoice?
OmniVoice brilla ovunque l'ampiezza linguistica, il costo o il controllo dei dati superino il bisogno di un'API cloud rifinita. È un cavallo da lavoro per il batch, non un motore conversazionale in tempo reale, quindi abbinalo a compiti in cui generi l'audio in anticipo o esegui sul tuo hardware.
- Doppiaggio video in decine di lingue da un'unica voce di riferimento, il flusso di doppiaggio video IA dove la fatturazione a carattere sarebbe brutale.
- IVR multilingue e TTS di agenti vocali, lo strato vocale dietro un agente vocale per ristoranti o quel tipo di sistemi che sostituiscono gli agenti dei call center.
- Audiolibri in lunghe esecuzioni in batch dove l'RTF conta più della latenza.
- Accessibilità e narrazione per screen reader in lingue che i fornitori cloud ignorano.
- Lingue poco diffuse che ElevenLabs semplicemente non copre.
- Lavoro on-premise e sensibile al GDPR dove l'audio non può toccare un server di terzi.
Quest'ultimo è la funzione decisiva e silenziosa. Per un cliente sanitario o legale, "l'audio non lascia mai la nostra macchina" non è un vezzo, è l'intera ragione per cui un TTS cloud viene escluso.
Pro e contro di OmniVoice (incluso ciò per cui NON è adatto)
OmniVoice si guadagna le sue stelle, ma non è un sostituto immediato di ElevenLabs per ogni team. I pro riguardano libertà e ampiezza; i contro riguardano rifinitura, latenza e il peso operativo di far girare un modello proprio.
Pro:
- Gratuito sotto Apache-2.0, nessuna fatturazione a carattere, nessun limite.
- 646 lingue, comprese alcune che nessun grande fornitore cloud tocca.
- Gira interamente in locale, i tuoi dati restano dove sono.
- Forte qualità di clonazione multilingue (SIM-o 0,830) da una clip di 3 secondi.
- Throughput in batch veloce (RTF ~0,03 nel nostro test).
Contro, i limiti onesti:
- Non è costruito per il conversazionale in tempo reale sotto i 300 ms.
- Meno rifinito e coerente delle migliori voci commerciali come ElevenLabs.
- Nessun supporto gestito né SLA, ti affidi alle issue di GitHub.
- Richiede una GPU (~8 GB di VRAM); su CPU gira circa 3 volte più lento.
- Libreria di voci preimpostate più piccola del catalogo di ElevenLabs.
- Consenso e licenza delle voci clonate sono una tua responsabilità legale, non della piattaforma.
Se il tuo prodotto ha bisogno di risposte immediate e rifinite dentro una telefonata dal vivo, OmniVoice oggi è lo strumento sbagliato. Se generi audio in batch, in oltre 600 lingue, sul tuo hardware, è difficile da battere al prezzo del gratis.
Come iniziare con OmniVoice
Mettere in moto OmniVoice richiede un comando di installazione e poche righe di Python, niente account, niente chiave API, niente configurazione di fatturazione. È il vantaggio pratico di un modello open source: passi da zero a una voce clonata in pochi minuti, e nulla di ciò che generi lascia la tua macchina.
# Installazione (build GPU, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
# --extra-index-url https://download.pytorch.org/whl/cu128
from omnivoice import OmniVoice
model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")
audio = model.generate(
text="Hello, this is a test of zero-shot voice cloning.",
ref_audio="ref.wav", # clip di riferimento ~3-6s
ref_text="Transcription of the reference audio.", # aumenta la fedeltà del clone
)
# audio -> np.ndarray a 24 kHzI modelli vengono scaricati automaticamente da HuggingFace al primo avvio. Preferisci non scrivere codice? Avvia l'interfaccia Gradio con omnivoice-demo, oppure elabora i file in batch con la CLI omnivoice-infer-batch. Le note complete di installazione si trovano nel repository GitHub.
Informazioni sull'autore
Mert Batur è co-fondatore di Techsy.io, dove il team realizza agenti IA, sistemi di automazione e pipeline voce/SDR per clienti B2B. Scrive dello stack di strumenti LLM che il team Techsy usa davvero in produzione. Collega su LinkedIn.
Domande frequenti
OmniVoice è gratuito per uso commerciale?
Sì. OmniVoice è rilasciato sotto licenza Apache-2.0, che consente l'uso commerciale senza abbonamento, senza tariffe a carattere e senza limiti di utilizzo. Puoi eseguirlo sul tuo hardware per lavoro con clienti o prodotti interni. Ricorda solo che ogni voce che cloni porta con sé obblighi propri di consenso e licenza, distinti dalla licenza del modello.
Quante lingue supporta OmniVoice?
OmniVoice supporta 600+ lingue, con 646 citate sulla sua scheda modello, tutte tramite sintesi multilingue zero-shot. È circa 20 volte le ~32 lingue di ElevenLabs. L'ampiezza è il suo vantaggio maggiore, con copertura di lingue poco diffuse che i grandi fornitori commerciali di TTS cloud oggi non offrono affatto.
OmniVoice è davvero buono come ElevenLabs?
Dipende da cosa misuri. OmniVoice vince su lingue (646 contro ~32), costo (0 $ contro 5–330 $/mese), privacy e similarità del parlante multilingue (SIM-o 0,830 contro 0,655). ElevenLabs vince su rifinitura, coerenza, latenza di streaming in tempo reale, la sua grande libreria di voci preimpostate e il supporto commerciale. Per il multilingue in batch, OmniVoice è davvero competitivo; per voci dal vivo e rifinite, ElevenLabs è ancora avanti.
Quale GPU serve per eseguire OmniVoice?
Circa 8 GB di VRAM in fp16 bastano per un uso comodo, e il modello gira bene su schede come la RTX 4090 che abbiamo testato. Puoi eseguirlo solo su CPU, ma aspettati una sintesi circa 3 volte più lenta. Per carichi di produzione in batch, k2-fsa raccomanda 16 GB di RAM di sistema accanto a una GPU con 8 GB o più.
OmniVoice può clonare una voce?
Sì, OmniVoice esegue la clonazione vocale zero-shot da una clip di riferimento anche di soli 3 secondi, senza addestramento per voce. Per la migliore fedeltà, passa una trascrizione ref_text della clip insieme all'audio. Nel nostro test, aggiungere la trascrizione ha migliorato in modo evidente quanto l'output rimanesse vicino al parlante originale.
OmniVoice è abbastanza buono per agenti vocali in produzione?
Come strato TTS per doppiaggio, messaggi IVR o qualsiasi audio pre-generato, sì, è pronto per la produzione. Come voce dal vivo in un agente conversazionale in tempo reale che richiede turni sotto i 300 ms, oggi no, l'RTF in batch è veloce ma la latenza di streaming non è il suo forte. Usalo dove generi l'audio prima dell'interazione.
OmniVoice gira completamente offline e on-premise?
Sì. Dopo il download iniziale del modello da HuggingFace, OmniVoice gira interamente sulla tua macchina, senza inviare dati ad alcun server esterno. Questo lo rende una scelta solida per ambienti sensibili al GDPR, legali o isolati, dove un'API TTS cloud verrebbe esclusa dai requisiti di conformità.
Come si confronta OmniVoice con Chatterbox o Fish Audio?
Ciascuno guida una categoria diversa. Chatterbox-Turbo (Resemble AI) vince i test di qualità alla cieca in inglese ma è solo inglese. Fish Audio S2 Pro guida la classifica indipendente EmergentTTS-Eval con output espressivo su 80+ lingue. Il vantaggio di OmniVoice è la pura copertura linguistica di 646, più la clonazione zero-shot, il che lo rende la scelta quando ampiezza e uso on-premise contano di più.
Il verdetto
OmniVoice è la più credibile alternativa open source a ElevenLabs che abbiamo testato, ed è gratuita. Dopo aver eseguito noi stessi la v0.1.5, la raccomandazione è semplice: scegli OmniVoice se ti servono molte lingue, privacy on-premise o costo zero per audio in batch, e resta su un'API cloud se oggi ti servono voci rifinite, in tempo reale e conversazionali.
- Gratuito e open source sotto Apache-2.0, nessuna fatturazione a carattere.
- 646 lingue e clonazione zero-shot, ben oltre ElevenLabs.
- Locale e privato, ideale per on-premise e lavoro vincolato alla conformità.
- Non per conversazione dal vivo sotto i 300 ms, quello resta un compito da cloud.
Se stai costruendo una pipeline vocale o di doppiaggio multilingue e vuoi aiuto nello scegliere lo stack giusto, richiedi una consulenza gratuita, è il genere di cosa che impostiamo per i clienti ogni mese.