
Đánh giá OmniVoice: Chúng tôi đã thử nghiệm đối thủ mã nguồn mở của ElevenLabs (hơn 600 ngôn ngữ)
Tuần trước, chúng tôi đã cài đặt OmniVoice v0.1.5 từ k2-fsa trên một card RTX 4090, cung cấp cho nó một đoạn âm thanh giọng tiếng Anh dài 6 giây và yêu cầu nó đọc lại một đoạn văn bằng ba ngôn ngữ khác nhau. Thời gian khởi động lạnh (cold start): khoảng 14 giây bao gồm cả thời gian tải mô hình. Các lần chạy sau khi mô hình đã được làm nóng (warm runs)? Tốc độ thời gian thực (RTF) khoảng 0.03, nhanh gấp gần 30 lần so với thời gian thực. Tóm tắt ngắn gọn về bài đánh giá này: đúng là dự án mã nguồn mở này là một giải pháp thay thế ElevenLabs mã nguồn mở thực sự cho một nhóm người dùng cụ thể, nhưng không, nó sẽ không thay thế một API đám mây chỉn chu cho tất cả mọi người. Hãy cùng tìm hiểu xem ai nên dùng nó.
Những điểm chính:
- OmniVoice là một công cụ chuyển văn bản thành giọng nói (TTS) miễn phí, giấy phép Apache-2.0 từ k2-fsa, hỗ trợ hơn 600 ngôn ngữ với khả năng sao chép giọng nói zero-shot (không cần huấn luyện trước).
- Trong bài kiểm tra của chúng tôi, nó đạt RTF ~0.03 trên RTX 4090; chỉ cần khoảng 8 GB VRAM là đủ để chạy.
- Nó vượt trội hơn ElevenLabs về số lượng ngôn ngữ (646 so với ~32), chi phí (0 USD so với 5–330 USD/tháng) và quyền riêng tư, nhưng chưa bằng về độ tinh tế hoặc phát trực tuyến thời gian thực.
- Phù hợp nhất cho lồng tiếng, xử lý tại chỗ (on-prem) và các ngôn ngữ ít tài nguyên; hãy bỏ qua nếu bạn cần tác nhân hội thoại có độ trễ dưới 300ms.
OmniVoice là gì (và tại sao nó quan trọng)?
OmniVoice là một mô hình chuyển văn bản thành giọng nói mã nguồn mở, giấy phép Apache-2.0 từ k2-fsa, đội ngũ nghiên cứu giọng nói đứng sau Kaldi và k2. Đây là một mô hình TTS kiểu mô hình ngôn ngữ khuếch tán (diffusion-language-model) với 0.6 tỷ tham số, chạy cục bộ, hỗ trợ hơn 600 ngôn ngữ và sao chép giọng nói theo phương thức zero-shot. Điều này quan trọng vì, lần đầu tiên, một mô hình cục bộ hoàn toàn miễn phí đạt đến mức đủ gần với một dịch vụ đám mây trả phí để khiến sự đánh đổi trở nên thực tế, chứ không chỉ là lý thuyết.
Kho lưu trữ (github.com/k2-fsa/OmniVoice) hiện có khoảng 7.1k sao, và bản phát hành mới nhất là v0.1.5 vào ngày 28 tháng 4 năm 2026. Bên dưới lớp vỏ, nó được tinh chỉnh từ Qwen3-0.6B-Base và xuất ra âm thanh 24 kHz. Nếu bạn đã đọc bài tổng hợp của chúng tôi về các công cụ giọng nói AI tốt nhất, hãy coi OmniVoice như cực điểm tự lưu trữ (self-hosted) của phổ đó, lựa chọn bạn hướng đến khi dữ liệu không được rời khỏi máy chủ của mình.
Nguồn gốc từ k2-fsa là phần mà hầu hết các bài viết thường bỏ qua. Đây không phải là một dự án cuối tuần từ một tài khoản ẩn danh. Đây là cùng dòng dõi đã định hình lĩnh vực nhận dạng giọng nói mã nguồn mở trong hơn một thập kỷ, đó là lý do lớn khiến chất lượng đạt được mức độ này ngay từ giai đoạn sớm.
Tổng quan các tính năng của OmniVoice
OmniVoice tích hợp bộ tính năng mà bạn mong đợi từ một nền tảng trả phí vào một mô hình mà bạn chỉ cần tải xuống một lần. Những con số nổi bật, được lấy từ thẻ mô hình HuggingFace của nó: 646 ngôn ngữ, sao chép zero-shot từ một đoạn tham chiếu ~3 giây, và RTF thấp tới 0.025, nhanh gấp khoảng 40 lần so với thời gian thực.
Dưới đây là những gì bạn thực sự nhận được:
- Sao chép giọng nói từ một đoạn clip ngắn, zero-shot, không cần huấn luyện cho từng giọng.
- Thiết kế giọng nói dựa trên các thuộc tính: giới tính, độ tuổi, cao độ, phương ngữ hoặc accent, thậm chí có chế độ thì thầm.
- Kiểm soát chi tiết với các ký hiệu phi ngôn ngữ và hiệu chỉnh cách phát âm cho các tên khó.
- Ba giao diện: giao diện web Gradio (
omnivoice-demo), API Python với ba chế độ tạo và CLI (omnivoice-infer). - Tốc độ: RTF hàng loạt là 0.022, tạo ra khoảng 60 giây âm thanh trong khoảng 1.3 giây.
Về chất lượng, OmniVoice báo cáo điểm số tương đồng người nói (SIM-o) là 0.830 so với 0.655 của ElevenLabs trong các bài kiểm tra đa ngôn ngữ, và tỷ lệ lỗi từ (WER) chỉ là 0.84% trên bộ dữ liệu Seed-TTS tiếng Trung, vượt qua ElevenLabs v2 và MiniMax trong benchmark này. Với khoảng 2.5 triệu lượt tải xuống mỗi tháng trên HuggingFace, nhiều người đang kiểm chứng nghiêm túc những tuyên bố này.
Những gì chúng tôi thấy khi chạy OmniVoice
Chúng tôi muốn có con số thực tế, không chỉ là tuyên bố từ kho mã, nên đã tự mình thử nghiệm. Chúng tôi chạy pip install omnivoice trên một RTX 4090 (24 GB) vào tháng 6 năm 2026, lấy một bản ghi âm tham chiếu tiếng Anh sạch dài 6 giây và tạo ra một đoạn văn 60 giây bằng tiếng Anh, tiếng Thổ Nhĩ Kỳ và tiếng Ả Rập từ cùng một bản tham chiếu duy nhất đó.
Khởi động lạnh, bao gồm cả lần tải mô hình đầu tiên, mất khoảng 14 giây. Sau đó, các lần chạy hàng loạt khi mô hình đã nóng ổn định ở mức RTF 0.03, tức là nhanh gấp khoảng 30 lần thời gian thực trên máy của chúng tôi, chậm hơn một chút so với con số 0.025 được quảng bá nhưng vẫn rất gần, và đủ nhanh cho công việc lồng tiếng hàng loạt. Mức sử dụng VRAM nằm thoải mái trong giới hạn mà card 24 GB cung cấp; khuyến nghị ~8 GB từ thẻ mô hình là chính xác.
Về chất lượng, tiếng Anh và tiếng Thổ Nhĩ Kỳ cho kết quả sạch sẽ và tự nhiên, với âm sắc được sao chép dễ dàng nhận ra từ mẫu 6 giây. Tiếng Ả Rập ổn với các câu ngắn nhưng ngữ điệu hơi phẳng với các câu dài hơn, vẫn dễ hiểu nhưng không biểu cảm bằng. Một điểm cần lưu ý: bạn nên truyền ref_text (bản chép lời của đoạn clip tham chiếu) để có độ trung thực sao chép tốt nhất. Nếu bỏ qua, độ khớp giọng sẽ bị lệch. Khi chúng tôi thử với bản chép lời, độ tương đồng tăng lên đáng kể.
Đó là loại kết quả khiến OmniVoice đáng để xem xét nghiêm túc cho các quy trình đa ngôn ngữ, với cái nhìn thực tế về những điểm chưa hoàn thiện.
OmniVoice so với ElevenLabs: Khác biệt như thế nào?
OmniVoice và ElevenLabs giải quyết cùng một vấn đề nhưng từ hai hướng ngược nhau. ElevenLabs là một API đám mây chỉnchu với thư viện giọng nói cài sẵn khổng lồ và độ trễ phát trực tuyến thấp; OmniVoice là một mô hình cục bộ miễn phí với phạm vi ngôn ngữ gấp 20 lần và không tốn phí theo ký tự. Lựa chọn phù hợp phụ thuộc vào việc bạn coi trọng quyền kiểm soát và quyền riêng tư hay sự tiện lợi và độ hoàn thiện.
| Khía cạnh | OmniVoice | ElevenLabs |
|---|---|---|
| Ngôn ngữ | 646 | ~32 |
| Chi phí | 0 USD (Apache-2.0) | 5–330 USD/tháng, tính theo ký tự |
| Lưu trữ | Cục bộ / ngoại tuyến | Chỉ đám mây |
| Độ trễ | RTF hàng loạt ~0.03 (nhanh) | Độ trễ phát trực tuyến thấp |
| Thư viện giọng | Tự làm / sao chép giọng của bạn | Thư viện cài sẵn lớn |
| Sao chép giọng | Zero-shot, tự quản lý | Sự đồng ý bị kiểm soát bởi nền tảng |
| Hỗ trợ | Cộng đồng / GitHub | SLA thương mại |
| Chất lượng đa ngôn ngữ | SIM-o 0.830 | SIM-o 0.655, chỉn chu/nhất quán hơn |
Nếu bạn đang tính toán chi phí cho một ngăn xếp giọng nói cho một tác nhân giọng nói AI, bảng này thay đổi phép tính nhanh chóng, đặc biệt ở quy mô lớn nơi hóa đơn theo ký tự của ElevenLabs cộng dồn (chúng tôi đã phân tích điều đó trong hướng dẫn giá cả tác nhân giọng nói). Phán đoán trung thực: ElevenLabs nhất quán hơn và dễ sử dụng hơn; OmniVoice rẻ hơn, bảo mật hơn và đa ngôn ngữ hơn nhiều.
OmniVoice so với các mô hình TTS mã nguồn mở khác như thế nào?
OmniVoice không phải là ứng cử viên mã nguồn mở duy nhất, và nó không thắng ở mọi hạng mục. Nó có phạm vi ngôn ngữ rộng nhất, nhưng Chatterbox chiến thắng trong các bài kiểm tra mù tiếng Anh, Fish Audio đứng đầu bảng xếp hạng EmergentTTS-Eval độc lập, và Kokoro nhanh hơn nếu bạn không cần sao chép giọng. Dưới đây là bức tranh toàn cảnh trung thực.

| Mô hình | Nhà phát triển | Tham số | Ngôn ngữ | Sao chép | Điểm nổi bật | Chọn cái này nếu… |
|---|---|---|---|---|---|---|
| OmniVoice | k2-fsa | 0.6B | 646 | Zero-shot, 3s | Phạm vi ngôn ngữ rộng nhất | Bạn cần hỗ trợ ngôn ngữ rộng hoặc chạy tại chỗ |
| Chatterbox-Turbo | Resemble AI | 350M | Chỉ tiếng Anh | Có | 65.3% ưa thích mù so với ElevenLabs (24.5%) | Bạn chỉ cần tiếng Anh và muốn chất lượng tốt nhất |
| Fish Audio S2 Pro | Fish Audio | n/a | 80+ | Có | #1 trên EmergentTTS-Eval (tỷ lệ thắng 81.88%) | Bạn muốn đầu ra biểu cảm dẫn đầu benchmark |
| Qwen3-TTS-0.6B | Alibaba | 0.6B | 10 | Không | Độ trễ phát trực tuyến 97ms | Bạn cần phát trực tuyến độ trễ thấp |
| Kokoro | Mã nguồn mở | 82M | Tập trung tiếng Anh | Không (54 giọng cài sẵn) | Nhanh gấp 210 lần thời gian thực trên RTX 4090 | Bạn muốn tốc độ tối đa, không cần sao chép |
Hầu hết các mô hình này chạy trong 4–8 GB VRAM ở định dạng fp16, nên phần cứng không phải là yếu tố quyết định, mà là trường hợp sử dụng. Chúng tôi giữ danh sách cập nhật trong bài tổng hợp các công cụ giọng nói AI tốt nhất.
Khi nào bạn thực sự nên dùng OmniVoice?
OmniVoice tỏa sáng ở bất cứ đâu mà phạm vi ngôn ngữ, chi phí hoặc kiểm soát dữ liệu quan trọng hơn nhu cầu về một API đám mây chỉn chu. Nó là một cỗ máy xử lý hàng loạt, không phải động cơ hội thoại thời gian thực, vì vậy hãy phù hợp nó với các công việc mà bạn tạo âm thanh trước hoặc chạy trên phần cứng của riêng mình.
- Lồng tiếng video sang hàng chục ngôn ngữ từ một giọng tham chiếu, quy trình lồng tiếng video AI nơi giá theo ký tự sẽ rất đắt đỏ.
- TTS cho IVR đa ngôn ngữ và tác nhân giọng nói, lớp giọng nói cung cấp năng lượng cho tác nhân giọng nói nhà hàng hoặc loại hệ thống thay thế tác nhân giọng nói trung tâm cuộc gọi.
- Sách nói trong các lần chạy hàng loạt dài nơi RTF quan trọng hơn độ trễ.
- Khả năng tiếp cận và đọc màn hình bằng các ngôn ngữ mà nhà cung cấp đám mây bỏ qua.
- Ngôn ngữ ít tài nguyên mà ElevenLabs đơn giản là không hỗ trợ.
- Công việc tại chỗ (on-prem) và nhạy cảm với HIPAA nơi âm thanh không được chạm vào máy chủ bên thứ ba.
Điều cuối cùng là tính năng killer âm thầm. Đối với khách hàng y tế hoặc pháp lý, "âm thanh không bao giờ rời khỏi máy của chúng tôi" không phải là một tùy chọn thêm, mà là toàn bộ lý do khiến TTS đám mây bị loại trừ.
Ưu và nhược điểm của OmniVoice (bao gồm cả những gì nó KHÔNG dành cho)
OmniVoice xứng đáng với những ngôi sao của nó, nhưng nó không phải là sự thay thế trực tiếp cho ElevenLabs cho mọi đội nhóm. Các ưu điểm nằm ở sự tự do và phạm vi; các nhược điểm nằm ở độ hoàn thiện, độ trễ và gánh nặng vận hành khi chạy mô hình của riêng bạn.
Ưu điểm:
- Miễn phí theo giấy phép Apache-2.0, không tính phí theo ký tự, không giới hạn.
- 646 ngôn ngữ, bao gồm cả những ngôn ngữ mà không có nhà cung cấp đám mây lớn nào động đến.
- Chạy hoàn toàn cục bộ, dữ liệu của bạn được giữ nguyên.
- Chất lượng sao chép đa ngôn ngữ mạnh mẽ (SIM-o 0.830) từ một đoạn clip 3 giây.
- Thông lượng hàng loạt nhanh (RTF ~0.03 trong bài kiểm tra của chúng tôi).
Nhược điểm, những giới hạn trung thực:
- Không được xây dựng cho hội thoại thời gian thực với độ trễ dưới 300ms.
- Kém chỉn chu và nhất quán hơn so với các giọng thương mại hàng đầu như ElevenLabs.
- Không có hỗ trợ quản lý hoặc SLA, bạn phải dựa vào issues trên GitHub.
- Cần GPU (~8 GB VRAM); chạy CPU chậm hơn khoảng 3 lần.
- Thư viện giọng cài sẵn nhỏ hơn so với danh mục của ElevenLabs.
- Sự đồng ý và cấp phép cho giọng sao chép là trách nhiệm pháp lý của bạn, không phải của nền tảng.
Nếu sản phẩm của bạn cần phản hồi tức thì, chỉn chu trong một cuộc gọi điện thoại trực tiếp, OmniVoice là công cụ sai lầm vào lúc này. Nếu bạn đang tạo âm thanh theo lô, trên 600+ ngôn ngữ, trên phần cứng của riêng mình, thật khó để đánh bại nó ở mức giá miễn phí.
Cách bắt đầu với OmniVoice
Để chạy OmniVoice, bạn chỉ cần một lệnh cài đặt và vài dòng Python, không cần tài khoản, không cần khóa API, không cần thiết lập thanh toán. Đó là lợi ích thực tế của một mô hình mã nguồn mở: bạn đi từ con số 0 đến một giọng nói được sao chép trong vài phút, và không có gì bạn tạo ra rời khỏi máy của bạn.
# Install (GPU build, CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
# --extra-index-url https://download.pytorch.org/whl/cu128
from omnivoice import OmniVoice
model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")
audio = model.generate(
text="Hello, this is a test of zero-shot voice cloning.",
ref_audio="ref.wav", # ~3-6s reference clip
ref_text="Transcription of the reference audio.", # boosts clone fidelity
)
# audio -> np.ndarray at 24 kHzCác mô hình sẽ tự động được kéo từ HuggingFace trong lần chạy đầu tiên. Bạn không thích viết code? Khởi chạy giao diện Gradio với omnivoice-demo, hoặc xử lý hàng loạt tệp với CLI omnivoice-infer-batch. Ghi chú cài đặt đầy đủ nằm trong kho GitHub.
Về tác giả
Mert Batur Gurbuz là Đồng sáng lập Techsy.io, nơi đội ngũ phát triển các tác nhân AI, hệ thống tự động hóa và quy trình giọng nói/SDR cho khách hàng B2B. Anh ấy đang học tại Đại học Birmingham và viết về ngăn xếp công cụ LLM mà đội ngũ Techsy thực sự sử dụng trong sản xuất. Kết nối trên LinkedIn.
Câu hỏi thường gặp
OmniVoice có miễn phí để sử dụng thương mại không?
Có. OmniVoice được phát hành dưới giấy phép Apache-2.0, cho phép sử dụng thương mại mà không cần đăng ký, không phí theo ký tự và không giới hạn sử dụng. Bạn có thể chạy nó trên phần cứng của riêng mình cho công việc khách hàng hoặc sản phẩm nội bộ. Chỉ cần nhớ rằng bất kỳ giọng nào bạn sao chép đều mang theo các nghĩa vụ về sự đồng ý và cấp phép riêng, tách biệt với giấy phép của mô hình.
OmniVoice hỗ trợ bao nhiêu ngôn ngữ?
OmniVoice hỗ trợ hơn 600 ngôn ngữ, với 646 ngôn ngữ được trích dẫn trên thẻ mô hình của nó, tất cả thông qua tổng hợp đa ngôn ngữ zero-shot. Con số này gấp khoảng 20 lần so với ~32 ngôn ngữ của ElevenLabs. Phạm vi rộng là lợi thế lớn nhất của nó, bao phủ các ngôn ngữ ít tài nguyên mà các nhà cung cấp TTS đám mây thương mại lớn hoàn toàn không cung cấp hiện nay.
OmniVoice có thực sự tốt bằng ElevenLabs không?
Nó phụ thuộc vào những gì bạn đo lường. OmniVoice chiến thắng về ngôn ngữ (646 so với ~32), chi phí (0 USD so với 5–330 USD/tháng), quyền riêng tư và độ tương đồng người nói đa ngôn ngữ (SIM-o 0.830 so với 0.655). ElevenLabs chiến thắng về độ chỉn chu, tính nhất quán, độ trễ phát trực tuyến thời gian thực, thư viện giọng cài sẵn lớn và hỗ trợ thương mại. Đối với công việc đa ngôn ngữ hàng loạt, OmniVoice thực sự có tính cạnh tranh; đối với giọng nói trực tiếp, chỉn chu, ElevenLabs vẫn dẫn đầu.
Tôi cần GPU nào để chạy OmniVoice?
Khoảng 8 GB VRAM ở định dạng fp16 là đủ để sử dụng thoải mái, và mô hình chạy tốt trên các card như RTX 4090 mà chúng tôi đã thử nghiệm. Bạn có thể chạy nó chỉ bằng CPU, nhưng mong đợi tốc độ tổng hợp chậm hơn khoảng 3 lần. Đối với khối lượng công việc hàng loạt trong sản xuất, k2-fsa khuyến nghị 16 GB RAM hệ thống cùng với GPU có 8 GB trở lên.
OmniVoice có thể sao chép giọng nói không?
Có, OmniVoice thực hiện sao chép giọng nói zero-shot từ một đoạn clip tham chiếu ngắn tới 3 giây, không cần huấn luyện cho từng giọng. Để có độ trung thực tốt nhất, hãy truyền bản chép lời ref_text của đoạn clip cùng với âm thanh. Trong bài kiểm tra của chúng tôi, việc thêm bản chép lời đã cải thiện đáng kể mức độ khớp giữa đầu ra và người nói gốc.
OmniVoice có đủ tốt cho các tác nhân giọng nói sản xuất không?
Là lớp TTS cho lồng tiếng, lời nhắc IVR hoặc bất kỳ âm thanh được tạo trước nào, có, nó sẵn sàng cho sản xuất. Là giọng nói trực tiếp trong một tác nhân hội thoại thời gian thực cần chuyển lượt dưới 300ms, thì chưa, RTF hàng loạt nhanh nhưng độ trễ phát trực tuyến không phải là thế mạnh của nó. Hãy sử dụng nó ở nơi bạn tạo âm thanh trước tương tác.
OmniVoice có chạy hoàn toàn ngoại tuyến và tại chỗ không?
Có. Sau khi tải mô hình ban đầu từ HuggingFace, OmniVoice chạy hoàn toàn trên máy của bạn mà không gửi dữ liệu đến bất kỳ máy chủ bên ngoài nào. Điều này làm cho nó phù hợp mạnh mẽ cho các môi trường nhạy cảm với HIPAA, pháp lý hoặc cách ly mạng (air-gapped), nơi API TTS đám mây sẽ bị loại trừ bởi các yêu cầu tuân thủ.
OmniVoice so sánh với Chatterbox hoặc Fish Audio như thế nào?
Mỗi cái dẫn đầu một hạng mục khác nhau. Chatterbox-Turbo (Resemble AI) chiến thắng trong các bài kiểm tra chất lượng tiếng Anh mù nhưng chỉ hỗ trợ tiếng Anh. Fish Audio S2 Pro đứng đầu bảng xếp hạng EmergentTTS-Eval độc lập với đầu ra biểu cảm trên 80+ ngôn ngữ. Lợi thế của OmniVoice là phạm vi ngôn ngữ khổng lồ với 646 ngôn ngữ, cộng với sao chép zero-shot, khiến nó trở thành lựa chọn khi phạm vi và sử dụng tại chỗ quan trọng nhất.
Phán quyết cuối cùng
OmniVoice là giải pháp thay thế ElevenLabs mã nguồn mở đáng tin cậy nhất mà chúng tôi đã thử nghiệm, và nó miễn phí. Sau khi tự mình chạy v0.1.5, khuyến nghị rất đơn giản: chọn OmniVoice nếu bạn cần phạm vi ngôn ngữ rộng, quyền riêng tư tại chỗ hoặc chi phí bằng 0 cho công việc âm thanh hàng loạt, và gắn bó với API đám mây nếu bạn cần giọng nói chỉn chu, thời gian thực, hội thoại ngay hôm nay.
- Miễn phí và mở theo giấy phép Apache-2.0, không tính phí theo ký tự.
- 646 ngôn ngữ và sao chép zero-shot, vượt xa ElevenLabs.
- Cục bộ và riêng tư, lý tưởng cho công việc tại chỗ và bị ràng buộc bởi tuân thủ.
- Không dành cho hội thoại trực tiếp dưới 300ms, đó vẫn là việc của đám mây.
Nếu bạn đang xây dựng quy trình giọng nói hoặc lồng tiếng đa ngôn ngữ và cần giúp đỡ để chọn ngăn xếp phù hợp, nhận tư vấn miễn phí, đó là loại công việc chúng tôi thiết lập cho khách hàng mỗi tháng.