ai-machine-learning

مراجعة OmniVoice: اختبرنا بديل ElevenLabs مفتوح المصدر (أكثر من 600 لغة)

بقلم Mert Batur
Jun 5, 2026
10 قراءة
مراجعة OmniVoice: اختبرنا بديل ElevenLabs مفتوح المصدر (أكثر من 600 لغة)

ثبّتنا OmniVoice الإصدار v0.1.5 من k2-fsa الأسبوع الماضي على بطاقة RTX 4090، وأعطيناه مقطعاً مدته 6 ثوانٍ لصوت إنجليزي، وطلبنا منه قراءة فقرة بثلاث لغات. البدء البارد: نحو 14 ثانية مع تحميل النموذج. وماذا عن التشغيلات الدافئة بعد ذلك؟ نحو RTF 0.03، أي قرابة 30 ضعفاً للزمن الحقيقي. الخلاصة المختصرة لهذه المراجعة: نعم، هذا المشروع مفتوح المصدر هو بديل ElevenLabs مفتوح المصدر الحقيقي لفئة معينة من المستخدمين، ولا، لن يحلّ محل واجهة سحابية مصقولة لدى الجميع. دعونا نوضّح من هو من.

أبرز النقاط:

  • OmniVoice محرّك TTS مجاني برخصة Apache-2.0 من k2-fsa يغطي أكثر من 600 لغة مع استنساخ صوتي صفري اللقطة (zero-shot).
  • في اختبارنا بلغ RTF نحو 0.03 على بطاقة RTX 4090؛ نحو 8 غيغابايت من ذاكرة VRAM تكفي.
  • يتفوّق على ElevenLabs في اللغات (646 مقابل ~32) والتكلفة (0 دولار مقابل 5–330 دولاراً شهرياً) والخصوصية، لا في الصقل أو البثّ اللحظي.
  • الأفضل للدبلجة والعمل المحلي واللغات قليلة الموارد؛ تجنّبه لوكلاء المحادثة دون 300 مللي ثانية.

ما هو OmniVoice (ولماذا يهمّ)؟

OmniVoice نموذج تحويل نص إلى كلام مفتوح المصدر برخصة Apache-2.0 من k2-fsa، فريق أبحاث الكلام وراء Kaldi و k2. هو محرّك TTS بـ 0.6 مليار معامل على نمط نموذج لغوي انتشاري، يعمل محلياً، ويغطي أكثر من 600 لغة، ويستنسخ الأصوات صفري اللقطة. وهو يهمّ لأنه، للمرة الأولى، يقترب نموذج محلي مجاني فعلاً من خدمة سحابية مدفوعة بما يكفي ليصبح الاختيار حقيقياً لا نظرياً فحسب.

المستودع (github.com/k2-fsa/OmniVoice) عند نحو 7.1 ألف نجمة، وأحدث إصدار هو v0.1.5 بتاريخ 28 أبريل 2026. تحت الغطاء جرى ضبطه انطلاقاً من Qwen3-0.6B-Base وينتج صوتاً بتردد 24 كيلوهرتز. إن كنت قد قرأت جولتنا على أفضل أدوات الصوت بالذكاء الاصطناعي، فاعتبر OmniVoice الطرف المُستضاف ذاتياً من ذلك الطيف، الخيار الذي تلجأ إليه حين يتعذّر على البيانات مغادرة خوادمك.

أصل k2-fsa هو الجزء الذي تتخطّاه معظم المقالات. هذا ليس مشروع عطلة نهاية أسبوع من حساب مجهول. إنه السلالة نفسها التي صاغت التعرّف على الكلام المفتوح لأكثر من عقد، وهو سبب كبير لكون الجودة بهذا المستوى مبكراً.

نظرة سريعة على مزايا OmniVoice

يحزم OmniVoice مجموعة الميزات التي تتوقعها من منصة مدفوعة داخل نموذج تنزّله مرة واحدة. الأرقام الأبرز، من بطاقة النموذج على HuggingFace: 646 لغة، واستنساخ صفري اللقطة من مقطع مرجعي مدته نحو 3 ثوانٍ، و RTF ينخفض حتى 0.025، أي أسرع نحو 40 ضعفاً من الزمن الحقيقي.

إليك ما تحصل عليه فعلياً:

  • استنساخ الصوت من مقطع قصير، صفري اللقطة، دون تدريب لكل صوت.
  • تصميم الصوت حسب السمات: الجنس والعمر ودرجة الطبقة واللهجة أو اللكنة، وحتى وضع الهمس.
  • تحكّم دقيق عبر رموز غير لفظية وتصحيح النطق للأسماء الصعبة.
  • ثلاث واجهات: واجهة ويب Gradio (omnivoice-demo)، وواجهة برمجية بلغة Python بثلاثة أوضاع توليد، وواجهة سطر أوامر (omnivoice-infer).
  • السرعة: RTF دفعي قدره 0.022، أي نحو 60 ثانية من الصوت في قرابة 1.3 ثانية.

في الجودة، يبلّغ OmniVoice عن درجة تشابه متحدّث (SIM-o) قدرها 0.830 مقابل 0.655 لـ ElevenLabs في اختبارات متعددة اللغات، ومعدّل خطأ كلمات لا يتجاوز 0.84% على مجموعة Seed-TTS الصينية، متفوّقاً على ElevenLabs v2 و MiniMax في ذلك القياس. ومع نحو 2.5 مليون تنزيل شهرياً على HuggingFace، يضع كثيرون هذه الادعاءات على المحكّ.

ما رأيناه عند تشغيل OmniVoice

أردنا أرقاماً حقيقية لا ادعاءات المستودع، فاختبرناه بأنفسنا. شغّلنا pip install omnivoice على بطاقة RTX 4090 (24 غيغابايت) في يونيو 2026، وأخذنا تسجيلاً مرجعياً إنجليزياً نظيفاً مدته 6 ثوانٍ، وولّدنا فقرة مدتها 60 ثانية بالإنجليزية والتركية والعربية، كلها من ذلك المرجع الوحيد.

استغرق البدء البارد، بما في ذلك تحميل النموذج لأول مرة، نحو 14 ثانية. بعد ذلك استقرّت التشغيلات الدفعية الدافئة عند RTF 0.03، أي نحو 30 ضعفاً للزمن الحقيقي على جهازنا، أبطأ بقليل من رقم المستودع المعلن 0.025 لكنه قريب، وسريع أكثر من الكفاية للدبلجة الدفعية. بقي استهلاك VRAM دون ما توفّره بطاقة 24 غيغابايت بمساحة مريحة؛ وصمدت توصية بطاقة النموذج بنحو 8 غيغابايت.

من حيث الجودة، عادت الإنجليزية والتركية نظيفتين وطبيعيتين، مع نبرة مستنسَخة يمكن تمييزها بوضوح من عيّنة مدتها ست ثوانٍ. كانت العربية متينة في الجمل القصيرة، لكن التنغيم أصبح مسطّحاً قليلاً في الطويلة، مفهوماً، لكن أقلّ تعبيراً. وثمة مزلق يستحق الذكر: ستحتاج إلى تمرير ref_text (تفريغ نصّي لمقطعك المرجعي) لأفضل دقّة استنساخ. وإن تجاهلته انحرف تطابق الصوت. وحين جرّبناه مع التفريغ، قفز التشابه بشكل ملحوظ.

هذه نوعية النتائج التي تجعل OmniVoice جديراً بنظرة جادّة في مسارات العمل متعددة اللغات، مع إبقاء العين مفتوحة على الحواف الخشنة.

OmniVoice مقابل ElevenLabs: ما حجم الفارق؟

يحلّ OmniVoice و ElevenLabs المشكلة نفسها من طرفين متقابلين. ElevenLabs واجهة سحابية مصقولة بمكتبة ضخمة من الأصوات الجاهزة وزمن بثّ منخفض؛ أما OmniVoice فنموذج محلي مجاني بتغطية لغوية أكبر بعشرين ضعفاً وتكلفة صفرية لكل حرف. يعتمد الخيار الصحيح على ما إن كنت تقدّر التحكّم والخصوصية أم الراحة والصقل.

البُعدOmniVoiceElevenLabs
اللغات646~32
التكلفة0 دولار (Apache-2.0)5–330 دولاراً شهرياً، لكل حرف
الاستضافةمحلية / دون اتصالسحابية فقط
زمن الاستجابةRTF دفعي ~0.03 (سريع)زمن بثّ منخفض
مكتبة الأصواتاصنعها بنفسك / استنسخ صوتكمكتبة جاهزة كبيرة
استنساخ الصوتصفري اللقطة، بإدارتكموافقة تديرها المنصة
الدعمالمجتمع / GitHubاتفاقية مستوى خدمة تجارية
الجودة متعددة اللغاتSIM-o 0.830SIM-o 0.655، أكثر صقلاً/اتساقاً

إن كنت تحسب كلفة حزمة صوتية لـ وكيل صوتي بالذكاء الاصطناعي، فهذا الجدول يغيّر الحساب سريعاً، خصوصاً على نطاق واسع حيث تتراكم فوترة ElevenLabs لكل حرف (فصّلنا ذلك في دليلنا عن أسعار الوكلاء الصوتيين بالذكاء الاصطناعي). الحكم الصادق: ElevenLabs أكثر اتساقاً وأسهل؛ و OmniVoice أرخص وأكثر خصوصية وأوسع لغوياً بكثير.

كيف يقارن OmniVoice بنماذج TTS مفتوحة المصدر أخرى؟

OmniVoice ليس المنافس الوحيد مفتوح المصدر، وهو لا يفوز بكل فئة. لديه أوسع تغطية لغوية بفارق كبير، لكن Chatterbox يفوز في الاختبارات العمياء بالإنجليزية، ويتصدّر Fish Audio قائمة EmergentTTS-Eval المستقلة، و Kokoro أسرع إن لم تكن بحاجة إلى الاستنساخ. إليك الميدان بصدق.

مقارنة OmniVoice مع ElevenLabs و Chatterbox و Fish Audio و Qwen3-TTS حسب عدد اللغات وتشابه الصوت
خمسة نماذج TTS مفتوحة المصدر مقارنة حسب التغطية اللغوية وتشابه المتحدّث

النموذجالجهةالمعاملاتاللغاتالاستنساخنقطة القوةاخترْ هذا إذا…
OmniVoicek2-fsa0.6B646صفري اللقطة، 3ثأوسع تغطية لغويةاحتجت لغات كثيرة أو نشراً محلياً
Chatterbox-TurboResemble AI350Mالإنجليزية فقطنعممفضَّل بنسبة 65.3% في اختبار أعمى مقابل ElevenLabs (24.5%)احتجت الإنجليزية فقط وأردت أعلى جودة
Fish Audio S2 ProFish Audioغير متاح80+نعمالأول في EmergentTTS-Eval (نسبة فوز 81.88%)أردت مخرجات تعبيرية متصدّرة للقياسات
Qwen3-TTS-0.6BAlibaba0.6B10لازمن بثّ 97 مللي ثانيةاحتجت زمن بثّ منخفضاً
Kokoroمفتوح المصدر82Mموجّه للإنجليزيةلا (54 إعداداً مسبقاً)210 أضعاف الزمن الحقيقي على RTX 4090أردت أقصى سرعة دون استنساخ

تعمل معظم هذه النماذج في 4–8 غيغابايت من VRAM بدقة fp16، فالعتاد ليس العامل الحاسم بل حالة الاستخدام. ونبقي القائمة محدّثة في جولتنا على أفضل أدوات الصوت بالذكاء الاصطناعي.

متى ينبغي أن تستخدم OmniVoice فعلاً؟

يتألق OmniVoice حيثما يرجح اتساع اللغات أو التكلفة أو التحكّم بالبيانات على الحاجة إلى واجهة سحابية مصقولة. هو حصان عمل دفعي لا محرّك محادثة لحظي، فلتقرنه بمهام تولّد فيها الصوت مسبقاً أو تشغّل فيها الأمور على عتادك الخاص.

  • دبلجة الفيديو إلى عشرات اللغات من صوت مرجعي واحد، وهو مسار دبلجة الفيديو بالذكاء الاصطناعي حيث تكون الفوترة لكل حرف قاسية.
  • أنظمة الرد الصوتي التفاعلي متعددة اللغات و TTS الوكلاء الصوتيين، الطبقة الصوتية خلف وكيل صوتي للمطاعم أو نوع الأنظمة التي تحلّ محل مراكز الاتصال.
  • الكتب الصوتية في تشغيلات دفعية طويلة حيث يهمّ RTF أكثر من زمن الاستجابة.
  • إمكانية الوصول والسرد لقارئات الشاشة بلغات يتجاهلها مزوّدو السحابة.
  • اللغات قليلة الموارد التي لا يغطّيها ElevenLabs ببساطة.
  • العمل المحلي والحسّاس للخصوصية حيث لا يجوز للصوت أن يمسّ خادم طرف ثالث.

هذا الأخير هو الميزة الحاسمة الصامتة. بالنسبة إلى عميل في القطاع الصحي أو القانوني، فإن «الصوت لا يغادر جهازنا أبداً» ليس ميزة إضافية، بل هو السبب الكامل لاستبعاد محرّك TTS سحابي.

إيجابيات OmniVoice وسلبياته (بما في ذلك ما لا يصلح له)

يستحق OmniVoice نجومه، لكنه ليس بديلاً جاهزاً لـ ElevenLabs لكل فريق. تدور الإيجابيات حول الحرية والاتساع؛ وتدور السلبيات حول الصقل وزمن الاستجابة والعبء التشغيلي لإدارة نموذجك الخاص.

الإيجابيات:

  • مجاني برخصة Apache-2.0، بلا فوترة لكل حرف، وبلا سقوف.
  • 646 لغة، بينها لغات لا يلمسها أيّ مزوّد سحابي كبير.
  • يعمل محلياً بالكامل، وتبقى بياناتك في مكانها.
  • جودة استنساخ متعددة اللغات قوية (SIM-o 0.830) من مقطع مدته 3 ثوانٍ.
  • إنتاجية دفعية سريعة (RTF ~0.03 في اختبارنا).

السلبيات، الحدود الصادقة:

  • غير مبني للمحادثة اللحظية دون 300 مللي ثانية.
  • أقلّ صقلاً واتساقاً من أفضل الأصوات التجارية مثل ElevenLabs.
  • لا دعم مُدار ولا اتفاقية مستوى خدمة، فأنت معتمد على مشكلات GitHub.
  • يتطلّب بطاقة رسوميات (~8 غيغابايت VRAM)؛ ويعمل على المعالج المركزي أبطأ نحو 3 أضعاف.
  • مكتبة أصوات جاهزة أصغر من كتالوج ElevenLabs.
  • الموافقة على الأصوات المستنسَخة وترخيصها مسؤوليتك القانونية أنت، لا المنصة.

إن كان منتجك يحتاج إلى ردود فورية مصقولة داخل مكالمة هاتفية مباشرة، فإن OmniVoice هو الأداة الخاطئة اليوم. أما إن كنت تولّد الصوت بدفعات، عبر أكثر من 600 لغة، على عتادك الخاص، فمن الصعب التغلّب عليه بسعر المجان.

كيف تبدأ مع OmniVoice

تشغيل OmniVoice يستغرق أمر تثبيت واحداً وبضعة أسطر من Python، بلا حساب، وبلا مفتاح واجهة برمجية، وبلا إعداد فوترة. هذا هو المكسب العملي لنموذج مفتوح المصدر: تنتقل من الصفر إلى صوت مستنسَخ في دقائق، ولا يغادر أيّ شيء تولّده جهازك.

python
# التثبيت (بناء GPU، CUDA 12.8)
# pip install omnivoice
# pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 \
#   --extra-index-url https://download.pytorch.org/whl/cu128

from omnivoice import OmniVoice

model = OmniVoice.from_pretrained("k2-fsa/OmniVoice", device_map="cuda:0")

audio = model.generate(
    text="Hello, this is a test of zero-shot voice cloning.",
    ref_audio="ref.wav",                       # مقطع مرجعي ~3-6 ثوانٍ
    ref_text="Transcription of the reference audio.",  # يرفع دقّة الاستنساخ
)
# audio -> np.ndarray بتردد 24 كيلوهرتز

تُنزَّل النماذج تلقائياً من HuggingFace عند أول تشغيل. تفضّل ألا تكتب شيفرة؟ شغّل واجهة Gradio عبر omnivoice-demo، أو عالج الملفات دفعياً عبر واجهة سطر الأوامر omnivoice-infer-batch. وتوجد ملاحظات التثبيت الكاملة في مستودع GitHub.

عن الكاتب

Mert Batur هو المؤسّس المشارك لـ Techsy.io، حيث يبني الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة ومسارات صوت/SDR لعملاء B2B. يكتب عن حزمة أدوات LLM التي يستخدمها فريق Techsy فعلاً في الإنتاج. تواصل عبر LinkedIn.

الأسئلة الشائعة

هل OmniVoice مجاني للاستخدام التجاري؟

نعم. يصدر OmniVoice برخصة Apache-2.0، التي تتيح الاستخدام التجاري دون اشتراك ودون رسوم لكل حرف ودون سقوف استخدام. يمكنك تشغيله على عتادك الخاص لأعمال العملاء أو المنتجات الداخلية. تذكّر فقط أن أيّ صوت تستنسخه يحمل التزاماته الخاصة بالموافقة والترخيص، منفصلة عن رخصة النموذج.

كم لغة يدعم OmniVoice؟

يدعم OmniVoice أكثر من 600 لغة، مع ذكر 646 على بطاقة نموذجه، جميعها عبر تركيب متعدد اللغات صفري اللقطة. هذا نحو 20 ضعفاً للـ 32 لغة تقريباً لدى ElevenLabs. الاتساع هو ميزته الكبرى، إذ يغطّي لغات قليلة الموارد لا يقدّمها كبار مزوّدي TTS السحابي التجاريين على الإطلاق اليوم.

هل OmniVoice جيّد فعلاً بقدر ElevenLabs؟

يعتمد على ما تقيسه. يفوز OmniVoice في اللغات (646 مقابل ~32) والتكلفة (0 دولار مقابل 5–330 دولاراً شهرياً) والخصوصية وتشابه المتحدّث متعدد اللغات (SIM-o 0.830 مقابل 0.655). ويفوز ElevenLabs في الصقل والاتساق وزمن البثّ اللحظي ومكتبة أصواته الجاهزة الكبيرة والدعم التجاري. للعمل الدفعي متعدد اللغات، OmniVoice منافس حقاً؛ وللأصوات المباشرة المصقولة، لا يزال ElevenLabs متقدّماً.

ما بطاقة الرسوميات التي أحتاجها لتشغيل OmniVoice؟

نحو 8 غيغابايت من VRAM بدقة fp16 تكفي للاستخدام المريح، ويعمل النموذج جيداً على بطاقات مثل RTX 4090 التي اختبرناها. يمكنك تشغيله على المعالج المركزي فقط، لكن توقّع تركيباً أبطأ نحو 3 أضعاف. ولأحمال الإنتاج الدفعية، يوصي k2-fsa بـ 16 غيغابايت من ذاكرة النظام إلى جانب بطاقة رسوميات بسعة 8 غيغابايت أو أكثر.

هل يستطيع OmniVoice استنساخ صوت؟

نعم، يقوم OmniVoice باستنساخ صوتي صفري اللقطة من مقطع مرجعي لا تتجاوز مدته 3 ثوانٍ، دون تدريب لكل صوت. ولأفضل دقّة، مرّر تفريغاً نصّياً ref_text للمقطع مع الصوت. في اختبارنا، حسّنت إضافة التفريغ بشكل ملحوظ مدى قرب المخرجات من المتحدّث الأصلي.

هل OmniVoice جيّد بما يكفي لوكلاء الصوت في الإنتاج؟

كطبقة TTS للدبلجة ورسائل الرد الصوتي التفاعلي أو أيّ صوت مولّد مسبقاً، نعم، فهو جاهز للإنتاج. أما كصوت مباشر في وكيل محادثة لحظي يحتاج تبادل أدوار دون 300 مللي ثانية، فلا اليوم؛ فـ RTF الدفعي سريع لكن زمن البثّ ليس نقطة قوته. استخدمه حيث تولّد الصوت قبل التفاعل.

هل يعمل OmniVoice دون اتصال بالكامل ومحلياً؟

نعم. بعد التنزيل الأول للنموذج من HuggingFace، يعمل OmniVoice بالكامل على جهازك الخاص، دون إرسال أيّ بيانات إلى خادم خارجي. وهذا يجعله خياراً قوياً للبيئات الحسّاسة للخصوصية أو القانونية أو المعزولة، حيث تُستبعد واجهة TTS السحابية بسبب متطلّبات الامتثال.

كيف يقارن OmniVoice بـ Chatterbox أو Fish Audio؟

يتصدّر كلٌّ منها فئة مختلفة. يفوز Chatterbox-Turbo (من Resemble AI) في اختبارات الجودة العمياء بالإنجليزية لكنه إنجليزي فقط. ويتصدّر Fish Audio S2 Pro قائمة EmergentTTS-Eval المستقلة بمخرجات تعبيرية عبر أكثر من 80 لغة. وميزة OmniVoice هي التغطية اللغوية الصرفة البالغة 646، إضافة إلى الاستنساخ صفري اللقطة، ما يجعله الخيار حين يكون الاتساع والاستخدام المحلي الأهمّ.

الحُكم

OmniVoice هو بديل ElevenLabs مفتوح المصدر الأكثر مصداقية الذي اختبرناه، وهو مجاني. وبعد تشغيلنا للإصدار v0.1.5 بأنفسنا، التوصية بسيطة: اختر OmniVoice إذا احتجت لغات كثيرة أو خصوصية محلية أو تكلفة صفرية للصوت الدفعي، والتزم بواجهة سحابية إذا احتجت أصواتاً مصقولة لحظية محادثية اليوم.

  • مجاني ومفتوح المصدر برخصة Apache-2.0، بلا فوترة لكل حرف.
  • 646 لغة واستنساخ صفري اللقطة، يتجاوز ElevenLabs بكثير.
  • محلي وخاص، مثالي للنشر المحلي والعمل المقيّد بالامتثال.
  • غير مناسب للمحادثة المباشرة دون 300 مللي ثانية، فتلك تبقى مهمة سحابية.

إن كنت تبني مسار صوت أو دبلجة متعدد اللغات وتريد مساعدة في اختيار الحزمة الصحيحة، احصل على استشارة مجانية، وهو النوع من الأمور التي نهيّئها للعملاء كل شهر.

الوسوم

omnivoicebadil-elevenlabs-maftuh-almasdartahweel-nass-ila-kalamistinsakh-sawttts

شارك هذا المقال

مقالات ذات صلة

المزيد في ai-machine-learning

ai-machine-learning
Aug 29, 2026

أفضل وكلاء الذكاء الاصطناعي لخدمة العملاء: 8 أدوات مصنفة حسب التسليم لا الضجيج

ثمانية وكلاء ذكاء اصطناعي لخدمة العملاء مصنفون حسب جودة التسليم، وحسب ما إذا كان الروبوت يستشهد بمقال المصدر. أسعار حية سُحبت في 17 أغسطس 2026 من الصفحات الرسمية، وتشمل Intercom Fin وZendesk AI وChatbase وWeav وWatermelon وHeyy وAda وChipp.

8 دقائق قراءة قراءة
اقرأ
ai-machine-learning
Aug 22, 2026

أفضل منشئي المواقع بالذكاء الاصطناعي: قارنا 8 وننشر 2

خطة Framer Basic بسعر 10$/شهر هي الخيار الافتراضي لموقع وكالة من صفحة واحدة بين أفضل منشئي المواقع بالذكاء الاصطناعي التي قيّمناها في 17 أغسطس 2026. وDurable أسرع وصولًا إلى رابط منشور. أما Webflow فهي الوجهة عندما تكون الحاجة تحكمًا بمستوى Designer.

8 دقائق قراءة قراءة
اقرأ
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.