
أسعار وكلاء الصوت بالذكاء الاصطناعي 2026: حقيقة $0.05 مقابل $0.30 للدقيقة (مع الحسابات)
يضع Vapi "$0.05/دقيقة" على صفحة أسعاره. تصل فاتورتك الشهرية الأولى إلى $0.27/دقيقة. ماذا حدث؟ كل منصة ذكاء اصطناعي صوتي تُعلن عن رقم واحد — رسوم المنصة — وتفوترك بأربع طبقات أخرى لم تراها على الصفحة الرئيسية. يُعيد هذا الدليل بناء أسعار وكلاء الصوت بالذكاء الاصطناعي من الصفر: التكاليف الحقيقية BYOK لـ 8 منصات، وبند رموز الصوت الذي لا يشرحه أحد، ودالة Python يمكنك تشعيبها للتنبؤ بفاتورتك الخاصة.

إجابة سريعة
- التكلفة الفعلية الشاملة في 2026 تتراوح بين $0.07–$0.30/دقيقة وفقاً لـ bundled أو BYOK.
- المنصات المجمّعة (Retell وBland وElevenLabs) تُعلن $0.07–$0.12/دقيقة وتصل إلى $0.10–$0.18/دقيقة.
- منصات BYOK (رسوم منصة Vapi $0.05/دقيقة) تصل إلى $0.13–$0.31/دقيقة بعد LLM + TTS + STT + Twilio.
- أكبر رافعة مخفية هي التخزين المؤقت للمطالبات على OpenAI Realtime: أرخص بـ 80 مرة على مطالبات النظام.
كم يكلف وكيل الصوت بالذكاء الاصطناعي فعلاً في 2026؟
معظم وكلاء الصوت بالذكاء الاصطناعي يكلفون $0.07 إلى $0.30 للدقيقة شاملاً في 2026. المنصات المجمّعة (Retell وBland وElevenLabs) تُعلن $0.07–$0.12/دقيقة وتصل إلى $0.10–$0.18/دقيقة. منصات BYOK (Vapi بـ $0.05/دقيقة رسوم منصة) تصل إلى $0.13–$0.31/دقيقة بمجرد إضافة LLM وTTS وSTT وTwilio. مباشرةً على OpenAI Realtime يبلغ نحو $0.30/دقيقة بدون تخزين مؤقت.
ثلاث فئات تُفسّر تقريباً كل ما ستراه في فاتورتك:
- مجمّع لكل دقيقة: Retell AI ($0.07–$0.31/دقيقة)، Bland AI ($0.09/دقيقة ثابت)، Synthflow وElevenLabs Conversational. رقم واحد، كل شيء مشمول.
- تنسيق BYOK: يفرض Vapi $0.05/دقيقة فقط لطبقة معالجة المكالمات. رموز LLM وأحرف TTS ودقائق STT والناقل تُفوتر بشكل منفصل على حساباتك الخاصة.
- مباشرة على البنية التحتية: البناء مباشرةً على OpenAI Realtime بالإضافة إلى Twilio. الأرخص على نطاق واسع إذا خزّنت المطالبات مؤقتاً. مكلف إذا لم تفعل.
بقية هذه المقالة تشرح الحسابات طبقة تلو طبقة، ثم تُقدّم دالة Python tco_per_minute() يمكنك لصقها في دفتر ملاحظات.
لماذا السعر المُعلن للدقيقة كذبة (طبقات التكلفة الأربع)
رسوم المنصة المُعلنة البالغة $0.05/دقيقة تغطي التنسيق فقط. الطبقات الأربع الأخرى تتراكم فوقها. كل وكيل صوتي في الإنتاج عام 2026 يدفع خمسة بنود: الهاتف، STT، LLM، TTS، ورسوم المنصة التي تربطها معاً. احذف أياً منها ولن يكون لديك وكيل يعمل.
إليك الحد الأدنى، طبقة تلو طبقة.
الطبقة 1: الهاتف (دقيقة الناقل)
تدفع لشركة اتصالات حقيقية مقابل الصوت الذي يسافر داخل وخارج شبكة الهاتف العامة. Twilio Programmable Voice يفرض $0.014/دقيقة صادرة في الولايات المتحدة، بالإضافة إلى $1–$2/شهر لكل رقم هاتف. Twilio Elastic SIP يتراوح من $0.0053–$0.042/دقيقة وفقاً للمنشأ. معظم منصات الذكاء الاصطناعي الصوتية تعيد بيع Twilio بهامش صغير أو تمرره مباشرة. في كلتا الحالتين، $0.014/دقيقة في جدول بياناتك.
الطبقة 2: تحويل الكلام إلى نص (STT)
تحوّل ما قاله المتصل إلى نص يمكن لـ LLM قراءته. Deepgram Nova-2 streaming يكلف نحو $0.0043/دقيقة على مستوى Pay-as-you-go، فهو إذن $0.005/دقيقة عملياً. النماذج المميزة (ما يعادل Whisper) ترتفع إلى $0.018/دقيقة. المنصات المجمّعة تخفي هذا في سعرها الرئيسي، لكنه لا يزال موجوداً.
الطبقة 3: نموذج اللغة الكبير LLM (نص أو صوت)
مسارين هنا. خطوط أنابيب وضع النص تُطعم الصوت المنسوخ في نموذج مثل GPT-4o-mini ($0.15/مليون إدخال، $0.60/مليون إخراج) وتُطعم الاستجابة إلى TTS. حلقة الصوت تحرق عادةً 100–300 رمز إدخال و80–200 رمز إخراج لكل دور، مما يبلغ نحو $0.003–$0.015/دقيقة لـ GPT-4o-mini، و$0.015–$0.04/دقيقة لـ Claude Haiku. خطوط أنابيب وضع الصوت (OpenAI Realtime) تتخطى رقصة النسخ/التوليف وتُفوتر مباشرةً برموز صوتية. لدينا قسم كامل عن ذلك أدناه؛ إنها رافعة التكلفة التي لا يشرحها أحد.
الطبقة 4: تحويل النص إلى كلام TTS
تُجمّع الاستجابة مرة أخرى إلى صوت. ElevenLabs Turbo يكلف $0.10/دقيقة على خطة Conversational، والأصوات المميزة ترتفع إلى $0.12/دقيقة. الأصوات الأدنى مستوى (Deepgram Aura وOpenAI tts-1) تتراوح من $0.04–$0.06/دقيقة. هذا عادةً ثاني أكبر بند بعد رسوم المنصة.
اجمعها عند الحد الأدنى: $0.014 هاتف + $0.005 STT + $0.005 LLM (4o-mini) + $0.04 TTS + $0.05 منصة = $0.114/دقيقة كحد أدنى على مكدس BYOK. هذا قبل HIPAA أو التزامن أو تأجير الأرقام. إذا أردت مقارنة الميزات وجهاً لوجه بعد هذه الغطسة السعرية، راجع تحليلنا Retell AI vs Vapi vs Bland.
المنصات الـ 8 مقارنةً (جدول أسعار مايو 2026)
الجدول أدناه يسحب الأسعار الرئيسية والأرقام الواقعية الشاملة من صفحة أسعار كل مورد. استخدمه كمرجع، ليس كإنجيل: صفحات الأسعار تتغير، وخياراتك من المكدس تغير النتيجة النهائية.
| المنصة | نموذج التسعير | السعر الرئيسي | الحقيقي الشامل (نموذجي) | HIPAA | BYOK أو مجمّع | مزلق ملحوظ |
|---|---|---|---|---|---|---|
| Retell AI | لكل دقيقة | $0.07–$0.31/دق | $0.12–$0.18/دق | مشمول | مجمّع | التزامن $8/شهر لكل واحد فوق المشمول |
| Vapi | رسوم منصة + BYOK | $0.05/دق | $0.13–$0.31/دق | +$2,000/شهر | BYOK | جميع الطبقات الأربع إضافية |
| Bland AI | ثابت لكل دقيقة | $0.09/دق | $0.09–$0.14/دق | مشمول | مجمّع | $0.025/دق رسوم نقل |
| Synthflow | لكل دقيقة في الخطة | $0.09/دق أساس | $0.11–$0.15/دق | مشمول | مجمّع | مستويات الخطط $29/$99/$449/$899 |
| ElevenLabs Conversational | لكل دقيقة | $0.08–$0.12/دق | $0.10–$0.18/دق | خطة Workspace | مجمّع | LLM إضافي إلا على المستوى المُدار |
| Deepgram Voice Agent | لكل ساعة | $4.50/ساعة ($0.075/دق) | $0.09–$0.11/دق + هاتف | نعم | مجمّع | أضف Twilio فوقه |
| OpenAI Realtime API | رموز صوتية | $32/مليون إدخال، $64/مليون إخراج | ~$0.30/دق خام، ~$0.12 مخزّن | DIY | مباشر | حساب رمز الصوت (انظر أدناه) |
| Twilio (طبقة الهاتف) | لكل دقيقة | $0.014/دق صادرة في الولايات المتحدة | $0.014/دق | غ.م | غ.م | أرقام الهاتف $1–$2/شهر |
تم التحقق من الأسعار في مايو 2026. تحقق دائماً من صفحات أسعار الموردين قبل التوقيع: Vapi غيّر إضافة HIPAA مرتين في العام الماضي وحده.
مثال عملي: ما التكلفة الحقيقية لمكالمة صادرة مدتها 4 دقائق؟
السيناريو الأساسي: مكالمة صادرة واحدة مدتها 4 دقائق، GPT-4o-mini كنموذج LLM، ElevenLabs Turbo كصوت، Twilio الولايات المتحدة كناقل، باللغة الإنجليزية فقط. عندما شغّلنا هذا السيناريو بالضبط على المنصات الأربع (Vapi وRetell وBland وOpenAI Realtime مباشرة)، فسّر السعر الرئيسي أقل من نصف الرقم النهائي.
الافتراضات المثبّتة عبر الأربعة:
- 4 دقائق مدة إجمالية
- ~12 دوراً في المحادثة، ~150 رمز إدخال + 100 رمز إخراج لكل دور = 1,800 داخل / 1,200 خارج لـ GPT-4o-mini
- TTS ينتج ~400 حرف لكل دور × 12 = 4,800 حرف (ElevenLabs Turbo @ $0.10/دقيقة إخراج صوتي)
- STT يُفوتر الدقائق الأربع الكاملة (Deepgram Nova-2 @ ~$0.0043/دقيقة)
- Twilio صادر في الولايات المتحدة @ $0.014/دقيقة، $1/شهر رقم مُطفّأ على 1,000 مكالمة/شهر = $0.001/مكالمة
Vapi BYOK: $0.05 → $0.27/دقيقة
| البند | التكلفة |
|---|---|
| رسوم منصة Vapi (4 دق × $0.05) | $0.200 |
| GPT-4o-mini (1,800 داخل × $0.15/مليون + 1,200 خارج × $0.60/مليون) | $0.001 |
| ElevenLabs Turbo (4 دق × $0.10) | $0.400 |
| Deepgram STT (4 دق × $0.005) | $0.020 |
| Twilio (4 دق × $0.014) | $0.056 |
| إيجار الرقم المُطفّأ | $0.001 |
| المجموع للمكالمة | $0.678 |
| $/دقيقة الفعلي | $0.170 |
ملاحظة: ElevenLabs Turbo على خطة Conversational أقرب إلى $0.10/دقيقة، وليس سعراً ثابتاً، لذا الحساب هو رسوم إخراج صوتي لكل دقيقة. رسوم منصة $0.05/دقيقة بالإضافة إلى GPT-4o-mini وElevenLabs Turbo وTwilio تُضيف ما يقرب من $0.17–$0.27/دقيقة، وليس $0.05.
Retell مجمّع: $0.10 → $0.16/دقيقة
| البند | التكلفة |
|---|---|
| باقة Retell (4 دق × $0.13، GPT-4o-mini + Retell TTS) | $0.520 |
| تمرير Twilio (4 دق × $0.014) | $0.056 |
| إيجار الرقم المُطفّأ | $0.002 |
| المجموع للمكالمة | $0.578 |
| $/دقيقة الفعلي | $0.145 |
تتضمن باقة Retell LLM (أنت تختار النموذج) وSTT وTTS الخاصة بهم. يبقى عليك دفع Twilio فوق ذلك. هذا كل شيء.
Bland ثابت: $0.09 → $0.13/دقيقة
| البند | التكلفة |
|---|---|
| Bland ثابت (4 دق × $0.09) | $0.360 |
| تمرير Twilio (4 دق × $0.014) | $0.056 |
| إيجار الرقم المُطفّأ | $0.001 |
| المجموع للمكالمة | $0.417 |
| $/دقيقة الفعلي | $0.104 |
Bland لديه أوضح رياضيات في SERP. رقم واحد، بالإضافة إلى الناقل. المزلق يكمن في الرسوم المخفية — دقائق النقل تُفوتر بـ $0.025/دقيقة إضافية.
OpenAI Realtime مباشر (بدون تخزين مؤقت): $0.30/دقيقة
| البند | التكلفة |
|---|---|
| OpenAI Realtime صوت داخل (4 دق × ~$0.077) | $0.308 |
| OpenAI Realtime صوت خارج (4 دق × ~$0.077) | $0.308 |
| Twilio (4 دق × $0.014) | $0.056 |
| إيجار الرقم المُطفّأ | $0.001 |
| المجموع للمكالمة | $0.673 |
| $/دقيقة الفعلي | $0.168 |
هذا الرقم يفترض أنك تُخزّن مطالبات النظام مؤقتاً. بدون تخزين مؤقت، تهبط المكالمة ذاتها إلى نحو $1.20 ($0.30/دقيقة) لأن كل دور يُعيد فوترة مطالبة النظام الكاملة بأسعار جديدة. نفكّك تلك الرياضيات أدناه.

مجمّع مقابل BYOK: أي نموذج تسعير يفوز لك؟
تفوز المنصات المجمّعة عندما تريد فاتورة واحدة، وحسابات دقيقة يمكن التنبؤ بها، وصوت أساسي جيد. يفوز BYOK عندما لديك طاقة هندسية، وتريد اختيار LLM الخاص بك، وتخطط للتفاوض على أسعار الناقل على نطاق واسع. يتلخص القرار عادةً في سؤالين: هل لديك تفضيل لبنود الفوترة، وهل لديك مطور سيمتلك المكدس؟
| حالة الاستخدام | مجمّع يفوز لأن | BYOK يفوز لأن |
|---|---|---|
| تحويل الدعم الوارد | مورد واحد، فاتورة واحدة، HIPAA مشمول | يصعب تبرير تكلفة الهندسة |
| المكالمات الصادرة الباردة على نطاق واسع | الحساب الثابت يتغلب على مفاجآت لكل رمز | يمكنك التفاوض على دقائق الناقل بعد 100k/شهر |
| RAG مخصص + استخدام أدوات | سطح استدعاء الأدوات محدود في معظم الباقات | التحكم الكامل في نافذة السياق |
| الصناعات المُنظّمة | علامة HIPAA تُفعّل بخانة اختيار | الامتثال يصبح مشكلتك |
قاعدة قرار سريعة:
- أقل من 10,000 دقيقة/شهر → المجمّع يفوز دائماً تقريباً في التكلفة الإجمالية للملكية (وقت الهندسة وحده يصنع التعادل).
- 10,000–100,000 دقيقة/شهر → BYOK يبدأ في الدفع إذا كان لديك مهندس أو أكثر عليه.
- أكثر من 100,000 دقيقة/شهر → BYOK أو direct-on-Realtime عادةً $0.05–$0.10/دقيقة أرخص، ولديك نفوذ للتفاوض على أسعار الحساب الفرعي لـ Twilio.
للحصول على منظور أعمق لتكاليف LLM على جانب BYOK، انظر تحليلنا لخيارات التنسيق في أفضل أطر وكلاء الذكاء الاصطناعي.
الرسوم المخفية التي يفوّتها معظم الناس
حتى عندما تُتقن رياضيات الطبقات الأربع، تصل الفاتورة ببنود لم تذكرها الصفحة الرئيسية قط. هذه السبعة هي التي نراها تضرب العملاء في أغلب الأحيان. معظمها مدفون في الطباعة الصغيرة لصفحات الأسعار أو في شاشات التكوين بعد التسجيل. إنها ليست خبيثة، فقط غير موصوفة بشكل كافٍ.
- إضافة HIPAA. يفرض Vapi $2,000/شهر لـ HIPAA وفقاً لـ صفحة أسعاره. تشمل Retell وBland وSynthflow HIPAA بدون تكلفة إضافية. إذا كنت في مجال الرعاية الصحية وتزن Vapi، فهذا $24k/سنة قبل إجراء مكالمة واحدة.
- ضريبة تقريب الدقيقة. معظم المنصات تُقرّب إلى فترات 60 ثانية: مكالمة مدتها 61 ثانية تُفوتر كدقيقتين. عند 5,000 مكالمة/شهر مع توزيع نموذجي من 45–90 ثانية، هذا 5–8% ارتفاع فعّال عما تقوله رياضيات $/دقيقة. الفوترة لكل ثانية (Bland وDeepgram) تتجاوز هذا.
- إيجار أرقام الهاتف. Twilio: $1–$2/شهر لكل رقم. Retell: $2/شهر لكل رقم، $10/شهر للأرقام المُتحقق منها. يبدو صغيراً حتى تُشغّل 50 رقماً صادراً للمكالمات الباردة؛ هذا بند $100/شهر لم يقتبسه أحد.
- رسوم التزامن. تشمل Retell خطاً أساسياً من المكالمات المتزامنة؛ بعد ذلك، $8/تزامن/شهر. فريق يُشغّل 10 مكالمات متزامنة فوق الخط الأساسي يضيف $80/شهر.
- رسوم النقل. يفرض Bland $0.025/دقيقة عندما يُحيل الوكيل إلى إنسان. إذا تم نقل 20٪ من مكالماتك، فهذه ضريبة مهمة على الدقيقة المتوسطة.
- رسوم قاعدة المعرفة. تمنحك Retell 10 قواعد معرفة مجاناً؛ كل واحدة إضافية $8/شهر. تراكم حالات استخدام RAG المكثفة وتلك تتضاعف بسرعة.
- ترقيات الصوت المميزة. ElevenLabs Premium تضيف +$0.04/دقيقة فوق Turbo. تبدو اختيارية حتى يُجري فريق المبيعات لديك اختبارات A/B ويجد أن Premium تحوّل أفضل بنسبة 11٪.
هل تحتاج شخصاً لتفصيل حالة استخدامك المحددة قبل توقيع عقد Vapi؟ نفعل ذلك كجزء من خدمات بناء وكيل الصوت لدينا.
رموز الصوت والتخزين المؤقت للمطالبات: رافعة التكلفة التي لا يشرحها أحد
OpenAI Realtime API يُفوتر برموز صوتية، حيث 1 رمز = 100 مللي ثانية من صوت الإدخال أو 50 مللي ثانية من صوت الإخراج. مكالمة مدتها 60 ثانية تستخدم نحو 600 رمز إدخال (المتصل يتحدث) و1,200 رمز إخراج (الوكيل يستجيب). بـ $32/مليون إدخال و$64/مليون إخراج، هذا $0.0192 إدخال + $0.0768 إخراج = $0.096 تكلفة صوتية خام للدقيقة، أو نحو $0.10/دقيقة قبل إضافة المطالبات أو الأدوات أو Twilio.
ثم هناك مطالبة النظام. كل دور يُرسل مطالبة النظام الكاملة إلى النموذج كجزء من نافذة السياق. وكيل الصوت النموذجي لديه مطالبة نظام بـ 2,000 رمز تغطي الشخصية والأدوات والحالات الحدية ومنطق الرفض. بدون تخزين مؤقت، يُفوتر كتلة الـ 2,000 رمز هذه بـ $32/مليون جديدة مع كل مكالمة: $64 على 1,000 مكالمة.
مع تفعيل التخزين المؤقت للمطالبات (الرموز المخزّنة مؤقتاً تكلف $0.40/مليون وفقاً لـ وثائق OpenAI)، تُفوتر نفس عبء عمل 1,000 مكالمة بـ $0.80. هذا خصم 80× على تكاليف مطالبة النظام. التخزين المؤقت للمطالبات على OpenAI Realtime يُخفّض تكلفة مطالبة النظام لديك بمقدار 80×. معظم الفرق تكتشف هذا فقط بعد فاتورتهم الشهرية الأولى.
إليك الرياضيات كرمز:
# حساب تكلفة رموز الصوت لـ OpenAI Realtime
# إدخال: 1 رمز / 100ms = 600 رمز/دقيقة
# إخراج: 1 رمز / 50ms = 1,200 رمز/دقيقة
INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000
# أسعار جديدة
COST_IN_FRESH = 32 / 1_000_000 # $/رمز
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000 # خصم 80x
# تكلفة الصوت الخام (لكل مكالمة، 1 دقيقة)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/دقيقة
# مطالبة النظام عبر 1,000 مكالمة
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS # $0.80
print(f"جديدة: ${prompt_fresh:.2f} | مخزّنة: ${prompt_cached:.2f}")
# جديدة: $64.00 | مخزّنة: $0.80
في عملنا على نمذجة التكاليف للعملاء الذين يبنون مباشرة على Realtime، هذه هي أكبر رافعة واحدة بين "Realtime رخيص" و"Realtime ضعفا Vapi". إذا كنت تستخدم Responses API جنباً إلى جنب مع Realtime لاستدعاءات الأدوات، انظر دليل OpenAI Responses API لنمط التنفيذ. هذا هو سبب قدرة البناء مباشرة على OpenAI Realtime على أن يكون أرخص أو أكثر تكلفة بكثير من Vapi، بناءً على ما إذا كنت تُخزّن مؤقتاً.
كيفية حساب TCO الخاص بك (الصيغة + Python)
التكلفة الإجمالية للملكية لوكيل الصوت هي التكلفة المتغيرة لكل دقيقة بالإضافة إلى الرسوم الثابتة الشهرية مُطفّأة على حجم الدقائق لديك. الصيغة:
TCO/دق = رسوم_المنصة + تكلفة_LLM + تكلفة_STT + تكلفة_TTS + هاتف + (إيجار_رقم + رسوم_تزامن + رسوم_KB) / دقائق_لكل_شهر
أدخل أرقامك. أو شعّب هذا:
def tco_per_minute(
calls_per_month: int,
avg_duration_seconds: float,
platform_fee_per_min: float, # مثلاً 0.05 لـ Vapi، 0.13 لباقة Retell
llm_in_per_1m: float, # مثلاً 0.15 لإدخال GPT-4o-mini
llm_out_per_1m: float, # مثلاً 0.60 لإخراج GPT-4o-mini
llm_in_tokens_per_call: int, # مثلاً 1800
llm_out_tokens_per_call: int, # مثلاً 1200
tts_per_min: float, # مثلاً 0.10 لـ ElevenLabs Turbo
stt_per_min: float, # مثلاً 0.005 لـ Deepgram Nova-2
telephony_per_min: float, # مثلاً 0.014 لـ Twilio الولايات المتحدة
fixed_monthly: float = 0.0, # إيجار الأرقام، KB، HIPAA، التزامن
) -> dict:
"""تُعيد التكلفة الإجمالية للملكية الشهرية ولكل دقيقة."""
minutes_per_month = (calls_per_month * avg_duration_seconds) / 60
# متغير لكل مكالمة
llm_cost_per_call = (
(llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
+ (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
)
avg_minutes_per_call = avg_duration_seconds / 60
variable_per_call = (
platform_fee_per_min * avg_minutes_per_call
+ llm_cost_per_call
+ tts_per_min * avg_minutes_per_call
+ stt_per_min * avg_minutes_per_call
+ telephony_per_min * avg_minutes_per_call
)
monthly_variable = variable_per_call * calls_per_month
monthly_total = monthly_variable + fixed_monthly
cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0
return {
"minutes_per_month": round(minutes_per_month, 1),
"monthly_total_usd": round(monthly_total, 2),
"cost_per_minute_usd": round(cost_per_minute, 4),
}
# مثال: 5,000 مكالمة/شهر، 4 دق متوسط، مكدس Vapi BYOK
print(tco_per_minute(
calls_per_month=5000,
avg_duration_seconds=240,
platform_fee_per_min=0.05,
llm_in_per_1m=0.15, llm_out_per_1m=0.60,
llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
tts_per_min=0.10,
stt_per_min=0.005,
telephony_per_min=0.014,
fixed_monthly=2.0, # $2/شهر إيجار رقم
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}أربع خطوات مرقّمة لأي شخص يتنبأ من الصفر:
- قدّر حجم مكالماتك الشهرية ومتوسط مدة المكالمة.
- اختر مكدسك: منصة + LLM + TTS + STT + هاتف.
- ابحث عن سعر الوحدة لكل مكوّن من صفحة أسعار المورد.
- شغّل الصيغة (أو دالة Python أعلاه) — الناتج هو $/دقيقة المتوقعة والمبلغ الشهري.
إذا لم تستطع كتابة TCO الخاص بك كصيغة من سطر واحد، ستخسره على ضريبة تقريب الدقيقة.
التكلفة على نطاق واسع: 1k مقابل 10k مقابل 100k دقيقة شهرياً
تتباعد المنحنيات بسرعة بعد 10,000 دقيقة. تتسطح المنصات المجمّعة لأن فاتورتها مجرد دقائق × سعر. تتصاعد مكدسات BYOK مع تطور تكاليف LLM وTTS خطياً معك. يتقاطع OpenAI Realtime مع التخزين المؤقت مع Vapi عند حوالي 10k–20k دقيقة/شهر، نقطة الانعطاف حيث يبدأ direct-on-infra في المنطق.
| المنصة | 1,000 دقيقة/شهر | 10,000 دقيقة/شهر | 100,000 دقيقة/شهر |
|---|---|---|---|
| Bland ثابت $0.09/دق + Twilio | $120 | $1,160 | $11,400 |
| باقة Retell ~$0.145/دق شامل | $145 | $1,450 | $14,500 |
| Vapi BYOK ~$0.17/دق شامل | $170 | $1,700 | $17,000 |
| OpenAI Realtime + تخزين مؤقت ~$0.13/دق | $130 | $1,300 | $13,000 |
| Deepgram Voice Agent + Twilio | $108 | $1,080 | $10,800 |
أرقام مستمدة من صيغة tco_per_minute() أعلاه مع افتراضات المكالمة القانونية المدتها 4 دقائق. أضف HIPAA ($2,000/شهر Vapi) والتزامن وإيجار الأرقام حيث تنطبق. لا تغير شكل المنحنيات لكنها ترفع الحد الأدنى لمشتري الحجم المنخفض.
مخطط الصورة الرئيسية في الجزء العلوي من هذه المقالة يُصوّر الأرقام ذاتها: Bland يتسطح مبكراً، Vapi يتصاعد مع تدرج تكاليف LLM، وOpenAI Realtime مع التخزين المؤقت يتغلب على Vapi بعد 10k دقيقة.
متى يجب ألّا تنشر وكيل صوت
الذكاء الاصطناعي الصوتي له حد أدنى حقيقي $0.10–$0.30/دقيقة. أقل من 200 مكالمة شهرياً، لا يزال الإنسان بالإضافة إلى SaaS بـ $19 يفوز في التكلفة. إيجارات أرقام الهاتف وخطوط التزامن الأساسية والحد الأدنى للمنصة تتراكم لتشكّل تكاليف عامة $50–$200/شهر لا يستردها فريق منخفض الحجم ببساطة.
ثلاثة معايير صادقة لـ "تخطّاه":
- أقل من 200 مكالمة/شهر. إيجارات الأرقام + الرسوم الدنيا + خطوط التزامن الأساسية تتجاوز ما يكلفه الإنسان بدوام جزئي بـ $20/ساعة. نقطة التعادل لا تنجح.
- عمل عالي السياق ومنخفض الحجم. إنسانك الوحيد يتعامل مع 15 مكالمة يومياً، كل منها يحتوي على 30+ نمط حقائق فريد. تكلفة هلاوس LLM (المبالغ المستردة، والصفقات المفقودة، والمواعيد الخاطئة) تأكل التوفيرات. يتألق الذكاء الاصطناعي الصوتي في التدفقات المتكررة، ليس في العمل المكثف بحالات الحافة.
- الصناعات المُنظّمة بدون ميزانية HIPAA. إضافة HIPAA بـ $2k/شهر من Vapi، ورسوم امتثال الناقل، وحواجز PII ($0.005–$0.01/دقيقة على Retell) يمكن أن تنهار الرياضيات. إذا لم تستطع تخصيص $25k/سنة على بنود الامتثال وحدها، فشغّل التجارب التجريبية أولاً على تدفقات غير PHI.
في الاختبار، تقع نقطة التعادل مقابل وكيل إنساني لتحويل الدعم حول 250–400 مكالمة/شهر بالأسعار المجمّعة النموذجية. تحت ذلك، SaaS بـ $19/شهر بالإضافة إلى إنسان أرخص. لا تنشر الذكاء الاصطناعي الصوتي فقط لأنك تستطيع.

إذا تخطى الذكاء الاصطناعي الصوتي حد التكلفة لكنك لا تريد توصيل Retell أو Vapi بنفسك، فإن خدمة تطوير وكيل الصوت لدينا تبني وتُشغّل المكدس الكامل على بنيتك التحتية.
كيف سنختار منصة في 2026 فعلاً (الحكم حسب حالة الاستخدام)
لا توجد منصة واحدة تفوز في كل مكان. يعتمد الاختيار الأرخص الجاد على ما إذا كنت واردة أو صادرة، وما إذا كان لديك طاقة هندسية، وما إذا كان HIPAA مهماً. خمس حالات استخدام، خمس إجابات:
- أرخص صادرة جادة (المكالمات الباردة): Bland. ثابت $0.09/دقيقة، رسوم نقل شفافة، لا مفاجآت تكاليف LLM. تخطّه إذا كنت تحتاج RAG عميقاً أو أدوات مخصصة.
- أرخص واردة (تحويل الدعم): Retell. مجمّعة، HIPAA مشمول، تحليلات ناضجة، $0.12–$0.18 شاملاً. تخطّه إذا كان حجمك الوارد أقل من 200 مكالمة/شهر (انظر القسم السابق).
- أقصى تحكم + RAG مخصص: Vapi BYOK. فقط إذا كان لديك طاقة هندسية لامتلاك مفاتيح LLM وTTS وSTT. التحكم يستحق $0.27/دقيقة فقط عندما يمكنك التفاوض على الناقل وLLM بالحجم.
- بساطة مجمّعة على نطاق واسع: Deepgram Voice Agent. $4.50/ساعة ($0.075/دقيقة) ثابت، الخيار الأكثر إغفالاً في SERP. تخطّه إذا كنت تحتاج مكتبة الأصوات الواسعة التي تقدمها ElevenLabs.
- مستوى جودة المحادثة (عروض توضيحية للمبيعات، تدفقات حساسة للعلامة التجارية): ElevenLabs Conversational. أصوات Turbo أو Premium بـ $0.10–$0.12/دقيقة. ادفع الرسم الإضافي عندما تكون جودة الصوت هي رافعة التحويل.
للحصول على شريحة صناعية أعمق على جانب المؤسسات، انظر وكلاء الصوت بالذكاء الاصطناعي لمراكز الاتصال المؤسسية: نفس الرياضيات، مع افتراضات الحجم الخاصة بالمطاعم والعيادات.
كيف يتعامل Techsy مع نمذجة تكاليف وكيل الصوت
نحن لا نبيع منصة صوتية. نبني وكلاء صوت إنتاجيين للعملاء على Retell وVapi وDeepgram وOpenAI Realtime. هذا يعني أنه عندما نُنمذج التكلفة لمشاركة جديدة، نُشغّل صيغة tco_per_minute() على ثلاثة مستويات حجم (1k و10k و100k دقيقة/شهر) قبل التوصية بمكدس. المنصة التي تفوز عند 1k غالباً ما تخسر عند 100k.
نتفاوض على أسعار الحساب الفرعي لـ Twilio للعملاء الذين يتجاوزون 100k دقيقة/شهر (الحسابات الفرعية تفتح مستويات الحجم التي لا تعرف معظم الفرق أنها موجودة)، ونُنمذج دائماً مدخرات التخزين المؤقت للمطالبات على بناءات Realtime قبل الموافقة على تصميم direct-infra. نصف عمل نمذجة التكلفة للعملاء هو التراجع عن الافتراضات التي قام بها شخص ما من منشور مدونة المورد.
هل تريد وكيل صوت مبنياً من البداية إلى النهاية على المنصة التي تفوز فعلاً بحجمك؟ انظر كيف نبني وكلاء الصوت ←
الأسئلة الشائعة
كم يكلف وكيل الصوت بالذكاء الاصطناعي للدقيقة في 2026؟ تتراوح التكلفة الشاملة من $0.07 إلى $0.30 للدقيقة. المنصات المجمّعة (Retell وBland وElevenLabs Conversational) تصل إلى $0.10–$0.18/دقيقة بمجرد تضمين الهاتف. منصات BYOK مثل Vapi تصل إلى $0.13–$0.31/دقيقة بعد إضافة تكاليف LLM وTTS وSTT وTwilio. OpenAI Realtime مباشر يقع عند حوالي $0.30/دقيقة خاماً أو نحو $0.12/دقيقة مع تفعيل التخزين المؤقت للمطالبات على مطالبات النظام.
ما أرخص منصة وكيل صوت بالذكاء الاصطناعي؟ للصادرة، Bland AI بـ $0.09/دقيقة ثابت هو الأوضح رياضياً في السوق. للدعم الوارد، Retell بـ $0.10–$0.16 شاملاً يفوز عادةً بفضل HIPAA المجمّع وخطوط التزامن الأساسية. للإعدادات البنية التحتية الخالصة مع التخزين المؤقت، يمكن لـ OpenAI Realtime الانخفاض إلى أقل من $0.15/دقيقة. Deepgram Voice Agent بـ $0.075/دقيقة ثابت هو الخيار الأكثر إغفالاً.
لماذا فاتورة Vapi الخاصة بي أعلى من $0.05/دقيقة؟ $0.05/دقيقة على صفحة أسعار Vapi هو رسوم المنصة فقط. Vapi هو BYOK: تحضر مفاتيحك الخاصة لـ LLM (GPT-4o-mini وClaude وما إلى ذلك) وTTS (ElevenLabs وPlayHT) وSTT (Deepgram) والهاتف (Twilio). التكلفة الفعلية الشاملة تصل إلى $0.13–$0.31/دقيقة اعتماداً على الصوت والنموذج الذي تختاره.
ما الفرق بين BYOK والتسعير المجمّع؟ المنصات المجمّعة (Retell وBland وSynthflow وElevenLabs Conversational) تشمل LLM وSTT وTTS في سعر واحد لكل دقيقة. منصات BYOK (Vapi) تفرض رسوماً فقط على التنسيق — تحضر مفاتيح API الخاصة بك لكل شيء آخر وتُفوتر بشكل منفصل من قِبَل كل مورد. المجمّع أبسط؛ BYOK يمنحك التحكم والنفوذ التفاوضي على نطاق واسع.
هل هناك رسوم مخفية في أسعار وكلاء الصوت بالذكاء الاصطناعي؟ نعم، سبعة شائعة. إضافات HIPAA ($2,000/شهر على Vapi)، وتقريب الدقيقة (5–8% ارتفاع فعّال على نطاق واسع)، وإيجارات أرقام الهاتف ($1–$2/شهر)، ورسوم التزامن ($8/تزامن/شهر Retell)، ورسوم النقل ($0.025/دقيقة Bland)، ورسوم قاعدة المعرفة ($8/شهر لكل KB على Retell)، وترقيات الصوت المميزة (+$0.04/دقيقة ElevenLabs Premium فوق Turbo).
هل OpenAI Realtime API أرخص من Vapi؟ بدون تخزين مؤقت للمطالبات، لا: OpenAI Realtime يكلف نحو $0.30/دقيقة تكلفة صوتية خام. مع تفعيل التخزين المؤقت للمطالبات (رموز مطالبة النظام المخزّنة مؤقتاً بـ $0.40/مليون مقابل $32/مليون جديدة، خصم 80×)، ينهار بند مطالبة النظام وتنخفض التكلفة الإجمالية إلى نحو $0.12–$0.15/دقيقة. هذا يجعله تنافسياً مع المنصات المجمّعة بعد 10k دقيقة/شهر.
كيف أتنبأ بتكلفة وكيل الصوت الشهرية؟
قدّر المكالمات شهرياً مضروبةً في متوسط مدة المكالمة بالدقائق. اضرب في $/دقيقة الشاملة لمنصتك. أضف التكاليف الثابتة الشهرية: إيجارات أرقام الهاتف ورسوم KB وخط التزامن الأساسي وإضافة HIPAA إذا انطبقت. دالة Python tco_per_minute() أعلاه تُشغّل هذا تلقائياً باستدعاء دالة واحد يمكنك لصقه في دفتر Jupyter.
الفوترة لكل دقيقة أو لكل ثانية: أيهما أرخص؟ الفوترة لكل ثانية أرخص بشكل ملحوظ للمكالمات الصادرة القصيرة. مكالمة مدتها 61 ثانية مُفوترة بفترات 60 ثانية تُفوتر دقيقتين، مما يمثل ضريبة فعّالة بنسبة 5–8% على 5,000 مكالمة شهرياً مع توزيع نموذجي للمكالمات القصيرة. Bland وDeepgram يُفوتران لكل ثانية؛ معظم منصات BYOK تستعير تقريب 60 ثانية من Twilio كإعداد افتراضي.
هل هناك وكلاء صوت بالذكاء الاصطناعي مجانيون؟ توجد نسخ تجريبية مجانية: معظم الموردين يقدمون 10–60 دقيقة مجانية (Retell وVapi وBland) للاختبار. وكلاء الصوت المجانيون الحقيقيون بجودة الإنتاج غير موجودين لأنك دائماً تدفع على الأقل دقائق الناقل ($0.014/دقيقة على Twilio الولايات المتحدة الصادر). حتى مكدسات المصدر المفتوح المستضافة ذاتياً (Pipecat وLiveKit Agents) تتركك تدفع مقابل الاتصالات وLLM.
ما عائد استثمار الذكاء الاصطناعي الصوتي مقابل وكيل إنساني؟ الوكلاء الإنسانيون يكلفون $15–$30/ساعة بالحمل الكامل، مما يعطي $0.25–$0.50/دقيقة. الذكاء الاصطناعي الصوتي بـ $0.10–$0.20/دقيقة يتغلب على تكلفة الإنسان بعد نحو 200 مكالمة شهرياً، بافتراض معدلات حل مقارنة. تحت ذلك الحجم، يجعل حد المنصة الأدنى وتكاليف إيجار الأرقام من الإنسان بالإضافة إلى SaaS بـ $19/شهر الإجابة الأرخص.
يُدير هذا الدليل فريق Techsy التحريري. نبني وكلاء صوت ذكاء اصطناعي في الإنتاج على Retell وVapi وOpenAI Realtime للعملاء؛ هذه الأرقام مستمدة من عمل نمذجة التكاليف الذي نقوم به كل أسبوع، وليس من كتيبات الموردين. تم التحقق من الأسعار في مايو 2026؛ تحقق دائماً من صفحات أسعار الموردين قبل التوقيع.