ai-machine-learning

كم تكلفة استدلال LLM؟ تحليل 4 سيناريوهات بأرقام حقيقية

بقلم Mert Batur
Aug 1, 2026
15 قراءة
كم تكلفة استدلال LLM؟ تحليل 4 سيناريوهات بأرقام حقيقية

كم تكلفة استدلال LLM؟ تحليل 4 سيناريوهات بأرقام حقيقية

كلّف GPT-4 ثلاثين دولارًا لكل مليون رمز إدخال في مارس 2023. بعد ثلاث سنوات، يشغّل GPT-5.6 المليون نفسه بعشرة دولارات. ويبلغ سعر Claude Opus 4.5 خمسة عشر دولارًا. أما الحد الأدنى؟ سنتان فقط. هذا فارق يبلغ 1,500 ضعف بين أرخص خيار وأغلاه لوحدة العمل ذاتها. تكلفة استدلال LLM هي الفاتورة المتكررة التي تدفعها في كل مرة يقرأ فيها نموذج مدرّب مدخلاتك ويولّد مخرجات، وتُسعَّر لكل مليون رمز لدى كل المزوّدين الكبار. تعمل نماذج الفئة الاقتصادية بنطاق 0.02 إلى 0.30 دولار لكل مليون رمز إدخال. وتفرض نماذج الفئة المتقدمة 15 إلى 75 دولارًا للحجم نفسه. هذا الفارق مهم لأن حمل العمل الذي تشغّله، لا طموحك، هو الذي يحدّد الفئة التي تحتاجها فعلًا.

أبرز النقاط:

  • تكلّف النماذج الاقتصادية 0.02-0.30 دولار لكل مليون رمز إدخال، بينما تتراوح نماذج الفئة المتقدمة بين 15 و75 دولارًا (يوليو 2026).
  • تكلّف رموز الإخراج 3 إلى 5 أضعاف رموز الإدخال لأن التوليد تسلسلي وليس متوازيًا.
  • يكلّف روبوت دعم فني يعالج 50 ألف محادثة شهريًا نحو 9 إلى 420 دولارًا شهريًا بحسب فئة النموذج.
  • تراجعت أسعار الاستدلال نحو 10 أضعاف سنويًا، وتتوقع Gartner انخفاضًا بنسبة 90% بحلول 2030.

كم تكلفة استدلال LLM لكل مليون رمز؟

يتبع تسعير استدلال LLM هيكلًا من ثلاث فئات حتى يوليو 2026. تفرض النماذج الاقتصادية من مزوّدين مثل Google (Gemini 2.5 Flash) والخيارات مفتوحة المصدر (Llama 4 وQwen 3) ما بين 0.02 و0.30 دولار لكل مليون رمز إدخال. وتستقر النماذج المتوسطة (GPT-4.1 وClaude Sonnet 4) بين 0.55 و15 دولارًا. أما نماذج الاستدلال المتقدمة (o3 وClaude Opus 4.5) فتفرض 15 إلى 75 دولارًا. ينشر كل مزوّد هذه الأسعار في صفحات التسعير الرسمية لديه (OpenAI وAnthropic)، ويتتبع موقع PricePerToken.com أكثر من 300 نموذج في شبكة محدّثة لحظيًا.

حتى يوليو 2026، يمكنك تشغيل مليون رمز إدخال بسنتين فقط، أو تدفع خمسة وسبعين دولارًا للمليون نفسه على نموذج من الفئة المتقدمة.

الفئةنماذج مثالالإدخال $/مليون رمزالإخراج $/مليون رمزالإدخال المخزّن $/مليونالأنسب لـ
اقتصاديةGemini 2.5 Flash، Llama 4 Scout، Qwen 3 32B$0.02-$0.30$0.06-$1.20$0.01-$0.15التصنيف عالي الحجم، التوجيه
متوسطةGPT-4.1، Claude Sonnet 4، Gemini 2.5 Pro، GPT-5.6$0.55-$15$2.20-$60$0.28-$7.50RAG، توليد الكود، التحليل
متقدمةo3، Claude Opus 4.5$15-$75$60-$300$7.50-$37.50الاستدلال المعقّد، البحث

تخفيضات الإدخال المخزّن تخفض فاتورتك بنسبة 50-90% على المطالبات المتكررة (يشرح دليل تخزين مطالبات LLM آلية ذلك). وللحصول على شبكة الـ300 نموذج المحدّثة بأسعار كل المزوّدين الحالية، راجع جدول التسعير الكامل لكل رمز.

ما الذي يحرّك تكلفة استدلال LLM؟ المكوّنات الأربعة

تنقسم فاتورة الاستدلال إلى أربعة محرّكات للتكلفة: زمن حساب GPU لكل رمز، والذاكرة المخصّصة لأوزان النموذج وذاكرة KV المؤقتة، وعدم التناظر بين الإدخال والإخراج الذي يجعل التوليد أغلى من القراءة، والبنية التحتية العامة (الكهرباء والتبريد والشبكات). معرفة المكوّن الذي يهيمن على حمل عملك تخبرك أين تستحق جهود التحسين العناء.

المكوّنما هوحصته من فاتورتكما الذي يحرّكه
الحساب (زمن GPU)عمليات FLOPs لمعالجة كل رمز عبر طبقات النموذج40-60%حجم النموذج، حجم الدفعة، مستوى التكميم
الذاكرة (الأوزان + ذاكرة KV)ذاكرة VRAM التي تحمل معاملات النموذج وحالة الانتباه20-35%طول السياق، الطلبات المتزامنة
عدم تناظر الإدخال/الإخراجتعمل مرحلة فك الترميز تسلسليًا، رمزًا واحدًا في كل مرةمدمج في تسعير الإخراجطول الإخراج، استراتيجية أخذ العينات
البنية التحتية العامةالكهرباء، التبريد، الشبكات، زمن خمول GPU10-20%موقع مركز البيانات، معدل الاستغلال

الحساب: زمن GPU لكل رمز

يمرّ كل رمز عبر كل طبقة من طبقات النموذج. يحتاج نموذج بمعاملات 70 مليار عند FP16 إلى نحو 140 GFLOPs لكل رمز. ويخفض التكميم إلى INT4 ذلك إلى نحو 35 GFLOPs. يفصّل دليل NVIDIA لقياس أداء الاستدلال معادلة التكلفة الإجمالية الكاملة: إهلاك العتاد مضافًا إليه الكهرباء مضافًا إليه التشغيل، مقسومًا على عدد الرموز المخدومة.

الذاكرة: أوزان النموذج + ذاكرة KV

يشغل نموذج 70 مليار عند FP16 نحو 140 غيغابايت من ذاكرة VRAM للأوزان وحدها. وتنمو ذاكرة KV المؤقتة مع طول السياق وحجم الدفعة المتزامنة. عند سياق 128 ألف رمز مع 32 طلبًا متزامنًا، قد تحرق 80 غيغابايت إضافية. لهذا السبب تكتسب متطلبات VRAM بحسب النموذج أهمية كبيرة في قرارات الاستضافة الذاتية.

عدم التناظر بين الإدخال والإخراج

تكلّف رموز الإخراج 3 إلى 5 أضعاف رموز الإدخال لأن النموذج يولّدها واحدًا تلو الآخر بالترتيب. فهو لا يستطيع الموازاة بالطريقة نفسها التي يقرأ بها مطالبتك.

إليك الصيغة المبسّطة: قراءة مطالبتك المكوّنة من 2,000 رمز (مرحلة "الملء المسبق") تعالج كل الرموز في وقت واحد عبر أنوية GPU. أما توليد 500 رمز إخراج (مرحلة "فك الترميز") فيعمل رمزًا واحدًا في كل خطوة، ويعتمد كل رمز على الذي قبله. يبقى GPU خاملًا معظم الوقت منتظرًا عرض نطاق الذاكرة بين الخطوات. وهذا الزمن الخامل هو ما تدفع مقابله 3 إلى 5 أضعاف سعر الإدخال.

البنية التحتية العامة

الكهرباء والتبريد والشبكات ووحدات GPU التي تبقى خاملة بين الطلبات. تغطي وثائق التحسين من Hugging Face كيف تستخرج تقنية الدفعات المستمرة وفك الترميز التخميني رموزًا أكثر لكل ساعة GPU من العتاد نفسه، ما يخفض حصة البنية التحتية هذه مباشرة.

كم تكلفة استدلال LLM لأربعة أحمال عمل حقيقية؟

يكلّف روبوت الدعم الفني النموذجي 9 إلى 420 دولارًا شهريًا، ويعمل خط أنابيب RAG بنطاق 168 إلى 3,360 دولارًا شهريًا، ويسجّل مساعد الكود لـ200 مطوّر فاتورة بين 123 و2,078 دولارًا شهريًا، وتستقر معالجة المستندات بالدفعات بين 240 و6,400 دولار شهريًا. يعتمد هذا الفارق شبه كليًا على اختيار فئة النموذج. بنينا هذه السيناريوهات الأربعة من أحجام الرموز في عمليات نشر عملائنا، وسعّرناها مقابل الصفحات الرسمية ليوليو 2026. كل رقم بالدولار أدناه قابل لإعادة الإنتاج: افتراضات الرموز المعلنة مضروبة في الأسعار المنشورة. إنه تحليلنا نحن، لا ادعاءات البائعين.

روبوت دعم العملاء: 50 ألف محادثة شهريًا

متوسط المحادثة: 800 رمز إدخال (مطالبة النظام + رسائل المستخدم + السياق المسترجع)، و400 رمز إخراج. الحجم الشهري: 50,000 محادثة = 40 مليون رمز إدخال، و20 مليون رمز إخراج.

  • الخيار الاقتصادي (Gemini 2.5 Flash): 40 مليون × $0.075/مليون + 20 مليون × $0.30/مليون = 9 دولارات شهريًا. رخيص بشكل يثير الريبة تقريبًا.
  • الخيار المتوسط (Claude Sonnet 4): 40 مليون × $3/مليون + 20 مليون × $15/مليون = 420 دولارًا شهريًا.

لروبوت دعم يعالج تذاكر المستوى الأول، يتعامل النموذج الاقتصادي مع 90% من الاستفسارات بكفاءة. وجّه الـ10% الصعبة إلى الفئة المتوسطة باستخدام مصنّف.

خط أنابيب RAG: 10 آلاف استعلام يوميًا

متوسط الاستعلام: 3,200 رمز إدخال (مقاطع مسترجعة + مطالبة النظام + سؤال المستخدم)، و600 رمز إخراج. شهريًا: 300 ألف استعلام = 960 مليون رمز إدخال، و180 مليون رمز إخراج.

  • الخيار الاقتصادي (Llama 4 Scout عبر API): 960 مليون × $0.10/مليون + 180 مليون × $0.40/مليون = 168 دولارًا شهريًا.
  • الخيار المتوسط (GPT-4.1): 960 مليون × $2/مليون + 180 مليون × $8/مليون = 3,360 دولارًا شهريًا.

حمل عمل RAG ثقيل على الإدخال، لذا تضرب تخفيضات الإدخال المخزّن بقوة هنا. مع تخزين 70% من المطالبات، تهبط الفئة المتوسطة إلى نحو 2,100 دولار شهريًا.

مساعد الكود: 200 مطوّر

متوسط الجلسة: 4,500 رمز إدخال (سياق الملفات + المحادثة)، و1,200 رمز إخراج. افترض 15 طلبًا لكل مطوّر يوميًا، و22 يوم عمل = 66,000 طلب شهريًا = 297 مليون إدخال، و79 مليون إخراج.

  • الخيار الاقتصادي (Qwen 3 32B): 297 مليون × $0.20/مليون + 79 مليون × $0.80/مليون = 123 دولارًا شهريًا.
  • الخيار المتوسط (Claude Sonnet 4): 297 مليون × $3/مليون + 79 مليون × $15/مليون = 2,078 دولارًا شهريًا.

يلاحظ المطوّرون فروقات الجودة بسرعة. للكود، تكون الفئة المتوسطة عادة هي الحد الأدنى. تصلح النماذج الاقتصادية لاقتراحات الإكمال التلقائي لكنها تعجز عن عمليات إعادة الهيكلة عبر ملفات متعددة.

معالجة المستندات بالدفعات: مليون مستند شهريًا

متوسط المستند: 2,000 رمز إدخال، و300 رمز إخراج (استخراج، تصنيف، تلخيص). شهريًا: 2 مليار إدخال، و300 مليون إخراج.

  • الخيار الاقتصادي (Gemini 2.5 Flash): 2 مليار × $0.075/مليون + 300 مليون × $0.30/مليون = 240 دولارًا شهريًا.
  • الخيار المتوسط (GPT-4.1): 2 مليار × $2/مليون + 300 مليون × $8/مليون = 6,400 دولار شهريًا.

عند هذا الحجم، يتحول فارق السعر البالغ 27 ضعفًا بين الفئات إلى بند بقيمة 6,160 دولارًا شهريًا. تتعامل النماذج الاقتصادية مع الاستخراج المنظم بكفاءة. ولتحديد حجم العتاد إن كنت تفكر في الاستضافة الذاتية لهذا الحجم، راجع متطلبات VRAM بحسب النموذج.

حمل العملالنموذجالرموز/الطلب (إدخال/إخراج)الطلبات/شهر$/شهر
روبوت الدعمGemini 2.5 Flash800 / 40050 ألف$9
روبوت الدعمClaude Sonnet 4800 / 40050 ألف$420
خط أنابيب RAGLlama 4 Scout3,200 / 600300 ألف$168
خط أنابيب RAGGPT-4.13,200 / 600300 ألف$3,360
مساعد الكودQwen 3 32B4,500 / 1,20066 ألف$123
مساعد الكودClaude Sonnet 44,500 / 1,20066 ألف$2,078
مستندات بالدفعاتGemini 2.5 Flash2,000 / 3001 مليون$240
مستندات بالدفعاتGPT-4.12,000 / 3001 مليون$6,400
python
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
    """Estimate monthly LLM inference cost.
    
    Args:
        input_tokens: avg input tokens per request
        output_tokens: avg output tokens per request
        requests: monthly request volume
        price_in: $/M input tokens
        price_out: $/M output tokens
    """
    total_in = input_tokens * requests / 1_000_000
    total_out = output_tokens * requests / 1_000_000
    return (total_in * price_in) + (total_out * price_out)

# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
    input_tokens=800,
    output_tokens=400,
    requests=50_000,
    price_in=3.00,
    price_out=15.00
)
print(f"${cost:,.2f}/month")  # $420.00/month

API أم الاستضافة الذاتية: متى يفوز كل خيار؟

يفوز API تحت نحو 20 ألف طلب يوميًا أو عندما يفتقر فريقك إلى خبرة البنية التحتية للتعلم الآلي. وتفوز الاستضافة الذاتية فوق 200 ألف طلب يوميًا مع استغلال مستدام لوحدة GPU يتجاوز 50%. تقع نقطة التعادل، وفق تحليل Introl، حول 50 إلى 80 ألف طلب يوميًا لنموذج من فئة 70 مليار على عقدة H100 واحدة. تحت تلك العتبة، تتفوق كفاءة المزوّد متعدد المستأجرين على حسابات عتادك أحادي المستأجر.

مستوى الحجمAPI $/شهرالاستضافة الذاتية $/شهر (GPU + تشغيل)الفائزالسبب
منخفض: 2,000 طلب يوميًا$150-$400$2,800-$4,500APIتبقى GPU خاملة 85% من الوقت
متوسط: 20 ألف طلب يوميًا$1,500-$4,000$3,200-$5,000API (بفارق ضئيل)يبلغ الاستغلال نحو 40%، ما دون التعادل
مرتفع: 200 ألف طلب يوميًا$15,000-$40,000$5,500-$8,000الاستضافة الذاتيةاستغلال فوق 70% يُهلك العتاد بسرعة

متى يفوز API

تُطلق منتجك في أيام لا أسابيع. لا راتب مهندس تعلم آلي (180 ألفًا إلى 250 ألف دولار سنويًا)، ولا مناوبة طوارئ لأعطال GPU، ولا تخطيط للسعة. لمعظم الفرق التي تضم أقل من 50 مهندسًا، يعد API الخيار الافتراضي الصحيح. دون نقاش.

متى تفوز الاستضافة الذاتية

لقد تجاوزت 200 ألف طلب يوميًا، وحمل عملك قابل للتنبؤ، ولديك بالفعل موظفو بنية تحتية للتعلم الآلي. تعمل النماذج مفتوحة المصدر (Llama 4 وQwen 3 وMistral) على عتادك بتكلفة الكهرباء مضافًا إليها الإهلاك. تُظهر مقارنات أداء vLLM مقابل SGLang فروقات إنتاجية بين 15 و30% بحسب شكل حمل العمل، وهذا مهم عند هذا الحجم.

رقم التعادل

لا تفوز الاستضافة الذاتية إلا فوق استغلال مستدام لوحدة GPU بنحو 50%. تحت ذلك، أنت تدفع مقابل سيليكون خامل. التكاليف البشرية الخفية (وقت مهندسي التعلم الآلي، المناوبات، تحديثات النماذج، الترقيعات الأمنية) هي السبب الحقيقي الذي يجعل معظم الفرق تبقى على API حتى حين تبدو حسابات GPU الخام في صالحها. إن كنت ستستضيف ذاتيًا، فإن نشر النماذج على Modal يزيل طبقة إدارة البنية التحتية مع إبقاء تكلفة الرمز الواحد أقل من أسعار API.

التكاليف الخفية التي لا يرصد لها أحد ميزانية

الإنفاق الخام على الرموز يمثل 60-80% من فاتورتك الحقيقية. الباقي يختبئ في ستة بنود لا تظهر أبدًا في حاسبة التسعير. رصد 20-40% إضافية فوق تقديرك للرموز لتغطيتها.

  • أدوات المراقبة والقابلية للرصد: 200 إلى 1,500 دولار شهريًا. لوحات استخدام الرموز، وتتبع زمن الاستجابة، ونسب التكلفة لكل ميزة. تدفع منصة رصد LLM ثمن نفسها من أول مرة تكتشف فيها تراجعًا في المطالبات قبل أن يستنزف ميزانيتك.
  • إعادة المحاولات وتشغيل الأعطال: تفشل 3-8% من الطلبات أو تحتاج إعادة محاولة (مهلات زمنية، حدود معدل، مخرجات معطوبة). هذا يعني 3-8% من فاتورة رموزك تُنفق دون إنتاج شيء.
  • ساعات تكرار هندسة المطالبات: 20 إلى 60 ساعة كل ربع سنة بتكلفة هندسية محمّلة بين 100 و200 دولار للساعة. كل تعديل على المطالبة يعيد تشغيل دفعات اختبار.
  • الاختبار والتقييم ضد التراجع: 100 إلى 800 دولار شهريًا من إنفاق الرموز لأجنحة التقييم الآلي. أنت تدفع للنموذج ليصحّح نفسه.
  • التكرار عبر مناطق متعددة: تكلفة بنية تحتية 1.5 إلى 2 ضعف إن كنت تحتاج إلى تجاوز الأعطال عبر المناطق لزمن الاستجابة أو الامتثال.
  • عقوبات زمن بدء التشغيل البارد: تفرض عمليات نشر GPU بلا خوادم (Modal وAWS Lambda) رسومًا على زمن الخمول. يضيف البدء البارد 2 إلى 8 ثوانٍ ويحاسبك على فترة الإحماء.

القاعدة العملية: اضرب تقديرك الخام للرموز في 1.3 للحصول على ميزانية واقعية. واضرب في 1.4 إن كنت في صناعة منظّمة ذات أعباء امتثال.

لماذا يستمر استدلال LLM في أن يصبح أرخص؟

تراجعت أسعار استدلال LLM نحو 10 أضعاف سنويًا منذ 2023. حمل العمل الذي كان يكلّف 1,000 دولار شهريًا في 2024 يكلّف اليوم أقرب إلى 100 دولار. تحرّك ذلك ثلاث قوى: تحسينات العتاد (NVIDIA Blackwell FP4 وGoogle TPU v6)، والضغط التنافسي (DeepSeek والنماذج مفتوحة المصدر التي تشعل حروب أسعار)، وتحسينات البرمجيات (فك الترميز التخميني، الدفعات المستمرة، التكميم). تتوقع Gartner انخفاض تكاليف الاستدلال 90% إضافية بحلول 2030، لكن هذا توقع لا ضمان.

يوثّق تتبع أسعار Epoch AI هذا الانخفاض بنقاط بيانات صلبة. وصاغ تحليل "LLMflation" من a16z المصطلح وأطّر آثاره الاقتصادية: الاستدلال ينكمش أسرع من أي فئة حسابية سابقة.

تكلفة التدريب مقابل تكلفة الاستدلال

يكلّف تدريب نموذج من الفئة المتقدمة 50 إلى 200 مليون دولار (مرة واحدة). أما الاستدلال لذلك النموذج نفسه، عبر كل المستخدمين، فيكلّف 5 إلى 50 مليون دولار سنويًا بحسب الحجم. لمعظم الفرق، النسبة 10 إلى 100 ضعف: يكلّف التدريب 10 إلى 100 ضعف ما تكلّفه سنة واحدة من الاستدلال. لكن التدريب مصروف رأسمالي لمرة واحدة. أما الاستدلال فهو فاتورة تشغيلية متكررة تتضاعف مع نمو المستخدمين. أنت لا تدفع للتدريب إلا إن كنت تبني نموذجًا تأسيسيًا. لكنك تدفع للاستدلال كل يوم.

بند الطاقة

تسحب وحدة NVIDIA H100 نحو 700 واط تحت الحمل. بسعر 0.10 دولار لكل كيلوواط/ساعة (المتوسط الأمريكي)، هذا يساوي 0.07 دولار لكل ساعة GPU. يولّد نموذج 70 مليار على وحدة H100 واحدة نحو 2,000 رمز إخراج في الثانية عند الدفعات. على مدى ساعة واحدة: 7.2 مليون رمز. تكلفة الكهرباء لكل مليون رمز إخراج: نحو 0.01 دولار. حسابنا نحن، وموسوم على هذا الأساس. الطاقة تمثل 1-3% من فاتورة API لكنها 8-15% من التكلفة الإجمالية للاستضافة الذاتية. وهي أهم إن كنت تشغّل وحدات GPU الخاصة بك في منطقة مرتفعة تكلفة الكهرباء (ألمانيا عند 0.30 دولار لكل كيلوواط/ساعة تضاعف هذا الرقم ثلاث مرات).

الخلاصة العملية: الأسعار تهبط بسرعة كافية تجعل الالتزام لمدة 12 شهرًا بفئة نموذج محددة مخاطرة. أعد التقييم كل ربع سنة. يغطي دليل 12 طريقة لخفض فاتورة LLM التحركات التكتيكية التي يمكنك تنفيذها الآن بينما يتولى الاتجاه العام الجزء الأكبر من العمل.

كيف تقدّر تكلفة الاستدلال الخاصة بك؟

قدّر تكلفة استدلال LLM الشهرية في أربع خطوات: احسب الرموز لكل طلب، واضرب في الحجم الشهري، وطبّق تسعير الفئة، ثم أضف 20-40% أعباء عامة. من خبرتنا في تقدير ميزانيات الاستدلال للعملاء، يتخطى معظم الفرق الخطوة الرابعة ويتساءلون لماذا تتجاوز فاتورتهم الفعلية التقدير بالثلث. هذه هي العملية التي نستخدمها.

  1. احسب الرموز لكل طلب. سجّل متوسط رموز الإدخال (مطالبة النظام + السياق + رسالة المستخدم) ورموز الإخراج (استجابة النموذج) عبر أكثر من 100 طلب حقيقي. لا تخمّن. قِس.
  2. اضرب في الحجم الشهري. الطلبات يوميًا × 30 = الطلبات الشهرية. اضرب في عدد الرموز لكل طلب.
  3. طبّق تسعير الفئة. اضرب إجمالي رموز الإدخال في سعر $/مليون إدخال للنموذج. والأمر نفسه للإخراج. اجمعهما.
  4. أضف 20-40% أعباء عامة. إعادة المحاولات، والتقييمات، وتكرار المطالبات، والمراقبة. هذا هو الرقم الذي يدخل ميزانيتك، لا الخطوة الثالثة.
python
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
                            requests_per_day, price_in, price_out,
                            overhead_pct=0.30):
    """Full monthly budget estimate with overhead."""
    monthly_requests = requests_per_day * 30
    raw_cost = monthly_cost(
        avg_input_tokens, avg_output_tokens,
        monthly_requests, price_in, price_out
    )
    return raw_cost * (1 + overhead_pct)

# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
    avg_input_tokens=3200,
    avg_output_tokens=600,
    requests_per_day=10_000,
    price_in=2.00,
    price_out=8.00,
    overhead_pct=0.30
)
print(f"${budget:,.0f}/month")  # $4,368/month

حين تعرف رقمك، توجّه أدوات بوابة LLM الحركة إلى أرخص نموذج يجتاز معيار الجودة لديك. البوابة ذات اختيار النموذج لكل طلب يمكنها خفض تكلفتك الممزوجة 30-50% دون المساس بمطالباتك.

عن المؤلف

مرت باطور هو المؤسس المشارك لـTechsy.io، حيث يشحن الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط أنابيب صوتية وSDR لعملاء B2B. يكتب عن حزمة أدوات LLM التي يستخدمها فريق Techsy فعليًا في الإنتاج. تواصل عبر LinkedIn.

الأسئلة الشائعة

هل استدلال LLM مكلف؟

يعتمد على الحجم واختيار النموذج. يكلّف مليون رمز إدخال 0.02 دولار على Gemini 2.5 Flash أو 75 دولارًا على نموذج استدلال متقدم. لتطبيق صغير يعالج 10 آلاف طلب يوميًا، توقّع 50 إلى 400 دولار شهريًا. ولأحمال العمل المؤسسية بأكثر من مليون طلب يوميًا، تتراوح الميزانيات بين 5,000 و40,000 دولار شهريًا. تكلفة الوحدة الواحدة منخفضة، لكن الحجم هو ما يراكمها.

كم يساوي مليون رمز واحد في LLM؟

يساوي مليون رمز نحو 750,000 كلمة، أو حوالي 10 روايات كاملة. في يوليو 2026، تكلّف معالجة مليون رمز إدخال 0.02 دولار (الفئة الاقتصادية) إلى 75 دولارًا (الفئة المتقدمة). وتتراوح رموز الإخراج للحجم نفسه بين 0.06 و300 دولار. تستقر معظم أحمال العمل الإنتاجية في الفئة المتوسطة: 2 إلى 15 دولارًا لكل مليون رمز إدخال.

لماذا استدلال الذكاء الاصطناعي مكلف جدًا؟

يتطلب الاستدلال تمرير كل رمز عبر مليارات معاملات النموذج على وحدات GPU يكلّف كل منها 25,000 إلى 40,000 دولار. تولّد مرحلة فك الترميز الرموز تسلسليًا، ما يترك أنوية GPU خاملة بين الخطوات. أنت تدفع مقابل عتاد متخصص وكهرباء وتبريد وفريق هندسة المزوّد الذي يُبقي حزمة الخدمة تعمل على مدار الساعة.

هل تنخفض تكاليف استدلال الذكاء الاصطناعي؟

نعم، نحو 10 أضعاف سنويًا منذ 2023. أُطلق GPT-4 بسعر 30/60 دولارًا لكل مليون رمز (إدخال/إخراج). القدرة المكافئة تكلّف اليوم 2 إلى 10 دولارات. تؤكد بيانات Epoch AI هذا المسار عبر كل المزوّدين. وتتوقع Gartner انخفاضًا إضافيًا بنسبة 90% بحلول 2030، مدفوعًا بتحسينات العتاد والضغط التنافسي من النماذج مفتوحة المصدر.

كم تكلفة استدلال LLM في 2026؟

النماذج الاقتصادية: 0.02-0.30 دولار لكل مليون رمز إدخال. المتوسطة: 0.55-15 دولارًا. المتقدمة: 15-75 دولارًا. حمل العمل الإنتاجي النموذجي (روبوت دعم، خط أنابيب RAG، أو مساعد كود) يكلّف 150 إلى 4,000 دولار شهريًا على النماذج المتوسطة. وتعالج النماذج الاقتصادية المهام عالية الحجم منخفضة التعقيد بأقل 10 إلى 30 ضعفًا.

ما الفرق بين تكلفة التدريب وتكلفة الاستدلال؟

التدريب هو المصروف لمرة واحدة لتعليم نموذج من الصفر: 50 إلى 200 مليون دولار لنموذج متقدم، ويتطلب آلاف وحدات GPU لأشهر. أما الاستدلال فهو التكلفة المتكررة لاستخدام ذلك النموذج المدرّب: تمرير المدخلات عبره للحصول على المخرجات، وتُحاسب لكل رمز. لمعظم الفرق، الاستدلال هو الفاتورة الوحيدة التي يدفعونها. التدريب مخصّص للشركات التي تبني نماذج تأسيسية.

كيف أحسب تكلفة استدلال LLM لتطبيقي؟

اضرب متوسط رموز الإدخال لكل طلب في حجم طلباتك الشهري، ثم في سعر $/مليون إدخال للنموذج. كرّر ذلك لرموز الإخراج. اجمع الرقمين. أضف 30% لإعادة المحاولات والتقييمات وأعباء المراقبة. أتمتة المقاطع البرمجية بلغة Python في هذا المقال تحسب ذلك آليًا. قِس أعداد الرموز الحقيقية بدل التخمين؛ تمنحك السجلات من أكثر من 100 طلب متوسطًا موثوقًا.

هل تكلّف رموز الإخراج أكثر من رموز الإدخال؟

نعم، عادة 3 إلى 5 أضعاف أكثر. توازي معالجة الإدخال (الملء المسبق) عبر كل الرموز في وقت واحد، مستغلة أنوية GPU بالكامل. أما توليد الإخراج (فك الترميز) فينتج رمزًا واحدًا في كل مرة، ويعتمد كل رمز على السابق. تنتظر GPU عرض نطاق الذاكرة بين الخطوات. يسعّر المزوّدون الإخراج أعلى ليعكس كفاءة العتاد المنخفضة هذه.

هل الاستضافة الذاتية للاستدلال أرخص من استخدام API؟

فقط فوق نحو 200 ألف طلب يوميًا مع استغلال مستدام لوحدة GPU يتجاوز 50%. تحت ذلك، تتفوق كفاءة مزوّدي API متعددة المستأجرين على عتادك أحادي المستأجر. تضيف الاستضافة الذاتية أيضًا تكاليف خفية: رواتب مهندسي التعلم الآلي (180 ألفًا إلى 250 ألف دولار سنويًا)، ومناوبات الطوارئ، وتحديثات النماذج، والترقيعات الأمنية. على معظم الفرق التي تضم أقل من 50 مهندسًا البقاء على API.

هل يستهلك استدلال LLM طاقة كبيرة؟

تسحب وحدة GPU من طراز H100 نحو 700 واط تحت الحمل. بسعر 0.10 دولار لكل كيلوواط/ساعة، هذا يساوي 0.07 دولار لكل ساعة GPU، أي ما يترجم إلى نحو 0.01 دولار لكل مليون رمز إخراج لنموذج 70 مليار. الطاقة تمثل 1-3% من فاتورة API لكنها 8-15% من التكلفة الإجمالية للاستضافة الذاتية. في المناطق مرتفعة الكهرباء (ألمانيا، 0.30 دولار لكل كيلوواط/ساعة)، تتضاعف حصة الطاقة ثلاث مرات وتؤثر جوهريًا في اقتصاديات الاستضافة الذاتية.

الخلاصة

أربعة أرقام تستحق التذكر: 0.02 دولار (الحد الأدنى الاقتصادي لكل مليون رمز إدخال)، و3 إلى 5 أضعاف (علاوة الإخراج فوق الإدخال)، و20-40% (الأعباء العامة التي تُضاف فوق حساب الرموز الخام)، و10 أضعاف (الانخفاض السنوي في السعر منذ 2023). تعتمد فاتورتك الفعلية على الحجم وفئة النموذج ومدى شراستك في التخزين والدفعات وتوجيه الحركة.

في Techsy، يقدّر فريقنا ميزانيات الاستدلال ويختار فئات النماذج لعملاء B2B يشغّلون أحمال عمل LLM إنتاجية. إن أردت رأيًا ثانيًا في نموذج التكلفة لديك، احصل على استشارة مجانية.

الوسوم

تكلفة استدلال LLMتسعير استدلال LLMسعر مليون رمزاستغلال GPUالاستضافة الذاتية للاستدلال

شارك هذا المقال

مقالات ذات صلة

المزيد في ai-machine-learning

ai-machine-learning
Aug 1, 2026

التقييم عبر الإنترنت مقابل التقييم دون اتصال لنماذج LLM: أيهما تحتاج؟ (ومتى؟)

تقييمات دون الاتصال تحرس عمليات نشرك، وتقييمات عبر الإنترنت تراقب ما يصل إلى المستخدمين. مقارنة في 9 أبعاد، وإعداد حقيقي لبوابة CI، ومصفوفة تربط الأدوات بالأوضاع، وحلقة التغذية الراجعة التي تحوّل إخفاقات الإنتاج إلى اختبارات تراجع.

10 دقائق للقراءة قراءة
اقرأ
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.