حاسبة تكلفة API لـ OpenAI وClaude وGemini
قارن التكاليف الشهرية بين المزوّدين، مع احتساب وفورات التخزين المؤقت والمعالجة المجمّعة.
تتراوح تكاليف واجهات API لـ GPT وClaude وGemini بين 0.15 $ و75 $ لكل مليون token إدخال، علماً أن tokens الإخراج أغلى عادةً بمقدار 3 إلى 5 أضعاف. وعند 10 ملايين token شهرياً، يكلّف GPT-4o نحو 775 $، وClaude Sonnet 4 نحو 1,140 $، وGemini 2.5 Pro نحو 825 $. ويخفّض التخزين المؤقت للموجِّهات (prompt caching) التكلفة بمقدار 10 أضعاف على الـ tokens المخزّنة، بينما تخفّضها المعالجة المجمّعة (Batch API) بنسبة 50% في الأعمال غير الفورية. وتتيح لك هذه الحاسبة محاكاة استخدامك بدقة عبر المزوّدين الثلاثة.
مدخلاتك
05 fieldsمن يجب أن يستخدم هذه الأداة
المؤسسون الذين يحدّدون نطاق مشروع openai api قبل الحديث مع الموردين. مديرو التقنية وقادة الهندسة الذين يبنون ميزانية سنوية لعمل منتج جديد. مديرو المنتج الذين يحوّلون فكرة من سطر واحد إلى نطاق تكلفة قابل للدفاع عنه أمام المالية. فرق المشتريات التي تتحقق من معقولية عروض الوكالات والمتعاقدين.
كيف نحسب ذلك
تستند الأسعار إلى المعدلات المعلنة من OpenAI وAnthropic وGoogle حتى عام 2026. وينطبق التخزين المؤقت للموجِّهات على tokens الإدخال المخزّنة فقط (عادةً موجِّه النظام مع السياق الثابت). أما المعالجة المجمّعة (Batch API) فتنطبق على tokens الإدخال والإخراج معاً، في الأعمال غير الفورية، ضمن اتفاقية مستوى خدمة مدتها 24 ساعة.
مصادر البيانات
العوامل التي تحرّك الرقم
اختيار فئة النموذج
النماذج الطليعية مثل GPT-4.5 وClaude Opus 4 وGemini 2.5 Pro أغلى بمقدار 5 إلى 10 أضعاف لكل token من نظيراتها متوسطة الفئة. استخدم الطليعية فقط في مهام الاستدلال الصعب التي تعجز فيها النماذج المتوسطة فعلاً: المنطق المعقّد متعدّد الخطوات، والرياضيات، وتوليد الكود الملتبس، أو المهام التي تتطلّب معرفة عميقة بالعالم. ووجّه كل ما عداها إلى Claude Sonnet 4 أو GPT-4o أو Gemini Flash. فجوة التكلفة واسعة بما يكفي ليخفّض التوجيه الذكي الإنفاق عادةً بنسبة 60 إلى 80% في أحمال العمل المختلطة.
Prompt caching
تخزّن Anthropic مؤقتاً tokens الإدخال لمدة 5 دقائق مجاناً، أو لساعة كاملة بعلاوة 25%، ما يخفّض كلفة الـ tokens المخزّنة بنحو 90%. أما OpenAI فتخزّن تلقائياً لمدة 5 إلى 10 دقائق على نقاط نهاية معيّنة دون أي إعداد. ويعمل التخزين المؤقت على أفضل وجه حين يتجاوز موجِّه النظام لديك 2,000 token ويبقى ثابتاً عبر الطلبات، وهو حال معظم روبوتات المحادثة وأنظمة RAG في الإنتاج. ويكون التوفير أكبر ما يكون في أحمال العمل ذات السياق الطويل الثابت والطلبات الكثيرة في الدقيقة.
Batch API
يوفّر كلٌّ من OpenAI وAnthropic نقاط نهاية مجمّعة بخصم 50% بالضبط عن السعر القياسي، مقابل اتفاقية مستوى خدمة مدتها 24 ساعة. والمعالجة المجمّعة مثالية للتصنيف، وتوليد التضمينات، والتلخيص، وعمليات التقييم، وأي معالجة في الخلفية. والتكامل في غاية البساطة: النموذج نفسه، والموجِّه نفسه، ونقطة نهاية مختلفة، إضافةً إلى طابور لانتظار النتائج. ومعظم الفرق تغفل المعالجة المجمّعة وتدفع السعر الكامل لأحمال لا تتطلّب استجابة فورية، وهو من أسهل تكاليف الذكاء الاصطناعي التي يمكن تجنّبها.
tokens الإخراج
tokens الإخراج أغلى من tokens الإدخال بمقدار 3 إلى 5 أضعاف لدى جميع المزوّدين، ومعظم الردود لا تحتاج سقف الإخراج البالغ 4,000 token الذي تتيحه الواجهة افتراضياً. فإن كنت تستخرج إجابة بنعم أو لا، فحدّد الإخراج بـ 10 tokens. وإن كنت تولّد ملخّصاً قصيراً، فحدّده بـ 200. فالنموذج كثيراً ما يميل إلى شرح استدلاله وإن لم تطلب ذلك، وأنت من يدفع ثمن تلك الشروح. وتقييد max_tokens كثيراً ما يخفّض كلفة الإخراج بنسبة 30 إلى 50% دون أي أثر على الجودة.
نافذة السياق لا تساوي السعر
يحتسب جميع كبار المزوّدين الكلفة لكل token مستهلَك، لا حسب حجم نافذة السياق. فاستخدام نافذة سياق سعتها 200K لموجِّه بحجم 5,000 token يكلّف تماماً مثل استخدام نافذة سعتها 5K للموجِّه نفسه. ومؤدّى ذلك أن النماذج طويلة السياق ليست "أغلى في الاستخدام" ما لم تملأ السياق فعلاً. فاختر النموذج بناءً على قدرته وسعره لكل token، لا على من يملك أكبر نافذة سياق.
كيف تقلّل التكلفة
فعّل التخزين المؤقت للموجِّهات كأول تحسين، قبل أي شيء آخر. مع Anthropic، علّم موجِّه النظام الثابت لديك برؤوس cache_control، فتنخفض كلفة الـ tokens المخزّنة إلى نحو 10% من سعر الإدخال القياسي. ومع OpenAI، يحدث التخزين تلقائياً على نقاط نهاية معيّنة عندما تكون بداية الموجِّه متطابقة عبر الطلبات. ويكون المكسب أكبر ما يكون في الأحمال ذات السياق الطويل الثابت والطلبات الكثيرة: روبوتات المحادثة ذات الشخصيات المفصّلة، وأنظمة RAG ذات سياق الاسترجاع المتكرّر، وأي حلقة وكيل تعيد إرسال مجموعة تعليمات طويلة. ومعظم الفرق تنسى تفعيل التخزين فتدفع أضعاف ما يلزم، بمقدار 5 إلى 10 مرات.
انقل كل حِمل غير فوري إلى المعالجة المجمّعة (Batch API). يوفّر كلٌّ من Anthropic وOpenAI نقاط نهاية مجمّعة بنصف السعر القياسي بالضبط، مقابل اتفاقية مستوى خدمة للردّ مدتها 24 ساعة. ومهام التصنيف، والإشراف على المحتوى، وتوليد التضمينات، وخطوط التلخيص، وعمليات التقييم، كلها مرشّحة جيدة لذلك. وعمل التكامل في غاية البساطة، لأن الموجِّه والنموذج لا يتغيّران. وكثيراً ما تشغّل الفرق خط وسم المحتوى بالكامل بالسعر القياسي، في حين كانت المعالجة المجمّعة ستخفّض الفاتورة إلى النصف دون أي فارق في الجودة.
وجّه الطلبات بحسب صعوبتها. فالاستعلامات البسيطة (التحيات، والتنسيق، والبحث الأساسي) مكانها GPT-4o mini أو Claude Haiku أو Gemini Flash بسعر 0.15 إلى 0.80 دولار لكل مليون token إدخال. أما الاستدلال الصعب فمكانه Claude Opus أو GPT-4.5 أو Gemini Pro بسعر 1.25 إلى 75 دولاراً لكل مليون. ووضع مصنّف صغير أمام موجّه النماذج يخفّض التكاليف عادةً بنسبة 60 إلى 80% في أحمال العمل المختلطة. وإرسال كل شيء إلى نموذج طليعي هو أكثر أخطاء تكلفة الذكاء الاصطناعي شيوعاً التي نصادفها في الإنتاج.
قيّد max_tokens بصرامة. فـ tokens الإخراج أغلى من tokens الإدخال بمقدار 3 إلى 5 أضعاف، وسقف الإخراج الافتراضي البالغ 4,000 token أكبر بكثير مما تحتاجه معظم الردود. حدّد إجابات نعم أو لا بـ 10 tokens، والملخّصات القصيرة بـ 200، ومخرجات JSON المنظّمة بما يتطلّبه مخطّطك مع هامش صغير. فالنموذج يميل أحياناً إلى الإسهاب وإن لم تطلب، وأنت من يدفع ثمن ذلك الإسهاب. وتضييق max_tokens يخفّض كلفة الإخراج بنسبة 30 إلى 50% في معظم الحالات.
اختصر السياق المسترجَع إلى ما يلزم فقط لكل استعلام. فأنظمة RAG كثيراً ما تسترجع 10 إلى 20 مقطعاً وتحشرها كلها في الموجِّه احتياطاً، والنتيجة دفع كلفة آلاف الـ tokens غير ذات الصلة في كل طلب. وإضافة أداة إعادة ترتيب ترشّح المقاطع إلى أعلى 3 إلى 5 مقاطع صلةً تخفّض عادةً استهلاك tokens الإدخال بنسبة 50 إلى 70% دون خسارة في الجودة، بل مع تحسّن فيها غالباً، لأن النموذج لا يتشتّت بسياق غير ذي صلة.
سجّل كل طلب مع عدد الـ tokens والنموذج المستخدم وحالة التخزين المؤقت. فأنت لا تستطيع تحسين ما لا تراه، وتكاليف الذكاء الاصطناعي قد تتبدّل بين عشية وضحاها حين تُطلق ميزة جديدة أو يُعدَّل موجِّه. اضبط تنبيهات إنفاق يومية، وابنِ لوحة معلومات تفصّل الإنفاق حسب الميزة والنموذج ونقطة النهاية. فمعظم تجاوزات التكلفة في الإنتاج التي نصادفها تحدث لأن نمط الاستخدام تغيّر قبل أسبوعين من أن ينظر أحد إلى الفاتورة.
الكلفة لكل مليون token (تسعير 2026)
| النموذج | الإدخال | الإخراج | إدخال مخزّن |
|---|---|---|---|
| GPT-4.5 | $75.00 | $150.00 | $37.50 |
| GPT-4o | $2.50 | $10.00 | $1.25 |
| GPT-4o mini | $0.15 | $0.60 | $0.075 |
| Claude Opus 4 | $15.00 | $75.00 | $1.50 |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 |
| Claude Haiku 4 | $0.80 | $4.00 | $0.08 |
| Gemini 2.5 Pro | $1.25 | $10.00 | N/A |
| Gemini 2.5 Flash | $0.075 | $0.30 | N/A |
الأسئلة الشائعة
أسئلة نتلقاها كل أسبوع
إجابات قصيرة بلغة واضحة. إن لم يكن سؤالك هنا،
GPT-4o: 2.50 $ لكل مليون token إدخال، و10 $ للإخراج. GPT-4o mini: 0.15 $ لكل مليون إدخال، و0.60 $ للإخراج. GPT-4.5: 75 $ لكل مليون إدخال، و150 $ للإخراج. وعند 10 ملايين token شهرياً بتوزيع 30/70 بين الإدخال والإخراج، توقّع كلفة بين 25 و13,000 $ بحسب النموذج.
لمعظم أحمال العمل: GPT-4o mini أو Gemini 2.5 Flash أو Claude Haiku 4، وجميعها أقل من 1 $ لكل مليون token إدخال. ولأفضل توازن بين الجودة والسعر: Claude Sonnet 4 أو Gemini 2.5 Pro.
يخزّن كلٌّ من Anthropic وOpenAI موجِّهات الإدخال الكبيرة مؤقتاً بين الطلبات، فتنخفض كلفة الـ tokens المخزّنة بنحو 90% مقارنةً بغير المخزّنة. وهو الخيار الأنسب لروبوتات المحادثة ذات موجِّهات النظام الثابتة، أو لأنظمة RAG ذات السياق الثابت.
خصم 50% بالضبط على tokens الإدخال والإخراج معاً، مقابل قبول اتفاقية مستوى خدمة (SLA) مدتها 24 ساعة. وهي مناسبة للتصنيف والتلخيص وتوليد التضمينات والتقييم، وغير مناسبة للمحادثة الفورية أو لتجارب المستخدم التفاعلية.
عند مستويات جودة متقاربة، تكون التكلفة متقاربة. فـ Claude Sonnet 4 وGPT-4o متعادلان تقريباً. أما Claude Opus 4 مع التخزين المؤقت للموجِّهات فأرخص بنحو 30% من GPT-4o في أحمال العمل ذات الموجِّهات المستقرة.
(1) فعّل التخزين المؤقت للموجِّهات. (2) استخدم المعالجة المجمّعة (Batch API) حيثما أمكن. (3) وجّه الاستعلامات البسيطة إلى النماذج الصغيرة. (4) قيّد max_tokens بحزم. (5) اختصر سياق الاسترجاع إلى الأساسيات فقط.
تقع نقطة التعادل عند نحو 5,000 $ من إنفاق API شهرياً. دونها، واصِل استخدام واجهات API. وفوقها، تخفّض الاستضافة الذاتية لـ Llama 3.1 أو Mistral التكاليف بنسبة 50 إلى 70%، إن توافرت لديك الخبرة اللازمة في البنية التحتية.
خذ عيّنة تمثيلية من 100 طلب، وقِس متوسّط tokens الإدخال والإخراج، ثم اضربه في حجم الطلبات الشهري، ثم في التكلفة لكل مليون token، وأضِف هامش أمان بنسبة 30%.
فقط في مهام الاستدلال الصعبة التي تفشل فيها النماذج متوسطة الفئة. أما في 80% من أحمال عمل الإنتاج، فإن Sonnet 4 أو GPT-4o أو Gemini 2.5 Pro كافية، وبتكلفة أقل بمقدار 10 أضعاف.
ضمن هامش ±15% لأحمال العمل النموذجية. ويأتي التباين الفعلي من تفاوت طول الموجِّه، وتفاوت طول الإخراج، وحلقات الخطأ وإعادة المحاولة، ومنطق توجيه النماذج. فاستخدم الحاسبة كأداة تخطيط، لا كفاتورة نهائية.
أدوات مماثلة
حاسبات أخرى يفتحها معظم الناس مباشرةً بعد هذه؛ اختر ما يناسب قرارك التالي.
كلفة التطوير زائد كلفة التشغيل الشهرية؛ الصورة كاملةً.
احصل على تقدير دقيق من فريقنا
الحاسبة تعطيك نطاقًا تقريبيًا. أما مكالمة من 30 دقيقة فتعطيك نطاقًا وجدولًا وميزانية ثابتة. استشارة مجانية دون التزام.
ابدأ المحادثة