
مراقبة تكاليف LLM: رصد الإنفاق قبل أن يقفز (2026)
مراقبة تكاليف LLM هي الفارق بين فاتورة مفاجئة بقيمة 412 دولارًا وتنبيه على Slack عند 80% من الميزانية. يُسعَّر Claude Sonnet 5 هذا الشهر بثلاثة دولارات لكل مليون توكن إدخال، وحلقة وكيل واحدة خارجة عن السيطرة قادرة على حرق هذا المبلغ في فترة ما بعد الظهر. معظم الفرق تربط التتبع في يوم واحد؛ أما التنبيه فهو الجزء الذي يتخطونه.
أبرز النقاط:
- ترفق مراقبة تكاليف LLM عدد التوكنات وتقديرًا بالدولار مع كل طلب، ثم تجمّعهما حسب النموذج والفريق.
- تتبّع خمسة مقاييس: التوكنات لكل طلب، والتكلفة لكل ميزة/فريق/نموذج، ونسبة إصابات التخزين المؤقت، والتكلفة لكل محادثة، ومعدل القفزات.
- ميزانيات LiteLLM، أو تتبع Langfuse، أو Datadog LLM Observability، كل منها يوفر رؤية الإنفاق في أقل من يوم.
- لوحات المتابعة تعرض تقديرات؛ وتسعير الإدخال المخزّن وخصومات الدفعات يعني أن الفاتورة تستقر عادة دونها.
ماذا تتتبع مراقبة تكاليف LLM فعليًا؟
مراقبة تكاليف LLM هي ممارسة إرفاق عدد التوكنات وتقدير بالدولار مع كل طلب LLM، ثم تجميع تلك التقديرات حسب النموذج والميزة والفريق حتى يمكن التنبيه على الإنفاق قبل وصول الفاتورة. يُحسب التقدير لكل طلب من أسعار التوكنات المنشورة، ويُجمّع حسب الوسوم التي تدمغها على الاستدعاء، ويُقارن بميزانية محددة مسبقًا.
الرياضيات underneath محايدة تجاه المزود. تفصل استجابة الاستخدام لدى كل مزود التوكنات إلى حقول، وتوثّق وثائق تكلفة Datadog هذه العلاقات صراحة. وتوحّد اصطلاحات OpenTelemetry GenAI الدلالية الحقول نفسها عبر المزودين، لذا فإن لوحة المتابعة المبنية عليها لا تُقيَّد بمزود واحد.
| الحقل | ماذا يعد | يُسعَّر بـ |
|---|---|---|
| input_tokens | كل ما ترسله: موجه النظام، والسجل، والسياق المسترجع، والسؤال | سعر الإدخال الأساسي |
| output_tokens | كل ما يولّده النموذج | سعر الإخراج الأساسي (3-6 أضعاف الإدخال) |
| cache_read_tokens | الإدخال المعاد استخدامه من تخزين مؤقت سابق | 0.1x-0.25x من الإدخال الأساسي |
| cache_write_tokens | الإدخال المكتوب في التخزين المؤقت لأول مرة | ~1.25x من الإدخال الأساسي (TTL 5 دقائق لدى Anthropic) |
| reasoning_tokens | سلسلة التفكير الداخلية، وهي جزء من الإخراج | سعر الإخراج |
ثلاث علاقات تنجز معظم العمل: إجمالي التوكنات = الإدخال + الإخراج؛ والإدخال = غير المخزّن + cache_read + cache_write؛ وتوكنات الاستدلال تقع داخل الإخراج، بسعر الإخراج. أتقن هذه العلاقات فيبقى تقديرك لكل طلب قريبًا من الواقع؛ وتجاهلها فتبتعد لوحة المتابعة عن الفاتورة كل شهر. مراقبة التكاليف ركيزة واحدة من ركائز قابلية مراقبة الذكاء الاصطناعي؛ أما التتبع والتقييمات فهما الركيزتان الأخريان، وجميعها يتقاسم مفردات الحقول نفسها.
لوحة المتابعة تعرض تقديرًا؛ والفاتورة هي المقياس الوحيد للتكلفة الذي لا يُخزَّن مؤقتًا أبدًا.
كم يساوي مليون توكن واحد في LLM؟
يعتمد ذلك على النموذج والاتجاه: مليون توكن يكلّف 0.14 دولار كإدخال DeepSeek-V4 و15.00 دولارًا كإخراج GPT-5.6 Terra، أي فارق 100 ضعف على الوحدة نفسها. إليك أربعة نماذج من بحث التسعير الذي أجريناه في 14 يوليو 2026، وتحقّقنا منه مقابل الصفحات الرسمية:
| النموذج | الإدخال / مليون توكن | الإخراج / مليون توكن | الإدخال المخزّن / مليون توكن |
|---|---|---|---|
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 |
المصادر: أسعار OpenAI وأسعار Anthropic. ملاحظة واحدة: يعمل Claude Sonnet 5 بتسعير تمهيدي عند 2.00 دولار للإدخال / 10.00 دولارات للإخراج حتى 31 أغسطس 2026، ثم يعود إلى الأرقام أعلاه.
المقاييس الخمسة التي تهم فعليًا
خمسة مقاييس تغطي تتبع تكاليف LLM، ومعظم الفرق لا تنبّه إلا على اثنين منها. ابدأ بالصفين الأولين: التوكنات لكل طلب تلتقط تضخم الموجه في يوم ظهوره، والتكلفة لكل فريق هي الرقم الذي ستطلبه المالية في النهاية. المقاييس الثلاثة الأخرى تصقل الصورة بعد ربط الأولين.
| المقياس | كيف تحسبه | لماذا يهم | عتبة التنبيه |
|---|---|---|---|
| التوكنات لكل طلب | اجمع الإدخال + الإخراج لكل استدعاء، وجمّع حسب الميزة | تضخم الموجه وحشو السياق يظهران هنا أولًا | +30% فوق وسيط 7 أيام |
| التكلفة لكل ميزة / فريق / نموذج | اجمع التكلفة المقدرة، وجمّع حسب الوسم أو المفتاح الافتراضي | الوحدة التي تعمل عليها المحاسبة الداخلية والميزانيات فعليًا | 80% من الميزانية الشهرية |
| نسبة إصابات التخزين المؤقت | cache_read ÷ إجمالي توكنات الإدخال | النسب المنخفضة تعني أنك تدفع السعر كاملًا لموجهات متكررة | أقل من 50% على حركة مستقرة |
| التكلفة لكل محادثة / جلسة | اجمع التكلفة عبر كل أدوار جلسة واحدة | يكشف الوكلاء متعددي الأدوار الخارجين عن السيطرة الذين يفوّتهم العرض لكل طلب | ضعف الجلسة عند المئين التسعين |
| معدل القفزات / الشذوذ | التغير اليومي في إجمالي الإنفاق | المقياس الوحيد الذي يمسك بحلقة معطلة قبل الفاتورة | +50% يومًا عن يوم |
ملاحظة حول الدقة: تخزّن Datadog التكلفة على مستوى الطلب بالنانو دولار (أجزاء من مليار من الدولار) وفق وثائق التكلفة الخاصة بها. عند 0.14 دولار لكل مليون توكن، قد يكلّف طلب DeepSeek-V4 واحد أقل من جزء من ألف من السنت، لذا جمّع قبل التقريب، وإلا اختفت حركة النماذج الصغيرة من التقرير.
إن لم تتتبع شيئًا آخر، فتتبع الصفين الأول والثاني. التوكنات لكل طلب هي أقدم إنذار تحصل عليه؛ والتكلفة لكل فريق هي التي تصمد أمام قسم المحاسبة.
ثلاث طرق لربط مراقبة تكاليف LLM
لا تقدّم أي من الصفحات المتصدرة لهذا الاستعلام سطرًا واحدًا قابلًا للتشغيل، لذا إليك ثلاثة إعدادات تعمل. كل منها ينطلق في أقل من يوم، وهي تتكامل: نحن نشغّل الأولين معًا.
ما نشغّله فعليًا في الإنتاج: في إعدادنا، يتحدث كل وكيل عميل مع بروكسي LiteLLM عبر مفتاحه الافتراضي الخاص، مع ميزانية شهرية على كل مفتاح وتتبع Langfuse لكل طلب خلف البروكسي. عندما نشرنا الاثنين معًا، كان تقسيم العمل هو المقصود: البروكسي يفرض السقوف، والتتبع يفسر ما الذي استهلكها. يحمل كل مفتاح من مفاتيح عملائنا أيضًا tpm_limit قدره 100,000 توكن في الدقيقة كصمام أمان ثانٍ؛ واستنادًا إلى وثائق LiteLLM، يرفض البروكسي الطلبات بمجرد بلوغ الحد، وهذا السلوك الموثّق هو ما نعتمد عليه، لا معيارًا قسناه بأنفسنا. يتخطى إعدادنا LiteLLM 1.82.7 و1.82.8 بالكامل، النسختين اللتين أصابتهما حادثة سلسلة التوريد في مارس 2026، ويثبّت وسم الصورة بدل الطفو على latest.
بروكسي LiteLLM: مفاتيح افتراضية + ميزانيات
تشغّل Techsy إعداد بروكسي LiteLLM في الإنتاج مع مفتاح افتراضي واحد لكل عميل وميزانية شهرية على كل مفتاح. الطلب أدناه هو الصيغة الموثّقة من وثائق virtual_keys لدى LiteLLM: استنادًا إلى تلك الوثائق، بمجرد أن يتجاوز الإنفاق التراكمي على هذا المفتاح 50 دولارًا في الشهر، يرفض البروكسي الطلبات اللاحقة بخطأ تجاوز الميزانية بدل تسجيل تحذير بعد فوات الأوان.
curl -X POST http://localhost:4000/key/generate \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"key_alias": "client-acme-search",
"max_budget": 50.0,
"budget_duration": "monthly",
"tpm_limit": 100000,
"models": ["anthropic/claude-sonnet-4-5"]
}'أجرِ الحساب مقابل الأسعار المنشورة: عند 3.00 دولارات / 15.00 دولارًا لكل مليون توكن في Claude Sonnet 5، يشتري 50 دولارًا نحو 16.7 مليون توكن إدخال أو 3.3 مليون توكن إخراج، أي نحو أسبوع من الحركة لأحد وكلاء عملائنا الأخف. هذا بالضبط نصف قطر الانفجار الذي نريده. وtpm_limit هو الصمام الثاني: حلقة خارجة عن السيطرة تصطدم بحد 100 ألف توكن في الدقيقة قبل أن تصطدم بالميزانية الشهرية بزمن طويل. وإسناد كل مستخدم يعمل بالطريقة نفسها عبر نقطة نهاية المستخدمين، ويغطي دليلنا لأفضل أدوات بوابات LLM متى يستحق البروكسي مكانه ومتى يكون مجرد قفزة إضافية.
Langfuse: تتبع التكلفة عبر @observe
يقترن الإكمال التلقائي في Google لعبارة "langfuse monitoring" بهذا الاستعلام، ولسبب وجيه: Langfuse هو الخيار الافتراضي مفتوح المصدر للتتبع. تلتف حزمة Python SDK الخاصة به حول عميل المزود لديك ليصبح كل استدعاء أثرًا يحمل أعداد التوكنات وتكلفة محسوبة، وفق وثائق تتبع Langfuse:
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper, auto-traces
@observe()
def answer(question: str):
return openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": question}],
)
answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cardsتستقر التكلفة على الأثر دون أي حساب للتوكنات من جانبك؛ وجمّع الآثار حسب الجلسة أو معرّف المستخدم لتجميعات لكل ميزة، واستضف ذاتيًا إن كانت البيانات لا تستطيع مغادرة شبكتك.
Datadog LLM Observability: إن كنت تستخدمه بالفعل
إن كان فريقك ينشر وكلاء Datadog بالفعل، فـوثائق تكلفة LLM الخاصة بها هي أعمق مرجع منفرد في هذه الصفحة: تكلفة على مستوى الطلب بالنانو دولار، وcost_tags مخصصة لتفصيلات الفريق والميزة، وقسم استكشاف أخطاء حقيقي لفجوات التكلفة الجزئية. الحد الصادق: إنها حصرية على Datadog. المقاييس لا تغادر المنصة، ولا بديل مفتوح المصدر إن لم يعد التسعير مناسبًا. اخترها للتوحيد، لا للمرونة.
كيف تربط الميزانيات والتنبيهات والمحاسبة الداخلية؟
تربطها في ثلاث طبقات: سقف ميزانية يرفض الطلبات عند الحد، وتنبيه webhook ينطلق عند عتبة مئوية قبل السقف، ومفاتيح افتراضية لكل فريق تحوّل العرض والمحاسبة الداخلية إلى استعلام بدل أن تكون جدالًا. توفر LiteLLM الثلاثة أصليًا؛ والأنماط تنتقل إلى أي بوابة بميزانيات على مستوى المفاتيح.
الميزانية التي تعد فحسب تقرير؛ والميزانية التي ترفض الطلبات عند السقف ضابط.
تنبيهات تنطلق قبل القفزة
اضبط التنبيه عند 80% من السقف، لا عند 100%. تشحن LiteLLM تنبيهات Slack مدمجة: اضبط alerting: ["slack"] وalerting_threshold: 80 في general_settings، ووجّه متغير البيئة SLACK_WEBHOOK_URL إلى قناة، فتهبط رسالة كهذه عندما يتجاوز مفتاح العتبة:
{
"text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}عند 80%، لا يزال أمام الإنسان أيام للتحرك: تخفيض النموذج، أو تشديد الموجه، أو رفع السقف باسم على الموافقة. التنبيه عند 100% تشريح لجثة.
من العرض إلى المحاسبة الداخلية
العرض يعني أن يرى كل فريق إنفاقه؛ والمحاسبة الداخلية تعني أنه يُخصم من ميزانيته. كلاهما يعمل بمكوّن واحد: مفتاح افتراضي لكل فريق، موسوم عند الإنشاء. والتقرير الشهري عندئذ تجميع على جدول الإنفاق:
| الفريق | الميزانية الشهرية | الإنفاق حتى تاريخه | الحالة |
|---|---|---|---|
| search | $50 | $40.18 | انطلق التنبيه عند 80% |
| support-chat | $200 | $112.40 | على المسار |
| evals-batch | $30 | $29.97 | بلغ السقف، يرفض |
| sandbox | $10 | $1.06 | على المسار |
صيغة مثال، لا بيانات عملاء. صف evals-batch هو النمط يعمل كما هو مقصود: العمل الدفعي بلغ سقفه وتوقف، بدل أن ينزف بهدوء إلى الفاتورة. سلوك الفرض موثّق في وثائق virtual_keys لدى LiteLLM، بما في ذلك كيفية إعادة تعيين مدة الميزانية.
لماذا تخالف لوحة المتابعة الفاتورة؟
لأن لوحات المتابعة تسعّر بالسعر المعلن بينما تطبق الفواتير خصومات لا تراها مراقبتك أبدًا. الإدخال المخزّن يستقر عند 0.1x إلى 0.25x من السعر الأساسي، والتشغيل الدفعي بالنصف، وتوكنات الاستدلال تسعّر بسعر الإخراج من داخل عدد الإخراج. عندما يختلف الرقمان، تكون الفاتورة عادة هي الأدنى، والفجوة تقريبًا دائمًا واحدة من أربعة معدّلات.
| معدّل التسعير | المضاعف النموذجي | الأثر على تقديرك |
|---|---|---|
| الإدخال المخزّن (قراءة التخزين) | 0.1x-0.25x من الإدخال الأساسي | ترتفع لوحة المتابعة إن سعّرت إصابات التخزين بالسعر الكامل |
| Batch API | 0.5x على الإدخال والإخراج | المهام غير المتزامنة تكلّف نصف الرقم المتتبع |
| توكنات الاستدلال | 1x سعر الإخراج، معدودة داخل الإخراج | سلاسل التفكير الطويلة تحرق ميزانية الإخراج بصمت |
| كتابة التخزين المؤقت | ~1.25x من الإدخال الأساسي | الطلب الأول في نافذة التخزين يكلّف أكثر قليلًا |
يُظهر كتالوج pydantic/genai-prices المفتوح لماذا تختلف هذه المضاعفات لكل نموذج: كل مزود يضبط عوامل التخزين والدفعات الخاصة به، لذا فإن جدول أسعار واحدًا مبرمجًا مسبقًا يبتعد في اليوم الذي يراجع فيه مزود بطاقاته. وتوثّق وثائق تكلفة Datadog النصف الآخر من المشكلة، فجوات التكلفة الجزئية حيث يعيد حقل توكن مفقود COST UNAVAILABLE لطلب. راجع هناك عندما تقرأ لوحة المتابعة أقل من الفاتورة؛ وراجع جدول الخصومات عندما تقرأ أعلى. الآلية خلف أكبر مضاعف هي تخزين موجهات LLM مؤقتًا، ونسبة إصابات التخزين المرتفعة هي السبب الأكثر شيوعًا لتجاوز التقدير المتتبع الفاتورة الحقيقية.
تقدير التكلفة بلا خصومات التخزين والدفعات سقف، لا توقع.
ما الأدوات التي تتتبع تكاليف LLM فعليًا؟
ست أدوات تغطي معظم إعدادات الإنتاج: Langfuse وLiteLLM وHelicone وPortkey على الجانب مفتوح المصدر وجانب البوابات، وDatadog وBraintrust على الجانب التجاري. الانقسام الصادق هو الفرض مقابل قابلية المراقبة: البروكسي يستطيع رفض الطلبات عند ميزانية، بينما تقيس أداة التتبع الإنفاق بعد وقوعه. معظم الحزم الناضجة تنتهي بواحدة من كل.
| الأداة | النوع | نهج تتبع التكلفة | الخطة المجانية | اخترها إن... |
|---|---|---|---|---|
| Langfuse | مفتوحة المصدر | تكلفة لكل أثر من بطاقات أسعار النموذج، قابلة للاستضافة الذاتية | مجانية ذاتية الاستضافة؛ خطة هواة مجانية على السحابة | أردت مفتوح المصدر وامتلاك البيانات |
| LiteLLM | بروكسي مفتوح المصدر | ميزانيات للمفاتيح والفرق مفروضة عند البوابة | مجانية (OSS)؛ مدفوعة للمؤسسات | احتجت ميزانيات ترفض الطلبات، لا تعد فحسب |
| Helicone | بوابة مفتوحة المصدر | سجلات تكلفة على مستوى البروكسي لكل مفتاح ونموذج | خطة مجانية بحدود معدل | أردت تبديل بروكسي بسطر واحد بلا تغييرات SDK |
| Portkey | بوابة تجارية | ميزانيات مفاتيح افتراضية مع تحليلات تكلفة | خطة مطور مجانية | أردت البوابة والموجهات والتقييمات في لوحة واحدة |
| Datadog LLM Observability | تجارية | مقاييس طلب بالنانو دولار مع cost_tags | تجربة 14 يومًا | كنت تشغّل Datadog لكل شيء آخر بالفعل |
| Braintrust | تجارية | إنفاق مرتبط بالتقييمات لكل مشروع | خطة مجانية | يبدأ عمل التكلفة لديك من التقييمات، لا الفواتير |
تحذير واحد حول محتوى البائعين في هذا المجال: مقارنة Braintrust نفسها لأدوات تتبع التكاليف في 2026 تضع نفسها في المرتبة الأولى وتحذف كل خيار مفتوح المصدر في الجدول أعلاه. اقرأ قوائم البائعين لبياناتها، لا لترتيبها.
لفريق يبدأ من الصفر، نشغّل LiteLLM في الأمام وLangfuse خلفه: البروكسي يفرض الميزانيات، والتتبع يفسرها، والاقتران لا يكلّف شيئًا حتى تتجاوز إلى الخطط المستضافة. إن كنت تزن بين خياري التتبع الافتراضيين، فمقارنتنا بين Langfuse وLangsmith تتعمق في هذا الخيار، وتغطي جولة أفضل منصات قابلية مراقبة الذكاء الاصطناعي المجال كاملًا.
من المراقبة إلى خفض التكاليف
تُظهر المراقبة أين يذهب المال؛ والخطوة التالية هي تقرير كم يذهب إلى هناك. الروافع الثلاثة، بترتيب العائد: خزّن الإدخال المتكرر مؤقتًا، ووجّه الطلبات السهلة إلى نماذج أرخص، وصغّر النموذج حيث لا تزال الجودة تصمد. يغطي دليلنا لـخفض تكاليف LLM API كل رافعة، ومقارنة أسعار LLM API هي المدخل لكل الحسابات أعلاه.
منظورنا: عندما يفاجئ إنفاق LLM عميلًا، نراقب أولًا ونخفض ثانيًا، لا العكس أبدًا. الفرق التي تخزّن مؤقتًا قبل أن تقيس تنتهي عادة بتخزين الموجهات الخاطئة. تخبرك المراقبة أين يذهب المال؛ والتخزين والتوجيه يقرران كم يذهب إلى هناك. إن كانت فاتورتك توجع بالفعل، فـاحصل على استشارة مجانية وسننظر في الأرقام معك.
عن الكاتب
Mert Batur هو المؤسس المشارك لـ Techsy.io، حيث يشحن الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط أنابيب صوتية/SDR لعملاء B2B. يكتب عن حزمة أدوات LLM التي يستخدمها فريق Techsy فعليًا في الإنتاج. تواصل على LinkedIn.
الأسئلة الشائعة
كم يساوي مليون توكن واحد في LLM؟
بالسعر المعلن، من 0.14 دولار إلى 15 دولارًا لكل مليون حسب النموذج والاتجاه: إدخال DeepSeek-V4 يكلّف 0.14 دولار لكل مليون، بينما يكلّف إخراج GPT-5.6 Terra 15 دولارًا. توكنات الإخراج تعمل بـ 3 إلى 6 أضعاف سعر الإدخال لدى كل مزود رئيسي. جدول القسم الأول فيه أربعة نماذج، ومقارنة أسعار LLM API الخاصة بنا تسعّر السبعة عشر جميعها، وتحقّقنا منها مقابل صفحتي OpenAI وAnthropic في يوليو 2026.
ما تحسين تكاليف LLM؟
ممارسة خفض التكلفة لكل طلب دون إسقاط الجودة: تخزين الموجهات مؤقتًا للإدخال المتكرر، وتوجيه المهام السهلة إلى نماذج أرخص، وواجهات Batch API للعمل غير المتزامن، وضبط حجم النموذج لكل ميزة. مراقبة تكاليف LLM هي الشرط المسبق، إذ لا يمكنك تحسين ما لم تنسبه. نسبة إصابات التخزين والتكلفة لكل ميزة هما المقياسان اللذان يشيران إلى أكبر الروافع أولًا.
لماذا LLMs باهظة جدًا؟
الاستدلال مقيد بالحساب: كل توكن مولّد يشغّل تمريرة أمامية كاملة للنموذج على وحدات GPU، ونماذج الاستدلال تنفق توكنات إضافية في التفكير قبل أن تجيب، وتُسعَّر بأسعار الإخراج. الموجهات النظامية الطويلة تضاعف تلك التكلفة عبر كل طلب. تنمو الفاتورة مع الإطناب على جانبي الاستدعاء، ولهذا فالتوكنات لكل طلب هي أول مقياس يستحق المراقبة.
كم يكلّف LLM في الولايات المتحدة؟
أسعار API مقوّمة بالدولار وعالمية: OpenAI وAnthropic وGoogle تتقاضى السعر المعلن نفسه لكل مليون توكن سواء نشأ الطلب في أوهايو أو أوساكا. تظهر الفروق الإقليمية في الاستضافة الذاتية، حيث تختلف ساعات GPU حسب منطقة السحابة، وفي المنصات المستضافة التي تضيف هامشًا. لعمل API، يغيّر الموقع زمن الاستجابة، لا السعر.
كيف أتتبع تكاليف LLM لكل فريق؟
أصدر مفتاحًا افتراضيًا واحدًا لكل فريق عبر بروكسي مثل LiteLLM، وسِم كل مفتاح باسم الفريق عند الإنشاء، وجمّع الإنفاق بهذا الوسم. عندئذ يحمل كل طلب نسبته من لحظة إنشائه، دون تحليل سجلات. جدول العرض في قسم الميزانيات أعلاه هو المنتج النهائي: الفريق، والميزانية الشهرية، والإنفاق حتى تاريخه، والحالة.
Langfuse أم Datadog لتتبع تكاليف LLM: أيهما أختار؟
اختر Langfuse إن أردت مفتوح المصدر والاستضافة الذاتية وبيانات تتحكم بها؛ تشغيله مجاني ويتتبع التكلفة لكل طلب من الصندوق. اختر Datadog فقط إن كان فريقك يشغّله بالفعل للبنية التحتية، إذ ميزات تكلفة LLM فيه لا تغادر المنصة. لمعظم الفرق التي تبدأ من جديد، Langfuse مع بروكسي LiteLLM يتفوق على أي خيار منفرد.
هل تطابق تكاليف LLM المقدرة الفاتورة الفعلية؟
لا، وعادة تكون الفاتورة أدنى. لوحات المتابعة تسعّر بالسعر المعلن بينما يستقر الإدخال المخزّن عند 0.1x إلى 0.25x والمهام الدفعية عند 0.5x، لذا يرى عبء عمل عالي التخزين الفاتورة الحقيقية تهبط جيدًا دون التقدير المتتبع. حقول التوكن المفقودة تدفع الخطأ في الاتجاه الآخر. جدول الانحراف أعلاه يسرد كل مضاعف وأين تنظر.
كيف أنبّه على قفزات إنفاق LLM؟
اضبط تنبيه عتبة عند 80% من ميزانية كل فريق الشهرية، يُوصل إلى Slack عبر webhook، مع تنبيه شذوذ يومي عند +50% للحلقات التي تحرق بسرعة. تشحن LiteLLM نمط العتبة أصليًا عبر إعداد alerting_threshold. التنبيه عند 80% يترك أيامًا للرد؛ والتنبيه عند 100% يؤكد فقط أن السقف أدى وظيفته.
هل يوجد متتبع تكاليف LLM مجاني؟
نعم، ثلاثة موثوقة. Langfuse ذاتية الاستضافة مجانية ومفتوحة المصدر، مع خطة هواة مجانية على السحابة وفق صفحة أسعار Langfuse. ميزانيات المفاتيح المدمجة في LiteLLM لا تكلّف شيئًا على البروكسي مفتوح المصدر. خطة Helicone المجانية تغطي سجلات التكلفة على مستوى البروكسي بحدود معدل. الخطط المجانية تغطي المراقبة؛ والفرض والتنبيه على نطاق واسع حيث تبدأ الخطط المدفوعة.
الخلاصة
اختر مسار إعداد اليوم، لأن التنبيه الذي ستريده بعد ستة أسابيع يستغرق ربطه فترة ما بعد الظهر الآن. النسخة المختصرة:
- تتبّع التوكنات لكل طلب والتكلفة لكل فريق أولًا؛ وأضف المقاييس الثلاثة الأخرى بمجرد أن تعمل.
- الميزانية التي ترفض الطلبات ضابط؛ والتي تعد فحسب تقرير.
- اضبط التنبيه عند 80%، على Slack، قبل أن تفاجئ الفاتورة أي أحد.
- لوحة المتابعة تقدير؛ وتسعير الإدخال المخزّن والدفعات يعني أن الفاتورة تستقر عادة دونها.
إن كنت تفضّل أن ينظر أحد في أرقامك معك، فـاحصل على استشارة مجانية.