Techsy
اتصل بنا
ابدأ
العودة للمدونة
comparisons

أفضل أطر عمل مفتوحة المصدر لتقييم LLM في 2026 (واحد منها ليس مفتوح المصدر فعلاً)

بقلم Mert Batur
Aug 4, 2026
15 قراءة
جدول المحتويات
أفضل أطر عمل مفتوحة المصدر لتقييم LLM في 2026 (واحد منها ليس مفتوح المصدر فعلاً)

أفضل أطر عمل مفتوحة المصدر لتقييم LLM في 2026 (واحد منها ليس مفتوح المصدر فعلاً)

السطر الأول من ملف LICENSE في مستودع Arize Phoenix يقول "Elastic License 2.0 (ELv2)". ليس Apache. وليس MIT. أحد أكثر أطر تقييم LLM مفتوحة المصدر توصيةً ليس مفتوح المصدر بحسب تعريف OSI، وتكاد كل صفحة تتصدّر نتائج هذا البحث تكرر الادعاء ذاته. وهذا ما فعلته إحدى صفحاتنا أيضًا، حتى اليوم. في 2026-08-04 قرأنا يدويًا ملف الترخيص وسجل الالتزامات على الفرع الرئيسي لثمانية أطر عمل، إضافة إلى ثلاثة أخرى ما زالت الصفحات المتصدّرة توصي بها، ثم ثبّتنا ستة منها وشغّلنا نفس الحالات العشر عبر كل واحد. نحن لا نبيع إطار تقييم، فلا حكم أدناه يحمي منتجًا.

أبرز النقاط

  • Arize Phoenix يُنشر بترخيص Elastic License 2.0، وهو ترخيص لا تعتمده OSI كمفتوح المصدر.
  • آخر التزام لـ UpTrain على main كان في 2024-07-29. لا تبدأ مشروعًا جديدًا عليه.
  • أمر pip install promptfoo يجلب حزمة مغلّفة من طرف ثالث. المشروع الحقيقي يُنشر على npm.
  • Ragas لم يشهد أي التزام منذ 2026-02-24، وانتقل إلى منظمة GitHub جديدة باسم vibrantlabsai.

أي إطار عمل مفتوح المصدر لتقييم LLM يجب أن تثبّته في 2026؟

اختر بناءً على القيد، لا الترتيب. للتأكيدات على هيئة pytest داخل مجموعة اختبارات قائمة، ثبّت DeepEval. لملف YAML وواجهة سطر أوامر تناسب أي مكدّس لغوي، ثبّت promptfoo. لأنظف فصل بين الجيد والسيئ رصدناه، ثبّت Opik. الثلاثة جميعًا مرخّصة بـ Apache-2.0 أو MIT.

إليك عملية التدقيق. ثمانية أطر عمل ضمن النطاق، إضافة إلى ثلاثة أخرى ما زالت الصفحات المتصدّرة لهذا البحث توصي بها.

الإطارالترخيص (تم التحقق منه بتاريخ 2026-08-04)آخر إصدارآخر التزام على mainالتثبيتشكل الواجهةالأفضل فيتكلفة التبديل
DeepEvalApache-2.0v4.1.5 (2026-07-29)2026-08-03pip install deepevalتأكيدات على نمط pytestحراسة مجموعة اختبارات بايثونمنخفضة، المقاييس كائنات بسيطة
PromptfooMIT0.121.20 (2026-07-31)2026-08-04npm install promptfooملف YAML إضافة إلى CLIاختبار موجّهات دون التقيّد بلغة برمجةمتوسطة، صيغة الإعداد خاصة بـ promptfoo
OpikApache-2.02.2.17 (2026-08-04)2026-08-04pip install opikاستدعاءات .score() مستقلةالحصول على درجة صالحة في أقل عدد أسطرمنخفضة، المقاييس تعمل دون المنصّة
Arize PhoenixElastic License 2.0، غير معتمد من OSIv19.15.0 (2026-08-03)2026-08-04pip install arize-phoenix-evalsمُقيّمات جاهزة فوق dataframeتصنيفات نجاح/فشل ثنائيةمنخفضة للتقييمات، مقيّدة بالترخيص إن أعدت بيعها
RagasApache-2.0v0.4.3 (2026-01-13)2026-02-24pip install ragasدالة evaluate() غير متزامنة فوق مجموعة بياناتمقاييس استرجاع RAGمنخفضة، الصفوف قواميس بسيطة
EvidentlyApache-2.0v0.7.21 (2026-03-10)2026-05-02pip install evidentlyواصفات إضافة إلى تقرير HTMLتقارير دفعية عبر صفوف كثيرةمرتفعة، مقياس الدرجات معكوس
Inspect AIMIT0.3.252 (2026-08-04)2026-08-04pip install inspect-aiملفات مهام بايثون إضافة إلى CLIقياس أداء نموذج معياريًامرتفعة، المهام خاصة بـ Inspect
GiskardApache-2.02.19.2 على PyPI (2026-07-06)، سلسلة v22026-08-04pip install giskardواجهة فحص scanفحوصات ثغرات آليةمتوسطة، مخرجات الفحص خاصة بـ Giskard
lm-evaluation-harnessMITv0.4.12 (2026-05-11)2026-07-13pip install lm-evalCLI فوق تعريفات مهاممعايير قياسية للنماذجمرتفعة، تعريفات المهام خاصة بأداة القياس (harness)
UpTrainApache-2.0v0.7.1 (2024-05-14)2024-07-29pip install uptrainمشغّلات فحص بايثونلا شيء نبدأ به اليومغير قابل للتطبيق
Deepchecksلم يكتشفه GitHub0.19.1 (2024-12-15)2025-11-24pip install deepchecksكائنات suite وcheckتحقق من بيانات جدولية ونماذج تعلم آليمرتفعة، الحزم suites خاصة بـ Deepchecks

التواريخ هي تاريخ آخر التزام على الفرع الرئيسي لكل مشروع حتى 2026-08-04. صفحة المستودع في GitHub تعرض آخر دفعة على أي فرع، وهو تاريخ لاحق لمشروعين هنا: UpTrain في 2024-08-18 وDeepchecks في 2025-12-28. لا مستودع منهما مؤرشف.

عمود تكلفة التبديل هو ما يتجاهله الناس ثم يندمون عليه. الدرجات مجرد أرقام، فالانتقال بين DeepEval وRagas وOpik وأداة phoenix-evals يعني غالبًا إعادة كتابة حلقة تكرار فقط. أما ترك promptfoo أو Inspect AI فيعني إعادة كتابة صيغة إعداد أو مهام لا مكافئ لها في مكان آخر، وترك Evidently يعني تدقيق كل عتبة كتبتها، لأن مقياسه يعمل بالاتجاه المعاكس. اثنان من الأطر التي ما زالت الصفحات المتصدّرة توصي بها لم يصدرا إصدارًا جديدًا منذ 2024.

تريد مستويات ومنصات مستضافة وترتيبًا واضحًا بدلًا من ذلك؟ هذه مهمة مختلفة، وقد أنجزناها بالفعل في مقارنتنا المرتبة لأدوات تقييم LLM بما فيها المنصات المدفوعة.

أطر تقييم LLM الثمانية مصنّفة بحسب طريقة التثبيت

شكل التثبيت هو ما ستتعايش معه، لذلك اخترناه أساسًا للتصنيف.

مكتبات بايثون تستوردها داخل الاختبارات

DeepEval (pip install deepeval، Apache-2.0) يغلّف مقاييس LLM في تأكيدات على نمط pytest: تبني LLMTestCase، وتسلّمها إلى assert_test، فيفشل الاختبار إذا نزلت الدرجة عن عتبتك. الأفضل في وضع بوابة جودة بجانب اختبارات الوحدة التي يشغّلها الفريق أصلًا. اختره إن كانت تقييماتك يجب أن تعيش في نفس مهمة CI مع كل شيء آخر.

إفصاح واحد، يُذكر مرة واحدة: DeepEval بناه فريق Confident AI، وهو شريك مدفوع في منشورين آخرين على هذا الموقع، منها المقارنة المرتبة التي تحيل إليها هذه الصفحة. لا يحصل على أي معاملة خاصة هنا، وكل رابط لـ DeepEval في هذه الصفحة يشير إلى مستودع GitHub.

Ragas (pip install ragas، Apache-2.0) هو الخيار المخصص لـ RAG: دالة evaluate() تأخذ صفوف السؤال والسياق والإجابة وتُرجع درجات لكل مقياس بشكل غير متزامن. الأفضل في قياس جودة الاسترجاع داخل خط معالجة بايثون. انتقل مستودعه من explodinggradients إلى vibrantlabsai، وكان آخر إصدار له v0.4.3 في 2026-01-13، ولا التزامات منذ 2026-02-24. اختره إن كانت مقاييس RAG هي كل المطلوب وكان مستودع هادئ مقبولًا لديك، وراجع مجموعة أدوات RAG الأوسع.

Opik (pip install opik، Apache-2.0، من Comet) يوفّر مقاييس يمكنك استدعاؤها بشكل مستقل. اضبط OPIK_TRACK_DISABLE=true وستعمل AnswerRelevance().score() دون حساب ودون خادم محلي ودون ملف إعداد، وهو ما لا يُعلن عنه التسويق للمنتج. الأفضل في الحصول على درجة حقيقية في أقل عدد أسطر. اختره إن أردت المقاييس الآن والمنصّة لاحقًا ربما.

Evidently (pip install evidently، Apache-2.0) يعامل التقييمات كواصفات فوق مجموعة بيانات ويكتب تقرير HTML كأثر جانبي. الأفضل في التقارير الدفعية عبر صفوف كثيرة بدلًا من بوابة ثنائية. درجاته لمقاييس LLM معكوسة: 1.0 تعني غير موثوقة الأساس (unfaithful). اختره إن كان ما تدين به لأحد هو تقرير قابل للمشاركة، لا بناء أحمر.

Giskard (pip install giskard، Apache-2.0) يفحص نموذجًا بحثًا عن ثغرات بدلًا من تسجيل درجات لمجموعة بيانات كتبتها. حزمة PyPI تحلّ سلسلة v2، وملف README الخاص بالمشروع نفسه يذكر أن v2 "لم تعد تحت الصيانة النشطة". الأفضل في فحوصات آلية على نمط الفريق الأحمر. اختره إن أردت أن تُكتشف الثغرات لك بدلًا من مقاييس LLM-as-a-judge التي تحددها بنفسك.

أدوات CLI وإعدادات تعمل على ملف YAML

promptfoo (npm install promptfoo، MIT) هو أداة سطر أوامر تقرأ ملف YAML: تعلن عن مزودين وحالات اختبار وتأكيدات، تشغّل npx promptfoo eval، وتحصل على نجاح/فشل لكل حالة إضافة إلى واجهة نتائج محلية. الأفضل في تقييم الموجّهات عندما لا يكون تطبيقك مكتوبًا بلغة بايثون. اختره إن كان يجب أن تكون بوابة الجودة لديك ملف إعداد يستطيع تعديله زميل لا يعرف بايثون.

فئة أدوات القياس المعيارية (harness) والحزم المدمجة بمنصّات

Inspect AI (pip install inspect-ai، MIT) قادم من معهد سلامة الذكاء الاصطناعي البريطاني (UK AI Safety Institute) ويقيّم النماذج مقابل مهام تحددها في بايثون، بتجريدات حقيقية للحلّالين والمُقيّمين ومُشاهد تشغيل. الأفضل في قياس أداء النماذج معياريًا بتعريفات مهام قابلة لإعادة الإنتاج. اختره إن كان الشيء قيد الاختبار نموذجًا لا تطبيقك.

Arize Phoenix (pip install arize-phoenix-evals) يمنحك مُقيّمات جاهزة مثل FaithfulnessEvaluator وCorrectnessEvaluator تُرجع تصنيفًا ثنائيًا إضافة إلى درجة. الأفضل في تصنيفات حتمية يمكنك بناء بوابة عليها دون اختيار عتبة. ترخيصه هو سبب وجود القوس في عنوان هذا المقال، وله قسم مستقل تاليًا.

هل Arize Phoenix مفتوح المصدر؟

لا، ليس بحسب التعريف الذي تتبناه Open Source Initiative. Arize Phoenix يُنشر بترخيص Elastic License 2.0 (ELv2). السطر الأول من ملف LICENSE الخاص بالمستودع يقول ذلك، وPyPI يُعلن بشكل مستقل license: Elastic-2.0 على الإصدار v19.15.0. المصدر قابل للقراءة والتفريع والاستضافة الذاتية. استخدام واحد فقط مقيَّد.

القيد المهم هو التالي: ELv2 يحظر تقديم البرنامج لأطراف ثالثة كخدمة مستضافة أو مُدارة. اقرأ هذا بعناية، لأنه يقيّد عددًا أقل بكثير مما يبدو. إن كنت تثبّت arize-phoenix-evals لتسجيل درجات تطبيقك الخاص، فلن يلمسك ELv2 إطلاقًا. أما إن كنت شركة استشارية أو فريق منصّة يحزم Phoenix ضمن خدمة تقييم تبيعها لعملاء خارجيين، فسيلمسك. هذا هو الفارق كله، وتعريف المصدر المفتوح هو ما يخفق فيه ELv2، تحديدًا البنود المتعلقة بقيود مجال الاستخدام.

الترخيصمعتمد من OSI؟يمكن الاستضافة الذاتية؟يمكن تقديمه كخدمة مُدارة؟الأطر في هذه القائمة
Apache-2.0نعمنعمنعمDeepEval، Ragas، Opik، Evidently، Giskard، UpTrain
MITنعمنعمنعمpromptfoo، Inspect AI، lm-evaluation-harness
Elastic License 2.0لانعملاArize Phoenix

كل صفحة تتصدّر نتائج هذا البحث حاليًا تصنّف Phoenix تحت "مفتوح المصدر"، وكذلك فعلنا نحن. مقارنتنا المرتبة لأدوات تقييم LLM تصف Phoenix بأنه مفتوح المصدر بالكامل، وهذا خطأ، ويجري تصحيحه الآن. Phoenix متاح المصدر (source-available)، لا مفتوح المصدر، والفارق لا يهم إلا إن كنت تخطط لبيعه كخدمة. وإن كان ما تحتاجه فعلًا هو التتبّع لا التسجيل، فذلك ينتمي إلى منصات مراقبة الذكاء الاصطناعي، لا إلى هنا.

أي هذه الأطر ما زال يحظى بصيانة نشطة؟

معظمها. ستة من أصل أحد عشر مستودعًا فحصناها تلقّت التزامًا على main في 2026-08-03 أو 2026-08-04: DeepEval وpromptfoo وOpik وArize Phoenix وInspect AI وGiskard. اثنان لم يصدرا إصدارًا منذ 2024. واحد هدأ خلال 2026 بعد تغيير منظمة GitHub.

أطر لن نبدأ عليها مشروعًا جديدًا في 2026

UpTrain ميت. آخر التزام له على main كان في 2024-07-29، وآخر إصدار له، v0.7.1، كان في 2024-05-14، ما يجعله باردًا لسنتين على أي من المقياسين. المستودع لا يزال موجودًا وما زال مرخّصًا بـ Apache-2.0، فلا شيء يمنعك، لكن البدء بعمل جديد على مكتبة تقييم مهجورة قرار ستضطر لتفسيره لاحقًا.

Deepchecks يستحق النسخة الدقيقة. لم يصدر إصدارًا منذ 0.19.1 في 2024-12-15، رغم أن المستودع ما زال يتلقى التزامات، وكان آخرها على main بتاريخ 2025-11-24. أناس ما زالوا يعملون عليه؛ لكن لم يقطع أحد إصدارًا منذ أكثر من ثمانية عشر شهرًا. لا UpTrain ولا Deepchecks مؤرشف على GitHub، ولا أحدهما أُغلق أمام المساهمات.

Ragas له تواريخ ولا شيء غيرها. آخر إصدار v0.4.3 في 2026-01-13، ولا التزامات منذ 2026-02-24، والمستودع انتقل من explodinggradients إلى vibrantlabsai. لم نجد تفسيرًا موثّقًا لسبب تغيير المنظمة، فلن نختلق واحدًا. المستودع الهادئ ليس بالضرورة مستودعًا معطلًا: كود Apache-2.0 الذي يحسب درجة موثوقية اليوم سيحسبها العام المقبل أيضًا. الخطر هو الاعتماديات غير المرقّعة، وهو بالضبط ما آذانا في الاختبار أدناه.

صفحات أخرى في الصفحة الأولى لنتائج هذا البحث ما زالت توصي بكل من UpTrain وDeepchecks، دون أي تاريخ مرفق بالتوصية. إطار عمل لم يصدر إصدارًا منذ ديسمبر 2024 قرار متعلق بالاعتماديات، لا قرار متعلق بالميزات.

هل تحتاج إلى إطار تقييم أم أداة قياس معيارية (harness)؟

إطار تقييم التطبيقات يسجّل درجات لمخرجات تطبيقك الخاص مقابل بياناتك الخاصة. DeepEval وRagas وpromptfoo وOpik وphoenix-evals وEvidently تفعل ذلك جميعًا. أما أداة القياس المعيارية للنموذج (harness) فتقيس أداء نموذج مقابل مهام عامة موحّدة بدلًا من ذلك. lm-evaluation-harness وInspect AI تفعلان ذلك. اختيار الفئة الخاطئة هو أغلى خطأ في هذه الصفحة.

البُعدإطار تقييم التطبيقاتأداة قياس معيارية للنموذج
ما تختبرهموجّهك واسترجاعك ومخرجاتكنقطة تفتيش نموذج أو نقطة نهاية
ما توفّرهأسئلتك وسياقاتك وإجاباتك الخاصةاسم مهمة من مجموعة موحّدة
المخرج النموذجيدرجة لكل مقياس لكل صف، إضافة إلى نجاح/فشلدقة على معيار منشور
أين يعملCI الخاص بك، عند كل طلب سحبتشغيل لمرة واحدة لكل نموذج أو ضبط دقيق
أمثلةDeepEval، Ragas، promptfoo، Opik، Evidently، phoenix-evalslm-evaluation-harness، Inspect AI

نمط الفشل ملموس. شخص ما يوصّل lm-evaluation-harness لاختبار روبوت محادثة RAG خاص به، يحصل على مجموعة درجات MMLU، ولا يتعلّم شيئًا بالضبط عمّا إذا كان مسترجعه يعيد المقاطع الصحيحة. الدرجات حقيقية. لكنها تقيس النموذج الأساسي، وهو ما لم يكن أحد قلقًا بشأنه.

شكل Inspect AI ينبع من أصله: بُني في معهد سلامة الذكاء الاصطناعي البريطاني تحت رخصة MIT لتقييم النماذج الحدودية، لذا الحلّالون والمُقيّمون والمهام عناصر أساسية أولى، وتطبيقك ليس مفهومًا يملكه أصلًا. هذا سبب جيد لاستخدامه فيما صُمم له. وإن كانت مشكلتك هي الوكلاء لا الجولات المفردة، فتقييم الوكلاء في الإنتاج تخصص مختلف تمامًا، وخوادم استدعاء الأدوات لها معالجتها الخاصة في دليلنا لـتقييم خوادم وأدوات MCP.

ماذا حدث عندما ثبّتنا ستة منها وشغّلنا نفس الحالات العشر

في 2026-08-04 ثبّتنا ستة من هذه الأدوات في بيئات بايثون 3.11.14 جديدة (إضافة إلى npm لـ promptfoo) وسجّلنا درجات لمجموعة RAG واحدة مكوّنة من 10 عناصر متطابقة، بحكَم واحد هو openai/gpt-4o-mini عبر OpenRouter وحرارة (temperature) صفر. سبعة عناصر كانت صحيحة. ثلاثة كانت معطوبة بثلاث طرق مختلفة: واحد يناقض سياقه، وآخر يختلق تفاصيل، وثالث نثر بليغ لا يجيب على السؤال إطلاقًا. شُغّل كل إطار مرتين، تباعًا.

الإطار (10 عناصر، الحكم openai/gpt-4o-mini، تشغيل 2026-08-04)التثبيتالأسطر حتى أول درجةزمن التشغيل، تشغيل 1 / تشغيل 2العيوب المُكتشفة على مقياس الموثوقيةالعناصر التي انحرفت عبر تشغيلين
DeepEval 4.1.526.6 ثانية21126.8 ثانية / 134.1 ثانية2 من 3، فاته الإجابة غير ذات الصلة0 من 10
Ragas 0.4.356.1 ثانية إضافة إلى تثبيت إصدار محدد2321.2 ثانية / 25.7 ثانية3 من 31 من 10
promptfoo 0.121.20337.9 ثانية14 إضافة إلى 40 لمجموعة البيانات34.3 ثانية / 44.4 ثانية3 من 32 من 10
Opik 2.2.17142.3 ثانية1554.1 ثانية / 44.8 ثانية3 من 34 من 10
Phoenix evals 3.3.08.7 ثانية1841.2 ثانية / 44.0 ثانية3 من 30 من 10
Evidently 0.7.2142.6 ثانية إضافة إلى openai259.9 ثانية / 9.7 ثانية3 من 34 من 10

خمسة من ستة مقاييس موثوقية اكتشفت العيوب الثلاثة جميعًا. النتائج الثلاث أدناه هي سبب وجود هذا القسم.

مقاييس الصلة ليست مقاييس جودة، ومقياسان منها سجّلا لكذبة واثقة درجة أعلى من إجابة صحيحة. مقياس ResponseRelevancy في Ragas سجّل للعنصر الذي يزعم أن HTTP 404 هو خطأ خادم من فئة 5xx درجة 0.777، أعلى من درجتين من الإجابات الصحيحة السبع، وسجّل للعنصر الذي اختلق حدود معدل استخدام درجة 0.813، أعلى من أربع منها. مقياس answer-relevance في promptfoo فعل الشيء نفسه: 0.800 لعنصر الـ404، نجاح واضح مقابل عتبة 0.7، بينما أخفق مع q01 الصحيح عند 0.679. ليست علة برمجية. الإجابة الخاطئة الواثقة تعالج السؤال بمثالية. لكن إن كانت الصلة هي الرقم على لوحة متابعتك، فسيبدو الهلوسة البليغة أفضل مخرجاتك.

بوابة تعتمد على الموثوقية وحدها تفوّت الإجابة غير ذات الصلة. DeepEval سجّل للعنصر الذي لا يجيب على السؤال إطلاقًا درجة 1.000 موثوقية، نجاح واضح، وهذا منطقي: إجابة لا تؤكد شيئًا عن السياق لا تناقض شيئًا فيه. مقياس الصلة وحده اكتشفه، عند 0.000. هذا هو الإخفاق الوحيد على مقياس الموثوقية في الجدول أعلاه. لكل مقياس بمفرده ثغرة؛ والزوج معًا يغطي كليهما.

المُقيّمات الثنائية كانت مستقرة عند حرارة صفر. أما المُقيّمة تدرجيًا فلم تكن كذلك. Phoenix وDeepEval لم يحرّكا أي عنصر من العشرة عبر تشغيلين متطابقين. Opik حرّك أربعة، جميعها على AnswerRelevance، على شبكة درجات بفواصل 0.05؛ وEvidently حرّك أربعة أيضًا. لم ينقلب أي حكم هنا بسبب الانحراف، لكن q01 الصحيح في promptfoo هبط من 0.679 إلى 0.642 مقابل عتبة 0.700، وهذا هو شكل بوابة CI متقلبة.

ملاحظتان أصغر: ثلاثة من ستة (DeepEval وOpik وPhoenix) ثُبّتت وعملت بسلاسة من المرة الأولى، بينما رفض Ragas الاستيراد حتى ثبّتنا langchain-community<0.4. promptfoo وحده أبلغ عن استهلاك رموز الحكم (judge tokens)، 16,011 رمز تأكيد في التشغيل الأول و16,010 في الثاني.

حدود هذا الاختبار، بوضوح. n = 10 اختبار دخان لا معيار قياسي: يخبرك عن سهولة الاستخدام والعيوب العمياء، لا عن دقة المقياس. حكم واحد فقط سجّل كل شيء، وحكم أكبر سيغيّر كل رقم، على الأرجح بما في ذلك النتيجتان الإيجابيتان الكاذبتان اللتان أنتجهما DeepEval وRagas على نفس العنصر الصحيح. تشغيلان يثبتان وجود الانحراف ولا يمكنهما وصف طبيعته. الإجابات كانت مكتوبة مسبقًا، فلا شيء هنا يختبر التوليد أو التتبّع أو إدارة مجموعات البيانات، ما يجعل زمن تثبيت promptfoo البالغ 337.9 ثانية يبدو أسوأ مما يستحق. "الأفضل" يعني دائمًا الأفضل لقيد معيّن: بوابة CI أو مقاييس RAG أو واجهة مستخدم، كل منها يغيّر الإجابة، وكذلك الفرق بين التقييم عبر الإنترنت ودون اتصال.

الفحص نفسه، مكتوب بثلاث طرق

أسرع طريقة لاختيار شكل الواجهة هي قراءة نفس التأكيد ثلاث مرات. إليك فحص موثوقية على عنصر واحد في DeepEval وRagas وpromptfoo، مقتطف من السكربتات التي شغّلناها فعلًا. أسماء المقاييس تختلف؛ نحيل إلى كيف تعمل مقاييس LLM-as-a-judge فعلًا بدلًا من إعادة تعريفها هنا.

python
# DeepEval 4.1.5: على نمط pytest، يُفشل الاختبار إذا نزل عن العتبة
from deepeval import assert_test
from deepeval.models import GPTModel
from deepeval.metrics import FaithfulnessMetric
from deepeval.test_case import LLMTestCase

judge = GPTModel(
    model="openai/gpt-4o-mini",
    base_url="https://openrouter.ai/api/v1",
    api_key=OPENROUTER_KEY,
)

def test_faithfulness():
    case = LLMTestCase(
        input=question,
        actual_output=answer,
        retrieval_context=[context],
    )
    assert_test(case, [FaithfulnessMetric(threshold=0.7, model=judge)])
python
# Ragas 0.4.3: انتبه لمسار الاستيراد. `from ragas.metrics import Faithfulness`
# يرفع ImportError في هذا الإصدار؛ المقياس المحدد انتقل مكانه.
from ragas import evaluate, EvaluationDataset
from ragas.metrics._faithfulness import Faithfulness
from ragas.llms import LangchainLLMWrapper
from langchain_openai import ChatOpenAI

judge = LangchainLLMWrapper(
    ChatOpenAI(model="openai/gpt-4o-mini",
               base_url="https://openrouter.ai/api/v1")
)

result = evaluate(
    dataset=EvaluationDataset.from_list(rows),
    metrics=[Faithfulness(llm=judge)],
)
yaml
# promptfoo 0.121.20: npm install promptfoo، ثم npx promptfoo eval
providers:
  - id: echo          # سجّلنا درجات لإجابات مكتوبة مسبقًا بدلًا من توليدها
defaultTest:
  assert:
    - type: context-faithfulness
      threshold: 0.7
tests:
  - vars:
      query: "Is HTTP 404 a client error or a server error?"
      context: "HTTP 404 Not Found is in the 4xx class, which denotes client errors."
      output: "HTTP 404 is a server error in the 5xx class."

سطور التثبيت تحمل من الفخاخ أكثر مما يحمله الكود، وكل تعليق أدناه هو شيء كلّفنا وقتًا فعليًا في 2026-08-04:

bash
# النسخة الحقيقية من promptfoo تُنشر على npm. حزمة PyPI بنفس الاسم
# هي حزمة مغلّفة من طرف ثالث: https://pypi.org/project/promptfoo/ مقابل
# https://www.npmjs.com/package/promptfoo
npm install promptfoo

# pip install giskard يحلّ سلسلة v2، التي يذكر README الخاص بالمشروع نفسه
# أنها لم تعد تحت الصيانة النشطة.
pip install giskard

# lm-evaluation-harness يُثبَّت باسم الحزمة lm-eval.
pip install lm-eval

# Evidently لا يسحب openai، والحكم ينهار وقت الاستدعاء لا وقت الاستيراد،
# بعد أن تكون قد بنيت مجموعة البيانات بالفعل.
pip install evidently openai

# Ragas 0.4.3 لن يستورد ضد langchain-community 0.4.x.
pip install ragas "langchain-community<0.4"

هل يمكنك إفشال بناء اعتمادًا على درجة تقييم؟

نعم. كل إطار هنا يُرجع درجة رقمية أو ثنائية، وكل واحد سيخرج برمز غير صفري عندما يفشل تأكيد عتبة، وهذا كل ما تحتاجه GitHub Actions لجعل بناء ما أحمر. توصيل رمز الخروج هو الجزء السهل. اختيار عتبة لن يتجاوزها نموذج الحكم عن طريق الخطأ هو الجزء الذي يستغرق أسبوعًا.

هذا هو شكل سير العمل الذي نشغّله، مثبّت على الإصدارات من اختبارنا في 2026-08-04:

yaml
name: evals
on: [pull_request]

jobs:
  eval:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - uses: actions/setup-python@v5
        with:
          python-version: "3.11.14"
      - run: pip install deepeval==4.1.5

      - name: Score the golden set
        env:
          # ثبّت الحكم. ترقية النموذج منتصف الربع تغيّر كل درجة.
          JUDGE_MODEL: openai/gpt-4o-mini
          # العتبات تعيش في مكان واحد، تقرأها منشئات المقاييس.
          EVAL_THRESHOLD: "0.7"
          OPENROUTER_API_KEY: ${{ secrets.OPENROUTER_API_KEY }}
        run: deepeval test run tests/evals/

مشكلتان تظهران قبل العتبة نفسها. أولًا، استدعاءات الحكم هي استدعاءات شبكة: تشغيل DeepEval لدينا من 10 عناصر استغرق 126.8 ثانية لأن .measure() تسلسلية، ومجموعة بيانات ذهبية من 200 عنصر على هذا المسار استراحة قهوة في كل طلب سحب. كل إطار آخر في الاختبار يوازي التنفيذ افتراضيًا، وهو أكبر رافعة منفردة لزمن جدار CI.

ثانيًا، التقلب. عند حرارة صفر، حرّك Opik وEvidently كل منهما أربعة من عشرة عناصر بين تشغيلين متتاليين، واستقرت الإجابة الصحيحة في promptfoo عند 0.679 ثم 0.642 مقابل بوابة 0.700. المعالجات مملة وتنجح: شغّل مجموعة بيانات ذهبية ثابتة لا تتغير إلا بحسب طلب السحب، ثبّت نموذج الحكم، فضّل المُقيّمات الثنائية حيث يكفي تصنيف، وابنِ البوابة على فارق لا على حد أدنى مطلق. هذه النقطة الأخيرة تهم أكثر ما تهم في التقييم متعدد الجولات، حيث تنتج المحادثة الواحدة درجات كثيرة يمكن أن تتذبذب كل منها.

للمقارنة على نطاق أوسع: استطلاع حالة هندسة الوكلاء من LangChain (1,340 ردًا، جُمعت بين 18 نوفمبر و2 ديسمبر 2025، ونُشرت في 12 يونيو 2026) وجد أن 89% من المؤسسات طبّقت شكلًا ما من المراقبة لوكلائها، بينما 52.4% فقط تشغّل تقييمات دون اتصال على مجموعات اختبار. المراقبة شائعة. أما البوابة فليست كذلك.

ما الذي كنا سنثبّته هذا الأسبوع

أربعة أشياء يجب أخذها بعين الاعتبار. Arize Phoenix متاح المصدر تحت رخصة Elastic License 2.0 وغير معتمد من OSI كمفتوح مصدر، ما لا يغيّر شيئًا لمعظم القراء ويغيّر كل شيء إن كنت تعيد بيع أدوات التقييم. UpTrain ميت، وصفحات دون تاريخ ما زالت توصي به. Deepchecks لم يقطع إصدارًا منذ ديسمبر 2024 أيضًا، رغم أن مستودعه ما زال يتلقى التزامات. ولكل مقياس موثوقية ومقياس صلة ثغرة يغطيها الآخر، فابنِ بوابتك على الاثنين معًا. والدرجات المتدرجة تنحرف حتى عند حرارة صفر، فثبّت حكمك وأعطِ العتبات هامشًا.

لو كنت أبدأ مجموعة تقييمات جديدة هذا الأسبوع، لثبّت DeepEval لبوابة CI لأن التأكيدات تنتمي بجانب الاختبارات (الإفصاح أعلاه)، وأضفت مقاييس Opik المستقلة لأنظف فصل قسناه. ولو لم يكن مكدّسنا بايثون، لاخترت promptfoo دون تردد. وإن كنت تفضّل أن يتولى شخص آخر توصيل المجموعة الذهبية وسير العمل، هذه محادثة يسرّنا أن نجريها.

الأسئلة الشائعة

ما هو أفضل إطار عمل مفتوح المصدر لتقييم LLM؟

لا يوجد فائز واحد، بل أفضل ملاءمة لكل قيد. لبوابة نجاح/فشل داخل مجموعة اختبارات بايثون، DeepEval. لإعداد YAML وCLI مستقل عن اللغة، promptfoo. لمقاييس استرجاع RAG، Ragas، إن كان بإمكانك قبول مستودع بلا التزامات منذ 2026-02-24. لأنظف فصل بين الإجابات الجيدة والسيئة في اختبارنا بتاريخ 2026-08-04، Opik.

هل Arize Phoenix مفتوح المصدر؟

ليس بحسب تعريف Open Source Initiative. Arize Phoenix يُنشر بترخيص Elastic License 2.0، الذي يُعلنه PyPI كـ license: Elastic-2.0 على الإصدار v19.15.0، والذي يذكره السطر الأول من ملف LICENSE في المستودع مباشرة. هو متاح المصدر: يمكنك قراءته وتفريعه وتعديله واستضافته ذاتيًا. القيد الوحيد هو تقديم البرنامج لأطراف ثالثة كخدمة مستضافة أو مُدارة.

هل Ragas ما زال تحت الصيانة؟

الحقائق القابلة للتحقق، حتى 2026-08-04: آخر إصدار كان v0.4.3 في 2026-01-13، ولا التزامات منذ 2026-02-24، وانتقل المستودع من منظمة explodinggradients إلى vibrantlabsai. المستودع غير مؤرشف. لم نجد تفسيرًا عامًا موثوقًا لتغيير المنظمة ولن نخمّن واحدًا. كود Apache-2.0 ما زال يعمل؛ والخطر هو الاعتماديات غير المرقّعة.

هل أحتاج إلى إطار تقييم أم منصة مراقبة؟

كلاهما في النهاية، لكنهما يجيبان عن سؤالين مختلفين. إطار التقييم يخبرك ما إذا كان تغيير ما قد حسّن مخرجاتك أو أسوأها قبل أن تنشرها، على مجموعة بيانات تتحكم بها. منصة المراقبة تخبرك بما حدث فعلًا في الإنتاج بعد أن نشرت. ابدأ بإطار التقييم إن كان لديك خط أنابيب CI؛ راجع منصات مراقبة الذكاء الاصطناعي للجانب الإنتاجي.

هل يمكنني تشغيل تقييمات LLM في CI/CD؟

نعم. كل إطار غطيناه هنا يخرج برمز غير صفري عند فشل تأكيد عتبة، وهذا كل ما تحتاجه مهمة GitHub Actions. القيود العملية هي زمن الجدار (استدعاءات الحكم هي استدعاءات شبكة، وتشغيل DeepEval التسلسلي لدينا استغرق 126.8 ثانية لـ10 عناصر) وعدم حتمية الحكم. شكل سير العمل والمعالجات موجودان في قسم CI أعلاه.

ما الفرق بين DeepEval وRagas؟

شكل الواجهة والنطاق، لا الجودة. DeepEval على نمط pytest وعام الغرض: تكتب حالات اختبار وتؤكد على عتبات المقاييس، ويغطي مخرجات تطبيقات من أنواع كثيرة. Ragas مكتبة مخصصة لـ RAG تعمل دالتها evaluate() بشكل غير متزامن فوق مجموعة بيانات من صفوف السؤال والسياق والإجابة. DeepEval يناسب بوابة CI بشكل طبيعي أكثر؛ وRagas يتعمّق أكثر في الاسترجاع.

لماذا يمنحني pip install promptfoo الحزمة الخاطئة؟

لأن promptfoo مشروع Node. النسخة الحقيقية منشورة على npm تحت رخصة MIT وتُثبَّت بأمر npm install promptfoo. حزمة PyPI بنفس الاسم هي حزمة مغلّفة من طرف ثالث، لا المشروع الأصلي، وتثبيتها طريقة شائعة لينتهي بك المطاف بتصحيح أخطاء واجهة سطر أوامر ليست تلك التي يصفها التوثيق.

هل lm-evaluation-harness إطار تقييم LLM؟

هو أداة قياس معيارية للنموذج (harness)، وهي مهمة مرتبطة لكنها مختلفة. lm-evaluation-harness (يُثبَّت باسم pip install lm-eval) يقيس أداء نموذج مقابل مهام عامة موحّدة مثل MMLU. لن يخبرك ما إذا كان خط استرجاعك أعاد المقطع الصحيح، لأن تطبيقك ليس مفهومًا يملكه أصلًا. راجع قسم إطار التقييم مقابل أداة القياس المعيارية أعلاه لمعرفة الفارق.

هل هذه الأطر مجانية الاستخدام؟

من ناحية الترخيص، نعم. DeepEval وRagas وOpik وEvidently وGiskard مرخّصة بـ Apache-2.0؛ وpromptfoo وInspect AI وlm-evaluation-harness مرخّصة بـ MIT. كلا الترخيصين يسمحان بالاستخدام التجاري والتعديل وإعادة التوزيع. Arize Phoenix هو الاستثناء: Elastic License 2.0 يسمح بالاستضافة الذاتية لكن لا يسمح بتقديم البرنامج لأطراف ثالثة كخدمة مُدارة. استخدام واجهة برمجة نموذج الحكم يُحاسب عليه مزودك بشكل منفصل.

الوسوم

إطار عمل مفتوح المصدر لتقييم llmdeepevalragaspromptfooarize phoenixopikتقييم llm

شارك هذا المقال

مقالات ذات صلة

المزيد في comparisons

comparisons
Jul 30, 2026

البحث الهجين: BM25 مقابل Vector (ولماذا تحتاج كليهما)

BM25 يعثر على أكواد SKU ورموز الأخطاء؛ والبحث المتجهي يعثر على السؤال المعاد صياغته الذي لا يستخدم تلك الكلمات نفسها. إليك كيف يجمع Reciprocal Rank Fusion بينهما، مع أرقام معايير حقيقية من 2025-2026 وكود Python محايد تجاه المزوّدين.

13 دقيقة قراءة قراءة
اقرأ
comparisons
Jul 21, 2026

RPA أم الذكاء الاصطناعي أم الهجين: أيهما الأنسب لأتمتة عمليات شركتك في 2026؟

أتمتة العمليات الروبوتية (RPA) تنفّذ القواعد كما هي، بينما يتخذ الذكاء الاصطناعي قرارات تقديرية، وفي 2026 يجمع أذكى نموذج أتمتة بين الاثنين. يقدّم هذا الدليل المحايد إطار قرار ثلاثي، ومقارنة تكاليف السنة الأولى بالثالثة، وبيانات حقيقية من مشاريع نفّذناها لاختيار RPA أو الذكاء الاصطناعي أو الحل الهجين.

11 دقيقة قراءة قراءة
اقرأ
comparisons
Jul 8, 2026

OpusClip مقابل Vizard: أي مولد مقاطع بالذكاء الاصطناعي يفوز في 2026؟

اختبرنا OpusClip مقابل Vizard لعام 2026. أجرينا حسابات التكلفة لكل دقيقة مصدر واختبارًا عمليًا لجودة المقاطع لمعرفة من يفوز فعليًا — ولمن. يميل Vizard نحو القيمة والحجم، بينما يميل OpusClip نحو الانتشار وإعادة التأطير التلقائي.

12 min read قراءة
اقرأ
عرض جميع المقالات
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.

احجز مكالمة استكشاف لمدة 30 دقيقةشاهد أعمالنا

الأحدث من المكتبة

Claude Skills

عرض الكل
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

أتمتة الذكاء الاصطناعي

عرض الكل
  • مُدقّق الأمن

    فحص SCA وIaC أسبوعي مع PRs إصلاح مرتّبة الأولوية.

  • كاتب البريد البارد

    ينشئ رسائل أول تواصل مبنية على تفصيل عام واحد محدّد.

  • وكيل بحث العملاء المحتملين

    يثري بريداً إلكترونياً إلى ملف، ويقيّم الملاءمة، وينبّه في Slack.

الأحدث من المكتبة

Claude Skills

عرض الكل
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

أتمتة الذكاء الاصطناعي

عرض الكل
  • مُدقّق الأمن

    فحص SCA وIaC أسبوعي مع PRs إصلاح مرتّبة الأولوية.

  • كاتب البريد البارد

    ينشئ رسائل أول تواصل مبنية على تفصيل عام واحد محدّد.

  • وكيل بحث العملاء المحتملين

    يثري بريداً إلكترونياً إلى ملف، ويقيّم الملاءمة، وينبّه في Slack.

الخدمات

  • حلول المؤسسات
  • تطبيقات الجوال
  • تطبيقات الويب

الحلول

  • أنظمة إدارة علاقات العملاء
  • تكامل الذكاء الاصطناعي
  • حلول تخطيط الموارد
  • المساعدون الصوتيون
  • أتمتة العمليات
  • الأمن السيبراني

المكتبة

  • المدونة
  • أعمالنا

المجتمع

  • أتمتة الذكاء الاصطناعي
  • Claude Skills

الأدوات

  • حاسبة تكلفة تطبيق الجوال
  • حاسبة تكلفة OpenAI / LLM API
  • حاسبة تكلفة MVP
  • حاسبة تكلفة الوكيل الصوتي بالذكاء الاصطناعي

الشركة

  • من نحن
  • الشركاء
  • اتصل بنا

قانوني

  • سياسة الخصوصية
  • شروط الخدمة
  • سياسة ملفات تعريف الارتباط

الخدمات

  • حلول المؤسسات
  • تطبيقات الجوال
  • تطبيقات الويب

الحلول

  • أنظمة إدارة علاقات العملاء
  • تكامل الذكاء الاصطناعي
  • حلول تخطيط الموارد
  • المساعدون الصوتيون
  • أتمتة العمليات
  • الأمن السيبراني

المكتبة

  • المدونة
  • أعمالنا

المجتمع

  • أتمتة الذكاء الاصطناعي
  • Claude Skills

الأدوات

  • حاسبة تكلفة تطبيق الجوال
  • حاسبة تكلفة OpenAI / LLM API
  • حاسبة تكلفة MVP
  • حاسبة تكلفة الوكيل الصوتي بالذكاء الاصطناعي

الشركة

  • من نحن
  • الشركاء
  • اتصل بنا
قانونيسياسة الخصوصيةشروط الخدمةسياسة ملفات تعريف الارتباط
TECHSY
© 2026 Techsy. جميع الحقوق محفوظة.