
درجة MTEB: لماذا النموذج الأول ليس خيارك الأفضل لـ RAG؟
تضم لوحة صدارة MTEB على Hugging Face أكثر من 5000 نموذج تضمين، وكل أسبوع تقريبًا يتسلل نموذج جديد إلى القمة. وهنا الفخ: النموذج الأول غالبًا ليس النموذج الذي يجب أن تنشره فعليًا. درجة MTEB التي تحدّق فيها هي متوسط عبر 8 أنواع مهام مختلفة، ومهمة واحدة فقط منها تتنبأ بجودة أداء الاسترجاع المعزز بالتوليد (RAG) على مستنداتك. تعلّمنا هذا بالطريقة الصعبة: في أبريل 2026 خسر اختيارنا الأعلى تصنيفًا أمام نموذج أرخص على قاعدة بياناتنا الخاصة. يشرح هذا الدليل ما تعنيه الأرقام فعليًا، وأي عمود يجب أن تثق به لتطبيقات RAG، ولماذا لوحة الصدارة نقطة انطلاق لا حكمًا نهائيًا.
أبرز النقاط
- MTEB مقياس متعدد المهام؛ ودرجة "الإجمالي" الرئيسية تمزج 8 أنواع مهام في متوسط واحد.
- بالنسبة لـ RAG، فقط تبويب الاسترجاع الفرعي (nDCG@10) يتنبأ بجودة الإنتاج، لا المتوسط الإجمالي.
- تسجّل نماذج التضمين الفعلية عادةً 0.4-0.7 في nDCG@10 دون تدريب مسبق (zero-shot)؛ أما 1.0 فيعني ترتيبًا مثاليًا.
- استخدم MTEB لعمل قائمة مختصرة، ثم اختبر على بياناتك الخاصة. النموذج الأول غالبًا ما يخسر.
ما هي درجة MTEB؟
MTEB اختصار لـ Massive Text Embedding Benchmark (مقياس التضمين النصي الضخم)، وهي مجموعة اختبارات مفتوحة ومتعددة المهام لتقييم نماذج تضمين النصوص. درجة MTEB هي مقياس لكل مهمة على حدة يُجمع في رقم إجمالي واحد عبر 8 أنواع مهام. قدّمها Muennighoff وزملاؤه عام 2022 (arXiv 2210.07316، ونُشرت في مؤتمر EACL 2023).
يستضيف المقياس مساحة عامة على Hugging Face يمكن لأي شخص من خلالها تقديم نموذج. الرقم الذي يقتبسه معظم الناس هو "المتوسط الإجمالي"، الذي يمزج الاسترجاع والتصنيف والتجميع وخمس عائلات مهام أخرى في رقم واحد. وهذا بالضبط سبب تضليل الترتيب الرئيسي: يمكن لنموذج أن يفوز بالمتوسط لأنه قوي في التجميع بينما هو متوسط فقط في المهمة الوحيدة التي يعتمد عليها منتجك. الورقة البحثية الأصلية تغطي 8 أنواع مهام عبر نحو 58 مجموعة بيانات و112 لغة.
فئات مهام MTEB الثماني (وما تقيسه كل درجة)
يقسّم MTEB تقييم التضمين إلى 8 أنواع مهام، وتُقاس كل مهمة بمقياس مختلف. لذا فإن عبارة "درجة MTEB مرتفعة" لا تعني شيئًا تقريبًا حتى تعرف أي مهمة تقرأها. الدرجة 0.85 في التصنيف (accuracy) والدرجة 0.85 في الاسترجاع (nDCG@10) تصفان قدرتين مختلفتين تمامًا.
إليك جدول فك الشيفرة الذي لا يبدو أن أحدًا ينشره بوضوح. المقياس يتغيّر بحسب المهمة:
| فئة المهمة | ما تختبره | المقياس |
|---|---|---|
| Retrieval (الاسترجاع) | إيجاد المستندات ذات الصلة بالاستعلام (هذا ما يخص RAG) | nDCG@10 |
| Classification (التصنيف) | تصنيف النصوص إلى فئات | accuracy |
| Clustering (التجميع) | تجميع النصوص المتشابهة | v-measure |
| Pair Classification (تصنيف الأزواج) | هل النصان متطابقان؟ | average precision |
| Reranking (إعادة الترتيب) | إعادة ترتيب النتائج المرشحة | MAP |
| STS (التشابه النصي الدلالي) | مدى تشابه معنى جملتين | Spearman correlation |
| Summarization (التلخيص) | ترتيب جودة الملخصات | Spearman correlation |
| Bitext mining (تنقيب النصوص الثنائية) | مطابقة الترجمات عبر اللغات | F1 |
خريطة ربط المهام بالمقاييس أعلاه تم التحقق منها من ورقة MTEB البحثية (arXiv 2210.07316). والخلاصة الوحيدة: النموذج الذي يتصدّر المتوسط الإجمالي لـ MTEB قد يظل متوسطًا في المهمة الوحيدة التي يعمل عليها منتجك.
أي درجة MTEB تهم فعليًا لـ RAG؟
بالنسبة لـ RAG، تجاهل المتوسط الإجمالي واقرأ تبويب الاسترجاع (Retrieval) الفرعي، المقاس بـ nDCG@10. فـ RAG هو بحث دلالي عبر مستنداتك، وهذا بالضبط ما تقيسه مهمة الاسترجاع. أما STS فمرتبط بشكل ضعيف لكنه ثانوي. يمكن لنموذج أن يفوز بلوحة الصدارة الإجمالية بينما يحتل مرتبة متوسطة في الاسترجاع، لذا فإن عمود الاسترجاع هو الذي يتنبأ بجودة الإنتاج.
لماذا يضلّل المزيج الإجمالي؟ مجموعة بيانات الاسترجاع الفرعية مبنية من مجموعات بيانات ويب عامة وأسئلة وأجوبة مثل MS MARCO وNatural Questions وHotpotQA. النموذج الذي يتألق في التصنيف يمكن أن يحقق متوسطًا رائعًا بينما يتراجع رقم الاسترجاع لديه. افتح لوحة صدارة Hugging Face (huggingface.co/spaces/mteb/leaderboard، تم الاطلاع في 13-07-2026) وصفِّ إلى تبويب الاسترجاع قبل مقارنة أي شيء.
إذا كنت تبني تقييمك الخاص، الفلترة ذاتها تنطبق في الكود:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksبعد قراءة عمود الاسترجاع، يصبح السؤال التالي أي نموذج تختار. مقالنا المحوري يشرح أي نموذج تضمين يجب أن تنشره فعليًا مع أرقام القياس الكاملة، وإذا كنت تحدد أين تعيش تلك المتجهات، فدليلنا حول أفضل قواعد البيانات المتجهة لعام 2026 يكمّله.
ماذا تعني درجة nDCG@10 فعليًا؟
nDCG@10 يقيس مدى جودة ترتيب أفضل 10 نتائج مسترجَعة. الدرجة 1.0 تعني أن كل مستند ذي صلة يقع في القمة تمامًا؛ و0 تعني ألا شيء منها في القمة. تحقق نماذج التضمين الفعلية عادةً بين 0.4 و0.7 دون تدريب مسبق (zero-shot)، لذا فإن 0.55 أمر طبيعي وليس عطلاً.
فكّر في الأمر وكأنك تقيّم صندوق بحث. ما يهمك هو ظهور الإجابة الصحيحة أولًا، لا أن تظهر في مكان ما فحسب، لأن نموذج اللغة الكبير (LLM) لديك لا يقرأ سوى المقاطع القليلة الأولى التي تُغذّيه بها. لا أحد يصل إلى 1.0، لأن الاستعلامات غامضة والمستندات ذات الصلة نادرًا ما تصطف بشكل مثالي. لذا إن كانت درجة nDCG@10 البالغة 0.55 تثير قلقك، فلا داعي لذلك؛ فهي درجة طبيعية وقابلة للنشر دون تدريب مسبق، ونطاق 0.4-0.7 هو المدى المعتاد (يؤكده zeroentropy.dev)، وليس قانونًا فيزيائيًا.
اختبرنا النموذج الأول في MTEB على قاعدة بياناتنا الخاصة لـ RAG (ولم يفز)
أخذنا النموذج المتصدر لتبويب الاسترجاع الإنجليزي في MTEB وشغّلناه مقابل ستة نماذج أخرى على قاعدة بياناتنا الخاصة من 10,000 مستند تقني، مُقيَّمة مقابل مجموعة من نحو 120 استعلامًا موسومة يدويًا. حقق متصدر لوحة الصدارة نتيجة Recall@10 قوية، لكنه لم يحتل المركز الأول، وجاء خياران أرخص قريبين بما يكفي لتغيير القرار. مع نحو 120 استعلامًا فقط، تعامل مع هذه النتائج كمؤشر اتجاهي لا كلوحة صدارة.
متصدر لوحة الصدارة الإنجليزية في MTEB خلال فترة اختبارنا كان Gemini Embedding 001 (يتصدر لقطة أبريل 2026)؛ الترتيب أدناه مأخوذ من لوحة MTEB على Hugging Face، وبما أن الأرقام تتغيّر حسب اللقطة الزمنية، فإننا نذكر أرقامنا مع تاريخ:
| النموذج (الأبعاد) | ترتيب MTEB الإنجليزي (HF، 2026) | Recall@10 على قاعدة بياناتنا | التكلفة |
|---|---|---|---|
| Gemini Embedding 001 (3072) | يتصدر تبويب الاسترجاع الإنجليزي | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | غير مُدرَج في اللوحة العامة | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (استضافة ذاتية) | متصدر النماذج مفتوحة المصدر | 0.87 | GPU فقط |
| text-embedding-3-large @1024 (مُقتطَع) | مرتبة متوسطة | 0.83 | ~$0.13/M |
هناك أمران لم تخبرنا بهما لوحة الصدارة. أولًا، تجاوز Voyage-4-large — وهو نموذج لا يُدرَج أصلًا في تلك اللوحة — المتصدرَ العام (Gemini) على قاعدة بياناتنا. ثانيًا، اقترب نموذج مفتوح المصدر مُستضاف ذاتيًا (Qwen3-8B) بفارق ضئيل جدًا دون أي تكلفة لكل رمز (token)، بينما حافظت متجهات OpenAI المُقتطَعة بـ1024 بُعدًا على Recall@10 بقيمة 0.83 بسعة تخزين أصغر بثلاث مرات. يُصنِّف MTEB الاسترجاع على نصوص ويب عامة وأسئلة وأجوبة؛ أما قاعدة بياناتنا فمفردات تقنية متخصصة مُقسَّمة بطريقتها الخاصة، لذا يعاد ترتيب النتائج. وهذا هو الدليل الكامل على أهمية الاختبار على بياناتك الخاصة. شرحنا حول كيفية الاختبار على قاعدة بيانات RAG الخاصة بك يغطي جانب التقييم، والمقال المحوري يحمل المنهجية الكاملة.
لماذا النموذج الأول في اللوحة ليس اختيارك الأفضل
ثلاثة أمور لا تراها لوحة الصدارة تحدد الفائز الحقيقي لديك: مفردات المجال (المصطلحات المتخصصة التي لا تحتويها مجموعات البيانات العامة أبدًا)، وحجم المقطع (النصوص القصيرة مقابل الطويلة تفضّل نماذج مختلفة)، ولغة الاستعلام. لهذا فإن MTEB أداة لعمل قائمة مختصرة، لا إجابة نهائية. الترتيب يخبرك بالنماذج المحتملة، لا بالنموذج الذي يناسب بياناتك.
إليك عوامل قاعدة البيانات التي تقلب الترتيب عمليًا:
- تحوّل المجال: النصوص القانونية أو الطبية أو نصوص الأكواد البرمجية تحمل مفردات لم تعاينها MS MARCO مطلقًا.
- حجم المقطع: النموذج المضبوط على مقاطع قصيرة قد يتعثر مع مقاطع من 800 رمز (token).
- لغة الاستعلام وأسلوبه: الاستعلامات متعددة اللغات أو الغنية بالكلمات المفتاحية تعيد ترتيب النتائج بسرعة.
في تجربتنا، سير العمل الموثوق مُملّ لكنه ناجح: استخدم تبويب الاسترجاع في MTEB لعمل قائمة مختصرة من 3-4 مرشحين، ثم قِس Recall@10 وnDCG@10 على مستنداتك الخاصة. مراجعتنا الشاملة لـأدوات RAG العامة تساعد في بناء خط الأنابيب، وللحصول على طريقة منظمة لـتقييم النماذج على بياناتك الخاصة، تلك المراجعة تغطي جانب التقييم. مقالان ذوا صلة يستحقان الحفظ: تشغيل نماذج التضمين محليًا باستخدام Ollama، ومقارنة مباشرة بين Voyage وOpenAI وCohere للتضمينات.
MTEB مقابل MMTEB، ولماذا تتغيّر الأرقام باستمرار
MMTEB هو التوسعة متعددة اللغات (النسخة v2) من MTEB (arXiv 2502.13595، نُشرت النسخة v2 في 8 أبريل 2025). يضيف أكثر من 500 مهمة مجتمعية عبر أكثر من 250 لغة، بالإضافة إلى استرجاع المستندات الطويلة واتباع التعليمات واسترجاع الأكواد البرمجية. إذا كان RAG لديك مخصصًا للإنجليزية فقط، فتبويب الاسترجاع الإنجليزي الأصلي في MTEB لا يزال هو الأنسب للقراءة. يصبح MMTEB أكثر أهمية عندما تمتد استعلاماتك ومستنداتك عبر لغات متعددة.
وهنا الجزء الصريح. أرقام MTEB تتضارب عبر اللقطات الزمنية بل وحتى عبر نسخ الورقة البحثية نفسها: الورقة الأصلية تذكر 56 مجموعة بيانات في نسخة و58 في نسخة أخرى، لذا لا تعامل أبدًا أي رقم واحد كمرجع نهائي. الترتيبات تتغيّر باستمرار مع وصول أكثر من 5000 مساهمة، لذا التقط دائمًا لقطة شاشة للوحة الصدارة مع تاريخ اطلاعك عليها. وإن لم تُحمَّل الصفحة، فمساحة Hugging Face تعمل على ترقية معالج (CPU) وغالبًا ما تكون بطيئة أو غير مستقرة، وليس اتصالك هو السبب.
الخلاصة
MTEB هو أفضل نقطة انطلاق عامة لاختيار نموذج تضمين، بمجرد أن تقرأه بالشكل الصحيح. اقرأ تبويب الاسترجاع، لا المتوسط الإجمالي. تعامل مع nDCG@10 بين 0.4 و0.7 كأمر طبيعي. اعمل قائمة مختصرة بالاستعانة بلوحة الصدارة، ثم اختبر تلك القائمة على قاعدة بياناتك الخاصة، لأن النموذج الأول غالبًا ما يخسر على البيانات الحقيقية (كما حدث معنا). عندما تكون جاهزًا للاختيار، عُد إلى مقالنا المحوري عن نماذج التضمين للحصول على القياس الكامل والتوصيات. وإذا كان العمل الحقيقي هو ربط النموذج الذي تختاره بخط إنتاج فعلي، فإن تقييم القائمة المختصرة ثم الاختبار هذا جزء من عملنا في تكامل الذكاء الاصطناعي.
عن الكاتب
Mert Batur هو المؤسس المشارك لـ Techsy.io، حيث يعمل الفريق على بناء وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط إنتاج صوتية وSDR للعملاء B2B. يكتب عن منظومة أدوات LLM التي يستخدمها فريق Techsy فعليًا في الإنتاج.
تواصل عبر LinkedIn.
الأسئلة الشائعة
ما هو MTEB؟
MTEB هو Massive Text Embedding Benchmark (مقياس التضمين النصي الضخم)، وهي مجموعة اختبارات مفتوحة لتقييم أداء نماذج تضمين النصوص عبر 8 أنواع مهام، من بينها الاسترجاع والتصنيف والتجميع. قدّمها Muennighoff وزملاؤه عام 2022 (arXiv 2210.07316)، وهو مستضاف كلوحة صدارة عامة على Hugging Face.
ماذا يعني اختصار MTEB؟
MTEB اختصار لـ Massive Text Embedding Benchmark. الاسم مهم لأن كلمة "Massive" (الضخم) تشير إلى اتساع المهام ومجموعات البيانات، لا اختبارًا واحدًا. درجة MTEB لديك هي في الحقيقة متوسط عبر تقييمات منفصلة عديدة، ولهذا يمكن للرقم الإجمالي أن يخفي نقاط ضعف في المهمة التي تهمك.
أي درجة MTEB تهم لـ RAG؟
بالنسبة لـ RAG، اقرأ تبويب الاسترجاع الفرعي، المقاس بـ nDCG@10، لا المتوسط الإجمالي. فـ RAG هو بحث دلالي عبر مستنداتك، وهذا بالضبط ما تقيسه مهمة الاسترجاع التي تقيّمها لوحة الصدارة. يمكن لنموذج أن يحقق درجة إجمالية قوية بينما يحتل مرتبة متوسطة في الاسترجاع، لذا فإن الاسترجاع هو الإشارة الموثوقة.
ما هي درجة الاسترجاع الجيدة في MTEB؟
تسجّل نماذج التضمين الفعلية عادةً بين 0.4 و0.7 في nDCG@10 دون تدريب مسبق، لذا فإن أي رقم في هذا النطاق طبيعي وقابل للنشر. 0.55 ليست علامة خطر. لا أحد يصل إلى 1.0، لأن الاستعلامات غامضة والمستندات ذات الصلة نادرًا ما تصطف بترتيب مثالي. قارن المرشحين ببعضهم بعضًا، لا بدرجة 1.0 المثالية.
ما هو nDCG@10؟
nDCG@10 يقيس مدى جودة ترتيب أفضل 10 نتائج مسترجَعة. الدرجة 1.0 تعني أن كل مستند ذي صلة يقع في القمة تمامًا؛ و0 تعني ألا شيء منها كذلك. يكافئ هذا المقياس وضع أفضل إجابة أولًا، وهو أمر مهم لـ RAG لأن نموذج اللغة الكبير لديك لا يقرأ سوى المقاطع القليلة الأولى التي تسترجعها.
ما الفرق بين MTEB وMMTEB (النسخة v1 مقابل v2)؟
MMTEB هو التوسعة متعددة اللغات (النسخة v2) من MTEB (arXiv 2502.13595، أبريل 2025). يوسّع المقياس ليشمل أكثر من 500 مهمة مجتمعية عبر أكثر من 250 لغة، ويضيف استرجاع المستندات الطويلة والتعليمات والأكواد البرمجية. إذا كان RAG لديك مخصصًا للإنجليزية فقط، التزم بتبويب الاسترجاع الإنجليزي الأصلي في MTEB.
لماذا تتغيّر لوحة صدارة MTEB كثيرًا (ولماذا لا تُحمَّل أحيانًا)؟
تتغيّر الترتيبات باستمرار لأن نماذج جديدة تُقدَّم طوال الوقت، بأكثر من 5000 مُدخل وفي تزايد مستمر. لقطة شهر مارس لن تطابق لقطة شهر يوليو، لذا التقط دائمًا لقطة شاشة للوحة الصدارة مع تاريخها. وإن لم تُحمَّل الصفحة، فمساحة Hugging Face تعمل على ترقية معالج (CPU) وغالبًا ما تكون بطيئة أو غير مستقرة.
هل يجب أن أختار فقط النموذج الأول في لوحة صدارة MTEB؟
لا. النموذج الأول مرشح لقائمة مختصرة، لا حكم نهائي. لا تستطيع لوحة الصدارة رؤية مفردات مجالك أو حجم مقاطعك أو لغة استعلاماتك، وكل هذه العوامل تغيّر النموذج الفائز. استخدم تبويب الاسترجاع لعمل قائمة مختصرة من 3-4 نماذج، ثم اختبرها على قاعدة بياناتك. في اختبارنا، تجاوز نموذج غير مُدرَج أصلًا في تلك اللوحة النموذجَ الأول العام (Gemini) على قاعدة بياناتنا الخاصة، وطابقه خيار أرخص مُستضاف ذاتيًا.