
أفضل 9 نماذج تضمين لـ RAG في 2026 (اختبرنا الاسترجاع والكمون والتكلفة على 10,000 وثيقة)
أُطلق Voyage-4 في 15 يناير 2026. ثم لحقه voyage-context-4 في 29 يونيو. إن كان خط أنابيب RAG لديك ما زال يفهرس على ada-002 من OpenAI، فأنت تخسر Recall@10 قابلاً للقياس وتدفع ثمن ذلك. اختيار أفضل نماذج التضمين لـ RAG في 2026 لا يعني الاستيلاء على أي نموذج يتصدر لوحة MTEB في ذلك الأسبوع. قمنا بتضمين 10,000 وثيقة من وثائقنا الخاصة لمعرفة أي النماذج تسترجع فعلاً، وكم يكلف كل واحد لكل مليون رمز. في الأسفل: الترتيب، والأسعار، وحيلة اقتطاع واحدة خفضت تخزين المتجهات لدينا 3 أضعاف. التضمينات مجرد طبقة واحدة من منظومة RAG الأوسع، لكن إن أخطأت في هذه الطبقة، تتأثر كل الطبقات التالية.
أبرز النقاط
- أفضل جودة استرجاع (API): Voyage-4-large، مع MoE وأبعاد Matryoshka وسعر ~$0.12 لكل مليون رمز.
- أفضل نموذج شامل عبر API: Gemini Embedding 001، متصدّر MTEB الإنجليزية، بأبعاد 3072 وسعر ~$0.15.
- أفضل نموذج مفتوح المصدر / للاستضافة الذاتية: Qwen3-Embedding-8B، متصدّر MTEB متعدد اللغات والأكواد.
- أفضل قيمة: OpenAI text-embedding-3-large مُقتطَع من 3072 إلى 1024، بسعر ~$0.13 ومتجهات أصغر 3 أضعاف.
ما الذي تغيّر في نماذج التضمين خلال 2026؟
التحوّل الأكبر في 2026 هو عائلة Voyage-4 (نموذج مزيج خبراء mixture-of-experts، بفضاء تضمين مشترك عبر nano/lite/standard/large، إضافة إلى اقتطاع Matryoshka وتكميم int8/binary)، وأيضاً voyage-context-4 الذي يُرمّز كل جزء (chunk) مع سياقه المحيط. في الوقت نفسه، يتصدّر Gemini Embedding 001 لوحة MTEB الإنجليزية، بينما يقود Qwen3-Embedding الاسترجاع المفتوح متعدد اللغات.
أعاد إطلاقان من Voyage تشكيل الساحة. قدّم Voyage-4 (15 يناير 2026) فضاء تضمين مشتركاً، بحيث يمكنك مزج نموذج صغير للفهرسة الرخيصة بالجملة مع نموذج كبير للاستعلامات عالية القيمة دون إعادة فهرسة كل شيء. هذا وحده يوفّر فاتورة إعادة التضمين التي تخشاها معظم الفرق.
ثم عالج voyage-context-4 (29 يونيو 2026) مشكلة التقطيع (chunking) مباشرة: بدلاً من تضمين فقرة بمعزل عن سياقها، يُرمّز الجزء مع سياق المستند المحيط به. عملياً، هذا يعني أنك لن تحتاج بعد الآن لضبط حدود التقطيع يدوياً لتفادي فقدان المعنى عند الأطراف.
الجملة التي تستحق أن تتذكرها: تضمينات الأجزاء السياقية تحوّل التقطيع من تمرين ضبط هش إلى إعداد افتراضي يمكنك الوثوق به. تريد مقارنة مباشرة بين واجهات برمجة التطبيقات المُستضافة؟ دليل مرافق كامل يقارن Voyage وOpenAI وCohere ننشره قريباً.
أفضل 9 نماذج تضمين لـ RAG، مُرتَّبة
بالنسبة لمعظم الفرق في 2026، ثلاثة اختيارات تغطي 90% من الحالات: Voyage-4-large لأعلى جودة استرجاع عبر واجهة برمجة مُستضافة، وGemini Embedding 001 كأفضل نموذج شامل من حيث النتائج، وQwen3-Embedding-8B إذا كنت تستضيف ذاتياً. الترتيب الكامل والجدول الرئيسي أدناه مباشرة، مرتّبان حسب الملاءمة لاسترجاع RAG، بدءاً بنماذج API ثم النماذج مفتوحة المصدر.
| النموذج | المزوّد | MTEB (استرجاع، مع التاريخ) | الأبعاد (Matryoshka؟) | نافذة السياق | السعر /مليون رمز | متعدد اللغات | مفتوح مقابل API/استضافة ذاتية |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | تقييم داخلي من المزوّد، غير مُدرَج في MTEB العامة (يناير 2026) | 2048/1024/512/256 (نعم، MRL) | ~32K رمز | ~$0.12 | قوي | API |
| Gemini Embedding 001 | ~67.7 استرجاع / 68.3 إجمالي (MTEB، أبريل 2026) | 3072 (نعم، MRL) | ~2K رمز | ~$0.15 | قوي | API | |
| text-embedding-3-large | OpenAI | راجع لوحة MTEB الحيّة (غير منشور من المزوّد)، 2026 | 3072→1024→256 (نعم، MRL) | ~8K رمز | ~$0.13 | جيد | API |
| Cohere Embed v4 | Cohere | تقييم داخلي من المزوّد، متعدد الوسائط (2026) | 1536 (قابل للتهيئة) | ~128K رمز | ~$0.12 | قوي | API |
| Voyage-context-4 | Voyage AI | تقييم سياقي (يونيو 2026) | 2048/1024/512/256 (نعم، MRL) | ~32K رمز | ~$0.12 | قوي | API |
| Qwen3-Embedding-8B | Alibaba | ~70.6 متعدد اللغات / ~80.7 كود (MTEB، 2026) | 32–4096 (مرن) | ~32K رمز | أوزان مجانية (تكلفة GPU) | متصدّر | استضافة ذاتية |
| BGE-M3 | BAAI | متعدد لغات قوي (لوحة Hugging Face، 2026) | 1024 (كثيف+متناثر+متعدد المتجهات) | ~8K رمز | أوزان مجانية (تكلفة GPU) | قوي | استضافة ذاتية |
| NV-Embed-v2 | NVIDIA | ~72.3 متوسط إنجليزي (HF MTEB، تحقّق بنفسك، 2026) | 4096 | ~32K رمز | أوزان مجانية (تكلفة GPU) | مُركَّز على الإنجليزية | استضافة ذاتية |
| nomic-embed-text | Nomic AI | متواضع، بمستوى أجهزة لابتوب (2026) | 768 | ~8K رمز | مجاني (محلي) | محدود | استضافة ذاتية |
خزّن هذه المتجهات في قاعدة بيانات متجهية مناسبة لعدد أبعادك، لأن فهرساً بـ 3072 بُعداً يكلّف أكثر بكثير من فهرس بـ 1024 بُعداً عند التوسّع.
1. Voyage-4-large
أفضل جودة استرجاع خالصة بين واجهات API. إنه نموذج مزيج خبراء بفضاء تضمين مشترك (امزج nano/lite/large دون إعادة فهرسة) وأبعاد Matryoshka عند 2048/1024/512/256، إضافة إلى تكميم fp32/int8/binary لتخزين أرخص. بسعر يقارب $0.12 لكل مليون رمز، سعره كنموذج متوسط الفئة لكنه يسترجع كنموذج فاخر. اختر هذا إن كانت جودة الاسترجاع هي عائقك ويمكنك تحمّل ~$0.12 لكل مليون.
2. Gemini Embedding 001
أفضل واجهة API شاملة. نموذج Google يتصدّر لوحة MTEB الإنجليزية (~68.3 إجمالاً، 67.7 استرجاعاً حسب لقطة أبريل 2026)، يأتي بأبعاد 3072 مع اقتطاع MRL، ويشارك فضاءً متعدد الوسائط. بسعر **$0.15 لكل مليون** فهو الأغلى بين اختياراتنا الأولى. اختر هذا إن أردت أعلى نموذج شامل من حيث النتيجة وكانت Gemini/Vertex بالفعل جزءاً من مجموعتك التقنية.
3. OpenAI text-embedding-3-large
أفضل خيار افتراضي عند التوسّع، والأسهل من حيث الإعداد. أبعاد 3072، اقتطاع MRL حتى 256، وأوسع تغطية من SDKs والشروحات بين كل نماذج التضمين. بسعر ~$0.13 لكل مليون فهو اختيار آمن، ويُعدّ text-embedding-3-small (~$0.02 لكل مليون) الشقيق الاقتصادي للمجموعات الإنجليزية. النموذج القديم ada-002 لا يزال يعمل، لكنك تدفع مقابل استرجاع أضعف. اختر هذا إن أردت صفر مفاجآت ودعماً واسعاً من المنظومة.
4. Cohere Embed v4
أفضل خيار للوسائط المختلطة والاستخدام المؤسسي متعدد اللغات. يتعامل Embed v4 مع النصوص والصور والمستندات المتداخلة في نموذج واحد، بنافذة سياق كبيرة واسترجاع قوي عبر اللغات، بسعر ~$0.12 لكل مليون. اختر هذا إن كانت مجموعتك تمزج ملفات PDF ولقطات شاشة ونصوصاً، أو تحتاج تغطية جادة متعددة اللغات عبر واجهة API واحدة.
5. Voyage-context-4
الاختيار الأحدث لـ RAG على المستندات الطويلة. أُطلق في 29 يونيو 2026، ويُضمّن كل جزء مع سياقه المحيط، ما يقلّل من إخفاقات "الضياع عند حدود التقطيع" التي تصيب التقسيم البسيط. بنفس نطاق السعر ~$0.12 لكل مليون كخط Voyage-4. اختر هذا إن كانت مستنداتك طويلة وكان التقطيع صداعك المستمر.
6. Qwen3-Embedding-8B
أفضل نموذج مفتوح المصدر إجمالاً، وأفضل اختيار لـ استرجاع الكود. يتصدّر Qwen3-Embedding من Alibaba لوحة MTEB المفتوحة متعددة اللغات (~70.6) ويتصدّر MTEB-Code (~80.7) حسب وثائق Qwen3-Embedding، بأبعاد مرنة من 32 إلى 4096 وتكميم Q4. اختر هذا إن كنت تستضيف ذاتياً، أو تُفهرس كوداً، أو تحتاج استرجاعاً قوياً متعدد اللغات دون فاتورة لكل رمز.
7. BGE-M3
أفضل نموذج شامل مفتوح المصدر. يمنحك BGE-M3 من BAAI استرجاعاً كثيفاً ومتناثراً ومتعدد المتجهات في نموذج واحد، ويدعم أكثر من 100 لغة، ويبقى من أكثر نماذج التضمين تنزيلاً على Hugging Face. اختر هذا إن أردت استرجاعاً هجيناً (كثيف + متناثر) من نموذج واحد تستضيفه ذاتياً.
8. NV-Embed-v2
أفضل أوزان مفتوحة لدقة إنجليزية فقط. يُسجّل نموذج NVIDIA ~72.3 كمتوسط إنجليزي على لوحة HF MTEB (الأرقام تختلف حسب اللقطة الزمنية، لذا راجع اللوحة الحيّة)، بأبعاد 4096. أثقل في التشغيل من معظم النماذج الأخرى. اختر هذا إن كانت الدقة الإنجليزية أولويتك القصوى ولديك مساحة GPU كافية.
9. nomic-embed-text
أفضل اختيار محلي وللابتوب. نموذج Nomic أصلي على Ollama، صغير، ورخيص للاستضافة الذاتية، يضحّي بأعلى استرجاع مقابل السرعة على عتاد متواضع. البدائل في نفس الفئة: mxbai-embed-large والقديم العريق all-MiniLM. اختر هذا إن أردت تضميناً محلياً بالكامل دون تكلفة API وتقبل استرجاعاً أقل.
شيء واحد ظلّ اختبارنا يؤكّده مراراً: المتصدّر رقم 1 على MTEB نادراً ما يكون الأفضل لمجموعتك أنت. وهذا بالضبط ما يقيسه القسم التالي.
كيف اختبرنا: تضمين 10,000 وثيقة وقياس ما يهم فعلاً
ضمّنّا نحو 10,000 وثيقة حقيقية من مجموعتنا الداخلية لوثائق المنتج وتذاكر الدعم، ثم قيّمنا الاسترجاع مقابل مجموعة مُصنَّفة يدوياً من نحو 120 استعلاماً. النتيجة الأبرز: اقتطاع text-embedding-3-large من OpenAI من 3072 إلى 1024 بُعداً كلّف انخفاضاً بمقدار 0.03 فقط في Recall@10، بينما قلّص تخزين المتجهات نحو 3 أضعاف. خسارة جودة صغيرة مقابل مكسب تخزين كبير.
اختبرنا مجموعة فرعية (وليس كل النماذج التسعة باستفاضة): Voyage-4-large، وGemini Embedding 001، وtext-embedding-3-large (الكامل والمُقتطَع)، وQwen3-Embedding-8B مُستضافاً ذاتياً، وBGE-M3، وnomic-embed-text. قسنا Recall@10 وnDCG@10 مقابل مجموعة الاستعلامات المُصنَّفة، وكمون التضمين عند النسبة المئوية 95 (p95)، والتكلفة لكل مليون رمز للواجهات، أو ثواني GPU للاستضافة الذاتية. بما أن لدينا نحو 120 استعلاماً فقط، اعتبر هذه الأرقام مؤشِّرة (directional) وليست لوحة ترتيب (leaderboard).
| النموذج (الأبعاد) | Recall@10 | nDCG@10 | كمون p95 | التكلفة |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0.89 | 0.81 | ~180 مللي ثانية (API) | ~$0.12/مليون |
| Gemini Embedding 001 (3072) | 0.88 | 0.80 | ~210 مللي ثانية (API) | ~$0.15/مليون |
| Qwen3-Embedding-8B (استضافة ذاتية) | 0.87 | 0.79 | ~430 مللي ثانية (GPU بارد) | ثواني GPU |
| text-embedding-3-large (3072) | 0.86 | 0.78 | ~160 مللي ثانية (API) | ~$0.13/مليون |
| text-embedding-3-large (1024) | 0.83 | 0.75 | ~150 مللي ثانية (API) | ~$0.13/مليون |
| BGE-M3 (1024) | 0.82 | 0.74 | ~300 مللي ثانية (استضافة ذاتية) | ثواني GPU |
| nomic-embed-text (768) | 0.76 | 0.69 | ~90 مللي ثانية (محلي) | مجاني |
خرجنا باستنتاجين ظلّا عالقين في ذهننا. الأول، أن Qwen3-8B المُستضاف ذاتياً ضاهى أفضل واجهة API على مجموعتنا الإنجليزية، لكن كمونه عند p95 تضاعف تقريباً دون GPU دافئ (warm)، فاحسب حساب إبقاء واحد جاهزاً باستمرار. الثاني، أن المتصدّر رقم 1 على لوحة الترتيب لم يكن الفائز على مجموعتنا بمجرد أن دخلت التكلفة في الحسبان. إن أردت تقييم جودة الاسترجاع من طرف إلى طرف على بياناتك الخاصة، فتلك هي الطريقة الصادقة للاختيار. وإن كنت فضولياً لمعرفة لماذا يمكن لرقم لوحة MTEB أن يُضلّل، فسننشر شرحاً مخصصاً لذلك قريباً.

كم تكلّف نماذج التضمين؟
واجهات التضمين المُستضافة تتراوح تكلفتها تقريباً بين $0.02 و$0.15 لكل مليون رمز حتى يوليو 2026. النماذج مفتوحة المصدر لها أوزان "مجانية"، لكنك تدفع بوقت GPU وVRAM. أرخص اختيارات API الجيدة بما يكفي هي text-embedding-3-small وvoyage-4-lite بسعر ~$0.02 لكل مليون؛ وأرخص مسار للاستضافة الذاتية هو nomic-embed-text، وهو مجاني فعلياً على مستوى الرمز الواحد.
إليك لقطة الأسعار المُتحقَّق منها (حتى يوليو 2026، وقد تغيّرت أسعار التضمين مرتين خلال النصف الأول من 2026، لذا راجع صفحة المزوّد قبل الالتزام):
| النموذج | السعر /مليون رمز (يوليو 2026) | ملاحظات |
|---|---|---|
| voyage-4-lite | ~$0.02 | أرخص فئة من Voyage |
| voyage-4 | ~$0.06 | الفئة القياسية |
| voyage-4-large | ~$0.12 | أفضل جودة استرجاع |
| voyage-context-4 | ~$0.12 | أجزاء سياقية |
| OpenAI 3-small | ~$0.02 | خيار اقتصادي للإنجليزية |
| OpenAI 3-large | ~$0.13 | الخيار الافتراضي عند التوسّع |
| Cohere Embed v4 | ~$0.12 | متعدد الوسائط |
| Gemini Embedding 001 | ~$0.15 | الأعلى نتيجة |
| مفتوح المصدر (Qwen3، BGE-M3، nomic) | تكلفة GPU/VRAM | بلا رسوم لكل رمز |
عند فهرسة 100 مليون رمز، الفارق بين $0.02 و$0.15 لكل مليون هو $2 مقابل $15. صغير. لكن أعِد تضمين تلك المجموعة شهرياً، أضف تضمينات وقت الاستعلام، والمُضاعِف يكبر بسرعة. لهذا تكلفة واجهات طبقة الاسترجاع تستحق بنداً حقيقياً في ميزانيتك، لا مجرد خطأ تقريب. الاستضافة الذاتية تقلب المعادلة: لا رسوم لكل رمز، لكنك تستأجر GPU سواء كان مشغولاً أو خاملاً.
التكلفة مقابل الجودة: أي نموذج تضمين يقدّم أفضل قيمة؟
قاعدة أفضل قيمة بسيطة: اختر أرخص نموذج يتجاوز Recall@10 ≥ 0.80 على مجموعتك. في اختبارنا، هذا هو text-embedding-3-large من OpenAI مُقتطَعاً إلى 1024 بُعداً: Recall@10 يبلغ 0.83 بسعر ~$0.13 لكل مليون، بمتجهات أصغر 3 أضعاف من نسخة 3072 بُعداً. يقع تماماً في ربع النقطة المثلى: استرجاع مرتفع بما يكفي، وتخزين منخفض بما يكفي.
تخيّل مخطط التشتت الرئيسي: التكلفة لكل مليون رمز على المحور السيني، وجودة الاسترجاع على المحور الصادي. الواجهات الفاخرة (Voyage-4-large وGemini 001) تعيش أعلى اليمين: استرجاع ممتاز وسعر أعلى. الفئة الاقتصادية (3-small وvoyage-4-lite) تقع أسفل اليسار: رخيصة لكن باسترجاع أضعف على الاستعلامات الصعبة. ربع أفضل قيمة هو الذي تتخطاه معظم الفرق: سعر متوسط، استرجاع مرتفع، متجهات صغيرة.
رأيي الصادق بعد تشغيل هذه الأرقام: معظم الفرق تبالغ في شراء جودة التضمين وتقصّر في الاستثمار بالتقطيع وإعادة الترتيب (reranking). إن كنت تحقق استرجاع 0.80 عند 1024 بُعداً، فإنفاق 3 أضعاف على التخزين مقابل ارتفاع 0.03 في الاسترجاع نادراً ما يستحق العناء.
قاعدة القرار في ثلاثة أسطر:
- إن كانت جودة الاسترجاع عائقك والميزانية مريحة، اختر Voyage-4-large أو Gemini 001.
- إن كنت مقيّداً بالتكلفة، اختر text-embedding-3-large مُقتطَعاً إلى 1024، أو 3-small للمجموعات السهلة.
- إن كنت تستضيف ذاتياً، فـ Qwen3-Embedding-8B هو ملك القيمة بمجرد أن يكون GPU لديك يعمل أصلاً.
ما هو أفضل نموذج تضمين مفتوح المصدر/محلي لـ RAG؟
أفضل نموذج للاستضافة الذاتية إجمالاً هو Qwen3-Embedding-8B (يحتاج GPU حقيقياً، بحدود 16 جيجابايت+ من VRAM عند Q4). أفضل اختيار للابتوب/محلي هو nomic-embed-text على Ollama، ويعمل على عتاد متواضع دون تكلفة API. الاستضافة الذاتية تفوز عندما تحتاج إقامة بيانات محلية (data residency)، أو حجماً عالياً، أو تريد إلغاء رسوم كل رمز؛ وواجهات API تفوز عندما تفضّل عدم رعاية GPU بنفسك.
تشغيل نموذج تضمين محلي أمر يتطلب أمرين اثنين فقط. اسحب النموذج، ثم ضمّن واستعلم. إليك المسار المحلي عبر Ollama إلى جانب مسار API عبر SDK الخاص بـ OpenAI، جنباً إلى جنب:
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingما يُبلّغ عنه الممارسون فعلاً على Reddit يتطابق مع اختبارنا: مستضيفو النماذج ذاتياً يستمرون بالإبلاغ عن قفزات في كمون p95 عندما يبرد GPU بين الطلبات. الحل هو إبقاء نسخة واحدة دافئة (warm) باستمرار، وهو ما يحوّل الاستضافة الذاتية "المجانية" بهدوء إلى فاتورة GPU شهرية ثابتة. يستحق تسعيره قبل أن تهجر واجهة API. إن كنت تُعِدّ حلقة تقييم (eval loop)، يساعد أيضاً أن تدير المطالبات (prompts) حول استرجاعك في مكان واحد. للحصول على الشرح الكامل، دليلنا الشامل لإعداد التضمين المحلي عبر Ollama قادم قريباً.
هل يعني بُعد أعلى استرجاعاً أفضل؟
لا، ليس بشكل خطي. بعد نقطة معينة، تضيف الأبعاد الزائدة تكلفة تخزين وكمون دون مكسب استرجاع متناسب. تقنية Matryoshka Representation Learning (MRL) تتيح لك اقتطاع متجه (مثلاً 3072→1024→512) والاحتفاظ بمعظم الاسترجاع بينما تُصغّر كل متجه 3 إلى 6 أضعاف. هذا خفض مباشر لفاتورة قاعدة بياناتك المتجهية.
أرقامنا تجعل هذا ملموساً. تقليص text-embedding-3-large من 3072 إلى 1024 بُعداً كلّف نحو 0.03 من Recall@10، لكنه خفّض التخزين نحو 3 أضعاف. انزل إلى 512 ويصبح انخفاض الاسترجاع أحدّ، خصوصاً على الاستعلامات الغامضة. النقطة المثلى لمعظم المجموعات الإنجليزية تقع حول 1024.
الخلاصة بجملة واحدة: الأبعاد ضريبة تخزين وكمون تدفعها على كل متجه، لذا قلّصها إلى أصغر حجم لا يزال يتجاوز حد الاسترجاع الذي تريده. عند 10 ملايين+ متجه، هذا القرار يحدد أي قاعدة بيانات متجهية يمكنك تحمّل تكلفتها، فتحقّق من أي قاعدة بيانات متجهية تناسب عدد أبعادك وتكلفة تخزينها قبل أن تُثبّت بُعداً نهائياً.
كيف تختار نموذج تضمين لـ RAG؟
اختيار نموذج تضمين لـ RAG يتلخّص في أربعة فحوصات، بالترتيب. طبّقها على بياناتك الخاصة، لا على لوحة ترتيب عامة، والقائمة المختصرة تتقلّص بسرعة.
- Recall@10 ≥ 0.80 على مجموعتك أنت. اختبر مجموعة فرعية بمجموعة استعلامات مُصنَّفة يدوياً. ترتيب لوحة الصدارة تلميح، لا إجابة.
- التكلفة تحت سقف $/مليون الخاص بك. احسب إعادة التضمين وتضمينات وقت الاستعلام، لا الفهرسة الأولية فقط.
- نافذة السياق ≥ حجم جزء (chunk) لديك. إن كانت أجزاؤك بحدود 1,000 رمز، فنموذج بحد 512 رمزاً يقتطعها ويفقد المعنى.
- صيانة نشطة وتعدد لغات إن احتجت ذلك. نموذج حُدِّث في 2026 يتفوّق على نسخة قديمة من 2024؛ اختبر لغاتك المستهدفة مباشرة.
قيِّم نموذجين أو ثلاثة على كل الفحوصات الأربعة، والفائز عادة يختار نفسه. من هناك، الأمر يتعلق بـدمج هذا في خط أنابيب RAG كامل: تقطيع، تضمين، تخزين، استرجاع، إعادة ترتيب.
عن الكاتب
Mert Batur هو الشريك المؤسس لـ Techsy.io، حيث يبني الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط أنابيب صوتية/SDR لعملاء B2B. يكتب عن حزمة أدوات LLM التي يستخدمها فريق Techsy فعلياً في الإنتاج. تواصل معه على LinkedIn.
اختيار الأداة هو الجزء السهل. أما تشغيلها بموثوقية داخل منتج حقيقي فهو ما تتعثر عنده معظم الفرق، وهذا بالضبط ما يبنيه فريق تكامل الذكاء الاصطناعي لدينا لعملائنا، من خطوط RAG إلى الوكلاء المخصصين.
الأسئلة الشائعة
هل تكفي نتيجة MTEB لاختيار أفضل نموذج تضمين لـ RAG؟
لا. MTEB في معظمه استرجاع نصي أحادي المجال على مجموعات بيانات عامة، لذا لن يعكس مجموعتك، أو حجم أجزائك، أو مزيج لغاتك، أو سقف تكلفتك. في اختبارنا المرجعي على 10,000 وثيقة، لم يكن المتصدّر رقم 1 على لوحة الترتيب الأفضل على مجموعتنا بمجرد إدخال السعر في الحساب. شغّل دائماً تقييماً صغيراً خاصاً بمجالك.
ما هو أفضل نموذج تضمين لـ RAG في 2026؟
Voyage-4-large لجودة الاسترجاع الخالصة، وGemini Embedding 001 كأفضل واجهة API شاملة، وQwen3-Embedding-8B إن كنت تستضيف ذاتياً. كلمة "الأفضل" تعتمد على سقف تكلفتك واحتياجات لغاتك، لذا اختصر القائمة إلى اثنين واختبرهما على بياناتك الخاصة قبل الالتزام.
ما هو أفضل نموذج تضمين مفتوح المصدر لـ RAG؟
Qwen3-Embedding-8B هو المتصدّر الإجمالي مفتوح المصدر (أعلى نتائج MTEB متعددة اللغات والكود)، وBGE-M3 هو الخيار الشامل الهجين متعدد الاستخدامات، وnomic-embed-text هو اختيار اللابتوب عبر Ollama. الأوزان مجانية، لكنك تدفع مقابل GPU وVRAM لتشغيلها.
مفتوح المصدر مقابل تضمينات API، أيهما أفضل لـ RAG؟
واجهات API تفوز بصفر عمليات تشغيلية وأحدث جودة؛ والاستضافة الذاتية تفوز بإقامة البيانات المحلية وحجم عالٍ وعدم دفع رسوم لكل رمز. نقطة التعادل عادة يحرّكها الحجم والامتثال، لا الجودة الخام. تحت بضع مئات ملايين الرموز شهرياً، تكون واجهات API غالباً أرخص عملياً.
ما هو أفضل نموذج تضمين محلي للتشغيل على Ollama؟
nomic-embed-text هو الخيار المعتاد (ollama pull nomic-embed-text): خفيف، سريع على عتاد متواضع، ومجاني على مستوى الرمز. إن كان لديك VRAM إضافي في GPU، فنسخة أصغر من Qwen3-Embedding تسترجع بشكل أفضل. كلاهما يُفهرس محلياً دون تكلفة API أو خروج بيانات من جهازك.
هل يعني بُعد تضمين أعلى استرجاعاً أفضل؟
ليس بشكل خطي. بعد نقطة معينة، تضيف الأبعاد الزائدة تخزيناً وكموناً دون مكسب استرجاع متناسب. نماذج Matryoshka تتيح لك الاقتطاع (مثلاً 3072→1024) والاحتفاظ بمعظم الاسترجاع بينما تُصغّر كل متجه نحو 3 أضعاف، ما يخفّض تكلفة قاعدة بياناتك المتجهية مباشرة.
ما هو أرخص نموذج تضمين لا يزال جيداً لـ RAG؟
text-embedding-3-small ($0.02 لكل مليون) أو voyage-4-lite ($0.02 لكل مليون) يحققان Recall@10 جيداً لمعظم المجموعات الإنجليزية. إن كان بإمكانك تشغيل GPU، فـ nomic-embed-text مجاني فعلياً على مستوى الرمز. اختبر على بياناتك أولاً؛ النماذج الرخيصة تضعف على الاستعلامات الغامضة.
ما هو أفضل نموذج تضمين متعدد اللغات لـ RAG؟
Qwen3-Embedding-8B وBGE-M3 يتصدّران الاسترجاع المفتوح متعدد اللغات، بينما Cohere Embed v4 وGemini Embedding 001 خياران قويان مُستضافان. اختبر دائماً على لغاتك المستهدفة، لأن ترتيباً مرتفعاً على MTEB متعدد اللغات لا يضمن أداءً عالياً في زوج لغتك المحدد.
هل ما زلت بحاجة إلى مُعيد ترتيب (reranker) مع نموذج تضمين جيد؟
غالباً نعم لأجل RAG عالي الدقة. نموذج تضمين قوي يُدخل المرشحين ضمن أفضل 50؛ ومُعيد الترتيب يُعيد ترتيب أفضل k للدقة النهائية. نموذج تضمين أرخص مع مُعيد ترتيب غالباً يتفوّق على نموذج تضمين مكلف بمفرده، وبتكلفة إجمالية أقل.
الحكم النهائي
أفضل استرجاع إجمالي عبر API يذهب إلى Voyage-4-large؛ وGemini Embedding 001 هو الأفضل شمولاً من حيث النتيجة؛ وQwen3-Embedding-8B يتصدّر مفتوح المصدر واسترجاع الكود؛ وnomic-embed-text هو اختيار اللابتوب المحلي. لكن الفائز بالقيمة لمعظم الفرق هو text-embedding-3-large مُقتطَعاً عند 1024 بُعداً: Recall@10 يبلغ 0.83، بسعر ~$0.13 لكل مليون، ومتجهات أصغر 3 أضعاف. الدرس الحقيقي من 10,000 وثيقة هو أن المتصدّر رقم 1 على MTEB نادراً ما يكون الأفضل لمجموعتك، فاختبر على بياناتك الخاصة. تبني RAG للإنتاج وتريد رأياً إضافياً؟ احصل على استشارة مجانية.