
Voyage مقابل OpenAI مقابل Cohere للتضمينات: اختبرنا الثلاثة لأنظمة RAG (2026)
مقارنة Voyage وOpenAI وCohere للتضمينات صارت سؤال 2026، لا سؤال 2024. أطلقت Voyage نموذج voyage-4 في 15 يناير، ثم voyage-context-4 في 29 يونيو. وأطلقت Cohere نموذج Embed v4. أما OpenAI؟ لا شيء جديد منذ يناير 2024. فجوة السنتين ونصف هذه تُغيّر حساباتك بشأن الواجهة البرمجية المُستضافة التي ينبغي أن تبني عليها خط أنابيب RAG لديك.
الحكم السريع: أي واجهة برمجية للتضمين تختار؟
في RAG لعام 2026، اختر Voyage لأعلى جودة استرجاع، وOpenAI كخيار افتراضي آمن وموثَّق جيداً، وCohere للتضمين متعدد اللغات أو متعدد الوسائط أو حزمة تضمين ومعيد ترتيب من مزوّد واحد. ملاحظة أولى مهمة: الرقم المتداول "14% أفضل" هو نتيجة Voyage الخاصة على معيار RTEB، وليس نتيجة MTEB مستقلة. انسبه لمصدره بدقة.
Voyage، اختره إن كانت جودة الاسترجاع عقبتك الفعلية، أو تعمل في مجال متخصص (كود، قانون، مالية)، أو تريد مسار ترقية بمساحة تضمين مشتركة يتيح لك التبديل بين نماذج Voyage دون إعادة فهرسة. أصغر منظومة بين الثلاثة، لكن الاسترجاع الأحدّ على الورق.
OpenAI، اختره إن أردت الخيار الافتراضي الأفضل توثيقاً بأوسع دعم لحزم SDK وأسعار يمكن التنبؤ بها لـRAG الإنجليزي العام. إنه الخيار الآمن غير المثير. المقابل: لا معيد ترتيب أصلي، وخط نماذج لم يُحدَّث منذ يناير 2024.
Cohere، اختره إن احتجت استرجاعاً متعدد اللغات (أكثر من 100 لغة)، أو متعدد الوسائط (نص وصورة)، أو أردت التضمينات مع معيد الترتيب المُستضاف المعياري في السوق (Rerank 4) من مزوّد واحد. أغلى ثمناً حين تتراكم عمليات بحث إعادة الترتيب، لكن الحزمة أحادية المزوّد مريحة.
تريد الصورة الأوسع بما فيها الخيارات ذاتية الاستضافة؟ راجع تصنيف النماذج التسعة الكامل شاملاً الخيارات مفتوحة المصدر. هذا المقال الفرعي يتعمّق في الواجهات البرمجية المُستضافة الثلاث فقط.
نظرة سريعة على تضمينات Voyage وOpenAI وCohere
يقارن الجدول أدناه رائد كل مزوّد من حيث الجودة، الأبعاد، نافذة السياق، السعر، القوة متعددة اللغات، وإقران معيد الترتيب. ملاحظة صادقة أولاً: لا يوجد صف MTEB عام واحد يقارن الثلاثة بنفس اللقطة الزمنية بشكل مباشر، لذا كل رقم جودة مذكور مع مصدره وتاريخه بدلاً من دمجه في عمود واحد.
| المزوّد + النموذج الرائد | الجودة MTEB/RTEB (المصدر والتاريخ) | الأبعاد (Matryoshka) | نافذة السياق | السعر لكل مليون رمز | متعدد اللغات | إقران معيد الترتيب | حدود المعدل / الطبقة المجانية |
|---|---|---|---|---|---|---|---|
| Voyage, voyage-4-large | RTEB nDCG@10، تقرير Voyage يناير 2026 (المزوّد، غير مستقل) | 2048 / 1024 / 512 / 256 | ~32K (تأكد من صفحة الوثائق) | $0.12 | جيد | rerank-2.5 ($0.05/M) | 200M رمز مجاني |
| OpenAI, text-embedding-3-large | متوسط MTEB ~64.6 إنجليزي، OpenAI يناير 2024 | حتى 3072 | 8191 | $0.13 ($0.065 دفعي) | مقبول | لا يوجد (إقران خارجي) | مستويات RPM/TPM قياسية |
| Cohere, embed-v4.0 | معيار داخلي متعدد الوسائط، Cohere 2026 | 256 / 512 / 1024 / 1536 | 128K | $0.12 | الرائد (أكثر من 100 لغة) | Rerank 4 ($2.00–2.50/1K بحث) | مفتاح تجريبي |
| خيارات اقتصادية | لا ينطبق | 512–1536 | لا ينطبق | $0.02 لكل نموذج | لا ينطبق | لا ينطبق | voyage-4-lite $0.02 / text-embedding-3-small $0.02 |
الأسعار محدَّثة حتى يوليو 2026، لذا تحقّق منها مجدداً على صفحات تسعير كل مزوّد قبل الالتزام، فأسعار التضمين تغيّرت مرتين خلال النصف الأول من 2026. الأبعاد مهمة للتكلفة أيضاً: كلما قصّرتَ الأبعاد أكثر، انخفضت تكلفة تخزين هذه التضمينات في قاعدة بيانات متجهة.
Voyage AI: أفضل استرجاع في فئته (إن استطعت إعادة التضمين)
تقدّم Voyage AI أحدّ جودة استرجاع بين الثلاثة وفق معاييرها الخاصة، إلى جانب مساحة تضمين مشتركة تتيح لك التبديل بين أحجام نماذج voyage-4 دون إعادة الفهرسة. أُطلقت عائلة voyage-4 في 15 يناير 2026: voyage-4-large بسعر $0.12 لكل مليون رمز، voyage-4 بسعر $0.06، وvoyage-4-lite بسعر $0.02.
تستخدم الأحجام الثلاثة جميعها بنية مزيج الخبراء (Mixture-of-Experts) وتتشارك مساحة تضمين واحدة، لذا لا تُجبرك الترقية من lite إلى large على إعادة فهرسة كاملة. ثم هناك voyage-context-4 (29 يونيو 2026، $0.12 لكل مليون رمز، منخفضاً من $0.18 لـcontext-3)، الذي ينتج تضمينات مقاطع سياقية: كل مقطع يُشفَّر مع سياق المستند المحيط به، بنافذة 32K لكل مقطع وسياق مستند يصل إلى 120K. تُقرن Voyage مُشفِّراتها بمعيد الترتيب rerank-2.5 بسعر $0.05 لكل مليون رمز.
وإليك ملاحظة الصدق التي يجب أن ترافق أي ادعاء لـVoyage: العنوان الرئيسي القائل إن "voyage-4-large يتفوّق على OpenAI بنحو 14.05% وعلى Cohere بنحو 8.20%" هو نتيجة Voyage الخاصة على معيار RTEB (معيار من 29 مجموعة بيانات، nDCG@10)، أعلنته الشركة بنفسها في مدونة الإطلاق بتاريخ 15 يناير. وهي ليست نتيجة MTEB مستقلة. لهذا فإن رقم MTEB وحده لا يحسم الأمر لصالحك.
التضمين مع Voyage بضعة أسطر فقط:
import voyageai
vo = voyageai.Client()
result = vo.embed(
["your chunk text here"],
model="voyage-4-large",
input_type="document",
)اختر Voyage إن كانت جودة الاسترجاع هي ما يُعيق نظام RAG لديك. الحدود الصادقة: إنها أصغر منظومة بين الثلاثة، ورقم الـ14% مُعلَن من المزوّد نفسه، والانتقال إلى Voyage يعني إعادة تضمين كامل مجموعة بياناتك.
تضمينات OpenAI: الخيار الافتراضي الآمن (بلا معيد ترتيب)
OpenAI هي الخيار الافتراضي الأكثر أماناً وتوثيقاً: يتمتّع text-embedding-3-large بأوسع دعم لحزم SDK والأدوات بين واجهات التضمين البرمجية، مع أسعار يمكن التنبؤ بها واسترجاع إنجليزي جيد. إنه الخيار حين تريد صفر مفاجآت وكل إطار عمل يدعمه فعلاً جاهزاً.
يعمل text-embedding-3-large بسعر $0.13 لكل مليون رمز ($0.065 دفعي)، ويدعم حتى 3072 بُعداً عبر تقنية Matryoshka، ويتعامل مع نافذة سياق 8191 رمزاً. الشقيق الاقتصادي، text-embedding-3-small، بسعر $0.02 لكل مليون رمز بـ1536 بُعداً، ويصمد جيداً في RAG العام.
حقيقتان لا تذكرهما أي صفحة منافسة. الأولى: لا يوجد text-embedding-4 — لا تزال وثائق التضمين الخاصة بـOpenAI تُدرج سلسلة 3 فقط. لم يُحدَّث هذا الخط منذ يناير 2024، أي أنك تُفهرس على نموذج عمره نحو عامين ونصف بينما أطلقت Voyage وCohere إصدارات 2026. الثانية: لا تقدّم OpenAI معيد ترتيب أصلياً. الفرق التي تحتاج واحداً تُقرن تضمينات OpenAI مع Cohere Rerank أو مُشفِّر متقاطع (cross-encoder). لا توجد نقطة نهاية لإعادة الترتيب من OpenAI حتى يوليو 2026، فلا تُصمّم معمارية على افتراض وجود واحدة.
دعم اللغات المتعددة مقبول (تحسّن MIRACL إلى ~54.9% عند الإطلاق) لكن OpenAI ليست رائدة في تعدد اللغات. في قرار voyage-4-large مقابل text-embedding-3-large، تُضحّي OpenAI بذروة الاسترجاع مقابل الاستقرار واتساع المنظومة.
اختر OpenAI إن أردت الخيار الافتراضي الآمن الموثوق لـRAG الإنجليزي العام بأفضل توثيق. الحدود الصادقة: لا معيد ترتيب، ونموذج ثابت منذ عامين ونصف بينما تحرّك المجال من حوله.
Cohere Embed v4: تعدد الوسائط + أفضل معيد ترتيب مُستضاف
Cohere Embed v4 هو الرائد متعدد اللغات ومتعدد الوسائط، والوحيد بين الثلاثة الذي يُقرَن أصلياً مع معيد الترتيب المُستضاف المعياري في السوق. إن كانت مجموعة بياناتك تمتد عبر أكثر من 100 لغة أو تمزج نصاً وصوراً، فهذا هو الخيار الأنسب.
يعمل embed-v4.0 بسعر $0.12 لكل مليون رمز، ويتعامل مع نافذة سياق 128K رمز، ويدعم إدخالاً متعدد الوسائط (نص، صور، ومستندات متداخلة). الأبعاد هي 256/512/1024/1536 عبر Matryoshka، مع 1536 كافتراضي. كان خط v3 نصياً فقط بـ1024 بُعداً، لذا يمثّل v4 قفزة حقيقية في كل من الوسائط والسياق.
السبب الحقيقي لاختيار Cohere هو الحزمة: اقرن Embed v4 مع Rerank 4 فتحصل على التضمين وإعادة الترتيب من مزوّد واحد. Rerank 4 Fast بسعر $2.00 لكل 1,000 بحث، وRerank 4 Pro بسعر $2.50 لكل 1,000، حيث يعني بحث واحد استعلاماً واحداً مقابل حتى 100 مستند. للمؤسسات التي تحتاج عزلاً، تعمل مستويات Cohere Model Vault المخصصة بسعر $2,500–6,500 شهرياً، لكن هذا خيار المؤسسات لا الخيار الافتراضي.
اختر Cohere إن احتجت تعدد اللغات أو تعدد الوسائط أو حزمة تضمين وإعادة ترتيب من مزوّد واحد. الحدود الصادقة: يصبح أغلى ثمناً كلما تراكمت عمليات بحث إعادة الترتيب، وفي النص الإنجليزي وحده لا تُعد جودة تضمينه لكل رمز تفوّقاً واضحاً على Voyage.
اختبرنا الثلاثة على مجموعة البيانات نفسها
أعدنا تشغيل مجموعة بيانات RAG الداخلية لدينا مقابل الواجهات البرمجية الرائدة الثلاث فقط، وكانت النتيجة الأبرز مفاجئة لنا: معيد الترتيب حرّك Recall@10 أكثر مما فعلت الفجوة بين أي مُشفِّرين تضمين. إليك الإعداد والأرقام.
مجموعة البيانات هي نفس المجموعة المكوّنة من نحو 10,000 مستند من الوثائق التقنية الإنجليزية وتذاكر الدعم التي استخدمناها في اختبار المقال المرجعي، لتبقى الأرقام متسقة عبر المجموعة. لكن هذا مقطع مقتصر على الواجهات البرمجية فقط: تحديداً voyage-4-large وtext-embedding-3-large وcohere embed-v4.0. لم نُعِد اختبار النماذج مفتوحة المصدر هنا؛ فتلك مهمة المقال المرجعي. قسنا Recall@10 وnDCG@10 مقابل مجموعة استعلامات مُوسَّمة يدوياً تضم نحو 120 استعلاماً، وقسنا الكمون عند النسبة المئوية 95 (p95) للتضمين على دفعة من 1,000 مقطع، وحسبنا التكلفة الفعلية لكل مليون رمز عند حجمنا.
| النموذج | Recall@10 | nDCG@10 | الكمون p95 (دفعة 1K) | التكلفة الفعلية لكل مليون رمز |
|---|---|---|---|---|
| voyage-4-large | 0.89 | 0.81 | 240 ms | $0.12 |
| text-embedding-3-large | 0.86 | 0.78 | 180 ms | $0.13 |
| cohere embed-v4.0 | 0.85 | 0.77 | 210 ms | $0.12 |
تصدَّر voyage-4-large في Recall@10 على مجموعتنا (0.89 مقابل 0.86)، لكن بفارق نحو 3 نقاط فقط عن OpenAI، لا الـ14% التي يوحي بها عنوان RTEB الرئيسي لـVoyage. في مجالنا، كانت الفجوة الحقيقية أصغر بكثير. تقليص أبعاد text-embedding-3-large من 3072 إلى 1024 كلّف نحو 3 نقاط فقط من Recall@10 (إلى 0.83) بينما خفّض تخزين قاعدة البيانات المتجهة لدينا نحو 3 أضعاف. ظهرت أفضلية Cohere في مجموعة التذاكر غير الإنجليزية لدينا، لا في الإنجليزية. وماذا عن معيد الترتيب؟ إضافة Cohere Rerank 4 (أو voyage rerank-2.5) رفعت Recall@10 بنحو 6 نقاط عبر مُشفِّرات التضمين الثلاثة جميعها. في مجموعتنا، حرّك معيد الترتيب Recall@10 أكثر مما فعل تبديل مُشفِّرات التضمين.
سؤال معيد الترتيب: لماذا اختيار مُشفِّر التضمين ليس القصة كاملة
مُشفِّر التضمين لديك طبقة واحدة، لا كامل حزمة الاسترجاع. يُعيد معيد الترتيب تسجيل أفضل المرشحين اللذين يُعيدهما مُشفِّر التضمين، وفي اختبارنا حرّك Recall@10 أكثر من تبديل مُشفِّرات التضمين. ولهذا فإن سؤال "أي واجهة برمجية للتضمين هي الأفضل" هو السؤال الأول الخاطئ إن لم تكن قد أضفت معيد ترتيب بعد.
| المزوّد | معيد ترتيب أصلي؟ | نموذج معيد الترتيب + السعر | ملاحظات |
|---|---|---|---|
| Voyage | نعم | rerank-2.5 بسعر $0.05/M، rerank-2.5-lite بسعر $0.02/M | رخيص، يُقرَن مع أي مُشفِّر تضمين |
| OpenAI | لا | لا يوجد | يجب إقرانه مع Cohere Rerank أو مُشفِّر متقاطع |
| Cohere | نعم | Rerank 4 Fast بسعر $2.00/1K، Rerank 4 Pro بسعر $2.50/1K | معيد الترتيب المُستضاف المعياري في السوق |
فكّر في التضمين مع إعادة الترتيب كحزمة واحدة. يُلقي مُشفِّر التضمين شبكة واسعة على مجموعة بياناتك؛ ويُصنّف معيد الترتيب ما اصطاده. اختر OpenAI للتضمينات وستظل بحاجة إلى معيد ترتيب من مكان آخر، عادةً Cohere Rerank، ما يحوّل خياراً أحادي المزوّد إلى خيار ثنائي المزوّد. لتنسيق كل هذا حول حزمة RAG، راجع بقية أدوات حزمة RAG.
تبديل المزوّدين: تكلفة إعادة التضمين التي لا يذكرها أحد
تبديل مزوّد التضمين يعني إعادة تضمين مجموعة بياناتك بالكامل. التضمينات ليست قابلة للتبادل بين المزوّدين، فمتجه Voyage ومتجه OpenAI يعيشان في فضاءين مختلفين. هذه تكلفة ترحيل حقيقية لا تكاد أي صفحة مقارنة تحسبها.
الاستثناء الجدير بالمعرفة: مساحة التضمين المشتركة لدى Voyage تتيح لك التبديل بين نماذج Voyage (من lite إلى large) دون إعادة فهرسة. أما بين المزوّدين المختلفين، فخطّط لإعادة تضمين كاملة لكل ما فهرسته. احسب تكلفة الرموز لإعادة تشفير مجموعة بياناتك بأكملها قبل التبديل، لا بعده. إن كان إجمالي إنفاقك على نماذج اللغة الكبيرة هو همّك الحقيقي، راجع كيف تقارن خطط الاشتراك من حيث التكلفة. تفضّل الاستضافة الذاتية بدل الدفع لكل رمز؟ هذا بناء منفصل يستحق دليله الخاص. وإن أردت تخطّي التضمينات كلياً وشراء الاسترجاع كواجهة بحث مُدارة، فهذا مسار صالح أيضاً.
عن الكاتب
مرت باتور هو المؤسس المشارك لـTechsy.io، حيث يبني الفريق وكلاء ذكاء اصطناعي وأنظمة أتمتة وخطوط أنابيب صوتية لفرق المبيعات الموجّهة للشركات (B2B). يكتب عن حزمة أدوات نماذج اللغة الكبيرة التي يستخدمها فريق Techsy فعلاً في الإنتاج. تواصل معه عبر LinkedIn.
الأسئلة الشائعة
هل Voyage أفضل فعلاً من تضمينات OpenAI؟
في ذروة الاسترجاع، نعم على الورق. يُبلغ voyage-4-large عن nDCG@10 أعلى بنحو 14% من text-embedding-3-large، لكن هذه نتيجة Voyage الخاصة على معيار RTEB، لا نتيجة مستقلة. في مجموعة بياناتنا كانت الفجوة الحقيقية في المجال نحو 3 نقاط فقط، ويُقلّصها معيد الترتيب أكثر. تفوز Voyage بذروة الاسترجاع؛ وتفوز OpenAI بالمنظومة والاستقرار.
أي واجهة برمجية للتضمين هي الأرخص؟
المستويان الاقتصاديان متعادلان. يكلّف كل من voyage-4-lite وtext-embedding-3-small $0.02 لكل مليون رمز حتى يوليو 2026. لفهرسة RAG عامة جيدة بميزانية محدودة، كلاهما يفي بالغرض. نموذج OpenAI الصغير يتمتّع بدعم أدوات أوسع؛ بينما يمنحك voyage-4-lite مسار ترقية بمساحة تضمين مشتركة إلى voyage-4-large لاحقاً.
هل تمتلك OpenAI معيد ترتيب؟
لا. لا تقدّم OpenAI أي نقطة نهاية لإعادة الترتيب حتى يوليو 2026، فقط تضمينات ونماذج محادثة. إن احتاج خط أنابيب RAG لديك إعادة ترتيب، ومعظم الأنظمة الإنتاجية تستفيد منها، فإنك تقرن تضمينات OpenAI مع Cohere Rerank 4 أو مُشفِّر متقاطع مثل BGE. لا تُصمّم معماريتك على افتراض وجود معيد ترتيب أصلي من OpenAI.
هل Cohere Embed v4 أفضل من OpenAI في تعدد اللغات؟
نعم. Cohere هي الرائدة متعددة اللغات ومتعددة الوسائط بين الثلاثة، ومُسوَّقة عبر أكثر من 100 لغة، بينما text-embedding-3-large من OpenAI مقبول لكنه غير موضوع كنموذج متعدد اللغات. في اختبارنا، ظهرت أفضلية Cohere الأوضح في مجموعة التذاكر غير الإنجليزية. أما في RAG الإنجليزي وحده، فتضيق الفجوة بينهما بشكل ملحوظ.
هل يمكنني تبديل مزوّدي التضمين دون إعادة فهرسة؟
لا. تضمينات المزوّدين المختلفين تعيش في فضاءات متجهة مختلفة، فتبديل المزوّد يعني إعادة تضمين مجموعة بياناتك بالكامل. الاستثناء الوحيد: مساحة التضمين المشتركة لدى Voyage تتيح لك التبديل بين نماذج Voyage (من lite إلى large) دون إعادة فهرسة. احسب تكلفة إعادة التشفير الكاملة قبل الترحيل بين المزوّدين.
ما نافذة السياق لكل مزوّد؟
تتفاوت بشكل كبير. يتوقف text-embedding-3-large من OpenAI عند 8191 رمزاً، وvoyage-4-large من Voyage نحو 32K (تأكد من صفحة الوثائق الحالية)، ويتعامل embed-v4.0 من Cohere مع 128K. يضيف voyage-context-4 من Voyage سياق مستند يصل إلى 120K لتضمينات المقاطع السياقية. لRAG المستندات الطويلة، تمنحك Cohere وvoyage-context-4 أكبر هامش.
voyage-4 مقابل voyage-context-4 — أيهما لـRAG؟
استخدم voyage-context-4 لـRAG كثيف التقطيع أو المستندات الطويلة، لأن كل مقطع يُشفَّر مع سياق المستند المحيط به، ما يُحسّن الاسترجاع على النصوص المجزّأة. استخدم voyage-4-large للاسترجاع القياسي أحادي المقطع حيث تكون المقاطع مكتفية ذاتياً أصلاً. كلاهما بسعر $0.12 لكل مليون رمز حتى يوليو 2026، فالاختيار يتعلق ببنية المستند لا بالسعر.
أيهما الأفضل لـRAG الخاص باسترجاع الكود؟
Voyage هو الخيار المعتاد لاسترجاع الكود، إذ نماذجها المتخصصة مضبوطة لهذا المجال، مع أن نماذج مفتوحة مثل Qwen3 منافس قوي أيضاً. إن كان بحث الكود عبء عملك الأساسي، قارن Voyage بمُشفِّر كود مفتوح المصدر على مستودعك الخاص. راجع تصنيف النماذج التسعة الكامل شاملاً الخيارات مفتوحة المصدر للخيارات المفتوحة.
تبني خط أنابيب RAG إنتاجياً وتريد رأياً ثانياً بشأن الحزمة؟ احصل على استشارة مجانية.