ai-machine-learning

اختبرنا 8 نماذج LLM مفتوحة المصدر: 3 فقط تتفوق على GPT-4 في 2026

بقلم Mert Batur
تم التحديث Jul 5, 2026
16 قراءة
اختبرنا 8 نماذج LLM مفتوحة المصدر: 3 فقط تتفوق على GPT-4 في 2026

أفضل نماذج اللغة الكبيرة مفتوحة المصدر في 2026: 8 نماذج مرتبة حسب الأداء الفعلي

آخر تحديث: 5 يوليو 2026. كل درجة مقياس وكل رقم VRAM وكل ترخيص في هذا الدليل تم إعادة التحقق منها لهذا التحديث. الترتيب أدناه يعكس النماذج ذات الأوزان المفتوحة الصادرة حتى منتصف 2026 — إذا غيّر إصدار جديد الترتيب، تُحدَّث هذه الصفحة خلال شهر.

أفضل نموذج LLM مفتوح المصدر في 2026 هو Qwen 3 235B-A22B للاستدلال العام والبرمجة، مع تصدر DeepSeek R1 في الاستدلال الرياضي العميق وLlama 4 Scout في السياق الطويل (10 ملايين رمز). لوحدة GPU استهلاكية واحدة، يُعد Gemma 3 27B (16 GB VRAM) وPhi-4 14B (8 GB) الأسهل للاستضافة الذاتية. تطابق الثلاثة نماذج الأعلى أداءً فئة GPT-4 في البرمجة والرياضيات مع البقاء مجانية للنشر.

نماذج LLM مفتوحة المصدر الرائدة: لمحة عن المقاييس

يغطي الجدول أدناه خمسة نماذج مفتوحة المصدر مستخدمة على نطاق واسع، مُقيَّمة وفق مقاييس عامة معيارية. يقيس MMLU المعرفة العامة الشاملة؛ ويقيس HumanEval نسبة النجاح في توليد الأكواد.

النموذجالمعاملاتالإصدارMMLUHumanEvalالترخيصالأفضل لـ
Llama 3.3 70B70Bديس. 202486.088.4Llama 3.3 Communityالأغراض العامة، متعدد اللغات
Qwen 2.5 72B72Bسبت. 202485.0+86.6Qwen Licenseالرياضيات، البرمجة، اتباع التعليمات
DeepSeek-V3671B (37B نشطة)ديس. 202487.182.6MITالأغراض العامة، البرمجة، موفر التكاليف
Mistral Small 3.124Bمار. 202580.688.4Apache 2.0سير العمل الوكيلية، الرؤية، متعدد اللغات
Gemma 3 27B27Bمار. 2025~78.687.8Gemma Terms of Useالنشر على GPU واحد، متعدد الوسائط

نحدّث هذا الجدول شهرياً.

نماذج اللغة الكبيرة مفتوحة المصدر لم تعد مجرد "منافس" للنماذج الاحتكارية -- في البرمجة والرياضيات والمهام ذات السياق الطويل، إنها تتصدر. الفجوة بين فاتورة API بقيمة 200 دولار شهرياً ونموذج مفتوح مستضاف ذاتياً لم تكن أصغر من أي وقت مضى.

هذا الترتيب يخترق الضجيج. كل نموذج هنا يُقيَّم وفقاً للمقاييس التي تهم فعلاً، والأجهزة التي ستحتاجها بالفعل، وحالة الاستخدام المحددة التي يتألق فيها كل نموذج.

ملخص سريع: أي نموذج LLM مفتوح المصدر يجب أن تختار؟

هل تحتاج إلى أفضل استدلال مطلق؟ اختر Qwen 3 235B أو DeepSeek R1. تريد تشغيل شيء على وحدة GPU واحدة؟ Gemma 3 27B أو Phi-4 14B. تعالج مستندات ضخمة؟ نافذة السياق البالغة 10 ملايين رمز لـ Llama 4 Scout لا مثيل لها.

الترتيبالنموذجالمعاملات (النشطة)الأفضل لـالترخيصالحد الأدنى للـ VRAM
no. 1Qwen 3 235B-A22B235B (22B)الاستدلال + البرمجةApache 2.0~132 GB (Q4)
no. 2DeepSeek R1671B (37B)الاستدلال العميق + الرياضياتMIT~136 GB (Q4)
no. 3Llama 4 Scout109B (17B)السياق الطويل (10M رمز)Llama License~55 GB (Q4)
no. 4DeepSeek V3671B (37B)الاستخدام العام + البرمجةMIT~136 GB (Q4)
no. 5Mistral Large 3675B (41B)متعدد اللغات + المؤسساتApache 2.0~140 GB (Q4)
no. 6Gemma 3 27B27B (27B، كثيف)النشر على GPU واحدأوزان مفتوحة~16 GB (Q4)
no. 7Phi-4 Reasoning14B (14B، كثيف)الحافة + الأجهزة المحمولةMIT~8 GB (Q4)
no. 8GLM-4.7355B (32B)سير عمل البرمجة الوكيليةMIT~130 GB (Q4)

أرقام VRAM تفترض تكميماً Q4. متطلبات الدقة الكاملة أعلى بمقدار 2-4 مرات. إذا كنت جديداً على تشغيل النماذج محلياً، ابدأ بـ Gemma 3 أو Phi-4 -- إنهما الخياران الأكثر توافقاً مع الأجهزة في هذه القائمة.

لوحة متصدري نماذج LLM مفتوحة المصدر: تصنيف يوليو 2026

اعتباراً من يوليو 2026، يتصدر Qwen 3 235B-A22B لوحة متصدرينا لنماذج LLM مفتوحة المصدر في الاستدلال والبرمجة الشاملين، بينما يأتي DeepSeek R1 ثانياً في الرياضيات العميقة وLlama 4 Scout ثالثاً في السياق الطويل. يغطي الترتيب الكامل أدناه جميع النماذج الثمانية التي قُيِّمت في هذا الدليل، من أجهزة مراكز البيانات وصولاً إلى الخيارات المناسبة لأجهزة الحاسوب المحمولة.

الترتيبالنموذجالترخيصالأفضل لـالحد الأدنى للـ VRAM
no. 1Qwen 3 235B-A22BApache 2.0الاستدلال + البرمجة~132 GB (Q4)
no. 2DeepSeek R1MITالاستدلال العميق + الرياضيات~136 GB (Q4)
no. 3Llama 4 ScoutLlama Licenseالسياق الطويل (10M رمز)~55 GB (Q4)
no. 4DeepSeek V3MITالاستخدام العام + البرمجة~136 GB (Q4)
no. 5Mistral Large 3Apache 2.0متعدد اللغات + المؤسسات~140 GB (Q4)
no. 6Gemma 3 27Bأوزان مفتوحةالنشر على GPU واحد~16 GB (Q4)
no. 7Phi-4 ReasoningMITالحافة + الأجهزة المحمولة~8 GB (Q4)
no. 8GLM-4.7MITسير عمل البرمجة الوكيلية~130 GB (Q4)

تعكس هذه التصنيفات إعادة تحققنا الشهري من المقاييس ومتطلبات الأجهزة وشروط التراخيص.

لنحلل الآن ما الذي يجعل كل نموذج يستحق اهتمامك.

1. Qwen 3 235B-A22B -- أفضل نموذج LLM مفتوح المصدر بشكل عام

Qwen 3 235B-A22B من Alibaba هو النموذج الذي يجب التغلب عليه الآن. إنه معمارية Mixture-of-Experts بإجمالي 235 مليار معامل، لكن يتم تنشيط 22 مليار فقط لكل رمز -- مما يخفض الحوسبة بنحو 90% مقارنة بنموذج كثيف بجودة مماثلة.

ما يميز Qwen 3 هو وضع التفكير المزدوج. يمكنك التبديل بين "وضع التفكير" للمسائل الرياضية والبرمجية المعقدة (حيث يعرض النموذج سلسلة تفكيره) و"الوضع غير التفكيري" السريع للردود الفورية في الدردشة. هذه المرونة مهمة في الإنتاج.

أبرز نتائج المقاييس:

المقياسنتيجة Qwen 3 235Bالسياق
AIME 202485.7%رياضيات على مستوى المسابقات
AIME 202581.5%مسائل رياضية أصعب
LiveCodeBench v570.7%مهام برمجة حقيقية
CodeForces2,056البرمجة التنافسية
BFCL v370.8%استدعاء الدوال

هذه الأرقام تضعه في نفس مستوى DeepSeek R1 و o1 من OpenAI و Gemini 2.5 Pro -- باستثناء أنه يمكنك تنزيله وضبطه الدقيق ونشره أينما تريد بموجب Apache 2.0.

متطلبات الأجهزة: يحتاج النموذج الكامل إلى نحو 132 GB من VRAM عند تكميم Q4. هذا إعداد متعدد GPU -- فكر في خمس وحدات RTX 3090 أو ثلاث A40 أو جهاز H100 مزدوج. ليس رخيصاً، لكنه في متناول شركة ناشئة أو مختبر أبحاث. تشمل عائلة Qwen 3 أيضاً متغيرات أصغر (32B وذ14B و8B و4B) تعمل على أجهزة المستهلكين.

من يجب أن يستخدمه: الفرق التي تحتاج إلى استدلال وبرمجة على مستوى المنافسة مع الرغبة في امتلاك بنيتها التحتية الخاصة. قوي بشكل خاص لأحمال العمل متعددة اللغات مع سياق 256K ودعم أكثر من 100 لغة. إذا كنت تخطط لضبط نموذج دقيق لمجالك المحدد، فإن ترخيص Apache 2.0 الخاص بـ Qwen 3 يمنحك حرية كاملة.

2. DeepSeek R1 -- الأفضل للاستدلال العميق

غيّر DeepSeek R1 قواعد اللعبة حين أُطلق في مطلع عام 2025، وأثبت أن النماذج مفتوحة المصدر يمكنها مضاهاة o1 من OpenAI في مهام الاستدلال. دفع تحديث R1-0528 الأمور إلى أبعد من ذلك -- قفزت دقة AIME 2025 من 70% إلى 87.5%.

سر النموذج هو منهجية تدريبه. أنشأ DeepSeek أولاً R1-Zero باستخدام التعلم المعزز البحت دون ضبط دقيق خاضع للإشراف. طوّر النموذج تلقائياً استدلال سلسلة الأفكار والتحقق الذاتي وسلوكيات التتبع الخلفي. تعلّم حرفياً كيف يتحقق من عمله الخاص.

أبرز نتائج المقاييس:

المقياسنتيجة DeepSeek R1السياق
AIME 202587.5% (R1-0528)أولمبياد الرياضيات
GPQA Diamond71.5%علوم على مستوى الدراسات العليا
SWE-bench49.2%هندسة برمجيات حقيقية
HumanEval92.4%توليد الأكواد

متطلبات الأجهزة: نفس معمارية 671B MoE الخاصة بـ DeepSeek V3، لذا فأنت تتطلع إلى ~136 GB VRAM عند Q4. لكن إليك الجانب العملي: أصدر DeepSeek أيضاً متغيرات مقطرة بمعاملات 1.5B و7B و14B و32B و70B. التقطير 32B يعمل على RTX 4090 واحد ولا يزال يتفوق على كثير من النماذج الأكبر في مهام الاستدلال.

من يجب أن يستخدمه: أي شخص يبني تطبيقات تتطلب استدلالاً خطوة بخطوة -- إثبات المبرهنات وتصحيح أخطاء الكود المعقد والتحليل العلمي. المتغيرات المقطرة مفيدة بشكل خاص إذا كنت تحتاج إلى قدرات استدلال بميزانية محدودة. تحقق من أفضل أدوات تشغيل نماذج LLM محلياً إذا أردت نشر التقطيرات الأصغر على جهازك الخاص.

3. Llama 4 Scout -- الأفضل للسياق الطويل

أحضر Llama 4 Scout من Meta شيئاً جديداً حقاً إلى عالم المصدر المفتوح: نافذة سياق بـ 10 ملايين رمز. هذه ليست خطأ مطبعياً. يمكنك تغذيته بقاعدة كود كاملة أو رف من الأوراق البحثية أو 20 ساعة من النصوص المحولة من الفيديو في موجّه واحد.

يستخدم Scout 16 خبيراً من نوع MoE مع نشاط خبيرين فقط لكل رمز، مما يمنحه إجمالي 109B معامل لكن 17B فقط نشطة. تزعم Meta أنه يناسب H100 واحداً مع تكميم INT4، وإن كانت نافذة السياق البالغة 10M رمز تحتاج بوضوح إلى ذاكرة أكبر لذاكرة التخزين المؤقت KV.

أبرز نتائج المقاييس:

المقياسنتيجة Llama 4 Scoutالسياق
Needle-in-a-Haystack (10M)100%استرجاع مثالي
MMLU79.6%المعرفة العامة
HumanEval81.2%توليد الأكواد
DocVQA85.1%فهم المستندات

درجة Needle-in-a-Haystack المثالية عند 10M رمز لافتة للنظر. تبدأ معظم النماذج في فقدان المعلومات قبل 128K بكثير. يستخدم Scout نهجاً جديداً لإخفاء الانتباه بين المستندات يحافظ على الحدود بين المستندات حتى داخل نافذة سياقه الضخمة.

متطلبات الأجهزة: عند Q4، تحتاج أوزان النموذج إلى نحو 55 GB من VRAM. H100 واحد (80 GB) يتعامل معه بسهولة. بالنسبة لأجهزة المستهلكين، يمكن لاثنتين من RTX 4090 (48 GB إجمالاً) التعامل مع أطوال سياق أقصر. المشكلة: استخدام نافذة السياق الكاملة البالغة 10M يتطلب ذاكرة KV cache ضخمة إضافية بالإضافة إلى أوزان النموذج. عملياً، تقتصر معظم عمليات النشر المستضافة ذاتياً على 128K-256K رمز.

من يجب أن يستخدمه: الفرق التي تعمل مع مستندات ضخمة -- التحليل القانوني وأسئلة وأجوبة مستودعات الأكواد وتوليف الأوراق البحثية. القدرات متعددة الوسائط (إدخال النص والصورة) قوية أيضاً. كن واقعياً بشأن طول السياق فحسب: السقف البالغ 10M حقيقي، لكنك ستحتاج إلى أجهزة بمستوى الخادم للوصول إليه.

4. DeepSeek V3 -- أفضل نموذج LLM مفتوح المصدر للأغراض العامة

بينما يحظى DeepSeek R1 بالعناوين الرئيسية لاستدلاله، يُعدّ DeepSeek V3 على الأرجح النموذج الأكثر عملية للاستخدام اليومي. إنه حصان العمل -- سريع وقادر على جميع الجبهات وفعّال بشكل ملحوظ لحجمه.

يشترك V3 في نفس معمارية 671B MoE / 37B نشطة الخاصة بـ R1 لكنه يستبدل سلاسل الاستدلال العميقة بأوقات استجابة أسرع وقدرات عامة أوسع. دمج تحديث V3-0324 تقنيات التعلم المعزز من تدريب R1، مما عزّز الاستدلال دون التأثير السلبي على زمن الاستجابة من سلسلة الأفكار الصريحة.

أبرز نتائج المقاييس:

المقياسنتيجة DeepSeek V3السياق
MMLU87.1%المعرفة العامة
HumanEval82.6%توليد الأكواد
MATH90.2%الاستدلال الرياضي
نافذة السياق128Kدعم المستندات الطويلة

يتفوق DeepSeek V3 على GPT-4.5 في مقاييس البرمجة والرياضيات. كفاءة تدريبه أسطورية -- 2.788 مليون ساعة GPU على H800 فقط لتشغيل التدريب المسبق الكامل، وهو جزء بسيط مما تتطلبه النماذج المقارنة.

متطلبات الأجهزة: مطابقة لـ R1 (~136 GB VRAM عند Q4). للنشر العملي، تعمل الإصدارات المكمَّمة GGUF عبر llama.cpp أو Ollama على إعدادات متعددة GPU للمستهلكين.

من يجب أن يستخدمه: إذا كنت تحتاج إلى نموذج واحد يتعامل مع كل شيء -- الدردشة والبرمجة والتحليل والترجمة والتلخيص -- فإن V3 هو الاختيار الأكثر توازناً. لن يتفوق على R1 في الاستدلال الصعب أو على Scout في طول السياق، لكنه سيتجاوز كليهما في أحمال العمل الإنتاجية النموذجية حيث تهم السرعة والتنوع أكثر من درجات المقاييس القصوى.

5. Mistral Large 3 -- الأفضل للاستخدام متعدد اللغات والمؤسسي

أعاد Mistral Large 3 شركة Mistral إلى الحدود الأمامية. بمعاملات إجمالية تبلغ 675B (41B نشطة)، إنه نموذج MoE كامل أُصدر بموجب Apache 2.0 -- تحول كبير عن ترخيص البحث المقيّد الخاص بـ Mistral Large 2.

دُرّب النموذج من الصفر على 3,000 وحدة GPU NVIDIA H200، ويظهر ذلك. في LMSYS Chatbot Arena، جاء في المرتبة no. 2 بين النماذج المفتوحة و#6 إجمالاً (بما فيها النماذج الاحتكارية). ما يجعله مثيراً للاهتمام بشكل خاص للفرق الأوروبية هو قوته في التعدد اللغوي -- دقة 85.5% تقريباً في اختبار MMLU متعدد اللغات متوازن.

أبرز نتائج المقاييس:

المقياسنتيجة Mistral Large 3السياق
MMLU متعدد اللغات85.5%المعرفة عبر اللغات
LMSYS Arenano. 6 إجمالاًتصنيف تفضيل البشر
AIME 2025 (متغير 14B)85%الاستدلال الرياضي
نافذة السياق128Kدعم المستندات الطويلة

سمة تميز نماذج Mistral: دُرّبت على قول "لا أعرف" بدلاً من الهلوسة. هذا يجعل Mistral Large 3 خياراً قوياً لـخطوط أنابيب RAG والتطبيقات المؤسسية حيث الدقة الواقعية أهم من الإخراج الإبداعي.

متطلبات الأجهزة: بمعاملات إجمالية 675B، متطلبات VRAM مماثلة لـ DeepSeek (~140 GB عند Q4). تقدم Mistral أيضاً متغير Small 3 البالغ 14B، الذي يناسب GPU واحداً للمستهلك ويتفوق بكثير على حجمه في الاستدلال والبرمجة.

من يجب أن يستخدمه: الشركات الأوروبية التي تحتاج إلى قدرات متعددة اللغات وسيادة البيانات. فرق المؤسسات التي تبني أنظمة RAG حيث تقليل الهلوسة أمر بالغ الأهمية. ترخيص Apache 2.0 يزيل الاحتكاك التجاري تماماً.

6. Gemma 3 27B -- الأفضل للنشر على GPU واحد

Gemma 3 27B من Google هو نقطة التوازن المثالية بين القدرة وإمكانية الوصول. بمعاملات 27 مليار في معمارية كثيفة، يعمل على RTX 4090 واحد مع تكميم Q4. لا أجهزة متعددة GPU، لا أجهزة بمستوى الخادم -- مجرد بطاقة رسومات للألعاب عادية.

لا تدع عدد المعاملات المتواضع يخدعك. يؤدي Gemma 3 27B أداءً أعلى بكثير من حجمه، خاصة في المهام متعددة الوسائط. يتعامل مع إدخال النص والصورة، ويدعم أكثر من 140 لغة، ونافذة السياق البالغة 130K كريمة لنموذج بهذا الحجم.

أبرز نتائج المقاييس:

المقياسنتيجة Gemma 3 27Bالسياق
MMLU78.6%المعرفة العامة
DocVQA85.6%فهم المستندات
MGSM74.3%الرياضيات متعددة اللغات
ChartQA76.3%الاستدلال البصري

تلك الدرجات متعددة الوسائط (DocVQA 85.6%، ChartQA 76.3%) تنافس نماذج أكبر منها بـ 3-5 أضعاف. بالنسبة للمطورين الذين يحتاجون إلى فهم الصور بدون مجموعة GPU، Gemma 3 هو الاختيار الواضح.

متطلبات الأجهزة: حوالي 16 GB من VRAM عند تكميم Q4، و32 GB عند Q8. RTX 4090 واحد (24 GB) يتعامل معه بسهولة. حتى MacBook Pro M2 مع 32 GB ذاكرة موحدة يمكنه تشغيله. إذا كنت تتبع دليلنا لتشغيل نماذج LLM محلياً، فإن Gemma 3 هو أحد أسهل النماذج للبدء به.

من يجب أن يستخدمه: المطورون المنفردون والفرق الصغيرة وأي شخص يريد نموذجاً متعدد الوسائط قادراً دون استئجار وحدات GPU سحابية. إنه ممتاز أيضاً للنماذج الأولية -- اختبر خط الأنابيب على Gemma 3 محلياً، ثم قم بالتوسع إلى نموذج أكبر في الإنتاج إذا لزم الأمر. لنموذج Google الأصغر الأحدث، اطلع على دليلنا لـGemma 4 12B.

7. Phi-4 Reasoning -- الأفضل للنشر على الحافة والموارد المحدودة

يُثبت Phi-4 Reasoning من Microsoft أن عدد المعاملات ليس كل شيء. بمعاملات 14 مليار فقط، يتفوق على التقطير 70B الخاص بـ DeepSeek R1 في عدة مقاييس استدلال. يضيف Phi-4-reasoning-vision-15B المطلق مؤخراً قدرات متعددة الوسائط، ويسجل نتائج أعلى بنسبة 17% من Gemma 3 12B في مهام الاستدلال الرياضي البصري.

سر عائلة Phi-4 هو جودة بيانات التدريب. يعطي نهج Microsoft الأولوية للبيانات المنسقة عالية الجودة على الحجم الخام، وهذا يعمل -- يسجل Phi-4 أكثر من 80% في مقاييس MATH وMGSM، ويتفوق على Gemini Pro من Google وGPT-4o-mini في الاستدلال الرياضي.

أبرز نتائج المقاييس:

المقياسنتيجة Phi-4السياق
MATH82.6%الاستدلال الرياضي
HumanEval82.6%توليد الأكواد
MGSM80%+الرياضيات متعددة اللغات
MathVista (رؤية)+17% مقابل Gemma 12Bالرياضيات البصرية

متطلبات الأجهزة: حوالي 8 GB من VRAM عند Q4 -- إنه GPU لاب توب أو حتى بطاقة مكتب أقدم. يعمل النموذج بسلاسة على MacBooks بشريحة Apple Silicon، مما يجعله محمولاً بشكل حقيقي. للنشر على الحافة، إنه أحد النماذج القليلة التي يمكنها العمل على الجهاز بزمن استجابة معقول.

من يجب أن يستخدمه: مطورو الجوال والحافة والفرق التي تبني ميزات الذكاء الاصطناعي على الجهاز، وأي شخص يحتاج إلى استدلال قوي على أجهزة محدودة. يُعد Phi-4 أيضاً خياراً ممتازاً لتقييم النماذج المضبوطة نظراً لأن حجمه الصغير يجعل تكرارات التدريب سريعة وغير مكلفة. ترخيص MIT لا يفرض قيوداً تجارية.

8. GLM-4.7 -- الأفضل للبرمجة الوكيلية

GLM-4.7 من Z.ai مبني خصيصاً لحالة استخدام محددة: سير عمل البرمجة الوكيلية حيث يحتاج النموذج إلى الاستدلال واستخدام الأدوات والحفاظ على السياق عبر تفاعلات طويلة متعددة الخطوات.

معماريته عبارة عن MoE بحجم 355B مع 32B معامل نشط، لكن الميزة البارزة هي نظام التفكير ثلاثي المستويات. على عكس معظم النماذج التي تعيد تشغيل عملية استدلالها في كل دور، يحتفظ GLM-4.7 بكتل التفكير طوال المحادثة. سياق الاستدلال المستمر هذا يحدث فرقاً حقيقياً عندما ينسق النموذج مهام البرمجة المعقدة متعددة الخطوات.

أبرز نتائج المقاييس:

المقياسنتيجة GLM-4.7السياق
SWE-bench73.8%هندسة برمجيات حقيقية
HumanEval94.2%توليد الأكواد
نافذة السياق200Kتفاعلات طويلة
الحد الأقصى للإخراج131K رمزتوليد موسع

درجة 73.8% في SWE-bench تنافس Claude Sonnet 4.5 -- في مهام هندسة البرمجيات الواقعية، لا المقاييس الاصطناعية. ونتيجة 94.2% في HumanEval هي الأعلى لأي نموذج في هذه القائمة.

متطلبات الأجهزة: مشابهة لنماذج MoE الكبيرة الأخرى (~130 GB VRAM عند Q4). نافذة السياق البالغة 200K والحد الأقصى للإخراج 131K تجعله جائعاً للذاكرة خلال الجلسات الوكيلية الطويلة.

من يجب أن يستخدمه: فرق التطوير بمساعدة الذكاء الاصطناعي التي تبني وكلاء البرمجة وأدوات التصحيح الآلي وأنظمة مراجعة الكود. إذا كنت تختار أدوات الضبط الدقيق لنموذج يركز على البرمجة، فإن GLM-4.7 أساس قوي. يتيح ترخيص MIT الاستخدام التجاري الكامل.

أفضل نموذج LLM مفتوح المصدر للبرمجة (يوليو 2026)

بالنسبة للبرمجة في يوليو 2026، يُعد GLM-4.7 الخيار الأول مفتوح المصدر، بتسجيله 94.2% في HumanEval و73.8% في SWE-bench، وهو ما ينافس Claude Sonnet 4.5 في مهام البرمجيات الحقيقية. تريد نموذج برمجة قوياً على أجهزة المستهلكين؟ تقطير DeepSeek R1 32B يعمل على RTX 4090 واحد.

تقيّم إصدار GLM الأحدث؟ اطلع على تحليل GLM 5.2 لمعرفة كيف يقارن.

كيفية الاختيار: إطار القرار

يعتمد النموذج "الأفضل" كلياً على قيودك. استخدم هذه المصفوفة لتضييق قرارك.

إذا كنت بحاجة إلى...اخترلماذا
أفضل استدلال إجماليQwen 3 235Bأعلى مقاييس رياضيات وكود وعامة
سلسلة أفكار عميقةDeepSeek R1استدلال ذاتي التصحيح، 87.5% AIME
نافذة سياق ضخمةLlama 4 Scout10M رمز، استرجاع مثالي
سريع وعامDeepSeek V3أفضل نسبة سرعة-جودة
مؤسسي متعدد اللغاتMistral Large 385.5% MMLU متعدد اللغات، ضد الهلوسة
GPU واحد للمستهلكGemma 3 27B16 GB VRAM، قوي في متعدد الوسائط
لاب توب أو جهاز حافةPhi-4 14B8 GB VRAM، ترخيص MIT
وكلاء البرمجةGLM-4.794.2% HumanEval، استدلال مستمر

لا تزال غير متأكد؟ ابدأ هنا: هل لديك أجهزة متعددة GPU؟ إذا لا، فخياراك هما Gemma 3 وPhi-4. إذا نعم، هل تبني وكيل برمجة؟ اختر GLM-4.7 أو DeepSeek R1. تحتاج سياقاً طويلاً؟ Llama 4 Scout. كل شيء آخر؟ Qwen 3 235B هو الخيار الافتراضي الأكثر أماناً.

كيف رتّبنا هذه النماذج

التصنيفات لا تعتمد على مقياس واحد. قُيِّم كل نموذج عبر خمسة أبعاد:

  1. أداء المقاييس -- MMLU وHumanEval وAIME وSWE-bench واختبارات خاصة بالمجال
  2. إمكانية الوصول للأجهزة -- هل يمكن للفرق الحقيقية نشره فعلاً؟
  3. حرية الترخيص -- Apache 2.0 وMIT تحصل على درجات أعلى من التراخيص المقيدة
  4. نضج النظام البيئي -- متاح على Hugging Face وOllama وvLLM ومحركات الاستدلال الرئيسية
  5. التبني الواقعي -- مجتمع نشط ونشر إنتاجي وتحديثات مستمرة

النماذج التي تؤدي أداءً جيداً في المقاييس لكنها تتطلب مجموعة GPU لا يمتلكها أحد (انظر إلى نسخة 671B بدقة كاملة) تُعاقب. النماذج ذات التراخيص المقيدة التي تحجب الاستخدام التجاري تفقد نقاطاً أيضاً. الهدف هو القيمة العملية، لا التفاخر بمراتب لوحات المتصدرين.

إذا أردت اختبار هذه النماذج بنفسك، يشرح دليل تقييم نماذج LLM الخاص بنا كيفية إعداد مقاييس منهجية، وملخص أفضل أدوات التقييم يغطي الأطر التي ستحتاجها.

اختيار الأداة هو الجزء السهل. أما تشغيلها بموثوقية داخل منتج حقيقي فهو ما تتعثر عنده معظم الفرق، وهذا بالضبط ما يبنيه فريق تكامل الذكاء الاصطناعي لدينا لعملائنا، من خطوط RAG إلى الوكلاء المخصصين. هل تريدون رأياً ثانياً في بنيتكم التقنية؟ احصلوا على استشارة مجانية.

الأسئلة الشائعة

ما أحدث نماذج LLM مفتوحة المصدر في 2026؟

أبرز الإصدارات في 2026: Qwen 3 (يناير، بما فيها المتغير الضخم 235B)، DeepSeek R1-0528 وDeepSeek V3-0324 (تحديثات مايو ومارس)، Llama 4 Scout (أبريل)، Mistral Large 3 (فبراير)، وGLM-4.7 (مايو). للبقاء على اطلاع دائم، تابع لوحة متصدري Open LLM على Hugging Face وتحقق من هذه الصفحة شهرياً.

كم مرة يُحدَّث هذا الترتيب لنماذج LLM مفتوحة المصدر؟

نُعيد التحقق من هذا الدليل شهرياً -- كل درجة مقياس وكل رقم VRAM وكل ترخيص. المجال يتحرك بسرعة: ثلاثة من النماذج الثمانية الواردة هنا أُطلقت أو حُدِّثت في الأشهر الستة الماضية. آخر تحديث: 6 يونيو 2026.

ما أفضل نموذج LLM مفتوح المصدر في 2026؟

يتصدر Qwen 3 235B-A22B حالياً أوسع نطاق من المقاييس، ويجمع بين استدلال وبرمجة وقدرات متعددة اللغات من الدرجة الأولى تحت ترخيص Apache 2.0. لحالات استخدام محددة، قد يكون DeepSeek R1 (الاستدلال) وLlama 4 Scout (السياق الطويل) خيارات أفضل.

هل يمكنني تشغيل نماذج LLM مفتوحة المصدر على أجهزة المستهلكين؟

نعم. يعمل Gemma 3 27B على RTX 4090 واحد (24 GB VRAM) ويتناسب Phi-4 14B مع GPU لاب توب بـ 8 GB. تعمل الإصدارات المكمَّمة (Q4 وQ8) للنماذج الأكبر أيضاً على إعدادات متعددة GPU للمستهلكين باستخدام أدوات مثل Ollama وllama.cpp.

هل نماذج LLM مفتوحة المصدر بجودة ChatGPT أو Claude؟

في مقاييس البرمجة والرياضيات، تعادل أفضل النماذج مفتوحة المصدر GPT-4.5 أو تتجاوزه وتقترب من أداء Claude Sonnet 4.5. الفجوة الأصغر في المهام المنظمة (الكود والرياضيات والاستدلال) والأكبر في الكتابة الإبداعية واتباع التعليمات الدقيقة.

ماذا تعني MoE (خليط الخبراء) للأجهزة؟

نماذج MoE لها عدد كبير إجمالي من المعاملات لكنها تنشط جزءاً صغيراً فقط لكل رمز. ومع ذلك، يجب تحميل النموذج بأكمله في الذاكرة حتى يتمكن الموجّه من اختيار الخبراء. نموذج MoE بحجم 235B مع 22B نشطة لا يزال يحتاج إلى VRAM بحجم 235B -- لا توفر في الذاكرة، توفر في الحوسبة.

أي نموذج LLM مفتوح المصدر الأفضل للبرمجة؟

يتصدر GLM-4.7 بنتيجة 94.2% في HumanEval و73.8% في SWE-bench. لتوليد الكود الخالص، DeepSeek R1 وQwen 3 235B يأتيان مباشرة خلفه. للبرمجة على أجهزة المستهلكين، يقدم تقطير DeepSeek R1 32B أفضل نسبة قدرة إلى تكلفة.

هل سياق 10 ملايين رمز لـ Llama 4 Scout حقيقي فعلاً؟

المعمارية تدعم ذلك، وأثبتت Meta استرجاعاً مثالياً لـ Needle-in-a-Haystack عند 10M رمز. لكن استخدام السياق الكامل فعلاً يتطلب ذاكرة KV cache ضخمة. معظم عمليات النشر المستضافة ذاتياً تقتصر واقعياً على 128K-256K رمز. يقدم مزودو السحابة مثل Together AI وFireworks نوافذ سياق أطول.

أي ترخيص يجب البحث عنه في نموذج LLM مفتوح المصدر؟

Apache 2.0 وMIT هما الأكثر تساهلاً -- استخدام تجاري كامل وتعديل وإعادة توزيع. يسمح ترخيص Llama المخصص بالاستخدام التجاري لكن له قيود للتطبيقات التي تتجاوز 700 مليون مستخدم. بعض نماذج "الأوزان المفتوحة" (مثل Gemma) لها شروط محددة -- اقرأ الترخيص دائماً قبل النشر الإنتاجي.

كمية VRAM اللازمة لنموذج 70B؟

عند تكميم Q4، يحتاج نموذج 70B كثيف إلى نحو 35-40 GB من VRAM. A100 واحد (80 GB) يتعامل معه بسهولة، أو اثنتان من RTX 4090 (48 GB إجمالاً). عند الدقة الكاملة (BF16)، تتطلع إلى 140+ GB -- مما يتطلب فعلياً أربع وحدات A100 أو ما يعادلها.

هل يمكنني ضبط نماذج LLM مفتوحة المصدر لحالة استخدامي؟

بالتأكيد. يجعل QLoRA من الممكن ضبط نموذج 70B بدقة على GPU واحد بسعة 24 GB. النماذج الأصغر مثل Phi-4 وGemma 3 أكثر سهولة للوصول إليها لتجارب الضبط الدقيق. النماذج المرخصة بموجب Apache 2.0 وMIT لا تفرض قيوداً على الأعمال المشتقة.

ما الوضع مع نماذج LLM مفتوحة المصدر متعددة الوسائط؟

يتعامل كل من Gemma 3 27B وLlama 4 Scout مع إدخال النص والصورة بشكل أصلي. يضيف Phi-4-reasoning-vision-15B استدلالاً بصرياً بحجم أصغر. لفهم الفيديو، يدعم Llama 4 Scout ما يصل إلى 20 ساعة من إدخال الفيديو داخل نافذة سياقه.

ما هو أفضل نموذج LLM مفتوح المصدر حالياً؟

حالياً، يُعد Qwen 3 235B-A22B أفضل نموذج LLM مفتوح المصدر بشكل عام، متصدراً في الاستدلال والبرمجة بموجب ترخيص Apache 2.0. لوحدة GPU استهلاكية واحدة، يُعد Gemma 3 27B (16 GB VRAM) الخيار الأفضل، ويفوز GLM-4.7 لوكلاء البرمجة بنتيجة 94.2% في HumanEval.

هل توجد لوحة متصدرين لنماذج LLM مفتوحة المصدر؟

نعم. تُصنّف لوحة متصدرينا ليوليو 2026 أعلاه جميع النماذج الثمانية في هذا الدليل، وتستضيف Hugging Face لوحة Open LLM Leaderboard التي يديرها المجتمع لتغطية أوسع. نُعيد التحقق من ترتيباتنا شهرياً مقابل مقاييس مثل MMLU وHumanEval وAIME وSWE-bench.

المصادر

الوسوم

أفضل نماذج llm مفتوحة المصدر 2026نماذج لغوية مفتوحة المصدرllama 4qwen 3deepseekgemma 3phi-4نماذج ذاتية الاستضافةنماذج محلية

شارك هذا المقال

مقالات ذات صلة

المزيد في ai-machine-learning

ai-machine-learning
Aug 29, 2026

أفضل وكلاء الذكاء الاصطناعي لخدمة العملاء: 8 أدوات مصنفة حسب التسليم لا الضجيج

ثمانية وكلاء ذكاء اصطناعي لخدمة العملاء مصنفون حسب جودة التسليم، وحسب ما إذا كان الروبوت يستشهد بمقال المصدر. أسعار حية سُحبت في 17 أغسطس 2026 من الصفحات الرسمية، وتشمل Intercom Fin وZendesk AI وChatbase وWeav وWatermelon وHeyy وAda وChipp.

8 دقائق قراءة قراءة
اقرأ
ai-machine-learning
Aug 22, 2026

أفضل منشئي المواقع بالذكاء الاصطناعي: قارنا 8 وننشر 2

خطة Framer Basic بسعر 10$/شهر هي الخيار الافتراضي لموقع وكالة من صفحة واحدة بين أفضل منشئي المواقع بالذكاء الاصطناعي التي قيّمناها في 17 أغسطس 2026. وDurable أسرع وصولًا إلى رابط منشور. أما Webflow فهي الوجهة عندما تكون الحاجة تحكمًا بمستوى Designer.

8 دقائق قراءة قراءة
اقرأ
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.