ai-machine-learning

متطلبات VRAM لنماذج LLM: الجدول الرئيسي لعام 2026 (كل نموذج، وكل مستوى ضغط)

بقلم Mert Batur
تم التحديث Jul 17, 2026
11 قراءة
متطلبات VRAM لنماذج LLM: الجدول الرئيسي لعام 2026 (كل نموذج، وكل مستوى ضغط)

متطلبات VRAM لنماذج LLM: الجدول الرئيسي لعام 2026 (كل نموذج، وكل مستوى ضغط)

إليك الرقم الذي يفاجئ الجميع: يمتلك DeepSeek-V3.2 671 مليار معامل (parameter)، لكن 37 مليار فقط منها يُفعَّل عند معالجة أي رمز (token). فكم من VRAM يحتاج فعليا؟ كل الـ671 مليار، أي ما يقارب 382 GB عند مستوى Q4. متطلبات VRAM لنماذج LLM نادرا ما تتبع الحدس، والفجوة بين "المعاملات النشطة" و"ما يجب تحميله فعليا" هي بالضبط النقطة التي تنفجر عندها ميزانيات الأجهزة. يقدم لك هذا الدليل الجدول الرئيسي (كل نموذج مفتوح رئيسي، وكل مستوى ضغط، ورقم GB، وبطاقة الـ GPU التي تشغّله) بالإضافة إلى المعادلة التي تتيح لك حساب حجم أي نموذج بنفسك خلال عشر ثوانٍ تقريبا.

أبرز النقاط

  • VRAM اللازمة للأوزان ≈ عدد المعاملات × البايتات لكل معامل: FP16 = 2.0، Q8 = 1.0، Q5_K_M ≈ 0.68، Q4_K_M ≈ 0.57. أضف إلى ذلك ذاكرة KV cache وحوالي 15-20% كنفقات إضافية.
  • نماذج Mixture-of-Experts (مثل DeepSeek وGLM-5.2 وQwen3-235B) يجب أن تحمّل كل خبير (expert) في VRAM. "المعاملات النشطة" تمنحك سرعة، لا توفيرا في الذاكرة.
  • ذاكرة KV cache هي التكلفة الخفية. يحتاج Llama 3.3 70B إلى حوالي 2.6 GB من الذاكرة المؤقتة عند سياق 8K، وحوالي 41 GB عند 128K، فوق حجم الأوزان.
  • Q4_K_M هو الخيار الافتراضي المعقول: جودة شبه كاملة بحجم يقارب ربع بصمة FP16.
  • نموذج بحجم 12B مثل Gemma 4 يعمل على بطاقة 8 GB عند Q4. نموذج dense بحجم 70B يحتاج حوالي 40 GB. نموذج MoE طليعي بحجم 671B يحتاج خادما صغيرا.

متطلبات VRAM لنماذج LLM حسب النموذج: الجدول الرئيسي

الإجابة المختصرة: عند Q4_K_M، تعمل النماذج الصغيرة (أقل من 14B) على بطاقات استهلاكية بسعة 8-12 GB، بينما تحتاج النماذج متوسطة الحجم (24-32B) إلى 16-24 GB، ويحتاج نموذج dense بحجم 70B إلى حوالي 40 GB، أما نماذج MoE الطليعية فتقفز إلى مئات الجيجابايتات لأن كل خبير يجب أن يكون مقيما في الذاكرة. إليك الصورة الكاملة في مكان واحد. كل الأرقام هي حجم الذاكرة للأوزان فقط، محسوبة من عدد معاملات كل نموذج، وتم التحقق منها مقابل بطاقات النماذج الرسمية من Meta AI وQwen وHugging Face.

النموذجالمعاملات (الإجمالي / النشط)FP16Q8Q5_K_MQ4_K_Mالحد الأدنى لـ GPU عند Q4
Qwen3-0.6B0.6B dense1.2 GB0.6 GB0.4 GB0.4 GBأي بطاقة 2 GB / هاتف
Qwen3-4B4B dense8 GB4 GB2.7 GB2.3 GB4 GB (GTX 1650)
Qwen3-8B8B dense16 GB8 GB5.4 GB4.6 GB6-8 GB (RTX 3060)
Gemma 4 12B11.95B dense24 GB12 GB8.1 GB6.8 GB8 GB (RTX 4060)
Qwen3-14B14B dense28 GB14 GB9.5 GB8.0 GB12 GB (RTX 3060 12GB)
Mistral Small 3.2 24B24B dense48 GB24 GB16.3 GB13.7 GB16 GB (RTX 4080)
Qwen3-30B-A3B30B / 3B MoE60 GB30 GB20.4 GB17.1 GB24 GB (RTX 3090/4090)
Qwen3-32B32B dense64 GB32 GB21.8 GB18.2 GB24 GB (RTX 4090)
Llama 3.3 70B70B dense140 GB70 GB47.6 GB39.9 GB48 GB (2x 3090 / A6000)
Llama 4 Scout109B / 17B MoE218 GB109 GB74.1 GB62.1 GB80 GB (H100 / A100)
Qwen3-235B-A22B235B / 22B MoE470 GB235 GB160 GB134 GB2x 80 GB أو 192 GB Mac
Llama 4 Maverick400B / 17B MoE800 GB400 GB272 GB228 GB4x 80 GB
DeepSeek-V3.2671B / 37B MoE1342 GB671 GB456 GB382 GB8x 80 GB عقدة
GLM-5.2744B / 40B MoE1488 GB744 GB506 GB424 GB8x 80 GB+ / متعدد العقد

يمكن استخلاص أمرين من هذا الجدول. أولا، الضغط الكمي (Quantization) هو أقوى أداة بين يديك: الانتقال من FP16 إلى Q4 يقلّص البصمة بمقدار 4 أضعاف تقريبا مقابل فرق جودة يكاد لا يُلاحظ. ثانيا، صفوف MoE تبدو قاسية لأنها كذلك فعلا. يُفعِّل Qwen3-30B-A3B 3B معامل فقط لكل رمز، لذلك يعمل بسرعة نموذج صغير، لكنك ما زلت بحاجة إلى الاحتفاظ بكامل الـ30B في الذاكرة لإبقاء كل خبير جاهزا. تريد التفاصيل الدقيقة وراء هذه الأرقام لكل نموذج؟ يغطي دليلنا المتعمق عن Gemma 4 12B وقائمة أفضل نماذج LLM مفتوحة المصدر لعام 2026 المعايير والتراخيص.

"VRAM for the weights at Q4_K_M (GB)"

جدول البيانات
"VRAM for the weights at Q4_K_M (GB)"
"VRAM (GB)""Q4_K_M VRAM"
"Qwen3-8B"4.6
"Gemma 4 12B"6.8
"Mistral 24B"13.7
"Qwen3-32B"18.2
"Llama 3.3 70B"39.9
"Llama 4 Scout 109B"62.1
"Qwen3-235B"134
"DeepSeek-V3.2 671B"382

معادلة VRAM: احسب أي نموذج بنفسك

لحساب حجم أي نموذج، اضرب عدد معاملاته في عدد البايتات لكل معامل حسب مستوى الضغط الذي تستخدمه، ثم أضف قليلا لذاكرة KV cache ونفقات وقت التشغيل. هذا كل ما في الأمر. الأوزان هي الحد المهيمن في المعادلة، والحساب بسيط بما يكفي لإجرائه على ظهر ورقة.

المعادلة الأساسية للأوزان:

text
VRAM_weights (GB) = parameters (billions) × bits_per_weight ÷ 8

قيم البتات لكل معامل (bits-per-weight) التي تحتاجها (هذه هي المعدلات الفعلية لملفات GGUF k-quant، والتي تحمل قدرا صغيرا من البيانات الوصفية للكتلة فوق عمق البت الاسمي):

مستوى الضغطالبتات لكل معاملالبايتات لكل معاملالجودة
FP16 / BF16162.0دقة كاملة، المرجع
Q8_081.0عديم الفقد عمليا
Q6_K~6.50.81شبه كاملة، نادرا ما تستحق التفضيل على Q5
Q5_K_M~5.50.68أفضل قليلا من Q4، وأثقل قليلا
Q4_K_M~4.50.57النقطة المثالية لمعظم المستخدمين

مثال عملي، Gemma 4 12B عند Q4_K_M: 11.95 × 4.5 ÷ 8 = حوالي 6.7 GB للأوزان. هذا يتوافق مع الرقم الذي تذكره بطاقة النموذج الرسمية، وهو حوالي 6.6 GB، ويفسر سبب ملاءمته لبطاقة 8 GB مع مساحة لسياق معتدل. طبّق الحساب نفسه على نموذج بحجم 70B عند Q4 وستحصل على 70 × 4.5 ÷ 8 = 39.4 GB، وهذا ما يفسر القاعدة العامة التي يكررها الجميع: "تحتاج بطاقتين بسعة 24 GB أو بطاقة واحدة بسعة 48 GB لنموذج 70B".

تضيف الصورة الكاملة حدين آخرين: إجمالي VRAM ≈ الأوزان + KV cache + حوالي 15-20% نفقات إضافية. تغطي هذه النفقات الإضافية ذاكرة التنشيط (activation buffers)، وسياق CUDA، وتجزؤ الذاكرة، كما تحجز بطاقة الـ GPU نصف جيجابايت تقريبا لتعريف التشغيل (driver)، لذا لا تخطط أبدا لاستخدام 100% من سعة VRAM المعلنة.

لماذا ذاكرة KV Cache هي الرقم الذي يفاجئك سلبا

تخزّن ذاكرة KV cache مفاتيح وقيم الانتباه (attention) لكل رمز موجود بالفعل في السياق، وتنمو خطيا مع طول السياق. في المطالبات القصيرة تكون خطأ تقريبيا لا يُذكر. لكن مع التوجه نحو سياق طويل، يمكن أن تضاهي حجم الأوزان نفسها أو تتجاوزه. هذا هو السبب الأكثر شيوعا وراء ظهور خطأ نفاد الذاكرة (out-of-memory) في منتصف التوليد لنموذج كان من المفترض أن "يتسع" بلا مشكلة.

المعادلة، لكل رمز (token):

text
KV_cache_per_token (bytes) = num_layers × 2 × kv_dim × precision_bytes
kv_dim = num_kv_heads × head_dim   (grouped-query attention shrinks this)

خذ Llama 3.3 70B مثالا: 80 طبقة، و8 رؤوس KV، وبُعد رأس 128، وبالتالي kv_dim يساوي 1024. عند FP16 يصبح الحساب 80 × 2 × 1024 × 2 = 327,680 بايت لكل رمز، أي حوالي 0.31 MB. اضرب هذا في طول السياق وتتضح الصورة بسرعة: عند 8K رمز تكون الذاكرة المؤقتة حوالي 2.6 GB، وعند 32K حوالي 10 GB، وعند 128K تتضخم إلى حوالي 41 GB. هذا الرقم الأخير يُضاف فوق أوزان الـ40 GB، لذا يتحول "نموذج 40 GB" بصمت إلى مشكلة 80 GB بمجرد ملء نافذة السياق.

هناك مخرجان عمليان. أولا، آلية Grouped-query attention (التي تستخدمها كل النماذج الحديثة تقريبا) تقلّص kv_dim بشكل كبير مقارنة بتصميم multi-head القديم، لذا النماذج الحديثة ألطف بكثير في هذا الجانب مقارنة بـLlama 2. ثانيا، تستطيع معظم محركات الاستدلال ضغط ذاكرة KV cache إلى 8-bit أو 4-bit، ما يقلّل حجمها إلى النصف أو الربع مقابل فقدان طفيف في الجودة. إذا كنت تخدم سياقات طويلة في بيئة الإنتاج، فإن مقارنة vLLM وSGLang تغطي أي محرك (backend) يدير هذه الذاكرة بأعلى كفاءة عبر paged attention.

نماذج MoE: لماذا لا توفّر "المعاملات النشطة" في VRAM

هذا هو الفخ الذي يكلّف الناس أكبر قدر من المال. يُوجّه نموذج Mixture-of-Experts مثل DeepSeek-V3.2 (671B إجمالي، 37B نشط، ويشارك بنية V3) أو GLM-5.2 (744B إجمالي، 40B نشط) كل رمز عبر مجموعة صغيرة فقط من خبرائه. تعتمد المواد التسويقية على رقم المعاملات النشطة لأنه يصف السرعة: أنت تدفع فقط تكلفة حوسبة تعادل 37B معامل لكل رمز، لذا الاستدلال سريع بالنسبة لحجم النموذج. لكن كل خبير يجب أن يبقى مقيما في الذاكرة، جاهزا لأن يُختار، ما يعني أن ميزانية VRAM لديك تُحدَّد بعدد المعاملات الإجمالي، لا النشط.

القراءة الصادقة للجدول أعلاه إذن: يعمل GLM-5.2 بسرعة نموذج 40B، لكنه يشغل ذاكرة نموذج 744B. لهذا السبب تحتاج هذه النماذج المفتوحة الطليعية إلى خادم بثماني بطاقات GPU أو جهاز بذاكرة موحدة كبيرة، رغم أن تمريرة أمامية واحدة (forward pass) رخيصة. Qwen3-235B-A22B له الشكل نفسه على نطاق أصغر: سريع لكل رمز، لكن ثقيل الاستضافة.

تظهر ميزة MoE بوضوح على أجهزة الذاكرة الموحدة. يستطيع جهاز Mac Studio بذاكرة موحدة سعة 512 GB استيعاب نموذج بحجم 671B عند Q4 وتشغيله بسرعة قابلة للاستخدام، وذلك بالتحديد لأن 37B فقط هي التي تُفعَّل، ما يبقي الطلب على نطاق ترددي للذاكرة (bandwidth) لكل رمز عند حد معقول. إذا كنت جديدا في تشغيل هذه النماذج محليا، ابدأ بـدليلنا لإعداد LLM محليا قبل أن تنفق على الأجهزة.

أي مستوى ضغط (Quantization) عليك اختياره؟

بالنسبة لمعظم المستخدمين، Q4_K_M هو الخيار الافتراضي الصحيح: فهو يحافظ على جودة شبه كاملة مع تقليص بصمة FP16 بمقدار 4 أضعاف تقريبا. انتقل إلى Q5_K_M أو Q8 فقط إذا كانت لديك مساحة VRAM إضافية ومهمة حساسة للجودة، والجأ إلى FP16 فقط عند إجراء fine-tuning أو مقارنة معيارية بمرجع. تحت مستوى Q4، يصبح تدهور الجودة ملحوظا بسرعة، لذا فإن Q3 وما دونه هو الملاذ الأخير لحشر نموذج على بطاقة صغيرة فعلا.

إذا كان لديكاخترالسبب
ميزانية VRAM محدودةQ4_K_Mأفضل جودة لكل جيجابايت، الخيار الافتراضي للمجتمع
مساحة إضافية بسيطةQ5_K_Mأدق قليلا في المطالبات الصعبة، وأثقل بشكل معتدل
ضعف حجم الأوزان في VRAMQ8_0عديم الفقد عمليا، يستحق فقط إذا كان يتسع بسهولة
مهمة fine-tuning أو تقييمFP16 / BF16دقة كاملة، نقطة المرجعية الصادقة

تنبيه واحد: جودة الضغط الكمي ليست متطابقة بين النماذج. تتأثر النماذج الصغيرة جدا (أقل من 4B) بـQ4 أكثر من النماذج الكبيرة، لأن لديها فائضا أقل يمكن التضحية به. في نموذج بحجم 70B، يصعب التمييز بين Q4 وQ8 في معظم المهام. أما في نموذج بحجم 1.7B، فالفجوة حقيقية.

ما بطاقة الـ GPU التي تحتاجها فعليا؟

طابق عمود Q4 في الجدول الرئيسي مع بطاقة تمنحك مساحة إضافية بسيطة لذاكرة KV cache. إليك الخريطة العملية من الأجهزة الاستهلاكية الاقتصادية وصولا إلى مراكز البيانات، مع فئة النماذج التي تشغّلها كل شريحة بارتياح عند Q4.

الجهازVRAMيعمل بارتياح عند Q4
RTX 4060 / 3060 (8-12 GB)8-12 GBحتى ~14B dense (Gemma 4 12B، Qwen3-14B)
RTX 4080 / 4070 Ti Super (16 GB)16 GBحتى ~24B dense (Mistral Small 3.2 24B)
RTX 4090 / 3090 (24 GB)24 GBحتى ~32B dense، أو Qwen3-30B-A3B
RTX 6000 Ada / A6000 (48 GB)48 GB70B dense (Llama 3.3 70B)
H100 / A100 (80 GB)80 GB~109B MoE (Llama 4 Scout)
عقدة 8x H100640 GB671-744B MoE طليعي (DeepSeek، GLM-5.2)
Mac Studio من سلسلة M (ذاكرة موحدة)64-512 GBيتوسع مع RAM؛ 512 GB يستوعب نموذج MoE بحجم 671B عند Q4

تستحق شرائح Apple Silicon ذكرا خاصا لأن الذاكرة الموحدة تغيّر المعادلة. لا يفصل جهاز Mac بين VRAM وRAM النظام، لذا يستطيع جهاز من سلسلة M بذاكرة 128 GB تحميل نماذج كانت ستحتاج عدة بطاقات GPU منفصلة، مقايضا أقصى إنتاجية بالقدرة على استيعاب أوزان ضخمة على جهاز مكتبي واحد. لمعرفة المحركات (backends) التي تستخرج أقصى أداء من أي من هذه البطاقات، تقارن قائمتنا لـأفضل أدوات تشغيل LLM محليا فروق السرعة الواقعية.

كيف نحدد حجم VRAM لعمليات نشر عملائنا

في Techsy، ننشر نماذج مفتوحة المصدر لعملائنا بشكل متكرر بما يكفي لجعل تحديد حجم VRAM أول نقاش يُطرح، قبل اختيار النموذج، وقبل المطالبات (prompts)، وقبل أي شيء آخر. طريقتنا ممِلّة عن قصد، لأن نمط الفشل (خطأ OOM في بيئة الإنتاج تحت حمل سياق حقيقي) مكلف. إليك العملية التي نطبقها فعليا.

نبدأ من حسابات الجدول، ثم نقيس. بعد تحميل النموذج، نتحقق من البصمة الفعلية المقيمة في الذاكرة بدلا من الاعتماد على التقدير:

bash
# What the GPU is actually holding
nvidia-smi --query-gpu=memory.used,memory.total --format=csv

# For an Ollama-served model, its real memory + how much sits on GPU vs CPU
ollama ps

# llama.cpp: control the split explicitly and cap context to bound KV cache
llama-server -m model-Q4_K_M.gguf --n-gpu-layers 999 --ctx-size 8192

الدرس الذي يتكرر دائما: تحدد الفرق حجم الأوزان وتنسى KV cache، ثم تتساءل لماذا نموذج تم تحميله بنجاح ينهار بعد ثلاثة طلبات طويلة في عرض تجريبي. نحن نحدد الحجم بناء على الأوزان بالإضافة إلى KV cache عند الحد الأقصى للسياق الذي سيستخدمه التطبيق فعليا، بالإضافة إلى هامش أمان، ونحدد سقفا لـ--ctx-size حتى لا يتسبب طلب متفلت في نفاد ذاكرة الجهاز (OOM). في أي شيء يواجه العملاء، نفضل تشغيل نموذج 32B مضغوط لا ينهار أبدا على نموذج 70B بدقة FP16 ينفد من الذاكرة تحت الحمل.

إذا كنت تزن قرار استضافة نموذج مفتوح بنفسك أو البقاء على واجهة API مستضافة، فإن هذه المقايضة (تكلفة الأجهزة وعبء التشغيل مقابل التسعير لكل رمز والتحكم) هي بالضبط ما يحدد نطاقه فريقنا خلال مشروع تكامل الذكاء الاصطناعي. وإذا كان من المفيد أن يقوم أحدهم بحساب الأرقام مقابل حمل العمل الفعلي لديك، احصل على استشارة مجانية وسنحدد الحجم المناسب معك.

عن الكاتب

مرت باتور هو الشريك المؤسس لـTechsy.io، حيث يقوم الفريق بتطوير وكلاء الذكاء الاصطناعي، وأنظمة الأتمتة، ومسارات الصوت وSDR لعملاء B2B. يكتب عن مجموعة أدوات LLM التي يستخدمها فريق Techsy فعليا في بيئة الإنتاج.

المؤهلات: الشريك المؤسس، Techsy.io. تواصل عبر LinkedIn.

الأسئلة الشائعة

كم من VRAM أحتاج لتشغيل نموذج بحجم 70B؟

نموذج dense بحجم 70B مثل Llama 3.3 70B يحتاج حوالي 40 GB من VRAM للأوزان عند Q4_K_M، لذا خطط لبطاقة بسعة 48 GB (RTX 6000 Ada) أو بطاقتين بسعة 24 GB. أضف عدة جيجابايتات إضافية لذاكرة KV cache إذا كنت تستخدم سياقا طويلا، وهو ما يدفع المتطلبات العملية نحو 48 GB أو أكثر.

كم من VRAM تحتاجه نماذج Llama أو Qwen أو DeepSeek؟

يعتمد الأمر كليا على النسخة المحددة. يحتاج Llama 4 Scout حوالي 62 GB عند Q4، وQwen3-32B حوالي 18 GB، وQwen3-8B أقل من 5 GB. أما DeepSeek-V3.2، وهو نموذج MoE بحجم 671B، فيحتاج حوالي 382 GB لأن كل خبير يجب أن يُحمَّل. تحقق دائما من عدد المعاملات الإجمالي، لا النشط، بالنسبة لنماذج MoE.

هل يمكنني تشغيل LLM على بطاقة GPU بسعة 8GB؟

نعم، وبارتياح. تشغّل بطاقة 8 GB مثل RTX 4060 نماذج تصل إلى حوالي 12B معامل عند Q4_K_M. يتسع Gemma 4 12B في حوالي 6.8 GB، ما يترك مساحة لسياق معتدل. بالنسبة لأي شيء أكبر، عليك إما زيادة درجة الضغط، أو إبقاء السياق قصيرا، أو الانتقال إلى بطاقة أكبر.

ماذا يمكن لبطاقة GPU بسعة 24GB مثل RTX 4090 تشغيله؟

تتعامل بطاقة 24 GB مع نماذج dense تصل إلى حوالي 32B عند Q4_K_M مع مساحة كافية لسياق معقول، لذا يعمل Qwen3-32B وMistral Small 3.2 24B بارتياح. كما تشغّل نموذج Qwen3-30B-A3B من نوع MoE، الذي يحمّل 30B من الأوزان لكنه يولّد بسرعة نموذج 3B بفضل التفعيل المتناثر (sparse activation).

هل يضر الضغط الكمي بجودة النموذج؟

عند Q4_K_M وما فوق، تكون خسارة الجودة صغيرة وغالبا لا تُلاحظ في المهام الواقعية، خصوصا للنماذج التي تتجاوز 13B. تتسع الفجوة كلما انخفض المستوى وكلما صغر النموذج، لذا فإن Q4 على نموذج 70B شبه مجاني، بينما Q4 على نموذج 1.7B ملحوظ. Q8 عديم الفقد عمليا إذا كانت لديك الذاكرة الكافية.

هل تحتاج نماذج MoE إلى VRAM أقل من النماذج dense؟

لا، وهذا هو الفهم الخاطئ الأكثر شيوعا. يجب أن يحتفظ نموذج Mixture-of-Experts بكل خبير في VRAM، لذا تُحدَّد ذاكرته بعدد المعاملات الإجمالي. رقم المعاملات النشطة يصف فقط سرعة الاستدلال. يعمل GLM-5.2 بسرعة نموذج 40B، لكنه يحتاج إلى ذاكرة نموذج 744B.

هل الذاكرة الموحدة هي نفسها VRAM؟

من الناحية الوظيفية، لتحميل النماذج، نعم. تشترك شرائح Apple Silicon وبعض الأنظمة الأخرى في مجمع ذاكرة واحد بين CPU وGPU، لذا يستطيع جهاز Mac بذاكرة 128 GB تحميل نماذج كانت ستحتاج بخلاف ذلك عدة بطاقات GPU منفصلة. المقايضة هي النطاق الترددي (bandwidth): عادة ما تقدم الذاكرة الموحدة أقصى إنتاجية أقل من بطاقة GPU متطورة في مركز بيانات، لذا يكون عدد الرموز في الثانية (tokens-per-second) أقل.

هل يمكنني تفريغ جزء من نموذج إلى RAM النظام أو CPU؟

نعم. تتيح لك محركات مثل llama.cpp وOllama إبقاء بعض الطبقات على GPU والباقي في RAM النظام باستخدام خيار مثل --n-gpu-layers. هذا يسمح لك بتشغيل نموذج أكبر من أن يتسع في VRAM لديك، لكن كل طبقة على CPU تبطئ التوليد بشكل ملحوظ، لذا استخدم هذا الخيار لجعل تشغيل النموذج ممكنا، لا سريعا.

كيف أحسب VRAM لنموذج غير موجود في الجدول؟

اضرب عدد المعاملات بالمليارات في عدد البتات لكل معامل حسب مستوى الضغط الذي تستخدمه، ثم اقسم على 8. بالنسبة لـQ4_K_M استخدم حوالي 4.5 بت، لذا يحتاج نموذج بحجم 40B إلى 40 × 4.5 ÷ 8 = حوالي 22.5 GB للأوزان. أضف حوالي 15-20% كنفقات إضافية بالإضافة إلى KV cache للحصول على المتطلب الحقيقي.

الوسوم

llm vram requirementsgpu memoryquantizationkv cachelocal llm

شارك هذا المقال

مقالات ذات صلة

المزيد في ai-machine-learning

ai-machine-learning
Aug 29, 2026

أفضل وكلاء الذكاء الاصطناعي لخدمة العملاء: 8 أدوات مصنفة حسب التسليم لا الضجيج

ثمانية وكلاء ذكاء اصطناعي لخدمة العملاء مصنفون حسب جودة التسليم، وحسب ما إذا كان الروبوت يستشهد بمقال المصدر. أسعار حية سُحبت في 17 أغسطس 2026 من الصفحات الرسمية، وتشمل Intercom Fin وZendesk AI وChatbase وWeav وWatermelon وHeyy وAda وChipp.

8 دقائق قراءة قراءة
اقرأ
ai-machine-learning
Aug 22, 2026

أفضل منشئي المواقع بالذكاء الاصطناعي: قارنا 8 وننشر 2

خطة Framer Basic بسعر 10$/شهر هي الخيار الافتراضي لموقع وكالة من صفحة واحدة بين أفضل منشئي المواقع بالذكاء الاصطناعي التي قيّمناها في 17 أغسطس 2026. وDurable أسرع وصولًا إلى رابط منشور. أما Webflow فهي الوجهة عندما تكون الحاجة تحكمًا بمستوى Designer.

8 دقائق قراءة قراءة
اقرأ
ai-machine-learning
Aug 12, 2026

Grok 4.6 مقابل Grok 4.5: أجرينا 80 استدعاء API يوم الإطلاق – نتيجة متطابقة 40/40 بفاتورة 1.38×

أطلقت SpaceXAI نموذج Grok 4.6 في 12 أغسطس 2026 بنفس بطاقة أسعار Grok 4.5 وهي `$2/$6`. أرسلنا 80 استدعاء API متطابقًا إلى النموذجين في اليوم نفسه: تعادلت الدقة عند `40/40`، بينما استهلك النموذج الأحدث 1.90× من متوسط رموز الإخراج وكلّف 1.38× من المال.

8 دقائق قراءة قراءة
اقرأ
ابدأ مشروعك

هل أنت مستعد لبناء شيء استثنائي؟

دعنا نحول رؤيتك إلى واقع. فريقنا جاهز لمساعدتك في إنشاء برمجيات تصنع الفرق.