
متطلبات VRAM لنماذج LLM: الجدول الرئيسي لعام 2026 (كل نموذج، وكل مستوى ضغط)
إليك الرقم الذي يفاجئ الجميع: يمتلك DeepSeek-V3.2 671 مليار معامل (parameter)، لكن 37 مليار فقط منها يُفعَّل عند معالجة أي رمز (token). فكم من VRAM يحتاج فعليا؟ كل الـ671 مليار، أي ما يقارب 382 GB عند مستوى Q4. متطلبات VRAM لنماذج LLM نادرا ما تتبع الحدس، والفجوة بين "المعاملات النشطة" و"ما يجب تحميله فعليا" هي بالضبط النقطة التي تنفجر عندها ميزانيات الأجهزة. يقدم لك هذا الدليل الجدول الرئيسي (كل نموذج مفتوح رئيسي، وكل مستوى ضغط، ورقم GB، وبطاقة الـ GPU التي تشغّله) بالإضافة إلى المعادلة التي تتيح لك حساب حجم أي نموذج بنفسك خلال عشر ثوانٍ تقريبا.
أبرز النقاط
- VRAM اللازمة للأوزان ≈ عدد المعاملات × البايتات لكل معامل: FP16 = 2.0، Q8 = 1.0، Q5_K_M ≈ 0.68، Q4_K_M ≈ 0.57. أضف إلى ذلك ذاكرة KV cache وحوالي 15-20% كنفقات إضافية.
- نماذج Mixture-of-Experts (مثل DeepSeek وGLM-5.2 وQwen3-235B) يجب أن تحمّل كل خبير (expert) في VRAM. "المعاملات النشطة" تمنحك سرعة، لا توفيرا في الذاكرة.
- ذاكرة KV cache هي التكلفة الخفية. يحتاج Llama 3.3 70B إلى حوالي 2.6 GB من الذاكرة المؤقتة عند سياق 8K، وحوالي 41 GB عند 128K، فوق حجم الأوزان.
- Q4_K_M هو الخيار الافتراضي المعقول: جودة شبه كاملة بحجم يقارب ربع بصمة FP16.
- نموذج بحجم 12B مثل Gemma 4 يعمل على بطاقة 8 GB عند Q4. نموذج dense بحجم 70B يحتاج حوالي 40 GB. نموذج MoE طليعي بحجم 671B يحتاج خادما صغيرا.
متطلبات VRAM لنماذج LLM حسب النموذج: الجدول الرئيسي
الإجابة المختصرة: عند Q4_K_M، تعمل النماذج الصغيرة (أقل من 14B) على بطاقات استهلاكية بسعة 8-12 GB، بينما تحتاج النماذج متوسطة الحجم (24-32B) إلى 16-24 GB، ويحتاج نموذج dense بحجم 70B إلى حوالي 40 GB، أما نماذج MoE الطليعية فتقفز إلى مئات الجيجابايتات لأن كل خبير يجب أن يكون مقيما في الذاكرة. إليك الصورة الكاملة في مكان واحد. كل الأرقام هي حجم الذاكرة للأوزان فقط، محسوبة من عدد معاملات كل نموذج، وتم التحقق منها مقابل بطاقات النماذج الرسمية من Meta AI وQwen وHugging Face.
| النموذج | المعاملات (الإجمالي / النشط) | FP16 | Q8 | Q5_K_M | Q4_K_M | الحد الأدنى لـ GPU عند Q4 |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | 0.6B dense | 1.2 GB | 0.6 GB | 0.4 GB | 0.4 GB | أي بطاقة 2 GB / هاتف |
| Qwen3-4B | 4B dense | 8 GB | 4 GB | 2.7 GB | 2.3 GB | 4 GB (GTX 1650) |
| Qwen3-8B | 8B dense | 16 GB | 8 GB | 5.4 GB | 4.6 GB | 6-8 GB (RTX 3060) |
| Gemma 4 12B | 11.95B dense | 24 GB | 12 GB | 8.1 GB | 6.8 GB | 8 GB (RTX 4060) |
| Qwen3-14B | 14B dense | 28 GB | 14 GB | 9.5 GB | 8.0 GB | 12 GB (RTX 3060 12GB) |
| Mistral Small 3.2 24B | 24B dense | 48 GB | 24 GB | 16.3 GB | 13.7 GB | 16 GB (RTX 4080) |
| Qwen3-30B-A3B | 30B / 3B MoE | 60 GB | 30 GB | 20.4 GB | 17.1 GB | 24 GB (RTX 3090/4090) |
| Qwen3-32B | 32B dense | 64 GB | 32 GB | 21.8 GB | 18.2 GB | 24 GB (RTX 4090) |
| Llama 3.3 70B | 70B dense | 140 GB | 70 GB | 47.6 GB | 39.9 GB | 48 GB (2x 3090 / A6000) |
| Llama 4 Scout | 109B / 17B MoE | 218 GB | 109 GB | 74.1 GB | 62.1 GB | 80 GB (H100 / A100) |
| Qwen3-235B-A22B | 235B / 22B MoE | 470 GB | 235 GB | 160 GB | 134 GB | 2x 80 GB أو 192 GB Mac |
| Llama 4 Maverick | 400B / 17B MoE | 800 GB | 400 GB | 272 GB | 228 GB | 4x 80 GB |
| DeepSeek-V3.2 | 671B / 37B MoE | 1342 GB | 671 GB | 456 GB | 382 GB | 8x 80 GB عقدة |
| GLM-5.2 | 744B / 40B MoE | 1488 GB | 744 GB | 506 GB | 424 GB | 8x 80 GB+ / متعدد العقد |
يمكن استخلاص أمرين من هذا الجدول. أولا، الضغط الكمي (Quantization) هو أقوى أداة بين يديك: الانتقال من FP16 إلى Q4 يقلّص البصمة بمقدار 4 أضعاف تقريبا مقابل فرق جودة يكاد لا يُلاحظ. ثانيا، صفوف MoE تبدو قاسية لأنها كذلك فعلا. يُفعِّل Qwen3-30B-A3B 3B معامل فقط لكل رمز، لذلك يعمل بسرعة نموذج صغير، لكنك ما زلت بحاجة إلى الاحتفاظ بكامل الـ30B في الذاكرة لإبقاء كل خبير جاهزا. تريد التفاصيل الدقيقة وراء هذه الأرقام لكل نموذج؟ يغطي دليلنا المتعمق عن Gemma 4 12B وقائمة أفضل نماذج LLM مفتوحة المصدر لعام 2026 المعايير والتراخيص.
"VRAM for the weights at Q4_K_M (GB)"
جدول البيانات
| "VRAM (GB)" | "Q4_K_M VRAM" |
|---|---|
| "Qwen3-8B" | 4.6 |
| "Gemma 4 12B" | 6.8 |
| "Mistral 24B" | 13.7 |
| "Qwen3-32B" | 18.2 |
| "Llama 3.3 70B" | 39.9 |
| "Llama 4 Scout 109B" | 62.1 |
| "Qwen3-235B" | 134 |
| "DeepSeek-V3.2 671B" | 382 |
معادلة VRAM: احسب أي نموذج بنفسك
لحساب حجم أي نموذج، اضرب عدد معاملاته في عدد البايتات لكل معامل حسب مستوى الضغط الذي تستخدمه، ثم أضف قليلا لذاكرة KV cache ونفقات وقت التشغيل. هذا كل ما في الأمر. الأوزان هي الحد المهيمن في المعادلة، والحساب بسيط بما يكفي لإجرائه على ظهر ورقة.
المعادلة الأساسية للأوزان:
VRAM_weights (GB) = parameters (billions) × bits_per_weight ÷ 8قيم البتات لكل معامل (bits-per-weight) التي تحتاجها (هذه هي المعدلات الفعلية لملفات GGUF k-quant، والتي تحمل قدرا صغيرا من البيانات الوصفية للكتلة فوق عمق البت الاسمي):
| مستوى الضغط | البتات لكل معامل | البايتات لكل معامل | الجودة |
|---|---|---|---|
| FP16 / BF16 | 16 | 2.0 | دقة كاملة، المرجع |
| Q8_0 | 8 | 1.0 | عديم الفقد عمليا |
| Q6_K | ~6.5 | 0.81 | شبه كاملة، نادرا ما تستحق التفضيل على Q5 |
| Q5_K_M | ~5.5 | 0.68 | أفضل قليلا من Q4، وأثقل قليلا |
| Q4_K_M | ~4.5 | 0.57 | النقطة المثالية لمعظم المستخدمين |
مثال عملي، Gemma 4 12B عند Q4_K_M: 11.95 × 4.5 ÷ 8 = حوالي 6.7 GB للأوزان. هذا يتوافق مع الرقم الذي تذكره بطاقة النموذج الرسمية، وهو حوالي 6.6 GB، ويفسر سبب ملاءمته لبطاقة 8 GB مع مساحة لسياق معتدل. طبّق الحساب نفسه على نموذج بحجم 70B عند Q4 وستحصل على 70 × 4.5 ÷ 8 = 39.4 GB، وهذا ما يفسر القاعدة العامة التي يكررها الجميع: "تحتاج بطاقتين بسعة 24 GB أو بطاقة واحدة بسعة 48 GB لنموذج 70B".
تضيف الصورة الكاملة حدين آخرين: إجمالي VRAM ≈ الأوزان + KV cache + حوالي 15-20% نفقات إضافية. تغطي هذه النفقات الإضافية ذاكرة التنشيط (activation buffers)، وسياق CUDA، وتجزؤ الذاكرة، كما تحجز بطاقة الـ GPU نصف جيجابايت تقريبا لتعريف التشغيل (driver)، لذا لا تخطط أبدا لاستخدام 100% من سعة VRAM المعلنة.
لماذا ذاكرة KV Cache هي الرقم الذي يفاجئك سلبا
تخزّن ذاكرة KV cache مفاتيح وقيم الانتباه (attention) لكل رمز موجود بالفعل في السياق، وتنمو خطيا مع طول السياق. في المطالبات القصيرة تكون خطأ تقريبيا لا يُذكر. لكن مع التوجه نحو سياق طويل، يمكن أن تضاهي حجم الأوزان نفسها أو تتجاوزه. هذا هو السبب الأكثر شيوعا وراء ظهور خطأ نفاد الذاكرة (out-of-memory) في منتصف التوليد لنموذج كان من المفترض أن "يتسع" بلا مشكلة.
المعادلة، لكل رمز (token):
KV_cache_per_token (bytes) = num_layers × 2 × kv_dim × precision_bytes
kv_dim = num_kv_heads × head_dim (grouped-query attention shrinks this)خذ Llama 3.3 70B مثالا: 80 طبقة، و8 رؤوس KV، وبُعد رأس 128، وبالتالي kv_dim يساوي 1024. عند FP16 يصبح الحساب 80 × 2 × 1024 × 2 = 327,680 بايت لكل رمز، أي حوالي 0.31 MB. اضرب هذا في طول السياق وتتضح الصورة بسرعة: عند 8K رمز تكون الذاكرة المؤقتة حوالي 2.6 GB، وعند 32K حوالي 10 GB، وعند 128K تتضخم إلى حوالي 41 GB. هذا الرقم الأخير يُضاف فوق أوزان الـ40 GB، لذا يتحول "نموذج 40 GB" بصمت إلى مشكلة 80 GB بمجرد ملء نافذة السياق.
هناك مخرجان عمليان. أولا، آلية Grouped-query attention (التي تستخدمها كل النماذج الحديثة تقريبا) تقلّص kv_dim بشكل كبير مقارنة بتصميم multi-head القديم، لذا النماذج الحديثة ألطف بكثير في هذا الجانب مقارنة بـLlama 2. ثانيا، تستطيع معظم محركات الاستدلال ضغط ذاكرة KV cache إلى 8-bit أو 4-bit، ما يقلّل حجمها إلى النصف أو الربع مقابل فقدان طفيف في الجودة. إذا كنت تخدم سياقات طويلة في بيئة الإنتاج، فإن مقارنة vLLM وSGLang تغطي أي محرك (backend) يدير هذه الذاكرة بأعلى كفاءة عبر paged attention.
نماذج MoE: لماذا لا توفّر "المعاملات النشطة" في VRAM
هذا هو الفخ الذي يكلّف الناس أكبر قدر من المال. يُوجّه نموذج Mixture-of-Experts مثل DeepSeek-V3.2 (671B إجمالي، 37B نشط، ويشارك بنية V3) أو GLM-5.2 (744B إجمالي، 40B نشط) كل رمز عبر مجموعة صغيرة فقط من خبرائه. تعتمد المواد التسويقية على رقم المعاملات النشطة لأنه يصف السرعة: أنت تدفع فقط تكلفة حوسبة تعادل 37B معامل لكل رمز، لذا الاستدلال سريع بالنسبة لحجم النموذج. لكن كل خبير يجب أن يبقى مقيما في الذاكرة، جاهزا لأن يُختار، ما يعني أن ميزانية VRAM لديك تُحدَّد بعدد المعاملات الإجمالي، لا النشط.
القراءة الصادقة للجدول أعلاه إذن: يعمل GLM-5.2 بسرعة نموذج 40B، لكنه يشغل ذاكرة نموذج 744B. لهذا السبب تحتاج هذه النماذج المفتوحة الطليعية إلى خادم بثماني بطاقات GPU أو جهاز بذاكرة موحدة كبيرة، رغم أن تمريرة أمامية واحدة (forward pass) رخيصة. Qwen3-235B-A22B له الشكل نفسه على نطاق أصغر: سريع لكل رمز، لكن ثقيل الاستضافة.
تظهر ميزة MoE بوضوح على أجهزة الذاكرة الموحدة. يستطيع جهاز Mac Studio بذاكرة موحدة سعة 512 GB استيعاب نموذج بحجم 671B عند Q4 وتشغيله بسرعة قابلة للاستخدام، وذلك بالتحديد لأن 37B فقط هي التي تُفعَّل، ما يبقي الطلب على نطاق ترددي للذاكرة (bandwidth) لكل رمز عند حد معقول. إذا كنت جديدا في تشغيل هذه النماذج محليا، ابدأ بـدليلنا لإعداد LLM محليا قبل أن تنفق على الأجهزة.
أي مستوى ضغط (Quantization) عليك اختياره؟
بالنسبة لمعظم المستخدمين، Q4_K_M هو الخيار الافتراضي الصحيح: فهو يحافظ على جودة شبه كاملة مع تقليص بصمة FP16 بمقدار 4 أضعاف تقريبا. انتقل إلى Q5_K_M أو Q8 فقط إذا كانت لديك مساحة VRAM إضافية ومهمة حساسة للجودة، والجأ إلى FP16 فقط عند إجراء fine-tuning أو مقارنة معيارية بمرجع. تحت مستوى Q4، يصبح تدهور الجودة ملحوظا بسرعة، لذا فإن Q3 وما دونه هو الملاذ الأخير لحشر نموذج على بطاقة صغيرة فعلا.
| إذا كان لديك | اختر | السبب |
|---|---|---|
| ميزانية VRAM محدودة | Q4_K_M | أفضل جودة لكل جيجابايت، الخيار الافتراضي للمجتمع |
| مساحة إضافية بسيطة | Q5_K_M | أدق قليلا في المطالبات الصعبة، وأثقل بشكل معتدل |
| ضعف حجم الأوزان في VRAM | Q8_0 | عديم الفقد عمليا، يستحق فقط إذا كان يتسع بسهولة |
| مهمة fine-tuning أو تقييم | FP16 / BF16 | دقة كاملة، نقطة المرجعية الصادقة |
تنبيه واحد: جودة الضغط الكمي ليست متطابقة بين النماذج. تتأثر النماذج الصغيرة جدا (أقل من 4B) بـQ4 أكثر من النماذج الكبيرة، لأن لديها فائضا أقل يمكن التضحية به. في نموذج بحجم 70B، يصعب التمييز بين Q4 وQ8 في معظم المهام. أما في نموذج بحجم 1.7B، فالفجوة حقيقية.
ما بطاقة الـ GPU التي تحتاجها فعليا؟
طابق عمود Q4 في الجدول الرئيسي مع بطاقة تمنحك مساحة إضافية بسيطة لذاكرة KV cache. إليك الخريطة العملية من الأجهزة الاستهلاكية الاقتصادية وصولا إلى مراكز البيانات، مع فئة النماذج التي تشغّلها كل شريحة بارتياح عند Q4.
| الجهاز | VRAM | يعمل بارتياح عند Q4 |
|---|---|---|
| RTX 4060 / 3060 (8-12 GB) | 8-12 GB | حتى ~14B dense (Gemma 4 12B، Qwen3-14B) |
| RTX 4080 / 4070 Ti Super (16 GB) | 16 GB | حتى ~24B dense (Mistral Small 3.2 24B) |
| RTX 4090 / 3090 (24 GB) | 24 GB | حتى ~32B dense، أو Qwen3-30B-A3B |
| RTX 6000 Ada / A6000 (48 GB) | 48 GB | 70B dense (Llama 3.3 70B) |
| H100 / A100 (80 GB) | 80 GB | ~109B MoE (Llama 4 Scout) |
| عقدة 8x H100 | 640 GB | 671-744B MoE طليعي (DeepSeek، GLM-5.2) |
| Mac Studio من سلسلة M (ذاكرة موحدة) | 64-512 GB | يتوسع مع RAM؛ 512 GB يستوعب نموذج MoE بحجم 671B عند Q4 |
تستحق شرائح Apple Silicon ذكرا خاصا لأن الذاكرة الموحدة تغيّر المعادلة. لا يفصل جهاز Mac بين VRAM وRAM النظام، لذا يستطيع جهاز من سلسلة M بذاكرة 128 GB تحميل نماذج كانت ستحتاج عدة بطاقات GPU منفصلة، مقايضا أقصى إنتاجية بالقدرة على استيعاب أوزان ضخمة على جهاز مكتبي واحد. لمعرفة المحركات (backends) التي تستخرج أقصى أداء من أي من هذه البطاقات، تقارن قائمتنا لـأفضل أدوات تشغيل LLM محليا فروق السرعة الواقعية.
كيف نحدد حجم VRAM لعمليات نشر عملائنا
في Techsy، ننشر نماذج مفتوحة المصدر لعملائنا بشكل متكرر بما يكفي لجعل تحديد حجم VRAM أول نقاش يُطرح، قبل اختيار النموذج، وقبل المطالبات (prompts)، وقبل أي شيء آخر. طريقتنا ممِلّة عن قصد، لأن نمط الفشل (خطأ OOM في بيئة الإنتاج تحت حمل سياق حقيقي) مكلف. إليك العملية التي نطبقها فعليا.
نبدأ من حسابات الجدول، ثم نقيس. بعد تحميل النموذج، نتحقق من البصمة الفعلية المقيمة في الذاكرة بدلا من الاعتماد على التقدير:
# What the GPU is actually holding
nvidia-smi --query-gpu=memory.used,memory.total --format=csv
# For an Ollama-served model, its real memory + how much sits on GPU vs CPU
ollama ps
# llama.cpp: control the split explicitly and cap context to bound KV cache
llama-server -m model-Q4_K_M.gguf --n-gpu-layers 999 --ctx-size 8192الدرس الذي يتكرر دائما: تحدد الفرق حجم الأوزان وتنسى KV cache، ثم تتساءل لماذا نموذج تم تحميله بنجاح ينهار بعد ثلاثة طلبات طويلة في عرض تجريبي. نحن نحدد الحجم بناء على الأوزان بالإضافة إلى KV cache عند الحد الأقصى للسياق الذي سيستخدمه التطبيق فعليا، بالإضافة إلى هامش أمان، ونحدد سقفا لـ--ctx-size حتى لا يتسبب طلب متفلت في نفاد ذاكرة الجهاز (OOM). في أي شيء يواجه العملاء، نفضل تشغيل نموذج 32B مضغوط لا ينهار أبدا على نموذج 70B بدقة FP16 ينفد من الذاكرة تحت الحمل.
إذا كنت تزن قرار استضافة نموذج مفتوح بنفسك أو البقاء على واجهة API مستضافة، فإن هذه المقايضة (تكلفة الأجهزة وعبء التشغيل مقابل التسعير لكل رمز والتحكم) هي بالضبط ما يحدد نطاقه فريقنا خلال مشروع تكامل الذكاء الاصطناعي. وإذا كان من المفيد أن يقوم أحدهم بحساب الأرقام مقابل حمل العمل الفعلي لديك، احصل على استشارة مجانية وسنحدد الحجم المناسب معك.
عن الكاتب
مرت باتور هو الشريك المؤسس لـTechsy.io، حيث يقوم الفريق بتطوير وكلاء الذكاء الاصطناعي، وأنظمة الأتمتة، ومسارات الصوت وSDR لعملاء B2B. يكتب عن مجموعة أدوات LLM التي يستخدمها فريق Techsy فعليا في بيئة الإنتاج.
المؤهلات: الشريك المؤسس، Techsy.io. تواصل عبر LinkedIn.
الأسئلة الشائعة
كم من VRAM أحتاج لتشغيل نموذج بحجم 70B؟
نموذج dense بحجم 70B مثل Llama 3.3 70B يحتاج حوالي 40 GB من VRAM للأوزان عند Q4_K_M، لذا خطط لبطاقة بسعة 48 GB (RTX 6000 Ada) أو بطاقتين بسعة 24 GB. أضف عدة جيجابايتات إضافية لذاكرة KV cache إذا كنت تستخدم سياقا طويلا، وهو ما يدفع المتطلبات العملية نحو 48 GB أو أكثر.
كم من VRAM تحتاجه نماذج Llama أو Qwen أو DeepSeek؟
يعتمد الأمر كليا على النسخة المحددة. يحتاج Llama 4 Scout حوالي 62 GB عند Q4، وQwen3-32B حوالي 18 GB، وQwen3-8B أقل من 5 GB. أما DeepSeek-V3.2، وهو نموذج MoE بحجم 671B، فيحتاج حوالي 382 GB لأن كل خبير يجب أن يُحمَّل. تحقق دائما من عدد المعاملات الإجمالي، لا النشط، بالنسبة لنماذج MoE.
هل يمكنني تشغيل LLM على بطاقة GPU بسعة 8GB؟
نعم، وبارتياح. تشغّل بطاقة 8 GB مثل RTX 4060 نماذج تصل إلى حوالي 12B معامل عند Q4_K_M. يتسع Gemma 4 12B في حوالي 6.8 GB، ما يترك مساحة لسياق معتدل. بالنسبة لأي شيء أكبر، عليك إما زيادة درجة الضغط، أو إبقاء السياق قصيرا، أو الانتقال إلى بطاقة أكبر.
ماذا يمكن لبطاقة GPU بسعة 24GB مثل RTX 4090 تشغيله؟
تتعامل بطاقة 24 GB مع نماذج dense تصل إلى حوالي 32B عند Q4_K_M مع مساحة كافية لسياق معقول، لذا يعمل Qwen3-32B وMistral Small 3.2 24B بارتياح. كما تشغّل نموذج Qwen3-30B-A3B من نوع MoE، الذي يحمّل 30B من الأوزان لكنه يولّد بسرعة نموذج 3B بفضل التفعيل المتناثر (sparse activation).
هل يضر الضغط الكمي بجودة النموذج؟
عند Q4_K_M وما فوق، تكون خسارة الجودة صغيرة وغالبا لا تُلاحظ في المهام الواقعية، خصوصا للنماذج التي تتجاوز 13B. تتسع الفجوة كلما انخفض المستوى وكلما صغر النموذج، لذا فإن Q4 على نموذج 70B شبه مجاني، بينما Q4 على نموذج 1.7B ملحوظ. Q8 عديم الفقد عمليا إذا كانت لديك الذاكرة الكافية.
هل تحتاج نماذج MoE إلى VRAM أقل من النماذج dense؟
لا، وهذا هو الفهم الخاطئ الأكثر شيوعا. يجب أن يحتفظ نموذج Mixture-of-Experts بكل خبير في VRAM، لذا تُحدَّد ذاكرته بعدد المعاملات الإجمالي. رقم المعاملات النشطة يصف فقط سرعة الاستدلال. يعمل GLM-5.2 بسرعة نموذج 40B، لكنه يحتاج إلى ذاكرة نموذج 744B.
هل الذاكرة الموحدة هي نفسها VRAM؟
من الناحية الوظيفية، لتحميل النماذج، نعم. تشترك شرائح Apple Silicon وبعض الأنظمة الأخرى في مجمع ذاكرة واحد بين CPU وGPU، لذا يستطيع جهاز Mac بذاكرة 128 GB تحميل نماذج كانت ستحتاج بخلاف ذلك عدة بطاقات GPU منفصلة. المقايضة هي النطاق الترددي (bandwidth): عادة ما تقدم الذاكرة الموحدة أقصى إنتاجية أقل من بطاقة GPU متطورة في مركز بيانات، لذا يكون عدد الرموز في الثانية (tokens-per-second) أقل.
هل يمكنني تفريغ جزء من نموذج إلى RAM النظام أو CPU؟
نعم. تتيح لك محركات مثل llama.cpp وOllama إبقاء بعض الطبقات على GPU والباقي في RAM النظام باستخدام خيار مثل --n-gpu-layers. هذا يسمح لك بتشغيل نموذج أكبر من أن يتسع في VRAM لديك، لكن كل طبقة على CPU تبطئ التوليد بشكل ملحوظ، لذا استخدم هذا الخيار لجعل تشغيل النموذج ممكنا، لا سريعا.
كيف أحسب VRAM لنموذج غير موجود في الجدول؟
اضرب عدد المعاملات بالمليارات في عدد البتات لكل معامل حسب مستوى الضغط الذي تستخدمه، ثم اقسم على 8. بالنسبة لـQ4_K_M استخدم حوالي 4.5 بت، لذا يحتاج نموذج بحجم 40B إلى 40 × 4.5 ÷ 8 = حوالي 22.5 GB للأوزان. أضف حوالي 15-20% كنفقات إضافية بالإضافة إلى KV cache للحصول على المتطلب الحقيقي.