
Απαιτήσεις VRAM για LLM: Ο Πίνακας Αναφοράς του 2026 (Κάθε Μοντέλο, Κάθε Κβάντιση)
Να ο αριθμός που πιάνει όλους απροετοίμαστους: Το DeepSeek-V3.2 έχει 671 δισεκατομμύρια παραμέτρους, αλλά μόνο 37 δισεκατομμύρια ενεργοποιούνται για οποιοδήποτε δεδομένο token. Άρα, πόση VRAM χρειάζεται πραγματικά; Όλες τις 671 δισεκατομμύρια, δηλαδή περίπου 382 GB σε Q4. Οι απαιτήσεις VRAM των LLM σπάνια ακολουθούν τη διαίσθηση, και το χάσμα μεταξύ «ενεργών παραμέτρων» και «αυτών που πρέπει να φορτώσετε» είναι ακριβώς εκεί όπου εκτοξεύονται οι προϋπολογισμοί hardware. Αυτός ο οδηγός σας δίνει τον κύριο πίνακα αναφοράς (κάθε σημαντικό ανοιχτό μοντέλο, κάθε επίπεδο κβάντισης, τα GB και την GPU που το τρέχει) καθώς και τον τύπο για να υπολογίσετε τις απαιτήσεις οποιουδήποτε μοντέλου σε περίπου δέκα δευτερόλεπτα.
Βασικά Συμπεράσματα
- VRAM για τα βάρη ≈ παράμετροι × bytes ανά παράμετρο: FP16 = 2.0, Q8 = 1.0, Q5_K_M ≈ 0.68, Q4_K_M ≈ 0.57. Προσθέστε KV cache και ~15-20% overhead сверху.
- Τα μοντέλα Mixture-of-Experts (DeepSeek, GLM-5.2, Qwen3-235B) πρέπει να φορτώσουν κάθε expert στη VRAM. Οι «ενεργές παράμετροι» σας προσφέρουν ταχύτητα, όχι εξοικονόμηση μνήμης.
- Το KV cache είναι το κρυφό κόστος. Το Llama 3.3 70B χρειάζεται περίπου 2.6 GB cache σε context 8K και περίπου 41 GB σε 128K, επιπλέον των βαρών.
- Το Q4_K_M είναι η λογική προεπιλογή: σχεδόν πλήρης ποιότητα στο περίπου ένα τέταρτο του footprint του FP16.
- Ένα μοντέλο 12B όπως το Gemma 4 χωράει σε κάρτα 8 GB σε Q4. Ένα πυκνό μοντέλο 70B χρειάζεται περίπου 40 GB. Ένα前沿 MoE 671B χρειάζεται έναν μικρό server.
Απαιτήσεις VRAM LLM ανά Μοντέλο: Ο Πίνακας Αναφοράς
Η σύντομη απάντηση: σε Q4_K_M, τα μικρά μοντέλα (κάτω από 14B) χωράνε σε consumer κάρτες 8-12 GB, τα μεσαίου μεγέθους (24-32B) θέλουν 16-24 GB, ένα πυκνό μοντέλο 70B χρειάζεται περίπου 40 GB, και τα前沿 μοντέλα MoE εκτοξεύονται σε εκατοντάδες gigabytes επειδή κάθε expert πρέπει να είναι resident. Εδώ είναι η πλήρης εικόνα συγκεντρωμένη. Όλα τα νούμερα αφορούν τη μνήμη μόνο για τα βάρη, υπολογισμένα από τον αριθμό παραμέτρων κάθε μοντέλου και επαληθευμένα με τις επίσημες κάρτες μοντέλων από Meta AI, Qwen και Hugging Face.
| Μοντέλο | Παράμετροι (σύνολο / ενεργές) | FP16 | Q8 | Q5_K_M | Q4_K_M | Ελάχ. GPU σε Q4 |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | 0.6B πυκνό | 1.2 GB | 0.6 GB | 0.4 GB | 0.4 GB | Οποιαδήποτε κάρτα 2 GB / κινητό |
| Qwen3-4B | 4B πυκνό | 8 GB | 4 GB | 2.7 GB | 2.3 GB | 4 GB (GTX 1650) |
| Qwen3-8B | 8B πυκνό | 16 GB | 8 GB | 5.4 GB | 4.6 GB | 6-8 GB (RTX 3060) |
| Gemma 4 12B | 11.95B πυκνό | 24 GB | 12 GB | 8.1 GB | 6.8 GB | 8 GB (RTX 4060) |
| Qwen3-14B | 14B πυκνό | 28 GB | 14 GB | 9.5 GB | 8.0 GB | 12 GB (RTX 3060 12GB) |
| Mistral Small 3.2 24B | 24B πυκνό | 48 GB | 24 GB | 16.3 GB | 13.7 GB | 16 GB (RTX 4080) |
| Qwen3-30B-A3B | 30B / 3B MoE | 60 GB | 30 GB | 20.4 GB | 17.1 GB | 24 GB (RTX 3090/4090) |
| Qwen3-32B | 32B πυκνό | 64 GB | 32 GB | 21.8 GB | 18.2 GB | 24 GB (RTX 4090) |
| Llama 3.3 70B | 70B πυκνό | 140 GB | 70 GB | 47.6 GB | 39.9 GB | 48 GB (2x 3090 / A6000) |
| Llama 4 Scout | 109B / 17B MoE | 218 GB | 109 GB | 74.1 GB | 62.1 GB | 80 GB (H100 / A100) |
| Qwen3-235B-A22B | 235B / 22B MoE | 470 GB | 235 GB | 160 GB | 134 GB | 2x 80 GB ή Mac 192 GB |
| Llama 4 Maverick | 400B / 17B MoE | 800 GB | 400 GB | 272 GB | 228 GB | 4x 80 GB |
| DeepSeek-V3.2 | 671B / 37B MoE | 1342 GB | 671 GB | 456 GB | 382 GB | Κόμβος 8x 80 GB |
| GLM-5.2 | 744B / 40B MoE | 1488 GB | 744 GB | 506 GB | 424 GB | 8x 80 GB+ / multi-node |
Δύο πράγματα να προσέξετε σε αυτόν τον πίνακα. Πρώτον, η κβάντιση είναι ο μεγαλύτερος μοχλός που έχετε: η μετάβαση από FP16 σε Q4 μειώνει το footprint περίπου 4 φορές με едва αισθητή απώλεια ποιότητας. Δεύτερον, οι γραμμές MoE φαίνονται brutal επειδή είναι. Το Qwen3-30B-A3B ενεργοποιεί μόνο 3B παραμέτρους ανά token, άρα τρέχει με την ταχύτητα ενός tiny μοντέλου, αλλά仍需 να κρατάτε όλα τα 30B στη μνήμη για να είναι έτοιμοι όλοι οι experts. Θέλετε τις λεπτομέρειες ανά μοντέλο πίσω από αυτά τα νούμερα; Η ανάλυση βάθους για το Gemma 4 12B και η συλλογή των καλύτερων open-source LLMs του 2026 καλύπτουν τα benchmarks και τις άδειες χρήσης.
"VRAM for the weights at Q4_K_M (GB)"
Πίνακας δεδομένων
| "VRAM (GB)" | "Q4_K_M VRAM" |
|---|---|
| "Qwen3-8B" | 4.6 |
| "Gemma 4 12B" | 6.8 |
| "Mistral 24B" | 13.7 |
| "Qwen3-32B" | 18.2 |
| "Llama 3.3 70B" | 39.9 |
| "Llama 4 Scout 109B" | 62.1 |
| "Qwen3-235B" | 134 |
| "DeepSeek-V3.2 671B" | 382 |
Ο Τύπος VRAM: Υπολογίστε Οποιοδήποτε Μοντέλο Μόνοι Σας
Για να dimensionare οποιοδήποτε μοντέλο, πολλαπλασιάστε τον αριθμό των παραμέτρων του με τα bytes ανά παράμετρο για την κβάντισή σας, και μετά προσθέστε λίγο για το KV cache και το runtime overhead. Αυτό είναι όλο. Τα βάρη είναι ο κυρίαρχος όρος, και τα μαθηματικά είναι αρκετά απλά για να γίνουν στο πίσω μέρος μιας χαρτοπετσέτας.
Η βασική εξίσωση για τα βάρη:
VRAM_weights (GB) = parameters (billions) × bits_per_weight ÷ 8Οι τιμές bits ανά βάρος που χρειάζεστε (αυτές είναι οι effective rates για αρχεία GGUF k-quant, τα οποία carry λίγα block metadata πάνω από το nominal bit depth):
| Κβάντιση | Bits ανά βάρος | Bytes ανά παράμετρο | Ποιότητα |
|---|---|---|---|
| FP16 / BF16 | 16 | 2.0 | Πλήρης ακρίβεια, το reference |
| Q8_0 | 8 | 1.0 | Πρακτικά lossless |
| Q6_K | ~6.5 | 0.81 | Σχεδόν πλήρης, σπάνια αξίζει over Q5 |
| Q5_K_M | ~5.5 | 0.68 | Ελαφρώς καλύτερο από Q4, λίγο πιο βαρύ |
| Q4_K_M | ~4.5 | 0.57 | Το sweet spot για τους περισσότερους |
Παράδειγμα εφαρμογής, Gemma 4 12B σε Q4_K_M: 11.95 × 4.5 ÷ 8 = περίπου 6.7 GB για τα βάρη. Αυτό ευθυγραμμίζεται με τα περίπου 6.6 GB που αναφέρει η επίσημη κάρτα μοντέλου και εξηγεί γιατί χωράει σε κάρτα 8 GB με χώρο για modest context. Κάντε τα ίδια μαθηματικά για ένα μοντέλο 70B σε Q4 και παίρνετε 70 × 4.5 ÷ 8 = 39.4 GB, γι' αυτό το «χρειάζεστε δύο κάρτες 24 GB ή μία 48 GB για ένα 70B» είναι ο κανόνας που επαναλαμβάνουν όλοι.
Η πλήρης εικόνα προσθέτει δύο ακόμη όρους: συνολική VRAM ≈ βάρη + KV cache + ~15-20% overhead. Το overhead καλύπτει activation buffers, το CUDA context και fragmentation μνήμης, και η GPU σας επίσης reserves περίπου μισό gigabyte για τον driver, οπότε μην planετε ποτέ να χρησιμοποιήσετε το 100% της αναγραφόμενης VRAM.
Γιατί το KV Cache Είναι ο Αριθμός που Σας «Τσιμπάει»
Το KV cache αποθηκεύει τα attention keys και values για κάθε token που είναι ήδη στο context, και μεγαλώνει γραμμικά με το μήκος του context. Σε σύντομα prompts είναι σφάλμα στρογγυλοποίησης. Αν pushαρετε προς long context, μπορεί να rivalize ή να ξεπεράσει даже τα ίδια τα βάρη. Αυτός είναι ο single most common λόγος που ένα μοντέλο που «θα έπρεπε να χωράει» πετάει out-of-memory error στη μέση της generation.
Ο τύπος, ανά token:
KV_cache_per_token (bytes) = num_layers × 2 × kv_dim × precision_bytes
kv_dim = num_kv_heads × head_dim (grouped-query attention shrinks this)Πάρτε το Llama 3.3 70B: 80 layers, 8 KV heads, head dimension 128, άρα kv_dim είναι 1024. Σε FP16 αυτό είναι 80 × 2 × 1024 × 2 = 327.680 bytes ανά token, περίπου 0.31 MB. Πολλαπλασιάστε με το μήκος context και η ιστορία γράφεται μόνη της: σε 8K tokens το cache είναι περίπου 2.6 GB, σε 32K είναι περίπου 10 GB, και σε 128K φουσκώνει στα περίπου 41 GB. Αυτό το τελευταίο νούμερο είναι επιπλέον των 40 GB των βαρών, οπότε ένα «μοντέλο 40 GB» γίνεται quietly ένα πρόβλημα 80 GB τη στιγμή που γεμίζετε το window.
Δύο πρακτικές διαφυγές. Το Grouped-query attention (που χρησιμοποιεί κάθε recent μοντέλο) ήδη slashes το kv_dim σε σχέση με τον παλιό multi-head design, οπότε τα modern μοντέλα είναι far kinder εδώ από ό,τι ήταν το Llama 2. Και οι περισσότεροι inference engines μπορούν να quantize το KV cache σε 8-bit ή 4-bit, halving ή quartering το μέγεθός του με μικρό κόστος ποιότητας. Αν servingετε long contexts σε production, η σύγκριση vLLM vs SGLang καλύπτει ποιο backend manages αυτή τη μνήμη most efficiently με paged attention.
Μοντέλα MoE: Γιατί οι «Ενεργές Παράμετροι» Δεν Σώζουν τη VRAM
Αυτή είναι η trap που κοστίζει στους ανθρώπους τα περισσότερα χρήματα. Ένα μοντέλο Mixture-of-Experts όπως το DeepSeek-V3.2 (671B σύνολο, 37B ενεργά, sharing την αρχιτεκτονική V3) ή το GLM-5.2 (744B σύνολο, 40B ενεργά) routes κάθε token μέσω ενός small subset των experts του. Το marketing leans στον active αριθμό επειδή περιγράφει την ταχύτητα: πληρώνετε μόνο compute 37B παραμέτρων ανά token, οπότε το inference είναι γρήγορο για το μέγεθος του μοντέλου. Αλλά κάθε expert πρέπει να sits στη μνήμη, ready να picked, which means ότι ο προϋπολογισμός VRAM σας καθορίζεται από τον συνολικό αριθμό παραμέτρων, όχι τον active.
Άρα η honest reading του παραπάνω πίνακα: Το GLM-5.2 τρέχει με την ταχύτητα ενός μοντέλου 40B αλλά καταλαμβάνει τη μνήμη ενός 744B. Γι' αυτό αυτά τα frontier open models χρειάζονται έναν server 8-GPU ή ένα large unified-memory machine, even though ένα single forward pass είναι cheap. Το Qwen3-235B-A22B έχει το same shape σε smaller scale, γρήγορο ανά token, heavy to host.
Το upside του MoE εμφανίζεται σε hardware unified-memory. Ένα Mac Studio με 512 GB unified memory μπορεί να hold ένα μοντέλο 671B σε Q4 και still να το τρέξει σε usable speeds precisely επειδή only 37B activate, οπότε η demand memory bandwidth ανά token stays reasonable. Αν είστε new στο running these locally, start με τον οδηγό setup τοπικού LLM πριν spendάρετε σε hardware.
Ποια Κβάντιση Να Επιλέξετε;
Για σχεδόν όλους, το Q4_K_M είναι η σωστή προεπιλογή: κρατά near-full quality ενώ cuts το footprint FP16 κατά περίπου 4x. Step up σε Q5_K_M ή Q8 μόνο αν έχετε spare VRAM και μια quality-sensitive task, και reach for FP16 μόνο όταν κάνετε fine-tuning ή benchmarking against a reference. Κάτω από Q4, η degradation ποιότητας becomes noticeable fast, οπότε Q3 και lower are a last resort για squeezing ένα μοντέλο σε μια κάρτα που is genuinely too small.
| Αν έχετε | Επιλέξτε | Γιατί |
|---|---|---|
| Tight budget VRAM | Q4_K_M | Καλύτερη ποιότητα ανά gigabyte, το community default |
| Λίγο headroom | Q5_K_M | Ελαφρώς sharper σε hard prompts, modestly heavier |
| 2x τα βάρη σε VRAM | Q8_0 | Πρακτικά lossless, worth it μόνο αν fits easily |
| Εργασία fine-tuning ή eval | FP16 / BF16 | Πλήρης ακρίβεια, το honest reference point |
Μια caveat: η ποιότητα κβάντισης δεν είναι identical across models. Very small models (κάτω από 4B) feel το Q4 more από large ones, επειδή have less redundancy to spare. Σε ένα μοντέλο 70B, το Q4 versus Q8 is hard to tell apart σε most tasks. Σε ένα μοντέλο 1.7B, το gap is real.
Ποια GPU Χρειάζεστε Πραγματικά;
Match the Q4 column του master table με μια κάρτα με little headroom για KV cache. Εδώ είναι το practical mapping από budget consumer hardware up to data center, με το model tier που each class runs comfortably σε Q4.
| Hardware | VRAM | Τρέχει comfortably σε Q4 |
|---|---|---|
| RTX 4060 / 3060 (8-12 GB) | 8-12 GB | Έως ~14B πυκνό (Gemma 4 12B, Qwen3-14B) |
| RTX 4080 / 4070 Ti Super (16 GB) | 16 GB | Έως ~24B πυκνό (Mistral Small 3.2 24B) |
| RTX 4090 / 3090 (24 GB) | 24 GB | Έως ~32B πυκνό, ή Qwen3-30B-A3B |
| RTX 6000 Ada / A6000 (48 GB) | 48 GB | 70B πυκνό (Llama 3.3 70B) |
| H100 / A100 (80 GB) | 80 GB | ~109B MoE (Llama 4 Scout) |
| Κόμβος 8x H100 | 640 GB | 671-744B frontier MoE (DeepSeek, GLM-5.2) |
| Mac Studio M-series (unified) | 64-512 GB | Scales με RAM; 512 GB holds ένα 671B MoE σε Q4 |
Το Apple Silicon deserves special mention επειδή το unified memory changes the calculus. Ένα Mac doesn't split VRAM από system RAM, οπότε ένα 128 GB M-series machine can load models που would need multiple discrete GPUs, trading peak throughput για την ability να fit huge weights σε one desktop. Για τα backends που squeeze the most out of any of these cards, το roundup μας των καλύτερων tools για τρέξιμο LLMs τοπικά benchmarks τις real-world speed differences.
Πώς Dimensionουμε τη VRAM για Client Deployments
Στη Techsy deployάρουμε open models για clients often enough ώστε το sizing VRAM να είναι η πρώτη conversation, before model choice, before prompts, before anything. Η method μας is boring on purpose, επειδή το failure mode (ένα OOM σε production under real context load) is expensive. Εδώ είναι η process που actually run.
Startάρουμε από τα math του πίνακα, και μετά measure. After loading ένα model checkάρουμε το real resident footprint αντί να trustάρουμε το estimate:
# What the GPU is actually holding
nvidia-smi --query-gpu=memory.used,memory.total --format=csv
# For an Ollama-served model, its real memory + how much sits on GPU vs CPU
ollama ps
# llama.cpp: control the split explicitly and cap context to bound KV cache
llama-server -m model-Q4_K_M.gguf --n-gpu-layers 999 --ctx-size 8192Το lesson που keeps repeating: οι teams size για τα βάρη και forget το KV cache, και μετά wonder γιατί ένα model που loaded fine dies three long requests into a demo. Sizeάρουμε για τα βάρη plus το KV cache στο maximum context που θα use really η app, plus headroom, και capάρουμε το --ctx-size ώστε ένα runaway request να μην μπορεί να OOMάρει το box. Για anything customer-facing θα preferάραμε να runάμε ένα quantized 32B που never falls over παρά ένα FP16 70B που OOMάρει under load.
Αν weighάρετε whether να self-hostάρετε ένα open model ή stay σε hosted API, αυτό το trade (hardware cost και ops burden versus per-token pricing και control) is exactly what η team μας scopes during ένα engagement AI integration. Αν θα βοηθούσε να runάrei κάποιος τα numbers against το actual workload σας, get a free consultation και θα το sizeάρουμε μαζί σας.
Σχετικά με τον Συγγραφέα
Ο Mert Batur Gurbuz είναι Συνιδρυτής της Techsy.io, όπου η team ships AI agents, automation systems, και voice/SDR pipelines για B2B clients. Σπουδάζει στο Πανεπιστήμιο του Birmingham και γράφει για το LLM tooling stack που η team της Techsy actually uses σε production.
Πιστοποιήσεις: Συνιδρυτής, Techsy.io, Πανεπιστήμιο του Birmingham. Συνδεθείτε στο LinkedIn.
Συχνές Ερωτήσεις
Πόση VRAM χρειάζομαι για να τρέξω ένα μοντέλο 70B;
Ένα πυκνό μοντέλο 70B όπως το Llama 3.3 70B χρειάζεται περίπου 40 GB VRAM για τα βάρη σε Q4_K_M, οπότε planάρετε για μια κάρτα 48 GB (RTX 6000 Ada) ή δύο κάρτες 24 GB. Προσθέστε several more gigabytes για KV cache αν useάρετε long context, which pushes τις practical requirements προς 48 GB ή more.
Πόση VRAM χρειάζονται τα Llama, Qwen ή DeepSeek;
Εξαρτάται entirely από το variant. Το Llama 4 Scout χρειάζεται περίπου 62 GB σε Q4, το Qwen3-32B περίπου 18 GB, και το Qwen3-8B κάτω από 5 GB. Το DeepSeek-V3.2, ένα 671B MoE, χρειάζεται περίπου 382 GB επειδή every expert must load. Always check the total parameter count, not the active one, για MoE models.
Μπορώ να τρέξω ένα LLM σε GPU 8GB;
Ναι, comfortably. Μια κάρτα 8 GB όπως μια RTX 4060 τρέχει models έως about 12B parameters σε Q4_K_M. Το Gemma 4 12B fits σε roughly 6.8 GB, leaving room για modest context. Για anything larger either quantizeάρετε harder, keepάρετε το context short, ή moveάρετε σε bigger card.
Τι μπορεί να τρέξει μια GPU 24GB όπως η RTX 4090;
Μια κάρτα 24 GB handles πυκνά models έως about 32B σε Q4_K_M με headroom για reasonable context, οπότε τα Qwen3-32B και Mistral Small 3.2 24B are comfortable. Also τρέχει το Qwen3-30B-A3B MoE, which loads 30B βαρών αλλά generates με την ταχύτητα ενός μοντέλου 3B thanks σε sparse activation.
Η κβάντιση hurtάει την ποιότητα του μοντέλου;
Σε Q4_K_M και above, η quality loss is small και often imperceptible σε real tasks, especially για models over 13B. Το gap widens καθώς goάρετε lower και καθώς τα models get smaller, οπότε το Q4 σε ένα 70B is nearly free ενώ το Q4 σε ένα 1.7B is noticeable. Το Q8 is effectively lossless αν έχετε τη μνήμη.
Τα MoE models χρειάζονται λιγότερη VRAM από τα πυκνά models;
Όχι, και αυτή είναι η most common misconception. Ένα Mixture-of-Experts model must hold every expert σε VRAM, οπότε η μνήμη του καθορίζεται από τον total parameter count. Το active-parameter figure only describes inference speed. Το GLM-5.2 τρέχει με την ταχύτητα ενός μοντέλου 40B αλλά needs τη μνήμη ενός 744B.
Η unified memory είναι ίδια με τη VRAM;
Λειτουργικά, για loading models, ναι. Το Apple Silicon και some other systems share one memory pool μεταξύ CPU και GPU, οπότε ένα 128 GB Mac can load models που otherwise would need multiple discrete GPUs. Το trade is bandwidth: η unified memory usually delivers lower peak throughput από μια high-end data-center GPU, οπότε τα tokens-per-second είναι lower.
Μπορώ να offloadάρω part ενός model σε system RAM ή CPU;
Ναι. Engines like llama.cpp και Ollama let you keep some layers on the GPU και the rest σε system RAM με flag like --n-gpu-layers. It lets you run ένα model too big για your VRAM, αλλά every layer on the CPU slows generation sharply, οπότε use it to make ένα model possible, not fast.
Πώς υπολογίζω τη VRAM για ένα model που δεν είναι στον πίνακα;
Πολλαπλασιάστε τον αριθμό παραμέτρων σε billions με τα bits-per-weight για την κβάντισή σας, και μετά divide by 8. Για Q4_K_M useάρετε about 4.5 bits, οπότε ένα μοντέλο 40B needs 40 × 4.5 ÷ 8 = about 22.5 GB για τα βάρη. Προσθέστε roughly 15-20% overhead plus το KV cache σας για την real requirement.