
LLM VRAM Gereksinimleri: 2026 Ana Tablosu (Her Model, Her Kuantizasyon)
Herkesi şaşırtan sayı şu: DeepSeek-V3.2'nin 671 milyar parametresi var, ama bir token için yalnızca 37 milyarı devreye giriyor. Peki gerçekte ne kadar VRAM gerekiyor? 671 milyarın tamamı, Q4'te yaklaşık 382 GB. LLM VRAM gereksinimleri sezgiye pek uymuyor; "aktif parametreler" ile "yüklemeniz gereken şey" arasındaki fark, donanım bütçelerinin tam olarak patladığı nokta. Bu rehber size ana tabloyu sunuyor: her önemli açık model, her kuantizasyon seviyesi, GB rakamı ve onu çalıştıran GPU; üstüne herhangi bir modeli yaklaşık on saniyede kendinizin hesaplayabileceği formül.
Temel Çıkarımlar
- Ağırlıklar için VRAM ≈ parametre × bayt-başına-parametre: FP16 = 2.0, Q8 = 1.0, Q5_K_M ≈ 0.68, Q4_K_M ≈ 0.57. Üstüne KV önbelleği ve ~15-20% ek yük ekleyin.
- Mixture-of-Experts modelleri (DeepSeek, GLM-5.2, Qwen3-235B) her uzmanı VRAM'e yüklemek zorunda. "Aktif parametreler" size hız kazandırır, bellek değil.
- KV önbelleği gizli maliyettir. Llama 3.3 70B, 8K bağlamda yaklaşık 2.6 GB önbellek, 128K'da ise ağırlıkların üstüne yaklaşık 41 GB gerektirir.
- Q4_K_M makul varsayılandır: FP16 ayak izinin kabaca dörtte biriyle tam kaliteye yakın sonuç verir.
- Gemma 4 gibi 12B'lik bir model, Q4'te 8 GB'lık bir karta sığar. 70B'lik yoğun bir model yaklaşık 40 GB gerektirir. 671B'lik bir uç MoE modeli ise küçük bir sunucu ister.
Modele Göre LLM VRAM Gereksinimleri: Ana Tablo
Kısa cevap şu: Q4_K_M'de küçük modeller (14B altı) tüketici sınıfı 8-12 GB kartlara sığar, orta boy modeller (24-32B) 16-24 GB ister, 70B'lik yoğun bir model yaklaşık 40 GB gerektirir ve uç MoE modelleri, her uzman bellekte hazır bulunmak zorunda olduğundan yüzlerce gigabayta sıçrar. İşte tüm tablo tek bir yerde. Rakamların tamamı yalnızca ağırlıklar için gereken bellek olup her modelin parametre sayısından hesaplanmış ve Meta AI, Qwen ile Hugging Face'in resmi model kartlarıyla çapraz kontrol edilmiştir.
| Model | Parametre (toplam / aktif) | FP16 | Q8 | Q5_K_M | Q4_K_M | Q4'te Minimum GPU |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | 0.6B yoğun | 1.2 GB | 0.6 GB | 0.4 GB | 0.4 GB | Herhangi bir 2 GB kart / telefon |
| Qwen3-4B | 4B yoğun | 8 GB | 4 GB | 2.7 GB | 2.3 GB | 4 GB (GTX 1650) |
| Qwen3-8B | 8B yoğun | 16 GB | 8 GB | 5.4 GB | 4.6 GB | 6-8 GB (RTX 3060) |
| Gemma 4 12B | 11.95B yoğun | 24 GB | 12 GB | 8.1 GB | 6.8 GB | 8 GB (RTX 4060) |
| Qwen3-14B | 14B yoğun | 28 GB | 14 GB | 9.5 GB | 8.0 GB | 12 GB (RTX 3060 12GB) |
| Mistral Small 3.2 24B | 24B yoğun | 48 GB | 24 GB | 16.3 GB | 13.7 GB | 16 GB (RTX 4080) |
| Qwen3-30B-A3B | 30B / 3B MoE | 60 GB | 30 GB | 20.4 GB | 17.1 GB | 24 GB (RTX 3090/4090) |
| Qwen3-32B | 32B yoğun | 64 GB | 32 GB | 21.8 GB | 18.2 GB | 24 GB (RTX 4090) |
| Llama 3.3 70B | 70B yoğun | 140 GB | 70 GB | 47.6 GB | 39.9 GB | 48 GB (2x 3090 / A6000) |
| Llama 4 Scout | 109B / 17B MoE | 218 GB | 109 GB | 74.1 GB | 62.1 GB | 80 GB (H100 / A100) |
| Qwen3-235B-A22B | 235B / 22B MoE | 470 GB | 235 GB | 160 GB | 134 GB | 2x 80 GB veya 192 GB Mac |
| Llama 4 Maverick | 400B / 17B MoE | 800 GB | 400 GB | 272 GB | 228 GB | 4x 80 GB |
| DeepSeek-V3.2 | 671B / 37B MoE | 1342 GB | 671 GB | 456 GB | 382 GB | 8x 80 GB düğüm |
| GLM-5.2 | 744B / 40B MoE | 1488 GB | 744 GB | 506 GB | 424 GB | 8x 80 GB+ / çoklu düğüm |
Bu tablodan iki şey çıkarılabilir. Birincisi, elinizdeki en büyük kaldıraç kuantizasyon: FP16'dan Q4'e düşmek, ayak izini kabaca 4 kat azaltır ve kalite kaybı zar zor fark edilir. İkincisi, MoE satırları acımasız görünüyor çünkü gerçekten öyleler. Qwen3-30B-A3B, token başına yalnızca 3B parametre aktive ediyor; bu yüzden küçük bir model hızında çalışıyor, ama her uzmanı hazır tutmak için yine de 30B'nin tamamını bellekte tutmanız gerekiyor. Bu rakamların ardındaki model bazlı detayları mı istiyorsunuz? Gemma 4 12B derinlemesine incelememiz ve 2026'nın en iyi açık kaynaklı LLM'leri derlememiz, benchmark'ları ve lisansları ele alıyor.
"VRAM for the weights at Q4_K_M (GB)"
Veri tablosu
| "VRAM (GB)" | "Q4_K_M VRAM" |
|---|---|
| "Qwen3-8B" | 4.6 |
| "Gemma 4 12B" | 6.8 |
| "Mistral 24B" | 13.7 |
| "Qwen3-32B" | 18.2 |
| "Llama 3.3 70B" | 39.9 |
| "Llama 4 Scout 109B" | 62.1 |
| "Qwen3-235B" | 134 |
| "DeepSeek-V3.2 671B" | 382 |
VRAM Formülü: Herhangi Bir Modeli Kendiniz Hesaplayın
Herhangi bir modeli boyutlandırmak için parametre sayısını kuantizasyonunuza karşılık gelen bayt-başına-parametre değeriyle çarpın, ardından KV önbelleği ve çalışma zamanı ek yükü için biraz pay ekleyin. Hepsi bu kadar. Baskın terim ağırlıklardır ve aritmetik bir peçetenin arkasına yazılabilecek kadar basittir.
Ağırlıklar için temel denklem:
VRAM_weights (GB) = parameters (billions) × bits_per_weight ÷ 8İhtiyacınız olan bayt-başına-bit değerleri (bunlar, nominal bit derinliğinin üzerine biraz blok metadata'sı taşıyan GGUF k-quant dosyaları için geçerli olan etkin oranlardır):
| Quantization | Bits per weight | Bytes per param | Quality |
|---|---|---|---|
| FP16 / BF16 | 16 | 2.0 | Tam hassasiyet, referans nokta |
| Q8_0 | 8 | 1.0 | Fiilen kayıpsız |
| Q6_K | ~6.5 | 0.81 | Tama yakın, Q5'e karşı nadiren değer |
| Q5_K_M | ~5.5 | 0.68 | Q4'ten biraz daha iyi, biraz daha ağır |
| Q4_K_M | ~4.5 | 0.57 | Çoğu kişi için ideal nokta |
Uygulamalı örnek, Gemma 4 12B için Q4_K_M'de: 11.95 × 4.5 ÷ 8 = ağırlıklar için yaklaşık 6.7 GB. Bu, resmi model kartının belirttiği yaklaşık 6.6 GB ile örtüşüyor ve modelin, makul bir bağlam için yer bırakarak 8 GB'lık bir karta neden sığdığını açıklıyor. Aynı hesabı Q4'te bir 70B model için yapın: 70 × 4.5 ÷ 8 = 39.4 GB çıkar; herkesin tekrarladığı "70B için iki adet 24 GB kart ya da tek bir 48 GB kart gerekir" kuralının nedeni de bu.
Tam tablo iki terim daha ekliyor: toplam VRAM ≈ ağırlıklar + KV önbelleği + ~15-20% ek yük. Ek yük; aktivasyon tamponlarını, CUDA bağlamını ve bellek parçalanmasını kapsar; GPU'nuz ayrıca sürücü için yarım gigabayt kadar bir pay ayırır, bu yüzden asla etiketteki VRAM'in 100%'ünü kullanmayı planlamayın.
KV Önbelleği Neden Sizi Gafil Avlayan Sayı?
KV önbelleği, bağlamda hâlihazırda bulunan her token için dikkat (attention) anahtarlarını ve değerlerini saklar ve bağlam uzunluğuyla doğrusal olarak büyür. Kısa istemlerde göz ardı edilebilecek kadar küçüktür. Uzun bir bağlama doğru ilerledikçe ağırlıklarla yarışabilir, hatta onları geçebilir. "Sığması gereken" bir modelin üretim sırasında bellek yetersizliği (out-of-memory) hatası vermesinin en yaygın tek nedeni budur.
Token başına formül:
KV_cache_per_token (bytes) = num_layers × 2 × kv_dim × precision_bytes
kv_dim = num_kv_heads × head_dim (grouped-query attention shrinks this)Llama 3.3 70B'yi ele alalım: 80 katman, 8 KV başlığı, 128'lik başlık boyutu; yani kv_dim 1024. FP16'da bu, 80 × 2 × 1024 × 2 = token başına 327,680 bayt, yaklaşık 0.31 MB eder. Bağlam uzunluğuyla çarpın, hikâye kendini yazıyor: 8K token'da önbellek yaklaşık 2.6 GB, 32K'da yaklaşık 10 GB, 128K'da ise yaklaşık 41 GB'a şişiyor. Bu son rakam, 40 GB'lık ağırlıkların üstüne ekleniyor; yani pencereyi doldurduğunuz anda "40 GB'lık bir model" sessizce 80 GB'lık bir soruna dönüşüyor.
İki pratik çıkış yolu var. Grouped-query attention (son dönem her model bunu kullanıyor), eski çoklu-başlık tasarımına kıyasla kv_dim'i zaten büyük ölçüde küçültüyor; bu yüzden modern modeller bu konuda Llama 2'den çok daha cömert. Ayrıca çoğu çıkarım motoru, KV önbelleğini 8-bit veya 4-bit'e kuantize edebiliyor; bu da küçük bir kalite bedeliyle boyutu yarıya veya çeyreğe indiriyor. Üretimde uzun bağlamlar sunuyorsanız, vLLM vs SGLang karşılaştırmamız hangi backend'in bu belleği paged attention ile en verimli şekilde yönettiğini ele alıyor.
MoE Modelleri: "Aktif Parametreler" Neden VRAM Kurtarmıyor?
İnsanlara en çok paraya mal olan tuzak bu. DeepSeek-V3.2 (671B toplam, 37B aktif, V3 mimarisini paylaşıyor) veya GLM-5.2 (744B toplam, 40B aktif) gibi bir Mixture-of-Experts modeli, her token'ı uzmanlarının küçük bir alt kümesinden geçirir. Pazarlama dili aktif sayıya dayanıyor çünkü bu rakam hızı tanımlar: token başına yalnızca 37B parametrelik hesaplama ödersiniz, bu yüzden çıkarım, modelin boyutuna göre hızlıdır. Ama her uzman, seçilmeye hazır şekilde bellekte durmak zorundadır; bu da VRAM bütçenizin aktif değil toplam parametre sayısıyla belirlendiği anlamına gelir.
Yukarıdaki tablonun dürüst okuması şu: GLM-5.2, 40B'lik bir model hızında çalışır ama 744B'lik bir modelin belleğini kaplar. Tek bir ileri geçiş ucuz olsa da bu uç açık modellerin 8 GPU'lu bir sunucuya veya büyük, birleşik bellekli bir makineye ihtiyaç duymasının nedeni bu. Qwen3-235B-A22B, daha küçük ölçekte aynı şekle sahip: token başına hızlı, barındırması ağır.
MoE'nin avantajı birleşik bellekli donanımda ortaya çıkıyor. 512 GB birleşik belleğe sahip bir Mac Studio, 671B'lik bir modeli Q4'te tutabilir ve yine de kullanılabilir hızlarda çalıştırabilir; çünkü yalnızca 37B aktive olur ve token başına bellek bant genişliği talebi makul kalır. Bunları yerel olarak çalıştırmakta yeniyseniz, donanıma para harcamadan önce yerel LLM kurulum rehberimizle başlayın.
Hangi Kuantizasyonu Seçmelisiniz?
Neredeyse herkes için doğru varsayılan Q4_K_M'dir: FP16 ayak izini yaklaşık 4 kat azaltırken tam kaliteye yakın kalır. Yalnızca elinizde fazladan VRAM varsa ve kaliteye duyarlı bir iş yapıyorsanız Q5_K_M veya Q8'e geçin; FP16'ya ise yalnızca ince ayar yaparken veya bir referansa karşı benchmark yaparken başvurun. Q4'ün altında kalite kaybı hızla belirginleşir, bu yüzden Q3 ve altı, gerçekten çok küçük bir karta modeli sıkıştırmak için son çare olarak kalır.
| Elinizde şu varsa | Seçin | Neden |
|---|---|---|
| Sınırlı bir VRAM bütçesi | Q4_K_M | Gigabayt başına en iyi kalite, topluluk varsayılanı |
| Biraz pay | Q5_K_M | Zor istemlerde biraz daha keskin, hafifçe daha ağır |
| VRAM'de ağırlıkların 2 katı yer | Q8_0 | Fiilen kayıpsız, yalnızca rahatça sığıyorsa değer |
| Bir ince ayar veya değerlendirme işi | FP16 / BF16 | Tam hassasiyet, dürüst referans noktası |
Bir uyarı: kuantizasyon kalitesi modeller arasında aynı değildir. Çok küçük modeller (4B altı), yedekleri daha az olduğundan Q4'ü büyük modellerden daha fazla hisseder. 70B'lik bir modelde Q4 ile Q8 arasındaki fark çoğu görevde ayırt edilemez. 1.7B'lik bir modelde ise fark gerçektir.
Gerçekte Hangi GPU'ya İhtiyacınız Var?
Ana tablodaki Q4 sütununu, KV önbelleği için biraz pay bırakan bir kartla eşleştirin. İşte bütçe dostu tüketici donanımından veri merkezine kadar pratik eşleştirme; her sınıfın Q4'te rahatça çalıştırdığı model kademesiyle birlikte.
| Donanım | VRAM | Q4'te Rahatça Çalıştırır |
|---|---|---|
| RTX 4060 / 3060 (8-12 GB) | 8-12 GB | ~14B yoğun modele kadar (Gemma 4 12B, Qwen3-14B) |
| RTX 4080 / 4070 Ti Super (16 GB) | 16 GB | ~24B yoğun modele kadar (Mistral Small 3.2 24B) |
| RTX 4090 / 3090 (24 GB) | 24 GB | ~32B yoğun modele kadar veya Qwen3-30B-A3B |
| RTX 6000 Ada / A6000 (48 GB) | 48 GB | 70B yoğun model (Llama 3.3 70B) |
| H100 / A100 (80 GB) | 80 GB | ~109B MoE (Llama 4 Scout) |
| 8x H100 düğüm | 640 GB | 671-744B uç MoE (DeepSeek, GLM-5.2) |
| Mac Studio M serisi (birleşik) | 64-512 GB | RAM ile ölçeklenir; 512 GB, Q4'te 671B'lik bir MoE'yi tutar |
Apple Silicon özel bir not hak ediyor çünkü birleşik bellek hesabı değiştiriyor. Bir Mac, VRAM'i sistem RAM'inden ayırmaz; bu yüzden 128 GB'lık bir M serisi makine, normalde birden fazla ayrık GPU gerektirecek modelleri yükleyebilir ve zirve verim kapasitesini, devasa ağırlıkları tek bir masaüstünde barındırma yeteneğiyle takas eder. Bu kartların her birinden en fazlasını sıkıp çıkaran backend'ler için, LLM'leri yerel çalıştırmak için en iyi araçlar derlememiz gerçek dünya hız farklarını benchmark ediyor.
Müşteri Dağıtımları İçin VRAM'i Nasıl Boyutlandırıyoruz
Techsy'de müşteriler için açık modelleri yeterince sık dağıtıyoruz ki VRAM boyutlandırması, model seçiminden önce, istemlerden önce, her şeyden önce gelen ilk konuşma haline geldi. Yöntemimiz bilerek sıkıcı; çünkü hata modu (üretimde gerçek bağlam yükü altında bir OOM) pahalıya mal oluyor. İşte gerçekten uyguladığımız süreç.
Tablo matematiğiyle başlıyoruz, sonra ölçüyoruz. Bir modeli yükledikten sonra tahmine güvenmek yerine gerçek yerleşik ayak izini kontrol ediyoruz:
# What the GPU is actually holding
nvidia-smi --query-gpu=memory.used,memory.total --format=csv
# For an Ollama-served model, its real memory + how much sits on GPU vs CPU
ollama ps
# llama.cpp: control the split explicitly and cap context to bound KV cache
llama-server -m model-Q4_K_M.gguf --n-gpu-layers 999 --ctx-size 8192Tekrar eden ders şu: ekipler yalnızca ağırlıklar için boyutlandırıyor, KV önbelleğini unutuyor, sonra sorunsuz yüklenen bir modelin bir demoda üç uzun istekten sonra neden çöktüğüne şaşırıyor. Biz ağırlıkları, uygulamanın gerçekten kullanacağı maksimum bağlamdaki KV önbelleğiyle ve üstüne bir pay ekleyerek boyutlandırıyoruz; ayrıca kaçak bir isteğin makineyi OOM'a sürüklememesi için --ctx-size'ı sınırlıyoruz. Müşteriyle doğrudan temas eden herhangi bir şey için, yük altında OOM veren bir FP16 70B yerine hiç çökmeyen kuantize bir 32B çalıştırmayı tercih ederiz.
Açık bir modeli kendiniz mi barındırmalısınız yoksa barındırılan bir API'de mi kalmalısınız diye tartıyorsanız, bu takas (donanım maliyeti ve operasyon yükü karşısında token başına fiyatlandırma ve kontrol) tam olarak ekibimizin bir yapay zeka entegrasyon projesi sırasında kapsamını belirlediği konu. Rakamları gerçek iş yükünüze göre birinin hesaplaması işinize yarayacaksa, ücretsiz danışmanlık alın ve birlikte boyutlandıralım.
Yazar Hakkında
Mert Batur, B2B müşterileri için yapay zeka ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları geliştiren Techsy.io'nun Kurucu Ortağı. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor.
Yetkinlikler: Kurucu Ortak, Techsy.io. LinkedIn üzerinden bağlantı kurun.
Sıkça Sorulan Sorular
70B'lik bir modeli çalıştırmak için ne kadar VRAM gerekir?
Llama 3.3 70B gibi 70B'lik yoğun bir model, Q4_K_M'de ağırlıklar için yaklaşık 40 GB VRAM gerektirir; bu yüzden 48 GB'lık bir kart (RTX 6000 Ada) veya iki adet 24 GB kart planlayın. Uzun bir bağlam kullanıyorsanız KV önbelleği için birkaç gigabayt daha ekleyin; bu da pratik gereksinimi 48 GB veya üzerine iter.
Llama, Qwen veya DeepSeek ne kadar VRAM ister?
Bu tamamen varyanta bağlı. Llama 4 Scout, Q4'te yaklaşık 62 GB; Qwen3-32B yaklaşık 18 GB; Qwen3-8B ise 5 GB'ın altında ister. 671B'lik bir MoE olan DeepSeek-V3.2, her uzman yüklenmek zorunda olduğundan yaklaşık 382 GB gerektirir. MoE modellerinde her zaman aktif değil, toplam parametre sayısını kontrol edin.
8GB'lık bir GPU'da LLM çalıştırabilir miyim?
Evet, rahatlıkla. RTX 4060 gibi 8 GB'lık bir kart, Q4_K_M'de yaklaşık 12B parametreye kadar modelleri çalıştırır. Gemma 4 12B, makul bir bağlam için yer bırakarak yaklaşık 6.8 GB'a sığar. Daha büyük bir şey için ya daha sıkı kuantize edersiniz, ya bağlamı kısa tutarsınız ya da daha büyük bir karta geçersiniz.
RTX 4090 gibi 24GB'lık bir GPU neyi çalıştırabilir?
24 GB'lık bir kart, makul bir bağlam için pay bırakarak Q4_K_M'de yaklaşık 32B'ye kadar yoğun modelleri kaldırır; bu yüzden Qwen3-32B ve Mistral Small 3.2 24B rahat çalışır. Ayrıca 30B'lik ağırlık yükleyen ama seyrek aktivasyon sayesinde 3B'lik bir model hızında üreten Qwen3-30B-A3B MoE modelini de çalıştırır.
Kuantizasyon model kalitesine zarar verir mi?
Q4_K_M ve üzerinde kalite kaybı küçüktür ve özellikle 13B üzeri modellerde gerçek görevlerde çoğunlukla fark edilmez. Aşağı indikçe ve modeller küçüldükçe fark açılır; bu yüzden bir 70B'de Q4 neredeyse bedavayken bir 1.7B'de belirgindir. Belleğiniz varsa Q8 fiilen kayıpsızdır.
MoE modelleri, yoğun modellerden daha az VRAM ister mi?
Hayır, ve bu en yaygın yanlış anlama. Bir Mixture-of-Experts modeli her uzmanı VRAM'de tutmak zorundadır; bu yüzden belleği toplam parametre sayısıyla belirlenir. Aktif parametre rakamı yalnızca çıkarım hızını tanımlar. GLM-5.2, 40B'lik bir model hızında çalışır ama 744B'lik bir modelin belleğine ihtiyaç duyar.
Birleşik bellek, VRAM ile aynı şey midir?
İşlevsel olarak, model yükleme açısından, evet. Apple Silicon ve bazı diğer sistemler, CPU ile GPU arasında tek bir bellek havuzunu paylaşır; bu yüzden 128 GB'lık bir Mac, aksi takdirde birden fazla ayrık GPU gerektirecek modelleri yükleyebilir. Takas ise bant genişliğidir: birleşik bellek genellikle üst düzey bir veri merkezi GPU'sundan daha düşük zirve verim sunar, bu yüzden saniyedeki token sayısı daha düşüktür.
Bir modelin bir kısmını sistem RAM'ine veya CPU'ya aktarabilir miyim?
Evet. llama.cpp ve Ollama gibi motorlar, --n-gpu-layers gibi bir bayrakla bazı katmanları GPU'da, geri kalanını sistem RAM'inde tutmanıza izin verir. Bu, VRAM'iniz için çok büyük bir modeli çalıştırmanızı sağlar, ama CPU'daki her katman üretimi ciddi şekilde yavaşlatır; bu yüzden bunu modeli hızlı değil, mümkün kılmak için kullanın.
Tabloda olmayan bir model için VRAM'i nasıl hesaplarım?
Milyar cinsinden parametre sayısını, kuantizasyonunuza karşılık gelen ağırlık-başına-bit değeriyle çarpın, ardından 8'e bölün. Q4_K_M için yaklaşık 4.5 bit kullanın; bu durumda 40B'lik bir model, ağırlıklar için 40 × 4.5 ÷ 8 = yaklaşık 22.5 GB gerektirir. Gerçek gereksinim için yaklaşık 15-20% ek yük ile KV önbelleğinizi ekleyin.