ai-machine-learning

LLM VRAM Gereksinimleri: 2026 Ana Tablosu (Her Model, Her Kuantizasyon)

Yazan Mert Batur
Güncellendi Jul 17, 2026
10 okuma
LLM VRAM Gereksinimleri: 2026 Ana Tablosu (Her Model, Her Kuantizasyon)

LLM VRAM Gereksinimleri: 2026 Ana Tablosu (Her Model, Her Kuantizasyon)

Herkesi şaşırtan sayı şu: DeepSeek-V3.2'nin 671 milyar parametresi var, ama bir token için yalnızca 37 milyarı devreye giriyor. Peki gerçekte ne kadar VRAM gerekiyor? 671 milyarın tamamı, Q4'te yaklaşık 382 GB. LLM VRAM gereksinimleri sezgiye pek uymuyor; "aktif parametreler" ile "yüklemeniz gereken şey" arasındaki fark, donanım bütçelerinin tam olarak patladığı nokta. Bu rehber size ana tabloyu sunuyor: her önemli açık model, her kuantizasyon seviyesi, GB rakamı ve onu çalıştıran GPU; üstüne herhangi bir modeli yaklaşık on saniyede kendinizin hesaplayabileceği formül.

Temel Çıkarımlar

  • Ağırlıklar için VRAM ≈ parametre × bayt-başına-parametre: FP16 = 2.0, Q8 = 1.0, Q5_K_M ≈ 0.68, Q4_K_M ≈ 0.57. Üstüne KV önbelleği ve ~15-20% ek yük ekleyin.
  • Mixture-of-Experts modelleri (DeepSeek, GLM-5.2, Qwen3-235B) her uzmanı VRAM'e yüklemek zorunda. "Aktif parametreler" size hız kazandırır, bellek değil.
  • KV önbelleği gizli maliyettir. Llama 3.3 70B, 8K bağlamda yaklaşık 2.6 GB önbellek, 128K'da ise ağırlıkların üstüne yaklaşık 41 GB gerektirir.
  • Q4_K_M makul varsayılandır: FP16 ayak izinin kabaca dörtte biriyle tam kaliteye yakın sonuç verir.
  • Gemma 4 gibi 12B'lik bir model, Q4'te 8 GB'lık bir karta sığar. 70B'lik yoğun bir model yaklaşık 40 GB gerektirir. 671B'lik bir uç MoE modeli ise küçük bir sunucu ister.

Modele Göre LLM VRAM Gereksinimleri: Ana Tablo

Kısa cevap şu: Q4_K_M'de küçük modeller (14B altı) tüketici sınıfı 8-12 GB kartlara sığar, orta boy modeller (24-32B) 16-24 GB ister, 70B'lik yoğun bir model yaklaşık 40 GB gerektirir ve uç MoE modelleri, her uzman bellekte hazır bulunmak zorunda olduğundan yüzlerce gigabayta sıçrar. İşte tüm tablo tek bir yerde. Rakamların tamamı yalnızca ağırlıklar için gereken bellek olup her modelin parametre sayısından hesaplanmış ve Meta AI, Qwen ile Hugging Face'in resmi model kartlarıyla çapraz kontrol edilmiştir.

ModelParametre (toplam / aktif)FP16Q8Q5_K_MQ4_K_MQ4'te Minimum GPU
Qwen3-0.6B0.6B yoğun1.2 GB0.6 GB0.4 GB0.4 GBHerhangi bir 2 GB kart / telefon
Qwen3-4B4B yoğun8 GB4 GB2.7 GB2.3 GB4 GB (GTX 1650)
Qwen3-8B8B yoğun16 GB8 GB5.4 GB4.6 GB6-8 GB (RTX 3060)
Gemma 4 12B11.95B yoğun24 GB12 GB8.1 GB6.8 GB8 GB (RTX 4060)
Qwen3-14B14B yoğun28 GB14 GB9.5 GB8.0 GB12 GB (RTX 3060 12GB)
Mistral Small 3.2 24B24B yoğun48 GB24 GB16.3 GB13.7 GB16 GB (RTX 4080)
Qwen3-30B-A3B30B / 3B MoE60 GB30 GB20.4 GB17.1 GB24 GB (RTX 3090/4090)
Qwen3-32B32B yoğun64 GB32 GB21.8 GB18.2 GB24 GB (RTX 4090)
Llama 3.3 70B70B yoğun140 GB70 GB47.6 GB39.9 GB48 GB (2x 3090 / A6000)
Llama 4 Scout109B / 17B MoE218 GB109 GB74.1 GB62.1 GB80 GB (H100 / A100)
Qwen3-235B-A22B235B / 22B MoE470 GB235 GB160 GB134 GB2x 80 GB veya 192 GB Mac
Llama 4 Maverick400B / 17B MoE800 GB400 GB272 GB228 GB4x 80 GB
DeepSeek-V3.2671B / 37B MoE1342 GB671 GB456 GB382 GB8x 80 GB düğüm
GLM-5.2744B / 40B MoE1488 GB744 GB506 GB424 GB8x 80 GB+ / çoklu düğüm

Bu tablodan iki şey çıkarılabilir. Birincisi, elinizdeki en büyük kaldıraç kuantizasyon: FP16'dan Q4'e düşmek, ayak izini kabaca 4 kat azaltır ve kalite kaybı zar zor fark edilir. İkincisi, MoE satırları acımasız görünüyor çünkü gerçekten öyleler. Qwen3-30B-A3B, token başına yalnızca 3B parametre aktive ediyor; bu yüzden küçük bir model hızında çalışıyor, ama her uzmanı hazır tutmak için yine de 30B'nin tamamını bellekte tutmanız gerekiyor. Bu rakamların ardındaki model bazlı detayları mı istiyorsunuz? Gemma 4 12B derinlemesine incelememiz ve 2026'nın en iyi açık kaynaklı LLM'leri derlememiz, benchmark'ları ve lisansları ele alıyor.

"VRAM for the weights at Q4_K_M (GB)"

Veri tablosu
"VRAM for the weights at Q4_K_M (GB)"
"VRAM (GB)""Q4_K_M VRAM"
"Qwen3-8B"4.6
"Gemma 4 12B"6.8
"Mistral 24B"13.7
"Qwen3-32B"18.2
"Llama 3.3 70B"39.9
"Llama 4 Scout 109B"62.1
"Qwen3-235B"134
"DeepSeek-V3.2 671B"382

VRAM Formülü: Herhangi Bir Modeli Kendiniz Hesaplayın

Herhangi bir modeli boyutlandırmak için parametre sayısını kuantizasyonunuza karşılık gelen bayt-başına-parametre değeriyle çarpın, ardından KV önbelleği ve çalışma zamanı ek yükü için biraz pay ekleyin. Hepsi bu kadar. Baskın terim ağırlıklardır ve aritmetik bir peçetenin arkasına yazılabilecek kadar basittir.

Ağırlıklar için temel denklem:

text
VRAM_weights (GB) = parameters (billions) × bits_per_weight ÷ 8

İhtiyacınız olan bayt-başına-bit değerleri (bunlar, nominal bit derinliğinin üzerine biraz blok metadata'sı taşıyan GGUF k-quant dosyaları için geçerli olan etkin oranlardır):

QuantizationBits per weightBytes per paramQuality
FP16 / BF16162.0Tam hassasiyet, referans nokta
Q8_081.0Fiilen kayıpsız
Q6_K~6.50.81Tama yakın, Q5'e karşı nadiren değer
Q5_K_M~5.50.68Q4'ten biraz daha iyi, biraz daha ağır
Q4_K_M~4.50.57Çoğu kişi için ideal nokta

Uygulamalı örnek, Gemma 4 12B için Q4_K_M'de: 11.95 × 4.5 ÷ 8 = ağırlıklar için yaklaşık 6.7 GB. Bu, resmi model kartının belirttiği yaklaşık 6.6 GB ile örtüşüyor ve modelin, makul bir bağlam için yer bırakarak 8 GB'lık bir karta neden sığdığını açıklıyor. Aynı hesabı Q4'te bir 70B model için yapın: 70 × 4.5 ÷ 8 = 39.4 GB çıkar; herkesin tekrarladığı "70B için iki adet 24 GB kart ya da tek bir 48 GB kart gerekir" kuralının nedeni de bu.

Tam tablo iki terim daha ekliyor: toplam VRAM ≈ ağırlıklar + KV önbelleği + ~15-20% ek yük. Ek yük; aktivasyon tamponlarını, CUDA bağlamını ve bellek parçalanmasını kapsar; GPU'nuz ayrıca sürücü için yarım gigabayt kadar bir pay ayırır, bu yüzden asla etiketteki VRAM'in 100%'ünü kullanmayı planlamayın.

KV Önbelleği Neden Sizi Gafil Avlayan Sayı?

KV önbelleği, bağlamda hâlihazırda bulunan her token için dikkat (attention) anahtarlarını ve değerlerini saklar ve bağlam uzunluğuyla doğrusal olarak büyür. Kısa istemlerde göz ardı edilebilecek kadar küçüktür. Uzun bir bağlama doğru ilerledikçe ağırlıklarla yarışabilir, hatta onları geçebilir. "Sığması gereken" bir modelin üretim sırasında bellek yetersizliği (out-of-memory) hatası vermesinin en yaygın tek nedeni budur.

Token başına formül:

text
KV_cache_per_token (bytes) = num_layers × 2 × kv_dim × precision_bytes
kv_dim = num_kv_heads × head_dim   (grouped-query attention shrinks this)

Llama 3.3 70B'yi ele alalım: 80 katman, 8 KV başlığı, 128'lik başlık boyutu; yani kv_dim 1024. FP16'da bu, 80 × 2 × 1024 × 2 = token başına 327,680 bayt, yaklaşık 0.31 MB eder. Bağlam uzunluğuyla çarpın, hikâye kendini yazıyor: 8K token'da önbellek yaklaşık 2.6 GB, 32K'da yaklaşık 10 GB, 128K'da ise yaklaşık 41 GB'a şişiyor. Bu son rakam, 40 GB'lık ağırlıkların üstüne ekleniyor; yani pencereyi doldurduğunuz anda "40 GB'lık bir model" sessizce 80 GB'lık bir soruna dönüşüyor.

İki pratik çıkış yolu var. Grouped-query attention (son dönem her model bunu kullanıyor), eski çoklu-başlık tasarımına kıyasla kv_dim'i zaten büyük ölçüde küçültüyor; bu yüzden modern modeller bu konuda Llama 2'den çok daha cömert. Ayrıca çoğu çıkarım motoru, KV önbelleğini 8-bit veya 4-bit'e kuantize edebiliyor; bu da küçük bir kalite bedeliyle boyutu yarıya veya çeyreğe indiriyor. Üretimde uzun bağlamlar sunuyorsanız, vLLM vs SGLang karşılaştırmamız hangi backend'in bu belleği paged attention ile en verimli şekilde yönettiğini ele alıyor.

MoE Modelleri: "Aktif Parametreler" Neden VRAM Kurtarmıyor?

İnsanlara en çok paraya mal olan tuzak bu. DeepSeek-V3.2 (671B toplam, 37B aktif, V3 mimarisini paylaşıyor) veya GLM-5.2 (744B toplam, 40B aktif) gibi bir Mixture-of-Experts modeli, her token'ı uzmanlarının küçük bir alt kümesinden geçirir. Pazarlama dili aktif sayıya dayanıyor çünkü bu rakam hızı tanımlar: token başına yalnızca 37B parametrelik hesaplama ödersiniz, bu yüzden çıkarım, modelin boyutuna göre hızlıdır. Ama her uzman, seçilmeye hazır şekilde bellekte durmak zorundadır; bu da VRAM bütçenizin aktif değil toplam parametre sayısıyla belirlendiği anlamına gelir.

Yukarıdaki tablonun dürüst okuması şu: GLM-5.2, 40B'lik bir model hızında çalışır ama 744B'lik bir modelin belleğini kaplar. Tek bir ileri geçiş ucuz olsa da bu uç açık modellerin 8 GPU'lu bir sunucuya veya büyük, birleşik bellekli bir makineye ihtiyaç duymasının nedeni bu. Qwen3-235B-A22B, daha küçük ölçekte aynı şekle sahip: token başına hızlı, barındırması ağır.

MoE'nin avantajı birleşik bellekli donanımda ortaya çıkıyor. 512 GB birleşik belleğe sahip bir Mac Studio, 671B'lik bir modeli Q4'te tutabilir ve yine de kullanılabilir hızlarda çalıştırabilir; çünkü yalnızca 37B aktive olur ve token başına bellek bant genişliği talebi makul kalır. Bunları yerel olarak çalıştırmakta yeniyseniz, donanıma para harcamadan önce yerel LLM kurulum rehberimizle başlayın.

Hangi Kuantizasyonu Seçmelisiniz?

Neredeyse herkes için doğru varsayılan Q4_K_M'dir: FP16 ayak izini yaklaşık 4 kat azaltırken tam kaliteye yakın kalır. Yalnızca elinizde fazladan VRAM varsa ve kaliteye duyarlı bir iş yapıyorsanız Q5_K_M veya Q8'e geçin; FP16'ya ise yalnızca ince ayar yaparken veya bir referansa karşı benchmark yaparken başvurun. Q4'ün altında kalite kaybı hızla belirginleşir, bu yüzden Q3 ve altı, gerçekten çok küçük bir karta modeli sıkıştırmak için son çare olarak kalır.

Elinizde şu varsaSeçinNeden
Sınırlı bir VRAM bütçesiQ4_K_MGigabayt başına en iyi kalite, topluluk varsayılanı
Biraz payQ5_K_MZor istemlerde biraz daha keskin, hafifçe daha ağır
VRAM'de ağırlıkların 2 katı yerQ8_0Fiilen kayıpsız, yalnızca rahatça sığıyorsa değer
Bir ince ayar veya değerlendirme işiFP16 / BF16Tam hassasiyet, dürüst referans noktası

Bir uyarı: kuantizasyon kalitesi modeller arasında aynı değildir. Çok küçük modeller (4B altı), yedekleri daha az olduğundan Q4'ü büyük modellerden daha fazla hisseder. 70B'lik bir modelde Q4 ile Q8 arasındaki fark çoğu görevde ayırt edilemez. 1.7B'lik bir modelde ise fark gerçektir.

Gerçekte Hangi GPU'ya İhtiyacınız Var?

Ana tablodaki Q4 sütununu, KV önbelleği için biraz pay bırakan bir kartla eşleştirin. İşte bütçe dostu tüketici donanımından veri merkezine kadar pratik eşleştirme; her sınıfın Q4'te rahatça çalıştırdığı model kademesiyle birlikte.

DonanımVRAMQ4'te Rahatça Çalıştırır
RTX 4060 / 3060 (8-12 GB)8-12 GB~14B yoğun modele kadar (Gemma 4 12B, Qwen3-14B)
RTX 4080 / 4070 Ti Super (16 GB)16 GB~24B yoğun modele kadar (Mistral Small 3.2 24B)
RTX 4090 / 3090 (24 GB)24 GB~32B yoğun modele kadar veya Qwen3-30B-A3B
RTX 6000 Ada / A6000 (48 GB)48 GB70B yoğun model (Llama 3.3 70B)
H100 / A100 (80 GB)80 GB~109B MoE (Llama 4 Scout)
8x H100 düğüm640 GB671-744B uç MoE (DeepSeek, GLM-5.2)
Mac Studio M serisi (birleşik)64-512 GBRAM ile ölçeklenir; 512 GB, Q4'te 671B'lik bir MoE'yi tutar

Apple Silicon özel bir not hak ediyor çünkü birleşik bellek hesabı değiştiriyor. Bir Mac, VRAM'i sistem RAM'inden ayırmaz; bu yüzden 128 GB'lık bir M serisi makine, normalde birden fazla ayrık GPU gerektirecek modelleri yükleyebilir ve zirve verim kapasitesini, devasa ağırlıkları tek bir masaüstünde barındırma yeteneğiyle takas eder. Bu kartların her birinden en fazlasını sıkıp çıkaran backend'ler için, LLM'leri yerel çalıştırmak için en iyi araçlar derlememiz gerçek dünya hız farklarını benchmark ediyor.

Müşteri Dağıtımları İçin VRAM'i Nasıl Boyutlandırıyoruz

Techsy'de müşteriler için açık modelleri yeterince sık dağıtıyoruz ki VRAM boyutlandırması, model seçiminden önce, istemlerden önce, her şeyden önce gelen ilk konuşma haline geldi. Yöntemimiz bilerek sıkıcı; çünkü hata modu (üretimde gerçek bağlam yükü altında bir OOM) pahalıya mal oluyor. İşte gerçekten uyguladığımız süreç.

Tablo matematiğiyle başlıyoruz, sonra ölçüyoruz. Bir modeli yükledikten sonra tahmine güvenmek yerine gerçek yerleşik ayak izini kontrol ediyoruz:

bash
# What the GPU is actually holding
nvidia-smi --query-gpu=memory.used,memory.total --format=csv

# For an Ollama-served model, its real memory + how much sits on GPU vs CPU
ollama ps

# llama.cpp: control the split explicitly and cap context to bound KV cache
llama-server -m model-Q4_K_M.gguf --n-gpu-layers 999 --ctx-size 8192

Tekrar eden ders şu: ekipler yalnızca ağırlıklar için boyutlandırıyor, KV önbelleğini unutuyor, sonra sorunsuz yüklenen bir modelin bir demoda üç uzun istekten sonra neden çöktüğüne şaşırıyor. Biz ağırlıkları, uygulamanın gerçekten kullanacağı maksimum bağlamdaki KV önbelleğiyle ve üstüne bir pay ekleyerek boyutlandırıyoruz; ayrıca kaçak bir isteğin makineyi OOM'a sürüklememesi için --ctx-size'ı sınırlıyoruz. Müşteriyle doğrudan temas eden herhangi bir şey için, yük altında OOM veren bir FP16 70B yerine hiç çökmeyen kuantize bir 32B çalıştırmayı tercih ederiz.

Açık bir modeli kendiniz mi barındırmalısınız yoksa barındırılan bir API'de mi kalmalısınız diye tartıyorsanız, bu takas (donanım maliyeti ve operasyon yükü karşısında token başına fiyatlandırma ve kontrol) tam olarak ekibimizin bir yapay zeka entegrasyon projesi sırasında kapsamını belirlediği konu. Rakamları gerçek iş yükünüze göre birinin hesaplaması işinize yarayacaksa, ücretsiz danışmanlık alın ve birlikte boyutlandıralım.

Yazar Hakkında

Mert Batur, B2B müşterileri için yapay zeka ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları geliştiren Techsy.io'nun Kurucu Ortağı. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor.

Yetkinlikler: Kurucu Ortak, Techsy.io. LinkedIn üzerinden bağlantı kurun.

Sıkça Sorulan Sorular

70B'lik bir modeli çalıştırmak için ne kadar VRAM gerekir?

Llama 3.3 70B gibi 70B'lik yoğun bir model, Q4_K_M'de ağırlıklar için yaklaşık 40 GB VRAM gerektirir; bu yüzden 48 GB'lık bir kart (RTX 6000 Ada) veya iki adet 24 GB kart planlayın. Uzun bir bağlam kullanıyorsanız KV önbelleği için birkaç gigabayt daha ekleyin; bu da pratik gereksinimi 48 GB veya üzerine iter.

Llama, Qwen veya DeepSeek ne kadar VRAM ister?

Bu tamamen varyanta bağlı. Llama 4 Scout, Q4'te yaklaşık 62 GB; Qwen3-32B yaklaşık 18 GB; Qwen3-8B ise 5 GB'ın altında ister. 671B'lik bir MoE olan DeepSeek-V3.2, her uzman yüklenmek zorunda olduğundan yaklaşık 382 GB gerektirir. MoE modellerinde her zaman aktif değil, toplam parametre sayısını kontrol edin.

8GB'lık bir GPU'da LLM çalıştırabilir miyim?

Evet, rahatlıkla. RTX 4060 gibi 8 GB'lık bir kart, Q4_K_M'de yaklaşık 12B parametreye kadar modelleri çalıştırır. Gemma 4 12B, makul bir bağlam için yer bırakarak yaklaşık 6.8 GB'a sığar. Daha büyük bir şey için ya daha sıkı kuantize edersiniz, ya bağlamı kısa tutarsınız ya da daha büyük bir karta geçersiniz.

RTX 4090 gibi 24GB'lık bir GPU neyi çalıştırabilir?

24 GB'lık bir kart, makul bir bağlam için pay bırakarak Q4_K_M'de yaklaşık 32B'ye kadar yoğun modelleri kaldırır; bu yüzden Qwen3-32B ve Mistral Small 3.2 24B rahat çalışır. Ayrıca 30B'lik ağırlık yükleyen ama seyrek aktivasyon sayesinde 3B'lik bir model hızında üreten Qwen3-30B-A3B MoE modelini de çalıştırır.

Kuantizasyon model kalitesine zarar verir mi?

Q4_K_M ve üzerinde kalite kaybı küçüktür ve özellikle 13B üzeri modellerde gerçek görevlerde çoğunlukla fark edilmez. Aşağı indikçe ve modeller küçüldükçe fark açılır; bu yüzden bir 70B'de Q4 neredeyse bedavayken bir 1.7B'de belirgindir. Belleğiniz varsa Q8 fiilen kayıpsızdır.

MoE modelleri, yoğun modellerden daha az VRAM ister mi?

Hayır, ve bu en yaygın yanlış anlama. Bir Mixture-of-Experts modeli her uzmanı VRAM'de tutmak zorundadır; bu yüzden belleği toplam parametre sayısıyla belirlenir. Aktif parametre rakamı yalnızca çıkarım hızını tanımlar. GLM-5.2, 40B'lik bir model hızında çalışır ama 744B'lik bir modelin belleğine ihtiyaç duyar.

Birleşik bellek, VRAM ile aynı şey midir?

İşlevsel olarak, model yükleme açısından, evet. Apple Silicon ve bazı diğer sistemler, CPU ile GPU arasında tek bir bellek havuzunu paylaşır; bu yüzden 128 GB'lık bir Mac, aksi takdirde birden fazla ayrık GPU gerektirecek modelleri yükleyebilir. Takas ise bant genişliğidir: birleşik bellek genellikle üst düzey bir veri merkezi GPU'sundan daha düşük zirve verim sunar, bu yüzden saniyedeki token sayısı daha düşüktür.

Bir modelin bir kısmını sistem RAM'ine veya CPU'ya aktarabilir miyim?

Evet. llama.cpp ve Ollama gibi motorlar, --n-gpu-layers gibi bir bayrakla bazı katmanları GPU'da, geri kalanını sistem RAM'inde tutmanıza izin verir. Bu, VRAM'iniz için çok büyük bir modeli çalıştırmanızı sağlar, ama CPU'daki her katman üretimi ciddi şekilde yavaşlatır; bu yüzden bunu modeli hızlı değil, mümkün kılmak için kullanın.

Tabloda olmayan bir model için VRAM'i nasıl hesaplarım?

Milyar cinsinden parametre sayısını, kuantizasyonunuza karşılık gelen ağırlık-başına-bit değeriyle çarpın, ardından 8'e bölün. Q4_K_M için yaklaşık 4.5 bit kullanın; bu durumda 40B'lik bir model, ağırlıklar için 40 × 4.5 ÷ 8 = yaklaşık 22.5 GB gerektirir. Gerçek gereksinim için yaklaşık 15-20% ek yük ile KV önbelleğinizi ekleyin.

Etiketler

llm vram gereksinimlerigpu bellekkuantizasyonkv cacheyerel llm

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.