
Kebutuhan VRAM LLM: Tabel Utama 2026 (Setiap Model, Setiap Kuantisasi)
Inilah angka yang sering mengejutkan semua orang: DeepSeek-V3.2 memiliki 671 miliar parameter, tetapi hanya 37 miliar yang aktif pada token tertentu. Jadi, berapa banyak VRAM yang sebenarnya dibutuhkannya? Semua 671 miliar nilai tersebut, sekitar 382 GB pada kuantisasi Q4. Kebutuhan VRAM LLM jarang mengikuti intuisi, dan kesenjangan antara "parameter aktif" dan "apa yang harus Anda muat" adalah tepat di mana anggaran perangkat keras membengkak. Panduan ini memberikan Anda tabel utama (setiap model open-source besar, setiap tingkat kuantisasi, angka GB, dan GPU yang menjalankannya) serta rumus untuk menghitung ukuran model sendiri dalam sekitar sepuluh detik.
Poin-Poin Penting
- VRAM untuk bobot ≈ parameter × byte-per-param: FP16 = 2,0, Q8 = 1,0, Q5_K_M ≈ 0,68, Q4_K_M ≈ 0,57. Tambahkan cache KV dan overhead ~15-20% di atasnya.
- Model Mixture-of-Experts (DeepSeek, GLM-5.2, Qwen3-235B) harus memuat setiap pakar ke dalam VRAM. "Parameter aktif" memberi Anda kecepatan, bukan penghematan memori.
- Cache KV adalah biaya tersembunyi. Llama 3.3 70B membutuhkan sekitar 2,6 GB cache pada konteks 8K dan sekitar 41 GB pada 128K, di atas bobot model.
- Q4_K_M adalah default yang masuk akal: kualitas hampir penuh dengan footprint sekitar seperempat dari FP16.
- Model 12B seperti Gemma 4 muat di kartu 8 GB pada Q4. Model padat 70B membutuhkan sekitar 40 GB. Model MoE frontier 671B membutuhkan server kecil.
Kebutuhan VRAM LLM per Model: Tabel Utama
Jawaban singkatnya: pada Q4_K_M, model kecil (di bawah 14B) muat di kartu konsumen 8-12 GB, model menengah (24-32B) menginginkan 16-24 GB, model padat 70B membutuhkan sekitar 40 GB, dan model MoE frontier melonjak ke ratusan gigabyte karena setiap pakar harus berada di memori. Berikut adalah gambaran lengkapnya dalam satu tempat. Semua angka adalah memori untuk bobot saja, dihitung dari jumlah parameter setiap model dan diverifikasi silang terhadap kartu model resmi dari Meta AI, Qwen, dan Hugging Face.
| Model | Parameter (total / aktif) | FP16 | Q8 | Q5_K_M | Q4_K_M | Min GPU pada Q4 |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | 0.6B padat | 1.2 GB | 0.6 GB | 0.4 GB | 0.4 GB | Kartu 2 GB apa saja / ponsel |
| Qwen3-4B | 4B padat | 8 GB | 4 GB | 2.7 GB | 2.3 GB | 4 GB (GTX 1650) |
| Qwen3-8B | 8B padat | 16 GB | 8 GB | 5.4 GB | 4.6 GB | 6-8 GB (RTX 3060) |
| Gemma 4 12B | 11.95B padat | 24 GB | 12 GB | 8.1 GB | 6.8 GB | 8 GB (RTX 4060) |
| Qwen3-14B | 14B padat | 28 GB | 14 GB | 9.5 GB | 8.0 GB | 12 GB (RTX 3060 12GB) |
| Mistral Small 3.2 24B | 24B padat | 48 GB | 24 GB | 16.3 GB | 13.7 GB | 16 GB (RTX 4080) |
| Qwen3-30B-A3B | 30B / 3B MoE | 60 GB | 30 GB | 20.4 GB | 17.1 GB | 24 GB (RTX 3090/4090) |
| Qwen3-32B | 32B padat | 64 GB | 32 GB | 21.8 GB | 18.2 GB | 24 GB (RTX 4090) |
| Llama 3.3 70B | 70B padat | 140 GB | 70 GB | 47.6 GB | 39.9 GB | 48 GB (2x 3090 / A6000) |
| Llama 4 Scout | 109B / 17B MoE | 218 GB | 109 GB | 74.1 GB | 62.1 GB | 80 GB (H100 / A100) |
| Qwen3-235B-A22B | 235B / 22B MoE | 470 GB | 235 GB | 160 GB | 134 GB | 2x 80 GB atau Mac 192 GB |
| Llama 4 Maverick | 400B / 17B MoE | 800 GB | 400 GB | 272 GB | 228 GB | 4x 80 GB |
| DeepSeek-V3.2 | 671B / 37B MoE | 1342 GB | 671 GB | 456 GB | 382 GB | Node 8x 80 GB |
| GLM-5.2 | 744B / 40B MoE | 1488 GB | 744 GB | 506 GB | 424 GB | 8x 80 GB+ / multi-node |
Ada dua hal yang bisa dibaca dari tabel ini. Pertama, kuantisasi adalah tuas terbesar yang Anda miliki: turun dari FP16 ke Q4 mengurangi footprint sekitar 4x dengan penurunan kualitas yang hampir tidak terasa. Kedua, baris MoE terlihat mengerikan karena memang demikian. Qwen3-30B-A3B hanya mengaktifkan 3B parameter per token, sehingga berjalan secepat model kecil, tetapi Anda tetap perlu memegang semua 30B di memori agar setiap pakar siap digunakan. Ingin detail per model di balik angka-angka ini? Ulasan mendalam Gemma 4 12B kami dan rangkuman LLM open-source terbaik tahun 2026 membahas benchmark dan lisensi.
"VRAM for the weights at Q4_K_M (GB)"
Tabel data
| "VRAM (GB)" | "Q4_K_M VRAM" |
|---|---|
| "Qwen3-8B" | 4.6 |
| "Gemma 4 12B" | 6.8 |
| "Mistral 24B" | 13.7 |
| "Qwen3-32B" | 18.2 |
| "Llama 3.3 70B" | 39.9 |
| "Llama 4 Scout 109B" | 62.1 |
| "Qwen3-235B" | 134 |
| "DeepSeek-V3.2 671B" | 382 |
Rumus VRAM: Hitung Sendiri Ukuran Model Apa Pun
Untuk mengukur ukuran model apa pun, kalikan jumlah parameternya dengan byte-per-parameter untuk kuantisasi Anda, lalu tambahkan sedikit untuk cache KV dan overhead runtime. Itu saja. Bobot adalah istilah dominan, dan aritmatikanya cukup sederhana untuk dilakukan di belakang amplop.
Persamaan inti untuk bobot:
VRAM_weights (GB) = parameters (billions) × bits_per_weight ÷ 8Nilai bit-per-weight yang Anda butuhkan (ini adalah tingkat efektif untuk file GGUF k-quant, yang membawa sedikit metadata blok di atas kedalaman bit nominal):
| Kuantisasi | Bit per weight | Byte per param | Kualitas |
|---|---|---|---|
| FP16 / BF16 | 16 | 2.0 | Presisi penuh, referensi |
| Q8_0 | 8 | 1.0 | Efektif tanpa loss |
| Q6_K | ~6.5 | 0.81 | Hampir penuh, jarang sepadan dibanding Q5 |
| Q5_K_M | ~5.5 | 0.68 | Sedikit lebih baik dari Q4, sedikit lebih berat |
| Q4_K_M | ~4.5 | 0.57 | Titik optimal bagi kebanyakan orang |
Contoh pengerjaan, Gemma 4 12B pada Q4_K_M: 11,95 × 4,5 ÷ 8 = sekitar 6,7 GB untuk bobot. Ini sejalan dengan kutipan sekitar 6,6 GB dari kartu model resmi dan menjelaskan mengapa model ini muat di kartu 8 GB dengan ruang untuk konteks yang moderat. Jalankan matematika yang sama untuk model 70B pada Q4 dan Anda mendapatkan 70 × 4,5 ÷ 8 = 39,4 GB, yang merupakan alasan mengapa "Anda memerlukan dua kartu 24 GB atau satu kartu 48 GB untuk model 70B" menjadi aturan umum yang selalu diulang orang.
Gambaran lengkapnya menambahkan dua istilah lagi: total VRAM ≈ bobot + cache KV + overhead ~15-20%. Overhead mencakup buffer aktivasi, konteks CUDA, dan fragmentasi memori, dan GPU Anda juga memesan sekitar setengah gigabyte untuk driver, jadi jangan pernah merencanakan untuk menggunakan 100% dari VRAM yang tertera.
Mengapa Cache KV Adalah Angka yang Menjerat Anda
Cache KV menyimpan kunci dan nilai perhatian (attention keys and values) untuk setiap token yang sudah ada dalam konteks, dan tumbuh secara linear dengan panjang konteks. Pada prompt pendek, ini hanyalah kesalahan pembulatan. Dorong menuju konteks panjang dan itu bisa menyaingi atau bahkan melebihi bobot itu sendiri. Ini adalah alasan paling umum mengapa model yang "seharusnya muat" melemparkan error out-of-memory di tengah generasi.
Rumusnya, per token:
KV_cache_per_token (bytes) = num_layers × 2 × kv_dim × precision_bytes
kv_dim = num_kv_heads × head_dim (grouped-query attention shrinks this)Ambil contoh Llama 3.3 70B: 80 lapisan, 8 kepala KV, dimensi kepala 128, jadi kv_dim adalah 1024. Pada FP16 itu berarti 80 × 2 × 1024 × 2 = 327.680 byte per token, sekitar 0,31 MB. Kalikan dengan panjang konteks dan ceritanya menjadi jelas: pada 8K token cache sekitar 2,6 GB, pada 32K sekitar 10 GB, dan pada 128K membengkak menjadi sekitar 41 GB. Angka terakhir itu di atas 40 GB bobot, jadi "model 40 GB" secara diam-diam menjadi masalah 80 GB begitu Anda mengisi jendela konteks.
Dua jalan keluar praktis. Grouped-query attention (yang digunakan setiap model terbaru) sudah memotong kv_dim dibandingkan desain multi-head lama, sehingga model modern jauh lebih ramah di sini daripada Llama 2. Dan sebagian besar mesin inferensi dapat mengkuantisasi cache KV ke 8-bit atau 4-bit, mengurangi ukurannya menjadi setengah atau seperempat dengan biaya kualitas kecil. Jika Anda melayani konteks panjang dalam produksi, perbandingan vLLM vs SGLang membahas backend mana yang mengelola memori ini paling efisien dengan paged attention.
Model MoE: Mengapa "Parameter Aktif" Tidak Menghemat VRAM
Ini adalah jebakan yang paling banyak menghabiskan uang orang. Model Mixture-of-Experts seperti DeepSeek-V3.2 (671B total, 37B aktif, berbagi arsitektur V3) atau GLM-5.2 (744B total, 40B aktif) merutekan setiap token melalui subset kecil dari pakarnya. Pemasaran mengandalkan angka aktif karena menggambarkan kecepatan: Anda hanya membayar komputasi senilai 37B parameter per token, sehingga inferensi cepat untuk ukuran modelnya. Tetapi setiap pakar harus duduk di memori, siap untuk dipilih, yang berarti anggaran VRAM Anda ditentukan oleh jumlah parameter total, bukan yang aktif.
Jadi pembacaan jujur dari tabel di atas: GLM-5.2 berjalan secepat model 40B tetapi menempati memori sebesar model 744B. Itulah sebabnya model open-source frontier ini membutuhkan server 8-GPU atau mesin unified-memory besar, meskipun satu forward pass murah. Qwen3-235B-A22B memiliki bentuk yang sama dalam skala lebih kecil, cepat per token, tetapi berat untuk di-hosting.
Sisi positif MoE muncul pada perangkat keras unified-memory. Mac Studio dengan 512 GB unified memory dapat menampung model 671B pada Q4 dan tetap menjalankannya dengan kecepatan yang dapat digunakan justru karena hanya 37B yang aktif, sehingga permintaan bandwidth memori per token tetap wajar. Jika Anda baru menjalankan ini secara lokal, mulailah dengan panduan penyiapan LLM lokal kami sebelum Anda membelanjakan uang untuk perangkat keras.
Kuantisasi Mana yang Harus Anda Pilih?
Bagi hampir semua orang, Q4_K_M adalah default yang tepat: ia mempertahankan kualitas hampir penuh sambil memotong footprint FP16 sekitar 4x. Naik ke Q5_K_M atau Q8 hanya jika Anda memiliki VRAM sisa dan tugas yang sensitif terhadap kualitas, dan gunakan FP16 hanya ketika Anda melakukan fine-tuning atau benchmarking terhadap referensi. Di bawah Q4, degradasi kualitas menjadi terlihat dengan cepat, jadi Q3 dan lebih rendah adalah upaya terakhir untuk memaksakan model masuk ke kartu yang benar-benar terlalu kecil.
| Jika Anda memiliki | Pilih | Mengapa |
|---|---|---|
| Anggaran VRAM ketat | Q4_K_M | Kualitas terbaik per gigabyte, default komunitas |
| Sedikit ruang napas | Q5_K_M | Sedikit lebih tajam pada prompt sulit, sedikit lebih berat |
| 2x bobot di VRAM | Q8_0 | Efektif tanpa loss, hanya sepadan jika muat dengan mudah |
| Pekerjaan fine-tuning atau eval | FP16 / BF16 | Presisi penuh, titik referensi yang jujur |
Satu catatan: kualitas kuantisasi tidak identik di seluruh model. Model yang sangat kecil (di bawah 4B) merasakan dampak Q4 lebih daripada model besar, karena mereka memiliki redundansi yang lebih sedikit untuk dikorbankan. Pada model 70B, perbedaan Q4 versus Q8 sulit dibedakan pada sebagian besar tugas. Pada model 1.7B, kesenjangan itu nyata.
GPU Apa yang Sebenarnya Anda Butuhkan?
Cocokkan kolom Q4 dari tabel utama dengan kartu yang memiliki sedikit ruang napas untuk cache KV. Berikut adalah pemetaan praktis dari perangkat keras konsumen beranggaran terbatas hingga pusat data, dengan tingkatan model yang masing-masing kelas jalankan dengan nyaman pada Q4.
| Perangkat Keras | VRAM | Berjalan nyaman pada Q4 |
|---|---|---|
| RTX 4060 / 3060 (8-12 GB) | 8-12 GB | Hingga ~14B padat (Gemma 4 12B, Qwen3-14B) |
| RTX 4080 / 4070 Ti Super (16 GB) | 16 GB | Hingga ~24B padat (Mistral Small 3.2 24B) |
| RTX 4090 / 3090 (24 GB) | 24 GB | Hingga ~32B padat, atau Qwen3-30B-A3B |
| RTX 6000 Ada / A6000 (48 GB) | 48 GB | 70B padat (Llama 3.3 70B) |
| H100 / A100 (80 GB) | 80 GB | ~109B MoE (Llama 4 Scout) |
| Node 8x H100 | 640 GB | 671-744B MoE frontier (DeepSeek, GLM-5.2) |
| Mac Studio M-series (unified) | 64-512 GB | Skala dengan RAM; 512 GB menampung MoE 671B pada Q4 |
Apple Silicon pantas mendapat sebutan khusus karena unified memory mengubah perhitungan. Mac tidak membagi VRAM dari RAM sistem, sehingga mesin M-series 128 GB dapat memuat model yang biasanya membutuhkan beberapa GPU diskrit, menukar throughput puncak dengan kemampuan untuk menampung bobot besar pada satu desktop. Untuk backend yang memeras performa maksimal dari kartu-kartu ini, rangkuman kami tentang alat terbaik untuk menjalankan LLM secara lokal menguji perbedaan kecepatan dunia nyata.
Bagaimana Kami Mengukur VRAM untuk Implementasi Klien
Di Techsy, kami sering menerapkan model open-source untuk klien sehingga pengukuran VRAM adalah percakapan pertama, sebelum pemilihan model, sebelum prompt, sebelum apa pun. Metode kami sengaja membosankan, karena mode kegagalan (OOM di produksi di bawah beban konteks nyata) mahal. Berikut adalah proses yang benar-benar kami jalankan.
Kami mulai dari matematika tabel, lalu mengukur. Setelah memuat model, kami memeriksa footprint residen nyata daripada mempercayai estimasi:
# What the GPU is actually holding
nvidia-smi --query-gpu=memory.used,memory.total --format=csv
# For an Ollama-served model, its real memory + how much sits on GPU vs CPU
ollama ps
# llama.cpp: control the split explicitly and cap context to bound KV cache
llama-server -m model-Q4_K_M.gguf --n-gpu-layers 999 --ctx-size 8192Pelajaran yang terus berulang: tim mengukur ukuran untuk bobot dan melupakan cache KV, kemudian bertanya-tanya mengapa model yang dimuat dengan baik mati setelah tiga permintaan panjang dalam demo. Kami mengukur ukuran untuk bobot plus cache KV pada konteks maksimum yang benar-benar akan digunakan aplikasi, plus ruang napas, dan kami membatasi --ctx-size sehingga permintaan yang tidak terkendali tidak dapat membuat kotak OOM. Untuk apa pun yang面向 pelanggan, kami lebih memilih menjalankan model 32B terkuantisasi yang tidak pernah jatuh daripada model 70B FP16 yang OOM di bawah beban.
Jika Anda menimbang apakah akan meng-host sendiri model open-source atau tetap menggunakan API yang dihosting, pertukaran itu (biaya perangkat keras dan beban operasional versus harga per-token dan kontrol) adalah tepat apa yang ditim kami cakup selama engagement integrasi AI. Jika akan membantu memiliki seseorang yang menjalankan angka-angka terhadap beban kerja aktual Anda, dapatkan konsultasi gratis dan kami akan mengukurnya bersama Anda.
Tentang Penulis
Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya mengirimkan agen AI, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang tumpukan alat LLM yang benar-benar digunakan tim Techsy dalam produksi.
Kredensial: Co-Founder, Techsy.io, University of Birmingham. Terhubung di LinkedIn.
Pertanyaan yang Sering Diajukan
Berapa banyak VRAM yang saya butuhkan untuk menjalankan model 70B?
Model padat 70B seperti Llama 3.3 70B membutuhkan sekitar 40 GB VRAM untuk bobot pada Q4_K_M, jadi rencanakan untuk kartu 48 GB (RTX 6000 Ada) atau dua kartu 24 GB. Tambahkan beberapa gigabyte lagi untuk cache KV jika Anda menggunakan konteks panjang, yang mendorong persyaratan praktis menuju 48 GB atau lebih.
Berapa banyak VRAM yang dibutuhkan Llama, Qwen, atau DeepSeek?
Itu sepenuhnya tergantung pada variannya. Llama 4 Scout membutuhkan sekitar 62 GB pada Q4, Qwen3-32B sekitar 18 GB, dan Qwen3-8B di bawah 5 GB. DeepSeek-V3.2, sebuah MoE 671B, membutuhkan sekitar 382 GB karena setiap pakar harus dimuat. Selalu periksa jumlah parameter total, bukan yang aktif, untuk model MoE.
Bisakah saya menjalankan LLM pada GPU 8GB?
Ya, dengan nyaman. Kartu 8 GB seperti RTX 4060 menjalankan model hingga sekitar 12B parameter pada Q4_K_M. Gemma 4 12B muat dalam sekitar 6,8 GB, menyisakan ruang untuk konteks yang moderat. Untuk apa pun yang lebih besar, Anda harus mengkuantisasi lebih keras, menjaga konteks tetap pendek, atau beralih ke kartu yang lebih besar.
Apa yang bisa dijalankan oleh GPU 24GB seperti RTX 4090?
Kartu 24 GB menangani model padat hingga sekitar 32B pada Q4_K_M dengan ruang napas untuk konteks yang wajar, jadi Qwen3-32B dan Mistral Small 3.2 24B berjalan dengan nyaman. Ini juga menjalankan MoE Qwen3-30B-A3B, yang memuat 30B bobot tetapi menghasilkan output secepat model 3B berkat aktivasi sparse.
Apakah kuantisasi merusak kualitas model?
Pada Q4_K_M dan di atasnya, kehilangan kualitas kecil dan sering kali tidak terlihat pada tugas nyata, terutama untuk model di atas 13B. Kesenjangan melebar saat Anda turun lebih rendah dan saat model menjadi lebih kecil, jadi Q4 pada model 70B hampir gratis sementara Q4 pada model 1.7B terlihat dampaknya. Q8 secara efektif tanpa loss jika Anda memiliki memori.
Apakah model MoE membutuhkan VRAM lebih sedikit daripada model padat?
Tidak, dan ini adalah kesalahpahaman paling umum. Model Mixture-of-Experts harus memegang setiap pakar di VRAM, sehingga memorinya ditentukan oleh jumlah parameter total. Angka parameter aktif hanya menggambarkan kecepatan inferensi. GLM-5.2 berjalan secepat model 40B tetapi membutuhkan memori sebesar model 744B.
Apakah unified memory sama dengan VRAM?
Secara fungsional, untuk memuat model, ya. Apple Silicon dan beberapa sistem lain berbagi satu pool memori antara CPU dan GPU, sehingga Mac 128 GB dapat memuat model yang biasanya membutuhkan beberapa GPU diskrit. Pertukarannya adalah bandwidth: unified memory biasanya memberikan throughput puncak lebih rendah daripada GPU pusat data kelas atas, sehingga token-per-detik lebih rendah.
Bisakah saya offload sebagian model ke RAM sistem atau CPU?
Ya. Mesin seperti llama.cpp dan Ollama memungkinkan Anda menjaga beberapa lapisan di GPU dan sisanya di RAM sistem dengan flag seperti --n-gpu-layers. Ini memungkinkan Anda menjalankan model yang terlalu besar untuk VRAM Anda, tetapi setiap lapisan di CPU memperlambat generasi secara tajam, jadi gunakan ini untuk membuat model mungkin dijalankan, bukan cepat.
Bagaimana cara menghitung VRAM untuk model yang tidak ada di tabel?
Kalikan jumlah parameter dalam miliaran dengan bits-per-weight untuk kuantisasi Anda, lalu bagi dengan 8. Untuk Q4_K_M gunakan sekitar 4,5 bit, jadi model 40B membutuhkan 40 × 4,5 ÷ 8 = sekitar 22,5 GB untuk bobot. Tambahkan overhead sekitar 15-20% plus cache KV Anda untuk persyaratan nyata.