
Gemma 4 12B: Benchmark, Kebutuhan VRAM & Cara Menjalankannya Secara Lokal
Google DeepMind merilis Gemma 4 12B pada 3 Juni 2026. Tiga hari kemudian, angka yang terus diulang semua orang adalah skor MMLU Pro: 77,2%. Itu mengalahkan Gemma 3 27B tahun lalu, yang hanya mencetak 67,6% di tes yang sama. Model 12 miliar parameter mengungguli flagship 27B? Dengan kurang dari setengah memori? Ya. Dan lisensinya juga berubah. Gemma 4 dirilis di bawah Apache 2.0, jadi penggunaan komersial aman, tanpa tanda bintang. Model ini membawa context window 256K token dan berjalan di sekitar 6,6 GB VRAM setelah dikuantisasi. Bagian terakhir itu adalah seluruh ceritanya bagi kebanyakan dari kita: model ini muat di GPU kelas menengah.
Poin Penting
- Gemma 4 12B (rilis 3 Juni 2026) mencetak skor 77,2% di MMLU Pro, mengalahkan Gemma 3 27B tahun lalu (67,6%).
- Berjalan di ~6,6 GB VRAM pada Q4_K_M, muat di GPU 8GB; ~16GB memberi ruang yang nyaman.
- Lisensi Apache 2.0 (penggunaan komersial OK), konteks 256K, input audio + gambar native, arsitektur tanpa encoder.
- Satu perintah untuk menjalankannya:
ollama run gemma4:12b(unduhan 7,6 GB).
Apa Itu Gemma 4 12B?
Gemma 4 12B adalah model open-weights 12 miliar parameter dari Google DeepMind, dirilis 3 Juni 2026 di bawah lisensi Apache 2.0. Ini adalah model multimodal terpadu tanpa encoder: teks, gambar, dan audio native masuk, teks keluar. Model ini membawa context window 256K token dan mendukung 140 bahasa.
Varian instruction-tuned yang akan Anda jalankan bernama gemma-4-12B-it ("it" singkatan dari instruction-tuned, versi yang siap untuk chat). Total parameternya 11,95B, jadi "12B" itu pembulatan ke atas sedikit. Data pelatihannya hingga cutoff Januari 2025.
Ini bagian yang membuatnya menarik: Gemma 4 12B adalah Gemma ukuran menengah pertama dengan input audio native. Tidak ada encoder audio terpisah yang ditempelkan. Waveform mentah diproyeksikan langsung ke dalam model. Sama untuk gambar. Pilihan desain itulah yang membuatnya cukup kecil untuk berjalan di satu kartu konsumen, dan kita akan bahas alasannya sebentar lagi.
Ingin gambaran besarnya dulu? Panduan kami tentang menjalankan model open di mesin sendiri mencakup dasar-dasar setup jika Anda baru di dunia LLM lokal. Posting peluncuran resmi Google punya pengumuman lengkapnya.
Spesifikasi Gemma 4 12B Sekilas
Semua terverifikasi, dalam satu tabel. Tanpa tebakan.
| Spesifikasi | Nilai |
|---|---|
| Nama lengkap | Gemma 4 12B (gemma-4-12B-it) |
| Parameter | 11,95B (~12B) |
| Lisensi | Apache 2.0 (penggunaan komersial OK) |
| Context window | 256K token |
| Modalitas | Teks + gambar + audio native masuk, teks keluar |
| Arsitektur | Terpadu tanpa encoder, 48 layer, atensi hibrida |
| Bahasa | 140 |
| Cutoff pelatihan | Januari 2025 |
| Tag Ollama | gemma4:12b (unduhan 7,6 GB) |
| Tag Apple Silicon | gemma4:12b-mlx |
| Sampling yang direkomendasikan | temperature 1.0, top_p 0.95, top_k 64 |
Satu catatan soal sampling: tetap gunakan temperature=1.0, top_p=0.95, top_k=64 yang direkomendasikan kecuali Anda punya alasan khusus. Model Gemma berperilaku aneh di temperature rendah, jadi jangan refleks menurunkannya ke 0.2 seperti yang mungkin Anda lakukan dengan model lain.
Bagaimana Arsitektur Tanpa Encoder Bekerja?
Tanpa encoder berarti tidak ada model terpisah yang mengonversi gambar atau audio sebelum mencapai language model. Patch visual dan waveform audio mentah diproyeksikan langsung ke ruang embedding bersama melalui layer linear tipis. Kebanyakan model multimodal menempelkan vision encoder berat ke LLM. Gemma 4 12B melewatkan itu, makanya muat di 16GB.
Bayangkan seperti penerjemah versus orang bilingual. Pendekatan lama menyewa penerjemah terpisah (encoder) untuk mengonversi gambar ke bahasa yang dipahami model, lalu menyerahkannya. Gemma 4 12B bilingual sejak lahir. Data audio dan gambar langsung berbicara dalam bahasa native model, melalui layer proyeksi ringan alih-alih encoder yang besar.
Di balik kap, ada 48 layer dengan atensi hibrida. Sebagian besar layer menggunakan sliding window 1024 token (murah, lokal), diselingi layer atensi global sesekali yang melihat seluruh konteks. Kombinasi itulah yang membuatnya menangani konteks 256K tanpa melelehkan GPU Anda.

Keuntungan praktisnya: lebih sedikit parameter yang dihabiskan untuk encoder berarti lebih banyak anggaran VRAM Anda yang masuk ke penalaran sebenarnya. Itulah trade-off yang membuat model 12B bisa jauh melampaui bobotnya.
Benchmark Gemma 4 12B: Angka Sebenarnya
Headline-nya terbukti: Gemma 4 12B mencetak skor 77,2% di MMLU Pro, mengalahkan 67,6% milik Gemma 3 27B di tes yang sama, dengan kurang dari setengah VRAM. Ini angka resmi instruction-tuned (-it) dari Google, bukan estimasi komunitas. Berikut set lengkapnya.
| Benchmark | Gemma 4 12B | Gemma 3 27B (referensi) |
|---|---|---|
| MMLU Pro | 77,2% | 67,6% |
| GPQA Diamond | 78,8% | , |
| MMMU Pro | 69,1% | , |
| AIME 2026 (tanpa tools) | 77,5% | , |
| LiveCodeBench v6 | 72,0% | , |
| Codeforces ELO | 1659 | , |
Model 12B sekarang mengalahkan flagship 27B tahun lalu di MMLU Pro: 77,2% vs 67,6%. Itu lompatan generasional yang membuat Anda menghitung ulang kebutuhan hardware.

Dua catatan jujur. Pertama, tanda strip berarti Google tidak mempublikasikan angka Gemma 3 27B untuk baris tersebut, jadi selnya tetap kosong alih-alih diisi tebakan. Kedua, setiap skor di sini adalah model instruction-tuned. Angka model base berbeda. Anda bisa cross-check semuanya di kartu model HuggingFace dan halaman model DeepMind.
Berapa VRAM yang Dibutuhkan Gemma 4 12B?
Gemma 4 12B membutuhkan sekitar 6,6 GB VRAM pada kuantisasi Q4_K_M, artinya muat di GPU 8GB. Untuk ruang yang nyaman, terutama jika ingin menggunakan sebagian dari konteks 256K itu, targetkan 16GB VRAM atau unified memory. Bisa jalan di laptop. Mac M-series menanganinya melalui unified memory dengan baik.
Kuantisasi itu sekadar kompresi untuk bobot model. Angka presisi lebih rendah, file lebih kecil, akurasi sedikit berkurang. Berikut pemetaan level yang umum.
| Kuantisasi | VRAM Perkiraan | Kualitas | Terbaik untuk |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Hampir penuh, kehilangan kecil | Default yang masuk akal; muat kartu 8GB |
| Q5_K_M | ~8,5 GB | Sedikit lebih baik dari Q4 | VRAM agak longgar, ingin akurasi lebih |
| Q8 | ~13 GB | Efektif kualitas penuh | Kartu 16GB+, fidelitas maksimal |
| QAT Q4_0 | ~6,6 GB | Mendekati FP di footprint Q4 | Kualitas-per-GB terbaik (rilis 5 Juni) |

Jika Anda memilih hardware berdasarkan model ini, rangkuman kami tentang tools LLM lokal yang kami benchmark membahas backend mana yang memeras performa terbaik dari kartu tertentu. Versi singkatnya: kartu 12GB menjalankan Q4 dengan ruang tersisa, kartu 8GB menjalankan Q4 jika konteksnya dijaga tetap moderat.
Kecepatan Gemma 4 12B: Token/detik di Berbagai Hardware
Seberapa cepat? Itu tergantung kartu, kuantisasi, dan backend Anda, jadi alih-alih satu angka kami mengumpulkan figur pihak ketiga yang dipublikasikan di satu tempat. Ini dilaporkan oleh penguji komunitas dan vendor, diatribusikan ke masing-masing sumber. Bukan angka lab kami sendiri.
| Hardware | Kuant | Token/detik dilaporkan | Sumber |
|---|---|---|---|
| RTX 3060 (6GB) | Q4_K_M | Footprint ~6,6 GB VRAM, berjalan lokal (tok/s belum dilaporkan secara presisi) | runaiathome |
| RTX 4090 (24GB) | Q4_K_M | Kisaran chat real-time (tok/s spesifik belum dilaporkan) | apxml / komunitas |
| Apple M-series (unified) | mlx / Q4 | Berjalan via gemma4:12b-mlx (tok/s belum banyak dilaporkan) | Ollama / komunitas |
Saya akan jujur soal apa yang sebenarnya dikatakan data publik saat ini. runaiathome mengonfirmasi model berjalan di RTX 3060 6GB dalam footprint Q4_K_M ~6,6 GB, yang merupakan laporan hardware terpublikasi paling konkret sejauh ini. Spec sheet apxml dan halaman library Ollama mengonfirmasi model disajikan secara lokal di RTX 4090 24GB pada Q4, nyaman di wilayah chat real-time, tapi figur tok/s sustained yang presisi belum dipublikasikan untuk kartu itu. Varian Apple Silicon gemma4:12b-mlx ada dan berjalan, tapi angka tok/s yang andal belum muncul tiga hari pasca-peluncuran.
Artinya untuk Anda, per tier: di kartu 6GB seperti RTX 3060, harapannya bisa load dan jalan untuk chat lokal, cukup jaga context window tetap moderat. Di RTX 4090 24GB pada Q4_K_M, laporan yang dipublikasikan menempatkannya nyaman di wilayah chat real-time. Di Apple Silicon, build MLX berjalan tapi angka benchmark masih masuk perlahan.
Ini figur pihak ketiga yang dipublikasikan, bukan angka lab kami sendiri, jadi perlakukan sebagai perkiraan kasar. Tok/s Anda tergantung panjang prompt, ukuran konteks, dan versi backend. Sumber: halaman library Ollama, apxml, dan runaiathome. Seiring masuknya benchmark komunitas dalam dua minggu ke depan, kami akan memperbarui tabel ini.
Bagaimana Cara Menjalankan Gemma 4 12B Secara Lokal?
Jalur tersingkat: install Ollama, jalankan satu perintah, selesai. ollama run gemma4:12b menarik model 7,6 GB dan langsung membuka prompt chat. Tanpa file konfigurasi, tanpa environment Python. Jika ingin kontrol lebih atau Anda di Apple Silicon, ada empat jalur lain di bawah.
1. Ollama (default termudah). Pull dan jalankan dalam dua baris:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp dengan GGUF. Jika ingin kuantisasi tertentu, arahkan llama.cpp ke file GGUF di HuggingFace. GGUF adalah format file yang digunakan llama.cpp untuk bobot terkuantisasi:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. MLX di Apple Silicon. Mac M-series mendapat build MLX khusus yang menggunakan framework Apple alih-alih CUDA:
ollama run gemma4:12b-mlx4. LM Studio (GUI, tanpa terminal). Lebih suka aplikasi desktop? Buka LM Studio, buka tab pencarian, dan ketik gemma 4 12b. Pilih GGUF Q4_K_M dan unduh. LM Studio menangani sisanya, termasuk toggle server lokal.
5. Query melalui API. Ollama mengekspos endpoint yang kompatibel dengan OpenAI di port 11434, jadi kode yang sudah ada cukup ganti base-URL satu baris:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'Setelah berjalan di CLI, Anda mungkin ingin antarmuka yang proper. Anda bisa membungkusnya dalam UI ala ChatGPT dengan Open WebUI dalam sekitar lima menit. Baru di semua ini? Mulai dari panduan setup LLM lokal lengkap kami. Untuk rekomendasi sampling resmi dan jalur menjalankan, lihat ai.google.dev dan dokumentasi Ollama.
Kuantisasi Mana yang Harus Dipilih untuk Gemma 4 12B?
Untuk kebanyakan orang, Q4_K_M adalah default yang masuk akal: sekitar 6,6 GB VRAM, kualitas hampir penuh, dan muat di GPU 8GB. Jika punya 16GB atau lebih dan ingin fidelitas maksimal, naik ke Q8. Dan jika ingin kualitas-per-gigabyte terbaik yang tersedia sekarang, lihat checkpoint QAT Q4_0 yang baru.
Ini sudut kesegaran yang belum banyak dibahas. Pada 5 Juni 2026, hanya dua hari setelah peluncuran, Google merilis checkpoint Quantization-Aware-Training (QAT) Q4_0 bersamaan dengan format mobile baru. QAT artinya model dilatih dengan mempertimbangkan kuantisasi, jadi mempertahankan kualitas mendekati FP (near-full-precision) di footprint Q4. Sama ~6,6 GB, kehilangan akurasi noticeably lebih sedikit dibanding Q4 post-training standar. Jika VRAM terbatas tapi sensitif terhadap kualitas, itu pilihan Anda.
Panduan keputusan cepat:
- Kartu 8GB, ingin simpel: Q4_K_M.
- Kartu 8GB, ingin kualitas terbaik di ukuran itu: QAT Q4_0.
- Kartu 16GB+, ingin fidelitas maksimal: Q8.
- Di antaranya, VRAM agak longgar: Q5_K_M.
Anda bisa membaca alasan Google di pengumuman QAT mereka. Kesimpulannya: Q4_K_M sudah bagus, QAT Q4_0 lebih baik di ukuran yang sama, dan Anda hanya perlu Q8 jika akurasi lebih penting dari memori.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Apakah Upgrade-nya Worth It?
Ya, upgrade dari Gemma 3 12B layak jika Anda peduli lisensi Apache 2.0, input audio native, context window 256K, atau lompatan MMLU Pro. Melawan Qwen 3.5, lebih ketat. Gemma 4 12B menang di permisifitas lisensi dan audio native, tapi Qwen 3.5 mengambil beberapa baris benchmark kelas 12B. Pilih berdasarkan kebutuhan aktual Anda, bukan headline.
| Fitur | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (kelas 12B) |
|---|---|---|---|
| Lisensi | Apache 2.0 | Lisensi custom Gemma | Apache 2.0 |
| Konteks | 256K | 128K | Hingga 256K |
| Modalitas | Teks + gambar + audio | Teks + gambar | Teks + gambar |
| Audio native | Ya | Tidak | Tidak |
| MMLU Pro | 77,2% | Lebih rendah | Kompetitif, menang di beberapa baris |
| VRAM Q4 | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Perubahan lisensi saja sudah membenarkan pindah dari Gemma 3 12B untuk banyak tim. Gemma 3 dirilis di bawah lisensi custom Google dengan pembatasan penggunaan; Gemma 4 langsung Apache 2.0. Jika Anda menahan diri dari Gemma karena alasan komersial, hambatan itu sudah hilang.
Melawan Qwen 3.5, jujurlah pada diri sendiri. Qwen 3.5 benar-benar kuat dan mengungguli Gemma 4 12B di beberapa baris penalaran dan coding. Jika input audio dan lisensi permisif tidak ada di daftar Anda, benchmark keduanya di task Anda sendiri sebelum memutuskan. Lihat di mana Gemma 4 12B berada di antara model open terbaik untuk gambaran lebih luas. Dan karena Apache 2.0, Anda bisa fine-tune di bawah Apache 2.0 dengan Unsloth tanpa pusing lisensi.
Kapan TIDAK Menggunakan Gemma 4 12B
Lewati Gemma 4 12B jika Anda butuh penalaran level frontier yang hanya bisa diberikan model jauh lebih besar, jika Qwen 3.5 menang di baris benchmark spesifik yang workload Anda bergantung padanya, atau jika proyek Anda sangat bergantung pada tooling audio yang masih matang tiga hari pasca-peluncuran. Ini model 12B yang sangat baik, bukan yang ajaib.
Gemma 4 12B tidak selalu pilihan tepat. Jika butuh penalaran level frontier, model lebih besar tetap menang. Dukungan audio native-nya nyata dan mengesankan, tapi tooling di sekitarnya, library, utilitas helper, integrasi framework, baru berusia hitungan hari dan masih kasar di beberapa bagian. Jika Anda merilis produk yang berat di audio minggu ini, uji menyeluruh sebelum bertaruh padanya.
Beberapa diskualifikasi jujur lainnya. Jika Anda memasangkannya ke agent, konfirmasi dulu keandalan tool-calling di task Anda, karena perilaku agentik bervariasi per model. Jika keunggulan Anda di konteks panjang, pastikan Anda memaksimalkan context window 256K alih-alih mengasumsikan ukuran window mentah sama dengan output lebih baik. Dan jika Anda bergerak melampaui jalankan lokal ke serving produksi, jalur serving produksi di luar lokal membahas vLLM dan SGLang. Jika Anda deploy model open seperti Gemma 4 12B di produksi, kami bisa bantu.
Tentang Penulis
Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya merilis AI agent, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang stack tooling LLM yang tim Techsy benar-benar gunakan di produksi. Terhubung di LinkedIn.
Memilih tool itu setengah yang mudah. Membuatnya berjalan andal di dalam produk nyata adalah tempat kebanyakan tim mandek, dan itu persis yang tim integrasi AI kami bangun untuk klien, dari pipeline RAG hingga agent custom.
Pertanyaan yang Sering Diajukan
Bagaimana cara menjalankan Gemma 4 12B secara lokal?
Install Ollama, lalu jalankan ollama run gemma4:12b. Itu menarik model 7,6 GB dan membuka prompt chat. Tanpa environment Python atau file konfigurasi. Jika ingin aplikasi grafis, LM Studio juga bisa: cari gemma 4 12b di browser modelnya dan unduh build Q4_K_M.
Apa kebutuhan VRAM dan hardware untuk Gemma 4 12B?
Gemma 4 12B membutuhkan sekitar 6,6 GB VRAM pada kuantisasi Q4_K_M, jadi muat di GPU 8GB. Untuk ruang yang nyaman, terutama saat menggunakan konteks panjang, targetkan 16GB VRAM atau unified memory. Bisa jalan di laptop, termasuk Mac M-series melalui unified memory.
Bisakah Gemma 4 12B berjalan di laptop 16GB?
Ya, dengan mudah. Pada Q4_K_M model menggunakan sekitar 6,6 GB, menyisakan banyak ruang di mesin 16GB. Di laptop Apple Silicon, unified memory menanganinya dengan baik melalui build gemma4:12b-mlx. Anda bahkan bisa naik ke kuantisasi Q8 di 16GB untuk fidelitas lebih tinggi.
Apakah Gemma 4 12B benar-benar lebih baik dari Llama atau Qwen 3.5?
Tergantung apa yang Anda ukur. Gemma 4 12B menang di lisensi Apache 2.0, input audio native, dan context window 256K, dan mencetak 77,2% yang kuat di MMLU Pro. Tapi Qwen 3.5 mengambil beberapa baris penalaran dan coding kelas 12B. Benchmark keduanya di task Anda sendiri sebelum memutuskan.
Apakah Gemma 4 12B lebih baik dari Gemma 3 12B?
Ya. Gemma 4 12B pindah ke lisensi Apache 2.0 yang permisif, menambahkan input audio native, menggandakan context window menjadi 256K token, dan mencetak peningkatan MMLU Pro yang berarti. Perubahan lisensi saja sudah membenarkan upgrade untuk proyek komersial yang terhalang oleh ketentuan custom Gemma 3.
Kuantisasi mana yang harus saya gunakan untuk Gemma 4 12B?
Q4_K_M adalah default yang masuk akal di sekitar 6,6 GB dengan kualitas hampir penuh. Jika ingin kualitas terbaik di ukuran yang sama, gunakan checkpoint QAT Q4_0 baru yang dirilis 5 Juni 2026, yang mempertahankan kualitas near-full-precision di footprint Q4. Gunakan Q8 hanya jika punya 16GB+ dan butuh fidelitas maksimal.
Apakah Gemma 4 12B gratis untuk penggunaan komersial?
Ya. Gemma 4 12B dirilis di bawah lisensi Apache 2.0, yang mengizinkan penggunaan komersial tanpa pembatasan penggunaan dari lisensi custom Gemma 3. Anda bisa membangun produk komersial, fine-tune, dan mendistribusikan ulang. Perubahan lisensi itu salah satu alasan terbesar tim meng-upgrade dari Gemma 3.
Apakah Gemma 4 12B benar-benar mendukung input audio?
Ya. Gemma 4 12B adalah Gemma ukuran menengah pertama dengan input audio native. Berkat desain tanpa encoder-nya, waveform audio mentah diproyeksikan langsung ke model tanpa encoder audio terpisah. Meski begitu, tooling di sekitarnya baru berusia hitungan hari, jadi uji dengan cermat sebelum merilis fitur berat audio di produksi.
Seberapa cepat Gemma 4 12B di RTX 4090?
Laporan pihak ketiga yang dipublikasikan menempatkan Gemma 4 12B pada Q4_K_M nyaman di wilayah chat real-time di RTX 4090 24GB, meski figur token/detik sustained yang presisi belum dipublikasikan tiga hari setelah peluncuran. Kecepatan bervariasi tergantung panjang prompt, ukuran konteks, dan versi backend, jadi perlakukan angka awal sebagai perkiraan kasar.
Di mana saya mengunduh Gemma 4 12B?
Model instruction-tuned ada di HuggingFace sebagai google/gemma-4-12B-it, atau Anda bisa menariknya melalui Ollama dengan ollama run gemma4:12b (unduhan 7,6 GB). Pengguna LM Studio bisa mencari gemma 4 12b di browser model aplikasi. Untuk kuantisasi tertentu, file GGUF tersedia dari repo komunitas seperti Unsloth.