Techsy
Bize Ulaşın
Başla
Bloga Dön
ai-machine-learning

Gemma 4 12B: Benchmark Sonuçları, VRAM Gereksinimleri ve Yerel Çalıştırma Rehberi

Yazan Mert Batur Gürbüz
Güncellendi Jul 14, 2026
12 okuma
İçindekiler
Gemma 4 12B: Benchmark Sonuçları, VRAM Gereksinimleri ve Yerel Çalıştırma Rehberi

Google DeepMind, 3 Haziran 2026'da Gemma 4 12B'yi yayımladı. Üç gün sonra herkesin tekrarladığı sayı MMLU Pro skoru: %77,2. Bu, aynı testte %67,6 alan geçen yılın Gemma 3 27B modelini geride bırakıyor. 12 milyar parametreli bir model, 27B'lik bir amiral gemisini yarı bellek kullanımıyla geçiyor mu? Evet. Bir de lisans değişikliği var. Gemma 4, Apache 2.0 kapsamında yayımlandığından ticari kullanım herhangi bir kısıt olmaksızın serbestçe yapılabiliyor. 256 bin token'lık bağlam penceresi var ve kuantize edilince yaklaşık 6,6 GB VRAM ile çalışıyor. Bu son detay, çoğumuz için asıl konuyu özetliyor: model orta segment bir GPU'ya sığıyor.

Temel Çıkarımlar

  • Gemma 4 12B (3 Haziran 2026 sürümü), MMLU Pro'da %77,2 ile geçen yılın Gemma 3 27B modelini (%67,6) geride bırakıyor.
  • Q4KM kuantizasyonunda ~6,6 GB VRAM ile çalışıyor; 8 GB'lık GPU'ya sığıyor, 16 GB ise rahat bir çalışma marjı sunuyor.
  • Apache 2.0 lisansı (ticari kullanım serbest), 256 bin token bağlam, yerleşik ses + görüntü girişi, encoder'sız mimari.
  • Tek komutla başlatılıyor: ollama run gemma4:12b (7,6 GB indirme).

Gemma 4 12B Nedir?

Gemma 4 12B, Google DeepMind tarafından Apache 2.0 lisansıyla 3 Haziran 2026'da yayımlanan 12 milyar parametreli açık ağırlıklı bir modeldir. Encoder'sız, birleşik bir multimodal model: metin, görüntü ve ham ses girişi alıp metin çıktısı üretiyor. 256 bin token'lık bağlam penceresi sunuyor ve 140 dili destekliyor.

Gerçekte çalıştıracağınız talimat-ayarlı varyant gemma-4-12B-it adını taşıyor ("it" kısaltması, sohbet için hazır talimat-ayarlı sürümü ifade ediyor). Toplam 11,95 milyar parametreye sahip olduğundan "12B" biraz yukarı yuvarlama. Eğitim verisi Ocak 2025 kesim tarihine kadar uzanıyor.

İlginç kılan nokta şu: Gemma 4 12B, yerleşik ses girişine sahip ilk orta ölçekli Gemma modeli. Ayrı bir ses encoder'ı yok; ham dalga formları doğrudan modele projeksiyon katmanı üzerinden aktarılıyor. Görüntüler için de aynısı geçerli. Bu tasarım tercihi modelin tek bir tüketici kartına sığmasını sağlıyor — birazdan nedenini açıklayacağız.

Önce daha geniş bağlamı görmek ister misiniz? Açık modelleri kendi makinenizde çalıştırma rehberimiz yerel LLM'lere yeniyseniz temel kurulum adımlarını kapsıyor. Google'ın resmi duyuru yazısı tam açıklamayı içeriyor.

Gemma 4 12B Teknik Özellikleri

Doğrulanmış veriler, tek tabloda. Tahmin yok.

ÖzellikDeğer
Tam adıGemma 4 12B (gemma-4-12B-it)
Parametre sayısı11,95 milyar (~12B)
LisansApache 2.0 (ticari kullanım serbest)
Bağlam penceresi256 bin token
ModalitelerMetin + görüntü + ham ses girişi, metin çıktısı
MimariEncoder'sız birleşik, 48 katman, hibrit dikkat mekanizması
Dil desteği140 dil
Eğitim kesim tarihiOcak 2025
Ollama etiketigemma4:12b (7,6 GB indirme)
Apple Silicon etiketigemma4:12b-mlx
Önerilen örneklemesıcaklık 1,0, top_p 0,95, top_k 64

Örnekleme hakkında bir not: Özel bir nedeniniz yoksa önerilen temperature=1.0, top_p=0.95, top_k=64 değerlerinde kalın. Gemma modelleri düşük sıcaklıklarda garip davranıyor; diğer modellerle alışkanlıkla yaptığınız gibi sıcaklığı 0,2'ye düşürmeyin.

Encoder'sız Mimari Nasıl Çalışır?

Encoder'sız mimari, görüntü veya sesi dil modeline ulaşmadan önce dönüştüren ayrı bir model olmadığı anlamına geliyor. Görüntü yamaları ve ham ses dalga formları, ince doğrusal katmanlar üzerinden doğrudan paylaşılan gömme uzayına projeksiyon yapıyor. Çoğu multimodal model, LLM'in üzerine ağır bir görme encoder'ı ekler. Gemma 4 12B bunu atlıyor; bu sayede 16 GB'a sığıyor.

Bunu bir çevirmen ile ikidilli bir kişi arasındaki farka benzetebiliriz. Eski yaklaşım, görüntüleri modelin anlayacağı bir dile çevirmek için ayrı bir çevirmen (encoder) tutar ve çıktıyı modele iletir. Gemma 4 12B ise doğuştan ikidilli. Ses ve görüntü verisi, hantal bir encoder yerine hafif bir projeksiyon katmanı aracılığıyla modelin ana diliyle doğrudan konuşuyor.

Altta yatan yapıda 48 katman ve hibrit dikkat mekanizması var. Katmanların büyük çoğunluğu 1.024 token'lık kayan pencere kullanıyor (ucuz, yerel), bu katmanlar arada sırada tüm bağlamı gören global dikkat katmanlarıyla kesişiyor. Bu karma yapı, modelin GPU'nuzu eritmeden 256 bin token'lık bağlamı nasıl yönettiğini açıklıyor.

Ham ses ve görüntü yamalarının Gemma 4 12B gömme uzayına doğrudan projeksiyon yapıldığını gösteren encoder'sız mimari şeması
Gemma 4 12B'nin ses ve görüntü verilerini ayrı bir encoder olmaksızın doğrudan modele nasıl beslediği

Pratik kazanım şu: encoder'lara harcanan daha az parametre, VRAM bütçenizin asıl akıl yürütmeye daha fazla ayrılması anlamına geliyor. 12B'lik bir modelin bu kadar üstün performans göstermesini sağlayan değiş tokuş bu.

Gemma 4 12B Benchmark Sonuçları: Gerçek Sayılar

Başlık geçerliliğini koruyor: Gemma 4 12B, MMLU Pro'da %77,2 skoru alarak Gemma 3 27B'nin aynı testteki %67,6 skorunu yarıdan az bellek kullanımıyla geçiyor. Bunlar topluluk tahminleri değil, Google'ın resmi talimat-ayarlı (-it) sonuçları. İşte tam tablo.

BenchmarkGemma 4 12BGemma 3 27B (referans)
MMLU Pro%77,2%67,6
GPQA Diamond%78,8—
MMMU Pro%69,1—
AIME 2026 (araçsız)%77,5—
LiveCodeBench v6%72,0—
Codeforces ELO1659—

12B'lik bir model artık geçen yılın 27B amiral gemisini MMLU Pro'da geride bırakıyor: %77,2'ye karşı %67,6. Bu tür nesil sıçramaları, donanım hesaplamalarınızı yeniden yapmak istemenize neden oluyor.

Gemma 4 12B'yi MMLU Pro benchmark'ında Gemma 3 27B ve Gemma 3 12B ile karşılaştıran çubuk grafik
MMLU Pro'da Gemma 4 12B ile Gemma 3 27B ve Gemma 3 12B karşılaştırması; küçük yeni model en yüksek skoru alıyor

İki dürüst uyarı. Birincisi, tire işaretleri Google'ın o satırlar için Gemma 3 27B verisi yayımlamamış olduğunu gösteriyor; bu nedenle hücreler tahminle değil boş bırakılarak dolduruluyor. İkincisi, buradaki tüm skorlar talimat-ayarlı modele ait. Temel model sayıları farklılık gösteriyor. Tümünü HuggingFace model kartı ve DeepMind model sayfası üzerinden doğrulayabilirsiniz.

Gemma 4 12B Ne Kadar VRAM Gerektiriyor?

Gemma 4 12B, Q4KM kuantizasyonunda yaklaşık 6,6 GB VRAM gerektiriyor; bu, 8 GB'lık bir GPU'ya sığması anlamına geliyor. Özellikle 256 bin token'lık bağlamın bir bölümünü kullanmak istiyorsanız rahat bir çalışma marjı için 16 GB VRAM veya birleşik belleği hedefleyin. Dizüstü bilgisayarlarda çalışıyor; M serisi Mac'ler birleşik bellek sayesinde modeli sorunsuz işliyor.

Kuantizasyon, model ağırlıkları için bir tür sıkıştırma tekniği. Daha düşük hassasiyetli sayılar, daha küçük dosya, biraz daha az doğruluk. Yaygın kuantizasyon seviyelerinin karşılaştırması şöyle:

KuantizasyonYaklaşık VRAMKaliteEn iyi kullanım alanı
Q4_K_M~6,6 GBTam kaliteye yakın, minimal kayıpMakul varsayılan; 8 GB kartlara sığar
Q5_K_M~8,5 GBQ4'ten biraz daha iyiBiraz fazla VRAM'ı olan, daha yüksek doğruluk isteyenler
Q8~13 GBFiilen tam kalite16 GB+ kartlar, maksimum doğruluk
QAT Q4_0~6,6 GBQ4 ayak izinde tam hassasiyete yakınGB başına en iyi kalite (5 Haziran'da yayımlandı)

Gemma 4 12B'nin kuantizasyon seviyesine göre VRAM kullanımını 8 GB ve 16 GB referans çizgileriyle gösteren yatay çubuk grafik
Gemma 4 12B kuantizasyon seviyelerine göre VRAM ayak izi; 8 GB ve 16 GB GPU referans çizgileri

Bu model için donanım seçiyorsanız, yerel ortamda LLM çalıştırmak için kullanılan araçlar rehberimiz hangi backend'lerin belirli bir karttan en iyi verimi aldığını inceliyor. Kısa özet: 12 GB'lık kart Q4'ü bolca çalıştırır, 8 GB'lık kart ise bağlamı makul tutarsanız Q4'ü kaldırır.

Gemma 4 12B Hızı: Gerçek Donanımda Tokens/Sn

Ne kadar hızlı? Bu, kartınıza, kuantizasyonunuza ve backend'inize bağlı; bu yüzden tek bir sayı yerine yayımlanan üçüncü taraf verileri bir araya getirilip her birinin kaynağıyla birlikte aktarılıyor. Bunlar topluluk test edicileri ve satıcılar tarafından raporlanan sayılar olup kendi lab ölçümlerimiz değil.

DonanımKuantizasyonRaporlanan tokens/snKaynak
RTX 3060 (6 GB)Q4_K_M~6,6 GB VRAM ayak izi, yerel olarak çalışıyor (tok/sn tam olarak raporlanmamış)runaiathome
RTX 4090 (24 GB)Q4_K_MGerçek zamanlı sohbet aralığı (belirli tok/sn henüz raporlanmamış)apxml / topluluk
Apple M serisi (birleşik)mlx / Q4gemma4:12b-mlx ile çalışıyor (tok/sn henüz yaygın olarak raporlanmamış)Ollama / topluluk

Şu an mevcut genel verilerin gerçekte ne söylediği konusunda dürüst olmak gerekiyor. runaiathome, modelin ~6,6 GB Q4KM ayak izi içinde 6 GB RTX 3060'ta çalıştığını doğruladı; bu, şimdiye kadar yayımlanan en somut donanım raporu. apxml'in teknik özeti ve Ollama kütüphanesi sayfası, modelin 24 GB RTX 4090'da Q4 ile yerel olarak rahat gerçek zamanlı sohbet aralığında çalıştığını doğruluyor, ancak bu kart için kesin sürekli tok/sn verisi henüz yayımlanmamış. Apple Silicon gemma4:12b-mlx varyantı mevcut ve çalışıyor; ancak güvenilir tok/sn rakamları piyasaya çıkalı üç gün olmasına rağmen henüz ortaya çıkmamış.

Bu, seviyelerinize göre ne anlama geliyor: RTX 3060 gibi 6 GB'lık bir kartta yerel sohbet için yükleme ve çalıştırma yapılabileceğini, yalnızca bağlam penceresini makul tutmanız gerektiğini bekleyin. Q4KM ile 24 GB RTX 4090'da, yayımlanan raporlar modelin rahat gerçek zamanlı sohbet aralığında olduğunu gösteriyor. Apple Silicon'da MLX derlemesi çalışıyor ancak benchmark rakamları hâlâ gelmekte.

Bunlar yayımlanan üçüncü taraf verileri olduğundan kendi lab rakamlarımız değil; yaklaşık tahmin olarak değerlendirin. Tokens/sn rakamınız istem uzunluğuna, bağlam boyutuna ve backend sürümüne göre değişiyor. Kaynaklar: Ollama kütüphanesi sayfası, apxml ve runaiathome. Önümüzdeki iki hafta içinde topluluktan daha fazla benchmark geldikçe bu tablo güncellenecek.

Gemma 4 12B Yerel Olarak Nasıl Çalıştırılır?

En kısa yol: Ollama'yı kurun, tek bir komut çalıştırın, bitti. ollama run gemma4:12b komutu 7,6 GB'lık modeli indirip sizi doğrudan sohbet istemine bırakıyor. Yapılandırma dosyası yok, Python ortamı yok. Daha fazla kontrol istiyorsanız veya Apple Silicon kullanıyorsanız aşağıda dört farklı yol var.

1. Ollama (kolay varsayılan). İki satırla çekip çalıştırın:

bash
ollama pull gemma4:12b
ollama run gemma4:12b

2. llama.cpp ile GGUF. Belirli bir kuantizasyon istiyorsanız llama.cpp'yi HuggingFace'teki bir GGUF dosyasına yönlendirin. GGUF, llama.cpp'nin kuantize ağırlıklar için kullandığı dosya formatı:

bash
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."

3. Apple Silicon için MLX. M serisi Mac'ler, CUDA yerine Apple'ın çerçevesini kullanan özel bir MLX derlemesiyle çalışıyor:

bash
ollama run gemma4:12b-mlx

4. LM Studio (GUI, terminal yok). Masaüstü uygulaması tercih ederseniz LM Studio'yu açın, arama sekmesine gidin ve gemma 4 12b yazın. Bir Q4KM GGUF seçip indirin. LM Studio yerel sunucu açma dahil gerisini hallediyor.

5. API üzerinden sorgu. Ollama, 11434 portunda OpenAI uyumlu bir endpoint sunuyor; mevcut kodlar tek satır base-URL değişikliğiyle çalışıyor:

bash
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma4:12b",
    "messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
  }'

CLI'da çalışır hale getirdikten sonra muhtemelen gerçek bir arayüz isteyeceksiniz. Open WebUI ile ChatGPT tarzı bir arayüze sarabilirsiniz; bu yaklaşık beş dakika alıyor. Tüm bunlar yeniyse yerel LLM kurulum rehberimizle başlayabilirsiniz. Resmi örnekleme önerileri ve çalıştırma yolları için ai.google.dev ve Ollama belgelerine bakın.

Gemma 4 12B için Hangi Kuantizasyonu Kullanmalısınız?

Çoğu kullanıcı için Q4KM makul varsayılandır: yaklaşık 6,6 GB VRAM, tam kaliteye yakın sonuç ve 8 GB GPU'ya sığma. 16 GB veya daha fazla belleğiniz varsa ve maksimum doğruluk istiyorsanız Q8'e geçin. Şu an mevcut GB başına en iyi kaliteyi istiyorsanız yeni QAT Q4_0 checkpoint'lerine bakın.

Henüz kimsenin dahil etmediği güncel bir bilgi var. 5 Haziran 2026'da, yayımlanmasından yalnızca iki gün sonra Google, yeni bir mobil format ile birlikte Quantization-Aware-Training (QAT) Q4_0 checkpoint'lerini yayımladı. QAT, modelin kuantizasyon göz önünde bulundurularak eğitildiği anlamına geliyor; bu sayede Q4 ayak izinde tam hassasiyete yakın (near-FP) kalite sunuyor. Aynı ~6,6 GB, standart eğitim-sonrası Q4'e kıyasla belirgin biçimde daha az doğruluk kaybıyla. VRAM kısıtlıysanız ama kalite konusunda titiz davranıyorsanız bu sizin tercihiniz.

Hızlı karar rehberi:

  • 8 GB kart, sadelik istiyorsanız: Q4KM.
  • 8 GB kart, bu boyutta en iyi kaliteyi istiyorsanız: QAT Q4_0.
  • 16 GB+ kart, maksimum doğruluk istiyorsanız: Q8.
  • Arada, biraz fazla VRAM'ınız varsa: Q5KM.

Google'ın QAT duyurusunda gerekçeleri okuyabilirsiniz. Özet: Q4KM yeterlidir, QAT Q4_0 aynı boyutta daha iyidir, Q8'e yalnızca doğruluk bellekten daha önemliyse ihtiyaç duyarsınız.

Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Yükseltme Buna Değer mi?

Apache 2.0 lisansı, yerleşik ses girişi, 256 bin token bağlam penceresi veya MMLU Pro artışı sizin için önemliyse Gemma 3 12B'den yükseltme buna değer. Qwen 3.5 karşısında ise daha dengeli bir tablo var. Gemma 4 12B lisans serbestliği ve yerleşik ses girişi konusunda öne çıkıyor, ancak Qwen 3.5 bazı 12B sınıfı benchmark satırlarında üstün geliyor. Gerçek gereksinimlerinize bakın, başlık rakamına değil.

ÖzellikGemma 4 12BGemma 3 12BQwen 3.5 (12B sınıfı)
LisansApache 2.0Özel Gemma lisansıApache 2.0
Bağlam256 bin128 bin256 bine kadar
ModalitelerMetin + görüntü + sesMetin + görüntüMetin + görüntü
Yerleşik sesEvetHayırHayır
MMLU Pro%77,2Daha düşükRekabetçi, bazı satırlarda üstün
Q4 VRAM~6,6 GB~6,6 GB~6,6 GB

Lisans değişikliği tek başına birçok ekip için Gemma 3 12B'den geçişi meşrulaştırıyor. Gemma 3, kullanım kısıtlamalarıyla birlikte Google'ın özel lisansıyla yayımlanmıştı; Gemma 4 düz Apache 2.0. Ticari nedenlerle Gemma'ya geçişi ertelediyseniz o engel artık yok.

Qwen 3.5 karşılaştırmasında dürüst olmak gerekiyor. Qwen 3.5 gerçekten güçlü ve bazı akıl yürütme ile kodlama satırlarında Gemma 4 12B'yi geçiyor. Ses girişi ve permissive lisans öncelik listenizde değilse, taahhüt vermeden önce her ikisini de kendi görevinizde test edin. Daha geniş açık model alanında Gemma 4 12B'nin nerede konumlandığını görmek için en iyi açık kaynak LLM'ler rehberimize bakın. Apache 2.0 kapsamında olduğundan Unsloth ile Apache 2.0 altında ince ayar yapabilirsiniz; lisans baş ağrısı yok.

Gemma 4 12B Ne Zaman Kullanılmamalıdır?

Yalnızca çok daha büyük modellerin sunduğu uç düzey akıl yürütmeye ihtiyacınız varsa, Qwen 3.5 iş yükünüzün bağlı olduğu benchmark satırında üstünse ya da projeniz yayımlanmaktan yalnızca üç gün önce hâlâ olgunlaşmakta olan ses araçlarına yoğun biçimde dayanıyorsa Gemma 4 12B'yi atlayın. Mükemmel bir 12B model; sihirli bir model değil.

Gemma 4 12B her zaman doğru tercih değil. Uç düzey akıl yürütmeye ihtiyacınız varsa daha büyük bir model hâlâ kazanıyor. Yerleşik ses desteği gerçek ve etkileyici, ancak çevreleyen araç ekosistemi — kütüphaneler, yardımcı araçlar, çerçeve entegrasyonları — günler yaşında ve bazı yerlerde ham durumda. Bu hafta ses ağırlıklı bir ürün gönderiyorsanız ona güvenmeden önce kapsamlı test yapın.

Birkaç dürüst ek çekince. Bir agent içine bağlıyorsanız, araç çağırma güvenilirliğini önce kendi görevlerinizde doğrulayın; ajansal davranış modelden modele değişiyor. Uzun bağlam sizin avantajınızsa, ham pencere boyutunun daha iyi çıktıya eşit olduğunu varsaymak yerine 256 bin token bağlam penceresinden en iyi şekilde yararlanın. Yerel çalıştırmanın ötesine geçip üretim ortamında sunmayı düşünüyorsanız, yerel çalıştırmanın ötesindeki üretim sunumu yolunu inceleyin; vLLM ve SGLang bu süreçte devreye giriyor. Gemma 4 12B gibi açık modelleri üretimde konuşlandırıyorsanız size yardımcı olabiliriz.

Yazar Hakkında

Mert Batur Gürbüz, B2B müşterileri için yapay zeka ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları geliştiren Techsy.io'nun Kurucu Ortağı. Birmingham Üniversitesi'nde eğitimine devam ediyor ve Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor. LinkedIn üzerinden bağlantı kurabilirsiniz.

Araç seçmek işin kolay kısmı. Onu gerçek bir üründe güvenilir şekilde çalıştırmak ise çoğu ekibin takıldığı yer; yapay zeka entegrasyon ekibimiz müşterileri için tam olarak bunu yapıyor, RAG hatlarından özel ajanlara kadar.

Sıkça Sorulan Sorular

Gemma 4 12B yerel olarak nasıl çalıştırılır?

Ollama'yı kurun, ardından ollama run gemma4:12b komutunu çalıştırın. Bu komut 7,6 GB'lık modeli indirir ve bir sohbet istemi açar. Python ortamı veya yapılandırma dosyası gerekmiyor. Grafik arayüz tercih ediyorsanız LM Studio da çalışıyor: model tarayıcısında gemma 4 12b aratın ve bir Q4KM derlemesi indirin.

Gemma 4 12B için VRAM ve donanım gereksinimleri nelerdir?

Gemma 4 12B, Q4KM kuantizasyonunda yaklaşık 6,6 GB VRAM gerektiriyor; bu, 8 GB'lık GPU'ya sığması anlamına geliyor. Özellikle uzun bağlam kullanıyorsanız rahat bir çalışma marjı için 16 GB VRAM veya birleşik belleği hedefleyin. Dizüstü bilgisayarlarda çalışıyor; M serisi Mac'ler birleşik bellek sayesinde modeli sorunsuz işliyor.

Gemma 4 12B 16 GB'lık dizüstü bilgisayarda çalışır mı?

Evet, kolaylıkla. Q4KM'de model yaklaşık 6,6 GB kullanıyor; bu, 16 GB'lık bir makinede bol yer bırakıyor. Apple Silicon dizüstü bilgisayarlarda birleşik bellek, gemma4:12b-mlx derlemesi aracılığıyla modeli sorunsuz işliyor. Daha yüksek doğruluk için 16 GB üzerinde Q8 kuantizasyonuna bile geçebilirsiniz.

Gemma 4 12B gerçekten Llama veya Qwen 3.5'ten iyi mi?

Ölçtüğünüz şeye bağlı. Gemma 4 12B; Apache 2.0 lisansı, yerleşik ses girişi ve 256 bin token bağlam penceresi konusunda kazanıyor; MMLU Pro'da güçlü bir %77,2 skoru alıyor. Ancak Qwen 3.5, bazı 12B sınıfı akıl yürütme ve kodlama satırlarında üstün geliyor. Karar vermeden önce her ikisini de kendi görevinizde test edin.

Gemma 4 12B, Gemma 3 12B'den daha iyi mi?

Evet. Gemma 4 12B, permissive Apache 2.0 lisansına geçiyor, yerleşik ses girişi ekliyor, bağlam penceresini 256 bin token'a ikiye katlıyor ve MMLU Pro'da anlamlı bir iyileşme kaydediyor. Lisans değişikliği tek başına, Gemma 3'ün özel koşullarıyla engellenmiş ticari projeler için yükseltmeyi meşrulaştırıyor.

Gemma 4 12B için hangi kuantizasyonu kullanmalıyım?

Q4KM, yaklaşık 6,6 GB ile tam kaliteye yakın sonuç veren makul varsayılandır. Aynı boyutta en iyi kaliteyi istiyorsanız 5 Haziran 2026'da yayımlanan yeni QAT Q4_0 checkpoint'lerini kullanın; bu checkpoint'ler Q4 ayak izinde tam hassasiyete yakın kalite sunuyor. Q8'i yalnızca 16 GB+ belleğiniz varsa ve maksimum doğruluğa ihtiyaç duyuyorsanız kullanın.

Gemma 4 12B ticari kullanım için ücretsiz mi?

Evet. Gemma 4 12B, Apache 2.0 lisansıyla yayımlandığından Gemma 3'ün özel Gemma lisansının kullanım kısıtlamaları olmaksızın ticari kullanıma izin veriyor. Ticari ürünler geliştirebilir, ince ayar yapabilir ve dağıtabilirsiniz. Bu lisans değişikliği, ekiplerin Gemma 3'ten yükseltmesinin en önemli nedenlerinden biri.

Gemma 4 12B ses girişini gerçekten destekliyor mu?

Evet. Gemma 4 12B, yerleşik ses girişine sahip ilk orta ölçekli Gemma modeli. Encoder'sız tasarımı sayesinde ham ses dalga formları ayrı bir ses encoder'ı olmaksızın doğrudan modele projeksiyon yapıyor. Ancak çevreleyen araç ekosistemi günler yaşında; üretimde ses ağırlıklı özellikler göndermeden önce kapsamlı test yapın.

Gemma 4 12B bir RTX 4090'da ne kadar hızlı?

Yayımlanan üçüncü taraf raporlar, Gemma 4 12B'nin 24 GB RTX 4090'da Q4KM ile rahat gerçek zamanlı sohbet aralığında çalıştığını gösteriyor; ancak yayımlanmadan üç gün sonra itibarıyla kesin sürekli tokens/sn verisi henüz yayımlanmış değil. Hız, istem uzunluğuna, bağlam boyutuna ve backend sürümüne göre değişiyor; erken rakamları yaklaşık tahmin olarak değerlendirin.

Gemma 4 12B nereden indirilir?

Talimat-ayarlı model, HuggingFace'te google/gemma-4-12B-it adıyla bulunuyor; Ollama üzerinden ollama run gemma4:12b komutuyla (7,6 GB indirme) da çekebilirsiniz. LM Studio kullanıcıları uygulamanın model tarayıcısında gemma 4 12b aratabilir. Belirli kuantizasyonlar için GGUF dosyaları Unsloth gibi topluluk depolarından temin edilebilir.

Etiketler

gemma 4 12bollamayerel-llmkuantizasyongemma

Bu makaleyi paylaş

İlgili Makaleler

Daha fazla ai-machine-learning

ai-machine-learning
Jul 20, 2026

Kodlama İçin Prompt Mühendisliği: Claude Code ve Cursor'da Her Gün Kullandığımız 7 Kalıp (2026)

Çoğu 'yapay zeka kodlama promptları' yazısı size kopyalayıp yapıştırmanız için 50 şablon verir. Bu yazı ise 16 ajanlı bir Claude Code pipeline'ını her gün çalıştırmak için kullandığımız 7 kalıbı, her biri için gerçek bir öncesi-sonrası örneğiyle ve 2026'da Claude Code, Cursor ve Copilot'ta her kalıbın nerede karşılığını bulduğuyla birlikte anlatıyor.

11 dakikalık okuma okuma
Oku
ai-machine-learning
Jul 20, 2026

2026'nın En İyi 8 Yapay Zeka Web Scraping API'si (Kendi Agent Stack'imizde Test Edildi)

8 yapay zeka web scraping API'sini kendi agent stack'imiz üzerinden çektiğimiz gerçek 2026 fiyatlarıyla test ettik. Firecrawl, Bright Data, ScrapingBee ve 5 tane daha; LLM'e hazır çıktı, anti-bot başarısı ve MCP desteğine göre sıraladık.

9 dk okuma okuma
Oku
ai-machine-learning
Jul 19, 2026

2026'da Chain of Thought Prompting: Ne Zaman İşe Yarar, Ne Zaman Ters Teper

Chain of thought prompting 2026'da bazı modellerde doğruluğu hâlâ artırıyor, bazılarında ise sessizce düşürüyor. GPT-5 ve Claude gibi reasoning modeller bunu zaten kendi içlerinde yapıyor, bu yüzden elle \"adım adım düşün\" demek çoğu zaman gereksiz. CoT'yi ne zaman kullanacağınızı, ne zaman atlayacağınızı ve nasıl karar vereceğinizi OpenAI ile Anthropic'in kendi belgeleriyle birlikte anlatıyoruz.

11 dakikalık okuma okuma
Oku
Tüm Yazıları Görüntüle
Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.

30 dakikalık keşif görüşmesi ayarlayınProjelerimiz

Kütüphaneden öne çıkanlar

Kaynaklar

Tümünü gör
  • Yazılım Tedarik Rehberi

    Yanlış platforma altı ay ve bir milyon dolar harcamadan yazılım satın almanın tekrarlanabilir yöntemi.

  • Mimari Karar Rehberi

    Teknoloji yığınınızı seçmek için pratik bir çerçeve: ne zaman geliştirmeli, ne zaman satın almalı, monolit mi mikroservis mi ve özgeçmiş süslemek için tasarlama tuzağından nasıl kaçınılır.

  • Tedarikçi Seçim Rehberi

    Doğru geliştirme ortağını seçmenin yolu: ajans, freelancer ya da ekip içi; fazla ödemeden ve yarım kalmış bir ürün teslim almadan.

Claude Skills

Tümünü gör
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI Otomasyonları

Tümünü gör
  • Güvenlik Denetçisi

    Önceliklendirilmiş düzeltme PR'larıyla haftalık SCA + IaC taraması.

  • Soğuk E-posta Yazarı

    Tek bir somut kamuya açık detaya dayalı ilk temas e-postaları üretir.

  • Lead Araştırma Agent'ı

    Bir e-postayı profile zenginleştirir, uygunluğu puanlar, Slack'te uyarır.

Kütüphaneden öne çıkanlar

Kaynaklar

Tümünü gör
  • Yazılım Tedarik Rehberi

    Yanlış platforma altı ay ve bir milyon dolar harcamadan yazılım satın almanın tekrarlanabilir yöntemi.

  • Mimari Karar Rehberi

    Teknoloji yığınınızı seçmek için pratik bir çerçeve: ne zaman geliştirmeli, ne zaman satın almalı, monolit mi mikroservis mi ve özgeçmiş süslemek için tasarlama tuzağından nasıl kaçınılır.

  • Tedarikçi Seçim Rehberi

    Doğru geliştirme ortağını seçmenin yolu: ajans, freelancer ya da ekip içi; fazla ödemeden ve yarım kalmış bir ürün teslim almadan.

Claude Skills

Tümünü gör
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI Otomasyonları

Tümünü gör
  • Güvenlik Denetçisi

    Önceliklendirilmiş düzeltme PR'larıyla haftalık SCA + IaC taraması.

  • Soğuk E-posta Yazarı

    Tek bir somut kamuya açık detaya dayalı ilk temas e-postaları üretir.

  • Lead Araştırma Agent'ı

    Bir e-postayı profile zenginleştirir, uygunluğu puanlar, Slack'te uyarır.

Hizmetler

  • Kurumsal Çözümler
  • Mobil Uygulamalar
  • Web Uygulamaları

Çözümler

  • CRM Sistemleri
  • Yapay Zeka Entegrasyonu
  • ERP Çözümleri
  • Sesli Asistanlar
  • Süreç Otomasyonu
  • Siber ve Veri Güvenliği

Kütüphane

  • Kaynaklar
  • Blog
  • Portfolyo

Topluluk

  • AI Otomasyonları
  • Claude Skills

Araçlar

  • Mobil Uygulama Maliyet Hesaplayıcı
  • OpenAI / LLM API Maliyet Hesaplayıcı
  • MVP Maliyet Hesaplayıcı
  • Sesli AI Ajan Maliyet Hesaplayıcı

Şirket

  • Hakkımızda
  • Partnerler
  • İletişim

Yasal

  • Gizlilik Politikası
  • Kullanım Şartları
  • Çerez Politikası

Hizmetler

  • Kurumsal Çözümler
  • Mobil Uygulamalar
  • Web Uygulamaları

Çözümler

  • CRM Sistemleri
  • Yapay Zeka Entegrasyonu
  • ERP Çözümleri
  • Sesli Asistanlar
  • Süreç Otomasyonu
  • Siber ve Veri Güvenliği

Kütüphane

  • Kaynaklar
  • Blog
  • Portfolyo

Topluluk

  • AI Otomasyonları
  • Claude Skills

Araçlar

  • Mobil Uygulama Maliyet Hesaplayıcı
  • OpenAI / LLM API Maliyet Hesaplayıcı
  • MVP Maliyet Hesaplayıcı
  • Sesli AI Ajan Maliyet Hesaplayıcı

Şirket

  • Hakkımızda
  • Partnerler
  • İletişim
YasalGizlilik PolitikasıKullanım ŞartlarıÇerez Politikası
TECHSY
© 2026 Techsy. Tüm hakları saklıdır.