
Google DeepMind, 3 Haziran 2026'da Gemma 4 12B'yi yayımladı. Üç gün sonra herkesin tekrarladığı sayı MMLU Pro skoru: %77,2. Bu, aynı testte %67,6 alan geçen yılın Gemma 3 27B modelini geride bırakıyor. 12 milyar parametreli bir model, 27B'lik bir amiral gemisini yarı bellek kullanımıyla geçiyor mu? Evet. Bir de lisans değişikliği var. Gemma 4, Apache 2.0 kapsamında yayımlandığından ticari kullanım herhangi bir kısıt olmaksızın serbestçe yapılabiliyor. 256 bin token'lık bağlam penceresi var ve kuantize edilince yaklaşık 6,6 GB VRAM ile çalışıyor. Bu son detay, çoğumuz için asıl konuyu özetliyor: model orta segment bir GPU'ya sığıyor.
Temel Çıkarımlar
- Gemma 4 12B (3 Haziran 2026 sürümü), MMLU Pro'da %77,2 ile geçen yılın Gemma 3 27B modelini (%67,6) geride bırakıyor.
- Q4KM kuantizasyonunda ~6,6 GB VRAM ile çalışıyor; 8 GB'lık GPU'ya sığıyor, 16 GB ise rahat bir çalışma marjı sunuyor.
- Apache 2.0 lisansı (ticari kullanım serbest), 256 bin token bağlam, yerleşik ses + görüntü girişi, encoder'sız mimari.
- Tek komutla başlatılıyor:
ollama run gemma4:12b(7,6 GB indirme).
Gemma 4 12B Nedir?
Gemma 4 12B, Google DeepMind tarafından Apache 2.0 lisansıyla 3 Haziran 2026'da yayımlanan 12 milyar parametreli açık ağırlıklı bir modeldir. Encoder'sız, birleşik bir multimodal model: metin, görüntü ve ham ses girişi alıp metin çıktısı üretiyor. 256 bin token'lık bağlam penceresi sunuyor ve 140 dili destekliyor.
Gerçekte çalıştıracağınız talimat-ayarlı varyant gemma-4-12B-it adını taşıyor ("it" kısaltması, sohbet için hazır talimat-ayarlı sürümü ifade ediyor). Toplam 11,95 milyar parametreye sahip olduğundan "12B" biraz yukarı yuvarlama. Eğitim verisi Ocak 2025 kesim tarihine kadar uzanıyor.
İlginç kılan nokta şu: Gemma 4 12B, yerleşik ses girişine sahip ilk orta ölçekli Gemma modeli. Ayrı bir ses encoder'ı yok; ham dalga formları doğrudan modele projeksiyon katmanı üzerinden aktarılıyor. Görüntüler için de aynısı geçerli. Bu tasarım tercihi modelin tek bir tüketici kartına sığmasını sağlıyor — birazdan nedenini açıklayacağız.
Önce daha geniş bağlamı görmek ister misiniz? Açık modelleri kendi makinenizde çalıştırma rehberimiz yerel LLM'lere yeniyseniz temel kurulum adımlarını kapsıyor. Google'ın resmi duyuru yazısı tam açıklamayı içeriyor.
Gemma 4 12B Teknik Özellikleri
Doğrulanmış veriler, tek tabloda. Tahmin yok.
| Özellik | Değer |
|---|---|
| Tam adı | Gemma 4 12B (gemma-4-12B-it) |
| Parametre sayısı | 11,95 milyar (~12B) |
| Lisans | Apache 2.0 (ticari kullanım serbest) |
| Bağlam penceresi | 256 bin token |
| Modaliteler | Metin + görüntü + ham ses girişi, metin çıktısı |
| Mimari | Encoder'sız birleşik, 48 katman, hibrit dikkat mekanizması |
| Dil desteği | 140 dil |
| Eğitim kesim tarihi | Ocak 2025 |
| Ollama etiketi | gemma4:12b (7,6 GB indirme) |
| Apple Silicon etiketi | gemma4:12b-mlx |
| Önerilen örnekleme | sıcaklık 1,0, top_p 0,95, top_k 64 |
Örnekleme hakkında bir not: Özel bir nedeniniz yoksa önerilen temperature=1.0, top_p=0.95, top_k=64 değerlerinde kalın. Gemma modelleri düşük sıcaklıklarda garip davranıyor; diğer modellerle alışkanlıkla yaptığınız gibi sıcaklığı 0,2'ye düşürmeyin.
Encoder'sız Mimari Nasıl Çalışır?
Encoder'sız mimari, görüntü veya sesi dil modeline ulaşmadan önce dönüştüren ayrı bir model olmadığı anlamına geliyor. Görüntü yamaları ve ham ses dalga formları, ince doğrusal katmanlar üzerinden doğrudan paylaşılan gömme uzayına projeksiyon yapıyor. Çoğu multimodal model, LLM'in üzerine ağır bir görme encoder'ı ekler. Gemma 4 12B bunu atlıyor; bu sayede 16 GB'a sığıyor.
Bunu bir çevirmen ile ikidilli bir kişi arasındaki farka benzetebiliriz. Eski yaklaşım, görüntüleri modelin anlayacağı bir dile çevirmek için ayrı bir çevirmen (encoder) tutar ve çıktıyı modele iletir. Gemma 4 12B ise doğuştan ikidilli. Ses ve görüntü verisi, hantal bir encoder yerine hafif bir projeksiyon katmanı aracılığıyla modelin ana diliyle doğrudan konuşuyor.
Altta yatan yapıda 48 katman ve hibrit dikkat mekanizması var. Katmanların büyük çoğunluğu 1.024 token'lık kayan pencere kullanıyor (ucuz, yerel), bu katmanlar arada sırada tüm bağlamı gören global dikkat katmanlarıyla kesişiyor. Bu karma yapı, modelin GPU'nuzu eritmeden 256 bin token'lık bağlamı nasıl yönettiğini açıklıyor.

Pratik kazanım şu: encoder'lara harcanan daha az parametre, VRAM bütçenizin asıl akıl yürütmeye daha fazla ayrılması anlamına geliyor. 12B'lik bir modelin bu kadar üstün performans göstermesini sağlayan değiş tokuş bu.
Gemma 4 12B Benchmark Sonuçları: Gerçek Sayılar
Başlık geçerliliğini koruyor: Gemma 4 12B, MMLU Pro'da %77,2 skoru alarak Gemma 3 27B'nin aynı testteki %67,6 skorunu yarıdan az bellek kullanımıyla geçiyor. Bunlar topluluk tahminleri değil, Google'ın resmi talimat-ayarlı (-it) sonuçları. İşte tam tablo.
| Benchmark | Gemma 4 12B | Gemma 3 27B (referans) |
|---|---|---|
| MMLU Pro | %77,2 | %67,6 |
| GPQA Diamond | %78,8 | — |
| MMMU Pro | %69,1 | — |
| AIME 2026 (araçsız) | %77,5 | — |
| LiveCodeBench v6 | %72,0 | — |
| Codeforces ELO | 1659 | — |
12B'lik bir model artık geçen yılın 27B amiral gemisini MMLU Pro'da geride bırakıyor: %77,2'ye karşı %67,6. Bu tür nesil sıçramaları, donanım hesaplamalarınızı yeniden yapmak istemenize neden oluyor.

İki dürüst uyarı. Birincisi, tire işaretleri Google'ın o satırlar için Gemma 3 27B verisi yayımlamamış olduğunu gösteriyor; bu nedenle hücreler tahminle değil boş bırakılarak dolduruluyor. İkincisi, buradaki tüm skorlar talimat-ayarlı modele ait. Temel model sayıları farklılık gösteriyor. Tümünü HuggingFace model kartı ve DeepMind model sayfası üzerinden doğrulayabilirsiniz.
Gemma 4 12B Ne Kadar VRAM Gerektiriyor?
Gemma 4 12B, Q4KM kuantizasyonunda yaklaşık 6,6 GB VRAM gerektiriyor; bu, 8 GB'lık bir GPU'ya sığması anlamına geliyor. Özellikle 256 bin token'lık bağlamın bir bölümünü kullanmak istiyorsanız rahat bir çalışma marjı için 16 GB VRAM veya birleşik belleği hedefleyin. Dizüstü bilgisayarlarda çalışıyor; M serisi Mac'ler birleşik bellek sayesinde modeli sorunsuz işliyor.
Kuantizasyon, model ağırlıkları için bir tür sıkıştırma tekniği. Daha düşük hassasiyetli sayılar, daha küçük dosya, biraz daha az doğruluk. Yaygın kuantizasyon seviyelerinin karşılaştırması şöyle:
| Kuantizasyon | Yaklaşık VRAM | Kalite | En iyi kullanım alanı |
|---|---|---|---|
| Q4_K_M | ~6,6 GB | Tam kaliteye yakın, minimal kayıp | Makul varsayılan; 8 GB kartlara sığar |
| Q5_K_M | ~8,5 GB | Q4'ten biraz daha iyi | Biraz fazla VRAM'ı olan, daha yüksek doğruluk isteyenler |
| Q8 | ~13 GB | Fiilen tam kalite | 16 GB+ kartlar, maksimum doğruluk |
| QAT Q4_0 | ~6,6 GB | Q4 ayak izinde tam hassasiyete yakın | GB başına en iyi kalite (5 Haziran'da yayımlandı) |

Bu model için donanım seçiyorsanız, yerel ortamda LLM çalıştırmak için kullanılan araçlar rehberimiz hangi backend'lerin belirli bir karttan en iyi verimi aldığını inceliyor. Kısa özet: 12 GB'lık kart Q4'ü bolca çalıştırır, 8 GB'lık kart ise bağlamı makul tutarsanız Q4'ü kaldırır.
Gemma 4 12B Hızı: Gerçek Donanımda Tokens/Sn
Ne kadar hızlı? Bu, kartınıza, kuantizasyonunuza ve backend'inize bağlı; bu yüzden tek bir sayı yerine yayımlanan üçüncü taraf verileri bir araya getirilip her birinin kaynağıyla birlikte aktarılıyor. Bunlar topluluk test edicileri ve satıcılar tarafından raporlanan sayılar olup kendi lab ölçümlerimiz değil.
| Donanım | Kuantizasyon | Raporlanan tokens/sn | Kaynak |
|---|---|---|---|
| RTX 3060 (6 GB) | Q4_K_M | ~6,6 GB VRAM ayak izi, yerel olarak çalışıyor (tok/sn tam olarak raporlanmamış) | runaiathome |
| RTX 4090 (24 GB) | Q4_K_M | Gerçek zamanlı sohbet aralığı (belirli tok/sn henüz raporlanmamış) | apxml / topluluk |
| Apple M serisi (birleşik) | mlx / Q4 | gemma4:12b-mlx ile çalışıyor (tok/sn henüz yaygın olarak raporlanmamış) | Ollama / topluluk |
Şu an mevcut genel verilerin gerçekte ne söylediği konusunda dürüst olmak gerekiyor. runaiathome, modelin ~6,6 GB Q4KM ayak izi içinde 6 GB RTX 3060'ta çalıştığını doğruladı; bu, şimdiye kadar yayımlanan en somut donanım raporu. apxml'in teknik özeti ve Ollama kütüphanesi sayfası, modelin 24 GB RTX 4090'da Q4 ile yerel olarak rahat gerçek zamanlı sohbet aralığında çalıştığını doğruluyor, ancak bu kart için kesin sürekli tok/sn verisi henüz yayımlanmamış. Apple Silicon gemma4:12b-mlx varyantı mevcut ve çalışıyor; ancak güvenilir tok/sn rakamları piyasaya çıkalı üç gün olmasına rağmen henüz ortaya çıkmamış.
Bu, seviyelerinize göre ne anlama geliyor: RTX 3060 gibi 6 GB'lık bir kartta yerel sohbet için yükleme ve çalıştırma yapılabileceğini, yalnızca bağlam penceresini makul tutmanız gerektiğini bekleyin. Q4KM ile 24 GB RTX 4090'da, yayımlanan raporlar modelin rahat gerçek zamanlı sohbet aralığında olduğunu gösteriyor. Apple Silicon'da MLX derlemesi çalışıyor ancak benchmark rakamları hâlâ gelmekte.
Bunlar yayımlanan üçüncü taraf verileri olduğundan kendi lab rakamlarımız değil; yaklaşık tahmin olarak değerlendirin. Tokens/sn rakamınız istem uzunluğuna, bağlam boyutuna ve backend sürümüne göre değişiyor. Kaynaklar: Ollama kütüphanesi sayfası, apxml ve runaiathome. Önümüzdeki iki hafta içinde topluluktan daha fazla benchmark geldikçe bu tablo güncellenecek.
Gemma 4 12B Yerel Olarak Nasıl Çalıştırılır?
En kısa yol: Ollama'yı kurun, tek bir komut çalıştırın, bitti. ollama run gemma4:12b komutu 7,6 GB'lık modeli indirip sizi doğrudan sohbet istemine bırakıyor. Yapılandırma dosyası yok, Python ortamı yok. Daha fazla kontrol istiyorsanız veya Apple Silicon kullanıyorsanız aşağıda dört farklı yol var.
1. Ollama (kolay varsayılan). İki satırla çekip çalıştırın:
ollama pull gemma4:12b
ollama run gemma4:12b2. llama.cpp ile GGUF. Belirli bir kuantizasyon istiyorsanız llama.cpp'yi HuggingFace'teki bir GGUF dosyasına yönlendirin. GGUF, llama.cpp'nin kuantize ağırlıklar için kullandığı dosya formatı:
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."3. Apple Silicon için MLX. M serisi Mac'ler, CUDA yerine Apple'ın çerçevesini kullanan özel bir MLX derlemesiyle çalışıyor:
ollama run gemma4:12b-mlx4. LM Studio (GUI, terminal yok). Masaüstü uygulaması tercih ederseniz LM Studio'yu açın, arama sekmesine gidin ve gemma 4 12b yazın. Bir Q4KM GGUF seçip indirin. LM Studio yerel sunucu açma dahil gerisini hallediyor.
5. API üzerinden sorgu. Ollama, 11434 portunda OpenAI uyumlu bir endpoint sunuyor; mevcut kodlar tek satır base-URL değişikliğiyle çalışıyor:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4:12b",
"messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
}'CLI'da çalışır hale getirdikten sonra muhtemelen gerçek bir arayüz isteyeceksiniz. Open WebUI ile ChatGPT tarzı bir arayüze sarabilirsiniz; bu yaklaşık beş dakika alıyor. Tüm bunlar yeniyse yerel LLM kurulum rehberimizle başlayabilirsiniz. Resmi örnekleme önerileri ve çalıştırma yolları için ai.google.dev ve Ollama belgelerine bakın.
Gemma 4 12B için Hangi Kuantizasyonu Kullanmalısınız?
Çoğu kullanıcı için Q4KM makul varsayılandır: yaklaşık 6,6 GB VRAM, tam kaliteye yakın sonuç ve 8 GB GPU'ya sığma. 16 GB veya daha fazla belleğiniz varsa ve maksimum doğruluk istiyorsanız Q8'e geçin. Şu an mevcut GB başına en iyi kaliteyi istiyorsanız yeni QAT Q4_0 checkpoint'lerine bakın.
Henüz kimsenin dahil etmediği güncel bir bilgi var. 5 Haziran 2026'da, yayımlanmasından yalnızca iki gün sonra Google, yeni bir mobil format ile birlikte Quantization-Aware-Training (QAT) Q4_0 checkpoint'lerini yayımladı. QAT, modelin kuantizasyon göz önünde bulundurularak eğitildiği anlamına geliyor; bu sayede Q4 ayak izinde tam hassasiyete yakın (near-FP) kalite sunuyor. Aynı ~6,6 GB, standart eğitim-sonrası Q4'e kıyasla belirgin biçimde daha az doğruluk kaybıyla. VRAM kısıtlıysanız ama kalite konusunda titiz davranıyorsanız bu sizin tercihiniz.
Hızlı karar rehberi:
- 8 GB kart, sadelik istiyorsanız: Q4KM.
- 8 GB kart, bu boyutta en iyi kaliteyi istiyorsanız: QAT Q4_0.
- 16 GB+ kart, maksimum doğruluk istiyorsanız: Q8.
- Arada, biraz fazla VRAM'ınız varsa: Q5KM.
Google'ın QAT duyurusunda gerekçeleri okuyabilirsiniz. Özet: Q4KM yeterlidir, QAT Q4_0 aynı boyutta daha iyidir, Q8'e yalnızca doğruluk bellekten daha önemliyse ihtiyaç duyarsınız.
Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: Yükseltme Buna Değer mi?
Apache 2.0 lisansı, yerleşik ses girişi, 256 bin token bağlam penceresi veya MMLU Pro artışı sizin için önemliyse Gemma 3 12B'den yükseltme buna değer. Qwen 3.5 karşısında ise daha dengeli bir tablo var. Gemma 4 12B lisans serbestliği ve yerleşik ses girişi konusunda öne çıkıyor, ancak Qwen 3.5 bazı 12B sınıfı benchmark satırlarında üstün geliyor. Gerçek gereksinimlerinize bakın, başlık rakamına değil.
| Özellik | Gemma 4 12B | Gemma 3 12B | Qwen 3.5 (12B sınıfı) |
|---|---|---|---|
| Lisans | Apache 2.0 | Özel Gemma lisansı | Apache 2.0 |
| Bağlam | 256 bin | 128 bin | 256 bine kadar |
| Modaliteler | Metin + görüntü + ses | Metin + görüntü | Metin + görüntü |
| Yerleşik ses | Evet | Hayır | Hayır |
| MMLU Pro | %77,2 | Daha düşük | Rekabetçi, bazı satırlarda üstün |
| Q4 VRAM | ~6,6 GB | ~6,6 GB | ~6,6 GB |
Lisans değişikliği tek başına birçok ekip için Gemma 3 12B'den geçişi meşrulaştırıyor. Gemma 3, kullanım kısıtlamalarıyla birlikte Google'ın özel lisansıyla yayımlanmıştı; Gemma 4 düz Apache 2.0. Ticari nedenlerle Gemma'ya geçişi ertelediyseniz o engel artık yok.
Qwen 3.5 karşılaştırmasında dürüst olmak gerekiyor. Qwen 3.5 gerçekten güçlü ve bazı akıl yürütme ile kodlama satırlarında Gemma 4 12B'yi geçiyor. Ses girişi ve permissive lisans öncelik listenizde değilse, taahhüt vermeden önce her ikisini de kendi görevinizde test edin. Daha geniş açık model alanında Gemma 4 12B'nin nerede konumlandığını görmek için en iyi açık kaynak LLM'ler rehberimize bakın. Apache 2.0 kapsamında olduğundan Unsloth ile Apache 2.0 altında ince ayar yapabilirsiniz; lisans baş ağrısı yok.
Gemma 4 12B Ne Zaman Kullanılmamalıdır?
Yalnızca çok daha büyük modellerin sunduğu uç düzey akıl yürütmeye ihtiyacınız varsa, Qwen 3.5 iş yükünüzün bağlı olduğu benchmark satırında üstünse ya da projeniz yayımlanmaktan yalnızca üç gün önce hâlâ olgunlaşmakta olan ses araçlarına yoğun biçimde dayanıyorsa Gemma 4 12B'yi atlayın. Mükemmel bir 12B model; sihirli bir model değil.
Gemma 4 12B her zaman doğru tercih değil. Uç düzey akıl yürütmeye ihtiyacınız varsa daha büyük bir model hâlâ kazanıyor. Yerleşik ses desteği gerçek ve etkileyici, ancak çevreleyen araç ekosistemi — kütüphaneler, yardımcı araçlar, çerçeve entegrasyonları — günler yaşında ve bazı yerlerde ham durumda. Bu hafta ses ağırlıklı bir ürün gönderiyorsanız ona güvenmeden önce kapsamlı test yapın.
Birkaç dürüst ek çekince. Bir agent içine bağlıyorsanız, araç çağırma güvenilirliğini önce kendi görevlerinizde doğrulayın; ajansal davranış modelden modele değişiyor. Uzun bağlam sizin avantajınızsa, ham pencere boyutunun daha iyi çıktıya eşit olduğunu varsaymak yerine 256 bin token bağlam penceresinden en iyi şekilde yararlanın. Yerel çalıştırmanın ötesine geçip üretim ortamında sunmayı düşünüyorsanız, yerel çalıştırmanın ötesindeki üretim sunumu yolunu inceleyin; vLLM ve SGLang bu süreçte devreye giriyor. Gemma 4 12B gibi açık modelleri üretimde konuşlandırıyorsanız size yardımcı olabiliriz.
Yazar Hakkında
Mert Batur Gürbüz, B2B müşterileri için yapay zeka ajanları, otomasyon sistemleri ve ses/SDR pipeline'ları geliştiren Techsy.io'nun Kurucu Ortağı. Birmingham Üniversitesi'nde eğitimine devam ediyor ve Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor. LinkedIn üzerinden bağlantı kurabilirsiniz.
Araç seçmek işin kolay kısmı. Onu gerçek bir üründe güvenilir şekilde çalıştırmak ise çoğu ekibin takıldığı yer; yapay zeka entegrasyon ekibimiz müşterileri için tam olarak bunu yapıyor, RAG hatlarından özel ajanlara kadar.
Sıkça Sorulan Sorular
Gemma 4 12B yerel olarak nasıl çalıştırılır?
Ollama'yı kurun, ardından ollama run gemma4:12b komutunu çalıştırın. Bu komut 7,6 GB'lık modeli indirir ve bir sohbet istemi açar. Python ortamı veya yapılandırma dosyası gerekmiyor. Grafik arayüz tercih ediyorsanız LM Studio da çalışıyor: model tarayıcısında gemma 4 12b aratın ve bir Q4KM derlemesi indirin.
Gemma 4 12B için VRAM ve donanım gereksinimleri nelerdir?
Gemma 4 12B, Q4KM kuantizasyonunda yaklaşık 6,6 GB VRAM gerektiriyor; bu, 8 GB'lık GPU'ya sığması anlamına geliyor. Özellikle uzun bağlam kullanıyorsanız rahat bir çalışma marjı için 16 GB VRAM veya birleşik belleği hedefleyin. Dizüstü bilgisayarlarda çalışıyor; M serisi Mac'ler birleşik bellek sayesinde modeli sorunsuz işliyor.
Gemma 4 12B 16 GB'lık dizüstü bilgisayarda çalışır mı?
Evet, kolaylıkla. Q4KM'de model yaklaşık 6,6 GB kullanıyor; bu, 16 GB'lık bir makinede bol yer bırakıyor. Apple Silicon dizüstü bilgisayarlarda birleşik bellek, gemma4:12b-mlx derlemesi aracılığıyla modeli sorunsuz işliyor. Daha yüksek doğruluk için 16 GB üzerinde Q8 kuantizasyonuna bile geçebilirsiniz.
Gemma 4 12B gerçekten Llama veya Qwen 3.5'ten iyi mi?
Ölçtüğünüz şeye bağlı. Gemma 4 12B; Apache 2.0 lisansı, yerleşik ses girişi ve 256 bin token bağlam penceresi konusunda kazanıyor; MMLU Pro'da güçlü bir %77,2 skoru alıyor. Ancak Qwen 3.5, bazı 12B sınıfı akıl yürütme ve kodlama satırlarında üstün geliyor. Karar vermeden önce her ikisini de kendi görevinizde test edin.
Gemma 4 12B, Gemma 3 12B'den daha iyi mi?
Evet. Gemma 4 12B, permissive Apache 2.0 lisansına geçiyor, yerleşik ses girişi ekliyor, bağlam penceresini 256 bin token'a ikiye katlıyor ve MMLU Pro'da anlamlı bir iyileşme kaydediyor. Lisans değişikliği tek başına, Gemma 3'ün özel koşullarıyla engellenmiş ticari projeler için yükseltmeyi meşrulaştırıyor.
Gemma 4 12B için hangi kuantizasyonu kullanmalıyım?
Q4KM, yaklaşık 6,6 GB ile tam kaliteye yakın sonuç veren makul varsayılandır. Aynı boyutta en iyi kaliteyi istiyorsanız 5 Haziran 2026'da yayımlanan yeni QAT Q4_0 checkpoint'lerini kullanın; bu checkpoint'ler Q4 ayak izinde tam hassasiyete yakın kalite sunuyor. Q8'i yalnızca 16 GB+ belleğiniz varsa ve maksimum doğruluğa ihtiyaç duyuyorsanız kullanın.
Gemma 4 12B ticari kullanım için ücretsiz mi?
Evet. Gemma 4 12B, Apache 2.0 lisansıyla yayımlandığından Gemma 3'ün özel Gemma lisansının kullanım kısıtlamaları olmaksızın ticari kullanıma izin veriyor. Ticari ürünler geliştirebilir, ince ayar yapabilir ve dağıtabilirsiniz. Bu lisans değişikliği, ekiplerin Gemma 3'ten yükseltmesinin en önemli nedenlerinden biri.
Gemma 4 12B ses girişini gerçekten destekliyor mu?
Evet. Gemma 4 12B, yerleşik ses girişine sahip ilk orta ölçekli Gemma modeli. Encoder'sız tasarımı sayesinde ham ses dalga formları ayrı bir ses encoder'ı olmaksızın doğrudan modele projeksiyon yapıyor. Ancak çevreleyen araç ekosistemi günler yaşında; üretimde ses ağırlıklı özellikler göndermeden önce kapsamlı test yapın.
Gemma 4 12B bir RTX 4090'da ne kadar hızlı?
Yayımlanan üçüncü taraf raporlar, Gemma 4 12B'nin 24 GB RTX 4090'da Q4KM ile rahat gerçek zamanlı sohbet aralığında çalıştığını gösteriyor; ancak yayımlanmadan üç gün sonra itibarıyla kesin sürekli tokens/sn verisi henüz yayımlanmış değil. Hız, istem uzunluğuna, bağlam boyutuna ve backend sürümüne göre değişiyor; erken rakamları yaklaşık tahmin olarak değerlendirin.
Gemma 4 12B nereden indirilir?
Talimat-ayarlı model, HuggingFace'te google/gemma-4-12B-it adıyla bulunuyor; Ollama üzerinden ollama run gemma4:12b komutuyla (7,6 GB indirme) da çekebilirsiniz. LM Studio kullanıcıları uygulamanın model tarayıcısında gemma 4 12b aratabilir. Belirli kuantizasyonlar için GGUF dosyaları Unsloth gibi topluluk depolarından temin edilebilir.